Netwrix 1Secure 提供跨数据和身份的统一可见性——免费试用14天,享有完全访问权限。开始免费试用

网络安全术语表安全概念

AI 越狱(jailbreaking)

AI 越狱(jailbreaking)

AI 越狱(AI jailbreaking)是指绕过人工智能模型中内置的安全防护、限制条件以及安全控制的过程。攻击者会使用专门构造的提示词(prompts)、间接指令、角色扮演场景或系统操纵技术,让 AI 系统生成它本应拒绝的回应。随着 AI 越来越深度地集成到企业运营中,越狱带来的安全、合规与治理挑战也在不断增加。组织必须将 AI 安全防护与监控、变更管理以及持续监督相结合,以降低风险。

什么是 AI 越狱(jailbreaking)?

AI 越狱(jailbreaking)是指绕过人工智能系统中内置的安全控制、政策或防护栏(guardrails)的做法。

现代的大型语言模型(LLM)会接受训练以遵循特定规则。它们被设计为拒绝可能促进有害活动、泄露敏感信息、生成恶意内容,或违反组织政策的请求。越狱(jailbreaking)试图绕过这些限制。

“越狱(jailbreaking)”一词起源于移动设备领域:用户通过修改操作系统来移除厂商限制。在 AI 中,这一概念类似——攻击者试图移除或绕过模型提供方施加的限制。

与传统的软件漏洞利用不同,AI jailbreaking 通常依赖于操纵模型的推理过程,而不是利用编程缺陷。攻击者可能会说服模型忽略先前的指令、采用不同的角色设定、泄露隐藏信息,或生成被禁止的内容。

生成式 AI 的兴起已将 jailbreaking 从一个研究课题转变为重要的安全顾虑。随着组织将 AI 部署到客户服务、软件开发、知识管理和业务运营等领域,成功 jailbreak 可能造成的影响也在持续扩大。

AI jailbreaking 攻击是如何运作的?

AI jailbreaking 攻击利用了两个相互竞争目标之间的张力:模型希望遵循用户指令的愿望,以及其必须遵守安全策略的义务。

攻击者会使用多种技术来操纵这种平衡。

提示注入

提示注入是最常见的越狱(jailbreaking)方法之一。攻击者会设计指令,试图覆盖或与模型现有规则发生冲突。

例如,用户可能会指示模型忽略先前的指令,或优先执行一组新的指令。

角色扮演攻击

攻击者经常要求模型假设一个虚构的角色。

示例包括:

  • 充当不受限制的 AI 助手
  • 假装自己是网络安全研究人员
  • 模拟历史或虚构的场景
  • 假设自己扮演系统管理员

目标是鼓励模型提供它本来会拒绝的信息。

间接提示注入

间接提示注入发生在恶意指令被嵌入到 AI 系统处理的外部内容中时。

示例包括:

  • 网页
  • 文档
  • 源代码仓库
  • 知识库
  • 电子邮件消息

当 AI 应用程序检索此内容时,隐藏的指令可能会影响模型的行为。

上下文操纵

攻击者不直接发出越狱(jailbreak)命令,而可能通过一系列交互逐步构建上下文。

对话在避开明显的安全触发器的同时,逐步引导模型生成不安全的输出。

系统与基础设施篡改

基于提示(Prompt)的攻击受到最多关注,但组织也必须考虑基础设施层面的风险。

获得 AI 环境访问权限的攻击者可能会尝试:

  • 修改安全配置
  • 更改部署设置
  • 更改模型参数
  • 禁用监控控制
  • 篡改审计日志

这些行为会削弱防御,并增加成功实施越狱(jailbreak)尝试的可能性。

为什么 AI 越狱(jailbreaking)会成为日益严重的安全隐患?

AI 越狱(jailbreaking)不再是一个纯理论的问题。

随着组织对 AI 的依赖不断加深,成功实施越狱的后果也变得更加严重。

敏感信息的暴露

越狱后的系统可能会泄露本应受到保护的信息。

示例包括:

  • 内部指令
  • 专有业务信息
  • 敏感的客户数据
  • 系统配置
  • 安全程序

即使是部分泄露也可能为威胁行为者提供有价值的情报。

网络安全风险增加

许多 AI 提供商会实施保护措施,以防止模型协助恶意活动。

成功的越狱(jailbreak)可能允许攻击者获取:

  • 漏洞研究协助
  • 恶意代码生成
  • 攻击计划指导
  • 社会工程内容

尽管防护措施持续改进,供应商普遍承认,没有任何模型能对每一种越狱(jailbreak)技术完全具备抵抗力。

合规与治理方面的挑战

组织越来越面临监管机构对 AI 治理的要求。

如果 AI 系统产生未经授权的输出、泄露受保护的数据或违反内部政策,可能会产生合规后果。

受严格监管的行业(包括医疗、金融服务、政府以及关键基础设施)面临的风险尤其高。

信任丧失

信任是成功采用 AI 的关键。

员工、客户以及业务负责人都希望 AI 系统能够以可预测且安全的方式运行。被广泛披露的越狱(jailbreak)事件可能会动摇人们对 AI 计划的信心,并拖慢部署进程。

现实影响:Fable 5 与 Mythos 5 被暂停

在 2026 年 6 月,AI 行业收到了一个提醒:各国政府对越狱(jailbreak)风险的重视程度有多高。

美国政府发布了一项指令,要求 Anthropic 暂停其对 Fable 5 和 Mythos 5 模型的访问,理由是对一项据称的越狱(jailbreak)技术存在担忧。据 Anthropic 称,该政府认为其已找到了绕过某些模型安全防护措施的方法。

该事件引发了业界范围内关于 AI 安全标准、越狱(jailbreak)抵御能力以及当前 AI 安全技术在实际层面的局限性的讨论。

也许更重要的是,这一事件凸显了许多领先 AI 提供商所承认的一个现实:目前可能还无法实现“完美”的越狱(jailbreak)抵御能力。

因此,组织必须依靠分层的安全控制、持续监测以及快速响应能力来管理风险。

组织如何防御 AI jailbreaking?

任何单一的安全控制都无法消除 AI jailbreaking 的风险。

组织应改而采用纵深防御(defense-in-depth)策略。

部署多层防护措施

AI 安全性绝不应依赖单一的过滤器或策略引擎。

组织应结合:

  • 模型级保护
  • 内容过滤
  • 输入校验
  • 输出监控
  • 人工监督

多层防护让成功绕过变得更加困难。

开展持续测试

安全团队应定期使用已知的越狱技术评估 AI 系统。

红队演练有助于在对手发现漏洞之前识别弱点。

测试应包括:

  • 提示注入(Prompt injection)尝试
  • 间接提示攻击
  • 对抗性提示
  • 工作流滥用场景

监控 AI 环境

监控至关重要,因为攻击者可能会瞄准支撑 AI 系统的基础设施,而不是模型本身。

安全团队应保持对以下方面的可视性:

  • 配置更改
  • 策略修改
  • 用户活动
  • 特权访问
  • 部署变更

实施严格的变更管理

所有影响 AI 系统的变更都应获得授权、记录在案,并进行审查。

规范的变更管理有助于防止意外的错误配置,同时使未授权的修改更容易被发现。

维护审计追踪

详细的日志记录既支持安全调查,也满足合规要求。

组织应保留以下记录:

  • 管理操作
  • 配置变更
  • 模型更新
  • 策略修改
  • 安全事件

应用最小特权

并非每个人都应具备修改 AI 系统的能力。

限制管理员权限可降低 攻击面,并减少未授权变更的机会。

使用场景

组织使用 AI jailbreaking 防御来:

  • 评估 AI 安全控制的有效性
  • 识别 AI 部署流水线中的薄弱环节
  • 检测未经授权的配置更改
  • 监控 AI 基础设施中的可疑活动
  • 支持 AI 治理举措
  • 改进监管合规工作
  • 防止敏感信息泄露
  • 部署前验证模型安全性
  • 调查异常的 AI 行为
  • 降低与 AI 采用

Netwrix 如何提供帮助

防止 AI 越狱(jailbreaking)需要的不仅仅是进行提示词过滤(prompt filtering)。

组织还必须保护支撑 AI 部署的系统、配置和基础设施。

Netwrix Change Tracker 帮助安全与 IT 团队通过持续监控配置变更、验证安全基线并检测未经授权的修改,来保持对关键系统的可视性与控制能力。Change Tracker 提供 文件完整性监测、实时变更检测、合规报告以及详细的审计轨迹,帮助团队在可疑活动升级为更大的安全事件之前识别出来。

对于部署 AI 应用的组织而言,这种可视性有助于发现对 AI 基础设施进行篡改、变更安全设置、禁用监控控制,或引入可能削弱防御能力的未经授权的配置变更等企图。通过强化变更管理并提升运营可视性,Netwrix Change Tracker 支持一种用于 AI 安全的纵深防御(defense-in-depth)方法。

了解 Netwrix Change Tracker 如何帮助检测未经授权的变更,并在支持您 AI 部署的系统中保持可视性。

常见问题

分享到