什么是 AI 越狱(jailbreaking)?
AI 越狱(jailbreaking)是指绕过人工智能系统中内置的安全控制、政策或防护栏(guardrails)的做法。
现代的大型语言模型(LLM)会接受训练以遵循特定规则。它们被设计为拒绝可能促进有害活动、泄露敏感信息、生成恶意内容,或违反组织政策的请求。越狱(jailbreaking)试图绕过这些限制。
“越狱(jailbreaking)”一词起源于移动设备领域:用户通过修改操作系统来移除厂商限制。在 AI 中,这一概念类似——攻击者试图移除或绕过模型提供方施加的限制。
与传统的软件漏洞利用不同,AI jailbreaking 通常依赖于操纵模型的推理过程,而不是利用编程缺陷。攻击者可能会说服模型忽略先前的指令、采用不同的角色设定、泄露隐藏信息,或生成被禁止的内容。
生成式 AI 的兴起已将 jailbreaking 从一个研究课题转变为重要的安全顾虑。随着组织将 AI 部署到客户服务、软件开发、知识管理和业务运营等领域,成功 jailbreak 可能造成的影响也在持续扩大。
AI jailbreaking 攻击是如何运作的?
AI jailbreaking 攻击利用了两个相互竞争目标之间的张力:模型希望遵循用户指令的愿望,以及其必须遵守安全策略的义务。
攻击者会使用多种技术来操纵这种平衡。
提示注入
提示注入是最常见的越狱(jailbreaking)方法之一。攻击者会设计指令,试图覆盖或与模型现有规则发生冲突。
例如,用户可能会指示模型忽略先前的指令,或优先执行一组新的指令。
角色扮演攻击
攻击者经常要求模型假设一个虚构的角色。
示例包括:
- 充当不受限制的 AI 助手
- 假装自己是网络安全研究人员
- 模拟历史或虚构的场景
- 假设自己扮演系统管理员
目标是鼓励模型提供它本来会拒绝的信息。
间接提示注入
间接提示注入发生在恶意指令被嵌入到 AI 系统处理的外部内容中时。
示例包括:
- 网页
- 文档
- 源代码仓库
- 知识库
- 电子邮件消息
当 AI 应用程序检索此内容时,隐藏的指令可能会影响模型的行为。
上下文操纵
攻击者不直接发出越狱(jailbreak)命令,而可能通过一系列交互逐步构建上下文。
对话在避开明显的安全触发器的同时,逐步引导模型生成不安全的输出。
系统与基础设施篡改
基于提示(Prompt)的攻击受到最多关注,但组织也必须考虑基础设施层面的风险。
获得 AI 环境访问权限的攻击者可能会尝试:
- 修改安全配置
- 更改部署设置
- 更改模型参数
- 禁用监控控制
- 篡改审计日志
这些行为会削弱防御,并增加成功实施越狱(jailbreak)尝试的可能性。
为什么 AI 越狱(jailbreaking)会成为日益严重的安全隐患?
AI 越狱(jailbreaking)不再是一个纯理论的问题。
随着组织对 AI 的依赖不断加深,成功实施越狱的后果也变得更加严重。
敏感信息的暴露
越狱后的系统可能会泄露本应受到保护的信息。
示例包括:
- 内部指令
- 专有业务信息
- 敏感的客户数据
- 系统配置
- 安全程序
即使是部分泄露也可能为威胁行为者提供有价值的情报。
网络安全风险增加
许多 AI 提供商会实施保护措施,以防止模型协助恶意活动。
成功的越狱(jailbreak)可能允许攻击者获取:
- 漏洞研究协助
- 恶意代码生成
- 攻击计划指导
- 社会工程内容
尽管防护措施持续改进,供应商普遍承认,没有任何模型能对每一种越狱(jailbreak)技术完全具备抵抗力。
合规与治理方面的挑战
组织越来越面临监管机构对 AI 治理的要求。
如果 AI 系统产生未经授权的输出、泄露受保护的数据或违反内部政策,可能会产生合规后果。
受严格监管的行业(包括医疗、金融服务、政府以及关键基础设施)面临的风险尤其高。
信任丧失
信任是成功采用 AI 的关键。
员工、客户以及业务负责人都希望 AI 系统能够以可预测且安全的方式运行。被广泛披露的越狱(jailbreak)事件可能会动摇人们对 AI 计划的信心,并拖慢部署进程。
现实影响:Fable 5 与 Mythos 5 被暂停
在 2026 年 6 月,AI 行业收到了一个提醒:各国政府对越狱(jailbreak)风险的重视程度有多高。
美国政府发布了一项指令,要求 Anthropic 暂停其对 Fable 5 和 Mythos 5 模型的访问,理由是对一项据称的越狱(jailbreak)技术存在担忧。据 Anthropic 称,该政府认为其已找到了绕过某些模型安全防护措施的方法。
该事件引发了业界范围内关于 AI 安全标准、越狱(jailbreak)抵御能力以及当前 AI 安全技术在实际层面的局限性的讨论。
也许更重要的是,这一事件凸显了许多领先 AI 提供商所承认的一个现实:目前可能还无法实现“完美”的越狱(jailbreak)抵御能力。
因此,组织必须依靠分层的安全控制、持续监测以及快速响应能力来管理风险。
组织如何防御 AI jailbreaking?
任何单一的安全控制都无法消除 AI jailbreaking 的风险。
组织应改而采用纵深防御(defense-in-depth)策略。
部署多层防护措施
AI 安全性绝不应依赖单一的过滤器或策略引擎。
组织应结合:
- 模型级保护
- 内容过滤
- 输入校验
- 输出监控
- 人工监督
多层防护让成功绕过变得更加困难。
开展持续测试
安全团队应定期使用已知的越狱技术评估 AI 系统。
红队演练有助于在对手发现漏洞之前识别弱点。
测试应包括:
- 提示注入(Prompt injection)尝试
- 间接提示攻击
- 对抗性提示
- 工作流滥用场景
监控 AI 环境
监控至关重要,因为攻击者可能会瞄准支撑 AI 系统的基础设施,而不是模型本身。
安全团队应保持对以下方面的可视性:
- 配置更改
- 策略修改
- 用户活动
- 特权访问
- 部署变更
实施严格的变更管理
所有影响 AI 系统的变更都应获得授权、记录在案,并进行审查。
规范的变更管理有助于防止意外的错误配置,同时使未授权的修改更容易被发现。
维护审计追踪
详细的日志记录既支持安全调查,也满足合规要求。
组织应保留以下记录:
- 管理操作
- 配置变更
- 模型更新
- 策略修改
- 安全事件
应用最小特权
并非每个人都应具备修改 AI 系统的能力。
限制管理员权限可降低 攻击面,并减少未授权变更的机会。
使用场景
组织使用 AI jailbreaking 防御来:
- 评估 AI 安全控制的有效性
- 识别 AI 部署流水线中的薄弱环节
- 检测未经授权的配置更改
- 监控 AI 基础设施中的可疑活动
- 支持 AI 治理举措
- 改进监管合规工作
- 防止敏感信息泄露
- 部署前验证模型安全性
- 调查异常的 AI 行为
- 降低与 AI 采用
Netwrix 如何提供帮助
防止 AI 越狱(jailbreaking)需要的不仅仅是进行提示词过滤(prompt filtering)。
组织还必须保护支撑 AI 部署的系统、配置和基础设施。
Netwrix Change Tracker 帮助安全与 IT 团队通过持续监控配置变更、验证安全基线并检测未经授权的修改,来保持对关键系统的可视性与控制能力。Change Tracker 提供 文件完整性监测、实时变更检测、合规报告以及详细的审计轨迹,帮助团队在可疑活动升级为更大的安全事件之前识别出来。
对于部署 AI 应用的组织而言,这种可视性有助于发现对 AI 基础设施进行篡改、变更安全设置、禁用监控控制,或引入可能削弱防御能力的未经授权的配置变更等企图。通过强化变更管理并提升运营可视性,Netwrix Change Tracker 支持一种用于 AI 安全的纵深防御(defense-in-depth)方法。
了解 Netwrix Change Tracker 如何帮助检测未经授权的变更,并在支持您 AI 部署的系统中保持可视性。
常见问题
分享到