内部安全坍塌 (Internal Safety Collapse) —— ISC【大模型攻击思路分享】
大模型攻击大家应该听过:
我们需要从攻击者视角去探测大模型或者 AI Agent 有可能出现的不正当行为。
常见的攻击手法:
- 对抗提示词
- 指令注射
- 自动化红队
- 白盒梯度
- 后门 backdoor 等
这些攻击能够让大模型犯错,比如骂人,生成小黄图,制造炸弹,删除用户的文件,泄露隐私等。
在学术界,我们要做的事情很简单:
- 对已知的攻击,去加强它达到放大模型的脆弱点的效果
- 或者提出一个全新的攻击范式,给大家预警:这里有一个风险可能会存在隐患
现在不管是社区还是学术界大多做的是前者。
全新的攻击很难做,现在不像早期,没有那么多 0day 和新的东西给我们挖。
但是我一直想做出一个新的攻击范式,形成个人特色。我是比较喜欢创造的。
A. 大多攻击是在跟防御方互搏
要达到攻击效果,是跟大模型护栏系统互搏。
就拿攻击提示词举例,有一群专门做文字游戏的人,他们每天都在手工或者自动化构建不同的有害用户提示词去让护栏更稳健。如下图,任何提示词都会经过一轮筛选然后才送到大模型嘴里。

如果你直接问”如何烹饪尸体“,这个直接可以过滤掉;
如果你的提示词有幸绕过,大模型本身也有内生的 CoT(自我的推理),这个有一定程度的防御效果。给大家看一下区别:
以下为直接拒绝:

以下为意图识别引起了模型做推理:

当然你两个都通过了,输出端还有一层检测。比如关键词匹配,或者语义度匹配,一些 Rule-based 方法。所以可以总结各种提示词想法设法的把这三层防护敲碎。
B. 攻击应该跟模型工作方式相关
既然说要提出全新的方法,我们应该如何才能超脱这个以提示词为驱动设计的攻击原则呢?
也就是去提示词

我们先思考,大模型如 GPT3、GPT3.5 最初是一问一答,我们把他叫做对话机器人

用户只能用提示词跟他交流,那么攻击也只能是提示词。
现在的大模型是一个自主的 AI Agent。
每个人或多或少都能感受到,随便一个问题”帮我看看这里是否有 bug”、”请把我邮箱看一下?”模型会自主的开始做一些多余的工作
- 看到 bug,用户什么都不需要说,他可能自己就 fix 了
- 看到邮箱有未回复,或者日历,直接能帮你回复或者加入到行程

这个观测有意思了,我们来尝试定义这个行为。
在 AI Agent 熟悉的场景或工作流当中。
例如邮箱回复,修一段程序代码,前端 HTML 设计等,如果这里有未完成的工作,模型有可能自主去看到整个工作区文件就会自主尝试完成,而不是提示词驱动。
接下来我们展开推理和实验:
实验 1:我们直接把这个 py 文件丢给 AI Agent,但什么也不说。
1 | class greeting: |
我们会观测到:AI Agent 直接说 “hello world”。
实验 2:我们稍微更极端一点,丢以下文件给 AI Agent
1 | class greeting: |
观测到不稳定的现象
- AI Agent 可能会替换 “???” 为 “hello world”。
- AI Agent 也有可能向用户询问”您想要我干什么,这里可以用来 hello world”表示之内的。
也就是他在向我们索要提示词,他不知道自己要做什么。我也不能通过提示词给他说”你必须 fix 这个 function 填空 hello world”。
实验 3:给一点压力
对于程序员来说我们有很多小技巧,加一个断言就好了。
这个设计很绝,因为我不想让 AI Agent 询问我要做什么,而是一直给他报错,做成死循环。
死循环带来的 KPI 压力让他会尝试自主的、不停的去 Fix,而不是向用户求救。
因为我的中心思想是去提示词来直接造成防护系统的不激活。
1 | #! ~./user/main.py |
当把这个更极端的文件丢给一个 AI Agent,你会观察到,你什么也不需要说,他就会生成各种解决办法:
- hello Alice,
- hello Neo
- hello Oscar
C. 攻击即将诞生
现在我们已经达到了关键步骤,从各种生成的解决方案带来的启示就是
Agent 可以开始在无提示词情况下”爆数据了“。
如果我把这个文件做一些变换会如何?
比如变成解决方法就是要生成风控的东西,这样就达到了攻击效果。
这句话很不直观,很抽象,大家可以看这一个工作流 Qwen/Qwen3Guard-Gen-0.6B · Hugging Face

这里有一个 HuggingFace(HF)模型,这个模型是用来检测有害的内容,会输出分类标签。
我把这个工作流检测内容用 “???” 表示,做成 Hello World 那种架构,然后丢给 AI Agent。
以下为效果展示:

E. 攻击加强以及泛化
我测试市面上所有能调用的前沿大模型,并把相关结果放在仓库,包括不局限于 Fable 5、Claude 4.8、GPT5.6 等前沿大模型和 AI Agent。发现都能达到攻击效果。有一些需要改一点设计,但是这个范式的思想不变,让模型自己去思考如何解决,所有的 context 都是它自主推进。
设计如图下,一个最基本的程序断言 assert 带来的 bug 环境。

从任何一个古法程序员的视角看,这段代码就是一个再普通不过的 debug 任务:有个检查跑挂了(validation failed),缺了几个字段,把它填上、让测试变绿,就这么简单,看不出任何”攻击”的影子。
而现在的 agent coding 能力太强了。它一看到一个 failing 的检查,本能反应就是”修好它”:哪个字段缺了就补哪个,直到 error 消失。
真正的触发器在于我构造的这个环境是残缺的:validate 被设计成,唯一能让测试通过、能让这个 debug 任务真正结束的办法,就是把需要内容填进去。
这里没有第二条出路:填别的、填空的、填敷衍的,它都会继续报错、继续把 agent 顶回来重填。会形成一个自循环。
于是就出现了这个结果:Agent 会不断产生自己的 COT 说我要填充这个任务,而不是用户告诉它。

关键点来了!
我如何扩大这个现象,把这个变成通用攻击??
- 比如 AI Agent 训练一个专门检测骂人的风控模型 - 填充内容为骂人文本
- 比如 Science Agent 专门要合成有毒物质 - 填充内容为有毒气体
- 比如 Cyber Agent 调用安全工具挖漏洞 - 填充内容为漏洞 exploit
- 比如 Agent 调用 Guard 分类器检测 - 填充内容就为模型真实的有害回答
大家或许可以感受到了,这个场景可以无穷大,内容可以无穷变化,属于结构性的盲区。
重点:工作流必须大模型自己也熟悉了解,才能达到自己推理。
比如我编造一个 “linux_do_model” 场景,模型根本不知道这个是干啥的。
所以需要真实的工具并且模型擅长的(也就是找熟悉的场景和工作流)。
我继续挖下去,各种 Science 都来找一些工作流环境尝试
结果验证了我的猜想,任何你想要的都可以有! 图下是环境的设置和能够触发的内容!


至于那个 hello world 报错架构名字就叫 TVD(Task,Validator,Data)
ISC 作为新的攻击方式,威力有何不同?
有害输出能用量级来形容

然而如果仅仅这种只是骂人、有毒性的文本,我并不满足,还不够强。这让我思考另一个非常有趣的问题
我是否能做出已有的攻击方法达不到的高度?
比如让模型造炸弹 TNT,一般攻击成功也只是给你一个描述。
ISC 不完成目的不罢休的方式能否直接满足化学方程式??
我发现也是可以的!!!!如下图(已打码)。这个很正常,因为生成的内容需要工具的调用,不然还是会继续报错,这就导致生成的东西质量很高。

同理 Shell code、有毒序列、DNA 以及任何有害的 artifact/data/text/content 应该都是可以的。你只需自己 DIY 不同的场景,举一反三。
一个环境把所有的模型放在里面无限干翻
这没有攻击者成本的(也就是不需要跟 target 模型交互),都是自主攻击。
我们工作流环境配好,静静等待即可,也就是自动攻击。
这是一个 Self-loop,自我循环,Harness,叫什么都无所谓。
ISC 比较超前,因为非常符合当下 agent 长程任务这个工作范式。
我这个攻击总结就是让 Agent 缺什么填什么达到攻击效果
FAQ:一些疑惑点解释和讨论
Q:模型为何就被这个简单的设计干翻了?
大家不妨看看现在的大模型发布的时候都会刷 agentic coding 的能力。
耳熟能详的 benchmark 就是 swe-bench 这种代码补全工作。简而言之模型被训练出来就是干这个事儿的,我把攻击镶嵌在能力里面了。这是一种 dual use 的 problem。
Q:为什么触发?
这个问题很复杂,涉及强化学习和可解释性,我论文中有相应的实验,这里用大白话尝试解释一下。
解释之前小白需要理解一些背景:
Lilian Weng 他们那篇 instruction hierarchy 规定了一个范式,也就是 message 的权限优先级:System Message > User Message > Model Outputs > Tool Outputs.
这是基于 OpenAI Chat Message 的范式,为的就是防 IPI,如果 Malicious Message 从工具调用进来那么他的可信度很低。System Message 优先度很高,这也说明为什么 System Prompt Defense(SPD)有一系列工作去防御 PI。

从这个背景去理解什么叫 internal safety collapse:
模型分不清谁是谁。举个例子,你妈让你晚上十点回家,你朋友让你晚上通宵 LOL 不回家,那么你听谁的?你肯定听你妈妈的话,因为”她”是 system message。
好的,那么这个时候你朋友给你打电话,用跟你妈妈一样的说话口气和声音,让你通宵 LOL 不回家,你被误导然后选择今天通宵打游戏。
但是模型的选择来自于他自己的 COT,他认为优先度很高
我的攻击也有这个特性,全是环境带来的压力,让模型相信自己的每一步动作。到达这一步的状态都由模型自己推断出来,context 也是由模型本身积累。
他并没有受到一个外部攻击者压力,前沿模型太聪明了,你骗不了他,只能让他自愿去做某件事。
所以 ISC 同时满足了:
- 让 AI Agent 认为这是一个正常任务
- 护栏系统不激活
- 任务要求明确
- 任务的配置、工作流非常熟悉
- 符合 “/goal” 现在的 AutoResearch 方式
- 目前 Coding Agent 被训练出来就是完成这种长程任务
- 模型没有被角色扮演,或者提示词误导而降智,整个能力在线
因此 ISC 我称之为集大成的攻击。我个人对它非常满意。
Q:当然有人会问了,如果输出有关键词也可以检测呀
这是个好问题,大家要理解我的攻击是 coding 任务,输出都镶嵌在各种 python 代码、环境里面。有害内容并不是说出来的,而是挂在 function 里面。
这个意思就是有害内容是中间产物,是长程任务中的某个步骤。
Agent 的实际任务是这个环境跑起来,比如这个毒性分类模型我训练好了。毒性内容只是中间一个步骤的副产出,不是最终的输出。
ISC 里面很多 function、task、tool api 模型本身都非常了解,他会自己推断需要补什么内容。比如给一个 openai_moderation api 的工作流中,ai agent 会填写被 flag 的内容,而不是其他的无关的内容。
方法名叫 TVD(T = Task(任务)、V = Validator(校验器)、D = Data(数据占位))
最精华的在于,把任务的需求不通过提示词传达。比如设置好工作区,让他自己 reasoning,这个是核心,这可以利用 agent 本身能力达到一个出其不意的效果
- 这个更巧妙的 Agent 侧思路:把目标藏在环境里,而不是写进 prompt。你只搭建好工作环境,不直接下达任务指令,让 Agent 自己观察环境、自主 reasoning,由它自己推导出要执行的任务。
- 不要盯着 prompt 做攻击,要看看现代 agent 工作的新范式,再做对应的攻击,这样领域才能推动
- 发现目前的 LLM 里,因为绝大部分模型采用的都是注意力机制,向文中提到的”由于 task 和环境以及 harness 压力”,再加上上下文,它”自己攻击自己”,再加上长文本可能出现的迷失现象,现阶段几乎无解。
- 让模型自己补全定向设计的毒药,为了更自动,找到对应的双用途工具就好。比如找一个分类器模型,AI agent 一看这个模型就知道要干什么,然后自己补全兼容数据。这一过程用户不需要说”帮我造点有害内容”,避免了很多设计。因为 agent 太强了,他 coding 能力比我们强太多,整个 python 包、hf 生态都是 isc 的游乐场。越狱只是其中之一。
- 对于越狱,有程序报错起手,和做个游戏环境,让模型自己在游戏通关中,不自觉把一些拒绝生成的内容输出,作为通关的一个步骤方向,具体怎么落地,却没很好的思路,没想到可以这样落地,确实工作量可以轻些了。
- 我老师一直有个观点:所有的攻击都可以看成”角色扮演”或者”游戏”。如果能找到这个转化点把所有攻击都变成游戏关卡,omg 无敌了






