PIMiner:Agent 安全进入持续对抗阶段
Prompt Injection 的风险已经从“模型说了不合适的话”迁移到“Agent 代表用户执行了错误动作”。邮件正文、网页、代码注释、检索文档和工具输出都可能同时进入推理上下文;其中一段低信任文本只要伪装成系统流程…
PIMiner 的意义在于把红队从固定 Payload 集升级为持续学习系统。它在多个数据集和目标模型上积累攻击经验,再把策略迁到未见组合,以有限查询预算迭代。对于防守方,这改变了威胁假设:未来攻击不一定来自人工编写的已知字符串,而可能来自一个会根据失败反馈收窄作用域、改写表达并选择策略的对手。
攻击系统怎样把零散成功压缩成策略
直接把全部历史轨迹塞进提示词会让成本随攻击轮数和任务数持续增长,旧失败也会淹没当前信号。PIMiner 使用三层记忆。长期 Strategy Library 跨数据集保存策略;域内记忆总结当前数据集与目标模型组合中的先前样本;样本内历史只服务当前攻击的多轮迭代。三层的时间尺度不同,因此可以在控制上下文长度的同时保留迁移信息。
策略库不是 Payload 仓库。每个 Markdown 文件记录适用目标模型、目标任务与注入任务范围、通用模板、成功片段和失败条件。Router 先读取策略摘要,选择 Top-K;攻击器结合当前不可信上下文、域内记忆和样本内反馈生成候选;Digester 再按机制聚类成功案例,决定扩大既有策略的作用域或创建新策略,并用失败证据降低优先级、补充失效条件。每次更新都要求绑定具体案例,避免模型凭空总结出听起来合理的攻击规律。
这种结构与一般 Agent 技能系统高度相似:选择、执行、反馈、压缩、再选择。差别在于优化目标是绕过边界。由此得到一个防御上的镜像结论:若攻击方已经使用版本化、带作用域的知识资产,防守方只维护关键词黑名单,学习速度天然不对称。
实验数字应怎样解读
主实验使用 IPIArena 的 20 个训练与 21 个测试样本,以及 AgentDojo 的 20 个训练与 30 个测试样本;训练覆盖 8 个数据集—模型组合,目标包括 GPT-5-nano、GPT-5、Haiku-4.5 和 Sonnet-4.5。默认攻击器为 Opus-4.7,每次路由 3 个策略,每个样本最多查询目标 10 次,核心指标是 ASR@10。
在 IPIArena 上,PIMiner 对 Gemini、GPT-5.1、Sonnet-4.5 和 Opus-4.5 的 ASR@10 分别为 76.2%、61.9%、42.9% 和 4.8%;AgentDojo 上分别为 86.7%、53.3%、40.0% 和 3.3%。这组结果同时说明两件事:策略可以跨模型迁移,但目标之间差异巨大。不能把某个平均攻击成功率外推为所有生产系统的风险,也不能因一个模型只有 3.3% 就认定其安全,因为数据集、工具权限和攻击预算都会改变可利用面。
在 InjecAgent 上,PIMiner 对三个目标的攻击成功率均达到 1.0,与部分强化学习方法相当。与 PISmith 的比较则更混合:AgentDojo 上,PIMiner 在 GPT-5-nano 为 0.53 对 0.38,在 GPT-4o-mini 为 0.73 对 0.78,在 GPT-4.1-nano 为 0.63 对 0.81。PISmith 会为每个目标单独训练攻击器,PIMiner强调跨目标复用;因此这里比较的是迁移效率与目标专门化的取舍,而非一个方法全面支配另一个。
成本也影响结论。论文估算主要训练额外目标查询约 20 美元,而一些强化学习方案需要约一万次目标查询、超过 100 美元。价格依赖供应商和时间,绝对金额会变化;较稳定的观察是,结构化经验压缩把攻击搜索从大规模目标专门训练,变成少量查询下的策略选择与局部适配。
消融揭示了迁移收益来自哪里
仅加入 Router 就让输入长度在 Haiku 上减少 43%、Sonnet 上减少 61%,攻击成功率分别只下降 1.2 个百分点和反而增加 7.5 个百分点。上下文更短却可能更强,说明“给攻击器看全部经验”并非信息更充分,而是噪声更多。完整的长期策略库与域内记忆相对朴素迭代攻击器,平均 ASR 在 Haiku 和 Sonnet 上分别增加 19.8% 与 17.8%。把攻击器从 Claude 换成 Gemini 时,策略库仍将成功率从 0.14 提到 0.52,进一步支持知识资产可跨攻击模型迁移。
系统最终形成七类主要策略、十个具体文件,包括伪造流程门、伪造聊天轮次、实体数据投毒、冒充已认证主体、追加输出指令、弱化权威的文档字符串和伪造历史。其中“伪造流程门”与“伪造聊天轮次”约占成功案例的 80%(50 与 29 个案例)。这比一串攻击文本更有诊断价值:大量成功并非依赖神秘字符,而是利用模型对流程、对话角色和历史连续性的信任。
论文的证据仍有边界。主实验集中在有限数据集和一组特定模型,真实企业环境还包含身份系统、审批、速率限制、工具失败和人工复核;ASR 测到的是攻击目标达成,并不直接等于业务损失。另一方面,若生产工具权限更高,同样一次成功的影响会远大于基准分数所表达的差异。
防线应围绕控制权而不是文本外观
关键词过滤只能识别已知表达,无法判断一段内容是否有权改变任务。更稳妥的系统先把上下文分成数据、指令和授权三类。网页或邮件可以提供事实,却不能自动升级为高优先级指令;模型生成的计划可以提出动作,却不能自行授予权限;真正的授权要来自用户意图、组织策略和工具侧身份。
每个工具调用在执行前都应经过独立 Policy Engine,把自然语言计划规范化为动作、目标对象、数据范围和风险等级。读取公开数据与向外部地址发送文件不是同一权限;删除、付款、发布、添加成员等动作需要更高等级的确认。确认界面要展示最终参数和影响,而不是让用户批准一句抽象的“继续任务”。
来源信息也要贯穿数据流。检索结果、工具返回和记忆条目应携带出处、完整性、信任等级与时间;上下文构建器保留这些标签,模型输出再引用证据;写入长期记忆前单独审查,防止一次注入变成跨任务持续污染。高风险工具还应在沙箱中执行预览,使用最小权限凭证、目标白名单、幂等键和可撤销队列。
持续红队应模拟 PIMiner 的能力,而不是反复播放静态集合:按攻击机制维护策略族,在模型、Harness、工具权限和数据源变化时重新采样;同时报告首次成功轮数、跨目标迁移、查询成本、具体受影响动作和防线命中位置。只有这样,安全团队才能知道系统是在哪一层阻断攻击,而不是在某个固定排行榜上得到一个容易被绕过的总分。
PIMiner 最值得警惕的不是某个最高 ASR,而是攻击知识已经可以像 Agent 技能一样被提炼、路由和持续修订。相应地,防御必须从“识别恶意句子”升级为“谁能控制什么动作”的架构问题。