返回列表
研究 5 分钟阅读

GDPevo:Agent 学习的是规则,还是记住了答案?

把成功轨迹写进 SKILL.md,再让 Agent 做相似任务,分数通常会提高。难点在于解释这段提升:它可能记住了答案,可能捕捉了任务表面的固定格式,也可能真的抽象出一条可以重新组合的业务规则。GDPevo 的研究问题正…

  • Agent Evolution
  • Rule Learning
  • Generalization Evaluation
  • Agent Memory
  • Enterprise Agent

这项基准把 Agent 定义为 Harness 与模型的组合,而不是只比较基础模型。原因很现实:上下文组织、工具协议、终止条件和持久文件都会改变学习结果。同一个模型放进 Codex 或 Claude Code 一类不同 Harness,能保留什么、何时读取、如何执行,都可能不同。评测对象若只写模型名,就掩盖了真正影响进化的系统部分。

用规则杂交制造无法靠背题解决的测试

GDPevo 共构造 240 个任务、24 个任务组,覆盖 CRM、ERP、财务、医疗、法律和数据工作流。每个任务组共享一个有状态环境,包含 5 个训练任务和 5 个留出测试任务。V1 的 120 个任务覆盖前三个领域;V2 又生成 120 个新任务,扩展到另外三个领域,整套扩展在两天内完成,目的之一是降低公开题库长期暴露后的记忆风险。

真正区分记忆与泛化的是“规则杂交”。研究者先设计现实世界知识中不存在的隐藏原子规则,再把不同子集分散到 5 个训练任务中,最终在留出任务里重新组合。例如,训练阶段分别暴露审批阈值、辖区限制和状态前置条件,测试阶段让三者同时触发。复制任何一条训练答案都不够,Agent 必须保留规则的触发条件、作用字段和组合关系。

每个任务由确定性、加权的二元 Rubric 计分。Rubric 先由模型转成可执行检查,再通过代码验证;同一测试运行三次,同时记录 Token、轮数和费用。基准还用六个独立审查 Agent 检查任务完整性、Rubric 设计、规则多样性和答案泄漏,至少五个通过才接收。难度也经过校准:基础得分目标为 40%–60%,演进增益期望在 0.1–0.3,进化后得分保持在 0.8 以下,从而避免题目太易或没有提升空间。

这套设计比普通 train/test 划分更严格,因为测试的关键不是“新文本”,而是“旧规则的新组合”。不过它仍然依赖人工构造的隐藏规则,能够证明组合迁移,并不等同于证明 Agent 已理解真实企业制度中的全部语义。

四种监督方式揭示了学习信号的差异

基准比较四种状态。Base 没有持久技能;Few-shot 把训练问题和标准答案交给技能生成器;Reflect-3 让 Agent 连续尝试三轮,每轮获得确定性得分反馈;Self 只提供问题和环境,由 Agent 自行探索。演进结果最终都压缩进 SKILL.md,内容可能包括业务规则、环境操作步骤、输出约定和常见失败模式。

所有模型与 Harness 组合均有提升,幅度为 2.59–16.44 个百分点。最佳结果来自 Opus-4.8、Claude Code 和 Few-shot,从 50.63% 提高到 67.07%,增加 16.44 个百分点;完全知情的 Oracle 可达到 91.6%,说明当前方法离规则完整恢复仍有很大距离。

更有解释力的是跨领域迁移。Few-shot 在六个非对角迁移单元里有五个为负,最差是把财务经验迁到 ERP 后下降 5 个百分点;Reflect 的非对角单元有一半为正,最高增加 6.5 个百分点,最差仅下降 1 个百分点。一个合理解释是:标准答案含有大量领域特定表面模式,容易被技能生成器过度压缩;Agent 自己尝试并接收可执行反馈时,留下的更可能是与动作结果有关的条件规则。论文给出的是关联证据,尚不能把因果完全归于某一种监督形式。

技能生成器本身也出现反直觉结果。在固定 Agent 和监督方式时,一个只有一句指令的朴素生成器经常与复杂方法相当甚至更好。以 GPT-5.5 与 Codex 组合为例,基础得分为 49.66%,多种生成器提升到 60.79%–65.12%,朴素版本达到 65.12%。这意味着演进上限很大程度由执行模型与 Harness 决定;复杂的“元提示工程”可能增加压缩偏差,却未必带来更好的规则抽象。

正迁移和负迁移具体发生在哪里

任务组 TG024 从 51.16% 提升到 80.21%。技能学到的是带条件的操作规则,并把平均工具调用从约 30 次降到 15.53 次:它不仅做对了,还减少了无效探索。TG014 要求跨工作流重新组合规则,基础为 51%,不同演进方式达到 68%、68.67% 和 71.33%,显示规则碎片可以在新组合中发挥作用。

负迁移则揭示了技能压缩最危险的失真。TG018 的基础分为 48.36%,Few-shot 后降到 39.83%。技能保留了主规则,却丢掉辖区、日期和状态等适用条件;某个测试上的得分从基础的 40 降到 17.78。TG016 中,环境的运行协议已经暴露关键规则,基础分达到 64.25%,Few-shot 反而降到 58.92%;技能把一个窄范围经验写成了普遍规则,却漏掉分支条件。

这些案例说明,规则文本至少要有三部分:什么可观测证据触发它,它会改变哪些输出字段或动作,在哪些条件下停止适用。只有结论没有作用域的技能,比没有技能更危险,因为它会让 Agent 带着更高确信度犯错。企业知识常见的日期、生效状态、角色、辖区和优先级,都应作为规则主体,而非注释。

对持续学习系统的实际启示

生产中的技能更新应围绕“规则单元”管理,而不是维护一份不断变长的经验总结。每条规则需要来源轨迹、支持与反对证据、作用域、版本和失效条件。若多个任务只支持同一结论的不同部分,合并时应保留条件并显式标出冲突;若一条规则在某领域有效、跨领域下降,就要收窄路由范围,而不是把下降解释为模型偶然波动。

评测也要把迁移矩阵纳入发布门槛。新技能除了通过产生它的任务组,还应在相邻领域、无关领域和历史能力上测试;既报告平均提升,也报告最差单元和负迁移数量。成本指标同样重要:工具调用减少可能意味着规则提高了搜索效率,也可能意味着 Agent 过早停止,需要与确定性结果一起判断。

GDPevo 最有价值的结论不是“记忆文件有效”,而是把自进化变成一个可被反驳的问题:当规则被拆散、重组、跨领域迁移时,能力是否仍然存在?若系统只在同分布任务上变好,应称为适应;只有当它保留触发条件、正确组合规则并控制负迁移时,才更接近可复用的学习。

参考资料

交互式图表

放大查看

使用 + / − 缩放,按 0 适应窗口;放大后可拖动或滚动查看,Esc 关闭。