从技能文档到策略基因:迈向经验驱动的测试时进化

From Procedural Skills to Strategy Genes: Towards Experience-Driven Test-Time Evolution

总结
问题
方法
结果
要点
摘要

本文提出了 Strategy Gene (策略基因),一种旨在提升大语言模型(LLM)在科学代码求解任务中表现的轻量化、结构化经验表示方法。通过 Gene Evolution Protocol (GEP) 协议,该方法在 CritPt 基准测试中将模型性能从 9.1% 提升至 18.57%,显著优于传统的文档型 Skill 包装。

TL;DR

如果给 LLM 智能体喂入过多的过往经验,它反而可能“消化不良”。本文提出了一种名为 Strategy Gene (策略基因) 的新方案:摒弃冗长的 Skill(技能)说明文档,将其精炼为不到 250 tokens 的结构化控制信号。实验证明,这种“少即是多”的策略不仅提升了科学代码生成的准确率,还为智能体的自进化提供了最理想的载体。

背景定位:经验复用的“信息陷阱”

在当前的 LLM Agent 研究中,人们倾向于将过往的成功或失败经验存成“技能库”(Skill Libraries)。但本文指出,这些技能通常更像是写给人类看的 Documentation(文档),而非写给机器看的 Control Signal(控制信号)。

作者发现,当把上千 token 的详细技能包丢给模型时,模型往往会迷失在稀疏的有用信号中,导致性能反而不如没有任何指导的 Baseline。

核心直觉:什么是 Strategy Gene?

作者提出了一个关键假设:复用经验的核心难题不是如何提供“更多”的经验,而是如何将其编码为**紧凑、面向控制、准时就绪(Evolution-ready)**的对象。

Strategy Gene 与传统 Skill 的区别在于:

  • Skill (文档导向):侧重于 Overview, Workflow, API Notes,目标是让人读懂。
  • Gene (控制导向):侧重于核心战略步骤、触发信号以及致命的 AVOID (坑点预防),目标是精准影响模型行为。

模型架构与表示对比

进化协议:GEP (Gene Evolution Protocol)

为了让这些基因能够随着时间迭代,作者设计了 GEP 协议。这个协议将经验划分为三个层级:

  1. Gene (原子单元):最小的可复用策略。
  2. Capsule (执行单元):记录策略在具体任务中的验证路径。
  3. Event (进化记录):记录策略的版本变迁、突变和修正过程。

这种结构化的设计让“失败经验”不再只是简单的文本追加,而是被蒸馏(Distill)成紧凑的警告信号。

实验战果:更小,却更强大

作者在涉及蛋白质解析、地震目录处理等 45 个硬核科学编码场景下进行了数千次实验。

1. 技术有效性对比

数据表明,Gene 表示法在所有模型上均表现稳健。相比之下,完整的 Skill 包在某些模型(如 Gemini Pro)上竟然导致了严重的性能下降(从 60% 跌至 50%),证明了冗余信息的负面影响。

实验结果对比

2. 鲁棒性验证

通过对 Gene 进行结构扰动(如颠倒步骤顺序)和内容损坏发现:Gene 对结构改动极度宽容,但对语义错误(算法写错)极度敏感。这说明 Gene 捕获的是深层的解题直觉,而非某种固定的 Prompt 模板。

扰动实验分析

深度洞察:自进化的终局

最令人振奋的是第 4.4 节关于 Test-time Evolution 的讨论。在 CritPt 基准上,基于 Gene 进化的系统能够将过去运行中的执行轨迹、错误日志自动转化为新的 Gene 单元。

经过两个月的迭代,Evolver (Gene) 系统在物理科学推理任务上的通过率从 9% 爬升到了 27%。这证明了:当经验被协议化为“基因”后,LLM Agent 具备了类似于生物进化的持续改进能力。

总结与启示

这篇论文向我们展示了 Agent 未来的一种可能性:模型参数哪怕固定不动(Fixed Weights),通过不断进化其“外部基因库”,其处理复杂问题的上限依然可以被大幅抬高。对于开发者而言,这提示我们:在构建 Agent 记忆系统时,与其追求“记忆录放”,不如追求“基因剪辑”。

局限性

  • 领域局限性:目前主要验证在科学编码任务中,多模态或其他通用创意任务的表现尚待观察。
  • 组合性挑战:实验发现简单叠加多个 Gene 反而可能模糊控制焦点,如何实现更高级的“基因重组”仍是开放课题。

发现相似论文

试试这些示例

  • 查找最近其他探讨 LLM 智能体经验表示(Experience Representation)优化或测试时扩增(Test-time Augmentation)的论文。
  • 哪篇论文最早提出了 LLM 领域中的“技能库(Skill Library)”或“程序化记忆(Procedural Memory)”概念,本文的 Strategy Gene 对其做了哪些本质改进?
  • 有哪些研究将类似 GEP 的自进化协议应用到了需要长期规划的复杂多智能体协作或强化学习任务中?
目录
从技能文档到策略基因:迈向经验驱动的测试时进化
1. TL;DR
2. 背景定位:经验复用的“信息陷阱”
3. 核心直觉:什么是 Strategy Gene?
4. 进化协议:GEP (Gene Evolution Protocol)
5. 实验战果:更小,却更强大
5.1. 1. 技术有效性对比
5.2. 2. 鲁棒性验证
6. 深度洞察:自进化的终局
7. 总结与启示
7.1. 局限性