Google提出RRSI:给Agent自我进化加正则化,破解OOD失效难题

📅 发布时间:2026/9/30 8:39:15
Google提出RRSI:给Agent自我进化加正则化,破解OOD失效难题
RRSI: Regularized Recursive Self-Improvement of Agent Harnesses作者Peng Xia, Rujun Han, Zifeng Wang, Yanfei Chen, Yufan Zhuang, Yoonho Lee, Chengsong Huang, Han Yu, Zhongying CuiZhu, Yifei Ming, Huaxiu Yao, Burak Gokturk, Tomas Pfister, Chen-Yu Lee核心发表机构Google Cloud AI Research、UNC-Chapel Hill、Stanford University、Washington University in St. Louis论文链接arXiv:2609.24972v2发布于arXiv 预印本cs.LG|————|T TT| evolution rounds | 20 | 20 | 40 ||k kk| trials per task per evaluation | 2 | 2 | 4 ||δ \deltaδ| empirical noise tolerance | 0.017 | 0.004 | 0.020 ||b min ⁡ b_{\min}bmin​| final-round edit budget | 1 | 1 | 1 ||b max ⁡ b_{\max}bmax​| initial edit budget | 4 | 3 | 4 ||w ww| stall-detection window | 3 | 3 | 3 ||m d r a f t m_{\mathrm{draft}}mdraft​| reserved exploratory proposals | 1 | 1 | 1 ||n p r u n e n_{\mathrm{prune}}nprune​| pruning window | 4 | 4 | 5 ||β 0 \beta_0β0​| base cost allowance | 0.10 | 0.10 | 0.15 ||β 1 \beta_1β1​| gain-dependent cost allowance | 44.5 | 35.4 | 24.4 |单位方面scoreS ^ \hat SS^是[ 0 , 1 ] [0,1][0,1]的分数Δ C \Delta CΔC是 policy tokens per trial 的相对变化因此δ \deltaδ和β 1 \beta_1β1​用这些单位表示。Coding instance 中δ \deltaδ对应 89 ×k kk 178 trials 中的 3 passesagentic workspace instance 中δ \deltaδ对应约 14,100 criterion verdicts 中的 60 criteriaengineering design instance 中δ \deltaδ对应 61 ×k kk 244 trials 中的 5 passes。β 1 \beta_1β1​对应coding 每额外一次 pass 允许 25% tokenagentic workspace 每额外 100 criteria 允许 25% tokenengineering design 每额外一次 pass 允许 10% token。四、实验 / Experiments4.1 数据集与评估指标 / Datasets Metrics实验覆盖八个 benchmark横跨 coding、agentic workspace 与 engineering design 三个领域。评估原则是harness 与其 baseline 总在同一窗口、同一工具环境、同一 judge、同样 trials 数下评估。五个 OOD 面包括 SWE-bench Verified、JobBench、GDPval、APEX-Agents 与 Frontier-Eng其中 Frontier-Eng 仅作为 out-of-distribution 测试面。Benchmark领域/角色任务与评分指标Terminal-Bench 2.1coding, evolve每个任务是 container image含 task description、working directory、hidden unit testsagent 通过 harness 驱动真实 shell任务解决仅当 agent 停止后任务自己的测试套件通过89 个任务中解决比例即 accuracySWE-bench Verifiedcoding, OOD每个实例是真实 GitHub issue 与报告时 repository snapshot 配对agent 产生 patch检查 fail-to-pass 与 pass-to-pass 测试同时满足两者的实例比例即 resolve rateHarvey LABagentic workspace, ID evolve/held-out每个任务提供 Word、Excel、PDF 源文档文件夹要求产生 deliverable严格 per-criterion rubric每任务 20 到 100 个独立 judged criteria约 14,000 criterion verdictsLLM judge 为 Gemini-3.5-Flash所有任务通过 criteria 的比例160 个任务固定划分为 120-task evolve set 与 40-task held-out setJobBenchagentic workspace, OOD任务来自真实专业工作流含 task folder、input files、wrapper prompt参考材料故意 withheldharness 暴露 filesystem、code execution、grounded web searchbenchmark 自己的 weighted rubric scorejudge 取 Gemini-3.5-Flash 与 Claude Opus 4.8 的平均GDPvalagentic workspace, OOD每个任务将 harness 产出与人类专家 deliverable 并排三位 judge 组成 panelQwen3.6-35B-A3B、Claude Sonnet 4.6、Gemini-3.1 Pro每对以两种 presentation orders 判断任务 verdict 为多数投票对 185 个任务的 win rate against the expert每个 judge 每个 harness 发出 204 次比较APEX-Agentsagentic workspace, OOD每个任务把 agent 放入 sandboxed world有自身 MCP tool surface覆盖 filesystem、PDF reading、spreadsheets、mail、chat、calendar、documents、code executionper-task rubricLLM judge 为 Gemini-3.5-Flash完整 480 个任务的 pass1基础设施失败导致 rollout 缺失计为失败不排除EngDesignengineering design, evolve使用 license-free subset取 61 个无需 proprietary simulators 的任务每个任务陈述 design goal 与物理约束由 frozen simulation 或 testbench 评分确定性 grading所有 61 个任务都用于 evolution无 in-distribution held-out splitFrontier-Engengineering design, OOD收集 26 个领域的真实工程优化问题每个任务要求产生 design 或 program由 frozen task-specific simulator/evaluator 在连续目标上评分Medal Score冻结 v1 snapshot 的三个最佳可行结果为 gold、silver、bronze 阈值提交达到阈值分别得 1、0.67、0.3347 个任务平均38 个贡献 credit评估指标中的S ^ \hat SS^是[ 0 , 1 ] [0,1][0,1]的 measured score。Δ C \Delta CΔC是 policy tokens per trial 的相对变化。Harvey LAB、JobBench、GDPval 使用 LLM judge因此论文用 EngDesign 与 Frontier-Eng 的确定性评分来检验收益是否能在无 judge 偏差路径下保持。所有任务在 arms 之间拆除重建容器或环境避免状态携带APEX-Agents 对基础设施失败的 rollout 也计为失败防止崩溃的 harness 因缺失数据看起来更好。4.2 主实验结果 / Main Results摘要报告跨八个 benchmarkRRSI 在其演化的 split 上最多提升 14.1 分在五个 OOD benchmark 上最多提升 4.7 分同时产生比无正则化演化少用 30% policy tokens 的 harness。下图汇总三个领域的主结果。在 coding domain 中论文分别用两个不同家族 policy 从相同 coding harness 开始只在 Terminal-Bench 2.1 上演化然后在 evolve benchmark 与 SWE-bench Verified 上评估。结果如下PolicyBenchmarkH 0 H_0H0​RRSIΔ \DeltaΔClaude Opus 4.8Terminal-Bench 2.1 (Evolve)74.280.26.0Claude Opus 4.8SWE-bench Verified (OOD)82.083.81.8Gemini 3.5 FlashTerminal-Bench 2.1 (Evolve)64.678.714.1Gemini 3.5 FlashSWE-bench Verified (OOD)76.879.02.2这说明 RRSI 不绑定单一 policy family。对于较强 policy Claude Opus 4.8起点已接近两个 suite 的上限增益空间更小对于 Gemini 3.5 Flashevolve split 提升 14.1 分OOD SWE-bench Verified 也提升 2.2 分。关键是harness 从未在 SWE-bench Verified 上被评分却改进了该未见 benchmark说明收益不特定于某一 backbone。跨模型迁移进一步支持这一点。论文取 coding run 的最终 harness用 Gemini 3.5 Flash 演化然后用从未参与搜索的 Gemini 3.1 Flash Lite 原样评估Evaluation policyH 0 H_0H0​RRSIΔ \DeltaΔGemini 3.5 Flash搜索 policy64.678.714.1Gemini 3.1 Flash Lite未见11.214.63.4Terminal-Bench 2.1 accuracy 从 11.2 提升到 14.6相对提升 30.4%base 分数不到搜索 policy 的五分之一。绝对增益更小因为较弱 backbone 能触达的任务更少但机制并不完全依赖搜索时所用 policy 的能力水平。Harness 是程序不是权重集合若机制只帮助搜索时所用 policy它就只是该 policy 的 artifact而非可复用机制。这里的迁移结果表明至少部分被保留的编辑具有跨 policy 的可复用性。在 agentic workspace 的消融表中RRSI 的 OOD Avg. 为 43.6高于未演化 harness 的 39.7、无正则化演化的 40.3、去掉 proposal regularizers 的 41.9 和去掉 acceptance regularizers 的 41.0其 evolve split 分数为 90.5ID held-out 为 89.2且 token 成本为 2.42 million/trial低于无正则化演化的 3.80。这些数值将在下一节结合消融机制展开。4.3 消融实验 / Ablation Study论文在 agentic workspace tasks 上对 proposal-side 与 acceptance-side 正则化做消融。OOD Avg. 是 JobBench、GDPval、APEX-Agents 的平均。VariantHarvey LAB (Evolve)Harvey LAB (ID Held-out)OOD Avg.Tokens/trial (m) ↓H 0 H_0H0​无演化89.486.939.71.56无正则化演化92.888.940.33.80w/o proposal regularizers90.788.841.92.69w/o acceptance regularizers91.588.741.03.59RRSI90.589.243.62.42这组消融清楚展示了过拟合与正则化的权衡。无正则化演化在 evolve split 上达到 92.8是所有 arm 中最高但其 OOD Avg. 只有 40.3距离未演化 harness 的 39.7 只差不到 1 分而 token 成本从 1.56 million 升至 3.80 million。换句话说无正则化演化把大量预算用于提高 evolve-set 分数但迁移收益几乎消失。去掉 acceptance constraints 后evolve-set 分数从 RRSI 的 90.5 升至 91.5但 OOD 平均从 43.6 降至 41.0token 成本约增加一半2.42 → 3.59 million/trial。这符合论文的解释无约束选择规则把大多数被接受的编辑花在 noise 和 context 上而不是 mechanism 上。去掉 proposal constraints 后evolve split 只损失 0.2 分RRSI 90.5 → 90.7实际略升但 OOD 损失 1.7 分43.6 → 41.9。这说明即使没有拒绝候选引导搜索“看哪里”也很重要proposal-side 约束让搜索更系统地探索组件而不是把预算耗在已有路径上的局部拟合。RRSI 在 ID Held-out 上最高为 89.2同时 OOD Avg. 最高为 43.6token 成本却低于无正则化演化。两组正则化的作用可以理解为互补proposal-side 约束改善搜索方向与结构探索acceptance-side 约束阻止噪声、上下文拟合与昂贵但不可迁移的变化进入持久演化路径。4.4 效率与机制分析 / Efficiency and Mechanism AnalysisRRSI 的两个正则化直接作用于成本。第一L 1 L_1L1​-style budget 拒绝“提议时未被支付”的增长第二pruning rule 移除“之后不再被支付”的增长。论文指出没有 prior method 同时携带这两个约束。下图在 agentic workspace instance 的 evolve split 上测量每个 arm 最终 harness 成本OOD Avg. 是 JobBench、GDPval、APEX-Agents 平均。图 (a) 中阴影区域是 RRSI 支配的区域每 trial 更多 policy tokens 换更低 OOD 平均。所有四个基线都落在 RRSI 支配区域它们花更多 policy tokens/trialOOD 平均更低。AHE 是极端例子3.82 million tokens/trial比 RRSI 多 58%OOD 低 4.4 分。图 (b) 显示轨迹长度RRSI 为 26.3 steps/trialprior methods 为 27.3 到 34.6。没有 evolved harness 像H 0 H_0H0​一样便宜H 0 H_0H0​为 1.56 million tokens、21.2 steps。因此演化确实用 test-time compute 买来部分收益预算决定买多少。定性案例进一步说明 RRSI 不是简单累积提高 evolve-set score 的 edits而是选择性保留 measured benefit 相对 complexity 足够稳健的变化。Domain / RoundHarness changeOutcomeWhat it illustratesCoding, R0-A增加 bounded pre-completion verification audit 和 non-blocking polling of long-running jobs 的 guidanceAcceptedevolve set 上 3.93 points当增益超过 noise threshold 时可复用 behavioral mechanism 可以正当化相对广泛的 early-round updateCoding, R0-B增加类似 verification reminder 和 long-running-work guidance但 measured gain 更小且额外推理成本Rejected by cost rule1.69 points26.1% cost当 apparent improvement 落在 noise band 内并需要大量额外计算时不会自动保留Coding, R8-B将原始 task instruction 固定进 completion gate使 policy 在提交前重新检查 literal specificationRejected by floor-2.81 points尽管 -13.6% cost仅降低 cost 不能补偿 performance 低于 noise-adjusted acceptance floor 的候选Engineering, R2为反复出现的 “workdir must be an existing directory” tool-use error 增加 bounded recovery hintAccepted122/244 → 128/244 passes1.6% tokens搜索可保留小的、task-agnostic control-flow fixes以很少复杂度提升可靠性第一轮 coding 的两个候选表面相似但只有 measured improvement 足够大的候选通过 cost-aware selection rule。第 8 轮 coding 候选降低 inference cost但 performance 低于 admissible floor仍被拒绝。Engineering 例子展示互补情况小的可复用 control-flow correction 在很少资源增长下被保留。这些案例共同表明stability floor、cost rule、noise-shaped admissibility 与 pruning 共同塑造了演化路径。五、相关工作 / Related Work在 agent harness 方向论文指出 harness 不只是 backbone 决定 agent 能完成什么。前沿实验室工程报告描述 prompt structure、tool interfaces、context compaction、recovery logic 决定长运行 agent 是否能完成任务。近期分析认为 harness 自身可以组合和泛化好的 harness 甚至可以替代规模以一小部分成本恢复更大 backbone 的许多能力。然而这种工程大多是手工的由于最佳 harness 与特定 backbone 绑定每次模型发布都要重付成本。在 harness evolution 方向最接近的工作自动化该循环LLM proposer 重写 harness若编辑提高 benchmark 分数则保留或只演化单个组件如 skills、memory或对 rollouts 的 preference signal。这类方法继承自改进 agent 的机制与风险在自身代码上搜索并以经验 fitness signal 驱动。问题在于搜索由其所优化 suite 的分数驱动没有泛化项报告增益经常不能跨 suite 存活delta attribution 可区分“安装可复用机制”的编辑与“仅拟合 evolution tasks”的编辑。并发工作也直接针对泛化把泛化作为搜索显式目标或把 greedy selection 替换为对候选 harnesses 的多样性保留 archive。RRSI 的贡献与这些方法“编辑什么”正交它保持相同开放编辑空间但正则化搜索动态。具体而言credit 分配给完整演化历史task-specific logic 在评分前过滤接受对比噪声调整基线proposal 通过退火预算、未探索组件引导与结构剪枝目标被塑造。因此RRSI 的目标是让存活的是机制而不是对 evolution suite 的拟合。四个 harness-evolution 基线包括Meta-Harness将 harness engineering 表述为对可执行 harness code 的 outer-loop optimizationagentic proposer 可访问 source code、evaluation scores、previous candidates 的 execution tracesAgentic Harness Engineering (AHE)使用 observability-driven evolution loop 演化 coding-agent harnesses将 harness components、execution experience、edit outcomes 组织为显式表示Test-Time Harness Evolution (TTHE)在 test-time adaptation 中演化可执行 harness同时保持底层 model weights 固定维护多个候选 harnesses从 execution traces 提出修改用 agentic judge 选择持续到后续输入的 harnessHarnessX将 agent harness 表示为 modular、typed primitives 的组合涵盖 prompts、tools、memory、control flow其 trace-driven adaptation 机制利用 execution feedback 修改和选择 harness 配置。RRSI 与它们的关键差异在于对搜索动态施加正则化而不仅是改变编辑空间或选择启发式。六、局限性与展望 / Limitations Future Work论文列出三点局限。第一研究聚焦 frozen backbone models 的 harness-level RSI因此不涉及演化过程中更新模型权重的设定。第二RRSI 仍依赖有限 evolve set 和若干正则化超参数效果可能依赖反馈信号质量和所选搜索预算。第三虽然跨多个领域、benchmark、policy models 评估迁移仍需更广泛验证以确定方法如何泛化到显著不同的 agent 架构、工具生态与更长运行的自我改进过程。从给定源码笔记还可确认若干边界。超参数按 evolution instance 固定且只在 evolve environment 上调参未使用 held-out 或 OOD这意味着其泛化性依赖该调参协议。噪声容差δ \deltaδ需要对未改动 base harness 进行重复评估来校准。领域防护是手工设定的engineering design 使用 0.03 valid-output rate 下降和 0.02 no-submission rate 上升阈值coding 与 agentic workspace 没有额外 guard。OOD 增益最高 4.7 分小于 evolve split 上 14.1 分说明泛化差距虽被缓解但仍存在。定性案例是代表性示例不是统计显著性检验。另外笔记片段未展示 Eq. (tokenbudget) 的具体形式因此完整成本接受规则无法仅凭该片段复核这属于资料限制说明而不是对论文结论的否定。展望方面论文的方向是继续研究 agent-system 层面的递归自我改进并把正则化原则扩展到更广泛的 agent 架构、工具生态和更长运行过程。一个自然问题是当 backbone 权重也可更新时harness-level 正则化如何与模型权重训练交互。另一个问题是如何减少对有限 evolve set 和手工领域防护的依赖让正则化从反馈质量、任务分布与搜索预算中自适应校准。七、总结 / Conclusion论文研究迭代 harness evolution 作为 agent-system 层面的一种实用 RSI 形式并表明递归过程本身需要正则化。因为有限 evolve set 在多轮中被自适应复用表观自我改进可能反映 benchmark-specific fitting、evaluation noise、不必要的复杂度而不是可迁移进展。RRSI 通过同时正则化 proposal 和 selection同时保持 harness 编辑空间开放来应对这一问题。Proposer 侧使用时间退火编辑预算、未探索组件引导与结构剪枝目标Selector 侧使用稳定性下限、复杂度感知接受规则、噪声带内接受规则与领域特定非补偿性防护。跨 coding、agentic workspace、engineering design 任务得到的 harness 提高 held-out 和 cross-benchmark 性能并比无正则化演化使用更少推理成本。摘要与笔记中的关键数值包括evolve split 最多 14.1五个 OOD benchmark 最多 4.7最终 harness 比无正则化演化少用 30% policy tokens在 agentic workspace 消融中RRSI 的 OOD Avg. 为 43.6高于无正则化演化的 40.3 和未演化 harness 的 39.7同时 token 成本为 2.42 million/trial低于无正则化演化的 3.80。论文的结论是通过 RSI 让 agent 系统越来越有能力不仅要控制“什么可以改变”还要控制“重复反馈如何转化为持久变化”。原文摘要:An LLM agent’s capability is largely magnified by its harness, namely the prompts, control flow, tooling, memory, and context management surrounding the frozen backbone model. Recent methods increasingly automate this process by iteratively proposing and selecting component-wise edits of an agent harness, practically establishing a form of recursive self-improvement (RSI) at the agent-system level. However, such recursive evolution may overfit by memorizing the training tasks, showing large in-distribution gains that shrink or even vanish on out-of-distribution benchmarks. We introduce Regularized Recursive Self-Improvement of Agent Harnesses (RRSI), which incorporates the principles of regularizations into harness self-improvement by constraining the evolution candidate proposal and selection. The proposer operates with a temporally annealed budget, limiting how many edits a candidate can bundle, and it encourages unexplored trajectories based on evolution history. The selector is equipped with a critic and a pruner: the critic screens benchmark-specific proposals, while the pruner, removes changes that are too small, too expensive, or no longer useful. Together these constraints favor reusable agent mechanisms over benchmark-specific ones or even noises. Across eight benchmarks spanning coding, agentic workspace and engineering design tasks, RRSI gains up to 14.1 points on the split it evolves against and up to 4.7 points on the five out-of-distribution benchmarks, while producing a harness that runs on 30% fewer policy tokens than the unregularized evolution. Code is available at https://github.com/google-research/rrsi and project page is https://regularized-rsi.com/.PDF链接:https://arxiv.org/pdf/2609.24972v2部分平台可能图片显示异常请以我的博客内容为准