Loading...
Loading...

Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。
如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。
联系小助手微信:seventy3_podcast(加群/投稿论文)
今天的这篇的主题是:
Harness Updating Is Not Harness Benefit: Disentangling Evolution Capabilities in Self-Evolving LLM Agents
Summary
大型语言模型(LLM)智能体正越来越多地以围绕可编辑外部 harness构建的系统形式部署。这些 harness 包括提示(prompts)、技能(skills)、记忆(memories)和工具(tools),它们无需修改模型参数即可影响任务执行过程。**Harness 自演化(harness self-evolution)**则通过利用执行过程中积累的证据,不断更新这些 harness,以实现智能体的持续适应。
然而,一个尚未明确的问题是:**模型自身的基础任务求解能力(base capability)是否能够预测其 Harness 自演化能力?**换言之,哪些模型能够生成有价值的 harness 更新,又有哪些模型能够真正从这些更新中获益?
我们将 Harness 自演化能力划分为两个方面进行分析:
Harness 更新能力(harness-updating):即模型根据执行证据生成有价值、可长期保留的 harness 更新的能力。
Harness 受益能力(harness-benefit):即模型在任务执行过程中利用更新后的 harness 提升自身表现的能力。
我们的分析得到两个主要发现。
首先,Harness 更新能力与模型基础能力几乎无关(flat in base capability)。来自不同能力层级的模型所生成的 harness 更新,带来的性能提升出乎意料地相近。例如,Qwen3.5-9B 所生成的 harness 更新,其效果与 Claude Opus 4.6 产生的更新几乎相当。
其次,Harness 受益能力与模型基础能力之间呈现非单调关系(non-monotonic)。具体而言:
弱能力层级(weak-tier)模型几乎无法从更新后的 harness 中获得明显收益;
中等能力层级(mid-tier)模型能够获得最大的性能提升;
强能力层级(strong-tier)模型虽然仍有收益,但提升幅度反而低于中等能力模型。
进一步分析表明,弱能力模型收益较低主要源于两种失效模式:
无法激活(activate)与当前任务相关的 harness 内容;
虽然成功激活了相关 harness,但无法忠实地遵循(follow faithfully)其中提供的指导。
这些发现表明,在构建具备 Harness 自演化能力的智能体时,计算和能力预算更应优先投入到负责任务求解的智能体本身,而不是负责生成 harness 更新的演化器(evolver)。与此同时,在智能体训练过程中,应重点提升其Harness 调用能力(harness invocation)以及长时程指令遵循能力(long-horizon instruction following)。
原文链接:https://arxiv.org/abs/2605.30621
No transcript available for this episode.