Loading...
Loading...

Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。
如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。
联系小助手微信:seventy3_podcast(加群/投稿论文)
今天的这篇的主题是:
Learning Agent-Compatible Context Management for Long-Horizon Tasks
Summary
大语言模型(LLM)智能体在现实应用中越来越多地需要完成长时程任务(long-horizon tasks),例如网络搜索(web search)和深度研究(deep research)。然而,随着交互上下文不断累积,智能体容易出现**长上下文退化(long-context degradation)和推理能力下降(reasoning failures)**等问题。
现有工作通常通过**上下文管理(context management)来缓解这一问题,例如由智能体自身控制上下文,或采用固定策略(如摘要生成)对上下文进行压缩。然而,这些方法往往需要重新训练智能体以适应相应策略,因此对于闭源智能体(closed-source agents)**而言难以应用;同时,它们也忽略了不同智能体可能需要采用不同上下文管理策略这一事实。
为此,我们提出 Adaptive Context Management(AdaCoM)。AdaCoM 并不修改智能体本身,而是训练一个外部大语言模型(external LLM)作为上下文管理器,通过灵活的上下文修改操作(flexible modification actions)以及端到端强化学习(end-to-end reinforcement learning),为一个保持冻结(frozen)的智能体动态管理其上下文。
在多个不同智能体以及网络搜索和深度研究基准上的实验表明,AdaCoM 能够在**删除过时信息(pruning stale content)**的同时,尽可能保留任务约束(task constraints)和执行进度(task progress),从而显著提升智能体的整体性能。
进一步分析学习得到的上下文管理策略,我们发现了一种保真度—可靠性权衡(Fidelity–Reliability Trade-off):
基础 ReAct 表现较强的智能体,更适合采用**高保真(higher-fidelity)**的上下文保留策略,即尽可能保留完整上下文,以维持其推理能力。
基础性能较弱的智能体,则需要采用更加激进的上下文压缩策略,以避免过长上下文导致推理失稳,使其始终保持在一个**可靠的推理工作区间(reliable reasoning regime)**内。
此外,我们还进行了跨智能体迁移实验(transfer experiments)。结果表明,AdaCoM 在能力水平相近(以原始 ReAct 性能为衡量标准)的智能体之间具有最佳的迁移效果。这说明,一个为某类智能体训练得到的上下文管理器,可以较容易地复用于能力相近的其他智能体。
这些结果表明,将上下文管理从智能体本身解耦出来,并通过一个可复用的外部上下文管理器进行学习和优化,是构建长时程智能体系统的一条切实可行的发展路径。
原文链接:https://arxiv.org/abs/2605.30785
No transcript available for this episode.