Loading...
Loading...

今天的这篇的主题是:LLM-as-a-Verifier: A General-Purpose Verification Framework
Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。
如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。
联系小助手微信:seventy3_podcast(加群/投稿论文)
Summary
扩展预训练(Pre-training)、后训练(Post-training)以及测试时计算量(Test-time Compute)已成为提升大型语言模型(LLM)能力的核心范式。在这项工作中,我们将“验证能力”(即确定解决方案正确性的能力)识别为一种全新的扩展轴(Scaling Axis)。为了解锁这一维度并证明其有效性,我们提出了“LLM-as-a-Verifier”——这是一个通用的验证框架,无需额外训练即可为智能体任务(Agentic Tasks)提供细粒度的反馈。与提示 LLM 为候选方案输出离散评分的标准 LM 评测器(LM Judges)不同,LLM-as-a-Verifier 通过计算评分 Token Logit 分布的期望值来生成连续分数。这种概率化的表征方式使得验证能够沿着多个维度进行扩展:(1)评分粒度、(2)重复评估,以及(3)标准分解。特别是,我们表明扩展评分粒度可以更好地区分正确与错误方案,从而实现更加校准的对比。此外,通过降低方差和复杂度,扩展重复评估与标准分解能稳步地进一步提升验证准确率。我们还提出了一种低成本的高效排序算法,利用验证器的连续分数从候选方案中挑选出最佳结果。LLM-as-a-Verifier 在 Terminal-Bench V2 (86.5%)、SWE-Bench Verified (78.2%)、RoboRewardBench (87.4%) 和 MedAgentBench (73.3%) 上均取得了业界领先(SOTA)的性能。除了验证本身之外,来自 LLM-as-a-Verifier 的细粒度信号还可以作为估计任务进度的代理指标。我们针对 Claude Code 构建了一个扩展程序,使开发者能够监控并改进他们自己的智能体系统。最后,我们展示了 LLM-as-a-Verifier 能够为强化学习(RL)提供密集反馈,从而在机器人学和数学推理基准测试中提升 SAC 和 GRPO 的采样效率。
原文链接:https://arxiv.org/abs/2607.05391
No transcript available for this episode.