多数投票在长任务里最不可靠的时候,Google 让模型回到环境里翻证据
让智能体把同一个长任务跑上好几遍,是现在最省事的提分手段:采样多了,总有一两次撞对。但长程任务的产物往往是一份报告、一个改好的代码仓、一张填完的表格,没有标准答案可以对。到底挑哪一份,以前常见的做法无非两种——少数服从多数,或者另请一个模型当裁判打分。
这篇论文(arXiv 2610.00972,作者包括 Caiqi Zhang、Tomas Pfister、Chen-Yu Lee 等,第一作者是在 Google Cloud AI Research 实习期间完成的)开头先做了一组观察,正好戳在这两种做法的软肋上:
换句话说,多数投票在最需要分辨的时候恰好最不可靠。
VeriHarness 的处理办法很朴素:别光读草稿,去环境里翻证据。它给底座模型配了一个工作区、一组取证工具和可复用的「验证技能」,拆成两个角色:
两边的发现汇总后,用来决定是直接选某一份、在某一份上修改,还是推倒重写。整个过程在测试时不需要参考答案,也不需要评分细则,用的还是那个出草稿的模型,没有额外请一个更大的裁判。
论文报告,在 5 个长程工作区基准、2 个前沿模型上,VeriHarness 的「选择分」在所有对比基线里最高;再叠加基于证据的修订,相对单次生成的平均提升达到 Gemini 3.5 Flash 6.2 分、Claude Opus 4.8 6.4 分。两家模型的增幅几乎持平,至少说明这套办法不是专门为某一家调出来的。
另一处容易被忽略的细节是成本。作者公开了约 2.6 万条 rollouts,摘要里直说生成这批数据花了超过 10 万美元。这个数字反过来也提醒了代价:多次采样加智能体式复核,等于把一次任务的推理开销乘上好几倍,6 分换多少钱,各家团队得自己算。论文还提到验证技能可以从失败反馈里自我改进,但具体能走多远,摘要没有给出量化结论。
Google 团队拿自家 Gemini 和 Anthropic 的 Opus 4.8 并排测,说明在长程智能体这条线上,Claude 已经是研究者默认要比的那一档。更有意思的是结果:同一个框架下,Opus 4.8 的提升略高于 Gemini 3.5 Flash,这意味着「自己查自己」的收益不取决于谁家出的方法,而取决于模型本身用不用得好工具、肯不肯推翻自己。
当然,选择分和平均分都只是论文作者在自选基准上的数字,基准具体是哪五个、对照的基线强不强,要等社区拿开源的 rollouts 复现之后才说得清。目前能确定的只有一点:「多数说了算」这条捷径,在长任务里正在被证据驱动的复核取代——至少在研究圈是这样。