← 返回 Claude AI IP 检测更多资讯 →

让写答案的模型自己查账,Opus 4.8 长任务多拿 6.4 分

首页 › AI 资讯 › Claude 资讯 · 2026-10-05 · Net.Coffee

多数投票在长任务里最不可靠的时候,Google 让模型回到环境里翻证据

怎么回事:Google Cloud AI Research 等发表 VeriHarness 论文,不另训评审模型,而是让生成答案的同一个模型带上工作区和取证工具反过来查自己的多份草稿;在 5 个长程任务基准上,修订后的结果比单次生成平均多出 6.2 分(Gemini 3.5 Flash)和 6.4 分(Claude Opus 4.8)。

多跑几遍不难,难的是信哪一遍

让智能体把同一个长任务跑上好几遍,是现在最省事的提分手段:采样多了,总有一两次撞对。但长程任务的产物往往是一份报告、一个改好的代码仓、一张填完的表格,没有标准答案可以对。到底挑哪一份,以前常见的做法无非两种——少数服从多数,或者另请一个模型当裁判打分。

这篇论文(arXiv 2610.00972,作者包括 Caiqi Zhang、Tomas Pfister、Chen-Yu Lee 等,第一作者是在 Google Cloud AI Research 实习期间完成的)开头先做了一组观察,正好戳在这两种做法的软肋上:

换句话说,多数投票在最需要分辨的时候恰好最不可靠。

分歧去查证据,共识去找茬

VeriHarness 的处理办法很朴素:别光读草稿,去环境里翻证据。它给底座模型配了一个工作区、一组取证工具和可复用的「验证技能」,拆成两个角色:

两边的发现汇总后,用来决定是直接选某一份、在某一份上修改,还是推倒重写。整个过程在测试时不需要参考答案,也不需要评分细则,用的还是那个出草稿的模型,没有额外请一个更大的裁判。

6 分左右的提升放在哪个量级

论文报告,在 5 个长程工作区基准、2 个前沿模型上,VeriHarness 的「选择分」在所有对比基线里最高;再叠加基于证据的修订,相对单次生成的平均提升达到 Gemini 3.5 Flash 6.2 分、Claude Opus 4.8 6.4 分。两家模型的增幅几乎持平,至少说明这套办法不是专门为某一家调出来的。

另一处容易被忽略的细节是成本。作者公开了约 2.6 万条 rollouts,摘要里直说生成这批数据花了超过 10 万美元。这个数字反过来也提醒了代价:多次采样加智能体式复核,等于把一次任务的推理开销乘上好几倍,6 分换多少钱,各家团队得自己算。论文还提到验证技能可以从失败反馈里自我改进,但具体能走多远,摘要没有给出量化结论。

Claude 出现在 Google 论文里不算新鲜,新鲜的是它当了对照组

Google 团队拿自家 Gemini 和 Anthropic 的 Opus 4.8 并排测,说明在长程智能体这条线上,Claude 已经是研究者默认要比的那一档。更有意思的是结果:同一个框架下,Opus 4.8 的提升略高于 Gemini 3.5 Flash,这意味着「自己查自己」的收益不取决于谁家出的方法,而取决于模型本身用不用得好工具、肯不肯推翻自己。

当然,选择分和平均分都只是论文作者在自选基准上的数字,基准具体是哪五个、对照的基线强不强,要等社区拿开源的 rollouts 复现之后才说得清。目前能确定的只有一点:「多数说了算」这条捷径,在长任务里正在被证据驱动的复核取代——至少在研究圈是这样。