它不打算单方面停下,它要的是一套还没人造出来的验证机制
一家把 AI 编程工具卖得正火的公司,公开主张整个行业应该有能力踩刹车——这件事本身就足够让人起疑,也足够让人认真看看它到底拿出了什么理由。
这篇文章最有分量的部分不是结论,而是 Anthropic 摊开的内部数字。按其披露,截至今年 5 月,合并进 Anthropic 生产代码库的代码中,超过 80% 由 Claude 写成;而在 2025 年 Claude Code 推出之前,这个比例只是个位数。另一组数据:
Anthropic 由此担心的,是所谓「递归自我改进」:AI 系统能够完全自主地设计和开发自己的下一代。文章承认「我们还没到那一步,这也并非必然」,但认为它可能比多数机构准备好的时间来得更早。换句话说,它警告的那个闭环,最早的迹象就出现在它自己的研发流程里。
容易被标题带偏的是,Anthropic 并没有说自己要停。它的原话是:如果前沿或接近前沿的其他开发者也以可验证的方式放缓,它就会跟着放缓或暂时暂停。单方面停下来不在选项里——文章自己就写了,如果放缓只是让最不谨慎的参与者追上来,所有人反而更不安全。
所以真正的提案是一套还不存在的机制:多个国家、多家资源充足的实验室,在同样的条件下同意停下;每一方都能确认别人真的停了;事先说清楚什么情况触发、什么情况解除、由谁裁决。难点 Anthropic 也点得很直白——训练任务比导弹发射井容易隐藏得多(原文:far easier to conceal than missile silos),而悄悄违约的诱惑巨大。它给自己揽下的活,是由 Anthropic Institute 去研究这套验证体系需要什么,并组织政策制定者、研究者和其他公司一起讨论。
反对意见集中在两点。其一是动机:据外媒报道,白宫官员和部分业内人士认为,Anthropic 反复强调最坏情况是在夸大风险,本质上是借安全之名拖慢竞争对手。其二是地缘:美国官员和科技高管一再主张,任何放缓都可能把这场技术竞赛的优势拱手让给中国。
有意思的是,第二条批评和 Anthropic 自己的前提其实是一致的——双方都同意单方面放缓会让对手抢跑。分歧在于下一步:批评者据此认为不该慢,Anthropic 则认为应该先把能让大家一起慢的验证工具造出来。至于第一条,领跑者提议全行业同步减速,天然会被怀疑是想锁定身位,这个嫌疑 Anthropic 很难靠一篇文章洗清。
三个月过去,局面有了变化。7 月 29 日,来自 Anthropic、Google DeepMind、OpenAI 和 Meta 的 1200 多名员工(后续报道称约 1400 人)联名致信,希望美国政府支持国际层面开发「有意识地调节前沿自动化 AI 开发节奏」所需的技术与治理工具,签名者包括 Dario Amodei 与多位 Anthropic 联合创始人、OpenAI 首席科学家 Jakub Pachocki、Meta 首席科学家赵晟佳和 DeepMind 的 Anca Dragan。进入 9 月,Pachocki 发文呼吁极度谨慎,据彭博社报道,奥尔特曼也在全员会上表示愿意与其他实验室协调放慢步伐。
6 月那篇文章里被当成孤立立场的东西,如今至少有了几家同行的口头呼应。但它最硬的那个前提——一套能让竞争对手互相确认「真的停了」的验证体系——到今天还没有任何一家公司、任何一个政府拿出来。
还有一层绕不开的讽刺:让 Anthropic 觉得时间不多的那个 80%,正是它卖得最好的产品在客户那里复制的东西。它想要的刹车,得装在一辆自己也在踩油门的车上。