评估结论的保质期,正被压到比评估周期还短
四家把节奏挤进同一周,对使用方来说就不是四条独立新闻,而是一次同时到期的重新选型。
版本多本身不累,累的是上一轮结论作废得太快。一家公司做一次像样的选型比较——搭测试集、拿真实工单跑、算单位任务成本、再观察一周的稳定性——通常要两到三周。而这两三周里,四家各自又发了新版本,等结论出来,被比较的对象已经不是当初那几个了。评估的保质期被压到比评估周期还短,这笔投入就很难收回来。
AI 初创公司 Runpod 的 CEO Zhen Lu 说,模型疲劳是真实存在的。这句话的分量在于说话的人所处的位置:他不是被更新推着跑的下游用户,而是要为客户备好算力去承接这些新模型的那一端。连他都觉得跟不上,说明节奏的问题不只出在采购部门。
比较成本上升,并没有让预算跟着收缩。Gartner 预计今年全球 AI 支出将达到 2.59 万亿美元,同比增长 47%,其中超过 45% 流向 AI 基础设施,另有超过 1 万亿美元花在服务、软件、安全和各类工具上。钱花得越多,证明这些钱有回报的压力就越大,而回报的证据恰恰要靠那套来不及做完的评估来提供。这是一个自己咬住自己的循环。
推动这个节奏的不全是技术竞争。Anthropic 与 OpenAI 都在往公开市场走,私募市场给出的估值各自接近 1 万亿美元,在这个阶段,发布密度本身就是叙事的一部分。代价也开始露头:几家公司近期都出现过未授权访问相关的事件,外界因此开始追问,发布速度是不是已经跑到了安全测试前面。
还有一层变量不会写进任何对照表。频繁切换模型的团队常会发现,最先出问题的不是模型能力,而是自己这一端:账号被判定异常、请求被拦在半路,看起来像模型不稳定,实际是接入侧的风控在起作用。要做横向对比,先把账号与出口环境这层变量排掉,比出来的结果才算数。