320B 总参数、18B 激活、100 万上下文,限时输入价 0.075 美元每百万 tokens,且全部推理流量由国产 AI 芯片承载。
8 月 26 日,智谱把 GLM-5 系列的第一个原生多模态模型 GLM-5.3-Flash 放了出来,同时开源权重。名字里带 Flash,通常意味着"快而便宜的那一档",但这次它被摆到了对标 Claude Opus 4.8 的位置上——这是这条消息真正扎眼的地方。
先把可核实的数字摆齐:
看到十分之一的降价,第一反应容易是"又在烧钱抢用户"。但把参数摆出来会发现,这个价格和它的结构是自洽的:320B 的总容量决定了它能装下多少知识,18B 的激活量决定了每生成一个 token 实际要过多少次乘加。MoE 的意义就在于把这两件事解耦——推理成本跟着激活参数走,而不是跟着总参数走。18B 激活在今天已经属于相当克制的规模,配上稀疏与线性注意力的混合设计(长上下文里注意力开销往往比前馈层更要命),单位 token 的算力账确实能压得很低。
换句话说,这次降价的可持续性,比单纯的促销要高一些。限时价过后回到 0.15 / 0.50 美元,仍然是个低到不像旗舰的数字。
需要说清楚:所谓打平,指的是 Artificial Analysis 那个综合智力指数上的 57 分同分,以及若干编程和智能体基准的分数接近,不是"用起来和 Opus 4.8 一样"。这两件事之间的距离,任何长期用大模型干活的人都清楚。
基准分数衡量的是有标准答案的题目答对了多少;而实际工作里更折磨人的,是长任务里的指令保持、改到第七轮还记不记得第一轮的约束、面对含糊需求敢不敢反问、工具调用出错之后能不能自己收拾残局。这些维度榜单基本测不出来,也正是各家旗舰模型价格差距的真实来源。
所以更准确的读法是:在"一次性答对一道有明确答案的题"这个层面,一个 18B 激活的模型已经追上了当前第一梯队。这已经足够有信息量了——它意味着大量批量化、模板化、可验证的活儿,继续用最贵的模型跑正在变得难以辩护。
官方说法里有一句容易被价格盖过去的话:匿名测试期间,这个模型(此前以 Ox-Alpha 的代号出现)的全部推理流量由国产 AI 芯片集群承载,官方称端到端推理性能相比基线提升了约 3 倍,效率可以比肩主流英伟达 GPU。
据官方技术说明,做法是在 SGLang 之上自建推理引擎,用 EPD(编码-预填充-解码)分离配合张量并行,再叠加 W8A8 量化与混合缓存量化,绕开国产芯片在显存容量和带宽上的短板。这些手段本身不新鲜,新鲜的是它们被组合起来撑住了一个真实在线服务的全部流量,而不是跑个 demo。
如果这个说法站得住,它的分量其实大过降价本身。一个旗舰级模型的推理侧摆脱对特定硬件供应链的依赖,意味着后面的价格还能继续往下走,而且不受出口管制节奏的牵制。对 Anthropic、OpenAI 这些同时要付英伟达账单的公司来说,压力不在这一次的分数,而在对手的成本曲线是不是一条自己够不到的斜线。
结论不必二选一。比较务实的做法是按任务的"可验证程度"分层:格式转换、批量摘要、结构化抽取、有测试兜底的代码补全,这类跑错了立刻能发现的活儿,用便宜模型的边际风险很小,省下的钱是实打实的;而跨文件重构、模糊需求下的方案设计、长链路的智能体任务,出错成本高且不易察觉,继续留给自己最信得过的那个模型更划算。
顺带一提,真按 tokens 计费之后,很多人会突然对自己每天烧掉多少上下文变得敏感起来——这方面 Claude Code 的配置习惯里有不少能直接省钱的细节,比如别让整个仓库无谓地进上下文。
而如果你的主力仍然是 Claude,那么在纠结换不换模型之前,更值得先确认的是访问链路本身稳不稳——同一个账号挂在被判定为高风险的出口 IP 上,体验落差往往比换模型还明显,而这件事用 Claude AI IP 检测就能先排除掉。