参数没涨,性能暴涨50%
8月14日,智谱发布GLM-5.3。参数还是7400亿,没换底座,但性能硬生生拉高了50%——这个"不卷参数卷后训练"的路子,有点意思。
此前传闻的万亿参数升级没出现,那张牌被留给了GLM-5.5。GLM-5.3的打法很明确:用更长的后训练时间,把模型能力逼出来。
三个数据看懂这次升级
智谱放出的benchmark数据很硬核,挑三个最关键的看:
- Terminal-Bench 3.0:从4.6蹿到28.3。这个测试衡量模型在真实终端环境完成任务的能力,翻了6倍。
- DeepSWE v1.1:从46.2涨到66.9。专注长程软件工程和持续代码修改,涨了20个百分点。
- Z.ai Code Bench:High档位准确率31.4%,超过Claude Opus 4.8的29.5%,而且每任务只输出5万tokens,Opus要12万。
翻译成人话:GLM-5.3能用更少的token、更短的路径,干完同样复杂的编程任务。
编程能力追上Claude了?
智谱自己说"编程能力接近Claude Fable 5"。Fable是Anthropic的高端编程模型,GLM-5.3能追到这个水平,在国产模型里确实是头一份。
不过要客观看:"接近"不是"超越",而且Fable 5本身也在迭代。GLM-5.3的真正优势在于——它是开源的,模型权重两周内就会放出。
对开发者来说,有个接近闭源顶级水平的开源模型可用,这才是实打实的好处。
怎么用?
GLM-5.3已经上线智谱官方工具:
- ZCode:智谱的编程工具,类似Cursor
- AutoClaw:效率工具,类似AI助手
第三方平台也接入了:TraeWork、TraeCode、扣子、WorkBuddy、CodeBuddy、Qoder、QwenWork、CatPaw、JoyCode、OpenCode等。
API很快上线,完整模型权重两周内开源(MIT协议)。
这波升级意味着什么
GLM-5.3的发布,其实释放了一个信号:国产大模型开始从"卷参数"转向"卷后训练"。
参数量是有边际效应的,万亿参数的训练成本和推理成本都是天文数字。智谱这波证明:把后训练做深,7400亿参数也能逼近闭源顶级水平。
对开发者来说,这是好事——模型更聪明了,但调用成本没涨。
今天13:00,智谱GLM Coding Plan的全员额度已经重置,后台用量统计都能看到额度回满。想尝鲜的可以去试试。
评论区