Files
tech/知识/微信公众平台/阿颖/2026-08-20_对_GLM-5.3_的真实评价.md
T
arnoandClaude 576fbc0253 文档(金鹏): 2026-08-20 章节 26 篇文章摘要归档
- 26 篇微信公众号文章原文+摘要归档至 知识/微信公众平台/{公众号}/
- 9 个主题分组:Skill工程/Agent运行时/数据基础设施/交互工具/产品服务/大模型前沿/产业开源/制造业AI/军事社会
- 生成 9 组配图(2560x1440 大图 + 160x90 thumb)至 知识/金鹏/20260820/
- 知识/金鹏.md 2026-08-20 章节改写为结构化索引(主题标签+配图+金句+分层子条目)
- 1 个小红书视频链接以视频笔记条目保留(内容无法文本化)

Co-Authored-By: Claude <noreply@anthropic.com>
2026-08-20 17:01:28 +08:00

229 lines
12 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters
This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.
# 对 GLM-5.3 的真实评价。
> **来源**:微信公众平台(阿颖)
> **作者**:阿颖
> **发布日期**:2026-08-20(原文未标注明确日期,按下载日占位)
> **原文链接**:https://mp.weixin.qq.com/s/SpXEbbzv9jZ2xrZd7lcM7w
---
时隔两个月,GLM-5.3 来了。
从今天大家的反馈来看,效果确实非常不错。**我感觉智谱这一年,应该是找到了一条非常清楚的路径来继续优化模型能力。**
而且这次出乎所有人的意料。按照智谱 Release Blog 的说法,GLM-5.3 相比 GLM-5.2,基座模型没有变,模型参数也没有继续增加,但能力仍然有不小的提升。
这些提升,全部来自后训练。
![Image 1: 文章图片](https://mmbiz.qpic.cn/mmbiz_png/iagroyM7YaBnpVF1c5pibmfdHyHs4nz2OvmgjWPWbSURepd4xdH8UDejT4UmJpFaH12ItGlrFcbiac5oxuzJLTSZ1UYvLicZFwGyicTFXpFWHR7M/640?wx_fmt=png&from=appmsg&tp=webp&wxfrom=5&wx_lazy=1#imgIndex=0)
**智谱这家公司真的非常神。**从学术起家,创始人也是国内大模型圈里最学术的,感觉所有对大模型技术路线感兴趣的同学,都值得认真看他们的 Model Card。
**#01**
**预训练和后训练**
这两年,其实所有大模型公司主要都在两个地方下功夫。一个是继续做 Pre-training Scaling,另一个就是越来越重要的 Post-training Scaling。
两边大家其实都在做,只是不同公司、不同阶段的侧重点不一样。
先说 Pre-training Scaling。
这条路我们其实非常熟悉,一个最直观的表现,就是模型还在越做越大。**比如 Kimi K3,直接把总参数做到了 2.8T。**字节的模型据说也要奔着 10 万亿去。
模型参数大概已经成了每次大模型发布时,大家最喜欢问的问题之一。
但其实参数量从来都不是一个可以单独看的数字。至少还要一起看几件事:你有多少训练数据、多少算力,以及这个模型最后要在什么样的条件下运行。
2020 年,OpenAI 的 Jared Kaplan 等人发表了一篇后来影响非常大的论文《Scaling Laws for Neural Language Models》。
很多人今天讨论大模型的 Scaling Law,都会追溯到这篇论文。
它当时给行业一个很强的信号:随着算力增加,模型规模还可以继续往上做,而且参数量可以比训练数据增长得更快。
整个行业很快就沿着这个方向往前走。
于是有了 GPT-3 的 175B、Gopher 的 280B,以及后来的 MT-NLG 530B。那几年大家最直观的感受就是,模型越大,能力通常也越强。
到了 2022 年,DeepMind 又重新研究了一遍这个问题。
**他们训练了四百多个不同规模的模型,最后发现,之前大家其实有点过于追求参数量了。**
在同样的算力预算下,与其把参数一味做大,不如把更多算力拿出来,让模型看更多数据。
他们最后给出了一个很有名的经验值:大约每一个参数,配 20 个 Token 的训练数据。并且应当以相同的速率增长,也就是说这个配比不随规模漂移。
随后 DeepMind 训练出了 Chinchilla。它只有 70B 参数,远小于 280B 的 Gopher,但用了 1.4T Token 来训练。
**结果在差不多的训练算力下,Chinchilla 不仅超过了 Gopher,也超过了当时很多参数规模大得多的模型。**
这件事当时给行业一个很大的启发:
模型参数、数据和算力之间需要找到更合适的配比。**一个参数少一些、但训练得更充分的模型,完全可能超过一个大得多的模型。**
所以今天我们看到大家继续做 Pre-training Scaling,也不能简单理解成继续堆参数。真正要 Scale 的,其实一直都是参数、数据和算力这一整套东西。
与此同时,Post-training Scaling 也已经变得无比重要。
我再稍微解释一下。
**预训练其实就是先给模型打一个足够好的底子,后训练则是通过 RL、环境和真实任务,把这个底子不断变成更强的能力。**
像 GPT-3 时代,预训练几乎承担了模型能力提升的大部分工作。后训练更多是在做最后一层调整,比如让模型学会聊天、遵循指令。
所以当时大家基本会认为,一个模型到底有多强,在 Base Model 训练完成的时候,大概已经决定了。这也是最早“大力出奇迹”的由来。
后来到了 O1 这一代,大家发现 RL 不只是负责把模型调整得更好用,它本身也能够继续提升模型能力。
数学推理、Coding,包括 Agent 连续完成复杂任务的能力,都可以通过大规模 RL 继续往上训练。
智谱的 GLM-5.3 这次,没有增加参数,也没有换基座,只靠后训练,仍然把模型能力往上推了一截。
所以我推测,他们在后训练这部分,应该确实找到了一些切实有效的方法。
**#02**
**Post-training Scaling**
Post-training Scaling 到底怎么做?**很简单,Scale Environment,Scale Experience。**
我们可以把 Post-training 的发展分成几个阶段。
最早就是我们熟悉的单轮 Q&A。模型回答一道数学题,然后告诉它对还是错,然后 RL 更新权重。
**后来大家发现,单纯做 Q&A 太简单了,很多更复杂的能力根本练不出来,于是就开始把模型放进模拟环境里训练。**
比如 Coding。以前可能只是给模型一道编程题,现在会真的给它一个代码库,允许它调用 Terminal、修改代码、运行测试。
模型可能先看代码,发现问题之后修改,跑一遍测试失败了,再回来重新分析,然后继续修改。
整个过程可能连续几十步甚至几百步,最后再根据任务到底有没有完成,给它一个 Reward。
这时候,模型就开始学习怎么使用工具,以及怎么在很长的任务里保持目标等等。
**过去这一年,模型在长程任务上的快速提升,很大程度上都和这些后训练方法有关。**
同时,大家也意识到,如果想让模型获得更高阶的能力,就需要同时提高环境的复杂度。
**如果大家去看智谱今天的公众号,会发现他们专门提到了这事。**
![Image 2: 文章图片](blob:https://mp.weixin.qq.com/37d80127b73f829661c0d17b431e0b18)
所以 Post-training Scaling 和 Pre-training Scaling,Scale 的东西开始不太一样。
预训练的 Scale,主要增加模型规模、训练数据和计算量。**后训练往上 Scale,则是让模型面对越来越复杂的任务、更真实的环境,以及越来越长的任务过程。**
**有点像读万卷书和行万里路的区别。**
话说我还是强烈推荐大家读一下智谱官方的 Blog。前面讲的这些线索,他们都已经点到了。
![Image 3: 文章图片](blob:https://mp.weixin.qq.com/37d80127b73f829661c0d17b431e0b18)
**像我圈红框的地方,IndexShare、SAO、Slime 都有对应的论文或者 GitHub 地址可以研究。**我放下链接,感兴趣的同学可以看看,我都想组个读智谱论文的活动了.......
https://arxiv.org/abs/2603.12201
https://arxiv.org/abs/2607.07508
https://github.com/THUDM/slime/blob/main/README_zh.md
**而且你看红框最后一句,他们说,可能还远未开发出这个基座的智能上界。**这话太给人想象空间了。
毕竟 GLM-5 系列在开发者内心的封神程度,已经超过大家对这个尺寸模型的预期上限了。
这次官方 Blog 的第二点,专门把网络安全能力拎了出来,他们专门用了很大的篇幅解释网络安全。
我的理解是,GLM 前面一直在重点 Scale Coding 和 Agent 的长程任务。
**但随着训练环境越来越复杂,模型原来在 Coding 里练出来的能力,也开始迁移到更专业的领域,网络安全就是其中一个。**后面可能还会解锁能多的领域。
从逻辑上,我觉得这也能理解。毕竟安全工作本身就和 Coding 高度相关。再加上智谱专门的安全环境训练,这个能力就被迅速放大了。
再看看今年以来的变化。**进入 2026,据传几个 Frontier Labs 包括 OpenAI 和 Anthropic 几乎都在模型中用到了 Loop Transformer。**
Loop Transformer 的核心,是让 Scaling Law 的衡量目标从单纯扩大总参数量,转向推理链路长度(一次 forward 中实际经过了多少有效计算)。
本质上,这是预训练中的后训练带来的收益。
**#03**
**我跑的几个 Case**
最后给大家看看我用 GLM-5.3 做的一些 Case。
这个是我一位 00 后同事做的。小哥花了一个多小时,就跑出了完全可用的象棋应用。还挺酷炫的。有同学需要的话,我可以私发。
我用 GLM-5.3 给团队做了一个排版小工具。
这个想法其实周一就有了,因为我同事每次排公众号都特别慢,我觉得 10 分钟能搞定的事,他经常要花半个小时,主要时间都耗在段落调整、加粗这些细节上。
**所以今天我干脆说,直接做个工具吧。**以后这些段落、加粗之类的排版工作都交给 AI,5 分钟基本就能搞定。
大家看,左侧直接从飞书文档把文章复制进去,右侧加粗和段落都会调整好。我直接点复制到公众号的按钮,再粘贴到公众号的文章页就行了。
![Image 4: 文章图片](blob:https://mp.weixin.qq.com/37d80127b73f829661c0d17b431e0b18)
图片也可以直接过去。
![Image 5: 文章图片](blob:https://mp.weixin.qq.com/37d80127b73f829661c0d17b431e0b18)
前面两个 Case 都偏工具,我们再看一个复杂的,直接看我们线上跑的生产系统。
这两天我发现,下个月准备上线的购票订单功能总有一些 Bug。
**平时测试看着没问题,但一到并发高一点的时候,就会偶尔出现重复订单、漏单,或者订单状态对不上的情况。**
![Image 6: 文章图片](blob:https://mp.weixin.qq.com/37d80127b73f829661c0d17b431e0b18)
之前的代码我其实是用 Codex 写的。这个问题,Codex 也没有解决,我这边已经没有什么思路了。
大家看 GLM 5.3 的排查逻辑。先是把整个链路的代码都过了一遍,跑了下测试,发现没问题。**我看的时候就心想,小样,这个级别的小问题,肯定不会卡我这么久啊。**
![Image 7: 文章图片](blob:https://mp.weixin.qq.com/37d80127b73f829661c0d17b431e0b18)
接着继续,他通过端到端的模拟,跑了一次链路。发现了问题。
![Image 8: 文章图片](blob:https://mp.weixin.qq.com/37d80127b73f829661c0d17b431e0b18)
这是最后的结论:
![Image 9: 文章图片](blob:https://mp.weixin.qq.com/37d80127b73f829661c0d17b431e0b18)
以及还顺带发现了一些连带的 Bug。其实这部分已经是安全层面的问题了。**强烈建议大家可以让 GLM 5.3 扫一下自己现有产品的安全类 Bug。**绝对会有惊喜。
![Image 10: 文章图片](blob:https://mp.weixin.qq.com/37d80127b73f829661c0d17b431e0b18)
这是最终的修复结果。
![Image 11: 文章图片](blob:https://mp.weixin.qq.com/37d80127b73f829661c0d17b431e0b18)
**#04**
**写在最后**
我发现很多创业公司发模型的时候,都喜欢在 Blog 最前面放一句话。
这种话通常不会太长,但它多少代表了模型团队最近一段时间的真实心境。
**智谱这次写的是:**
**单弦不成音,独木不成林。**
**官方没有解释,我自己的理解是,这句话至少有两层意思。**
第一层,是现在国内外模型之间这种你追我赶的状态。
尤其国内这半年特别明显。DeepSeek、Kimi、Qwen、GLM、豆包,大家的节奏都非常之快。
我特别喜欢这种状态。**虽然大家在竞争,但这种竞争最后会逼着所有人一起往前走。**一个模型做出了新东西,其他团队很快就会跟进。
如果整个市场最后只剩下一家公司,这件事反而没什么意思了。就像我们觉得,如果整个模型行业只有 OpenAI 和 Anthropic 的话,那对于应用层公司可能也是灾难。
第二层,大概是说合作和生态。尤其这次智谱重点强调的网络安全,背后就不是一个模型团队自己能完成的。
**整篇 Blog 里提到了清华、南开,也有绿盟、赛博昆仑、DARKNAVY、腾讯玄武这些安全团队。**安全已经是一个垂直领域了,它需要专门的 Know How。
还有更深入的芯片、人才、开源社区,其实也是一样。
**单弦不成音,独木不成林。**说的真好。希望国模越来越好。