文档(金鹏): 2026-08-20 章节 26 篇文章摘要归档

- 26 篇微信公众号文章原文+摘要归档至 知识/微信公众平台/{公众号}/
- 9 个主题分组:Skill工程/Agent运行时/数据基础设施/交互工具/产品服务/大模型前沿/产业开源/制造业AI/军事社会
- 生成 9 组配图(2560x1440 大图 + 160x90 thumb)至 知识/金鹏/20260820/
- 知识/金鹏.md 2026-08-20 章节改写为结构化索引(主题标签+配图+金句+分层子条目)
- 1 个小红书视频链接以视频笔记条目保留(内容无法文本化)

Co-Authored-By: Claude <noreply@anthropic.com>
This commit is contained in:
2026-08-20 17:01:28 +08:00
co-authored by Claude
parent 24af71a072
commit 576fbc0253
71 changed files with 6718 additions and 0 deletions
@@ -0,0 +1,228 @@
# 对 GLM-5.3 的真实评价。
> **来源**:微信公众平台(阿颖)
> **作者**:阿颖
> **发布日期**:2026-08-20(原文未标注明确日期,按下载日占位)
> **原文链接**:https://mp.weixin.qq.com/s/SpXEbbzv9jZ2xrZd7lcM7w
---
时隔两个月,GLM-5.3 来了。
从今天大家的反馈来看,效果确实非常不错。**我感觉智谱这一年,应该是找到了一条非常清楚的路径来继续优化模型能力。**
而且这次出乎所有人的意料。按照智谱 Release Blog 的说法,GLM-5.3 相比 GLM-5.2,基座模型没有变,模型参数也没有继续增加,但能力仍然有不小的提升。
这些提升,全部来自后训练。
![Image 1: 文章图片](https://mmbiz.qpic.cn/mmbiz_png/iagroyM7YaBnpVF1c5pibmfdHyHs4nz2OvmgjWPWbSURepd4xdH8UDejT4UmJpFaH12ItGlrFcbiac5oxuzJLTSZ1UYvLicZFwGyicTFXpFWHR7M/640?wx_fmt=png&from=appmsg&tp=webp&wxfrom=5&wx_lazy=1#imgIndex=0)
**智谱这家公司真的非常神。**从学术起家,创始人也是国内大模型圈里最学术的,感觉所有对大模型技术路线感兴趣的同学,都值得认真看他们的 Model Card。
**#01**
**预训练和后训练**
这两年,其实所有大模型公司主要都在两个地方下功夫。一个是继续做 Pre-training Scaling,另一个就是越来越重要的 Post-training Scaling。
两边大家其实都在做,只是不同公司、不同阶段的侧重点不一样。
先说 Pre-training Scaling。
这条路我们其实非常熟悉,一个最直观的表现,就是模型还在越做越大。**比如 Kimi K3,直接把总参数做到了 2.8T。**字节的模型据说也要奔着 10 万亿去。
模型参数大概已经成了每次大模型发布时,大家最喜欢问的问题之一。
但其实参数量从来都不是一个可以单独看的数字。至少还要一起看几件事:你有多少训练数据、多少算力,以及这个模型最后要在什么样的条件下运行。
2020 年,OpenAI 的 Jared Kaplan 等人发表了一篇后来影响非常大的论文《Scaling Laws for Neural Language Models》。
很多人今天讨论大模型的 Scaling Law,都会追溯到这篇论文。
它当时给行业一个很强的信号:随着算力增加,模型规模还可以继续往上做,而且参数量可以比训练数据增长得更快。
整个行业很快就沿着这个方向往前走。
于是有了 GPT-3 的 175B、Gopher 的 280B,以及后来的 MT-NLG 530B。那几年大家最直观的感受就是,模型越大,能力通常也越强。
到了 2022 年,DeepMind 又重新研究了一遍这个问题。
**他们训练了四百多个不同规模的模型,最后发现,之前大家其实有点过于追求参数量了。**
在同样的算力预算下,与其把参数一味做大,不如把更多算力拿出来,让模型看更多数据。
他们最后给出了一个很有名的经验值:大约每一个参数,配 20 个 Token 的训练数据。并且应当以相同的速率增长,也就是说这个配比不随规模漂移。
随后 DeepMind 训练出了 Chinchilla。它只有 70B 参数,远小于 280B 的 Gopher,但用了 1.4T Token 来训练。
**结果在差不多的训练算力下,Chinchilla 不仅超过了 Gopher,也超过了当时很多参数规模大得多的模型。**
这件事当时给行业一个很大的启发:
模型参数、数据和算力之间需要找到更合适的配比。**一个参数少一些、但训练得更充分的模型,完全可能超过一个大得多的模型。**
所以今天我们看到大家继续做 Pre-training Scaling,也不能简单理解成继续堆参数。真正要 Scale 的,其实一直都是参数、数据和算力这一整套东西。
与此同时,Post-training Scaling 也已经变得无比重要。
我再稍微解释一下。
**预训练其实就是先给模型打一个足够好的底子,后训练则是通过 RL、环境和真实任务,把这个底子不断变成更强的能力。**
像 GPT-3 时代,预训练几乎承担了模型能力提升的大部分工作。后训练更多是在做最后一层调整,比如让模型学会聊天、遵循指令。
所以当时大家基本会认为,一个模型到底有多强,在 Base Model 训练完成的时候,大概已经决定了。这也是最早“大力出奇迹”的由来。
后来到了 O1 这一代,大家发现 RL 不只是负责把模型调整得更好用,它本身也能够继续提升模型能力。
数学推理、Coding,包括 Agent 连续完成复杂任务的能力,都可以通过大规模 RL 继续往上训练。
智谱的 GLM-5.3 这次,没有增加参数,也没有换基座,只靠后训练,仍然把模型能力往上推了一截。
所以我推测,他们在后训练这部分,应该确实找到了一些切实有效的方法。
**#02**
**Post-training Scaling**
Post-training Scaling 到底怎么做?**很简单,Scale Environment,Scale Experience。**
我们可以把 Post-training 的发展分成几个阶段。
最早就是我们熟悉的单轮 Q&A。模型回答一道数学题,然后告诉它对还是错,然后 RL 更新权重。
**后来大家发现,单纯做 Q&A 太简单了,很多更复杂的能力根本练不出来,于是就开始把模型放进模拟环境里训练。**
比如 Coding。以前可能只是给模型一道编程题,现在会真的给它一个代码库,允许它调用 Terminal、修改代码、运行测试。
模型可能先看代码,发现问题之后修改,跑一遍测试失败了,再回来重新分析,然后继续修改。
整个过程可能连续几十步甚至几百步,最后再根据任务到底有没有完成,给它一个 Reward。
这时候,模型就开始学习怎么使用工具,以及怎么在很长的任务里保持目标等等。
**过去这一年,模型在长程任务上的快速提升,很大程度上都和这些后训练方法有关。**
同时,大家也意识到,如果想让模型获得更高阶的能力,就需要同时提高环境的复杂度。
**如果大家去看智谱今天的公众号,会发现他们专门提到了这事。**
![Image 2: 文章图片](blob:https://mp.weixin.qq.com/37d80127b73f829661c0d17b431e0b18)
所以 Post-training Scaling 和 Pre-training Scaling,Scale 的东西开始不太一样。
预训练的 Scale,主要增加模型规模、训练数据和计算量。**后训练往上 Scale,则是让模型面对越来越复杂的任务、更真实的环境,以及越来越长的任务过程。**
**有点像读万卷书和行万里路的区别。**
话说我还是强烈推荐大家读一下智谱官方的 Blog。前面讲的这些线索,他们都已经点到了。
![Image 3: 文章图片](blob:https://mp.weixin.qq.com/37d80127b73f829661c0d17b431e0b18)
**像我圈红框的地方,IndexShare、SAO、Slime 都有对应的论文或者 GitHub 地址可以研究。**我放下链接,感兴趣的同学可以看看,我都想组个读智谱论文的活动了.......
https://arxiv.org/abs/2603.12201
https://arxiv.org/abs/2607.07508
https://github.com/THUDM/slime/blob/main/README_zh.md
**而且你看红框最后一句,他们说,可能还远未开发出这个基座的智能上界。**这话太给人想象空间了。
毕竟 GLM-5 系列在开发者内心的封神程度,已经超过大家对这个尺寸模型的预期上限了。
这次官方 Blog 的第二点,专门把网络安全能力拎了出来,他们专门用了很大的篇幅解释网络安全。
我的理解是,GLM 前面一直在重点 Scale Coding 和 Agent 的长程任务。
**但随着训练环境越来越复杂,模型原来在 Coding 里练出来的能力,也开始迁移到更专业的领域,网络安全就是其中一个。**后面可能还会解锁能多的领域。
从逻辑上,我觉得这也能理解。毕竟安全工作本身就和 Coding 高度相关。再加上智谱专门的安全环境训练,这个能力就被迅速放大了。
再看看今年以来的变化。**进入 2026,据传几个 Frontier Labs 包括 OpenAI 和 Anthropic 几乎都在模型中用到了 Loop Transformer。**
Loop Transformer 的核心,是让 Scaling Law 的衡量目标从单纯扩大总参数量,转向推理链路长度(一次 forward 中实际经过了多少有效计算)。
本质上,这是预训练中的后训练带来的收益。
**#03**
**我跑的几个 Case**
最后给大家看看我用 GLM-5.3 做的一些 Case。
这个是我一位 00 后同事做的。小哥花了一个多小时,就跑出了完全可用的象棋应用。还挺酷炫的。有同学需要的话,我可以私发。
我用 GLM-5.3 给团队做了一个排版小工具。
这个想法其实周一就有了,因为我同事每次排公众号都特别慢,我觉得 10 分钟能搞定的事,他经常要花半个小时,主要时间都耗在段落调整、加粗这些细节上。
**所以今天我干脆说,直接做个工具吧。**以后这些段落、加粗之类的排版工作都交给 AI,5 分钟基本就能搞定。
大家看,左侧直接从飞书文档把文章复制进去,右侧加粗和段落都会调整好。我直接点复制到公众号的按钮,再粘贴到公众号的文章页就行了。
![Image 4: 文章图片](blob:https://mp.weixin.qq.com/37d80127b73f829661c0d17b431e0b18)
图片也可以直接过去。
![Image 5: 文章图片](blob:https://mp.weixin.qq.com/37d80127b73f829661c0d17b431e0b18)
前面两个 Case 都偏工具,我们再看一个复杂的,直接看我们线上跑的生产系统。
这两天我发现,下个月准备上线的购票订单功能总有一些 Bug。
**平时测试看着没问题,但一到并发高一点的时候,就会偶尔出现重复订单、漏单,或者订单状态对不上的情况。**
![Image 6: 文章图片](blob:https://mp.weixin.qq.com/37d80127b73f829661c0d17b431e0b18)
之前的代码我其实是用 Codex 写的。这个问题,Codex 也没有解决,我这边已经没有什么思路了。
大家看 GLM 5.3 的排查逻辑。先是把整个链路的代码都过了一遍,跑了下测试,发现没问题。**我看的时候就心想,小样,这个级别的小问题,肯定不会卡我这么久啊。**
![Image 7: 文章图片](blob:https://mp.weixin.qq.com/37d80127b73f829661c0d17b431e0b18)
接着继续,他通过端到端的模拟,跑了一次链路。发现了问题。
![Image 8: 文章图片](blob:https://mp.weixin.qq.com/37d80127b73f829661c0d17b431e0b18)
这是最后的结论:
![Image 9: 文章图片](blob:https://mp.weixin.qq.com/37d80127b73f829661c0d17b431e0b18)
以及还顺带发现了一些连带的 Bug。其实这部分已经是安全层面的问题了。**强烈建议大家可以让 GLM 5.3 扫一下自己现有产品的安全类 Bug。**绝对会有惊喜。
![Image 10: 文章图片](blob:https://mp.weixin.qq.com/37d80127b73f829661c0d17b431e0b18)
这是最终的修复结果。
![Image 11: 文章图片](blob:https://mp.weixin.qq.com/37d80127b73f829661c0d17b431e0b18)
**#04**
**写在最后**
我发现很多创业公司发模型的时候,都喜欢在 Blog 最前面放一句话。
这种话通常不会太长,但它多少代表了模型团队最近一段时间的真实心境。
**智谱这次写的是:**
**单弦不成音,独木不成林。**
**官方没有解释,我自己的理解是,这句话至少有两层意思。**
第一层,是现在国内外模型之间这种你追我赶的状态。
尤其国内这半年特别明显。DeepSeek、Kimi、Qwen、GLM、豆包,大家的节奏都非常之快。
我特别喜欢这种状态。**虽然大家在竞争,但这种竞争最后会逼着所有人一起往前走。**一个模型做出了新东西,其他团队很快就会跟进。
如果整个市场最后只剩下一家公司,这件事反而没什么意思了。就像我们觉得,如果整个模型行业只有 OpenAI 和 Anthropic 的话,那对于应用层公司可能也是灾难。
第二层,大概是说合作和生态。尤其这次智谱重点强调的网络安全,背后就不是一个模型团队自己能完成的。
**整篇 Blog 里提到了清华、南开,也有绿盟、赛博昆仑、DARKNAVY、腾讯玄武这些安全团队。**安全已经是一个垂直领域了,它需要专门的 Know How。
还有更深入的芯片、人才、开源社区,其实也是一样。
**单弦不成音,独木不成林。**说的真好。希望国模越来越好。