文档(金鹏): 2026-08-28 章节 9 篇文章摘要归档

按主题分三组归档:Agent 工程纵深(经验治理/循环工程/
Token 成本治理/溯源生成)、最弱环节定律(推理链窃取/
GLM-5.3-Flash 开源)、人机共进(意志稀缺/数字员工化/
大学之问);每组配 4K 题图与 160x90 缩略图共 3 组,
昇腾 WAIC 纯图片一文无法文本化按先例未收录
This commit is contained in:
2026-08-27 13:24:04 +08:00
parent 28c4dfed4e
commit 5f2964bf68
25 changed files with 2409 additions and 0 deletions
@@ -0,0 +1,82 @@
# ox-alpha 揭晓:GLM-5.3-Flash 开源,SGLang Day0 支持
> **来源**:微信公众平台
> **作者**:卡工
> **发布日期**:2026-08-27
> **原文链接**:https://mp.weixin.qq.com/s/YLqgHOgPvL17FQPnBgTZFw
---
01
GLM-5.3-Flash 开源,SGLang Day0 支持
![图片](https://mmbiz.qpic.cn/mmbiz_jpg/JGW0bUOic27UlMESYzynYMJPrcbvk76ZsJhDqG9Bdic1v0kJSBhy1ASYY5b9Z6U5sjzusGhDSBKrKxaCwpamNm61rAgtRqpmx6jdwgpjmxvg4/640?wx_fmt=jpeg&from=appmsg&watermark=1&tp=webp&wxfrom=5&wx_lazy=1#imgIndex=0)
智谱(Z.ai)今天开源了 GLM-5.3-Flash(320B-A18B),SGLang 目前已 Day0 支持
02
背景
GLM-5.3-Flash 是 GLM-5 系列第一个原生多模态模型:320B 总参数、18B 激活,文本、图像、视频输入,MIT 协议,可商用
官方口径是性能反超 GLM-5.2、价格只有 1/10,编程和 agentic benchmark 上逼近 Claude Opus 4.8
发布前它用 ox-alpha 的马甲在 OpenCode 和 OpenRouter 上匿名跑了好几天,拿下当周最受欢迎模型,而且全部跑在中国 AI 芯片上
能力边界也从编程扩展到专业办公:slides、文档、表格、金融研究,端到端处理
03
核心亮点
- 320B 总参数、18B 激活:45 层文本层(MLA + DSA 稀疏注意力 + KDA 线性注意力)+ 24 层视觉编码器;288 个路由专家、每 token 激活 8 个
- 原生多模态:文本、图像、视频输入,并且能识别自己的输出并修正错误
- 1M 上下文,FP8 权重 + BF16 KV cache 为默认精度
- 自带 MTP draft layer,SGLang 以 NEXTN 投机解码 serving,低延迟策略默认 adaptive MTP
- Artificial Analysis 智能指数 v4.1.1 得分 57,单任务成本 $0.045(折扣价),这个智能水平此前要约 10 倍价格
04
SGLang 部署指令
(示例为官方 Day0 镜像,硬件覆盖 NVIDIA H100 / H200 / B200 / B300 / GB200 / GB300;完整 docker run 命令按硬件在 Cookbook 的部署面板生成)
```
docker pull lmsysorg/sglang:glm-5.3-flash
```
两种预设策略:Low Latency(默认开 adaptive MTP 投机解码,适合对话和 agent 负载)、High Throughput(关投机,适合持续大批量)
生成参数默认 temperature=1.0、top_p=0.95、thinking 开启
命令默认带 --reasoning-parser glm45 和 --tool-call-parser glm47。视频输入需要装 torchcodec,按 2 FPS 采样,上限 240,000 个 visual token
05
参考链接
1. HF link
huggingface.co/zai-org/GLM-5.3-Flash
2. SGL Cookbook
docs.sglang.io/cookbook/autoregressive/GLM/GLM-5.3-Flash
3.智谱官方博客
z.ai/blog/glm-5.3-flash
06
推荐阅读
Qwen4 架构预览:Qwen3.8-Flash 开源!
企业 agent 专用?IBM Granite 4.2 发布,SGLang Day0 支持
蚂蚁集团 Theta 项目组在 SGLang 的实践:把 H20 上的 DeepSeek-V4-Pro 服务推向极限
Mooncake for Miles:从碎片化 Rollout 数据到高效批量传输
@@ -0,0 +1,67 @@
# 📊 文章摘要:ox-alpha 揭晓:GLM-5.3-Flash 开源,SGLang Day0 支持
> **原文**:[2026-08-27_ox-alpha_揭晓_GLM-5.3-Flash_开源_SGLang_Day0_支持](./2026-08-27_ox-alpha_揭晓_GLM-5.3-Flash_开源_SGLang_Day0_支持.md)
> **原文链接**:https://mp.weixin.qq.com/s/YLqgHOgPvL17FQPnBgTZFw
> **来源**:微信公众平台
> **作者**:卡工
> **发布日期**:2026-08-27
> **摘要日期**:2026-08-27
> **价值评级**:⭐⭐ 中
---
## 核心命题
> **智能平价** — GLM-5.3-Flash 以 320B-A18B 稀疏激活+原生多模态+MIT 协议,把"智能指数 57"档位的成本压到 $0.045/任务(约原价 1/10),开源权重可自部署,高性能推理正在从奢侈品变成基础设施。
---
## 文章概要
智谱开源 GLM-5 系列 Flash 档模型:320B 总参数、18B 激活(288 专家每 token 激活 8 个),45 层文本层(MLA+DSA 稀疏注意力+KDA 线性注意力)+24 层视觉编码器,原生支持文本/图像/视频输入与 1M 上下文,MIT 协议可商用。发布前以 ox-alpha 匿名登录 OpenCode 与 OpenRouter 匿名测试并拿下当周最受欢迎模型(全部跑在中国 AI 芯片上),官方口径性能反超 GLM-5.2、价格仅 1/10、编程与 agentic 基准逼近 Claude Opus 4.8。SGLang 提供 Day0 支持与官方镜像,含投机解码(NEXTN/adaptive MTP)双预设策略。价值在于提供了开源多模态推理模型的新基准点与即用的部署信息;局限是全文为发布快讯,性能主张均为官方口径、无第三方复测。
---
## 关键要点
1. **架构:稀疏激活原生多模态** — 320B-A18B(激活比约 5.6%)、45 层文本+24 层视觉编码器、288 路由专家激活 8 个;FP8 权重+BF16 KV cache 默认精度。 `[分类: 共识]`
2. **匿名实测先于发布** — 以 ox-alpha 马甲在 OpenCode/OpenRouter 跑匿名测试拿下当周最受欢迎模型,且全部推理跑在中国 AI 芯片上。 `[分类: 共识]`
3. **成本断崖** — Artificial Analysis 智能指数 v4.1.1 得分 57、单任务成本 $0.045(折扣价),官方称此前该智能水平需约 10 倍价格。 `[分类: 争议]`(官方口径,第三方复测未出)
4. **能力边界扩展到专业办公** — slides、文档、表格、金融研究端到端处理;能识别自己的输出并修正错误(自校验多模态)。 `[分类: 共识]`
5. **SGLang Day0 部署要点** — Low Latency(adaptive MTP 投机解码,适合对话/agent)与 High Throughput 两种预设;默认 temperature=1.0、top_p=0.95、thinking 开启;视频输入 2 FPS 采样、上限 24 万 visual token。 `[分类: 共识]`
---
## 批判性分析
### 假设前提
文章默认官方基准口径可信("逼近 Claude Opus 4.8"来自智谱自家编程与 agentic 基准选型);匿名测试的受欢迎度(用量)不等价于质量(用户可能因便宜而大量试用)。
### 论据与逻辑
发布快讯体,无作者独立验证。可核实部分:HF 仓库、MIT 协议、SGLang 镜像与参数均为可复现事实;性能对比部分引用第三方 Artificial Analysis 指数(57 分、$0.045)相对可信,但"1/10 价格""反超 GLM-5.2"为官方话术。对匿名登顶的叙事应保留:OpenRouter 排名反映的是 token 消耗量与增速。
### 边界与局限
适用于自部署推理、Agent 负载与多模态文档处理场景的成本敏感选型;与闭源旗舰的对比在长程 agentic 任务、极端推理深度上未经第三方检验。1M 上下文的实际有效利用率(needle 类长文检索质量)文中未提。
---
## 可引用金句
> "GLM-5.3-Flash 是 GLM-5 系列第一个原生多模态模型:320B 总参数、18B 激活,文本、图像、视频输入,MIT 协议,可商用。"
> "发布前它用 ox-alpha 的马甲……拿下当周最受欢迎模型,而且全部跑在中国 AI 芯片上。"
---
## 总体评价
**亮点**:架构参数、部署命令、采样参数等工程细节完整即用;匿名测试+国产芯片细节有信息增量。
**不足**:纯发布通稿,性能数据全为官方口径;无基准明细表。
**适用场景**:推理模型自部署选型的候选清单;多模态文档流水线(slides/表格/金融研究)的成本优化选项;SGLang 生态用户的直接上手指南。
**关联建议**:与同批《116页论文教你「蒸馏」Claude、GPT-5.6》对读——推理数据窃取的经济性(720 美元/万条)与高性价比开源模型的涌现是同一攻防的两面;与同批《Multi-Agent 成本优化》中 GLM-5v 分层路由(成本约 Sonnet 36%)呼应:国产模型分层路由已成工程团队的省钱标配;关注 Artificial Analysis 后续独立复测再下性能结论。