文档(金鹏): 2026-08-28 章节 9 篇文章摘要归档
按主题分三组归档:Agent 工程纵深(经验治理/循环工程/ Token 成本治理/溯源生成)、最弱环节定律(推理链窃取/ GLM-5.3-Flash 开源)、人机共进(意志稀缺/数字员工化/ 大学之问);每组配 4K 题图与 160x90 缩略图共 3 组, 昇腾 WAIC 纯图片一文无法文本化按先例未收录
This commit is contained in:
@@ -0,0 +1,82 @@
|
||||
# ox-alpha 揭晓:GLM-5.3-Flash 开源,SGLang Day0 支持
|
||||
|
||||
> **来源**:微信公众平台
|
||||
> **作者**:卡工
|
||||
> **发布日期**:2026-08-27
|
||||
> **原文链接**:https://mp.weixin.qq.com/s/YLqgHOgPvL17FQPnBgTZFw
|
||||
|
||||
---
|
||||
|
||||
01
|
||||
|
||||
GLM-5.3-Flash 开源,SGLang Day0 支持
|
||||
|
||||

|
||||
|
||||
智谱(Z.ai)今天开源了 GLM-5.3-Flash(320B-A18B),SGLang 目前已 Day0 支持
|
||||
|
||||
02
|
||||
|
||||
背景
|
||||
|
||||
GLM-5.3-Flash 是 GLM-5 系列第一个原生多模态模型:320B 总参数、18B 激活,文本、图像、视频输入,MIT 协议,可商用
|
||||
|
||||
官方口径是性能反超 GLM-5.2、价格只有 1/10,编程和 agentic benchmark 上逼近 Claude Opus 4.8
|
||||
|
||||
发布前它用 ox-alpha 的马甲在 OpenCode 和 OpenRouter 上匿名跑了好几天,拿下当周最受欢迎模型,而且全部跑在中国 AI 芯片上
|
||||
|
||||
能力边界也从编程扩展到专业办公:slides、文档、表格、金融研究,端到端处理
|
||||
|
||||
03
|
||||
|
||||
核心亮点
|
||||
|
||||
- 320B 总参数、18B 激活:45 层文本层(MLA + DSA 稀疏注意力 + KDA 线性注意力)+ 24 层视觉编码器;288 个路由专家、每 token 激活 8 个
|
||||
- 原生多模态:文本、图像、视频输入,并且能识别自己的输出并修正错误
|
||||
- 1M 上下文,FP8 权重 + BF16 KV cache 为默认精度
|
||||
- 自带 MTP draft layer,SGLang 以 NEXTN 投机解码 serving,低延迟策略默认 adaptive MTP
|
||||
- Artificial Analysis 智能指数 v4.1.1 得分 57,单任务成本 $0.045(折扣价),这个智能水平此前要约 10 倍价格
|
||||
|
||||
04
|
||||
|
||||
SGLang 部署指令
|
||||
|
||||
(示例为官方 Day0 镜像,硬件覆盖 NVIDIA H100 / H200 / B200 / B300 / GB200 / GB300;完整 docker run 命令按硬件在 Cookbook 的部署面板生成)
|
||||
|
||||
```
|
||||
docker pull lmsysorg/sglang:glm-5.3-flash
|
||||
```
|
||||
|
||||
两种预设策略:Low Latency(默认开 adaptive MTP 投机解码,适合对话和 agent 负载)、High Throughput(关投机,适合持续大批量)
|
||||
|
||||
生成参数默认 temperature=1.0、top_p=0.95、thinking 开启
|
||||
|
||||
命令默认带 --reasoning-parser glm45 和 --tool-call-parser glm47。视频输入需要装 torchcodec,按 2 FPS 采样,上限 240,000 个 visual token
|
||||
|
||||
05
|
||||
|
||||
参考链接
|
||||
|
||||
1. HF link
|
||||
|
||||
huggingface.co/zai-org/GLM-5.3-Flash
|
||||
|
||||
2. SGL Cookbook
|
||||
|
||||
docs.sglang.io/cookbook/autoregressive/GLM/GLM-5.3-Flash
|
||||
|
||||
3.智谱官方博客
|
||||
|
||||
z.ai/blog/glm-5.3-flash
|
||||
|
||||
06
|
||||
|
||||
推荐阅读
|
||||
|
||||
Qwen4 架构预览:Qwen3.8-Flash 开源!
|
||||
|
||||
企业 agent 专用?IBM Granite 4.2 发布,SGLang Day0 支持
|
||||
|
||||
蚂蚁集团 Theta 项目组在 SGLang 的实践:把 H20 上的 DeepSeek-V4-Pro 服务推向极限
|
||||
|
||||
Mooncake for Miles:从碎片化 Rollout 数据到高效批量传输
|
||||
@@ -0,0 +1,67 @@
|
||||
# 📊 文章摘要:ox-alpha 揭晓:GLM-5.3-Flash 开源,SGLang Day0 支持
|
||||
|
||||
> **原文**:[2026-08-27_ox-alpha_揭晓_GLM-5.3-Flash_开源_SGLang_Day0_支持](./2026-08-27_ox-alpha_揭晓_GLM-5.3-Flash_开源_SGLang_Day0_支持.md)
|
||||
> **原文链接**:https://mp.weixin.qq.com/s/YLqgHOgPvL17FQPnBgTZFw
|
||||
> **来源**:微信公众平台
|
||||
> **作者**:卡工
|
||||
> **发布日期**:2026-08-27
|
||||
> **摘要日期**:2026-08-27
|
||||
> **价值评级**:⭐⭐ 中
|
||||
|
||||
---
|
||||
|
||||
## 核心命题
|
||||
|
||||
> **智能平价** — GLM-5.3-Flash 以 320B-A18B 稀疏激活+原生多模态+MIT 协议,把"智能指数 57"档位的成本压到 $0.045/任务(约原价 1/10),开源权重可自部署,高性能推理正在从奢侈品变成基础设施。
|
||||
|
||||
---
|
||||
|
||||
## 文章概要
|
||||
|
||||
智谱开源 GLM-5 系列 Flash 档模型:320B 总参数、18B 激活(288 专家每 token 激活 8 个),45 层文本层(MLA+DSA 稀疏注意力+KDA 线性注意力)+24 层视觉编码器,原生支持文本/图像/视频输入与 1M 上下文,MIT 协议可商用。发布前以 ox-alpha 匿名登录 OpenCode 与 OpenRouter 匿名测试并拿下当周最受欢迎模型(全部跑在中国 AI 芯片上),官方口径性能反超 GLM-5.2、价格仅 1/10、编程与 agentic 基准逼近 Claude Opus 4.8。SGLang 提供 Day0 支持与官方镜像,含投机解码(NEXTN/adaptive MTP)双预设策略。价值在于提供了开源多模态推理模型的新基准点与即用的部署信息;局限是全文为发布快讯,性能主张均为官方口径、无第三方复测。
|
||||
|
||||
---
|
||||
|
||||
## 关键要点
|
||||
|
||||
1. **架构:稀疏激活原生多模态** — 320B-A18B(激活比约 5.6%)、45 层文本+24 层视觉编码器、288 路由专家激活 8 个;FP8 权重+BF16 KV cache 默认精度。 `[分类: 共识]`
|
||||
2. **匿名实测先于发布** — 以 ox-alpha 马甲在 OpenCode/OpenRouter 跑匿名测试拿下当周最受欢迎模型,且全部推理跑在中国 AI 芯片上。 `[分类: 共识]`
|
||||
3. **成本断崖** — Artificial Analysis 智能指数 v4.1.1 得分 57、单任务成本 $0.045(折扣价),官方称此前该智能水平需约 10 倍价格。 `[分类: 争议]`(官方口径,第三方复测未出)
|
||||
4. **能力边界扩展到专业办公** — slides、文档、表格、金融研究端到端处理;能识别自己的输出并修正错误(自校验多模态)。 `[分类: 共识]`
|
||||
5. **SGLang Day0 部署要点** — Low Latency(adaptive MTP 投机解码,适合对话/agent)与 High Throughput 两种预设;默认 temperature=1.0、top_p=0.95、thinking 开启;视频输入 2 FPS 采样、上限 24 万 visual token。 `[分类: 共识]`
|
||||
|
||||
---
|
||||
|
||||
## 批判性分析
|
||||
|
||||
### 假设前提
|
||||
|
||||
文章默认官方基准口径可信("逼近 Claude Opus 4.8"来自智谱自家编程与 agentic 基准选型);匿名测试的受欢迎度(用量)不等价于质量(用户可能因便宜而大量试用)。
|
||||
|
||||
### 论据与逻辑
|
||||
|
||||
发布快讯体,无作者独立验证。可核实部分:HF 仓库、MIT 协议、SGLang 镜像与参数均为可复现事实;性能对比部分引用第三方 Artificial Analysis 指数(57 分、$0.045)相对可信,但"1/10 价格""反超 GLM-5.2"为官方话术。对匿名登顶的叙事应保留:OpenRouter 排名反映的是 token 消耗量与增速。
|
||||
|
||||
### 边界与局限
|
||||
|
||||
适用于自部署推理、Agent 负载与多模态文档处理场景的成本敏感选型;与闭源旗舰的对比在长程 agentic 任务、极端推理深度上未经第三方检验。1M 上下文的实际有效利用率(needle 类长文检索质量)文中未提。
|
||||
|
||||
---
|
||||
|
||||
## 可引用金句
|
||||
|
||||
> "GLM-5.3-Flash 是 GLM-5 系列第一个原生多模态模型:320B 总参数、18B 激活,文本、图像、视频输入,MIT 协议,可商用。"
|
||||
|
||||
> "发布前它用 ox-alpha 的马甲……拿下当周最受欢迎模型,而且全部跑在中国 AI 芯片上。"
|
||||
|
||||
---
|
||||
|
||||
## 总体评价
|
||||
|
||||
**亮点**:架构参数、部署命令、采样参数等工程细节完整即用;匿名测试+国产芯片细节有信息增量。
|
||||
|
||||
**不足**:纯发布通稿,性能数据全为官方口径;无基准明细表。
|
||||
|
||||
**适用场景**:推理模型自部署选型的候选清单;多模态文档流水线(slides/表格/金融研究)的成本优化选项;SGLang 生态用户的直接上手指南。
|
||||
|
||||
**关联建议**:与同批《116页论文教你「蒸馏」Claude、GPT-5.6》对读——推理数据窃取的经济性(720 美元/万条)与高性价比开源模型的涌现是同一攻防的两面;与同批《Multi-Agent 成本优化》中 GLM-5v 分层路由(成本约 Sonnet 36%)呼应:国产模型分层路由已成工程团队的省钱标配;关注 Artificial Analysis 后续独立复测再下性能结论。
|
||||
Reference in New Issue
Block a user