3.1 KiB
3.1 KiB
GLM 模型评测报告
评测时间: 2026-04-15
API 基础验证
通过 curl 直接调用 GLM API(open.bigmodel.cn/api/anthropic),max_tokens=50,回复"OK"。
| 模型 | 耗时 | 状态 |
|---|---|---|
| glm-4.5 | 546ms | ✓ |
| glm-4.5-air | 397ms | ✓ |
| glm-4.6 | 586ms | ✓ |
| glm-4.7 | 1208ms | ✓ |
| glm-5 | 32305ms | ✓ |
| glm-5-turbo | 606ms | ✓ |
| glm-5.1 | 1507ms | ✓ |
综合任务评测
评测条件
- 任务: 3 个(Python quicksort + docs 文件分析 + Svelte 5 TodoList)
- max_tokens: 4096
- 执行方式: bash 后台并行(4+3 分批)
- 评测 prompt: 统一
结果
| 模型 | 耗时 | 输入tok | 输出tok | 截断 | 任务完成 | 质量 |
|---|---|---|---|---|---|---|
| glm-4.5 | 35.7s | 158 | 6430 | 否 | 2/3 | 可接受 |
| glm-4.5-air | 37.4s | 1 | 2555 | 否 | 3/3 | 良好(精简) |
| glm-4.6 | 27.7s | 101 | 4096 | 是 | 2/3 | 过度包装 HTML |
| glm-4.7 | 28.6s | 101 | 4096 | 是 | 3/3 | 过度包装 HTML |
| glm-5 | 27.4s | 101 | 1296 | 否 | 3/3 | 良好 |
| glm-5-turbo | 52.7s | 101 | 1390 | 否 | 0/3 | 高峰期限流 |
| glm-5.1 | 35.2s | 101 | 1314 | 否 | 3/3 | 良好 |
各模型特性
glm-4.5
- 速度中等(35.7s)
- 输出 token 较多(6430),可能因为 max_tokens 设置较大
- 完成 2/3 任务
- 适合:一般代码生成
glm-4.5-air
- 速度中等(37.4s),但输入 token 计数异常(1 tok,可能 tokenizer 不同)
- 输出精简(2555 tok),完整完成 3 个任务
- 适合:需要精简输出的场景,token 敏感场景
glm-4.6
- 速度较快(27.7s)
- 问题: 倾向于生成 HTML 包装页面(含 Tailwind CSS、SVG 图标),导致 4096 token 截断
- 实际代码被 HTML 结构淹没,不适合纯代码任务
- 适合:需要 HTML 展示效果的场景
glm-4.7
- 速度较快(28.6s)
- 与 glm-4.6 类似,生成 HTML 包装页面导致截断
- 代码质量本身尚可,但被过度包装
- 适合:需要 HTML 展示效果的场景
glm-5
- 速度最快(27.4s)
- 输出精炼(1296 tok),完整完成 3 个任务
- 代码质量好,输出格式清晰
- 适合:日常开发,代码生成和文件分析
glm-5-turbo
- 不稳定:高峰期限流(code 1305),非高峰 52.7s
- 首次并发测试无响应,重试后成功但较慢
- 适合:非高峰时段的快速任务
glm-5.1
- 速度中等(35.2s)
- 输出精炼(1314 tok),完整完成 3 个任务
- 代码质量好,输出格式清晰
- 推荐: 日常开发首选
推荐方案
| 场景 | 推荐模型 | 别名 |
|---|---|---|
| 日常开发(默认) | glm-5.1 | cc / cc51 |
| 快速任务 | glm-5 | cc5 |
| 省 token | glm-4.5-air | cc45a |
| HTML 生成 | glm-4.7 | cc47 |
Claude Code 真实环境测试
以下为通过 ccX 命令启动 Claude Code 实际会话的测试结果
| 模型 | 别名 | 启动耗时 | 状态栏模型名 | 子 Agent | 备注 |
|---|---|---|---|---|---|
| (待测试) |