Files
team/team/GLM模型评测报告.md
T
2026-04-19 21:47:08 +08:00

98 lines
3.1 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters
This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.
# GLM 模型评测报告
> 评测时间: 2026-04-15
## API 基础验证
通过 `curl` 直接调用 GLM API`open.bigmodel.cn/api/anthropic`),max_tokens=50,回复"OK"。
| 模型 | 耗时 | 状态 |
|------|-----:|:----:|
| glm-4.5 | 546ms | ✓ |
| glm-4.5-air | 397ms | ✓ |
| glm-4.6 | 586ms | ✓ |
| glm-4.7 | 1208ms | ✓ |
| glm-5 | 32305ms | ✓ |
| glm-5-turbo | 606ms | ✓ |
| glm-5.1 | 1507ms | ✓ |
## 综合任务评测
### 评测条件
- **任务**: 3 个(Python quicksort + docs 文件分析 + Svelte 5 TodoList
- **max_tokens**: 4096
- **执行方式**: bash 后台并行(4+3 分批)
- **评测 prompt**: 统一
### 结果
| 模型 | 耗时 | 输入tok | 输出tok | 截断 | 任务完成 | 质量 |
|------|-----:|-------:|-------:|:----:|:-------:|------|
| glm-4.5 | 35.7s | 158 | 6430 | 否 | 2/3 | 可接受 |
| glm-4.5-air | 37.4s | 1 | 2555 | 否 | 3/3 | 良好(精简) |
| glm-4.6 | 27.7s | 101 | 4096 | 是 | 2/3 | 过度包装 HTML |
| glm-4.7 | 28.6s | 101 | 4096 | 是 | 3/3 | 过度包装 HTML |
| glm-5 | 27.4s | 101 | 1296 | 否 | 3/3 | 良好 |
| glm-5-turbo | 52.7s | 101 | 1390 | 否 | 0/3 | 高峰期限流 |
| glm-5.1 | 35.2s | 101 | 1314 | 否 | 3/3 | 良好 |
### 各模型特性
#### glm-4.5
- 速度中等(35.7s
- 输出 token 较多(6430),可能因为 max_tokens 设置较大
- 完成 2/3 任务
- 适合:一般代码生成
#### glm-4.5-air
- 速度中等(37.4s),但输入 token 计数异常(1 tok,可能 tokenizer 不同)
- 输出精简(2555 tok),完整完成 3 个任务
- 适合:需要精简输出的场景,token 敏感场景
#### glm-4.6
- 速度较快(27.7s
- **问题**: 倾向于生成 HTML 包装页面(含 Tailwind CSS、SVG 图标),导致 4096 token 截断
- 实际代码被 HTML 结构淹没,不适合纯代码任务
- 适合:需要 HTML 展示效果的场景
#### glm-4.7
- 速度较快(28.6s
- 与 glm-4.6 类似,生成 HTML 包装页面导致截断
- 代码质量本身尚可,但被过度包装
- 适合:需要 HTML 展示效果的场景
#### glm-5
- 速度最快(27.4s
- 输出精炼(1296 tok),完整完成 3 个任务
- 代码质量好,输出格式清晰
- 适合:日常开发,代码生成和文件分析
#### glm-5-turbo
- 不稳定:高峰期限流(code 1305),非高峰 52.7s
- 首次并发测试无响应,重试后成功但较慢
- 适合:非高峰时段的快速任务
#### glm-5.1
- 速度中等(35.2s
- 输出精炼(1314 tok),完整完成 3 个任务
- 代码质量好,输出格式清晰
- **推荐**: 日常开发首选
## 推荐方案
| 场景 | 推荐模型 | 别名 |
|------|----------|------|
| 日常开发(默认) | glm-5.1 | cc / cc51 |
| 快速任务 | glm-5 | cc5 |
| 省 token | glm-4.5-air | cc45a |
| HTML 生成 | glm-4.7 | cc47 |
## Claude Code 真实环境测试
> 以下为通过 ccX 命令启动 Claude Code 实际会话的测试结果
| 模型 | 别名 | 启动耗时 | 状态栏模型名 | 子 Agent | 备注 |
|------|------|---------|-------------|----------|------|
| (待测试) | | | | | |