98 lines
3.1 KiB
Markdown
98 lines
3.1 KiB
Markdown
# GLM 模型评测报告
|
||
|
||
> 评测时间: 2026-04-15
|
||
|
||
## API 基础验证
|
||
|
||
通过 `curl` 直接调用 GLM API(`open.bigmodel.cn/api/anthropic`),max_tokens=50,回复"OK"。
|
||
|
||
| 模型 | 耗时 | 状态 |
|
||
|------|-----:|:----:|
|
||
| glm-4.5 | 546ms | ✓ |
|
||
| glm-4.5-air | 397ms | ✓ |
|
||
| glm-4.6 | 586ms | ✓ |
|
||
| glm-4.7 | 1208ms | ✓ |
|
||
| glm-5 | 32305ms | ✓ |
|
||
| glm-5-turbo | 606ms | ✓ |
|
||
| glm-5.1 | 1507ms | ✓ |
|
||
|
||
## 综合任务评测
|
||
|
||
### 评测条件
|
||
|
||
- **任务**: 3 个(Python quicksort + docs 文件分析 + Svelte 5 TodoList)
|
||
- **max_tokens**: 4096
|
||
- **执行方式**: bash 后台并行(4+3 分批)
|
||
- **评测 prompt**: 统一
|
||
|
||
### 结果
|
||
|
||
| 模型 | 耗时 | 输入tok | 输出tok | 截断 | 任务完成 | 质量 |
|
||
|------|-----:|-------:|-------:|:----:|:-------:|------|
|
||
| glm-4.5 | 35.7s | 158 | 6430 | 否 | 2/3 | 可接受 |
|
||
| glm-4.5-air | 37.4s | 1 | 2555 | 否 | 3/3 | 良好(精简) |
|
||
| glm-4.6 | 27.7s | 101 | 4096 | 是 | 2/3 | 过度包装 HTML |
|
||
| glm-4.7 | 28.6s | 101 | 4096 | 是 | 3/3 | 过度包装 HTML |
|
||
| glm-5 | 27.4s | 101 | 1296 | 否 | 3/3 | 良好 |
|
||
| glm-5-turbo | 52.7s | 101 | 1390 | 否 | 0/3 | 高峰期限流 |
|
||
| glm-5.1 | 35.2s | 101 | 1314 | 否 | 3/3 | 良好 |
|
||
|
||
### 各模型特性
|
||
|
||
#### glm-4.5
|
||
- 速度中等(35.7s)
|
||
- 输出 token 较多(6430),可能因为 max_tokens 设置较大
|
||
- 完成 2/3 任务
|
||
- 适合:一般代码生成
|
||
|
||
#### glm-4.5-air
|
||
- 速度中等(37.4s),但输入 token 计数异常(1 tok,可能 tokenizer 不同)
|
||
- 输出精简(2555 tok),完整完成 3 个任务
|
||
- 适合:需要精简输出的场景,token 敏感场景
|
||
|
||
#### glm-4.6
|
||
- 速度较快(27.7s)
|
||
- **问题**: 倾向于生成 HTML 包装页面(含 Tailwind CSS、SVG 图标),导致 4096 token 截断
|
||
- 实际代码被 HTML 结构淹没,不适合纯代码任务
|
||
- 适合:需要 HTML 展示效果的场景
|
||
|
||
#### glm-4.7
|
||
- 速度较快(28.6s)
|
||
- 与 glm-4.6 类似,生成 HTML 包装页面导致截断
|
||
- 代码质量本身尚可,但被过度包装
|
||
- 适合:需要 HTML 展示效果的场景
|
||
|
||
#### glm-5
|
||
- 速度最快(27.4s)
|
||
- 输出精炼(1296 tok),完整完成 3 个任务
|
||
- 代码质量好,输出格式清晰
|
||
- 适合:日常开发,代码生成和文件分析
|
||
|
||
#### glm-5-turbo
|
||
- 不稳定:高峰期限流(code 1305),非高峰 52.7s
|
||
- 首次并发测试无响应,重试后成功但较慢
|
||
- 适合:非高峰时段的快速任务
|
||
|
||
#### glm-5.1
|
||
- 速度中等(35.2s)
|
||
- 输出精炼(1314 tok),完整完成 3 个任务
|
||
- 代码质量好,输出格式清晰
|
||
- **推荐**: 日常开发首选
|
||
|
||
## 推荐方案
|
||
|
||
| 场景 | 推荐模型 | 别名 |
|
||
|------|----------|------|
|
||
| 日常开发(默认) | glm-5.1 | cc / cc51 |
|
||
| 快速任务 | glm-5 | cc5 |
|
||
| 省 token | glm-4.5-air | cc45a |
|
||
| HTML 生成 | glm-4.7 | cc47 |
|
||
|
||
## Claude Code 真实环境测试
|
||
|
||
> 以下为通过 ccX 命令启动 Claude Code 实际会话的测试结果
|
||
|
||
| 模型 | 别名 | 启动耗时 | 状态栏模型名 | 子 Agent | 备注 |
|
||
|------|------|---------|-------------|----------|------|
|
||
| (待测试) | | | | | |
|