Files
team/team/GLM模型评测报告.md
T
2026-04-19 21:47:08 +08:00

3.1 KiB
Raw Blame History

GLM 模型评测报告

评测时间: 2026-04-15

API 基础验证

通过 curl 直接调用 GLM APIopen.bigmodel.cn/api/anthropic),max_tokens=50,回复"OK"。

模型 耗时 状态
glm-4.5 546ms
glm-4.5-air 397ms
glm-4.6 586ms
glm-4.7 1208ms
glm-5 32305ms
glm-5-turbo 606ms
glm-5.1 1507ms

综合任务评测

评测条件

  • 任务: 3 个(Python quicksort + docs 文件分析 + Svelte 5 TodoList
  • max_tokens: 4096
  • 执行方式: bash 后台并行(4+3 分批)
  • 评测 prompt: 统一

结果

模型 耗时 输入tok 输出tok 截断 任务完成 质量
glm-4.5 35.7s 158 6430 2/3 可接受
glm-4.5-air 37.4s 1 2555 3/3 良好(精简)
glm-4.6 27.7s 101 4096 2/3 过度包装 HTML
glm-4.7 28.6s 101 4096 3/3 过度包装 HTML
glm-5 27.4s 101 1296 3/3 良好
glm-5-turbo 52.7s 101 1390 0/3 高峰期限流
glm-5.1 35.2s 101 1314 3/3 良好

各模型特性

glm-4.5

  • 速度中等(35.7s
  • 输出 token 较多(6430),可能因为 max_tokens 设置较大
  • 完成 2/3 任务
  • 适合:一般代码生成

glm-4.5-air

  • 速度中等(37.4s),但输入 token 计数异常(1 tok,可能 tokenizer 不同)
  • 输出精简(2555 tok),完整完成 3 个任务
  • 适合:需要精简输出的场景,token 敏感场景

glm-4.6

  • 速度较快(27.7s
  • 问题: 倾向于生成 HTML 包装页面(含 Tailwind CSS、SVG 图标),导致 4096 token 截断
  • 实际代码被 HTML 结构淹没,不适合纯代码任务
  • 适合:需要 HTML 展示效果的场景

glm-4.7

  • 速度较快(28.6s
  • 与 glm-4.6 类似,生成 HTML 包装页面导致截断
  • 代码质量本身尚可,但被过度包装
  • 适合:需要 HTML 展示效果的场景

glm-5

  • 速度最快(27.4s
  • 输出精炼(1296 tok),完整完成 3 个任务
  • 代码质量好,输出格式清晰
  • 适合:日常开发,代码生成和文件分析

glm-5-turbo

  • 不稳定:高峰期限流(code 1305),非高峰 52.7s
  • 首次并发测试无响应,重试后成功但较慢
  • 适合:非高峰时段的快速任务

glm-5.1

  • 速度中等(35.2s
  • 输出精炼(1314 tok),完整完成 3 个任务
  • 代码质量好,输出格式清晰
  • 推荐: 日常开发首选

推荐方案

场景 推荐模型 别名
日常开发(默认) glm-5.1 cc / cc51
快速任务 glm-5 cc5
省 token glm-4.5-air cc45a
HTML 生成 glm-4.7 cc47

Claude Code 真实环境测试

以下为通过 ccX 命令启动 Claude Code 实际会话的测试结果

模型 别名 启动耗时 状态栏模型名 子 Agent 备注
(待测试)