主 题:GLM-5.3-Flash 我要打十个
发 布 者:cogoxu
标签分类: 技术
时 间:2026-08-28 19:56:34
内容预览:Z.ai 先后发布了 GLM-5.3 和 GLM-5.3-Flash 两份评测报告,但两张图的基准版本并不一致(比如 Terminal Bench 一个用 2.1、一个用 3.0),直接对比会产生“84 分 vs 28 分”的错觉。我把两份报告的原始数据提取出来,对齐到同一基准,并补上 Kimi K3、GPT-5.6 Sol、DeepSeek-V4 Pro 作参照,整理成下面这张表。基准能力域GLM-5.3GLM-5.3-FlashKimi K3GPT-5.6 SolDeepSeek-V4 Pro-0813Terminal Bench 2.1终端任务88.284.388.388.887.9Terminal Bench 3.0终端任务(加难版)28.3–17.434.6–DeepSWE v1.1复杂软件工程66.963.467.572.762.7NL2Repo生成完整仓库5856.358–61.1SWE-Marathon v1.1超长程工程42.5–48.142.5–PostTrainBenchML 工程39.8–3236.2–CyberGym漏洞发现84.5–8083.683.3ExploitGym (2h/6h)漏洞利用105/130–36/70216/293–ExploitBench漏洞利用54.4–32.276.5–Toolathlon Verified工具编排7378.476.574.974.1AutomationBench v1.0.6办公自动化48.248.846.745.843.2Agents' Last Exam (CLI)代理能力上限28.526.327.628.625.7HLE w/ Tools前沿推理62.555.359.864.560.0GDPval-AA v2专业工作交付(Elo)17691773168217301590("–" 表示官方未公布该项
直达链接: https://www.nodeseek.com/post-899037-1
 
 
Back to Top