主 题:dsh对于盲测结果的汇报
发 布 者:yszmnl2233
标签分类: 技术
时 间:2026-08-19 21:13:53
内容预览:让三家大模型重答实验(二):盲测结果与 DeepSeek 的红温时刻前情:《让三家大模型给我的训练数据重答:一次蒸馏实验的流水账》。这次是后续:盲测出分了,而且其中一家 agent —— DeepSeek V4 Pro —— 在跑到 3% 的时候拒绝继续,留下了完整的现场。一、先给数据:三家 agent 的实际产出(可验证)所有文件都在 /data/cabbage-next/work/ 下,下面每个数字都可以用 wc -l 复现:Agent输出文件行数最后写入时间GLM 5.3glm-5.3-tmp/parts/part_*.jsonl(9 个分片)1071持续更新中Kimi K3output/kimi-k3.jsonl700持续更新中DeepSeek V4 Prooutput/deepseek-v4-pro.jsonl(80)+ output/_sub/a_0004_0005.jsonl(87)+ a_0006_0007.jsonl(83)250 去重04:56 停更总任务 7699 条。DeepSeek 覆盖率:250/7699 = 3.2%。二、盲测结果:GLM 微弱领先,DS 垫底(8 份记录,185 题)我在服务器上搭了个盲测页(A/B/C 与真实模型每次随机绑定),8 份记录、185 题的选择已落盘在服务器 results.jsonl。按题还原后的统计:排名模型胜场胜率🥇GLM 5.39048.6%🥈Kimi K37942.7%🥉DeepSeek V4 Pro168.6%两两对决(同一题两个模型都在场时谁被选中):GLM 胜 Kimi:90 : 79Kimi 胜 DeepSeek:23 : 16DeepSeek 胜 GLM:16 : 14有意思的点:DeepSeek 虽然总胜率最低,但它参与的题目里对 GLM 不落下风(16:14)——它的低胜率主要是覆盖率不足
直达链接: https://www.nodeseek.com/post-883136-1
发 布 者:yszmnl2233
标签分类: 技术
时 间:2026-08-19 21:13:53
内容预览:让三家大模型重答实验(二):盲测结果与 DeepSeek 的红温时刻前情:《让三家大模型给我的训练数据重答:一次蒸馏实验的流水账》。这次是后续:盲测出分了,而且其中一家 agent —— DeepSeek V4 Pro —— 在跑到 3% 的时候拒绝继续,留下了完整的现场。一、先给数据:三家 agent 的实际产出(可验证)所有文件都在 /data/cabbage-next/work/ 下,下面每个数字都可以用 wc -l 复现:Agent输出文件行数最后写入时间GLM 5.3glm-5.3-tmp/parts/part_*.jsonl(9 个分片)1071持续更新中Kimi K3output/kimi-k3.jsonl700持续更新中DeepSeek V4 Prooutput/deepseek-v4-pro.jsonl(80)+ output/_sub/a_0004_0005.jsonl(87)+ a_0006_0007.jsonl(83)250 去重04:56 停更总任务 7699 条。DeepSeek 覆盖率:250/7699 = 3.2%。二、盲测结果:GLM 微弱领先,DS 垫底(8 份记录,185 题)我在服务器上搭了个盲测页(A/B/C 与真实模型每次随机绑定),8 份记录、185 题的选择已落盘在服务器 results.jsonl。按题还原后的统计:排名模型胜场胜率🥇GLM 5.39048.6%🥈Kimi K37942.7%🥉DeepSeek V4 Pro168.6%两两对决(同一题两个模型都在场时谁被选中):GLM 胜 Kimi:90 : 79Kimi 胜 DeepSeek:23 : 16DeepSeek 胜 GLM:16 : 14有意思的点:DeepSeek 虽然总胜率最低,但它参与的题目里对 GLM 不落下风(16:14)——它的低胜率主要是覆盖率不足
直达链接: https://www.nodeseek.com/post-883136-1