主 题:[转发]DeepSeek V4 Pro在 Minimal 工具下启动行为和其它工具下的能力表现存在较大差异
发 布 者:KimJun
标签分类: 情报
时 间:2026-08-15 00:06:10
内容预览:原文:有人测出来 V4 Pro 在 Minimal 工具下启动行为和其它工具下表现完全不一样,Minimal 工具下和之前灰度时候的 “I need” CoT 一模一样,复现了一下是真的真绷不住了,我说他们怎么做到官方跑 Terminal Bench 跑 87.9,结果 AA 跑的只有 79 的,感情搁这疯狂过拟合 Minimal Harness,还有安全词的说是又要变祖了吗...DeepSeek V4 Pro 不是能力不行,而是对首次请求的工具结构极其敏感。官方 Standard/PTC 只有 91/92 分,Minimal 是 99/96,但只有两个工具。我们做了一个两阶段插件:首轮只给 shell + read 锚定 Minimal 推理轨迹,第一次工具调用后立刻恢复 Standard 全部 25 项工具。Windows 连跑两次 98/99,均值 98.5,第二轮全程 let me=0,证明不是抽卡,也不需要牺牲完整工具能力。插件已开源:https://github.com/xiaobright/dsh-anchored-standard完整评测、原理分析和统计证据:https://github.com/xiaobright/modeltest如果真的是这样的话那也太弱智了,dpsk 这模型发的真是创记录了· 全球首个发了权重以后发现发成 V4Flash 权重了,然后紧急撤回权重的模型· 全球首个在短短一天内发布和不发布来回抽搐 N 次的模型· 全球首个不在指定环境运行就能掉完性能的模型(原来对标 Codex 是这么个对标法吗),而且还不告诉用户要在这个环境运行搁这当 ARG 玩呢甚至 deepseek-harness 还专门有一个 Commit 将 Minimal 的提示词对齐到 RL 环境 (https://github.com/deepseek-ai/deep
直达链接: https://www.nodeseek.com/post-874812-1
发 布 者:KimJun
标签分类: 情报
时 间:2026-08-15 00:06:10
内容预览:原文:有人测出来 V4 Pro 在 Minimal 工具下启动行为和其它工具下表现完全不一样,Minimal 工具下和之前灰度时候的 “I need” CoT 一模一样,复现了一下是真的真绷不住了,我说他们怎么做到官方跑 Terminal Bench 跑 87.9,结果 AA 跑的只有 79 的,感情搁这疯狂过拟合 Minimal Harness,还有安全词的说是又要变祖了吗...DeepSeek V4 Pro 不是能力不行,而是对首次请求的工具结构极其敏感。官方 Standard/PTC 只有 91/92 分,Minimal 是 99/96,但只有两个工具。我们做了一个两阶段插件:首轮只给 shell + read 锚定 Minimal 推理轨迹,第一次工具调用后立刻恢复 Standard 全部 25 项工具。Windows 连跑两次 98/99,均值 98.5,第二轮全程 let me=0,证明不是抽卡,也不需要牺牲完整工具能力。插件已开源:https://github.com/xiaobright/dsh-anchored-standard完整评测、原理分析和统计证据:https://github.com/xiaobright/modeltest如果真的是这样的话那也太弱智了,dpsk 这模型发的真是创记录了· 全球首个发了权重以后发现发成 V4Flash 权重了,然后紧急撤回权重的模型· 全球首个在短短一天内发布和不发布来回抽搐 N 次的模型· 全球首个不在指定环境运行就能掉完性能的模型(原来对标 Codex 是这么个对标法吗),而且还不告诉用户要在这个环境运行搁这当 ARG 玩呢甚至 deepseek-harness 还专门有一个 Commit 将 Minimal 的提示词对齐到 RL 环境 (https://github.com/deepseek-ai/deep
直达链接: https://www.nodeseek.com/post-874812-1