Forwarded from LoopDNS资讯播报
社区消融实验揭秘:DeepSeek V4 Pro 严重依赖首轮工具锚定,两阶段插件成功复现高分能力

DeepSeek V4 Pro 正式版发布后,因实际表现不及灰度测试预期而引发社区争议。近日,开源社区通过消融实验探针对其进行了深入分析,揭示了其性能波动的底层机制并给出了解决方案:

V4 Pro 对首轮请求中可见的 API 工具目录(Schema Surface)极度敏感。在暴露完整 25 个工具的 Standard 模式下,模型易陷入低效的 “Let me...” 思维链(CoT)轨迹,Project2 评分仅为 9192 分;而在仅提供 Shell 和 Read 的 Minimal 模式下,模型能被激活为灰测时的 “We need...” 推理轨迹,基准分回升至 9699 分。

针对 Minimal 模式缺失高级工具的问题,社区开源了 dsh-anchored-standard 插件。该方案采用“首轮锚定 + 动态晋升”策略——首次请求仅暴露 2 项核心工具以锚定优质推理轨迹,一旦模型发起首次 Tool Call,立即在后续轮次解锁全部 25 项标准工具。

在 Windows 原生 Project2 测试中,该方案连续跑出 98、99 的高分,成功进入 Fable 等前沿模型分数带。该实验表明,V4 Pro 的核心能力并未丢失,但可能在强化学习(RL)后训练阶段对特定的 Harness 脚手架与工具暴露环境存在显著过拟合。

参考:microblock_pubDeepSeek V4 Pro / Flash 轨迹触发机制实验dsh-anchored-standard