如何看待DeepSeek-V4 Pro正式版疑似过拟合DeepSeek Harness的极简模式?
注:过拟合的具体提示词为“You are a helpful software engineer assistant.”,放在对话开头作为首条消息发送在后续对话中即可发现思维链明显改变,思考强度也生效了 Flash也有一定的过拟合现象,使用上述提示词也会改变思维链并明显变聪明 社区消融实验揭秘:DeepSeek V4 Pro 正式版严重依赖首轮工具锚定,两阶段插件成功复现高分能力 DeepSeek V4 Pro 正式版发布后,因实际表现不及灰度测试预期而引发社区争议。近日,开源社区通过消融实验探针对其进行了深入分析,揭示了其性能波动的底层机制并给出了解决方案: V4 Pro 对首轮请求中可见的 API 工具目录(Schema Surface)极度敏感。在暴露完整 25 个工具的 Standard 模式下,模型易陷入低效的 “Let me...” 思维链(CoT)轨迹,Project2 评分仅为 9192 分;而在仅提供 Shell 和 Read 的 Minimal 模式下,模型能被激活为灰测时的 “We need...” 推理轨迹,基准分回升至 9699 分。 针对 Minimal 模式缺失高级工具的问题,社区开源了 dsh-anchored-standard 插件。该方案采用“首轮锚定 + 动态晋升”策略——首次请求仅暴露 2 项核心工具以锚定优质推理轨迹,一旦模型发起首次 Tool Call,立即在后续轮次解锁全部 25 项标准工具。 在 Windows 原生 Project2 测试中,该方案连续跑出 98、99 的高分,成功进入 Fable 等前沿模型分数带。该实验表明,V4 Pro 的核心能力并未丢失,但可能在强化学习(RL)后训练阶段对特定的 Harness 脚手架与工具暴露环境存在显著过拟合。 参考:microblock_pub 、DeepSeek V4 Pro / Flash 轨迹触发机制实验 、dsh-anchored-standard
热度走势
已确认的信息
- 来源平台:知乎
- 首次收录:2026-08-15 04:22:26 UTC
- 最近更新:2026-08-15 06:37:37 UTC
- 历史最佳排名:第 12 位
- 最近热度:174 万热度