DSH 不同模式下 V4 Pro + Max 制作小游戏的真实效果

看到很多平台都在聊 dsh 搭配 v4 pro (with max reasoning effort) 正式版使用时,不同的模式间思维链和产品效果存在较大差异,于是花了 20 多块实测了几轮较简单的任务,也搭配 Pi Native 模式作为对照,供参考。测试除 Pi 对照之外,都在 DSH 中使用 DeepSeek V4 Pro max 推理强度进行。Prompt:“复刻超级马里奥”实测效果: https://deepseek-v4-harness.pages.dev/个人看来,“We need” “Let me” 这两种思维链间的差异确实挺大的(链接里标准模式和 Pi 对照组里的有些简直没法玩),目前好像还没有其他企业部署开源权重的 v4p ,不确定是官方动了手脚还是模型本身注意力等存在问题。用 DSH 并且想发挥 v4p 最佳实力的话,还是建议用极简模式。网上也有人做了标准/PTC 模式伪装极简模式实现 We need 思维链,但是这里没有测试。