我针对实际任务测试了 DeepSeek V4.1 Flash。测试涉及 2 个代码库和 105 个隐藏 Bug,要求模型尽可能找出并修复这些问题。

我针对实际任务测试了 DeepSeek V4.1 Flash。测试涉及 2 个代码库和 105 个隐藏 Bug,要求模型尽可能找出并修复这些问题。

Opus 5 (max): 27
Grok 4.6 (max): 27
DeepSeek V4.1 Flash (max): 24
GPT-5.6 Luna (xhigh): 23
Opus 5 (high): 21

对于日常任务而言,这确实是一款非常强大的模型。再来看看成本:

Opus 5 (max): $51.33
Grok 4.6 (max): $16.96
DeepSeek V4.1 Flash (max): $1.80
GPT-5.6 Luna (xhigh): $2.50
Opus 5 (high): $38.77

它处于帕累托前沿(Pareto frontier)位置。

关于 DeepSeek V4 Pro 的其他强度等级(high)测试及额外评估结果,将陆续发布在这个帖子中 🧵


分类