查看: 6|回复: 0

我针对实际任务测试了 DeepSeek V4.1 Flash。测试涉及 2 个代码库和 105 个隐藏 Bug,要求模型尽可能找出并修复这些问题。

[复制链接]

13

主题

0

回帖

49

积分

新手上路

积分
49
发表于 昨天 21:42 | 显示全部楼层 |阅读模式
我针对实际任务测试了 DeepSeek V4.1 Flash。测试涉及 2 个代码库和 105 个隐藏 Bug,要求模型尽可能找出并修复这些问题。

Opus 5 (max): 27
Grok 4.6 (max): 27
DeepSeek V4.1 Flash (max): 24
GPT-5.6 Luna (xhigh): 23
Opus 5 (high): 21

对于日常任务而言,这确实是一款非常强大的模型。再来看看成本:

Opus 5 (max): $51.33
Grok 4.6 (max): $16.96
DeepSeek V4.1 Flash (max): $1.80
GPT-5.6 Luna (xhigh): $2.50
Opus 5 (high): $38.77

它处于帕累托前沿(Pareto frontier)位置。

关于 DeepSeek V4 Pro 的其他强度等级(high)测试及额外评估结果,将陆续发布在这个帖子中 🧵


本帖子中包含更多资源

您需要 登录 才可以下载或查看,没有账号?立即注册

×
您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

关注公众号

相关侵权、举报、投诉及建议等,请发 E-mail:2776601884@qq.com

Powered by Discuz! X5.0 © 2001-2026 Discuz! Team.|青ICP备2025004122号-1

在本版发帖
关注公众号
返回顶部