查看: 6|回复: 0

使用 DeepSeek V4 Flash 进行自验证扩展,在 Terminal-Bench 2.1 测试中超越了 Claude Fable 5,成本却降低了 11 倍💰

[复制链接]

30

主题

0

回帖

96

积分

注册会员

积分
96
发表于 昨天 23:29 | 显示全部楼层 |阅读模式
使用 DeepSeek V4 Flash 进行自验证扩展,在 Terminal-Bench 2.1 测试中超越了 Claude Fable 5,成本却降低了 11 倍💰

随着开源模型能力的不断提升,它们现在可以生成大量高质量的候选解,并以极低的成本验证自身的输出。

例如,我们发现,仅使用 DeepSeek V4 Flash 采样 5 个解,并使用 LLM-as-a-Verifier 对它们进行排序,就能显著提升准确率(79% → 88%),在 Terminal-Bench 测试中超越了封闭边界模型。

立即体验:https://github.com/llm-as-a-veri ... n-terminal-bench-21

更多关于验证扩展的内容,请参阅我之前的文章。


本帖子中包含更多资源

您需要 登录 才可以下载或查看,没有账号?立即注册

×
您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

关注公众号

相关侵权、举报、投诉及建议等,请发 E-mail:2776601884@qq.com

Powered by Discuz! X5.0 © 2001-2026 Discuz! Team.|青ICP备2025004122号-1

在本版发帖
关注公众号
返回顶部