随着开源模型能力的不断提升,它们现在可以生成大量高质量的候选解,并以极低的成本验证自身的输出。
例如,我们发现,仅使用 DeepSeek V4 Flash 采样 5 个解,并使用 LLM-as-a-Verifier 对它们进行排序,就能显著提升准确率(79% → 88%),在 Terminal-Bench 测试中超越了封闭边界模型。
立即体验:https://github.com/llm-as-a-verifier/llm-as-a-verifier#self-verification-terminal-bench-21
更多关于验证扩展的内容,请参阅我之前的文章。