隆重推出 LLM-as-a-Verifier✨——一个简单的验证扩展框架,在智能体基准测试中达到了 SOTA 水平🚀
核心思想:
- 使用更细粒度的评分(例如,1-20 分制,而非标准的 1-5 分制)
- 计算分数标记的完整对数概率分布的期望值
- 扩展重复评估和准则分解
您可以利用这些细粒度信号,实现更有效的测试时扩展、强化学习和智能体监控!它在 Terminal-Bench V2、SWE-Bench Verified、RoboRewardBench 和 MedAgentBench 等测试中均达到了 SOTA 水平👑