如何从 AI 反馈中提取更丰富的信号?

如何从 AI 反馈中提取更丰富的信号?

隆重推出 LLM-as-a-Verifier✨——一个简单的验证扩展框架,在智能体基准测试中达到了 SOTA 水平🚀

核心思想:

- 使用更细粒度的评分(例如,1-20 分制,而非标准的 1-5 分制)

- 计算分数标记的完整对数概率分布的期望值

- 扩展重复评估和准则分解

您可以利用这些细粒度信号,实现更有效的测试时扩展、强化学习和智能体监控!它在 Terminal-Bench V2、SWE-Bench Verified、RoboRewardBench 和 MedAgentBench 等测试中均达到了 SOTA 水平👑














分类