查看: 8|回复: 0

如何从 AI 反馈中提取更丰富的信号?

[复制链接]

17

主题

1

回帖

53

积分

注册会员

积分
53
发表于 昨天 23:32 | 显示全部楼层 |阅读模式
如何从 AI 反馈中提取更丰富的信号?

隆重推出 LLM-as-a-Verifier✨——一个简单的验证扩展框架,在智能体基准测试中达到了 SOTA 水平🚀

核心思想:

- 使用更细粒度的评分(例如,1-20 分制,而非标准的 1-5 分制)

- 计算分数标记的完整对数概率分布的期望值

- 扩展重复评估和准则分解

您可以利用这些细粒度信号,实现更有效的测试时扩展、强化学习和智能体监控!它在 Terminal-Bench V2、SWE-Bench Verified、RoboRewardBench 和 MedAgentBench 等测试中均达到了 SOTA 水平👑














本帖子中包含更多资源

您需要 登录 才可以下载或查看,没有账号?立即注册

×
您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

关注公众号

相关侵权、举报、投诉及建议等,请发 E-mail:2776601884@qq.com

Powered by Discuz! X5.0 © 2001-2026 Discuz! Team.|青ICP备2025004122号-1

在本版发帖
关注公众号
返回顶部