喵个咪终于有人把 LLM 判题(LLM-as-a-Judge)这个大冤种架构给算明白了,

喵个咪终于有人把 LLM 判题(LLM-as-a-Judge)这个大冤种架构给算明白了,
中国几个学生做的这份Jev研究,把AI决策的成本账彻底算透了,

把这套方法粘贴进Claude和GPT的工作流,判断校验成本直接降了约63倍。

之前搞 Agent 最让我肉疼的一件事,就是让大模型自己给自己当裁判,

每次让 GPT 或 Claude 生成完,还得再调一次大模型去抓幻觉、防提示注入。

慢得要死不说,一趟下来等好几秒,月末一看账单,大半的钱全给这个质检员交了学费。

今天把国内几个学生刚发的那篇 Jev 论文(arXiv: 2609.29429)仔细看了一遍,他们把这笔成本账算得是真透。
他们在 44 个基准、7000 多个真实样本里把各种翻车场景全测了一遍。其实核心思路就一句话:别再让大模型从头包到尾了,把校验这道脏活直接拆出来。
几个非常反直觉但极度实用的工程细节:
第一,别去瞎折腾 Prompt 技巧了,根本没用。直接把你的判定规则和来源原文原封不动喂给 Jev,给足上下文,一个最普通的提问就能打赢绝大多数调优过的基线。
第二,千万别直接要“是”或者“否”。把 Jev 输出的概率留着,随便找 10 个样本拟合一下阈值,准确率直接上一个台阶。
第三,分流做质检。在它信心最足的那一半决策里,准确率有 93% 以上。平时跑流程,90% 的请求让 0.3 秒的 Jev 毫秒级放行,只有它拿不准的个别个例,才丢给大模型做深度复审。

他们测下来的数据很夸张:平均 0.31 秒出结果,检查一次成本 0.3 美元,而以前用大模型做判定要 18.96 美元,整整省了 63 倍。

以前大模型既当运动员又当裁判,又贵又慢还容易自己骗自己。现在前面大模型负责写,后面挂个极便宜的小脑负责质检,心里踏实多了。

真的,写代码别死磕单一大模型了。生成一层,校验一层,执行一层,把成本降下来系统才能真正跑起来。

(论文和他们开源的 44 个测试集我扔在评论区一楼了,做 Agent 的兄弟建议直接抄作业)

分类