这种范式在demo 阶段无敌,上生产撞三堵墙:慢、贵、说不清为什么。
判断和生成是两种事:判断要的是固定选项、可校准的概率、能调的阈值、能画的 ROC,生成模型给你的是一段"我觉得这个操作有风险,建议人工确认"(除了照办,无法量化)。
老板问你幻觉和误杀率多少?
>正在发生的迁移:单体 agent → 生成层 + 一堆小决策器,跟当年 PHP 单体拆成网关/鉴权/限流,是同一个剧本,要想开使用Jev,以下3步就可以开始:
1、把你 agent 里所有判断点标出来:工具授权、模型路由、内容准入、结果验证
2、每个判断点定义:标签集、阈值、两类误判各自的代价
3、三个状态:PASS / FAIL / 不确定,别让模型在没把握的时候硬猜,把不确定导给人
提醒一句:小模型专职判断不是新东西,传统 NLP 干了十几年,只是最近这两年被 LLM 的光盖住了,真正难的从来不是模型,是标注和调阈值:幻觉或者误杀率 3% 在 demo 里没感觉,在生产里就是每天几十个投诉。
还有:这层会让系统更复杂,不是更简单,只有当你的 agent 真在替人做有后果的事时,才值得加。
如果是做demo类的agent 不需要,但生产级agent需要,但是要在成本和带来的结果提升上找平衡点,如果为了1%话费1倍的成本调这个估计老板未必会同意。