当医疗大模型开始进入问诊辅助、用药咨询、健康管理等真实场景,一个很自然的问题会出现:AI给出的回答真的可靠吗?

当医疗大模型开始进入问诊辅助、用药咨询、健康管理等真实场景,一个很自然的问题会出现:AI给出的回答真的可靠吗?

一般做法是外挂式护栏,大模型先回答,用另外一个审核模型再把问题和答案重新读一遍,判断是否违规、是否有风险

问题是贵、慢、还容易看不懂复杂上下文

蚂蚁刚发布并开源了一套内生式运行时护栏:SingProbe,让模型一边生成答案,一边同步给自己打风险分

它不是重新读文本,是从主模型已有的hidden states里读风险信号,针对每个基座模型训练一个约3–5M的小探针,像“读数器”一样,从主模型中间状态里读出风险分数

每个token输出几类分数:用户意图是否有风险、已生成回答是否不安全、内容幻觉风险有多高。因为只依赖当前已生成前缀,所以可以做到流式实时预警,风险刚露头就能告警、截断、重试或切换策略

在Ling-3.0-flash生产环境的decode阶段,额外开销小于 0.5%

医疗版中,AI答错的地方,可以现场把25%的错误拗回来,并且它平时不全程干预,风险触发后才在有限窗口内纠偏




分类