Grok 4.6 刚刚在 MedAgentBench 上排名第一......这是现实世界代理医疗保健任务最有趣的基准之一

Grok 4.6 刚刚在 MedAgentBench 上排名第一......这是现实世界代理医疗保健任务最有趣的基准之一

现在,Grok 有两代人跻身前三名

• #1 Grok 4.6 — ~95.9%
• #2 GPT-5.6 Sol — ~94.7%
• #3 Grok 4.5 — ~93.4%

MedAgentBench 远远超出了回答医疗问题的范围

它在真实的电子健康记录环境中针对 10 个类别的 300 项临床衍生任务测试 AI 代理,要求模型进行推理、使用工具并实际执行多步骤临床工作流程

Grok 4.5 已经是测试中最强的医疗制剂之一。 Grok 4.6 将其推向了另一个水平

Grok 正在迅速成为代理医疗保健工作中最强大的 AI 模型系列之一


分类