近期,智源研究院正式发布FlagEval-Robo具身智能评测体系,用"仿真+真机"双轨评测,为具身智能建立真实能力标尺。仿真评测聚焦效率与可复现,真机评测聚焦真实与可拆解,让模型从仿真能力到真实任务表现,有了一把统一的衡量尺度。
这次评测有几个发现,值得行业认真看看:仿真结果会明显高估模型的能力;强原子技能并不能直接组合泛化到其他任务;高质量的真机数据依然是提升模型性能的黄金口粮;Scaling Law尚未在具身大模型显现。还有一句要提醒:演示视频效果不等于真实水平。
具身评测不应只是一张一劳永逸的榜单。用评测看清问题,用挑战推动解题,用真实场景检验答案。知道哪里还不行,才是进步的开始。