查看: 3|回复: 0

具身智能的Demo越看越热闹,但我心里总有个问题:这些能力到了真实世界,还剩多少?

[复制链接]

7

主题

1

回帖

23

积分

新手上路

积分
23
发表于 昨天 15:00 | 显示全部楼层 |阅读模式
具身智能的Demo越看越热闹,但我心里总有个问题:这些能力到了真实世界,还剩多少?所以我们决定自己造一把尺子。

近期,智源研究院正式发布FlagEval-Robo具身智能评测体系,用"仿真+真机"双轨评测,为具身智能建立真实能力标尺。仿真评测聚焦效率与可复现,真机评测聚焦真实与可拆解,让模型从仿真能力到真实任务表现,有了一把统一的衡量尺度。
这次评测有几个发现,值得行业认真看看:仿真结果会明显高估模型的能力;强原子技能并不能直接组合泛化到其他任务;高质量的真机数据依然是提升模型性能的黄金口粮;Scaling Law尚未在具身大模型显现。还有一句要提醒:演示视频效果不等于真实水平。
具身评测不应只是一张一劳永逸的榜单。用评测看清问题,用挑战推动解题,用真实场景检验答案。知道哪里还不行,才是进步的开始。

本帖子中包含更多资源

您需要 登录 才可以下载或查看,没有账号?立即注册

×
您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

关注公众号

相关侵权、举报、投诉及建议等,请发 E-mail:2776601884@qq.com

Powered by Discuz! X5.0 © 2001-2026 Discuz! Team.|青ICP备2025004122号-1

在本版发帖
关注公众号
返回顶部