“世界第一”成标配 具身大模型榜单林立背后的含金量几何?
证券时报记者 周春媚
“拿下具身世界模型第一”“登顶具身智能榜单”“具身大模型登顶国际评测公开排行榜”……搜索最近的具身大模型新闻,满屏的“第一”和“登顶”跃入眼帘。在这个资本最密集的赛道,榜单已经变得不够用了。
当几乎所有头部公司都手握至少一个“第一”时,这些榜单究竟在衡量什么?记者调研发现,当前具身大模型榜单数量已超20个,但业内公认的权威标准尚未形成。仿真榜单刷分容易、真机测试成本高昂、榜单性质混杂——“第一”的含金量千差万别。在这场“榜单狂欢”背后,真正值得追问的是:如何让“榜单第一”经得起真实世界的检验?
人手一个“世界第一”
8月11日,越疆科技宣布,在面向复杂遮挡机器人抓取的国际评测赛事UNOBench Challenge公开排行榜上,越疆空弈DobotWAM具身大模型在两大赛道中同时登顶。越疆科技表示,这一成绩展现出该具身大模型从语义理解到动作前置推理的领先实力。
而就在此前不到半个月,具身智能公司智元宣布,其自研的具身原生全模态大模型WITA-Omni Preview在具身全模态理解权威榜单DailyOmni上,超过国内外众多领先模型登顶榜首。智元强调,DailyOmni榜单高度贴合人形机器人在真实物理空间开展人机交互所需的核心感知能力,登顶榜首意味着该模型在物理世界视听时序理解任务上具备独特竞争力。
如果将时间轴拉长,会发现在令人眼花缭乱的具身大模型榜单中,机器人公司都曾榜上有名,几乎人手一个“世界第一”。
证券时报记者根据公开资料不完全梳理,今年3月,极佳视界宣布其自研的GigaWorld-1世界模型在权威评测基准WorldArena中登上全球榜首;4月,中科第五纪宣布其研发的具身世界模型FlowWAM登顶WorldArena榜单;6月,千寻智能宣布在全球具身智能实战评测平台RoboArena中,其自研模型Spirit v1.6排名全球第一。
纵观以上案例,涉及的榜单就有4个,每一个的形容词都是“全球”“权威”。在层出不穷的“登顶榜单”新闻中,普通人很难分辨不同榜单之间有何区别、登顶到底意味着什么,只是在同质化的宣传话语中,留下“不明觉厉”的粗浅印象。
这与行业当前所处的阶段有关。安邦智库宏观经济研究中心助理研究员赵至江在接受证券时报记者采访时表示,具身智能正处于技术探索与产业验证的早期阶段。“一方面,技术路线尚未完全收敛,还没有形成统一的行业评价标准。另一方面,资本市场对具身智能保持高度关注,企业需要通过测试成绩、演示视频和技术指标证明自身领先优势,客观上推动了部分指标包装和营销放大现象。”赵至江说。
赵至江强调,不能简单否定榜单的意义,但也要客观看待其价值。“不同企业仍在探索差异化的技术路径,在这种格局下,形成统一的行业评价标准并不容易。”赵至江说,当前榜单更多反映企业在某一单项能力上的突破,而非技术水平的全貌。
榜单含金量各不相同
首先,要厘清的概念是,机器人公司竞相追逐的“榜单第一”究竟是什么,与通用大模型的榜单有何区别?
近一两年来,随着供应链的成熟,造一台机器人已经不是难事,行业竞争从“拼本体”转向“拼大脑”,而这个“大脑”就是具身大模型。
因此,机器人要真正变得聪明好用,就需要拥有自己的具身大模型,重新采集训练机器人所需要的数据。通用大模型由于较为成熟,指标清晰,行业内已经形成了若干个公认的权威榜单,但具身大模型领域还没有。不同机构提出的榜单在评分维度与指标上差异较大,缺乏统一标准。
此外,天使投资人、资深人工智能专家郭涛告诉证券时报记者,具身大模型榜单高度依赖配套进行评测的机器人本体、执行器与仿真环境,分数无法脱离硬件单独成立。厂商可以通过调整机械参数、优化仿真环境定向提分,纯技术参考价值弱于通用大模型榜单。
其次,当前有哪些主流的具身大模型榜单,各自含金量如何?
据证券时报记者不完全梳理,当前各类具身大模型榜单数量已超20个,发起方包括清华大学、北京大学、普林斯顿大学、斯坦福大学等顶尖高校,美国艾伦AI研究院、上海AI实验室等研究机构,以及英伟达等企业。大多数榜单由几个机构联合发起。
按照不同类别,具身大模型榜单有不同的划分方式。如果从考察能力范围的全面性来看,可以分为综合能力榜单和专项能力榜单。前者就像对模型能力的“全面体检”;后者则侧重专项测试,考察其特定能力或极端场景下的表现。如果按照评测环境与真实物理世界的距离来划分,则主要分为仿真任务榜单与真机测试榜单,前者如同理论考试,后者则像实战演习。
一名业内人士告诉记者,不同于通用大模型测评以数字形式输入、数字结果输出,可以线上进行,具身大模型真机评测需要匹配硬件和场地,耗时长,成本高,因此真机测试榜单十分稀缺。
“仿真任务榜单是目前数量最多的,比如LIBERO、RoboTwin、ManiSkill等,它们标准化、低成本、容易复现,特别适合做算法横向比较。”中国社会科学院大学数字中国研究院特聘研究员刘兴亮在接受证券时报记者采访时表示。在他看来,真机和真实场景评测是含金量最高的一类,目前一些榜单比赛已经开始采用“仿真初赛+真机决赛”形式,把仿真评测与实体机器人验证结合起来。
当榜单足够多、赛道足够细分,机器人公司总能找到某个维度让模型登顶。刘兴亮表示,一个榜单有没有含金量,应从四方面来判断:题目是否公开透明,测试集是否与训练集隔离,结果能否被第三方复现,能否经过真实世界的验证。“科研评价关注的是能力问题,而产业评价关注的是技术能否形成稳定商业价值,两者本身就是不同逻辑。”赵至江说,一些榜单是为营销、融资而服务,但真正有能力有价值的企业,最终会由具体的应用而不是榜单排名筛选出来。
亟需从“做题”走向“实战”
具身大模型榜单看似热闹,但一个尴尬的现实是,仿真环境中的“学霸”到了真实世界,往往变成“学渣”,“榜单上的高手,实践中的矮子”是行业的普遍现象。
原因是多方面的。首先,郭涛指出,许多榜单不具备完整有效的评价能力,测试场景单一,任务边界固定,无法覆盖工业、家庭等多元化的真实工况。一家公司在某个榜单上得分高,可能只是在该榜单的特定任务上表现优异,而非整体技术实力领先。
其次,大多数榜单基于仿真环境,与真机实测存在不可忽视的差距。“在仿真环境里,光照可以标准化,摩擦系数可以设定,摄像机不会突然被人挡住。但进入工厂、商场和家庭以后,桌子可能挪了两厘米,袋子会变形,玻璃会反光,人可能突然伸手过来,网络还可能延迟。”刘兴亮说,机器人面对的是一个开放、不确定并且持续变化的物理世界,仿真环境测试的结果更多是一种理想状态。
以被誉为具身智能领域“珠峰级”评测的RoboDojo为例,该榜单采取“仿真+真机”双榜单机制,设计了42个仿真任务和18个真实机器人任务,真实世界部分表现最好的模型总体成功率仅为12.8%,折射出机器人落地的巨大鸿沟。
最后,部分企业存在定向“刷榜”行为,人为抬高分数。郭涛表示,有的是针对仿真榜单的“题库式刷分”,比如企业提前获取测试任务样本,针对榜单内固定物体、固定动作场景专项微调模型权重,刻意降低陌生场景权重分配。有的是针对真机榜单的硬件调优,锁定专用测试样机,调试关节阻尼、运动速度适配榜单任务,规避通用工况的严苛约束。此外,个别厂商还可能针对一些榜单挑战赛的规则,利用自己注册的评测账号不断测试、刷新评分。
刘兴亮指出,破解榜单“虚假繁荣”,关键不是取消榜单,而是把考试从“做题”变成“实战”。在他看来,具身大模型榜单需从以下几个方面加以改进:一是评测标准要统一。现有的评测在环境设置、硬件配置、测试条件等方面都不同,不同模型间很难进行公平对比,唯有制定更统一的标准,才能提高结果的可复现性。二是需要引入盲测,测试任务不能全部提前公开,最终排名应由隐藏测试集、陌生物体、陌生场景决定,以此达到防“刷榜”,真正测试机器人泛化能力的目的。三是将仿真测试与真机测试结合起来,验证机器人在物理世界的可靠性。
“目前,具身智能还处于发展的早期阶段,评价更多围绕单项能力、实验性能、技术参数展开,目的在于证明技术路线是否成立。随着产业进入应用阶段,评价体系会逐渐转向综合能力,由技术展示驱动转向产业价值驱动。”赵至江说,一个成熟的产业,通常不会依赖技术性的榜单作为评价标准,而是形成由行业标准、第三方测试和市场反馈共同构成的评价体系。“具身智能距离这一阶段还有较长过程,三到五年甚至更长的时间都是有可能的。”赵至江表示。
大家都在看
-
刚刚,诺贝尔化学奖揭晓,95岁老人破解了生命为何只用「一只手」 就在10月7日,2026年诺贝尔化学奖公布!这届化学奖,颁给了法国巴黎南大学的Henri Kagan和日本东京理科大学的Kenso Soai,以表彰他们在不对称有机合成中发现非线性效应和自催化作用。这两位的发现,解答了一个困扰人 ... 机械之最10-08
-
具身智能冲击IPO:估值盛宴之后狂欢退潮 一名科技记者在今年6月,加入了北京一家估值200亿的具身智能公司,上班第一天从下午2点到晚上10点,除去1小时的晚饭时间,他一直在开会。会议的主题只有一个:筹备IPO。一位市场营销方向的候选人去上海的一家机器人 ... 机械之最10-08
-
新职业亮相,写下产业升级鲜活注脚 江苏常州武进高新区智慧微电网车网互动先导站。光明图片/视觉中国安徽合肥2026世界机器人大会展示的机器人。光明图片/视觉中国贵州黔西某化工企业打造绿色工厂。光明图片/视觉中国中国电科网络通信研究院卫星导航专 ... 机械之最10-08
-
国庆假期丰富游玩体验 多元场景激发消费活力 央视网消息(焦点访谈):今天(10月7日)是国庆假期的最后一天。过去一周,公路铁路车流如织,景区内外人潮涌动。有人奔赴远方,感受别样风情;有人回到家乡,在熟悉的街巷中寻找久违的烟火气;也有人选择留在原地 ... 机械之最10-08
-
2026诺贝尔生理学或医学奖:如何用一束光“操控”大脑? 10月5日,北京时间17时30分,2026年诺贝尔生理学或医学奖在瑞典卡罗林斯卡医学院揭晓,授予卡尔·戴塞罗思(Karl Deisseroth)、彼得·黑格曼(Peter Hegemann)和格奥尔格·内格尔(Georg Nagel),以表彰他们在光 ... 机械之最10-08
-
赖大:贾府这台机器里,最清醒的“寄生虫” 《红楼梦》里写奴才,曹雪芹从不偷懒。焦大是忠到发疯,来旺是坏到露骨,而赖大这个名字,起得本身就带刺——“赖”着贾府这棵大树,“大”起来的奴才。但他又不是普通恶奴,他是整部书里最像现代职业经理人的角色: ... 机械之最10-08
-
北宋一台12米高的机器自己报时,钟表关键零件比欧洲早六百年 说明:本文资料由 AI 协助检索整理,所有史料与数据均标注出处并逐条核对。钟表里控制走时的那个零件叫擒纵机构,很多人以为它是十四世纪欧洲人的发明。可北宋元祐七年(1092年),汴京就立起过一台十二米高的机器: ... 机械之最10-07
-
从系统代谢、物理约束与长时段历史重审能源转型 2026年9月14日至15日,第二十一期中法历史文化国际合作研讨班在上海大学宝山校区文学院成功举办。本届研讨班由上海大学文学院历史学系、中国法国史研究会、法国巴黎人文科学之家基金会联合主办。在气候变化加剧、全 ... 机械之最10-07
-
未来10年最稳的六个方向:机器抢不走,国家又缺人 现在很多年轻人找工作,心里最大的顾虑,就是岗位会不会被人工智能、自动化设备替代。不少办公室基础工作,简单的数据录入、文稿整理,已经可以交给机器完成。大家开始担心,辛辛苦苦学的技能,没过几年就失去市场价 ... 机械之最10-07
-
缝纫机是人类机械史上最成功的骗局,不骗人的那种 人类机械史上最成功的骗局,不是什么庞氏骗局,而是家家户户都见过的缝纫机!你敢信?这台踩起来哒哒响的老机器,当年把整个欧洲最顶尖的工程师集体卡了整整50年,没人能摸到破局的门槛。第一个把它造出来的发明家, ... 机械之最10-07
相关文章
- 从系统代谢、物理约束与长时段历史重审能源转型
- 母亲有块苞谷地(大地风华)
- 未来10年最稳的六个方向:机器抢不走,国家又缺人
- 致敬坚守岗位的劳动者
- 从传统特产纪念品到流动名片——城市礼物,延续城市热度
- 缝纫机是人类机械史上最成功的骗局,不骗人的那种
- 半月不到,果断从华为Mate80换回荣耀Magic6!还是老机器比较顺手
- 母亲有块苞谷地
- 走近大国重器 感受硬核实力
- 王光美揭秘:为何刘少奇当选国家主席却没笑容?
- 驾校教练用“跑马机”伪造学时被拘留【三分钟新闻早知道】
- 走近大国重器,感受硬核实力
- 当中国机器狗进入哈萨克斯坦工地:托卡耶夫平衡术下的中美“错位竞争”
- AlphaGo核心作者:十年了,LLM还没学到那场棋局神之一手的精华
- 7000元预算轻薄本推荐:四款高配高分OLED轻薄旗舰推荐榜单
- 走近大国重器感受硬核实力(文化中国行·人文观察)
- 战争机器前传2天后上线:Game Pass白嫖,马库斯回归
- 我想了解鼓风机怎么样才能判断罗茨风机运行是否稳定
- 【能源观察家】从太阳能量到电气文明:能源革命重塑人类文明形态及其对中国式现代化的战略启示
- 哈尔滨双友机械制造厂农机设计合理,用户力荐
热门阅读
-
天下第一暗器暴雨梨花针,传说中的唐门暗器做出来了 07-13
-
汽车投诉排行榜前十名汽车 问题最多的就是这些车 07-13
-
世界上最牛挖掘机,甚至可以挖穿一座城市 11-05
-
世界最大核潜艇制造厂,产量远超中美法 11-20
