开源机器人项目GR00T : 让机器人听懂指令并开始干活

你对人形机器人说:“把桌上的杯子放进托盘。”它不仅要听懂“杯子”和“托盘”,还要识别位置、规划动作并控制双手。过去这些环节往往由多套系统拼接,NVIDIA 开源的 GR00T N1.7,尝试用一个视觉—语言—动作模型把理解与执行连起来。
项目地址:
https://github.com/NVIDIA/Isaac-GR00T
GR00T N1.7 是一个面向通用机器人,尤其是人形机器人操作任务的开放视觉—语言—动作模型,让机器人能够根据画面和语言指令预测连续动作。
它解决的不是聊天问题,而是“看懂以后怎么动”
大模型可以解释怎样收拾桌面,但机器人真正执行任务时,困难才刚刚开始。摄像头看到的物体在哪里?哪只手先靠近?机械臂应该移动多远?夹爪什么时候闭合?每一步都需要转换成机器人能够执行的连续动作。
传统机器人系统通常把视觉识别、自然语言理解、任务规划和运动控制拆成不同模块。这样的方案可控,但每增加一种物品、任务或机器人形态,都可能需要重新设计接口和规则。GR00T 采用视觉—语言—动作模型,也就是 VLA:把图像、语言、机器人状态放入同一个模型,再输出后续动作序列。
这并不意味着机器人突然拥有了人的常识,而是让“看见什么、接到什么任务、下一步怎样行动”可以在统一模型中学习。官方将 N1.7 定位为跨机器人形态模型,可通过后训练适配具体机器人、任务和环境。
模型一边理解场景,一边生成连续动作
GR00T N1.7 的网络大致可以分成两个部分。前半部分是视觉语言基础模型,使用基于 Qwen3-VL 架构的 Cosmos-Reason2-2B,负责理解摄像头画面、语言指令和任务语义。例如,它需要分辨桌上的杯子与托盘,并理解“放进”意味着什么关系。
后半部分是扩散 Transformer 动作头。扩散模型常用于逐步去除噪声生成图片,在这里则被用来生成连续动作。模型不会只回答“向左移动”,而是预测一段随时间变化的动作轨迹,让机械臂、末端执行器或其他控制组件获得可执行信号。
这种组合很像把“理解任务的大脑”和“组织动作的运动系统”接在一起。N1.7 扩展了状态与动作维度,并把动作预测范围从上一代的 16 步增加到 40 步,使模型能够一次规划更长的动作片段。
20K 小时人类视频,帮助机器人学习“怎么做”
N1.7 的一个重点变化,是在预训练中加入约 20K 小时 EgoScale 第一视角人类视频,并与双臂、半人形及人形机器人示范数据共同训练。
人类视频没有机器人的标准关节角和控制指令,为什么仍然有价值?关键在于 N1.7 使用相对末端执行器动作空间。末端执行器可以理解为机械臂最前端的手、夹爪或工具。模型关注的是它相对当前位置应该移动多少,而不是死记某个机器人坐标系里的绝对位置。
当人手与机器人夹爪都被描述成“从当前位置向目标移动一段距离”,模型就更容易把人类示范中的操作经验迁移给机器人。这是 GR00T 追求跨机器人形态泛化的重要基础,但迁移效果仍取决于机器人结构、视角、数据质量和后续微调。
从采集示范到真实部署,它给出了完整工作流
GR00T 不只是发布一个模型权重,也提供了从数据准备到部署的参考代码。
1. 准备数据。 采集视频、机器人状态和动作示范,再转换为 GR00T 使用的 LeRobot 数据格式,并通过 modality.json 描述摄像头、状态和动作字段。
2. 运行推理。 可使用基础模型在预训练支持的机器人形态上测试,也能加载已经针对 DROID、LIBERO、SimplerEnv 等数据微调的检查点。
3. 微调模型。 团队可以使用自己的机器人示范数据,通过 launch_finetune.py 适配新机器人或新任务,并配置对应的状态、动作与视频模态。
4. 评估效果。 先进行开环评估,对比预测动作与数据集中的真实动作;随后进入仿真环境或真实硬件执行闭环测试。
5. 连接机器人。 Policy API 采用服务端与客户端结构,GPU 服务器负责模型推理,机器人端发送观测并接收动作;部署时还可使用 ONNX 或 TensorRT 加速。
官方推荐克隆仓库时同时拉取子模块,并提前安装 Git LFS:
git clone --recurse-submodules https://github.com/NVIDIA/Isaac-GR00T
真正的人形机器人亮点,是语言与全身控制开始接轨
对于人形机器人,仅让双手抓取物体还不够。机器人可能需要先迈步靠近桌面,再保持身体平衡,同时协调手臂、手掌和腿部完成操作。
GR00T N1.7 可以与开源的 GR00T Whole-Body Control 项目配合。以 Unitree G1 的 GEAR-SONIC 流程为例,VLA 模型先根据语言和视觉信息预测紧凑的动作表示,再由学习型全身控制器解码成腿、手臂和手部的关节命令。这样,任务理解与全身运动可以进入一条端到端流程。
但必须注意,GR00T 本身不是可以直接驱动任何人形机器人的万能控制器。不同硬件仍需要对应的机器人形态标签、模态配置、全身控制器、标定和安全限制。模型负责提供高层动作策略,底层控制系统仍要保证平衡、碰撞防护和实时执行。
它比固定动作更灵活,但还远没有“拿来就用”
传统工业机器人擅长在固定工位重复准确动作,却很难理解开放式语言或适应环境变化。GR00T 的价值,是让机器人有机会从多种数据中学习较通用的操作规律,再针对具体任务微调,而不必为每一句指令手写完整流程。
相应地,它的输出具有机器学习模型常见的不确定性。同一句指令换一个视角、光照或物体位置,动作表现都可能变化。基础模型的零样本能力也只适用于支持的预训练机器人形态,换成新硬件通常仍需准备示范数据、定义模态并进行微调。
因此,GR00T 更像一套研究和工程基础设施,而不是装进机器人后就能包揽家务的成品软件。它提供的是可扩展起点,而不是对现实环境成功率的承诺。
想把它跑起来,设备和权限门槛并不低
官方给出的推理要求是至少一张拥有 16GB 显存的 GPU;微调则建议使用一张或多张 40GB 以上显存的 GPU。默认桌面显卡环境以 Python 3.12 和 CUDA 12.8 为主,Jetson、DGX Spark 等平台有各自的安装脚本和版本组合。
基础模型约 3B 参数,首次运行还会下载模型文件。它依赖的 Cosmos-Reason2-2B 属于 Hugging Face 受限访问模型,使用者需要先申请权限并登录,否则会遇到权限错误。视频数据处理还涉及 FFmpeg、TorchCodec、Git LFS 等依赖,版本不匹配也可能导致安装失败。
许可证同样需要区分:仓库代码采用 Apache 2.0,而模型权重受 NVIDIA Open Model License 管理。计划商业使用时,应分别核对代码、模型权重、训练数据以及具体机器人硬件的授权条件。
哪些团队最值得关注
GR00T 更适合具身智能研究团队、人形机器人厂商、机器人算法工程师,以及正在研究 VLA、模仿学习、跨机器人迁移或全身控制的实验室。已有机器人硬件、示范数据和 GPU 资源的团队,可以把它作为建立通用策略模型的参考底座。
如果只是想快速体验聊天机器人,或者团队没有仿真环境、机器人数据和控制接口,GR00T 的投入会明显过重。真实机器人还必须配备急停、速度限制、工作空间约束和人工监护,不能因为模型开源就跳过安全验证。
这三个趋势,比“机器人会干活”更值得看
1. VLA 正在成为机器人通用能力的新接口。 图像、语言、状态和动作进入统一模型后,团队可以围绕同一套策略适配不同任务,而不必为每句指令重新编排全部模块。
2. 人类视频与机器人示范开始共同训练。 人类视频规模更大,机器人数据更接近真实控制;两者结合,有机会降低机器人学习新操作的成本。
3. 竞争重点正从单个模型转向完整技术栈。 数据采集、微调、仿真评估、全身控制、安全约束和部署工具缺一不可,只有演示视频还远远不够。
GR00T N1.7 真正值得关注的地方,不是它已经让人形机器人像人一样工作,而是它把这些环节逐渐接进同一套开放技术栈。人形机器人要进入真实环境,最终比拼的可能不只是硬件关节数量,而是谁能更快积累高质量数据,并把模型输出稳定地变成安全动作。
如果一台人形机器人可以听懂你的自然语言指令,你最希望它先学会整理房间、搬运物品,还是进入工厂完成重复作业?
大家都在看
-
刚刚,诺贝尔化学奖揭晓,95岁老人破解了生命为何只用「一只手」 就在10月7日,2026年诺贝尔化学奖公布!这届化学奖,颁给了法国巴黎南大学的Henri Kagan和日本东京理科大学的Kenso Soai,以表彰他们在不对称有机合成中发现非线性效应和自催化作用。这两位的发现,解答了一个困扰人 ... 机械之最10-08
-
具身智能冲击IPO:估值盛宴之后狂欢退潮 一名科技记者在今年6月,加入了北京一家估值200亿的具身智能公司,上班第一天从下午2点到晚上10点,除去1小时的晚饭时间,他一直在开会。会议的主题只有一个:筹备IPO。一位市场营销方向的候选人去上海的一家机器人 ... 机械之最10-08
-
新职业亮相,写下产业升级鲜活注脚 江苏常州武进高新区智慧微电网车网互动先导站。光明图片/视觉中国安徽合肥2026世界机器人大会展示的机器人。光明图片/视觉中国贵州黔西某化工企业打造绿色工厂。光明图片/视觉中国中国电科网络通信研究院卫星导航专 ... 机械之最10-08
-
国庆假期丰富游玩体验 多元场景激发消费活力 央视网消息(焦点访谈):今天(10月7日)是国庆假期的最后一天。过去一周,公路铁路车流如织,景区内外人潮涌动。有人奔赴远方,感受别样风情;有人回到家乡,在熟悉的街巷中寻找久违的烟火气;也有人选择留在原地 ... 机械之最10-08
-
2026诺贝尔生理学或医学奖:如何用一束光“操控”大脑? 10月5日,北京时间17时30分,2026年诺贝尔生理学或医学奖在瑞典卡罗林斯卡医学院揭晓,授予卡尔·戴塞罗思(Karl Deisseroth)、彼得·黑格曼(Peter Hegemann)和格奥尔格·内格尔(Georg Nagel),以表彰他们在光 ... 机械之最10-08
-
赖大:贾府这台机器里,最清醒的“寄生虫” 《红楼梦》里写奴才,曹雪芹从不偷懒。焦大是忠到发疯,来旺是坏到露骨,而赖大这个名字,起得本身就带刺——“赖”着贾府这棵大树,“大”起来的奴才。但他又不是普通恶奴,他是整部书里最像现代职业经理人的角色: ... 机械之最10-08
-
北宋一台12米高的机器自己报时,钟表关键零件比欧洲早六百年 说明:本文资料由 AI 协助检索整理,所有史料与数据均标注出处并逐条核对。钟表里控制走时的那个零件叫擒纵机构,很多人以为它是十四世纪欧洲人的发明。可北宋元祐七年(1092年),汴京就立起过一台十二米高的机器: ... 机械之最10-07
-
从系统代谢、物理约束与长时段历史重审能源转型 2026年9月14日至15日,第二十一期中法历史文化国际合作研讨班在上海大学宝山校区文学院成功举办。本届研讨班由上海大学文学院历史学系、中国法国史研究会、法国巴黎人文科学之家基金会联合主办。在气候变化加剧、全 ... 机械之最10-07
-
未来10年最稳的六个方向:机器抢不走,国家又缺人 现在很多年轻人找工作,心里最大的顾虑,就是岗位会不会被人工智能、自动化设备替代。不少办公室基础工作,简单的数据录入、文稿整理,已经可以交给机器完成。大家开始担心,辛辛苦苦学的技能,没过几年就失去市场价 ... 机械之最10-07
-
缝纫机是人类机械史上最成功的骗局,不骗人的那种 人类机械史上最成功的骗局,不是什么庞氏骗局,而是家家户户都见过的缝纫机!你敢信?这台踩起来哒哒响的老机器,当年把整个欧洲最顶尖的工程师集体卡了整整50年,没人能摸到破局的门槛。第一个把它造出来的发明家, ... 机械之最10-07
相关文章
- 从系统代谢、物理约束与长时段历史重审能源转型
- 母亲有块苞谷地(大地风华)
- 未来10年最稳的六个方向:机器抢不走,国家又缺人
- 致敬坚守岗位的劳动者
- 从传统特产纪念品到流动名片——城市礼物,延续城市热度
- 缝纫机是人类机械史上最成功的骗局,不骗人的那种
- 半月不到,果断从华为Mate80换回荣耀Magic6!还是老机器比较顺手
- 母亲有块苞谷地
- 走近大国重器 感受硬核实力
- 王光美揭秘:为何刘少奇当选国家主席却没笑容?
- 驾校教练用“跑马机”伪造学时被拘留【三分钟新闻早知道】
- 走近大国重器,感受硬核实力
- 当中国机器狗进入哈萨克斯坦工地:托卡耶夫平衡术下的中美“错位竞争”
- AlphaGo核心作者:十年了,LLM还没学到那场棋局神之一手的精华
- 7000元预算轻薄本推荐:四款高配高分OLED轻薄旗舰推荐榜单
- 走近大国重器感受硬核实力(文化中国行·人文观察)
- 战争机器前传2天后上线:Game Pass白嫖,马库斯回归
- 我想了解鼓风机怎么样才能判断罗茨风机运行是否稳定
- 【能源观察家】从太阳能量到电气文明:能源革命重塑人类文明形态及其对中国式现代化的战略启示
- 哈尔滨双友机械制造厂农机设计合理,用户力荐
热门阅读
-
天下第一暗器暴雨梨花针,传说中的唐门暗器做出来了 07-13
-
汽车投诉排行榜前十名汽车 问题最多的就是这些车 07-13
-
世界上最牛挖掘机,甚至可以挖穿一座城市 11-05
-
世界最大核潜艇制造厂,产量远超中美法 11-20
