开源机器人项目GR00T : 让机器人听懂指令并开始干活

发布者:不是知青 2026-8-25 10:08

你对人形机器人说:“把桌上的杯子放进托盘。”它不仅要听懂“杯子”和“托盘”,还要识别位置、规划动作并控制双手。过去这些环节往往由多套系统拼接,NVIDIA 开源的 GR00T N1.7,尝试用一个视觉—语言—动作模型把理解与执行连起来。

项目地址:
https://github.com/NVIDIA/Isaac-GR00T

GR00T N1.7 是一个面向通用机器人,尤其是人形机器人操作任务的开放视觉—语言—动作模型,让机器人能够根据画面和语言指令预测连续动作。

它解决的不是聊天问题,而是“看懂以后怎么动”

大模型可以解释怎样收拾桌面,但机器人真正执行任务时,困难才刚刚开始。摄像头看到的物体在哪里?哪只手先靠近?机械臂应该移动多远?夹爪什么时候闭合?每一步都需要转换成机器人能够执行的连续动作。

传统机器人系统通常把视觉识别、自然语言理解、任务规划和运动控制拆成不同模块。这样的方案可控,但每增加一种物品、任务或机器人形态,都可能需要重新设计接口和规则。GR00T 采用视觉—语言—动作模型,也就是 VLA:把图像、语言、机器人状态放入同一个模型,再输出后续动作序列。

这并不意味着机器人突然拥有了人的常识,而是让“看见什么、接到什么任务、下一步怎样行动”可以在统一模型中学习。官方将 N1.7 定位为跨机器人形态模型,可通过后训练适配具体机器人、任务和环境。

模型一边理解场景,一边生成连续动作

GR00T N1.7 的网络大致可以分成两个部分。前半部分是视觉语言基础模型,使用基于 Qwen3-VL 架构的 Cosmos-Reason2-2B,负责理解摄像头画面、语言指令和任务语义。例如,它需要分辨桌上的杯子与托盘,并理解“放进”意味着什么关系。

后半部分是扩散 Transformer 动作头。扩散模型常用于逐步去除噪声生成图片,在这里则被用来生成连续动作。模型不会只回答“向左移动”,而是预测一段随时间变化的动作轨迹,让机械臂、末端执行器或其他控制组件获得可执行信号。

这种组合很像把“理解任务的大脑”和“组织动作的运动系统”接在一起。N1.7 扩展了状态与动作维度,并把动作预测范围从上一代的 16 步增加到 40 步,使模型能够一次规划更长的动作片段。

20K 小时人类视频,帮助机器人学习“怎么做”

N1.7 的一个重点变化,是在预训练中加入约 20K 小时 EgoScale 第一视角人类视频,并与双臂、半人形及人形机器人示范数据共同训练。

人类视频没有机器人的标准关节角和控制指令,为什么仍然有价值?关键在于 N1.7 使用相对末端执行器动作空间。末端执行器可以理解为机械臂最前端的手、夹爪或工具。模型关注的是它相对当前位置应该移动多少,而不是死记某个机器人坐标系里的绝对位置。

当人手与机器人夹爪都被描述成“从当前位置向目标移动一段距离”,模型就更容易把人类示范中的操作经验迁移给机器人。这是 GR00T 追求跨机器人形态泛化的重要基础,但迁移效果仍取决于机器人结构、视角、数据质量和后续微调。

从采集示范到真实部署,它给出了完整工作流

GR00T 不只是发布一个模型权重,也提供了从数据准备到部署的参考代码。

1. 准备数据。 采集视频、机器人状态和动作示范,再转换为 GR00T 使用的 LeRobot 数据格式,并通过 modality.json 描述摄像头、状态和动作字段。

2. 运行推理。 可使用基础模型在预训练支持的机器人形态上测试,也能加载已经针对 DROID、LIBERO、SimplerEnv 等数据微调的检查点。

3. 微调模型。 团队可以使用自己的机器人示范数据,通过 launch_finetune.py 适配新机器人或新任务,并配置对应的状态、动作与视频模态。

4. 评估效果。 先进行开环评估,对比预测动作与数据集中的真实动作;随后进入仿真环境或真实硬件执行闭环测试。

5. 连接机器人。 Policy API 采用服务端与客户端结构,GPU 服务器负责模型推理,机器人端发送观测并接收动作;部署时还可使用 ONNX 或 TensorRT 加速。

官方推荐克隆仓库时同时拉取子模块,并提前安装 Git LFS:

git clone --recurse-submodules https://github.com/NVIDIA/Isaac-GR00T

真正的人形机器人亮点,是语言与全身控制开始接轨

对于人形机器人,仅让双手抓取物体还不够。机器人可能需要先迈步靠近桌面,再保持身体平衡,同时协调手臂、手掌和腿部完成操作。

GR00T N1.7 可以与开源的 GR00T Whole-Body Control 项目配合。以 Unitree G1 的 GEAR-SONIC 流程为例,VLA 模型先根据语言和视觉信息预测紧凑的动作表示,再由学习型全身控制器解码成腿、手臂和手部的关节命令。这样,任务理解与全身运动可以进入一条端到端流程。

但必须注意,GR00T 本身不是可以直接驱动任何人形机器人的万能控制器。不同硬件仍需要对应的机器人形态标签、模态配置、全身控制器、标定和安全限制。模型负责提供高层动作策略,底层控制系统仍要保证平衡、碰撞防护和实时执行。

它比固定动作更灵活,但还远没有“拿来就用”

传统工业机器人擅长在固定工位重复准确动作,却很难理解开放式语言或适应环境变化。GR00T 的价值,是让机器人有机会从多种数据中学习较通用的操作规律,再针对具体任务微调,而不必为每一句指令手写完整流程。

相应地,它的输出具有机器学习模型常见的不确定性。同一句指令换一个视角、光照或物体位置,动作表现都可能变化。基础模型的零样本能力也只适用于支持的预训练机器人形态,换成新硬件通常仍需准备示范数据、定义模态并进行微调。

因此,GR00T 更像一套研究和工程基础设施,而不是装进机器人后就能包揽家务的成品软件。它提供的是可扩展起点,而不是对现实环境成功率的承诺。

想把它跑起来,设备和权限门槛并不低

官方给出的推理要求是至少一张拥有 16GB 显存的 GPU;微调则建议使用一张或多张 40GB 以上显存的 GPU。默认桌面显卡环境以 Python 3.12 和 CUDA 12.8 为主,Jetson、DGX Spark 等平台有各自的安装脚本和版本组合。

基础模型约 3B 参数,首次运行还会下载模型文件。它依赖的 Cosmos-Reason2-2B 属于 Hugging Face 受限访问模型,使用者需要先申请权限并登录,否则会遇到权限错误。视频数据处理还涉及 FFmpeg、TorchCodec、Git LFS 等依赖,版本不匹配也可能导致安装失败。

许可证同样需要区分:仓库代码采用 Apache 2.0,而模型权重受 NVIDIA Open Model License 管理。计划商业使用时,应分别核对代码、模型权重、训练数据以及具体机器人硬件的授权条件。

哪些团队最值得关注

GR00T 更适合具身智能研究团队、人形机器人厂商、机器人算法工程师,以及正在研究 VLA、模仿学习、跨机器人迁移或全身控制的实验室。已有机器人硬件、示范数据和 GPU 资源的团队,可以把它作为建立通用策略模型的参考底座。

如果只是想快速体验聊天机器人,或者团队没有仿真环境、机器人数据和控制接口,GR00T 的投入会明显过重。真实机器人还必须配备急停、速度限制、工作空间约束和人工监护,不能因为模型开源就跳过安全验证。

这三个趋势,比“机器人会干活”更值得看

1. VLA 正在成为机器人通用能力的新接口。 图像、语言、状态和动作进入统一模型后,团队可以围绕同一套策略适配不同任务,而不必为每句指令重新编排全部模块。

2. 人类视频与机器人示范开始共同训练。 人类视频规模更大,机器人数据更接近真实控制;两者结合,有机会降低机器人学习新操作的成本。

3. 竞争重点正从单个模型转向完整技术栈。 数据采集、微调、仿真评估、全身控制、安全约束和部署工具缺一不可,只有演示视频还远远不够。

GR00T N1.7 真正值得关注的地方,不是它已经让人形机器人像人一样工作,而是它把这些环节逐渐接进同一套开放技术栈。人形机器人要进入真实环境,最终比拼的可能不只是硬件关节数量,而是谁能更快积累高质量数据,并把模型输出稳定地变成安全动作。

如果一台人形机器人可以听懂你的自然语言指令,你最希望它先学会整理房间、搬运物品,还是进入工厂完成重复作业?

大家都在看

  • “中国力量”在哥伦比亚主要灾区全覆盖引发当地热烈反响,哥民众“刷屏”感谢中方援助物资

    “中国力量”在哥伦比亚主要灾区全覆盖引发当地热烈反响,哥民众“刷屏”感谢中方援助物资 【环球时报报道 记者 唐亚】据中国地震台网正式测定,当地时间10日上午,哥伦比亚西北部发生里氏7.5级强震,全国有32个城市严重受灾。据中国驻哥伦比亚大使馆消息,当地时间18日中午,中国政府向哥伦比亚提供的紧急 ... 机械之最08-24

  • 我们到底需要什么样的机器人?

    我们到底需要什么样的机器人? 【科技观察】2026世界机器人大会8月19日至23日在北京举行。人形机器人跑步、格斗、跳舞、叠衣服……可谓一个比一个亮眼。大会发布的数据显示,今年上半年,中国人形机器人出货量已超过4万台,全球占比达97%。不过, ... 机械之最08-24

  • 谷歌TPU之父,被Anthropic连夜挖走了

    谷歌TPU之父,被Anthropic连夜挖走了 谷歌TPU之父,跳槽Anthropic了?今天一大早,AI圈被这个消息刷屏了。外媒曝出猛料:Anthropic成功挖角前谷歌高管、大名鼎鼎的「TPU之父」Amir Salek!看来,Anthropic要自己造芯片了。此前,Anthropic就从OpenAI那里 ... 机械之最08-24

  • 青绿山水:墨色交融 富丽清雅

    青绿山水:墨色交融 富丽清雅 【艺点·当代绘画材料与技法创新】作者:刘旭(北京画院专职画家、国家一级美术师)在中国山水画千年发展谱系中,青绿山水是辨识度较高、技法独特、受众颇为喜爱的门类。与追求纯水墨意趣的山水不同,青绿山水依托天 ... 机械之最08-24

  • 1978 Honda CBX1000:横扫千军的“六缸猛兽”,日本超跑的封神之作

    1978 Honda CBX1000:横扫千军的“六缸猛兽”,日本超跑的封神之作 在1978年的摩托车江湖,本田扔下了一颗震撼弹——CBX1000。这台搭载1047cc直列六缸DOHC 24气门发动机的超级运动摩托车,以103匹马力(9000转爆发)和220km/h+的极速,成为了那个时代日系性能车的天花板。六根标志性 ... 机械之最08-24

  • 刷新多项世界纪录!这一大国重器,有望合成中国人自己的新元素

    刷新多项世界纪录!这一大国重器,有望合成中国人自己的新元素 ◎ 科技日报记者 叶青 在广东惠州稔平半岛,几座红色建筑拔地而起,其中两座尤为引人瞩目:一个形如圆角三角形,一个好似巨型操场跑道。地下13米深处,还藏着一条两公里长的隧道。这里安放着的,正是国家重大科技基 ... 机械之最08-24

  • “全球97%出货量,来自中国”!

    “全球97%出货量,来自中国”! 8月19日至23日2026世界机器人大会在北京亦庄举行大会以“人机共生,产需共融”为主题373家国内外知名企业及3000件创新产品参展311款新品亮相大会期间发布的权威行业报告显示2026年上半年中国交付的人形机器人出货量 ... 机械之最08-24

  • 00后清华博士生创业“神经接口”:把人类肌肉反应炼成Token

    00后清华博士生创业“神经接口”:把人类肌肉反应炼成Token 具身智能数采,又多了一条新路线。正式介绍之前我们来做个小互动:抛开AI、不查资料,5秒内能说出现有的具身数据采集方式有哪些?真机遥操作采集、无本体便携采集(UMI/Ego)、仿真合成数据、互联网视频蒸馏是最主流 ... 机械之最08-24

  • 机器人,开干!

    机器人,开干! “与其唱歌跳舞,不如干活儿。”这句话几乎成了今年世界机器人大会的“题眼”。展馆里,少了几分往年“看机器人跳舞”的喧闹,多了些“看机器人干活”的踏实。373家企业、3000余件展品、300余件首发新品——数字背后 ... 机械之最08-23

  • 和同事闲聊暴露!我新买14T硬盘,已经存满快10T资源

    和同事闲聊暴露!我新买14T硬盘,已经存满快10T资源 前几天上班午休,和同事闲聊存储设备,随口说了自己刚入手一块14T大容量机械硬盘,专门用来存放影音资源,没想到短短一段时间,已经塞进去将近10TB的数据。同事听完都很惊讶,14T看着体量巨大,实际填满的速度远比想 ... 机械之最08-23

相关文章