Embodied AI Lab

具身智能专栏

按话题精选外链文章与项目页——从 Physical AI / VLA 全景,到世界模型、数据栈、模仿学习、人形平台与端侧部署。 共 7 个话题 · 24 篇。

端侧硬件更深清单(Jetson / Hailo / RK3588 / 高通 NPU)

入门与全景

Overview

Physical AI / VLA 是什么、主流模型怎么排、从哪里入门

What Is Physical AI & VLA Models? [2026 Guide]

2026 实用向导:GR00T、Gemini Robotics On-Device、OpenVLA 该怎么选;讲清 tokenized / diffusion / flow-matching 三条动作头路线

UDHY
导读

5 Robotics AI Models Changing the Field

RT-2 → OpenVLA → GR00T → LeRobot → π0,用叙事串起开源与通用操控的关键跃迁

Drift
导读

VLA Models Compared: RT-2, OpenVLA, Pi0, SmolVLA… (2025)

参数量、开源与否、推理 Hz、动作表示一张表比完;适合选型与读论文前扫盲

SVRC
对比

VLA 与机器人基础模型

VLA & Foundation Models

从 RT-2 到 OpenVLA / π0 / GR00T:看、听指令、直接出动作

Foundation Models for Robot Manipulation

RT-2 / OpenVLA / Octo / π0 能力边界与微调成本;开源研究 vs 商业 API 怎么取舍

SVRC
综述

Open X-Embodiment:跨本体数据集与 RT-X

22 种机器人、100 万+ 轨迹、跨实验室统一格式;「一个策略管多种身体」的数据地基

Google DeepMind
项目

GR00T N1:人形通用基础模型(论文)

System 2(VLM 理解)+ System 1(扩散动作)双系统;真机 + 人体视频 + 合成数据混合预训练

arXiv
论文

Develop Humanoid Policies End-to-End with Isaac GR00T

从遥操作采集 → 后训练 → 真机部署的工程全链路;GR00T 1.7 Apache 2.0 可商用

NVIDIA Blog
工程

世界模型与 Physical AI

World Models

用世界模型做推理、仿真与合成数据,再接到策略学习

Cosmos 3:面向 Physical AI 的开放 Omni 世界模型

理解 / 生成 / 正逆动力学 / 机器人策略同一套 omnimodal backbone;Physical AI 的「世界层」

NVIDIA Cosmos Lab
项目

Welcome NVIDIA Cosmos 3(Hugging Face)

Nano 16B / Super 64B 怎么选;MoT 架构如何把 Reason + Generate 合成一次前向

Hugging Face
导读

NVIDIA Launches Cosmos 3(新闻稿)

官方叙事:合成数据与评测周期从月压到天;机器人 / 智驾 / 空间智能共用底座

NVIDIA Newsroom
产业

数据与开源学习栈

Data & OSS Stack

没有数据就没有具身:OXE、LeRobot、可复现训练管线

LeRobot v0.4.0:开源机器人学习加速

Dataset v3.0 流式读 OXE 级数据;PI0.5 / GR00T N1.5、LIBERO、多卡训练与课程一锅端

Hugging Face Blog
工程

Hugging Face LeRobot(仓库)

ACT / Diffusion / VLA / World Model 统一 PyTorch 接口;数据集上 Hub、策略也能分享

GitHub
工具

Open X-Embodiment Datasets(GitHub)

RLDS 统一格式 + Colab 可视化;下游训练「跨本体」策略的标准入口

Google DeepMind
数据

模仿学习与灵巧操控

Imitation & Dexterity

ACT、Diffusion Policy、触觉闭环:从示教到接触丰富任务

ALOHA + ACT:低成本双臂精细操控

Action Chunking 压短有效视野;50 条左右 demo 就能拧瓶盖、插电池——模仿学习入门必读

Stanford / Tony Zhao
经典

Diffusion Policy:动作扩散做 visuomotor 策略

多峰动作分布、高维动作空间、训练更稳;几乎所有现代 VLA 动作头的「前传」

Columbia
经典

Dexterous & Embodied Robotic Manipulation Survey

从示教/规划到「感知-决策-执行」闭环;视觉 + 力/触觉多模态为何是灵巧操控关键

arXiv
综述

Embodied Robot Manipulation in the Era of Foundation Models

高层规划(语言/代码/affordances)+ 底层策略学习统一抽象;读 VLA 时代操控论文的地图

arXiv
综述

Reactive Diffusion Policy:视触慢快双系统

慢扩散规划 + 快触觉反应;接触丰富任务相对纯视觉 IL 显著提升,补上 action chunk 开环盲区

arXiv
论文

人形机器人与端到端平台

Humanoid & Platforms

仿真到真机、GR00T 工作流、通用人形技能学习

Isaac GR00T 开发者主页

开源数据管线 + 基础模型 + Isaac Sim/Lab + Jetson Thor;人形 Physical AI 参考平台

NVIDIA
平台

Isaac GR00T:VLA 与 SO-101 Sim-to-Real 课程章节

用仿真 demo 后训练 GR00T,再落到真机;讲清 VLA、action chunk、post-training 节奏

NVIDIA Learning
课程

Isaac GR00T N1.6 Explained

CES 2026 语境下的 N1.6:多模态输入到全身协调动作,适合快速了解产品定位

C# Corner
导读

端侧与边缘部署

Edge Deployment

机器人大脑要上板:Jetson / NPU / 边缘 runtime

The Edge LLM Runtime Stack 2026

按板卡选 runtime:Thor→TensorRT Edge-LLM,手机→LiteRT/ExecuTorch,SBC→llama.cpp

Edge AI Stack
选型

TensorRT Edge-LLM on Jetson(实操)

Thor 跑 Cosmos Reason2、Orin Nano 跑 Qwen3;量化→ONNX→板端 engine 全流程

Jetson AI Lab
实操

Edge Inference:ANE / Hexagon / WebGPU / Jetson

核心观点:端侧瓶颈是内存带宽不是 TOPS;四条硬件路径对照

AI Engineering Academy
导读
话题规划(持续扩容)
后续可补:触觉/力控硬件、Sim2Real 技巧、具身评测基准(LIBERO / CALVIN / RoboCasa)、中国人形与工业落地案例。