Robotics Knowledge Base

机器人模型架构知识库 —— 按主题分类,共 23 篇文档。

知识导图

从感知与学习目标出发,经过 VLA / WAM 产生动作,再连接全身控制与生产数据闭环。点击主要节点可进入代表文档。

知识领域覆盖

六边形中的数字是涉及该领域的文档数,颜色深浅表示相对覆盖量。标签可重叠;点击六边形可筛选下方文档。

当前显示全部文档;一篇文档可以覆盖多个领域。

方法年月 · 卡片标注所述方法 / 版本的首次公开年月,并区分论文、模型、代码、项目和文章;不是本文修改时间。点击「来源」可核对。日期较新不等于效果更好。

VLA 模型17

视觉-语言-动作 (Vision-Language-Action) 模型架构

Pi0

模型首发来源 ↗

Pi0 是 Physical Intelligence 提出的视觉-语言-动作 (VLA) 模型,采用 PaliGemma (SigLIP + Gemma 2B) 作为视觉语言主干网络,配合独立的 Gemma 300M Action Expert 进行动作生成。其核心创新在于 双流 Transformer 注意力机制——VLM 前缀序列与动作专家后缀序列共享同一组 Transformer 层,通过...

Pi0.5

模型首发来源 ↗

Pi0.5 (Physical Intelligence 0.5) 是 Physical Intelligence 推出的视觉-语言-动作 (VLA) 模型,在架构上与 Pi0 几乎完全相同,均采用 PaliGemma 视觉语言模型作为感知主干、Gemma 300M 作为动作专家 (Action Expert),通过双流 Transformer 实现视觉语言特征与动作特征的联合处理,并使用 Flo...

Pi0-FAST

方法首发来源 ↗

Pi0-FAST (Fast Action Sequence Tokenizer) 是 Physical Intelligence 提出的一种高效视觉-语言-动作 (VLA) 模型。与 Pi0 使用 Flow Matching 扩散生成连续动作不同,Pi0-FAST 将连续动作离散化为 token,然后通过 PaliGemma 视觉语言模型进行 自回归 next-token 预测。这种设计避免了多...

π*₀.₆ (Pi-Star-0.6)

论文首发来源 ↗

π*₀.₆ 是 Physical Intelligence 2025 年 11 月发布的 VLA(arXiv:2511.14759),核心不是新的网络主干,而是一种让 VLA 通过真实世界部署反复改进的训练方法 —— RECAP(RL with Experience and Corrections via Advantage-conditioned Policies)。论文报告:在折叠衣物、纸箱装...

π₀.₇ (Pi-0.7)

论文首发来源 ↗

π₀.₇ 是 Physical Intelligence 2026 年 4 月发布的 VLA(arXiv:2604.15483),定位为 "steerable generalist robotic foundation model"。它最大的卖点不在新主干,而是在 prompt 里塞进了多模态 context conditioning:除了语言指令,还给模型喂 episode metadata(速...

Isaac-GR00T N1.7

版本公布来源 ↗

Isaac GR00T N1.7 是 NVIDIA 2026 年发布的通用人形机器人 VLA 基座模型(3B 级,Apache 2.0)。相对 N1.6,它把 VLM 主干从自研 Eagle 换成 Cosmos-Reason2-2B(Qwen3-VL 架构),把 DiT 从 32 层减半到 16 层,把状态/动作维度上限从 29 扩到 132、动作 horizon 从 16 扩到 40,并统一改用...

Isaac-GR00T N1.6

版本公布来源 ↗

N1.6 首次公布;不以之后的代码更新计时。

Isaac GR00T N1.6 是 NVIDIA 提出的视觉-语言-动作 (VLA) 通用人形机器人基座模型,3B 参数级。其架构由两部分串联:上游 Eagle Vision-Language Backbone(基于 NVIDIA Cosmos-Reason-2B VLM 变体)将图像 + 语言编码成统一的多模态特征序列;下游 Action Head 使用 32 层 AlternateVLDiT...

Isaac-GR00T N1.5

版本公布来源 ↗

2025.05 公布;技术详解于 2025.06 发布。

Isaac GR00T N1.5 是 NVIDIA 发布的首个公开 VLA 基座模型(3B 参数)。架构由两段组成:Eagle 2 VLM Backbone(冻结)→ 4 层 transformer adapter → 16 层 DiT + Flow Matching 出动作 chunk。多 embodiment 支持通过 CategorySpecificMLP 实现,最多 32 种形态。N1.5...

ACT

论文首发来源 ↗

ACT (Action Chunking Transformer) 是一种基于 Transformer 编码器-解码器结构的机器人操作策略模型,出自论文 Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (Zhao et al., 2023)。其核心思想是 动作分块 (Action Chunking):模型一次性预...

SmolVLA

论文首发来源 ↗

SmolVLA (Small Vision-Language-Action) 是由 Hugging Face 设计的轻量级视觉-语言-动作 (VLA) 模型,采用 SmolVLM2-500M-Video-Instruct 作为视觉语言主干网络,并引入独立的 Action Expert 网络通过交叉注意力机制从 VLM 中提取特征来生成机器人动作。SmolVLA 使用 Flow Matching(与...

WALL-OSS / WALL-X

模型首发来源 ↗

初代 WALL-OSS;不是 2026.05 的 WALL-OSS-0.5。

WALL-OSS (WALL-X) 是一个跨具身的 视觉-语言-动作 (VLA) 模型,以 Qwen2.5-VL + 混合专家 (MoE) 作为视觉语言骨干网络,结合 Flow Matching 动作头 进行机器人连续动作预测。与 GR00T N1.5 等模型不同,WALL-X 采用当前最强的 VLM (Qwen2.5-VL) 作为骨干,通过 3D RoPE 位置编码对图像/视频的时空维度建模,并...

X-VLA

论文首发来源 ↗

X-VLA (Extended Vision-Language-Action) 是一个基于扩散的跨具身视觉-语言-动作模型,将 Florence2 视觉语言模型作为感知主干网络,配合软提示 Transformer (SoftPromptedTransformer) 动作头进行机器人动作预测。其核心设计思路为:Florence2 的 Vision Tower 和 BART 编码器提取多模态特征(移除...

Psi0 (ψ₀)

论文首发来源 ↗

Ψ₀ 是 USC PSI Lab 面向人形机器人全身 loco-manipulation 的开源基础模型(RSS 2026,arXiv:2603.12263,CVPR 2026 第二届 3D-LLM/VLA Workshop 最佳论文)。它的核心主张不是某个新模块,而是一条数据配方:"scaling the right data in the right way" —— 先用大规模人类第一视角视频...

Helix

模型首发来源 ↗

初代 Helix;不使用后续 Helix 02 的日期。

Helix 是 Figure 于 2025 年 2 月发布的通用人形机器人视觉-语言-动作模型(Vision-Language-Action, VLA)。它面向 Figure 02 的全上半身灵巧操作,把互联网预训练视觉语言模型的语义泛化能力,与 200 Hz 反应式视觉运动策略组合成一套端到端系统。Figure 展示的能力包括自然语言指定新任务、抓取训练中未出现的物体、双机器人协作,以及在嵌入式...

Skild S1

模型首发来源 ↗

Skild S1 是一个以示范视频作为任务提示的机器人基础模型:用户不必为每个新任务重新采集数百条轨迹并微调权重,而是把一段人类或机器人示范放进上下文,模型在推理时理解任务意图、场景对应关系与执行进度,再将它翻译成当前机器人身体上的动作。它关注的不是普通 VLA 的“用语言选择已学技能”,而是机器人能否从一次演示中执行训练时未见的新技能和最长约十分钟的任务组合。

DreamZero

论文首发来源 ↗

DreamZero 是一个世界动作模型 (World Action Model, WAM),通过联合预测未来视频帧与机器人动作序列,实现对未见任务的零样本泛化。其核心创新在于:基于 Wan2.1 视频扩散模型构建 Causal WAN DiT,以 Flow Matching 框架在视频 latent 空间和动作空间上同步去噪,配合 Category-specific MLP 构成的本体接口(sta...

Fast-WAM

论文首发来源 ↗

Fast-WAM 是一个世界动作模型 (World Action Model, WAM),论文标题本身就是它要回答的问题:"Do World Action Models Need Test-time Future Imagination?"(arXiv:2603.16666)。结论是不需要 —— 现有 WAM(如 DreamZero、IDM 类方法)在推理时要先把未来视频去噪生成出来,再从中读出动...

全身控制 (WBC)4

人形机器人全身控制与运动生成

总览 · 从这里开始

GR00T-WBC 总览

项目首发来源 ↗

多方法总览;各子方法的年月分别标注。

GR00T-WholeBodyControl 是 NVIDIA GEAR 团队的人形机器人全身控制代码库,目标平台是 Unitree G1(29 DoF,带灵巧手时 43 DoF)。它不是一个单一模型,而是三条并列的技术路线外加一套共享的部署/遥操作基础设施:

细分

Decoupled WBC

代码首发来源 ↗

按独立控制器的公开代码发布计时。

Decoupled WBC 是 GR00T-WholeBodyControl 里最保守也最好调试的一条全身控制路线:它不训练一个端到端的全身策略,而是把机器人从腰部劈成两半 —— 下半身交给强化学习(ONNX 策略,50 Hz 闭环),上半身交给逆运动学(QP-IK + 插值,开环跟随遥操作目标)。

细分

GEAR-SONIC

论文首发来源 ↗

2026.02 开源推理;2026.04 开源训练。

GEAR-SONIC 要解决的是一个很具体的接口问题:人类动捕、VR 遥操作、机器人参考轨迹这三种运动来源,格式完全不同,能不能压进同一个空间,让同一个控制器都能跟踪?

细分

MotionBricks

方法预览来源 ↗

MotionBricks(arXiv:2604.24833,Tingwu Wang 等,2026)是 GR00T-WholeBodyControl 里的运动生成层 —— 它不控制机器人,它生产机器人要跟踪的运动。给定几帧上下文和一个方向/风格指令,它在毫秒级内合成一段物理合理的 G1 全身运动,吞吐达到 15,000 FPS 的零样本合成速度。

3D 视觉与 VLM1

空间理解、深度、位姿与视觉语言模型

VLM³

论文首发来源 ↗

VLM³ 的论点非常直接,也非常反直觉:

部署、评估与运维1

机器人从模型演示到规模化生产的数据、评估与可靠性系统

Dyna 部署飞轮

文章发布来源 ↗

生产系统文章的年月,不是公司或模型首次发布。

Dyna 的规模化部署方法不是单独的机器人模型,而是一套把 Dyna-2 世界动作模型、客户 SOP、全天候 episode 记录、自动语义标注、硬件退化监测与训练数据筛选 连成闭环的生产系统。它的核心不是“收集更多数据”,而是让每次部署都产生可查询、可回放、可归因、可重用的经验,再用这些经验同时改进模型、工具和整个机器人舰队。