新芽专题介绍(21):具身智能
一、专题介绍
1.1 研究背景与统一定义
定义:**具身智能(Embodied AI)**指的是将人工智能集成到物理实体中,使其能够感知、学习并与环境互动 。
具身智能的研究源于对传统符号主义人工智能的反思。早期人工智能强调符号推理与规则处理,但在复杂、动态、开放环境中暴露出适应性不足、依赖先验知识强、难以实现真实感知等问题。研究者因此认识到,脱离身体与环境的“纯计算智能”难以形成真正接近生命体的智能。
认知科学中的具身认知理论指出,人的认知与身体结构、感知经验和行动过程密切相关,身体不仅是执行工具,也是智能形成的重要基础。另一方面,机器人在真实世界中面临环境不确定、任务多变、感知噪声大等挑战,传统“先建模、再规划、后执行”的方法已难以满足需求。
近年来,随着深度学习、强化学习、大模型和多模态技术的发展,具身智能快速兴起,成为连接感知智能与行动智能的重要方向,也被视为通向更高水平通用人工智能的关键路径。
1.2 研究意义
- 缓解数据匮乏与跨模态瓶颈
真实世界数据采集成本高,具身智能通过自监督学习、多模态模型和数据共享提升技能获取效率,降低开发门槛。
- 提升跨形态通用性
传统机器人常是一机一程,而具身智能强调通用基础模型,希望实现同一套智能适配不同硬件形态。
- 增强安全性与鲁棒性
具身智能关注机器人在真实物理环境中的自适应、避障与稳定交互能力,以保障复杂场景下的安全运行。
- 推动虚实迁移与闭环进化
通过Sim-to-Real技术,可在仿真中低成本迭代训练,再迁移到现实环境中验证和优化系统性能。
1.3 当前主要挑战
感知与语义鸿沟:多模态传感器存在噪声、标注误差与模态异构,智能体难以从原始数据中形成支撑操作决策的语义理解。
感知-行动闭环的实时性:动态环境要求毫秒级完成感知-规划-执行闭环,而大模型推理延迟与机器人控制频率之间存在显著的时序不匹配。
Sim-to-Real迁移失效:仿真环境在接触力学、材质形变等物理保真度上与真实世界差距显著,导致习得策略迁移至真实场景时性能大幅衰退。
长程任务规划能力不足:面对指令模糊、子任务依赖复杂的开放场景,智能体需具备常识推理与多步因果推断能力,远超当前模型的规划深度上限。
具身数据获取成本高昂:带物理交互标注的真实操作数据采集成本高、规模化难,远不及语言或视觉数据丰富,严重制约模型训练与泛化。
安全性与鲁棒性的双重约束:人机共存环境中须同时保证物理安全与决策鲁棒性,二者之间存在内在权衡,现有方法尚难兼顾。
二、基础-文献综述与具身智能基础
2.1 基础教材与学习材料
入门综述:
2.2 机器人学与系统构建
理解机器人系统的组成,包括感知、决策、执行等模块。
Introduction to Robot Learning
- CMU Robotics官方视频账号:https://www.youtube.com/@cmurobotics
2.3 深度学习基础
三.初级学习路径-决策算法与仿真平台
3.1 算法与决策
强化学习:
模仿学习:
3.2 仿真平台
AI Habitat
AI2-THOR
AirSim
CHALET
Isaac Sim
Isaac Gym
Gazebo
PyBullet
Webots
MuJoCo
Matterport 3D
MORSE
RoboTHOR
SAPIEN
SofyGym
Virtual Home
iGibson
V-REP (CoppeliaSim)
Unity ML-Agents
TDW
Virtual Home
VRKitchen
SonoGym:High Performance Simulation for Challenging Surgical Tasks with Robotic Ultrasound
学习资源:
Building and Working in Environments for Embodied AI
四.进阶学习路径--前沿文献与开源项目实践
4.1前沿文献
最新综述
Embodied Robot Manipulation in the Era of Foundation Models: Planning and Learning Perspectives** **基础模型时代下的具身机器人操作综述:规划与学习视角
An Anatomy of Vision-Language-Action Models: From Modules to Milestones and Challenges视觉语言动作VLA模型综述:从模块到里程碑和挑战
What Is The Best 3D Scene Representation for Robotics? From Geometric to Foundation Models机器人领域中最优的3D场景表示是什么?从几何表示到基础模型
The Reality Gap in Robotics: Challenges, Solutions, and Best Practices机器人技术的现实差距:挑战、解决方案和最佳实践
文献
任务规划与通用具身智能
PaLM-E:An Embodied Multimodal Language Model 【被引 **3100 **次】
RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control 【被引 2962 次】
Voyager: An Open-Ended Embodied Agent with Large Language Models 【被引 1914 次】
Recurrent Reasoning with Vision-Language Models for Estimating Long-Horizon Embodied Task Progress【CVPR 2026】
视觉导航与环境交互
Learning to Navigate in Complex Environments 【被引 1166 次】
Object Goal Navigation using Goal-Oriented Semantic Exploration 【NeurlPS 2020,被引 **823 **次】
Habitat: A Platform for Embodied AI Research 【ICCV 2019,被引 2211 次】
CoT-VLA: Visual Chain-of-Thought Reasoning for Vision-Language-Action Models 【CVPR 2025,被引 **305 **次】
交互操作与机器人学习
Transporter Networks: Rearranging the Visual World for Robotic Manipulation 【被引 658 次】
Perceiver-Actor: A Multi-Task Transformer for Robotic Manipulation 【被引 855 次】
CLIPort: What and Where Pathways for Robotic Manipulation 【被引 **1015 **次】
Towards Generalizable Robotic Manipulation in Dynamic Environments【大规模数据集】
Core4d: A 4d human-object-human interaction dataset for collaborative object rearrangement 【CVPR 2025,4D交互数据集】
多模态学习与基础模型
Flamingo: a Visual Language Model for Few-Shot Learning 【NeurlPS 2022,被引 **7667 **次】
BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models 【ICML 2023,被引** 10868 **次】
Segment anything 【ICCV 2023,被引 **19241 **次】
SaPaVe: Towards Active Perception and Manipulation in Vision-Language-Action Models for Robotics 【CVPR 2026】
4.2开源项目
五、结语与期望
跨越“感知→决策→行动”的闭环鸿沟,是具身智能从算法走向真实世界的关键一步。通过本专题,你将系统掌握具身智能基础理论、机器人系统组成、强化/模仿学习方法、仿真平台使用以及VLA与基础模型前沿进展,逐步完成从文献阅读 → 平台实践 → 方法复现 → 小型创新的科研训练链条。期待你在最终汇报中:
1)清晰界定研究问题与任务场景,说明所关注的是导航、操作、任务规划还是通用具身智能;
2)完成扎实的基线复现与实验评测,能够结合仿真平台或开源项目开展验证;
3)提出小而有效的改进思路,例如:更高效的多模态对齐、更稳健的Sim-to-Real迁移、更可靠的长程规划机制、更安全的交互控制策略等,推动具身智能系统向更强泛化、更高鲁棒、更易落地的方向发展。