具身智能到底是什么?从“会聊天”到“会干活”,一篇讲明白
从感知与行动,到机器人走进现实

你对 AI 说:“帮我把桌上的杯子拿过来。”
它也许能立刻写出一份条理清晰的操作说明:找到杯子,伸手,握住,抬起,递过来。可如果真给它接上一条机械臂,事情就没那么简单了。
杯子有一半被纸盒挡住,里面可能装着水;把手朝向墙壁,桌边还放着一个碗。机器人必须判断从哪里下手、用多大力、怎样避开障碍。就算已经夹住,杯子也可能在移动时滑落。
从“描述怎样做”,走到“在现实中做成”,正是理解具身智能的一个入口。
这个词听起来很前沿,讨论的问题却很具体:机器怎样借助身体认识环境、完成任务,并在遇到变化时调整自己?要回答它,我们得把目光从聊天框,移到那只普普通通的杯子上。
01|具身智能,为什么强调“身体”?
在机器人语境中,具身智能可以理解为:**智能系统通过身体感知环境、采取行动,再利用行动产生的反馈继续决策。**研究范围还可以涉及模拟环境中的智能体,本文主要讨论实体机器人。
这里的“身体”,并不要求有人的外形。机械臂、轮式移动平台、四足机器人,都能成为与环境交互的载体。关键在于,智能活动与身体能做什么、环境允许做什么联系在一起。
同样是拿杯子,五指手可以尝试握把手,简单夹爪可能更适合夹杯身;机械臂够不到远处的桌角,带轮子的底座则可以先移动。一个合理的方案,必须符合具体机器的能力。
这也解释了为什么“给机器人装上聊天模型”并不等于完成了具身智能。模型说出“把杯子拿起来”,还需要转化成可执行的运动,并由传感器检查结果。软件、传感器、机械结构与控制系统共同决定了任务能否完成。
机器人也不必每次都重新学习。它可能使用已经训练好的模型,根据眼前状态选择动作。**交互时调整行为,与训练时更新模型参数,是两回事。**把两者混为一谈,会误以为机器人每做一次家务都会自动变聪明。
身体、感知与环境交互
02|一只杯子,怎样变成机器的任务?
我们设定一个具体目标:把蓝色杯子放进托盘。要完成这件事,机器人需要持续回答四类问题。
**第一类:现在是什么情况?**摄像头提供图像,深度传感器可以辅助估计距离,关节传感器报告手臂姿态,部分系统还有力觉或触觉信息。机器需要把这些观察转化成对场景和自身状态的估计。
“估计”两个字很重要。看到杯子的轮廓,不意味着知道它有多重;夹爪移动到预定位置,也不意味着已经抓牢。传感器有误差,物体可能被遮挡,因此机器人面对的往往是不完整信息。
**第二类:下一步要做什么?**它需要选择抓取位置,确定接近方向,并考虑托盘是否有足够空间。如果把手贴着墙,继续照着“抓把手”的方案执行,就可能根本没有操作余地。
**第三类:怎样让身体执行?**目标位置还要转化成关节运动或其他控制指令。控制器通过反馈,使实际运动尽量接近期望运动;具体设计取决于硬件和任务。[5]
**第四类:刚才做成了吗?**夹空了就重新定位,发现杯子倾斜就调整,托盘被移走就重新判断放置位置。感知、决策、行动和反馈由此形成循环。
这个过程可以类比骑自行车:人不会先想好整段路上每一秒的车把角度,再闭眼照做,而是不断观察和修正。类比只用于理解反馈,并不意味着机器人拥有与人相同的感受或思维机制。
再把任务稍微改一下:杯子装满了水。目标仍是“放进托盘”,但移动时保持平稳就更重要;如果托盘里已经有物品,还要判断放下后能否稳定支撑。原来一句简短指令,实际上隐含着许多没有被说出来的条件。
这里还能区分两个层次的计划。一个层次关心“先拿杯子还是先清出位置”,另一个层次关心“手臂沿哪条路径移动”。前者顺序合理,不能保证后者不会碰撞;后者动作顺畅,也不能保证最后完成了用户真正想做的事。
因此,任务评价需要看状态的变化:杯子是否已经离开桌面,是否到达托盘,夹爪是否松开,杯子是否稳住。它们并不必然由同一个传感器或同一个模型判断,但需要共同服务于最终目标。
这些例子也说明,行动中的智能经常体现在处理细节上。用户不会为每个细节单独写一条指令,系统却必须识别其中哪些是完成任务的必要条件,哪些地方存在不确定性,以及什么时候应该先确认再动作。

03|为什么真实世界这么难?
写一段文字,主要是在符号之间组织关系;移动一个物体,还必须应对重量、摩擦、形变和碰撞。真实世界不会因为指令表达得漂亮,就放宽物理条件。
**首先,接触会改变局面。**抓草莓时,力度太小可能滑落,太大可能压坏;拉扯衣角,整件衣服的形状都会变化。动作既是在解决问题,也会制造下一时刻的新情况。
在 π₀ 的研究展示中,折衣服、组装纸盒等任务就体现了这种难点:物体可以有许多不同状态,机器人需要观察操作进展并调整策略。[2]这些研究案例说明了问题的性质,不代表任意机器人都能完成同样的任务。
**其次,身体存在硬约束。**关节只能转到一定角度,夹爪有宽度限制,电机有承载能力。一个几何上看似可行的姿势,未必适合实际机器长期稳定地执行。
**再者,环境一直在变化。**杯子会被人挪动,光线会改变,地面可能变滑。机器人必须在有限时间内处理新信息;一份几秒前还正确的计划,现在可能已经不合适。
还有一种更隐蔽的困难:失败可能到最后才显现。比如夹持位置稍偏,刚抬起时没有问题,转弯时才发生滑动。因此,完成动作序列不等于完成任务,系统还需要检查最终结果。
这也是为什么“动作看起来像人”不是充分标准。对于使用者,真正重要的是杯子有没有被稳妥放好,以及出错时系统如何处理。
从左至右:遮挡、接触力度、环境变化
04|大模型带来的变化,究竟在哪里?
过去,机器人系统经常为具体任务设计专门流程。如今,大规模图文预训练让模型有机会利用更广泛的语义知识,理解多样化的指令和场景,再与机器人的行动能力连接起来。
一种思路是分层协作:较高层的模型理解需求、拆分步骤,较低层的技能或控制器负责实际执行。类似“先去桌边,再拿杯子,再送到托盘”,但每个步骤都必须结合机器能否做到来选择。
SayCan 的研究就探索了这种结合:既考虑语言模型判断的任务相关性,也考虑机器人技能在当前情况下成功的可能性。[6]一句听起来合理的建议,如果机器人没有对应技能,也不能直接当成可执行计划。
另一条路线是 VLA,也就是视觉—语言—动作模型。它把看到的画面、收到的语言指令与动作输出联系起来。输出可以经过编码和解码,转化为机器人能够执行的控制目标。
RT-2 将机器人动作表示为模型可学习的序列,并结合机器人轨迹与视觉语言任务进行训练。在其测试中,这种方法改善了对新物体和部分新指令的处理。[3]
但 VLA 并不是唯一架构,也不是“万能大脑”的同义词。不同系统仍要处理动作表示、控制频率、硬件适配等问题。是否把更多环节放入一个模型,与是否能够稳定完成任务,是两个需要分别验证的问题。
VLA 概念示意:视觉和语言输入连接动作输出
05|机器人怎样学:示范、试错与模拟
让机器人学会动作,常见思路之一是模仿学习。人通过遥操作等方式演示任务,系统记录观察和动作,再学习在类似情况下如何行动。
这有点像学徒看师傅做事,但也有局限。演示如果只包含顺利完成的过程,机器人遇到夹歪、掉落等状态时,就可能不知道怎样恢复。训练材料覆盖了哪些情况,会影响它能处理哪些情况。
另一种思路是强化学习:系统尝试不同动作,依据奖励调整策略。比如训练移动能力时,可以鼓励到达目标,同时约束不希望出现的行为。奖励是设计出来的指标,因此必须检查它是否真的对应任务目的。
举个假设例子:如果只奖励“尽快把物体移到指定区域”,却完全忽略碰撞和物体完整性,学到的行为就未必符合使用者期待。指标越容易计算,不代表它越完整地表达了“做好这件事”。
反复使用真机练习又慢又有损耗,于是研究者会让虚拟机器人在物理模拟环境中训练。模拟便于重复实验,但它与现实存在差异:摩擦、质量、控制延迟等都可能不完全一致。
这就是仿真到现实的迁移问题。一种办法是在训练时改变相关参数,让策略适应一系列条件,而不是只适应单一设定。四足机器人运动研究已经探索了这类方法。[4]
这些方法可以组合使用:先利用已有模型和示范建立能力,再针对具体任务训练和验证。现场根据反馈重新规划,则未必涉及重新训练,不能把“实时纠错”都叫作“在线学习”。
示范采集、模拟练习与真机验证;方法可组合,并非唯一固定流程
06|数据瓶颈:看过视频,不等于练过动作
互联网有大量图像和视频,但它们通常不会完整告诉机器人:当时关节转了多少、夹爪用了什么控制指令、接触后物体如何变化。看见一个结果,与拥有可执行的动作经验,中间仍有距离。
机器人数据还与身体有关。同一个“向前移动”,对于不同长度的手臂、不同坐标定义和不同夹爪,具体表示可能不同。把数据放在一起,并不会自动消除这些差异。
Open X-Embodiment 项目汇集了多个机器人平台的数据,探索跨机器人训练和能力迁移。[7]它的意义在于尝试让经验得到更广泛的利用,而不是让每一种硬件都从完全独立的数据起步。
OpenVLA 则是一个具体研究例子:项目报告使用约 97 万条机器人操作轨迹进行训练,并研究了向新机器人设置适配的方法。[8]这里的“轨迹”是一段操作经历,不能简单理解成一张图片或一次抓取动作。
数量之外,还要看多样性和质量。重复一万次相同摆放,与覆盖遮挡、不同抓取位置、失败恢复等情况,能提供的经验并不相同。传感器与动作记录是否同步,也影响数据是否可用。
人类视频能帮助研究者利用视觉与行为信息,但要转成机器自己的动作,还需解决视角、身体结构和动作对应关系。把“学过很多视频”直接推导为“会做各种家务”,跳过了最关键的验证环节。
不同机器人、任务与操作序列构成多样化数据
07|泛化:换个杯子,它还会不会拿?
具身智能研究常说的“泛化”,可以通俗理解为:在训练经验之外,系统还能否合理处理新情况。但“新情况”有很多种,不能只用一句“泛化很好”概括。
换一张桌布,是外观变化;把杯子移到桌角,是位置变化;换成细长玻璃杯,是物体形状变化;把“拿蓝杯子”改成“拿左边那个”,则涉及语言与场景的对应。
OpenVLA 的研究把测试分为视觉、运动、物理和语义等不同方面,也呈现了不同模型在不同任务上的差异。[8]这提醒我们:某一类能力进步,并不保证所有维度一起提升。
还要考虑任务长度。拿起一个物体与整理整张餐桌,难度不只差在动作数量。前一步稍有偏差,可能改变后面每一步的条件。
做一个纯粹用于理解的计算:假设十个步骤相互独立,每一步成功率都是 95%,那么十步全部成功的概率约为 60%。真实机器人任务并不满足这么简单的假设,也可能重试恢复;这个例子只是说明,小概率失误在长任务中不能忽略。
因此,可靠的系统需要识别进度、发现偏差,并决定重试、换策略还是请求帮助。它不仅要知道“下一步通常怎么做”,还要知道“眼前是否仍然适合这样做”。
泛化测试示意:改变物体、背景、光照与遮挡条件
08|人形、轮式、机械臂:谁更合适?
人形机器人容易吸引目光,因为它让人联想到通用助手。但具身智能和人形机器人不能画等号:前者关注智能与身体、环境的交互,后者是一类硬件形态。
人的生活空间为人的尺度设计,双手和双腿可能有助于使用某些现成设施。与此同时,双足平衡、整机重量、关节数量与能耗,又增加了系统需要解决的问题。
可以用一个场景选择题来理解:如果任务是在固定工作台前分拣零件,就应比较固定机械臂能否满足需求;如果需要在平整地面上运送物品,就可以考虑轮式平台;如果必须跨越复杂地形,再评估腿式结构带来的价值。
这是一种工程判断方式,而不是对所有产品的统一排名。**合适的身体,是在目标环境中以可接受的成本完成任务的身体。**外观越像人,不意味着对所有任务越有优势。
同样,专用自动化也不会因为大模型出现就失去价值。需求稳定时,专门设计的工具和流程可能更容易验证。需要处理更多变化时,学习能力和灵活交互才会更突出。
对于普通读者,与其先问“它像不像人”,不如先问“它准备替谁,在什么地方,完成哪一件事”。这样更容易看懂演示背后的真实用途。
左上:固定机械臂;右上:轮式平台;左下:四足机器人;右下:人形机器人
09|从实验室到日常:还要算哪些账?
拿仓储、制造和家庭三个场景作分析,它们对机器人的要求并不相同。以下是理解应用条件的例子,不代表某类通用机器人已经在这些领域全面成熟。
在仓储场景,可以考虑搬运和拣选任务,但物品种类、包装状态与工作节拍会改变难度。在制造场景,即使动作范围不大,精度、一致性和停机代价也可能非常重要。
家庭看起来熟悉,却充满变化:房间布局不同,物品随时被挪动,指令还可能含糊。“把桌子收拾一下”,究竟是把所有东西收进柜子,还是只清理垃圾?机器人需要理解目标,也可能需要追问。
落地还必须计算购买、部署、维护、充电、耗材和人工接管等成本。一个机器人能够完成任务,并不等于它在给定条件下比现有方案更划算。这属于应用评估,无法只靠模型参数量回答。
安全同样要落实到系统。除了判断指令是否合适,还要控制碰撞风险、接触力和移动稳定性。Gemini Robotics 的技术介绍明确讨论了高层理解与底层安全控制配合的思路。[1]
例如,在有人靠近时停止运动,需要可靠的检测和控制机制;不能仅靠模型回答“我会注意安全”。从一次成功走向日常使用,关注点会逐渐转向长期表现、异常处理和维护能力。
仓储、制造与家庭的应用设想,不代表产品部署或性能证明
10|普通人怎样看懂一段机器人视频?
面对令人惊叹的演示,可以先确认:**哪些步骤是自主完成的?**遥操作、预编程和自主决策都各有用途,但它们证明的能力不同。有人在远程控制,不等于机器人自己理解了整项任务。
接着看:**测试条件写清楚了吗?**是否经过特定任务训练?展示了多少次尝试?视频是否加速?物体的位置和种类能否改变?“这次完成了”与“多数时候都能完成”,需要不同证据。
还要问:**失败后发生了什么?**自己重新抓取、停下求助,以及必须由工程师复位,是不同程度的恢复能力。只看剪辑后的最佳片段,很难判断它能独立工作多久。
最后看指标是否对应实际需要。抓取成功率、整项任务完成率、用时和人工接管频率,并不是可以互相替代的数字。比较两个系统之前,应先确认任务和测试条件是否接近。
这不是要求每位读者成为工程师,而是给技术判断多加一层依据。理解一项进展,既可以承认它解决了过去的难题,也可以保留对适用范围的追问。
具身智能值得关注,正因为它把智能放进了一个必须接受结果检验的环境:杯子是否拿稳,衣服是否叠好,路径是否安全,都需要由实际行动回答。
评估演示:关注自主程度、重复试验、耗时与失败恢复
从认识一个杯子,到把它稳稳放进托盘,中间连接着感知、规划、控制、学习和工程验证。
未来的进展,也许体现在更复杂的动作上,也许体现在一次普通任务中:少夹空一次,遇到变化时及时停下,发现自己做不到时能够求助。
当一句“帮我拿杯子”,能够在不同环境里反复变成可靠的行动,具身智能的价值才真正走进了生活。
资料来源
- Google DeepMind|Gemini Robotics brings AI into the physical world(2025)
- Physical Intelligence|Our First Generalist Policy(π₀,2024)
- RT-2|Vision-Language-Action Models(2023)
- RSS|Sim-to-Real: Learning Agile Locomotion For Quadruped Robots(2018)
- Modern Robotics|11.1 Control System Overview
- SayCan|Grounding Language in Robotic Affordances(2022)
- Open X-Embodiment|Robotic Learning Datasets and RT-X Models(2023)
- OpenVLA|An Open-Source Vision-Language-Action Model(2024)

362

被折叠的 条评论
为什么被折叠?



