(来源:Imagination Tech)
人工智能的下一阶段,不会由一种新型机器人来定义,而是由机器智能获得身体所定义
几十年来,机器人一直被理解为执行特定功能的机器:焊接一条焊缝、搬运一个包裹、检查一件产品、在仓库中导航。而新兴的"Physical AI"(物理人工智能)一词彻底颠覆了这一视角。它不是从机器人出发,问需要多少智能来完成任务。它从机器智能出发——感知条件、解释目标、选择行动、并做出调整的操作能力——然后追问这种智能如何获得物理形态。在这种视角下,机器人不再是整个系统,而成了具身化的载体:一个人工智能借以感知、行动、并承受其决策后果的身体。生成式AI让机器成为数字内容的生产者。智能体AI(Agentic AI)让它们成为数字系统内的操作者。Physical AI则试图将这种智能跨越计算与物质世界之间的边界。
Physical AI 颠覆了视角
Physical AI 目前还不是一个标准的技术术语——研究人员同时使用具身AI(embodied AI)、具身推理(embodied reasoning)、物理智能(physical intelligence)、机器人基础模型(robot foundation models)、通用机器人策略(generalist robot policies)、视觉-语言-动作模型(vision-language-action models)等其他术语。NVIDIA 帮助将 Physical AI 推广为一个行业统称,而 Google DeepMind 越来越多地谈论物理智能体和具身推理。美国国家标准与技术研究院(NIST)在当前商业热潮之前就已在制造机器人项目中使用这个术语。这种多样性正好揭示了这个词的作用:它不是定义一个公认的技术,而是在引入一种组织该领域的新方式。
传统机器人通常从设备出发。工程师定义它的本体、执行器、传感器、控制器、工作空间、安全限制和分配的任务。结果可能是一个焊接臂、自动叉车、手术平台、配送机器人或移动检测系统。每台机器主要通过它执行的功能来被理解。即使它自主运行,其智能通常也被视为一个更大的、专门构建的设备中的一项能力。
Physical AI 从智能出发。这里的"智能"并不意味着意识、人类意义上的意图、或独立意志。它意味着一个系统能够接收或推断目标、感知相关条件、在可能的行动中进行选择、通过工具或机器行动、观察结果、并修正自身行为。机器人提供了这个过程发生的物理装置。它的摄像头和触觉传感器成为AI感知的手段;它的轮子、手臂、夹具和关节成为决策获得物理后果的途径。
这使得 Physical AI 成为智能的一个类别,而非硬件的一个类别。人形机器人可能体现它,但自动驾驶汽车、无人机、工业臂、仓储平台、实验室仪器或手术系统也同样可以。它们的形态和目的可能截然不同。连接它们的是机器智能通过物理身体运行的愿景。这个词的意义在于,它使原本分离的机器类别看起来像是同一更大发展的不同具身化形式。
具身智能的更早根源
传统机器人的机械技术远未过时。2024年,全球企业安装了54.2万台工业机器人,有超过460万台在工厂中运行。这些机器代表了一个极其成功的工程范式:约束环境、明确任务、编程或教授动作、以速度和精度重复执行。它们的能力往往恰恰来自于消除 Physical AI 现在被期望管理的那些不确定性。
智能通过物理交互涌现的观点也并不新鲜。1991年,Rodney Brooks 认为机器人研究人员过度强调了抽象的内部表征,而对感知与行动之间的直接循环关注不足。他基于行为的方法强调机器与世界持续互动,而不是等待一个集中式系统构建完整模型并下发详细计划。智能,在这种观点中,与情境化行为密不可分。
Rolf Pfeifer 和 Josh Bongard 后来论证,智能无法与产生它的身体截然分开。身体的形式、材料、传感器和运动可能性,帮助决定了它能学到什么以及它的问题有多困难。一个柔性夹具可以贴合不规则物体,而无需计算其几何的每个细节。一条弹性腿可以利用动量,而不是通过软件控制每一个动作。系统智能的一部分是通过其物理设计来表达的。
这一传统产生了更具体的物理智能概念。2020年,Aslan Miriyev 和 Mirko Kovač 将"物理人工智能"描述为将计算机科学与机械工程、材料科学、生物学和化学结合的多学科努力。2021年,Metin Sitti 认为智能能力既可以编码在机器的控制器中,也可以编码在机器身体中。这段历史使当前的叙事更加复杂。早期的研究者通常从身体出发,询问机械和材料如何贡献于智能。今天的行业往往从一个基础模型出发,询问它如何控制一个身体。最具影响力的 Physical AI 版本将需要这两种视角。
从生成式AI到机器智能
生成式AI为人工智能确立了一个新的公共角色。AI不再是幕后分类信息或做出预测,而是成为了一个可见的生产者。单个模型可以根据开放式指令生成语言、图像、音频、视频和软件。它的输出范围可以非常广泛,但主要仍然是表征性的:对世界的描述、在其中行动的计划、或人们和其他系统可以使用的数字产物。
智能体AI将重点从产生输出转向追求目标。一个智能体可以决定使用哪些工具、导航软件、检索信息、执行一系列操作、检查中间结果、并修正其方法。它的定义性能力不仅仅是生成,而是随时间推移的目标导向行动。然而,大多数AI智能体仍在计算环境内运行,其行动以应用命令、消息、数据库查询、代码执行或数字文件变更的形式存在。
Physical AI 给这种智能赋予了身体。智能体的观察现在通过摄像头、麦克风、激光雷达、雷达、力传感器、触觉和本体感知到达。它的行动可以移动物体、打开阀门、驾驶车辆、装载机器、进行实验、或改变工作场所的状态。它必须应对重量、动量、摩擦力、形变、有限的能量、传感器噪声、变化的光线、人类的运动以及不如预期表现的对象。一个数字智能体可以重试失败的表单提交。一个物理智能体可能已经把容器打翻、损坏了组件、或将人置于风险之中。
从生成式AI到智能体AI再到Physical AI的演进,并不是一个正式的分类学或技术时代的清晰更替。生成模型仍然存在于智能体内部,物理系统将继续将学习到的智能与传统控制、规划和自动化相结合。但这种演进捕捉到了机器能力范围的扩展。生成式AI生产内容。智能体AI在数字环境中追求目标。Physical AI 则赋予这种目标导向能力以物理具身,使其能够参与物质世界。
赋予智能以身体的技术栈
第一个关键发展是多模态基础模型。在语言、图像、视频和其他数据形式上训练的系统,可以识别物体、解释指令、推理关系、并利用传统机器人程序所不包含的广泛知识。Google DeepMind 的 RT-2 展示了如何将视觉-语言模型适配为输出机器人动作的令牌。其后的 Gemini Robotics 系统将具身推理、任务规划、工具使用和视觉-语言-动作控制相结合或分离。模型不仅仅识别机器人面前是什么;它还可以帮助确定具身智能体应该对此做什么。
第二个关键发展是使物理知识可迁移的努力。Open X-Embodiment 合作项目汇集了来自22种机器人形态和34个机器人实验室的超过100万条轨迹,测试通过一台机器积累的经验能否改善其他机器的性能。Physical Intelligence 开发了旨在控制多种机器人类型的通用策略,而 Skild AI 明确将其目标描述为不受限于单一机器形态的"全身智能"。这些系统尚未构成一个通用的机器人大脑,但它们指向了一个不同的发展单元:一种智能通过多个身体学习,而不是为了一台机器编写一个程序。
第三个关键发展是仿真、合成数据、强化学习和世界模型的增长。语言模型可以在已经充满文本的互联网上进行训练。但不存在类似的公共档案,包含每一种有用的抓取、碰撞、插入、交接、驾驶交互或工厂异常情况。真实世界的机器人经验收集起来既缓慢又昂贵。NVIDIA Omniverse、Isaac 和 Cosmos 等平台旨在通过数字孪生、仿真物理、生成环境和合成传感器数据来补充这些经验。一个具身智能体可以在虚拟环境中练习任务的变体,包括罕见或危险的场景,然后再在物理设备上尝试。
第四个关键发展是身体本身。改进的摄像头、触觉传感器、力反馈、灵巧手、柔性执行器、高效计算和更安全的机械系统,扩展了机器智能能够感知和完成的内容。这些技术也说明了为什么 Physical AI 不能简化为单一的模型架构。视觉-语言-动作模型、世界模型、强化学习、仿真、先进传感器和机器人硬件是一个新兴技术栈的组成部分,而不是一份确定的蓝图。统一的概念不是规格说明,而是创造能够获得物理形态并在与现实接触中存活的机器智能的努力。
一种智能,多种具身化
最深层的变革将在于行业将智能定位在哪里。在传统机器人技术中,能力通常与个体机器、其控制器、其任务编程和围绕它构建的环境密不可分。在 Physical AI 模型中,高层级知识可以驻留在一个理解目标、物体、关系和可能行动的更广泛系统中。低层级控制器则将那些决策转化为适合特定身体的运动。
工业臂、移动操作器、自动驾驶汽车和人形机器人不会使用相同的电机指令。它们没有相同的尺寸、关节、力量、传感器或物理能力。但它们可能能够共享关于抓取、搬运、插入、分拣、打开、避让或导航意味着什么的高层级知识。长期目标不是一套通用的运动序列,而是一个可复用的物理理解层,可以适应不同的形态。
不同的组织正在从不同层面追求这种可能性。Google DeepMind 正在将基础模型扩展到具身推理和机器人行动。NVIDIA 正在构建计算、仿真、世界模型和机器人开发基础设施。Physical Intelligence 和 Skild AI 专注于通用控制模型。丰田研究所开发了大型行为模型,并与波士顿动力合作 Atlas。亚马逊和 Waymo 在物流和自动驾驶系统中构建垂直整合的智能。大学实验室仍然是机器人学习、控制、操作、感知和具身化基础研究的核心。
如果机器智能变得更加可复用,机器人业务的格局也可能随之改变。模型提供商可以许可跨多种硬件运行的能力。机器人制造商可以暴露接口,供那些模型控制不同的身体。仿真公司可以提供训练环境,而大型车队运营商则从其机器收集的物理数据中获得优势。机器人仍将不可或缺,但它将越来越多地被理解为一个更大的模型、数据、计算、控制和积累经验系统中的一种具身化形式。
机器智能在何处获得物理形态
制造业提供了进展与局限的一个有用例证。宝马报告称,一台 Figure 02 人形机器人在其斯帕坦堡工厂为期十个月的项目中工作了大约1250小时,搬运了超过9万个钣金部件,支持了超过3万辆宝马X3的生产。这台机器并没有作为万能工厂工人运行,而是在为任务准备好的生产环境中执行一项定义明确的搬运操作。但宝马以 Physical AI 的语言描述了该项目,将特定的机器人具身化置于更广泛的可适应机器智能策略之中。
亚马逊展示了另一种具身化形式。2025年,该公司表示已在超过300个设施中部署了第100万台机器人。它还推出了 DeepFleet,一个旨在协调整个车队运动的基础模型,亚马逊估计这可以将机器人运输效率提升10%。DeepFleet 并没有把每个仓库机器变成通用智能体。其意义在于将智能向上移动——从单个设备的行为,变为作用于庞大机器网络的一个模型。在这种情况下,舰队本身就成了具身化。
自动驾驶汽车可能代表了 Physical AI 最成熟的形式,尽管它们通常被视为一个独立行业。自动驾驶系统感知不断变化的环境、预测他人的行动、规划、控制机器、并随着事件展开而适应。截至2025年10月,Waymo 报告在公共道路上完成了超过1亿英里全自动驾驶里程和超过1000万次付费乘车。这比大多数通用机器人演示提供了更强有力的、机器智能在物理世界中持续运行的证据。这也显示了当前系统的界限:Waymo Driver 在驾驶领域越来越能干,但它并不是恰好占据一辆汽车的通用智能。
科学实验室和医疗保健揭示了机器智能可以采取的其他形式。利物浦大学的一个移动机器人化学家在八天内完成了688次实验,寻找改进的光催化剂。伯克利的 A-Lab 将计算预测、文献知识、机器学习、主动学习和机器人技术整合为材料合成的闭环,在17天运行中完成了353次实验。约翰霍普金斯大学的研究人员展示了一个机器人系统,在最小人工干预下规划、适应并在猪身上执行精细的肠道缝合手术。这些系统并非自主科学家或外科医生。人类定义了它们的目标、仪器、约束和操作边界。它们所展示的更为精确:机器智能能够越来越多地在决策、行动、测量和再次决策之间闭环。
范式即具身化
Physical AI 不需要作为一个单一的突破、通用的机器人模型或公认的技术标准到来才能产生影响。它的直接重要性在于它引入的视角逆转。机器人技术传统上是围绕机器及其功能来组织的:焊接机器人、配送机器人、手术机器人、自动驾驶汽车、实验室机器人。Physical AI 围绕智能重新组织了这些类别。它要求我们将每台机器理解为一个能够感知、决策和行动的更大智能的可能物理表达。
这并不使身体成为次要的或可互换的。一台机器仍然需要被工程化、供电、维护、集成并确保安全。它的形状和材料影响它能感知、学习和完成什么。物理行动仍然比数字行动更不容忍错误,许多任务通过传统自动化执行比通过通用AI系统更加有效。这个术语不应被用来模糊这些约束,或暗示每一台自主机器都已成为一个复杂的智能体。
这个词的真正力量在于它将机器人技术置于人工智能更广泛的演进之中。生成式AI使机器智能成为内容的生产者。智能体AI使其成为能够通过数字工具追求目标的操作者。Physical AI 将那种智能扩展到能够改变物质世界状态的机器人系统。输出不再只是文字、图像、计划或软件命令。它们变成了运动、操作、旅程、实验和物理后果。
这就是为什么"Physical AI"不仅仅是机器人学的一个时髦替代词。它改变了故事中心的对象。机器人不再仅仅被视为一个包含一定智能的独立功能设备。它变成了机器智能的机器人具身化——人工智能通过它与物理现实建立直接关系的身体。当今的系统最终能否实现这一承诺尚不确定。但概念转变已经开始:AI的下一个前沿可能不再是另一种内容,而是智能获得形态,走向世界。
参考文献
NIST — Physical AI and Data Generation for Robotics[1]
NVIDIA — Cosmos: World Foundation Models for Physical AI[2]
International Federation of Robotics — World Robotics 2025[3]
Rodney Brooks — "Intelligence Without Representation"[4]
Rolf Pfeifer and Josh Bongard — How the Body Shapes the Way We Think: A New View of Intelligence[5]
原文:Physical AI: The Robotic Embodiment of Machine Agency
引用链接
[1] NIST — Physical AI and Data Generation for Robotics: https://www.nist.gov/programs-projects/physical-ai-and-data-generation-robotics
[2] NVIDIA — Cosmos: World Foundation Models for Physical AI: https://www.nvidia.com/en-us/ai/cosmos/
[3] International Federation of Robotics — World Robotics 2025: https://ifr.org/worldrobotics/report-2025
[4] Rodney Brooks — "Intelligence Without Representation": https://doi.org/10.1016/0004-3702(91)90053-M
[5] Rolf Pfeifer and Josh Bongard — How the Body Shapes the Way We Think: A New View of Intelligence: https://mitpress.mit.edu/9780262537421/how-t