
1、物理AI概述与核心能力
·物理AI行业基本概述:过去两年AI从大语言模型、多模态模型发展到AI agent,推动AI在文本、代码、图像、视频等数字世界实现智能力落地。AI产业下一个核心趋势是大模型能力从数字世界向真实物理世界外溢,AI不再仅能在数字世界理解信息、调用工具,还可进入物理世界完成感知环境、理解空间、规划任务、控制具身智能体完成物理动作。物理AI范畴覆盖世界模型、机器人、自动驾驶、空间智能等所有与物理世界AI智能化相关的方向,下游核心代表场景为自动驾驶与机器人,今年到2030年物理AI都将是相对较新的赛道方向。
·物理AI四层核心能力:物理AI核心能力共分为四层,各层能力较传统技术有明显差异化特征:
1)感知能力:需通过摄像头、激光雷达、力觉、触觉等多类传感器获取外部环境信息,可识别物体、空间、路径、障碍物、人类行为及任务状态;与传统视觉AI不同,物理AI的感知不止停留在识别层面,而是服务于后续动作执行,例如机器人识别杯子时还需判断其位置、材质、可抓取性及抓取后的滑落风险等。
2)理解能力:核心为空间智能相关能力,需对三维空间物体关系、场景语义、物理规律形成充分理解;不同于传统大模型从文本、图像中学习知识,物理AI需进入真实世界采集数据,学习真实世界三维空间与物理规律。
3)任务规划能力:需将复杂任务拆解为可执行的子任务,还可根据环境反馈动态调整策略,例如家庭整理任务中机器人需先识别环境、确定目标位置,再规划移动路径、抓取及放置方式,若任务过程中出现物体掉落等环境变化还需重新规划;与依赖固定程序规则控制的传统机器人不同,规划能力更强调基于模型的推理、任务分解及失败任务的恢复调整能力,与世界模型关联密切。
4)执行能力:是物理AI区别于数字世界AI agent的核心特征,依赖机器人等物理载体完成移动、抓取、搬运、装配等动作,是当前机器人产业链的主要价值组成部分。
物理AI落地需四层能力协同,只有软件大模型、机械结构、传感器相结合,才能让物理AI能力真正落地真实世界。
·物理AI技术属性:物理AI本质并非单一算法突破,而是涉及世界模型、感知等多环节的系统性工程,其发展不仅依赖模型升级,还受数据、训练平台、本体控制能力等多因素影响。今年已有论文指出,物理AI领域的世界模型遵循scaling law,通过提升数据量可大幅增强世界模型的能力表现,今年世界模型算法层面已出现相关突破。
2、物理AI核心技术体系
·核心概念关系梳理:物理AI是总目标,核心是让AI在真实物理世界完成任务;空间智能是认知基础,支撑AI对三维物理世界的理解、生成与推理;具身智能是物理AI的交互载体,包含自动驾驶车辆、机器人等形态,可与真实环境交互;世界模型是今年发展较快的核心技术方向。
·VLA模型技术演进:机器人领域技术经历多轮迭代,从规则控制逐步发展到VLA模型阶段。VLA模型输入包含视觉信息(vision)、语言指令(language),输出为机器人可执行动作序列或可理解的控制信号,相比传统机器人预设的固定动作模板,VLA模型可支撑机器人在更复杂、开放的环境中执行操作任务,核心意义是将机器人智能核心从感知系统向动作生成系统转变,有望成为机器人大脑的重要技术路线。代表性产品方面,谷歌DeepMind旗下RT-2是VLA模型早期重要代表,核心思路是将视觉语言模型与机器人控制数据结合,把互联网大量语义知识迁移到机器人动作控制中;后续推出的Robotics产品将Gemini多模态能力扩展到物理世界,可将视觉信息与自然语言指令转化为动作。
·世界模型价值与应用:VLA模型解决从感知到动作环节的问题,世界模型核心解决物理世界理解、动作后果预测的问题,是自动驾驶、机器人大脑能力的进一步升级。世界模型核心价值分为三点:a. 提升AI对物理世界的理解能力;b. 支持动作执行前的结果推演与风险评估,可基于动作后果预测调整当下动作,比如自动驾驶车辆决策前,可通过预测其他车辆、行人、道路环境的变化及对应后果优化决策;c. 可生成仿真与合成数据,降低机器人、自动驾驶系统的训练成本,提升长尾场景覆盖度。行业代表性产品为英伟达Cosmos平台,其定位是面向物理AI的世界基础模型平台,具备世界生成、物理推理、视频生成、合成数据生成能力,支持机器人、自动驾驶场景开发,可帮助开发者搭建定制化的物理AI训练环境,是英伟达布局AI下一重要方向、推广物理AI基础平台的核心载体。
·世界模型数据瓶颈:当前世界模型的主要发展瓶颈是数据,数据是未来物理AI产业竞争的核心壁垒。相比大语言模型已出现的训练数据短缺问题,机器人领域数据稀缺问题更突出:机器人训练需要大量三维数据,目前主要有三类来源:a. 从互联网视频中提取的数据,是当前数据量最大的来源;b. 仿真生成数据,可通过世界模型生成;c. 真实采集数据、真实机器人部署数据、人类遥操作机器人数据,该类数据质量最高但采集成本也最高。未来随着机器人部署量不断提升,采集到的真实数据将持续积累,形成正向数据飞轮。
3、海内外企业布局情况
·海外核心企业布局:海外布局物理AI的主体分为算力厂商、整车厂商、创新势力三类,英伟达、特斯拉、Figure AI、Facebook Intelligence为核心代表。其中英伟达作为算力厂商,从过往提供算力及算力平台转向提前布局物理AI基础设施层,构建了从底层算力到数据仿真再到模型的完整物理AI生态:算力层面,物理AI所需GPU与AI服务器算力规模大于生成式AI;仿真层面,拥有Omniverse、SX Sim平台,可提供高保真物理仿真、测试及合成数据能力;模型层面布局Cosmo世界模型,是可提供物理AI开发流程全栈体系的综合基础设施厂商。特斯拉作为整车厂商,物理AI路线偏落地应用,Optimus人形机器人的发展基础来自此前自动驾驶与制造体系积累的视觉感知、神经网络训练能力,自动驾驶与人形机器人技术逻辑相近,均需在真实世界完成感知、预测、规划、控制,依赖大量真实数据支撑,特斯拉自有工厂为Optimus提供了早期训练与部署场景。人形机器人早期商业化验证优先落地工厂场景,核心原因是工厂环境具备结构化特征、任务边界清晰,复杂度远低于家庭场景,家庭场景落地进度更慢。海外新势力与传统机器人公司侧重本体、机械结构的发展逻辑不同,更看重机器人软件栈定义,重点围绕VLA、真实数据闭环、机器人模型布局,推动机器人产业从侧重硬件工程能力向软件模型驱动转型。
·国内机器人企业布局:国内物理AI机器人赛道核心代表企业包括银河通用、宇树、智元等。其中银河通用是仿真合成数据赛道代表,重点围绕机器人基础模型、仿真训练平台、机器人操作能力布局技术,通过大规模合成数据与真实数据融合训练提升机器人复杂环境下的泛化能力,核心发展思路是打造数据-模型-部署的完整闭环。宇树产品布局全面,区别于聚焦单一机器人产品的企业,侧重产品矩阵建设与工程化能力提升,丰富的产品矩阵体现了机器人产业从技术验证向规模化商业落地演进的趋势。
·国内软件企业布局:国内物理AI软件赛道核心代表企业包括五一世界、群核科技,二者对应世界模型发展的两条核心技术路径。其中五一世界从数字孪生向仿真训练平台延伸,支撑物理AI领域的自动驾驶、人形机器人训练工作,技术路径对标英伟达Omniverse、Cosmos平台,核心是构建物理AI数字世界底座,搭建技术栈与产品矩阵,可支持自动驾驶在高仿真环境中开展训练测试,后续还将向机器人领域拓展。群核科技是空间智能赛道代表,此前在家装设计软件业务中积累了大量室内家装数据、房屋三维空间数据,提前布局物理AI相关技术转型,从酷家乐空间编辑工具切入,基于积累的海量空间数据推出空间理解与空间生成大模型,构建完整空间智能体系。其差异化优势在于拥有大量高质量真实室内空间数据资产,商业化方向分为两类:一是以数据服务形式为机器人室内环境训练提供支撑;二是空间理解模型可服务于影视拍摄、电商广告拍摄的三维空间构建场景,空间智能业务对标海外李飞飞World Lab产品。
4、物理AI发展趋势展望
·技术演进趋势:物理AI是AI向真实世界任务执行方向演进的重要技术趋势,核心组成覆盖感知、理解、任务规划与执行全链路。当前其技术范式正持续升级,历经规则设定、VLA模型、世界模型三个阶段。其中世界模型核心作用突出:一是可生成仿真合成数据,解决训练数据短缺问题;二是可预测未来物理状态,进而优化当前动作,为技术落地提供支撑。
·落地节奏与阶段判断:物理AI商业化落地节奏清晰,将首先在自动驾驶领域体现核心价值,后续向机器人行业渗透,助力提升机器人的大脑能力。从商业化进展来看,当前处于大规模商业化前期、小批量验证阶段,尚未进入大规模落地期,现阶段可重点梳理物理AI相关技术,持续跟踪行业内软件技术栈变化,把握技术迭代节奏。

盈辉优配提示:文章来自网络,不代表本站观点。