
我身边不少做自动驾驶的朋友这两年陆续开始转方向了。有人去了具身智能公司有人转向纯AI Infra真正从量产一线跳出来自己干的张颖算其中一个。他之前在自动驾驶公司做量产项目从感知、规划、控制到数据闭环都摸过一遍现在出来做AI for Physical AI——也就是用AI去理解和操作物理世界。这个转变很有意思不是那种“做腻了换赛道”的逃离而是把量产自动驾驶里积累的东西平移到一个更接近通用机器人的方向上。这篇文章我不打算写成人物专访因为张颖本人的信息披露有限。我更想聊的是他这次转型背后暴露出的行业逻辑为什么自动驾驶量产一线的人会成为Physical AI创业的主力军Physical AI到底是什么和自动驾驶有什么关系又有哪些技术点值得关注以及如果你也想往这个方向走应该怎么切入。1. 从自动驾驶量产到Physical AI本质是同一个问题的迁移1.1 自动驾驶量产到底积累了哪些核心能力先说结论自动驾驶量产一线和Physical AI的底层能力高度重合甚至可以说前者是后者最接近的“预科班”。张颖在量产一线做的工作大致可以分成四块感知系统的工程化落地也就是传感器标定、多帧融合、目标追踪这些脏活累活规划控制算法的实车调参别以为就是把论文里的MPC或者Lattice Planner搬上车就完事实际要处理的是转向延迟、刹车顿挫、横风干扰这些下三路问题数据闭环体系搭建从车端数据采集、回传、挖掘、标注到模型迭代这是一个完整的飞轮做不好就谈不上“越开越聪明”最后是面向量产的安全验证包括仿真测试、封闭场地测试、开放道路测试的三级验证体系。这些东西放到Physical AI里几乎没有一项是浪费的。机器人的感知系统要识别物体、理解场景虽然传感器形态从多个摄像头加激光雷达变成了可能是RGB-D相机加力觉传感器但感知算法的底层逻辑是一样的。机器人的操作策略要生成轨迹要处理动态环境要实时反馈这和自动驾驶里的规划控制在数学上是非常接近的——都是在高维状态空间里找一个可行的、安全的、尽量最优的路径。机器人也需要数据闭环只是数据的形态从“路采视频点云”变成了“操作视频力觉记录”。机器人更需要安全验证因为它要进入家庭、工厂、医院直接和人对面打交道出错的代价比自动驾驶撞护栏要严重得多。所以张颖从自动驾驶量产一线出来做Physical AI本质上不是跨界是把同一套方法论从一个物理载体搬到另一个物理载体上。要说区别最大的变化是物理交互维度增加了车只需要在一个平面世界里移动机器人要在一个三维世界里同时做移动和操作自由度翻了一倍不止。1.2 Physical AI这个概念的来龙去脉“Physical AI”这个词真正被圈子里大规模讨论是因为英伟达在GTC大会上的反复强化。黄仁勋的说法是下一个AI浪潮不是生成文字和图片而是生成动作——让AI能够理解物理规律并在物理世界中完成交互。他把这个方向叫做Physical AI核心载体就是人形机器人、自动驾驶汽车、工业机械臂这些有真实物理存在的智能体。这个概念能火起来有三个推手。第一个推手是大语言模型给AI圈带来的范式转移大家相信zhuān注于“下一步词元预测”的方法论可以迁移到“下一步动作预测”上。第二个推手是具身智能技术的突破尤其是VLA模型的出现把视觉、语言、动作统一到一个模型里让机器人能够理解自然语言指令并直接输出动作。第三个推手是人形机器人硬件产业链的成熟电机、减速器、传感器这些核心零部件的成本在快速下降让“通用机器人”从PPT变成了能跑能跳的样机。我个人理解Physical AI和传统机器人的本质区别在于传统机器人是“编程出来的”每一个动作都是工程师预先写好的流程换个场景就失灵Physical AI是“学出来的”它通过大量数据学习物理世界的规律从而获得面对新场景的泛化能力。这就像自动驾驶里规则时代的决策树已经走到了天花板只有数据驱动的方法才能在长尾场景里生存。1.3 为什么张颖这类人适合做这件事做Physical AI创业最容易犯的错误是低估物理世界的复杂度。一个做纯大模型出身的团队可能会以为给机器人接一个ChatGPT它就能自己干家务了。但真上手就傻眼光是“拿起桌上那个红色杯子”这个指令就要解决识别杯子、估计位姿、规划抓取点、避开障碍物、施加合适力度这一连串难题任何一个环节出了问题整个动作就失败了。而张颖这类从自动驾驶量产一线出来的人对物理世界的复杂度有着刻骨铭心的认知。他们见过暴雨天里传感器的失灵见过十字路口行人横穿时的博弈难题见过一个小小corner case让整个测试团队加班一个月。这种经验带来的不是某个具体的技术优势而是一种“敬畏心”——知道物理世界有多难搞知道系统要多鲁棒才能谈得上可用知道数据要多闭环才能让模型持续进化。另外量产经历还带来一个隐性优势供应链和工程化能力。做自动驾驶量产要解决的是在有限算力、有限成本下实现可落地的性能这种约束意识在做机器人时尤其重要。很多人做Demo时很炫一提到量产就哑火就是因为从来没有被成本、可靠性、生产一致性这些“俗事”教育过。张颖这类人不一样他们知道什么叫“为一个99%场景设计系统”什么叫“为剩下的1%场景兜底”。2. 瞄准Physical AI核心赛道与关键技术拆解2.1 世界模型让AI学会物理常识如果说大语言模型的本质是学习语言的统计规律那么Physical AI第一个绕不开的技术点就是世界模型。所谓世界模型说直白一点就是让AI对物理世界建立一个内部的、可预测的表征。你推一个杯子它知道杯子会倒你扔一个球它知道球会沿抛物线飞出去你用手挡在机器人前面它知道不能硬往前撞。世界模型在自动驾驶里的应用其实已经开始了业界热门的行为预测就依赖“场景理解多模态预测”的能力本质上就是在车端建立一个局部世界模型。到了Physical AI里世界模型的粒度要细得多因为你不仅要知道“前面有一辆车在减速”还要知道“这个抽屉的阻尼有多大该用多大力才能拉开”。所以现在的头部团队都在做“视频生成式世界模型”——用海量视频训练模型让模型学会物体运动的物理规律然后在部署时用来预测动作后果相当于给机器人装了一个“脑内模拟器”。这个方向的创业机会在于通用的世界模型大概率是大厂或者头部AI实验室的菜但面向特定物理交互场景的行业世界模型还是一片蓝海。比如医疗手术场景、精密装配场景、仓储分拣场景每个场景都有自己独特的物理规律谁能做出一个“懂行”的世界模型谁就掌握了这个行业的机器人智能底座。2.2 VLA模型打通视觉-语言-动作的桥梁VLA全称Vision-Language-Action Model是目前Physical AI领域最炙手可热的方向。它的思路是把视觉输入摄像头看到的画面、语言输入人类的指令描述、动作输出机器人的执行轨迹统一到一个模型架构里。换句话说你告诉机器人“把桌上那瓶水递给我”VLA模型会理解这句话的语义结合摄像头画面找到那瓶水然后输出一个具体的抓取和递送动作序列。VLA模型的出现把机器人的“指挥系统”和“执行系统”合二为一了。以前的方案是先让感知模型识别物体再让规划模块生成轨迹最后让控制模块去执行一条流水线下来中间任何一环出错都会导致整体失败。VLA的路线是用一个大模型端到端地“输入感知信息输出动作指令”省掉了中间的很多模块也减少了很多误差累积。但这个方向有个很关键的现实问题数据太缺了。文本数据互联网上有海量资源图像数据也有差不多够用的规模但“视觉-语言-动作”配对的数据全世界加起来都是稀缺品。所以现在各家都在卷数据有的用仿真环境批量生成操作数据有的用遥操作设备让人工采集数据还有的尝试直接从互联网视频里提取动作信息。张颖这类做过自动驾驶数据闭环的人在这个问题上有天然优势——他们看到“缺数据”的第一反应不是焦虑而是“那就先把采集、清洗、标注、迭代的体系搭起来”。2.3 数据闭环与仿真验证决定项目上限的隐形战场我一直觉得Physical AI领域最性感的不是算法和模型而是数据基础设施。原因很简单模型架构可以抄算力可以堆但一套能自我造血的数据闭环体系是需要时间和工程能力慢慢磨出来的。自动驾驶给行业留下的最大遗产其实就是数据闭环系统。车端采集数据筛选出有价值的场景上传到云端标注之后进入训练集模型迭代后回灌到车上再通过影子模式验证新模型的效果。这个过程业界花了好几年才跑通现在原封不动地迁移到机器人数据闭环上逻辑是一样的。区别在于车的数据是“行驶数据”机器人的数据是“操作数据”采集设备从“路采车”变成了“遥控臂”和“穿戴式数据采集服”。仿真验证也一样。自动驾驶行业在仿真上花了巨大代价CARLA、SUMMIT这些开源平台加上各自内部自研的仿真系统目的就一个在虚拟环境里尽可能多地测试极端场景减少实车测试的风险和成本。到了Physical AI阶段仿真的挑战更大不仅要模拟视觉还要模拟物理接触要算接触力、摩擦力、形变这对仿真引擎的要求高出了一个量级。现在比较热的方案是“合成数据域随机化”也就是在仿真环境里极尽所能地制造差异让模型在虚拟世界里学会适应变化再迁移到真实世界。2.4 模型部署与边缘推理把智能塞进物理实体还有一个经常被忽略、但决定产品能否落地的环节模型部署与边缘推理。自动驾驶的量产车算力是严格受限的。一个算法模型再厉害如果跑不到30帧每秒就无法在高速场景中实时响应。所以自动驾驶团队里都有一批专门做模型压缩、量化、剪枝和推理加速的工程师他们的工作就是在精度和速度之间抠出每一毫秒的延迟。Physical AI同样面临这个问题而且更严峻。机器人搭载的算力平台通常比汽车要弱不少因为要考虑电池续航、散热和成本。但机器人要在更复杂的三维空间里实时决策一个柔顺操作任务往往要求在几十毫秒内完成一次感知和规划的循环。所以Physical AI里的模型部署工程师很可能就是未来最抢手的人才。这也是我在标题热词里看到“模型部署”“AI工程实践”“AI Infra”时特别有共鸣的原因——大家都在谈模型多聪明却很少有人谈怎么把模型塞进一个风扇都没有的小盒子里还能稳定跑一年。3. 从坐到动Physical AI创业的几个可行切入点3.1 聚焦垂直场景的模型服务商如果你的团队没有能力从零做通用机器人最务实的切入方式是做垂直场景的AI模型服务商。选一个物理交互复杂度适中、商业付费意愿强的领域比如工业质检、物流分拣、农业采摘、医疗辅助针对这个场景做好感知和决策模型以软件方案的方式卖给机器人制造商或者集成商。这个路子的好处是轻资产不需要自己造硬件坏处是天花板相对有限因为你本质上还是一个“卖模型”的公司议价能力取决于你的模型比竞争对手好多少。从自动驾驶出来的人做这个有天然优势因为自动驾驶本身就是“感知决策”模型的集合体很多算法框架可以直接复用。甚至不用从零开始把车端的检测模型、跟踪模型改一改输入输出格式就能迁移到工业场景。3.2 世界模型与仿真平台卖水和铲子另一个切入点是做基础设施层面的工具和平台重点服务那些需要“理解物理世界”的团队。前面说到了仿真系统在Physical AI里的核心地位但市面上像样的工具太少了。自动驾驶时代有CARLA、SUMMIT这些开源仿真器而Physical AI尤其是机器人操作这一个细分方向还没有一个类似的开源标准。如果能做一个高保真、易上手、支持真实物理交互的仿真平台让机器人团队能够在虚拟环境里生成数据、训练模型、验证策略这个方向非常值得做。收入模式可以参考自动驾驶仿真工具的发展轨迹先开源社区版本建立生态再卖企业版的私有化部署和数据生成服务。有人说这是“卖水卖铲子”但在一个赛道还很早期的阶段卖水卖铲子往往是活得最稳的方式。3.3 数据采集与标注服务也被低估的赛道你可能觉得数据服务不够“高大上”但现实是Physical AI领域最缺的就是高质量操作数据。现在很多具身智能团队在实验室里跑得很欢一到真实场景就趴窝原因往往就是训练数据的覆盖度不够。所以“构建面向Physical AI的高质量操作数据集”是一个被严重低估的创业方向。具体做法可以是搭建一套机器人遥操作数据采集工作站雇佣操作员用穿戴式设备控制机器人完成各种任务同时记录多模态数据也可以做自动化数据增强工具把已有的操作数据通过换背景、换物体纹理、变光照、改动力学参数等方式生成更多样性的训练样本。这件事听起来很苦很累但壁垒恰恰就在这里——越苦越累的活大厂越不愿意亲自下场做而这正是创业公司的机会。3.4 AI Infra和部署工具链被忽略的硬需求机器人团队最常见的痛点是部署难。模型在GPU服务器上跑得好好的一到机器人主板上就各种问题算子不支持、显存不够、延迟超标、精度下降。这个痛点背后是一整套面向机器人场景的AI推理优化工具链需求轻量化的模型转换工具、高性能的推理引擎、适配各种异构芯片的中间层。可以这么说在自动驾驶行业英伟达的Drive平台、地平线和一些工具链公司已经把这个需求市场教育得差不多了机器人行业还在早期谁先做出好用的部署工具谁就有机会定义标准。关于“AI编程”和“AI辅助开发”这个话题也有观点认为未来3-5年Physical AI的研发效率会极大地依赖AI辅助工具。模型的代码生成、仿真场景的自动构建、数据管线的自动调优这些都会有“AI for AI”的二次开发需要。所以如果你既懂AI又懂工程往“AI辅助Physical AI开发工具”这个方向扎也是一个卡位的选择。4. 从想法到落地想入局Physical AI的人该做什么4.1 先分清自己想做的是哪个层次我见过太多人一开口就说“我要做具身智能创业”但问他聚焦在哪个环节、解决哪个具体痛点他就沉默了。Physical AI的产业链足够长从最底层的大模型训练、世界模型研究到中间的仿真平台、数据服务、部署工具链再到上层的机器人本体、场景应用每个层次都有机会但每个层次对团队能力的要求完全不同。我的建议是先想清楚自己的核心壁垒是什么。如果你擅长算法可以扎进VLA模型或者世界模型的某一个具体模块如果你擅长工程可以做部署优化工具或者仿真平台如果你擅长行业理解可以绑定一个具体场景比如咖啡店、药店、仓库做场景化的机器人解决方案。最怕的是什么都想碰结果什么都做不深。4.2 赶紧补足这几个技术短板不管你现在是做什么方向的如果想切入Physical AI我建议按优先级补齐这几个能力第一3D视觉与空间感知。Physical AI和普通AI最大的区别就是它必须理解三维空间。相机标定、点云处理、位姿估计、空间变换这些是基本功没有这个基础后面所有工作都做不了。第二运动规划与控制理论。你不需要成为控制论专家但至少要看得懂RRT、MPC、阻抗控制这些概念理解“生成轨迹”和“执行轨迹”之间永远有差距。第三仿真工具链的使用。至少把Isaac Sim、MuJoCo、PyBullet其中一个玩熟能独立搭建一个简单的机器人操作仿真环境。第四模型部署与优化。至少要会用TensorRT、ONNX Runtime这些推理框架理解量化、剪枝的基本原理。4.3 动手做一两个真实的小项目看再多的文章和视频都不如亲手做一个项目学得快。我会建议你先做一个小型但完整的Physical AI项目比如用一台带机械臂的移动机器人实现一个“感知桌面物体并抓取到指定区域”的功能。这个项目虽然简单但涵盖了感知、规划、控制、数据采集的完整链路做完之后你对整个系统的痛点会有非常直观的感知。做完这个基础项目可以再往上加需求比如让机器人根据自然语言指令完成操作这就引入了VLA模型比如让机器人在仿真环境里反复训练再迁移到真实环境这就涉及仿真到现实的迁移问题。一步一步往深了做你的技术栈自然就搭建起来了。5. 行业观察与避坑指南5.1 最大的坑把大模型思维直接搬到物理世界这几年大模型太火了火到很多人产生了一种错觉只要模型够大、够聪明什么问题都能解决。但物理世界不是文本世界。在文本世界里你让模型“编一个故事”它编得离谱一点读者顶多觉得无聊在物理世界里你让机器人“倒一杯水”倒偏了就可能烫到人。物理交互是有不可逆后果的这种“物理事故成本”让Physical AI不能像大模型那样“先上线再修”。所以做Physical AI一定要建立“安全优先”的工程观。自动驾驶行业花了巨大代价才建立起来的一套方法论——冗余感知、安全兜底、功能安全等级划分、极限场景测试——到了Physical AI时代一个都不能丢掉。这也是我为什么看好张颖这类从量产一线出来的人因为他们的基因里已经刻着这套方法论了。5.2 第二个坑低估仿真到现实的差距很多人觉得我在仿真的环境里训练得很好那搬到真实世界也应该没啥问题。这是新手最容易犯的错误。仿真和现实之间存在一道“现实鸿沟”仿真的物理引擎再先进也无法完全模拟真实的摩擦力、材质形变、传感器噪声、环境光照变化。自动驾驶行业为了解决这个问题发明了“域随机化”——在仿真里故意把光照、纹理、物理参数随机打乱让模型见过各种奇奇怪怪的组合从而在真实世界里具备更强的泛化能力。这个方法在Physical AI领域同样适用但难度更高因为机器人的触觉、力觉反馈是现在仿真最难模拟的部分。在做项目规划的时候一定要把“仿真-现实迁移”的时间和成本算进去。我的经验是一个在仿真里跑通的机器人操作策略迁移到真实机器人上至少还要花仿真阶段一半多的精力去调优和适配。5.3 第三个坑只看Demo不看数据飞轮我给很多创业者和投资人的建议是看一家Physical AI公司不要看它的Demo视频有多炫要看它的数据飞轮跑没跑起来。一家公司的机器人如果只能在演示环境里动说明它只是“算法表演”阶段如果它的机器人已经在用户现场部署并且每天都在产生新数据回传到训练系统用新数据持续优化模型并回灌到机器人端这才算真正进入“产品闭环”阶段。数据飞轮的搭建恰好是自动驾驶量产公司的强项。张颖在做的事情大概率就是想把这个能力复制到Physical AI领域。道理很简单谁掌握了数据闭环谁就掌握了持续进化的能力谁掌握了持续进化的能力谁才有资格谈“通用”。5.4 关于标准和安全验证早期布局才是明智之举我在搜索热词里看到ISO 34505:2025《自动驾驶测试场景评价与用例测试生成》这个标准被大量检索说明圈子里的同行们对测试标准和安全验证的重视程度在快速提高。这个标准虽然是面向自动驾驶的但它的方法论——从场景库构建、用例生成、仿真评价到实车验证——对整个Physical AI行业有极强的参考价值。Robotaxi和自动驾驶行业这十年的惨痛教训就是安全验证体系必须跟技术研发同步搭建等到出事再补已经晚了。Physical AI要走进家庭、进入工厂必然会遭遇更严格的安全监管和市场信任挑战。我的看法是早期就把测试场景库、用例生成工具、安全评价体系这些基础设施考虑进去的团队未来的路会走得更稳而这些经验恰恰是自动驾驶量产老兵们最熟悉的领域。6. 写在后面的一些个人体会最后说点我自己的感受。我身边很多做自动驾驶的朋友今年多少都有点迷茫觉得行业商业化比预期慢技术瓶颈又很明显资本也不再像前几年那样疯狂涌入。但我觉得自动驾驶这十年的积累并不会白费它给整个行业留下了一支被训练过的工程师队伍一套成熟的方法论一套完整的供应链体系。现在这批人去搞Physical AI本质上是在把过去十年的经验和教训“搬砖”到一个更大的市场。我自己也是从自动驾驶背景出发现在关注Physical AI的创业生态。如果你恰好也在考虑转型或者已经在做相关项目我的建议是不要被每天的热点带着跑先想清楚自己在整个产业链里的位置想清楚自己的独特优势是什么然后选一个足够窄的切入点扎进去把一个垂直场景打穿再去想扩张的事。毕竟物理世界是一个比数字世界大得多的金矿但挖矿需要耐心也需要铁锹前者靠心态后者靠技术两者缺一不可。