全明星阵容聚焦灵巧手!T-Rex如何解决触觉添加难题,推动具身智能发展?

发布时间:2026/7/22 22:29:25
全明星阵容聚焦灵巧手!T-Rex如何解决触觉添加难题,推动具身智能发展? 【全明星阵容齐聚具身智能】李飞飞ImageNet奠基人美国三院院士Trevor Darrell伯克利BAIR联合创始人他的Caffe深度学习框架曾是计算机视觉领域最广泛使用的平台之一Jitendra MalikR - CNN的核心贡献者之一深刻影响了计算机视觉的发展轨迹同样美国三院院士Pieter Abbeel深度强化学习先驱伯克利机器人学习实验室主任、BAIR实验室联合主任ACM计算奖得主Ken Goldberg机器人学泰斗30年前就深耕机器人抓取和自动化IEEE会士Jim Fan英伟达GEAR实验室掌舵者具身智能领域最受瞩目的年轻学者之一。具身智能学术圈迎来如此全明星阵营他们齐聚具身智能关注点却是灵巧手。【T - Rex要解决的问题】T - Rex从何而起要解决什么问题自动驾驶靠纯视觉有可能解决问题但机器人尤其是灵巧手却很难。手指、手掌进行精密复杂操作时很难只用摄像头记录运动数据360°无死角的视频数据量庞大机位也没法布置不同任务类别很难像自动驾驶那样形成标准化数据集导致模型泛化性受限。因此给模型加入触觉这个数据模态能使感知精度更高、操作更精准细腻还可形成较为标准的数据集。然而T - Rex团队把触觉力信号直接拼接到一个预训练好的VLA模型里任务成功率从17%掉到了6%。论文把原因拆成三层第一层数据太贵现有的大规模机器人数据集主要面向平行夹爪而灵巧手遥操作成本是平行夹爪的5到10倍第二层频率对不上视觉模型处理一帧图像只能跑到5到10Hz而触觉反应需要20Hz以上第三层表征太浅很多方法把触觉当成静态数字而触觉本质是时序信号。【T - Rex的解决效果】在12项真实世界的灵巧操作任务上T - Rex平均成功率达到65%比最强纯视觉基线的35%高出了30个百分点。翻书页96%对68%开锁70%对0%纯视觉方案在开锁任务上完全被碾压。消融实验显示把T - Rex的触觉输入全部拿掉成功率从65%掉到42%降了23个百分点12项任务里超过三分之一的有效操作纯靠“手感”撑着。数据效率也惊人仅给10条微调演示时经过中期训练的T - Rex能达到约40%成功率没经过中期训练的模型直接归零这说明模型真正理解了动作的通用手感。由此可见视觉数据对灵巧手来说本质上不够用触觉不是锦上添花而是必选项。谁先解决“触觉怎么加”的架构问题谁就可能在灵巧手赛道上卡住位置。【T - Rex的核心思路与架构】T - Rex的核心思路是给触觉单独开一条高速通路而不是让它和视觉挤在同一条慢车道上。整体架构叫Mixture - of - Transformer - Experts三个专家分工明确。Latent Expert处理视觉和语言预测未来的视觉表征为模型提供大局感Action Expert做低频动作规划参数量1.41B是三个专家里最大的跑一次管一个动作块Tactile Expert做高频触觉精修参数量只有0.62B轻量到可以频繁触发。关键机制是Cascaded Flow Matching扩散去噪通常需要10步才能从一团随机噪声变成一个干净的动作轨迹而T - Rex在第4步处一切两半前6步由Action Expert完成生成半成品后4步由Tactile Expert接手注入实时触觉数据完成精修。作者团队通过实验发现第4步刚好处在“该有的形状都有了但细节还能改”的黄金位置。【触觉信号编码与工程细节】触觉信号怎么编码是另一个关键设计。触觉传感器有零点漂移和高频噪声T - Rex用VQ - VAE把过去16帧约0.5秒的力历史压缩成64个离散码字不同接触状态会被自动聚类到不同的码字上这样过滤掉了传感器漂移还让触觉信号变得可解释。还有两个工程细节第一个是让码本“活起来”T - Rex定期检查闲置抽屉主动塞数据激活它确保所有码字都被利用起来第二个是给“有手感”的时刻更高权重T - Rex给高力帧更高的学习权重让模型把算力集中在关键接触点上。【T - Rex的训练策略】T - Rex采用三阶段训练先在大规模人类视频上预训练22,889小时让模型看懂“人是怎么动的”再用100小时遥操作数据做中期训练覆盖207种物体和22种动作基元目的是把人类视频里的运动知识迁移到机器人本体上最后用约100条任务演示做后训练快速适配特定需求。其中最核心是中期训练解决了人手和机械手抓杯子方式不同的问题让模型理解不同动作在不同物体上的执行方式。有了这个基础最后阶段只用100条任务演示就能快速适配。【T - Rex的技术价值与行业影响】T - Rex的技术路线表明视觉和触觉在灵巧操作中是并行关系它用异步架构解决频率不匹配矛盾用时序编码让传感器信号可解释用基元组合覆盖策略替代特定任务深度堆叠为灵巧手的触觉利用提供了可复用的系统方案。灵巧手赛道的争论集中在关节运动形式和自由度数量但学术前沿核心关注的是算法能否用好硬件。传统大模型范式缺乏针对触觉模态的有效利用方案T - Rex团队跳出硬件参数争论探索灵巧手做精细操作需要的数据给出了能泛化的方案。T - Rex研究的关键前提是Sharpa Wave提供的硬件基础反过来T - Rex的算法探索也给硬件提出了新要求。T - Rex的软件、SHARPA的硬件探索方向后续可能带来深刻变化。首先灵巧手可能从具身智能本体中分化出来成为独立赛道若触觉数据成为核心壁垒谁掌握相关能力谁就掌握议价权其次可能启发更多专用场景的具身应用T - Rex证明在垂直场景用专用方案可取得比“通用”方案更好的效果。【作者简介】牛丹彤UC Berkeley PhD CandidateNVIDIA Gear Lab实习生导师Trevor Darrell主要从事具身灵巧手大模型的研究曾以第一作者或共同第一作者身份在CVPR, ICML, ICLR等国际顶级会议上发表论文8篇领导或主要贡献T - RexEgoScale等工作目前谷歌学术引用1100 。刘卓洋北京大学元培学院本科生导师仉尚航目前在UC Berkeley访问导师Trevor Darrell主要从事具身多模态推理大模型方向的研究曾以第一作者或共同第一作者身份在ICML, ICLR, NeurIPS, ICRA等国际顶级会议上发表论文6篇其他参与论文共计15篇目前谷歌学术引用400余次曾获2026商汤奖学金全国30人2025北京大学学术新星提名北京大学元培学院年度科研奖励北京大学新生奖学金等。Trevor Darrell教授开发了Caffe深度学习库该库在深度学习领域具有重要地位推动了深度学习技术的发展。他现在是加州大学伯克利分校Berkeley DeepDrive研究中心的主任同时担任伯克利EECS系计算机科学分部的教职并受聘于加州大学附属的国际计算机科学研究所ICSI研究方向涵盖大规模感知学习算法等多种场景研究兴趣包括计算机视觉、机器学习等。