(2026|CVPR VGI Workshop| 众多大牛)视觉通用智能:白皮书

发布时间:2026/9/3 16:58:17
(2026|CVPR VGI Workshop| 众多大牛)视觉通用智能:白皮书 Visual General Intelligence: A White Paper论文地址Visual General Intelligence: A White Paper本文源于 CVPR 2026 VGI Workshop 的讨论。文中所表达的观点并非旨在为视觉通用智能VGI提供单一定义而是总结了多种视角这些视角为面向通用智能的视觉研究开辟了多样化的可能性。VGI Workshophttps://cvpr2026-vgi-workshop.limitlab.xyz/学术交流群922230617目录1. 引言视觉被低估的智能之源2. 关于视觉通用智能的十个视角2.1 视频模型就是视觉基础模型Robert Geirhos2.2 创造力应成为 VGI 的核心测试Aditi Raghunathan2.3 一个能从 “一个数据” 中持续学习的系统Yuki M. Asano2.4 智能将是多模态、生成式且高效的Deva Ramanan et al.2.5 视觉智能与科学发现David Fouhey2.6 空间 AI 的计算结构是什么Andrew J. Davison2.7 视觉智能即具身智能Yilun Du2.8 通过代码 “看到” 物理世界Shangzhe Wu Jiajun Wu2.8.1 Code World Model2.8.2 思想的共鸣为何 “代码” 是理解物理世界的关键2.8.3 总结从 “看起来像” 到 “本质上就是”2.9 从视觉模型到“视觉原生”智能Zhuang Liu2.10 预测、想象与重建通向通用智能的视觉路径Hirokatsu Kataoka et al.3. 总结与讨论3.1 十个视角的概览3.2 核心共识与开放问题4. 结论1. 引言视觉被低估的智能之源在 AI 的讨论中语言模型几乎成了 “智能” 的代名词。GPT 系列展现出的上下文学习、推理和泛化能力让人们相信 “下一个词预测” 加上足够大的规模和数据就能让智能涌现。然而从地球生命的演化史来看视觉远比语言古老得多。高级视觉系统如相机眼和复眼可追溯到约 5 亿年前的寒武纪大爆发而人类语言、文字系统则是极其晚近的现象。这一事实暗示视觉可能不仅仅是一种感官输入而是一种捕捉世界结构的根本性智能功能。本文汇集了来自计算机视觉、机器人、认知科学、物理学等多领域的 10 位学者及其团队的观点共同探讨一个核心问题从视觉经验中涌现的智能能否成为通向通用人工智能AGI的路径本文称这一研究方向为视觉通用智能Visual General IntelligenceVGI。本文的目标不是给出 VGI 的单一定义而是厘清在 AGI 时代计算机视觉应该追求的原则、输入模态、基准、学习范式以及视觉与其他模态尤其是语言之间的关系。2. 关于视觉通用智能的十个视角2.1 视频模型就是视觉基础模型Robert Geirhos核心观点将语言模型成功的范式大规模生成式训练 网络级数据直接迁移到视频生成模型就能解决视觉智能问题。理由有三规模驱动Rich Sutton的 “苦涩的教训” 表明规模一直是 AI 进步的最大驱动力视觉模型没有理由例外。生成式目标更难、更好分类任务太容易模型可以偷懒例如用 “草地” 预测 “奶牛”。但生成式模型必须把一切——物体、背景、纹理、光照、阴影——都做对否则就会被损失函数惩罚。任务越难学到的世界知识越丰富。视频是视觉任务的超集视频生成包含静态图像作为特例是最通用的视觉任务框架。重要发现他们最近的实验表明像 Veo 3 这样的生成式视频模型——未经任何任务特定训练——仅通过 “图像→视频” 生成就能执行边缘检测、目标分割、关键点定位、超分辨率、图像编辑、风格迁移甚至简单的视觉推理如迷宫求解、图遍历。这意味着一个为娱乐而训练的视频模型恰好在无意中成为了一个视觉基础模型。一句话总结视频生成模型正在走语言模型的老路——规模生成能力涌现。2.2 创造力应成为 VGI 的核心测试Aditi Raghunathan核心观点智能不仅仅是解出唯一正确答案的题目。真正的智能需要创造力——在开放场景中提出新颖、有用且连贯的方案。创造力的两种形式借鉴认知科学分类组合性创造力在熟悉元素之间建立意外的、有意义的联系如类比、双关。探索性创造力在规则或约束下构建新模式如设计新蛋白质、新机械结构。评估创造性视觉智能的三个维度连贯性Coherence输出必须满足物理、几何、语义或任务约束。结构多样性Structural Diversity不同输出代表有意义的、真正不同的方案而非仅仅是纹理、颜色或视角的轻微变化。原创性Originality输出不应是训练样本的简单复现。关键设计思路通过“种子条件”Seed Conditioning——在训练和推理时向模型提供一个随机潜在变量——可以保证不同随机种子产生不同方案而每个方案内部保持连贯。这与常见的 “输出温度采样” 有本质区别种子决定的是高层布局、机制、轨迹或假设而非解码时的局部随机性。一句话总结一个好的视觉智能系统不仅能 “看到” 和 “预测”还能 “想象出多个不一样的、但每个都自洽的可能世界”。2.3 一个能从 “一个数据” 中持续学习的系统Yuki M. Asano核心观点当前最强的视觉系统令人印象深刻但它们不具备真正的通用性——它们被训练一次然后被冻结部署。真正的 VGI 应该能在其整个视觉生命周期中持续学习无需标签无需重放过去无需事先知道哪些任务重要。想象中的 “视觉大脑” 应包含四个交互系统模块功能感知系统将当前视觉流转换为对象、区域、表面、运动和语义特征空间与动态世界模型维护关于几何、视角、对象身份、运动、因果变化的假设能区分 “自身运动引起的改变”与 “世界自身的变化”多尺度记忆系统在不同时间尺度上存储信息任务与动作接口将学到的视觉知识暴露给下游系统机器人、科学仪器、搜索工具、人类用户语言的角色语言是接口而非组织原则。深度、运动、持续性、容纳、接触、可供性……这些世界结构在被命名之前就已存在。视觉智能系统应该在没有标题的情况下学会这些规律然后才将其与词语连接起来。一句话总结本文需要一个像婴儿一样——没有目标、不说话——但能不断观察、不断理解世界结构的视觉系统而不是一个 “训练完就毕业” 的静态模型。2.4 智能将是多模态、生成式且高效的Deva Ramanan et al.三个 “押注”Bets押注 1视觉智能不会是纯视觉的。多模态信号音频、触觉、本体感觉同样重要。有趣的是当前大多数四足机器人演示包括后空翻是由仅靠本体感觉的盲策略驱动的——闭着眼睛也能翻跟头但视觉的信息论价值最高信息量最大不应被忽视。近场视觉如 GelSight 触觉传感器将触觉重定义为光度立体重建是一个待探索的方向。押注 2视觉智能将是生成式的。他认同 Hinton 的观点——“要识别形状先学会生成图像”。生成模型是自监督学习的自然演变和巅峰。生成模型将 “接管” 表征学习使得像 DINO、JEPA 这样的显式embedding空间表征变得不再必要。押注 3视觉智能将是高效的。OpenAI 停用 SORA 的核心原因是推理成本太高。解决方案包括重新引入循环Recurrence、3D 结构和多尺度处理拥抱低分辨率、低帧率的长期生成更符合实用工作流用强化学习视角看待数据——数据采集的责任应放在学习器本身而非人工整理。数据多样性比规模更重要。一句话总结视觉智能的未来 多模态原始信号预训练 生成式表征学习 极其高效的推理架构。2.5 视觉智能与科学发现David Fouhey核心观点视觉智能应服务于科学发现——从专业仪器的有限数据中提取新知识其挑战远超 CVPR 常见的基准测试。科学场景中的五大挑战挑战说明数据有限无法回到 1970 年重新收集物种数据气候变化对动物形态的影响不能用 “加数据” 解决无真实基准太阳物理只有光子且常为单一视角演化生态学涉及数千万年的深时过程没有 “正确答案” 可对比多模态验证需连接 X 射线观测、原子物理方程等多种来源不能仅凭 “看起来对” 来判断仪器系统误差所有仪器都有非物理属性系统误差模型会同等真实地学习真假信号必须能在数据源头剔除干扰现实难以建模前沿物理中渲染本身就是优化问题干净解仅存在于有限问题集重要体会与科学家合作后发现他们关心的问题与 CVPR 审稿人完全不同——“你的 AI 数据有系统误差吗” “你能捕捉到所有的错误吗”——而不仅仅是表格里的加粗数字。一句话总结科学场景中的视觉智能核心是“用有限的、有噪声的、无基准的数据结合领域知识做出可验证的判断”。2.6 空间 AI 的计算结构是什么Andrew J. Davison核心观点Spatial AI——让设备建立丰富而高效的周围环境表征并以人类般通用的方式与之交互——需要关注计算结构什么被计算、存在哪里、如何连接。关键概念表征一组描述设备和世界状态的值必须持久但可适应随着新信息或世界变化而不断更新。SLAM同步定位与地图构建是最清晰的例子——增量构建持久世界表征实现了一致的长期行为。机器学习与状态估计SLAM 尚未被 ML 完全主导。最好的定位和稀疏建图方法仍然是手工设计的几何与概率状态估计算法。未来的系统将无缝集成学习组件和设计组件但存储和计算的整体结构仍然至关重要。未来硬件处理器将走向细粒度并行、分布式内存、稀疏通信、异步事件驱动、低比特率甚至模拟数值表示。“苦涩的教训” 在于能与这种硬件匹配最好的算法将表现最佳。Belief Propagation置信传播是一个强候选——它在分布式、异步甚至丢包通信中都有强大的收敛特性。一句话总结空间 AI 的未来不是 “纯端到端神经网络” 与 “纯手工设计” 的二选一而是将算法图直接 “地理式” 映射到芯片上追求极致的效率与持久性。2.7 视觉智能即具身智能Yilun Du核心观点VGI 的核心测试是能否让机器人可靠地在物理世界中感知、推理和行动。具身不是 “下游应用”而是视觉智能的闭环视觉引导行动行动的结果又提供改进视觉理解的证据。五个支柱支柱核心思路生成式世界模型将感知视为 “对产生观测的潜在场景状态的推理”通过 “分析-合成” 范式实现对新场景的泛化一致的场景表征跨视角、跨遮挡、跨时间维持实体身份和关系支持增量更新和任务相关检索视觉-行动连接将决策视为条件视觉生成——生成高层视觉轨迹表示 “任务如何完成”底层控制器将其转化为连续动作主动视觉学习通过移动到信息性视点、推动/提起/打开物体来消除感知歧义——行动是获取视觉证据的手段以Held Hein的小猫实验为经典证据持续适应遇到透明/折射等陌生视觉现象时系统应保持可塑性通过 “醒来-睡眠” 过程将在线体验整合到知识中一句话总结一个只被动 “看” 的系统永远无法真正理解世界——具身是检验视觉智能的唯一标准。2.8 通过代码 “看到” 物理世界Shangzhe Wu Jiajun Wu核心观点视觉智能是从视觉观测中恢复物理世界的结构或 “代码/Code”。图像是物理现象的一种测量——场景由特定形状、材质、光照、视角和物理定律下的运动构成。“看到” 就是对这个测量进行反演。需要恢复的五层结构层级内容实体场景分解为物体物体递归分解为部件内禀属性几何、纹理、材质、关节、质量、摩擦、刚度外禀属性姿态、光照、相机负责大部分像素变化应被显式分解出来关系哪个支撑哪个、哪个转动哪个、什么包含在什么中动态状态在外部作用下的变化规律关键洞察一个能渲染出 “杯子落下” 精彩画面的视频模型只说明它知道 “落下的杯子看起来什么样”而不能证明它内部有 “质量” “接触” “摩擦力” 的任何表征。这两者之间的差距只有当你想干预、编辑或行动时才会暴露出来。“代码即结构”物体的层级结构天然适合用程序表达嵌套、循环、参数、断言。LLM Agent 在写代码并验证执行结果方面已非常擅长——这一能力可用于生成可编辑、可模拟、可验证的 3D 资产和操纵程序。问题不在于 “结构 vs 无结构”而在于 “结构如何获得”——一部分结构最适合写成离散程序“左边” “放下”另一部分如一片叶子的精确几何最好保留为学习的embedding。一句话总结生成式模型擅长 “看起来像”而物理理解需要能够被编辑、模拟和验证的可解释结构——代码是表达这种结构的天然语言。【注本节的观点让我想到了 CWM。2026|西湖大学 NTUCWMproxy 视频模型视频生成模型代码世界模型Coding Agent 作为世界大脑2.8.1 Code World ModelCWM 的核心思想与本节有异曲同工之妙。CWM 框架的关键在于它将 “世界如何演化” 和 “世界看起来怎样” 这两个问题彻底分开处理一个代码Agent (Coding Agent) 充当 “世界大脑”它负责理解事件、进行推理、维护世界的持久状态比如游戏里 NPC 的位置、任务状态等并通过生成可执行的代码来驱动整个世界的演化。一个视频生成模型充当 “视觉后端”它负责将代码Agent维护的抽象世界状态“翻译” 成高保真、符合物理规律的视觉画面。简单来说就是用代码保证世界的逻辑不出错用视频模型保证世界的画面足够真实。2.8.2 思想的共鸣为何 “代码” 是理解物理世界的关键本节观点可以看作是 CWM 以及类似研究的理论基础。两者共同回答了同一个问题为什么 “代码” 是通往视觉通用智能VGI的关键路径将两者的观点总结如下对比维度CWM本节核心主张用代码Agent负责逻辑演化视频模型负责视觉渲染。视觉智能的核心是恢复物理世界的“代码”结构。“代码” 的角色是“世界大脑” 的操作语言用于执行规则、更新状态。是物理世界本身的结构化表达用于描述实体、关系、动态。为何用 “代码”保证逻辑一致性和长期可追溯性解决视频模型 “只知结果不知原因” 的困境。代码具有可执行、可验证、可编辑的特性是连接感知与行动的桥梁。目标构建一个逻辑自洽、能持续演化的可交互虚拟世界。让 AI 获得可干预、可模拟、可推理的物理世界理解。2.8.3 总结从 “看起来像” 到 “本质上就是”综合来看无论是 CWM本节的观点都反映了 AI 研究的一个重要转向从追求 “看起来像” 的视觉真实感转向追求 “本质上就是” 的结构化理解。传统视频模型追求的是 “看起来像”。它能生成以假乱真的视频但它并不理解画面中物体之间的物理关系也无法预测干预后的结果。“代码” 驱动的视觉智能追求的是 “本质上就是”。它试图用代码这种精确、可验证的语言来表达物理世界的实体、关系和规律。一旦拥有了这个 “代码”AI 不仅能预测画面更能进行推理、模拟和行动。本节为这个方向提供了理论上的正当性而 CWM 则是一个具体的实现案例。两者共同描绘了一幅未来 AI 的蓝图未来的 AI 不仅要会 “看”更要会 “编写” 它所看到的世界。】2.9 从视觉模型到 “视觉原生” 智能Zhuang Liu核心观点当前大多数系统将视觉视为 “语言的附件”。VGI 应走向视觉原生——将视觉作为获取上下文和提供及时反馈的自然、连续、低摩擦通道。为什么视觉看起来不如语言重要这恰恰说明它更重要人类视觉是极其强大的基线——经过漫长的进化塑造大多数人在几乎无意识的情况下使用它。AI 视觉是在与生物学最成熟的智能系统之一竞争而语言 AI 是在与一个更可变、更依赖文化训练的人类基线竞争。视觉没有像语言那样的符号单位体系——像素太低级图像块是工程便利而非感知基元。语言是压缩后的人类经验视觉是原始经验。视觉学习可能需要比语言预训练多1000 倍甚至 10000 倍的有效计算和数据才能让正确的摘要自然涌现。“视觉原生” 的关键问题该看哪里视觉世界可分解为任意精细的细节但并非所有细节都同等有用。有用的视觉感知单元是任务相关的——系统应在无关区域保持粗粒度在任务相关区域分配细粒度。该收集什么样的数据更多图像/视频 ≠ 更广的视觉经验——如果数据重复、狭窄或有偏。本文需要更好的数据多样性理解而非仅追求规模。一句话总结视觉原生智能的核心测试是——它是否知道 “什么时候该看看哪里以及需要看多细”2.10 预测、想象与重建通向通用智能的视觉路径Hirokatsu Kataoka et al.核心观点VGI 可能通过三个互补的学习目标的汇合而涌现目标功能视觉对应序列预测预期下一步会发生什么预测下一个视觉状态 → 必须推断物体、几何、运动、遮挡、物理约束、时间因果开放生成探索 “可能存在什么”生成高保真图像/视频/3D/物理未来 → 提供内部模拟器的基础重建从不完整观测中推断隐藏结构超分、修复、逆渲染、3D/4D重建 → 恢复空间、尺度、对应、表面、运动和物理一致性三者结合的深层意义如果模型能预测未来视觉状态它就被迫学会 “世界如何演化”如果它能生成任意可能的场景它就具备了 “想象” 能力——可以创建反事实、测试假设、模拟后果然后在行动前完善理解如果它能重建完整结构它就能检测异常、推断不可见结构、理解物理合理性。人类视觉不应成为视觉智能的上限——一个被暴露在超越人类视觉信息多光谱、超分辨率、长时间序列的系统可能获得超越人类中心视觉的智能。一句话总结预测 想象 重建 从视觉经验通向一般智能的三足鼎立之路。3. 总结与讨论3.1 十个视角的概览贡献者核心立场Robert Geirhos生成式视频模型将成为视觉基础模型Aditi Raghunathan创造力连贯多样原创有用应是 VGI 的核心测试Yuki M. AsanoVGI 应在其整个视觉生命周期中持续自主学习Deva Ramanan et al.视觉智能应多模态、生成式、高效David Fouhey视觉智能应支持科学发现——有限数据、无基准、需物理知识验证Andrew J. Davison空间 AI 需要持久的空间表征实时计算高效硬件结构Yilun Du视觉智能即具身智能——感知世界模型行动主动探索持续适应Shangzhe Wu Jiajun Wu视觉智能应恢复可编辑、可模拟、可验证的组合式物理结构Zhuang LiuVGI 应 “视觉原生”——学会 “何时看、看哪里、看多细”Hirokatsu Kataoka et al.预测想象重建三个目标汇合可能从视觉经验通向一般智能3.2 核心共识与开放问题尽管视角各异但它们共享一个关键前提VGI 不应被理解为 “更准确的图像分类器” 或 “附加到语言模型上的视觉编码器”。VGI 关注的是从视觉经验中涌现的智能——发现世界结构、维护并更新知识、预测可能未来、想象替代方案、重建未观测结构、并适应陌生情境。达成共识的方向✅ 生成式学习是核心基石模型必须 “做对一切”✅ 组合式物理结构是必要的不应仅满足于像素级逼真✅ 模型应持久、可适应、能主动获取信息✅ 视觉是世界结构的独立来源而非语言的输入通道未解决的开放问题❓ 仅靠像素预测物体的质量、接触、摩擦等物理属性能否自然涌现❓ 视觉学习应 “先独立后多模态” 还是 “从一开始就多模态联合”❓ 如何在不让模型遗忘过去的前提下持续整合新经验灾难性遗忘的破解❓ VGI 的评估应包含哪些维度单一基准显然不够。4. 结论这篇白皮书的结论是开放而谦逊的VGI 不应被过早地定义为某一种模型或某一种能力。它应被理解为一种更广泛的智能——从视觉经验中获取知识、发现并维护世界结构、想象并评估可能方案、适应新观察、并将视觉知识用于预测、发现和行动。当前系统已经展示了 VGI 的碎片化证据生成式视频模型展现出乎意料的跨任务能力重建模型恢复越来越丰富的几何和物理结构空间系统维持持久表征具身Agent通过交互改善感知和行为。但这些能力仍然是碎片化的、昂贵的、时间受限的、依赖精心选择的数据和训练条件的。一个更紧迫的问题是能否首先观察到智能从视觉经验中涌现出来这需要超越固定任务集上的性能提升寻找可迁移的能力、可检验的世界知识、创造性和反事实推理、主动信息寻求、持续适应、空间和物理一致性以及在陌生情境中的可靠行动。最终的问题不是 “VGI 是否已是通向 AGI 的路径”而是——什么样的证据会让本文相信智能已经开始从视觉中涌现而这正是留给整个计算机视觉社区去回答的问题。