AGI已到?从Astra发布与跑分争议看大模型真实能力

发布时间:2026/9/9 17:19:49
AGI已到?从Astra发布与跑分争议看大模型真实能力 黄仁勋在社交平台上公开祝贺OpenAI发布Astra并抛出一句“AGI已经到来”紧接着Gary Marcus就站出来泼冷水“现在判断AGI到来为时过早。”这两种声音放到一起等于把大模型行业最核心的争议摆到了台面上我们到底该怎么定义AGI以及我们是不是真的已经走到了那个临界点。这篇文章不打算当复读机把两个人的原话再念一遍。我想从事件本身出发拆一下Astra这个模型到底做了什么黄仁勋为什么敢说AGI已到Gary Marcus的质疑又凭什么站得住脚。再把最近社区里吵得很凶的“GPT-6跑分作弊”这个话题一起聊掉。如果你是做大模型应用、AI产品或者日常重度使用模型的开发者和从业者这篇文章也会给你一些实际可用的判断方法和落地建议而不是停留在概念口水战里。1. 一场关于“AGI是否已来”的正面交锋1.1 事件还原Astra发布与隔空对话这次事件的导火索是OpenAI对外发布了新一代多模态模型Astra。按社区的说法Astra对应的就是传闻已久的GPT-6这一代旗舰模型。与以往偏重文本能力的迭代不同Astra把重点放在了“多模态统一理解”上文本、图像、语音、视频以及复杂的多轮任务规划全部由一个模型在端侧和云端协同完成。你给它一段视频它能实时解读画面里的环境变化你给它一堆混杂语音和文档的材料它能直接抽取关键信息并执行后续动作。这种“全能感知统一推理”的形态确实把大模型的输入边界又往外推了一大截。紧接着黄仁勋在公开场合和社交平台上为OpenAI站台核心信息就一句AGI已经到了。他的理由是模型在感知、理解、推理和生成这几个维度上已经全面接近甚至超过普通人的水平加上算力还在持续指数级增长继续否认AGI的到来已经不太符合工程现实。Gary Marcus的反应则完全相反。作为纽约大学荣休教授、认知科学家他对深度学习的批判不是一天两天了。他很快发文回应大意是Astra确实是一个很漂亮的工程演示但它和真正的AGI之间还隔着“稳健性”“因果理解”“世界模型”这几座大山。一个模型能在精心设计的演示里表现得像人和它在真实世界里像人一样稳定地解决问题是两件完全不同的事。一正一反两个人其实是在用不同的坐标系评价同一件事。黄仁勋的坐标系是“工程能力”Gary Marcus的坐标系是“科学定义”。这两个坐标系不统一争论就很难有结果。1.2 两个人为什么各说各话要理解这场争论得先搞清楚两个人的身份和立场差异。黄仁勋是NVIDIA的掌舵人他的视角天然是“算力驱动一切”。在他的商业逻辑里AI能力越强对加速卡的需求就越大AGI如果真的到来意味着整个社会需要海量的算力去支撑训练和推理。GPU是AI时代的“石油”这句他自己反复强调的话本质上就是说AI进步的最大瓶颈不是算法不是数据而是算力本身。所以他说“AGI已到”是一句既能鼓舞开发者士气、又符合商业叙事的判断。这一代模型确实在视觉、语言、语音、视频等能力上实现了大融合从产品体验的角度看它已经像一个“什么都能干的AI助手”。用工程标准来衡量说AGI“已到”并不是完全没有依据。Gary Marcus则是从认知科学的角度出发。他一直强调人类智能的核心不是“查资料快”或者“模式匹配强”而是能够建立因果模型、理解物理世界、在遇到新情况时做出稳健的判断。他之前就批评过大语言模型是“超级模式匹配器”现在看到Astra虽然感知能力更丰富了但核心架构还是“下一个token预测”那一套自然认为离AGI还差得远。这两个人说的“AGI”其实根本不是同一个东西。黄仁勋说的是“能力达到一定阈值的超级AI助手”Gary Marcus说的是“具备真正理解和稳健推理的通用人工智能”。类比一下一个学生考试次次满分体育老师说他“德智体美劳全面发展”语文老师却说他“阅读理解还欠火候”两个人看的是同一张成绩单但评价的标准完全不同。2. 黄仁勋说AGI来了他的逻辑站得住吗2.1 算力信仰与工程驱动黄仁勋的判断背后有一条非常清晰的逻辑链模型能力取决于参数规模、数据规模和算力投入而这三者都在持续增长既然模型在大量标准化任务上的表现已经超过了人类平均水平那从“能做事的程度”来看AGI就是一个可以接受的结论。这个逻辑在工程领域是自洽的。你去问一个做自动驾驶的工程师他会觉得“能自己开车的AI已经是AGI”你去问一个做客服机器人的团队他们会觉得“能独立处理80%用户问题的AI已经够智能”。行业里对AGI的期待从来不是“像人一样全能”而是“能不能把具体的事情做好”。Astra在视频理解、多模态交互和任务执行上的表现确实把“能做事的边界”又扩大了一圈。而且模型能力正在从“单点专家”走向“通用底座”。过去你做一个图像识别系统要单独训练一个视觉模型做一个语音助手要单独做一个语音模型。现在Astra这类多模态模型把文本、图像、语音、视频的学习统一到了一个架构里开发者只需要在通用底座上做适配就能完成过去需要多个专用模型才能做的事。这种“底座化”的趋势确实让AI更像是“通用智能”而不是“专用工具”。2.2 具身智能黄式AGI的最终落地黄仁勋心里的AGI大概率不是坐在电脑前聊天的那种AI而是能与物理世界交互的“具身智能”。这也是他这两年反复讲机器人、讲自动驾驶、讲数字孪生的原因。在他的构想里大模型是大脑GPU是神经系统机器人是手脚三者结合起来的智能体能在真实世界里干活那才是真正的AGI。从这个角度看Astra这种多模态模型的重要意义就不只是在聊天框里回答问题了。它能理解实时视频就能成为机器人的视觉感知系统它能做长程任务规划就能成为自动驾驶的决策大脑它能统一处理语音和文本就能成为智能家居、工业控制的中枢。黄仁勋说“AGI已到”他想的其实是“支撑AGI的算力底座和模型形态已经就位了”。但要承认这条逻辑链里有一个跳跃算力和模型形态就位不等于智能本身已经成熟。你有了一个聪明的大脑但身体的协调性、环境的适应性、系统的稳定性都还没跟上。说“零件都齐了机器就造好了”多少有点把过程当成了结果。3. Gary Marcus的质疑为什么他说为时过早3.1 会说≠会理解语言模型最大的陷阱Gary Marcus的批评核心永远在“理解”两个字上。他有一个很形象的比喻大语言模型像是一个背下了海量题库的学生你问它问题它总能给出一个听起来合理的答案但这个答案到底是“理解后的推导”还是“记忆中的检索”模型自己也不知道。这个说法并不是抬杠。大模型的训练目标就是“预测下一个token”它学到的是词语之间的统计规律而不是物理世界里的因果关系。你问它“苹果为什么会掉到地上”它能给你写一篇牛顿力学的小作文但这不代表它“理解”了引力。它只是在海量文本里记住了“苹果落地”和“万有引力”经常一起出现。Astra加入多模态能力后这个问题依然存在。它能“看”视频但不等于它“理解”了视频里的物理规律。你给它一个杯子从桌子上滑落的视频它能描述“杯子掉下去了”但它未必能像人一样预判“这个杯子会碎”。这种对物理世界的直觉理解恰恰是人类智能的基础也是Gary Marcus认为当前模型最欠缺的部分。3.2 稳健性、因果推理与评测失真除了“理解”问题Gary Marcus还反复提到“稳健性”。人类司机在有雾、下雨、夜里、陌生路况下都能开车但自动驾驶系统哪怕只遇到一个训练数据里没有的极端场景就可能全线崩溃。大模型也一样你问它一个它见过的题型它能答得滴水不漏换一个反事实的、训练数据里没有的逻辑题它可能立刻翻车。这种“平时满分、突发零分”的现象在行业里太常见了。我做过一个测试问同一个模型两遍同一个问题只是把其中的地点从“北京”换成“上海”模型给出的推理链条甚至结论都对不上。这暴露的是模型对“事实”和“逻辑”的建模非常脆弱。一个连句子里的实体换了之后就改变答案的模型说它是AGI确实让人心里打鼓。Gary Marcus真正反对的是大家把“漂亮的演示”误当成“成熟的智能”。他在多次访谈里都说过一句话大模型的成熟度更像是“到处是漏洞的电子游戏Demo”玩家看预告片觉得神作预定实际玩起来才发现满屏Bug。Astra的演示视频确实震撼但它是精心策划、多次重录之后的结果。真实环境里的表现能不能稳定维持这才是AGI争论的核心。而恰恰在这些方面现有的测评数据还远远不够。4. 跑分疑云从“GPT-6跑分作弊”看大模型评估4.1 质疑从哪里来测试集污染最近社区里有一个很热闹的话题就是“OpenAI GPT-6跑分作弊是怎么一回事”。虽然我没办法给你一个最终定论但这个争议本身非常值得聊因为它戳中了大模型评估体系里一个长期的痛测试集污染。所谓测试集污染指的是模型在训练阶段已经“见过”了评测题目或答案。这就像考前拿到了真题卷考试分数再高也不能说明真实水平。公开的基准测试集比如MMLU、GPQA、HumanEval这些长期挂在互联网上模型训练时抓取的数据里可能早就包含了这些题目的内容和答案。一个模型如果真的在训练数据里“背”过这些题它跑出来的高分就不是“真实能力”的反映而是“记忆能力”的累计。社区质疑GPT-6跑分主要怀疑点也在这里模型在某些基准上的分数涨得“过于顺滑”而且上涨幅度远超大家对其推理能力提升的感知。这种“跑分很高、上手一般”的反差感让不少人觉得分数不值得太当真。我知道的实际情况是很多第三方机构为了解决这个问题已经开始用“私有测试集”“动态生成题目”“人类专家盲评”等方式重新评估模型尽量避开“题库泄露”的坑。4.2 一种更靠谱的评估方法论对于普通开发者和从业者我觉得与其纠结哪家模型跑分高不如自己建立一套“以任务为导向”的评估体系。跑分只能告诉你“这个模型在标准化考试里大概什么水平”但要决定“这个模型能不能接入我的业务”必须做场景化实测。我建议的评估流程是这样的第一整理自己的业务数据集。不要用网上的公开评测集而是把你业务里真实的问题、真实的用户输入、真实的边缘情况收集起来。可以先用几百条小样本快速判断模型在你场景里的基础表现。第二设计“反事实”测试题。专门找一些公开数据里不太可能出现的组合。比如你做法律问答就问“如果某条法律假设与另一条冲突法院会倾向哪种裁判逻辑”你做客服就问“如果用户把产品型号说错了但描述的特征是对的模型能不能识别”。这种题最能暴露模型是在“套模板”还是“真理解”。第三做回归对比。把新的模型和老模型放到同一批测试集上跑关注的不只是准确率还有回答的稳定性、格式是否统一、极端场景下是否崩溃。我见过不少案例新模型跑分全面碾压旧模型但真接到线上用户满意度反而下降因为新模型更喜欢“自由发挥”输出格式漂移严重。第四引入人工抽检。机器评估只能看“对不对”人工抽检才能看“好不好”。让业务人员给模型的答案打分关注逻辑性、可解释性、用户体感。这一步虽然成本高但在模型上线前的那一两周请业务侧的人花半天时间集中过一遍典型case比看一万个跑分数据都有用。我一直跟团队强调一句话跑分是广告业务测试才是体检。广告可以说得天花乱坠体检报告才能决定你买不买这份“保险”。5. 对开发者和团队的实操启示5.1 别把AGI当标准把能力当指标AGI到底来没来对写代码、做产品的我们来说其实没那么重要。真正重要的是搞清楚“今天这个模型能帮我做什么、不能做什么”以及“我该怎么把它接入到业务里”。我见过不少团队看到“AGI已到”的宣传立刻决定把核心流程全面AI化结果上线后模型在边缘case上翻车只能连夜回滚。反过来也有团队对AI特别保守新产品全部拒绝接入模型结果竞品用AI把成本砍掉一半自己毫无还手之力。这两个极端都不可取。更合理的思路是把模型当作一个“能力模块”哪些环节适合接、哪些环节不适合接逐一验证。适合接的往往是容错率高的环节比如文本初筛、内容摘要、知识库问答、代码建议不适合一上来就全自动的是那些出错代价极大的环节比如医疗诊断、金融风控、法律裁决。在这些领域模型可以做辅助但决定权必须留给人。5.2 新模型引入流程从POC到上线如果你所在团队准备接入Astra这类新一代多模态模型我建议按下面这个流程推进第一步定义“成功标准”。不要只写“提升效率”这种空话要写具体指标。比如“工单分类准确率从85%提升到93%”“用户等待时长从40秒降低到15秒”“客服介入率从50%降到30%”。有了量化标准后面评测才有据可依。第二步小范围POC。挑一个成本低、影响面小、数据现成的场景先跑起来。比如先做一个“会议纪要自动生成”或者“客服知识库问答”用真实数据跑两到三周观察效果和问题。第三步做A/B测试。把新模型和旧方案放到同一批流量里对比。建议按5%到10%的流量切给新方案观察一周以上。关注的不只是准确率还有延迟、成本、用户投诉率。如果新方案在竞品指标上没有全面超越旧方案不要急着切全量。第四步灰度扩大与监控。数据没问题后逐步把流量扩大到30%、50%、100%。全程保留旧方案作为兜底一旦新模型出现严重问题要做到一键回滚。整个过程大概需要两到四周但它能帮你避免“上线即翻车”的尴尬。做AI应用最贵的从来不是API调用费用而是上线之后才发现方向错了。5.3 个人开发者可以怎么用对个人开发者来说Astra这类模型带来的最直接变化是“多模态应用的开发门槛大幅降低”。以前你想做一个“识别图片里的产品缺陷并生成报告”的小工具得叠视觉模型、OCR模型、文本生成模型三套技术栈。现在用一个多模态模型加几十行代码就能搞定。你想做一个“根据语音指令整理日程并生成邮件”的助手过去要接语音识别、意图理解、文本生成好几个服务现在一个模型就能端到端完成。这种“从拼装到一体”的变化其实比AGI争论更值得关注。它意味着个人开发者有机会用极小的团队去做过去只有大公司才能做的智能应用。Astra这个级别的模型本质上是一个“智能底座”你只需要在底座上铺业务逻辑。至于它算不算AGI真没那么重要。你关心的是它能不能不眠不休地处理你业务里的脏活、累活、重复活。6. 常见的认知误区与判断小技巧6.1 五个高频误区误区真实情况后果AGI 全知全能当前模型只是在很多任务上接近人类水平远未达到“无所不能”对模型抱有不切实际的期望上线后被边缘case打脸跑分高 能力强公开基准测试可能存在测试集污染分数与实际体验经常脱节选型失误被“高分模型”坑进生产环境演示效果好 产品成熟演示视频是精心挑选、多次重录的“高光时刻”不能代表平均表现把Demo当成品用户一用就发现落差算力堆够了 AGI自然到来算力是必要条件而非充分条件算法与数据同样关键盲目堆算力、烧预算忽视数据质量和算法改进能对答如流 有真正的推理能力模型擅长“模式匹配”遇到新题型、反事实问题时容易翻车把模型输出当权威结论在关键决策上吃大亏这几个误区我在实际项目中都踩过。尤其是“跑分高能力强”这条基本是每个AI团队选型时都会经历的坑。现在我看到一家模型供应商放出漂亮的跑分表第一反应不是兴奋而是找他们要一份评测集的样本看看里面有没有跟业务场景重叠的内容。6.2 快速判断模型真实水平的方法如果你没有太多时间做完整评测可以用几个速测方法快速判断一个模型的“成色”。第一个问它一个很“冷”的问题。找那种公开资料极少、你自己非常熟悉的领域让它做深度解释。如果它能讲出连你都要想一想的细节说明它的知识图谱很扎实如果它开始编造听起来专业但实际错误的术语说明它只是在“一本正经地胡说八道”。第二个给它一个反事实假设。比如“如果重力变成原来的两倍飞机设计会有什么变化”“如果人类没有发明轮子城市形态会如何演变”。这类问题没有标准答案模型必须靠真正的推理来组织逻辑。编得有条理说明它有不错的逻辑能力只会复述常识说明它还在“套模板”。第三个做多模态交叉验证。Astra这类多模态模型你可以给它一张图、一段文字、一段语音让它分别描述然后比较描述的一致性。如果输入不同模态但表达同一个意思它能给出统一的结论说明跨模态对齐做得不错如果结论互相矛盾说明它的多模态能力还是“拼装”的不是真正融合的。第四个测稳定性。同一个问题反复问五遍看看答案是不是基本一致。一份稳定输出的模型哪怕不是最聪明的至少是可以“用”的一个情绪波动极大的模型就算偶尔惊艳放生产环境也是定时炸弹。这些小技巧都不需要多少成本几分钟就能对模型有一个粗略但准确的认识。看完之后你大概就能判断黄仁勋口中的“AGI已到”和你手里的实际需求之间还有多少距离。我在实际测试Astra这个级别模型时整体感受是它确实很聪明大量日常任务的完成度已经高得吓人。但我也遇到了一些典型的“AI式翻车”比如对视频里物体空间关系的判断出错、在长程规划的中段突然忘记最初目标、对模糊指令过度解释。这些问题都在提醒我我们距离真正的AGI还有一段需要耐心走完的路。但我也必须承认Astra已经让我日常工作的很多环节变得更快了哪怕它只是一个“高级工具”也已经足够改变游戏规则。对我来说这就是这个时代最真实的样子AGI的定义还在争吵但工具已经悄悄换了代。