GTC巅峰对话:预训练范式终结与AI推理新瓶颈

发布时间:2026/9/10 7:07:36
GTC巅峰对话:预训练范式终结与AI推理新瓶颈 1. GTC 2026开场这场对话为什么值得熬夜看每年GTCGPU Technology Conference最吸引人的除了各种核弹级硬件发布就是那些站在AI技术最前沿的大佬之间的思想碰撞。而这一次黄仁勋把Jeff Dean和Bill Dally两个人一起请上台搞了一场巅峰对话单从阵容来看就已经算是近年GTC含金量最高的一场了。Jeff Dean是谁不用多说了Google Research的掌门人TensorFlow的创始人之一MapReduce、BigTable这些改变一个时代的技术背后都有他的影子。在深度学习还没有像今天这么风靡的时候他就已经在用大规模分布式系统解决机器学习问题了。而Bill Dally则是NVIDIA的首席科学家图形学、计算机体系结构领域的老泰斗现在整个NVIDIA的GPU架构路线图、CUDA生态的底层逻辑都跟他有直接关系。这两个人坐在一起聊AI的未来基本上可以说是软件派和硬件派两个视角的一次正面碰撞。这场对话最抓人的其实是几个非常大胆的判断第一预训练范式已死第二延迟瓶颈不在计算。这两个观点抛出之后现场的开发者圈子里基本瞬间炸开了锅。很多人第一反应是Jeff Dean是不是在唱衰大模型其实仔细听完两个人的完整阐述会发现他们不是在否定大模型本身而是在说——过去五年我们习以为常的那种堆数据、堆算力、搞一个超大Transformer、然后微调的老套路正在走向终结。这篇文章我就把这场对话的核心观点拆开揉碎结合我自己在AI工程实践里的理解聊聊这几个判断背后的逻辑以及未来五年AI技术栈会往哪个方向走。不管你是做大模型应用开发的、搞AI基建的还是刚入行的算法工程师这篇文章都值得你花十分钟认真看完。2. 预训练范式已死解剖这个劲爆判断2.1 预训练范式的黄金十年过去十年AI领域的最大叙事就是预训练 微调。2017年Transformer架构被提出来之后紧接着BERT、GPT系列模型一路把这条路走通了。它的核心逻辑其实特别简单先用海量的无标注文本把模型喂饱让它学会语言的统计规律和世界知识然后再用少量有标注的数据做微调适配到具体的任务上。这套范式之所以能横扫一切是因为它极度高效。不需要为每个任务从零开始设计特征工程、不需要为每个领域单独标注海量数据一个预训练好的底座模型可以在十几个下游任务上都取得不错的效果。从NLP到CV再到多模态基本是一个Transformer打天下的状态。但是这套范式走到今天其实已经出现了非常明显的结构性瓶颈。第一个问题就是数据。预训练模型对数据的需求是近乎贪婪的GPT-4级别模型的训练数据动辄几万亿token而互联网上真正高质量的文本数据是有限的。不少团队已经开始用合成数据来凑数但合成数据的质量、多样性、偏差问题又成了新的挑战。换句话说预训练时代的燃料正在枯竭。第二个问题是算力成本。训练一个前沿级别的模型电费账单都是千万美元起步的这种成本注定了只有极少数巨头能玩得动。整个行业的创新活力被死死压住学术界和中小团队基本失去了训练基础模型的能力。这不是技术上的问题而是经济模型上的问题。第三个问题也是我认为最根本的问题预训练范式做的是知识的存储和检索而不是问题的解决。一个模型在预训练阶段学到的是世界是什么样的但到了实际应用阶段我们需要的是我应该怎么行动。这两者之间存在着一条巨大的鸿沟。这也是为什么很多大模型在聊天、写文章这些开放式任务上表现惊人但到了复杂推理、工具调用、多步骤规划这些场景里就开始露怯了。2.2 Jeff Dean说的死到底是什么意思Jeff Dean在对话里提到预训练范式已死其实强调的不是预训练模型没用了而是仅仅靠预训练已经不够了。他的完整逻辑链条是这样的下一代AI系统不会是单个巨型模型而是一整套由多个模型、多个工具、多个子系统组成的复杂体系。预训练模型只是这个体系里的一个组件而不是全部。这就像盖房子。预训练模型相当于砖头和水泥它们是基础材料但房子本身还需要钢筋、混凝土、管线、门窗还需要一个总设计师来做整体规划。过去我们把所有精力都花在了怎么把砖头烧得更好上面但真正的竞争已经转移到了怎么设计这整套房屋结构上。所以我们看到Google最近在Gemini上的很多工作其实已经不是单纯追求模型参数的变大而是把大量精力放在多模态对齐、长上下文理解、工具调用、Agent能力这些方向上。这些都是预训练之外的增量。Jeff Dean想表达的核心观点是预训练的下一个阶段是让模型真正学会思考和行动而不仅仅是记忆。2.3 后预训练时代的技术路径如果预训练范式真的在走向终结那接下来的技术路径是什么从这场对话以及过去一年各家的技术动向来看我认为有几个非常明确的方向。第一个方向是从通用底座走向复合系统架构。未来的AI产品不会是一个大模型解决所有问题而更像一个模型超市——系统根据用户请求的类型自动调度合适的模型。简单问题用轻量模型快速响应复杂推理用深度模型慢慢想。这种思路在业内已经有了雏形比如Google的Gemini系列本身就分了Ultra、Pro、Nano几个档位背后就是一套模型路由的逻辑。到了更复杂的场景系统还需要叠加向量数据库、知识图谱、外部API调用、代码解释器等模块形成一套完整的智能体体系。第二个方向是推理能力的深度强化。OpenAI的o1、o3系列模型已经验证了一个判断让模型在推理阶段多想几步能够显著提升复杂问题的解决率。这种做法实际上是把模型在预训练阶段学到的知识和模型在推理阶段进行的计算分开对待。预训练的目的是打下知识基础而真正的智能体现在推理过程中的慢思考上。Jeff Dean和Bill Dally在对话中都强调了这一点这意味着未来模型的差异化竞争会越来越多地从预训练阶段向推理阶段转移。第三个方向是持续学习与在线自适应能力。目前的主流模型训练完之后基本上就冻结了对外部世界的理解停留在训练数据的截止日期。但未来的AI系统需要具备与真实世界持续交互、不断吸收新信息、动态调整自身行为的能力。这个方向目前还没有特别成熟的技术方案但已经有公司在做模型热更新和持续学习的探索。谁能在这一块率先突破谁就能在未来的AI竞争中建立巨大的优势。3. 延迟瓶颈不在计算推理架构的范式转移3.1 从练得动到跑得快AI算力重心正在迁移过去几年整个AI算力产业的核心叙事是怎么把模型训练出来。英伟达的A100、H100、H200Google的TPU v4/v5AMD的MI300系列几乎所有芯片厂商在宣传自己的硬件时卖点都是训练效率提升多少倍。但这场对话里Bill Dally提出了一个非常重要的观点未来AI算力的真正瓶颈不在计算本身而在数据传输和内存带宽。这句话怎么理解我们可以把一次AI推理请求想象成一个餐厅出餐的过程。计算单元GPU的算力核心就是后厨的厨师内存就是后厨的冰箱和储物柜数据传输就是厨师取食材的过程。过去我们一直觉得菜做得慢是因为厨师不够多、手艺不够好于是拼命给后厨加人手增加算力核心。但当我们把厨师加到一定数量之后突然发现瓶颈变成了厨师从冰箱里取食材的速度跟不上大家都在那儿排队等食材后厨再多人也白搭。这就是Bill Dally要表达的核心逻辑推理延迟的瓶颈已经从计算转移到了数据搬运上。实际上这个趋势在AI推理场景中表现得非常明显。以当前最火的大模型推理为例模型参数量动辄几百亿甚至上千亿单次推理需要读取的权重数据量极其庞大。而GPU的显存带宽虽然在不断提升但相对于算力核心的增长速度来说仍然严重滞后。这就导致了一个非常尴尬的现实GPU的算力利用率可能不到50%大部分时间都浪费在等待数据上。3.2 真正卡住延迟的隐形瓶颈那具体是什么在卡住推理延迟Bill Dally在对话中重点提到了几个方向。首先是内存带宽大模型推理的权重读取对显存带宽的要求极高HBM高带宽内存虽然已经是目前最快的方案但依然不能满足未来模型规模的需求。其次是芯片间互连当模型大到单卡放不下的时候必须做模型并行把不同层分到不同的GPU上那么层与层之间的激活值传输就会成为严重瓶颈。这个问题在超长上下文场景下尤其突出因为KV Cache键值缓存的读写会产生巨量的数据流量。再往深一层说真正耽误时间的其实是内存墙和互连墙。芯片的计算能力提升遵循摩尔定律大概每两年翻一倍但内存带宽的提升速度远低于这个水平大概每三年多才能翻一倍。这就导致了一个越来越大的差距——计算能力在突飞猛进内存却跟不上脚步。打个比方你的电脑CPU再强但如果硬盘是几十年前的老式机械硬盘开机照样要等半天。AI推理就是这个道理算得再快数据供不上也白搭。这也是为什么我们看到一个非常有趣的现象NVIDIA在最新的GPU架构上把大量精力放在了提升显存容量和带宽上同时还推出了NVLink这样的高速互连方案把多卡之间的通信延迟压缩到极低水平。另外各种模型压缩技术——量化、剪枝、蒸馏——在做的事情本质上都是减少需要搬运的数据量。H100在推理场景下比A100强很多很大一部分功劳要归于HBM3带宽的提升以及Transformer Engine对各种精度格式的原生支持而不仅仅是计算核心数量的增加。3.3 推理优化的三条实战路线这场对话关于延迟的讨论其实给我们这些做工程的人带来了很多非常具体的启示。如果你正在部署大模型推理服务下面几个优化方向值得重点关注。模型量化是目前性价比最高的优化手段。把模型从FP16降到INT8权重体积直接减半推理延迟基本能下降30%到50%而精度损失在大多数场景下都可以忽略不计。更激进一些的INT4量化虽然精度损失会稍微大一些但对于一些对精度不太敏感的任务比如代码生成、闲聊对话来说还是可以接受的。关键心得是量化不能只看权重还要关注激活值的分布尤其是当模型包含一些outlier神经元的时候纯INT8量化可能会导致精度跳水。实践中更推荐混合精度量化——让敏感层保持FP16非敏感层用INT8这样可以在精度和性能之间取得更好的平衡。KV Cache优化也是效果很好的手段。长上下文场景的显存开销主要来自KV Cache它的大小跟序列长度的平方成正比。当上下文从4K扩展到128K时KV Cache的内存占用会爆炸式增长。为了解决这个问题业界已经探索出了很多方案PagedAttention页面注意力把KV Cache分页管理让显存利用率大幅提升MQA多查询注意力/GQA分组查询注意力通过让多个注意力头共享部分KV缓存把KV Cache的容量需求直接砍掉一半以上还有针对超长上下文的上下文压缩技术比如某些稀疏注意力机制可以把不太重要的历史token从缓存中摘除。第三个路线是投机解码Speculative Decoding和多级推理架构。自回归生成的核心痛点是逐token串行生成每个token都要走一遍完整的前向计算。投机解码的思路是先用一个速度快但精度稍低的草稿模型一次性生成多个候选token然后用大模型并行验证这些token是否符合分布。如果验证通过一次前向计算就能产出多个token推理吞吐量可以翻好几倍。实践中草稿模型的质量是决定收益的核心指标——草稿模型太弱验证通过率低反而浪费计算草稿模型太强又失去了速度优势。通常的做法是拿轻量化蒸馏模型或者稍小尺寸的同系模型做草稿模型目标是把接受率做到0.7到0.8以上。4. AI的五年未来从大模型竞赛到智能体生态4.1 大模型竞赛的两个分化方向聊完了预训练范式和推理瓶颈这场对话的重头戏其实是Jeff Dean和Bill Dally对AI未来五年的展望。两个人的观点有不少共识其中最核心的一个判断是大模型竞赛正在分化为两个截然不同的方向。第一个方向是超级模型路线继续往更大的规模、更强的推理能力、更广泛的知识覆盖去走。这个方向会由少数几家巨头主导因为所需要的资金、算力、数据资源不是一般公司能承受的。但它们的目标已经不是做一个更聪明的聊天机器人而是打造一个更底层的AI操作系统——上面承载着各类Agent、各种应用向下管理着庞大的算力资源池。就像当年的Windows和iOS一样谁掌握了这个底层平台谁就掌握了整个生态的话语权。第二个方向是轻量模型的百花齐放。当基础模型的能力通过蒸馏、量化、剪枝等方式传递到中小尺寸模型上之后会有大量针对特定场景、特定行业、特定硬件优化的轻量模型涌现出来。这些模型不需要几百亿参数但它们在具体的垂直任务上可以做到非常极致。举个例子一个专门为代码补全设计的3B参数模型配合良好的IDE插件和本地硬件优化在开发体验上完全可以超过一个通用的70B参数大模型。这两个方向并存的结果就是未来的AI生态不会是一个一家独大的格局而是一个金字塔结构。顶部是少数通用超级模型中间是行业模型和垂直模型底部是无数的端侧小型模型。不同的层级之间通过API、模型网关、推理路由等基础设施连接起来形成一套完整的生态系统。4.2 智能体是下一个十年的操作系统Jeff Dean在对话中用了相当大的篇幅来谈AI Agent。他的观点很明确未来的AI应用形态不会是对话框而是一个能够自主完成任务的智能体系统。这个判断其实已经在很多场景中得到了验证。过去一年我们看到了大量AI Agent的应用尝试——有自动写代码的、有自动做数据分析的、有自动管理日程的。虽然这些尝试大多还处于半自动的阶段但方向已经非常明确了AI正在从一个回答问题的工具变成一个执行任务的伙伴。Agent与目前主流大模型应用的差异主要体现在两个核心能力上规划能力和工具调用能力。规划能力指的是Agent能够把一个复杂任务拆解成一系列的子任务并按照合理的顺序逐步执行。工具调用能力指的是Agent能够理解并使用外部API、数据库、代码解释器等工具来完成那些单靠模型本身搞不定的工作。这些能力对模型本身提出了全新的要求——它不仅需要知道答案是什么还需要知道下一步该做什么。从工程架构上看Agent系统的复杂度远高于传统的请求-响应模式。一个典型的Agent需要包含任务规划模块、工具注册与调度模块、记忆管理模块、结果验证模块等多个部分这对底层的推理基础设施也提出了更高的要求。Jeff Dean在对话中提到未来的Agent系统对延迟的敏感度会远超现在的聊天场景——因为一个复杂的Agent任务可能需要连续调用几十次甚至上百次模型推理每一次都要求低延迟、高可靠。这就把话题又拉回到Bill Dally强调的推理优化上两个人在这场对话中其实形成了很好的互补。4.3 五年内的产业机会在哪里如果站在2026年看未来五年我觉得有几个确定性的趋势是值得提前布局的。针对AI应用开发者和产品经理Agent是最值得关注的方向。2025年被很多人称作Agent元年但真正的Agent爆发期我认为是在接下来的两三年内。关键驱动因素有三个模型的工具调用能力越来越稳定、Agent框架如LangGraph、AutoGen、CrewAI等越来越成熟、推理成本持续下降。这三个因素叠加起来会让Agent从玩具变成生产力工具。针对AI基础设施和平台团队推理优化是一条非常扎实的技术路线。随着AI应用的普及推理成本会成为比训练成本重要得多的考量因素。那些能够在推理延迟、吞吐量、成本之间找到最佳平衡点的团队将在未来的竞争中占据巨大的优势。这不仅仅是算法问题更是系统工程问题——需要从硬件选型、模型压缩、推理框架、调度策略等多个维度综合考虑。针对企业决策者一个重要的判断是未来AI的护城河不再是模型本身而是数据管道和业务闭环。随着开源模型的性能持续逼近闭源模型模型本身会越来越像水电煤一样的通用基础设施。真正的差异化竞争力在于你能不能建立起一套持续产生高质量数据、快速迭代模型、紧密贴合业务场景的闭环系统。这个判断其实是整场对话的核心思想的延伸——预训练范式已死因为未来属于那些能够把AI真正嵌入到业务流程中的创新者而不是那些仅仅能够训练出一个大模型的团队。5. 实操视角怎样把这场对话的观点落到真实项目里5.1 技术选型随预训练范式终结需要怎么变听了两位技术大佬讲了这么多前沿理念很多人最关心的问题其实是这些观点对我眼下的技术选型和工作规划有什么直接影响我结合自己的项目经验谈几点特别具体的心得。第一如果你的公司还在纠结要不要自研大模型我的建议是可以彻底放下这个念头了。预训练范式走向终结意味着做一个通用大模型的路越来越窄投入产出比越来越低。除非你是头部大厂有几十亿美元级别的预算和专门的顶级研究团队否则自研通用大模型基本上就是一条不归路。更务实的策略是站在开源模型比如Llama系列、Qwen系列、DeepSeek系列的肩膀上把精力集中在数据工程和场景适配上面。第二如果你正在做AI应用开发现在应该把重心从怎么把模型调得更聪明转向怎么把Agent系统搭得更稳。我见过太多AI产品团队天天在调Prompt、微调模型试图让AI准确理解用户意图但真正的体验瓶颈往往出在AI理解了但对实际环境操作不起来。一个能稳定查询数据库、调用第三方API、操作办公软件、验证自身执行结果的Agent哪怕用的是不那么强的模型其实际价值都远远超过一个只会聊天的超大模型。这个判断我强烈建议你重视起来因为它将深刻影响未来五年AI应用的产品形态和技术架构。第三重视工程化能力而不是炼丹能力。过去几年算法工程师的招聘市场上有预训练经验是个高端标签但现在你会看到各大公司挂在嘴边的是AI工程化、模型推理优化、系统稳定性这些词。这些能力本质上就是Bill Dally说的那套东西——把延迟降下来、把吞吐提上去、把成本控制住。对于个人开发者来说我认为这是非常值得投入的方向未来几年的人才缺口会非常大。5.2 延迟优化的落地顺序先量化再解耦后投机如果你正在负责一个真实的大模型推理服务我建议的落地路径是非常清晰的不需要一上来就把所有手段全部上齐而是要按性价比一路做下去。第一步是量化压箱底。先把FP16切到INT8做一轮质量回归测试确认精度影响可控后基本就能看到20%到40%的性能提升。这一步的前提是你的推理框架和硬件已经支持INT8的算子加速。实测下来TensorRT-LLM、vLLM对INT8的支持已经很成熟了直接改一下模型精度配置即可不需要动业务代码。第二步是结合上下文做KV Cache的优化。这块要从两个方向同时入手一个是算法层面的GQA/MQA改造如果用的是比较老的模型架构另一个是工程层面的PagedAttention和KV Cache量化。vLLM内置的PagedAttention已经比传统框架节省了90%以上的显存浪费这是直接把可用上下文长度翻倍的改动收益极其可观。第三步才是投机解码和更高级的分布式推理。投机解码适合对单token延迟非常敏感的场景比如实时对话、代码补全它的收益受模型尺寸、草稿模型质量、批处理大小的影响很大需要做实际benchmark来验证。分布式推理张量并行、流水线并行主要是为了解决单卡放不下的问题它本身不会降低延迟反而可能因为通信开销增加延迟但在吞吐量上的收益是实打实的。这里我要特别强调一个心得延迟优化一定要从全局视角去看不能只盯着模型那一层。很多时候用户在意的响应慢至少有三分之一的瓶颈出在网络传输、API网关、业务逻辑这些地方。我曾经遇到过一个项目模型推理本身只要200毫秒但整个接口响应却要2秒一查发现是上游数据服务有1.5秒的固定延迟。把那个优化掉比做什么投机解码都来得实在。5.3 给AI应用团队的两个反共识建议最后分享两个我在实践中总结出来的、可能和大环境观念不太一样但非常实用的建议。第一个建议是不要等到模型完美再上线。现在大模型技术迭代的速度是周更的模型的最佳版本永远在下一个版本。如果你的产品设计和架构是基于模型能力足够强这个前提来做的那你会发现你永远在追赶模型更新的速度始终处于被动状态。反过来如果你的架构设计了足够多的外部缓冲——比如通过RAG检索增强生成补充知识、通过外部工具执行动作、通过规则引擎兜底安全性——那么即使模型能力不够强你的系统依然能给用户提供可用的价值。而且当更强的模型发布时你的系统可以无缝升级到新模型上不需要做架构改动。这种模型无关的架构思路我强烈推荐。第二个建议是重视评估体系而不是模型调优。很多AI应用团队把大量时间花在怎么让模型输出更符合预期上面却忽略了一个更根本的问题你怎么知道模型输出好不好如果没有一套自动化的评估体系你就无法量化模型的每一次改动带来了什么效果也无法在多个候选方案之间做出理性的选择。我见过太多团队把模型调了几十版最后问哪个版本更好的时候居然没有一个能拿出客观的数据来回答。建立一套覆盖核心场景的自动化评估集、每次改动后跑一遍评估、对比前后差异这个投入带来的长期回报远远高于你在Prompt上抠来抠去的那点收益。6. 写在最后一边看风向一边踩油门说实话听这场对话的时候我最大的感受是AI行业正在从摸着石头过河的阶段进入修桥铺路的阶段。过去五年所有人的注意力都集中在模型能力还能不能更强上面而未来五年更核心的命题会是AI系统能不能更可靠、更高效、更深入地融入真实世界。预训练范式是否真的已死其实并不重要重要的是那些存量的大模型能力会以怎样的新方式被重新组合、重新激活。我自己在实际操作中的体会是方向判断和工程落地之间隔着的从来不是智力而是执行力。GTC这种级别的技术对话最大的价值不是给你一个可以直接照抄的解决方案而是帮你校准未来的方向感——哪些赛道会快速增长、哪些技能会持续增值、哪些投入需要及时止损。如果你也想在AI这条路上走得更远我建议你从今天开始花更多时间去思考怎么让AI在真实场景里把事情做成而不是继续纠结模型还能不能更聪明。前者是工程问题有路径可循后者是科学问题需要漫长的等待。对于绝大多数团队和个人来说前者才是真正值得倾注心力的地方。