少即是多,这次轮到大模型来证明

发布时间:2026/7/30 8:04:36
少即是多,这次轮到大模型来证明 模型或许也一样。看发布会久了我们很容易把注意力全部放在能力上限上仿佛我们每天上班遇到的最大困难是办公室里缺少一位能够证明黎曼猜想的同事。每逢重要的新模型发布我们编辑部通常比新闻本身更早进入工作状态提前打开官网、直播和社交媒体等结果陆续出来大家一边热火朝天地开始写文章一边梳理参数、榜单和演示案例判断这一次技术究竟向前走了多远。这套流程已经相当熟练大模型行业似乎也形成了一种默认的审美更多的参数更长的上下文更复杂的推理以及越来越接近「全能」的能力清单。但设计圈有一句经典名言Less is More。它强调设计要保持克制知道哪里应该保留哪里可以舍弃。模型或许也一样。看发布会久了我们很容易把注意力全部放在能力上限上仿佛我们每天上班遇到的最大困难是办公室里缺少一位能够证明黎曼猜想的同事。其实大多数工作并不涉及人类文明的终极命运。它们只是数量很多、过程重复、要求明确同时又有一套复杂的流程。这种时候我们需要的往往是一个反应够快、听得懂话、能够稳定使用的工具。7 月 24 日蚂蚁集团旗下百灵大模型发布的最新模型 Ling-3.0-flash正是沿着这一思路设计的。它是一款面向 Agent 长程工作流的 Flash 模型总参数量为 124B、激活参数量为 5.1B强调快速响应、稳定调用工具以及适合高频使用的可控成本。上下文方面Ling-3.0-flash 原生支持 256K可扩展至 1M并能在长输入下保持较高召回率。官方给它的定位是「智以密胜」相较于百灵上一代旗舰思考模型 Ring-2.6-1T 的总参数约 1T、激活约 63BLing-3.0-flash 只用了旗舰约 1/8 的总参数、约 1/12 的激活参数就在多数基准测试上实现了「对标甚至超越」旗舰。因此Ling-3.0-flash 要讲的其实并非「又一个小模型」的故事而是一次思路上的切换模型获取智能的方式不再单纯追求规模堆砌而是转向对每一寸算力的高效压榨。百灵把这种取向称为「智能密度」IQ 除以显存成本与「智效比」IQ 除以计算成本而 Ling-3.0-flash 在这两个指标上的表现非常亮眼。从产品定位上看Ling-3.0-flash 并不试图取代那些参数量庞大的全能推理模型而是想要承担更多「执行」工作复杂模型先搜索信息、制定方案并拆解任务Ling-3.0-flash 再按照方案调用工具、修改代码、处理数据并根据运行结果不断检查和修正。这样一来需要深度思考的部分可以交给大模型需要反复执行和试错的部分则由 Ling-3.0-flash 完成。在保证任务效果的同时也减少了每一步都调用超大模型所带来的等待和成本。这个定位踩在了一个正在成型的行业共识上。进入 2026 年业界对 Agent 的讨论已经从「能不能自主完成任务」转向「一套 Agent 系统里该由谁来干什么」。也就是说一套行之有效的 Agent 系统中不仅需要能深思熟虑的大型推理模型也需要能快速高效完成基本任务的相对轻量模型。一手实测把「快」和「稳」放进真实工作流那么Ling-3.0-flash 的真实表现如何呢目前Ling-3.0-flash 正在开放限时免费 API 调用截至北京时间 8 月 3 日 23:00趁这个窗口我们也来免费体验一番用真实任务对其进行实测。上手门槛比预想的低。我们选的测试工具是 OpenCode下载打开后Ling-3.0-flash 已经是默认的免费选项之一不需要额外配置就能直接用。如果想接入 Claude Code 等其他工具也可以在 OpenRouter 或百灵官方平台免费申领 API key 后自行配置。官方体验平台https://chat.ant-ling.com/chatOpenRouter 体验地址https://openrouter.ai/inclusionai/ling-3.0-flash:free第一个任务我们让它构建一个模拟太阳系。结果有点出乎意料Ling-3.0-flash 不仅正确搭出了太阳与八大行星的相对关系还主动用不同颜色和行星环在视觉上做了区分。不仅如此Ling-3.0-flash 的完成速度也相当快整个过程不过 3 分钟。第二个任务偏审美我们让它做一个「Less is More」的包豪斯风格的「机器之心精选作品集」网站全程不用任何图片素材。成品相当精准地还原了纯 CSS/SVG 的无图美学三原色、几何构成、非对称网格的语言都在。这也算是对官方同类 demo 的一次侧面印证。在这类前端视觉任务上它的表现确实撑得起「对标」二字。视觉展示之外我们更关心它能不能真正嵌进生产流程。于是我们把它接进了自己的工作流指示它安装集成了机器之心自产全部行业数据的「机器之心数据 Skills」。很快Ling-3.0-flash 把这 4 个 skill 配置进了 OpenCode。配好 API key 之后只需在对话框里提问它就能按 skill 里定义的方式查询机器之心的全部行业数据。举个例子我们让它检索数据库中所有蚂蚁百灵发布过的模型与技术文章并据此总结蚂蚁百灵的技术演进路线。基于数据库中的 24 篇相关文章Ling-3.0-flash 相当利落地梳理出了蚂蚁百灵这些年从基础设施、到 MoE 架构突破、再到全模态与智能体能力集成的一条主线条理清晰足以当作快速了解这家团队的一份参考。这类「读一批结构化资料、抽取要点、组织成文」的活正是其擅长的信息聚合与结构化输出场景。当然我们也没只挑它擅长的来。我们尝试让它独立完成一个更复杂的工程用 Vite TypeScript Three.js 加 cannon-es 物理引擎做一个 3D 物理台球沙箱。这一次它并没有完全跑通。这个结果谈不上意外反倒和 Ling-3.0-flash 自身的定位相互印证它本就不是为「一句话端到端拿下复杂工程」而设计的全能架构师而更适合在人把架构和路径规划清楚之后作为执行节点分步落地。如果先由人或更大的规划模型搭好台球沙箱的模块骨架再让它逐轮填充实现大概率会是更顺手的协作方式。综合几轮体验我们的直观感受和官方口径大体吻合在边界清晰、有明确验证信号的任务上它响应快、执行稳接入工作流的成本也低而一旦任务滑向开放、松散、需要它自己从零扛起整体架构它的短板就会显现。这正是一个「执行模型」应有的样子把它用在对的地方性价比很高用错地方则可能会带来失望。极致「压榨」背后一套围绕效率重写的架构Ling-3.0-flash 的能力官方归因于两条线的共同作用一是底层架构的系统性升级二是面向生产力场景的 Agent 定向优化。前者决定了「同样的参数能转化出多少能力」后者决定了「这些能力能不能在真实任务里稳定交付」。先看架构。原生混合线性注意力是这次升级的地基。与上一代 Ling-2.6 先进行架构迁移、再继续训练不同Ling-3.0 从预训练阶段便采用原生混合线性注意力架构以 5:1 的比例交替堆叠 KDA 线性注意力层和 MLA 层即每 6 层中包含 5 层 KDA 和 1 层 MLA。由于各组件从训练初期便在同一架构中共同优化模型可以兼顾长上下文处理效率和整体能力。这里的 KDAKimi Delta Attention即 Moonshot月之暗面在 2025 年底 Kimi Linear 工作中提出的线性注意力机制随后成为业界探索高效注意力的一个共同参照。它的思路是在 Delta Rule 的状态更新里引入细粒度对角门控让不同特征通道拥有各自独立的保留、衰减与写入控制而不是用一个全局旋钮统一处理记忆的遗忘。通俗地说模型在读长文档、大型代码库时能更精准地维护那些跨段落、跨步骤的关键信息不至于把新旧信息混成一团。Ling-3.0 把上一代的 Lightning Attention 换成了 KDA正是看中这一点。MoE 稀疏度进一步压低是「智效比」的直接来源。这一取向的方法论依据来自百灵此前提出的效率杠杆Efficiency Leverage与 Ling Scaling Law在达到同等性能的前提下更低的专家激活比例能换来更高的算力效率。激活比例越低效率杠杆相对稠密模型节省的算力越高且随算力预算放大。图为 1e22 FLOPs 下的估计值。来源蚂蚁百灵团队 Efficiency Leverage 论文arXiv:2507.17702据介绍Ling-3.0 据此把每个 Token 的专家激活比例从前代的 1/32 进一步降到 1/64。也就是说124B 的总参数里每次推理只点亮很小一部分以极低的计算消耗驱动模型能力实现跃迁。原生混合线性注意力、KDA 与稀疏 MoE 三者叠加构成了它敢在 124B激活 5.1B体量上「越级挑战」的架构底气。不过这条「线性注意力 极致稀疏」的路线能否在更大规模上继续保持质量行业内仍有不同看法。Acing AI 的第三方分析指出线性注意力混合架构在研究规模数十亿参数上的「质量对齐」未必能平滑迁移到前沿规模尤其是在长上下文多跳推理这类被标准测试集低估的任务上。当然Ling-3.0-flash 走的本来就不是「什么都懂一点」的路线而是把有限资源集中用在 Agent 和核心推理上。但这也提醒我们「小体量对标大旗舰」的成立范围需要落到具体任务上去看而非一概而论。除了模型本身的架构升级Ling-3.0-flash 还针对真实生产环境中的 Agent 任务在训练、推理服务和多智能体协同等方面做了专门优化。按照官方说法团队将 Coding Agent、General Agent 和 Deep Research Agent 的可交互训练环境扩展至 1 万多个并持续提高环境的多样性、质量和任务难度。强化学习阶段还引入了完整执行轨迹复盘和步骤贡献评估为长程任务提供更细粒度的步骤级训练信号。这些训练主要提升模型在复杂约束下持续规划、调用工具、处理失败反馈和动态调整执行路径的能力。官方称相比上一代旗舰 Ring-2.6-1TLing-3.0-flash 的 Agent 能力有明显提升部分指标达到更大参数规模模型的水平。MiniAppBench 可以提供一个外部参照——这个基准要求模型仅凭一句用户需求生成完整可用的 APP。参与评测的 16 个主流模型平均通过率约为 17%Ling-3.0-flash 的通过率达到 25.3%与总参数规模约为其两倍的开源 SOTA 模型持平。工程层面还有两处改动针对的是「Agent 任务越长服务越吃力」这个问题一是响应速度。Agent 任务的对话轮次越多、上下文越长传统推理服务一旦本地缓存被挤出或会话被调度至其他节点就可能需要重新处理此前数万 Token 的上下文导致首 Token 延迟快速上升。Ling-3.0-flash 基于 SGLang HiCache 与 Mooncake 构建了集群级分层缓存体系将缓存从「实例私有」升级为「集群共享」使已有上下文能够跨层级存储、跨节点复用和按需恢复。官方实测称在长输入场景下命中 L3 Cache 相比重新计算可将 TTFT 降低 60%80% 以上。对于 Coding Agent 和长文档问答等场景这可以减少上下文重算并加快任务接续。二是协同稳定性。面对复杂 Agent 任务单一推理链路容易出现决策漂移、局部误判和容错能力不足等问题。为此百灵升级了名为「Ling Multi-Agent」的多智能体协同架构。不同 Agent 可以围绕任务进行多层级分工并通过交叉验证、信息补充、协同纠错和竞争式「赛马」降低单一推理路径造成的偏差。根据官方展示的实验结果Ling Multi-Agent 在 BrowseComp 和 BrowseComp_zh 上的表现会随协同计算规模增加而提升。这表明在复杂检索和深度研究任务中能力扩展不仅取决于单个模型也可以来自更有效的任务委派和结果校验。从这些改动来看Ling-3.0-flash 的产品逻辑是自洽的把「执行」这一环节的速度、稳定性和成本做到极致再靠工程手段解决长程交互中的重算与漂移问题。相应地这种取舍也带来了明确的边界。模型资源更多集中于智能体与核心推理在广度知识储备和多语言稳定性方面仍有提升空间长对话或高压交互下也可能出现中英文混杂。对使用者而言这意味着一些明确的「不适合」极度冷门、需要庞大世界知识硬背的研究任务缺少「可验证节点」的松散开放式需求以及「一句话帮我做完整工程」的 One-shot 预期……这些场景更适合交给更大的推理模型或由人先把架构和路径规划好再让它分步执行。当前版本也不具备原生多模态能力遇到需要理解截图或音频的任务需要配合多模态模型使用。当「智能」开始按密度计价从 Ling-3.0-flash 身上可以看到一个越来越明显的行业变化Agent 落地进入深水区之后衡量一个模型价值的坐标正从「参数有多大、榜单有多高」悄悄挪向「单位算力、单位成本能换来多少可靠的执行」。这也是 2026 年不少企业在做的取舍与其用一个昂贵的大模型端到端包揽一切不如让大模型负责思考、让轻量执行模型负责高频落地用动态路由把成本压下来。在这个坐标系里Ling-3.0-flash 给出了一个不错的答案但它是否适用于更多任务和场景还需要继续验证。接下来模型之间比拼的可能不只是能力有多强也包括能否用更少的资源把能力用在真正需要的地方。而对今天的开发者来说选择这类模型时标准其实很简单先想清楚要让它做什么再把任务边界和验收标准说明白剩下的交给它快速执行。官方表示Ling-3.0-flash 模型权重将在免费体验期结束后正式开源。可以开始期待了……