
AI 大模型密集更新Claude、Gemini、Muse Spark 谁能在‘干活能力’竞争中胜出这两天AI 领域热闹非凡大模型市场迎来了一轮密集更新。9 月 1 日Anthropic 刚刚发布 Claude Fable 5.1 和 Claude Mythos 5.1主打编码、知识工作和长时间 Agent 任务。紧接着Google 和 Meta 也在同一时间带来新模型Google 推出 Gemini 3.8 Flash 和 Gemini 3.8 Flash CyberMeta 则发布 Muse Spark 1.3。短短几天三家头部 AI 公司接连出手而且不约而同地把重点放在了编码、Agent 和复杂任务执行上。大模型的竞争正在从单纯比拼‘谁的回答更聪明’进一步转向比拼谁能真正把事情做完。仅三周Gemini 3.8 Flash 就来了回看 Gemini 3.7 Flash 版本的发布也只不过是三周前的事情。如今 Google 加快了模型版本迭代的步伐最新带来了 Gemini 3.8 Flash 和 Gemini 3.8 Flash Cyber。官方表示这是目前最智能的 Flash 模型重点提升软件工程、Agent 任务和多步骤推理能力。其中Gemini 3.8 Flash 最大的特点是在保持 Flash 系列速度和成本优势的同时开始向更高能力的模型靠近。它支持 100 万 Token 上下文输入价格为每百万 Token 0.75 美元输出为 3.75 美元。模型还支持低、中、高三档 thinking 强度可以在性能、延迟和成本之间进行调整。在 DeepSWE v1.1 这一长程软件工程测试中Google 自己公布的数据显示Gemini 3.8 Flash 可以自主处理复杂工程问题。在 Vals Finance Agent V2 和 Harvey’s Legal Agent Benchmark 等专业 Agent 测试中也超过上一代。HLE - Verified 得分则达到 54.9%证明了其能够处理 STEM、人文和专业领域的多步骤推理。第三方测试同样给出了不错的结果。Artificial Analysis 测试显示Gemini 3.8 Flash 在最高推理强度下拿到 59 分比 Gemini 3.7 Flash 的 56 分提高 3 分中等推理强度为 57 分低推理强度为 52 分。这与 Anthropic 的 GPT - 5.6 Sol 和 SpaceXAI 的 Grok 4.6 仅差一点。不过Google 也很坦率3.8 Flash 会‘想得更多’。在处理复杂任务时这款模型会表现得更加细致会增加推理步骤并反复调用工具。有时为了尽可能提升任务表现模型会消耗更多 Token尤其是在更高推理强度下。Google 对此建议道对于算力效率是首要考量的应用场景开发者可以选择较低的推理强度以减少 Token 开销也可以继续使用 Gemini 3.7 Flash。后者目前仍得到完整支持适合那些更看重效率和成本的工作负载。Gemini 3.8 Flash CyberGoogle 把网络安全单独拎出来随着 Gemini 3.8 Flash 一起发布的还有 Gemini 3.8 Flash Cyber同样值得关注。这个版本不是面向普通用户的‘加强版 Gemini’而是专门用于网络安全防御目前通过 Google 新推出的 Fairwind Program 提供给一组受信任的防御者。Google 重点测试了两个能力发现漏洞和自动修复漏洞。在用于查找漏洞的行业标准基准测试 CyberGym 中Gemini 3.8 Flash Cyber 达到前沿水平并超过了 Gemini 3.5 Flash Cyber 以及更大的模型。在 CWE - Bench 漏洞修复测试中模型 pass1 达到 47.2%与领先前沿模型的 47.8% 非常接近但 Google 强调其成本明显更低。更直接的例子来自实际使用Chrome 安全团队发现3.8 Flash Cyber 生成的正确漏洞补丁数量是体量更大的商业模型中最佳结果的 2.6 倍。Google 还披露Cloud Vulnerability Research 团队利用该模型在不到 2 小时内发现了一个关键基础漏洞而这类漏洞通常可能需要数月研究。当然这一能力也意味着更严格的访问控制。Google 表示Gemini 3.8 Flash 已经加入针对网络攻击和 CBRN 相关滥用的安全措施而 Cyber 版本因为需要提供更完整的网络安全能力因此只开放给可信防御方。Meta Muse Spark 1.3 同台竞技Alexandr Wang 调侃‘Gemini 是谁’同一天Meta AI Research 也拿出了 Muse Spark 1.3是继今年 8 月发布 Muse Spark 1.2 后短时间内再次升级的一代模型。一直热衷于为自家模型‘站台’的 Meta AI 负责人 Alexandr Wang在新模型发布后也不忘调侃一番直接在社交平台上发问‘我真不想这么说但是……Gemini 是谁’相比 Google 和 Anthropic 此前更明显的模型升级Meta 这次并没有改变 Muse Spark 的定位而是继续围绕 Agent 和编程能力加码。官方表示Muse Spark 1.3 重点提升了 Agentic 任务和编程任务的表现并针对真实使用场景进行了大量优化让模型不仅在测试中表现更好也能更稳定地处理需要多步骤执行的复杂任务。详细来看Muse Spark 1.3 针对 Agent 和编码任务进行了优化可以在一个较长的对话线程中同时处理多个工作流。面对开放式任务它能够利用工具收集上下文、发现计划中的缺口并主动修正同时在任务过程中记住已经获得的信息。这种能力在实际工作中尤其重要。比如用户要求模型根据 CFD 仿真数据和 CAD 文件制作一份航空工程报告Muse Spark 1.3 不仅需要读取不同类型的输入还要提取仿真数据、整理性能指标、生成表格、分析气动性能最后按照指定结构输出 PDF。Meta 展示的另一个案例则要求模型处理音频工程任务根据时间码定位贝斯轨道中的错误音符、噪声和爆音再完成编辑和混音。在与用户协作方面Muse Spark 1.3 也进行了优化。面对存在歧义的要求模型会主动请求澄清执行过程中遇到无法解决的问题时也可以向用户寻求帮助并在执行重要操作前进行确认。对于长时间任务它还可以根据场景选择持续汇报进度或者尽量减少打扰在后台完成工作。编程也是此次升级的重点。Meta 表示Muse Spark 1.3 针对长周期编码任务和常见软件工程工作流进行了优化在没有必要的情况下会减少交互轮次同时让代码更加简洁。根据 Meta 工程师的测试在相同类型的任务中Muse Spark 1.3 相比 Muse Spark 1.2 的工具调用次数减少约 20%Token 使用量减少约 25%。这意味着新模型并非单纯依靠更多推理和工具调用完成任务而是在减少无效操作的同时提高执行效率。安全方面Muse Spark 1.3 也针对 Agent 和编码场景进行了优化包括增强对抗恶意输入和 Prompt Injection提示词注入的能力并改进对高风险、不可逆操作的判断在必要情况下会暂停执行并请求用户确认。目前Muse Spark 1.3 已经上线 Muse Code 和 Meta Model API。此前提供的推理模式现已开放而更高强度的 Max Reasoning 模式将在完成额外安全测试后推出。对于这一新版本Alexandr Wang 表示这一升级也是 Meta 继续推进‘个人 Agent’的一部分目标是让 Agent 未来能够长期运行替用户完成任务。不同模型碰到一起真正比的是‘干活能力’事实上把这几款模型放在一起看会发现一个很明显的变化。这轮新品已经很难单纯用‘谁的模型更聪明’来概括。Claude Fable 5.1 目前在 Artificial Analysis 综合智能指数上以 66 分排名第一它的优势集中在复杂推理、编码和专业知识工作但最高强度下也会消耗大量 Token。Gemini 3.8 Flash 则更像一个高性价比的‘工作马’。最高推理强度下达到 59 分开发者还可以主动降低 thinking 强度把单任务成本进一步压低。Muse Spark 1.3 则把重点放在长任务执行效率上。它不只是提高模型本身的能力还试图让 Agent 少调用几次工具、少消耗一些 Token并在复杂任务中更好地保持上下文和执行约束。这也是为什么最近模型发布越来越频繁却越来越不像过去那种简单的‘刷榜’。模型已经开始进入一个新的竞争阶段不仅要回答得对还要能连续工作不仅要能写代码还要能自己运行、测试和修改不仅要完成任务还得控制完成任务的 Token 和时间成本。从这个角度看Anthropic、Google 和 Meta 这几款新品虽然走的是不同方向但最终瞄准的是同一个问题——当大模型不再只是聊天机器人而是开始真正替用户执行任务时谁能让它们干得更久、更稳、更快而且成本还能接受。接下来大模型赛道的竞争真正值得看的可能已经不是下一款模型能把榜单提高几分而是这些模型进入真实工作流之后究竟谁能最先把‘Agent 自己干活’从演示变成日常工具。