AI 大模型日报 — 2026年8月13日

发布时间:2026/8/14 3:18:04
AI 大模型日报 — 2026年8月13日 AI 大模型日报 — 2026年8月13日 日期2026-08-13星期四 数据来源LLM Rank、LLM Stats、The Decoder、OpenAI 官网、DeepSeek API Docs、新浪财经、新华网、WIRED、TechCrunch、Reuters 等公开资讯汇总 今日热门话题摘要xAI 发布 Grok 4.68月12日——专为长时运行 Agent 打造的前沿模型Artificial Analysis 智能指数 61 分追平 OpenAI GPT-5.6 Sol仅次于 Anthropic Claude Opus 5500K 上下文、知识截止 2026-02-01定价 $2/$6 每百万 tokens200K性价比突出。阿里开源 Qwen3.8-Max 权重8月12日——Qwen3.8-2.4T-A95B2.4 万亿参数、激活 95B成为首个可下载的 Max 级 Qwen开源路线再跨一大步。Mistral 平台化转型8月12日——Mistral 宣布其平台将托管第三方开源模型首发智谱 GLM-5.2与自有模型共享基础设施开放生态格局生变。OpenAI GPT-5.6-Cyber 正式发布8月10日——Daybreak Blue Red 双网络安全模型解决 95% 网络安全问题同时OpenAI Doug模型揭晓预计 11 月发布GPT-5.6 家族持续扩容。DeepSeek V4 正式版进入发布窗口——V4-Flash 正式版 API 公测后 Agent 能力大幅跃升Terminal Bench 2.1 达 82.7V4 GA 预计在8 月 10~20 日开放V4-Pro 正式版将尽快发布。白宫拟扩展 AI 政策WIRED——开源模型可能被纳入更新的联邦 AI 监管框架美国 AI 治理走向选择性监管。AI 基础设施财报强劲——Cisco Q4 单季 AI 基础设施订单 $4B、营收同比 18% 至 $172.5 亿Cerebras Q2 营收 74% 至 $1.8 亿并上调全年指引算力军备竞赛持续升温。 各重要模型动态 OpenAIGPT 系列模型时间要点GPT-5.6 Luna / Terra / Sol2026-07-095.6 家族三档位7月30日 Luna 降价80%、Terra 降价 20%价格战升级GPT-5.6 August Updates2026-08-06更新 ChatGPT 模型并扩大访问范围能力进一步提升GPT-5.6-Cyber2026-08-10Daybreak Blue防御/ Red红队攻击双模型解决 95% 网络安全问题已上架 AWS Bedrock“OpenAI Doug”2026-08-09 揭晓新模型公开计划 2026 年 11 月正式发布ChatGPT Business Premium 席位2026-08-10企业版新增高级席位商业化继续深化排行榜数据GPT-5.4 Pro 在 HLE人类最后考试得分 58.70、ARC-AGI-2 83.30居闭源旗舰第一梯队GPT-5.6 Sol 综合指数 60.9。 AnthropicClaude 系列Claude Opus 52026-07-24 发布当前综合实力榜首级模型Max Effort 综合指数 63.1、MMLU Pro 93.2%Grok 4.6 发布时官方对比即仅次于 Opus 5。Claude Opus 4.8SWE-bench Verified 达88.60%、HLE 57.90编码能力持续领先。生态背景Anthropic 与亚马逊、谷歌各签 100 万颗定制芯片协议预计 2028 年接近盈亏平衡。 GoogleGemini 系列Gemini 3.1 Pro PreviewHLE 51.40、SWE-bench 80.60、τ²-Bench 90.80长程 Agent 任务能力稳健。Gemini 3.6 Flash (high)2026-07-21综合指数 51.6、输出速度 212 tokens/s性价比路线延续。背景Gemini 3 Pro2025-11-18仍保持 100 万 token 上下文与 91.9% GPQA Diamond 的多模态标杆地位。 MetaLlama / Muse 系列Muse Spark 1.2 (xhigh)2026-08-05开源推理模型综合 56.8、Coding 72.2、MMLU Pro 90.4%开源阵营主力。Muse Glimmer (high)2026-08-10轻量档综合 35.1。Llama 4 Behemoth仍未发布社区对 Meta 开源节奏持续讨论Llama 4 Scout/Maverick2025-04仍是公开主力。 DeepSeekDeepSeek-V4-Flash 正式版 API 公测2026-07-31模型结构与 Preview 一致、仅重训后训练Agent 能力大幅增强——Terminal Bench 2.1: 82.7、DeepSWE: 54.4、Cybergym: 76.7、DSBench-FullStack: 68.7原生支持 Responses API 并针对性适配 Codex。V4 正式版GA预计 8 月 10~20 日发布封闭测试结束 1~2 周后开放已分出 V4 Flash 与 V4 Pro 两档市场传满血版最快 8 月 20 日亮相。V4-Pro 正式版将尽快发布期间 DeepSeek 暂停第二轮融资谈判。性价比依旧极致V4 Flash 输入约 ¥1/百万 tokens 级别。 国内其他厂商模型厂商时间亮点Qwen3.8-Max开源权重阿里2026-08-12首个 Max 级开源 Qwen2.4T 参数A95B 激活自定义许可Qwen3.7-Max-Preview阿里—HLE 53.50、SWE-bench 80.40Kimi K3月之暗面2026-07-16HLE 56.00免费商用综合 59.7GLM-5.2智谱 Z.ai2026HLE 54.70、开源榜首级成为 Mistral 平台首个第三方托管开源模型GLM-5.1智谱2026-06发布当天 API 逆势提价 10%年内第三次调用量反增Step 3.7 Flash阶跃星辰—HLE 47.20免费商用宏观背景据新华网报道国产大模型进入密集上新期商业化竞速升级智谱 GLM-5 全程华为昇腾训练为首个完全去美国化训练的千亿级前沿模型。 其他国际玩家xAI Grok 4.68/12全新发布Agent 聚焦旗舰——500K 上下文、文本图像输入、reasoning_effort low/medium/high/xhigh定价 200K$2/$0.50/$6≥200K$4/$1/$12每百万 tokensCursorBench v3.2 69.9%、DeepSWE v1.1 65.9%厂商自测已接入 Cursor、OpenRouter、Vercel、Cloudflare。Liquid AI LFM2.5-VL-3B8/12开源约 31 亿参数边缘端视觉语言模型屏幕/UI 理解与 grounding 能力增强。Microsoft MAI-Code-1.1-Flash8月更低价位的视觉编码模型。NVIDIA Nemotron 3.5 Lightning8/11开源30B MoE约 3B 激活代理执行模型另有 Nemotron 3 Ultra550B-A55B。Thinking Machines LabSmall Thinking Machines 与 InklingHLE 46.0进入主流榜单新势力崛起。 行业趋势分析Agent 即旗舰成为行业共识Grok 4.6 直接以长时运行 Agent为产品定位OpenAI 适配 Codex、DeepSeek V4-Flash 把 Agent 基准Terminal Bench / DeepSWE作为宣传主轴——模型竞争的重心已从聊天生成全面转向可靠执行与工具使用Agent 成功率、长程稳定性成为新标尺。开源生态加速高端化 平台化Qwen 首次开放 Max 级2.4T 参数权重DeepSeek V4 系列、GLM-5.2、Kimi K3 均免费商用更关键的是 Mistral 开放平台托管第三方开源模型——开源从发布权重走向基础设施互操作生态话语权争夺进入新阶段。价格战白热化推理成本快速下探GPT-5.6 Luna 降价 80%、Terra 降价 20%Grok 4.6 以 $2 输入价对标同级DeepSeek 保持人民币级别低价。低成本高能力模型持续压缩闭源旗舰的定价空间性价比基准线不断上移。网络安全成为模型厂商新战场OpenAI 将 GPT-5.6-CyberDaybreak Red/Blue产品化并上架 AWS Bedrock安全能力从评测指标变成可售卖产品叠加此前思维链窃取研究争议AI 安全正从合规成本转化为差异化商业卖点。算力军备与资本开支仍在加码Cisco 单季 AI 基础设施订单 40 亿美元、Cerebras 营收 74% 且上调指引OpenAI 规划超 $1 万亿数据中心投资、Anthropic 锁定 200 万颗定制芯片——模型迭代速度与资本强度正深度绑定行业集中度进一步提升。监管与治理进入务实期白宫拟将开源模型纳入更新版 AI 框架欧盟 AI 法案执行落地中美监管均从原则讨论转向具体条款开源权重分发与出口规则可能成为下一轮博弈焦点。中大模型进入发布窗口冲刺DeepSeek V4 GA 呼之欲出Qwen3.8-Max、Kimi K3、GLM-5.2 密集上新国产模型在推理、开源、性价比三条线上同时逼近国际前沿8 月下旬至 9 月或迎来新一轮发布潮。 主要参考来源LLM Statsllm-stats.com— AI 新闻聚合与模型发布记录2026-08-11~12The Decoder — Grok 4.6 与 GPT-5.6 Sol 对比报道2026-08-12OpenAI 官网 — GPT-5.6 发布页、GPT-5.6 August Updates2026-08-06DeepSeek API Docs — 更新日志2026-07-31 V4-Flash 公测新浪财经 / 世界日报 — DeepSeek V4 延期与满血版报道DataLearner 排行榜 — 各模型 HLE / SWE-bench / ARC-AGI-2 基准数据WIRED / TechCrunch / Reuters — 白宫 AI 政策、Cisco 与 Cerebras 财报、Twitch 训练数据争议新华网 / 华为云社区 — 国产大模型商业化与昇腾训练动态本报告由 AI 自动汇总生成仅供参考。22354754842235475484qq.com AI 大模型日报 — 2026-08-13