基模技术报告整理

发布时间:2026/8/15 9:35:26
基模技术报告整理 Qwen32025年5月阿里思考/非思考双模式融合到同一模型中用户可动态切换无需在不同模型间切换。引入思考预算机制可按任务复杂度自适应分配推理计算资源。首次在 Qwen 系列中引入 MoE 架构235B总参数/22B激活并去掉共享专家、采用全局批量负载均衡损失促进专家专业化。注意力机制中移除 QKV-bias、引入 QK-Norm 以提升训练稳定性。预训练使用 36 万亿 token、覆盖 119 种语言三阶段训练策略通用→STEM/推理→长上下文。通过强到弱蒸馏off-policy on-policy大幅降低小模型训练成本。Qwen3.52026年初阿里引入门控 Delta 网络Gated Delta Networks即线性注意力机制替代传统注意力实现高吞吐低延迟推理。采用原生多模态早期融合Early Fusion在架构层面统一文本、视觉、音频的联合建模。结合 mRoPE多维旋转位置编码与稀疏 MoE 混合架构打破传统 Transformer 效率瓶颈。Qwen3.5-Omni 采用 Thinker-Talker 双引擎 MoE 架构支持 256k 上下文和音视频实时交互。引入 ARIA 技术动态对齐文本与语音 tokenizer显著提升流式语音合成的稳定性与自然度。涌现出Audio-Visual Vibe Coding新能力——可基于音视频指令直接编写代码。DeepSeek V42026年4月深度求索引入 mHC流形约束超连接Manifold-Constrained Hyper-Connections对残差连接施加流形约束增强深层网络信号传递稳定性。设计混合稀疏注意力架构CSA HCA 交替叠加在百万 token 场景下单 token FLOPs 降至 V3.2 的 27%、KV cache 降至 10%。采用 Muon 优化器替代 AdamW接管绝大多数参数训练提升训练稳定性和收敛速度。全系默认 1M 上下文窗口V4-Pro 1.6T/49B激活V4-Flash 284B/13B激活不再区分长短模型。MoE 路由细节优化激活函数从 Sigmoid 改为 Sqrt(Softplus(·))前几层 dense FFN 替换为 Hash routing 的 MoE 层。配套 DeepSeek Harness 智能体框架“Model Harness Agent”重做后训练大幅提升 Agent 与代码能力。完成华为昇腾等国产算力芯片适配Day 0 运行在国产算力平台。GLM 5.22026年6月智谱AI采用 753.3B 总参数的 MoE 架构256 专家中激活 8 个激活约 40B兼顾知识容量与推理成本。自研 IndexShare 技术每 4 层稀疏注意力共享一个轻量级 indexer1M token 下每 token FLOPs 降低 2.9 倍。延续 DSA动态稀疏注意力路线将可用上下文从 20 万稳定升级至 100 万 token解决超长文本注意力衰减问题。优化 MTP多 Token 预测层用于推测解码接受长度提升约 20%。专为长程工程任务跨数天/数周的软件工程设计FrontierSWE 74.4% 仅落后 Claude Opus 4.8 一个百分点。MIT 开源协议、无地域限制完成华为昇腾、寒武纪、昆仑芯等全系国产芯片适配。Kimi K32026年7月月之暗面全球最大开源模型2.8 万亿参数相比 K2 整体扩展效率提升约 2.5 倍证明算法创新可弥补算力差距。自研 KDAKimi Delta Attention混合线性注意力机制将百万 token 解码加速 6.3 倍使 1M 上下文真正可用。引入 AttnRes注意力残差通过保留前序注意力权重构建层间信息高速公路训练效率提升 25%额外开销仅 2%。Stable LatentMoE 架构896 个专家中仅激活 16 个在潜在空间中稳定训练路由用分位数均衡替代传统调参。原生多模态视觉理解是架构级原生能力而非后训练插件可基于视觉反馈进行规划与修订。在 Program Bench、FrontierSWE 等编程评测中超越 GPT-5.6 Sol代码能力位居全球前列。Qwen3.8-Max2026年8月阿里基于 Qwen3.5 架构基础扩展至 2.4 万亿参数95B 激活是 Qwen 系列首个开源 Max 级权重模型。联合扩展 RL 环境与计算规模沿任务、工作空间、Harness 三个独立轴持续扩展设计统一奖励系统执行验证 评分卡裁决 智能体检查和在线数据均衡器实现跨多 HarnessQwenWork / Claude Code / Codex / OpenClaw / Hermes的水平能力提升。