小米开源万亿参数模型MiMo-V2.6:6天RL训练花了347万美元

发布时间:2026/9/24 10:13:50
小米开源万亿参数模型MiMo-V2.6:6天RL训练花了347万美元 9月22日凌晨小米发布并开源了 Xiaomi MiMo-V2.6 系列包含 Pro 与 Flash 两个原生全模态模型。官方把它定位成探索 RSI递归自我改进路径的一步。上一代 V2.5 的公测还没走远V2.6 就落地了——这个迭代节奏本身就说明了一些事情。这次到底发了什么先把参数和定位摆出来MiMo-V2.6-Pro总参数约 1.02 万亿MoE 架构单次推理激活约 420 亿参数面向复杂项目、长程任务、科研与网络安全场景MiMo-V2.6-Flash总参数约 3090 亿激活约 150 亿主打快和便宜两个都是原生全模态模型权重开源到 Hugging FaceAPI 价格同步挂到 OpenRouter并提供了 SGLang 和 vLLM 的部署配方。据报道第三方测评平台 Artificial Analysis 的综合智能指数v4.3中MiMo-V2.6-Pro 得 46 分是目前开源权重模型里的第一名高于 GLM-5.345 分和 Kimi K344 分。价格方面据报道同等智能水平下单任务成本约 0.13 美元为海外同类模型的 1/20 到 1/60。也有报道提到它和 Claude Fable 5.1、GPT-6 Astra 这类闭源旗舰相比仍有差距。技术本质这次的重点不在又大了一点真正值得看的是训练方式而不是参数表。据报道这次发布前小米首次公开直播了强化学习RL的训练曲线整个 RL 训练阶段持续不到六天投入约 347 万美元。罗福莉称这是开源史上最大规模单次 RL 训练之一另有报道给出的口径是约 262 万美元、4000 块 GPU。数字口径不完全一致但方向一致钱主要花在后训练而不是预训练上。把 RL 规模做上去本质是在解决一个老问题——基座模型的能力上限越来越靠后训练拉开而不是靠继续堆预训练数据。这和过去两年从堆参数转向堆后训练、堆 Agent 交互的趋势是一条线。变的是规模与工程化程度没变的是模型仍是 Transformer MoE 的老配方长上下文、MTP 多 token 预测这类提速手段也还是标配。对开发者来说实际影响有三点开源权重的可选项又多了一个而且是在 Agent、编程基准上能和闭源掰手腕的那一档部署门槛仍然高。万亿参数的 MoE 想自己跑需要的显存和互联不是普通团队能扛的Flash 版才是更现实的自建选项真正的成本优势在 API 侧。价格打到海外同类的一小截意味着以前用不起的批量任务长文档处理、代码审阅、批量 Agent 调用开始变得可算了。怎么用、怎么选以及几个坑第一别急着自建。万亿参数模型除非你有集群否则自建就是给自己找事。合理路径是先调 API 验证效果再决定要不要在 Flash 上做私有化。第二只接调用的话用 OpenAI 兼容接口就够了模型名和 base_url 以官方模型卡为准fromopenaiimportOpenAI clientOpenAI(api_keyYOUR_API_KEY,base_urlhttps://官方文档给出的兼容地址/v1,)respclient.chat.completions.create(modelMiMo-V2.6-Pro,# 实际模型名请以官方模型卡为准messages[{role:user,content:帮我检查这段 Python 代码的并发安全问题}],)print(resp.choices[0].message.content)**第三自建优先看 Flash。**MoE 模型通常要开 tensor parallel 才藏得下 bash vllm serve模型路径或 HuggingFace 仓库名\--tensor-parallel-size8\--max-model-len32768 注意显存和 TP 度数的匹配MoE 的激活参数小、权重总量大别拿激活 150 亿去估算显存占用。**第四一个容易忽略的坑**基准第一不等于你的场景第一。综合指数是通用分落到具体业务中文长文本、特定领域结构化抽取还是得自己跑一套小评测集别直接照搬排行榜选型。## 结尾开源模型这条线现在比的已经不是谁的参数大而是谁能用更少的钱把后训练做扎实。小米这次把 RL 训练的工程细节摊开给行业看本身也是一种姿态。这种直播训练以后会不会成为常规操作开源模型能不能在编程和 Agent 场景里真正替代闭源你怎么看评论区聊聊。