Kimi K2.5技术报告解读:15T视觉文本Token如何炼出原生多模态模型(MoonViT-3D架构详解)

发布时间:2026/10/4 17:33:38
Kimi K2.5技术报告解读:15T视觉文本Token如何炼出原生多模态模型(MoonViT-3D架构详解) Kimi K2.5技术报告解读15T视觉文本Token如何炼出原生多模态模型MoonViT-3D架构详解【免费下载链接】Kimi-K2.5Open Visual Agentic Intelligence项目地址: https://gitcode.com/gh_mirrors/ki/Kimi-K2.5Kimi K2.5 是月之暗面开源的原生多模态智能体模型它在 1T 参数 MoE 底座之上通过约15 万亿15T视觉文本混合 Token持续预训练让看与说从训练初期就共同进化而不是事后打补丁。本文带你用通俗的方式解读官方技术报告 tech_report.pdf 的三大核心15T Token 训练配方、MoonViT-3D 视觉编码器以及把单智能体变成蜂群并行的 Agent Swarm 框架。 一分钟看懂 Kimi K2.5关键规格速览项目参数️ 架构Mixture-of-ExpertsMoE 总参数量1T1 万亿⚡ 激活参数量32B每 Token 仅激活 8/384 个专家 层数61 层含 1 层 Dense 注意力机制MLA64 头隐藏维度 7168 上下文长度256K️ 视觉编码器MoonViT400M 参数 词表160K三大核心特性源自 README.md原生多模态视觉与语言 Token 全程混合预训练擅长视觉知识、跨模态推理和基于视觉输入的工具调用视觉驱动编程Coding with Vision从 UI 设计稿、视频工作流直接生成代码Agent Swarm智能体蜂群复杂任务被动态拆解为并行子任务由多个专家子智能体协作完成 15T Token 是怎么炼的三阶段预训练全流程技术报告中最关键的发现是在总 Token 预算固定的前提下早融合 低视觉比例比后期猛灌视觉数据效果更好。消融实验显示早期以 10%:90% 的视觉:文本比例注入视觉数据在视觉知识、OCR、文本推理上全面领先于 80% 进度时才以 50%:50% 注入的方案。完整的预训练分为三个阶段阶段训练数据序列长度Token 规模训练对象1️⃣ ViT 训练图片 alt text、合成描述、视频、定位框、OCR40961T视觉编码器2️⃣ 联合预训练文本知识、图文交错、视频、OS 截图 高质量多模态409615TViT LLM3️⃣ 长上下文中期训练长文本、长视频、推理、长思维链32768→262144500B→200BViT LLM用大白话解释每个阶段阶段 1给模型装眼睛MoonViT-3D 视觉编码器从 SigLIP 初始化先单独用 1T 图文对做 caption 交叉熵训练不加对比损失学会看懂高分辨率图像和视频随后一个极短的阶段只训练 MLP 投影层把视觉特征对线到 1T 语言模型上。阶段 215T 联合预训练从接近训完的 Kimi K2 语言模型继续训练全程以恒定比例混合视觉与文本 Token同时强化语言和多模态能力——这正是原生多模态的含义。阶段 3学会长记性通过 YaRN 插值逐步把上下文从 32K 拉长到 262K即 256K显著改善长文本理解与长视频理解。️ MoonViT-3D 架构详解一套眼睛同时看懂图片和视频MoonViT-3D 是 K2.5 多模态架构的视觉核心设计理念可以概括为原生分辨率 时空统一编码 4 倍时间压缩1️⃣ 原生分辨率处理Patch n Pack沿用 NaViT 的打包策略图像被切成 patch小块展平后按序列拼接因此不同分辨率、不同长宽比的图像可以在同一批次高效混训无需复杂的切图/拼接操作。2️⃣ 从 2D 到 3D视频帧的时空打包K2.5 把最多 4 个连续帧当作一个时空体spatiotemporal volume这 4 帧的 2D patch 一起展平、打包进同一条序列同一套注意力机制同时跨越空间和时间两个维度。额外引入的时间注意力让模型对快速运动和视觉特效的理解明显增强。3️⃣ 完全共享权重 4 倍时间压缩图像和视频编码器完全共享参数图像预训练中获得的能力会整体迁移到视频无需专门的视频模块。在送入投影层之前轻量的时间池化会把每个 4 帧块内的 patch 聚合起来实现4 倍时间压缩——同样的上下文窗口能处理长 4 倍的视频。成果立竿见影K2.5 输入超过2000 帧后在长视频理解上拿下 LVBench 75.9%、LongVideoBench 79.8% 的全球 SOTA。 视觉与文本互相带飞零视觉 SFT 与视觉 RL 的两大惊喜后训练阶段有两个反直觉的发现非常值得新手理解惊喜一零视觉 SFTZero-Vision SFT预训练好的 VLM 并不会天然进行看图调工具。传统做法是人工标注视觉思维链数据但这类数据稀缺且套路单一。K2.5 的方案是——只用纯文本 SFT 数据激活视觉智能体能力所有图像操作都通过 IPython 编程指令二值化、计数等像素级操作来代理结果视觉推理、定位、OCR 能力照样被激活且泛化性优于直接加入人工视觉轨迹数据。原因很可能是 15T 联合预训练已经建立了很强的视觉-文本对齐。惊喜二视觉 RL 反而提升了文本能力在结果导向的视觉强化学习覆盖视觉定位计数、图表文档理解、视觉 STEM 三类任务之后纯文本基准不降反升文本基准视觉 RL 前视觉 RL 后提升MMLU-Pro84.786.41.7GPQA-Diamond84.386.42.1LongBench v256.758.92.2这就是 K2.5 反复强调的双向增强文本为视觉奠基视觉反过来精炼文本。联合 RL 也按能力维度知识、推理、编码、智能体而非模态来组织训练领域最大化跨模态能力迁移。 Agent Swarm从单兵串行到蜂群并行传统智能体模型像一个人独自处理任务工具调用一步步串行执行推理时间线性增长延迟和任务复杂度都上不去。K2.5 的Agent Swarm引入 PARL并行智能体强化学习范式来解决这个问题可训练编排者 冻结子智能体编排者Orchestrator动态创建领域专家子智能体、分配并行子任务训练时只更新编排者子智能体保持冻结规避了信用分配模糊和训练不稳定两大难题三段式奖励任务结果奖励 子智能体创建奖励防止退化成串行 子任务完成率奖励防止虚假并行刷指标关键步Critical Steps约束借鉴计算图关键路径思想——每个阶段的耗时由最长的子智能体决定迫使编排者做均衡的分解而不是无脑开子智能体效果非常直观基准单智能体 K2.5K2.5 Agent Swarm对比 GPT-5.2 ProBrowseComp60.6%78.4%77.9%WideSearch (item-f1)72.7%79.0%-在 WideSearch 上达到相同精度所需的执行时间缩短3×~4.5×且任务越复杂蜂群优势越大。此外Agent Swarm 还是一种主动的上下文管理各子智能体在独立的小上下文中工作只把与任务相关的结果汇报回编排者避免全局上下文被污染。 基准成绩亮点与头部模型同场竞技从 README.md 的完整评测表中挑选几项代表性成绩Thinking 模式256K 上下文能力维度基准K2.5 成绩一句话点评数学推理AIME 202596.1逼近 GPT-5.2 的满分超过 Claude 4.5 Opus工具增强推理HLE-Full (w/ tools)50.2全场最高超 Gemini 3 Pro 与 GPT-5.2真实软件工程SWE-Bench Verified76.8超 Gemini 3 Pro紧追顶级闭源模型OCR 与文档OCRBench92.3领先所有对比模型视频理解VideoMMMU86.6长视频基准 LVBench 全球 SOTA计算机使用OSWorld-Verified63.3远超开源同类接近 Claude 4.5 Opus智能体搜索BrowseComp (Swarm)78.4超过 GPT-5.2 Pro 快速上手部署 Kimi K2.5 的最快配置方法本地部署推荐以下推理引擎docs/deploy_guidance.md 提供完整示例vLLM/SGLang需携带--tool-call-parser kimi_k2和--reasoning-parser kimi_k2两个参数分别启用工具调用和推理内容解析transformers最低要求 4.57.1KTransformersCPUGPU 异构推理在 8×L20 2×Intel 6454S 上可达 640 tok/s 预填充分辨率还支持 LoRA 微调常用采样参数来自 README.mdThinking 模式temperature 1.0Instant 模式temperature 0.6top_p 0.95K2.5 支持图像与视频输入并支持交错思考与多步工具调用 项目文件导览文件说明README.md模型介绍、规格表、完整评测结果与调用示例tech_report.pdf官方技术报告全文本文解读的原始来源docs/deploy_guidance.mdvLLM / SGLang / KTransformers 部署指南LICENSEModified MIT 许可证代码与权重均开源figures/kimi-logo.pngKimi K2.5 品牌标识图总结Kimi K2.5 用三个关键设计回答了如何让多模态与智能体真正融合15T Token 的早期恒定比例联合预训练塑造了原生多模态底座MoonViT-3D用一套共享权重让图像能力无损迁移到视频Agent Swarm把任务复杂度从线性串行转化为并行处理。对新手而言最值得关注的是它证明了一件事——视觉与文本不是你强我弱的零和博弈而是可以互相成就的双向增强。想要深入细节建议直接阅读 tech_report.pdf 的消融实验部分那是本文所有结论的出处。【免费下载链接】Kimi-K2.5Open Visual Agentic Intelligence项目地址: https://gitcode.com/gh_mirrors/ki/Kimi-K2.5创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考