Miles框架支持模型全景图:Qwen3、DeepSeek、Kimi、GLM、Nemotron谁能跑RL训练

发布时间:2026/9/17 18:49:26
Miles框架支持模型全景图:Qwen3、DeepSeek、Kimi、GLM、Nemotron谁能跑RL训练 Miles框架支持模型全景图Qwen3、DeepSeek、Kimi、GLM、Nemotron谁能跑RL训练【免费下载链接】milesMiles is an enterprise-facing reinforcement learning framework for LLM and VLM post-training, forked from and co-evolving with slime.项目地址: https://gitcode.com/GitHub_Trending/miles1/milesMiles 是一个面向企业级的大模型强化学习RL训练框架基于 SGLang 高吞吐推理 Megatron-LM 大规模训练的组合专门解决 LLM / VLM 后训练场景。最让新手关心的问题是Miles 到底支持哪些模型Qwen3、DeepSeek、Kimi、GLM、Nemotron 这些热门模型谁能跑 RL 训练本文给你一张完整的支持模型全景图并附上每个家族的最快上手路径。支持模型全景图一眼看清谁能跑RLMiles 官方为每个模型家族都提供了可直接运行的训练配方recipe覆盖权重转换、并行策略和启动脚本。完整清单见 docs/models/index.md。模型家族代表模型规模激活/总参数单机可跑QwenQwen3 / Qwen3.5 / Qwen3.60.6 B → 235 B-A22BMoE✅ Qwen3-4B 单节点DeepSeekV4.1 Flash / V4 Flash / V3.2284 B → ~750 B❌ 需多节点KimiK2.5 / K2.6 / K31 T32 B 激活✅ 2-layer 冒烟测试GLMGLM-4.5 / GLM-5 / GLM-5.2106 B-A12B → 744 B-A40B✅ GLM-4.7-Flash 单节点NemotronNemotron-3 Nano → Ultra4 B → 550 B-A55B✅ Nano 4B 单节点其他Gemma-4、GPT-OSS-20B、Inkling、JoyAI-LLM-Flash—视规模而定结论先行这五个家族的模型全部能跑 RL 训练区别只在于需要多少卡、多少节点。Qwen新手入门的第一选择Qwen 是 Miles 覆盖最全的家族从稠密的 Qwen30.6B → 32B到 MoE 的 Qwen3-30B-A3B / 235B-A22B再到 Qwen3.5、Qwen3.6 全系以及 Gated-Delta-Net 架构的 Qwen3-Next-80B-A3B。新手最快路径是 Qwen3-4B单台 8×H100 节点即可跑通使用 scripts/run_qwen3_dense.py 一条命令启动详见 docs/models/qwen/index.mdpython scripts/run_qwen3_dense.py --model-name Qwen3-4B 选型建议第一次学 Miles→ Qwen3-4B一个节点循环快想体验 MoE→ Qwen3-30B-A3B多节点扩规模→ Qwen3-235B-A22B脚本见 scripts/run_qwen3_235b_a22b.pyDeepSeek旗舰级MoE多节点才是主场DeepSeek 家族横跨三代DeepSeek-V3、V3.2新增稀疏注意力 DSA、V4 Flash284B以及最新的 V4.1 Flash约 750B激活仅 6B 专家。DeepSeek-V4 Flash8 节点 8×H200用 scripts/run_deepseek_v4.py 启动DeepSeek-V3.28 训练节点 独立 rollout GPU脚本见 scripts/run_deepseek_v32.pyDeepSeek 系列配方还与低精度 RLFP8/MXFP8、P2P 权重传输、容错恢复等高级特性配合最佳详见 docs/models/deepseek/index.md。Kimi万亿参数也能训K3 首发即支持Kimi 家族在 Miles 上从顶到全支持K2-Instruct / K2-Thinking、多模态智能体的 K2.5 / K2.6均为 1T 总参数、32B 激活以及首发day-0支持的Kimi-K3——KDA MLA 混合注意力 896 专家潜空间 MoE。K2.5 / K2.6 走INT4 QAT训练路径先用 2-layer 冒烟测试验证环境python scripts/run_kimi_k25.py full-train --model-name Kimi-K2.5-2layerK3 采用LoRA RL冻结基座权重、只训低秩适配器这是让它在有限卡数上跑得动的关键16 节点 4 卡已验证配方见 docs/models/kimi/kimi-k3.md 一句话万亿参数模型在 Miles 上不是传说——Kimi-K2.6 的新权重可以在几秒内通过 P2P RDMA 同步到所有推理引擎。GLM从单节点冒烟到 744B 旗舰全覆盖GLM 家族的 RL 训练配方覆盖每一代GLM-4.5106B-A12B / 355B-A32B、紧凑的 GLM-4.7-Flash、旗舰级 GLM-5 / GLM-5.2744B-A40B以及 KDA DSA 混合架构的 GLM-5.3-Flash。GLM-4.7-Flash全家族最小配方单台 8×H100 节点即可python scripts/run_glm47_flash.pyGLM-5.2744B完整多节点配方见 scripts/run_glm5_2_744b_a40b.py也支持 LoRA 版 scripts/run_glm5_2_744b_a40b_lora.pyNemotronMamba混合架构免权重转换直达训练NVIDIA 的 Nemotron-3 全系Mamba Attention 混合架构Super 档还带 MoE 且原生 FP8都通过 Megatron AutoBridge 路径加载无需离线 HF → torch_dist 权重转换省掉新手最容易踩坑的一步。档位规模硬件规模Nano稠密4 B单节点 8 卡最快冒烟Nano MoE30 B-A3B中等规模SuperFP8 原生120 B-A12B多节点Ultra550 B-A55B16 节点单节点启动命令python scripts/run_nemotron_3_nano.py --model-name NVIDIA-Nemotron-3-Nano-4B-BF16配方详情见 docs/models/nemotron/index.md。算法与硬件跑通模型之后还有什么RL 算法GRPO、GSPO、PPO、REINFORCE 全部内置另支持 SFT 与 on-policy 蒸馏PPO 示例见 examples/ppo/run_qwen3_4b_ppo.py。硬件NVIDIA GB300 / GB200 / B300 / B200 / H200 / H100 / A100以及 AMD MI300X / MI325 / MI350 / MI355XROCm——DeepSeek-V4 Flash 还已在 AMD MI355X 上完成 RL 训练验证。低精度训练MXFP8、NVFP4 端到端 RL外加 FP8、INT4 QAT、BF16、FP16小卡预算也能训大模型示例脚本在 examples/infra_features/low_precision/ 目录。新手上手路径最小成本跑通第一个RL训练选小模型Qwen3-4B 或 Nemotron-3-Nano-4B单台 8 卡节点跑冒烟测试Kimi-K2.5 的 2-layer 变体适合先验证环境再看指标健康的训练运行中rollout/raw_reward应随 rollout 稳步上升eval 分数如 AIME在若干轮后明显抬升 记住这张表的选型口诀学框架 → Qwen3-4B试 MoE → GLM-4.7-Flash / Qwen3-30B-A3B上旗舰 → DeepSeek-V4 Flash、Kimi-K2.5、GLM-5.2 多节点满配。Miles 的插件架构还允许你把任意 HuggingFace 模型包装成 Megatron 模块接入训练意味着这份支持模型全景图还在持续扩展中。【免费下载链接】milesMiles is an enterprise-facing reinforcement learning framework for LLM and VLM post-training, forked from and co-evolving with slime.项目地址: https://gitcode.com/GitHub_Trending/miles1/miles创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考