POLARIS 模型部署指南:用 vLLM 高效运行 4B/7B/1.7B 三个版本

发布时间:2026/8/20 16:43:59
POLARIS 模型部署指南:用 vLLM 高效运行 4B/7B/1.7B 三个版本 POLARIS 模型部署指南用 vLLM 高效运行 4B/7B/1.7B 三个版本【免费下载链接】POLARISScaling RL on advanced reasoning models项目地址: https://gitcode.com/gh_mirrors/polaris34/POLARISPOLARIS 是一个通过强化学习RL大幅提升推理能力的开源后训练项目本文将给出一份面向初学者的POLARIS 模型部署指南重点讲解如何用vLLM高效运行 POLARIS 的 1.7B、4B、7B 三个版本。无论你是想本地体验数学推理能力还是准备接入线上服务这份教程都能帮你快速跑通。认识 POLARIS用 RL 撬动推理能力上限POLARIS 的全称是 APOst-training recipe for scalingRL on Advanced ReasonIng modelS核心思路很直接在 Qwen3-1.7B、Qwen3-4B、DeepSeek-R1-Distill-Qwen-7B 这些已具备推理能力的基座模型之上再用 GRPO 强化学习继续打磨。官方评测显示POLARIS-4B-Preview 在 AIME 2025 上拿到 79.4 分甚至超过了 Claude-4-Opus、Grok-3-Beta 等商业大模型而它只有40 亿参数。上图来自项目官方 README.md可以看到 POLARIS-4B-Preview79.4 分在 AIME 2025 上仅次于 Qwen3-235B-A22B性价比非常惊人。这也是它值得被部署的原因用更小的模型拿到接近超大模型的推理效果。POLARIS 1.7B / 4B / 7B 三个版本怎么选部署前先搞清楚三个版本的差异。它们分别基于不同基座模型微调参数规模和提升幅度也不同版本基座模型AIME24 (avg32)AIME25 (avg32)相对基座提升POLARIS-1.7BQwen3-1.7B66.953.0AIME24 18.6AIME25 16.2POLARIS-4BQwen3-4B81.279.4AIME24 7.4AIME25 13.8POLARIS-7BDeepSeek-R1-Distill-Qwen-7B72.652.6AIME24 17.6AIME25 12.9选择建议很直接追求极致效果选 4B 版本评测分数最高单卡即可推理显存紧张 / 追求低延迟选 1.7B 版本性能依然吊打同尺寸模型想复现官方 7B 实验选 7B 版本它在 Minerva、Olympiad Bench 上也有均衡表现。三个版本的训练脚本分别在 scripts/train/qwen3-4b/、scripts/train/qwen3-1.7b/、scripts/train/r1-distill-7b/想深入了解训练细节可以自行查看。部署第一步搭建 vLLM 运行环境POLARIS 官方推荐的推理引擎就是vLLM训练时的 rollout 也用它。先克隆仓库获取评估与训练脚本git clone https://gitcode.com/gh_mirrors/polaris34/POLARIS cd POLARIS然后安装依赖注意版本需要严格对齐pip install -e ./verl pip install -e ./ pip install transformers4.51.0 pip install vllm0.8.4 pip install tensordict0.6.2 # 不要使用 xformers 后端 unset VLLM_ATTENTION_BACKEND这里有两个易踩的坑帮你提前排雷vLLM 版本必须是 0.8.4过高或过低的版本都可能与 verl 不兼容必须unset VLLM_ATTENTION_BACKEND官方明确警告vLLM 在 xformers 后端下会报 CUDA 错误。用 vLLM 加载 POLARIS 模型三步快速推理环境就绪后vLLM 推理 POLARIS 模型非常简单核心只有三步加载模型、设置采样参数、生成回答。以下代码来自官方 Demo已精简把模型路径换成你的权重目录即可运行import torch from transformers import AutoTokenizer from vllm import SamplingParams, LLM model /path/to/Polaris-4B-Preview tokenizer AutoTokenizer.from_pretrained(model) llm LLM( modelmodel, dtypetorch.bfloat16, tensor_parallel_size1, gpu_memory_utilization0.9, ) sampling_params SamplingParams( temperature1.4, top_p1.0, max_tokens90000, ) prompt Find the largest possible real part of ... output llm.generate( promptstokenizer.apply_chat_template( conversation[{content: prompt, role: user}], add_generation_promptTrue, tokenizeFalse, ), sampling_paramssampling_params, ) print(output[0].outputs[0].text)对新手来说只要记住模型用 bfloat16 加载单卡tensor_parallel_size1就能跑 4B 版本。1.7B 和 7B 的加载方式完全一致只改model路径即可。关键采样参数调优让 POLARIS 发挥全部实力这是 POLARIS 部署中最容易忽略、也最影响效果的一环。官方在 README 中特别强调temperature 建议 1.4而不是 Qwen3 默认的 0.6。POLARIS 是强化学习训练的采样温度本身就偏高训练时约 1.4~1.5温度太低会导致推理性能明显下降但也不要超过训练温度否则输出会发散max_tokens 建议开到 90000约 9 万 token。POLARIS 的回答很长官方建议响应长度超过 64K截断会让性能跌回基座模型水平top_p 保持 1.0评估场景下官方还搭配top_k20。一句话总结调优口诀高温、长回答、不截断。这是 POLARIS 部署与普通模型最大的不同点。用 AIME 基准验证 POLARIS 部署效果部署完成后可以用官方评估脚本验证模型是否正常工作。项目提供了基于 vLLM 的批量推理脚本 scripts/eval/eval_vllm_aime24.py 和 scripts/eval/eval_vllm_aime25.py# AIME 2024 评测vLLM 推理输出 jsonl 文件 python scripts/eval/eval_vllm_aime24.py --model /path/to/model --n 32 --max_length 90000 --k 20 --t 1.4 # AIME 2025 评测温度可用 1.4 或 1.45 python scripts/eval/eval_vllm_aime25.py --model /path/to/model --n 32 --max_length 90000 --k 20 --t 1.4参数含义--n 32表示每道题采样 32 次--k 20是 top_k--t 1.4是温度。生成结果后用 evaluation/grade.py 一键评分python evaluation/grade.py --file_name evaluation/results/aime24-reproduced.parquet如果跑出来的分数接近官方数值4B 版本 AIME25 约 79 分说明你的 vLLM 部署完全正常。评测基准数据存放在 evaluation/benchmarks/包含 aime24、aime25、amc23、minerva、olympiad 五套题。部署常见问题与避坑建议最后整理几个新手最容易遇到的问题显存不够怎么办4B 版本用 bfloat16 单卡 24GB 即可运行如果上下文开得很大9 万 token建议gpu_memory_utilization调到 0.9 并适当降低并发数回答被截断导致效果差检查max_tokens是否足够官方要求超过 64K推理速度慢先把temperature调到 1.4避免低温度下模型反复思考想微调自己的数据官方提供了三阶段训练脚本和 53K 条过滤数据见 parquet/stage1/polaris-data-53K.parquet单节点 8×H800 即可复现。总结POLARIS 用强化学习把小模型推理做到了新的高度而vLLM 部署正是把它落地的最快路径。回顾这份指南的核心要点装对版本vllm0.8.4、用对参数temperature1.4、max_tokens 开大、跑对评测AIME 脚本 grade.py你就能在单卡上拥有接近超大模型的推理能力。现在就动手部署你的第一个 POLARIS 模型吧【免费下载链接】POLARISScaling RL on advanced reasoning models项目地址: https://gitcode.com/gh_mirrors/polaris34/POLARIS创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考