
人工智能大模型模型推理服务AscendCANN【免费下载链接】vllm-ascendCommunity maintained hardware plugin for vLLM on Huawei Ascend项目地址https://gitcode.com/gh_mirrors/vl/vllm-ascend点击查看免费下载本指南以仓库内 ref-past-release-notes-highlight.md 收录的 vLLM Ascend 历史发布说明精华为主线系统梳理 v0.11.0、v0.13.0rc1、v0.13.0rc2、v0.14.0rc1 四个版本的 Highlights、功能特性、性能优化、依赖变更、废弃项与已知问题并结合当前仓库源码对关键特性进行印证。读者将掌握 vLLM Ascend 的演进脉络、各版本升级注意事项、环境变量与配置项迁移方法以及如何在当前代码库中定位对应实现为部署升级与二次开发提供决策依据。一、版本总览发布节奏与整体演进方向vLLM Ascend 是 vLLM 在华为昇腾Ascend硬件上的社区维护插件其版本号与上游 vLLM 保持同步。从关联文档收录的四个版本发布时间看发布节奏密集且方向明确版本发布时间定位核心主题v0.11.02025.12.16正式版性能提升与生态过渡Eagle3 回归v0.13.0rc12025.12.27候选版长序列、上下文并行实验特性、跨机 PD 分离v0.13.0rc22026.01.24候选版质量与性能专项图模式与推理框架稳定化v0.14.0rc12026.01.26候选版310P 回归、量化与投机解码扩展整体演进呈现三条主线推理框架代际升级Model Runner V2 逐步接管、ACL Graph 全图模式扩展、硬件与模型覆盖扩张310P、Qwen3 系列、DeepSeek 3.x、GLM、Kimi、Minimax 等以及性能优化下沉到算子与图融合层Triton kernel、Allreduce-RMSNorm 融合、Q/K 拆分合并等。v0.14.0rc1 已包含 v0.13.0rc2 的全部变更若从 v0.13.0rc1 升级需同时阅读两个 rc 的发布说明。二、v0.14.0rc1310P 回归与推理栈全面刷新v0.14.0rc1 是 v0.14.0 的首个发布候选定位为在 v0.13.0rc2 基础上的差异增量。官方指引请参见 docs/source/user_guide 下的相关指南。2.1 Highlights310P 支持回归本版本重新支持昇腾 310P 芯片但仅限基础 Dense 模型与视觉语言VL模型且运行于 eager 模式。310P 支持将由社区持续改进维护对应 PR #5776。仓库中可找到完整的 310P 专用实现目录 vllm_ascend/_310p内含 worker_310p.py、model_runner_310p.py、attention、fused_moe、ops、quantization、spec_decode等子模块印证了这一版本对 310P 的专门支持路径。压缩张量 MoE W8A8-INT8 量化新增对 compressed-tensors 格式下 MoE 权重 W8A8-INT8 量化的支持PR #5718。仓库中 AscendCompressedTensorsConfig 即是对 LLM-Compressorcompressed_tensors量化配置的昇腾适配实现支持 int8 / fp16 / bf16 激活并通过_add_fused_moe_to_target_scheme_map将线性层量化方案同步映射到 MoE 专家模块。Medusa 投机解码支持 Medusa 多 token 投机解码PR #5668。仓库 AscendMedusaProposer 继承自 vLLM 的MedusaProposer其dummy_run在set_ascend_forward_context下完成图捕获与预跑propose基于已采样 token 与隐藏状态生成投机 token。Qwen3-VL 的 Eagle3 投机解码Eagle3 投机解码适配 Qwen3VLPR #4848相关 proposer 实现在 vllm_ascend/spec_decode/eagle_proposer.py。2.2 FeaturesXlite Backend 支持 Qwen3 MoEXlite 后端仓库目录 vllm_ascend/xlite新增 Qwen3 MoE 支持PR #5951。DSA-CP 支持 PD-mix 部署DSADeepSeek Sparse Attention与上下文并行Context Parallel结合支持 Prefill/Decode 混合部署场景PR #5702。相关实现位于 vllm_ascend/attention/context_parallel。新增 W4A4_LAOS_DYNAMIC 量化方法引入新的 W4A4 动态量化方案PR #5143可在 vllm_ascend/quantization/methods 中查找对应实现。2.3 PerformanceQwen3-Next 性能提升通过多个 PR#5664、#5984、#5765持续优化。CPU 绑定逻辑与性能改进PR #5555 优化了 CPU 亲和性绑定相关实现见 cpu_binding.py。合并 Q/K 拆分为简化AscendApplyRotaryEmb旋转位置编码算子合并 Q/K 拆分降低算子开销PR #5799。Matmul-Allreduce-RMSNorm 融合 Pass新增融合编译 PassPR #5034默认关闭需在--additional_config中设置fuse_allreduce_rmsTrue启用。仓库中同类图融合实现可参考 vllm_ascend/compilation/passes 下的 norm_quant_fusion_pass.py、qknorm_rope_fusion_pass.py 等。Triton RoPE 内核使用 Triton kernel 优化 rope embedding带来显著性能收益PR #5918。相关环境变量VLLM_ASCEND_ROPE_UB_SIZE_KB定义于 envs.py用于覆盖 Triton kernel 的 Unified BufferUB大小单位 KB默认 0 表示自动探测回退到 192 KB适用于 910B/A3。高级 top_k/top_p 采样支持无 top_k 约束下的高级apply_top_k_top_pPR #6098。AscendMMEncoderAttention 的 Q/K/V padding 并行化提升多模态编码器注意力性能PR #6204。2.4 OthersModel Runner V2 扩展支持 Triton 版 penalty 采样PR #5854与 Eagle 投机解码PR #5840。Model Runner V2 是 vLLM 下一代推理执行框架仓库实现位于 vllm_ascend/worker/v2。多模态 OOM 修复默认设置expandable_segments:True修复多模态推理 OOMPR #5855。MLAPO 默认开启环境变量VLLM_ASCEND_ENABLE_MLAPO默认设为True在 PDPrefill-Decode 分离部署场景的 decode 节点自动启用。注意该特性会消耗更多显存对显存敏感的场景请显式设为False。当前 ascend_config.py 中enable_mlapo: bool True印证了默认开启状态同时新增mlapo_keep_prefill_weights选项默认 False用于在 decode 节点保留 MLAPO 预填充权重以避免显存释放导致的稳定性问题。MLAPO 的算子级实现见 mla_v1.py 与 sfa_v1.py其 token 数上限常量MLAPO_MAX_SUPPORTED_TOKENS 1024定义于 vllm_ascend/attention/utils.py。SSL 配置PD 部署配合 mooncake layerwise connector 时SSL 配置可写入kv_extra_configPR #5875。--max_model_lenauto支持自动推断最大模型长度PR #6193。2.5 DependenciesTorchNPU 升级至 2.9.0PR #6112。2.6 Deprecation Breaking ChangesEPLB 配置迁移EPLB 配置项统一迁移到additional_config下的eplb_config子配置对应仓库 ascend_config.py 中的EplbConfig旧配置项在本版本已移除。Profiler 环境变量废弃VLLM_TORCH_PROFILER_DIR、VLLM_TORCH_PROFILER_WITH_PROFILE_MEMORY等 profiler 环境变量在 vLLM Ascend 中不再生效请改用 vLLM 的--profiler-config参数PR #5928。2.7 Known IssuesEngineCore 进程 Pickle 错误若偶发遇到来自EngineCore进程的 pickle 错误需将上游 vLLM 的对应修复 PR 合入本地 vLLM 代码该问题将在 vLLM 下一版本修复。三、v0.13.0rc2质量与性能专项冲刺v0.13.0rc2 以质量与性能提升为核心投机解码、图模式、上下文并行与 EPLB 均有显著改进并为 DeepSeek3.1/3.2、Qwen3 Dense/MoE 模型修复大量 bug 并提升性能。3.1 Highlights投机解码、图模式、上下文并行、EPLB 四个方向系统性改进。3.2 FeaturesBatch Invariant 基础框架为批处理不变性实现打基础PR #5517对应 batch_invariant.py。Eagle 全图模式Eagle 投机解码可与 full graph 模式协同工作PR #5118。上下文并行更稳定PCPPrefill Context Parallel与 DCPDecode Context Parallel在大多数场景可用实现位于 vllm_ascend/attention/context_parallel。MTP 与 Eagle 投机解码在大多数场景可用并被推荐使用。EPLB 稳定性提升修复大量 bugMix Placement混合放置可用PR #6086。EPLB 相关实现见 vllm_ascend/eplb 与 vllm_ascend/distributed/eplb。DeepSeek decode 节点 KV NZ在 disagg-prefill 场景下为 DeepSeek decode 节点支持 KV NZ 特性PR #3072。3.3 Model SupportLongCat-Flash新增支持PR #3833。minimax_m2新增支持PR #5624。仓库中已有后续 models/minimax_m3 实现表明该模型族持续演进。Cross-Attention 与 Whisper 模型新增支持PR #5592。3.4 Performance本版本新增大量自定义算子与 Triton kernel 加速模型性能包括RejectSampler、MoeInitRoutingCustom、DispatchFFNCombine等。Layerwise Connector 性能改进PR #5303相关代码见 vllm_ascend/distributed/kv_transfer。3.5 OthersModel Runner V2 基础支持vLLM 下一代执行框架 Model Runner V2 获得基础支持未来版本将默认启用PR #5210。修复 ZMQ 收发偶发失败PR #5503。支持 Qwen3-Next-MTP 使用全图模式PR #5477。修复 RL 场景的权重转置问题PR #5567。Eagle3 适配序列并行 SPPR #5562。上下文并行PCPDCP支持 MLAPOPR #5672。GLM4.6 支持 MTP full graphPR #5460。支持 Eagle draft 模型设置tp1PR #5804。Flashcomm1 特性适配 qwen3-vlPR #5848。支持细粒度共享专家重叠PR #5962。3.6 DependenciesCANN 升级至 8.5.0。TorchNPU 升级至 2.8.0.post1。注意post 版本默认不会自动安装需手动从华为云昇腾 PyPI 镜像安装 torch-npu。triton-ascend 升级至 3.2.0。3.7 Deprecation Breaking ChangesCPUOffloadingConnector废弃未来将被 vLLM 的 CPUOffload 特性替代。EPLB 配置项迁移至eplb_config旧配置项下一版本移除。ProfileExecuteDuration特性废弃由 vLLM 的ObservabilityConfig替代。VLLM_ASCEND_ENABLE_MLAPO将在下一版本默认设为Truedecode 节点默认启用该特性消耗更多显存显存敏感场景设为False。四、v0.13.0rc1长序列与上下文并行初探v0.13.0rc1 聚焦长序列能力与上下文并行实验特性同时完成上游 vLLM 0.13.0 基线升级。4.1 HighlightsDeepSeek V3.2 性能提升教程见 docs/source/tutorials 目录。Qwen3-Next MTP chunked prefillQwen3-Next 的 MTP多 token 预测支持 chunked prefillPR #4770相关实现可参考 qwen3_dspark.py。上下文并行实验特性Prefill Context Parallel 与 Decode Context Parallel 首次支持属实验特性欢迎反馈功能指南见 docs/source/user_guide/feature_guide。4.2 Features支持 openPangu Ultra MoEPR #4615。新增 W8A16 量化方法PR #4541。支持跨机 Disaggregated PrefillPR #5008。新增 UCMConnector 用于 KV Cache OffloadingPR #4411实现位于 vllm_ascend/distributed/kv_transfer。Eagle 支持async_scheduler与disable_padded_drafter_batchPR #4893。全图模式支持 PCP MTPPR #4572。NPUModelRunner 增强 MoE 模型 all-reduce 跳过逻辑PR #5329。4.3 Performance新增 L2Norm Triton kernelPR #4595。新增 AddRmsnormQuant 与 SP 结合的图模式新模式PR #5077仅在图模式下生效对应 norm_quant_fusion_pass.py。模型执行期间异步执行指数运算PR #4501。移除 attention 后的 transpose 步骤改用transpose_batchmatmulPR #5390。针对小 batch 场景提供带 flash decoding 功能的 attention 算子启用方法参见 docs/source/faqs.md。4.4 Other修复 VL 模型 OOMPR #5136仍在持续观察。修复 Qwen3-Next-MTP 批量推理时的精度 bugPR #4932。修复 NPU-CPU offloading 接口变更 bugPR #5290。修复 aclgraph 模式下 MHA 模型运行时错误PR #5397。修复ep1场景下不合适的moe_comm_typePR #5388。4.5 Deprecation Breaking ChangesVLLM_ASCEND_ENABLE_DENSE_OPTIMIZE移除推荐改用VLLM_ASCEND_ENABLE_PREFETCH_MLP两者总是同时启用PR #5272。VLLM_ENABLE_FUSED_EXPERTS_ALLGATHER_EP移除PR #5270。VLLM_ASCEND_ENABLE_NZ在 float 权重场景默认禁用某些 float 场景性能不佳确认可用时可手动设为 2PR #4878。additional_config中的chunked_prefill_for_mla移除PR #5296。additional_config中的dump_config重命名为dump_config_path类型由dict改为stringPR #5296。当前 ascend_config.py 已实现dump_config_path: str | None None并校验dump_config_path与dump_config互斥。4.6 DependenciesvLLM 升级至 0.13.0放弃 0.12.0 支持PR #5146。Transformers 升级至 4.57.3PR #5250。4.7 Known IssuesQwen3-Next 暂不支持长序列场景需按文档限制gpu-memory-utilization。Qwen3-Next 输入/输出约 3.5k/1.5k 时的功能断裂已修复但引入性能回归下一版本解决issue #5357。DeepSeek-V3.2 超短序列下存在 curl 精度问题下一版本修复issue #5370。五、v0.11.0正式版本与生态过渡v0.11.0 是 vLLM Ascend 的正式发布版本发布说明仅列出相对 v0.11.0rc3 的重要变更。5.1 HighlightsDeepSeek 3/3.1 性能提升PR #3995。修复 Qwen3-VL 精度 bugPR #4811。采样sample性能提升PR #4153。Eagle3 回归PR #4721相关 proposer 见 eagle_proposer.py。5.2 OtherKimi-K2 性能提升PR #4555后续模型实现见 models/kimi_k3.py 等。修复 DeepSeek3.2-exp 量化 bugPR #4797。修复高并发下 Qwen3-VL-MoE bugPR #4658。修复 Prefill-Decode 分离场景精度 bugPR #4437。修复 EPLB 若干 bugPR #4576、PR #4777。修复 openEuler Docker 镜像版本兼容问题PR #4745。5.3 Deprecation AnnouncementLLMdatadist connector 废弃将于 v0.12.0rc1 移除。Torchair graph 废弃将于 v0.12.0rc1 移除。Ascend scheduler 废弃将于 v0.12.0rc1 移除。5.4 Upgrade NoticeTorchNPU 升级至 2.7.1.post1需从昇腾 PyPI 镜像手动安装post 版本不自动依赖。CANN 升级至 8.3.rc2。5.5 Known IssuesQwen3-Next 本版本不支持专家并行EP与 MTP输入过长会 OOM。DeepSeek 3.2 本版本仅支持 torchair graph 模式下一版本支持 aclgraph 模式。Qwen2-Audio 默认不可用临时方案是设置--gpu-memory-utilization为合适值如 0.8。同一节点运行多个 vLLM 实例时 CPU 绑定特性不生效。六、升级与迁移要点速查6.1 环境变量与配置迁移对照版本变更项迁移动作v0.13.0rc1dump_configdict重命名为dump_config_pathstring见 ascend_config.pyv0.13.0rc1chunked_prefill_for_mla移除不再设置v0.13.0rc1VLLM_ASCEND_ENABLE_DENSE_OPTIMIZE移除改用VLLM_ASCEND_ENABLE_PREFETCH_MLPv0.13.0rc1VLLM_ENABLE_FUSED_EXPERTS_ALLGATHER_EP移除v0.13.0rc1VLLM_ASCEND_ENABLE_NZfloat 权重默认禁用可手动设为 2v0.13.0rc2EPLB 配置迁移至additional_config.eplb_configv0.13.0rc2ProfileExecuteDuration改用 vLLMObservabilityConfigv0.13.0rc2CPUOffloadingConnector废弃改用 vLLM CPUOffloadv0.14.0rc1EPLB 旧配置项已移除仅保留eplb_configv0.14.0rc1Profiler 环境变量改用 vLLM--profiler-config6.2 依赖版本对照组件v0.11.0v0.13.0rc1v0.13.0rc2v0.14.0rc1vLLM—0.13.0放弃 0.12.0——CANN8.3.rc2—8.5.0—TorchNPU2.7.1.post1手动安装—2.8.0.post1手动安装2.9.0Transformers— 4.57.3——triton-ascend——3.2.0—6.3 需特别注意的行为变更MLAPO 默认开启v0.14.0rc1 起VLLM_ASCEND_ENABLE_MLAPO默认TruePD 场景 decode 节点自动启用代价是更多显存显存敏感场景设False。多模态 OOM 缓解expandable_segments:True已默认开启。310P 能力边界仅支持基础 Dense 与 VL 模型、eager 模式。--max_model_lenauto可用于自动推断最大长度。七、从发布精要到源码印证关键特性定位发布说明中的特性均可在当前仓库中找到实现落点便于读者进一步深入310P 支持vllm_ascend/_310p 目录worker、model runner、attention、ops、quantization、spec_decode 等。投机解码家族vllm_ascend/spec_decode 下汇集 Eagle3eagle_proposer.py、Medusamedusa_proposer.py、Draft、DSParkdspark_proposer.py、D-Flashdflash_proposer.py等。量化方法vllm_ascend/quantization 下含 configs/compressed_tensors_config.pycompressed-tensors W8A8、methods含 W4A4_LAOS_DYNAMIC 等新方法以及 quant_type.py。上下文并行vllm_ascend/attention/context_parallelDSA-CP、PCP、DCP 相关实现均在此。图融合与编译 Passvllm_ascend/compilation/passesnorm_quant、qknorm_rope、noop_elimination 等acl_graph.py。EPLBvllm_ascend/eplbcore、adaptor、updator与 distributed/eplb。KV 传输与 offloadingvllm_ascend/distributed/kv_transferUCMConnector、Layerwise Connector、Mooncake 等相关部署示例见 examples/disaggregated_prefill_v1。模型生态vllm_ascend/modelsDeepSeek V4/V4.1、GLM5Next、Kimi K3、Minimax M3、Qwen3 系列等。环境变量全集vllm_ascend/envs.py包含VLLM_ASCEND_ROPE_UB_SIZE_KB、VLLM_ASCEND_ENABLE_BATCH_MEMCPY等新增项。Model Runner V2vllm_ascend/worker/v2。八、结语从 v0.11.0 到 v0.14.0rc1vLLM Ascend 在保持与上游 vLLM 同步的同时逐步构建起覆盖 310P 到 A 系列芯片、Dense 到 MoE、标准推理到投机解码/上下文并行/PD 分离的完整能力矩阵。升级时请重点关注 MLAPO 默认开启、EPLB 配置迁移、Profiler 切换与依赖版本CANN、TorchNPU、triton-ascend等 breaking changes使用已知问题涉及的能力如 Qwen3-Next 长序列、DeepSeek 3.2 图模式时请以各版本发布说明中的约束为准并持续关注仓库内 docs/source 下的用户指南与 docs/source/faqs.md 获取最新实践建议。赞分享人工智能大模型模型推理服务AscendCANN【免费下载链接】vllm-ascendCommunity maintained hardware plugin for vLLM on Huawei Ascend项目地址https://gitcode.com/gh_mirrors/vl/vllm-ascend点击查看免费下载相关推荐fl_chart CHANGELOG 深度解读从 0.0.1 到 1.2.0 的版本演进、核心特性与升级迁移指南fl_chart CHANGELOG 深度解读从 0.0.1 到 1.2.0 的版本演进、核心特性与升级迁移指南 本篇技术指南以 fl_chart 仓库的 Cclickhouse-operator 版本演进深度解读从 0.6 到 0.20 的核心特性、安全加固与升级指南clickhouse operator 版本演进深度解读从 0.6 到 0.20 的核心特性、安全加固与升级指南 本文基于 Altinity clickhou云原生容器编排后端运维可观测性Kong 3.x CHANGELOG 深度解读3.0 到 3.9.3 的版本演进、关键特性与升级避坑指南Kong 3.x CHANGELOG 深度解读3.0 到 3.9.3 的版本演进、关键特性与升级避坑指南 KongKong GatewayKong/ko/API网关后端LLM 网关微服务人工智能上一篇Jina HTTP 端点自定义完全指南expose_endpoint、CORS、GraphQL 与 Uvicorn 调优下一篇OBS Studio多机位切换深度解析6种过渡效果实现原理与实战指南创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考