飞桨 PP 系列产业级模型全景指南:PaddlePaddle 官方模型库的精度与效率平衡之道

发布时间:2026/10/7 16:06:33
飞桨 PP 系列产业级模型全景指南:PaddlePaddle 官方模型库的精度与效率平衡之道 人工智能深度学习计算机视觉NLP语音【免费下载链接】modelsOfficially maintained, supported by PaddlePaddle, including CV, NLP, Speech, Rec, TS, big models and so on.项目地址https://gitcode.com/gh_mirrors/mo/models点击查看免费下载飞桨PaddlePaddle围绕企业产业落地中的精度、速度、部署成本等痛点打造了覆盖图像分类、目标检测、图像分割、OCR 文档智能、视频理解、NLP 大模型与语音识别合成的 PP 系列模型在精度与预测效率之间取得平衡。本文以 docs/official/PP-Models.md 为骨架逐套件梳理全部 PP 系列模型的定位、关键指标与设计思路并结合本仓库 modelcenter 模型中心与 paddlecv 配置体系说明每个模型在仓库中的快速开始路径帮助读者按任务与硬件条件完成模型选型并快速跑通。PP 系列模型是什么面向产业实践的精度-效率平衡方案根据 docs/official/PP-Models.md 的说明飞桨打造 PP 系列模型的核心出发点是解决用户产业实践中的痛点问题——既要模型精度足够支撑业务又要预测效率满足实时或成本约束最终实现模型精度与预测效率的最佳平衡满足企业落地实际需求。在整个官方模型库中PP 系列处于核心位置。按 docs/official/README.md 的描述官方模型库面向产业实践、数量超过 600 个其中「飞桨 PP 系列模型」以「效果与精度最佳平衡」为定位由飞桨官方实现并提供持续技术支持与答疑且与飞桨核心框架版本对齐、经过充分测试保证。PP 系列模型横跨以下开发套件开发套件覆盖能力PP 系列模型PaddleClas图像分类与图像识别PP-LCNet、PP-LCNetV2、PP-HGNet、PP-ShiTu、PP-ShiTuV2PaddleDetection目标检测、多目标跟踪、人体分析PP-YOLO、PP-YOLOv2、PP-YOLOE、PP-YOLOE、PP-PicoDet、PP-Tracking、PP-TinyPose、PP-TinyPose、PP-Human、PP-HumanV2、PP-VehiclePaddleSeg语义分割、人像分割、抠图PP-HumanSeg、PP-HumanSegV2、PP-HumanMatting、PP-LiteSeg、PP-Matting、PP-MattingV2PaddleOCR文字检测识别、文档智能分析PP-OCR、PP-OCRv2、PP-OCRv3、PP-Structure、PP-StructureV2PaddleGAN视频超分PP-MSVSRPaddleVideo视频分类PP-TSM、PP-TSMv2PaddleNLP预训练模型、信息抽取、文档智能ERNIE-M、ERNIE-UIE、ERNIE 3.0 系列、ERNIE-Layout、ERNIE-ViLPaddleSpeech语音识别、语音合成、声纹检索PP-ASR、PP-TTS、PP-VPR、ERNIE-SAT下文按套件逐一展开关键指标均来自 docs/official/PP-Models.md 的官方声明。PaddleClasCPU/GPU 骨干网络与轻量图像识别系统PaddleClas 的 PP 系列聚焦「骨干网络」与「图像识别系统」两个方向前者解决分类模型的效率问题后者解决海量图像的检索识别问题。PP-LCNetCPU 轻量级骨干网络PP-LCNet 是面向 CPU 场景的轻量级骨干网络提供 8 种不同尺度的模型在 docs/official/README.md 的官方模型列表中对应 PPLCNet_x0_25 至 PPLCNet_x2_5 等 8 个权重档位。其官方核心指标为在 ImageNet 1k 分类数据集上精度可达71.32%相比 MobileNetV3-Small x0.35 模型提高 18 个百分点Intel CPU 硬件上预测速度超过 400 FPS相比 MobileNetV3-Small x0.35 提高 22%。对应模型中心入口为 modelcenter/PP-LCNet其中 info.yaml 将 PP-LCNet 描述为「面向 Intel CPU 端的轻量级卷积神经网络」提供 ImageNet1k 数据集、Apache-2.0 许可等元信息该目录还包含 introduction_cn.ipynb、download_cn.md、benchmark_cn.md、fastdeploy_cn.md 等完整配套资料。在 paddlecv/configs/single_op/PP-LCNet.yml 中可以看到其在 PaddleCV 统一配置体系下的算子级配置入口。PP-LCNetV2基于 PP-LCNet 优化的轻量级 SOTA 骨干网络PP-LCNetV2 是 PP-LCNet 的升级版本ImageNet 1k 精度可达77.04%相较 MobileNetV3-Large x1.25提高 0.64 个百分点Intel CPU 上预测速度可达230 FPS相比 MobileNetV3-Large x1.25提高 20%。模型中心入口为 modelcenter/PP-LCNetV2对应的 paddlecv/configs/single_op/PP-LCNetV2.yml 同样提供单算子级配置。PP-HGNetGPU 高性能骨干网络PP-HGNet 面向 Nvidia GPU 场景ImageNet 1k 精度可达79.83% / 81.51%不同规格同等速度下相较 ResNet34-D 提高 3.8 个百分点相较 ResNet50-D 提高 2.4 个百分点在使用百度自研SSLD 蒸馏策略后精度相较 ResNet50-D提高 4.7 个百分点。modelcenter/PP-HGNet/info.yaml 将其定位为「面向 Nvidia GPU 端的高性能卷积神经网络」完整资料见 modelcenter/PP-HGNet配置入口见 paddlecv/configs/single_op/PP-HGNet.yml。PP-ShiTu 与 PP-ShiTuV2轻量图像识别系统PP-ShiTu 是轻量图像识别系统集成了目标检测、特征学习、图像检索等模块广泛适用于各类图像识别任务官方声明其CPU 上 0.2s 即可完成在 10w 库的图像识别。PP-ShiTuV2 是基于 PP-ShiTuV1 改进的实用轻量级通用图像识别系统由主体检测、特征提取、向量检索三个模块构成相比 V1 具有更高的识别精度、更强的泛化能力以及相近的推理速度。模型中心入口分别为 modelcenter/PP-ShiTu 与 modelcenter/PP-ShiTuV2在 paddlecv/configs/system/PP-ShiTu.yml 与 paddlecv/configs/system/PP-ShiTuV2.yml 中可看到其作为系统级多算子串联流程的配置方式。PaddleDetection目标检测、跟踪与人体/车辆分析PaddleDetection 的 PP 系列覆盖从通用检测到端侧超轻量检测、从单模型到多任务流水线的完整谱系。PP-YOLO / PP-YOLOv2 / PP-YOLOE / PP-YOLOEYOLO 系列演进模型定位与关键指标PP-YOLO基于 YOLOv3 优化的高精度目标检测模型精度45.9%单卡 V100 FP32 推理72.9 FPS开启 TensorRT 后 FP16 推理155.6 FPSPP-YOLOv2对比 PP-YOLO 精度提升 3.6%达到49.5%640×640 输入下速度68.9 FPS采用 TensorRT 加速可达106.5 FPSPP-YOLOE高精度云边一体 SOTA 检测模型提供s/m/l/x 版本l 版本 COCO test2017 精度51.4%V100 预测78.1 FPS支持混合精度训练训练较 PP-YOLOv2 加速 33%多尺度系列适配服务器、边缘端 GPU 及其他 AI 加速卡PP-YOLOEPP-YOLOE 升级版最高精度提升 2.4% mAP 达到54.9% mAP训练收敛速度提升 3.75 倍端到端预测速度最高提升 2.3 倍多个下游任务泛化性提升对应模型中心入口modelcenter/PP-YOLO、modelcenter/PP-YOLOv2、modelcenter/PP-YOLOE、modelcenter/PP-YOLOE配置入口paddlecv/configs/single_op/PP-YOLO.yml、paddlecv/configs/single_op/PP-YOLOv2.yml、paddlecv/configs/single_op/PP-YOLOE.yml、paddlecv/configs/single_op/PP-YOLOE.yml。PP-PicoDet超轻量级目标检测PP-PicoDet 提供xs/s/m/l 四种尺寸其中 s 版本参数量仅1.18M却可达到32.5% mAP相较 YOLOX-Nano 精度高 6.7%、速度快 26%同时优化量化部署方案实现在移动端部署加速 30%。模型中心入口为 modelcenter/PP-PicoDet单算子配置见 paddlecv/configs/single_op/PP-PicoDet.yml。PP-Tracking实时多目标跟踪工具PP-Tracking 融合目标检测、行人重识别、轨迹融合等核心能力提供行人车辆跟踪、跨镜头跟踪、多类别跟踪、小目标跟踪及流量计数等能力与产业应用。PP-TinyPose / PP-TinyPose超轻量级人体关键点检测PP-TinyPose超轻量级人体关键点检测算法单人场景 FP16 推理可达122 FPS、精度 51.8% AP具有精度高速度快、检测人数无限制、微小目标效果好的特点。模型中心入口为 modelcenter/PP-TinyPoseinfo.yaml 展示其同时挂载「目标检测」与「关键点检测」两个任务标签并附有「智能健身动作识别」产业范例系统级配置见 paddlecv/configs/system/PP-TinyPose.yml。PP-TinyPosePP-TinyPose 升级版在健身、舞蹈等场景的业务数据集端到端 AP 提升 9.1新增体育场景真实数据复杂动作识别效果显著提升覆盖侧身、卧躺、跳跃、高抬腿等非常规动作检测模型升级为 PP-PicoDet 增强版COCO 数据集精度提升 3.1%关键点稳定性增强新增滤波稳定方式视频预测结果更加稳定平滑。PP-Human / PP-HumanV2产业级实时行人分析PP-Human产业级实时行人分析工具支持属性分析、行为识别、流量计数/轨迹留存三大功能覆盖目标检测、多目标跟踪、属性识别、关键点检测、行为识别和跨镜跟踪六大核心技术。系统级配置见 paddlecv/configs/system/PP-Human.yml 与 paddlecv/configs/system/PP-Human-Attr.yml。PP-HumanV2新增打架、打电话、抽烟、闯入四大行为识别底层算法性能升级覆盖行人检测、跟踪、属性三类核心算法能力提供保姆级全流程开发及模型优化策略。完整代码与配置在 modelcenter/PP-HumanV2含 pipeline、pptracking、python 三套代码目录与 app.py、app.yml。PP-Vehicle车辆识别与分析PP-Vehicle 提供车牌识别、车辆属性分析颜色、车型、车流量统计以及违章检测四大功能完善的文档教程支持高效完成二次开发与模型优化。完整实现位于 modelcenter/PP-Vehicle同样包含 pipeline、pptracking、python 三套代码目录系统级配置见 paddlecv/configs/system/PP-Vehicle.yml。PaddleSeg人像分割、轻量语义分割与高精度抠图PaddleSeg 的 PP 系列同时覆盖「人像场景」与「通用场景」。PP-HumanSeg / PP-HumanSegV2人像分割系列PP-HumanSeg在大规模人像数据上训练的人像分割系列模型提供多种模型满足 Web 端、移动端、服务端多种使用场景。其中PP-HumanSeg-Lite采用轻量级网络设计、连通性学习策略、非结构化稀疏技术实现体积、速度和精度的平衡参数量137K、速度95 FPS、mIoU 达93%。PP-HumanSegV2改进版本肖像分割模型推理耗时减小 45.5%、mIoU提升 3.03%、可视化效果更佳通用人像分割模型的推理速度和精度也有明显提升。模型中心入口为 modelcenter/PP-HumanSegV2配置见 paddlecv/configs/single_op/PP-HumanSegV2.yml。PP-HumanMatting / PP-Matting / PP-MattingV2抠图系列PP-HumanMatting通过低分辨率粗预测和高分辨率 Refine 的两阶段设计在增加小量计算量的情况下有效保持高分辨率2048人像抠图中细节信息。PP-Matting通过引导流设计实现语义引导下的高分辨率细节预测进而实现trimap-free高精度图像抠图在公开数据集 Composition-1k 和 Distinctions-646 测试集取得了 SOTA 效果。完整代码与配置见 modelcenter/PP-Matting含 APP1 目录下的 app.py、predict.py、download.py 等。PP-MattingV2轻量级抠图模型通过双层金字塔池化及空间注意力提取高级语义信息并利用多级特征融合机制兼顾语义和细节的预测。对比 MODNet 模型推理速度提升 44.6%误差平均相对减小 17.91%追求更高速度时推荐使用。对应 paddlecv/configs/single_op/PP-MattingV1.yml。PP-LiteSeg通用轻量级语义分割PP-LiteSeg 使用灵活高效的解码模块、统一注意力融合模块、轻量的上下文模块针对 Nvidia GPU 上的产业级分割任务实现精度和速度的平衡在 1080ti 上精度为 mIoU72.0Cityscapes 数据集时速度高达273.6 FPS。模型中心入口为 modelcenter/PP-LiteSeg配置见 paddlecv/configs/single_op/PP-LiteSeg.yml。PaddleOCR两阶段 OCR 系统与文档智能分析PaddleOCR 的 PP 系列覆盖「文字识别」与「文档分析」两大场景。PP-OCR / PP-OCRv2 / PP-OCRv3OCR 系统代际演进模型定位与关键指标PP-OCR两阶段超轻量 OCR 系统包括文本检测、方向分类器、文本识别三个部分支持竖排文本识别PP-OCR mobile 中英文模型3.5M、英文数字模型2.8M在通用场景下达到产业级标准PP-OCRv2在 PP-OCR 基础上优化平衡 PP-OCR 模型的精度和速度效果相比 PP-OCR mobile 提升 7%推理速度相比于 PP-OCR server 提升 220%支持80 种多语言模型PP-OCRv3进一步优化中文场景效果相比 PP-OCRv2 再提升 5%英文场景提升 11%80 语种多语言模型平均识别准确率提升 5% 以上模型中心入口modelcenter/PP-OCRv2、modelcenter/PP-OCRv3。其中 modelcenter/PP-OCRv3/info.yaml 表明其训练数据来自 ICDAR 2015、LSVT、RCTW-17、Total-Text、ArT 等公开数据集并附有「电表检测识别」「PCB 字符识别」两个产业范例系统级配置见 paddlecv/configs/system/PP-OCRv2.yml、paddlecv/configs/system/PP-OCRv3.yml。PP-Structure / PP-StructureV2智能文档分析系统PP-Structure一套智能文档分析系统支持版面分析、表格识别含 Excel 导出、关键信息提取与 DocVQA含语义实体识别和关系抽取。PP-StructureV2基于 PP-Structure 全面升级适配中文场景新增支持版面复原支持一行命令完成 PDF 转 Word。模型中心入口为 modelcenter/PP-StructureV2在 paddlecv/configs/system 中可看到其拆分为版面分析PP-Structure-layout-table.yml、语义实体识别PP-Structure-ser.yml、关系抽取PP-Structure-re.yml、表格识别PP-Structure-table.yml等多个子任务配置。PaddleGAN 与 PaddleVideo视频超分与视频理解PP-MSVSR高精度视频超分PP-MSVSR 提供1.45M 和 7.4M 两种参数量大小的模型以PSNR 32.53、SSIM 0.9083达到业界 SOTA对输入视频的分辨率不限制支持分辨率一次提升 400%。模型中心入口为 modelcenter/PP-MSVSR。PP-TSM / PP-TSMv2高精度实用视频分类PP-TSM高精度 2D 实用视频分类模型在不增加参数量和计算量的情况下在 UCF-101、Kinetics-400 等数据集上精度显著超过 TSM 原始模型。PP-TSMv2沿用部分 PP-TSM 优化策略从骨干网络与预训练模型选择、数据增强、tsm 模块调优、输入帧数优化、解码速度优化、DML 蒸馏、时序 attention 模块等 7 个方面进行调优在中心采样评估方式下精度达到75.16%输入 10s 视频在 CPU 端的推理速度仅需456ms。模型中心入口为 modelcenter/PP-TSM。PaddleNLP多语言预训练、通用信息抽取与文档大模型PaddleNLP 的 PP 系列以 ERNIE 家族为主体覆盖多语言建模、通用信息抽取、轻量级文本预训练与跨模态文档智能。ERNIE-M多语言预训练模型ERNIE-M 提出基于回译机制从单语语料中学习语言间的语义对齐关系在跨语言自然语言推断、语义检索、语义相似度、命名实体识别、阅读理解等各种跨语言下游任务中取得了 SOTA 效果。模型中心入口为 modelcenter/ERNIE-M。ERNIE-UIE通用信息抽取模型ERNIE-UIE 实现实体抽取、关系抽取、事件抽取、情感分析等任务的统一建模使不同任务间具备良好的迁移和泛化能力支持文本、跨模态文档的信息抽取支持中、英、中英混合文本抽取零样本和小样本能力卓越。模型中心入口为 modelcenter/ERNIE-UIE含可直接运行的 app.py 与 app.yml。ERNIE 3.0 系列在线蒸馏得到的轻量级文本预训练模型在文心大模型 ERNIE 3.0 基础上通过在线蒸馏技术得到四个轻量级规格CLUE 评测验证其在同等规模模型中效果 SOTA模型结构规格ERNIE 3.0-Medium6-layer, 768-hidden, 12-headsERNIE 3.0-Mini6-layer, 384-hidden, 12-headsERNIE 3.0-Micro4-layer, 384-hidden, 12-headsERNIE 3.0-Nano4-layer, 312-hidden, 12-heads统一模型中心入口为 modelcenter/ERNIE-3.0含 introduction_cn.ipynb、download_cn.md、benchmark_cn.md、fastdeploy_cn.md 等。ERNIE-Layout多语言跨模态布局增强文档智能大模型ERNIE-Layout 将布局知识增强技术融入跨模态文档预训练在多项文档理解任务上刷新效果官方声明登顶 DocVQA 榜首。模型中心入口为 modelcenter/ERNIE-Layout。ERNIE-ViL场景图知识多模态预训练模型ERNIE-ViL 是业界首个融合场景图知识的多模态预训练模型在视觉常识推理、视觉问答、引用表达式理解、跨模态图像检索、跨模态文本检索等典型多模态任务中刷新世界最好效果并在视觉常识推理任务VCR上登顶榜首。PaddleSpeech语音识别、语音合成与声纹检索PP-ASR流式语音识别系统PP-ASR 是基于端到端神经网络结构模型的流式语音识别系统支持实时语音识别服务支持 Language Model 解码与个性化识别。模型中心入口为 modelcenter/PP-ASR。PP-TTS流式语音合成系统PP-TTS 是基于端到端神经网络结构的流式语音合成系统支持流式声学模型与流式声码器开源快速部署流式合成服务方案。模型中心入口为 modelcenter/PP-TTS。PP-VPR声纹提取与检索系统PP-VPR 使用ECAPA-TDNN模型提取声纹特征识别等错误率EER低至0.95%通过串联 MySQL 和 Milvus 搭建完整的音频检索系统实现毫秒级声音检索。ERNIE-SAT语音-语言跨模态大模型ERNIE-SAT 在语音编辑、个性化语音合成以及跨语言的语音合成等多个任务取得领先效果可应用于语音编辑、个性化合成、语音克隆、同传翻译等一系列场景。在仓库中快速上手 PP 系列模型本仓库为每个 PP 模型提供了结构统一的模型中心modelcenter可直接作为快速开始入口。以 modelcenter/PP-LCNet 为例目录内包含info.yaml模型元信息包括名称、中英文简介、来源套件from_repo、任务与子任务标签、数据集、发布方、License、论文、是否支持训练IfTraining与在线 DemoIfOnlineDemo等introduction_cn.ipynb / introduction_en.ipynb模型原理与应用场景介绍Notebook 形式可在线运行download_cn.md / download_en.md各任务场景下的推理模型与预训练模型文件下载说明benchmark_cn.md / benchmark_en.md训练与推理 Benchmark包括软硬件环境、数据集、训练和推理指标等评估数据fastdeploy_cn.md / fastdeploy_en.md基于 FastDeploy 的快速部署方案APP/部分模型提供可运行的在线体验 Demo 代码Streamlit / Gradio如 modelcenter/PP-HumanV2/APP、modelcenter/PP-OCRv3/APP。按照 modelcenter/guide_cn.md 的说明体验方式有三种一是在 AI Studio 深度学习实训平台直接在线运行二是在 BML 产业 AI 中台实践三是下载压缩包到本地需提前安装好飞桨框架基础环境压缩包内不包含模型训练文件和推理文件。对于希望以统一配置方式串联多模型/多算子的开发者仓库提供了 paddlecv 这一面向产业应用的 CV 能力库单算子配置paddlecv/configs/single_op如 PP-LCNet、PP-HGNet、PP-PicoDet、PP-YOLOE、PP-LiteSeg 等每个模型一个 YAML系统级配置paddlecv/configs/system如 PP-Human、PP-Vehicle、PP-OCRv3、PP-ShiTuV2、PP-TinyPose 等描述多模型串联的完整流水线运行入口为 paddlecv/paddlecv.py 与 paddlecv/tools/predict.py并有配套测试paddlecv/tests与文档paddlecv/docs/GETTING_STARTED.md、paddlecv/docs/INSTALL.md。模型选型参考结合 docs/official/PP-Models.md 提供的官方指标可按硬件与场景做如下初步选型属于对文档数据的归纳具体仍需结合业务数据集验证CPU 端分类骨干追求极致速度选 PP-LCNet400 FPS 档兼顾精度选 PP-LCNetV277.04% / 230 FPSGPU 端分类骨干选 PP-HGNet配合 SSLD 蒸馏可进一步提升端侧/移动端检测选 PP-PicoDet1.18M 参数、支持量化部署云边一体检测选 PP-YOLOE/PP-YOLOE 的 s/m/l/x 多尺度系列人体/车辆分析PP-HumanV2 覆盖检测、跟踪、属性与行为识别PP-Vehicle 覆盖车牌、属性、流量与违章检测均提供完整的 pipeline 代码可直接二次开发OCR 与文档智能通用 OCR 选 PP-OCRv3文档版面/表格/关键信息抽取选 PP-StructureV2视频超分选 PP-MSVSR分类选 PP-TSMv2NLP/语音信息抽取选 ERNIE-UIE零样本/小样本轻量文本预训练选 ERNIE 3.0 系列语音识别/合成/声纹分别对应 PP-ASR、PP-TTS、PP-VPR。小结飞桨 PP 系列模型的价值在于它不是孤立的模型集合而是围绕「精度与效率平衡」的产业诉求在 PaddleClas、PaddleDetection、PaddleSeg、PaddleOCR、PaddleGAN、PaddleVideo、PaddleNLP、PaddleSpeech 八大套件中形成的一整套可落地能力。本仓库通过 modelcenter 的统一模型中心元信息、介绍、下载、Benchmark、FastDeploy、Demo与 paddlecv 的配置化流水线把从模型了解、数据准备、训练评估到部署集成的全流程都收敛到了可复现的路径上。开发者可以直接以 docs/official/PP-Models.md 为索引按任务类型进入对应模型的模型中心完成快速开始。赞分享人工智能深度学习计算机视觉NLP语音【免费下载链接】modelsOfficially maintained, supported by PaddlePaddle, including CV, NLP, Speech, Rec, TS, big models and so on.项目地址https://gitcode.com/gh_mirrors/mo/models点击查看免费下载相关推荐飞桨产业级开源模型库全景导读官方、学术与社区三大模型生态及 PP 系列产业模型实战指南飞桨产业级开源模型库全景导读官方、学术与社区三大模型生态及 PP 系列产业模型实战指南 飞桨PaddlePaddle产业级开源模型库PaddlePadd人工智能深度学习计算机视觉NLP语音飞桨官方模型库全览600 产业级模型的分方向索引与开发套件实践指南飞桨官方模型库全览600 产业级模型的分方向索引与开发套件实践指南 飞桨PaddlePaddle官方模型库汇聚了 600 余个经过产业实践长期打磨的主流人工智能深度学习计算机视觉NLP语音SmartJavaAI PaddlePaddle飞桨模型兼容SmartJavaAI PaddlePaddle飞桨模型兼容 ? 痛点直击Java开发者为何需要PaddlePaddle兼容 还在为Java项目集成OCR人工智能计算机视觉OCR语音NLP上一篇GitHub_Trending/by/bytebot日志聚合挑战大规模部署与性能优化下一篇Oak语言文档工具使用教程为你的代码自动生成专业文档创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考