
LLM推理吞吐上不去TensorRT-LLM 推理加速实战【免费下载链接】TensorRT-LLMTensorRT LLM provides users with an easy-to-use Python API to define Large Language Models (LLMs) and supports state-of-the-art optimizations to perform inference efficiently on NVIDIA GPUs. TensorRT LLM also contains components to create Python and C runtimes that orchestrate the inference execution in a performant way.项目地址: https://gitcode.com/GitHub_Trending/te/TensorRT-LLM你在 NVIDIA GPU 上跑 LLM 在线服务大概率遇到过这种体验prefill一次处理完全部输入的阶段很快decode逐 token 生成的阶段很慢批大小加上去吞吐也不涨。TensorRT-LLM 推理加速就是冲着这个卡点来的一套手写 CUDA 内核库、一层 KV cache 管理、一个开箱即用的 trtllm-serve 服务工具让你不改自己的代码也能把 decode 阶段拉起来。第一刀砍在 decodeXQA 内核怎么干给任何 LLM 服务做个 profiledecode 几乎都是内存带宽受限的负载每步只产出一个 token矩阵乘太小喂不饱 GPU注意力还得反复去 HBM 里捞 KV cache存放已生成 token 中间结果的缓存。仓库在 cpp/kernels/xqa/ 下写了个专门的内核 XQAeXtended Quality Attention目标就是生成阶段的 MQA多头查询注意力多个头共享同一份 K/V和 GQA分组查询注意力一组头共享 K/V结构。思路很直白用 tensor core 算用 TMA张量内存加速器硬件 DMA 通道搬数据顺路砍掉数据搬运和格式转换。效果不是营销话术。仓库里 XQA 内核博客 附了实测表H200 上跑 Llama-70B、FP88 位浮点量化格式在同样的单 token 延迟预算内启用 XQA 吞吐最高提升2.4x。TensorRT-LLM 推理加速 XQA 内核吞吐与延迟对比曲线换成正确路径后这张图里 Y 轴是 TPOT单 token 输出时间越低越好启用 XQA 之后曲线明显走平意思是批量加大时单 token 耗时不再陡涨——这才是同等体验下多服务用户的实际含义。KV cache 与 MoE后台的两个重量级内核只是一半。decode 阶段每个请求都要反复读 KV cache怎么组织它决定显存占用和调度余地。看 tensorrt_llm/runtime/kv_cache_manager_v2/ 目录_block_radix_tree.py 把 KV 页组织成基数树压缩前缀树共享同一段 system prompt 的请求直接复用同一批页_eviction_controller/ 管池子满了怎么淘汰整层用 mypyc 编译因为它每个调度步都会被调用吃不起解释器开销。如果你的模型是 MoE混合专家路由把每个 token 分给少数专家网络专家调度和跨 GPU 通信就是新的瓶颈。cpp 层的 mixtureOfExperts 模块、examples/wide_ep/ 目录专门做专家并行EP把专家摊到多卡README 的技术博客清单里还有 alltoall专家间换 token 的集合通信原语优化的持续记录。这种按模型结构做的针对性调优是它区别于通用 serving 框架的地方。在 NVIDIA GPU 上部署 LLM 服务两步到第一条响应不需要自己编译内核库官方容器里全装好了关键点只有一个把 GPU 和内存限制交给容器。docker run --rm -it --ipc host --gpus all --ulimit memlock-1 -p 8000:8000 nvcr.io/nvidia/tensorrt-llm/release:x.y.z容器里执行trtllm-serve TinyLlama/TinyLlama-1.1B-Chat-v1.0就能起一个 OpenAI 兼容的服务有预量化好的 checkpoint 直接换上去省掉运行时量化。发一条请求验证curl -X POST http://localhost:8000/v1/chat/completions \ -H Content-Type: application/json \ -d {model: TinyLlama/TinyLlama-1.1B-Chat-v1.0, max_tokens: 32}拿到返回说明从内核到服务链路全通了。上生产前容易踩的三个坑量化 checkpoint 优先。仓库 tensorrt_llm/quantization/ 下有量化工具和配置模板离线量化好的模型直接部署比运行时转换稳。先用官方工具跑基线。trtllm-bench 是仓库内置的基准命令developer-guide 里单独写了 benchmark 方法论先复现出数字再判断问题出在内核还是配置。遥测要表态。trtllm-serve 等命令默认收集匿名遥测接受不了就用--no-telemetry关掉收集字段在 README 里逐条列了可审计。部署指南 里按模型各有一篇配方DeepSeek-R1、Qwen3、Kimi 都覆盖到了碰到具体配置先翻那里。打开终端把容器拉起来发出第一条请求——剩下的就是调参了。【免费下载链接】TensorRT-LLMTensorRT LLM provides users with an easy-to-use Python API to define Large Language Models (LLMs) and supports state-of-the-art optimizations to perform inference efficiently on NVIDIA GPUs. TensorRT LLM also contains components to create Python and C runtimes that orchestrate the inference execution in a performant way.项目地址: https://gitcode.com/GitHub_Trending/te/TensorRT-LLM创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考