H100 和 H200 怎么选:训练、推理、长上下文任务分别怎么租

发布时间:2026/8/22 22:51:05
H100 和 H200 怎么选:训练、推理、长上下文任务分别怎么租 租旗舰卡时大家真正纠结的往往不是 H100 强不强而是 H200 那部分差价能不能赚回来。这个答案主要藏在显存里。H100 和 H200 都是 Hopper 架构核心计算性能、700W 功耗和 900GB/s 的 NVLink 没拉开差距。H200 多出来的是从80GB 到 141GB的显存以及从3.35TB/s 到 4.8TB/s的带宽。省流版直接看结论7B 到 32B 的常规推理和微调H100 80G 基本够用。上下文很长、并发很高或者训练配置偏重再去看 H200。70B 模型做 FP8 单卡推理是两张卡拉开差距的典型场景。H100 装下权重后所剩不多H200 装下权重后通常够留出像样的 KV cache 和运行余量。128K 级长上下文、高并发推理显存空间往往比标称算力更要紧H200 的优势也最容易落到业务里。多卡训练不能只看单价。H200 若能少用一半卡互联、调度和机柜资源也会少一截还是要拿实际报价算总账。两张卡的核心计算指标相同。H200 的差价买的是显存和带宽不是更多的 Tensor Core。01 先看硬件差别H100 SXM 和 H200 SXM 的计算指标一样差别集中在显存系统。规格H100 SXMH200 SXM差异显存容量80GB HBM3141GB HBM3e1.76 倍显存带宽3.35 TB/s4.8 TB/s1.43 倍FP16/BF16 Tensor Core 非稀疏/稀疏989.5 / 1,979 TFLOPS989.5 / 1,979 TFLOPS相同FP8 Tensor Core 非稀疏/稀疏1,979 / 3,958 TFLOPS1,979 / 3,958 TFLOPS相同NVLink900 GB/s900 GB/s相同最大 TDP700W700W相同MIG 实例最多 7 个最多 7 个每实例 18GBH200 分片更大只看官方核心计算指标两张卡没什么区别FP64、FP32、TF32、BF16 和 FP8 全部一致。大模型生成 token 时经常在等显存搬数据。H200 的显存带宽高约 43%通常有利于提高这段过程的吞吐。能快多少还是要看模型、并发、框架和调度方式不能把带宽差直接当成业务吞吐差。容量带来的变化更直观。H200 多出的 61GB可以塞下更大的 batch也能留更长的上下文。NVIDIA 的 Llama 2 70B 演示里H100 使用 batch 8H200 使用 batch 32最终测得 1.9 倍吞吐。虽然这个数字是特定测试条件下的结果不能直接套到每个模型上但它说明了显存余量会怎样影响服务能力。还有一点很实在两张卡都是 700W。在显存带宽受限的推理任务里H200 有机会用同样的电力和机柜功率换来更高吞吐。规模起来后这部分才可能变成 TCO 差距。需要提醒的是下单前还得核对版本。H100 市面上常见的是 SXM 80G也有 PCIe 版本。后者是 80GB HBM2e带宽 2.0TB/sNVLink 为 600GB/s和 H200 的差距会更大。H200 也有 SXM 与 NVLNVL 是 PCIe 双卡形态显存带宽同为 4.8TB/s。H10002不同任务分别需要什么1. 推理看剩余显存推理时的显存主要花在模型权重和 KV cache 上。FP16 权重可以先按每 10 亿参数约 2GB 粗算FP8 或 INT8 大致减半实际还要给量化元数据和运行时留位置。拿 70B 模型做 FP8 推理举例权重大约70GB。H100 80G 装进权重后只剩约10GBKV cache 和运行时很容易把空间挤满单卡做服务会很局促。H200 装下权重后还剩约70GB一张卡能留出更多回旋余地。30B 以内的模型FP16 权重通常不超过 60GBH100 已经够用。再往下到 7B、13BA100 或 L40S 常常更省钱没必要一上来就租 H200。上下文不长、并发也只是中等的 32B 以内任务H200 的大显存很难被吃满。钱会花在空闲显存上。2.长上下文最吃 KV cacheKV cache 会跟着 token 总量往上走。每个 token 占多少和模型的层数、KV 头数、维度以及 KV 精度有关。以 Llama 3 70B 为例它有 80 层、8 个 KV 头每头 128 维。FP16 下每个 token 的 KV cache 约 0.3MB换成 FP8 KV 可以大致减半。一条128K上下文请求就可能吃掉40GB 以上的 KV cache。10 个并发请求量级就到400GB了。PagedAttention、KV 量化和批处理策略能提高利用率但很难把这个量级变没。这时两张卡的区别很直观。H100 跑完 70B FP8 权重余下约10GB放不下一条 128K 请求所需的 FP16 KV cache。H200 还有约 70GB更有机会容纳一条 128K 级请求所需的 KV cache实际还要看 KV 精度和运行时开销中短上下文下 H200 通常能拉起更高并发。预算卡得紧可以先压 KV 精度、限制上下文再用 2 张 H100 分摊也能跑。只是业务本身就是长文档分析、代码库 RAG 或 Agent 长记忆时这些办法往往是在和显存较劲H200 会省事一些。H2003. 微调和训练看卡数微调还要留出梯度、优化器状态和激活值显存压力比推理高。70B 的 QLoRA 使用 4-bit 基座时权重大约 35GB 到 40GB。单卡 H100 有社区实践能跑只是 batch 和序列长度不太好放开。H200 空间宽松一些这两项都更容易放开。这份宽松来自显存不是算力。70B 的 LoRA 使用 FP16 基座时权重约 140GB。2 张 H200 比较从容。4 张 H100 也能做卡数多一倍通信和调度也跟着复杂起来。13B 及以下的 LoRA 或 QLoRAH100 甚至 A100 就够了H200 的优势很难用出来。全参数训练又是另一档。BF16 下把权重、梯度和 Adam 状态放在一起算每个参数常按 12 到 16 字节估。这里按保守的 16 字节算70B 模型只算这几项就要 1.1TB 以上激活值还没算进去。8 张 H200 总显存是 1128GB跑 70B 全参训练依然很紧通常还要配 ZeRO 分片、激活重计算甚至 CPU offload。8 张 H100 只有 640GB空间会更不够常常要往 16 卡级去配。H200 在全参训练里的价值通常不是单卡算得更快而是有机会用更少的卡完成部署通信和重计算压力也小一些。7B 到 14B 的全参训练用 8 张 H100 已是常见配置。这个任务上H200 未必划算。按任务选卡一表总结维度H100 80GH200 141G选型含义FP8 推理模型规模7B 到 32B7B 到 70B 单卡70B 是常见单卡分界线128K 级长上下文单卡余量很紧单卡显存余量更充足KV cache 是关键高并发推理并发上限容易受显存挤压同一任务可能用更少卡要算总价LoRA/QLoRA70B 单卡偏紧单卡更宽裕更容易放开 batch全参训练70B 常需 16 卡级8 卡可尝试仍需 ZeRO 等策略通信更简单计算性能相同相同不用为算力差价买单租赁单价较低更高溢价来自显存和带宽模型在 32B 以内、上下文是中短、并发也不高选 H100。7B 到 14B 的微调或全参训练预算敏感的阶段性验证也适合从 H100 起。要跑 70B 的单卡或双卡推理业务有 128K 级长上下文或者 KV cache 已经开始和权重抢位置H200 才进入候选名单。7B、13B 的轻量推理H100 都可能偏贵A100 80G、L40S 或消费级卡更合算。千亿级稠密模型训练和超大规模 MoE 部署H100 和 H200 可能都只是起步配置还得看更新的旗舰卡和集群方案。03租赁别只看单价租错卡不一定最贵。没把显存算清就包月才容易把预算烧在空转上。先把峰值显存拆开算模型权重、KV cache训练的话还要算上梯度、优化器状态和激活值最后额外留 20% 给运行时。峰值在 60GB 内H100 通常够用。落在 60GB 到 130GB单卡 H200 可以进入比较。超过 130GB多卡绕不开这时要反过来算 H200 能不能省下卡数。验证模型、量化方案和吞吐时先短租 H100 跑一轮很合适。瓶颈真在显存再升级 H200。旗舰卡按天空转费用攒得很快。生产服务比较稳定后包周或包月的均摊价通常更低。压测结果显示 H100 能扛住峰值就不用为了将来可能不够提前上 H200。需求涨上来再扩往往比提前囤显存划算。多卡尤其要拿实际价格算。如果 2 张 H200 在你的模型、上下文和并发配置下能顶 4 张 H100少掉的不只是两张卡还有机柜位置、互联复杂度和日常维护。反过来2 张 H200 的总价明显高过 4 张 H100省下的运维成本是否值得差价就得按你的业务规模算。已经算过显存最靠谱的下一步还是开一台实例跑压测。立方云是杭州网鼎科技旗下专注GPU算力租赁的边缘算力平台提供多种GPU实例以及裸金属服务具体卡型配置和价格可点击下方访问立方云算力平台官网查看。