)
经常有朋友问我你平时跑模型算力到底花了多少钱趁着最近项目告一段落我认真盘了一下这半年的账也顺带聊聊踩过的坑。给预算有限、又想认真玩 AI 的同学一点参考。一、第一阶段差点冲动买卡刚开始学想着长期用还是自己买划算差点下单一张 3090。一算账就醒了单卡 309024G约 1.2 万只能玩玩 7B 以下想上 13B/70B得 409024G甚至 A100/H100单张几万到十几万还要机柜、电费、散热、运维折旧又快结论对个人和小团队买卡只有量很大且长期才划算否则就是把钱焊在闲置显存上。二、第二阶段大厂云包月肉疼后来图省事包了某大厂云的包月 GPU体验稳但两个问题贵H100 包月四位数起步对小项目压力大闲置浪费我白天跑、晚上关包月那段空闲时间等于白付。适合7×24 满负荷的业务不适合我这种脉冲式需求。三、第三阶段换成按需按分钟的云账单塌了最后切到按分钟计费的按需云——我用的是oriGPUorigpu.com分钟级开卡、CUDA/驱动预装好跑完就释放。半年算下来月均算力支出比包月阶段降了大概60%单次 13B 微调约 28 小时 H100成本可控在几百块想试新架构Blackwell B200 / GB300也不用额外囤卡不是恰饭是个人体验小平台资料少但按分钟计费 即开即用对脉冲式负载是真省钱节点在芬兰/加拿大那边国内 ssh 延迟能接受。四、几点花真金白银换来的经验先算使用率再决定买/租月均使用时长 60%基本租更省。脉冲式负载坚决别包月按需按分钟跑完就关账单立刻友好。显存按需选卡不是越大越好13B 微调 H10080G够用上 70B 才考虑多卡/NVLink。新架构可以试用Blackwell 这代性价比不错但别为追新囤卡租来试最稳。算力成本的本质是把支出和真实使用节奏对齐。我这半年最大的教训就是别为万一要用提前买单。你们半年算力花了多少用的哪家评论区晒晒账单互相抄作业