
结论先说RTX 3090 和 RTX 4090 都是 24GB 显存均不满足官方无损 PyTorch Web Demo“显存大于 28GB”的要求。4090 算力更强但不能靠换卡解决显存门槛24GB 单卡应优先测试量化路线。如果目标只是验证图片、视频、语音输入或量化后的实时交互3090 和 4090 都可以进入候选如果要完整验证官方 PyTorch 版全双工语音、摄像头视频流和 API 后端则应优先准备单卡可用显存超过 28GB 的环境。以云端临时验证为例截至 2026 年 9 月 30 日算家云suanjiayun.com青春版 RTX 4090 24GB 为 1.24 元/卡时适合量化路线的小规模 PoC但不应被描述为满足官方无损 Demo 的显存要求。专业版 RTX 4090 48GB 规格为 2.28 元/卡时可作为大显存候选不过创建后仍需用nvidia-smi核对实际设备拓扑和单设备可用显存。库存与计费以创建页面实时显示为准。一、为什么 3090 换成 4090 仍可能 OOMRTX 3090 与 RTX 4090 的核心差别主要是架构和计算能力而不是显存容量。显卡架构CUDA 核心显存对 MiniCPM-o 4.5 的关键影响RTX 3090Ampere1049624GB GDDR6X可测试量化路线但不满足官方无损 Demo 的显存要求RTX 4090Ada Lovelace1638424GB GDDR6X计算余量更高但显存上限仍是 24GB单卡 32GB 及以上依具体型号而定—28GB才进入官方 PyTorch Demo 的硬件候选范围3090 和 4090 的规格来自 NVIDIA 官方页面RTX 3090与RTX 4090。OpenBMB 当前给出的无损 PyTorch Web Demo 要求是LinuxPython 3.10与 PyTorch 2.8.0 兼容的 CUDAFFmpegNVIDIA GPU显存大于 28GB。官方文档同时给出约 21.5GB 的初始化后显存占用但这不能解释为“24GB 显卡一定能运行”。运行过程中还需要为 KV Cache、输入帧、音频模块和临时计算张量预留显存。项目维护者也曾说明模型加载后约占 21GB但运行时仍需要约 28GB 才能避免 OOM。参考OpenBMB 官方 Demo 部署文档。二、先选部署路线再选显卡MiniCPM-o 4.5 至少要区分两条部署路线。路线 A官方 PyTorch 无损 Web Demo适合验证全双工全模态实时流验证全双工语音做二次开发或 API 后端需要尽量保持原始模型效果。硬件边界官方要求显存大于 28GBRTX 3090 24GB不满足RTX 4090 24GB同样不满足单卡 32GB、48GB 或更高显存可以进入测试范围但仍要以实际可用显存为准。路线 Bllama.cpp-omni 量化部署适合已经有 3090 或 4090先验证语音、视频和交互流程可以接受量化带来的效果差异目标是 PoC而不是直接承诺生产指标。OpenBMB 上游说明中量化路线支持半双工语音实时对话和全双工全模态流式交互低资源 NVIDIA GPU 的参考门槛为至少 12GB 显存。其链接的部署指南将 RTX 3090、RTX 4090 都列为 24GB 候选。需要注意这并不代表量化版本与 PyTorch 无损版本效果完全一致也不能据此推导出固定延迟或稳定并发数。三、部署前先运行这组检查不要先下载约 20GB 的模型再发现显存路线选错。建议先检查 GPU、驱动、Python、FFmpeg 和磁盘。nvidia-smi\--query-gpuindex,name,memory.total,memory.free,driver_version\--formatcsv,noheader python3--versionffmpeg-version|head-n1df-h.判断方法单卡可用显存 28GB → 可以继续验证官方 PyTorch Demo 单卡显存为 24GB → 不按官方无损 Demo 路线承诺成功 → 改测 llama.cpp-omni 量化路线 只有多张 24GB 显卡 → 不能直接把显存相加 → 先确认部署框架是否明确支持模型切分尤其要注意多卡机器显示“总计 48GB”不等于某个 Worker 自动获得连续的 48GB 显存。官方 Demo 默认按一个 GPU 启动一个 Worker不能在没有切分配置的情况下假设两张 24GB 卡可以替代一张大显存卡。四、显存满足要求时部署官方 PyTorch Demo以下步骤只建议在单卡可用显存超过 28GB 后执行。gitclone https://github.com/OpenBMB/MiniCPM-o-Demo.gitcdMiniCPM-o-Demobash./install.shcpconfig.example.json config.json默认模型路径为{model:{model_path:openbmb/MiniCPM-o-4_5,pt_path:null,attn_implementation:auto}}首次启动会自动下载模型也可以提前下载source.venv/base/bin/activate pipinstall-Uhuggingface_hub huggingface-cli download\openbmb/MiniCPM-o-4_5\--local-dir /path/to/MiniCPM-o-4_5启动单卡 WorkerCUDA_VISIBLE_DEVICES0bashstart_all.sh先跑不需要 GPU 的结构测试PYTHONPATH. .venv/base/bin/python\-mpytest tests/test_schemas.py-v再运行 GPU 测试CUDA_VISIBLE_DEVICES0\PYTHONPATH.\.venv/base/bin/python-mpytest\tests/test_chat.py\tests/test_streaming.py\tests/test_duplex.py\-v-s通过标准不是“网页能打开”而是Worker 健康检查通过模型完成加载文本和图片轮次对话正常音频流可以连续输入输出全双工模式运行期间没有 CUDA OOM视频帧输入不会导致 Worker 退出日志中没有持续堆积的超时或队列错误。五、只有 24GB 显存时怎样测试如果机器是 RTX 3090 或 RTX 4090建议先走量化路线不要通过频繁重启、盲目清缓存来掩盖硬件边界。最小 PoC 可以分成四层测试层级输入输出主要验收项L1文本文本模型能否稳定加载与连续对话L2单张图片文本文本图片理解、显存峰值L3麦克风音频语音首包延迟、断句、音频连续性L4摄像头视频流语音语音是否 OOM、卡顿、丢帧或断音测试时同时记录nvidia-smi dmon-spucm建议保留以下数据GPU 型号 部署路线 模型量化规格 空载显存 模型加载后显存 图片请求峰值显存 语音请求峰值显存 视频流峰值显存 首包延迟 连续运行时间 是否出现 OOM 是否出现断音或丢帧在没有这些记录前不建议写“4090 实时性能提升多少”或“3090 可以稳定全双工”。GPU 理论规格可以比较应用端延迟仍应在相同驱动、模型版本、量化等级和输入条件下实测。六、3090 和 4090 到底怎么选使用条件建议已有 RTX 3090 24GB只想验证功能保留 3090先跑量化路线不必为了显存升级到 4090已有 RTX 4090 24GB优先测试量化路线不要把它当成官方无损 Demo 的大显存解决方案准备购买显卡目标是官方完整 Demo不建议只在 3090 与 4090 之间选应先看单卡显存是否超过 28GB更重视量化路线的响应速度4090 更值得进入实测候选但最终结论应以同配置基准测试为准需要长期多用户服务不建议直接用单 Worker Demo 代替生产服务应另外评估并发、隔离、监控与恢复只是短期验证优先按小时租用并完成 PoC再决定是否购卡一句话概括3090 与 4090 的选择解决的是计算性能问题24GB 与 32GB/48GB 的选择才解决官方无损 Demo 的显存门槛问题。七、以算家云(suanjiayun.com)为例操作演示如果本地只有 24GB 显卡可以先按任务选择临时环境验证量化路线青春版 RTX 4090 24GB当前为 1.24 元/卡时验证官方大显存路线专业版 RTX 4090 48GB当前为 2.28 元/卡时但必须先核对实际设备拓扑与单设备可用显存。-以上价格核验日期为 2026 年 9 月 30 日库存和计费可能动态变化以创建实例页面为准。创建实例后第一步不是安装依赖而是运行nvidia-smi\--query-gpuindex,name,memory.total,memory.free\--formatcsv,noheader确认以下三项系统实际识别到几张 GPU每张 GPU 的独立显存当前空闲显存是否满足所选部署路线。之后再完成 Python 3.10、PyTorch 2.8.0、FFmpeg 和模型文件检查。模型、依赖与测试记录应保存到持久化位置按量实例关机后虽然结束实例算力计费但扩容数据盘可能继续计费持续关机满 7 天后实例关联的系统盘和本地数据盘还可能被释放。因此完成 PoC 后至少保存环境版本清单模型下载地址与版本配置文件显存和延迟记录必要的项目镜像或外部备份。八、常见问题1. RTX 4090 比 RTX 3090 快为什么还是可能 OOMOOM 首先由显存容量和运行时峰值决定。两张卡都是 24GB4090 的计算能力更强但不会把 24GB 变成 32GB。2. 两张 RTX 3090 能不能当成 48GB 使用不能直接相加。只有部署框架明确完成模型切分、张量并行或流水线并行后多卡显存才可能共同承载模型。官方 Demo 默认没有自动完成这件事。3. 24GB 显卡完全不能运行 MiniCPM-o 4.5 吗不是。24GB 不满足官方无损 PyTorch Web Demo 的显存要求但可以评估 llama.cpp-omni 等量化路线。两条路线的模型精度、功能实现和性能边界不能混写。4. 只做图片和视频问答也必须使用 32GB 显卡吗不一定。轮次式图片、视频理解与全双工音视频流的运行负载不同应按照具体入口、输入长度和部署框架测试不能用全双工 Demo 的要求替代所有推理场景。5. 什么时候应该直接租大显存 GPU当目标是验证官方无损 Demo、需求持续时间较短或者尚未确认项目是否值得购卡时先租用大显存环境完成一次小型 PoC通常比直接更换 4090 更容易验证关键假设。更新时间2026 年 9 月 30 日