第一次租用 GPU 云服务器:从 SSH、CUDA 到 PyTorch 跑通第一个任务

发布时间:2026/8/23 5:56:24
第一次租用 GPU 云服务器:从 SSH、CUDA 到 PyTorch 跑通第一个任务 本文目标从零开始创建一台 GPU 实例通过 SSH 登录确认 NVIDIA 驱动和 PyTorch 可以识别 GPU并运行一个最小 CUDA 任务。本文以起源算力origpu.com控制台为例但文中的 SSH、Linux、CUDA 和 PyTorch 检查命令具有通用性。GPU 型号、区域、库存、价格和可选镜像会变化最终请以创建页面当前显示的信息为准。一、第一次使用 GPU 云服务器最容易卡在哪里很多人第一次租用 GPU 云服务器时以为只要创建成功就可以开始训练。实际更容易遇到的问题通常是SSH 用户名或密钥配置不正确实例仍处于初始化状态NVIDIA 驱动和 CUDA 环境没有准备好PyTorch 已经安装但没有识别到 GPU任务结束后只退出了 SSH没有停止或释放实例。因此第一次使用的目标不应该是马上跑大型模型而是先完成一条最小闭环创建实例 → SSH 登录 → 识别 GPU → 运行 PyTorch → 停止或释放资源。二、创建实例前需要准备什么1. 准备 SSH 密钥如果还没有 SSH 密钥可以在本地终端生成一对 Ed25519 密钥ssh-keygen-ted25519-Corigpu-testcat~/.ssh/id_ed25519.pub私钥只保存在自己的电脑上控制台只需要添加公钥。不要把私钥上传到网页、聊天群或代码仓库。2. 选择适合测试的配置第一次使用时建议先选择单卡、短时可完成的配置不要一开始就创建多卡或长时间运行的实例。选择时至少确认GPU 型号和数量GPU 显存CPU 和内存系统盘容量区域和网络条件系统镜像与 CUDA 版本当前价格和计费方式。如果只是验证环境重点是让任务稳定跑通而不是直接追求最贵或最新的 GPU。三、通过 SSH 连接实例实例创建完成后先等待状态变为可连接并从实例详情中确认公网 IP、登录用户名和 SSH 密钥名称。在本地执行chmod600~/.ssh/id_ed25519ssh-i~/.ssh/id_ed25519 用户名公网IP如果出现 Permission denied (publickey)可以按以下顺序检查使用的私钥是否与控制台添加的公钥匹配私钥文件权限是否为 600用户名是否与系统镜像一致实例是否已经获得公网 IP实例是否已经完成初始化。实例还在创建中或初始化时SSH 连接失败并不一定代表实例故障。四、确认系统是否识别 GPU登录实例后先执行nvidia-smi如果命令正常返回通常可以看到 GPU 型号、驱动版本、显存使用量和当前进程。这里不需要只看 GPU 名称还要注意显存总量、驱动版本以及 GPU 利用率是否在任务运行时发生变化。如果出现 nvidia-smi: command not found先确认选择的镜像是否包含 NVIDIA 驱动和 CUDA 环境。不同镜像的预装内容可能不同不建议直接复制其他系统的安装命令。五、确认 PyTorch 可以使用 CUDA如果镜像中已经安装 PyTorch可以执行python -PY import torch print(PyTorch:, torch.__version__) print(CUDA available:, torch.cuda.is_available()) if torch.cuda.is_available(): print(CUDA:, torch.version.cuda) print(GPU:, torch.cuda.get_device_name(0)) print(GPU count:, torch.cuda.device_count()) PY如果 CUDA available 为 False常见原因包括安装的是 CPU 版本 PyTorchPyTorch 与当前 CUDA 环境不匹配驱动没有正确加载当前容器没有获得 GPU 权限代码运行在错误的 Python 环境中。可以继续确认 Python 和 PyTorch 的位置whichpython python-mpip show torch nvidia-smi排查环境时先记录版本再决定是否重新安装依赖。直接反复安装不同版本可能会让问题更难定位。六、运行一个最小 GPU 任务确认 PyTorch 可以识别 GPU 后可以先运行一个矩阵乘法任务importtimeimporttorchifnottorch.cuda.is_available():raiseRuntimeError(CUDA is not available)devicetorch.device(cuda)size2048atorch.randn((size,size),devicedevice)btorch.randn((size,size),devicedevice)torch.cuda.synchronize()starttime.perf_counter()ca b torch.cuda.synchronize()elapsedtime.perf_counter()-startprint(GPU:,torch.cuda.get_device_name(0))print(Result shape:,tuple(c.shape))print(Elapsed seconds:,round(elapsed,4))print(Allocated memory MB:,round(torch.cuda.memory_allocated()/1024/1024,2))这不是完整的模型 benchmark但可以验证 GPU 是否真的参与计算。真正比较不同 GPU 时应该使用同一个模型、同一份数据、相同的 batch size、精度和软件版本不能只比较理论算力或每小时价格。七、费用应该怎么比较GPU 云服务器的成本不只包括 GPU 小时价格。一次任务可以用下面的方式估算总成本 GPU 价格 × GPU 数量 × 实际运行时长 存储费用 数据传输费用 失败重试成本比较不同型号时还应该记录任务完成时间实际吞吐量峰值显存失败次数数据上传和下载时间任务完成后的总成本。最稳妥的方式是先用目标模型做一次小规模实测再决定是否长期使用或扩展到多卡。八、任务结束后要停止或释放实例退出 SSH 不等于停止实例也不一定会停止计费。任务结束后回到控制台检查实例状态根据实际需要执行关机、停止或释放操作并确认计费状态已经发生变化。同时注意数据生命周期实例本地盘可能随实例释放而删除需要长期保存的数据不要只放在临时实例中代码、模型和结果最好提前同步到独立存储或自己的仓库释放前先确认是否还有任务或文件需要保留。九、下一步可以做什么完成上述最小闭环后可以继续尝试使用预配置镜像运行 LoRA 微调使用 vLLM 或 Ollama 部署推理服务对比不同 GPU 的推理吞吐和延迟测试多卡通信和分布式训练记录一次完整任务的实际成本。第一次使用 GPU 云服务器时不建议只看型号名称或宣传参数。先明确模型、显存、精度、并发和运行时长再通过小规模实验选择配置通常比直接创建高规格实例更稳妥。参考资料起源算力快速开始CUDA / PyTorch 环境检查GPU 型号选型指南起源算力实时价格与库存文中命令适用于常见 Linux、NVIDIA Driver 和 PyTorch 环境。具体 GPU 型号、区域、库存、镜像、价格和计费规则以平台当前页面显示为准。