想在 VPS 上运行 Ollama、ComfyUI、Stable Diffusion 或 AI Agent,真正难的不是输入一条 Docker 命令,而是先买对 GPU。很多人只看“显卡型号”和“每小时价格”,却忽略显存、磁盘读写、驱动、实例是否会被回收,以及停机后数据是否还在。
这篇文章按购买决策来写:先判断你需要哪一类 GPU,再给出 Ollama、ComfyUI、训练和 AI Agent 的配置起点,最后比较 GPU 云实例、GPU VPS 和独立 GPU 服务器的区别。价格会随库存和地区变化,文中的数字只用于建立预算,不应当当作长期报价。
如果你的目标是“偶尔运行本地模型、做图片生成、测试工作流”,优先选按小时计费的 GPU 云实例,而不是直接签一年 GPU VPS。这样可以用完即停,先验证模型、驱动和实际显存需求。
- Ollama 跑 7B/8B 量化模型:24GB 显存是舒服的起点,RTX 3090、RTX 4090、L4 或同级显卡都可以考虑。
- Ollama 跑 14B/32B 量化模型:优先 48GB 显存;如果模型需要更大上下文或更高并发,考虑 80GB 以上或多卡方案。
- ComfyUI 图片生成:SDXL 通常从 16GB–24GB 显存开始,工作流复杂、放大或批量生成时,24GB 更稳。
- LoRA 微调和小规模训练:24GB 可以做入门实验,32GB–48GB 更适合减少 batch size 和显存优化带来的折腾。
- 长期在线的 AI Agent、API 或团队服务:不能只算 GPU,至少同时看 8 vCPU、32GB RAM、NVMe、固定公网 IP、持久化磁盘和备份策略。
一个实用原则是:先按显存买,再按 GPU 计算能力优化。显卡算力再强,模型装不进显存,最终还是跑不起来。
“GPU VPS”在不同商家那里可能代表完全不同的产品。下单前先确认虚拟化方式和计费方式。
| 类型 | 计费方式 | 适合场景 | 主要风险 |
|---|---|---|---|
| GPU 云实例 | 按秒、按小时或按月 | 模型测试、短任务、弹性推理 | 关机后磁盘和公网 IP 是否继续收费 |
| GPU VPS | 月付或按量,通常带固定系统环境 | 长期运行 Ollama、ComfyUI、个人 API | GPU 是否独占、是否超售、能否更换驱动 |
| 独立 GPU 服务器 | 月付、租赁或托管 | 稳定高并发、训练、团队共享 | 起租期长,机器和带宽成本高 |
| 按需 GPU 市场 | 供应商竞价,按秒或按小时 | 低成本批处理、容错任务 | 抢占、节点质量、网络和数据持久化差异大 |
以按需 GPU 市场为例,Vast.ai 官方说明其价格由供应和需求决定,并区分 On-Demand、Interruptible 和 Reserved:Interruptible 可能被回收,Reserved 则适合稳定任务。RunPod 也把 Pods、Serverless 和 Clusters 分开计费,分别对应长时间实例、推理工作负载和多节点场景。不要把 Serverless 的单次推理价格直接拿来和一台长期运行的 VPS 月费比较。
下面的配置是购买起点,不是厂商套餐清单。相同型号在不同云平台上的显存、PCIe 代际、CPU 配额、磁盘和网络可能完全不同。
| 目标 | 推荐显存 | CPU / 内存起点 | 磁盘建议 | 适合的实例 |
|---|---|---|---|---|
| Ollama 7B/8B 量化 | 16GB–24GB | 4 vCPU / 16GB | 80GB NVMe | RTX 4000、L4、3090、4090 |
| Ollama 14B/32B 量化 | 24GB–48GB | 8 vCPU / 32GB | 120GB NVMe | 4090、A6000、A40、L40S |
| ComfyUI / SDXL | 16GB–24GB | 8 vCPU / 16GB | 100GB NVMe | 3090、4090、L4、A5000 |
| LoRA 微调 | 24GB–48GB | 8–16 vCPU / 32–64GB | 200GB NVMe | 4090、A6000、A40、L40S |
| 多用户推理 API | 48GB–80GB | 16 vCPU / 64GB | 200GB+ NVMe | L40S、A100、H100 |
| 多卡训练 | 80GB+ | 32 vCPU / 128GB+ | 500GB+ NVMe | A100、H100、B200 等 |
8GB 显存可以跑小模型、低分辨率图片和部分量化推理,但余量很少。升级上下文长度、加载 ControlNet、启用图像放大或并发请求后,常见结果就是 CUDA out of memory。除非你已经确认工作流固定、任务很轻,否则 16GB 是更合理的最低线,24GB 是多数个人用户的甜点位。
Ollama 的模型大小不是唯一指标,还要考虑量化格式、上下文长度、并发数和 KV cache。一个 8B Q4 模型可能能放进 8GB 显存,但这不代表能在同一台机器上稳定运行长上下文、工具调用和多个会话。
单人低并发可以从 24GB 显存起步,系统盘预留 80GB–120GB。模型文件、Docker 镜像和日志会持续占用空间,磁盘太小往往比显存更早成为问题。运行 API 时,把 Ollama 只监听内网或本机,再由 Caddy、Nginx 或应用网关提供 HTTPS、鉴权和限流。
如果要稳定跑 14B 或 32B 量化模型,48GB 显存更省心。24GB 也可以通过 CPU offload 或更激进的量化运行,但速度和并发会明显受影响。购买前要确认平台是否提供完整 NVIDIA 驱动、CUDA 版本是否与容器兼容,以及是否允许自定义 Docker 镜像。
AI Agent 通常不只占 GPU:向量数据库、浏览器、代码沙箱、队列、日志和文件上传都会吃 CPU、内存和磁盘。单台 GPU VPS 建议至少 8 vCPU、32GB RAM;如果还要运行 PostgreSQL、Redis、SearXNG 或多个 Worker,建议 64GB RAM,或者把数据库和对象存储拆出去。
ComfyUI 的显存消耗取决于基础模型、分辨率、采样器、ControlNet、LoRA、VAE 和放大节点。不要只根据“能启动”判断配置够不够。
- 只做 SD 1.5、小尺寸图像:12GB–16GB 可以尝试;
- SDXL、常规 1024×1024:16GB–24GB 更合适;
- 多个 ControlNet、高清修复、放大和批量队列:24GB–48GB;
- 视频生成、Flux 大模型或复杂节点图:先按 48GB 显存评估,必要时使用 80GB 级别 GPU。
ComfyUI 的模型目录应放在持久化磁盘或独立 Volume 中。临时实例被回收后,容器可能还在,但模型、输出图片和自定义节点未必还在。购买时确认:系统盘和数据盘是否分离、Volume 是否跨实例保留、快照是否收费、删除实例后公网 IP 是否释放。
不要只乘“每小时价格 × 30 天”。完整成本至少包括 GPU、CPU/RAM、系统盘、持久化 Volume、公网 IPv4、出站流量、快照和空闲实例费用。
例如,按 RunPod 当前公开页面的示例价格,RTX 3090 约为 $0.50/小时、RTX 4090 约为 $0.69/小时、A40 约为 $0.44/小时、L40S 约为 $0.99/小时;如果全天运行,月度 GPU 计算费用大约分别是 $360、$497、$317 和 $713,实际价格会随地区、库存和实例类型变化。按小时实例适合间歇使用,长期 24×7 运行前,应当拿月付独立服务器或 Reserved 价格做一次对比。
可以用这条公式估算:
月成本 = GPU小时价 × 实际运行小时 + 磁盘/月 + Volume/月 + IP/月 + 出站流量 + 快照
如果只在晚上使用,每天运行 4 小时,一个月约 120 小时,按小时 GPU 往往比全天包机划算。反过来,如果推理 API 需要全天在线,月付独享 GPU 的价格和稳定性通常更容易控制。
- GPU 是独占、切分还是共享?
- 显存容量和 GPU 型号是否在订单页面明确写出?
- 实例会不会被抢占或回收?回收前是否有通知?
- 关机后 GPU、磁盘、IP 和 Volume 是否继续计费?
- 能否使用官方 NVIDIA 驱动和 Docker,CUDA 版本是什么?
- 是否允许自定义内核、容器和端口?
- 公网 IPv4 是否固定,重装系统后是否变化?
- 数据盘是否独立于计算实例,删除实例后能否保留?
- 快照、备份和跨区域复制分别如何收费?
- 出站流量是否有限额,超出后如何计费或限速?
- 是否有退款、迁移、更换 GPU 和故障赔付政策?
- 服务商是否提供控制台、VNC 或救援模式,GPU 驱动坏了能否自救?
如果客服无法明确回答“GPU 是否独占”和“实例删除后数据是否保留”,不要只因为便宜就下单。GPU 价格差几美元,远不如一次数据丢失和环境重装的成本高。
GPU 服务器通常会开放 Jupyter、ComfyUI、Open WebUI 或 API 端口,直接把管理界面暴露在公网很危险。
- SSH 只允许密钥登录,关闭密码登录并限制管理 IP;
- 用 Caddy 或 Nginx 配 HTTPS,不把数据库、Redis 和 Docker Socket 暴露公网;
- ComfyUI、Jupyter、Open WebUI 和 Ollama API 都要加认证或放在 VPN 后面;
- 模型文件和用户上传文件单独备份,不能只备份容器;
- 为 GPU、磁盘、显存、温度、容器重启和 API 错误设置告警;
- 给按量计费账户设置预算、余额和异常用量提醒;
- 固定镜像版本,升级 CUDA、驱动和 PyTorch 前先创建快照;
- 训练和批处理任务要定期保存 checkpoint,防止抢占实例回收后从头开始。
先确认实例真的分配了 GPU,再检查宿主机驱动、容器运行时和 NVIDIA Container Toolkit。不要一上来重装 PyTorch;如果宿主机驱动都没有,容器内部安装再多 CUDA 包也没有用。
按顺序降低 batch size、分辨率和上下文长度,关闭不必要的 ControlNet 或并发,再确认是否有其他进程占用显存。长期使用时,升级显存通常比反复改参数更省时间。
检查 GPU 是否被共享、功耗是否受限、PCIe 链路是否降级,以及 CPU 是否成为数据预处理瓶颈。对 AI Agent,还要检查模型 API 延迟、向量检索和浏览器工具,而不只是 GPU 利用率。
通常是把模型写进临时容器层或临时盘。将模型目录映射到持久化 Volume,保存 Compose 文件、环境变量、插件清单和启动脚本,并定期做异地备份。
如果你是第一次运行本地 AI,推荐从 24GB 显存、8 vCPU、32GB RAM、120GB NVMe 的按小时 GPU 实例开始,先用 Ollama 或 ComfyUI 验证真实工作流。每天只用几小时,就按需启动和停止;需要全天 API 服务,再比较月付 GPU VPS、Reserved 实例和独立服务器。
预算有限时,优先保证显存和持久化磁盘,不要为了更高型号牺牲数据安全。对大模型、多用户和训练任务,直接选择 48GB、80GB 甚至多卡方案,并把数据库、对象存储和备份纳入总成本。
下一步可以先列出你的模型、目标并发、每天运行时长和是否需要公网 API,再按这四项去筛选 GPU VPS。这样比先看一张“显卡价格排行榜”更不容易买错。
