上线优惠价:每个套餐的价格都比我们追踪的最便宜的离岸竞争对手低 30%。 查看价格对比所有套餐价格均比最便宜的离岸主机服务商低 30%

RTX A4000 · 4090 · 5090 · 6000 Ada

RTX 4090 与 5090 服务器
单 token 成本最优

RTX 显卡的每美元推理速度最高:4090 配备 24 GB 显存,5090 配备 32 GB GDDR7,RTX 6000 Ada 配备 48 GB。独享显卡,预装驱动和 CUDA,使用加密货币支付。月付 $61.99 起。

  • 16 至 64 GB 显存
  • 单卡带宽最高 1.8 TB/s
  • 私密推理
  • 1 至 24 小时内交付

配置您的 RTX 服务器1–24 小时就绪

司法管辖区摩尔多瓦 · 基希讷乌

套餐比较套餐

付费周期

$84.99/月

月付 · 随时取消

竞品最低价 $121.50−30%

无需证件BTC、XMR、USDT +2免开通费

01 套餐与价格

五款 RTX 服务器,16 至 64 GB 显存

每块显卡都由您独享。每台服务器均配备 NVMe 存储和不限流量的 1 Gbps 端口。

GPU 服务器:5 个套餐,月付价格(美元)
GPU VRAM CPU 内存 存储 地区 价格 订购
RTX A4000 入门级推理,7-13B 模型 16 GB VRAM8 vCPU64 GB 内存1 TB NVMe摩尔多瓦荷兰罗马尼亚 16 GB 8 vCPU 64 GB 1 TB NVMe 摩尔多瓦荷兰罗马尼亚 $61.99/月 竞品最低价 $89.00 部署 RTX A4000
RTX 5090 快速推理、图像与视频 32 GB VRAM12 vCPU96 GB 内存2 TB NVMe摩尔多瓦荷兰冰岛 32 GB 12 vCPU 96 GB 2 TB NVMe 摩尔多瓦荷兰冰岛 $134.99/月 竞品最低价 $193.00 部署 RTX 5090
RTX 6000 Ada 48 GB,可运行 8 位精度的 32B 模型 48 GB VRAMEPYC 7302P 16c128 GB 内存2 × 1.92 TB NVMe摩尔多瓦荷兰 48 GB EPYC 7302P · 16c 128 GB 2 × 1.92 TB NVMe 摩尔多瓦荷兰 $306.99/月 竞品最低价 $439.00 部署 RTX 6000 Ada
2 × RTX 5090 单机 64 GB VRAM 64 GB VRAMEPYC 9354 32c256 GB 内存2 × 1.92 TB NVMe摩尔多瓦荷兰 64 GB EPYC 9354 · 32c 256 GB 2 × 1.92 TB NVMe 摩尔多瓦荷兰 $558.99/月 竞品最低价 $799.00 部署 2 × RTX 5090
  • RTX 4090、5090、L40S、A100、H100
  • 预装 CUDA 驱动
  • 单 GPU 与多 GPU 节点
  • 无需 KYC · BTC、ETH、XMR、USDT、SOL

需要 HBM 显存或 NVLink?请看 A100、L40S 与 H100。

02 选择

RTX 4090 还是 RTX 5090?

4090 是高性价比之选。5090 多出 8 GB 显存,显存带宽高出约 78%,这一点会体现在每秒 token 数上。

RTX 4090 超值

24 GB GDDR6X

显存带宽
1,008 GB/s
16 位精度可运行
最高约 8B
8 位精度可运行
最高约 14B
图像模型
SDXL 与 Flux
适用场景
聊天助手、图像生成

RTX 5090

32 GB GDDR7

显存带宽
1,792 GB/s
4 位精度可运行
最高约 32B
8 位精度可运行
14B(长上下文)
图像模型
Flux、视频模型
适用场景
token 生成更快,上下文更长

03 选型

每块显卡能运行哪些模型

稠密模型在 8K token 上下文、预留 10% 余量时所需的显存。上下文越长,所需显存越多。

每块显卡能运行哪些模型
模型规模4 位精度8 位精度16 位精度
7–8B~7 GB
RTX A4000
~11 GB
RTX A4000
~19 GB
RTX 4090
13–14B~11 GB
RTX A4000
~18 GB
RTX 4090
~32 GB
RTX 6000 Ada, L40S
32B~24 GB
RTX 5090
~40 GB
RTX 6000 Ada, L40S
~73 GB
A100 或 H100
70B~50 GB
A100、H100 或 2 × RTX 5090
~85 GB
2 × H100
~157 GB
4 × H100

4 位精度的 70B 模型约需 50 GB:可选 2 × RTX 5090(64 GB),或一块 80 GB 的 A100 或 H100。完整指南:大语言模型需要多少显存?

04 应用场景

RTX 服务器最擅长什么

当模型能装进 24 至 64 GB 显存时,消费级和工作站级显卡最能发挥优势。

  • 私有聊天助手

    以 Open WebUI 为前端运行 8B 至 32B 模型,供您本人或团队使用。

    Ollama 指南
  • 图像生成

    在 ComfyUI 中运行 Stable Diffusion 和 Flux 工作流。

    RTX 5090
  • 视频与 3D

    在您独享的显卡上运行视频模型和 Blender Cycles 渲染。

    2 × RTX 5090
  • 编程助手

    自托管的代码模型,基于您自己的代码仓库作答。

    vLLM 指南

06 离岸承诺,白纸黑字

付款之前,先看规则

我们的承诺写进了政策条款,而不只是营销文案。

  • 美国 DMCA 通知不予执行

    我们依据政策予以答复,但从不执行。只有当地法院命令,或在欧盟地区收到的有效欧盟通知,才能要求我们采取行动。

    DMCA 政策
  • 身份仅需邮箱

    我们从不索取姓名、地址、电话或身份证件。私密邮箱或一次性邮箱均可。

    隐私政策
  • 支付5 种加密货币

    比特币、以太坊、门罗币、USDT 和 Solana,可从任意钱包链上支付至您的余额。不经过银行卡收单机构,不存在拒付。

    加密货币支付
  • 透明度签名金丝雀声明

    每季度发布一份经 PGP 签名的令状金丝雀(warrant canary),并公开统计我们收到的每一项请求。

    令状金丝雀

07 常见问题

RTX 服务器常见问题

还有其他问题?完整的常见问题页面解答了大家下单前常问的问题:付款、隐私、投诉与支持。

阅读完整常见问题
为什么选 RTX 而不是 A100 或 H100?

对于能装进 24 至 48 GB 显存的模型,RTX 显卡在推理时每美元能产出更多 token。当您需要单卡 80 GB 显存、用于训练的 HBM 带宽或 GPU 间的 NVLink 互联时,数据中心级 GPU 才更合适。

两块 RTX 5090 能运行同一个模型吗?

可以。vLLM 和 llama.cpp 可将一个模型拆分到两块显卡上(张量并行或层并行),这样您就有 64 GB 显存来运行 4 位精度的 70B 模型。两块显卡通过 PCIe 而非 NVLink 通信,因此推理扩展性良好,训练扩展性则较为有限。

RTX 6000 Ada 值得选吗?

如果您需要单卡 48 GB 且带 ECC 的显存,那么值得:它能以 8 位精度运行 32B 模型、以全精度运行 14B 模型,无需跨 GPU 拆分。4 位精度的 70B 模型约需 50 GB,因此需规划两块显卡或 80 GB 显存。对于更小的模型,RTX 5090 更快也更便宜。

是否已安装驱动和 CUDA?

是的,Ubuntu 24.04 镜像已预装。RTX 5090 需要较新的 CUDA 版 PyTorch;GPU 镜像指南给出了具体命令。

可以退款吗?

GPU 服务器一经交付即不可退款,因为硬件是专门为您预留的。订购前请查看规格参数和 GPU 镜像指南。

每美元 token 速度最快的离岸之选

  1. 1 选择显卡和司法管辖区
  2. 2 加密货币付款,无需证件
  3. 31 至 24 小时内即可 SSH 登录
配置您的 RTX 服务器 全部 GPU 服务器

月付 $61.99 起 · 独享显卡 · 预装 CUDA

欢迎回来

登录以管理您的服务器和余额。

无需 KYC由 Cloudflare Turnstile 提供人机验证无跟踪