上线优惠价:每个套餐的价格都比我们追踪的最便宜的离岸竞争对手低 30%。 查看价格对比所有套餐价格均比最便宜的离岸主机服务商低 30%

2 × RTX 5090 · 2 × H100 · 4 × H100

多 GPU 服务器
显存最高 320 GB

单台服务器配备两块或四块 GPU,适合单卡装不下的模型:2 × RTX 5090(共 64 GB),或配备 NVLink、HBM3 显存最高 320 GB 的 2 × 与 4 × H100。月付 $558.99 起,无需 KYC。

  • 64 至 320 GB 显存
  • H100 节点配备 NVLink
  • 最高 30 TB NVMe 存储
  • 1 至 24 小时内交付

配置您的多 GPU 服务器1–24 小时就绪

司法管辖区摩尔多瓦 · 基希讷乌

套餐比较套餐

付费周期

$1,096.99/月

月付 · 随时取消

竞品最低价 $1,567.50−30%

无需证件BTC、XMR、USDT +2免开通费

01 套餐与价格

三款多 GPU 服务器

服务器中的所有 GPU 都由您独享,并配备大容量 NVMe 阵列,用于存放模型权重和数据集。

GPU 服务器:3 个套餐,月付价格(美元)
GPU VRAM CPU 内存 存储 地区 价格 订购
2 × RTX 5090 单机 64 GB VRAM 64 GB VRAMEPYC 9354 32c256 GB 内存2 × 1.92 TB NVMe摩尔多瓦荷兰 64 GB EPYC 9354 · 32c 256 GB 2 × 1.92 TB NVMe 摩尔多瓦荷兰 $558.99/月 竞品最低价 $799.00 部署 2 × RTX 5090
2 × H100 160 GB HBM3, NVLink 160 GB VRAM48 vCPU384 GB 内存4 TB NVMe摩尔多瓦荷兰 160 GB 48 vCPU 384 GB 4 TB NVMe 摩尔多瓦荷兰 $1,096.99/月 竞品最低价 $1,567.50 部署 2 × H100
  • RTX 4090、5090、L40S、A100、H100
  • 预装 CUDA 驱动
  • 单 GPU 与多 GPU 节点
  • 无需 KYC · BTC、ETH、XMR、USDT、SOL

02 选型

单节点能运行哪些模型

按稠密模型、8K token 上下文并预留 10% 余量计算,由 vLLM 或 llama.cpp 拆分到各块 GPU 上。上下文越长,所需显存越多。

单节点能运行哪些模型
服务器总显存4 位精度下的最大模型16 位精度下GPU 互联
2 × RTX 509064 GB70B14BPCIe
2 × H100160 GB123B32B(8 位精度下可运行 70B)NVLink
4 × H100320 GB405B123BNVLink

gpt-oss-120b 等混合专家(MoE)模型每个 token 所需的计算量更少,但仍需将全部权重载入显存。

03 运作方式

一个模型,多块 GPU

为什么 GPU 之间的互联与 GPU 本身同样重要。

推理服务框架有两种方式将模型拆分到多块 GPU 上。张量并行将每一层都切分到各块显卡上,需要显卡之间有高速互联;流水线并行或层并行则让每块显卡负责一段连续的层,可以容忍较慢的互联。

这就是互联至关重要的原因。在我们的 H100 服务器上,GPU 之间通过 NVLink 通信,因此张量并行无论用于推理服务还是训练都能良好扩展。两块 RTX 5090 显卡则通过 PCIe 通信:用于一分为二的模型推理表现出色,用于训练则较为受限。

交付后运行 nvidia-smi topo -m 查看拓扑,然后在 vLLM 中将 --tensor-parallel-size 设为 GPU 数量。完整命令见 GPU 镜像指南。

多 GPU 服务器:显存与带宽
服务器内存单 GPU 显存带宽
2 × RTX 50902 × 32 GB GDDR71,792 GB/s
2 × H1002 × 80 GB HBM33.35 TB/s
4 × H1004 × 80 GB HBM33.35 TB/s

04 应用场景

当一块 GPU 不够用时

需要单台机器内多块 GPU 的显存或吞吐量的模型与任务。

  • 70B 至 405B 模型

    将最大的开放权重模型拆分到多块 GPU 上,私密地提供服务。

    4 × H100
  • 分布式训练

    基于 NVLink 的数据并行和张量并行训练。

    2 × H100
  • 并行任务

    每块 GPU 运行一个模型:同时进行多个实验或服务多位用户。

    2 × RTX 5090
  • 高吞吐推理服务

    借助批处理,让单个端点同时服务大量并发用户。

    vLLM 指南

06 离岸承诺,白纸黑字

付款之前,先看规则

我们的承诺写进了政策条款,而不只是营销文案。

  • 美国 DMCA 通知不予执行

    我们依据政策予以答复,但从不执行。只有当地法院命令,或在欧盟地区收到的有效欧盟通知,才能要求我们采取行动。

    DMCA 政策
  • 身份仅需邮箱

    我们从不索取姓名、地址、电话或身份证件。私密邮箱或一次性邮箱均可。

    隐私政策
  • 支付5 种加密货币

    比特币、以太坊、门罗币、USDT 和 Solana,可从任意钱包链上支付至您的余额。不经过银行卡收单机构,不存在拒付。

    加密货币支付
  • 透明度签名金丝雀声明

    每季度发布一份经 PGP 签名的令状金丝雀(warrant canary),并公开统计我们收到的每一项请求。

    令状金丝雀

07 常见问题

多 GPU 服务器常见问题

还有其他问题?完整的常见问题页面解答了大家下单前常问的问题:付款、隐私、投诉与支持。

阅读完整常见问题
可以分别使用各块 GPU 吗?

可以。每块 GPU 在系统中都是独立可见的:可以用 CUDA_VISIBLE_DEVICES 让每块显卡各跑一个模型,也可以把一个模型拆分到所有显卡上。

每台多 GPU 服务器都配备 NVLink 吗?

2 × 和 4 × H100 服务器配备 NVLink。RTX 5090 不支持 NVLink,因此 2 × RTX 5090 服务器的显卡之间通过 PCIe 连接。

能否提供八块 GPU 或多个节点?

可以,以定制配置的形式提供。首台服务器交付后,请在客户中心提交工单,说明您需要的集群,我们会回复报价。

多久可以交付?

订购后 1 至 24 小时内交付。多 GPU 节点视库存而定:如果在您所选的司法管辖区暂无可用节点,我们会通知您,并为您保留订单或将款项退回您的余额。

可以退款吗?

GPU 服务器一经交付即不可退款,因为硬件是专门为您预留的。

最大的开放模型,运行在您自己的节点上

  1. 1 选择 2 块或 4 块 GPU
  2. 2 加密货币付款,无需证件
  3. 31 至 24 小时内即可 SSH 登录
配置您的服务器 全部 GPU 服务器

月付 $558.99 起 · 独享 GPU · H100 配备 NVLink

欢迎回来

登录以管理您的服务器和余额。

无需 KYC由 Cloudflare Turnstile 提供人机验证无跟踪