
多 GPU 服务器
显存最高 320 GB
单台服务器配备两块或四块 GPU,适合单卡装不下的模型:
- 64 至
320 GB 显存 - H100 节点配备 NVLink
- 最高
30 TB NVMe 存储 - 1 至 24 小时内交付
01 套餐与价格
三款多 GPU 服务器
服务器中的所有 GPU 都由您独享,并配备大容量 NVMe 阵列,用于存放模型权重和数据集。
| GPU | VRAM | CPU | 内存 | 存储 | 地区 | 价格 | 订购 |
|---|---|---|---|---|---|---|---|
|
|
$558.99/月
竞品最低价 |
部署 |
|||||
|
|
$1,096.99/月
竞品最低价 |
部署 |
|||||
|
|
$2,348.99/月
竞品最低价 |
部署 |
该司法管辖区暂无 GPU 套餐:或比较各司法管辖区。
RTX 4090 、5090、L40S、A100、H100- 预装 CUDA 驱动
- 单 GPU 与多 GPU 节点
- 无需 KYC
· BTC、ETH、XMR、USDT、SOL
02 选型
单节点能运行哪些模型
按稠密模型、8K token 上下文并预留 10% 余量计算,由 vLLM 或 llama.cpp 拆分到各块 GPU 上。上下文越长,所需显存越多。
| 服务器 | 总显存 | 4 位精度下的最大模型 | 16 位精度下 | GPU 互联 |
|---|---|---|---|---|
| 70B | 14B | PCIe | ||
| 123B | 32B(8 位精度下可运行 70B) | NVLink | ||
| 405B | 123B | NVLink |
03 运作方式
一个模型,多块 GPU
为什么 GPU 之间的互联与 GPU 本身同样重要。
推理服务框架有两种方式将模型拆分到多块 GPU 上。张量并行将每一层都切分到各块显卡上,需要显卡之间有高速互联;流水线并行或层并行则让每块显卡负责一段连续的层,可以容忍较慢的互联。
这就是互联至关重要的原因。在我们的 H100 服务器上,GPU 之间通过 NVLink 通信,因此张量并行无论用于推理服务还是训练都能良好扩展。两块
交付后运行 nvidia-smi topo -m--tensor-parallel-size
| 服务器 | 内存 | 单 GPU 显存带宽 |
|---|---|---|
04 应用场景
当一块 GPU 不够用时
需要单台机器内多块 GPU 的显存或吞吐量的模型与任务。
70B 至 405B 模型
将最大的开放权重模型拆分到多块 GPU 上,私密地提供服务。
分布式训练
基于 NVLink 的数据并行和张量并行训练。
并行任务
每块 GPU 运行一个模型:同时进行多个实验或服务多位用户。
高吞吐推理服务
借助批处理,让单个端点同时服务大量并发用户。
05 司法管辖区
多 GPU 服务器的可用地区
我们的多 GPU 节点位于摩尔多瓦和荷兰。
-
摩尔多瓦基希讷乌超值 欧盟以外
· 不适用 DSA 伦敦~33 ms 纽约~113 ms 新加坡~129 ms -
荷兰阿姆斯特丹网络枢纽 欧盟成员国
· 适用 DSA 伦敦~7 ms 纽约~87 ms 新加坡~154 ms - 对比全部七个司法管辖区 是否属于欧盟、哪些途径可以移除内容、网络延迟,并排对比。 查看对比
延迟数据根据距离估算,并非实测。所有司法管辖区价格相同。我们如何估算延迟
06 离岸承诺,白纸黑字
付款之前,先看规则
我们的承诺写进了政策条款,而不只是营销文案。
07 常见问题
多 GPU 服务器常见问题
还有其他问题?完整的常见问题页面解答了大家下单前常问的问题:付款、隐私、投诉与支持。
阅读完整常见问题可以分别使用各块 GPU 吗?
可以。每块 GPU 在系统中都是独立可见的:可以用 CUDA_VISIBLE_DEVICES
每台多 GPU 服务器都配备 NVLink 吗?
能否提供八块 GPU 或多个节点?
可以,以定制配置的形式提供。首台服务器交付后,请在客户中心提交工单,说明您需要的集群,我们会回复报价。
多久可以交付?
订购后 1 至 24 小时内交付。多 GPU 节点视库存而定:如果在您所选的司法管辖区暂无可用节点,我们会通知您,并为您保留订单或将款项退回您的余额。
可以退款吗?
GPU 服务器一经交付即不可退款,因为硬件是专门为您预留的。
最大的开放模型,运行在您自己的节点上
- 1 选择 2 块或 4 块 GPU
- 2 加密货币付款,无需证件
- 31 至 24 小时内即可 SSH 登录