---
title: "多卡 GPU 服务器：2× RTX 5090、2× 与 4× H100 · 免实名"
description: "一台离岸服务器配备两块或四块独享显卡：2 × RTX 5090，或 2 × 与 4 × H100（NVLink 互联），显存最高 320 GB。"
url: https://offshoreserv.com/zh/offshore-gpu-servers/multi-gpu
lang: zh-Hans
updated: 2026-09-27
source: HTML page at the url above (canonical); this is its Markdown version
---

2 × RTX 5090 · 2 × H100 · 4 × H100

# 多 GPU 服务器 显存最高 320 GB

单台服务器配备两块或四块 GPU，适合单卡装不下的模型：2 × RTX 5090（共 64 GB），或配备 NVLink、HBM3 显存最高 320 GB 的 2 × 与 4 × H100。 **月付 $558.99 起，无需 KYC。**

- 64 至 320 GB 显存
- H100 节点配备 NVLink
- 最高 30 TB NVMe 存储
- 1 至 24 小时内交付

## 三款多 GPU 服务器

服务器中的所有 GPU 都由您独享，并配备大容量 NVMe 阵列，用于存放模型权重和数据集。

| GPU | VRAM | CPU | 内存 | 存储 | 价格 |
| --- | --- | --- | --- | --- | --- |
| **2 × RTX 5090** (单机 64 GB VRAM) | 64 GB | EPYC 9354 · 32c | 256 GB | 2 × 1.92 TB NVMe | **$558.99**/月 |
| **2 × H100** (160 GB HBM3, NVLink) | 160 GB | 48 vCPU | 384 GB | 4 TB NVMe | **$1,096.99**/月 |
| **4 × H100 ** (320 GB HBM3, NVLink), 集群 | 320 GB | 96 vCPU | 768 GB | 30 TB NVMe | **$2,348.99**/月 |

## 单节点能运行哪些模型

按稠密模型、8K token 上下文并预留 10% 余量计算，由 vLLM 或 llama.cpp 拆分到各块 GPU 上。上下文越长，所需显存越多。

| 服务器 | 总显存 | 4 位精度下的最大模型 | 16 位精度下 | GPU 互联 |
| --- | --- | --- | --- | --- |
| 2 × RTX 5090 | 64 GB | 70B | 14B | PCIe |
| 2 × H100 | 160 GB | 123B | 32B（8 位精度下可运行 70B） | NVLink |
| 4 × H100 | 320 GB | 405B | 123B | NVLink |

gpt-oss-120b 等混合专家（MoE）模型每个 token 所需的计算量更少，但仍需将全部权重载入显存。

## 一个模型，多块 GPU

为什么 GPU 之间的互联与 GPU 本身同样重要。

推理服务框架有两种方式将模型拆分到多块 GPU 上。 **张量并行** 将每一层都切分到各块显卡上，需要显卡之间有高速互联； **流水线并行或层并行** 则让每块显卡负责一段连续的层，可以容忍较慢的互联。

这就是互联至关重要的原因。在我们的 H100 服务器上，GPU 之间通过 **NVLink** 通信，因此张量并行无论用于推理服务还是训练都能良好扩展。两块 RTX 5090 显卡则通过 PCIe 通信：用于一分为二的模型推理表现出色，用于训练则较为受限。

交付后运行 `nvidia-smi topo -m` 查看拓扑，然后在 vLLM 中将 `--tensor-parallel-size` 设为 GPU 数量。完整命令见 [GPU 镜像指南](https://offshoreserv.com/zh/docs/gpu/images)。

| 服务器 | 内存 | 单 GPU 显存带宽 |
| --- | --- | --- |
| 2 × RTX 5090 | 2 × 32 GB GDDR7 | 1,792 GB/s |
| 2 × H100 | 2 × 80 GB HBM3 | 3.35 TB/s |
| 4 × H100 | 4 × 80 GB HBM3 | 3.35 TB/s |

## 当一块 GPU 不够用时

需要单台机器内多块 GPU 的显存或吞吐量的模型与任务。

- **70B 至 405B 模型** — 将最大的开放权重模型拆分到多块 GPU 上，私密地提供服务。 — 4 × H100
- **分布式训练** — 基于 NVLink 的数据并行和张量并行训练。 — 2 × H100
- **并行任务** — 每块 GPU 运行一个模型：同时进行多个实验或服务多位用户。 — 2 × RTX 5090
- **高吞吐推理服务** — 借助批处理，让单个端点同时服务大量并发用户。 — [vLLM 指南](https://offshoreserv.com/zh/docs/gpu/images)

## 多 GPU 服务器的可用地区

我们的多 GPU 节点位于摩尔多瓦和荷兰。

- [摩尔多瓦 基希讷乌 超值 — 欧盟以外 · 不适用 DSA — 伦敦 **~33 ms** 纽约 **~113 ms** 新加坡 **~129 ms**](https://offshoreserv.com/zh/locations/moldova)
- [荷兰 阿姆斯特丹 网络枢纽 — 欧盟成员国 · 适用 DSA — 伦敦 **~7 ms** 纽约 **~87 ms** 新加坡 **~154 ms**](https://offshoreserv.com/zh/locations/netherlands)
- [对比全部七个司法管辖区 — 是否属于欧盟、哪些途径可以移除内容、网络延迟，并排对比。](https://offshoreserv.com/zh/locations#compare)

延迟数据根据距离估算，并非实测。所有司法管辖区价格相同。[我们如何估算延迟](https://offshoreserv.com/zh/network)

## 付款之前，先看规则

我们的承诺写进了政策条款，而不只是营销文案。

- 美国 DMCA 通知 **不予执行** — 我们依据政策予以答复，但从不执行。只有当地法院命令，或在欧盟地区收到的有效欧盟通知，才能要求我们采取行动。
- 身份 **仅需邮箱** — 我们从不索取姓名、地址、电话或身份证件。私密邮箱或一次性邮箱均可。
- 支付 **5 种加密货币** — 比特币、以太坊、门罗币、USDT 和 Solana，可从任意钱包链上支付至您的余额。不经过银行卡收单机构，不存在拒付。
- 透明度 **签名金丝雀声明** — 每季度发布一份经 PGP 签名的令状金丝雀（warrant canary），并公开统计我们收到的每一项请求。

## 多 GPU 服务器常见问题

**还有其他问题？** 完整的常见问题页面解答了大家下单前常问的问题：付款、隐私、投诉与支持。

### 可以分别使用各块 GPU 吗？

可以。每块 GPU 在系统中都是独立可见的：可以用 `CUDA_VISIBLE_DEVICES` 让每块显卡各跑一个模型，也可以把一个模型拆分到所有显卡上。

### 每台多 GPU 服务器都配备 NVLink 吗？

2 × 和 4 × H100 服务器配备 NVLink。RTX 5090 不支持 NVLink，因此 2 × RTX 5090 服务器的显卡之间通过 PCIe 连接。

### 能否提供八块 GPU 或多个节点？

可以，以定制配置的形式提供。首台服务器交付后，请在 [客户中心](https://offshoreserv.com/zh/account/support) 提交工单，说明您需要的集群，我们会回复报价。

### 多久可以交付？

订购后 1 至 24 小时内交付。多 GPU 节点视库存而定：如果在您所选的司法管辖区暂无可用节点，我们会通知您，并为您保留订单或将款项退回您的余额。

### 可以退款吗？

GPU 服务器一经交付即不可退款，因为硬件是专门为您预留的。

## 延伸阅读

为本页精选的指南、政策和文章，均由我们的团队撰写。

- [H100 服务器 80 GB HBM3 显存，最多 4 × H100。](https://offshoreserv.com/zh/offshore-gpu-servers/h100)
- [RTX 5090 服务器 32 GB GDDR7 显存，$134.99/月。](https://offshoreserv.com/zh/offshore-gpu-servers/rtx-5090)
- [大语言模型需要多少显存？模型规模、量化与 GPU 选型。](https://offshoreserv.com/zh/blog/how-much-vram-for-llms)
- [AI 就绪的 GPU 镜像 GPU 服务器预装的驱动、CUDA 及相关工具。](https://offshoreserv.com/zh/docs/gpu/images)
- [A100、L40S 与 H100 HBM、ECC 和 NVLink，适合训练。](https://offshoreserv.com/zh/offshore-gpu-servers/datacenter)
- [RTX GPU 服务器 推理的单 token 成本最低。](https://offshoreserv.com/zh/offshore-gpu-servers/rtx)

## 最大的开放模型，运行在您自己的节点上

1. 选择 2 块或 4 块 GPU
2. 加密货币付款，无需证件
3. 31 至 24 小时内即可 SSH 登录

月付 $558.99 起 · 独享 GPU · H100 配备 NVLink

---

OffshoreServ 是一家离岸主机服务商，在七个司法管辖区（冰岛、瑞士、摩尔多瓦、罗马尼亚、荷兰、保加利亚和马来西亚）提供 VPS、独立服务器、Windows RDP 和 GPU 服务器，仅接受加密货币付款（比特币、以太坊、门罗币、泰达币（USDT）和 Solana），无需身份验证（无需 KYC）。

Prices and plans: https://offshoreserv.com/zh/pricing · Answers: https://offshoreserv.com/zh/faq · Every page: https://offshoreserv.com/llms.txt
