
NVIDIA
离岸 GPU 服务器
私有 AI,无需 KYC
独享 NVIDIA GPU,从
- 1 至 24 小时内交付
- 独享 GPU,绝不共享
- 提示词只留在您的服务器上
- 无需 KYC,仅需邮箱
01 套餐与价格
10 款 GPU 服务器,从 RTX A4000 到 4 × H100
每块 GPU 都由您独享:没有分时复用,也没有会在任务中途被收回的竞价实例。
| GPU | VRAM | CPU | 内存 | 存储 | 地区 | 价格 | 订购 |
|---|---|---|---|---|---|---|---|
|
|
$61.99/月
竞品最低价 |
部署 |
|||||
|
|
$84.99/月
竞品最低价 |
部署 |
|||||
|
|
$134.99/月
竞品最低价 |
部署 |
|||||
|
|
$306.99/月
竞品最低价 |
部署 |
|||||
|
|
$355.99/月
竞品最低价 |
部署 |
|||||
|
L40S
大规模推理
|
$418.99/月
竞品最低价 |
部署 L40S | |||||
|
|
$558.99/月
竞品最低价 |
部署 |
|||||
|
|
$581.99/月
竞品最低价 |
部署 |
|||||
|
|
$1,096.99/月
竞品最低价 |
部署 |
|||||
|
|
$2,348.99/月
竞品最低价 |
部署 |
该司法管辖区暂无 GPU 套餐:或比较各司法管辖区。
RTX 4090 、5090、L40S、A100、H100- 预装 CUDA 驱动
- 单 GPU 与多 GPU 节点
- 无需 KYC
· BTC、ETH、XMR、USDT、SOL
计划搭建集群,或运行需要超过
02 产品系列
三类 GPU 服务器
消费级 RTX 显卡胜在单 token 成本低,数据中心级 GPU 胜在显存与带宽,多 GPU 节点则面向最大规模的模型。
03 按型号
租用指定型号的 GPU
用户咨询最多的四款显卡,逐一列出规格参数、显存能容纳的模型,以及按使用时长折算的每小时价格。
04 私有大语言模型托管
您的模型、您的提示词、您的服务器
在无人共用的硬件上运行开放权重模型。没有任何 API 服务商能看到您的提示词,我们也不会记录或检查您的流量。
Llama、Qwen、Mistral、DeepSeek、Gemma 等开放权重模型经过量化后即可在单块 GPU 上运行,最大的模型也能装进我们的多 GPU 节点。部署推理服务时,可用 Ollama 快速上手,用 vLLM 在高负载下提供兼容 OpenAI 的端点,或用 llama.cpp 实现最精简的配置。
下表列出了模型在各精度下所需的显存,按单用户、8K token 上下文并预留 10% 余量计算。上下文更长或用户更多时,所需显存也更多。
- 通过 SSH 隧道,在浏览器中与私有助手对话。
- 为您自己的应用提供 API,绝不经由第三方服务商。
- 用 LoRA 基于您自己的数据进行微调,数据始终不离开服务器。
| 模型规模 | 4 位精度 | 8 位精度 | 16 位精度 |
|---|---|---|---|
| 7–8B | ~ | ~ | ~ |
| 13–14B | ~ | ~ | ~ |
| 32B | ~ | ~ | ~ A100 或 H100 |
| 70B | ~ A100、H100 或 | ~ | ~ |
| 123B | ~ | ~ | ~ |
05 标配
首次登录即可使用 CUDA
检查显卡,拉取模型,开始提供服务。
独享 GPU
每块显卡都由您独享:没有分时复用,也没有共享显存。
驱动与 CUDA 就绪
Ubuntu 24.04 ,已安装 NVIDIA 驱动和 CUDA 工具包。每种技术栈都有指南
PyTorch、vLLM、Ollama、ComfyUI 和 Docker 的分步教程。
NVMe 存储
1 至
30 TB NVMe 存储,用于存放数据集、检查点和模型权重。1 Gbps 不限流量拉取模型和数据集不计流量。
不留日志
我们从不查看或记录您的提示词、输出内容或训练数据。
DDoS 防护
公开端点在遭受攻击时仍保持在线。
完整 root 权限
驱动、内核模块和技术栈,全由您自己决定。
06 对比
所有 GPU 并排对比
就推理而言,显存带宽决定每秒生成的 token 数,显存容量决定能装下哪些模型。
| 规格 | L40S | |||||||||
|---|---|---|---|---|---|---|---|---|---|---|
| GPU | ||||||||||
| VRAM | ||||||||||
| 显存类型 | GDDR6 ECC | GDDR6X | GDDR7 | GDDR6 ECC | HBM2e | GDDR6 ECC | GDDR7 | HBM3 | HBM3 | HBM3 |
| 单 GPU 显存带宽 | ~ | |||||||||
| CPU | ||||||||||
| 系统内存 | ||||||||||
| 存储 | ||||||||||
| 司法管辖区 | ||||||||||
| 月付 | $61.99 | $84.99 | $134.99 | $306.99 | $355.99 | $418.99 | $558.99 | $581.99 | $1,096.99 | $2,348.99 |
| 季付(折合每月) | $58.89 | $80.74 | $128.24 | $291.64 | $338.19 | $398.04 | $531.04 | $552.89 | $1,042.14 | $2,231.54 |
| 年付(折合每月) | $54.55 | $74.79 | $118.79 | $270.15 | $313.27 | $368.71 | $491.91 | $512.15 | $965.35 | $2,067.11 |
| 竞品最低价 | ||||||||||
| 订购 | 部署 | 部署 | 部署 | 部署 | 部署 | 部署 L40S | 部署 | 部署 | 部署 | 部署 |
07 应用场景
离岸 GPU 的常见用途
从私有聊天助手到基于自有数据的微调,全部运行在无人共用的显卡上。
大语言模型推理
基于 8B 至 405B 开放权重模型的私有聊天与 API。
微调
基于您自己的数据进行 LoRA 和 QLoRA 微调,数据始终不离开服务器。
图像与视频生成
通过 ComfyUI 运行 Stable Diffusion、Flux 和视频模型。
3D 渲染
Blender Cycles 等 GPU 渲染器,无需占用您的工作站。
语音与转写
用 Whisper 和文本转语音模型处理必须保密的音频。
科研与数据科学
在独享硬件上进行 Jupyter、PyTorch 和 CUDA 实验。
08 司法管辖区
GPU 服务器覆盖 4 个司法管辖区
供货情况因显卡而异:套餐表列出了每款显卡的有货地区。
-
摩尔多瓦基希讷乌超值 欧盟以外
· 不适用 DSA 伦敦~33 ms 纽约~113 ms 新加坡~129 ms -
荷兰阿姆斯特丹网络枢纽 欧盟成员国
· 适用 DSA 伦敦~7 ms 纽约~87 ms 新加坡~154 ms -
冰岛雷克雅未克言论自由的避风港 欧洲经济区
· 欧盟以外· 不适用 DSA 伦敦~29 ms 纽约~63 ms 新加坡~169 ms -
罗马尼亚布加勒斯特欧盟实惠之选 欧盟成员国
· 适用 DSA 伦敦~32 ms 纽约~113 ms 新加坡~131 ms
延迟数据根据距离估算,并非实测。所有司法管辖区价格相同。我们如何估算延迟
09 离岸承诺,白纸黑字
付款之前,先看规则
我们的承诺写进了政策条款,而不只是营销文案。
10 常见问题
GPU 服务器常见问题
还有其他问题?完整的常见问题页面解答了大家下单前常问的问题:付款、隐私、投诉与支持。
阅读完整常见问题GPU 会被共享或分时复用吗?
不会。在租用期内,您套餐中的每块 GPU 都专属于您的服务器。其他人不会在上面运行任务,其显存也绝不共享。
我的模型需要哪款 GPU?
是否已安装 NVIDIA 驱动和 CUDA?
是的。Ubuntu 镜像已自带 NVIDIA 驱动和 CUDA 工具包。PyTorch、vLLM、Ollama 和 ComfyUI 只需几条命令即可安装,详见 GPU 镜像指南。
我可以运营面向公众的 AI 服务吗?
可以,只要该服务在您服务器所在的司法管辖区合法,并遵守我们的可接受使用政策。您需对您的服务所生成和提供的内容负责。
多久可以交付?
订购后 1 至 24 小时内交付,具体取决于显卡型号。如果某款 GPU 在您所选的司法管辖区暂时缺货,我们会通知您,并为您保留订单或将款项退回您的余额。
可以在 GPU 服务器上挖加密货币吗?
可以。GPU 服务器和独立服务器允许挖矿,这些服务器专为您一人开通。
可以退款吗?
GPU 服务器一经交付即不可退款,因为硬件是专门为您预留的。订购前请查看规格参数和 GPU 镜像指南;账户余额随时可用于支付其他服务。
你们会记录提示词、输出内容或数据集吗?
不会。我们不会记录或检查您服务器的流量,也从不查看服务器内运行的内容。
专属 GPU,远离大型云平台
- 1 选择 GPU 和司法管辖区
- 2 加密货币付款,无需证件
- 31 至 24 小时内即可 SSH 登录