RTX 4090 超值
- 显存带宽
1,008 GB/s - 16 位精度可运行
- 最高约 8B
- 8 位精度可运行
- 最高约 14B
- 图像模型
- SDXL 与 Flux
- 适用场景
- 聊天助手、图像生成

RTX 显卡的每美元推理速度最高:4090 配备
01 套餐与价格
每块显卡都由您独享。每台服务器均配备 NVMe 存储和不限流量的
| GPU | VRAM | CPU | 内存 | 存储 | 地区 | 价格 | 订购 |
|---|---|---|---|---|---|---|---|
|
|
$61.99/月
竞品最低价 |
部署 |
|||||
|
|
$84.99/月
竞品最低价 |
部署 |
|||||
|
|
$134.99/月
竞品最低价 |
部署 |
|||||
|
|
$306.99/月
竞品最低价 |
部署 |
|||||
|
|
$558.99/月
竞品最低价 |
部署 |
该司法管辖区暂无 GPU 套餐:或比较各司法管辖区。
需要 HBM 显存或 NVLink?请看 A100、L40S 与 H100。
02 选择
4090 是高性价比之选。5090 多出
03 选型
稠密模型在 8K token 上下文、预留 10% 余量时所需的显存。上下文越长,所需显存越多。
| 模型规模 | 4 位精度 | 8 位精度 | 16 位精度 |
|---|---|---|---|
| 7–8B | ~ | ~ | ~ |
| 13–14B | ~ | ~ | ~ |
| 32B | ~ | ~ | ~ A100 或 H100 |
| 70B | ~ A100、H100 或 | ~ | ~ |
4 位精度的 70B 模型约需
04 应用场景
当模型能装进 24 至
以 Open WebUI 为前端运行 8B 至 32B 模型,供您本人或团队使用。
在 ComfyUI 中运行 Stable Diffusion 和 Flux 工作流。
在您独享的显卡上运行视频模型和 Blender Cycles 渲染。
自托管的代码模型,基于您自己的代码仓库作答。
05 司法管辖区
每款显卡的可用地区各不相同,具体请看上方套餐。
延迟数据根据距离估算,并非实测。所有司法管辖区价格相同。我们如何估算延迟
06 离岸承诺,白纸黑字
我们的承诺写进了政策条款,而不只是营销文案。
07 常见问题
还有其他问题?完整的常见问题页面解答了大家下单前常问的问题:付款、隐私、投诉与支持。
阅读完整常见问题对于能装进 24 至
可以。vLLM 和 llama.cpp 可将一个模型拆分到两块显卡上(张量并行或层并行),这样您就有
如果您需要单卡