上线优惠价:每个套餐的价格都比我们追踪的最便宜的离岸竞争对手低 30%。 查看价格对比所有套餐价格均比最便宜的离岸主机服务商低 30%

AI 与 GPU

运行大语言模型需要多少显存?(2026年指南)

为大语言模型估算 GPU 显存的实用方法:按精度计算权重,为上下文预留 KV 缓存,留出余量,以及哪些 GPU 能容纳 8B 至 120B 参数的模型。

阅读约 9 分钟OffshoreServ 团队撰写

要点

  • 权重:参数量乘以每个权重的字节数。FP16 或 BF16 为 2 字节,8 位精度约为 1 字节,4 位精度约为 0.5 至 0.6 字节。
  • KV 缓存:随上下文长度而增长,每多一个并发用户也会随之增加。Llama 3.1 8B 每 8K token 约需 1 GB,70B 的 Llama 模型约需 2.7 GB。
  • 余量:预留 10% 至 20% 的空闲显存,供运行时、激活值和缓冲区使用。
  • 速度:生成速度受显存带宽限制,因此即使容量相同,显存更快的 GPU 生成 token 的速度也更快。
  • 经验法则:24 GB 的 RTX 4090 能以全精度运行 8B 模型;4 位精度的 70B 模型约需 50 GB,也就是一块 80 GB 的 GPU 或两块 32 GB 的显卡。
本页内容
  1. 计算公式:权重、缓存与余量
  2. 按模型规模估算显存
  3. 哪些 GPU 装得下
  4. 速度:显存带宽决定快慢
  5. 将模型拆分到多块 GPU 上
  6. 微调需要多得多的显存
  7. 如何在五分钟内核算某个模型
  8. 快速选型
  9. 在 OffshoreServ 上运行您的模型
  10. 常见问题

要运行大语言模型,您需要足够的显存来容纳其权重(参数量乘以每个权重的字节数),再加上与上下文长度对应的 KV 缓存,外加 10% 至 20% 的余量。8B 模型的权重在 FP16 下约需 16 GB,8 位精度下约需 8.5 GB,4 位精度下约需 5 GB。70B 模型则分别约需 140 GB、75 GB 和 43 GB,这还不包括缓存。

本指南将逐一解释这个总和的各个组成部分,给出常见模型规模的对照表,并将其与实际 GPU 对应起来:从 16 GB 的 RTX A4000 到四卡 H100 服务器。

计算公式:权重、缓存与余量

1. 权重:参数量乘以每个权重的字节数

每个参数都以一个数值的形式存储,其占用的空间由精度决定。以 NVIDIA 自己举的例子来说:一个 7B 参数的模型以 16 位精度加载时,约占用 14 GB。量化可以进一步压缩所需空间:

精度每个权重的字节数备注
FP324训练时的主权重;推理中很少使用
FP16 或 BF162推理中通常所说的“全精度”
8 位(INT8、FP8、Q8)约 1对大多数模型而言几乎无损
4 位(INT4、Q4、MXFP4)理论值 0.5,实际为 0.55 至 0.6缩放因子和元数据会略微增加占用

实际文件印证了这条法则。在 llama.cpp 对 Llama 3.1 8B 的实测中,F16 文件为 14.96 GiB,Q8_0 为 7.95 GiB,Q4_K_M 为 4.58 GiB,折算下来,这种流行的 4 位格式每个权重约占 4.9 位。

2. KV 缓存:上下文占用的显存

在生成过程中,模型会为每一层保存此前每个 token 的键和值。NVIDIA 给出的每 token 缓存大小为 2 × layers × (heads × head dimension) × bytes per value。现代模型采用分组查询注意力,因此关键在于键/值头的数量,它远少于注意力头的数量。例如,Llama 3 8B 有 32 层、8 个键/值头,每个头的维度为 128:

2 × 32 layers × 8 KV heads × 128 × 2 bytes = 131,072 bytes (128 KiB) per token
模型每 token 的 KV 缓存(FP16)8K 上下文32K 上下文128K 上下文
Llama 3.1 8B128 KiB1.1 GB4.3 GB17.2 GB
Qwen3-14B160 KiB1.3 GB5.4 GB需要扩展上下文
Qwen3-32B256 KiB2.1 GB8.6 GB需要扩展上下文
Llama 3.3 70B320 KiB2.7 GB10.7 GB42.9 GB

Qwen3 的数据采用官方公布的模型配置(14B:40 层;32B:64 层;两者均有 8 个 KV 头;默认配置支持 40,960 个位置,因此 128K 需要扩展上下文)。在实践中,有两点影响很重要。缓存是按序列计算的,因此十个各使用 8K 上下文的并发用户,需要上表数值的十倍。此外,长上下文所需的显存可能超过权重本身:一个 4 位精度的 8B 模型在跑满 128K 上下文时,缓存所需的显存比模型本身还多。一些推理引擎可以用 8 位精度存储缓存,只需付出少许质量代价,就能将其减半。

3. 为运行时预留余量

CUDA 上下文、激活值、临时缓冲区和显存碎片都会占用空间。在权重加缓存的基础上,请再预留 10% 至 20%。有些推理服务引擎一启动就会把大部分空闲显存预留给缓存,因此监控工具中显示的“已用”数值,并不能说明模型真正需要多少显存。

按模型规模估算显存

下表将权重、单用户 8K token 上下文和 10% 余量相加。请将这些数字视为规划参考:不同量化格式之间会相差几个百分点,上下文更长或用户更多时需要更多显存。

模型级别(示例)FP16 或 BF168 位精度4 位精度
7B 至 8B(Llama 3.1 8B)约 19 GB约 11 GB约 7 GB
13B 至 14B(Qwen3-14B)约 32 GB约 18 GB约 11 GB
32B(Qwen3-32B)约 73 GB约 40 GB约 24 GB
70B(Llama 3.3 70B)约 157 GB约 85 GB约 50 GB
120B 级稠密模型(Mistral Large 2,123B)约 274 GB约 147 GB约 86 GB
120B 级混合专家模型(gpt-oss-120b)不适用不适用单块 80 GB GPU 即可容纳(原生 MXFP4)

混合专家(MoE)模型只在一个方向上打破了规模与显存之间的简单对应关系。gpt-oss-120b 的总参数量为 117B,但每个 token 仅激活 5.1B;其专家权重以 4 位 MXFP4 格式发布,这正是 OpenAI 称它可以在单块 80 GB GPU 上运行的原因。所有专家仍须全部载入显存,因此容量需求由总规模决定,而速度则取决于激活参数量。

哪些 GPU 装得下

显存容量和带宽数据来自 NVIDIA 的产品规格:RTX A4000、RTX 4090 和 RTX 5090、RTX 6000 Ada、L40S、A100 和 H100。价格为我们独立 GPU 服务器的月付价格。

GPUVRAM显存带宽可从容运行(8K 上下文)OffshoreServ 月费
RTX A400016 GB GDDR6448 GB/s8B(8 位)、14B(4 位)$61.99
RTX 409024 GB GDDR6X1,008 GB/s8B(FP16)、14B(8 位)$84.99
RTX 509032 GB GDDR71,792 GB/s32B(4 位)、14B(8 位,长上下文)$134.99
RTX 6000 Ada48 GB GDDR6960 GB/s32B(8 位)、14B(FP16)$306.99
L40S48 GB GDDR6864 GB/s32B(8 位)、14B(FP16)$418.99
A100 80 GB80 GB HBM2e1,935 至 2,039 GB/s(PCIe 或 SXM)70B(4 位)、gpt-oss-120b、32B(FP16,较紧张)$355.99
H100 80 GB SXM580 GB HBM33.35 TB/s与 A100 可运行的模型相同,速度更快$581.99
2 × RTX 5090共 64 GB每卡 1,792 GB/s70B(4 位),拆分到两块显卡上$558.99
2 × H100共 160 GB每卡 3.35 TB/s70B(8 位)、123B(8 位,较紧张)$1,096.99
4 × H100共 320 GB每卡 3.35 TB/s70B 和 123B(FP16)$2,348.99

有两个临界情况值得了解。4 位精度的 32B 模型约需 24 GB,一旦上下文变长,24 GB 的 RTX 4090 就没有余地了,因此对于这个规模,RTX 5090 是更稳妥的单块消费级显卡。4 位精度的 70B 模型约需 50 GB,刚好超出 48 GB 显卡的容量,因此请按 80 GB 或两块 GPU 来规划。

速度:显存带宽决定快慢

用 NVIDIA 的话说,生成 token 是一种内存受限的操作:起主导作用的是从显存中搬运权重和缓存的时间,而不是计算本身。对于只服务一个用户的稠密模型,每生成一个新 token 都要将全部权重读取一遍,由此得出一个硬性上限:

maximum tokens per second ≈ memory bandwidth ÷ size of the weights
模型与精度权重GPU理论上限
8B(4 位)4.9 GBRTX 4090约 205 token/s
32B(4 位)19.6 GBRTX 5090约 90 token/s
70B 模型(4 位精度)42.9 GBA100 80 GB(SXM)约 48 token/s
70B 模型(4 位精度)42.9 GBH100 SXM5约 78 token/s

实际的单用户速度远低于这些上限,因为计算内核的效率永远不可能达到完美,而且还必须读取缓存。不过,排名顺序依然成立,这也解释了为什么 RTX 6000 Ada 虽有 48 GB 显存,但带宽只有 960 GB/s,在运行两者都装得下的模型时,生成速度通常比 RTX 5090 慢。

有三个因素会改变这一局面。混合专家模型每个 token 只读取被激活的专家,因此 gpt-oss-120b 的生成速度远快于同等规模的 120B 稠密模型。处理长提示词(即“预填充”阶段)受限于算力而非带宽,因此 Tensor 核心吞吐量更高的 GPU 更占优势。此外,对多个用户进行批处理时,每次读取的权重可由多个请求共享,因此总吞吐量会随并发数上升,但每个用户的缓存也会增加显存开销。

将模型拆分到多块 GPU 上

当模型装不进一块显卡时,推理引擎可以对其进行拆分:按层分配到多块 GPU 上,或者将每一层切分到多块 GPU 上(张量并行)。两块显卡并不等于一块显存翻倍的显卡。每块 GPU 都有各自的运行时开销,而且显卡之间每一步都要交换数据。

因此,显卡之间的互联至关重要。根据 NVIDIA 的产品规格,RTX 4090、RTX 5090、RTX 6000 Ada 和 L40S 均不支持 NVLink,因此它们通过 PCIe 通信。H100 SXM 支持 NVLink,速率最高可达 900 GB/s。对于拆分到两块 RTX 5090 上的 4 位精度 70B 模型,PCIe 已经够用;如果是大规模张量并行部署,请在据此制定方案之前,先核实具体服务器的互联方式。

微调需要多得多的显存

以上讨论的都是推理。全参数微调则是另一个量级:使用混合精度 Adam 时,权重、梯度和优化器状态在不计激活值的情况下每个参数就要占用 16 字节,因此 8B 模型约需 128 GB。参数高效方法改变了这一点:QLoRA 的作者在冻结的 4 位精度模型之上训练小型适配器,在单块 48 GB GPU 上微调了一个 65B 模型。

如何在五分钟内核算某个模型

  1. 查看权重文件。您计划运行的那个量化版本的下载大小,就是对权重所占显存的最佳估计。
  2. 打开模型的 config.json。记下 num_hidden_layers、num_key_value_heads 和 head_dim(或用隐藏层大小除以注意力头数)。
  3. 用上面的公式计算每 token 的缓存,再乘以预计的最长上下文,以及需要同时服务的用户数。
  4. 再加上 10% 至 20%,然后与显卡的显存容量比较。如果结果与上限只差几个百分点,请选择更大一档的显卡,或位数更低的量化版本。
  5. 用真实的提示词测试。运行您预计要处理的最长文档,并在生成过程中观察显存占用。

快速选型

  • 基于 8B 模型的聊天助手或编程助手:全精度用 RTX 4090,8 位精度用 RTX A4000。
  • 处理长文档的 14B 模型:RTX 5090,8 位精度。
  • 32B 模型:RTX 5090,4 位精度;如需更好的质量,可用 48 GB 显卡运行 8 位精度。
  • 70B 模型:A100 或 H100,4 位精度;或两块 H100,8 位精度。
  • 120B 级:gpt-oss-120b 用一块 80 GB GPU;Mistral Large 2 等稠密模型用两到四块 H100。
  • 大量并发用户:先估算 KV 缓存大小,再在预算范围内选择带宽最高的 GPU。

在 OffshoreServ 上运行您的模型

我们的 GPU 服务器配备独享 NVIDIA GPU,从 RTX A4000 到四卡 H100 节点。RTX 系列可胜任大多数 8B 至 32B 的工作负载,数据中心系列增加了 48 GB 和 80 GB 显卡,多 GPU 服务器则可运行更高精度的 70B 模型以及 120B 级稠密模型。我们的 Linux 镜像预装了 CUDA 驱动,详见 GPU 镜像文档。服务器视型号不同,在摩尔多瓦、荷兰、冰岛或罗马尼亚 1 至 24 小时内即可就绪,使用加密货币付款,无需身份验证。

常见问题

70B 模型能在 24 GB 的 GPU 上运行吗?

无法以实用的速度运行。在 4 位精度下,70B 模型仅权重就约占 40 GB,因此在 24 GB 显卡上,大部分层只能放在系统内存中,生成速度会变得极其缓慢。请使用两块 RTX 5090、一块 48 GB 显卡,或一块 80 GB 的 A100 或 H100。

8B 模型需要多少显存?

权重在 16 位精度下约需 16 GB,8 位精度下约需 9 GB,4 位精度下约需 5 GB,此外还要加上上下文所需的 KV 缓存。24 GB 的显卡能以全精度运行 8B 模型,并有余量支持长上下文。

有了 GPU 之后,如何运行模型?

Ollama 上手最快,vLLM 则可在高负载下提供兼容 OpenAI 的 API。我们的在 GPU 服务器上自托管大语言模型指南详细介绍了这两种方式,包括如何让端点保持私密。

GPU 应该按月租还是按小时租?

如果 GPU 大多数日子都在忙,就按月租;如果只是做短期实验,就按小时租。用月付价格除以您在别处需要支付的小时费率,就能算出盈亏平衡点:我们在独享 GPU 与云 GPU 对比中做了具体计算。

选择法律站在您这边的地方托管

离岸 VPS、独立服务器、RDP 与 GPU 服务器,覆盖七个司法管辖区。无需 KYC,使用加密货币付款。

欢迎回来

登录以管理您的服务器和余额。

无需 KYC由 Cloudflare Turnstile 提供人机验证无跟踪