---
title: "运行大模型需要多少显存？2026 年 LLM 显存指南 | OffshoreServ"
description: "大语言模型需要多少 GPU 显存：参数量 × 字节数的计算规则、KV 缓存与余量，8B 到 120B 模型显存对照表，以及适合的显卡。"
url: https://offshoreserv.com/zh/blog/how-much-vram-for-llms
lang: zh-Hans
updated: 2026-09-26
source: HTML page at the url above (canonical); this is its Markdown version
---

[AI 与 GPU](https://offshoreserv.com/zh/blog/category/ai-gpus)

# 运行大语言模型需要多少显存？（2026年指南）

为大语言模型估算 GPU 显存的实用方法：按精度计算权重，为上下文预留 KV 缓存，留出余量，以及哪些 GPU 能容纳 8B 至 120B 参数的模型。

2026年9月26日 阅读约 9 分钟 OffshoreServ 团队撰写

要点

- 权重：参数量乘以每个权重的字节数。FP16 或 BF16 为 2 字节，8 位精度约为 1 字节，4 位精度约为 0.5 至 0.6 字节。
- KV 缓存：随上下文长度而增长，每多一个并发用户也会随之增加。Llama 3.1 8B 每 8K token 约需 1 GB，70B 的 Llama 模型约需 2.7 GB。
- 余量：预留 10% 至 20% 的空闲显存，供运行时、激活值和缓冲区使用。
- 速度：生成速度受显存带宽限制，因此即使容量相同，显存更快的 GPU 生成 token 的速度也更快。
- 经验法则：24 GB 的 RTX 4090 能以全精度运行 8B 模型；4 位精度的 70B 模型约需 50 GB，也就是一块 80 GB 的 GPU 或两块 32 GB 的显卡。

要运行大语言模型，您需要足够的显存来容纳其权重（参数量乘以每个权重的字节数），再加上与上下文长度对应的 KV 缓存，外加 10% 至 20% 的余量。8B 模型的权重在 FP16 下约需 16 GB，8 位精度下约需 8.5 GB，4 位精度下约需 5 GB。70B 模型则分别约需 140 GB、75 GB 和 43 GB，这还不包括缓存。

本指南将逐一解释这个总和的各个组成部分，给出常见模型规模的对照表，并将其与实际 GPU 对应起来：从 16 GB 的 RTX A4000 到四卡 H100 服务器。

## 计算公式：权重、缓存与余量

### 1. 权重：参数量乘以每个权重的字节数

每个参数都以一个数值的形式存储，其占用的空间由精度决定。以 NVIDIA 自己举的例子来说：一个 7B 参数的模型以 16 位精度加载时，[约占用 14 GB](https://developer.nvidia.com/blog/mastering-llm-techniques-inference-optimization/)。量化可以进一步压缩所需空间：

| 精度 | 每个权重的字节数 | 备注 |
| --- | --- | --- |
| FP32 | 4 | 训练时的主权重；推理中很少使用 |
| FP16 或 BF16 | 2 | 推理中通常所说的“全精度” |
| 8 位（INT8、FP8、Q8） | 约 1 | 对大多数模型而言几乎无损 |
| 4 位（INT4、Q4、MXFP4） | 理论值 0.5，实际为 0.55 至 0.6 | 缩放因子和元数据会略微增加占用 |

实际文件印证了这条法则。在 llama.cpp 对 Llama 3.1 8B 的实测中，[F16 文件为 14.96 GiB，Q8_0 为 7.95 GiB，Q4_K_M 为 4.58 GiB](https://github.com/ggml-org/llama.cpp/blob/master/tools/quantize/README.md)，折算下来，这种流行的 4 位格式每个权重约占 4.9 位。

### 2. KV 缓存：上下文占用的显存

在生成过程中，模型会为每一层保存此前每个 token 的键和值。NVIDIA 给出的每 token 缓存大小为 `2 × layers × (heads × head dimension) × bytes per value`。现代模型采用分组查询注意力，因此关键在于键/值头的数量，它远少于注意力头的数量。例如，Llama 3 8B 有 32 层、[8 个键/值头](https://arxiv.org/abs/2407.21783)，每个头的维度为 128：

```
2 × 32 layers × 8 KV heads × 128 × 2 bytes = 131,072 bytes (128 KiB) per token
```

| 模型 | 每 token 的 KV 缓存（FP16） | 8K 上下文 | 32K 上下文 | 128K 上下文 |
| --- | --- | --- | --- | --- |
| Llama 3.1 8B | 128 KiB | 1.1 GB | 4.3 GB | 17.2 GB |
| Qwen3-14B | 160 KiB | 1.3 GB | 5.4 GB | 需要扩展上下文 |
| Qwen3-32B | 256 KiB | 2.1 GB | 8.6 GB | 需要扩展上下文 |
| Llama 3.3 70B | 320 KiB | 2.7 GB | 10.7 GB | 42.9 GB |

Qwen3 的数据采用官方公布的模型配置（[14B](https://huggingface.co/Qwen/Qwen3-14B/blob/main/config.json)：40 层；[32B](https://huggingface.co/Qwen/Qwen3-32B/blob/main/config.json)：64 层；两者均有 8 个 KV 头；默认配置支持 40,960 个位置，因此 128K 需要扩展上下文）。在实践中，有两点影响很重要。缓存是按序列计算的，因此十个各使用 8K 上下文的并发用户，需要上表数值的十倍。此外，长上下文所需的显存可能超过权重本身：一个 4 位精度的 8B 模型在跑满 128K 上下文时，缓存所需的显存比模型本身还多。一些推理引擎可以用 8 位精度存储缓存，只需付出少许质量代价，就能将其减半。

### 3. 为运行时预留余量

CUDA 上下文、激活值、临时缓冲区和显存碎片都会占用空间。在权重加缓存的基础上，请再预留 10% 至 20%。有些推理服务引擎一启动就会把大部分空闲显存预留给缓存，因此监控工具中显示的“已用”数值，并不能说明模型真正需要多少显存。

## 按模型规模估算显存

下表将权重、单用户 8K token 上下文和 10% 余量相加。请将这些数字视为规划参考：不同量化格式之间会相差几个百分点，上下文更长或用户更多时需要更多显存。

| 模型级别（示例） | FP16 或 BF16 | 8 位精度 | 4 位精度 |
| --- | --- | --- | --- |
| 7B 至 8B（Llama 3.1 8B） | 约 19 GB | 约 11 GB | 约 7 GB |
| 13B 至 14B（Qwen3-14B） | 约 32 GB | 约 18 GB | 约 11 GB |
| 32B（Qwen3-32B） | 约 73 GB | 约 40 GB | 约 24 GB |
| 70B（Llama 3.3 70B） | 约 157 GB | 约 85 GB | 约 50 GB |
| 120B 级稠密模型（[Mistral Large 2，123B](https://mistral.ai/news/mistral-large-2407/)） | 约 274 GB | 约 147 GB | 约 86 GB |
| 120B 级混合专家模型（[gpt-oss-120b](https://huggingface.co/openai/gpt-oss-120b)） | 不适用 | 不适用 | 单块 80 GB GPU 即可容纳（原生 MXFP4） |

混合专家（MoE）模型只在一个方向上打破了规模与显存之间的简单对应关系。gpt-oss-120b 的总参数量为 117B，但每个 token 仅激活 5.1B；其专家权重以 4 位 MXFP4 格式发布，这正是 OpenAI 称它可以在单块 80 GB GPU 上运行的原因。所有专家仍须全部载入显存，因此容量需求由总规模决定，而速度则取决于激活参数量。

## 哪些 GPU 装得下

显存容量和带宽数据来自 NVIDIA 的产品规格：[RTX A4000](https://www.nvidia.com/content/dam/en-zz/Solutions/gtcs21/rtx-a4000/nvidia-rtx-a4000-datasheet.pdf)、[RTX 4090 和 RTX 5090](https://images.nvidia.com/aem-dam/Solutions/geforce/blackwell/nvidia-rtx-blackwell-gpu-architecture.pdf)、[RTX 6000 Ada](https://www.nvidia.com/content/dam/en-zz/Solutions/design-visualization/rtx-6000/proviz-print-rtx6000-datasheet-web-2504660.pdf)、[L40S](https://www.nvidia.com/en-us/data-center/l40s/)、[A100](https://www.nvidia.com/en-us/data-center/a100/) 和 [H100](https://www.nvidia.com/en-us/data-center/h100/)。价格为我们独立 GPU 服务器的月付价格。

| GPU | VRAM | 显存带宽 | 可从容运行（8K 上下文） | OffshoreServ 月费 |
| --- | --- | --- | --- | --- |
| RTX A4000 | 16 GB GDDR6 | 448 GB/s | 8B（8 位）、14B（4 位） | $61.99 |
| RTX 4090 | 24 GB GDDR6X | 1,008 GB/s | 8B（FP16）、14B（8 位） | $84.99 |
| RTX 5090 | 32 GB GDDR7 | 1,792 GB/s | 32B（4 位）、14B（8 位，长上下文） | $134.99 |
| RTX 6000 Ada | 48 GB GDDR6 | 960 GB/s | 32B（8 位）、14B（FP16） | $306.99 |
| L40S | 48 GB GDDR6 | 864 GB/s | 32B（8 位）、14B（FP16） | $418.99 |
| A100 80 GB | 80 GB HBM2e | 1,935 至 2,039 GB/s（PCIe 或 SXM） | 70B（4 位）、gpt-oss-120b、32B（FP16，较紧张） | $355.99 |
| H100 80 GB SXM5 | 80 GB HBM3 | 3.35 TB/s | 与 A100 可运行的模型相同，速度更快 | $581.99 |
| 2 × RTX 5090 | 共 64 GB | 每卡 1,792 GB/s | 70B（4 位），拆分到两块显卡上 | $558.99 |
| 2 × H100 | 共 160 GB | 每卡 3.35 TB/s | 70B（8 位）、123B（8 位，较紧张） | $1,096.99 |
| 4 × H100 | 共 320 GB | 每卡 3.35 TB/s | 70B 和 123B（FP16） | $2,348.99 |

有两个临界情况值得了解。4 位精度的 32B 模型约需 24 GB，一旦上下文变长，24 GB 的 RTX 4090 就没有余地了，因此对于这个规模，RTX 5090 是更稳妥的单块消费级显卡。4 位精度的 70B 模型约需 50 GB，刚好超出 48 GB 显卡的容量，因此请按 80 GB 或两块 GPU 来规划。

## 速度：显存带宽决定快慢

用 NVIDIA 的话说，生成 token 是 [一种内存受限的操作](https://developer.nvidia.com/blog/mastering-llm-techniques-inference-optimization/)：起主导作用的是从显存中搬运权重和缓存的时间，而不是计算本身。对于只服务一个用户的稠密模型，每生成一个新 token 都要将全部权重读取一遍，由此得出一个硬性上限：

```
maximum tokens per second ≈ memory bandwidth ÷ size of the weights
```

| 模型与精度 | 权重 | GPU | 理论上限 |
| --- | --- | --- | --- |
| 8B（4 位） | 4.9 GB | RTX 4090 | 约 205 token/s |
| 32B（4 位） | 19.6 GB | RTX 5090 | 约 90 token/s |
| 70B 模型（4 位精度） | 42.9 GB | A100 80 GB（SXM） | 约 48 token/s |
| 70B 模型（4 位精度） | 42.9 GB | H100 SXM5 | 约 78 token/s |

实际的单用户速度远低于这些上限，因为计算内核的效率永远不可能达到完美，而且还必须读取缓存。不过，排名顺序依然成立，这也解释了为什么 RTX 6000 Ada 虽有 48 GB 显存，但带宽只有 960 GB/s，在运行两者都装得下的模型时，生成速度通常比 RTX 5090 慢。

有三个因素会改变这一局面。混合专家模型每个 token 只读取被激活的专家，因此 gpt-oss-120b 的生成速度远快于同等规模的 120B 稠密模型。处理长提示词（即“预填充”阶段）受限于算力而非带宽，因此 Tensor 核心吞吐量更高的 GPU 更占优势。此外，对多个用户进行批处理时，每次读取的权重可由多个请求共享，因此总吞吐量会随并发数上升，但每个用户的缓存也会增加显存开销。

## 将模型拆分到多块 GPU 上

当模型装不进一块显卡时，推理引擎可以对其进行拆分：按层分配到多块 GPU 上，或者将每一层切分到多块 GPU 上（张量并行）。两块显卡并不等于一块显存翻倍的显卡。每块 GPU 都有各自的运行时开销，而且显卡之间每一步都要交换数据。

因此，显卡之间的互联至关重要。根据 NVIDIA 的产品规格，RTX 4090、RTX 5090、RTX 6000 Ada 和 L40S 均不支持 NVLink，因此它们通过 PCIe 通信。H100 SXM 支持 NVLink，速率最高可达 900 GB/s。对于拆分到两块 RTX 5090 上的 4 位精度 70B 模型，PCIe 已经够用；如果是大规模张量并行部署，请在据此制定方案之前，先核实具体服务器的互联方式。

## 微调需要多得多的显存

以上讨论的都是推理。全参数微调则是另一个量级：使用混合精度 Adam 时，权重、梯度和优化器状态在不计激活值的情况下 [每个参数就要占用 16 字节](https://arxiv.org/abs/1910.02054)，因此 8B 模型约需 128 GB。参数高效方法改变了这一点：QLoRA 的作者在冻结的 4 位精度模型之上训练小型适配器，[在单块 48 GB GPU 上微调了一个 65B 模型](https://arxiv.org/abs/2305.14314)。

## 如何在五分钟内核算某个模型

1. **查看权重文件。** 您计划运行的那个量化版本的下载大小，就是对权重所占显存的最佳估计。
2. **打开模型的 `config.json`。** 记下 `num_hidden_layers`、`num_key_value_heads` 和 `head_dim`（或用隐藏层大小除以注意力头数）。
3. **用上面的公式计算每 token 的缓存** ，再乘以预计的最长上下文，以及需要同时服务的用户数。
4. **再加上 10% 至 20%** ，然后与显卡的显存容量比较。如果结果与上限只差几个百分点，请选择更大一档的显卡，或位数更低的量化版本。
5. **用真实的提示词测试。** 运行您预计要处理的最长文档，并在生成过程中观察显存占用。

## 快速选型

- **基于 8B 模型的聊天助手或编程助手：** 全精度用 [RTX 4090](https://offshoreserv.com/zh/offshore-gpu-servers/rtx-4090)，8 位精度用 RTX A4000。
- **处理长文档的 14B 模型：** [RTX 5090](https://offshoreserv.com/zh/offshore-gpu-servers/rtx-5090)，8 位精度。
- **32B 模型：** RTX 5090，4 位精度；如需更好的质量，可用 48 GB 显卡运行 8 位精度。
- **70B 模型：** [A100](https://offshoreserv.com/zh/offshore-gpu-servers/a100) 或 [H100](https://offshoreserv.com/zh/offshore-gpu-servers/h100)，4 位精度；或两块 H100，8 位精度。
- **120B 级：** gpt-oss-120b 用一块 80 GB GPU；Mistral Large 2 等稠密模型用两到四块 H100。
- **大量并发用户：** 先估算 KV 缓存大小，再在预算范围内选择带宽最高的 GPU。

## 在 OffshoreServ 上运行您的模型

我们的 [GPU 服务器](https://offshoreserv.com/zh/offshore-gpu-servers) 配备独享 NVIDIA GPU，从 RTX A4000 到四卡 H100 节点。[RTX 系列](https://offshoreserv.com/zh/offshore-gpu-servers/rtx) 可胜任大多数 8B 至 32B 的工作负载，[数据中心系列](https://offshoreserv.com/zh/offshore-gpu-servers/datacenter) 增加了 48 GB 和 80 GB 显卡，[多 GPU 服务器](https://offshoreserv.com/zh/offshore-gpu-servers/multi-gpu) 则可运行更高精度的 70B 模型以及 120B 级稠密模型。我们的 Linux 镜像预装了 CUDA 驱动，详见 [GPU 镜像文档](https://offshoreserv.com/zh/docs/gpu/images)。服务器视型号不同，在摩尔多瓦、荷兰、冰岛或罗马尼亚 1 至 24 小时内即可就绪，使用加密货币付款，无需身份验证。

## 常见问题

### 70B 模型能在 24 GB 的 GPU 上运行吗？

无法以实用的速度运行。在 4 位精度下，70B 模型仅权重就约占 40 GB，因此在 24 GB 显卡上，大部分层只能放在系统内存中，生成速度会变得极其缓慢。请使用两块 RTX 5090、一块 48 GB 显卡，或一块 80 GB 的 A100 或 H100。

### 8B 模型需要多少显存？

权重在 16 位精度下约需 16 GB，8 位精度下约需 9 GB，4 位精度下约需 5 GB，此外还要加上上下文所需的 KV 缓存。24 GB 的显卡能以全精度运行 8B 模型，并有余量支持长上下文。

### 有了 GPU 之后，如何运行模型？

Ollama 上手最快，vLLM 则可在高负载下提供兼容 OpenAI 的 API。我们的 [在 GPU 服务器上自托管大语言模型](https://offshoreserv.com/zh/blog/self-host-llm-gpu-server) 指南详细介绍了这两种方式，包括如何让端点保持私密。

### GPU 应该按月租还是按小时租？

如果 GPU 大多数日子都在忙，就按月租；如果只是做短期实验，就按小时租。用月付价格除以您在别处需要支付的小时费率，就能算出盈亏平衡点：我们在 [独享 GPU 与云 GPU 对比](https://offshoreserv.com/zh/blog/dedicated-gpu-vs-cloud-gpu) 中做了具体计算。

**选择法律站在您这边的地方托管**

离岸 VPS、独立服务器、RDP 与 GPU 服务器，覆盖七个司法管辖区。无需 KYC，使用加密货币付款。

## 更多博客文章

- [AI 与 GPU 独立 GPU 服务器与云 GPU 对比：成本、隐私与速度 按月还是按小时计费？如何找到独立 GPU 服务器与云 GPU 之间的盈亏平衡点，以及两者在可用性、速度和隐私方面有何不同。2026年9月26日 阅读约 8 分钟](https://offshoreserv.com/zh/blog/dedicated-gpu-vs-cloud-gpu)
- [AI 与 GPU 如何在 GPU 服务器上自托管大语言模型（Ollama、vLLM）从一台空白的 GPU 服务器到私有的、兼容 OpenAI 的端点：租用哪款显卡、Ollama 与 vLLM 的部署、TLS 与密钥、基准测试、隐私与成本。2026年9月26日 阅读约 10 分钟](https://offshoreserv.com/zh/blog/self-host-llm-gpu-server)
- [法律与司法管辖区 5 眼、9 眼和 14 眼联盟国家：对主机托管意味着什么 哪些国家属于 5 眼、9 眼和 14 眼联盟，哪些信息是官方公布的、哪些来自泄露，以及成员国身份对我们七个地区中每一处的服务器究竟意味着什么。2026年9月26日 阅读约 8 分钟](https://offshoreserv.com/zh/blog/14-eyes-countries-hosting)

---

OffshoreServ 是一家离岸主机服务商，在七个司法管辖区（冰岛、瑞士、摩尔多瓦、罗马尼亚、荷兰、保加利亚和马来西亚）提供 VPS、独立服务器、Windows RDP 和 GPU 服务器，仅接受加密货币付款（比特币、以太坊、门罗币、泰达币（USDT）和 Solana），无需身份验证（无需 KYC）。

Prices and plans: https://offshoreserv.com/zh/pricing · Answers: https://offshoreserv.com/zh/faq · Every page: https://offshoreserv.com/llms.txt
