---
title: "Сколько видеопамяти нужно для LLM? Руководство 2026 года"
description: "Сколько памяти GPU нужно LLM: правило «параметры × байты», KV-кеш и запас, таблица VRAM для моделей от 8B до 120B и какие видеокарты подойдут."
url: https://offshoreserv.com/ru/blog/how-much-vram-for-llms
lang: ru
updated: 2026-09-26
source: HTML page at the url above (canonical); this is its Markdown version
---

[ИИ и GPU](https://offshoreserv.com/ru/blog/category/ai-gpus)

# Сколько видеопамяти нужно для запуска LLM? (руководство 2026 года)

Практический способ рассчитать объём видеопамяти для больших языковых моделей: веса в зависимости от точности, KV-кэш для контекста, запас и какие GPU подходят для моделей от 8 до 120 млрд параметров.

26 сентября 2026 г.9 мин чтения От команды OffshoreServ

Главное

- Веса: число параметров, умноженное на размер веса в байтах. 2 байта в FP16 или BF16, около 1 байта в 8-битной точности, около 0.5–0.6 байта в 4-битной.
- KV-кэш: растёт с длиной контекста и с каждым одновременным пользователем. Около 1 ГБ на 8K токенов для Llama 3.1 8B и около 2.7 ГБ для модели Llama 70B.
- Запас: оставляйте 10–20% памяти свободными для среды выполнения, активаций и буферов.
- Скорость: генерацию ограничивает пропускная способность памяти, поэтому GPU с более быстрой памятью выдаёт токены быстрее даже при одинаковом объёме.
- Практические ориентиры: RTX 4090 на 24 ГБ запускает модель 8B в полной точности; модели 70B в 4-битной точности нужно около 50 ГБ, то есть один GPU на 80 ГБ или две карты по 32 ГБ.

Чтобы запустить большую языковую модель, нужно достаточно видеопамяти для её весов (число параметров, умноженное на размер веса в байтах), плюс KV-кэш под длину вашего контекста, плюс запас 10–20%. Модели 8B для весов нужно около 16 ГБ в FP16, около 8.5 ГБ в 8-битной точности и около 5 ГБ в 4-битной. Модели 70B — около 140 ГБ, 75 ГБ и 43 ГБ соответственно, без учёта кэша.

В этом руководстве разобрано каждое слагаемое этой суммы, приведена таблица для распространённых размеров моделей и показано, каким реальным GPU они соответствуют — от RTX A4000 на 16 ГБ до сервера с четырьмя H100.

## Формула: веса, кэш и запас

### 1. Веса: число параметров, умноженное на размер веса в байтах

Каждый параметр хранится как число, и его размер определяется точностью. Пример от самой NVIDIA: модель на 7 миллиардов параметров, загруженная в 16-битной точности, [занимает примерно 14 ГБ](https://developer.nvidia.com/blog/mastering-llm-techniques-inference-optimization/). Квантование уменьшает этот объём ещё сильнее:

| Точность | Байт на вес | Примечания |
| --- | --- | --- |
| FP32 | 4 | Мастер-копия весов при обучении; для инференса используется редко |
| FP16 или BF16 | 2 | Обычная «полная точность» для инференса |
| 8 бит (INT8, FP8, Q8) | Около 1 | Почти без потерь для большинства моделей |
| 4 бит (INT4, Q4, MXFP4) | 0.5 в теории, 0.55–0.6 на практике | Масштабные коэффициенты и метаданные немного добавляют сверху |

Реальные файлы подтверждают это правило. По собственным измерениям llama.cpp для Llama 3.1 8B, [файл F16 занимает 14.96 ГиБ, Q8_0 — 7.95 ГиБ, а Q4_K_M — 4.58 ГиБ](https://github.com/ggml-org/llama.cpp/blob/master/tools/quantize/README.md), что для популярного 4-битного формата даёт около 4.9 бита на вес.

### 2. KV-кэш: память, которую занимает ваш контекст

Во время генерации модель хранит ключи и значения всех предыдущих токенов для каждого слоя. Размер на один токен NVIDIA рассчитывает как `2 × layers × (heads × head dimension) × bytes per value`. Современные модели используют внимание с группировкой запросов (grouped-query attention), поэтому значение имеет число голов ключей/значений, которое намного меньше числа голов внимания. Например, у Llama 3 8B 32 слоя и [8 голов ключей/значений](https://arxiv.org/abs/2407.21783) размерностью 128:

```
2 × 32 layers × 8 KV heads × 128 × 2 bytes = 131,072 bytes (128 KiB) per token
```

| Модель | KV-кэш на токен (FP16) | Контекст 8K | Контекст 32K | Контекст 128K |
| --- | --- | --- | --- | --- |
| Llama 3.1 8B | 128 КиБ | 1.1 ГБ | 4.3 ГБ | 17.2 ГБ |
| Qwen3-14B | 160 КиБ | 1.3 ГБ | 5.4 ГБ | Нужно расширение контекста |
| Qwen3-32B | 256 КиБ | 2.1 ГБ | 8.6 ГБ | Нужно расширение контекста |
| Llama 3.3 70B | 320 КиБ | 2.7 ГБ | 10.7 ГБ | 42.9 ГБ |

Цифры для Qwen3 основаны на опубликованных конфигурациях моделей ([14B](https://huggingface.co/Qwen/Qwen3-14B/blob/main/config.json): 40 слоёв; [32B](https://huggingface.co/Qwen/Qwen3-32B/blob/main/config.json): 64 слоя; у обеих 8 KV-голов; конфигурация по умолчанию допускает 40 960 позиций, поэтому для 128K нужно расширение контекста). На практике важны два следствия. Кэш рассчитывается на каждую последовательность, поэтому десяти одновременным пользователям с контекстом 8K нужно в десять раз больше, чем указано выше. Кроме того, длинный контекст может перерасти сами веса: 4-битной модели 8B при полном контексте 128K нужно больше памяти для кэша, чем для самой модели. Ряд движков инференса умеет хранить кэш в 8-битном формате, что вдвое уменьшает его ценой небольшой потери качества.

### 3. Запас для среды выполнения

Место занимают контекст CUDA, активации, временные буферы и фрагментация памяти. Закладывайте 10–20% сверх объёма весов и кэша. Кроме того, некоторые движки для обслуживания моделей сразу при запуске резервируют под кэш большую часть свободной памяти, поэтому показатель «использовано» в инструментах мониторинга мало говорит о том, сколько на самом деле нужно модели.

## Объём видеопамяти по размеру модели

В таблице сложены веса, контекст 8K токенов для одного пользователя и запас 10%. Считайте эти цифры ориентиром для планирования: форматы квантования различаются на несколько процентов, а для более длинного контекста или большего числа пользователей нужно больше памяти.

| Класс модели (пример) | FP16 или BF16 | 8 бит | 4 бит |
| --- | --- | --- | --- |
| От 7B до 8B (Llama 3.1 8B) | Около 19 ГБ | Около 11 ГБ | Около 7 ГБ |
| От 13B до 14B (Qwen3-14B) | Около 32 ГБ | Около 18 ГБ | Около 11 ГБ |
| 32B (Qwen3-32B) | Около 73 ГБ | Около 40 ГБ | Около 24 ГБ |
| 70B (Llama 3.3 70B) | Около 157 ГБ | Около 85 ГБ | Около 50 ГБ |
| Плотные модели класса 120B ([Mistral Large 2, 123B](https://mistral.ai/news/mistral-large-2407/)) | Около 274 ГБ | Около 147 ГБ | Около 86 ГБ |
| Модели класса 120B со смесью экспертов ([gpt-oss-120b](https://huggingface.co/openai/gpt-oss-120b)) | Неприменимо | Неприменимо | Помещается в один GPU на 80 ГБ (нативный MXFP4) |

Модели со смесью экспертов (MoE) нарушают простую связь между размером и памятью только в одном направлении. У gpt-oss-120b 117 миллиардов параметров, но на каждый токен активируется лишь 5.1 миллиарда; веса её экспертов поставляются в 4-битном формате MXFP4, поэтому OpenAI и заявляет, что модель работает на одном GPU с 80 ГБ. При этом все эксперты всё равно должны находиться в памяти, так что требуемый объём определяется общим размером, а скорость — активными параметрами.

## Какие GPU подходят

Объёмы памяти и пропускная способность взяты из спецификаций NVIDIA: [RTX A4000](https://www.nvidia.com/content/dam/en-zz/Solutions/gtcs21/rtx-a4000/nvidia-rtx-a4000-datasheet.pdf), [RTX 4090 и RTX 5090](https://images.nvidia.com/aem-dam/Solutions/geforce/blackwell/nvidia-rtx-blackwell-gpu-architecture.pdf), [RTX 6000 Ada](https://www.nvidia.com/content/dam/en-zz/Solutions/design-visualization/rtx-6000/proviz-print-rtx6000-datasheet-web-2504660.pdf), [L40S](https://www.nvidia.com/en-us/data-center/l40s/), [A100](https://www.nvidia.com/en-us/data-center/a100/) и [H100](https://www.nvidia.com/en-us/data-center/h100/). Цены — наши ежемесячные цены на выделенный GPU-сервер.

| GPU | VRAM | Пропускная способность памяти | Комфортно помещаются (контекст 8K) | OffshoreServ, в месяц |
| --- | --- | --- | --- | --- |
| RTX A4000 | 16 ГБ GDDR6 | 448 ГБ/с | 8B в 8-битной точности, 14B в 4-битной | $61.99 |
| RTX 4090 | 24 ГБ GDDR6X | 1 008 ГБ/с | 8B в FP16, 14B в 8-битной точности | $84.99 |
| RTX 5090 | 32 ГБ GDDR7 | 1 792 ГБ/с | 32B в 4-битной точности, 14B в 8-битной с длинным контекстом | $134.99 |
| RTX 6000 Ada | 48 ГБ GDDR6 | 960 ГБ/с | 32B в 8-битной точности, 14B в FP16 | $306.99 |
| L40S | 48 ГБ GDDR6 | 864 ГБ/с | 32B в 8-битной точности, 14B в FP16 | $418.99 |
| A100 80 GB | 80 ГБ HBM2e | 1 935–2 039 ГБ/с (PCIe или SXM) | 70B в 4-битной точности, gpt-oss-120b, 32B в FP16 (впритык) | $355.99 |
| H100 80 ГБ SXM5 | 80 ГБ HBM3 | 3.35 ТБ/с | Те же модели, что и на A100, но быстрее | $581.99 |
| 2 × RTX 5090 | 64 ГБ в сумме | 1 792 ГБ/с на карту | 70B в 4-битной точности, распределённая между двумя картами | $558.99 |
| 2 × H100 | 160 ГБ в сумме | 3.35 ТБ/с на карту | 70B в 8-битной точности, 123B в 8-битной (впритык) | $1,096.99 |
| 4 × H100 | 320 ГБ в сумме | 3.35 ТБ/с на карту | 70B и 123B в FP16 | $2,348.99 |

Стоит знать о двух пограничных случаях. Модели 32B в 4-битной точности нужно около 24 ГБ, и на RTX 4090 с 24 ГБ при росте контекста места уже не остаётся, поэтому для моделей такого размера RTX 5090 — более надёжный вариант среди одиночных потребительских карт. Модели 70B в 4-битной точности нужно около 50 ГБ — чуть больше, чем есть у карты на 48 ГБ, поэтому рассчитывайте на 80 ГБ или два GPU.

## Скорость: темп задаёт пропускная способность памяти

Генерация токена, по словам NVIDIA, — [операция, ограниченная пропускной способностью памяти](https://developer.nvidia.com/blog/mastering-llm-techniques-inference-optimization/): основное время уходит на перемещение весов и кэша из памяти, а не на вычисления. Для плотной модели, обслуживающей одного пользователя, каждый новый токен требует однократного чтения всех весов, что задаёт жёсткий потолок:

```
maximum tokens per second ≈ memory bandwidth ÷ size of the weights
```

| Модель и точность | Веса | GPU | Теоретический потолок |
| --- | --- | --- | --- |
| 8B в 4-битной точности | 4.9 ГБ | RTX 4090 | Около 205 токенов/с |
| 32B в 4-битной точности | 19.6 ГБ | RTX 5090 | Около 90 токенов/с |
| 70B в 4-битной точности | 42.9 ГБ | A100 80 ГБ (SXM) | Около 48 токенов/с |
| 70B в 4-битной точности | 42.9 ГБ | H100 SXM5 | Около 78 токенов/с |

Реальные показатели для одного пользователя заметно ниже этих потолков, потому что ядра (kernels) никогда не работают с идеальной эффективностью, а кэш тоже нужно читать. Но соотношение сохраняется, и оно объясняет, почему RTX 6000 Ada с 48 ГБ, но лишь 960 ГБ/с, как правило, генерирует медленнее, чем RTX 5090, на модели, которая помещается в память обеих карт.

Картину меняют три эффекта. Модели со смесью экспертов на каждом токене читают только активных экспертов, поэтому gpt-oss-120b генерирует гораздо быстрее, чем генерировала бы плотная модель на 120B. Обработка длинного промпта (так называемый prefill) ограничена вычислительной мощностью, а не пропускной способностью, что даёт преимущество GPU с более высокой производительностью тензорных ядер. Наконец, при пакетной обработке запросов многих пользователей каждое чтение весов распределяется между запросами, поэтому суммарная производительность растёт с числом одновременных запросов, а кэш каждого пользователя увеличивает расход памяти.

## Разделение модели между несколькими GPU

Если модель не помещается на одну карту, движки инференса могут её разделить: по слоям между GPU или разрезая каждый слой между GPU (тензорный параллелизм). Две карты — это не одна карта с удвоенной памятью. Каждому GPU нужны собственные накладные расходы среды выполнения, а карты обмениваются данными на каждом шаге.

Поэтому важна связь между картами. Согласно спецификациям NVIDIA, у RTX 4090, RTX 5090, RTX 6000 Ada и L40S нет NVLink, так что они обмениваются данными через PCIe. H100 SXM поддерживает NVLink со скоростью до 900 ГБ/с. Для 4-битной модели 70B, разделённой между двумя RTX 5090, PCIe вполне подходит; для крупных развёртываний с тензорным параллелизмом проверьте межсоединение конкретного сервера, прежде чем строить на нём планы.

## Дообучению нужно гораздо больше памяти

Всё сказанное выше относится к инференсу. Полное дообучение — совсем другой масштаб: при обучении со смешанной точностью и оптимизатором Adam веса, градиенты и состояния оптимизатора занимают [16 байт на параметр](https://arxiv.org/abs/1910.02054) без учёта активаций, поэтому модели 8B нужно около 128 ГБ. Параметрически эффективные методы меняют ситуацию: авторы QLoRA [дообучили модель 65B на одном GPU с 48 ГБ](https://arxiv.org/abs/2305.14314), обучая небольшие адаптеры поверх замороженной 4-битной модели.

## Как проверить конкретную модель за пять минут

1. **Посмотрите на файлы весов.** Размер загрузки именно той квантованной версии, которую вы планируете запускать, — лучшая оценка объёма весов в памяти.
2. **Откройте `config.json` модели.** Выпишите `num_hidden_layers`, `num_key_value_heads` и `head_dim` (или размер скрытого слоя, делённый на число голов внимания).
3. **Рассчитайте кэш на токен** по формуле выше, затем умножьте на самый длинный ожидаемый контекст и на число пользователей, которых вы будете обслуживать одновременно.
4. **Добавьте 10–20%** и сравните с объёмом видеопамяти карты. Если результат отличается от предела всего на несколько процентов, возьмите карту на размер больше или квантование с меньшей разрядностью.
5. **Протестируйте на реальных промптах.** Прогоните самый длинный документ, который планируете обрабатывать, и следите за памятью во время генерации.

## Быстрый выбор

- **Чат-ассистент или помощник для программирования на модели 8B:** [RTX 4090](https://offshoreserv.com/ru/offshore-gpu-servers/rtx-4090) в полной точности или RTX A4000 в 8-битной.
- **Модель 14B и длинные документы:** [RTX 5090](https://offshoreserv.com/ru/offshore-gpu-servers/rtx-5090) в 8-битной точности.
- **Модель 32B:** RTX 5090 в 4-битной точности или, ради лучшего качества, карта на 48 ГБ в 8-битной.
- **Модель 70B:** [A100](https://offshoreserv.com/ru/offshore-gpu-servers/a100) или [H100](https://offshoreserv.com/ru/offshore-gpu-servers/h100) в 4-битной точности; две H100 — в 8-битной.
- **Класс 120B:** один GPU на 80 ГБ для gpt-oss-120b; от двух до четырёх H100 для плотных моделей, таких как Mistral Large 2.
- **Много одновременных пользователей:** сначала рассчитайте KV-кэш, затем выберите GPU с максимальной пропускной способностью, которую позволяет бюджет.

## Запуск вашей модели в OffshoreServ

Наши [GPU-серверы](https://offshoreserv.com/ru/offshore-gpu-servers) — это выделенные GPU NVIDIA, от RTX A4000 до узлов с четырьмя H100. [Линейка RTX](https://offshoreserv.com/ru/offshore-gpu-servers/rtx) покрывает большинство задач с моделями от 8B до 32B, [линейка для дата-центров](https://offshoreserv.com/ru/offshore-gpu-servers/datacenter) добавляет карты на 48 ГБ и 80 ГБ, а [серверы с несколькими GPU](https://offshoreserv.com/ru/offshore-gpu-servers/multi-gpu) справляются с моделями 70B в более высокой точности и с плотными моделями класса 120B. Драйверы CUDA предустановлены в наших Linux-образах, которые описаны в [документации по образам для GPU](https://offshoreserv.com/ru/docs/gpu/images). Серверы готовы через 1–24 часа в Молдове, Нидерландах, Исландии или Румынии в зависимости от модели и оплачиваются криптовалютой без проверки личности.

## Часто задаваемые вопросы

### Можно ли запустить модель 70B на GPU с 24 ГБ?

Не с приемлемой скоростью. В 4-битной точности одни только веса модели 70B занимают около 40 ГБ, поэтому на карте с 24 ГБ большинство слоёв оказалось бы в системной оперативной памяти, и генерация еле ползла бы. Используйте две RTX 5090, карту на 48 ГБ или A100 либо H100 на 80 ГБ.

### Сколько видеопамяти нужно модели 8B?

Для весов — около 16 ГБ в 16-битной точности, 9 ГБ в 8-битной и 5 ГБ в 4-битной, плюс KV-кэш для вашего контекста. Карта на 24 ГБ запускает модель 8B в полной точности с запасом для длинного контекста.

### Как запустить модель, когда GPU уже есть?

Ollama — самый быстрый способ начать, а vLLM обслуживает OpenAI-совместимый API под нагрузкой. В нашем руководстве [по запуску LLM на собственном GPU-сервере](https://offshoreserv.com/ru/blog/self-host-llm-gpu-server) разобраны оба варианта, в том числе то, как закрыть эндпоинт от посторонних.

### Арендовать GPU помесячно или почасово?

Помесячно, если GPU загружен большую часть дней, почасово — для коротких экспериментов. Чтобы найти точку безубыточности, разделите месячную цену на почасовую ставку, которую вы платили бы в другом месте: расчёты приведены в статье [«Выделенный GPU или облачный»](https://offshoreserv.com/ru/blog/dedicated-gpu-vs-cloud-gpu).

**Размещайте проекты там, где закон на вашей стороне**

Офшорные VPS, выделенные, RDP- и GPU-серверы в семи юрисдикциях. Без KYC, оплата криптовалютой.

## Ещё из блога

- [ИИ и GPU Выделенный GPU-сервер или облачный GPU: стоимость, конфиденциальность и скорость Помесячно или почасово? Как найти точку безубыточности между выделенным GPU-сервером и облачным GPU и что меняется с точки зрения доступности, скорости и конфиденциальности.26 сентября 2026 г.8 мин чтения](https://offshoreserv.com/ru/blog/dedicated-gpu-vs-cloud-gpu)
- [ИИ и GPU Как запустить LLM на собственном GPU-сервере (Ollama, vLLM) От пустого GPU-сервера до приватного API, совместимого с OpenAI: какую карту арендовать, настройка Ollama и vLLM, TLS и ключи, тесты производительности, конфиденциальность и стоимость.26 сентября 2026 г.10 мин чтения](https://offshoreserv.com/ru/blog/self-host-llm-gpu-server)
- [Право и юрисдикции Страны «5, 9 и 14 глаз»: что это значит для хостинга Какие страны входят в альянсы «Пять глаз», «Девять глаз» и «14 глаз», что из этого официально, а что известно из утечек, и что членство на самом деле означает для сервера в каждой из наших семи локаций.26 сентября 2026 г.8 мин чтения](https://offshoreserv.com/ru/blog/14-eyes-countries-hosting)

---

OffshoreServ — офшорный хостинг-провайдер: VPS, выделенные серверы, Windows RDP и GPU-серверы в семи юрисдикциях (Исландия, Швейцария, Молдова, Румыния, Нидерланды, Болгария и Малайзия), оплата только криптовалютой (Bitcoin, Ethereum, Monero, Tether (USDT) и Solana), без проверки личности (без KYC).

Prices and plans: https://offshoreserv.com/ru/pricing · Answers: https://offshoreserv.com/ru/faq · Every page: https://offshoreserv.com/llms.txt
