На этой странице
- Формула: веса, кэш и запас
- Объём видеопамяти по размеру модели
- Какие GPU подходят
- Скорость: темп задаёт пропускная способность памяти
- Разделение модели между несколькими GPU
- Дообучению нужно гораздо больше памяти
- Как проверить конкретную модель за пять минут
- Быстрый выбор
- Запуск вашей модели в OffshoreServ
- Часто задаваемые вопросы

Чтобы запустить большую языковую модель, нужно достаточно видеопамяти для её весов (число параметров, умноженное на размер веса в байтах), плюс KV-кэш под длину вашего контекста, плюс запас 10–20%. Модели 8B для весов нужно около 16 ГБ в FP16, около 8.5 ГБ в 8-битной точности и около 5 ГБ в 4-битной. Модели 70B — около 140 ГБ, 75 ГБ и 43 ГБ соответственно, без учёта кэша.
В этом руководстве разобрано каждое слагаемое этой суммы, приведена таблица для распространённых размеров моделей и показано, каким реальным GPU они соответствуют — от
Формула: веса, кэш и запас
1. Веса: число параметров, умноженное на размер веса в байтах
Каждый параметр хранится как число, и его размер определяется точностью. Пример от самой NVIDIA: модель на 7 миллиардов параметров, загруженная в 16-битной точности, занимает примерно 14 ГБ. Квантование уменьшает этот объём ещё сильнее:
| Точность | Байт на вес | Примечания |
|---|---|---|
| FP32 | 4 | Мастер-копия весов при обучении; для инференса используется редко |
| FP16 или BF16 | 2 | Обычная «полная точность» для инференса |
| 8 бит (INT8, FP8, Q8) | Около 1 | Почти без потерь для большинства моделей |
| 4 бит (INT4, Q4, MXFP4) | 0.5 в теории, 0.55–0.6 на практике | Масштабные коэффициенты и метаданные немного добавляют сверху |
Реальные файлы подтверждают это правило. По собственным измерениям llama.cpp для
2. KV-кэш: память, которую занимает ваш контекст
Во время генерации модель хранит ключи и значения всех предыдущих токенов для каждого слоя. Размер на один токен NVIDIA рассчитывает как 2 × layers × (heads × head dimension) × bytes per value. Современные модели используют внимание с группировкой запросов (
2 × 32 layers × 8 KV heads × 128 × 2 bytes = 131,072 bytes (128 KiB) per token
| Модель | KV-кэш на токен (FP16) | Контекст 8K | Контекст 32K | Контекст 128K |
|---|---|---|---|---|
| 128 КиБ | 1.1 ГБ | 4.3 ГБ | 17.2 ГБ | |
| 160 КиБ | 1.3 ГБ | 5.4 ГБ | Нужно расширение контекста | |
| 256 КиБ | 2.1 ГБ | 8.6 ГБ | Нужно расширение контекста | |
| 320 КиБ | 2.7 ГБ | 10.7 ГБ | 42.9 ГБ |
Цифры для Qwen3 основаны на опубликованных конфигурациях моделей (14B: 40 слоёв; 32B: 64 слоя; у обеих 8 KV-голов; конфигурация по умолчанию допускает 40 960 позиций, поэтому для 128K нужно расширение контекста). На практике важны два следствия. Кэш рассчитывается на каждую последовательность, поэтому десяти одновременным пользователям с контекстом 8K нужно в десять раз больше, чем указано выше. Кроме того, длинный контекст может перерасти сами веса: 4-битной модели 8B при полном контексте 128K нужно больше памяти для кэша, чем для самой модели. Ряд движков инференса умеет хранить кэш в 8-битном формате, что вдвое уменьшает его ценой небольшой потери качества.
3. Запас для среды выполнения
Место занимают контекст CUDA, активации, временные буферы и фрагментация памяти. Закладывайте 10–20% сверх объёма весов и кэша. Кроме того, некоторые движки для обслуживания моделей сразу при запуске резервируют под кэш большую часть свободной памяти, поэтому показатель «использовано» в инструментах мониторинга мало говорит о том, сколько на самом деле нужно модели.
Объём видеопамяти по размеру модели
В таблице сложены веса, контекст 8K токенов для одного пользователя и запас 10%. Считайте эти цифры ориентиром для планирования: форматы квантования различаются на несколько процентов, а для более длинного контекста или большего числа пользователей нужно больше памяти.
| Класс модели (пример) | FP16 или BF16 | 8 бит | 4 бит |
|---|---|---|---|
| От 7B до 8B ( | Около 19 ГБ | Около 11 ГБ | Около 7 ГБ |
| От 13B до 14B ( | Около 32 ГБ | Около 18 ГБ | Около 11 ГБ |
| 32B ( | Около 73 ГБ | Около 40 ГБ | Около 24 ГБ |
| 70B ( | Около 157 ГБ | Около 85 ГБ | Около 50 ГБ |
| Плотные модели класса 120B (Mistral Large 2, 123B) | Около 274 ГБ | Около 147 ГБ | Около 86 ГБ |
| Модели класса 120B со смесью экспертов ( | Неприменимо | Неприменимо | Помещается в один GPU на 80 ГБ (нативный MXFP4) |
Модели со смесью экспертов (MoE) нарушают простую связь между размером и памятью только в одном направлении. У
Какие GPU подходят
Объёмы памяти и пропускная способность взяты из спецификаций NVIDIA:
| GPU | VRAM | Пропускная способность памяти | Комфортно помещаются (контекст 8K) | OffshoreServ, в месяц |
|---|---|---|---|---|
| 16 ГБ GDDR6 | 448 ГБ/с | 8B в 8-битной точности, 14B в 4-битной | $61.99 | |
| 24 ГБ GDDR6X | 1 008 ГБ/с | 8B в FP16, 14B в 8-битной точности | $84.99 | |
| 32 ГБ GDDR7 | 1 792 ГБ/с | 32B в 4-битной точности, 14B в 8-битной с длинным контекстом | $134.99 | |
| 48 ГБ GDDR6 | 960 ГБ/с | 32B в 8-битной точности, 14B в FP16 | $306.99 | |
| L40S | 48 ГБ GDDR6 | 864 ГБ/с | 32B в 8-битной точности, 14B в FP16 | $418.99 |
| 80 ГБ HBM2e | 1 935–2 039 ГБ/с (PCIe или SXM) | 70B в 4-битной точности, | $355.99 | |
| H100 80 ГБ SXM5 | 80 ГБ HBM3 | 3.35 ТБ/с | Те же модели, что и на A100, но быстрее | $581.99 |
| 64 ГБ в сумме | 1 792 ГБ/с на карту | 70B в 4-битной точности, распределённая между двумя картами | $558.99 | |
| 160 ГБ в сумме | 3.35 ТБ/с на карту | 70B в 8-битной точности, 123B в 8-битной (впритык) | $1,096.99 | |
| 320 ГБ в сумме | 3.35 ТБ/с на карту | 70B и 123B в FP16 | $2,348.99 |
Стоит знать о двух пограничных случаях. Модели 32B в 4-битной точности нужно около 24 ГБ, и на
Скорость: темп задаёт пропускная способность памяти
Генерация токена, по словам NVIDIA, — операция, ограниченная пропускной способностью памяти: основное время уходит на перемещение весов и кэша из памяти, а не на вычисления. Для плотной модели, обслуживающей одного пользователя, каждый новый токен требует однократного чтения всех весов, что задаёт жёсткий потолок:
maximum tokens per second ≈ memory bandwidth ÷ size of the weights
| Модель и точность | Веса | GPU | Теоретический потолок |
|---|---|---|---|
| 8B в 4-битной точности | 4.9 ГБ | Около 205 токенов/с | |
| 32B в 4-битной точности | 19.6 ГБ | Около 90 токенов/с | |
| 70B в 4-битной точности | 42.9 ГБ | A100 80 ГБ (SXM) | Около 48 токенов/с |
| 70B в 4-битной точности | 42.9 ГБ | H100 SXM5 | Около 78 токенов/с |
Реальные показатели для одного пользователя заметно ниже этих потолков, потому что ядра (kernels) никогда не работают с идеальной эффективностью, а кэш тоже нужно читать. Но соотношение сохраняется, и оно объясняет, почему
Картину меняют три эффекта. Модели со смесью экспертов на каждом токене читают только активных экспертов, поэтому
Разделение модели между несколькими GPU
Если модель не помещается на одну карту, движки инференса могут её разделить: по слоям между GPU или разрезая каждый слой между GPU (тензорный параллелизм). Две карты — это не одна карта с удвоенной памятью. Каждому GPU нужны собственные накладные расходы среды выполнения, а карты обмениваются данными на каждом шаге.
Поэтому важна связь между картами. Согласно спецификациям NVIDIA, у
Дообучению нужно гораздо больше памяти
Всё сказанное выше относится к инференсу. Полное дообучение — совсем другой масштаб: при обучении со смешанной точностью и оптимизатором Adam веса, градиенты и состояния оптимизатора занимают 16 байт на параметр без учёта активаций, поэтому модели 8B нужно около 128 ГБ. Параметрически эффективные методы меняют ситуацию: авторы QLoRA дообучили модель 65B на одном GPU с 48 ГБ, обучая небольшие адаптеры поверх замороженной 4-битной модели.
Как проверить конкретную модель за пять минут
- Посмотрите на файлы весов. Размер загрузки именно той квантованной версии, которую вы планируете запускать, — лучшая оценка объёма весов в памяти.
- Откройте
модели. Выпишитеconfig.json ,num_hidden_layers иnum_key_value_heads (или размер скрытого слоя, делённый на число голов внимания).head_dim - Рассчитайте кэш на токен по формуле выше, затем умножьте на самый длинный ожидаемый контекст и на число пользователей, которых вы будете обслуживать одновременно.
- Добавьте 10–20% и сравните с объёмом видеопамяти карты. Если результат отличается от предела всего на несколько процентов, возьмите карту на размер больше или квантование с меньшей разрядностью.
- Протестируйте на реальных промптах. Прогоните самый длинный документ, который планируете обрабатывать, и следите за памятью во время генерации.
Быстрый выбор
- Чат-ассистент или помощник для программирования на модели 8B:
RTX 4090 в полной точности илиRTX A4000 в 8-битной. - Модель 14B и длинные документы:
RTX 5090 в 8-битной точности. - Модель 32B:
RTX 5090 в 4-битной точности или, ради лучшего качества, карта на 48 ГБ в 8-битной. - Модель 70B: A100 или H100 в 4-битной точности; две H100 — в 8-битной.
- Класс 120B: один GPU на 80 ГБ для
gpt-oss-120b ; от двух до четырёх H100 для плотных моделей, таких как Mistral Large 2. - Много одновременных пользователей: сначала рассчитайте KV-кэш, затем выберите GPU с максимальной пропускной способностью, которую позволяет бюджет.
Запуск вашей модели в OffshoreServ
Наши GPU-серверы — это выделенные GPU NVIDIA, от
Часто задаваемые вопросы
Можно ли запустить модель 70B на GPU с 24 ГБ?
Не с приемлемой скоростью. В 4-битной точности одни только веса модели 70B занимают около 40 ГБ, поэтому на карте с 24 ГБ большинство слоёв оказалось бы в системной оперативной памяти, и генерация еле ползла бы. Используйте две
Сколько видеопамяти нужно модели 8B?
Для весов — около 16 ГБ в 16-битной точности, 9 ГБ в 8-битной и 5 ГБ в 4-битной, плюс KV-кэш для вашего контекста. Карта на 24 ГБ запускает модель 8B в полной точности с запасом для длинного контекста.
Как запустить модель, когда GPU уже есть?
Ollama — самый быстрый способ начать, а vLLM обслуживает OpenAI-совместимый API под нагрузкой. В нашем руководстве по запуску LLM на собственном GPU-сервере разобраны оба варианта, в том числе то, как закрыть эндпоинт от посторонних.
Арендовать GPU помесячно или почасово?
Помесячно, если GPU загружен большую часть дней, почасово — для коротких экспериментов. Чтобы найти точку безубыточности, разделите месячную цену на почасовую ставку, которую вы платили бы в другом месте: расчёты приведены в статье «Выделенный GPU или облачный».
Офшорные VPS, выделенные, RDP- и GPU-серверы в семи юрисдикциях. Без KYC, оплата криптовалютой.


