Стартовые цены: все тарифы на 30% дешевле самого дешёвого конкурента. Сравнение ценКаждый тариф на 30% дешевле самого дешёвого офшорного хостера

ИИ и GPU

Сколько видеопамяти нужно для запуска LLM? (руководство 2026 года)

Практический способ рассчитать объём видеопамяти для больших языковых моделей: веса в зависимости от точности, KV-кэш для контекста, запас и какие GPU подходят для моделей от 8 до 120 млрд параметров.

9 мин чтенияОт команды OffshoreServ

Главное

  • Веса: число параметров, умноженное на размер веса в байтах. 2 байта в FP16 или BF16, около 1 байта в 8-битной точности, около 0.5–0.6 байта в 4-битной.
  • KV-кэш: растёт с длиной контекста и с каждым одновременным пользователем. Около 1 ГБ на 8K токенов для Llama 3.1 8B и около 2.7 ГБ для модели Llama 70B.
  • Запас: оставляйте 10–20% памяти свободными для среды выполнения, активаций и буферов.
  • Скорость: генерацию ограничивает пропускная способность памяти, поэтому GPU с более быстрой памятью выдаёт токены быстрее даже при одинаковом объёме.
  • Практические ориентиры: RTX 4090 на 24 ГБ запускает модель 8B в полной точности; модели 70B в 4-битной точности нужно около 50 ГБ, то есть один GPU на 80 ГБ или две карты по 32 ГБ.
На этой странице
  1. Формула: веса, кэш и запас
  2. Объём видеопамяти по размеру модели
  3. Какие GPU подходят
  4. Скорость: темп задаёт пропускная способность памяти
  5. Разделение модели между несколькими GPU
  6. Дообучению нужно гораздо больше памяти
  7. Как проверить конкретную модель за пять минут
  8. Быстрый выбор
  9. Запуск вашей модели в OffshoreServ
  10. Часто задаваемые вопросы

Чтобы запустить большую языковую модель, нужно достаточно видеопамяти для её весов (число параметров, умноженное на размер веса в байтах), плюс KV-кэш под длину вашего контекста, плюс запас 10–20%. Модели 8B для весов нужно около 16 ГБ в FP16, около 8.5 ГБ в 8-битной точности и около 5 ГБ в 4-битной. Модели 70B — около 140 ГБ, 75 ГБ и 43 ГБ соответственно, без учёта кэша.

В этом руководстве разобрано каждое слагаемое этой суммы, приведена таблица для распространённых размеров моделей и показано, каким реальным GPU они соответствуют — от RTX A4000 на 16 ГБ до сервера с четырьмя H100.

Формула: веса, кэш и запас

1. Веса: число параметров, умноженное на размер веса в байтах

Каждый параметр хранится как число, и его размер определяется точностью. Пример от самой NVIDIA: модель на 7 миллиардов параметров, загруженная в 16-битной точности, занимает примерно 14 ГБ. Квантование уменьшает этот объём ещё сильнее:

ТочностьБайт на весПримечания
FP324Мастер-копия весов при обучении; для инференса используется редко
FP16 или BF162Обычная «полная точность» для инференса
8 бит (INT8, FP8, Q8)Около 1Почти без потерь для большинства моделей
4 бит (INT4, Q4, MXFP4)0.5 в теории, 0.55–0.6 на практикеМасштабные коэффициенты и метаданные немного добавляют сверху

Реальные файлы подтверждают это правило. По собственным измерениям llama.cpp для Llama 3.1 8B, файл F16 занимает 14.96 ГиБ, Q8_0 — 7.95 ГиБ, а Q4_K_M — 4.58 ГиБ, что для популярного 4-битного формата даёт около 4.9 бита на вес.

2. KV-кэш: память, которую занимает ваш контекст

Во время генерации модель хранит ключи и значения всех предыдущих токенов для каждого слоя. Размер на один токен NVIDIA рассчитывает как 2 × layers × (heads × head dimension) × bytes per value. Современные модели используют внимание с группировкой запросов (grouped-query attention), поэтому значение имеет число голов ключей/значений, которое намного меньше числа голов внимания. Например, у Llama 3 8B 32 слоя и 8 голов ключей/значений размерностью 128:

2 × 32 layers × 8 KV heads × 128 × 2 bytes = 131,072 bytes (128 KiB) per token
МодельKV-кэш на токен (FP16)Контекст 8KКонтекст 32KКонтекст 128K
Llama 3.1 8B128 КиБ1.1 ГБ4.3 ГБ17.2 ГБ
Qwen3-14B160 КиБ1.3 ГБ5.4 ГБНужно расширение контекста
Qwen3-32B256 КиБ2.1 ГБ8.6 ГБНужно расширение контекста
Llama 3.3 70B320 КиБ2.7 ГБ10.7 ГБ42.9 ГБ

Цифры для Qwen3 основаны на опубликованных конфигурациях моделей (14B: 40 слоёв; 32B: 64 слоя; у обеих 8 KV-голов; конфигурация по умолчанию допускает 40 960 позиций, поэтому для 128K нужно расширение контекста). На практике важны два следствия. Кэш рассчитывается на каждую последовательность, поэтому десяти одновременным пользователям с контекстом 8K нужно в десять раз больше, чем указано выше. Кроме того, длинный контекст может перерасти сами веса: 4-битной модели 8B при полном контексте 128K нужно больше памяти для кэша, чем для самой модели. Ряд движков инференса умеет хранить кэш в 8-битном формате, что вдвое уменьшает его ценой небольшой потери качества.

3. Запас для среды выполнения

Место занимают контекст CUDA, активации, временные буферы и фрагментация памяти. Закладывайте 10–20% сверх объёма весов и кэша. Кроме того, некоторые движки для обслуживания моделей сразу при запуске резервируют под кэш большую часть свободной памяти, поэтому показатель «использовано» в инструментах мониторинга мало говорит о том, сколько на самом деле нужно модели.

Объём видеопамяти по размеру модели

В таблице сложены веса, контекст 8K токенов для одного пользователя и запас 10%. Считайте эти цифры ориентиром для планирования: форматы квантования различаются на несколько процентов, а для более длинного контекста или большего числа пользователей нужно больше памяти.

Класс модели (пример)FP16 или BF168 бит4 бит
От 7B до 8B (Llama 3.1 8B)Около 19 ГБОколо 11 ГБОколо 7 ГБ
От 13B до 14B (Qwen3-14B)Около 32 ГБОколо 18 ГБОколо 11 ГБ
32B (Qwen3-32B)Около 73 ГБОколо 40 ГБОколо 24 ГБ
70B (Llama 3.3 70B)Около 157 ГБОколо 85 ГБОколо 50 ГБ
Плотные модели класса 120B (Mistral Large 2, 123B)Около 274 ГБОколо 147 ГБОколо 86 ГБ
Модели класса 120B со смесью экспертов (gpt-oss-120b)НеприменимоНеприменимоПомещается в один GPU на 80 ГБ (нативный MXFP4)

Модели со смесью экспертов (MoE) нарушают простую связь между размером и памятью только в одном направлении. У gpt-oss-120b 117 миллиардов параметров, но на каждый токен активируется лишь 5.1 миллиарда; веса её экспертов поставляются в 4-битном формате MXFP4, поэтому OpenAI и заявляет, что модель работает на одном GPU с 80 ГБ. При этом все эксперты всё равно должны находиться в памяти, так что требуемый объём определяется общим размером, а скорость — активными параметрами.

Какие GPU подходят

Объёмы памяти и пропускная способность взяты из спецификаций NVIDIA: RTX A4000, RTX 4090 и RTX 5090, RTX 6000 Ada, L40S, A100 и H100. Цены — наши ежемесячные цены на выделенный GPU-сервер.

GPUVRAMПропускная способность памятиКомфортно помещаются (контекст 8K)OffshoreServ, в месяц
RTX A400016 ГБ GDDR6448 ГБ/с8B в 8-битной точности, 14B в 4-битной$61.99
RTX 409024 ГБ GDDR6X1 008 ГБ/с8B в FP16, 14B в 8-битной точности$84.99
RTX 509032 ГБ GDDR71 792 ГБ/с32B в 4-битной точности, 14B в 8-битной с длинным контекстом$134.99
RTX 6000 Ada48 ГБ GDDR6960 ГБ/с32B в 8-битной точности, 14B в FP16$306.99
L40S48 ГБ GDDR6864 ГБ/с32B в 8-битной точности, 14B в FP16$418.99
A100 80 GB80 ГБ HBM2e1 935–2 039 ГБ/с (PCIe или SXM)70B в 4-битной точности, gpt-oss-120b, 32B в FP16 (впритык)$355.99
H100 80 ГБ SXM580 ГБ HBM33.35 ТБ/сТе же модели, что и на A100, но быстрее$581.99
2 × RTX 509064 ГБ в сумме1 792 ГБ/с на карту70B в 4-битной точности, распределённая между двумя картами$558.99
2 × H100160 ГБ в сумме3.35 ТБ/с на карту70B в 8-битной точности, 123B в 8-битной (впритык)$1,096.99
4 × H100320 ГБ в сумме3.35 ТБ/с на карту70B и 123B в FP16$2,348.99

Стоит знать о двух пограничных случаях. Модели 32B в 4-битной точности нужно около 24 ГБ, и на RTX 4090 с 24 ГБ при росте контекста места уже не остаётся, поэтому для моделей такого размера RTX 5090 — более надёжный вариант среди одиночных потребительских карт. Модели 70B в 4-битной точности нужно около 50 ГБ — чуть больше, чем есть у карты на 48 ГБ, поэтому рассчитывайте на 80 ГБ или два GPU.

Скорость: темп задаёт пропускная способность памяти

Генерация токена, по словам NVIDIA, — операция, ограниченная пропускной способностью памяти: основное время уходит на перемещение весов и кэша из памяти, а не на вычисления. Для плотной модели, обслуживающей одного пользователя, каждый новый токен требует однократного чтения всех весов, что задаёт жёсткий потолок:

maximum tokens per second ≈ memory bandwidth ÷ size of the weights
Модель и точностьВесаGPUТеоретический потолок
8B в 4-битной точности4.9 ГБRTX 4090Около 205 токенов/с
32B в 4-битной точности19.6 ГБRTX 5090Около 90 токенов/с
70B в 4-битной точности42.9 ГБA100 80 ГБ (SXM)Около 48 токенов/с
70B в 4-битной точности42.9 ГБH100 SXM5Около 78 токенов/с

Реальные показатели для одного пользователя заметно ниже этих потолков, потому что ядра (kernels) никогда не работают с идеальной эффективностью, а кэш тоже нужно читать. Но соотношение сохраняется, и оно объясняет, почему RTX 6000 Ada с 48 ГБ, но лишь 960 ГБ/с, как правило, генерирует медленнее, чем RTX 5090, на модели, которая помещается в память обеих карт.

Картину меняют три эффекта. Модели со смесью экспертов на каждом токене читают только активных экспертов, поэтому gpt-oss-120b генерирует гораздо быстрее, чем генерировала бы плотная модель на 120B. Обработка длинного промпта (так называемый prefill) ограничена вычислительной мощностью, а не пропускной способностью, что даёт преимущество GPU с более высокой производительностью тензорных ядер. Наконец, при пакетной обработке запросов многих пользователей каждое чтение весов распределяется между запросами, поэтому суммарная производительность растёт с числом одновременных запросов, а кэш каждого пользователя увеличивает расход памяти.

Разделение модели между несколькими GPU

Если модель не помещается на одну карту, движки инференса могут её разделить: по слоям между GPU или разрезая каждый слой между GPU (тензорный параллелизм). Две карты — это не одна карта с удвоенной памятью. Каждому GPU нужны собственные накладные расходы среды выполнения, а карты обмениваются данными на каждом шаге.

Поэтому важна связь между картами. Согласно спецификациям NVIDIA, у RTX 4090, RTX 5090, RTX 6000 Ada и L40S нет NVLink, так что они обмениваются данными через PCIe. H100 SXM поддерживает NVLink со скоростью до 900 ГБ/с. Для 4-битной модели 70B, разделённой между двумя RTX 5090, PCIe вполне подходит; для крупных развёртываний с тензорным параллелизмом проверьте межсоединение конкретного сервера, прежде чем строить на нём планы.

Дообучению нужно гораздо больше памяти

Всё сказанное выше относится к инференсу. Полное дообучение — совсем другой масштаб: при обучении со смешанной точностью и оптимизатором Adam веса, градиенты и состояния оптимизатора занимают 16 байт на параметр без учёта активаций, поэтому модели 8B нужно около 128 ГБ. Параметрически эффективные методы меняют ситуацию: авторы QLoRA дообучили модель 65B на одном GPU с 48 ГБ, обучая небольшие адаптеры поверх замороженной 4-битной модели.

Как проверить конкретную модель за пять минут

  1. Посмотрите на файлы весов. Размер загрузки именно той квантованной версии, которую вы планируете запускать, — лучшая оценка объёма весов в памяти.
  2. Откройте config.json модели. Выпишите num_hidden_layers, num_key_value_heads и head_dim (или размер скрытого слоя, делённый на число голов внимания).
  3. Рассчитайте кэш на токен по формуле выше, затем умножьте на самый длинный ожидаемый контекст и на число пользователей, которых вы будете обслуживать одновременно.
  4. Добавьте 10–20% и сравните с объёмом видеопамяти карты. Если результат отличается от предела всего на несколько процентов, возьмите карту на размер больше или квантование с меньшей разрядностью.
  5. Протестируйте на реальных промптах. Прогоните самый длинный документ, который планируете обрабатывать, и следите за памятью во время генерации.

Быстрый выбор

  • Чат-ассистент или помощник для программирования на модели 8B: RTX 4090 в полной точности или RTX A4000 в 8-битной.
  • Модель 14B и длинные документы: RTX 5090 в 8-битной точности.
  • Модель 32B: RTX 5090 в 4-битной точности или, ради лучшего качества, карта на 48 ГБ в 8-битной.
  • Модель 70B: A100 или H100 в 4-битной точности; две H100 — в 8-битной.
  • Класс 120B: один GPU на 80 ГБ для gpt-oss-120b; от двух до четырёх H100 для плотных моделей, таких как Mistral Large 2.
  • Много одновременных пользователей: сначала рассчитайте KV-кэш, затем выберите GPU с максимальной пропускной способностью, которую позволяет бюджет.

Запуск вашей модели в OffshoreServ

Наши GPU-серверы — это выделенные GPU NVIDIA, от RTX A4000 до узлов с четырьмя H100. Линейка RTX покрывает большинство задач с моделями от 8B до 32B, линейка для дата-центров добавляет карты на 48 ГБ и 80 ГБ, а серверы с несколькими GPU справляются с моделями 70B в более высокой точности и с плотными моделями класса 120B. Драйверы CUDA предустановлены в наших Linux-образах, которые описаны в документации по образам для GPU. Серверы готовы через 1–24 часа в Молдове, Нидерландах, Исландии или Румынии в зависимости от модели и оплачиваются криптовалютой без проверки личности.

Часто задаваемые вопросы

Можно ли запустить модель 70B на GPU с 24 ГБ?

Не с приемлемой скоростью. В 4-битной точности одни только веса модели 70B занимают около 40 ГБ, поэтому на карте с 24 ГБ большинство слоёв оказалось бы в системной оперативной памяти, и генерация еле ползла бы. Используйте две RTX 5090, карту на 48 ГБ или A100 либо H100 на 80 ГБ.

Сколько видеопамяти нужно модели 8B?

Для весов — около 16 ГБ в 16-битной точности, 9 ГБ в 8-битной и 5 ГБ в 4-битной, плюс KV-кэш для вашего контекста. Карта на 24 ГБ запускает модель 8B в полной точности с запасом для длинного контекста.

Как запустить модель, когда GPU уже есть?

Ollama — самый быстрый способ начать, а vLLM обслуживает OpenAI-совместимый API под нагрузкой. В нашем руководстве по запуску LLM на собственном GPU-сервере разобраны оба варианта, в том числе то, как закрыть эндпоинт от посторонних.

Арендовать GPU помесячно или почасово?

Помесячно, если GPU загружен большую часть дней, почасово — для коротких экспериментов. Чтобы найти точку безубыточности, разделите месячную цену на почасовую ставку, которую вы платили бы в другом месте: расчёты приведены в статье «Выделенный GPU или облачный».

Размещайте проекты там, где закон на вашей стороне

Офшорные VPS, выделенные, RDP- и GPU-серверы в семи юрисдикциях. Без KYC, оплата криптовалютой.

Что почитать дальше

Ещё из блога

Все статьи

С возвращением

Войдите, чтобы управлять серверами и балансом.

Без KYCПроверка на человека с помощью Cloudflare TurnstileБез отслеживания