Все руководства
Начало работы
VPS
- Операционные системы для VPS
- Снапшоты VPS и резервные копии на внешней площадке
- Как развернуть собственный VPN на VPS с помощью WireGuard
- Как запустить ретранслятор, мост или onion-сервис Tor на VPS
- Как самостоятельно развернуть BTCPay Server на VPS
- Как запустить узел Bitcoin или Monero на VPS
Выделенные серверы
Windows RDP
Windows Server 2019 , 2022 или 2025 противWindows 10 и 11 для RDP- Как подключиться к серверу Windows RDP с любого устройства
GPU-серверы
Безопасность
На этой странице
Наши GPU-серверы поставляются с выделенными GPU NVIDIA и образом Linux, готовым к работе с CUDA. В этом руководстве мы сначала проверим образ, а затем установим на него популярные инструменты для ИИ. Команды рассчитаны на sudoSERVER_IP
Что входит в образ
Ubuntu 24.04 LTS со стандартной поддержкой до мая 2029 г.- Драйвер NVIDIA, включая утилиту
.nvidia-smi - CUDA, включая компилятор
.nvcc
Версии меняются по мере обновления образа, поэтому проверьте свои:
nvidia-smi
nvcc --version
В верхней части вывода nvidia-sminvcc/usr/local/cuda
echo 'export PATH=/usr/local/cuda/bin:$PATH' >> ~/.bashrc
source ~/.bashrc
Проверка GPU
nvidia-smi -L
nvidia-smi topo -m
Первая команда выводит список всех GPU с указанием модели: убедитесь, что количество и модель соответствуют вашему тарифу, а объём памяти, который показывает nvidia-smiCUDA_VISIBLE_DEVICES
CUDA_VISIBLE_DEVICES=1 python train.py
Подготовка Python
pip installexternally-managed-environment
sudo apt update
sudo apt install -y python3-venv python3-dev build-essential git
Установка PyTorch
PyTorch публикует сборки под конкретные версии CUDA. Актуальные выпуски предлагают сборки для nvidia-smi
python3 -m venv ~/venvs/torch
source ~/venvs/torch/bin/activate
pip install --upgrade pip
pip install torch torchvision --index-url https://download.pytorch.org/whl/cu130
python -c "import torch; print(torch.__version__, torch.cuda.is_available(), torch.cuda.get_device_name(0))"
Последняя строка должна вывести Truecu130cu126
Запуск моделей в Ollama
Зачем нужен собственный сервер моделей и как обеспечить его безопасность, читайте в статье о том, как развернуть LLM на собственном GPU-сервере. Ollama — самый быстрый способ запустить языковые модели с открытыми весами. Скрипт установки Ollama создаёт системную службу и определяет GPU NVIDIA. Скрипт можно скачать и прочитать перед запуском или сразу передать по конвейеру в оболочку:
curl -fsSL https://ollama.com/install.sh | sh
ollama pull llama3.1:8b
ollama run llama3.1:8b
ollama ps
ollama run/byeollama ps
По умолчанию Ollama принимает подключения на 127.0.0.1:11434/v1/usr/share/ollama/.ollama/modelsEnvironment=
sudo systemctl edit ollama.service
OpenAI-совместимый эндпоинт на vLLM
vLLM — сервер инференса, созданный для высокой пропускной способности: он обрабатывает множество запросов одновременно, объединяя их в батчи, и работает по тому же HTTP-протоколу, что и OpenAI, поэтому с ним совместимы существующие клиентские библиотеки. Его сборки компилируются под конкретные версии PyTorch и CUDA, поэтому устанавливайте его в отдельное окружение с URL индекса из документации vLLM:
python3 -m venv ~/venvs/vllm
source ~/venvs/vllm/bin/activate
pip install --upgrade pip
pip install vllm --extra-index-url https://download.pytorch.org/whl/cu129
Если ваш драйвер сообщает более старую версию CUDA, в документации vLLM описана и установка через uv--torch-backend=auto
Создайте токен, чтобы пользоваться сервером могли только вы, запишите его и запустите сервер на localhost:
export VLLM_API_KEY=$(openssl rand -hex 32)
echo "$VLLM_API_KEY"
vllm serve Qwen/Qwen2.5-7B-Instruct --host 127.0.0.1 --port 8000 --max-model-len 8192
При первом запуске модель загружается с Hugging Face в ~/.cache/huggingfaceQwen/Qwen2.5-3B-Instruct--tensor-parallel-size 2--hostHF_TOKEN
Проверьте работу сервера из второго SSH-сеанса, предварительно экспортировав в нём тот же токен:
curl http://127.0.0.1:8000/v1/models -H "Authorization: Bearer $VLLM_API_KEY"
curl http://127.0.0.1:8000/v1/chat/completions -H "Content-Type: application/json" -H "Authorization: Bearer $VLLM_API_KEY" -d '{"model": "Qwen/Qwen2.5-7B-Instruct", "messages": [{"role": "user", "content": "Say hello in five words."}]}'
Запуск vLLM как службы
Сервер, запущенный из оболочки, останавливается, когда вы выходите из системы. Чтобы он продолжал работать и снова запускался после перезагрузки, сохраните токен в файле, доступном для чтения только root, затем создайте юнит systemd:
sudo install -m 600 /dev/null /etc/vllm.env
echo "VLLM_API_KEY=$(openssl rand -hex 32)" | sudo tee /etc/vllm.env > /dev/null
sudo cat /etc/vllm.env
sudo systemctl edit --force --full vllm.service
Вставьте этот юнит в редактор, заменив YOUR_USER
[Unit]
Description=vLLM server
After=network-online.target
Wants=network-online.target
[Service]
User=YOUR_USER
EnvironmentFile=/etc/vllm.env
ExecStart=/home/YOUR_USER/venvs/vllm/bin/vllm serve Qwen/Qwen2.5-7B-Instruct --host 127.0.0.1 --port 8000 --max-model-len 8192
Restart=on-failure
[Install]
WantedBy=multi-user.target
Затем запустите службу, включите её автозапуск при загрузке и следите за её журналом:
sudo systemctl enable --now vllm.service
sudo journalctl -u vllm.service -f
Генерация изображений в ComfyUI
git clone https://github.com/Comfy-Org/ComfyUI.git
cd ComfyUI
python3 -m venv .venv
source .venv/bin/activate
pip install --upgrade pip
pip install torch torchvision torchaudio --extra-index-url https://download.pytorch.org/whl/cu130
pip install -r requirements.txt
python main.py --listen 127.0.0.1 --port 8188
Контрольные точки моделей поместите в ComfyUI/models/checkpointsmodels--listen
Docker и NVIDIA Container Toolkit
Чтобы контейнеры получили доступ к GPU, нужен NVIDIA Container Toolkit. Установите Docker из репозиториев Ubuntu, добавьте репозиторий NVIDIA и настройте Docker на использование среды выполнения NVIDIA:
sudo apt install -y docker.io
curl -fsSL https://nvidia.github.io/libnvidia-container/gpgkey | sudo gpg --dearmor -o /usr/share/keyrings/nvidia-container-toolkit-keyring.gpg
curl -s -L https://nvidia.github.io/libnvidia-container/stable/deb/nvidia-container-toolkit.list | sed 's#deb https://#deb [signed-by=/usr/share/keyrings/nvidia-container-toolkit-keyring.gpg] https://#g' | sudo tee /etc/apt/sources.list.d/nvidia-container-toolkit.list
sudo apt update
sudo apt install -y nvidia-container-toolkit
sudo nvidia-ctk runtime configure --runtime=docker
sudo systemctl restart docker
sudo docker run --rm --gpus all ubuntu nvidia-smi
Последняя команда должна вывести ту же таблицу, что и на хосте. Если вы предпочитаете Docker CE из собственного репозитория Docker, он работает точно так же. Например, эта команда запускает vLLM в контейнере и публикует его только на localhost:
sudo docker run --rm --gpus all --ipc=host -p 127.0.0.1:8000:8000 -v ~/.cache/huggingface:/root/.cache/huggingface vllm/vllm-openai:latest --model Qwen/Qwen2.5-7B-Instruct
Закрытие эндпоинтов от внешнего доступа
Открывать любой из этих инструментов наружу в исходном виде небезопасно: у Ollama и ComfyUI вообще нет аутентификации, а токен vLLM необязателен. Держите их привязанными к 127.0.0.1
ssh -N -L 8188:127.0.0.1:8188 -L 8000:127.0.0.1:8000 -L 11434:127.0.0.1:11434 YOUR_USER@SERVER_IP
Пока туннель работает, откройте в браузере http://127.0.0.1:8188http://127.0.0.1:8000/v1
Мониторинг GPU
nvidia-smi dmon -s pucm
watch -n 1 nvidia-smi
nvidia-smi --query-gpu=index,temperature.gpu,utilization.gpu,memory.used,memory.total,power.draw --format=csv -l 5
sudo apt install -y nvtop
nvtop
nvidia-smi dmonnvtop
nvidia-smi -q -d PERFORMANCE
Устранение неполадок
- «CUDA out of memory»: модель, её контекст или батч не помещаются в память. Выберите модель поменьше или с более сильным сжатием, уменьшите
в vLLM или сократите размер батча.--max-model-len покажет, не занимает ли память другой процесс.nvidia-smi возвращает False: виртуальное окружение не активировано или сборка PyTorch рассчитана на более новую версию CUDA, чем поддерживает драйвер. Сравнитеtorch.cuda.is_available() с версией CUDA в выводеtorch.version.cuda .nvidia-smi- «Driver/library version mismatch»: пакеты драйвера обновились, но старый модуль ядра всё ещё загружен. Перезагрузите сервер.
- Контейнер не видит GPU: добавьте
к команде--gpus all и проверьте, что командаdocker run была выполнена, а Docker перезапущен.nvidia-ctk runtime configure - Медленный первый запуск: при первом запуске загружаются модели и компилируются ядра для GPU. Последующие запуски проходят быстрее.
Готовы выбрать оборудование? Сравните серверы с RTX, GPU для дата-центров и серверы с несколькими GPU.
Клиенты с выделенными и GPU-серверами могут открыть тикет в личном кабинете, указав IP-адрес сервера и то, что они уже пробовали сделать. Целевой срок первого ответа — менее 12 часов. Для всех остальных серверов используйте действия с сервером на его странице, руководства и страницу статуса сети.