Какая видеокарта нужна: обучение, инференс или рендер
Выбор GPU для выделенного сервера зависит от задачи, а не от того, "какая карта мощнее". Обучение больших моделей требует много VRAM и высокой пропускной способности памяти. Инференс (запуск уже обученной модели) можно вести на карте с меньшим объёмом памяти, но с упором на низкую задержку. Рендер и видеокодирование сильнее зависят от количества CUDA/Tensor-ядер и поддержки нужных кодеков.
Ошибка новичка — брать самую мощную карту "с запасом", не посчитав, влезает ли модель или сцена в её память. Если не влезает, толку от лишних тысяч ядер немного.
VRAM решает больше, чем ядра
Объём видеопамяти определяет, какую модель вообще можно загрузить и с каким batch size обучать. Ориентировочные классы задач:
| Класс задачи | Минимум VRAM | Комментарий |
|---|---|---|
| Инференс малых моделей, рендер сцен | 16 ГБ | Хватает для большинства прикладных задач |
| Fine-tuning средних моделей | 24-48 ГБ | Требует карты уровня workstation |
| Обучение больших моделей с нуля | 80 ГБ и выше | Обычно несколько карт с NVLink |
Если модель не помещается в память одной карты, приходится либо урезать batch size, либо распределять модель на несколько GPU — а это уже другая архитектура сервера и другие требования к процессору, который должен успевать кормить карты данными.
Питание и охлаждение сервера с GPU
Топовая карта для ML потребляет 300-700 Вт под нагрузкой. Сервер с 4-8 такими картами легко выходит на 4-6 кВт суммарного потребления — это уже не стандартная стойка на 16 А, а отдельный расчёт по резервированию питания с двумя независимыми вводами.
Охлаждение тоже нельзя недооценивать: GPU-сервер с плотной упаковкой карт требует направленного воздушного потока front-to-back и может не поместиться в компактный корпус без ущерба для теплового режима.
Процессор, PCIe и форм-фактор под несколько карт
Каждая видеокарта уровня датацентра занимает линии PCIe x16. При 4 и более картах процессор должен отдавать 64+ линий PCIe без деления с сетевыми картами и NVMe-накопителями — это одна из причин, почему GPU-серверы почти всегда строят на платформах с большим числом линий PCIe, а не на потребительских чипсетах.
Форм-фактор тоже играет роль: карты полной высоты с активным охлаждением физически влезают не в любой корпус, и здесь стоит свериться со статьёй про форм-факторы 1U и 2U — большинство многокарточных GPU-серверов собирают в корпусах 3U-4U именно из-за требований к охлаждению и длине карт.
NVLink, passthrough и виртуализация GPU
Если карты должны обмениваться данными напрямую, без прохождения через оперативную память хоста, нужен NVLink или аналогичная шина — это ускоряет распределённое обучение на несколько GPU в разы по сравнению с обменом через PCIe.
Для виртуализации применяют PCIe passthrough (вся карта отдаётся одной виртуальной машине) или vGPU (карта делится между несколькими ВМ программно, если производитель это поддерживает). Passthrough проще в настройке и даёт полную производительность, но исключает совместное использование карты.
nvidia-smi
nvidia-smi -q -d POWER
Чек-лист выбора GPU-сервера
- Посчитайте, сколько VRAM реально нужно под вашу модель, а не берите с запасом.
- Проверьте суммарное энергопотребление всех карт и запас блоков питания.
- Уточните число линий PCIe у процессора при 4 и более картах.
- Решите заранее: passthrough или vGPU, если сервер будет виртуализирован.