Яка відеокарта потрібна: навчання, інференс чи рендер
Вибір GPU для виділеного сервера залежить від задачі, а не від того, "яка карта потужніша". Навчання великих моделей вимагає багато VRAM і високої пропускної здатності пам'яті. Інференс (запуск вже навченої моделі) можна вести на карті з меншим обсягом пам'яті, але з упором на низьку затримку. Рендер і відеокодування сильніше залежать від кількості CUDA/Tensor-ядер і підтримки потрібних кодеків.
Помилка новачка — брати найпотужнішу карту "про запас", не порахувавши, чи влазить модель або сцена в її пам'ять. Якщо не влазить, користі від зайвих тисяч ядер небагато.
VRAM вирішує більше, ніж ядра
Обсяг відеопам'яті визначає, яку модель взагалі можна завантажити і з яким batch size навчати. Орієнтовні класи задач:
| Клас задачі | Мінімум VRAM | Коментар |
|---|---|---|
| Інференс малих моделей, рендер сцен | 16 ГБ | Вистачає для більшості прикладних задач |
| Fine-tuning середніх моделей | 24-48 ГБ | Потребує карти рівня workstation |
| Навчання великих моделей з нуля | 80 ГБ і вище | Зазвичай декілька карт з NVLink |
Якщо модель не вміщується в пам'ять однієї карти, доводиться або урізати batch size, або розподіляти модель на декілька GPU — а це вже інша архітектура сервера й інші вимоги до процесора, який повинен встигати годувати карти даними.
Живлення і охолодження сервера з GPU
Топова карта для ML споживає 300-700 Вт під навантаженням. Сервер з 4-8 такими картами легко виходить на 4-6 кВт сумарного споживання — це вже не стандартна стійка на 16 А, а окремий розрахунок за резервуванням живлення з двома незалежними вводами.
Охолодження теж не можна недооцінювати: GPU-сервер зі щільним пакуванням карт вимагає спрямованого повітряного потоку front-to-back і може не поміститися в компактний корпус без шкоди для теплового режиму.
Процесор, PCIe і форм-фактор під декілька карт
Кожна відеокарта рівня дата-центру займає лінії PCIe x16. При 4 і більше картах процесор повинен віддавати 64+ ліній PCIe без поділу з мережевими картами і NVMe-накопичувачами — це одна з причин, чому GPU-сервери майже завжди будують на платформах з великою кількістю ліній PCIe, а не на споживчих чипсетах.
Форм-фактор теж відіграє роль: карти повної висоти з активним охолодженням фізично влазять не в будь-який корпус, і тут варто звіритись зі статтею про форм-фактори 1U і 2U — більшість багатокарткових GPU-серверів збирають у корпусах 3U-4U саме через вимоги до охолодження і довжини карт.
NVLink, passthrough і віртуалізація GPU
Якщо карти повинні обмінюватись даними напряму, без проходження через оперативну пам'ять хоста, потрібен NVLink або аналогічна шина — це прискорює розподілене навчання на декілька GPU в рази порівняно з обміном через PCIe.
Для віртуалізації застосовують PCIe passthrough (вся карта віддається одній віртуальній машині) або vGPU (карта ділиться між декількома ВМ програмно, якщо виробник це підтримує). Passthrough простіший у налаштуванні і дає повну продуктивність, але виключає спільне використання карти.
nvidia-smi
nvidia-smi -q -d POWER
Чек-лист вибору GPU-сервера
- Порахуйте, скільки VRAM реально потрібно під вашу модель, а не беріть про запас.
- Перевірте сумарне енергоспоживання всіх карт і запас блоків живлення.
- Уточніть кількість ліній PCIe у процесора при 4 і більше картах.
- Вирішіть заздалегідь: passthrough чи vGPU, якщо сервер буде віртуалізовано.