Начинайте не с видеокарты, а с нагрузки
Фраза «нужен сервер для модели 14B» описывает лишь небольшую часть задачи. Одна и та же модель может обслуживать одного инженера, внутренний поиск по документам или десятки сотрудников через корпоративного ассистента. В этих сценариях различаются требования к задержке, количеству одновременных сессий, длине контекста и доступности.
Перед подбором оборудования мы фиксируем четыре параметра:
- назначение системы: чат, поиск по базе знаний, обработка документов, генерация кода или пакетный анализ;
- количество активных пользователей и ожидаемый пик параллельных запросов;
- тип и точность модели, допустимость квантования;
- целевое время первого ответа и общая скорость генерации.
Видеопамять определяет, что вообще поместится
В GPU должны разместиться веса модели, служебные буферы и KV-кеш, размер которого растёт вместе с контекстом и числом одновременных сессий. Поэтому расчёт «объём файла модели плюс небольшой запас» почти всегда слишком оптимистичен. Длинные документы и параллельные диалоги способны занять заметную часть памяти даже при неизменных весах.
Квантование снижает требования к видеопамяти, но может повлиять на качество и скорость. Решение принимают после испытаний на реальных запросах компании, а не по одному публичному тесту. Если система должна работать с несколькими моделями, учитывать нужно не только их суммарный размер, но и порядок загрузки, возможность выгрузки и требования к времени переключения.
CPU, RAM и накопители не являются второстепенными
Процессор готовит данные, обслуживает API, выполняет токенизацию и поддерживает соседние сервисы. Оперативная память нужна для самой ОС, контейнеров, векторной базы, кеша документов и временного размещения моделей. Для производственного узла разумно оставлять резерв: система не должна входить в своп при первом же пике.
Локальный NVMe влияет на загрузку моделей, индексацию и обработку больших массивов документов. Для RAG отдельно оценивают объём исходных файлов, индексов, резервных копий и журналов. Один быстрый диск без отказоустойчивости подходит для стенда, но не для сервиса, от которого зависит работа подразделения.
Топология важнее количества слотов
В многопроцессорном сервере GPU должны быть сбалансированы по CPU-сокетам и PCIe-корням. Для нескольких ускорителей проверяют число полноскоростных линий, расстояние между GPU, NIC и NVMe, а также поддержку межсоединений. Формально установить восемь карт недостаточно: при неверной топологии часть производительности теряется на перемещении данных.
Не менее важны питание и охлаждение. Ускорители создают высокую постоянную нагрузку, поэтому заранее проверяют мощность блоков питания, резервирование, допустимую температуру воздуха, направление потока и возможности стойки.
Производительность подтверждает пилот
Финальную конфигурацию выбирают по результатам короткого нагрузочного испытания. В пилоте измеряют время первого токена, скорость генерации, число одновременных сессий, загрузку GPU, расход памяти и стабильность при длинном контексте. Это позволяет отличить красивую спецификацию от платформы, которая действительно выдержит рабочий режим.
Практичный путь — начать с измеряемого профиля нагрузки, предусмотреть рост и не покупать максимальную конфигурацию без необходимости. Архитектура должна позволять добавить ускорители или второй узел без полной замены платформы.

