Железо одной таблицей
Сводные требования к серверам: видеокарты, процессор, память, диск, питание и сеть.
Используйте таблицы для расчёта закупки. Обоснование требований приведено на страницах Требования к машинам и Железо под свою модель.
Три машины
Первые две нужны всегда. Третья появляется, только если языковая модель, выполняющая задачи и отвечающая в чате, работает у вас, а не у поставщика.
| Сервер портала | Сервер моделей | Машина под свою модель | |
|---|---|---|---|
| Когда нужна | всегда | всегда | только при своей языковой модели |
| Видеокарты | нет | 1 × RTX 6000 Pro, 96 ГБ | 8 × RTX 6000 Pro, 96 ГБ |
| Ядра | от 16 | от 16 | от 32 |
| Базовая частота | от 2,5 ГГц | от 2,5 ГГц | от 3 ГГц |
| Процессорных разъёмов | — | — | один, со 128 линиями PCIe 5.0 |
| Оперативная память | 64 ГБ; 96 ГБ при постоянной очереди задач | 64 ГБ | 192 ГБ минимум, 384 ГБ расчётные |
| Диск, объём | от 200 ГБ и растёт | от 200 ГБ | от 1 ТБ |
| Диск, тип | местный NVMe | NVMe | местный NVMe |
| Питание | — | — | 6–8 кВт с резервированием |
| Корпус | — | — | от 4U, с продувом под пассивные карты |
Прочерк означает, что особых требований нет: подойдёт обычная серверная машина.
Восемь карт в третьей машине — это стойка в серверной, отдельная линия питания и расчёт холода. Если серверной нет, сравнивать облачную модель со своей нужно не по цене машины, а по цене её размещения.
Чем заменить видеокарты
Расчёт в таблице выполнен для RTX 6000 Pro, но можно использовать другие карты.
Требование задано в гигабайтах видеопамяти: 768 ГБ суммарно. Набрать их можно другими
картами, в том числе более мощными, и часто меньшим числом.
Сами 768 ГБ посчитаны под полмиллиона единиц текста в обращении и десять сессий одновременно. Оба предела ваши, и портал по умолчанию укорачивает переписку раньше — на 250 тысячах единиц текста. При меньших пределах карт нужно меньше. Уточните эти пределы до заказа: например, четыре карты по 141 ГБ дают 564 ГБ.
| Карта | На карту | Сколько карт | NVLink | Что меняется |
|---|---|---|---|---|
RTX 6000 Pro | 96 ГБ | 8 → 768 ГБ | нет | расчёт этой страницы |
H200 NVL | 141 ГБ | 8 → 1128 ГБ, 4 → 564 ГБ | есть, мостом на 2–4 карты | обмен внутри группы идёт мимо платы, линий PCIe хватает с запасом |
B200 | 180 ГБ | 8 → 1440 ГБ, собранной системой | есть, все карты со всеми | плату, корпус и охлаждение выбрал производитель; около 1 кВт на карту |
L40S, RTX 6000 Ada | 48 ГБ | 16 → 768 ГБ | нет | шестнадцать карт в один разъём не заходят: нужна плата с коммутаторами линий |
Четыре правила, по которым проверяется любая замена.
- Число карт — степень двойки: 2, 4, 8, 16. Модель раскладывается между картами поровну, и при другом их числе сервер модели не стартует. «Шесть карт по 141 ГБ» набирают нужный объём на бумаге и не работают — берут четыре или восемь.
- Чем крупнее карта, тем проще машина. 128 линий
PCIeодного процессорного разъёма — это восемь карт на прямых линиях. Больше восьми можно только через плату с коммутаторами линий, и это отдельный класс железа. NVLinkснимает главное требование к плате. УRTX 6000 Proего нет, поэтому каждой карте нужен слот на все 16 линий: весь обмен между картами идёт через плату. У карт сNVLinkон идёт по прямому мосту, и требование к слотам смягчается.- Питание пересчитывается заново. Восемь карт по 600 Вт — это 4,8 кВт, остальное до
6–8 кВт забирает машина вокруг них. У карт по киловатту та же видеопамять обойдётся
дороже по электричеству и холоду, даже если карт меньше. В обратную сторону это тоже
работает: у
RTX 6000 Proесть исполнение на 300 Вт — те же 96 ГБ при 2,4 кВт на восемь карт, ценой скорости счёта.
Системы на B200 и подобных картах покупаются целиком, вместе с корпусом, платой и
охлаждением. Строки «процессор», «плата» и «корпус» из таблицы выше к ним не применяются:
их выбрал производитель системы. Сверять в этом случае нужно только суммарную
видеопамять, оперативную память и диск.
Диск: скорость
| Показатель | Сервер портала | Сервер моделей | Машина под свою модель |
|---|---|---|---|
| Чтение подряд | от 1 ГБ/с, на больших папках от 3 ГБ/с | от 1 ГБ/с | от 2 ГБ/с |
| Задержка чтения 4 КБ вразнобой | до 1 мс | не важна | не важна |
| Чтение 4 КБ вразнобой | от 50 000 операций в секунду | не важно | не важно |
| Запись 4 КБ вразнобой | от 20 000 операций в секунду | не важно | не важно |
Поиск по базе знаний на один запрос читает объём, сравнимый со всей папкой: на 733 тысячах файлов это 30 ГБ поисковых файлов, и в кэш памяти они не помещаются. Модели читаются один раз при старте, поэтому на двух других машинах от диска зависит только время подъёма после перезагрузки.
Требования из таблицы блочное устройство на сети обычно выполняет. Считать нужно не их, а полосу до хранилища: те же тридцать гигабайт на запрос поедут по сети. Разбор — Каким должен быть диск.
Отчего растёт диск сервера портала
200 ГБ — это старт, дальше объём определяют четыре вещи.
| Что | Сколько |
|---|---|
| Файлы задач | около 50 МБ на задачу с вложениями |
| База знаний | типично 10–50 ГБ |
| Поисковые файлы базы знаний | около 30 ГБ на 733 тысячи файлов, сверх самих документов |
| Резервные копии, если лежат здесь же | ещё столько же, сколько сумма выше |
| Запас | 30% сверх суммы — под служебные журналы хранилища |
Тысяча задач с вложениями в месяц — это плюс 50 ГБ в месяц, и сами они не исчезают. Поисковые файлы чаще всего забывают в расчёте, а копии — считают запасом в 30%, хотя копия файлов это сжатый архив всего хранилища и по умолчанию она ложится внутрь него же. Правильный ответ — увозить копии с машины.
Сеть
| Что | Как |
|---|---|
| Сервер портала → сервер моделей | внутренняя сеть, адрес задаётся при установке |
| Наружу | только к облачной языковой модели и к службам рассылки уведомлений |
| Своя языковая модель, уведомления в браузере выключены | наружу не ходит ничего |
| Корпоративный прокси | поддерживается |
| Администраторская часть | закрывается списком разрешённых адресов |
Где объяснения
Требования к машинам
Откуда 64 ГБ и 16 ядер, что занимает память на сервере моделей и почему диску важна задержка, а не полоса.
Железо под свою модель
Расчёт видеопамяти под длину обращения и число сессий, линии PCIe, память, питание и приёмка собранной машины.
Облачная модель или своя
Считать ли третью машину вообще: что даёт каждый вариант и во что обходится.