Vortholm — документация

Требования к машинам

Требования к серверу портала, серверу моделей и отдельному серверу локальной языковой модели.

Обязательны сервер портала и сервер моделей. Для локальной языковой модели нужен третий сервер.

Сотрудники · браузер
ваша сеть
1Сервер портала
64 ГБ · 16 ядер · диск от 200 ГБ · без видеокарты
Портал и хранилище · выполнение задач и чат · распознавание текста на сканах
① → записи, индексация, поиск по смыслу
2Сервер моделей
RTX 6000 Pro 96 ГБ · 64 ГБ ОЗУ · 16 ядер
Перевод записей в текст и разделение по голосам · подбор по смыслу и переупорядочивание · служебная модель: индексация документов и пересказы записей
① → задачи сотрудников и ответы в чате
3Языковая модель — развилка
одно из двух
Облачная — железа не нужно, обращения уходят из вашей сетиилиСвоя — третья машина: 8 × RTX 6000 Pro, 384 ГБ ОЗУ, диск от 1 ТБ, наружу не уходит ничего
Обязательны первые две машины. Третья нужна только тем, кто выбрал свою языковую модель: у остальных её место занимает обращение к облачной.

Сервер портала

Откуда 64 ГБ

У каждой части свой предел памяти, выставленный при установке:

Часть порталаПределРаботает
Пользовательская часть портала6 ГБвсегда
Администраторская часть4 ГБвсегда
Служба, которая ведёт задачи4 ГБвсегда
Одна выполняемая задача8 ГБпо числу задач в работе — по умолчанию две сразу
Одна сессия чата6 ГБпока идёт ответ
Распознавание текста на картинках и сканах10 ГБволнами, когда заливают сканы

Сумма пределов для одной сессии чата — 46 ГБ; это не постоянное потребление. Каждая дополнительная сессия добавляет до 6 ГБ. Портал по умолчанию допускает 10 сессий, а их число задаётся при установке. Для десятков сотрудников и постоянной очереди задач используйте 96 ГБ.

Откуда 16 ядер

Одна задача берёт до 12 ядер, одна сессия чата — до 6. Это не сумма: ядра делятся, а не резервируются, и при меньшем числе портал не падает, а замедляется.

Число ядер влияет на параллельность, а частота — на скорость одной работы. Базовая частота должна быть не ниже 2,5 ГГц. Для портала 16 ядер по 3,2 ГГц предпочтительнее 32 ядер по 2,0 ГГц: дополнительные ядра не компенсируют снижение скорости одной задачи.

Диск

Минимальный объём диска — 200 ГБ. Добавьте место для следующих данных:

  • Файлы задач — около 50 МБ на задачу с вложениями. Тысяча задач в месяц это 50 ГБ в месяц, и они не исчезают сами.
  • База знаний — типично от 10 до 50 ГБ: сколько систем подключите и сколько документов из них зальёте, столько и займёт.
  • Поисковые файлы базы знаний — отдельная величина, сопоставимая с самими документами. В рабочей папке из 733 тысяч файлов они занимают около 30 ГБ сверх самих документов. Учитывайте их отдельно.
  • Запас 30% сверх суммы — под служебные журналы хранилища.
  • Резервные копии, если они остаются на этой машине. Копия файлов — архив всего хранилища, и по умолчанию она ложится внутрь него же. Сжатие тут почти не помогает: документы и картинки уже сжаты. Если копии остаются на машине, место нужно удвоить; иначе переносите их на другое хранилище.

Каким должен быть диск

При одном запросе поиск читает объём, сравнимый со всей папкой, а не с размером ответа. В проверенной папке из 733 тысяч файлов поисковые файлы занимают 30 ГБ, и кэш памяти их не удерживает — на сервере с 80 ГБ памяти в кэше оседало около 7 ГБ. Остальное каждый раз идёт с диска.

ПоказательТребование
Чтение подрядот 1 ГБ/с, на больших папках лучше от 3 ГБ/с
Задержка чтения 4 КБ вразнобойдо 1 мс
Чтение 4 КБ вразнобойот 50 000 операций в секунду
Запись 4 КБ вразнобойот 20 000 операций в секунду

Серверный NVMe обычно выполняет эти требования. Сравните его измеренные показатели с таблицей; для ориентира, проверенный сервер даёт 7,9 ГБ/с последовательного чтения.

Медленный поиск не всегда вызван диском. В проверенной папке запрос занимал 55 секунд из-за построения запросов к поисковым файлам, хотя диск выполнял требования. Сначала проверьте настройку поиска.

Сетевой том допустим, если выполняет требования из таблицы. Учтите также пропускную способность сети: в приведённом примере поиск читает из хранилища 30 ГБ помимо кэша.

Сервер моделей

Нужна одна видеокарта RTX 6000 Pro на 96 ГБ. Одновременно работают:

Что работаетСколько занимает
Перевод записи с микрофона в текст4 ГБ обычной памяти
Перевод файлов записей в текст, с разделением по голосам9 ГБ обычной памяти
Подбор по смыслу в базе знаний8 ГБ обычной памяти
Переупорядочивание найденного8 ГБ обычной памяти
Служебная модель: индексация документов, описание картинок, пересказ записей27–35 ГБ видеопамяти под веса, остальная — под одновременные запросы

Служебная модель — не та, что выполняет задачи людей. Через неё проходит каждый файл, попавший в базу знаний: она составляет описание документа, по которому его потом находит поиск, отдельно описывает картинки и пересказывает залитую запись после перевода в текст. Это одна модель с тремя наборами настроек — по одному на каждый вид работы.

Используется актуальная открытая модель семейства Qwen на 27–35 миллиардов параметров в формате FP8; конкретная версия обновляется по мере выхода новых. В FP8 веса занимают около гигабайта видеопамяти на миллиард параметров: 27 или 35 ГБ. На картах поколения Blackwell, к которым относится и RTX 6000 Pro, модель можно разместить в NVFP4 — вдвое компактнее. Модели перевода записей и поиска по смыслу занимают ещё менее 10 ГБ; остальная память используется для одновременных запросов.

Свободная видеопамять здесь превращается в число файлов, разбираемых одновременно. Портал индексирует не по одному: по умолчанию 10 параллельных разборов в пользовательской части и 6 в администраторской, настройкой — до 32 в каждой. Для базы из миллиона документов параллельность определяет длительность индексации. Поэтому рекомендуется карта на 96 ГБ.

Требуются 64 ГБ обычной памяти и 16 ядер: сумма пределов — 29 ГБ, а перевод записи в текст берёт до 14 ядер сам по себе.

Диск — от 200 ГБ: модели перевода записей занимают около 5 ГБ, модели поиска по смыслу — по паре гигабайт, служебная модель — те же 27–35 ГБ, что занимает в видеопамяти. Требования к скорости здесь мягче, чем на сервере портала: модели читаются один раз при старте, дальше машина работает из видеопамяти. Важно только чтение подряд — от 1 ГБ/с, иначе машина поднимается после перезагрузки минутами. Частота процессора — те же 2,5 ГГц и выше.

Сборки этих служб под обычный процессор в поставке есть, и портал не сломается, если поднять их на первой машине. Но это резерв для разработки: почему именно так, и что тогда становится медленным.

Если языковая модель своя

Для модели уровня DeepSeek V4 Flash нужен отдельный сервер с восемью картами. На сервере моделей для неё недостаточно видеопамяти.

Видеокарты8 × RTX 6000 Pro по 96 ГБ
Процессородин разъём, 128 линий PCIe 5.0, от 32 ядер, от 3 ГГц
Оперативная памятьот 192 ГБ, расчётно 384 ГБ
Дискместный NVMe от 1 ТБ
Питание6–8 кВт

Почему линии PCIe здесь важнее ядер и откуда 384 ГБ — на странице Железо под свою модель.

Сеть

Сервер портала обращается к серверу моделей по адресу, который задаётся при установке. Внешний доступ нужен в двух случаях:

КудаЗачемКогда нужно
К облачной языковой моделивыполнение задач и чатесли не подняли свою
К службам рассылки уведомленийуведомления в браузереесли они включены

Полностью изолированная сеть возможна — если языковая модель своя и уведомления в браузере выключены. Ходить наружу через корпоративный прокси тоже можно, это настройка при установке.

Администраторскую часть портала не открывают в интернет: её либо оставляют доступной только изнутри сети, либо закрывают списком разрешённых адресов — тогда обращение с чужого адреса отклоняется раньше, чем портал успевает проверить что-либо ещё. Наружу смотрит только пользовательская часть; точный список портов отдаёт установщик.

На этой странице