Почта скопирована

Как мы внедрили локального RAG-ассистента по документации на Onyx AI и Qwen 3.8 27B

  • Тип задачи

    Локальный RAG-ассистент для инструкции сложного ПО

  • Оборудование

    NVIDIA DGX Spark с 128 ГБ унифицированной памяти

  • Условие

    Конфиденциальная документация и внутренний контур

  • Режим

    Onyx AI, Qwen 3.8 27B, Kubernetes и KServe

  • Результат

    Диалоговая база знаний и меньше типовых обращений к экспертам

Резюме

К ServerICT обратился клиент, которому требовался локальный ИИ-помощник для работы с инструкцией объемом около 100 страниц к сложному проприетарному ПО. Мы предложили локального RAG-ассистента на базе Onyx AI и Qwen 3.8 27B, развернутого на NVIDIA DGX Spark во внутреннем контуре. Пользователь задает вопрос в чате, система находит релевантные фрагменты документации и формирует ответ с опорой на них. Решение сокращает число типовых консультаций, ускоряет обучение и сохраняет контроль над закрытыми данными.

Задача: сделать сложную инструкцию удобной для пользователей

Основным источником знаний была инструкция объемом около 100 страниц. Чтобы найти нужную настройку или порядок действий, сотруднику приходилось изучать документ вручную либо обращаться к квалифицированному специалисту. Эксперты регулярно отвечали на похожие вопросы и участвовали в обучении новых пользователей, хотя большая часть информации уже содержалась в документации.

Клиент хотел перенести этот сценарий в привычный чат. При этом облачный сервис не подходил. Инструкция описывала проприетарное программное обеспечение и относилась к конфиденциальным материалам. Значит, документы, поисковый индекс, история запросов и языковая модель должны были работать в локальной инфраструктуре с управляемым доступом.

Почему для задачи выбрали RAG

Локальный RAG не требует переобучать языковую модель на каждой редакции инструкции. Документ делится на смысловые фрагменты, для них рассчитываются векторные представления, а затем они сохраняются в поисковом индексе вместе с метаданными. Когда пользователь задает вопрос, система выбирает подходящие фрагменты и добавляет их в контекст запроса к модели.

Такой подход связывает ответ с внутренним источником и упрощает обновление базы знаний. При выпуске новой версии инструкции меняется индекс, а не сама модель. Локальный RAG-ассистент также может показывать ссылки на использованные разделы. Это помогает пользователю проверить ответ и снижает риск того, что правдоподобная формулировка будет принята за подтвержденный факт.

Ограничения

  • Облачный сервис не подходил: документация, индекс, запросы и модель должны были работать во внутреннем контуре.

  • Качество решения зависит от разбиения инструкции, полноты поиска, корректности ссылок и поведения при отсутствии ответа в документации.

  • Длину контекста, число параллельных запросов и объем памяти для кеша определяют по результатам нагрузочного тестирования.

  • Локальное размещение не заменяет аутентификацию, разграничение прав, сетевую изоляцию, журналирование и правила хранения истории диалогов.

Архитектура локального решения

В качестве вычислительной платформы команда ServerICT предложила NVIDIA DGX Spark с 128 ГБ когерентной унифицированной памяти. Для генерации ответов выбрали Qwen 3.8 27B. Модель содержит 27 млрд параметров и поддерживается популярными движками инференса, включая vLLM и SGLang. Выбранная конфигурация модели размещается в памяти DGX Spark. Оптимальную длину контекста, число параллельных запросов и объем памяти для кеша определяют по результатам нагрузочного тестирования.

Onyx AI используется как пользовательский интерфейс и слой работы с приемом файлов, индексацией, поиском и чатом. Контейнерные компоненты развертываются в Kubernetes, а KServe управляет публикацией модели как сервиса. Такая схема отделяет интерфейс и поиск от инференса, упрощает обновление компонентов и дает понятные точки для мониторинга.

Компонент Роль в решении Что получает клиент
Nvidia DGX Spark Локальная вычислительная платформа с 128 ГБ унифицированной памяти Инференс во внутреннем контуре без передачи инструкции во внешний сервис
Qwen 3.8 27B Формирует ответ по найденным фрагментам документации Диалог на естественном языке и разбор сложных вопросов
Onyx AI Чат, загрузка документов, индексация и поиск по базе знаний Единое рабочее окно для пользователей и администраторов
Векторный индекс Хранит смысловые представления фрагментов и метаданные Поиск по смыслу, а не только по точному совпадению слов
Kubernetes и KServe Развертывание контейнеров и управление сервисом модели Контролируемые обновления, наблюдаемость и единый способ публикации инференса

Как работает запрос пользователя

  • Администратор загружает актуальную инструкцию и задает правила доступа к базе знаний;
  • Onyx разбивает документ на фрагменты, рассчитывает векторные представления и обновляет поисковый индекс;
  • Пользователь задает вопрос в чате, например о настройке функции или последовательности действий;
  • Поисковый контур отбирает релевантные фрагменты с учетом метаданных и разрешений пользователя;
  • Qwen 3.8 27B получает вопрос и найденный контекст, после чего формирует ответ с указанием источника.

Что нужно проверить перед запуском

Качество локального RAG зависит не только от языковой модели. До ввода в эксплуатацию команда проверяет разбиение инструкции, полноту поиска, корректность ссылок и поведение системы, когда в документации нет необходимой информации. Также проводится тестирование Qwen 3.8 27B на контрольном наборе вопросов клиента. Публичные бенчмарки не показывают, насколько точно модель будет работать с материалами конкретной компании.

Отдельно наши специалисты провели нагрузочные испытания, измерили время до первого токена, скорость генерации, длину очереди и потребление памяти при одновременных сессиях. Это позволило подобрать движок инференса, параметры контекста и лимиты сервиса.

Как защищаются конфиденциальные данные

Локальное размещение исключает штатную передачу текста инструкции во внешнюю облачную модель, но само по себе не заменяет меры информационной безопасности. Для рабочего контура нужны аутентификация, разграничение прав, изоляция сети, журналирование действий и правила хранения истории диалогов. Права на документы должны учитываться и на этапе поиска. Пользователь не должен получить фрагмент, к которому у него нет доступа.

Onyx AI можно настроить для работы с локальными моделями и внутренними источниками. Перед эксплуатацией также определяется, какие логи допустимо сохранять и кто может обновлять базу знаний. Это делает внедрение RAG-ассистента управляемым не только технически, но и организационно.

Результат

Клиент ServerICT получил локального помощника, который превращает объемную инструкцию в диалоговую базу знаний. Пользователи быстрее находят порядок действий и могут самостоятельно решать типовые вопросы. Эксперты подключаются к нестандартным ситуациям, а не повторяют одни и те же разъяснения. Это сокращает нагрузку на квалифицированных специалистов и время обучения новых сотрудников.

Архитектура остается расширяемой: в индекс можно добавлять новые версии руководств и другие разрешенные документы, сохраняя единый чат-интерфейс. При этом ответы нужно регулярно оценивать на контрольном наборе вопросов, особенно после обновления модели, инструкции или настроек поиска. Такой цикл поддерживает качество системы после запуска.

Ключевые тезисы кейса

  • Локальный RAG-ассистент дает пользователям быстрый доступ к знаниям из инструкции объемом около 100 страниц через привычный чат.
  • Onyx AI объединяет интерфейс, индексацию и поиск, а Qwen 3.8 27B формирует ответы по найденным фрагментам.
  • NVIDIA DGX Spark позволяет разместить решение во внутреннем контуре и сохранить контроль над конфиденциальными материалами.
  • Качество определяется не только моделью: важны подготовка документов, права доступа, контрольные вопросы и нагрузочные испытания.

Похожая ситуация?

Этот кейс интересен, если:

  • Нужен локальный ИИ-помощник для объемной инструкции или базы документации.
  • Облачный сервис не подходит из-за конфиденциальности материалов.
  • Пользователям нужен привычный чат с ответами по внутренним источникам.
  • Важно сократить число типовых консультаций и ускорить обучение сотрудников.
Подберем любое оборудование* под ваш запрос

    * ноутбуки, настольные компьютеры, телефоны, планшеты и т.д.
    Translate »