← Новости
НейросетиКонтент-завод07 сентября 2026 г.299просмотров

Как мы научили ИИ читать корпоративные регламенты: от наивного RAG до измеримого pipeline

Команда описала создание корпоративного RAG-сервиса для поиска по нормативным документам и переход от базовой схемы на n8n и Qdrant к гибридному пайплайну. В архитектуре использованы BM25, embeddings, RRF, reranking, структурный chunking, обработка таблиц и измерение качества через Arize Phoenix и LLM-as-a-Judge.

Что это значит

Здесь ценен не сам факт, что кто-то собрал ещё один RAG, а показанный переход от «подключили документы к модели» к инженерной системе с измеримым качеством. На нормативных текстах обычная нарезка действительно ломается: смысл зависит от структуры разделов, формулировок, таблиц и корпоративных терминов. Поэтому в пайплайне появляются гибридный поиск, reranking, словари и отдельная работа со сложными форматами.

Для контент-завода это прямой урок. Как только у тебя накапливается база сценариев, брендбуков, расшифровок, инструкций и правил публикации, простой поиск по папкам перестаёт масштабироваться. Но подключить модель к архиву недостаточно: без тестового набора вопросов и метрик ты не поймёшь, где система уверенно находит нужный фрагмент, а где красиво ошибается.

Начни с небольшого внутреннего корпуса: собери документы, разметь 30-50 реальных запросов и зафиксируй правильные ответы или источники. Затем сравни обычный поиск, гибридную схему и reranking на одной выборке. Отдельно проверь таблицы, длинные регламенты и термины, которые модель может не знать. Такой подход позволит автоматизировать не только поиск, но и подготовку контента без скрытой ручной проверки каждого результата.

Первоисточник: Habr

Хочешь такой же поток контента у себя?

Разбираю на консультации, как собрать контент-завод под твою задачу: что автоматизировать первым, где взять съёмку и как считать деньги.

Записаться на разбор

Ещё в рубрике «Нейросети»

Разборы в блоге

КонсультацияTelegram