Первый вариант системы выглядел вполне стандартно: документы разбиваются на фрагменты, для них считаются embeddings, пользователь задаёт вопрос, несколько наиболее подходящих фрагментов отправляются в LLM вместе с запросом. Модель формулирует ответ — на первых тестах этого было достаточно. Проблемы…
Как устроен RAG для юридических документов и почему одной LLM оказалось недостаточно
Это краткое изложение. Полный текст материала доступен на сайте источника.