Обычно задача «создать базу знаний из сайта» звучит просто: взять HTML, извлечь текст, разбить его на фрагменты, построить embeddings и отправить всё в RAG. На современных сайтах этот подход всё чаще перестаёт работать. Главная причина — сайт может практически не содержать данных в исходном HTML…
Как мы научили LLMCOD собирать базу знаний не только из HTML, но и из SPA и открытых API
Это краткое изложение. Полный текст материала доступен на сайте источника.