Модель эмбеддингов читает только первые несколько сотен токенов документа, а остальное молча отбрасывает. Теперь Manticore Search сам разбивает длинные документы при INSERT: добавьте chunk_strategy к векторному столбцу и выберите одну из пяти стратегий. Без конвейера загрузки и библиотек для…
[Перевод] Улучшенный векторный поиск по длинным документам: чанкинг внутри Manticore Search
Это краткое изложение. Полный текст материала доступен на сайте источника.