Всем привет. На связи Сергей Игнатенко, основатель ИИ-платформы VibePilot. Мы сделали свой бенчмарк моделей ИИ на реальных задачах: сметы, договоры, многостраничный Excel. 1 198 задач, 22 сбоя, 1,8%. Считается, что суверенные модели слишком слабы для агентов. Внутри жёсткого конвейера Алиса делает…
Наш бенчмарк ИИ-агентов: собачьи бега моделей LLM, в которых Алиса выигрывает
Это краткое изложение. Полный текст материала доступен на сайте источника.