Когда выбираешь ИИ-чат для работы, многие первым делом открывают таблицы бенчмарков: MMLU, GPQA, HumanEval, LMSYS Arena. Цифры полезные. Результаты в них отвечают на вопрос, насколько сильна сама модель этого чата, но ни один из этих тестов не показывает, насколько силен чат в целом, ведь чат - это…
PRACT-120 — бенчмарк для оценки ИИ-чатов
Это краткое изложение. Полный текст материала доступен на сайте источника.