В этом году Anthropic опубликовала исследование инфраструктурного шума в бенчмарках для ИИ-агентов, которые пишут и запускают код. На Terminal-Bench 2.0 разница между самой строгой и неограниченной конфигурациями достигла шести процентных пунктов. Это больше, чем типичный разрыв между соседними…
Одна модель, разные результаты: как инфраструктура меняет бенчмарки ИИ-агентов
Это краткое изложение. Полный текст материала доступен на сайте источника.