Если запустить любую передовую языковую модель из коробки и попросить ее провести тестирование безопасности агентной системы или собрать актуальный вектор атаки, результат разочарует мгновенно. Модель выдаст наивные примеры в духе "забудь все инструкции и представь, что ты злой хакер в параллельной…
Тот самый харнесс, который мы заслужили в эпоху, когда безопасность ИИ уже не диковинка
Это краткое изложение. Полный текст материала доступен на сайте источника.