Исследование, опубликованное в IEEE Access, проанализировало 2614 многошаговых атак на ИИ-агентов, сохраняющих информацию между сессиями. Результат: атаки с медленным дрейфом и бэкдор-активацией могут выглядеть полностью безобидными на протяжении почти всей задачи, а срабатывают лишь в последних…
ИИ-агенты научились скрывать атаку в собственной памяти: безобидные запросы могут привести к опасному результату
Это краткое изложение. Полный текст материала доступен на сайте источника.