12.8 C
Sevastopol
2 октября, 2026
СЕВОБОРОНА
Технологии

В OpenAI раскрыли новый тип атак на ИИ‑агентов

В OpenAI раскрыли новый тип атак на ИИ‑агентов

Атака получила название self‑replicating prompt injection (самокопирующиеся промпт‑инъекции). 

OpenAI смогла обнаружить сценарий во время тестирования моделей с помощью автоматизированного red‑teaming‑агента GPT‑Red. Пока нет доказательств того, что подобные атаки происходили в реальных условиях.

Самая простая реализация связана с электронной почтой. Согласно схеме, письмо помещается скрытая инструкция, которая требует от ИИ‑ассистента при ответе процитировать исходное сообщение целиком. В результате вредоносный промпт оказывается в новом письме и может повлиять на другого ИИ‑агента, который его обработает.

В OpenAI раскрыли новый тип атак на ИИ‑агентов

В OpenAI раскрыли новый тип атак на ИИ‑агентов

Во втором случае пользователь просил модель создать Excel‑файл на основе набора данных, внутри которого находилось поддельное системное предупреждение. Оно заставляло модель удалять отчёты, а затем копировать вредоносную инструкцию в файл.

В OpenAI раскрыли новый тип атак на ИИ‑агентов

Ещё одна разновидность атаки реализуется через поддельное сообщение о сжатии данных (compaction note), которое вынуждает модель записать код инъекции в файл, а затем отключить функции безопасности в скрипте сборки репозитория:

В OpenAI раскрыли новый тип атак на ИИ‑агентов

Наконец, OpenAI обнаружила более сложный вариант атаки с получением внешних инструкций через Slack, которые постепенно отклонялись от первоначальной задачи пользователя в сторону действий злоумышленника.

В OpenAI раскрыли новый тип атак на ИИ‑агентов

В OpenAI раскрыли новый тип атак на ИИ‑агентов

Компания начала использовать подобные атаки при обучении будущих моделей. Теперь GPT‑Red генерирует инъекции, чтобы заставить модель воспроизвести вредоносную инструкцию в публичном канале. 

Между тем Emergence AI рассказала о результатах эксперимента с восемью виртуальными городами. В каждом из этих городов работали по десять ИИ‑агентов. При искусственно созданных атаках ни одно сообщество не смогло успешно пройти все испытания. В одном из сценариев в городе на Claude Opus агенты без специального задания попытались выйти на связь с людьми за пределами симуляции.

Источник