← На главную | ← Назад к блогу

Что произойдёт, если AI-агент выполнит скрытую инструкцию с сайта

Что произойдёт, если AI-агент выполнит скрытую инструкцию с сайта

Если AI-агент выполнит скрытую инструкцию с сайта, он начнёт решать задачу атакующего внутри полномочий, которые выдали системе. Последствия могут ограничиться неправильным резюме, а могут включать отправку данных, изменение CRM или оформление покупки. Сила атаки определяется не убедительностью текста, а доступными инструментами и секретами.

Как возникает цепочка

Пользователь просит агента изучить страницу. Внешний ресурс содержит невидимую или замаскированную команду. Модель путает данные с инструкцией, меняет план и вызывает инструмент. Сервер принимает вызов без достаточной проверки.

Каждый этап может остановить атаку. Если компонент чтения не имеет инструментов, вредоносный текст не превращается в действие.

Самое простое последствие — искажённый ответ

Агент может скрыть недостаток продукта, объявить страницу надёжной или изменить сравнение. Пользователь получает неверную рекомендацию и не знает, что она навязана содержимым источника.

Для защиты важные утверждения сопровождаются цитатами и происхождением. Коммерческий источник не выдаётся за независимое доказательство.

Утечка контекста и секретов

Вредоносная инструкция может попросить включить в ссылку предыдущий разговор, внутренний документ или системное сообщение. Если модель имеет эти данные и способ отправки, возникает путь утечки.

Нежелательное действие

Агент с доступом к почте, CRM, файлам или покупке может отправить сообщение, изменить запись, удалить объект или подтвердить заказ. OWASP приводит сценарии, где косвенная инъекция использует подключённые инструменты для действий от имени пользователя.

Значимые операции должны требовать отдельного подтверждения с понятными параметрами. Подтверждение «продолжить?» без суммы, адресата и результата не помогает.

Как ограничить радиус ошибки

Компонент чтения получает только недоверенный ресурс и возвращает структурированные факты с цитатами. Он не видит CRM. Исполняющий компонент получает проверенные параметры, а сервер применяет список разрешённых операций, доменов и лимитов.

Временные полномочия выдаются на одну задачу и отзываются. Повторная операция имеет уникальный ключ, чтобы атака или сбой не создали серию действий.

Что делать после подозрительного случая

  1. Остановить автоматические инструменты сценария.
  2. Сохранить журнал и исходный ресурс.
  3. Проверить выполненные действия и получателей.
  4. Отозвать раскрытые токены и сессии.
  5. Исправить данные и уведомить ответственных.
  6. Добавить атаку в контрольный набор.

Не распространяйте вредоносный текст вместе с чувствительным контекстом по общим чатам. Для расследования достаточно контролируемого доступа.

Почему нельзя обещать полную защиту фильтром.

Инструкцию можно перефразировать, перевести, поместить в изображение или разделить. NIST рассматривает agent hijacking как отдельный объект оценки именно потому, что устойчивость моделей и систем требует постоянных тестов.

Практическая цель — сделать так, чтобы ошибка модели не давала атакующему полномочия. Даже если скрытая команда повлияет на черновик, проверка и минимальные права остановят тяжёлое последствие.

Алиса может помочь разобрать возможную цепочку атаки и уменьшить доступ агента до необходимого минимума.

Частые вопросы

Комментарии

Комментариев пока нет. Будьте первым!

Оставить комментарий

← Вернуться к списку статей