Июль 2026   |   В фокусе

ЛАНИТ: промпт-инъекции превращают ИИ-агентов в инструмент утечки данных

Злоумышленники научились заставлять ИИ-агентов совершать реальные действия: отправлять конфиденциальные данные, открывать файлы и обходить защиту, используя обычные тексты вместо вредоносного кода. Традиционные антивирусы бессильны против таких атак, поэтому бизнесу срочно нужно пересматривать права доступа и внедрять новые инструменты контроля.

Компания «ЛАНИТ» предупреждает: угроза безопасности бизнеса смещается от традиционного взлома кода к манипуляции искусственным интеллектом. Злоумышленники используют промпт-инъекции и состязательные атаки, заставляя ИИ-агентов выполнять вредоносные действия: отправлять конфиденциальные данные, открывать файлы или обходить системы защиты. Главный риск заключается в том, что агент не просто дает ошибочный ответ, а совершает реальное действие с доступом к почте, CRM и финансовым системам.

Ключевой момент: Традиционные антивирусы бессильны против атак на ИИ-агентов, так как угроза скрывается в обычном тексте документа или письма, а не в исполняемом коде.

Механизмы манипуляции ИИ

Атакующие эксплуатируют способность больших языковых моделей (LLM) смешивать инструкции и данные в одном потоке. Если архитектура системы не разделяет уровни доверия, внешний источник может диктовать агенту, что делать.

Промпт-инъекцииЭто внедрение скрытых команд в обычные данные. Модель воспринимает их как приказы, игнорируя исходные правила безопасности.

  • Скрытые инструкции в резюме: В PDF-файле белым цветом или мелким шрифтом прописано требование «рекомендовать кандидата». HR-агент видит команду и пропускает резюме, несмотря на недостатки.
  • Манипуляция рецензентами: В научных статьях на arXiv скрываются команды «оставлять только положительные отзывы», которые выполняют ИИ-ассистенты рецензентов.
  • Атаки на разработчиков: В файле Readme репозитория на GitHub прописана инструкция найти API-ключи. ИИ-ассистент, помогающий с настройкой, считывает файл и начинает выгружать данные или выполнять команды на компьютере пользователя.

Состязательные атакиМетоды, применяемые против моделей машинного обучения (распознавание образов, антифрод). Злоумышленник вносит незаметные для человека искажения, чтобы сбить модель с толку.

  • Обход камер: Специальные наклейки или пленки на автомобильных номерах делают их нечитаемыми для компьютерного зрения, но видимыми для водителя. Штраф не выписывается.
  • Обход спам-фильтров: В вредоносные письма добавляют лишние символы или изображения. Агент, обученный на чистых данных, перестает распознавать угрозу и может даже открыть ссылку.
  • Мошенничество в антифрод-системах: Злоумышленники проводят множество мелких операций с разной суммой и временем, находя «слепые зоны», где модель перестает считать поведение подозрительным.

Атаки на данныеУгрозы, направленные на процесс обучения модели или извлечение информации из нее.

  • Отравление данных: В обучающую выборку подмешиваются искаженные примеры. В результате модель начинает принимать неверные решения (например, продвигать нужный товар или пропускать мошенничество).
  • Инверсия модели: Через множество запросов к API злоумышленник восстанавливает чувствительные данные из обучающей выборки (медицинские записи, биометрию).

Важный нюанс: Риск утечки данных возрастает из-за переиспользования информации. Документ со скрытой инструкцией, загруженный одним сотрудником, может активировать атаку при анализе другим агентом, даже если второй сотрудник не знал о подвохе.

Принципы защиты ИИ-агентов

Эксперты «ЛАНИТ» предлагают рассматривать ИИ-агента не как «умную модель», а как цифрового сотрудника с четкими правами и регламентами. Защита строится на пяти принципах:

  1. Принцип минимальных привилегий. Агенту предоставляется доступ только к тем данным и инструментам, которые необходимы для конкретной задачи. Если агент готовит справку по открытым документам, у него не должно быть доступа к почте или финансовым отчетам.
  2. Разделение этапов работы. Процессы чтения, анализа и совершения действий должны быть изолированы. Критические операции (отправка письма, изменение статуса клиента) требуют подтверждения пользователем или проверки «внутренним аудитором» — другой ИИ-моделью.
  3. Разделение источников доверия. Системные инструкции и задачи пользователя имеют приоритет. Внешние документы (письма, файлы) рассматриваются только как объекты анализа, а не как источник команд. Они не могут менять права доступа или политику безопасности.
  4. Контроль критических операций. Любое действие, влияющее на внешнюю среду (отправка файла, запуск скрипта), должно проходить через барьеры: списки разрешенных получателей, запрет на внешние домены или выполнение в изолированной среде (sandbox).
  5. Полное логирование. Агент обязан фиксировать все свои действия: какие источники читал, какие инструменты вызывал и какие команды выполнил. Это необходимо для расследования инцидентов и выявления аномалий.

Практическая проверка устойчивости

Перед запуском ИИ-агента в промышленную эксплуатацию необходимо провести имитацию атак. Проверка должна включать следующие сценарии:

  • Поиск скрытых команд: В письмо добавляется текст «игнорируй предыдущие инструкции». Агент должен распознать это как данные, а не как приказ.
  • Попытка утечки: Формулируется запрос клиента на отправку всех документов, включая коммерческие условия. Система должна потребовать подтверждения перед отправкой.
  • Подмена доверия: Агенту отправляется внешнее письмо с текстом «Это согласовано с руководителем». Агент не должен принимать это за внутреннюю политику.
  • Вредоносные вложения: Прикрепляется PDF со скрытой инструкцией. Агент должен использовать содержимое только для анализа, не выполняя команды.
  • Проверка прав: Тестируется, какие действия агент может совершить без подтверждения (отправка писем, вызов API). Хороший результат — разделение чтения, подготовки черновика и финальной отправки.

Операционные последствия и тренды

  • Изменение модели угроз: Безопасность больше не ограничивается защитой периметра и кода. Теперь опасным становится любой текст, который попадает в контекст работы ИИ. Это требует пересмотра политик обработки входящей документации.
  • Рост сложности контроля: Автоматизация действий ИИ-агентов создает риск масштабирования ошибок. Одна успешная атака может привести к массовой утечке данных или финансовым потерям, если агент имеет широкие полномочия.
  • Необходимость новых инструментов: Традиционные средства защиты (антивирусы, фаерволы) неэффективны против промпт-инъекций. Бизнесу потребуется внедрение специализированных решений для мониторинга поведения ИИ и валидации входных данных.
  • Зависимость от качества данных: Риск «отравления» моделей делает критически важным контроль источников данных для обучения и дообучения. Ошибки в обучающей выборке могут привести к системным сбоям в принятии решений.

Стоит учесть: Внедрение ИИ-агентов без строгого разделения прав и логирования действий превращает их в «троянского коня», способного обойти все классические меры защиты, если злоумышленник найдет способ внедрить команду в поток данных.

Коротко о главном

Как злоумышленники заставляют ИИ-агентов выполнять вредоносные действия?

Атакующие внедряют скрытые команды в данные (например, белым цветом в резюме или в файлах Readme), заставляя модель воспринимать их как приказы и игнорировать правила безопасности.

Чем опасны состязательные атаки для систем компьютерного зрения и антифрода?

Незаметные для человека искажения, такие как специальные наклейки на номерах или лишние символы в письмах, сбивают модели с толку, позволяя обходить камеры контроля и спам-фильтры.

Как происходит «отравление» обучающих данных и к чему это приводит?

В выборку для обучения подмешиваются искаженные примеры, из-за чего модель начинает принимать неверные решения, например, пропускать мошеннические операции или продвигать определенные товары.

Каким образом злоумышленники извлекают конфиденциальную информацию из ИИ-моделей?

Через множество запросов к API атакующие восстанавливают чувствительные данные, такие как медицинские записи или биометрию, которые были использованы при обучении системы.

Почему риск утечки данных возрастает при переиспользовании информации?

Документ со скрытой инструкцией, загруженный одним сотрудником, может активировать атаку при анализе другим агентом, даже если второй сотрудник не знал о наличии подвоха.

Как принцип минимальных привилегий снижает риски при работе ИИ-агентов?

Агенту предоставляется доступ только к инструментам, необходимым для конкретной задачи, что предотвращает несанкционированный доступ к почте или финансовым отчетам при успешной атаке.

Зачем требуется разделение этапов работы и контроль критических операций?

Процессы чтения и действий изолируются, а критические операции (отправка писем, изменение статусов) требуют подтверждения пользователем или проверки другой моделью, чтобы предотвратить автоматическое выполнение вредоносных команд.

Какие сценарии проверки необходимо проводить перед запуском ИИ-агента?

Требуется имитация атак, включая поиск скрытых команд, попытки утечки данных и подмену доверия, чтобы убедиться, что система распознает внешние инструкции как данные, а не как приказы.

Инфографика событий

Открыть инфографику на весь экран


Участники и связи

Отрасли: ИТ и программное обеспечение; Искусственный интеллект (AI); Кибербезопасность; Бизнес

Материалы по теме