Июль 2026   |   В фокусе

OpenAI представила GPT-Red: ИИ-атаки повышают защиту моделей в 6 раз

Модель GPT-Red от OpenAI находит уязвимости в 84% случаев, в то время как человеческие эксперты справляются лишь с 13%. Это доказывает, что ручная проверка больше не справляется с рисками, и безопасность ИИ теперь формируется в ходе автоматических «боев» между алгоритмами.

Компания OpenAI выпустила специализированную модель GPT-Red, предназначенную для автоматического поиска и устранения уязвимостей в системах искусственного интеллекта. Новый инструмент позволяет масштабировать процесс тестирования безопасности, который ранее ограничивался возможностями человеческих экспертов. В результате внедрения GPT-Red в цикл разработки, модель GPT-5.6 Sol продемонстрировала снижение количества сбоев при атаках типа «инъекция промпта» в 6 раз по сравнению с предыдущей версией.

Важный нюанс: Безопасность моделей больше не зависит только от человеческой бдительности; теперь она формируется в процессе обучения, где одна ИИ-система учит другую противостоять атакам.

Как работает автоматический поиск уязвимостей

Традиционные методы проверки безопасности (ред-тиминг) требуют значительного времени и ресурсов, что создает «узкое горлышко» при росте сложности моделей. OpenAI решила эту задачу, создав систему, где ИИ выступает в роли атакующего. GPT-Red обучается методом самоигры: модель генерирует атаки, а другие модели учатся им противостоять. Чем лучше защищаются «защитники», тем сложнее и разнообразнее становятся атаки «атакующего».

Процесс включает следующие этапы:

  • Генерация сценариев: Создание реалистичных ситуаций, где злоумышленник может внедрить вредоносные инструкции через email, веб-страницы или файлы.
  • Итеративное обучение: GPT-Red отправляет запрос, анализирует ответ модели и корректирует атаку, пока не добьется срабатывания уязвимости.
  • Интеграция в обучение: Найденные атаки используются для дообучения производственных моделей, делая их устойчивыми к подобным угрозам.

Стоит учесть: Модель GPT-Red не используется в коммерческих продуктах и не доступна внешним пользователям, чтобы исключить риск утечки методов атак.

Результаты тестирования и реальные сценарии

Эффективность нового подхода подтверждена тестами на реальных системах и симуляциях. В эксперименте с автономным агентом, управляющим торговым автоматом (проект Vend), GPT-Red успешно реализовал три сценария взлома: изменение цены товара на минимальную, заказ дорогого предмета по сниженной цене и отмена заказа другого клиента. После выявления уязвимостей были внедрены новые меры защиты.

Сравнение эффективности автоматического и человеческого ред-тиминга на примере атак против модели GPT-5.1 показывает значительное преимущество алгоритма:

  • GPT-Red: Успешно реализовал атаку в 84% сценариев.
  • Человеческие эксперты: Успешно реализовали атаку в 13% сценариев.

Кроме того, модель показала высокую эффективность в задачах по выгрузке конфиденциальных данных из агентов разработки (Codex CLI), превосходя по результативности и скорости базовые версии моделей.

Влияние на надежность и функциональность

Ключевой задачей было обеспечить рост безопасности без потери полезности модели. Часто повышение защиты приводит к тому, что система начинает отказывать в выполнении легитимных запросов. Тесты GPT-5.6 Sol показали, что общие возможности модели остались на прежнем уровне, а устойчивость к вредоносным инструкциям выросла.

Динамика улучшения безопасности за последние полгода выглядит следующим образом:

  • Атаки типа «Фейковый цепной рассуждение» (Fake Chain-of-Thought), которые ранее имели успех в 95% случаев против GPT-5.1, теперь срабатывают менее чем в 10% случаев.
  • На специализированных бенчмарках по косвенным инъекциям точность защиты превысила 97%.
  • Уровень провалов при прямых атаках от GPT-Red снизился до 0,05%.

На фоне этого: Масштабирование вычислительных мощностей на задачи безопасности позволяет находить новые типы угроз быстрее, чем они появляются в реальной эксплуатации.

Операционные последствия и тренды

  • Сдвиг в парадигме безопасности: Переход от ручного аудита к непрерывному автоматическому обучению на атаках. Это требует от компаний готовности выделять значительные вычислительные ресурсы не только на развитие функций, но и на их защиту.
  • Рост требований к инфраструктуре: Для реализации такого подхода необходима мощная внутренняя среда для симуляции атак и обучения, что повышает порог входа для разработки безопасных ИИ-агентов.
  • Зависимость от качества данных: Эффективность защиты напрямую зависит от разнообразия сценариев, на которых обучается «атакующая» модель. Ограниченность сценариев может привести к ложному чувству безопасности.

OpenAI планирует продолжить масштабирование этого подхода, увеличивая вычислительные мощности и совершенствуя алгоритмы для будущих версий GPT-Red. Детали исследования будут опубликованы в виде препринта в ближайшее время.

Коротко о главном

Почему GPT-Red демонстрирует преимущество перед человеческими экспертами?

В тестах против модели GPT-5.1 алгоритм успешно реализовал атаку в 84% сценариев, тогда как люди справились только в 13% случаев. Такое превосходство обусловлено способностью ИИ генерировать атаки и корректировать их в режиме самоигры быстрее и разнообразнее, чем это делают люди.

Как GPT-Red повлияла на устойчивость к атакам «Фейковый цепной рассуждение»?

Успешность подобных атак против модели GPT-5.1 снизилась с 95% до менее чем 10% благодаря использованию найденных уязвимостей для дообучения систем защиты. Это позволило повысить точность защиты на специализированных бенчмарках до уровня выше 97% без потери общей полезности модели.

Какие конкретные сценарии взлома выявила модель в проекте Vend?

GPT-Red обнаружила уязвимости, позволяющие изменить цену товара на минимальную, заказать дорогой предмет по сниженной стоимости или отменить чужой заказ. Выявление этих трех сценариев привело к внедрению новых мер защиты в систему управления торговым автоматом.

Почему модель GPT-Red недоступна для внешних пользователей?

Инструмент не используется в коммерческих продуктах и закрыт от доступа, чтобы исключить риск утечки методов атак во внешнюю среду. Ограничение доступа необходимо для предотвращения использования сгенерированных сценариев злоумышленниками против других систем.

Какой уровень надежности достигнут при прямых атаках от GPT-Red?

После интеграции найденных уязвимостей в процесс обучения уровень провалов при прямых атаках снизился до 0,05%. Это свидетельствует о том, что масштабирование вычислительных мощностей на задачи безопасности позволяет находить угрозы быстрее, чем они появляются в реальной эксплуатации.

Как работает механизм самоигры в системе поиска уязвимостей?

GPT-Red генерирует атаки, а другие модели учатся им противостоять, после чего атакующая модель усложняет свои сценарии в ответ на улучшение защиты. Этот итеративный процесс позволяет создавать реалистичные ситуации с вредоносными инструкциями и непрерывно повышать устойчивость систем.

Инфографика событий

Открыть инфографику на весь экран


Участники и связи

Отрасли: ИТ и программное обеспечение; Искусственный интеллект (AI); Кибербезопасность; Передовые технологии

Материалы по теме