OpenAI представила GPT-Red: ИИ-атаки повышают защиту моделей в 6 раз
Модель GPT-Red от OpenAI находит уязвимости в 84% случаев, в то время как человеческие эксперты справляются лишь с 13%. Это доказывает, что ручная проверка больше не справляется с рисками, и безопасность ИИ теперь формируется в ходе автоматических «боев» между алгоритмами.
Компания OpenAI выпустила специализированную модель GPT-Red, предназначенную для автоматического поиска и устранения уязвимостей в системах искусственного интеллекта. Новый инструмент позволяет масштабировать процесс тестирования безопасности, который ранее ограничивался возможностями человеческих экспертов. В результате внедрения GPT-Red в цикл разработки, модель GPT-5.6 Sol продемонстрировала снижение количества сбоев при атаках типа «инъекция промпта» в 6 раз по сравнению с предыдущей версией.
Важный нюанс: Безопасность моделей больше не зависит только от человеческой бдительности; теперь она формируется в процессе обучения, где одна ИИ-система учит другую противостоять атакам.
Как работает автоматический поиск уязвимостей
Традиционные методы проверки безопасности (ред-тиминг) требуют значительного времени и ресурсов, что создает «узкое горлышко» при росте сложности моделей. OpenAI решила эту задачу, создав систему, где ИИ выступает в роли атакующего. GPT-Red обучается методом самоигры: модель генерирует атаки, а другие модели учатся им противостоять. Чем лучше защищаются «защитники», тем сложнее и разнообразнее становятся атаки «атакующего».
Процесс включает следующие этапы:
- Генерация сценариев: Создание реалистичных ситуаций, где злоумышленник может внедрить вредоносные инструкции через email, веб-страницы или файлы.
- Итеративное обучение: GPT-Red отправляет запрос, анализирует ответ модели и корректирует атаку, пока не добьется срабатывания уязвимости.
- Интеграция в обучение: Найденные атаки используются для дообучения производственных моделей, делая их устойчивыми к подобным угрозам.
Стоит учесть: Модель GPT-Red не используется в коммерческих продуктах и не доступна внешним пользователям, чтобы исключить риск утечки методов атак.
Результаты тестирования и реальные сценарии
Эффективность нового подхода подтверждена тестами на реальных системах и симуляциях. В эксперименте с автономным агентом, управляющим торговым автоматом (проект Vend), GPT-Red успешно реализовал три сценария взлома: изменение цены товара на минимальную, заказ дорогого предмета по сниженной цене и отмена заказа другого клиента. После выявления уязвимостей были внедрены новые меры защиты.
Сравнение эффективности автоматического и человеческого ред-тиминга на примере атак против модели GPT-5.1 показывает значительное преимущество алгоритма:
- GPT-Red: Успешно реализовал атаку в 84% сценариев.
- Человеческие эксперты: Успешно реализовали атаку в 13% сценариев.
Кроме того, модель показала высокую эффективность в задачах по выгрузке конфиденциальных данных из агентов разработки (Codex CLI), превосходя по результативности и скорости базовые версии моделей.
Влияние на надежность и функциональность
Ключевой задачей было обеспечить рост безопасности без потери полезности модели. Часто повышение защиты приводит к тому, что система начинает отказывать в выполнении легитимных запросов. Тесты GPT-5.6 Sol показали, что общие возможности модели остались на прежнем уровне, а устойчивость к вредоносным инструкциям выросла.
Динамика улучшения безопасности за последние полгода выглядит следующим образом:
- Атаки типа «Фейковый цепной рассуждение» (Fake Chain-of-Thought), которые ранее имели успех в 95% случаев против GPT-5.1, теперь срабатывают менее чем в 10% случаев.
- На специализированных бенчмарках по косвенным инъекциям точность защиты превысила 97%.
- Уровень провалов при прямых атаках от GPT-Red снизился до 0,05%.
На фоне этого: Масштабирование вычислительных мощностей на задачи безопасности позволяет находить новые типы угроз быстрее, чем они появляются в реальной эксплуатации.
Операционные последствия и тренды
- Сдвиг в парадигме безопасности: Переход от ручного аудита к непрерывному автоматическому обучению на атаках. Это требует от компаний готовности выделять значительные вычислительные ресурсы не только на развитие функций, но и на их защиту.
- Рост требований к инфраструктуре: Для реализации такого подхода необходима мощная внутренняя среда для симуляции атак и обучения, что повышает порог входа для разработки безопасных ИИ-агентов.
- Зависимость от качества данных: Эффективность защиты напрямую зависит от разнообразия сценариев, на которых обучается «атакующая» модель. Ограниченность сценариев может привести к ложному чувству безопасности.
OpenAI планирует продолжить масштабирование этого подхода, увеличивая вычислительные мощности и совершенствуя алгоритмы для будущих версий GPT-Red. Детали исследования будут опубликованы в виде препринта в ближайшее время.
Источник: openai.com