Июль 2026   |   В фокусе

Google представила Gemini 3.5 Flash Cyber для поиска уязвимостей в коде

Специализированная модель от Google нашла 55 скрытых уязвимостей в коде, где другие системы застряли на 36. Переход на быстрые и дешевые ИИ-агенты позволяет бизнесу проверять миллионы строк кода за часы, но доступ к такому мощному инструменту пока строго ограничен для защиты от злоумышленников.

Google DeepMind анонсировала выпуск Gemini 3.5 Flash Cyber — облегченной модели искусственного интеллекта, созданной специально для обнаружения, проверки и исправления ошибок в программном обеспечении. Новая разработка построена на базе Gemini 3.5 Flash и оптимизирована для работы в инструменте CodeMender, что позволяет сканировать огромные объемы кода быстрее и дешевле, чем это делают тяжелые модели общего назначения. Доступ к технологии пока ограничен: в рамках пилотной программы она будет доступна только правительствам и проверенным партнерам, чтобы предотвратить возможное злоупотребление инструментом злоумышленниками.

Важный нюанс: Ограниченный доступ к модели обусловлен двойным назначением технологии: она эффективна как для защиты, так и для поиска путей атаки, поэтому Google вынуждена контролировать круг пользователей.

Почему легковесная модель эффективнее тяжелых аналогов

Поиск глубоких ошибок в коде требует анализа огромного количества возможных сценариев выполнения программы. Использование одной мощной и дорогой модели для каждого шага создает «узкое горлышко»: процесс становится медленным и затратным. Gemini 3.5 Flash Cyber решает эту задачу за счет скорости и низкой стоимости вызова. Инструмент CodeMender может запускать эту модель до 5 раз для одного анализа, позволяя исследовать значительно больше путей выполнения кода, чем это возможно с дорогими аналогами.

Такая архитектура дает следующие преимущества:

  • Масштабируемость: Модель легко встраивается в процессы частого сканирования кода и проверки перед выпуском обновлений.
  • Экономическая эффективность: Низкая стоимость одного запроса позволяет проводить более тщательную проверку без резкого роста бюджета на безопасность.
  • Глубина анализа: Возможность многократных итераций помогает находить ошибки, которые пропускаются при однократном анализе.

В тестах на бенчмарке CyberGym, где ИИ-агенты проверяются на способность находить реальные уязвимости, агент с использованием Gemini 3.5 Flash Cyber показал результаты, сопоставимые с моделями значительно большего размера.

Результаты тестов на реальных и сложных системах

Google проверила новую модель не только на стандартных тестах, но и на реальных сложных кодовых базах, таких как браузеры Chrome и Safari, а также движок V8 JavaScript Engine. В независимом тестировании команды Big Sleep, направленном на поиск критических уязвимостей без ограничений безопасности, Gemini 3.5 Flash Cyber значительно превзошла базовые версии Gemini 3.5 Flash и Gemini 3.6 Flash.

Сравнительные данные по количеству найденных уникальных подтвержденных ошибок в движке V8 (при фиксированном количестве вызовов):

  • Gemini 3.5 Flash Cyber: 55 уникальных проблем.
  • Gemini 3.5 Flash (базовая): 47 проблем.
  • Claude Opus 4.6: 36 проблем.

Новая модель нашла 10 уязвимостей, которые не обнаружили другие протестированные системы. Кроме того, при масштабировании количества вызовов Gemini 3.5 Flash Cyber продолжает находить новые пути и ошибки, в то время как базовые модели часто «застревают» в цикле, находя одни и те же проблемы.

Стоит учесть: Конкурентные модели последних версий (например, после Opus 4.6) в тестах отказывались выполнять задачи из-за встроенных ограничений безопасности, что делает прямое сравнение их производительности в этой области невозможным.

Практическое применение и влияние на безопасность

Технология уже работает внутри экосистемы Google, защищая продукты Chrome, Android, Cloud, Ads и YouTube. Скорость работы облегченной модели позволила команде по исследованию уязвимостей в облачных сервисах Google Cloud зафиксировать реальные результаты: за 2 часа модель обнаружила уязвимости, позволяющие удаленно выполнять код в публичных API, и ошибку повреждения памяти в критическом сервисе.

На основе найденных данных модель сгенерировала эксплойт с надежностью 100%, который обошел стандартные методы защиты, такие как ASLR (случайная организация адресного пространства) и W^X (защита от записи и выполнения). Это демонстрирует, что инструмент способен находить не только очевидные, но и сложные, скрытые угрозы.

Ранняя обратная связь от партнеров, таких как Wiz и инженеров по безопасности, подтверждает существенный прирост возможностей по сравнению с предыдущими версиями. Google использует базу данных уязвимостей OSV.dev (более 700 000 записей) и данные OSS-Fuzz за 10 лет, чтобы обучать модель работать так, как это делают профессиональные специалисты по кибербезопасности: анализировать миллионы строк кода и использовать отраслевые инструменты.

Операционные последствия и тренды

  • Смена парадигмы тестирования: Переход от однократного вызова дорогих моделей к многократному использованию легких специализированных агентов позволяет увеличить глубину проверки кода без роста затрат. Это может стать стандартом для DevSecOps-процессов.
  • Рост требований к скорости реагирования: Возможность находить критические уязвимости за часы вместо дней меняет цикл выпуска обновлений, позволяя закрывать дыры безопасности до того, как они будут использованы злоумышленниками.
  • Зависимость от качества обучающих данных: Эффективность модели напрямую зависит от доступа к реальным данным об уязвимостях (как в базе OSV.dev). Компании без доступа к таким масштабным историческим данным могут столкнуться с трудностями при самостоятельной адаптации подобных решений.
  • Регулирование доступа к инструментам: Ограничение распространения мощных инструментов поиска уязвимостей только доверенными лицами указывает на то, что рынок движется к модели контролируемого доступа для предотвращения кибератак.

Важно: Успех модели зависит от интеграции в существующие конвейеры разработки. Без автоматизации вызова CodeMender в процессе коммита кода преимущество скорости и масштабируемости не будет реализовано на практике.

Коротко о главном

Почему доступ к модели ограничен только правительствами и партнерами?

Ограничение введено из-за двойного назначения технологии: инструмент способен не только защищать системы, но и находить пути для атак, поэтому Google контролирует круг пользователей, чтобы предотвратить злоупотребления злоумышленниками.

Как инструмент CodeMender повышает эффективность поиска уязвимостей?

Благодаря низкой стоимости и высокой скорости вызова, модель запускается до 5 раз для одного анализа, что позволяет исследовать значительно больше сценариев выполнения кода и избегать «узких мест», характерных для дорогих моделей общего назначения.

Сколько уникальных ошибок в движке V8 нашла модель в сравнении с конкурентами?

В тестах Gemini 3.5 Flash Cyber обнаружила 55 уникальных проблем, превзойдя базовую версию Gemini 3.5 Flash (47 ошибок) и модель Claude Opus 4.6 (36 ошибок), а также выявила 10 уязвимостей, которые пропустили другие системы.

Какие результаты показала модель при тестировании реальных продуктов Google?

За 2 часа система обнаружила критические уязвимости в облачных сервисах, включая возможность удаленного выполнения кода и повреждение памяти, что позволило сгенерировать эксплойт с надежностью 100%, обходящий стандартные защиты ASLR и W^X.

На каких данных обучалась модель для имитации работы специалистов по безопасности?

Для обучения использовались база данных уязвимостей OSV.dev с более чем 700 000 записей и десятилетние данные OSS-Fuzz, что позволило настроить ИИ на анализ миллионов строк кода и применение отраслевых инструментов.

Как новая технология меняет процессы DevSecOps?

Переход к многократному использованию легких агентов вместо однократных вызовов дорогих моделей позволяет увеличить глубину проверки кода без роста бюджета, ускоряя цикл выпуска обновлений и закрытие дыр безопасности за часы вместо дней.

Инфографика событий

Открыть инфографику на весь экран


Участники и связи

Отрасли: ИТ и программное обеспечение; Искусственный интеллект (AI); Кибербезопасность

Материалы по теме