Google представила Gemini 3.5 Flash Cyber для поиска уязвимостей в коде
Специализированная модель от Google нашла 55 скрытых уязвимостей в коде, где другие системы застряли на 36. Переход на быстрые и дешевые ИИ-агенты позволяет бизнесу проверять миллионы строк кода за часы, но доступ к такому мощному инструменту пока строго ограничен для защиты от злоумышленников.
Google DeepMind анонсировала выпуск Gemini 3.5 Flash Cyber — облегченной модели искусственного интеллекта, созданной специально для обнаружения, проверки и исправления ошибок в программном обеспечении. Новая разработка построена на базе Gemini 3.5 Flash и оптимизирована для работы в инструменте CodeMender, что позволяет сканировать огромные объемы кода быстрее и дешевле, чем это делают тяжелые модели общего назначения. Доступ к технологии пока ограничен: в рамках пилотной программы она будет доступна только правительствам и проверенным партнерам, чтобы предотвратить возможное злоупотребление инструментом злоумышленниками.
Важный нюанс: Ограниченный доступ к модели обусловлен двойным назначением технологии: она эффективна как для защиты, так и для поиска путей атаки, поэтому Google вынуждена контролировать круг пользователей.
Почему легковесная модель эффективнее тяжелых аналогов
Поиск глубоких ошибок в коде требует анализа огромного количества возможных сценариев выполнения программы. Использование одной мощной и дорогой модели для каждого шага создает «узкое горлышко»: процесс становится медленным и затратным. Gemini 3.5 Flash Cyber решает эту задачу за счет скорости и низкой стоимости вызова. Инструмент CodeMender может запускать эту модель до 5 раз для одного анализа, позволяя исследовать значительно больше путей выполнения кода, чем это возможно с дорогими аналогами.
Такая архитектура дает следующие преимущества:
- Масштабируемость: Модель легко встраивается в процессы частого сканирования кода и проверки перед выпуском обновлений.
- Экономическая эффективность: Низкая стоимость одного запроса позволяет проводить более тщательную проверку без резкого роста бюджета на безопасность.
- Глубина анализа: Возможность многократных итераций помогает находить ошибки, которые пропускаются при однократном анализе.
В тестах на бенчмарке CyberGym, где ИИ-агенты проверяются на способность находить реальные уязвимости, агент с использованием Gemini 3.5 Flash Cyber показал результаты, сопоставимые с моделями значительно большего размера.
Результаты тестов на реальных и сложных системах
Google проверила новую модель не только на стандартных тестах, но и на реальных сложных кодовых базах, таких как браузеры Chrome и Safari, а также движок V8 JavaScript Engine. В независимом тестировании команды Big Sleep, направленном на поиск критических уязвимостей без ограничений безопасности, Gemini 3.5 Flash Cyber значительно превзошла базовые версии Gemini 3.5 Flash и Gemini 3.6 Flash.
Сравнительные данные по количеству найденных уникальных подтвержденных ошибок в движке V8 (при фиксированном количестве вызовов):
- Gemini 3.5 Flash Cyber: 55 уникальных проблем.
- Gemini 3.5 Flash (базовая): 47 проблем.
- Claude Opus 4.6: 36 проблем.
Новая модель нашла 10 уязвимостей, которые не обнаружили другие протестированные системы. Кроме того, при масштабировании количества вызовов Gemini 3.5 Flash Cyber продолжает находить новые пути и ошибки, в то время как базовые модели часто «застревают» в цикле, находя одни и те же проблемы.
Стоит учесть: Конкурентные модели последних версий (например, после Opus 4.6) в тестах отказывались выполнять задачи из-за встроенных ограничений безопасности, что делает прямое сравнение их производительности в этой области невозможным.
Практическое применение и влияние на безопасность
Технология уже работает внутри экосистемы Google, защищая продукты Chrome, Android, Cloud, Ads и YouTube. Скорость работы облегченной модели позволила команде по исследованию уязвимостей в облачных сервисах Google Cloud зафиксировать реальные результаты: за 2 часа модель обнаружила уязвимости, позволяющие удаленно выполнять код в публичных API, и ошибку повреждения памяти в критическом сервисе.
На основе найденных данных модель сгенерировала эксплойт с надежностью 100%, который обошел стандартные методы защиты, такие как ASLR (случайная организация адресного пространства) и W^X (защита от записи и выполнения). Это демонстрирует, что инструмент способен находить не только очевидные, но и сложные, скрытые угрозы.
Ранняя обратная связь от партнеров, таких как Wiz и инженеров по безопасности, подтверждает существенный прирост возможностей по сравнению с предыдущими версиями. Google использует базу данных уязвимостей OSV.dev (более 700 000 записей) и данные OSS-Fuzz за 10 лет, чтобы обучать модель работать так, как это делают профессиональные специалисты по кибербезопасности: анализировать миллионы строк кода и использовать отраслевые инструменты.
Операционные последствия и тренды
- Смена парадигмы тестирования: Переход от однократного вызова дорогих моделей к многократному использованию легких специализированных агентов позволяет увеличить глубину проверки кода без роста затрат. Это может стать стандартом для DevSecOps-процессов.
- Рост требований к скорости реагирования: Возможность находить критические уязвимости за часы вместо дней меняет цикл выпуска обновлений, позволяя закрывать дыры безопасности до того, как они будут использованы злоумышленниками.
- Зависимость от качества обучающих данных: Эффективность модели напрямую зависит от доступа к реальным данным об уязвимостях (как в базе OSV.dev). Компании без доступа к таким масштабным историческим данным могут столкнуться с трудностями при самостоятельной адаптации подобных решений.
- Регулирование доступа к инструментам: Ограничение распространения мощных инструментов поиска уязвимостей только доверенными лицами указывает на то, что рынок движется к модели контролируемого доступа для предотвращения кибератак.
Важно: Успех модели зависит от интеграции в существующие конвейеры разработки. Без автоматизации вызова CodeMender в процессе коммита кода преимущество скорости и масштабируемости не будет реализовано на практике.
Источник: deepmind.google