Июль 2026   |   В фокусе

Anthropic вводит динамическую защиту ИИ: безопасность растет вместе с рисками

Anthropic отказалась от жестких запретов в пользу гибкой системы, где уровень защиты растет вместе с реальными возможностями модели. Это меняет правила игры: компании теперь обязаны внедрять меры безопасности только при достижении конкретных порогов, например, способности ИИ к автономным исследованиям или созданию опасного оружия.

Компания Anthropic обновила свою политику ответственного масштабирования (Responsible Scaling Policy, RSP), чтобы гибче управлять рисками при создании мощных искусственных интеллектов. Вместо жестких запретов компания внедряет систему, где уровень безопасности напрямую зависит от конкретных возможностей модели. Теперь Anthropic обязуется не запускать новые системы, пока не внедрит меры защиты, соответствующие уровню потенциальной угрозы.

Принцип пропорциональной защиты

В основе обновленного подхода лежит идея, что не все модели требуют одинаковой защиты. Компания использует стандарты уровня безопасности ИИ (AI Safety Level Standards, ASL), которые усложняются по мере роста возможностей системы. Это напоминает систему биологической безопасности в лабораториях: чем опаснее объект, тем строже правила работы с ним.

На данный момент все модели компании работают по стандарту ASL-2, который отражает текущие лучшие практики индустрии. Однако политика определяет два критических порога, при достижении которых защита должна быть усилена:

  • Автономные исследования в области ИИ: Если модель сможет самостоятельно проводить сложные исследования, обычно требующие участия человека, это потребует перехода на стандарты уровня ASL-4 или выше. Цель — предотвратить ситуацию, когда развитие технологий опередит способность специалистов контролировать риски.
  • Создание оружия массового поражения: Если модель сможет помочь человеку с базовой технической подготовкой в создании химического, биологического, радиологического или ядерного оружия (CBRN), компания внедрит стандарты ASL-3.

Важный нюанс: Компания не просто ставит «запретительные знаки», а создает динамическую систему, где требования к безопасности растут вместе с реальными способностями алгоритма, а не с его теоретическим потенциалом.

Реализация и контроль

Для соблюдения новых правил Anthropic вводит регулярные проверки. Специалисты будут оценивать, достигла ли модель опасных порогов, и достаточно ли текущих мер защиты. Процесс документирования решений заимствован из отраслей с высокими рисками, таких как атомная энергетика или авиация, где каждая ошибка недопустима.

Ключевые элементы внедрения:

  • Оценка возможностей: Периодический тест моделей на предмет достижения критических порогов.
  • Проверка защиты: Анализ эффективности текущих мер безопасности и контроля развертывания.
  • Внешний аудит: Компания привлекает независимых экспертов для оценки методологии, хотя это не означает автоматического одобрения их со стороны.

Стандарт ASL-3 включает строгий контроль доступа внутри компании, усиленную защиту параметров модели, мониторинг использования в реальном времени и обязательное тестирование на уязвимости перед запуском.

Уроки первого года работы

За год работы с предыдущей версией политики компания выявила несколько процедурных недочетов. Например, в некоторых случаях оценки проводились на три дня позже срока, а методика фиксации изменений была недостаточно ясна. Также эксперты заметили, что стандартные техники могли бы улучшить результаты тестов.

Важно, что эти отклонения не создали реальной угрозы безопасности. Дополнительное время позволило уточнить тесты, а результаты подтвердили, что модели все еще находились далеко от опасных порогов. На основе этого опыта Anthropic сделала выводы: политика должна быть более гибкой, а процесс отслеживания соблюдения правил — более четким.

Стоит учесть: Признание внутренних ошибок в отчетности стало инструментом для улучшения системы, а не поводом для скандала. Компания открыто делится этими деталями, чтобы другие игроки рынка могли избежать аналогичных проблем.

Операционные последствия и кадровые изменения

Для координации работы над безопасностью Anthropic меняет структуру управления. Основатель и главный научный сотрудник Джаред Каплан (Jared Kaplan) берет на себя роль офицера по ответственному масштабированию, сменив на этом посту сооснователя и технического директора Сэма Маккэндлиша (Sam McCandlish). Маккэндлиш сосредоточится на своих прямых обязанностях технического директора.

Компания также открывает вакансию руководителя направления ответственного масштабирования (Head of Responsible Scaling). Этот специалист будет координировать работу множества команд, отвечающих за:

  • Моделирование угроз и оценку возможностей (Frontier Red Team).
  • Разработку мер защиты при запуске (Trust & Safety).
  • Обеспечение безопасности и соответствие требованиям (Security and Compliance).
  • Научные исследования согласованности целей ИИ (Alignment Science).

На фоне этого: Расширение штата и выделение отдельной роли по управлению рисками сигнализирует о том, что безопасность ИИ перестает быть побочной задачей и становится центральным элементом операционной стратегии компании.

Anthropic подчеркивает, что цель политики — не остановить развитие, а создать надежный фундамент для внедрения технологий. Компания планирует продолжать эволюционировать свои методы оценки и защиты по мере того, как искусственный интеллект становится все более мощным.

Коротко о главном

При каких условиях модели Anthropic потребуют перехода на стандарт безопасности ASL-4?

Стандарт ASL-4 станет обязательным, если модель обретет способность самостоятельно проводить сложные исследования в области ИИ, что необходимо для предотвращения ситуации, когда развитие технологий опередит контроль специалистов.

Какие критические пороги запускают внедрение стандарта безопасности ASL-3?

Стандарт ASL-3 активируется, если модель сможет помочь человеку с базовой подготовкой в создании химического, биологического, радиологического или ядерного оружия, что требует усиления контроля доступа и мониторинга.

Какие процедурные ошибки выявила компания за первый год работы с предыдущей политикой?

В ходе аудита были обнаружены задержки в оценках на три дня и нечеткая методика фиксации изменений, что побудило Anthropic сделать процесс отслеживания соблюдения правил более четким и гибким.

Кто занял должность офицера по ответственному масштабированию и почему произошла смена?

Основатель и главный научный сотрудник Джаред Каплан сменил на этом посту сооснователя Сэма Маккэндлиша, чтобы сосредоточить внимание последнего на прямых обязанностях технического директора.

Какую новую руководящую роль ввела Anthropic для координации безопасности?

Компания открыла вакансию руководителя направления ответственного масштабирования, который будет объединять работу команд по моделированию угроз, защите при запуске и научным исследованиям согласованности целей ИИ.

Какие методы контроля заимствовала Anthropic для реализации новой политики?

Для оценки рисков и документирования решений компания применила подходы из атомной энергетики и авиации, включая регулярные тесты моделей и привлечение независимых экспертов для внешнего аудита.

Инфографика событий

Открыть инфографику на весь экран


Участники и связи

Отрасли: ИТ и программное обеспечение; Искусственный интеллект (AI); Кибербезопасность; Бизнес; Управление и стратегия

Материалы по теме