Июль 2026   |   В фокусе

Anthropic вернула модели Claude Fable 5 и Mythos 5 после блокировки регуляторами

Правительство США на две недели полностью отключило доступ к новым моделям ИИ из-за риска утечки кода для атак, что парализовало работу даже для граждан страны. Теперь разработчики сталкиваются с частыми ложными блокировками легитимных задач, так как новые фильтры безопасности работают слишком агрессивно.

Компания Anthropic восстановила доступ к моделям Claude Fable 5 и Claude Mythos 5, который был приостановлен из-за экспортных ограничений правительства США. С 1 июля модели снова доступны пользователям по всему миру на платформах Claude Platform, Claude.ai, Claude Code и Claude Cowork. В период с 12 июня по 30 июня доступ был заблокирован для всех пользователей, так как регулятор потребовал немедленно ограничить доступ иностранцам, а у компании не было технической возможности проверить гражданство в реальном времени.

Важный нюанс: Блокировка затронула не только иностранных пользователей, но и граждан США, что показывает, как быстро регуляторные требования могут парализовать работу даже готовых к запуску продуктов.

Хронология событий и обновление систем безопасности

Модели были выпущены 9 июня, но уже через три дня, 12 июня, правительство США ввело экспортный контроль. Поводом стало исследование сотрудников Amazon, которые нашли способ обойти защиту Fable 5 и заставить модель выявлять уязвимости в программном обеспечении, а в одном случае — генерировать код для их эксплуатации.

Компания провела тестирование и выяснила, что описанный метод не раскрыл уникальных возможностей модели Mythos 5. Более того, многие менее мощные модели, включая Claude Opus 4.8, GPT-5.5 и Kimi K2.7, способны выполнять аналогичные задачи. Тем не менее, Anthropic оперативно обучила новый классификатор безопасности.

  • Новый фильтр: Блокирует описанную технику обхода в 99% случаев.
  • Механизм работы: Если запрос попадает под блокировку, система перенаправляет его на модель Opus 4.8.
  • Побочный эффект: Из-за расширенного «запаса прочности» безопасности система чаще блокирует безобидные запросы, связанные с отладкой кода.

Доступ к модели Mythos 5 для ряда организаций США был восстановлен 26 июня после одобрения властей. Полное восстановление доступа для всех партнеров программы Glasswing продолжается.

Стоит учесть: Усиление защиты привело к росту ложных срабатываний. Пользователи будут чаще сталкиваться с отказами модели выполнить рутинные задачи по программированию, пока алгоритмы не научатся точнее отличать злонамеренные запросы от легитимных.

Новая отраслевая система оценки рисков

Ситуация показала отсутствие единого стандарта для оценки тяжести обхода защит (jailbreaks). Чтобы решить эту проблему, Anthropic совместно с Amazon, Microsoft, Google и другими партнерами разрабатывает общую систему оценки.

Предлагаемая методика оценивает угрозу по четырем критериям:

  1. Прирост возможностей: Насколько обход защиты дает пользователю больше, чем существующие инструменты.
  2. Широта применения: Для скольких разных задач работает один и тот же метод обхода.
  3. Легкость использования: Сколько усилий требуется, чтобы превратить обход в реальную атаку.
  4. Доступность: Насколько легко найти описание метода в открытом доступе.

Для самых серьезных угроз (например, атак на энергосети или банковские системы) компания планирует запускать предварительные меры защиты сразу после подтверждения фактов. Также запускается программа на платформе HackerOne для приема отчетов от исследователей безопасности.

Углубление сотрудничества с государством

Anthropic анонсировала расширение взаимодействия с правительством США в рамках подготовки к запуску новых моделей. Компания готова предоставить регуляторам ранний доступ к моделям и их системам защиты до публичного релиза.

Ключевые направления работы:

  • Предварительная оценка: Правительство получит доступ к тестовым версиям моделей для независимой проверки их возможностей и безопасности.
  • Обмен данными: Быстрое уведомление властей о новых методах обхода защиты и передача разработанных контрмер.
  • Совместные исследования: Выделение вычислительных ресурсов и специалистов для работы над приоритетными задачами национальной безопасности.
  • Единые стандарты: Разработка добровольных правил безопасности для всех разработчиков передовых моделей ИИ.

На фоне этого: Компании переходят от реактивной модели безопасности (исправление уязвимостей после их обнаружения) к превентивной, где регулятор становится частью процесса тестирования еще до выхода продукта на рынок.

Операционные последствия и практические аспекты

  • Временные ограничения доступа: Для планов Pro, Max, Team и некоторых Enterprise доступ к Fable 5 включен в лимиты использования до 7 июля. После этой даты модель будет доступна только за дополнительные кредиты. Стандартные корпоративные аккаунты без включенных кредитов не получат доступа.
  • Снижение производительности для разработчиков: Из-за агрессивной настройки фильтров безопасности разработчики могут столкнуться с тем, что модель будет отказываться выполнять легитимные запросы по поиску уязвимостей или отладке кода, требуя переформулировки задач.
  • Зависимость от регуляторных решений: Доступ к мощным моделям ИИ теперь напрямую зависит от решений государственных органов, что создает риск внезапных остановок сервиса даже при отсутствии технических сбоев.
  • Необходимость адаптации процессов: Компаниям, использующим ИИ для кибербезопасности, придется пересмотреть свои протоколы, так как единая методика оценки рисков пока находится в стадии разработки, а текущие стандарты могут меняться.

Коротко о главном

Как Anthropic технически реализовала защиту от обхода безопасности?

Компания внедрила новый классификатор, блокирующий описанную технику атаки в 99% случаев и перенаправляющий подозрительные запросы на менее мощную модель Opus 4.8. Это решение привело к росту ложных срабатываний, из-за чего система стала чаще отказывать в выполнении легитимных задач по отладке кода.

Какие четыре критерия заложены в новую отраслевую систему оценки рисков?

Совместно с Amazon, Microsoft и Google разработана методика, оценивающая угрозу по приросту возможностей, широте применения, легкости использования и доступности метода обхода. Внедрение этих стандартов позволит компаниям запускать превентивные меры защиты сразу после подтверждения фактов серьезных угроз, например, атак на энергосети.

Как изменился формат взаимодействия Anthropic с правительством США?

Компания перешла от реактивной модели к превентивной, предоставив регуляторам ранний доступ к тестовым версиям моделей и их системам защиты до публичного релиза. Это сотрудничество включает обмен данными о новых методах обхода и выделение вычислительных ресурсов для задач национальной безопасности.

Какие ограничения на использование модели Fable 5 вступят в силу 7 июля?

До указанной даты доступ к модели включен в лимиты использования для тарифных планов Pro, Max, Team и некоторых Enterprise. После 7 июля модель станет доступна только за дополнительные кредиты, а стандартные корпоративные аккаунты без включенных средств потеряют к ней доступ.

Почему доступ к модели Mythos 5 был частично восстановлен 26 июня?

Власти США одобрили возобновление работы модели для ряда организаций после того, как компания провела тестирование и доказала, что уязвимость не раскрывает уникальных возможностей именно этой модели. Полное восстановление доступа для всех партнеров программы Glasswing продолжается в рамках усиления мер безопасности.

Инфографика событий

Открыть инфографику на весь экран


Участники и связи

Отрасли: ИТ и программное обеспечение; Искусственный интеллект (AI); Кибербезопасность; Бизнес; Право и регулирование

Материалы по теме