Anthropic представила J-lens для анализа «мыслей» ИИ и контроля над выводами
Инструмент J-lens от Anthropic позволяет заглянуть в скрытые слои нейросети и менять её логику, подменяя факты на лету. Это открывает путь к аудиту вредоносных планов модели, но одновременно создает риск для безопасности, если доступ к внутренним механизмам получат злоумышленники.
Компания Anthropic выпустила инструмент J-lens («Якобианская линза»), позволяющий выявлять и манипулировать промежуточными концепциями внутри языковых моделей. Исследователи продемонстрировали, что в архитектуре моделей Claude существует выделенный слой активаций, отвечающий за доступ к информации для отчета и логического вывода, но не для автоматической генерации текста. Это подтверждает гипотезу о существовании функционального аналога «глобального рабочего пространства» в ИИ, однако не доказывает наличие у моделей субъективного опыта или сознания.
Важный нюанс: Обнаруженный механизм отвечает за доступность информации для отчета, но не гарантирует наличие у модели внутренних переживаний или «души».
Механизм разделения функций
Традиционные методы анализа нейросетей часто сталкиваются с проблемой: понятия распределены по тысячам нейронов, а отдельные нейроны участвуют в множестве несвязанных задач. J-lens решает это, вычисляя усредненное влияние активации на ранних слоях на финальный вывод модели. Это позволяет отделить автоматическую обработку (например, продолжение текста на испанском языке) от осознанного использования фактов (например, написание имени испанского автора).
В ходе экспериментов исследователи меняли внутреннее представление языка в модели. При замене испанского на французский в «рабочем пространстве» модель продолжала писать текст на испанском, но при запросе на написание имени автора называла французского писателя. Это доказывает наличие двух независимых путей обработки информации:
- Автоматический путь: Обеспечивает беглость речи и выполнение рутинных задач без необходимости «осознания» фактов.
- Путь доступа: Отвечает за гибкое использование информации, логические цепочки и возможность сообщить о своих «мыслях» пользователю.
Практическое применение и ограничения
Инструмент работает как линза, проецирующая скрытые векторы активаций на словарь модели. Это позволяет не только читать промежуточные состояния, но и вмешиваться в них. Например, замена концепции «паук» на «муравей» в промежуточном слое меняет ответ модели на вопрос о количестве ног с 8 на 6. Аналогично работает и с планированием: если модель задумала рифму, вмешательство в этот план меняет последующий текст.
Метод имеет четкие границы применимости:
- Зависимость от словаря: J-lens эффективен только для концепций, которые можно выразить одним токеном. Сложные, многозначные или неязыковые представления (визуальные образы, пространственные схемы) могут оставаться невидимыми.
- Вычислительная стоимость: Подгонка линзы требует доступа к весам модели и обратного распространения ошибки. Это делает процесс ресурсоемким, хотя сама линза создается один раз и затем переиспользуется.
- Отсутствие универсальности: Метод не заменяет другие инструменты интерпретируемости, такие как разреженные автоэнкодеры, которые лучше находят низкоуровневые признаки, не связанные с речью.
Стоит учесть: Метод позволяет менять ответы модели, но не дает полного контроля над ней. Усиление вмешательства повышает точность результата, но не гарантирует его на 100% случаев.
Влияние на безопасность и развитие ИИ
Работа Anthropic важна для сферы безопасности искусственного интеллекта. Возможность выявлять скрытые намерения и промежуточные рассуждения модели до того, как они превратятся в текст, открывает новые возможности для аудита. Регуляторы и разработчики смогут проверять, не формирует ли модель вредоносные планы на ранних этапах генерации.
Нейробиологи, включая Станисласа Деане и Лионеля Наккаша, отмечают, что обнаруженная структура напоминает теорию глобального нейронного рабочего пространства в мозге человека. Однако они подчеркивают ключевые различия:
- У ИИ нет автономной рекуррентной активности, тела с сигналами боли или удовольствия.
- Доступ к информации в модели жестко привязан к языку, в то время как человеческое сознание оперирует и образами, и звуками.
Исследование не дает ответа на философский вопрос о том, «чувствует» ли модель что-либо. Оно лишь подтверждает, что для выполнения сложных задач система должна иметь механизм, делающий часть данных доступной для гибкого управления.
Важный нюанс: Код инструмента и настройки для открытых моделей (например, Google Gemma) опубликованы, что позволяет независимым исследователям воспроизводить эксперименты без доступа к проприетарным API.
Операционные последствия, тренды и практические аспекты
- Новый стандарт интерпретируемости: J-lens предлагает более прямой способ проверки причинно-следственных связей в моделях по сравнению с методами, требующими обучения дополнительных словарей признаков. Это упрощает аудит моделей для критически важных задач.
- Риск манипуляции выводами: Способность вмешиваться в промежуточные активации означает, что злоумышленники теоретически могут влиять на логику модели, если получат доступ к её внутренним слоям. Это требует усиления защиты весов и активаций.
- Зависимость от архитектуры: Метод применим только к автоэнкодерным трансформерам с открытыми весами. Модели с закрытой архитектурой или иной структурой (например, без остаточных связей) могут потребовать разработки новых инструментов анализа.
- Ограниченность языковой привязки: Поскольку инструмент опирается на токены словаря, он может пропускать важные логические связи, которые модель кодирует в неязыковом формате. Разработчикам не стоит полагаться на J-lens как на единственный источник истины о «мыслях» модели.
Источник: huggingface.co