J-lens
J-lens в новостной повестке, календарь упоминаний и aналитика в реальном времени.
Календарь упоминаний:
J-lens выявляет и меняет промежуточные концепции в нейросетях Anthropic
Суть: Инструмент J-lens позволяет выявлять и манипулировать скрытыми концепциями внутри языковых моделей, разделяя автоматическую генерацию текста и доступ к фактам для логических выводов.
Событие: Anthropic выпустила инструмент J-lens, который проецирует скрытые векторы активаций на словарь модели, позволяя менять ответы (например, количество ног у паука) через вмешательство в промежуточные слои.
Связь: Наличие в архитектуре Claude выделенного слоя активаций, доступного для J-lens, подтверждает гипотезу о функциональном аналоге «глобального рабочего пространства» для гибкого управления информацией.
Риск: Способность J-lens вмешиваться в промежуточные активации создает теоретическую возможность для злоумышленников влиять на логику модели при получении доступа к её внутренним слоям.
Фактор: Эффективность J-lens ограничена зависимостью от словаря модели, так как инструмент работает только с концепциями, выражаемыми одним токеном, и требует доступа к весам для настройки.
В нашей базе собрано 1 событие по теме «J-lens». Мы показываем все из них.