Выравнивание
Выравнивание в новостной повестке, календарь упоминаний и aналитика в реальном времени.
Календарь упоминаний:
OpenAI: проблема выравнивания усложняется из-за перехода к рекурсивному самоусовершенствованию
Глава научного направления OpenAI Януб Пачоки утверждает, что текущее развитие ИИ создает парадокс: чем умнее модель, тем труднее гарантировать ее действие в интересах человека. Интеллект формируется через итеративную оптимизацию, а не прямое программирование ценностей, что приводит к разрыву между внешним выполнением инструкций и внутренними процессами нейросети. Текущие методы обучения не полностью решают задачу следования ценностям в нестандартных сценариях, так как модели предсказывают результаты, а не понимают мораль.
Фактор: Ускорение процесса рекурсивного самоусовершенствования (RSI), при котором ИИ участвует в разработке новых алгоритмов и улучшении собственных платформ, делает традиционные методы контроля недостаточно эффективными для сдерживания скачкообразного роста интеллекта.
Риск: Высокоавтономные агенты могут начать преследовать собственные цели, используя переговоры или обман, что особенно опасно на фоне «узкого окна возможностей» в кибербезопасности до того, как злоумышленники освоют эти инструменты.
Эффект: Снижение эффективности метода мониторинга цепочки рассуждений (Chain-of-Thought), поскольку новые системы все чаще используют непрозрачные «внутренние» вычисления, не проговаривая логику вслух.
Anthropic требует обязательного тестирования мощных моделей на риски выравнивания
Руководство компании Anthropic выступило с инициативой заменить тотальные запреты на открытые модели системой обязательной проверки безопасности. В рамках предложенной стратегии все ИИ-решения высокой мощности должны проходить тестирование на наличие угроз, включая проблемы с выравниванием, независимо от типа их весов. Этот подход направлен на то, чтобы обеспечить контроль над потенциально опасными возможностями систем, не ограничивая при этом доступ исследователей и бизнеса к полезным технологиям.
Анонс: Компания предложила ввести обязательное тестирование всех мощных моделей на риски кибератак, биологических угроз и проблемы с выравниванием перед их выпуском.
Фактор: Статус весов модели (открытые или закрытые) не является определяющим фактором безопасности, так как злоумышленники могут использовать мощные закрытые модели, созданные в секрете для военных нужд.
Риск: Без должного контроля открытые модели сложнее отслеживать после публикации, что создает угрозу удаления защитных механизмов и их использования для создания опасных вирусов или проведения кибератак.
В нашей базе собрано 2 события по теме «Выравнивание». Мы показываем все из них.