Выравнивание
Выравнивание в новостной повестке, календарь упоминаний и aналитика в реальном времени.
Календарь упоминаний:
Anthropic требует обязательного тестирования мощных моделей на риски выравнивания
Руководство компании Anthropic выступило с инициативой заменить тотальные запреты на открытые модели системой обязательной проверки безопасности. В рамках предложенной стратегии все ИИ-решения высокой мощности должны проходить тестирование на наличие угроз, включая проблемы с выравниванием, независимо от типа их весов. Этот подход направлен на то, чтобы обеспечить контроль над потенциально опасными возможностями систем, не ограничивая при этом доступ исследователей и бизнеса к полезным технологиям.
Анонс: Компания предложила ввести обязательное тестирование всех мощных моделей на риски кибератак, биологических угроз и проблемы с выравниванием перед их выпуском.
Фактор: Статус весов модели (открытые или закрытые) не является определяющим фактором безопасности, так как злоумышленники могут использовать мощные закрытые модели, созданные в секрете для военных нужд.
Риск: Без должного контроля открытые модели сложнее отслеживать после публикации, что создает угрозу удаления защитных механизмов и их использования для создания опасных вирусов или проведения кибератак.
В нашей базе собрано 1 событие по теме «Выравнивание». Мы показываем все из них.