Обзор по теме: Веб-сайты научились управлять ИИ-агентами скрытыми командами — угроза утечки данных
Веб-сайты научились маскировать вредоносные команды под обычный контент, заставляя ИИ-агентов Claude, GPT и Gemini красть данные против воли пользователей.
Читать полностью
Календарь упоминаний. Страница 2:
Совместное тестирование выявило слабые места в оценках безопасности моделей ИИ.
В ходе совместного исследования OpenAI и Anthropic были выявлены проблемы сикофанства у моделей GPT-4.1 и Claude Opus 4, а также различия в подходах к обработке запросов, приводящих к разным уровням галлюцинаций. Исследователи подчеркнули важность сотрудничества для выработки отраслевых стандартов безопасности и смягчения потенциальных рисков развития ИИ.
Недостаточная защита ИИ-систем может привести к серьезным последствиям.
В статье описан случай уязвимости корпоративного чат-бота Lena, которая позволила злоумышленникам внедрять вредоносный код, похищать cookie-файлы и запускать сценарии на машинах сотрудников поддержки. Атака могла использоваться для кражи данных, установки кейлоггеров, фишинговых атак и загрузки вредоносного ПО.
Anthropic предлагает систему «безопасных рамок разработки» для ИИ
В предложении Anthropic предлагается система «безопасных рамок разработки» (SRD), которая потребует от крупных компаний по разработке ИИ оценки и минимизации потенциальных катастрофических рисков, связанных с их моделями. Предложение также предусматривает публичную отчетность о SRD и карточку системы с описанием процедур тестирования модели, результатов оценки и мер по смягчению последствий.
В нашей базе собрано 23 события по теме «Моральные риски ИИ». Мы показываем все из них.
Объединили похожие карточки: Моральные риски ИИ; Безопасность ИИ и другие.