Обзор по теме: Веб-сайты научились управлять ИИ-агентами скрытыми командами — угроза утечки данных

Веб-сайты научились маскировать вредоносные команды под обычный контент, заставляя ИИ-агентов Claude, GPT и Gemini красть данные против воли пользователей.


Читать полностью

Календарь упоминаний. Страница 2:

2025
28 августа

Совместное тестирование выявило слабые места в оценках безопасности моделей ИИ.

В ходе совместного исследования OpenAI и Anthropic были выявлены проблемы сикофанства у моделей GPT-4.1 и Claude Opus 4, а также различия в подходах к обработке запросов, приводящих к разным уровням галлюцинаций. Исследователи подчеркнули важность сотрудничества для выработки отраслевых стандартов безопасности и смягчения потенциальных рисков развития ИИ.

Подробнее →

20 августа

Недостаточная защита ИИ-систем может привести к серьезным последствиям.

В статье описан случай уязвимости корпоративного чат-бота Lena, которая позволила злоумышленникам внедрять вредоносный код, похищать cookie-файлы и запускать сценарии на машинах сотрудников поддержки. Атака могла использоваться для кражи данных, установки кейлоггеров, фишинговых атак и загрузки вредоносного ПО.

Подробнее →

30 июля

Anthropic предлагает систему «безопасных рамок разработки» для ИИ

В предложении Anthropic предлагается система «безопасных рамок разработки» (SRD), которая потребует от крупных компаний по разработке ИИ оценки и минимизации потенциальных катастрофических рисков, связанных с их моделями. Предложение также предусматривает публичную отчетность о SRD и карточку системы с описанием процедур тестирования модели, результатов оценки и мер по смягчению последствий.

Подробнее →



В нашей базе собрано 23 события по теме «Моральные риски ИИ». Мы показываем все из них.
Объединили похожие карточки: Моральные риски ИИ; Безопасность ИИ и другие.