Июль 2026   |   В фокусе

Microsoft передает контроль над данными для ИИ самим сообществам

Microsoft передала право формировать данные для обучения нейросетей самим сообществам, чтобы исключить стереотипы и искажения в генерируемых изображениях. Это меняет экономику разработки ИИ: вместо дешевого автоматического сбора информации компании теперь вынуждены вкладывать ресурсы в долгую работу с людьми ради точности и репутации.

Microsoft представила инструмент Community Library Creator, позволяющий группам людей самостоятельно формировать базы данных для обучения искусственного интеллекта. Проект направлен на то, чтобы сообщества людей с инвалидностью, редкими заболеваниями или уникальным жизненным опытом могли сами определять, как они должны выглядеть на изображениях, генерируемых ИИ. Вместо того чтобы полагаться на случайные данные из интернета, где часто встречаются стереотипы, группы создают собственные библиотеки с подробными описаниями и контекстом.

Важный нюанс: Впервые право определять «правильное» изображение человека передается не инженерам, а самим представителям сообществ, что меняет саму логику сбора данных для нейросетей.

Как работают библиотеки сообществ

Традиционные модели ИИ обучаются на огромных массивах данных, собранных из открытых источников. Это часто приводит к искажениям: например, люди с низким ростом могут генерироваться с ушами эльфов из-за обилия фэнтези-контента в сети, а люди с ампутациями конечностей — только в медицинских или спортивных контекстах. Новый подход меняет этот процесс.

Инструмент Community Library Creator, разработанный командой Microsoft под руководством исследователя Аньи Тиме (Anja Thieme), предлагает структурированный метод создания данных:

  • Выбор тем: Участники определяют ключевые аспекты жизни, которые важно отразить (например, работа, отдых, семья).
  • Сбор материалов: Сообщество собирает около 400 качественных фотографий или видео, отражающих реальную жизнь.
  • Детальная разметка: К каждому изображению добавляются описания, объясняющие контекст. Например, для сообщества людей с альбинизмом отмечается необходимость носить шляпы для защиты от солнца или особенности зрения.
  • Оценка результатов: ИИ генерирует изображения на основе новых данных, а участники сообщества оценивают их точность, создавая цикл обратной связи.

Стоит учесть: Качество данных здесь важнее их количества. Библиотека из 400 тщательно описанных снимков работает эффективнее, чем миллион случайных фотографий из интернета.

Владельцы данных и права на использование

Ключевое отличие проекта заключается в распределении прав. В текущей модели ИИ данные часто собираются без явного согласия, а их происхождение невозможно отследить. В случае с библиотеками сообществ:

  1. Полное владение: Данные принадлежат самой организации, создавшей библиотеку, а не Microsoft.
  2. Контроль доступа: Сообщество само решает, делиться ли данными с разработчиками, выкладывать ли их на платформы вроде Hugging Face или ограничить использование.
  3. Право на удаление: Если участник передумает, его данные могут быть удалены из библиотеки в любой момент.

Для реализации такой модели потребовалась переработка внутренних процессов и контрактов Microsoft, чтобы гарантировать соблюдение прав людей на свои изображения.

Операционные последствия и практические аспекты

  • Снижение рисков репутационных потерь: Компании, использующие ИИ для генерации контента, смогут избежать создания стереотипных или оскорбительных изображений, получая данные напрямую от целевых групп.
  • Усложнение процесса сбора данных: Внедрение такого подхода требует времени на организацию работы с сообществами, получение согласий и ручную разметку, что делает процесс дороже и медленнее, чем автоматический скрапинг.
  • Повышение точности моделей: Нейросети, обученные на таких данных, будут лучше понимать нюансы реального мира, что критично для задач, требующих высокой точности визуального восприятия.

На фоне этого: Переход к модели «данные от сообщества» может стать новым стандартом для этичного ИИ, но потребует от разработчиков значительных ресурсов на взаимодействие с людьми, а не только с алгоритмами.

Сейчас инструмент используется в ограниченном режиме с конкретными организациями, такими как Kilimanjaro Blind Trust Africa и Short Stature Society Kenya. Команда Microsoft планирует расширить проект, добавив необходимые инженерные и юридические механизмы для работы с более широким кругом сообществ. Это может изменить подход к оценке успеха ИИ-моделей в будущем, сместив фокус с технических метрик на соответствие ожиданиям реальных людей.

Коротко о главном

Почему традиционные методы сбора данных приводят к искажениям?

Нейросети, обученные на открытых источниках, часто генерируют нереалистичные образы, например, изображая людей с низким ростом с ушами эльфов из-за обилия фэнтези-контента в сети. Новый подход требует сбора около 400 качественных фотографий с детальными описаниями контекста, что обеспечивает более точное отражение реальности.

Кому принадлежат данные, созданные через новый инструмент?

В отличие от текущей модели, где происхождение данных часто невозможно отследить, в библиотеках сообществ полное владение информацией остается у создавшей её организации, а не у Microsoft. Участники могут самостоятельно решать, делиться ли данными с разработчиками, выкладывать их на платформы или удалять их в любой момент.

Какие организации уже тестируют новый инструмент?

В ограниченном режиме система используется такими группами, как Kilimanjaro Blind Trust Africa и Short Stature Society Kenya, для создания собственных визуальных библиотек. Команда Microsoft под руководством Аньи Тиме планирует расширить проект, добавив необходимые юридические и инженерные механизмы для работы с более широким кругом сообществ.

Как новый метод влияет на бизнес-риски компаний?

Использование данных, полученных напрямую от целевых групп, позволяет корпорациям избегать создания оскорбительных или стереотипных изображений, что снижает вероятность репутационных потерь. Однако этот процесс становится дороже и медленнее из-за необходимости организации работы с людьми, получения согласий и ручной разметки материалов.

Почему качество данных в новом подходе важнее их количества?

Библиотека из 400 тщательно описанных снимков работает эффективнее, чем миллион случайных фотографий из интернета, так как содержит критически важный контекст, например, необходимость ношения шляп людьми с альбинизмом. Это позволяет нейросетям лучше понимать нюансы реального мира, что критично для задач, требующих высокой точности визуального восприятия.

Инфографика событий

Открыть инфографику на весь экран


Участники и связи

Отрасли: ИТ и программное обеспечение; Искусственный интеллект (AI); Бизнес; Право и регулирование; Передовые технологии

Материалы по теме