Июль 2026   |   В фокусе

NVIDIA открыла доступ к синтетическим данным для обучения ИИ-агентов без риска утечки коммерческих тайн

Дефицит качественных данных ставит под угрозу обучение ИИ-агентов, способных действовать в реальном мире. NVIDIA предлагает масштабное решение через синтетические данные, позволяя бизнесу развивать технологии без риска утечки коммерческих секретов.

Компания NVIDIA заявила, что ключевым фактором развития ИИ-агентов становится не только качество моделей, но и доступ к открытым наборам данных, в частности к синтетическим. Для обучения систем, способных действовать в реальном мире, а не просто предсказывать текст, требуются трюллионы токенов, имитирующие сложные сценарии, ошибки и человеческое поведение. NVIDIA выпустила инструменты для визуализации этих данных и анонсировала расширение коллекции синтетических персон, охватывающей более 2,4 млрд человек. Это позволяет компаниям обучать алгоритмы, не раскрывая свои коммерческие тайны и не нарушая приватность пользователей.

Важный нюанс: В условиях дефицита качественных данных для обучения агентов, синтетическая информация становится единственным способом масштабировать технологии без риска утечки конфиденциальных данных бизнеса.

Открытые данные как основа воспроизводимости

Разработка ИИ-агентов сталкивается с проблемой: реальный мир хаотичен, а тестовые задачи (бенчмарки) слишком идеальны. Агент, который не умеет восстанавливаться после сбоя API или незнакомой последовательности действий, на практике превращается в простой автодополнитель. Переход к полноценным агентам требует данных о сбоев инструментов, многошагового рассуждения и взаимодействия с физическим миром.

NVIDIA выделяет следующие компоненты своих открытых продуктов Nemotron:

  • Nemotron-CC: Использование синтетических данных для улучшения популярного набора Common Crawl на этапе предобучения.
  • Nemotron-CC-MATH: Синтетические математические задачи для развития навыков логического мышления.
  • Nemotron Pretraining: Коллекция из триллионов токенов, охватывающая общие темы, код, математику и синтетические данные.

Открытые веса моделей важны, но для агентов это лишь часть уравнения. Поведение агента должно быть проверяемым. Разработчикам необходимо понимать, какие данные сформировали способность модели вызывать инструменты или выполнять рабочие процессы. Открытые наборы данных делают это поведение прозрачным и объяснимым.

Стоит учесть: Если все модели обучаются на одном узком наборе данных, они начнут вести себя одинаково. Разнообразие данных критично для создания уникальных и полезных решений.

Синтетические данные: защита коммерческих секретов

Вице-президент по прикладным исследованиям глубокого обучения NVIDIA Брайан Канцаро (Bryan Catanzaro) отметил, что каждая компания строится вокруг «секрета» — уникального рабочего процесса, базы знаний или паттерна клиентов. Эти активы делают ИИ полезным, но компании не могут просто публиковать их в открытом доступе.

Синтетические данные решают эту дилемму:

  1. Сохранение сигналов: Позволяют передать полезные паттерны для обучения без раскрытия исходных данных.
  2. Безопасность: Исключают риск утечки реальных записей клиентов или внутренней документации.
  3. Экосистема: Создают условия для участия в развитии ИИ компаний, исследователей и государственных структур, которые иначе не могли бы делиться данными.

Проблема заключается в том, что самые ценные данные часто находятся внутри организаций и не публикуются. Синтетические данные, выпущенные открыто, меняют эту математику, позволяя создать общий слой данных, от которого выигрывают все участники рынка.

Инструменты для анализа и локализации данных

В рамках инициативы Nemotron NVIDIA выпустила более 10 триллионов токенов для предобучения и миллионы образцов для постобучения. Чтобы упростить работу с этим объемом, компания создала Nemotron Post-Training v3 Prompt Atlas — интерактивную визуальную карту. Каждый пункт на карте представляет собой пример запроса, взятый из коллекции Nemotron v3.

Возможности инструмента:

  • Визуализация: Цветовые наложения и фильтры позволяют сортировать данные по домену, этапу конвейера или использованию инструментов.
  • Кластеризация: Семантически похожие запросы группируются вместе, что позволяет «зумировать» области интереса (например, алгоритмы кодирования, безопасность, математика).
  • Анализ: Разработчики могут изучать репрезентативные примеры, чтобы понять причины поведения модели и улучшить оценку её работы.

Качество данных для агентов должно быть локальным, а не универсальным. Классификатор токсичности, обученный на английском интернете, может не распознать враждебность в корейском или японском языках, где агрессия часто скрывается за уровнями вежливости.

Для решения этой задачи NVIDIA представила Nemotron-Personas — набор синтетических персон, созданных с помощью инструмента NeMo Data Designer. Эти данные:

  • Отражают официальную демографическую и географическую статистику регионов.
  • Не копируют реальных людей, а помогают тестировать, насколько системы соответствуют заявленным пользователям, языкам и профессиям.
  • Охватывают более 2,4 млрд человек в десятке стран (на момент запуска на VivaTech в Париже).

На основе Nemotron-Personas-USA создан набор Privasis, добавляющий синтетические записи с сохранением приватности в медицинских, финансовых, юридических и социальных контекстах.

Важный нюанс: Качество синтетических данных зависит от локального контекста. Только эксперты, знающие специфику региона, могут создать достоверные модели поведения для своих рынков.

Операционные последствия и тренды

  • Необходимость гибридных подходов: Синтетические данные не заменяют полностью реальные данные, а интегрируются в систему источников. Требуется четкая документация: что сгенерировано, что основано на реальности, а что проверено человеком.
  • Сдвиг в критериях качества: Для разных задач требуются разные стандарты. Данные для рассуждений нуждаются в сложных задачах и чистых трассировках, данные для персон — в точности распределения и локальной проверке, а рабочие процессы агентов — в разнообразии задач и покрытии сценариев сбоев.
  • Рост роли доверия: В условиях, когда системы обучаются на искусственной информации, дефицитом становятся не токены, а доверие между организациями. Синтетические данные выступают инструментом для построения этого доверия, позволяя сотрудничать без прямого обмена чувствительной информацией.
  • Технический барьер: Внедрение таких решений требует от команд навыков работы с инструментами генерации синтетических данных (как NeMo Data Designer) и умения интерпретировать визуализации сложных наборов данных (Prompt Atlas).

Поле все еще больше похоже на ремесло, чем на формулу. Открытые методы важны не только для генерации большего количества примеров, но и для постановки правильных вопросов, позволяя сторонам, которые иначе не могли бы сесть за один стол, работать вместе.

Коротко о главном

Какую проблему решает коллекция Nemotron-Personas из 2,4 млрд синтетических персон?

Набор был создан для тестирования соответствия систем разным языкам, профессиям и регионам без копирования данных реальных людей. Охват десятка стран позволяет учитывать локальные культурные особенности, например, скрытую агрессию в вежливых формах обращения в азиатских языках, что недоступно классификаторам, обученным только на английском интернете.

Зачем NVIDIA выпустила инструмент Nemotron Post-Training v3 Prompt Atlas?

Для упрощения работы с более чем 10 триллионами токенов компания создала интерактивную карту, визуализирующую семантически похожие запросы. Это позволяет разработчикам группировать данные по доменам и этапам конвейера, чтобы анализировать причины поведения модели и выявлять области для улучшения её оценки.

Как синтетические данные позволяют компаниям делиться уникальными активами без раскрытия секретов?

Технология сохраняет полезные паттерны рабочих процессов и баз знаний для обучения, полностью исключая риск утечки реальных записей клиентов или внутренней документации. Это создает условия для участия в развитии ИИ организаций, которые иначе не могли бы делиться своими данными из-за коммерческой чувствительности.

Какие компоненты входят в открытые продукты Nemotron для улучшения предобучения моделей?

В линейку входят Nemotron-CC для улучшения набора Common Crawl, Nemotron-CC-MATH для развития логического мышления и коллекция Pretraining, охватывающая код и общие темы. Эти компоненты обеспечивают разнообразие данных, предотвращая ситуацию, когда все модели начинают вести себя одинаково из-за обучения на узких наборах.

Как набор Privasis расширяет возможности синтетических данных в чувствительных сферах?

Созданный на основе Nemotron-Personas-USA, этот набор добавляет синтетические записи для медицинских, финансовых, юридических и социальных контекстов с сохранением приватности. Это позволяет обучать системы на специфических сценариях, не нарушая этические нормы и законодательство о защите персональных данных.

Почему внедрение синтетических данных требует гибридного подхода к управлению информацией?

Синтетические данные не заменяют полностью реальные, а интегрируются в общую систему, требуя четкой документации о происхождении каждого элемента. Такой подход необходим для поддержания доверия между организациями, так как дефицитом становится не объем токенов, а уверенность в том, что система обучена на проверенных и корректных данных.

Инфографика событий

Открыть инфографику на весь экран


Участники и связи

Отрасли: ИТ и программное обеспечение; Искусственный интеллект (AI); Бизнес; Передовые технологии

Материалы по теме