NVIDIA и Google открыли доступ к 3D-структурам тысяч вирусов для ускорения разработки вакцин
NVIDIA и Google DeepMind открыли доступ к 3D-структурам белков более 2800 вирусов, что позволяет ученым мгновенно моделировать патогены без дорогостоящих лабораторных экспериментов. Этот ресурс ускоряет разработку вакцин и готовит научное сообщество к новым эпидемиям, вероятность которых оценивается в 50% к 2050 году.
NVIDIA, Google DeepMind и Европейский институт молекулярной биологии (EMBL-EBI) сделали общедоступным набор данных с предсказанными трехмерными структурами белковых комплексов свыше 2800 видов вирусов. Материалы опубликованы в базе AlphaFold Database, что позволяет ученым по всему миру изучать механизмы работы патогенов без проведения дорогостоящих экспериментов.
Инициатива направлена на подготовку к возможным будущим пандемиям. По оценкам Центра глобального развития, вероятность того, что мир столкнется с эпидемией уровня COVID-19 к 2050 году, составляет около 50%. В отличие от ситуации с коронавирусом, для которого существовали предшествующие исследования, новые вирусы могут появиться без предварительной научной базы.
Как ИИ ускоряет изучение вирусов
Традиционные методы определения структуры белка требуют его кристаллизации и рентгеновской дифракции. Этот процесс занимает годы и стоит тысячи долларов за одну структуру. Алгоритм AlphaFold2, оптимизированный с помощью ускорителей NVIDIA BioNeMo Inference Runtime, предсказывает структуру в течение минут.
Ключевые особенности нового набора данных:
- Масштаб: Покрыты вирусные семейства, известные как инфекции человека — от вирусов простуды до Mpox (оспы обезьян).
- Новизна: Около 30% описанных белковых взаимодействий ранее не были задокументированы в Protein Data Bank (основном хранилище экспериментальных данных о структурах белков).
- Доступность: Данные размещены в открытом доступе, что снижает барьеры для исследователей из стран с ограниченными ресурсами.
Открытый доступ к данным позволяет ученым из развивающихся стран участвовать в разработке диагностических средств и вакцин наравне с ведущими лабораториями, сокращая разрыв в скорости реагирования на вспышки заболеваний.
От последовательности генов к готовой модели
NVIDIA также выпустила публично BioNeMo Structure Prediction Pipeline — рабочий процесс на базе графических процессоров (GPU), который использовался для генерации данных. Это позволяет исследователям самостоятельно загружать последовательности белков своих целей и получать их предсказанные 3D-структуры.
Белки редко работают поодиночке: они объединяются в комплексы, которые выполняют сложные функции. Именно эти комплексы часто становятся мишенями для вакцин и лекарств. Понимание того, как белки взаимодействуют внутри вирусного протеома (набора всех белков вируса), критически важно для создания эффективных терапевтических средств.
Практическое значение для науки
Для научного сообщества это означает переход от гипотетических моделей к конкретным структурным данным. Исследователи могут использовать предсказания ИИ как отправную точку, а затем верифицировать наиболее точные результаты экспериментальными методами.
- Ускорение фундаментальной науки: Докторанты и исследователи получают доступ к высококачественным структурным данным для вирусов, которые ранее изучались «в темноте», без известных структур.
- Генерация гипотез: База данных служит инструментом для проверки теорий о взаимодействии белков, что ускоряет поиск новых мишеней для препаратов.
- Подготовка к неизвестным угрозам: Накопление знаний о структуре вирусных комплексов создает «банк» информации, который можно использовать при возникновении новой угрозы, даже если конкретный штамм ранее не изучался.
Релиз данных совпал с заседанием Генеральной Ассамблеи ООН по вопросам предотвращения пандемий в Нью-Йорке. База AlphaFold Database теперь содержит более 260 миллионов предсказаний структур белков и их комплексов, охватывая практически все каталогизированные белки, известные науке.
Подтверждение: blogs.nvidia.com