Июль 2026   |   В фокусе

DoctoBERT: локальный ИИ для медицины без утечки данных пациентов

Медицинские ИИ-модели теперь можно запускать на локальном оборудовании, полностью исключая риск утечки данных пациентов в облако. Это меняет правила игры для клиник: точный анализ диагнозов и лекарств становится доступным без дорогих серверов и зависимости от внешних провайдеров.

Команда Doctolib выпустила DoctoBERT — набор предобученных моделей для анализа медицинских текстов на французском языке. В отличие от универсальных языковых моделей, эти инструменты оптимизированы для извлечения конкретных данных: названий лекарств, симптомов и диагнозов. Ключевое преимущество решения — возможность запуска на локальном оборудовании без отправки чувствительных данных пациентов в облако. Модели обучены на корпусе FineMed, содержащем 19,2 млрд слов, что обеспечивает высокую точность на специализированных задачах.

Важный нюанс: Использование специализированных энкодеров вместо генеративных моделей позволяет снизить затраты на вычисления и ускорить обработку, так как система анализирует текст за один проход, а не строит ответ посимвольно.

Выбор архитектуры и базовые возможности

Разработчики предлагают две версии модели, доступные по лицензии Apache-2.0. Выбор зависит от требований к длине контекста и скорости обработки.

  • DoctoBERT-fr-base: Архитектура RoBERTa, 111 млн параметров, контекст до 512 токенов. Подходит для классических стеков.
  • DoctoModernBERT-fr-base: Архитектура ModernBERT, 149 млн параметров, контекст до 8192 токенов. Рекомендуемый вариант для большинства задач благодаря эффективной пакетной обработке и поддержке длинных записей.

На практике разница в понимании контекста очевидна. При анализе фразы «при боли в груди следует заподозрить...» общая модель предлагает общие слова вроде «лечение» или «врач». DoctoModernBERT сразу выдает конкретные диагнозы: «пневмоторакс», «инфаркт», «ангина». Это происходит потому, что модель видела эти термины тысячи раз в процессе обучения на клинических текстах, в то время как общие модели встречали их редко.

Практическое применение: от извлечения сущностей до поиска

Для реальных задач базовую модель необходимо дообучить (fine-tune) на конкретных данных. В статье приведены три сценария использования с готовыми инструкциями.

1. Распознавание именованных сущностей (NER)Задача: найти в тексте названия лекарств, болезней и анатомических структур.

  • Данные: Используется бенчмарк QUAERO (раздел EMEA — листовки к лекарствам).
  • Результат: Модель достигает рекордных показателей точности (F1-score) на публичных тестах.
  • Особенность: Система учится помечать не просто слова, а их границы. Например, слово «Prialt» (лекарство) помечается как химическое вещество, а «enfant» (ребенок) — как живой организм.

2. Классификация документовЗадача: определить специальность или диагностическую группу документа.

  • Данные: Датасет MORFITT, где одна статья может относиться к нескольким специальностям одновременно (многометочная классификация).
  • Пример: Статья о дерматите у животных классифицируется сразу как «ветеринария» и «иммунология».
  • Метрика: Оценка проводится по микро-F1, объединяющей точность и полноту для всех классов.

3. Семантический поиск и сходствоЗадача: найти похожие клинические случаи или релевантные отрывки в базе знаний.

  • Механизм: Модель преобразует предложения в векторы (эмбеддинги), сравнивая их косинусное сходство.
  • Данные: Корпус CLISTER с парами предложений и оценкой их схожести от 0 до 5.
  • Результат: Система корректно определяет, что «рентген показал задержку секреции» и «рентген показал расширение мочеточника» — это схожие по смыслу описания.

Стоит учесть: Для задач поиска (retrieval) в продакшене можно использовать продвинутые методы позднего взаимодействия (late interaction), такие как ColBERT, которые сохраняют вектор для каждого токена, повышая точность сопоставления сложных медицинских описаний.

Развертывание и оптимизация производительности

Для внедрения в производственную среду разработчики дают четкие рекомендации по ускорению работы и снижению требований к железу.

  • Работа на GPU: Рекомендуется использовать полуточность (bfloat16) и технологию Flash Attention 2 для модели ModernBERT. Это позволяет эффективно обрабатывать длинные тексты без потери скорости.
  • Пакетная обработка: Модели с 111–149 млн параметров способны обрабатывать большие объемы данных за один раз. Использование API с параметром batch_size=64 значительно ускоряет работу.
  • Запуск на CPU: Если видеокарты нет, модель можно конвертировать в формат ONNX и квантовать до int8. Это дает максимальный прирост производительности на обычных процессорах, что критично для работы в изолированных сетях больниц.

Важно: Дообучение модели на собственных данных занимает всего несколько минут на одной видеокарте, что позволяет быстро адаптировать инструмент под специфику конкретного учреждения.

Операционные последствия и технические барьеры

  • Требования к данным: Для успешного дообучения необходим размеченный датасет. Хотя базовые модели уже обучены на 19,2 млрд слов, для точного распознавания внутренних терминов клиники или специфических протоколов потребуются примеры с метками (например, BIO-схема для NER).
  • Зависимость от инфраструктуры: Высокая скорость работы достигается только при использовании современных GPU с поддержкой Flash Attention. На старом оборудовании или без оптимизации (ONNX) задержки могут быть неприемлемыми для интерактивных систем.
  • Языковой барьер: Текущая версия работает только с французским языком. Для других языков потребуется повторение процесса сбора данных и обучения с нуля, так как медицинские термины и синтаксис сильно различаются.
  • Риск галлюцинаций: В отличие от генеративных моделей, энкодеры не «выдумывают» текст, а лишь классифицируют или извлекают. Это снижает риск получения ложной медицинской информации, но требует точной настройки порогов уверенности при классификации.

Контекст и последствия

Источник: Статья опубликована в сообществе Hugging Face авторами Doctolib Lab (Bofeng Huang, Emma Scharfmann и др.) 9 июля 2026 года.

Ключевые цифры и продукты:

  • FineMed: Корпус из 19,2 млрд слов.
  • FineMed-rephrased: Подкорпус из 4,5 млрд слов, перефразированных ИИ.
  • Модели: DoctoBERT-fr-base (111M параметров), DoctoModernBERT-fr-base (149M параметров).
  • Лицензия: Apache-2.0.
  • Платформа: Hugging Face Hub (репозиторий doctolib-lab).

Сигнал для рынка:Появление открытых, легких и эффективных медицинских энкодеров меняет подход к внедрению ИИ в здравоохранении. Компании больше не обязаны использовать тяжелые облачные решения для базовых задач анализа текста. Возможность запускать точные модели локально решает главную проблему отрасли — конфиденциальность данных пациентов. Это может ускорить автоматизацию рутинных процессов (кодирование диагнозов, поиск анамнеза) в клиниках, где доступ к публичным API ограничен.

Коротко о главном

Какой объем данных использовался для обучения моделей?

Дообучение проводилось на корпусе FineMed, содержащем 19,2 млрд слов, включая подкорпус из 4,5 млрд перефразированных ИИ предложений. Такая масштабная база специализированных текстов позволила достичь высокой точности при распознавании медицинских терминов и диагнозов.

В чем ключевое преимущество архитектуры ModernBERT перед базовой версией?

Версия DoctoModernBERT-fr-base поддерживает контекст до 8192 токенов против 512 у базовой модели, что критично для анализа длинных медицинских записей. Благодаря этому система способна сразу выдавать конкретные диагнозы, такие как «пневмоторакс», вместо общих понятий, которые предлагают универсальные модели.

Как энкодеры снижают риск появления ложной медицинской информации?

В отличие от генеративных моделей, создающих текст посимвольно, эти инструменты работают как классификаторы и извлекатели, анализируя текст за один проход. Это архитектурное решение исключает возможность «галлюцинаций» или выдумывания несуществующих фактов, характерных для генеративных нейросетей.

Какие методы оптимизации позволяют запускать модель на обычных процессорах?

Для работы без видеокарт модель конвертируется в формат ONNX и квантуется до int8, что обеспечивает максимальный прирост производительности на CPU. Это делает внедрение возможным даже в изолированных сетях больниц, где отсутствует современное GPU-оборудование.

Сколько времени занимает адаптация модели под специфику конкретного учреждения?

Дообучение на собственных размеченных данных требует всего нескольких минут работы на одной видеокарте. Такая скорость позволяет быстро настраивать инструмент под внутренние термины клиники или специфические протоколы лечения.

Почему текущая версия DoctoBERT не может быть использована для других языков?

Модель обучена исключительно на французском языке, где медицинский синтаксис и терминология имеют уникальные особенности. Перенос решения на другие языки потребует полного повторения процесса сбора данных и обучения с нуля из-за значительных различий в структуре текстов.

Инфографика событий

Открыть инфографику на весь экран


Участники и связи

Отрасли: ИТ и программное обеспечение; Искусственный интеллект (AI); Здоровье и медицина; Медицинские технологии

Материалы по теме