Июль 2026   |   В фокусе

Модель LightOnOCR-2-1B в 9 раз меньше и в 3.3 раза быстрее конкурентов

Модель распознавания документов в 9 раз меньше конкурентов, но обрабатывает страницы в 3.3 раза быстрее, сводя к минимуму затраты на серверную инфраструктуру. Отказ от сложных многоэтапных конвейеров устраняет лишние точки отказа и позволяет запускать точную транскрипцию на стандартном оборудовании без потери качества.

Команда LightOnAI представила модель LightOnOCR-2-1B — второе поколение инструмента для преобразования страниц документов в чистый текст. Это решение работает без сложных многоэтапных конвейеров, выдавая результат напрямую. На тестовом стенде OlmOCR-Bench модель показала лучший результат среди протестированных систем, набрав 83.2 балла. При этом она в 9 раз меньше по объему параметров, чем ближайший конкурент Chandra-9B, и работает в 3.3 раза быстрее.

Производительность и скорость обработки

Главное преимущество нового решения — баланс между точностью и скоростью. Модель оптимизирована для работы в промышленных масштабах, где пропускная способность критична. Тестирование проводилось на одной видеокарте NVIDIA H100 (80 ГБ) с полной загрузкой бенчмарка из 1,403 страниц.

Сравнение скорости обработки (страниц в секунду) с другими популярными решениями:

  • Chandra OCR: LightOnOCR-2 работает в 3.3 раза быстрее.
  • OlmOCR: Ускорение составляет 1.7 раза.
  • dots.ocr: Модель опережает конкурента в 5 раз.
  • PaddleOCR-VL-0.9B: Скорость выше в 2 раза.
  • DeepSeekOCR: Преимущество составляет 1.73 раза.

Важный нюанс: Высокая скорость достигается не за счет упрощения алгоритмов, а благодаря оптимизации архитектуры под современные видеокарты, что позволяет обрабатывать большие объемы данных без потери качества транскрипции.

Семейство моделей и специализированные задачи

Разработчики не ограничиваются одной версией, предлагая набор контрольных точек (чекпоинтов) под разные задачи. Это позволяет бизнесу выбрать оптимальный инструмент без лишней нагрузки на систему.

  • LightOnOCR-2-1B: Базовая версия для чистой транскрипции текста из PDF в Markdown. Рекомендована для большинства сценариев.
  • LightOnOCR-2-1B-bbox: Специализированная версия для локализации. Помимо текста, она выдает координаты (bounding boxes) для встроенных изображений и фигур.
  • LightOnOCR-2-1B-ocr-soup: Компромиссный вариант, объединяющий сильные стороны транскрипции и локализации.
  • Base checkpoints: Базовые модели (с поддержкой bbox и без) для дообучения на собственных данных или экспериментов с методами обучения с подкреплением.

Доступность данных и интеграция

Для повторения результатов и адаптации моделей под конкретные ниши компания открыла доступ к обучающим наборам данных.

  • LightOnOCR-mix-0126: Более 16 млн страниц документов с качественной разметкой.
  • LightOnOCR-bbox-mix-0126: Около 500 тыс. аннотаций с выделением границ изображений.

Модель интегрирована в экосистему Hugging Face Transformers. Это упрощает внедрение:

  • Запуск возможен через стандартные инструменты без необходимости использования специализированных фреймворков вроде vLLM.
  • Поддержка методов дообучения LoRA и PEFT.
  • Возможность работы на процессорах (CPU) для задач с низкой нагрузкой, что снижает требования к железу.

Стоит учесть: Открытый доступ к обучающим данным и рецептам обучения позволяет компаниям создавать узкоспециализированные версии модели под свои документы, не начиная разработку с нуля.

Операционные последствия и практическое применение

Внедрение LightOnOCR-2-1B меняет подход к автоматизации документооборота, особенно для компаний, работающих с большими объемами сканов и научных статей.

  • Снижение затрат на инфраструктуру: Возможность работы на одной видеокарте NVIDIA H100 с высокой пропускной способностью позволяет сократить количество серверов для обработки тех же объемов данных по сравнению с предыдущими поколениями моделей.
  • Упрощение архитектуры: Отказ от многоэтапных конвейеров (где один модуль распознает текст, другой — структуру, третий — изображения) снижает сложность поддержки и количество точек отказа в системе.
  • Гибкость под задачи: Наличие отдельных моделей для локализации изображений позволяет бизнесу не перегружать основной процесс распознавания текста, если координаты фигур не нужны, или, наоборот, использовать специализированную версию для задач верстки.
  • Доступность для локального развертывания: Поддержка запуска через стандартные библиотеки и возможность работы на CPU открывают возможности для внедрения в системах с ограниченным доступом к облачным мощностям или жесткими требованиями к безопасности данных.

Коротко о главном

Во сколько раз модель LightOnOCR-2-1B быстрее конкурента Chandra-9B при меньшем объеме параметров?

Решение работает в 3.3 раза быстрее и содержит в 9 раз меньше параметров, что достигнуто за счет оптимизации архитектуры под современные видеокарты без потери качества транскрипции.

На каком оборудовании проводилось тестирование производительности и сколько страниц было обработано?

Тестирование выполнялось на одной видеокарте NVIDIA H100 с памятью 80 ГБ, что позволило полностью загрузить бенчмарк из 1,403 страниц для оценки пропускной способности.

Какие специализированные версии модели доступны для задач локализации изображений?

Разработчики выпустили версию LightOnOCR-2-1B-bbox, которая выдает координаты границ для встроенных фигур, и компромиссный вариант ocr-soup, объединяющий функции транскрипции и локализации.

Какие объемы обучающих данных открыты для повторения результатов и дообучения?

Компания предоставила доступ к набору LightOnOCR-mix-0126, содержащему более 16 млн страниц документов, и набору bbox-mix-0126 с около 500 тыс. аннотаций границ изображений.

Как интеграция в экосистему Hugging Face Transformers упрощает внедрение модели?

Модель запускается через стандартные инструменты без необходимости использования специализированных фреймворков вроде vLLM и поддерживает методы дообучения LoRA и PEFT.

Какое влияние на инфраструктуру оказывает возможность работы модели на процессорах (CPU)?

Поддержка запуска на CPU позволяет внедрять решение в системах с ограниченным доступом к облачным мощностям или жесткими требованиями к безопасности данных, снижая требования к железу.

Инфографика событий

Открыть инфографику на весь экран


Участники и связи

Отрасли: ИТ и программное обеспечение; Искусственный интеллект (AI); Бизнес; Цифровизация и технологии

Материалы по теме