Июль 2026   |   В фокусе

Pulpie очистит веб-страницы в 20 раз быстрее Dripper и снизит затраты на инфраструктуру до $7900

Очистка одного миллиарда веб-страниц теперь обходится в $7 900 вместо $159 000 благодаря переходу на энкодерную архитектуру. Сокращение затрат в 20 раз делает экономически целесообразным обучение языковых моделей на терабайтах данных, где эвристики искажают код и формулы.

Компания Feyn представила семейство моделей Pulpie для очистки веб-страниц от лишнего контента. Решение демонстрирует качество, сопоставимое с текущим эталоном Dripper, но работает в 20 раз быстрее и стоит в 20 раз дешевле при обработке больших объемов данных. Ключевое преимущество новой технологии — архитектура энкодера, позволяющая обрабатывать страницу за один проход, в отличие от последовательной генерации токенов у конкурентов.

Важный нюанс: Переход от декодеров к энкодерам в задачах извлечения текста позволяет снизить затраты на инфраструктуру с $159 000 до $7 900 за очистку одного миллиарда страниц.

Проблема «шума» в данных и влияние на модели

Языковые модели потребляют интернет дважды: при дообучении (pre-training) и при генерации ответов (инференс). В обоих случаях входные данные на 70% состоят из «мусора»: навигации, рекламы, подвалов и боковых панелей. Исследования показывают, что даже незначительное улучшение качества очистки данных напрямую повышает точность моделей.

Эксперименты команды AICC подтвердили: модель, обученная на данных, очищенных алгоритмически, показала на 1.08 процентных пункта более высокую точность по 13 бенчмаркам по сравнению с моделью, обученной на данных, очищенных простыми эвристиками. При этом она обошла модели, обученные на известных фильтрах FineWeb и RefinedWeb.

Плохая очистка не только снижает качество, но и искажает структуру данных. Эвристики часто «ломают» сложные блоки, такие как код или математические формулы. Сравнение показывает разницу в сохранении структуры:

  • Кодовые блоки: эвристика Trafilatura сохраняет сходство на уровне 0.13, модельные методы — 0.91.
  • Формулы: эвристика — 0.61, модельные методы — 0.94.

При генерации ответов наличие даже одного нерелевантного фрагмента может сбить модель с толку, снижая точность и увеличивая затраты на вычисления.

Стоит учесть: Качество очистки данных становится критическим фактором, определяющим итоговую точность ИИ, часто важнее, чем объем обучающей выборки.

Архитектурные решения и сравнение методов

Существующие инструменты делятся на два типа: работающие со структурой HTML (эвристики) и «читающие» содержимое (модели). Эвристики (Trafilatura, Readability) быстрые, но путают похожие элементы, например, таблицу данных и таблицу навигации. Модели-декодеры, такие как Dripper, читают контент, но генерируют метки по одному токену. Это требует постоянного чтения модели из памяти, что делает процесс медленным и дорогим.

Pulpie использует подход энкодера. Модель помечает каждый блок как «контент» или «мусор» за один проход (forward pass). Это переносит ограничение с пропускной способности памяти на вычислительную мощность, что дает значительный прирост скорости.

Сравнение производительности на видеокарте NVIDIA L4:

МодельПараметрыСкорость (страниц/сек)Стоимость очистки 1 млрд страниц
Pulpie Orange Small210 млн13.7$7 900
Pulpie Orange Base610 млн3.9$28 000
Pulpie Orange Large2.1 млрд1.3$83 000
Dripper600 млн0.68$159 000

На более мощной карте NVIDIA A100 разрыв в скорости сохраняется, хотя и меньше: Pulpie Orange Small работает в 7.1 раза быстрее Dripper. Это связано с тем, что декодеры сильно зависят от пропускной способности памяти, которая у L4 значительно ниже, чем у A100.

Обучение и качество моделей

Для создания обучающей выборки команда собрала 16 670 страниц из Common Crawl, разделила их на блоки и разметила с помощью модели DeepSeek V3.2. Для повышения точности использовалась двойная проверка: Dripper 0.6B выступал вторым разметчиком. В финальный набор вошли 14 959 страниц, где разметчики согласились минимум по 70% блоков.

Базовая модель-учитель (Pulpie Orange Large, 2.1 млрд параметров) достигла показателя 0.873 по метрике ROUGE-5 F1 на бенчмарке WebMainBench. Затем знания были переданы (дистиллированы) двум меньшим моделям:

  • Pulpie Orange Base (610 млн параметров): 0.863 ROUGE-5 F1.
  • Pulpie Orange Small (210 млн параметров): 0.862 ROUGE-5 F1.

Модель Pulpie Orange Small показывает результат, сопоставимый с Dripper (0.864), при этом занимая в три раза меньше места. На сложных страницах, где эвристики теряют до 20 пунктов точности, модели-энкодеры теряют лишь около 9 пунктов.

Важный нюанс: Модель Pulpie не имеет ограничений по длине страницы, так как разбивает контент на чанки по 8 192 токена, в то время как Dripper часто не может обработать страницу, превышающую окно в 32 000 токенов.

Практическое применение и доступность

Все модели семейства Pulpie доступны бесплатно в открытом доступе на платформе Hugging Face. Они построены на базе архитектуры EuroBERT и используют единый токенизатор.

Для внедрения в инфраструктуру достаточно установить пакет через pip install pulpie. По умолчанию используется модель Pulpie Orange Small, которая рекомендуется для продакшена благодаря оптимальному балансу скорости и качества. Для задач, где критична максимальная точность, можно выбрать модель Large.

Пайплайн поддерживает пакетную обработку с перекрытием предобработки на CPU и инференса на GPU, что позволяет эффективно использовать ресурсы при работе с большими объемами данных.

Операционные последствия и условия внедрения

  • Снижение затрат на инфраструктуру: Переход на энкодерную архитектуру позволяет сократить расходы на очистку данных в 20 раз, что делает экономически выгодной обработку терабайтов веб-контента даже на бюджетном оборудовании (NVIDIA L4).

  • Зависимость от типа оборудования: Разрыв в производительности между Pulpie и декодерами увеличивается на видеокартах с низкой пропускной способностью памяти. Это означает, что при использовании доступных GPU экономический эффект от внедрения будет максимальным.

  • Улучшение качества данных для обучения: Использование модельной очистки вместо эвристик предотвращает искажение структурированных данных (кода, формул), что напрямую влияет на способность ИИ решать сложные технические задачи.

  • Масштабируемость: Отсутствие жестких ограничений по длине страницы (благодаря чанкированию) позволяет обрабатывать современные многостраничные ресурсы, которые ранее отсеивались или обрезались конкурентами.

Коротко о главном

Какое влияние имеет качество очистки данных на точность ИИ-моделей?

Использование алгоритмической очистки вместо простых эвристик повысило точность модели на 1.08 процентных пункта по 13 бенчмаркам, так как это предотвращает искажение структуры кода и формул.

Сколько стоит очистка одного миллиарда страниц с помощью Pulpie Orange Small?

Стоимость обработки составляет всего $7 900, что в 20 раз меньше затрат на эталонный инструмент Dripper ($159 000) благодаря оптимизации вычислительных ресурсов.

Почему модельные методы лучше сохраняют структуру сложных блоков данных?

В отличие от эвристики Trafilatura, которая сохраняет сходство кода лишь на уровне 0.13, модельные методы достигают показателя 0.91, не «ломая» сложные элементы при фильтрации.

Какие модели были использованы для создания обучающей выборки Pulpie?

Команда разметила 14 959 страниц с помощью модели DeepSeek V3.2 и Dripper 0.6B, включив в финальный набор только те данные, где разметчики согласились минимум по 70% блоков.

Почему Pulpie может обрабатывать страницы любой длины, в отличие от Dripper?

Технология разбивает контент на чанки по 8 192 токена, что позволяет обойти ограничение окна в 32 000 токенов, часто блокирующее работу конкурентов на длинных ресурсах.

Какое оборудование рекомендуется для максимальной экономии при внедрении Pulpie?

Видеокарты NVIDIA L4 с низкой пропускной способностью памяти демонстрируют наибольший прирост производительности (в 20 раз быстрее Dripper), так как декодеры критически зависят от этого параметра.

Инфографика событий

Открыть инфографику на весь экран


Участники и связи

Отрасли: ИТ и программное обеспечение; Искусственный интеллект (AI); Передовые технологии

Материалы по теме