Pulpie очистит веб-страницы в 20 раз быстрее Dripper и снизит затраты на инфраструктуру до $7900
Очистка одного миллиарда веб-страниц теперь обходится в $7 900 вместо $159 000 благодаря переходу на энкодерную архитектуру. Сокращение затрат в 20 раз делает экономически целесообразным обучение языковых моделей на терабайтах данных, где эвристики искажают код и формулы.
Компания Feyn представила семейство моделей Pulpie для очистки веб-страниц от лишнего контента. Решение демонстрирует качество, сопоставимое с текущим эталоном Dripper, но работает в 20 раз быстрее и стоит в 20 раз дешевле при обработке больших объемов данных. Ключевое преимущество новой технологии — архитектура энкодера, позволяющая обрабатывать страницу за один проход, в отличие от последовательной генерации токенов у конкурентов.
Важный нюанс: Переход от декодеров к энкодерам в задачах извлечения текста позволяет снизить затраты на инфраструктуру с $159 000 до $7 900 за очистку одного миллиарда страниц.
Проблема «шума» в данных и влияние на модели
Языковые модели потребляют интернет дважды: при дообучении (pre-training) и при генерации ответов (инференс). В обоих случаях входные данные на 70% состоят из «мусора»: навигации, рекламы, подвалов и боковых панелей. Исследования показывают, что даже незначительное улучшение качества очистки данных напрямую повышает точность моделей.
Эксперименты команды AICC подтвердили: модель, обученная на данных, очищенных алгоритмически, показала на 1.08 процентных пункта более высокую точность по 13 бенчмаркам по сравнению с моделью, обученной на данных, очищенных простыми эвристиками. При этом она обошла модели, обученные на известных фильтрах FineWeb и RefinedWeb.
Плохая очистка не только снижает качество, но и искажает структуру данных. Эвристики часто «ломают» сложные блоки, такие как код или математические формулы. Сравнение показывает разницу в сохранении структуры:
- Кодовые блоки: эвристика Trafilatura сохраняет сходство на уровне 0.13, модельные методы — 0.91.
- Формулы: эвристика — 0.61, модельные методы — 0.94.
При генерации ответов наличие даже одного нерелевантного фрагмента может сбить модель с толку, снижая точность и увеличивая затраты на вычисления.
Стоит учесть: Качество очистки данных становится критическим фактором, определяющим итоговую точность ИИ, часто важнее, чем объем обучающей выборки.
Архитектурные решения и сравнение методов
Существующие инструменты делятся на два типа: работающие со структурой HTML (эвристики) и «читающие» содержимое (модели). Эвристики (Trafilatura, Readability) быстрые, но путают похожие элементы, например, таблицу данных и таблицу навигации. Модели-декодеры, такие как Dripper, читают контент, но генерируют метки по одному токену. Это требует постоянного чтения модели из памяти, что делает процесс медленным и дорогим.
Pulpie использует подход энкодера. Модель помечает каждый блок как «контент» или «мусор» за один проход (forward pass). Это переносит ограничение с пропускной способности памяти на вычислительную мощность, что дает значительный прирост скорости.
Сравнение производительности на видеокарте NVIDIA L4:
| Модель | Параметры | Скорость (страниц/сек) | Стоимость очистки 1 млрд страниц |
|---|---|---|---|
| Pulpie Orange Small | 210 млн | 13.7 | $7 900 |
| Pulpie Orange Base | 610 млн | 3.9 | $28 000 |
| Pulpie Orange Large | 2.1 млрд | 1.3 | $83 000 |
| Dripper | 600 млн | 0.68 | $159 000 |
На более мощной карте NVIDIA A100 разрыв в скорости сохраняется, хотя и меньше: Pulpie Orange Small работает в 7.1 раза быстрее Dripper. Это связано с тем, что декодеры сильно зависят от пропускной способности памяти, которая у L4 значительно ниже, чем у A100.
Обучение и качество моделей
Для создания обучающей выборки команда собрала 16 670 страниц из Common Crawl, разделила их на блоки и разметила с помощью модели DeepSeek V3.2. Для повышения точности использовалась двойная проверка: Dripper 0.6B выступал вторым разметчиком. В финальный набор вошли 14 959 страниц, где разметчики согласились минимум по 70% блоков.
Базовая модель-учитель (Pulpie Orange Large, 2.1 млрд параметров) достигла показателя 0.873 по метрике ROUGE-5 F1 на бенчмарке WebMainBench. Затем знания были переданы (дистиллированы) двум меньшим моделям:
- Pulpie Orange Base (610 млн параметров): 0.863 ROUGE-5 F1.
- Pulpie Orange Small (210 млн параметров): 0.862 ROUGE-5 F1.
Модель Pulpie Orange Small показывает результат, сопоставимый с Dripper (0.864), при этом занимая в три раза меньше места. На сложных страницах, где эвристики теряют до 20 пунктов точности, модели-энкодеры теряют лишь около 9 пунктов.
Важный нюанс: Модель Pulpie не имеет ограничений по длине страницы, так как разбивает контент на чанки по 8 192 токена, в то время как Dripper часто не может обработать страницу, превышающую окно в 32 000 токенов.
Практическое применение и доступность
Все модели семейства Pulpie доступны бесплатно в открытом доступе на платформе Hugging Face. Они построены на базе архитектуры EuroBERT и используют единый токенизатор.
Для внедрения в инфраструктуру достаточно установить пакет через pip install pulpie. По умолчанию используется модель Pulpie Orange Small, которая рекомендуется для продакшена благодаря оптимальному балансу скорости и качества. Для задач, где критична максимальная точность, можно выбрать модель Large.
Пайплайн поддерживает пакетную обработку с перекрытием предобработки на CPU и инференса на GPU, что позволяет эффективно использовать ресурсы при работе с большими объемами данных.
Операционные последствия и условия внедрения
Снижение затрат на инфраструктуру: Переход на энкодерную архитектуру позволяет сократить расходы на очистку данных в 20 раз, что делает экономически выгодной обработку терабайтов веб-контента даже на бюджетном оборудовании (NVIDIA L4).
Зависимость от типа оборудования: Разрыв в производительности между Pulpie и декодерами увеличивается на видеокартах с низкой пропускной способностью памяти. Это означает, что при использовании доступных GPU экономический эффект от внедрения будет максимальным.
Улучшение качества данных для обучения: Использование модельной очистки вместо эвристик предотвращает искажение структурированных данных (кода, формул), что напрямую влияет на способность ИИ решать сложные технические задачи.
Масштабируемость: Отсутствие жестких ограничений по длине страницы (благодаря чанкированию) позволяет обрабатывать современные многостраничные ресурсы, которые ранее отсеивались или обрезались конкурентами.
Источник: huggingface.co