Вердикт AI-ReadyНаблюдать и затем тестировать на корпусе AI-Ready; библиотека имеет Apache-2.0, но лицензия весов моделей CC BY-NC 4.0 требует отдельного решения для коммерческого использования.

Что это

маленькие encoder-модели для извлечения основного контента из raw HTML в clean Markdown/HTML, чтобы web pages можно было нормально кормить RAG, crawler-агентам и research pipelines. Проект сегодня был заметен на HN как “pareto-optimal models for cleaning the web”.

Бизнес-проблема

RAG по вебу часто ломается не на LLM, а на мусорном HTML: навигация, footer, ads, related links, cookie banners, sidebars. Pulpie режет страницу до полезного контента.

Практическая польза

для AI-Ready это сильный кандидат на web-to-RAG ingestion layer: AI Radar, content engine, competitor monitoring, wiki sourcing, client knowledge hubs.

Почему интересно сейчас

около 22 stars, 0 forks, 34 commits, 0 issues, 0 PR, 2 releases, свежий pulpie 0.0.2 от 1 июля 2026. Библиотека под Apache-2.0, но веса моделей на HuggingFace указаны как CC BY-NC 4.0, то есть коммерческое использование надо отдельно проверять, потому что лицензии не пишутся для украшения README.

Проверка официального репозитория, README и LICENSE выполнена 2026-07-18; эти данные относятся к текущему наблюдению и не заменяют собственный тест.

Технические особенности

pip install pulpie или pulpie[markdown]; Extractor().extract(html) возвращает Markdown/HTML. Модели: orange-small 210M, orange-base 610M, orange-large 2.1B; заявлены throughput/cost benchmarks против autoregressive extractors, но это нужно повторить на своих страницах.

Значение для AI-Ready

RAG/content component / Test now. Риски: tiny repo, vendor benchmarks, non-commercial model weights, качество русского/румынского и сложных сайтов нужно проверять. Вердикт: Test now на корпусе AI-Ready radar/wiki.

Риски

  • Весы моделей могут ограничивать коммерческое применение, даже если код библиотеки Apache-2.0.
  • Очистка может удалить контекст, нужный для доказательства происхождения утверждения.

Граница вывода

Первый тест - локальный корпус без клиентских данных; не использовать model weights в коммерческом контуре до проверки CC BY-NC 4.0 и provenance output.

Ключевые риски

  • Весы моделей могут ограничивать коммерческое применение, даже если код библиотеки Apache-2.0.
  • Очистка может удалить контекст, нужный для доказательства происхождения утверждения.

Разберите эту страницу со своей LLM

Скопируйте контекст страницы в ChatGPT, Claude, Gemini или другую LLM и попросите применить эту схему к вашему бизнесу.

Можно спросить:

  • Какую ограниченную задачу AI-Ready разумно проверить с помощью pulpie?
  • Какие риски и условия нужно закрыть перед пилотом pulpie?
Открыть каталог