← Все статьи
2026-07-25 12:02 · 🤖 AI World

Marker v2 против всех: новый лидер парсинга документов

Datalab переписали Marker как трёхрежимный пайплайн — версия 2 набирает 76.0 на olmOCR-bench и держит 2.9 страницы в секунду на одном GPU B200. MinerU отстаёт по скорости в пять раз, Docling проигрывает по обоим показателям сразу.

Marker v2 против всех: новый лидер парсинга документов

Datalab выпустили Marker v2 — полный рерайт популярного open-source парсера документов. Теперь это трёхрежимный пайплайн, который набирает 76.0 баллов на olmOCR-bench и устойчиво обрабатывает 2.9 страницы в секунду на одном GPU NVIDIA B200. По скорости это более чем в 5 раз превосходит MinerU в pipeline-режиме, а по точности — опережает Docling сразу по обоим метрикам из сравнения.

Контекст

Парсинг неструктурированных документов — PDF, сканов, таблиц — давно является узким местом любого RAG-пайплайна или агентной системы. Качество извлечения текста напрямую определяет качество контекста, который получает LLM. Плохой парсинг = галлюцинации даже при мощной модели. Именно поэтому гонка инструментов в этом сегменте идёт активно.

Marker — open-source проект от Datalab, конвертирует PDF и другие форматы в чистый Markdown с сохранением структуры таблиц, заголовков и формул. MinerU — китайский конкурент с акцентом на многоязычные документы и сложные макеты. Docling — библиотека от IBM для корпоративного рынка. LiteParse — лёгкий вариант для сценариев с минимальными вычислительными требованиями.

До v2 часть разработчиков уходила от Marker к альтернативам именно из-за скорости на больших объёмах. Полный рерайт архитектуры меняет этот расклад.

Аналитика

Трёхрежимный подход — архитектурное решение, а не маркетинг: один инструмент покрывает разные сценарии нагрузки и требований к точности. Это убирает необходимость держать несколько библиотек в стеке и управлять их совместимостью.

Скоростной показатель 2.9 стр/с на одном B200 важен в контексте enterprise-нагрузки: при обработке тысяч документов в день разница между медленным и быстрым парсером — это разница между несколькими серверами и одним. Сокращение инфраструктурных расходов линейное. Та же архитектура будет масштабироваться вниз на менее дорогие GPU — для SMB это означает доступный self-hosted вариант.

Для рынка результат подтверждает тренд: open-source document AI быстро закрывает разрыв с проприетарными облачными решениями — и делает это без vendor lock-in и без передачи корпоративных данных наружу. Для команд в КР и СНГ, где регулирование данных или бюджет ограничивают использование западных cloud-сервисов, это полноценная альтернатива.

Кейсы применения в бизнесе

B2B SaaS стартап с document-heavy пайплайном. Если продукт принимает PDF на вход — договоры, финансовые отчёты, технические спецификации — Marker v2 встраивается в ingestion-шаг перед векторным поиском или LLM. Чистый Markdown на выходе — стандартный формат для чанкинга в RAG. Результат: выше релевантность ответов, меньше галлюцинаций из-за битого контекста.

Корпорация с legacy-архивом. Тысячи PDF в файловых хранилищах — типичная ситуация в банках, страховых компаниях, госструктурах. Batch-обработка через Marker v2 переводит их в индексируемые Markdown-файлы, после чего поверх можно запустить корпоративный AI-ассистент или полнотекстовый поиск. Без ручного разбора.

SMB и локальный бизнес в КР. Юридические конторы, бухгалтерские фирмы, торговые компании работают со сканами актов, договоров, накладных. Marker v2 плюс несложный Python-скрипт плюс Haiku-класс LLM — автоматическое извлечение реквизитов и сумм без ручного ввода. Стоимость — собственная инфраструктура, а не ежемесячная SaaS-подписка.

Кейсы в личной жизни

Разработчик. Строишь локальный RAG поверх технической документации, книг или research papers? Marker v2 — замена ручному copy-paste и всем кривым PDF-парсерам в пайплайне. Одна команда, чистый вывод, работает полностью офлайн.

Контент-мейкер и исследователь. arXiv-статьи, whitepaper'ы, аналитические отчёты приходят в PDF. Пропустить их через Marker v2 и отдать Claude для саммаризации или генерации скриптов — занимает секунды, а не минуты ручной работы с форматированием.

Студент или фрилансер. Конвертация учебников, лекционных слайдов, клиентских контрактов в Markdown — это и поиск по содержимому, и готовый материал для AI-ассистента. Установка через pip, запуск одной командой в терминале.

Переход с mediocrного парсера на Marker v2 — это не оптимизация. Это исправление фундамента, на котором стоит вся точность вашего AI-продукта.

Как применить сегодня

  • Установить: pip install marker-pdf — запустить на реальном рабочем PDF за 5 минут.
  • Сравнить вывод с текущим решением (PyMuPDF, pdfplumber, Docling) — особенно на таблицах и многоколоночных документах, где разница наиболее заметна.
  • Если уже есть RAG-пайплайн: заменить ingestion-шаг на Marker v2 и замерить качество ответов LLM на нескольких тестовых запросах к документу.
  • Для batch-обработки архивов — протестировать pipeline-режим на выборке из 100+ документов и оценить throughput до масштабирования на всю базу.
  • Следить за репозиторием Datalab: активная разработка означает, что поддержка форматов и режимов будет расширяться.
← Все статьи