Datalab выпустили Marker v2 — полный рерайт популярного open-source парсера документов. Теперь это трёхрежимный пайплайн, который набирает 76.0 баллов на olmOCR-bench и устойчиво обрабатывает 2.9 страницы в секунду на одном GPU NVIDIA B200. По скорости это более чем в 5 раз превосходит MinerU в pipeline-режиме, а по точности — опережает Docling сразу по обоим метрикам из сравнения.
Контекст
Парсинг неструктурированных документов — PDF, сканов, таблиц — давно является узким местом любого RAG-пайплайна или агентной системы. Качество извлечения текста напрямую определяет качество контекста, который получает LLM. Плохой парсинг = галлюцинации даже при мощной модели. Именно поэтому гонка инструментов в этом сегменте идёт активно.
Marker — open-source проект от Datalab, конвертирует PDF и другие форматы в чистый Markdown с сохранением структуры таблиц, заголовков и формул. MinerU — китайский конкурент с акцентом на многоязычные документы и сложные макеты. Docling — библиотека от IBM для корпоративного рынка. LiteParse — лёгкий вариант для сценариев с минимальными вычислительными требованиями.
До v2 часть разработчиков уходила от Marker к альтернативам именно из-за скорости на больших объёмах. Полный рерайт архитектуры меняет этот расклад.
Аналитика
Трёхрежимный подход — архитектурное решение, а не маркетинг: один инструмент покрывает разные сценарии нагрузки и требований к точности. Это убирает необходимость держать несколько библиотек в стеке и управлять их совместимостью.
Скоростной показатель 2.9 стр/с на одном B200 важен в контексте enterprise-нагрузки: при обработке тысяч документов в день разница между медленным и быстрым парсером — это разница между несколькими серверами и одним. Сокращение инфраструктурных расходов линейное. Та же архитектура будет масштабироваться вниз на менее дорогие GPU — для SMB это означает доступный self-hosted вариант.
Для рынка результат подтверждает тренд: open-source document AI быстро закрывает разрыв с проприетарными облачными решениями — и делает это без vendor lock-in и без передачи корпоративных данных наружу. Для команд в КР и СНГ, где регулирование данных или бюджет ограничивают использование западных cloud-сервисов, это полноценная альтернатива.
Кейсы применения в бизнесе
B2B SaaS стартап с document-heavy пайплайном. Если продукт принимает PDF на вход — договоры, финансовые отчёты, технические спецификации — Marker v2 встраивается в ingestion-шаг перед векторным поиском или LLM. Чистый Markdown на выходе — стандартный формат для чанкинга в RAG. Результат: выше релевантность ответов, меньше галлюцинаций из-за битого контекста.
Корпорация с legacy-архивом. Тысячи PDF в файловых хранилищах — типичная ситуация в банках, страховых компаниях, госструктурах. Batch-обработка через Marker v2 переводит их в индексируемые Markdown-файлы, после чего поверх можно запустить корпоративный AI-ассистент или полнотекстовый поиск. Без ручного разбора.
SMB и локальный бизнес в КР. Юридические конторы, бухгалтерские фирмы, торговые компании работают со сканами актов, договоров, накладных. Marker v2 плюс несложный Python-скрипт плюс Haiku-класс LLM — автоматическое извлечение реквизитов и сумм без ручного ввода. Стоимость — собственная инфраструктура, а не ежемесячная SaaS-подписка.
Кейсы в личной жизни
Разработчик. Строишь локальный RAG поверх технической документации, книг или research papers? Marker v2 — замена ручному copy-paste и всем кривым PDF-парсерам в пайплайне. Одна команда, чистый вывод, работает полностью офлайн.
Контент-мейкер и исследователь. arXiv-статьи, whitepaper'ы, аналитические отчёты приходят в PDF. Пропустить их через Marker v2 и отдать Claude для саммаризации или генерации скриптов — занимает секунды, а не минуты ручной работы с форматированием.
Студент или фрилансер. Конвертация учебников, лекционных слайдов, клиентских контрактов в Markdown — это и поиск по содержимому, и готовый материал для AI-ассистента. Установка через pip, запуск одной командой в терминале.
Переход с mediocrного парсера на Marker v2 — это не оптимизация. Это исправление фундамента, на котором стоит вся точность вашего AI-продукта.
Как применить сегодня
- Установить:
pip install marker-pdf— запустить на реальном рабочем PDF за 5 минут. - Сравнить вывод с текущим решением (PyMuPDF, pdfplumber, Docling) — особенно на таблицах и многоколоночных документах, где разница наиболее заметна.
- Если уже есть RAG-пайплайн: заменить ingestion-шаг на Marker v2 и замерить качество ответов LLM на нескольких тестовых запросах к документу.
- Для batch-обработки архивов — протестировать pipeline-режим на выборке из 100+ документов и оценить throughput до масштабирования на всю базу.
- Следить за репозиторием Datalab: активная разработка означает, что поддержка форматов и режимов будет расширяться.