#OCR

Публикаций: 5

Marker v2 против всех: новый лидер парсинга документов

Datalab переписали Marker как трёхрежимный пайплайн — версия 2 набирает 76.0 на olmOCR-bench и держит 2.9 страницы в секунду на одном GPU B200. MinerU отстаёт по скорости в пять раз, Docling проигрывает по обоим показателям сразу.

OCR без потолка: конвейер Baidu для тяжёлых документов и PDF

MarkTechPost опубликовал end-to-end туториал по Baidu Unlimited-OCR — модели для распознавания текста в высокоразрешённых изображениях и многостраничных PDF. Пайплайн покрывает настройку GPU-окружения, два режима инференса и обработку плотных таблиц с кросс-страничным контентом.

OCRmyPDF: превращаем горы сканов в поисковую базу за один скрипт

OCRmyPDF — open-source Python-инструмент, который добавляет настоящий текстовый слой к отсканированным PDF через Tesseract. Берёт папку с тысячами документов, прогоняет батчем и отдаёт архивный PDF/A плюс sidecar.txt — готовый к индексации и RAG-пайплайнам.

RevPDF 4.0: бесплатный офлайн-редактор PDF против Adobe Acrobat

Вышла четвёртая версия RevPDF — бесплатного кроссплатформенного редактора PDF, который работает полностью без интернета, без аккаунта и без облака. Полный рерайт интерфейса, встроенный OCR и реальное редактирование текста внутри файла — не поверх него.

Шесть YOLO-моделей читают чертёж вместо технолога

Команда из машиностроительного производства построила пайплайн, который извлекает параметры детали из PDF-чертежа автоматически — тип, габариты, квалитеты, шероховатости, резьбы, материал, масса — и отдаёт их в калькулятор стоимости в виде JSON. До автоматизации каждый чертёж занимал у технолога от 5 до 15 минут ручной работы.

← Все статьи