Главная страница » Блог » Технологические новости​ » Быстрый способ вытащить текст из PDF без облаков

Быстрый способ вытащить текст из PDF без облаков

Наткнулся на отличный опенсорсный инструмент для тех, кто устал вручную копировать данные из сложных документов. Главная фишка здесь в скорости — утилита переваривает больше сотни страниц в секунду прямо на процессоре. При этом всё работает полностью локально, так что за приватность документов можно не переживать.

Программа умеет конвертировать файлы в Markdown, JSON или HTML. Что особенно радует, она сохраняет структуру таблиц и колонок, а не сваливает всё в нечитаемую кучу текста. Это превращает работу с отчётами или документацией из рутины в секундное дело. Если часто возитесь с PDF, инструмент точно стоит добавить в закладки.
https://github.com/opendataloader-project/opendataloader-pdf

Оставьте комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *

Прокрутить вверх