Мастерская

Извлечение данных из PDF

Достаёт из счёта, акта или накладной номер, дату, ИНН, суммы и НДС. Разбор идёт в браузере — структура PDF, потоки и карты символов читаются на месте.
ФАЙЛ
СВОЁ ПРАВИЛО ПОИСКА
Для сложных таблиц, где позиции стоят в несколько колонок, разбор собирается вручную — об этом честно написано ниже.
Файл не загружен
0СТРОК ТЕКСТА
0ПОЛЕЙ НАЙДЕНО
ЧТО НАШЛОСЬ
Загрузите PDF.
ТАБЛИЦА, КАК ЕЁ СОБРАЛ ИНСТРУМЕНТ
Загрузите PDF.
ТЕКСТ, КАК ЕГО ВИДИТ ИНСТРУМЕНТ
Для сложных таблиц, где позиции стоят в несколько колонок, я собираю разбор вручную — инструмент показывает, что уже можно получить без человека.
ГДЕ ИНСТРУМЕНТ СДАЁТСЯ

Как это работает и что ломается — как перевести PDF в Excel. Не читается? Разбор пяти причин — какие PDF не читаются и почему: скан, шрифт без карты символов, запрет на извлечение, сжатые таблицы ссылок, нарисованная таблица.

Беру только текстовый слой. Скан, фотография, факс и защищённый файл не читаются — инструмент так и скажет, а не покажет пустоту. Счёт, отсканированный на МФУ, — это картинка. Текста внутри нет, и никакой разбор структуры его не достанет.

Сложная вёрстка собирается криво: позиции в две строки, объединённые ячейки, колонки без заголовков. Координаты есть, а смысла в них нет. Такие документы я разбираю вручную или распознаванием — и всегда сверяю итог с суммой в документе, потому что цена ошибки в счёте выше скорости.

Скан, кривая вёрстка, сотня счетов?
Текстовый слой читается автоматически. Там, где текста нет или таблица собрана из блоков, я разбираю документ вручную и собираю таблицу — с проверкой, что суммы сходятся с итогом.
Написать мне