Извлечение данных из PDF
Достаёт из счёта, акта или накладной номер, дату, ИНН, суммы и НДС. Разбор идёт в браузере — структура PDF, потоки и карты символов читаются на месте.Как это работает и что ломается — как перевести PDF в Excel. Не читается? Разбор пяти причин — какие PDF не читаются и почему: скан, шрифт без карты символов, запрет на извлечение, сжатые таблицы ссылок, нарисованная таблица.
Беру только текстовый слой. Скан, фотография, факс и защищённый файл не читаются — инструмент так и скажет, а не покажет пустоту. Счёт, отсканированный на МФУ, — это картинка. Текста внутри нет, и никакой разбор структуры его не достанет.
Сложная вёрстка собирается криво: позиции в две строки, объединённые ячейки, колонки без заголовков. Координаты есть, а смысла в них нет. Такие документы я разбираю вручную или распознаванием — и всегда сверяю итог с суммой в документе, потому что цена ошибки в счёте выше скорости.