Здравствуйте.
Озадачился выуживанием из pdf файлов больших таблиц. Попробовал использовать PyPDF2, pdfminer, tesseract (из textract) и tabula. Только табула позволяет выдернуть таблицу из pdf файла, но есть одна проблема - dataframe создается не правильно. Сливаются 2 и 3 колонки таблицы (их всего 3). Разделить их вручную через split не получится, потому что обе колонки могут содержат слова, разделенные пробелом. Для меня как раз эти колонки и имеют значение, а так как я работаю с большим количеством pdf файлов (тысячи) и большими таблицами (от ~300 до десятков тысяч ячеек) мне крайне необходимо процесс автоматизировать, чтобы иметь возможность выдергивать нужные ячейки из разных строк. Я насколько смог проанализировал список атрибутов датафрейма отсюда https://pandas.pydata.org/pandas-docs/stable/generated/pandas.DataFrame.html
Попробовал экспортировать в json, csv, excel, html. Экспорт в эти форматы сохраняет слияние 2 и 3 колонки. Может кто-нибудь подсказать способ экспорта таблицы с сохранением форматирования?
Использую python 3.7 и последние версии указанных модулей. Если это имеет значение, судя по информации о pdf файлах, они созданы с помощью itext (java).
Вариант изучить java, чтобы работать с этими файлами, буду рассматривать только в крайнем случае… Хотелось все таки на уже знакомом и родном питоне решить задачу.
Пример pdf файла прикреплен.