Версия для печати темы
Нажмите сюда для просмотра этой темы в оригинальном формате
Форум программистов > Java: Общие вопросы > Получить текст из pdf


Автор: Genada 18.2.2014, 03:03
Помогите вытащить весь текст из pdf. Пытаюсь получить через PDFBOX ( http://pdfbox.apache.org/) . С простыми pdf все работает но со сложными (таблицы) не работает. В примерах есть работа с pdf через PDFTextStripperByArea где через .getAnnotations()  по идее можно вытаскивать текст из всех регионов. Вот кусок:
PDPage page = (PDPage) allPages.get(i);
List annotations = page.getAnnotations();
int a = annotations.size();
У меня почему-то всегда a=0 хотя в файле много объектов с текстом... Помогите вытащить весь текст из pdf... Может надо смотреть на другие библиотеки (iText)?

Автор: Samotnik 19.2.2014, 17:25
Genada, iText действительно не плох. Это по технологиям. 
Если вопрос по работе кода, то нужно увидеть сам документ и рабочий кусок кода, что бы запустить у себя.

Powered by Invision Power Board (http://www.invisionboard.com)
© Invision Power Services (http://www.invisionpower.com)