| Версия для печати темы
Нажмите сюда для просмотра этой темы в оригинальном формате |
| Форум программистов > Java: Общие вопросы > Получить текст из pdf |
| Автор: Genada 18.2.2014, 03:03 |
| Помогите вытащить весь текст из pdf. Пытаюсь получить через PDFBOX ( http://pdfbox.apache.org/) . С простыми pdf все работает но со сложными (таблицы) не работает. В примерах есть работа с pdf через PDFTextStripperByArea где через .getAnnotations() по идее можно вытаскивать текст из всех регионов. Вот кусок: PDPage page = (PDPage) allPages.get(i); List annotations = page.getAnnotations(); int a = annotations.size(); У меня почему-то всегда a=0 хотя в файле много объектов с текстом... Помогите вытащить весь текст из pdf... Может надо смотреть на другие библиотеки (iText)? |
| Автор: Samotnik 19.2.2014, 17:25 |
| Genada, iText действительно не плох. Это по технологиям. Если вопрос по работе кода, то нужно увидеть сам документ и рабочий кусок кода, что бы запустить у себя. |