![]() |
|
Модераторы: LSD, AntonSaburov |
![]()
|
|
| Гость_Тамара |
|
|||
|
Unregistered |
Есть таблица с данными в pdf файле.
Необходимо программно извлечь эти данные из таблицы. Я нашла только, как можно извлечь весь текст, но это пока не очень подходит. Хочется чтобы данные можно было извлекать порциями, в порядке как они лежат в таблице. Подскажите, плиз, возможно ли это? и можно ли вообще решить данную проблему |
|||
|
||||
| LSD |
|
|||
![]() Leprechaun Software Developer ![]() ![]() ![]() ![]() Профиль Группа: Модератор Сообщений: 15718 Регистрация: 24.3.2004 Где: Dublin Репутация: 210 Всего: 538 |
Тамара а как ты читаешь текст, с помощью чего?
-------------------- Disclaimer: this post contains explicit depictions of personal opinion. So, if it sounds sarcastic, don't take it seriously. If it sounds dangerous, do not try this at home or at all. And if it offends you, just don't read it. |
|||
|
||||
| Гость_Тамара |
|
|||
|
Unregistered |
Я считывала с помощью библиотеки PDFBox. Получается обычное считывание текста в потоке из файла.
Не удобно |
|||
|
||||
| LSD |
|
|||
![]() Leprechaun Software Developer ![]() ![]() ![]() ![]() Профиль Группа: Модератор Сообщений: 15718 Регистрация: 24.3.2004 Где: Dublin Репутация: 210 Всего: 538 |
PDFBox осуществляет полный разбор PDF файла, с сохранением всех объектов. Только вот чтобы вытащить из него таблицы надо будет постараться, надо смотреть спецификацию PDF, как там хранятся таблицы.
-------------------- Disclaimer: this post contains explicit depictions of personal opinion. So, if it sounds sarcastic, don't take it seriously. If it sounds dangerous, do not try this at home or at all. And if it offends you, just don't read it. |
|||
|
||||
| Bulat |
|
|||
![]() татарский Нео ![]() ![]() ![]() Профиль Группа: Завсегдатай Сообщений: 1701 Регистрация: 22.3.2006 Где: Альметьевск Репутация: 4 Всего: 57 |
"Некромантирую" темку
Давненько уже не садился за Java. Задача тривиальна - просто получить некоторую информацию о PDF-файле.
PageSize - возвращает мне размеры в поинтах, я так полагаю, что я перевожу в миллиметры, соотв 72 поинта = 1 дюйм, 1 дюйм = 25,4 мм.. Или я ошибаюсь?? И может есть какие методы которые возвращают размеры не в поинтах?? -------------------- менеджер по кодеврайтингу |
|||
|
||||
| Bulat |
|
|||
![]() татарский Нео ![]() ![]() ![]() Профиль Группа: Завсегдатай Сообщений: 1701 Регистрация: 22.3.2006 Где: Альметьевск Репутация: 4 Всего: 57 |
мож кто-нить API поделится на тему как работать с pdf в Java?
-------------------- менеджер по кодеврайтингу |
|||
|
||||
| Gantenbain |
|
|||
|
Новичок Профиль Группа: Участник Сообщений: 47 Регистрация: 16.10.2007 Репутация: нет Всего: нет |
Судя по вялости темы, надеяться на горячее обсуждение не стоит, "но вопросы жгут мне небо перцем и хотят наружу.." (С) М. Щербаков.
Пользую PDFBOX 0.7.3. PDFTextStripper "пропускает" пробелы, что на многих англоязычных форумах обсуждается безрезультатно, причем, мне, как человеку поверхностно пролиставшему описание PDF, не ясно, в том ли проблема, что он неверно сращивает куски текста из потока (исходник: http://kickjava.com/src/org/pdfbox/util/PD...ripper.java.htm - алгоритм понятный и в релизе 0.7.4 класс, хоть и переписан, но идея осталась прежней), или он, возможно, пренебрегает какой-то часть данных.. (?) Например, применив PrintTextLocations из org.pdfbox.examples.util , получаю String[341.88,176.15997 fs=1.0 xscale=6.0 height=3.7500005 width=7.2059937]41 реально числа "4" и "1" должны быть разделены пробелом, и при копировании "4 1" через текстовой буфер Adobe Acrobat'a, я могу благополучно перенести этот текст в "блокнот". Цеплял PDFBOX 0.7.4 - с тем же результатом, написал Ben Litchfield'у, но, т.к. аналогичные вопросы на многих форумах оставлены им без ответа, то особо не жду ответа. А отказываться от библиотеки жалко. Кто-нибудь знаком с проблемой? Спасибо. P.S. API в архиве http://sourceforge.net/projects/pdfbox/fil....3.zip/download, есть на сайте, но версия 0.7.4, исходники надо искать в сети |
|||
|
||||
| Gantenbain |
|
|||
|
Новичок Профиль Группа: Участник Сообщений: 47 Регистрация: 16.10.2007 Репутация: нет Всего: нет |
С этой страницы http://incubator.apache.org/pdfbox/download.html можно загрузить требуемые версии PDFBox'a или рабочую версию из репозитория Subversion.
|
|||
|
||||
| Gantenbain |
|
|||
|
Новичок Профиль Группа: Участник Сообщений: 47 Регистрация: 16.10.2007 Репутация: нет Всего: нет |
В общем, проблема понятна: PDFTextStripper пренебрегает указаниями оператора "Tc",
Example: BT 6 0 0 6 244.0800018311 795.8400268555 Tm 6.5475001335 Tc (41) Tj пробел между 4 и 1 поставлен не будет. |
|||
|
||||
| Gantenbain |
|
|||
|
Новичок Профиль Группа: Участник Сообщений: 47 Регистрация: 16.10.2007 Репутация: нет Всего: нет |
Решение разместил на http://issues.apache.org/jira/browse/PDFBOX-508. С моей задачей работает.
|
|||
|
||||
| Vladimir_K |
|
|||
![]() Шустрый ![]() Профиль Группа: Участник Сообщений: 149 Регистрация: 2.12.2006 Репутация: нет Всего: 1 |
Я только начинаю изучать JavaScript. Вот, вопрос появился - скрипт работает в какой-нибудь программе (в браузере, например), можно ли программно открыть пдф-файл (расположенный на этом же компьютере), и из него брать текстовую информацию?
--------------------
Судя по всему, у меня огромное количество мозгов - мне требуется уйма времени, чтобы ими пораскинуть |
|||
|
||||
| LSD |
|
|||
![]() Leprechaun Software Developer ![]() ![]() ![]() ![]() Профиль Группа: Модератор Сообщений: 15718 Регистрация: 24.3.2004 Где: Dublin Репутация: 210 Всего: 538 |
-------------------- Disclaimer: this post contains explicit depictions of personal opinion. So, if it sounds sarcastic, don't take it seriously. If it sounds dangerous, do not try this at home or at all. And if it offends you, just don't read it. |
|||
|
||||
| Vladimir_K |
|
|||
![]() Шустрый ![]() Профиль Группа: Участник Сообщений: 149 Регистрация: 2.12.2006 Репутация: нет Всего: 1 |
Интересные комменты к статье. Но, цитируя zxspectrum128k, высказавшегося в одном из комментов: zxspectrum128k/ 29 октября 2006, 20:50:33 здесь нету того, что я искал скажу - все-таки здесь нету того, что я искал. Можно ли при помощи JavaScript, работающей в браузере или какой-нибудь другой программе, брать инфу (текст, картинки) из сторонних документов - PDF, DOC, TXT? Или тут не JavaScript обсуждают? О, я, кажись, не туда попал? Ну, звыняйте. Это сообщение отредактировал(а) Vladimir_K - 18.10.2010, 18:28 --------------------
Судя по всему, у меня огромное количество мозгов - мне требуется уйма времени, чтобы ими пораскинуть |
|||
|
||||
![]()
|
| Правила форума "Java" | |
|
|
Если Вам помогли, и атмосфера форума Вам понравилась, то заходите к нам чаще! С уважением, LSD, AntonSaburov, powerOn, tux, javastic. |
| 0 Пользователей читают эту тему (0 Гостей и 0 Скрытых Пользователей) | |
| 0 Пользователей: | |
| « Предыдущая тема | Java: Общие вопросы | Следующая тема » |
|
|
По вопросам размещения рекламы пишите на vladimir(sobaka)vingrad.ru
Отказ от ответственности Powered by Invision Power Board(R) 1.3 © 2003 IPS, Inc. |