| Версия для печати темы
Нажмите сюда для просмотра этой темы в оригинальном формате |
| Форум программистов > Perl: Системное программирование > pdf to html |
| Автор: tankred 1.10.2008, 12:16 |
| Собственно смысл вот в чем: Имеются пдф файлы которые нужно регулярно переводить в формат хтмл (для чего отдельная песня - надо именно так) Скорость выполнения скриптов не имеет значения Нужен совет возможно ли это напрямую средствами перл (модулями типа PDF::API2 etc) PDF::Parse пробовал он видимо действительно нерабочий. Вытягивать нужно текст, а главное таблицы(ни графики ничего другого не надо). А может проще воспользоваться например pdftohtml-0.39, а там уже с помощью перл как-то таблицы форматить (в pdftohtml-0.39 тупо фиксируется положение текста на поле - границ у таблиц нет) Или акробатом сохранить в хтмл и опять же править таблицы? Вообще что посоветуете? Путь 1: пдф - работа с пдф модулями перл - качественный результат; Путь 2: пдф - "кривой хтмл" - работа с перл - качественный результат; Существуют ли модули перл КОРРЕКТНО вытягивающие информацию из пдф (с красивыми расчерчеными таблицами)? |
| Автор: nitr 3.10.2008, 00:55 |
| tankred, это вы про HTML ? Если да, то что вы имеете ввиду? Таблица в html сами знаете что... Если вы хотите, чтобы получились таблицы с форматированием как в pdf, то имхо - надо "ручками"... |
| Автор: tankred 3.10.2008, 14:05 |
| to nitr Цель получить таблицу вида идентичного пдф. С тем же количеством колонок и столбцов, с нужным текстом находящимся в нужной ячейке без текста вылезшего за ее пределы и т.д. и т.п. Т.е. как я понял, лучший ход чем-нибудь конвертнуть в хтм (типа файнридера или того же пдфтухтмл), а затем perl+regexp? |