| Версия для печати темы
Нажмите сюда для просмотра этой темы в оригинальном формате |
| Форум программистов > Perl: разработка для Web > Парсинг файла по тегам |
| Автор: Mosaicolor 6.8.2006, 13:22 | ||||
| Значит задача такая: Скопировали модулем LWP::UserAgent некий HTML-файл и записали его на сервер.
Теперь требуется: А. Вытащить все ссылки в файл links.dat Это сделано (нашел на этом форуме)
Б. Вытащить содержимое тега TITLE в файл title.dat Чтобы внутри файла было: <TITLE>Текст заголовка </TITLE> Как сделать не знаю C. Б. Вытащить содержимое тега HEAD в файл head.dat Чтобы внутри файла было: <HEAD> Все вложенные теги </HEAD> Как сделать не знаю D. Вытащить содержимое тега BODY в файл body.dat Чтобы внутри файла было: <BODY> Все вложенные теги и тексты </BODY> Как сделать не знаю Поможите? |
| Автор: Nab 6.8.2006, 14:41 | ||||
HTML::Parser
А смысл? |
| Автор: nitr 6.8.2006, 22:28 | ||
Mosaicolor, тут же огромный форум
|
| Автор: nitr 7.8.2006, 00:43 | ||||
две строки в одну мона
в
|
| Автор: nitr 7.8.2006, 01:01 | ||
кстати... решение всех твоих задач ;)
меньше кода, неправда ли? Но и его можно сократить... и оптимизировать... ;) |
| Автор: Mosaicolor 8.8.2006, 11:51 |
| Огромное спасибо! Все работает. Выявилась, правда, одна проблемка, но пытаюсь ее решить сам. А проблема такая. Например, тег <BODY> - при написании тега <BODY> - все в порядке - но при написании <BODY onload тра-та-та onclick тра-ла-ла...> - не работает Не слишком большой наглостью с моей стороны будет попросить помощи и в решении этого? |
| Автор: nitr 8.8.2006, 13:12 | ||
я ж для примеру пишу... и вроде говорил, читай книжки ;) строку №18 ($index =~ /<$_>(.+)<\/$_>/smi;) меняй на
З.Ы.: прочти некоторые статьи, книги. Множество книг есть на форуме, переведённые доки... ищи и гляди... Изучай! |
| Автор: rcdimon 8.8.2006, 20:15 |
| Конечно! Все можно по красоте сделать через регулярки. Нафиг хтмл::парсеры.... Нет конечно это клева, но чисто ради прикола или повышения квалификации стоит и самому пописать такие штуки. Молодец нитр |