| Версия для печати темы
Нажмите сюда для просмотра этой темы в оригинальном формате |
| Форум программистов > Perl: разработка для Web > Парсер web страниц |
| Автор: Nаtаshа 3.12.2011, 13:46 | ||
Доброго всем дня!Нужна ваша помощь, т.к. в перл я еще не разбираюсь.
Собственно первый вопрос: почему не работает c именем хоста mail.ru ( выдает bad request) или go.mail.ru/search_images?fr=mailru(вообще не работает) Второй: как скачать всю страничку целиком. Т.е. выдернуть все ссылки на файлы и скачать их в папку res и заменить ссылки в документе. пробовала с помощью HTML::LinkExtor, но не помогло что-то(точнее я глупая). Третий нужно выдернуть ссылки на другие страницы,и вывести их в STDOUT Что бы не было лишних вопросов,программа должна быть написана с использование сокетов.(т.е. нужно реализовать протокол html самостоятельно). Заранее спасибо |
| Автор: Pfailed 3.12.2011, 18:56 |
Потому что запрос неверный. Должно начинаться с "GET /PATH", где PATH путь к требуемуму документу от корня. http://ru.wikipedia.org/wiki/HTTP#.D0.A1.D1.82.D1.80.D1.83.D0.BA.D1.82.D1.83.D1.80.D0.B0_.D0.BF.D1.80.D0.BE.D1.82.D0.BE.D0.BA.D0.BE.D0.BB.D0.B0 Как пробовали? |
| Автор: dixoNICH 4.12.2011, 13:02 |
| протокол, наверно, не html, а http, всё же. |
| Автор: Nаtаshа 4.12.2011, 13:23 | ||||||
Спасибо.
Список ссылок с тегами получем так:
Нужно собрать ссылки на другие страницы отдельно и вывести их. В странице их не менять. А ссылки на файлы(картинки архивы css, js и т.д.) скачать в отдельную папочку и заменить ссылки на эти файлы в документе(страничке). Сложность в том,что нужно скачивать эти файлы через сокет. С посыланием запросов через сокет. Добавлено через 1 минуту и 19 секунд Да, точно.Ошиблась! |
| Автор: Palatin 7.1.2012, 13:46 | ||
парсер ($page - ваша страница):
В массиве @refs - все ссылки |