Версия для печати темы
Нажмите сюда для просмотра этой темы в оригинальном формате
Форум программистов > C/C++: Общие вопросы > url в html


Автор: vandaler 10.4.2012, 01:04
Нужно вытащить из html все урлы по типу того, как это делает lynx -dump URL (пишу в линуксе), но lynx не подходит, так как нужно вытащить не просто ссылки на другие страницы, а те урлы, которые нужны для отображения, типа ссылки на картинки, скрипты. Как это можно сделать?

Автор: volatile 10.4.2012, 01:37
Вероятно нужно смотреть в сторону регэкспов... 

Автор: borisbn 10.4.2012, 06:47
Я не знаток линуха, но, кажется, можно после этого lynx -dump URL добавить | grep а дальше регекс типа (.*\.jpg)|(.*\.php)
Хотя правильнее будет получить все ссылки, запросить заголовок GET-запроса по каждой из них и проверить, является ли ссылка ссылкой на картинку. Кажется и это можно сделать из командной строки - какой-нибудь wget с параметром вытащить только заголовок + тот же grep

Автор: feodorv 10.4.2012, 16:30
Можно посмотреть исходный код wget.
Но нужно понимать, что html-код может генериться JavaScript'м, тогда по-простому не получится... 

Автор: vandaler 12.4.2012, 14:09
Цитата(borisbn @ 10.4.2012,  06:47)
Я не знаток линуха, но, кажется, можно после этого lynx -dump URL добавить | grep а дальше регекс типа (.*\.jpg)|(.*\.php)
Хотя правильнее будет получить все ссылки, запросить заголовок GET-запроса по каждой из них и проверить, является ли ссылка ссылкой на картинку. Кажется и это можно сделать из командной строки - какой-нибудь wget с параметром вытащить только заголовок + тот же grep

в том и дело, что lynx мне не возвращает ссылки на картинки. он оставляет только ссылки на другие страницы.

Powered by Invision Power Board (http://www.invisionboard.com)
© Invision Power Services (http://www.invisionpower.com)