| Версия для печати темы
Нажмите сюда для просмотра этой темы в оригинальном формате |
| Форум программистов > C/C++: Общие вопросы > url в html |
| Автор: vandaler 10.4.2012, 01:04 |
| Нужно вытащить из html все урлы по типу того, как это делает lynx -dump URL (пишу в линуксе), но lynx не подходит, так как нужно вытащить не просто ссылки на другие страницы, а те урлы, которые нужны для отображения, типа ссылки на картинки, скрипты. Как это можно сделать? |
| Автор: volatile 10.4.2012, 01:37 |
| Вероятно нужно смотреть в сторону регэкспов... |
| Автор: borisbn 10.4.2012, 06:47 |
| Я не знаток линуха, но, кажется, можно после этого lynx -dump URL добавить | grep а дальше регекс типа (.*\.jpg)|(.*\.php) Хотя правильнее будет получить все ссылки, запросить заголовок GET-запроса по каждой из них и проверить, является ли ссылка ссылкой на картинку. Кажется и это можно сделать из командной строки - какой-нибудь wget с параметром вытащить только заголовок + тот же grep |
| Автор: feodorv 10.4.2012, 16:30 |
| Можно посмотреть исходный код wget. Но нужно понимать, что html-код может генериться JavaScript'м, тогда по-простому не получится... |
| Автор: vandaler 12.4.2012, 14:09 | ||
в том и дело, что lynx мне не возвращает ссылки на картинки. он оставляет только ссылки на другие страницы. |