![]() |
|
Модераторы: korob2001, ginnie |
![]()
|
|
| korob2001 |
|
|||
![]() Эксперт ![]() ![]() ![]() ![]() Профиль Группа: Комодератор Сообщений: 2871 Регистрация: 29.12.2002 Репутация: 13 Всего: 61 |
Usya - Гипер ссылка является частью html кода, потому, что бы получить ссылки со всех страниц сайта, нужно пропарсить все эти страницы. Можно конечно получить их прямо из БД, но для этого у тебя должен быть доступ к базе или файлу.
-------------------- "Время проходит", - привыкли говорить вы по неверному пониманию. "Время стоит - проходите вы". |
|||
|
||||
| Usya |
|
|||
|
Бывалый ![]() Профиль Группа: Участник Сообщений: 154 Регистрация: 7.6.2005 Репутация: нет Всего: нет |
Это понятно, но одно дело парсить вручную, вернее самому писать и отлаживать код (локальные, глобальные ссылки, всякие исключения) и совсем другое, если это можно записать в одну-две строчки...
Кстати, кажется нашел золотую жилу 1) из руководства пользователя wget
(для некоторых задач может подойти на 100%) 2) только щас в голову пришло: выкачать с помощью wget сайт (одна строка кода), а потом вырезать из log-файла все ссылки (еще несколько строчек) и не надо никаких дополнительных модулей 3) может еще что-нибудь придет в голову, посмотрим Пока экспериментирую... --------------------
Я не волшебник, я только учусь... |
|||
|
||||
| Sadok |
|
|||
|
Шустрый ![]() Профиль Группа: Участник Сообщений: 74 Регистрация: 2.11.2004 Репутация: 1 Всего: 2 |
Usya
Это только для ftp подходит, т.к.: Заметим, что эти две опции не касаются выгрузки HTML файлов, Wget должен выгружать все HTML документы чтобы выяснять куда ему двигаться дальше, в противном случае рекурсивная выгрузка становится просто бессмысленной. Это сообщение отредактировал(а) Sadok - 20.7.2005, 08:34 |
|||
|
||||
| Usya |
|
|||
|
Бывалый ![]() Профиль Группа: Участник Сообщений: 154 Регистрация: 7.6.2005 Репутация: нет Всего: нет |
Sadok
Так я не против того, что wget приходится выгружать html-файлы. Это видно по результатам выполнения программы (или по log-файлу). Хотя, честно говоря, до последнего надеялся на другое. Wget, как я понял, сначала их закачивает, а потом сам и удаляет. Дело в другом: проверять html-файлы в любом случае придется. Кроме того, мне абсолютно не нужны файлы, на которые нет ссылок. Если разработчик сайта решил сделать для себя несколько временных файлов, путь к которым знает только он, или забыл просто удалить отработанные файлы - это его дело. Меня это не интересует. Однако чтобы собрать все ссылки (с последующей обработкой, если нужно), используя wget, можно просто оптимизировать код, тем более, что wget как раз под это и заточен. Выкачал c сайта html-файлы или просто задал какую-нибудь ключевую комбинацию для поиска (которая в принципе не должна встретиться, чтоб случайно не закачать лишнего), из log-файла собрал все ссылки и обрабатывай их сколько хочешь. А можно сразу выкачивать нужные файлы (само собой это не касается html-файлов). Плюс к тому же не надо устанавливать дополнительные модули - мелочь, а приятно Возможно есть и другие варианты, но пока это наиболее оптимальный из тех, до которых я докопался. Впрочем, все нюансы пока не изведал, так что может что-то придется изменить. Правда говорят, что wget достаточно не плох в качестве качалки, по идее должен собирать все (или почти все) ссылки... Время покажет... --------------------
Я не волшебник, я только учусь... |
|||
|
||||
![]()
|
| Правила форума "Perl: CGI программирование" | |
|
|
Если Вам понравилась атмосфера форума, заходите к нам чаще! С уважением, korob2001, sharq. |
| 0 Пользователей читают эту тему (0 Гостей и 0 Скрытых Пользователей) | |
| 0 Пользователей: | |
| « Предыдущая тема | Perl: разработка для Web | Следующая тема » |
|
|
По вопросам размещения рекламы пишите на vladimir(sobaka)vingrad.ru
Отказ от ответственности Powered by Invision Power Board(R) 1.3 © 2003 IPS, Inc. |