Модераторы: korob2001, ginnie

Поиск:

Ответ в темуСоздание новой темы Создание опроса
> Скан HTML кода на ссылки, Надо получить список ссылок 
:(
    Опции темы
korob2001
Дата 19.7.2005, 20:26 (ссылка) | (нет голосов) Загрузка ... Загрузка ... Быстрая цитата Цитата


Эксперт
****


Профиль
Группа: Комодератор
Сообщений: 2871
Регистрация: 29.12.2002

Репутация: 13
Всего: 61



Usya - Гипер ссылка является частью html кода, потому, что бы получить ссылки со всех страниц сайта, нужно пропарсить все эти страницы. Можно конечно получить их прямо из БД, но для этого у тебя должен быть доступ к базе или файлу.


--------------------
"Время проходит", - привыкли говорить вы по неверному пониманию. 
"Время стоит - проходите вы".
PM MAIL WWW ICQ MSN   Вверх
Usya
Дата 20.7.2005, 07:00 (ссылка) | (нет голосов) Загрузка ... Загрузка ... Быстрая цитата Цитата


Бывалый
*


Профиль
Группа: Участник
Сообщений: 154
Регистрация: 7.6.2005

Репутация: нет
Всего: нет



Это понятно, но одно дело парсить вручную, вернее самому писать и отлаживать код (локальные, глобальные ссылки, всякие исключения) и совсем другое, если это можно записать в одну-две строчки...

Кстати, кажется нашел золотую жилу

1) из руководства пользователя wget
Цитата
Таким образом определение "wget -A gif,jpg" укажет Wget выгружать только файлы заканчивающиеся на "gif" или "jpg", т.е. графические файлы формата GIF или JPEG. С другой стороны, 'wget -A "zelazny*196[0-9]*"' будет выгружать только файлы с именами начинающимися с "zelazny" и содержащие числа от 1960 до 1969 далее в любом месте имени файла

(для некоторых задач может подойти на 100%)

2) только щас в голову пришло: выкачать с помощью wget сайт (одна строка кода), а потом вырезать из log-файла все ссылки (еще несколько строчек) и не надо никаких дополнительных модулей

3) может еще что-нибудь придет в голову, посмотрим smile

Пока экспериментирую...



--------------------
Я не волшебник, я только учусь...
PM MAIL   Вверх
Sadok
Дата 20.7.2005, 08:34 (ссылка) | (нет голосов) Загрузка ... Загрузка ... Быстрая цитата Цитата


Шустрый
*


Профиль
Группа: Участник
Сообщений: 74
Регистрация: 2.11.2004

Репутация: 1
Всего: 2



Usya
Цитата
1) из руководства пользователя wget

Это только для ftp подходит, т.к.:

Заметим, что эти две опции не касаются выгрузки HTML файлов, Wget должен выгружать все HTML документы чтобы выяснять куда ему двигаться дальше, в противном случае рекурсивная выгрузка становится просто бессмысленной.

Это сообщение отредактировал(а) Sadok - 20.7.2005, 08:34
PM   Вверх
Usya
Дата 20.7.2005, 11:50 (ссылка) | (нет голосов) Загрузка ... Загрузка ... Быстрая цитата Цитата


Бывалый
*


Профиль
Группа: Участник
Сообщений: 154
Регистрация: 7.6.2005

Репутация: нет
Всего: нет



Sadok

Так я не против того, что wget приходится выгружать html-файлы. Это видно по результатам выполнения программы (или по log-файлу). Хотя, честно говоря, до последнего надеялся на другое. Wget, как я понял, сначала их закачивает, а потом сам и удаляет.

Дело в другом: проверять html-файлы в любом случае придется. Кроме того, мне абсолютно не нужны файлы, на которые нет ссылок. Если разработчик сайта решил сделать для себя несколько временных файлов, путь к которым знает только он, или забыл просто удалить отработанные файлы - это его дело. Меня это не интересует.

Однако чтобы собрать все ссылки (с последующей обработкой, если нужно), используя wget, можно просто оптимизировать код, тем более, что wget как раз под это и заточен. Выкачал c сайта html-файлы или просто задал какую-нибудь ключевую комбинацию для поиска (которая в принципе не должна встретиться, чтоб случайно не закачать лишнего), из log-файла собрал все ссылки и обрабатывай их сколько хочешь. А можно сразу выкачивать нужные файлы (само собой это не касается html-файлов). Плюс к тому же не надо устанавливать дополнительные модули - мелочь, а приятно smile

Возможно есть и другие варианты, но пока это наиболее оптимальный из тех, до которых я докопался.
Впрочем, все нюансы пока не изведал, так что может что-то придется изменить.
Правда говорят, что wget достаточно не плох в качестве качалки, по идее должен собирать все (или почти все) ссылки...
Время покажет...
--------------------
Я не волшебник, я только учусь...
PM MAIL   Вверх
Ответ в темуСоздание новой темы Создание опроса
Правила форума "Perl: CGI программирование"
korob2001
sharq
  • В этом разделе обсуждаются вопросы относящиеся только к CGI программированию
  • Если ваш вопрос не относится к системному или CGI программированию, задавайте его в общем разделе
  • Если ваш вопрос относится к системному программированию, задавайте его здесь
  • Интерпретатор Perl можно скачать здесь ActiveState, O'REILLY, The source for Perl
  • Справочное руководство "Установка perl-модулей", качать здесь


Если Вам понравилась атмосфера форума, заходите к нам чаще! С уважением, korob2001, sharq.

 
0 Пользователей читают эту тему (0 Гостей и 0 Скрытых Пользователей)
0 Пользователей:
« Предыдущая тема | Perl: разработка для Web | Следующая тема »


 




[ Время генерации скрипта: 0.0459 ]   [ Использовано запросов: 22 ]   [ GZIP включён ]


Реклама на сайте     Информационное спонсорство

 
По вопросам размещения рекламы пишите на vladimir(sobaka)vingrad.ru
Отказ от ответственности     Powered by Invision Power Board(R) 1.3 © 2003  IPS, Inc.