Версия для печати темы
Нажмите сюда для просмотра этой темы в оригинальном формате
Форум программистов > PHP: Общие вопросы > Обнаружение ссылок


Автор: maxipub 10.9.2010, 14:28
Добрый, пятничный, день, уважаемые! smile 

Задача типичная. Должно быть готовое решение (туториал, функция, класс, библиотека, етц), так что о нем, в принципе, и спрашиваю.

По сути, нужен парсер ссылок на странице. Единственное, нужно чтоб на выходе все ссылки были полными. На странице могут быть и полные вида http://domain.com/page/ и различные относительные /page/ и ../../../../xe-xe_page/ и т.д. Нам на выходе нужно все получать как полные, http://... Так же желательно чтоб сие решение изначально учитывало параметр href тега base (если он присутствует в документе, конечно же). Кто не в курсе, этот тег задает базовый адрес для элементов текущего документа. Так, если на странице http://domain.com/page/ есть картинка <img src="img.jpg" />, то считается что она находится по адресу http://domain.com/page/img.jpg, но если прописан тег base, например, так: <base href="http://domain.com/">, то адрес картинки будет таким http://domain.com/img.jpg

Буду благодарен за любую помощь! smile 

Автор: enoff 10.9.2010, 14:35
Регулярные выражения в помощь.
Или код за вас писать?

Автор: Muerto 10.9.2010, 15:10
maxipub, Чет я не понял... вы хотите с чужого сайта сдирать ссылки ?
или же на своем сайте нечто типа шаблонизатора делать?

Автор: maxipub 10.9.2010, 18:29
enoff, велосипеды делать мне уже надоело. Да и вопрос не в парсинге, а в процессинге.

Цитата(Muerto @  10.9.2010,  15:10 Найти цитируемый пост)
Чет я не понял... вы хотите с чужого сайта сдирать ссылки ?

По сути, да, именно так. Экспериментирую с созданием индексатора сайтов. Детская мечта о своем поисковике. smile

Powered by Invision Power Board (http://www.invisionboard.com)
© Invision Power Services (http://www.invisionpower.com)