| Версия для печати темы
Нажмите сюда для просмотра этой темы в оригинальном формате |
| Форум программистов > PHP: Общие вопросы > Обнаружение ссылок |
| Автор: maxipub 10.9.2010, 14:28 |
| Добрый, пятничный, день, уважаемые! Задача типичная. Должно быть готовое решение (туториал, функция, класс, библиотека, етц), так что о нем, в принципе, и спрашиваю. По сути, нужен парсер ссылок на странице. Единственное, нужно чтоб на выходе все ссылки были полными. На странице могут быть и полные вида http://domain.com/page/ и различные относительные /page/ и ../../../../xe-xe_page/ и т.д. Нам на выходе нужно все получать как полные, http://... Так же желательно чтоб сие решение изначально учитывало параметр href тега base (если он присутствует в документе, конечно же). Кто не в курсе, этот тег задает базовый адрес для элементов текущего документа. Так, если на странице http://domain.com/page/ есть картинка <img src="img.jpg" />, то считается что она находится по адресу http://domain.com/page/img.jpg, но если прописан тег base, например, так: <base href="http://domain.com/">, то адрес картинки будет таким http://domain.com/img.jpg Буду благодарен за любую помощь! |
| Автор: enoff 10.9.2010, 14:35 |
| Регулярные выражения в помощь. Или код за вас писать? |
| Автор: Muerto 10.9.2010, 15:10 |
| maxipub, Чет я не понял... вы хотите с чужого сайта сдирать ссылки ? или же на своем сайте нечто типа шаблонизатора делать? |
| Автор: maxipub 10.9.2010, 18:29 |
| enoff, велосипеды делать мне уже надоело. Да и вопрос не в парсинге, а в процессинге. По сути, да, именно так. Экспериментирую с созданием индексатора сайтов. Детская мечта о своем поисковике. |