Версия для печати темы
Нажмите сюда для просмотра этой темы в оригинальном формате
Форум программистов > PHP: Общие вопросы > Парсинг статьи fopen


Автор: Гость_Qwerty 25.1.2004, 11:10
Парсинг новостей fopen

К примеру я хочу отобразить какую-то часть новости с другого сайта используя рег. выражение fopen, но как им доконца пользоваться я не разобрался.
(интересует все о рег. выражениях так или иначе относящихся к этому вопросу)

А так, не знаю, как выбрать конкретный отрывок текста для парсинга на требуемой странице.

Требуется : взять часть текста с другого ресурса, распарсить и отобразить у себя, при этом исключив из парсинга графический логотип и панель навигации сайта и некоторые другие элементы. Как это осуществить?

Автор: Secandr 25.1.2004, 11:20
А как эти новости передаются?
Единого регулярного вырожения для разбора новостей не существует, всё зависит от формата данных.

Пример новостей в студию!

Автор: Гость_Qwerty 25.1.2004, 11:41
Я не имею в виду RSS новости !!! Мне это не нужно !

----->> К примеру на Lenta.ru появляется новый выпуск новостей и я хочу отобразить их у себя на сайте,

но проблема в том, что я не знаю, как выбрать со страницы новостей сайта Lenta.ru только определенную часть текста, не включая логотип и некоторые другие элементы сайта Lenta.


Автор: Secandr 25.1.2004, 12:42
Получить набор статей:
Цитата
Квашнин: Россия готова к отражению угрозы любого масштаба
[24.01 15:17] Россия готова к ***** операциях.


Так?

Для этого нужно найти закономерности в структуре хтмла, вот как выглядят эти новости:
Код
<font size=4><b><a href=/vojna/2004/01/25/georgia/>Спецназ разогнал сторонников Саакашвили сразу после военного парада</a></b></font><br>
В воскресенье, *** , участники акций протеста разошлись.
<dl><a href=/vojna/2004/01/25/georgia/><b>ПОДРОБНОСТИ</b></a><p>
<ul>
</ul>

<font size=4><b><a href=/terror/2004/01/24/left/>Спецслужбы США справились с "Аль-Каедой" на 70 процентов</a></b></font><br>
<small>[24.01 07:38]</small> По оценкам американских спецслужб, *** Госдепартамента США Кофер Блэк. &nbsp;&nbsp;&nbsp; <small>*<a href=/terror/2004/01/24/left/_Printed.htm>версия для печати</a>*</small>
<P>


тоесть нам нужно искать :
<font size=4><b><a {любой симол кроме >}>{любой симол кроме <}</a>{все сиволы до <a}<a
Выглядеть это будет примерно так:

Код
/<font size=4><b><a [^>]>([^<]+)</a>(.+)<a/

В итоге в \1 будет зашоловок в \2 будет тескт из которого нужно будет вырезать хтмл теги.

Отсюда можно плесать дальше.

Автор: Guest 25.1.2004, 19:00
А можно (если не трудно) набросать пример скрипта на PHP.

Чтобы мне хотя бы визуально понять, что из чего выходит. Пожалуйста.

Автор: Wowa 25.1.2004, 19:59
Цитата
Чтобы мне хотя бы визуально понять, что из чего выходит

Для этого надо выучить регулярные выражение, иначе код на пхп будет одними закарлючками казаться.

Автор: Guest 25.1.2004, 20:22
В том-то и дело, что уже читал, там только описания,

а как на практике написать? Может кто уделит немного времени?

Автор: Secandr 25.1.2004, 20:34
Guest>> Написать это дело красиво и понятно не смогу. Я сам еду завтра покупать книгу "Регулярные выражения" (с) О`Рели

Powered by Invision Power Board (http://www.invisionboard.com)
© Invision Power Services (http://www.invisionpower.com)