Поиск:

Ответ в темуСоздание новой темы Создание опроса
> Парсинг новостей, Как можно получить полный текст новости 
:(
    Опции темы
dmitriydonetsk
  Дата 20.8.2011, 15:16 (ссылка) | (нет голосов) Загрузка ... Загрузка ... Быстрая цитата Цитата


Новичок



Профиль
Группа: Участник
Сообщений: 2
Регистрация: 20.8.2011

Репутация: нет
Всего: нет



Доброго дня всем!

Никак не могу составить алгоритм. Подскажите, пжлст, как можно решить такую задачку.
Есть множество новостных сайтов. На страничке, кроме текста, может быть всякий "мусор": реклама, комментарии, всякие блоки типа "Читайте также", и т.д. 

Исходные данные:
Есть HTML код страницы
Есть заголовок статьи 

Как можно получить текст новости? 
PM MAIL   Вверх
VictorTsaregorodtsev
Дата 20.8.2011, 16:49 (ссылка) | (нет голосов) Загрузка ... Загрузка ... Быстрая цитата Цитата


Опытный
**


Профиль
Группа: Участник
Сообщений: 274
Регистрация: 28.7.2006

Репутация: 3
Всего: 8



Мы с командой 10 лет назад для этой задачи всё же сделали возможность вручную создавать для каждого сервера (источника новостей) свой шаблон - указывать, какие блоки выкидывать со страницы, а какие - брать в качестве результата. Просто у используемых серваков была довольно хорошая разметка блоков (комментариями к блокам, например). И прога создавалась только для работы в одной конторе, поэтому в рамках регулярной техподдержки можно было шаблоны регулярно обновлять и дорабатывать.

ЗЫ. Блоки - имеется в виду не divная верстка, а именно структурные блоки документа.

ЗЗЫ. См в сторону готовых систем, объединяющих новости из разных источников и их анализирующих - например, на Астарту от русской Когнитив Технолоджиз (cognitive.ru - а там в продуктах). Пошарьте в инете насчёт логики работы подобного софта.
PM MAIL WWW   Вверх
dmitriydonetsk
Дата 20.8.2011, 16:51 (ссылка) | (нет голосов) Загрузка ... Загрузка ... Быстрая цитата Цитата


Новичок



Профиль
Группа: Участник
Сообщений: 2
Регистрация: 20.8.2011

Репутация: нет
Всего: нет



VictorTsaregorodtsev, спасибо, принял к сведению, буду читать
PM MAIL   Вверх
nworm
Дата 20.8.2011, 16:57 (ссылка) | (нет голосов) Загрузка ... Загрузка ... Быстрая цитата Цитата


Опытный
**


Профиль
Группа: Участник
Сообщений: 502
Регистрация: 22.10.2005

Репутация: 4
Всего: 8



1) Можете посмотреть технологию xpath и регулярные выражения. Например, web-harvest.
Так у Вас для каждого сайта будет свой способ выделения новости.

2) Попытайтесь написать общий алгоритм для выделения полезного текста. Так будет один алгоритм для всех сайтов.

1-й способ - более качественные результаты по сравнению со 2-м
1-й способ будет сложнее поддерживать, очень трудозатратный, в сравнении со 2-м.
2-й способ сложный по сравнению с первым.
PM MAIL WWW   Вверх
nworm
Дата 24.8.2011, 15:31 (ссылка) | (нет голосов) Загрузка ... Загрузка ... Быстрая цитата Цитата


Опытный
**


Профиль
Группа: Участник
Сообщений: 502
Регистрация: 22.10.2005

Репутация: 4
Всего: 8



Да, и ещё, раз там новости, возможно, будет очень полезно работать с rss.
PM MAIL WWW   Вверх
  
Ответ в темуСоздание новой темы Создание опроса
Правила форума "Алгоритмы"

maxim1000

Форум "Алгоритмы" предназначен для обсуждения вопросов, связанных только с алгоритмами и структурами данных, без привязки к конкретному языку программирования и/или программному продукту.


Если Вам понравилась атмосфера форума, заходите к нам чаще! С уважением, maxim1000.

 
0 Пользователей читают эту тему (0 Гостей и 0 Скрытых Пользователей)
0 Пользователей:
« Предыдущая тема | Алгоритмы | Следующая тема »


 




[ Время генерации скрипта: 0.0382 ]   [ Использовано запросов: 21 ]   [ GZIP включён ]


Реклама на сайте     Информационное спонсорство

 
По вопросам размещения рекламы пишите на vladimir(sobaka)vingrad.ru
Отказ от ответственности     Powered by Invision Power Board(R) 1.3 © 2003  IPS, Inc.