![]() |
|
|
![]()
|
|
| dmitriydonetsk |
|
|||
|
Новичок Профиль Группа: Участник Сообщений: 2 Регистрация: 20.8.2011 Репутация: нет Всего: нет |
Доброго дня всем!
Никак не могу составить алгоритм. Подскажите, пжлст, как можно решить такую задачку. Есть множество новостных сайтов. На страничке, кроме текста, может быть всякий "мусор": реклама, комментарии, всякие блоки типа "Читайте также", и т.д. Исходные данные: Есть HTML код страницы Есть заголовок статьи Как можно получить текст новости? |
|||
|
||||
| VictorTsaregorodtsev |
|
|||
|
Опытный ![]() ![]() Профиль Группа: Участник Сообщений: 274 Регистрация: 28.7.2006 Репутация: 3 Всего: 8 |
Мы с командой 10 лет назад для этой задачи всё же сделали возможность вручную создавать для каждого сервера (источника новостей) свой шаблон - указывать, какие блоки выкидывать со страницы, а какие - брать в качестве результата. Просто у используемых серваков была довольно хорошая разметка блоков (комментариями к блокам, например). И прога создавалась только для работы в одной конторе, поэтому в рамках регулярной техподдержки можно было шаблоны регулярно обновлять и дорабатывать.
ЗЫ. Блоки - имеется в виду не divная верстка, а именно структурные блоки документа. ЗЗЫ. См в сторону готовых систем, объединяющих новости из разных источников и их анализирующих - например, на Астарту от русской Когнитив Технолоджиз (cognitive.ru - а там в продуктах). Пошарьте в инете насчёт логики работы подобного софта. |
|||
|
||||
| dmitriydonetsk |
|
|||
|
Новичок Профиль Группа: Участник Сообщений: 2 Регистрация: 20.8.2011 Репутация: нет Всего: нет |
VictorTsaregorodtsev, спасибо, принял к сведению, буду читать
|
|||
|
||||
| nworm |
|
|||
|
Опытный ![]() ![]() Профиль Группа: Участник Сообщений: 502 Регистрация: 22.10.2005 Репутация: 4 Всего: 8 |
1) Можете посмотреть технологию xpath и регулярные выражения. Например, web-harvest.
Так у Вас для каждого сайта будет свой способ выделения новости. 2) Попытайтесь написать общий алгоритм для выделения полезного текста. Так будет один алгоритм для всех сайтов. 1-й способ - более качественные результаты по сравнению со 2-м 1-й способ будет сложнее поддерживать, очень трудозатратный, в сравнении со 2-м. 2-й способ сложный по сравнению с первым. |
|||
|
||||
| nworm |
|
|||
|
Опытный ![]() ![]() Профиль Группа: Участник Сообщений: 502 Регистрация: 22.10.2005 Репутация: 4 Всего: 8 |
Да, и ещё, раз там новости, возможно, будет очень полезно работать с rss.
|
|||
|
||||
![]()
|
| Правила форума "Алгоритмы" | |
|
|
Форум "Алгоритмы" предназначен для обсуждения вопросов, связанных только с алгоритмами и структурами данных, без привязки к конкретному языку программирования и/или программному продукту.
Если Вам понравилась атмосфера форума, заходите к нам чаще! С уважением, maxim1000. |
| 0 Пользователей читают эту тему (0 Гостей и 0 Скрытых Пользователей) | |
| 0 Пользователей: | |
| « Предыдущая тема | Алгоритмы | Следующая тема » |
|
|
По вопросам размещения рекламы пишите на vladimir(sobaka)vingrad.ru
Отказ от ответственности Powered by Invision Power Board(R) 1.3 © 2003 IPS, Inc. |