Версия для печати темы
Нажмите сюда для просмотра этой темы в оригинальном формате
Форум программистов > Вёрстка веб-сайтов > Чистка HTML


Автор: MoebiusCat 1.7.2013, 10:56
Сразу оговариваюсь - в HTML ничего не смыслю, сегодня спервые столкнулась. Надобность возникла по работе. Работаю разработчиком алгоритмов по обработке текста, а тут возникла проблема с извлечением этого самого текста...

Обычно в HTML странице есть некая область, где состредоточена вся полезная информация - см. картинки:
http://s1.ipicture.ru/Gallery/Viewfull/27630108.html
http://s1.ipicture.ru/Gallery/Viewfull/27630198.html

"Вручную" её видно очень хорошо. А можно ли сделать то же автоматически? У нас в компании умеют делать это для сайтов вроде того, который на сторой картинке (агентства новостей, например), но не для произвольного сайта. Вопрос - что человечество знает по этой теме? Где можно почитать, посмотреть код?

У меня ещё была такая мысль. Эта самая информативная часть страницы находится примерно посередине (геометрически). Можно ли эффективно извлекать из HTML информацию, в какой части экрана появится та или иная надпись, и можно ли этим эффективно пользоваться для моей задачи? Ещё я так поняла, что HTML страница состоит из этаких клеток, как таблица. Если извлечь структуру этих клеток вместе с их размерами, думаю, можно будет найти закономерность, которая из клеток содержит информацию, а которые - рекламу, ссылки, и т.п.

Заранее благодарна.
Прошу прощения, если вопрос глупый.


Автор: Temp 5.7.2013, 06:44
Цитата

"Вручную" её видно очень хорошо. А можно ли сделать то же автоматически?

не совсем понятно что вам нужно сделать?
куда вы хотите текст извлекать?

Автор: Arantir 5.7.2013, 07:02
Цитата(MoebiusCat @  1.7.2013,  09:56 Найти цитируемый пост)
У меня ещё была такая мысль. Эта самая информативная часть страницы находится примерно посередине (геометрически). Можно ли эффективно извлекать из HTML информацию, в какой части экрана появится та или иная надпись, и можно ли этим эффективно пользоваться для моей задачи? Ещё я так поняла, что HTML страница состоит из этаких клеток, как таблица. Если извлечь структуру этих клеток вместе с их размерами, думаю, можно будет найти закономерность, которая из клеток содержит информацию, а которые - рекламу, ссылки, и т.п.

Какая интересная интерпретация понимания работы HTML-страниц =)

Попробуйте в браузере ПКМ - Показать исходный код. Там любой текст в чистом виде, разве что между тегами. И, как мне кажется, из текстового файла его вытянуть уж точно попроще, чем с уже визуализированной страницы.


Но все равно слишком абстрактно и даже как-то сюрреалистично Вы описали... Не думаю, что я до конца понял то, что вы хотели сказать. 
Попробуйте как-то конкретизировать саму задачу, чтобы без всяких догадок.

Powered by Invision Power Board (http://www.invisionboard.com)
© Invision Power Services (http://www.invisionpower.com)