Версия для печати темы
Нажмите сюда для просмотра этой темы в оригинальном формате
Форум программистов > Алгоритмы > Автогенераторы контента


Автор: OneFourth 4.12.2006, 00:27
По какому принципу работают автоматические генераторы контента. Т.е. понятно, что заходят на сайт, скачивают хтмл-страницу, парсят, выкладывают куда надо. Не понятно какую имено часть вырезать, т.е. как программно распознать в хтмл-странице имено сам контент, а не меню, скрипты, хедеры и футеры и т.д. 
К примеру, можно вырезать фрагменты между тегами <td>, и тот который из них больше по объему предположительно и будет контентом, либо вырезать только содержимое поля description.
Какие еще есть идеи?

Автор: maxim1000 4.12.2006, 02:04
я бы посмотрел на статистики всякие
например, подозреваю, что во всяких "служебных" частях процент того же "<" будет побольше, чем в обычном тексте
или можно посмотреть на статистику попарных сочетаний
если память не изменяет, нам в курсе по криптографии рассказывали, что этот показатель неплохо характеризует естественный язык, даже использовался для взлома простейших шифров...

Автор: OneFourth 4.12.2006, 22:05
Попарных  сочетаний каких именно элементов?

В том то и вопрос как естественный язык отличить от всего остального хлама на веб-странице...

Автор: maxim1000 5.12.2006, 01:51
Цитата(OneFourth @  4.12.2006,  21:05 Найти цитируемый пост)
Попарных  сочетаний каких именно элементов?

соседних

хотя я сейчас повспоминал, вроде там была частота совпадения символов в зависимости от расстояния между ними...

Автор: OneFourth 5.12.2006, 13:13
Можешь подкинуть пару линков на материалы по этой теме? Хотелось бы более подробно вникнуть...

Автор: maxim1000 5.12.2006, 13:58
не, просто написал, что вспомнилось с лекций... давно это было уже...

Powered by Invision Power Board (http://www.invisionboard.com)
© Invision Power Services (http://www.invisionpower.com)