| Версия для печати темы
Нажмите сюда для просмотра этой темы в оригинальном формате |
| Форум программистов > Алгоритмы > Автогенераторы контента |
| Автор: OneFourth 4.12.2006, 00:27 |
| По какому принципу работают автоматические генераторы контента. Т.е. понятно, что заходят на сайт, скачивают хтмл-страницу, парсят, выкладывают куда надо. Не понятно какую имено часть вырезать, т.е. как программно распознать в хтмл-странице имено сам контент, а не меню, скрипты, хедеры и футеры и т.д. К примеру, можно вырезать фрагменты между тегами <td>, и тот который из них больше по объему предположительно и будет контентом, либо вырезать только содержимое поля description. Какие еще есть идеи? |
| Автор: maxim1000 4.12.2006, 02:04 |
| я бы посмотрел на статистики всякие например, подозреваю, что во всяких "служебных" частях процент того же "<" будет побольше, чем в обычном тексте или можно посмотреть на статистику попарных сочетаний если память не изменяет, нам в курсе по криптографии рассказывали, что этот показатель неплохо характеризует естественный язык, даже использовался для взлома простейших шифров... |
| Автор: OneFourth 4.12.2006, 22:05 |
| Попарных сочетаний каких именно элементов? В том то и вопрос как естественный язык отличить от всего остального хлама на веб-странице... |
| Автор: maxim1000 5.12.2006, 01:51 |
соседних хотя я сейчас повспоминал, вроде там была частота совпадения символов в зависимости от расстояния между ними... |
| Автор: OneFourth 5.12.2006, 13:13 |
| Можешь подкинуть пару линков на материалы по этой теме? Хотелось бы более подробно вникнуть... |
| Автор: maxim1000 5.12.2006, 13:58 |
| не, просто написал, что вспомнилось с лекций... давно это было уже... |