![]() |
|
|
![]()
|
|
| les |
|
|||
|
Новичок Профиль Группа: Участник Сообщений: 44 Регистрация: 24.4.2006 Репутация: нет Всего: нет |
Доброе время суток.
Я хотел бы узнать.. Вот, нашел в сети такую статью http://romip.narod.ru/romip2005/05_specs.pdf В ней описываеться метод Байеса. Но немного модифицированный... Был бы признателен если кто нибудь прокомментировал формулу на 3 стр. Как она выводиться из привычного метода Байеса я не понял, хотелось бы закрасить этот пробел. Да и сама формулка не совсем корректна написана. Fw там количество должно быть, или частота относительная, или вообще приправленная еще какимито параметрами...? Это сообщение отредактировал(а) les - 15.5.2008, 00:22 |
|||
|
||||
| les |
|
|||
|
Новичок Профиль Группа: Участник Сообщений: 44 Регистрация: 24.4.2006 Репутация: нет Всего: нет |
И еще хотел узнать...
Попытавшись реализовать пару методов Байеса и prTFIDF получил ужасную скорость.... Мои данные: в mysql храняться тексты, категории этих текстов, словарь слово-норм... этап индексации состоит у меня в создании таблицы, в которой храниться информация, какое слово в каком тексте встречаеться и его относительная частота по отношение ко всему набору слов в тексте (в понятие слово я вкладываю слово-норму - слово с обрезанным окончанием, и содержашиеся в базе-словаре) Классификация же происходит в виде - нахождение слово-норм в текссте без категории, их частоту а потом двойной цикл по катерории (гипотезе) и по слову из предложения... Реализовав все на перле получил неприемлимое быстродействие - классификация одного теста (прогон по все категириям, с поиском максимальной вероятности) занимает несколько минут. Вопрос - понимаю что трудно с моих слов чтолибо оценить, но может кому то броситься ошибка в глаза. Или кто подскажет алгоритм реализации методов на языке ближе к perl. |
|||
|
||||
| les |
|
|||
|
Новичок Профиль Группа: Участник Сообщений: 44 Регистрация: 24.4.2006 Репутация: нет Всего: нет |
все, с формулой разобрался....
Кроме одного... что нужно сделать чтоб работало быстрей... а то так.. для проверки одной гипоиезы (категории) уходит 9*32 секунд (32 категории 9 на штуку). Везде в статьях указано если уж не до сотен, то до десятков в секунду....? |
|||
|
||||
![]()
|
| Правила форума "Алгоритмы" | |
|
|
Форум "Алгоритмы" предназначен для обсуждения вопросов, связанных только с алгоритмами и структурами данных, без привязки к конкретному языку программирования и/или программному продукту.
Если Вам понравилась атмосфера форума, заходите к нам чаще! С уважением, maxim1000. |
| 0 Пользователей читают эту тему (0 Гостей и 0 Скрытых Пользователей) | |
| 0 Пользователей: | |
| « Предыдущая тема | Алгоритмы | Следующая тема » |
|
|
По вопросам размещения рекламы пишите на vladimir(sobaka)vingrad.ru
Отказ от ответственности Powered by Invision Power Board(R) 1.3 © 2003 IPS, Inc. |