![]() |
|
|
![]()
|
|
| dereyly |
|
|||
|
Бывалый ![]() Профиль Группа: Участник Сообщений: 217 Регистрация: 16.6.2006 Репутация: 1 Всего: 4 |
-) Естественно нужно отсечь окончания или привести к инфинитиву...
-) Но при глобальном кодировании возникает проблема размерности... на мой взгляд есть вариант динамической размерности. В вашей задачи есть либо сравнение текста с группой либо двух текстов. Каждый раз вам придется их по новому индексировать. Суть вообщем в том что вам по сути не нужно индексирование НУЖНЫХ слов, вам нужно избавится от лишних составляющих, текста а нужным словам присвоить в конце предобработки любые индексы. -) Ну и еще по поводу сравнения... кроме к-средних можно использовать что-то вроде Хопфилда (ТекстАналист) или Кохонена (НейроОК). |
|||
|
||||
| VictorTsaregorodtsev |
|
|||
|
Опытный ![]() ![]() Профиль Группа: Участник Сообщений: 274 Регистрация: 28.7.2006 Репутация: 3 Всего: 8 |
W4FhLF, Пример - Астарта от когнитивовцев.
Я в 2001 поиском такого софта занимался - уже с тех пор всё забыл. les, Словарь стоп-слов - для нескольких языков и русского в том числе шел в поставке седьмой версии пакета Статистика. Стукнись в мыло - вышлю. И ХЗ как там алгоритмы нормализации называются - мы работали с книжкой Зализняка и его словарем словоформ. dereyly,
|
|||
|
||||
| les |
|
|||
|
Новичок Профиль Группа: Участник Сообщений: 44 Регистрация: 24.4.2006 Репутация: нет Всего: нет |
По поводу стоп слов... Если учитывать только существительные - по стоп слова свой "вклад" в большей степени теряют. Так как предлоги и прочие шалости такие как наречие сущ. не являються.
У меня делема... как орнагизовать хранение этих веторов... Или создать матрицу двумерую ______|text1|text2|text3 word1_|____|____|____| word2_|____|____|____| word3_|____|____|____| где значения - значение ячеек - это как раз "весовая" характеристика, или чатота.... Но в таком случае надо учесть что и строки и столбцы МОГУТ увеличиваться... так как в строки можнодобавлять имена собственные, а в столбцы новые множества для обучения.... Но как хранить - точнее в чем такую матрицу (как ее организвавть к примеру хранение в SQl) не приходит пока в голову.... |
|||
|
||||
| les |
|
|||
|
Новичок Профиль Группа: Участник Сообщений: 44 Регистрация: 24.4.2006 Репутация: нет Всего: нет |
Пробное тестирование показало что алгоритм база базовs форм существительных - база их словоформ - алгоритм Портера - дальнейшие сравнение по этой базе к хорошему результату не приводит.
Существует ли способ нахождения нормальной формы слова по ее слофоформе? Кроме как тупо в лоб через базу Это сообщение отредактировал(а) les - 7.5.2008, 22:09 |
|||
|
||||
| les |
|
|||
|
Новичок Профиль Группа: Участник Сообщений: 44 Регистрация: 24.4.2006 Репутация: нет Всего: нет |
Пришел к выводу что подходит метод Байеса....
Точнее модифицированный.... http://romip.narod.ru/romip2005/05_specs.pdf |
|||
|
||||
![]()
|
| Правила форума "Алгоритмы" | |
|
|
Форум "Алгоритмы" предназначен для обсуждения вопросов, связанных только с алгоритмами и структурами данных, без привязки к конкретному языку программирования и/или программному продукту.
Если Вам понравилась атмосфера форума, заходите к нам чаще! С уважением, maxim1000. |
| 0 Пользователей читают эту тему (0 Гостей и 0 Скрытых Пользователей) | |
| 0 Пользователей: | |
| « Предыдущая тема | Алгоритмы | Следующая тема » |
|
|
По вопросам размещения рекламы пишите на vladimir(sobaka)vingrad.ru
Отказ от ответственности Powered by Invision Power Board(R) 1.3 © 2003 IPS, Inc. |