Поиск:

Ответ в темуСоздание новой темы Создание опроса
> Информационный поиск. 
:(
    Опции темы
dereyly
Дата 4.5.2008, 18:53 (ссылка) | (нет голосов) Загрузка ... Загрузка ... Быстрая цитата Цитата


Бывалый
*


Профиль
Группа: Участник
Сообщений: 217
Регистрация: 16.6.2006

Репутация: 1
Всего: 4



-) Естественно нужно отсечь окончания или привести к инфинитиву...

-) Но при глобальном кодировании возникает проблема размерности...
на мой взгляд есть вариант динамической размерности. В вашей задачи есть либо сравнение текста с группой либо двух текстов. Каждый раз вам придется их по новому индексировать. Суть вообщем в том что вам по сути не нужно индексирование НУЖНЫХ слов, вам нужно избавится от лишних составляющих, текста а нужным словам присвоить в конце предобработки любые индексы.

-) Ну и еще по поводу сравнения... кроме к-средних можно использовать что-то вроде Хопфилда (ТекстАналист) или Кохонена (НейроОК). 
PM MAIL   Вверх
VictorTsaregorodtsev
Дата 6.5.2008, 17:08 (ссылка) | (нет голосов) Загрузка ... Загрузка ... Быстрая цитата Цитата


Опытный
**


Профиль
Группа: Участник
Сообщений: 274
Регистрация: 28.7.2006

Репутация: 3
Всего: 8



W4FhLF, Пример - Астарта от когнитивовцев. 
Я в 2001 поиском такого софта занимался - уже с тех пор всё забыл.

les, Словарь стоп-слов - для нескольких языков и русского в том числе шел в поставке седьмой версии пакета Статистика. Стукнись в мыло - вышлю.
И ХЗ как там алгоритмы нормализации называются - мы работали с книжкой Зализняка и его словарем словоформ.

dereyly
Цитата
более эффективная система у вас получится если вы будете вычислять не только статистику встречаемости слов, но и статистику взаимного расположения слов для данного текста. 
 И сразу существенно вырастет размерность вектора. Потестировать-то лучше на минимуме, а потом, если не хватит, можно и взаимное расположение прицепить.
PM MAIL WWW   Вверх
les
Дата 6.5.2008, 20:59 (ссылка) | (нет голосов) Загрузка ... Загрузка ... Быстрая цитата Цитата


Новичок



Профиль
Группа: Участник
Сообщений: 44
Регистрация: 24.4.2006

Репутация: нет
Всего: нет



По поводу стоп слов... Если учитывать только существительные - по стоп слова свой "вклад" в большей степени теряют. Так как предлоги и прочие шалости такие как наречие сущ. не являються.
У меня делема... как орнагизовать хранение этих веторов...
Или создать матрицу двумерую

______|text1|text2|text3
word1_|____|____|____|
word2_|____|____|____|
word3_|____|____|____|

где значения - значение ячеек - это как раз "весовая" характеристика, или чатота.... Но в таком случае надо учесть что и строки и столбцы МОГУТ увеличиваться... так как в строки можнодобавлять имена собственные, а в столбцы новые множества для обучения.... Но как хранить - точнее в чем такую матрицу (как ее организвавть к примеру хранение в SQl) не приходит пока в голову....
PM MAIL   Вверх
les
Дата 7.5.2008, 22:09 (ссылка) | (нет голосов) Загрузка ... Загрузка ... Быстрая цитата Цитата


Новичок



Профиль
Группа: Участник
Сообщений: 44
Регистрация: 24.4.2006

Репутация: нет
Всего: нет



Пробное тестирование показало что алгоритм база базовs форм существительных - база их словоформ - алгоритм Портера - дальнейшие сравнение по этой базе к хорошему результату не приводит.

Существует ли способ нахождения нормальной формы слова по ее слофоформе? Кроме как тупо в лоб через базу

Это сообщение отредактировал(а) les - 7.5.2008, 22:09
PM MAIL   Вверх
les
Дата 12.5.2008, 19:55 (ссылка) | (нет голосов) Загрузка ... Загрузка ... Быстрая цитата Цитата


Новичок



Профиль
Группа: Участник
Сообщений: 44
Регистрация: 24.4.2006

Репутация: нет
Всего: нет



Пришел к выводу что подходит метод Байеса....
Точнее модифицированный.... 
http://romip.narod.ru/romip2005/05_specs.pdf

PM MAIL   Вверх
Ответ в темуСоздание новой темы Создание опроса
Правила форума "Алгоритмы"

maxim1000

Форум "Алгоритмы" предназначен для обсуждения вопросов, связанных только с алгоритмами и структурами данных, без привязки к конкретному языку программирования и/или программному продукту.


Если Вам понравилась атмосфера форума, заходите к нам чаще! С уважением, maxim1000.

 
0 Пользователей читают эту тему (0 Гостей и 0 Скрытых Пользователей)
0 Пользователей:
« Предыдущая тема | Алгоритмы | Следующая тема »


 




[ Время генерации скрипта: 0.0418 ]   [ Использовано запросов: 21 ]   [ GZIP включён ]


Реклама на сайте     Информационное спонсорство

 
По вопросам размещения рекламы пишите на vladimir(sobaka)vingrad.ru
Отказ от ответственности     Powered by Invision Power Board(R) 1.3 © 2003  IPS, Inc.