Поиск:

Ответ в темуСоздание новой темы Создание опроса
> Кластерный анализ, Алгоритмы и программы, реализующие КА 
:(
    Опции темы
LoneRay
Дата 3.11.2005, 10:57 (ссылка) | (нет голосов) Загрузка ... Загрузка ... Быстрая цитата Цитата


Новичок



Профиль
Группа: Участник
Сообщений: 3
Регистрация: 3.11.2005
Где: г.Москва

Репутация: нет
Всего: нет



Уважаемые форумчане и гости столицы форума!

Подскажите пожалуйста, какие есть средства для кластерного анализа. Я долго рыскал по сети, но ничего приемлимого кроме, разве что, r-project.org, не нашёл. В идеале хотелось бы вообще open-code, но, если честно, сомневаюсь, что такие есть.

Всякие дорогущие монстры типа SAS/STAT тут совсем не катят smile

Да, ещё одно, поделитесь ссылочками, где можно почитать как про сам КА, так и про различные алгоритмы.

Заранее спасибо!
PM MAIL   Вверх
podval
Дата 3.11.2005, 11:52 (ссылка) | (нет голосов) Загрузка ... Загрузка ... Быстрая цитата Цитата


Где я? Кто я?
****


Профиль
Группа: Экс. модератор
Сообщений: 3094
Регистрация: 25.3.2002
Где: СПб

Репутация: нет
Всего: 62



Цитата(LoneRay @ 3.11.2005, 10:57)
Всякие дорогущие монстры типа SAS/STAT тут совсем не катят

Определись с задачей, которую хочешь решить и напиши прогу сам. Там ничего сложного.

Основной вопрос, на который может ответить кластерный анализ, - группируются ли статистические данные в группы, схожие по какому-то критерию. Отсюда и пляши, надо ли тебе это.
PM WWW ICQ   Вверх
Reptor
Дата 3.11.2005, 19:55 (ссылка) | (нет голосов) Загрузка ... Загрузка ... Быстрая цитата Цитата


Эксперт
***


Профиль
Группа: Завсегдатай
Сообщений: 1213
Регистрация: 29.12.2004

Репутация: нет
Всего: 0



Есть программа под названием STATISTICA так есть кластерный анализ (сам недавно смотрел). Да и кроме этого много чего другого.
PM MAIL ICQ   Вверх
Гость_Silver
Дата 8.11.2005, 14:46 (ссылка)    |    (голосов: 0) Загрузка ... Загрузка ... Быстрая цитата Цитата


Unregistered











Много интересного по кластерному анализу есть в книгах В.Д. Мазурова из УРГУ.
Там выделены два решения проблемы задача таксономии (кстати наиболее просто реализуемый алгорим вручную) и при помощи нейросети (тоже не сложно реализовать алгорим вручную но он поаккуратнее))
  Вверх
LoneRay
Дата 8.11.2005, 15:12 (ссылка) | (нет голосов) Загрузка ... Загрузка ... Быстрая цитата Цитата


Новичок



Профиль
Группа: Участник
Сообщений: 3
Регистрация: 3.11.2005
Где: г.Москва

Репутация: нет
Всего: нет



Сразу хочу сказать спасибо)) за то, что ответили.


podval Я ищу инфу для диплома. Т.е. описания алгоритмов, некоторые программы для тестирования. Отсюда требования бесплатности. Скорее всего - действительно придётся писать. Оно действительно несложно, но из-за раздолбайства научника всё это может обрасти большим количеством проблемм.


Reptor Я читал про эту прогу, но себе не записал. Она платная?


Гость_Silver Ты не в курсе, эта книжка есть в электронном варианте?
PM MAIL   Вверх
bilbobagginz
Дата 8.11.2005, 23:39 (ссылка) | (нет голосов) Загрузка ... Загрузка ... Быстрая цитата Цитата


Naughtius Maximus
****


Профиль
Группа: Экс. модератор
Сообщений: 8813
Регистрация: 2.3.2004
Где: Israel

Репутация: нет
Всего: 317



ты как-то сыро диплом пишешь. есть несколько сфер "кластерного" анализа.
основные сферы - это "высоко-производительный анализ" как противопоставлиение "высоко-нагруженный анализ"
1. когда тебе нужно большое кол-во ресурсов в короткий пром. времени (напр. предсказание акций, или погоды). в таком случае есть огромное кол-во и решений и проблем. ( high performance computing )
2. когда у тебя есть огромная масса данных и тебе их нужно переработать без жестких ограничений во времени. напр. переработка снятых данных с физического или другого опыта, обработка генов, рендеринг мультфильмов и т.д. ( high throughput computing )

в обоих случаях тебе нужно хотя-бы ознакомиться с параллельнным/распределенным программированием. есть сайт: www.pаrallel.ru








--------------------
Я ещё не демон. Я только учусь.
PM WWW   Вверх
LoneRay
Дата 9.11.2005, 09:21 (ссылка) | (нет голосов) Загрузка ... Загрузка ... Быстрая цитата Цитата


Новичок



Профиль
Группа: Участник
Сообщений: 3
Регистрация: 3.11.2005
Где: г.Москва

Репутация: нет
Всего: нет



bilbobagginz Спасибо за ссылочку! Буду читать smile Некоторое представление о параллельном программировании у меня есть, но, думаю, его недостаточно.

А с неточностью темы диплома и прочим... меня этот вопрос тоже сильно напрягает. Из научника приходится всё буквально выдавливать, а инициативу проявлять здесь себе дороже будет.

Скорее всего, в виде данных будет некоторая геологическая и/или географическая информация. Объём ожидается не слишком большой, но вот с мощностью компов, на которых будет всё это проссчитываться - прокол. Слабые они там. Т.е., скорее всего, будет именно high throughput computing
PM MAIL   Вверх
Виктор Царегородцев
Дата 8.1.2006, 14:26 (ссылка)    |    (голосов: 0) Загрузка ... Загрузка ... Быстрая цитата Цитата


Unregistered











Посмотрите ссылочки в разделе Software на kdnuggets.com

Алгоритмы кластерного анализа практически все являются вычислительно линейными по любой размерности (число признаков в векторе, число анализируемых векторов, число кластеров) - за исключением лямбда-алгоритма Н.Г.Загоруйко квадратичной сложности.
Т.е. и метод динамических ядер (базовый алгоритм кластеризации), и нейросетевые его перепевки (карты Кохонена, квантующие сети) абсолютно ненапряжны в плане времени расчетов - до момента переваливания числа векторов за миллион. Секунды и минуты на обычном компе, без всякого распараллеливания (если вся база данных в память влезает - чтобы к диску не лазить).

Распараллеливается всё тоже без проблем.
Из возможностей ускорения - использование неравенства треугольника для сокращения числа сравнений (статья Чарльза Элкана с соавторами года так 2003 - точное название и ссылку не помню), но поскольку методы кластеризации - одни из базовых в группе методов data mining, то люди уже понаделали кучу разных вариантов алгоритмов под разные специфики задач. В интернете буржуинских статей в свободном доступе навалом.

Я себе писал обычный метод динамических ядер, с возможностью выбора метрики при сравнении векторов и с возможностью задания правил предварительного масштабирования данных, плюс обобщение кода на случай наличия векторов-эталонов (т.е. реализация и метода классификации с учителем - метода К ближайших соседей, KNN).

Виктор Царегородцев
www.NeuroPro.ru - нейросети, анализ данных, прогнозирование
  Вверх
  
Ответ в темуСоздание новой темы Создание опроса
0 Пользователей читают эту тему (0 Гостей и 0 Скрытых Пользователей)
0 Пользователей:
« Предыдущая тема | Разыскивается | Следующая тема »


 




[ Время генерации скрипта: 0.0471 ]   [ Использовано запросов: 22 ]   [ GZIP включён ]


Реклама на сайте     Информационное спонсорство

 
По вопросам размещения рекламы пишите на vladimir(sobaka)vingrad.ru
Отказ от ответственности     Powered by Invision Power Board(R) 1.3 © 2003  IPS, Inc.