![]() |
|
|
![]()
|
|
| LoneRay |
|
|||
|
Новичок Профиль Группа: Участник Сообщений: 3 Регистрация: 3.11.2005 Где: г.Москва Репутация: нет Всего: нет |
Уважаемые форумчане и гости
Подскажите пожалуйста, какие есть средства для кластерного анализа. Я долго рыскал по сети, но ничего приемлимого кроме, разве что, r-project.org, не нашёл. В идеале хотелось бы вообще open-code, но, если честно, сомневаюсь, что такие есть. Всякие дорогущие монстры типа SAS/STAT тут совсем не катят Да, ещё одно, поделитесь ссылочками, где можно почитать как про сам КА, так и про различные алгоритмы. Заранее спасибо! |
|||
|
||||
| podval |
|
|||
![]() Где я? Кто я? ![]() ![]() ![]() ![]() Профиль Группа: Экс. модератор Сообщений: 3094 Регистрация: 25.3.2002 Где: СПб Репутация: нет Всего: 62 |
Определись с задачей, которую хочешь решить и напиши прогу сам. Там ничего сложного. Основной вопрос, на который может ответить кластерный анализ, - группируются ли статистические данные в группы, схожие по какому-то критерию. Отсюда и пляши, надо ли тебе это. |
|||
|
||||
| Reptor |
|
|||
![]() Эксперт ![]() ![]() ![]() Профиль Группа: Завсегдатай Сообщений: 1213 Регистрация: 29.12.2004 Репутация: нет Всего: 0 |
Есть программа под названием STATISTICA так есть кластерный анализ (сам недавно смотрел). Да и кроме этого много чего другого.
|
|||
|
||||
| Гость_Silver |
|
|||
|
Unregistered |
Много интересного по кластерному анализу есть в книгах В.Д. Мазурова из УРГУ.
Там выделены два решения проблемы задача таксономии (кстати наиболее просто реализуемый алгорим вручную) и при помощи нейросети (тоже не сложно реализовать алгорим вручную но он поаккуратнее)) |
|||
|
||||
| LoneRay |
|
|||
|
Новичок Профиль Группа: Участник Сообщений: 3 Регистрация: 3.11.2005 Где: г.Москва Репутация: нет Всего: нет |
Сразу хочу сказать спасибо)) за то, что ответили.
podval Я ищу инфу для диплома. Т.е. описания алгоритмов, некоторые программы для тестирования. Отсюда требования бесплатности. Скорее всего - действительно придётся писать. Оно действительно несложно, но из-за раздолбайства научника всё это может обрасти большим количеством проблемм. Reptor Я читал про эту прогу, но себе не записал. Она платная? Гость_Silver Ты не в курсе, эта книжка есть в электронном варианте? |
|||
|
||||
| bilbobagginz |
|
|||
![]() Naughtius Maximus ![]() ![]() ![]() ![]() Профиль Группа: Экс. модератор Сообщений: 8813 Регистрация: 2.3.2004 Где: Israel Репутация: нет Всего: 317 |
ты как-то сыро диплом пишешь. есть несколько сфер "кластерного" анализа.
основные сферы - это "высоко-производительный анализ" как противопоставлиение "высоко-нагруженный анализ" 1. когда тебе нужно большое кол-во ресурсов в короткий пром. времени (напр. предсказание акций, или погоды). в таком случае есть огромное кол-во и решений и проблем. ( high performance computing ) 2. когда у тебя есть огромная масса данных и тебе их нужно переработать без жестких ограничений во времени. напр. переработка снятых данных с физического или другого опыта, обработка генов, рендеринг мультфильмов и т.д. ( high throughput computing ) в обоих случаях тебе нужно хотя-бы ознакомиться с параллельнным/распределенным программированием. есть сайт: www.pаrallel.ru -------------------- Я ещё не демон. Я только учусь. |
|||
|
||||
| LoneRay |
|
|||
|
Новичок Профиль Группа: Участник Сообщений: 3 Регистрация: 3.11.2005 Где: г.Москва Репутация: нет Всего: нет |
bilbobagginz Спасибо за ссылочку! Буду читать
А с неточностью темы диплома и прочим... меня этот вопрос тоже сильно напрягает. Из научника приходится всё буквально выдавливать, а инициативу проявлять здесь себе дороже будет. Скорее всего, в виде данных будет некоторая геологическая и/или географическая информация. Объём ожидается не слишком большой, но вот с мощностью компов, на которых будет всё это проссчитываться - прокол. Слабые они там. Т.е., скорее всего, будет именно high throughput computing |
|||
|
||||
| Виктор Царегородцев |
|
|||
|
Unregistered |
Посмотрите ссылочки в разделе Software на kdnuggets.com
Алгоритмы кластерного анализа практически все являются вычислительно линейными по любой размерности (число признаков в векторе, число анализируемых векторов, число кластеров) - за исключением лямбда-алгоритма Н.Г.Загоруйко квадратичной сложности. Т.е. и метод динамических ядер (базовый алгоритм кластеризации), и нейросетевые его перепевки (карты Кохонена, квантующие сети) абсолютно ненапряжны в плане времени расчетов - до момента переваливания числа векторов за миллион. Секунды и минуты на обычном компе, без всякого распараллеливания (если вся база данных в память влезает - чтобы к диску не лазить). Распараллеливается всё тоже без проблем. Из возможностей ускорения - использование неравенства треугольника для сокращения числа сравнений (статья Чарльза Элкана с соавторами года так 2003 - точное название и ссылку не помню), но поскольку методы кластеризации - одни из базовых в группе методов data mining, то люди уже понаделали кучу разных вариантов алгоритмов под разные специфики задач. В интернете буржуинских статей в свободном доступе навалом. Я себе писал обычный метод динамических ядер, с возможностью выбора метрики при сравнении векторов и с возможностью задания правил предварительного масштабирования данных, плюс обобщение кода на случай наличия векторов-эталонов (т.е. реализация и метода классификации с учителем - метода К ближайших соседей, KNN). Виктор Царегородцев www.NeuroPro.ru - нейросети, анализ данных, прогнозирование |
|||
|
||||
![]()
|
| 0 Пользователей читают эту тему (0 Гостей и 0 Скрытых Пользователей) | |
| 0 Пользователей: | |
| « Предыдущая тема | Разыскивается | Следующая тема » |
|
|
По вопросам размещения рекламы пишите на vladimir(sobaka)vingrad.ru
Отказ от ответственности Powered by Invision Power Board(R) 1.3 © 2003 IPS, Inc. |