Версия для печати темы
Нажмите сюда для просмотра этой темы в оригинальном формате
Форум программистов > Алгоритмы > Распознавание речи


Автор: kjohnny 17.11.2005, 15:40
Добрый день! Столкнулся со следующей задачей: распознание голосовых сигналов, типа "Сохранить", ну или "Выход"...
Знаю, что в качестве критерия близости получаемой реализации некотого входного сигнала (коэффициенты разложения по какому-либо базису (Фурье, вейвлет-пакеты)), используются некоторые расстояния (метрики), т.е. в моем понимании это выглядит так: вычисляем "расстояние" по метрике между реализацией сигнала и всеми хранимыми эталонами сигналов, далее выбирает тот эталон, при котором получили наименьшее "расстояние". Вроде все верно, да?
Т.е. метрика считает "расстояние" между характеристиками-признаками входного сигнала (по сути, коэффициентами рахложения по базису) и характеристиками эталонов? по-моему, эт так.

smile Так, вот, очень сильно smile хотелось бы узнать об этих самых МЕТРИКАХ для сравнения голосовых сигналов! КАКИЕ они ЕСТЬ (так сказать, полный списочек smile !!!!!!!!!!!!!!!!!!!!!!!!!!!) ЧЕМ отличаются друг от друга!! Влияет ли выбор исходного базиса (Фурье, вейвлет-пакеты) на выбор метрики?! Какие лучше в мое случает распознания??!

Знаю только парочку названий метрик: расстояние Евклида, Махаланобиса, Минковского. А вот их устройство, принцип вычисления, отличия, ничего не знаю! smile

И еще, что позволяет нам сделать корреляция и ФУНКЦИЯ когерентности???

Я в этом деле полный новичок, случай вот такой --> smile (экспромтик такой!) Хотелось бы оч основательных ответов на доходчивом языке, заранее всем спасибо! smile

И еще, буду очень благодарен, если тот, у кого есть интересные поучительные статейки, лекции или еще чАго, вышлет на мыло студенту smile так сказать! smile

Автор: podval 17.11.2005, 18:43
Цитата(kjohnny @ 17.11.2005, 15:40)
т.е. в моем понимании это выглядит так: вычисляем "расстояние" по метрике между реализацией сигнала и всеми хранимыми эталонами сигналов, далее выбирает тот эталон, при котором получили наименьшее "расстояние". Вроде все верно, да?
Т.е. метрика считает "расстояние" между характеристиками-признаками входного сигнала (по сути, коэффициентами рахложения по базису) и характеристиками эталонов? по-моему, эт так.


Оно выглядит так, когда распознаются статические образы. Речь - штука динамическая! Поэтому используется накопленная метрика.


Цитата(kjohnny @ 17.11.2005, 15:40)
Фурье, вейвлет-пакеты

Этот базис для распознавания речи не годится.


L. Rabiner and B.-H. Juang, Fundamentals of Speech Recognition, Prentice Hall, 1993. - рекомендую начать с этого. А то будет вопросов еще больше smile

Автор: kjohnny 18.11.2005, 04:30
Цитата
Речь - штука динамическая! Поэтому используется накопленная метрика.


Под накопленной метрикой подразумевается методы DTW, марковские модели??

Цитата
Fundamentals of Speech Recognition


Облазил множество источников, нашел тока интернет-магазины, стоимость книжки впечатляет, может не там ищу.

Цитата
Этот базис для распознавания речи не годится.


А какие годятся?

smile

Автор: podval 18.11.2005, 12:55
Сверху в разделе прикреплена тема, в которой можно много чего найти.

Автор: kjohnny 22.11.2005, 18:29
Cкрытые марковские модели и DTW - в чем отличие данных методов, в чем их концепция??
Где о них можно почитать подробно, желательно на естественном национальном?

Автор: podval 22.11.2005, 19:42
На естественном английском языке находится при помощи Гугля.

http://www.google.com/search?hl=en&lr=&q=dynamic+time+warping&btnG=Search

http://www.google.com/search?hl=en&lr=&q=hidden+markov+models&as_q=tutorial&btnG=Search+within+results

На русском языке даже в бумажном варианте найти непросто, особенно по СММ.
По DTW на форуме уже много раз спрашивали, ищи здесь.

Автор: podval 25.11.2005, 12:26
Professor Joseph Picone. http://www.cavs.msstate.edu/hse/ies/publications/courses/ece_8463/lectures/current/

тоже хороший учебник

Powered by Invision Power Board (http://www.invisionboard.com)
© Invision Power Services (http://www.invisionpower.com)