Версия для печати темы
Нажмите сюда для просмотра этой темы в оригинальном формате
Форум программистов > Delphi: Звук, графика и видео > распознавание слов


Автор: bald 10.1.2011, 06:42
Вечер добрый, господа! 

Хотел бы проконсультироваться по поводу задачи, суть которой такова :
  •  есть несколько wav-файлов, на которых записаны разные слова (далее эталоны);
  •  некто произносит слово, оно так же записывается в wav-файл (далее образец);
  •  необходимо провести сравнительный анализ образца с эталонами и сказать, какое слово было произнесенно
  •  визуализировать эталонное слово и образец
Интересуют варианты того, как это можно реализовать.

Предполагаю, что нужно распарсить wav-файл (это уже сделал), получить данные (также меня интересует, что за данные я оттуда получаю?) и уже используя некие математические алгоритмы (возможно сравнение независимо от амплитуды (нормализованное), сравнение формы огибающей, Kepstrum, или разбитие на фонемы ) определить, какое слово было произнесено.




Автор: Alexeis 10.1.2011, 10:41
Цитата(bald @  10.1.2011,  07:42 Найти цитируемый пост)
получить данные (также меня интересует, что за данные я оттуда получаю?) 

Подробно тут http://forum.vingrad.ru/topic-89826.html

Цитата(bald @  10.1.2011,  07:42 Найти цитируемый пост)
 и уже используя некие математические алгоритмы (возможно сравнение независимо от амплитуды (нормализованное), сравнение формы огибающей, Kepstrum, или разбитие на фонемы ) определить, какое слово было произнесено.

  Алгоритм свертки определяет степень подобия сигналов. Правда похожие на слух слова могут слишком отличаться (например по длительности произношения слова, тембру)

Автор: bald 10.1.2011, 16:30
Цитата(Alexeis @ 10.1.2011,  10:41)
Подробно тут http://forum.vingrad.ru/topic-89826.html

благодарю. мое предположение подтвердилось, в wav-файле содержатся амплитуды

Powered by Invision Power Board (http://www.invisionboard.com)
© Invision Power Services (http://www.invisionpower.com)