.
Рисунок
2.4 Соотношение спектра речи
и
спектра формант
[1]
Относительная
встречаемость формант
по спектру может быть оценена так. Разобьем весь
диапазон частот на полоски, например, по 100 Гц, и подсчитаем относительное
число формант (в %) каждой полоске. Результат такого подсчета даст нам кривую
(рисунок 2.5).
Рисунок
2.5 Относительная встречаемость формант
[1]
Для оценивания разборчивости речи наибольшее значение имеют следующие характеристики слуховой системы человека, именуемые «постоянными слуха» [1]:
-
порог слышимости
;
логарифмическая
ширина критической полосы слуха
;
маскировка
слуха
.
Порог
слышимости
- это минимальное звуковое давление, ниже которого
ухо не воспринимает звук (рисунок 2.6). Выражается в децибелах, по отношению к
давлению
, соответствующему пороговой величине давления звука
на частоте 1000 Гц.
Рисунок
2.6 Порог слышимости
и болевой порог
[1]
Рисунок
2.7 Критическая полоса слуха
[1]
Ширина
критической полосы слуха
- это разрешающая способность слухового аппарата
человека, который можно уподобить гребенке фильтров. Например, на частоте 100
Гц критическая полоса слуха близка 100 Гц, а на частоте 8000 Гц - близка 600 Гц
(рисунок 2.7). Для удобства расчетов вводят понятие логарифмической критической
полосы слуха (рисунок 2.8):
.
Рисунок
2.8 Логарифмическая критическая полоса слуха [1]
Маскировка
слуха - это явление ослабления слышимости или полного пропадания полезного
звука на фоне мешающего звука. Количественно выражается как разница:
, (2.2)
где
- порог слышимости при наличии мешающего звука. На
рисунке 2.9 приведено семейство индивидуальных кривых маскировки для различных
уровней маскирующего сигнала
. Здесь
- разность высот тона маскирующей
и маскируемой
компонент,
причем высота тона
измеряется в Барках:
.
Рисунок 2.9 Семейство индивидуальных кривых маскировки [7]
Различают [1] следующие виды (меры) разборчивости речи:
- разборчивость
формант
;
- разборчивость
звуков
;
- разборчивость
слогов
;
- разборчивость
слов
;
- разборчивость
фраз
.
При расчете разборчивости приходится иметь дело с частотно-зависимыми функциями. Поэтому результаты количественного расчета для различных участков спектра различны. Ввиду этого задача расчета решается разделением диапазона частот, используемого для передачи речи, на узкие полосы, внутри которых можно не считаться с указанной частотной зависимостью и относить полученные результаты к средней частоте полосы. Далее вычисляется разборчивость для каждой полосы частот, а общая разборчивость находится суммированием «полосовых» разборчивостей.
Поскольку свойством аддитивности обладает только формантная
разборчивость:
, (2.3)
где
- формантная разборчивость в
-той полосе частот, идея расчета сводится к предварительному
вычислению величины
, с последующим пересчетом ее в величины
,
,
,
, на
основании имеющейся информации о зависимости между разными мерами
разборчивости.
Разборчивость
в каждой полосе можно представить в виде:
, (2.4)
где
- формантная разборчивость в отсутствие мешающих
факторов (шум, влияние тракта передачи);
-
коэффициент восприятия, учитывающий потери разборчивости из-за наличия мешающих
факторов.
Разделение диапазона частот речевого сигнала на полосы можно производить по-разному. В [1] называется два способа:
- деление на полосы одинаковой ширины;
- деление на равноартикуляционные полосы,
причем
предпочтение отдается второму способу, позволяющему упростить выкладки.
Количество полос при этом предлагается выбрать равным
. В работе [8] также выбран способ деления на
равноартикуляционные полосы.
В
[2-9] указывается иной способ - деление на октавные или третьоктавные полосы.
Количество полос при этом предлагается выбрать равным
.
По-видимому, выбор способа деления на полосы частот - вопрос не столько принципиальный, сколько зависящий от «вкуса» исследователя.
Рассмотрим
далее идею расчета разборчивости речи, исходя из принципа деления на
равноартикуляционные полосы [1]. При этом
,поскольку,
в силу вероятностного характера формантной разборчивости, справедливо
соотношение
.Таким образом,
.
Величины
определяют, исходя из эмпирической функциональной
зависимости
(функцию
называют
«постоянной артикуляционной характеристикой речи» [1]), где уровень ощущения
формант
вычисляют по формуле 2.5:
, (2.5)
где
- значение спектра формант на входе тракта;
- порог слышимости;
-
маскировка от шумов всех видов;
-
затухание в тракте;
- логарифмическая ширина критической полосы слуха.
Для
достаточно высоких уровней шума:
выражение
для уровня ощущения формант
можно
вычислять по упрощенной формуле 2.6:
(2.6)
Вид
зависимости
приведен на рисунке 2.10.
Рисунок
2.10 Вид зависимости
Отметим
два важных обстоятельства. Во-первых, функция
не
зависит от полосы частот. Во-вторых, в литературе можно встретить весьма
различающиеся кривые
. Например, даже в работе [1] встречаем две такие
кривые: для «идеализированной артикуляционной бригады» и для «типовой
артикуляционной бригады». А в работе [5] приводится аналогичная зависимость,
существенно отличающаяся от соответствующих кривых в работе [6]. Более
внимательный анализ работы [10] показывает, что здесь вместо спектра формант
используют спектр речи
, и, как
следствие, вместо уровня ощущения формант
используют
уровень ощущения речи (формула 2.7):
(2.7)
Таким
образом, в [5] вместо зависимости
предлагают
использовать сходную, но количественно отличающуюся зависимость
.
Таким
образом, хотя аналитическая методика расчета разборчивости речи на сегодняшний
день проработана теоретически и экспериментально весьма глубоко, при
практическом ее использовании следует помнить о существовании множества
модификаций такой методики. Непродуманное «перекрестное» использование
элементов этих методик может привести к неверным результатам расчета
разборчивости речи.
Рисунок 2.11 Зависимость слоговой словесной разборчивости от разборчивости
речь акустический шум разборчивость
Рисунок 2.12 Зависимость от разборчивости формант разборчивости слогов
Рисунок 2.13 Зависимость фразовой разборчивости от разборчивости слов
3. Методы распознавания речи и их связь с повышением разборчивости
Распознавание речи - это общее название широкой области речевых
технологий, за которым кроется целый ряд достаточно обособленных направлений,
каждое из которых ориентировано на решение конкретных прикладных задач и
требует отдельной проработки.
.1 Технология распознавания речи
Система распознавания речи состоит, как правило, из трех основных компонентов: акустические модели, языковая модель и декодер.
Акустические модели Акустические модели позволяют оценить распознавание
речевого сегмента с точки зрения схожести на звуковом уровне. Современные
акустические модели для так называемого пофонемного распознавания основаны на
использовании скрытых Марковских моделей (Hidden Markov Models - HMM) (рисунок
3.1).
Рисунок 3.1 Структура скрытой Марковской модели
Модели языка Использования чисто акустической информации недостаточно для осуществления качественного распознавания речи. Например, в реальных условиях (при наличии посторонних шумов и искажений речевого сигнала) ни одни даже самые точные акустические модели не смогут отличить слово крюк от слова трюк.
В такой ситуации важна информация о контексте: теме разговора и, что еще более важно, о тех словах, которые уже были распознаны ранее. Например, если ранее было распознано слово железный, то в этой ситуации гораздо вероятнее ожидать произнесения слова крюк, чем трюк. Подобная оценка и осуществляется языковой моделью.
При помощи грамматик можно вручную задать возможные последовательности слов, которые, как ожидается, произнесет говорящий. Такой подход эффективен для узких задач, когда пользователь поставлен жесткие в рамки определенной речевой ситуации. Например, грамматика может задавать произвольную последовательность цифр в том случае, если известно, что в данный момент пользователь отвечает на вопрос «Пожалуйста, продиктуйте номер вашего телефона».
Статистические модели языка используются при распознавании слитной речи, не ограниченной узкой ситуацией. В этом случае невозможно вручную создать грамматику, которая моделировала бы все возможные сочетания слов в языка. Вместо этого на основании текстовых данных большого объема (десятки миллионов слов) строится статистическая модель, которая оценивает вероятности следования слов друг за другом. Для примера, приведенного выше, такая модель могла бы сообщить, что вероятность словосочетания железный крюк в 30 раз больше, чем железный трюк.
Декодер Декодер - это программный компонент системы распознавания, который совмещает данные, получаемые в ходе распознавания от акустических и языковых моделей, и на основании их объединения определяет наиболее вероятную последовательность слов, которая и является конечным результатом распознавания.
На первый взгляд декодер - наименее нагруженный в научном плане компонент
системы распознавания. Однако, быстрый и надежный декодер является главным
фактором успеха любой прикладной системы распознавания. Создание такого
декодера - сложнейшая техническая задача, требующая высочайшей квалификации
разработчиков.
Методы распознавания речи бывают следующих видов:
. Распознавание голосовых команд
Распознавание голосовых команд предусматривает, что пользователь произносит отдельные команды из заранее предопределенного списка.
Такие системы используются для организации управления голосом отдельными компьютерными программами или устройствами.
. Языконезависимое распознавание
Не зависящее от языка распознавание команд предполагает обязательную тренировку системы голосом.
Для того чтобы создать эталон новой команды пользователь должен несколько раз произнести данную команду в микрофон. Подобные системы распознавания применимы для случаев, когда количество команд составляет не более одной сотни.