и
.
Передаточная функция шумоподавителя определяется формулой:
,
где
- это обобщенное отношение правдоподобия,
которое принимает во внимание величину неопределенности присутствия полезного
сигнала (речи) в зашумленном сигнале. Отношение правдоподобия оценивается как
,
,
где
- обозначают модифицированные функции
Бесселя нулевого и первого порядка, а
- вероятность отсутствия полезного
сигнала в соответствующей спектральной компоненте.
Приведенные формулы выведены при неявном предположении, что
априорное отношение сигнал/шум известно. В реальных условиях, однако, этот
параметр априори неизвестен, при этом предлагается его оценивать соотношением:
,
где
- индекс времени и
- обозначает операцию клиппирования
полуволны. Параметр
выбирается из эмпирических соображений и
обычно
.
Превосходство метода оценивания минимальной среднеквадратической ошибки над методиками типа Винеровской фильтрации или вычитания амплитудных спектров в значительной мере связано именно с введением априорной оценки сигнал/шум в каждой спектральной полосе. В связи с этим, были предложены модификации стандартных подходов (Винеровской фильтрации, вычитания амплитудных спектров и оценок максимального правдоподобия) использующие априорные отношения сигнал/шум типа, что привело к существенному улучшению результатов фильтрации.
Разработка аппарата искусственных нейронных сетей привела к появлению нового типа алгоритмов для обработки зашумленных речевых сигналов, основанных на использовании моделей нейронных сетей. Подобных работ пока еще немного и получаемые в этом направлении результаты пока хуже, чем достигаемые более традиционными методами, однако, поскольку нейронные сети обладают потенциально огромными возможностями по непараметрическому моделированию различных типов плотностей, можно ожидать в этом направлении появления мощных алгоритмов фильтрации.
Исследование свойств многослойного персептрона как нелинейного фильтра во временной области выполнено. В качестве помехи рассматривались аддитивный гауссовский шум и нелинейный шум, моделирующий артефакты низкоскоростного CELP кодера. Персептрон обучался на зашумленном сигнала, роль сигнала-учителя выполнял чистый сигнал (доступный на этапе обучения). В качестве речевого материала использовались записи гласного «e» (120 записей от 40 дикторов).
Наилучшие результаты были продемонстрированы на трехслойном персептроне (на каждом слое по 60 нейронов): улучшение отношения сигнал/шум составило 3 дБ для шума кодека и 6 дБ для белого шума при начальном уровне сигнал/шум = 7.4 дБ. Эти результаты, показывают, что пока выигрыша от использования многослойного персептрона по сравнению со многими стандартными методиками нет.
Некоторые алгоритмы анализа речевых сигналов основаны на использовании свойств слухового анализатора человека. В основе развития этого класса методов лежит утверждение, что анализ речи, основанный на модели слуха человека, будет возможно более успешным, чем анализ, основанный на довольно абстрактных моделях речеобразования или статистических марковских моделях. В частности, утверждается, что системы цифровой обработки речевых сигналов, построенные на таких принципах, будут устойчивы по отношению к мешающему шуму и дикторам.
Одним из наиболее специфических механизмов слуха является эффект маскировки в слуховой системе, который во многом определяет свойства помехоустойчивости, присущие слуху.
Поскольку традиционные методы фильтрации типа вычитания спектров или оптимального среднеквадратического оценивания сопровождаются наличием постпроцессорных искажений сигнала, основным направлением использования моделей эффекта маскировки является их использование в качестве дополнительных блоков, имитирующих маскировку слабых сигналов более сильными в критических полосах слуха.
Метода повышения разборчивости зашумленной речи основан на том, что речевой сигнал сначала подвергался высокочастотной фильтрации таким образом, чтобы ослабить первую форманту, тем самым, повышая удельный вес высших формант в спектре речевого сигнала. Далее отфильтрованный речевой сигнал подвергается клиппированию. Авторы утверждают, что операция клиппирования увеличивает амплитуду речевой волны на участках, которые соответствуют важным для восприятия согласным по отношению к амплитуде гласных звуков.
Одним из часто применяемых на практике методов обработки зашумленных речевых сигналов является фильтрация этих сигналов полосовыми или режекторными фильтрами. Если спектральные характеристики шума известны заранее, то этот метод скорее можно отнести к классу методов, использующих априорные сведения о спектральных характеристиках шума.
Потенциально весьма многообещающие результаты получены при испытаниях систем анализа и обработки зашумленных речевых сигналов, построенных на представлении речевых сигналов с помощью волновых функциях-вейвлетах.
Волновой (вейвлетный, wavelet) анализ речи широко применяется при анализе и обработке речевых сигналов последние 10-15 лет.
Семейство волновых функций описывается соотношением:
адаптивный фильтрация сигнал речевой
,
где
обозначает время, параметры
и
регулируют перенос (трансляцию) по времени и сжатие / растяжение.
Так же как и в других базисах, эти ортогональные функции используются для декомпозиции речевого сигнала в сумму элементарных сигналов.
Основная идея предложенного метода фильтрации навеяна свойствами робастности по отношению к помехам, которыми обладает человеческая аудиторная система и заключается в моделировании уже упомянутого эффекта маскировки, когда слуховая система суммирует сигналы в критических полосках и, при одновременном присутствии двух сигналов разного уровня, сигнал с более высоким уровнем подавляет сигнал меньшего уровня.
Характеристики метода оценивались субъективными методами, посредством прослушивания записей исходного и обработанного сигнала. При этом аудитор постепенно добавлял к обработанному речевому сигналу шум до тех пор, пока персептивно получаемый сигнал не становился таким же шумным как и исходный зашумленный сигнал. Уровень шума, который необходимо было добавить к обработанному сигналу (чтобы получить такой же по качеству сигнал, как и до обработки), являлся мерой качества обработки.
Повышение качества и комфортности звучания очищенного сигнала
вовсе не означает улучшения его разборчивости. Одной из причин такого положения
является то, что большинство из предложенных методов ориентированы на
подавление шума, а не на выделение полезного речевого сигнала, что не одно и то
же. Как результат, подавление шума в переходных сегментах речи и низкочастотных
полосах, незначительно и не сопровождается улучшением разборчивости.
Заключение
Обзор методов повышения качества и разборчивости зашумленных речевых сигналов показывает, что существует много различных подходов к обработке зашумленной речи. Такое разнообразие методов обусловлено как важностью проблемы так и отсутствием достаточно надежных методов ее решения.
Объективное сравнение этих методов и выбор наиболее приемлемых сделать весьма затруднительно, так как перед системами коррекции речевых сигналов ставятся различные задачи. Например, можно в качестве главного критерия использовать повышение разборчивости речи, допуская при этом возможность искажений в тембре голоса или появление артефактов в виде структурированного шума. Можно поставить целью понижение утомляемости аудитора или сохранение натуральности голоса диктора, что достигается в основном за счет повышения качества речевого сигнала. Наконец, могут быть известны заранее важные априорные сведения, например тип или параметры шума, характеристики голоса диктора, наконец, гипотезы о произносимом тексте, что также может определяющим образом повлиять на выбор метода фильтрации.
Важно отметить, что универсальных методов обработки, которые
одинаково хорошо боролись бы с существенно нестационарными и стационарными, аддитивными
и мультипликативными шумами, существенно повышали бы качество и одновременно
разборчивость речи, сейчас нет, и возможно не будет. Как типичная (за редкими,
указанными в обзоре исключениями, наблюдается обратная тенденция: если
сравнивать системы обработки зашумленной речи по двум показателям - повышению
качества звучания речевых сигналов и повышению разборчивости, то системы,
повышающие качество и натуральность звучания, скорее всего снижают
разборчивость и наоборот, повышение разборчивости приводит к понижению качества
и натуральности звучания. Поэтому, многие из названных методов фильтрации нужно
рассматривать как взаимодополняющие.
Список использованной литературы
1. Журавлев Ю.И. Цифровая фильтрация зашумленных речевых сигналов. М.: ВЦ РАН, 1998.
2. Шелухин О.И., Лукьянцев Н.Ф. Цифровая обработка и передача речи. М.: Радио и связь, 2000.
. Рабинер Л.Р., Шафер Р.В. Цифровая обработка речевых сигналов. М.: Радио и связь, 2001.
. Золотарев В.И. Методы и аппаратура адаптивной фильтрации речевого сигнала. 2008.
. Назаров М.В., Прохоров Ю.Н. Методы цифровой обработки и передачи речевых сигналов. М.: Радио и связь, 2005.
. Овчинникова О.П. Повышение разборчивости речи путем цифровой фильтрации. М., 1997.
. Курицын С.А. Адаптивные методы обработки сигналов в цифровых и аналоговых системах передачи: Учебное пособие. СПб.: СПбГУТ, 2004.