Вметоде многоимпульсного возбуждения (Multe-Pulse Excitation – МРЕ) оптимизируют как положение, так и амплитуды импульсов возбуждения. Их число при этом может быть выбрано малым ( 3 - 5 ) , что существенно меньше числа отсчетов в анализируемом подсегменте (40).
Вметоде возбуждения регулярной импульсной последовательностью
(Regular-Pulse Excitation – RPE) взаимное положение импульсов предопределено заранее – используют решетку равноотстоящих импульсов, а оптимизируют расположение решетки и амплитуды импульсов. В методе RPE число импульсов возбуждения выбирают в 3 - 4 раза меньшим числа отсчетов
вподсегменте, например 13. Таким образом, метод RPE менее эффективен по сравнению с МРЕ, однако алгоритм обработки при RPE значительно проще. Это и определяет широкое распространение данного метода аппроксимации второго остаточного сигнала.
Вметодах кодового возбуждения, объединенных наименованием CELP (Code-Excited Linear Prediction – кодовое возбуждение и линейное
предсказание), наиболее подходящий вектор возбуждения выбирают из заранее составленных кодовых книг, содержащих обычно 27 -210 квазислучайных векторов заданной длины с элементами, нормированными по амплитуде. Амплитуда вектора возбуждения кодируется отдельно в соответствии с громкостью передаваемого сегмента речи. Частными случаями CELP являются методы VSELP (Vector Sum Excited Linear Prediction – возбуждение векторной суммой и линейное предсказание) и ACELP (Algebraic Code Excited Linear Prediction – алгебраическое кодовое возбуждение и линейное предсказание).
Влюбом случае информацию о втором остаточном сигнале кодируют небольшим числом бит и вместе с информацией о параметрах кратковременного и долговременного предсказания передают по каналу связи на приемный конец – в декодер.
2.3.5 Структура декодера речи
Упрощенная структурная схема декодера речи с линейным предсказанием представлена на рис. 2.25.
Демультиплексор |
Генератор |
r2ВОС(n) |
Фильтр |
r1ВОС(n) |
Фильтр |
SВОС(n |
ЦАП |
SВОС(t) |
|
восстанов |
восстанов |
||||||||
возбужде- |
|||||||||
|
|
|
И |
|
|||||
|
л |
|
л |
|
|
||||
ния |
|
|
|
|
|||||
|
|
|
|
|
|||||
|
осн. тона |
|
формант |
|
ФНЧ |
|
|||
|
|
|
|
|
|||||
|
|
|
|
|
|
|
|
||
Рис.2.25 Структура декодера речи с линейным предсказанием |
|||||||||
81
Переданные по каналу связи параметры аппроксимации второго остаточного сигнала, параметры основного тона G и а, коэффициенты формантного фильтра ak (или отмеченные ранее другие параметры кратковременного анализа) поступают на соответствующие блоки декодера.
Синтез сигнала начинают с восстановления второго остаточного сигнала, выполняемого генератором возбуждения. Восстановленный сигнал r2ВОС(n) несколько отличается от второго остаточного сигнала в кодере из -за погрешности аппроксимации.
Восстановленный второй остаточный сигнал пропускают через фильтр восстановления основного тона, передаточную характеристику которого H2(z) устанавливают обратной характеристике фильтра удаления основного тона кодера, т. е.
H2 (z) |
|
A2 (z) |
|
1 . |
(2.31) |
|
|
||||
На выходе этого фильтра получают восстановленный первый |
|||||
остаточный сигнал r1ВОС(n), который включает в себя основной тон. |
|
||||
Наконец, фильтр восстановления формант с передаточной функцией |
|
||||
H1 (z) |
A1(z) 1 , |
(2.32) |
|||
восстанавливает формантные составляющие сигнала.
Восстановленный сигнал SВОС(n) достаточно близок к исходному сигналу на входе кодера S(n). Выполнив цифро-аналоговое преобразование и пропустив сигнал через ФНЧ, получают восстановленный аналоговый сигнал.
Отметим, что все процедуры обработки сигнала в кодере и декодере выполняются цифровыми методами. Кодер и декодер реализуют на высокопроизводительном сигнальном процессоре. Показанные на рис.4.1 и 5.1 модули фактически являются блоками программного обеспечения.
2.3.6 Низкоскоростные речевые кодеры
Как уже отмечалось, основной сферой применения вокодеров является цифровая подвижная радиосвязь и радиодоступ. Сведения о речевых кодерах таких систем приведены в табл. 2.4.
Все приведенные в ней кодеры, реализуют вокодерный метод кодирования с линейным предсказанием. На этапах кратковременного и долговременного анализа, что позволяет снизить скорость передачи до 4.6 - 13.5 кбит/с.
Один из вариантов построения декодера с линейным предсказанием приведен на рис. 2.26. Основными узлами схемы декодера являются два синтезирующих фильтра с большой и малой постоянной времени и алгебраическая кодовая книга.
82
Фильтр с большой постоянной времени выполняет функцию долговременного предсказателя (Long Term Predictor), моделирует квазипериодичность (долговременные корреляции) речевого сигнала. Он выполнен на основе адаптивной кодовой книги, содержащей сигналы возбуждения и реализующей генерацию квазипериодических колебаний голосового тракта.
Фильтр с малой постоянной времени выполняет функцию кратковременного предиктора (Short Term Predictor), моделирует кратковременные корреляции, т.е. корреляции между отсчетами речевого сигнала, и имеет порядок предсказывающего устройства p = 10.
Алгебраическая (постоянная) кодовая книга содержит совокупность векторов возбуждения, представляющих собой последовательности с белым гауссовским распределением с нулевым средним значением и единичной дисперсией. Она служит для реализации первого этапа генерации возбуждающего сигнала. На втором этапе производится коррекция возбуждающего сигнала путем добавления к нему данных из адаптивной кодовой книги. Сформированная в итоге возбуждающая последовательность поступает на вход синтезирующего фильтра [H1(z)]-1, где вычисляются значения выходного речевого сигнала .
Вкодере производится оценка p = 10 коэффициентов линейного предсказания
ианализ возможных значений параметра синтезатора (индекса kc и коэффициента усиления gc алгебраической кодовой книги и индекса kp и коэффициента усиления gp адаптивной кодовой книги), целью которого является минимизация взвешенной ошибки рассогласования между входным и синтезированным речевыми сигналами.
Индекс алгебраической кодовой книги (k) |
|
|
||
Задержка периода основного тона (Т) |
|
Входной |
||
|
цифровой |
|||
|
|
|
|
|
|
Предсказание |
Коэффициенты |
Демуль |
сигнал |
|
усиления |
типлекс |
|
|
|
усиления и |
ор |
|
|
Предыдущий |
|
|
||
векторное |
|
|
|
|
сигнал |
|
|
|
|
квантование |
|
|
|
|
возбуждения |
|
|
|
|
|
|
|
|
|
|
|
Коэффициент |
||
|
gp |
ы линейного |
||
|
предсказания |
|||
Адаптивная |
|
|||
|
|
|
Выходной |
|
кодовая |
|
Синтезирующий |
||
|
речевой |
|||
книга |
|
фильтр с малой |
||
|
сигнал |
|||
Синтезирующий фильтр с большой |
постоянной |
|||
времени |
|
|||
постоянной времени P-1(z) |
|
|||
|
|
[H1(z)]-1 |
|
|
Алгебраичес |
gc |
|
|
|
|
|
|
|
|
кая кодовая |
|
|
|
|
книга |
|
|
|
|
Рис.2.26 Структурная схема декодера речевого сигнала |
||||
Полученные при этом оптимальные параметры синтезатора квантуются и передаются в канал связи. Обработка сигналов в кодере и декодере производится по блокам. Длительность основного блока составляет 30 мс, что соответствует 240
83
отсчетам при частоте дискретизации 8 кГц. Для каждого такого блока формируется кадр передаваемой в канал связи информации объемом 137 бит, что обеспечивает скорость передачи информации 4567 бит/с. Оценка значений коэффициентов линейного предсказания выполняется один раз на всем блоке, а оптимизация остальных параметров синтезатора выполняется на сегментах длительностью 60 отсчетов, т.е. 4 раза на блок. Поразрядное распределение информации в передаваемом кадре приведено в таблице 2.5.
Таблица 2.5 Поразрядное распределение информации в кадре речевого кодека
Параметр |
1-й сегмент |
2-й сегмент |
3-й сегмент |
4-й сегмент |
Всего в |
|
|
|
|
|
кадре |
Коэффициенты линейного |
|
|
|
|
26 |
предсказания |
|
|
|
|
|
|
|
|
|
|
|
Период основного тона |
8 |
5 |
5 |
5 |
23 |
Индекс алгебраической кодовой |
16 |
16 |
16 |
16 |
64 |
книги |
|
|
|
|
|
|
|
|
|
|
|
Коэффициенты усиления |
6 |
6 |
6 |
6 |
24 |
|
|
|
|
|
|
Всего |
|
|
|
|
137 |
|
|
|
|
|
|
2.3.7 Субъективное измерение производительности кодера
Целью кодирования речи является использование избыточности сигнала структуры сигнала и знаний об особенностях человеческого восприятия для предоставления различных скоростей передачи данных с сохранением при этом максимально возможного качества сигнала При оценке производительности кодера речи более подходят субъективные измерения качества, чем объективные, например, по отношению сигнал/шум или среднеквадратической ошибке. Впрочем, надежные значения субъективных измерений, как правило, труднее получить.
Из субъективных измерений, используемых как стандарт качества услуг, наиболее распространенным является усредненная оценка разборчивости речи (mean opinion score — MOS), которая устанавливается на основе субъективного тестирования. Для измерений параметра MOS группу субъектов просят прослушать образец кодированной речи и оценить его по пятибалльной шкале. Для повышения надежности результатов тест проводится несколько раз, с разными образцами речи и разными группами слушателей. Шкала MOS используется во множестве спецификаций как стандарт качества.
Используемая шкала приведена в табл. 2.6, где также даны две еѐ альтернативные (но при этом эквивалентные) интерпретации. На рис. 2.27 показаны результаты тестов MOS [19] для различных схем кодирования речи, включая ADPCM. Следует обратить внимание на то, что даже некодированная речь не получает наивысшей оценки 5. Это происходит потому, что слушатели иногда склонны ставить оценку 4 даже тем
84
образцам речи, которые вполне заслуживают оценки 5. Учитывая это явление, оценки от 4 до 4,5 можно считать признаком высокого качества оцифровки.
Оценка MOS
5 |
|
|
|
|
|
|
4 |
|
|
|
|
|
|
3 |
|
|
|
|
|
|
2 |
|
|
|
|
|
|
1 |
|
|
|
|
|
Тип кодера |
|
|
|
|
|
|
|
Некодированная PCM |
ADPCM |
LD-CELP |
CELP |
CELP |
LPC |
|
речь |
64 |
32 |
16 |
8 |
4,2 |
2,4 |
PCM – импульсно-кодовая модуляция ADPCM - адаптивная дифференциальная РСМ
CELP — активируемое кодом линейное предсказание LD-CELP - CELP с малой задержкой
LPC — линейное кодирование с предсказанием
Рис. 2.27. Субъективное качество речи для различных кодеров
ТАБЛИЦА 2.6 Усредненная оценка разборчивости речи (MOS)
Оценка |
Качество |
Недостатки |
5 |
Отличное |
Незначительные |
4 |
Хорошее |
Еле ощутимые, но не раздражающие |
3 |
Достаточное |
Ощутимые и слегка раздражающие |
2 |
Плохое |
Раздражающие, но не неприемлемые |
1 |
Неудовлетворительное |
Очень раздражающие (неприемлемые) |
85