Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Сети радиодоступа. Ч.1. Учебное пособие
.pdf
51
U(t)
t
Рисунок 3.4 – Осциллограммы сигналов с различными фазами третьих
гармоник
Существует большое число идей построения вокодеров. По принципу
определения параметров фильтровой функции речи различают вокодеры:
• полосные (канальные, channel);
• формантные;
• ортогональные;
• липредеры (с линейным предсказанием речи);
• гомоморфные.
В полосных вокодерах спектр речи делится на 7 – 20 полос (каналов)
аналоговыми или цифровыми полосовыми фильтрами. Большее число каналов в
вокодере дает большую натуральность и разборчивость. С каждого полосового
фильтра сигнал поступает на детектор и фильтр низких частот с частотой среза
25 Гц. Таким образом, сигналы на выходе каждого канала изменяются с частотой
менее 25 Гц. Их передача возможна в аналоговом и ли цифровом
виде. В формантных вокодерах огибающая спектра речи описывается
комбинацией формант (резонансных частот голосового тракта). Основные
параметры формант – центральная частота, амплитуда и ширина.
В ортогональных вокодерах огибающая мгновенного спектра
раскладывается в ряд по выбранной системе ортогональных базисных функций.
Вычисленные коэффициенты этого разложения передаются на приемную
сторону. Распространение получили гармонические вокодеры, использующие
разложение в ряд Фурье.
Вокодеры с линейным предсказанием (LPC – Linear Prediction Coding) или
липредеры основаны на оригинальном математическом аппарате.

52
Гомоморфная обработка позволяет разделить генераторную и
фильтровую функции, образующие речевой сигнал.
Из-за сложности определения параметров генераторной функции появились
полувокодеры (VEV – Voice Excited Vocoder), в которых вместо сигналов
основного тона и тон-шума используете полоса речевого сигнала. Полоса частот
до 800 – 1000 Гц кодируется АДИКМ, АДМ или с помощью линейного
предсказания малого порядка, а в некоторых моделях передается в аналоговом
виде.
Есть разные типы полувокодеров-липредеров:
• вокодеры VELP (Voice Excited Linear Prediction);
• вокодеры RELP (Residual Excited Linear Prediction).
Гомоморфная обработка разделяет речевой сигнал на генераторную и
фильтровую функции. Для этого последовательность отсчетов речевого сигнала
длиной около 40 мс взвешивается временным окном и подвергается прямому
дискретному преобразованию Фурье (ДПФ). Затем находится логарифм модуля
спектра, к нему применяется обратное ДПФ. Результат называется кепстром.
По области 4 – 40 мс кепстра можно определить признак "тон-шум" и частоту
основного тона. Если участок вокализованный, то в кепстре будет пик в точке,
равной периоду основного тона.
В начале кепстра (0 – 4 мс) содержится информация об огибающей
спектра речи. Чтобы ее получить, нужно обнулить в кепстре участок 4 – 40 мс
и подвергнуть кепстр прямому ДПФ.
Вокодеры VELP используют голосовое возбуждение и коэффициенты
линейного предсказания КЛП. В вокодерах RELP по исходному сигналу также
вычисляются КЛП. Так как КЛП описывает фильтровую функцию, то сигнал
ошибки предсказания (сигнал-остаток предсказания, prediction residial)
содержит информацию о генераторной функции речи. Он и передается на
приемную сторону (возможно его сжатие АДИКМ, АДМ или с помощью
линейного предсказания малого порядка).
В последнее время все шире используются липредеры с кодовым
возбуждением (CELP – Code Excited Linear Prediction). Такие вокодеры имеют
на приемном и передающем концах кодовую книгу (codebook). Кодовая книга – это
матрица, строки которой являются последовательностями чисел (отсчетов
сигналов генераторных функций, то есть это сигналы возбуждения).
По исходному сигналу вычисляются КЛП. Затем на фильтр с
найденными КЛП подаются по очереди все сигналы возбуждения из кодовой

53
книги. По каждому сигналу возбуждения синтезируется речь. На приемную
сторону передаются КЛП и номер того сигнала из кодовой книги, для которого
разница между исходным и синтезированным сигналом минимальна.
Сегодня вокодеры применяют для кодирования телефонных сигналов в
военных и коммерческих цифровых системах связи. Перспективно применение
вокодеров для организации служебной телефонной связи со скоростью
передачи данных 1 200 – 2 400 бит/с. Формантные и полосные вокодеры
находят применение также при цифровой передаче телефонных сигналов по
КВ-каналам радиосвязи.
Современные вокодеры обеспечивают хорошее качество речи при
скорости передачи 2400 – 4800 бит/с и качество речи, пригодное для ведения
служебных переговоров, при скорости передачи 1200 бит/с.
3.3.2 Процесс речеобразования
Рассмотрим особенности процесса речеобразования. При разговоре
грудная клетка сжимается и расширяется, поток воздуха проходит из легких
через трахею и гортань в полости глотки, рта и носа. Голосовой тракт
простирается от голосовой щели (отверстия между голосовыми складками в
гортани) до губ. В процессе речеобразования его форма меняется.
Если произносятся звонкие звуки (гласные, носовые, звонкие согласные),
голосовые складки в гортани смыкаются и размыкаются с той или иной
частотой, которая называется частотой основного тона. Получается
последовательность импульсов воздушного потока, которые возбуждают
полости голосового тракта.
Говоря, человек меняет геометрические размеры этих полостей,
соответственно меняются и их резонансные частоты, которые называют
формантами. Звонкие звуки называются также вокализованными.
Частота основного тона обычно находится в интервале от 50 до 400
Гц. На рисунке 3.5 приведены временная зависимость а и спектр б,
соответствующие гласному звуку "и". Хорошо виден периодический
характер сигнала; в спектре ярко выражены основной тон и форманты.
При произнесении глухих (невокализованных) звуков голосовые
складки расслаблены. Проходя по суженному голосовому тракту, воз дух
создает турбулентный поток. Полости рта и носа во збуждаются при этом
шумоподобным сигналом. На рисунке 3.6 показаны временная

54
зависимость а и спектр б, соответствующие глухому согласному звуку
"с". Сигнал не содержит периодических составляющих и подобен шуму, в
его спектре отсутствуют форманты и основной тон.
Сигнал не содержит взрывные (смычные) звуки, получаются путем
кратковременного выхлопа: полного перекрытия речевого тракта, нагнетания
давления и внезапного открытия тракта. Взрывные звуки бывают звонкие (б, д, г)
и глухие (п, т, к), то есть могут образовываться с участием голосовых складок и
без них. Органы речи обладают инерционностью: на интервале 20 – 30 мс
параметры речи можно считать постоянными.
а)
б)
Рисунок 3.5 – Временное а) и спектральное б) представление речевого сигнала,
соответствующего гласному звуку «и»

55
а)
б)
Рисунок 3.6 –
Временное а) и спектральное б) представление речевого
сигнала, соответствующего
глухому согласному звуку "с"
3.3.3 Построение кодера
В современных вокодерах информацию о квазипериодических и
шумоподобных составляющих речи передают раздельно в закодированном виде,
причем для анализа и фильтрации квазипериодических составляющих
используют процедуру линейного предсказания. Поэтому современные
вокодеры часто называют кодерами с линейным предсказанием.
Рассмотрим упрощенную структуру вокодера, приведенную на рисунке 3.7.
На подготовительном этапе выполняют квантование сигнала. При передаче
телефонных сообщений, верхняя частота спектра которых FВ = 3.4 кГц,
применяют частоту дискретизации FД = 8 кГц. Здесь же выполняют
сегментацию сигнала – для последующей обработки выбирают отсчеты
сигнала на интервале длительностью 20 – 30 мс. При обычно используемой
длительности сегмента 20 мс и FД = 8 кГц число обрабатываемых отсчетов

56
равно 160. На следующем интервале длительностью 20 мс обрабатывают новые
160 отсчетов.
После сегментации 160 отсчетов сигнала повергают процедуре
кратковременного или формантного анализа. Его проводят, как уже отмечалось, с
использованием процедуры линейного предсказания.
При этом оценку текущего отсчета определяют как сумму p
предшествующих отсчетов
( ) ( )
1
ˆ
,
p
k
k
s n s n k a
=
= −
(3.8)
где ak – коэффициенты предсказания.
При формантном анализе порядок предсказания р выбирают равным 8 –
12.
Разность между истинным и предсказанным значением отсчета определяет
ошибку предсказания или первый остаточный сигнал:
( ) ( ) ( ) ( ) ( )
1
1
ˆ
.
n
k
k
r n s n s n s n s n k a
=
= − = − −
(3.9)
В результате z – преобразования этого разностного уравнения имеем
Дискретизация
, квантование
и сегментация
Фильтр
удаления
формант
A1(z)
Фильтр
удаления
осн. тона
A2(z)
Этап
кратковременного
анализа
Анализ
основного
тона
Аппроксима
ция 2-го
остаточного
сигнала
Мультиплексор
Этап
долговременного
анализа
Этап
аппроксимации
2-го остаточного
сигнала
Рисунок 3.7 – Структура кодера с линейным предсказанием
S(t)
S(n)
r1(n)
r2(n)
Формант-
ный анализ
Цифровой
сигнал

57
1 1 1
1
( ) ( ) ( ), ( ) 1 .
p
k
k
k
r z S z A z где A z a z
−
=
= = −
(3.10)
Функция A1(z) является передаточной характеристикой цифрового фильтра,
частотная характеристика которого обратная по отношению к частотной
характеристике голосового тракта.
Значения коэффициентов предсказания ak являются параметрами этого
фильтра. Они остаются постоянными на интервале анализируемого сегмента
речи (20 мс). Определение коэффициентов ak производят в блоке формантного
анализа (рисунок 3.7) из условия минимизации среднеквадратичного значения
первого остаточного сигнала на интервале сегмента.
Вычисленные значения коэффициентов предсказания используют в
фильтре удаления формант кодера. Кроме того, их вместе с другими
параметрами передают по каналу связи в декодер, где используют при
синтезе речевого сигнала.
На выходе фильтра удаления формант получают первый остаточный сигнал
r1(n) – сигнал, свободный от квазипериодических составляющих, – формант.
Информацию о формантах несут переданные на приемный конец параметры
фильтра ak , либо связанные с ними коэффициенты частичной корреляции
(коэффициенты отражения). Иногда используют функции от коэффициентов
отражения – так называемые логарифмические отношения площадей.
Первый остаточный сигнал все еще содержит квазипериодические
составляющие, прежде всего основной тон. Для определения параметров
основного тона на этапе долговременного анализа также используют процедуру
линейного предсказания. С учетом того, что основной тон характеризуется всего
двумя параметрами – амплитудой и периодом, передаточная функция фильтра
удаления основного тона A2(z) описывается более простым выражением
2
( ) 1 ,A z G z
= −
(3.11)
где G – единственный коэффициент предсказания, характеризующий
амплитуду основного тона. Задержка α определяет период основного тона, ее
значение обычно заключается в пределах от 20 до 160 интервалов дискретизации
сигнала, что соответствует диапазону частот основного тона 50 – 400 Гц.
Несмотря на относительную простоту выражения (3.11), анализ и удаление
основного тона является более сложной процедурой по сравнению с
формантным анализом. Это обусловлено существенно большим периодом
основного тона и сложностью выявления корреляции между отсчетами на
большом временном интервале. Кроме того, период и амплитуда основного тона
очень важны для точного восстановления речи. Именно поэтому на этапе
долговременного анализа сегмент речи разделяют на 4 подсегмента. Каждый
подсегмент имеет длительность 5 мс и содержит 40 отсчетов. Значения G и α
определяют для каждого подсегмента по отдельности.

58
Найденные параметры G и α используют в фильтре удаления основного тона.
Их также передают на приемный конец в декодер, где используют при синтезе
речевого сигнала.
На выходе фильтра удаления основного тона получают второй остаточный
сигнал r2(n), который свободен от всех квазипериодических составляющих, как
формант, так и основного тона. Фактически второй остаточный сигнал является
шумоподобным сигналом – между отсчетами отсутствует корреляция.
Задача последующего этапа – аппроксимировать второй остаточный сигнал
таким образом, чтобы при минимальном объеме информации о нем обеспечить
приемлемое качество восстановленного сигнала. Обработку второго остаточного
сигнала производят отдельно для каждого подсегмента из 40 отсчетов. Суть
аппроксимации состоит в том, что второй остаточный сигнал моделируют в
виде определенного числа импульсов на интервале подсегмента.
Если процедуры кратковременного и долговременного анализа сходны во
всех современных вокодерах, то методы аппроксимации второго остаточного
сигнала существенно отличаются.
В методе многоимпульсного возбуждения (Multe-Pulse Excitation – МРЕ)
оптимизируют как положение, так и амплитуды импульсов возбуждения. Их
число при этом может быть выбрано малым (3- 5 ) , что существенно меньше
числа отсчетов в анализируемом подсегменте (40).
В методе возбуждения регулярной импульсной последовательностью
(Regular-Pulse Excitation – RPE) взаимное положение импульсов
предопределено заранее – используют решетку равноотстоящих импульсов, а
оптимизируют расположение решетки и амплитуды импульсов. В методе RPE
число импульсов возбуждения выбирают в 3-4 раза меньше числа отсчетов в
подсегменте, например 13. Таким образом, метод RPE менее эффективен по
сравнению с МРЕ, однако алгоритм обработки при RPE значительно проще.
Это и определяет широкое распространение данного метода аппроксимации
второго остаточного сигнала.
В методах кодового возбуждения, объединенных наименованием CELP
(Code-Excited Linear Prediction – кодовое возбуждение и линейное
предсказание), наиболее подходящий вектор возбуждения выбирают из заранее
составленных кодовых книг, содержащих обычно 2
7
-210 квазислучайных
векторов заданной длины с элементами, нормированными по амплитуде.
Амплитуда вектора возбуждения кодируется отдельно в соответствии с
громкостью передаваемого сегмента речи. Частными случаями CELP являются
методы VSELP (Vector Sum Excited Linear Prediction – возбуждение
векторной суммой и линейное предсказание) и ACELP (Algebraic Code
Excited Linear Prediction – алгебраическое кодовое возбуждение и линейное
предсказание).
В любом случае информацию о втором остаточном сигнале кодирую т
небольшим числом бит и вместе с информацией о параметрах
кратковременного и долговременного предсказания передают по каналу связи
на приемный конец – в декодер.

59
3.3.4 Структура декодера речи
Упрощенная структурная схема декодера речи с линейным предсказанием
представлена на рисунок 3.8.
Переданные по каналу связи параметры аппроксимации второго
остаточного сигнала, параметры основного тона G и а, коэффициенты
формантного фильтра ak (или отмеченные ранее другие параметры
кратковременного анализа) поступают на соответствующие блоки декодера.
Синтез сигнала начинают с восстановления второго остаточного сигнала,
выполняемого генератором возбуждения. Восстановленный сигнал r
2ВОС
(n)
несколько отличается от второго остаточного сигнала в кодере из-за
погрешности аппроксимации.
Восстановленный второй остаточный сигнал пропускают через фильтр
восстановления основного тона, передаточную характеристику которого H2(z)
устанавливают обратной характеристике фильтра удаления основного тона
кодера, т.е.
1
22
( ) ( ) .H z A z
−
=
(3.12)
На выходе этого фильтра получают восстановленный первый
остаточный сигнал r
1ВОС
(n), который включает в себя основной тон.
Наконец, фильтр восстановления формант с передаточной функцией
1
11
( ) ( ) ,H z A z
−
=
(3.13)
восстанавливает формантные составляющие сигнала.
Восстановленный сигнал S
ВОС
(n) достаточно близок к исходному сигналу
на входе кодера S(n). Выполнив цифро-аналоговое преобразование и
пропустив сигнал через ФНЧ, получают восстановленный аналоговый сигнал.
Отметим, что все процедуры обработки сигнала в кодере и декодере
выполняются цифровыми методами. Кодер и декодер реализуют на
Демультиплексор
Генератор
возбужде-
ния
Фильтр
восстановл
осн. тона
H2(z)
Фильтр
восстановл
формант
H1(z)
ЦАП
И
ФНЧ
r
2ВОС
(n)
r
1ВОС
(n)
S
ВОС
(n)
Рисунок 3.8 – Структура декодера речи с линейным предсказанием
S
ВОС
(t)

60
высокопроизводительном сигнальном процессоре. Показанные на рисунках 3.7
и 3.8 модули фактически являются блоками программного обеспечения.
3.3.5 Субъективное измерение производительности кодера
Целью кодирования речи является использование избыточности сигнала
структуры сигнала и знаний об особенностях человеческого восприятия для
предоставления различных скоростей передачи данных с сохранением при
этом максимально возможного качества сигнала При оценке
производительности кодера речи более подходят субъективные измерения
качества, чем объективные, например, по отношению сигнал/шум или
среднеквадратической ошибке. Впрочем, надежные значения субъективных
измерений, как правило, труднее получить.
Из субъективных измерений, используемых как стандарт качества услуг,
наиболее распространенным является усредненная оценка разборчивости
речи (mean opinion score — MOS), которая устанавливается на основе
субъективного тестирования. Для измерений параметра MOS группу
субъектов просят прослушать образец кодированной речи и оценить его по
пятибалльной шкале. Для повышения надежности результатов тест
проводится несколько раз, с разными образцами речи и разными группами
слушателей. Шкала MOS используется во множестве спецификаций как
стандарт качества.
Используемая шкала приведена в таблице 3.1, где также даны две её
альтернативные (но при этом эквивалентные) интерпретации.
Таблица
3.1 – Усредненная оценка разборчивости речи (MOS)
Оценка
Качество
Недостатки
5
Отличное
Незначительные
4
Хорошее
Еле ощутимые, но не раздражающие
3
Достаточное
Ощутимые и слегка раздражающие
2
Плохое
Раздражающие, но не неприемлемые
1
Неудовлетворительное
Очень раздражающие (неприемлемые)
На рисунке 3.9 показаны результаты тестов MOS [19] для различных
схем кодирования речи, включая ADPCM. Следует обратить внимание на
то, что даже некодированная речь не получает наивысшей оценки 5. Это
происходит потому, что слушатели иногда склонны ставить оценку 4
даже тем образцам речи, которые вполне заслуживают оценки 5. Учитывая
это явление, оценки от 4 до 4,5 можно считать признаком высокого качества
оцифровки.
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
