Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Основы цифровой аудио- и видеотехники. Часть 1. Учебное пособие

.pdf
Скачиваний:
0
Добавлен:
12.08.2026
Размер:
1 Мб
Скачать

психоакустический анализ кодируемого аудиоматериала в диапазоне слышимых частот. Вышеописанные процессы преобразования позволяют исключить из исходного аудиоматериала больше половины информации. На заключительном этапе кодирования производится сжатие готового потока данных с использованием упрощенного аналога алгоритма Хаффмана (Huffman).

При сжатии данных с использованием уровня 2 идея упрощения сигнала остается той же, однако переквантованию подвергаются не коэффициенты MDCT, а отсчеты амплитудного сигнала в каждой частотной полосе. Здесь нужно отметить, что в соответствии с приблизительно аналогичной схемой кодирования работают и некоторые другие lossy-кодеки.

Комплект MPEG-1 предусмотрен для кодирования аудиосигналов, оцифрованных с частотой дискретизации 32, 44,1 и 48 кГц. Три упомянутых выше уровня MPEG-1 различаются своей целевой направленностью, механизмами кодирования и таким образом обеспечивают различные степени сжатия. Так, например, аудиоданные в формате (ИКМ/44,1 кГц/16 бит/стерео) Layer 1 позволяют сохранить без ощутимых потерь качества при скорости потока (битрейте11) 384 Кбит/с, что составляет четырехкратный выигрыш в занимаемом данными объеме; Layer 2 обеспечивает субъективно такое же качество при

192…224 Кбит/с, a Layer 3 (МРЗ) – при 128…160 Кбит/с.

Нельзя говорить о выигрыше или проигрыше одного уровня перед другим, так как каждый уровень разработан для достижения определенной цели. Например, преимущество Layer 3 в том, что он позволяет сжимать информацию в 8–12 раз (в зависимости от битрейта) без сильно ощутимых потерь качества исходного звучания. Layer 2 потенциально способен обеспечить более высокое качество кодирования ввиду более простой внутренней обработки сигнала в процессе преобразования. В то же время Layer 2 не позволяет достичь таких высоких степеней компрессии, какие достигаются при использовании Layer 3.

Ogg Vorbis. Существенной особенностью кодека МРЗ (MPEG-1 Layer 3) является его коммерческая основа: каждый изготовитель нового программного или аппаратного МРЗ-кодера обязан платить отчисления авторам кодека. Такая ситуация привела к тому, что появилось много новых независимых разработок в области компрессии аудиоданных.

Кодек Ogg Vorbis был создан в июне 2000 г. Это часть проекта Ogg Squish, имеющего цель создания полностью открытой системы муль-

41

тимедиа. Авторы и разработчики проекта – группа Xiphophorus. В основе Ogg Vorbis лежат те же идеи, что и в основе MPEG-1 Layer 2, при этом он используют собственные оригинальные математические алгоритмы, а также свою психоакустическую модель. Кодек Ogg Vorbis, появившийся позже MPEG-1, является несколько более развитым. Он рассчитан на сжатие данных на всех возможных битрейтах без ограничений – от 8 до 512 Кбит/с. Кодек позволяет хранить внутри файловконтейнеров подробные комментарии об исполнителе и названии композиции, а также предусматривает возможность кодирования нескольких каналов аудио (более двух, теоретически до 255), редактирования содержимого файлов и поддержки техники «масштабируемых битрейтов», изменения битрейта аудиопотока без необходимости его декодирования.

MusePak. Реальное развитие цифровых аудиосистем показало, что Ogg Vorbis не единственная некоммерческая разработка такого рода. Специалисты продолжают создание альтернативных качественных аудиокодеков. Кодек MPEGplus (MPEG+), переименованный позднее в MusePack из-за проблем, появившихся у автора в связи с тем, что название кодека содержало в себе аббревиатуру MPEG, – это еще один некоммерческий lossy-кодек. MusePack создан и разработан двумя авторами: Андре Бушманом (Andre Buschmann) и Френком Клеймом

(Frank Klemm). MusePak, как и Ogg Vorbis, базируется на идеях и алго-

ритмах MPEG-1 Layer 2.

Windows Media Audio. Кодек Windows Media Audio (сокращенно

WMA) – собственная разработка компании Microsoft, которая успешно используется во многих программных продуктах. Если кодек МРЗ был изначально стандартизован на предмет разрешенных значений битрейтов и других основных параметров, то WMA изменялся в процессе своего становления и развития. Существует несколько версий WMA: vl, v2, v7, v8 и v9, которые базируются в основном на методах

MPEG-1.

MPEG-2/4 ААС. Группа MPEG не ограничилась разработкой аудиокодека, включенного в стандарт MPEG-1. Исследования в области кодирования аудиоданных продолжались, и появились новые стандарты кодирования от MPEG.

Общий стандарт MPEG-2 разрабатывался специально для кодирования телевизионных сигналов. В апреле 1997 г. комплект MPEG-2 получил «продолжение» в виде алгоритма MPEG-2 ААС (MPEG-2 Advanced Audio Coding – усовершенствованное аудиокодирование).

42

Стандарт MPEG-2 ААС стал результатом кооперации усилий института Fraunhofer и компаний Sony, NEC и Dolby и является технологическим преемником MPEG-1, при этом намного более развитым. Поскольку между опубликованием MPEG-2 ААС и его стандартизацией прошло достаточно много времени, появилось несколько разновидностей этого алгоритма от независимых коммерческих и некоммерческих разработчиков: Homeboy ААС, AT&T а2Ь ААС, Astrid/Quartex ААС, Liquifier ААС, FAAC (Freeware Audio Coder), Mayah ААС и PsyTEL

ААС. Почти все приведенные разновидности алгоритма ААС несовместимы.

Так же, как и в комплекте аудиостандартов MPEG-1, в основе алгоритма ААС лежит психоакустический анализ сигнала. Вместе с тем алгоритм ААС имеет в своем механизме множество дополнений, направленных на улучшение качества выходного аудиосигнала. В частности, используется другой тип преобразований, улучшены методы шумовой обработки, модернизирован метод записи выходного битпотока и т. д. Следует отметить, что кодек ААС несовместим с уровнями MPEG-1, а значит, аудиоматериалы в формате MPEG-2 ААС не могут быть декодированы с помощью MPEG-1.

MPEG-2 ААС предусматривает три различных профиля (или в терминологии MPEG-1 «уровня») кодирования: Main, LC (Low Complexity) и SSR (Scalable Sampling Rate). В зависимости от того, ка-

кой профиль используется, изменяется время кодирования, размер получаемого цифрового потока и качество его звучания. Наивысшее качество звучания (при самой низкой скорости компрессии и декомпрессии) обеспечивает основной профиль Main, поскольку он содержит все механизмы анализа и обработки входного потока. Профили LC и SSR являются упрощенными, но при этом более скоростными.

Спустя несколько лет после стандартизации MPEG-2 появился новый комплект стандартов – MPEG-4, который помимо видеосигналов описывает и методы кодирования аудиосигналов, объединенных под общим названием MPEG-4 ААС.

В качестве средств компрессии аудиоданных в MPEG-4 используется целый комплекс стандартов аудиокодирования: улучшенный и доработанный алгоритм MPEG-2 ААС, алгоритм TwinVQ, а также ал-

горитмы кодирования речи HVXC (Harmonic Vector eXcitation Coding) и CELP (Code Excited Linear Predictive). В целом стандарт MPEG-4 –

это логическое продолжение MPEG-2 ААС. Стандарт MPEG-4 ААС

43

определяет следующие типы объектов (именно так называются профили или уровни):

MPEG-4 ААС LC (Low Complexity),

MPEG-4 ААС Main,

MPEG-4 AAC SSR (Scalable Sampling Rate),

MPEG-4 AAC LTP (Long Term Prediction),

MPEG-4 Version 2,

MPEG-4 Version 3 (в том числе НЕ-ААС).

Как видно, первые три объекта позаимствованы у MPEG-2 ААС, четвертый же – новшество LTP – основан на методах предсказания сигнала и является более сложным и более ресурсоемким алгоритмом, нежели остальные. Version 2 и Version 3 – это программные пакеты, расширяющие основной инструментарий кодирования стандарта MPEG-4 ААС. Центральным нововведением в Version 3 является стандартизованный в мае 2003 г. алгоритм НЕ-ААС (High Efficiency ААС – высокоэффективный ААС), известный также как aacPlus.

Расширение ААС под именем aacPlus было разработано компанией Coding Technologies в 2002 г. Этот алгоритм основан на использовании технологии SBR (Spectral Band Replication), которая предназначена для улучшения качества передачи верхнего частотного диапазона. Основные особенности данной технологии состоят в следующем. Кодеки, использующие психоакустическую модель, имеют один общий недостаток – все они обеспечивают хорошее качество звучания во всем диапазоне слышимых частот, но только до битрейта 128…112 Кбит/с. Компрессия на более низких битрейтах приводит к заметному ухудшению качества звучания. Это заставляет разработчиков кодеков при использовании низких битрейтов принудительно ограничивать кодируемый диапазон частот. Технология SBR – это попытка устранить указанный недостаток за счет сохранения ограниченной информации о верхней полосе частотного спектра сигнала в процессе кодирования и последующего искусственного синтеза (воссоздания) верхних частот в процессе декодирования. Технология хоть и является искусственным методом решения проблемы, но тем не менее оказывает благотворное влияние на восприятие закодированных таким образом аудиоматериалов.

В настоящее время продолжается комплектация MPEG-4 новыми подстандартами и дополнениями, так что список механизмов и инструментарий кодирования MPEG-4 будет постепенно расширяться. Кроме того, следует заметить, что не все стандартизованные в MPEG-4

44

методы кодирования нашли отражение в реально существующих аппаратных или программных продуктах. Это связано с тем, что многое из описанного в MPEG-4 стандартизует способы обмена информацией, но не сами способы кодирования. Ряд идей кодирования (особенно компрессия видеосигналов) требует даже по сегодняшним меркам гигантских вычислительных ресурсов, так что до полной реализации всего предусмотренного в MPEG-4 еще далеко.

В заключение данной главы отметим следующее. Кодирование с потерями – это очень удобный инструмент, однако, в отличие от кодирования без потерь, может привести к недопустимо большой потере информации. Применяться lossy-кодирование должно там, где это допустимо. Совершенно очевидно, что кодирование с потерями нельзя применять в студийной звукозаписи. Однако для телефонии и мобильных средств связи оно наиболее подходит.

2.6. ПОМЕХОУСТОЙЧИВОЕ КОДИРОВАНИЕ АУДИОСИГНАЛОВ

Одно из основных достоинств цифровых методов записи и передачи сигналов – возможность использования помехоустойчивых кодов, которые позволяют исправить большинство типов ошибок передаваемых или записываемых символов, в том числе групповые ошибки. Однако применение помехоустойчивого кодирования приводит к возрастанию скорости цифрового потока, что является неизбежной платой за высокое качество цифровых систем.

Принципы исправления ошибок можно пояснить следующим образом. Допустим, что нужно передать определенное количество цифр по каналу, в котором могут возникать ошибки. Например, по каналу связи необходимо передать три числа: 4, 6 и 8. Если одна из цифр будет повреждена и передана ошибочно, то на приемной стороне невозможно будет обнаружить и исправить ошибку. Простейший метод обеспечить обнаружение ошибки – это передать дополнительное число, равное сумме трех передаваемых чисел. Если одно из принятых чисел ошибочно, то, проверив сумму, можно обнаружить ошибку и сделать запрос на повторную передачу. Из данного примера следует очевидное условие – только одно из четырех чисел может быть ошибочным. Если ошибочными будут два числа, то не во всех случаях ошибка может быть обнаружена. Улучшенный вариант данного метода состоит в том,

45

что находится сумма всех четырех чисел и передается вторая проверочная сумма.

Таким образом, из данного примера следует, что для повышения помехоустойчивости необходимо больше передавать проверочных чисел или символов. Простейшим методом помехоустойчивого кодирования является добавление к семи двоичным разрядам восьмого разряда, обеспечивающего четность результирующего двоичного числа. Этот метод успешно применяется при передаче данных по компьютерным сетям.

Рассмотрим еще один метод обнаружения и исправления ошибок. Допустим, что нужно передать k чисел: X (1) , X (2) , … X (k) . К дан-

ным информационным числам добавим n k проверочных чисел: X (k 1) , …, X (n) . Отношение k / n называется скоростью кода. Да-

лее перейдем к частному случаю n k 2 и выберем проверочные символы X (k 1) и X (n) в соответствии со следующей системой

уравнений:

X (1)

X (2) ... X (n) 0,

(2.22)

 

2X (2) ... nX (n) 0.

X (1)

 

Обозначим передаваемые числа через R( j) (1 n) и предположим, что при передаче допущена только одна ошибка в числе X (i) . Тогда можно записать

R(i) X (i) E(i) ,

(2.23)

где R(i) – ошибочно принятое число; E(i) – ошибка, возникшая при

передаче.

На приемной стороне вычисляются две проверки, так называемые «синдромы»:

S1 R(1) R(2) ... R(n) ,

(2.24)

S2 R(1) 2R(2) ... nR(n) .

(2.25)

Если при передаче ошибки не произошло, т. е. E(i) 0 , то очевид-

но, что S1 S2 0 . Если же ошибка произошла:

E(i) 0 , то с помо-

щью (2.24) и (2.25) находим S1 E(i) и S2 iE(i) . Анализ этого результата показывает, что имеется возможность исправить ошибку: первый синдром S1равен значению ошибки E(i) , а ошибочная пози-

46

ция может быть найдена как i S2 / S1. Таким образом, простыми вычислениями можно восстановить символ X (i) .

Данный пример показывает, что можно не только обнаруживать ошибки, возникшие при передаче, но и исправлять их. Для исправле-

ния t ошибок передаваемое сообщение должно содержать 2t (n k)

проверочных чисел или символов. При осуществлении кодирования для формирования проверочных символов используется теория конечных полей Галуа. В частности, для стандарта CD-DA применяются помехоустойчивые двухступенчатые коды Рида–Соломона С2(28,24) и

С1(32,28) над полем Галуа GF (28 ) с образующим многочленом

F(X ) X 8 X 4 X 3 X 2 1.

В качестве символов используются кодовые слова, которые описываются восемью двоичными разрядами. Кодовое расстояние, или расстояние Хемминга, для обеих ступеней равно 5. Каждая ступень кода Рида–Соломона позволяет обнаружить четыре или исправить две ошибки. Образующий многочлен выбран таким образом, что он без

остатка делится на двучлен 1 X n . Разрешенные кодовые комбинации получаются перемножением полиномов порядка ( k 1), выражающих исходные кодовые комбинации, на образующий полином. Особенность операции перемножения полиномов в данном случае по сравнению с общепринятой заключается в следующем. Коэффициенты при X всех степеней суммируются по модулю 2, а показатели X суммируются обычным способом.

Коды Рида–Соломона сокращенно обозначают CIRS. В каждой ступени С2 и С1 определяются по четыре проверочных ошибки в каждом передаваемом блоке символов. Такие ошибки относятся к классу одиночных коротких повреждений.

Для борьбы с длинными ошибками, представляющими собой большое количество рядом расположенных поврежденных символов, применяют перекрестное перемежение. Смысл метода перемежения заключается в том, что рядом стоящие символы разносятся как можно дальше друг от друга в пространстве и во времени. Необходимо символы расположить не подряд один за другим, а с достаточно большим промежутком между ними, заполненным символами из других блоков. Тогда практически любое повреждение, даже очень длинное, не может испортить больше одного-двух символов в каждом блоке. На прием-

47

ной стороне восстанавливается исходный порядок следования символов. Таким образом, результат воздействия длинного дефекта эквивалентен воздействию соответствующего числа коротких дефектов. Графическая иллюстрация идеи метода перемежения представлена на рис. 2.11, на котором крестиком показаны поврежденные символы.

Принятые или считанные данные

Результат деперемежения

Помехоустойчивое

декодирование

Результат помехоустойчивого декодирования

Рис. 2.11. Графическая иллюстрация идеи перемежения

В оптической системе компакт-диск CD-AD за счет последовательного использования трех ступеней перемежения и интерполяции соседних отсчетов осуществляется исправление подряд идущих групповых ошибок до 12300 бит (длина участка дорожки на оптическом диске 8 мм). Точная коррекция возможна до 3500 подряд идущих групповых ошибок (длина участка дорожки на оптическом диске

3,5 мм).

В теории связи установлено, что вероятность ошибки в канале свя-

зи PK определяется отношением сигнал/шум SN (дБ):

 

 

 

 

 

 

 

 

 

 

PK 0,5 1 f (SN) ,

(2.25)

 

 

 

1

 

 

SN

 

 

 

 

 

 

 

 

 

 

 

 

 

 

10 20

 

 

 

 

 

 

 

 

 

 

 

 

f (SN )

2

2

e x2 dx .

 

где

 

 

 

 

 

 

 

 

 

 

 

 

 

0

 

 

 

 

 

 

 

 

 

 

 

 

График PK (SN ) , рассчитанный по (2.25), показан на рис. 2.12. Как видно, в цифровых системах при отношении сигнал/шум в канале свя-

48

зи более 10 дБ вероятность ошибки не превышает 10 3 . В этом случае после помехоустойчивого декодирования вероятность ошибки состав-

ляет не более 10 10 , что соответствует высокому качеству цифрового звука.

log(PK )

0,5

1,0

1,5

2,0

2,5

3,0

– 3,5

 

 

 

 

SN , дБ

0

2

4

6

8

10

Рис. 2.12. Зависимость вероятности ошибки в канале связи PK

от отношения сигнал/шум SN

При записи цифровых сигналов на оптический или магнитный носитель недопустимо большое количество нулей или единиц, следующих подряд, что приводит к появлению постоянной составляющей. Для устранения этого эффекта применяют специальное канальное кодирование. В частности, в системе CD-AD применен канальный код 8/14(17). Каждые 8 символов исходного сигнала преобразуются в 14 символов, к ним добавляется еще три разделительных символа. В канальном коде имеются разрешенные кодовые комбинации, следовательно, он является помехоустойчивым. Кроме того, канальный код позволяет осуществить дополнительное сжатие скорости цифрового потока.

49

2.7.МЕТОДЫ УВЕЛИЧЕНИЯ ОТНОШЕНИЯ СИГНАЛ/ШУМ В КАНАЛАХ СВЯЗИ

Вцифровых системах для увеличения отношения сигнал/шум применяют два основных метода: нелинейное квантование и предискажения. Рассмотрим эти методы более подробно.

Вцифровых системах перегрузка по уровню входного сигнала недопустима. При перегрузке АЦП возникают сильные неприятные для

слуха человека искажения. Нелинейное квантование позволяет заметно расширить динамический диапазон и наилучшим образом передать информацию об исходном аналоговом сигнале. В известной системе dbx Type IV на амплитудной характеристике квантователя имеются линейная область и логарифмическая область, как показано на рис. 2.13. Здесь уровень преобразованного сигнала отложен по вертикали, а уровень входного сигнала по горизонтали. Логарифмическая область начинается на 4 дБ ниже максимально допустимого уровня 0 дБ. Как видно из графика, этот прием инвариантен компрессированию звука, применяющемуся в аналоговых системах. Существенным достоинством данного подхода является неискаженная передача высокочастотных составляющих звука, поскольку резкого ограничения сигнала не происходит.

Таким образом, система dbx Type IV обеспечивает естественное сочетание как аналоговых, так и цифровых методов обработки сигналов, позволяющих наиболее эффективно использовать динамический диапазон передаваемых звуковых колебаний.

 

Uвых , дБ

 

 

 

0

Предельный уровень АЦП

 

 

 

 

 

 

-4

 

 

 

 

 

 

Логариф-

 

 

Линейная

мическая

 

 

 

 

 

область

область

Uвх , дБ

 

 

 

 

 

 

 

-4

0

4

8

Рис. 2.13. Амплитудная характеристика квантователя

 

для системы dbx Type IV

50

Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]