Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Основы цифровой аудио- и видеотехники. Часть 1. Учебное пособие

.pdf
Скачиваний:
0
Добавлен:
12.08.2026
Размер:
1 Мб
Скачать

В случае линейного разбиения амплитудной шкалы на уровни квантование называют линейным (однородным). Для линейного закона квантования динамический диапазон записываемого или передаваемого по каналу связи сигнала определяется соотношением

Q2

D 10 lg

 

 

 

12

 

1

 

2n

 

 

 

10 lg

 

 

6n 10,8 [дБ] .

(2.18)

 

 

12

 

 

 

 

 

 

 

Из соотношения (2.18) следует, что динамический диапазон D пропорционален разрядности квантования n . По соотношению (2.18) при заданной величине динамического диапазона D можно также определить необходимое число разрядов n .

Практический опыт работы с реальными цифровыми аудиосистемами показал, что спектральная плотность мощности шума квантования часто оказывается неравномерной и концентрируется в какой-то определенной области частот, что отрицательно сказывается на качестве воспроизводимого звука при малых уровнях сигнала. Существует несколько способов борьбы с этим явлением.

Так, нежелательную концентрацию шума квантования в некоторой частотной области можно нейтрализовать путем подмешивания к исходному аналоговому сигналу некоторого слабого по мощности псевдослучайного шума. Этот шум минимизирует степень зависимости ошибок округления от формы преобразуемого сигнала, что хорошо рассеивает спектр шума квантования и делает его равномерным. Таким образом, описанный прием (называемый дизерингом, dithering – размывание) как бы подменяет нежелательный шум квантования искусственно подмешанным псевдослучайным шумом (t) . При этом подме-

шанный псевдослучайный шум оказывается менее заметным на слух, чем тот шум квантования, какой получился бы без применения дизеринга.

Еще один метод борьбы с уровнем шума квантования называется формовкой шума (noise shaping). Идея этого метода – преднамеренное изменение формы исходного аналогового сигнала таким образом, чтобы последующее квантование привело к появлению шума квантования, основная мощность которого расположилась бы в наименее заметных на слух частотных областях. В качестве подмешиваемого сигнала обычно используют детерминированный низкочастотный сигнал Z (t) треугольной или пилообразной формы, который содержит

31

большое число высших гармоник. При этом уровень сигналов (t) или Z (t) сопоставим с шагом квантования Q . Структурная схема описан-

ных выше методов уменьшения заметности шумов квантования при малых уровнях сигнала приведена на рис. 2.7.

u(t) Uk

Квантователь

(t)

Z (t)

Рис. 2.7. Квантователь с равномерным спектром шума

Спектральная плотность мощности шумов квантования на выходе этого устройства равна

G( f )

Q2

 

Q2

const .

12Fmax

6 fd

 

 

 

Импульсный сигнал, получаемый в результате аналоговоцифрового преобразования, из-за несовершенства преобразующих устройств имеет некоторые искажения, которые выражаются в случайных отклонениях длительностей прямоугольных тактовых импульсов от номинальной величины шага дискретизации, а также в неабсолютной крутизне фронтов импульсов. Говоря иначе, осуществление выборки сигнала при оцифровке происходит не через абсолютно равные промежутки времени, а с некоторыми случайными отклонениями. Это приводит к паразитной широтно-импульсной или фазовой модуляции, кроме того, результирующий импульсный сигнал имеет неидеальную прямоугольную форму. Если, скажем, дискретизация проводится с частотой 44,1 кГц, то отсчеты берутся не точно каждые 1/44100 с, а либо чуть раньше, либо чуть позднее. А так как входной сигнал постоянно меняется, то такая погрешность приводит к регистрации не совсем верного уровня сигнала. Описанный эффект называется джиттером (jitter – дрожание) и по сути является результатом недостаточной стабильности работы аппаратуры (АЦП). На слух джиттер воспринимается как некоторое дрожание сигнала на высоких частотах, при этом

32

на низких частотах джиттер выражается в некотором «размывании» спектра сигнала. С другой стороны, проявление джиттера можно представить в дополнительном увеличении отношения сигнал/шум. С помощью статистического анализа получено следующее выражение для отношения сигнал/шум за счет джиттера:

 

2 fd t 2

 

SNJ 10 lg

 

 

 

 

[дБ],

(2.19)

 

 

 

 

3

 

 

где t – нестабильность начального положения тактовых импульсов. Результирующее выражение для отношения сигнал/шум, учиты-

вающее количество разрядов n и проявление джиттера, имеет вид

SN 10 lg 10

SNn

 

SNJ

 

 

 

10

10 10

 

[дБ].

(2.20)

 

 

 

 

 

 

График, построенный по соотношению (2.20), приведен на рис. 2.8. Видно, что в высококачественных цифровых аудиосистемах (n 16)

нестабильность начального положения тактовых импульсов t не должна превышать 0,2 нс.

SN , дБ

100

95

90

85

80

 

 

 

 

t 109 [c]

 

 

 

 

 

0

0,1

0,2

0,3

0,4

0,5

Рис. 2.8. Зависимость результирующего отношения сигнал/шум от величины нестабильности начального положения тактовых

импульсов t

33

Для борьбы с джиттером в качестве генераторов тактовой частоты применяют кварцевые генераторы с повышенной стабильностью частоты. Следует заметить, что причиной появления джиттера может быть не только аналого-цифровое преобразование, но и передача импульсного сигнала по цифровому каналу от одного устройства к другому. В этом случае появление джиттера – результат неидеальной коммутации/синхронизации устройств, и он может быть устранен только путем использования аппаратуры, регенерирующей цифровой сигнал.

На практике проявляется еще один побочный эффект оцифровки – гранулярный шум (granular noise) или нестабильность округления в процессе квантования. Если величина сигнала незначительно меняется около некоторой величины, являющейся границей между двумя соседними уровнями квантования, то даже самые незначительные колебания величины сигнала могут вызывать заметные изменения результатов округления при квантовании значений амплитуды. Это связано с тем, что квантователь в этом случае округляет измеренное значение сигнала до величины то одного, то соседствующего уровня квантования.

2.3. НЕЛИНЕЙНОЕ КВАНТОВАНИЕ

Линейное квантование, конечно же, не единственный способ квантования. Как было отмечено выше, восприятие громкости или интенсивности звука человеком носит нелинейный характер – нарастание интенсивности звука по степенной функции воспринимается на слух как линейное нарастание громкости. Следовательно, изменения амплитуды слабого по интенсивности сигнала различаются слухом намного лучше, чем изменения амплитуды в областях высокой интенсивности. Это, в свою очередь, означает, что погрешность квантования сигнала в областях со слабой амплитудой оказывается намного больше, чем погрешность квантования в областях, где сигнал характеризуется высокой интенсивностью.

Для уменьшения влияния погрешности квантования на воспринимаемое качество оцифровки амплитудная шкала разбивается на уровни по логарифмическому закону, как показано на рис. 2.9. Такой способ называют логарифмическим квантованием. При использовании логарифмической амплитудной шкалы в области малой амплитуды оказывается большее число уровней квантования, чем в области боль-

34

шой амплитуды (при этом общее число уровней квантования остается таким же, как и в случае однородного квантования). Соответственно при квантовании слабый по величине сигнал округляется на меньшие значения, чем более интенсивный. Это автоматически учитывает психоакустические особенности слуха и обеспечивает менее заметные на слух погрешности квантования. Аналогово-цифровое преобразование, основанное на применении метода нелинейного (неоднородного) квантования, называется неоднородной (нелинейной) импульсно-кодовой модуляцией – (Nonuniform PCM).

Uвых

Q

Qmin

Uвх

Qmax

Рис. 2.9. Логарифмический закон квантования

Устройство, реализующее нелинейное квантование, состоит из последовательно включенного компрессора и квантователя с линейной (равномерной) характеристикой. При воспроизведении записанного или передаваемого сигнала для компенсации влияния компрессора применяют экспандер. Амплитудная характеристика экспандера противоположна характеристике компрессора.

Для компрессора с логарифмической амплитудной характеристикой экспандер должен иметь амплитудную характеристику, описываемую степенной функцией. В этом случае экспандер компенсирует нелинейные искажения, образующиеся в компрессоре. Аналитическое

35

выражение для нормированной амплитудной характеристики компрессора имеет вид

 

 

 

 

Uвх

 

 

 

 

 

 

 

 

 

 

 

 

 

ln 1

 

 

 

 

 

 

 

 

 

 

 

 

Uвых

 

 

 

Uвх max

 

 

 

 

 

 

 

 

 

 

 

,

(2.21)

 

 

Uвых max

 

ln(1 )

 

 

 

 

 

 

 

 

 

 

где – параметр, называемый коэффициентом сжатия.

Физический смысл коэффициента сжатия определяется отношением максимального и минимального шагов квантования:

Qmax .

Qmin

Амплитудные характеристики компрессора, рассчитанные по (2.21) для различных значений коэффициента сжатия , показаны на

рис. 2.10.

Uвых

Uвых max

1,0

0,8

100

0,6

10

0,4

0

0,2

Uвх

 

Uвх max

0

0,2

0,4

0,6

0,8

1,0

Рис. 2.10. Амплитудные характеристики компрессора

Если от рассмотренных выше амплитудных характеристик перейти к коэффициентам передачи, то в соответствующих точках амплитудных характеристик компрессора и экспандера должно выполняться

условие Kк Kэ 1. В этом случае результирующая амплитудная харак-

36

теристика каналов записи и воспроизведения (приема и передачи) будет линейной и не произойдет искажения записываемой или передаваемой по каналу связи информации.

Увеличение коэффициента сжатия компрессора уменьшает

мощность шумов квантования 2n для входных сигналов небольшого

уровня и увеличивает для входных сигналов большого уровня. В телефонии и в средствах связи с подвижными объектами обычно полагают

100 . В высококачественных цифровых аудиосистемах рекомендуется выбирать 15 . Отметим, что в настоящее время аналоговые

компрессоры активно заменяются цифровыми, у которых непрерывная монотонная амплитудная характеристика, показанная на рис. 2.9, заменяется кусочно-ломаной аппроксимирующей функцией.

Еще один способ аналого-цифрового преобразования – это разностная импульсно-кодовая модуляция (Differential PCM – DPCM). До сих пор рассматривалась импульсно-кодовая модуляция, в которой осуществляется квантование абсолютных значений сигнала. В случае разностной ИКМ квантованию подвергают относительные значения амплитуды. Разностная ИКМ, как и обычная, может сочетаться с использованием как линейного, так и нелинейного методов квантования. Разностное кодирование имеет много вариаций, причем некоторые из них подразумевают использование квантователя с предсказателем сигнала. У таких квантователей меньше ошибок квантования за счет предсказания сигнала на каждом шаге преобразования на основании информации об уже известных предыдущих значениях сигнала.

2.4. КОДИРОВАНИЕ ЦИФРОВЫХ АУДИОСИГНАЛОВ

По существу, та или иная цифровая форма представления аналоговых аудиосигналов – это уже способ кодирования. Последовательность чисел, описывающая аналоговый аудиосигнал, сама по себе является цифровым кодом. Однако такое кодирование, во-первых, не оптимально, а во-вторых, не защищено от ошибок. Рассмотрим более совершенные методы кодирования цифровых аудиосигналов, обеспечивающие помехоустойчивость и сжатие данных.

Как было показано выше, чтобы получить полную информацию об оригинальном аналоговом сигнале в частотной полосе 20 Гц…20 кГц (в слышимом диапазоне частот), его необходимо дискретизировать по

37

времени с частотой не менее 40 кГц. Так, стандарт CD-DA (стандарт записи данных на привычных для всех аудиокомпакт-дисках) устанавливает следующие параметры кодирования: двухили одноканальная запись в формате ИКМ с частотой дискретизации 44,1 кГц и разрядностью квантования 16 бит. Один час музыки в таком формате занимает примерно 600 Мбайт. Для увеличения объема записи аудиоданных применяют специальные методы кодирования, позволяющие уплотнить данные.

В общем случае известные в настоящее время методы кодирования, предназначенные для сжатия аудиоинформации, можно условно разделить на два типа.

1. Сжатие данных без потерь (lossless coding) – это способ коди-

рования (уплотнения) цифровой аудиоинформации, позволяющий осуществлять 100%-ное восстановление исходных данных из сжатого потока (под понятием «исходные данные» здесь подразумевается исходный вид оцифрованных аудиоданных). К такому способу уплотнения данных прибегают в случаях, когда требуется абсолютное сохранение качества оригинального звучания аудиоданных. Существующие сегодня алгоритмы сжатия без потерь позволяют сократить занимаемый данными объем на 20…50 %. Механизмы работы подобных кодеров сходны с механизмами работы архиваторов общих данных, таких, как, например, ZIP или RAR, но при этом они адаптированы специально для сжатия аудиоданных. Кодирование без потерь, хотя и идеально с точки зрения сохранности качества аудиоматериалов, однако неспособно обеспечить высокий уровень компрессии.

2. Сжатие данных с потерями (lossy coding). Цель такого кодиро-

вания – достижение максимально высокого коэффициента компрессии данных при сохранении качества их звучания на приемлемом уровне. В основе идеи кодирования с потерями лежат два простых основополагающих соображения:

исходные цифровые аудиоданные избыточны – они содержат много несущественной для слуха информации, которую можно удалить, повысив тем самым коэффициент компрессии;

требования к качеству звучания аудиоматериала могут быть разными и зависят от конкретных целей и сфер использования.

Такое кодирование потому и называется «с потерями», что приводит к утрате некоторой части аудиоинформации и к тому, что декодированный сигнал при воспроизведении при звучании похож на оригинальный сигнал, но фактически перестает быть ему идентичным.

38

В основе большинства методов кодирования с потерями лежат учет психоакустических свойств слуховой системы человека, а также обработка сигнала, связанная с переквантованием и передискретизацией. В частности, в процессе компрессии аудиоданные анализируются кодером для выявления различных деталей звучания, которыми можно пренебречь. Замаскированными частотами, неслышимыми и слабослышимыми деталями звучания можно пожертвовать для достижения более высокого значения коэффициента компрессии.

Там, где в звучании важна лишь разборчивость (например, в мобильных средствах связи, где наличие частот выше 4 кГц не обязательно), аудиоинформация в процессе кодирования существенно «упрощается», что вместе с использованием нелинейных квантователей и эффективных алгоритмов компрессии данных позволяет достичь достаточно высоких степеней компрессии (1 : 50 и выше).

Там, где к качеству звучания предъявляются более высокие требования (например, в портативных и бытовых аудиосистемах), аудиосигналы подвергают более щадящему кодированию. Надо отметить, что степень потерь кодера по отношению к деталям звучания может регулироваться (эта способность зависит от конкретной реализации). В среднем современные кодеры даже при столь высокой степени компрессии, как 1:10, позволяют обеспечить отличное звучание, качество которого средним слушателем на средней аппаратуре оценивается как равное качеству звучания исходных аудиоданных.

2.5. ФОРМАТЫ КОДИРОВАНИЯ С ПОТЕРЯМИ

Сегодня существует множество кодеров аудиоданных, основанных на идее кодирования с потерями. Вот только некоторые из них: MPEG-1

Layer 3 (всем известный как МРЗ), Windows Media Audio (WMA), Ogg Vorbis (OGG), MusePack (MPC), MPEG-2/4 AAC и др. Рассмотрим их более подробно.

MPEG-1 Layer 3. Широко известный сегодня цифровой кодек MPEG-1 Layer 3 (формат МP3) – это наиболее старый из всех распространенных сейчас lossy-кодеков. Своим названием он обязан группе MPEG, которая занималась его разработкой и продолжает создавать новые аудио- и видеокодеки. MPEG расшифровывается как «Moving Picture Coding Experts Group» – группа экспертов по кодированию подвижных изображений. Группа MPEG ведет свою историю с января

39

1988 г. и занимается разработкой различных алгоритмов и стандартов кодирования аудио- и видеоинформации. В собраниях MPEG принимают участие несколько сотен специалистов из более чем двухсот крупных и мелких компаний. На сегодня группой MPEG разработаны следующие стандарты:

MPEG-1 (принят в ноябре 1992 г.) – стандарт кодирования, хранения и декодирования подвижных изображений и аудиоинформации;

MPEG-2 (принят в ноябре 1994 г.) – стандарт кодирования данных для цифрового телевещания;

MPEG-4 – стандарт для мультимедиа-приложений (в его разработке еще далеко не поставлена точка);

MPEG-7 – универсальный стандарт работы с мультимедиа-инфор- мацией, предназначенный для обработки, компоновки и управления такой информацией.

Стандарт MPEG-1 представляет собой, по сути, целый комплект аудио- и видеостандартов. Согласно стандартам ISO в «звуковую» часть MPEG-1 входят три алгоритма различных уровней сложности: Layer 1 (уровень 1), Layer 2 (уровень 2) и Layer 3 (уровень 3, называе-

мый большинством просто «МРЗ»). Общая структура процесса кодирования одинакова для всех уровней MPEG-1. Однако, несмотря на схожесть в общем подходе к кодированию, уровни различаются по целевому использованию и применяемым в кодировании внутренним механизмам. Для каждого уровня определен свой формат записи выходного потока данных и соответственно свой алгоритм декодирования. Алгоритмы MPEG-1 основаны в целом на изученных свойствах восприятия звуковых сигналов слуховым аппаратом человека.

Кодирование аудиоинформации представляет собой следующий процесс. В начале кодирования входной цифровой аудиопоток в формате РСМ с помощью цифровых фильтров разделяется на несколько частотных полос. Дальнейший процесс зависит от уровня.

В случае уровня 3 (формат МРЗ) в каждой полосе частот сигнал раскладывается на частотные составляющие спектра (применяется косинусное преобразование MDCT –, частный случай преобразования Фурье), в результате получается набор коэффициентов разложения. Вся дальнейшая обработка направлена на максимально возможное упрощение сигнала с целью достижения наиболее эффективного переквантования этих коэффициентов и их записи. Спектр входного сигнала очищается от заведомо неслышных составляющих – низкочастотных шумов и наивысших гармоник. На следующем этапе выполняется

40

Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]