Добавил:
Upload Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:
Лекции_Информатика_1.doc
Скачиваний:
1
Добавлен:
01.07.2025
Размер:
389 Кб
Скачать
☆
  1. Системы мультимедиа

Мультимедиа - это интерактивные системы, обеспечивающие ра­боту с непод­вижными изображениями и движущимся видео, анимированной компьютерной графикой и текстом, речью и высококачественным звуком.

Появление систем мультимедиа обусловлено развитием технических и системных средств, в том числе прогрессом ПЭВМ: резко возросшие объем памяти, быстродействие, графиче­ские возможности, характеристики внешней памяти, и достижения в об­ласти видеотехники, лазерных дисков, а также их массовое внедрение. Важную роль сыграла так же разработка методов быстрого и эффективного сжатия / развертки данных.

Современный мультимедиа персональный компьютер представляет собой домашний стереофонический Hi-Fi (High Fidelity) комплекс, объединенный с дисплеем-те­левизором. Он укомплектован активными стереофоническими системами, микрофоном и дисководом для оптических компакт–дисков. Кроме того, внутри компьютера расположен аудиоадаптер (звуковая плата), по­зволивший перейти к прослушиванию чистых стереофонических звуков че­рез акустические колонки с встроенными усилителями.

Известно, что в компьютере все дан­ные хранятся в цифровой форме, в то время как теле-, видео- и большин­ство аудиоаппаратуры работает с аналоговым сигналом. Поэтому простейший и наиболее дешевый путь построения первых систем мультимедиа состоял в стыковке разнородной аппаратуры с компьютером, предоставлении компьютеру возможностей управления этими устройствами, совмещении выходных сигналов компьютера и видео- и аудиоустройств и обеспечении их нормальной совместной работы. Даль­нейшее развитие систем мультимедиа происходит в направлении объедине­ния разнородных типов данных в цифровой форме на одной среде-носителе, в рамках одной системы.

Современный мультимедийный ПК требует подключения к нему множества внешних устройств. Все они обслуживаются массой программных утилит - драйверов и нередко конфликтуют друг с другом. В этой связи был создан стандарт Plug and Play (включай и работай). Этот стандарт представляет собой обширный комплекс программных и аппаратных средств по полностью автоматической настройке конфигурации компьютера в соответствии с используемым оборудованием.

Технология Plug and Play предполагает, что достаточно только включить компьютер и все аппаратные и программные средства автоматически оптимально настроятся и станут работать без сбоев и конфликтов.

Обработка и синтез графики

Отличительной особенностью видеоадаптеров в мультимедийных системах является вывод трехмерного 3D изображения. При этом характеристики таких видеоадаптеров позволяют осуществлять этот процесс, не уменьшая быстродействие вычислительной системы в целом.

При формировании изображения сначала из плоских многоугольников или криволинейных поверхно­стей создается объект. Его поверхности назначают текстуры, то есть картинки, имитирующие материал, из которого сделана поверх­ность моделируемого объекта, вводятся параметры отражения, карта рельефа поверхности, карта отражения и т.д. На сцене размещаются источники света, при необходимости вводится осветляющий (обыч­ный) или затемняющий (для эмуляции ночных условий) туман, и зада­ется направление взгляда наблюдателя (камера).

Видеоадаптер мультимедийных систем поддерживает работу с видеоинформацией.

Используются три формата записи, телевещания и видеостандарта: NTSC, PAL, SECAM. В основе каждой системы лежит свой стандарт, ко­торый определяет способ кодирования информации для получения элек­тронного сигнала, создающего изображение на теле­экране. Для перезаписи в разных форматах требуется специальное оборудование.

Система NTSC (National Television Standards Committee)

Согласно стандарту NTSC, каждый видеокадр состоит из 525 горизон­тальных строк экрана, по которым каждую 1/30 секунды проходит электронный луч. Скорость прохождения луча настолько велика, что создается зрительное впечатление стабильного изображения. При создании кадра элек­тронный луч фактически делает два прохода по всему экрану, сначала по учетным строкам, а затем по четным. После каждого прохода (60 проходов «секунду или 60 Гц) на экране создается поле. Этот процесс создания кадра из двух полей называется чересстрочной разверткой (interlacing), что помогает предотвратить мерцание на телеэкранах.

Система PAL (Phase Alternate Line)

Система PAL представляет собой метод добавления цвета к телевизион­ному сигналу черного и белого цвета, который создает на экране 625 строк с частотой 25 кадров в секунду. Аналогично системе NTSC применяется чересстрочная развертка, причем каждое поле создается за 1/50 секунды, т.е. с частотой 50 Гц.

Система SECAM (Sequential Color Memory)

В системе SECAM предусмотрено 625 строк и частота кадров 50 Гц; она принципиально отличается от систем NTSC и PAL.

Система HDTV (High Definition Television)

Новые разновидности стандарта NTSC «Super NTSC» и «16 х 9» входят в состав стандарта MPEG и стандарт DVD. Это основа стандарта телевиде­ния с высоким разрешением (High Definition Television), в котором использу­ется коэффициент относительного изменения вертикального и горизон­тального масштаба изображения, равный 16:9, а не 4:3, и число строк, в два раза превышающее число строк на обычном экране.

Поскольку в стандарте HDTV экран «шире», а существующий графический материал трудно растянуть или сжать в соответствии с новым коэф­фициентом, для HDTV-телевидения потребуются новые стандарты разра­ботки мультимедиа и интерфейсов.

Компьютерное видео использует цифровые сигналы и другие стандарты для вывода изображений, в связи с этим предполагается слияние стандартов телевизионного и компьютерного видео на основе стандартов DVD-Video и HDTV.

Для вывода аналогового видеоизображения на компьютерном мониторе видеосигнал сначала преобразуется в цифровую форму. Аналоговый видеосигнал (преобразованный в цифро­вую форму) и компьютерные изображения в цифровой форме объединяют­ся, и на экран выводится полноэкранный видеофильм или окно видео на фоне обычного экрана.

Сжатие видеоизображений

Запись последовательности кадров предъявляет высокие требования к вычислительной системе, такие как:

  1. Большой объем внешней памяти (для запоминания одной секунды полноцветного полноэкранного видео требуется 20–30 Мбайт, а оптический диск емкостью 600 Мбайт вместит менее полминуты изображения).

  2. Высокая пропускная способность внешних запоминающих устройств (от 30 МБайт/с).

Эти требования реализуются с помощью методов (алгоритмов) сжатия / развертки данных, которые позволяют сжимать информацию перед записью на внешнее устройство, а затем считывать и разворачивать в реальном режиме времени при выводе на экран. Для движущихся видеоизображений существующие адаптивные разностные алгоритмы могут сжимать данные с коэффициентом порядка 100:1 - 160:1, что позволяет разместить на CD-ROM около часа полноценного озвученного видео. Работа этих алгоритмов основана на том, что обычно последующий кадр отличается от предыдущего лишь некоторыми деталями, поэтому, взяв какой–то кадр за базовый, для следующих можно хранить только относительные изменения. При значительных изменениях кадра автоматически выбирается новый базовый кадр.

Алгоритмы реализуются аппаратно: в виде специальных микросхем, или в виде записанной в ПЗУ программы; либо только программно.

B настоящее время разработаны специальные алгоритмы автоматического сжатия, такие как JPEG, MPEG, P*64, DVI/lndeo. Коэффициенты сжа­тия находятся в диапазоне от 50:1 до 200:1. Следует различать процессы съемки и воспроизведения, поскольку тре­бования сжатия данных для этих процедур различны. Цель сжатия данных при съемке - это сокращение получаемого от видео-АЦП цифрового потока, чтобы его можно было записать на жесткий диск в реальном времени. При этом требуемая степень сжатия зависит от оснащения компьютерной системы. После переноса на жесткий диск данные можно обрабатывать без временных ограничений. Конечной целью должно быть такое сокращение объема данных, которое не вызывает задержек при воспроизведении на стандартном компьютере.

Самым большим недостатком программных видеосистем является зави­симость качества изображения от производительности компьютера. Это по­рождает трудности, особенно при создании мультимедиа-приложений. Как правило, разработчик мультимедиа-приложения имеет в своем распоряже­нии высокопроизводительную вычислительную систему. Из-за этого иногда возникают трудности воспроизведения на массовых персональных компью­терах.

Метод сжатия MPEG был разработан группой Moving Picture Experts Group, рабочей группы под руководством международной организации по стандартизации (International Standards Organization, ISO) и международной электротехнической комиссии (International Electro-technical Commission, IEC) для создания стандартов для цифрового представления видеофиль­мов и соответствующей звуковой информации и других данных, В настоя­щее время применяются три спецификации - MPEG-1, MPEG-2 и MPEG-4.

В стандарте MPEG1 обеспечивается скорость передачи видеоданных 1,2 Мбит в секунду; для двух каналов стереозвука - скорость 250 Кбит в секунду при работе с дисками CD-ROM. Стандарт MPEG2 полностью отличается от MPEG1 и определяет скорость обмена данных от 3 до 15 Мбит в секунду, более высокое разрешение и качество изображения, форматы чересстроч­ного видео, масштабирование с разными значениями разрешения и много­канальное звуковое сопровождение.

Метод сжатия MPEG вполне пригоден для кодирования подвижных изо­бражений, поскольку он широко применяется в сети Internet и в области DVD-видео. Разработан аппаратный метод MPEG-сжатия, и специальные схемы встраиваются на системной плате компьютера и видеоплатах; про­граммная реализация распаковки для MPEG имеет более низкое быстро­действие, чем аппаратные методы, и имеется в программе QuickTime.

MPEG принципиально не отличается от других методов сжатия и де­кодирования видеоданных. По существу метод основан на алгоритмах JPEG и Cinepak.

Стандарт MPEG-1 был специально разработан для съемки и воспроизве­дения цифровых видеопоследовательностей с помощью персональных компьютеров. Он устанавливает разрешение 352 х 240 элементов изобра­жения при 30 кадрах в секунду и, соответственно, 352 х 288 элементов изо­бражения при 25 кадрах в секунду - в зависимости от видеостандарта NTSC или PAL. При этом цифровой поток не должен превышать 0,15 мегабайта в секунду. Получаемое качество изображения довольно точно соответствует среднему качеству видеопоследовательностей Cinepak при разрешении, составляющем несколько ниже половины значения, обеспечиваемого ви­деомагнитофоном формата VHS, имеющего горизонтальное разрешение 3 МГц (в случае PAL воспроизводится 50 изображений в секунду, каждое из которых имеет разрешение около 380 х 288 элементов изображения).

В отличие от MPEG-1, MPEG-2 определяет стандарт для цифровой пере­дачи телевидения. В настоящее время пропускная способность спутников и других трактов передачи телевидения ограничивает количество переда­ваемых программ. Благодаря методу сжатия, определяемому стандартом MPEG-2, полосу частот, требуемую для передачи одной программы, можно сократить на 90%. Это означает, что без существенных дополнительных за­трат можно удесятерить число передаваемых программ.

В декабре 1999 г. был разработан новый стандарт - MPEG4. Увеличи­лась скорость передачи данных при том же разрешении изображения; объ­ем передаваемых данных, необходимых для нормального изображения по сравнению с MPEG2, уменьшился в 11 раз - картинки, видео и текстуры ко­дируются и компрессируются более эффективно; улучшено исправление ошибок; улучшен алгоритм кодирования- уменьшена буферная задержка.

После появления MPEG4 возможности сжатия резко увеличились и нако­нец-то отныне один полнометражный фильм равен одному диску. Однако для комфортного просмотра фильма необходимо наличие микропроцессора Pentium с тактовой частотой не менее 400 МГц. MPEG4 обеспечивает лучшее качество при том же размере файла или меньший размер при том же качестве, большую гибкость в выборе разрешения, частоты кадров и скорости потока данных, лучшую передачу быстрого движения, меньшее время компрессии, легко сочетается с разными аудио-кодеками, менее чув­ствителен к потери части данных, хорошо подходит для просмотра видео через сеть в реальном времени.

Как и MPEG2, MPEG4 также имеет различные профили. Это позволяет адаптировать аудио/видеопоток к используемому приложению. MPEG4 учи­тывает специальные требования к компьютеру, телекоммуникациям и теле­визионным областям. Он кодирует не только прямоугольные пиксели, но и индивидуальные объекты сцены. Например, на фоне едва изменяющегося экрана передвигается машина. В этом случае машина воспринимается как отдельный объект на неподвижном фоне, тогда как все остальное кодиру­ется отдельно. Благодаря этому, сейчас в "домашних" условиях возможно записать содер­жимое DVD-диска на обыкновенный CD-ROM, практически без потери качества.

Кодирование и декодирование MPEG требует большого объема вычис­лений, поэтому первоначально MPEG был задуман как чисто аппаратная видеосистема. Это означает, что для проигрывания MPEG-видеопоследовательностей необходима специальная плата MPEG-декодера. Строго говоря, теперь это верно только для процессов ввода.

Операционная система Windows содержит эффективный механизм воспроизведения программно декодируемых видеопоследовательностей. Графические платы способны очень быстро удваивать размер воспроизводимого изображения с помощью интерполяции. Это означает, что из видеопоследовательности среднего формата - 320 х 240 элементов получается полнокадровая видеопоследо­вательность в формате 640 х 480, причем для этого не требуется дополни­тельная вычислительная мощность. Благодаря этому цифровой поток, ко­торый должен поступать на графическую плату, сокращается на 75%, т.е. с 23 мегабайт в секунду (для видеопоследовательности в формате 640 х 480 при глубине цвета 24 бита и 24 кадрах в секунду) всего до 6 МБт в се­кунду. Поскольку компьютеры становятся все более быстродействующими, а программные декодеры все более совершенными, MPEG в своем разви­тии движется от аппаратной видеосистемы к программной.

Обработка и синтез звука

Звуковые волны, представляющие из себя аналоговый сигнал, при обработке на компьютере преобразуются в цифровую форму.

Под аналоговым сигналом обычно понимают плавно изменяющиеся сигналы, непрерывные по амплитуде во времени. Простейшая звуковая волна представляется обычно напряжением (или током), изменяющимся во времени по синусоидальному закону. Причем ам­плитуда такой волны определяет громкость звука, а частота - его высоту. Частота измеряется обычно в герцах (одно колебание в секунду); частоты звуковых (слышимых) колебаний лежат в диапазоне от 17-20 Гц до 20 кГц.

Реальные звуки помимо громкости и частоты характеризуются также тембром. В этом случае кроме основного тона (колебания основной частоты) в сигнале присутствуют также колебания более высоких частот - обертоны. Именно амплитудами обертонов и характеризуется тембр (насыщенность) звука.

Оцифровка звукового сигнала

В общем случае IBM PC-совместимые компьютеры имеют несколько воз­можностей для генерирования (воспроизведения) звука с использованием звуковой карты. Выбор способа зависит в первую очередь от типа конкрет­ной карты (аудиоадаптера). Обычно в функциональном составе звуковых плат можно выде­лить следующие узлы:

• модуль для записи и воспроизведения звука;

• модуль синтезатора;

• модуль интерфейсов.

Таким образом, для воспроизведения звука используется циф­ро-аналоговое преобразование. В этом случае цифровые выборки реального звукового сигнала хранятся в памяти компьютера (например, в виде WAV-файлов) и преобразовываются в аналоговый сигнал через цифро-аналоговый преобразователь (ЦАП - DAC).

В состав аудиоадаптера входит аналого–цифровой преобразователь (АЦП - ADC), периодически определяющий уровень звукового сигнала и превращающий этот отсчет в цифровой код. АЦП служит для дискретизации реального сигнала по времени и квантования по уровню. Для этого, как правило, используются ADC с импульсно-кодовой модуляцией РСМ (Pulse Code Modulation). ADC пред­ставляет из себя устройство, способное формировать из аналогового сигнала эквивалентный цифровой сигнал. Аналоговый сигнал "проверяется" в строго определенные (равноудаленные и дискретные) моменты времени. Временные интервалы между этими моментами называют интервалами выборки (Sampling Interval). Величина, обратная интервалу (точнее времени) выборки, называется частотой пре­образования, или сэмплингом (Sampling Rate).

Полученная в результате амплитуда аналогового сигнала, или значение выборки (Sample Value), делится (квантуется) по уровню и кодируется в со­ответствующий параллельный цифровой код (Digital Sample). Для преобразования выборки аналогового сигнала в цифровой код требуется некоторое время. Оно обычно называется временем преобразования, или временем выборки (Sampling Time).

Преобразование аналогового сигнала в цифровой можно произвести только с какой-то степенью точности. Под разрешающей способностью ADC понимают наименьшее изменение аналогового сигнала, которое может привести к изменению цифрового кода. Например, 8-разрядный преобразо­ватель может квантовать амплитуду сигнала на 256 (28), 16-разрядный - на 65536 (216) интервалов. Та­ким образом, в заданном входном диапазоне 8-разрядный ADC "заметит" отклонение аналогового сиг­нала, если тот изменится не менее чем на 1/256 часть своего максимального зна­чения.

Значение каждого кванта округляется до ближайшего целого числа, и, если величина амплитуды больше определенного интер­вала, то происходит клиппинг (clipping), т.е. отсечение верхней и нижней вершин волны звукового сигнала. Квантование сигнала может вызвать не­желательный шипящий шум, а клиппинг приводит к большому искажению звука.

ADC звуковых карт обычно имеют разрядность 8, 12 или 16 бит. С увели­чением разрядности АЦП растет его динамический диапазон. Каждый бит соответствует примерно 6 дБ (децибелам). В этом случае 8-разрядное пре­образование может обеспечить динамический диапазон 48 дБ (качество кассетного магнитофона), 12-разрядное - 72 дБ (качество аналогового маг­нитофона с катушками) и 16-разрядное - 96 дБ (качество, ассоциируемое с компакт-диском).

Для воспроизведения звука служит ЦАП, который выполняет обратное преобразование (параллельный код - аналоговый сигнал). После фильтра­ции выходной аналоговый сигнал поступает на усилитель мощности, откуда он может быть выведен на акустическую систему.

Синтез звука

Наряду с воспроизведением звука практикуется его синтез, при котором ком­пьютер передает на звуковую карту некоторую управляющую информацию, по которой и формируется выходной аналоговый сигнал. В настоящее вре­мя главным образом применяются две основные формы синтеза звукового сигнала:

  1. синтез с использованием частотной модуляции (Frequency Modulation) - FM-синтез;

  2. синтез с использованием таблицы волн (Wave Table) - табличный, или WT-синтез.

Помимо синтеза компьютер также может управлять устройством, которое либо выдает команды для синтеза звука другим устройством, либо само способно воспроизводить (или синтезировать) звук. В этом случае специ­альная управляющая информация между такими устройствами передается по так называемому MIDI-интерфейсу, а устройство, подключаемое к тако­му интерфейсу, называется MIDI-устройством.

Не менее распространенным способом воспроизведения звука с компью­тера со звуковой картой является управление приводом CD-ROM или DVD-ROM, в кото­ром находится компакт-диск с записанной на нем аудиоинформацией.

FM-синтез

Цифровой FМ-синтез звука осуществляется с использованием специаль­ных генераторов сигналов, называемых также операторами. В операторе можно выделить два базовых элемента: фазовый модулятор и генера­тор огибающей.

Фазовый модулятор опреде­ляет частоту (высоту) тона, а ге­нератор огибающей - его ампли­туду (громкость).

При нажатии клавиши н синтезаторе амплитуда сигнала сначала быстро возрастает до максимума, затем немного спадает, после чего следует сравни­тельно короткий, но равномерный участок, и только затем происходит дос­таточно медленный спад амплитуды. Вышеназванные фазы сигнала реализуются генератором огибающей и носят названия соответственно Attack, Decay, Sustain и Release, а сам генератор (по их первым буквам) часто называется ADSR-генератором,

В общем случае, для того чтобы воспроизвести голос одного инструмента, достаточно двух операторов. Первый оператор генерирует несущие коле­бания, то есть основной тон, а второй - модулирующую частоту, или обер­тона - интенсивность звука определяется амплитудой носителя, а тембро­вая окраска, или насыщенность - обертонами, то есть амплитудой модуля­тора и соотношением частот носителя и модулятора (глубиной модуляции).

Комбинации включения операторов называют FM-алгоритмами, при этом каждый из операторов может формировать одну из определенных форм сигнала (waveform). Для четырехоператорных синтезаторов схемы включения более сложные и задаются FM-алгоритмами, которые определяют, какой из операторов выступает генератором основного тона, а какой - модулятором, а также способы их включения и т.д.

WT-синтез

Суть технологии WT-синтеза состоит в следующем. На звуковой карте устанавливается модуль ПЗУ с “зашитыми” в него образцами звучания настоящих музыкальных инструментов - сэмплами (Samplers), при этом WT-процессор с помощью специальных алгоритмов по одному тону инструмента воспроизводит все его остальные звуки. Кроме того, многие производители оснащают свои звуковые карты модуляторами ОЗУ, так что есть возможность не только записывать произвольные сэмплы, но и загружать новые инструменты.

Выборки сигналов (таблицы) сохраняются либо в ПЗУ, либо программно загружаются в ОЗУ звуковой карты. WT-процессор выполня­ет операции над выборками сигнала, изменяя их амплитуду и частоту. Звук инструментов, получаемый таким образом более похож на звучание реальных инструментов, нежели, например, при FM-синтезе.

Управляющие команды для синтеза звука могут поступать на звуковую карту не только от компьютера, но и от другого, например, MIDI (Musical Instruments Digital Interface) устройства. MIDI определяет протокол передачи команд по стандартному интерфейсу. MIDI-сообщение содержит ссылки на ноты, а не запись музыки. Когда звуковая карта получает подобное сообщение, оно расшифровывается (какие ноты каких инструментов должны звучать) и отрабатывается.

Подготовка цифровых аудиофайлов

При подготовке цифровых аудиофайлов следует уделить внимание двум аспектам:

  • сопоставлению требуемого качества звука с имеющимся объемом оперативной памяти и дискового пространства;

  • установке соответствующего уровня записи для получения хорошей, чистой записи звука.

Стереозапись ближе по звучанию к реальности. Приведем формулу для расчета размера (в байтах) цифрового аудиофайла:

Для монофонического звучания:

(частота квантования) х (время записи в секундах) х (разрешение бит / 8)

Для стереозвука:

удвоение размера.

Если сигнал, который вводится в компьютер, имеет большие искажения, то в результате получится неприятный фоновый шум. И наоборот, если запись сделана при низком уровне, то фоновый шум может превысить уровень сигнала, т.е. необходим поиск оптимального уровня записи. Любая программа записи и редактирования цифрового звука показывает уровень звучания, поэтому пользователю не составляет сложности установить необходимый уровень записи.

Редактирование цифровой записи

После записи выполняется редактирование. Типовые функции редакти­рования в обычной программе записи и редактирования звуковых файлов:

Тримминг (Trimming). Удаление "мертвого воздуха" или пустого места в начале записи или в конце. Удалив всего несколько секунд записи, мо­жно существенно изменить размер файла

Секционирование и сборка. Уда­ление шумов, которые проникли в запись, вы­полнение сборки длинных записей из имеющихся коротких записей или раз­резка имеющихся длинных записей.

Преобразование форматов. Большинство программ редактирования звука для Macintosh записывают звуковые файлы в форматах SND AIF, и большинство инструментальных систем могут читать эти форматы. В среде Windows большинство программ редактирования звука читает файл в формате WAV.

Повторное квантование. Если запись или редактирование звука выполнялась с 16-битными частотами квантования, а используются более низкие частоты и разрешение, то необходимо повторить процесс квантования с соответствующими частотами и разрешением. Это значительно уменьшит размер файлов.

Нарастание (fade-in) и затухание (fade-out) звука. Большинство программ имеют возможность создавать эффект затухания или нарастания звука, что часто используется для сглаживания начала и конца звукового файла.

Временное растяжение. Более сложные программы позволяют изменять длительность файла, не изменяя при этом уровня звучания. Но необходимо помнить, что большинство алгоритмов растяжения понижают качество звукового файла, если растя­жение превышает несколько процентов в обоих направлениях.

Цифровая обработка сигнала. Некоторые программы позволяют обра­батывать сигнал с помощью специальных эффектов: реверберация (reverberation), задержки включения (multitap delay), рефрен (chorus), двой­ное звучание (flange) и др.

Сжатие звуковых файлов

Для сжатия информации используется дифференциальная импульсно-кодовая модуляция (Differential Pulse Code Modulation). В этом случае сохраняется только разность между текущим значением сигнала и предшествующим. Дифферен­циальная импульсно-кодовая модуляция основана на том факте, что раз­ность требует меньшего количества бит, чем полная величина амплитуды. Дельта-модуляция (Delta Modulation) представляет собой вариант диффе­ренциальной импульсно-кодовой модуляции, при которой для кодирования каждого дискретного значения сигнала используется единственный бит, от­ражающий изменение сигнала на единичную величину в сторону увеличе­ния или уменьшения. Однако наибольшее распространение, в частности, для записи звука по­лучила так называемая адаптивная импульсно-кодовая модуляция (Adaptive Pulse Code Modulation, ADPCM).

Формат МРЗ

MP3 (сокращение от MPEG Layer3) - один из цифровых форматов хране­ния аудио, используется главным образом для передачи аудио в реальном времени по сетевым каналам и для кодирования CD Audio.

МРЗ - потоковый формат; исходный сигнал при кодировании разбивается на равные по продолжительности участки, именуемые фреймами и кодируемые отдельно, а при декодировании конечный сигнал формируется из последовательности декодированных фреймов.

Высокая степень компактности МРЗ по сравнению с импульсно-кодовой модуляцией 16Bit Stereo 44.1 kHz (в формате CD Audio) достигается с помощью дополнительного квантования с учетом особенностей человеческого слуха, в том числе эффекта маскирования слабого сигнала одного диапазона частот более мощным сигналом соседнего диапазона, когда он имеет место, или мощным сигналом, преды­дущего фрейма, вызывающего временное понижение чувствительности уха о к сигналу текущего фрейма. Также учитывается неспособность большинства людей различать сигналы, по мощности лежащие ниже определенного уровня, разного для разных частотных диапазонов.

Степень сжатия, и, соответственно, объем дополнительного квантования, определяются не форматом, а самим пользователем в момент задания па­раметров кодирования. Ширина потока (bitrate) варьируется от наибольшего для МРЗ, равного 320kbs (320 килобит в секунду), до 96kbs и ниже. Термин битрейт обозначает общую ширину потока, безразлично к тому, монофони­ческий или стереофонический сигнал он содержит.

Разные программы обработки и проигрывания звука дают разное качест­во кодирования и декодирования.

Выбор программы кодирования, ее параметров и степени cжатия/битрейта (и связанного с его уровнем качества) зависит главным обра­зом от трех факторов:

  • содержания оцифрованной звуковой информации (речь, звуковое сопро­вождение, высококачественная музыка);

  • предполагаемого адресата аудиоинформации и уровня его претензий к качеству звука или скорости передачи аудиофайла по сети;

  • предполагаемого качества воспроизводящей аудиоаппаратуры (аудиокарты и акустических систем).

Разные битрейты дают разное качество. Любители МРЗ абсолютно по-разному оценивают степень приемлемости одних и тех же битрейтов и имеют свой взгляд на то, какой битрейт следует считать оптимальным. Кто-то выбирает 128 kbs, другие 160 kbs, третьи золотую середину - от 192 kbs до 256 kbs. Некоторые - 320 kbs.

Битрейт 256 kbs следует считать совершенно достаточным для абсолют­ного большинства пользователей;

Тесты определили МРЗ 160 kbs... 192 kbs в большинстве случаев вполне приемлемыми для хранения аудио на компьютере, например, в компьютер­ных играх, когда внимание отвлечено;

Битрейт 320kbs - максимальный (степень сжатия - более чем в че­тыре раза), для кодирования аудио с характеристиками CD Audio, то есть 44.1 kHz 16bit Stereo;

Самым популярным все же остается битрейт 128 kbs, но при его использовании мы имеем скорее качество аудиокассеты, записанной с очень низким уровнем шумов.

В сети INTERNET, как правило, можно найти только МРЗ, закодированные с битрейтом 128 kbs, признанным оптимальным для использования в сети INTERNET.

МРЗ стал массово признанным форматом хранения ау­диоинформации. Ситуация с форматом MP3 создала правовую колли­зию, связанную с нелегальным распространением аудиотреков через сеть Ин­тернет.

Стандарт МРЗ не определяет никакого точного стандартного математи­ческого алгоритма кодирования; он индивидуален для каждого разработанного кодера. Вместо этого стандарт определяет общую схему процесса кодирования, а также формат закодированного фрейма. Сами последова­тельности фреймов могут передаваться потоком (streaming) или храниться в файлах.

МРЗ файл, как и поток, состоит из последовательно расположенных фреймов, между которыми может содержаться произвольная информация. Основное требование состоит в том, что не должно быть совпадений с сигнатурой начала фрейма.

Часто к последовательности фреймов добавляют стандартный заголовок мета-аудиоформата WAV, и получается то, что называют WAV-MP3. Формат WAV является метаформатом для данных любого типа. Формат имеет стандартный заголовок и описания областей данных, которых может быть несколько, способ же кодирования аудиосигнала может быть каким угодно. Вполне могут содержаться данные, к аудио отношения не имеющие.

Оптические компакт-диски

Компакт-диск - традиционная среда для записи музыки, которую потом можно прослушать на бытовом CD-плейере или дру­гом компьютере. Смонтированное видео можно записать в MPEG-4 или MPEG-1, если необходимо высокое качество, на стандартный CD-R емкостью 650 Мбайт поместится около 20 минут видео DVD-качества (MPEG-2 с разрешением 720 х 576, 25 кадров/с). Очень удобна архивация мультиме­дийных данных с последующим переносом их на любой компьютер.

Приводы CD-R и CD-RW соответствуют системам однократной (CD-Recordable -записываемый CD) и многократной (CD-ReWritable - перезаписываемый CD) записи компакт-дисков. Терминами CD-R и CD-RW обозначаются как устройства для записи, так и сами диски.

Для однократной записи используются компакт-диски, в которых отражающий слой вы­полнен преимущественно из золотой или серебряной пленки, а между ним и поликарбонатной основой расположен регистрирующий слой из органиче­ского материала, темнеющего при нагревании. В процессе записи лазерный луч нагревает выбранные точки слоя, которые темнеют и перестают про­пускать свет к отражающему слою, образуя участки, аналогичные питам.

Ha CD-R организуется та же информационная структура, что и на штам­пованных дисках - ТОС и набор дорожек различных типов. Это позволяет при помощи соответствующего программного обеспечения записывать зву­ковые, фото- и видеодиски, которые могут затем проигрываться в бытовых звуковых и видеопроигрывателях. Однако отражающая способность зер­кального слоя и четкость питов у дисков CD-R ниже обычного, отчего неко­торые устройства могут работать с ними неуверенно.

В перезаписываемых дисках используется промежуточный слой из орга­нической пленки, изменяющей под воздействием луча свое фазовое со­стояние с аморфного на кристаллическое и обратно, в результате чего ме­няется прозрачность слоя. Фиксация изменений состояния происходит бла­годаря тому, что материал регистрирующего слоя при нагреве свыше кри­тической температуры переходит в аморфное состояние и остается в нем после остывания, а при нагреве до температуры значительно ниже крити­ческой восстанавливает кристаллическое состояние. Существующие диски выдерживают от тысяч до десятков тысяч циклов перезаписи. Однако их отражающая способность существенно ниже штампованных и однократных CD, что затрудняет их считывание в обычных приводах.

Для чтения CD-RW необходим привод с автоматической регулировкой усиления фотоприемника (Auto Gain Control), хотя некоторые обычные приводы CD-ROM и бытовые проигрыватели способны читать их наравне с обычными дисками. Способность привода читать CD-RW носит название Multiread.

Диски CD-R/CD-RW изготовляются со вспомогательной разметкой (pregroove) в которой закодирована временная сетка (ATIP - Actual Time In Pregroove, действительное время по разметке), которая одновременно слу­жит и для разбивки диска на кадры (блоки), и дополнительная информация о диске - коды, рекомендуемые значения скорости вращения и мощности записывающего лазера. Разметка используется для нахождения служебных и пользовательских областей диска и для облегчения слежения за инфор­мационной дорожкой в процессе записи. При считывании слежение произ­водится, как обычно, по записанной информационной дорожке. Кроме этого, диск содержит две служебные области: РСА (Power Calibration Area - об­ласть калибровки мощности) и РМА (Program Memory Area - область памяти программы), расположенные внутри от "официального" радиуса начала за­писи. РСА используется для выбора оптимальной мощности лазера перед каждой записью, а РМА - для временного хранения ТОС в случае записи одной сессии в несколько приемов. РСА и РМА являются таблицами фик­сированной длины емкостью по 100 элементов каждая, что ограничивает как общее количество случаев записи, так и этапов формирования незакры­тых сессий.

Минимальной единицей информации, записываемой на CD-R за один прием, является дорожка (track) в формате CD-DA или CD-ROM. Мини­мальная длина дорожки - 300 блоков (600 Кбайт, 4 сек). В начале каждой дорожки формируется служебный зазор (pre-gap), содержащий ее парамет­ры, размером 150 блоков (300 Кбайт, 2 сек) для однотипных дорожек и 225 блоков (450 Кбайт, 3 сек) для дорожек разных типов. Одна или несколько дорожек образуют программную область (Program Area), которая может формироваться в несколько приемов, между которыми адреса и параметры дорожек (ТОС) сохраняются в РМА.

Конструкция привода CD-ROM и принципы его работы

Типичный привод CD-ROM состоит из печатной платы с электрони­кой, шпиндельного двигателя, считывающей системы с оптической го­ловкой, системы загрузки CD-диска и механизма перемещения рамы с механикой привода. На плате с электроникой размещены:

• все схемы управления работой привода;

• разъем интерфейса для подключения к компьютеру;

• аналоговый звуковой выход (Analog Audio);

• цифровой звуковой выход S/PDIF (Digital Audio - может отсутствовать в некоторых моделях).

Шпиндельный двигатель служит для вращения диска с постоянной линейной (CLV - Constant Linear Velocity) или угловой (CAV - Constant Angular Velocity) скоростью. Поддержка постоянной линейной скорости требует изменения угловой скорости диска в зависимости от положе­ния оптической головки.

На оси шпиндельного двигателя крепится подставка, к которой при­жимается нижняя сторона диска (при горизонтальной загрузке). На конце оси шпиндельного двигателя крепится намагниченный металли­ческий наконечник, имеющий конусообразную форму. С другой сторо­ны диска - верхней в случае горизонтальной загрузки, то есть над дис­ком, - размещается намагниченный маховик, который притягивает ме­таллический наконечник, в результате чего диск оказывается зажатым между подставкой и маховиком, что обеспечивает фиксацию диска по вертикали и хорошее сцепление диска с вращающейся подставкой во время работы привода.

Считывающая система состоит из оптической головки и механизма ее позиционирования. В головке размещены лазерный излучатель на основе инфракрасного лазерного светодиода с длиной волны от 770 до 830 нм (обычно - около 780 нм) и мощностью 0,2-0,5 мВт, система фокусировки лазерного пучка, фотоприемник и предварительный уси­литель. Система фокусировки представляет собой набор подвижных линз, приводимых в движение электромагнитной системой типа «voice coil» (звуковая катушка), сделанной по аналогии с подвижной систе­мой громкоговорителя. Изменение напряженности магнитного поля приводит к передвижению линз и перемещению точки фокусировки лазерного луча.

Благодаря малой инерционности такая система эффективно отсле­живает вертикальные биения диска даже при значительных скоростях вращения. Механизм позиционирования оптической головки имеет собственный двигатель, приводящий в движение каретку с оптической головкой при помощи зубчатой или червячной передачи.

Система загрузки диска бывает трех типов:

• Caddy - с использованием специального футляра для диска, вставляемого в приемное отверстие привода;

• Tray - с использованием выдвижного лотка, на который кла­дется диск;

• Slot-in - загрузка диска непосредственно в приемную щель привода.

В приводах типа Caddy и Slot-in диск может загружаться как гори­зонтально, так и вертикально - то есть при горизонтальном и, соответ­ственно, вертикальном монтаже привода.

После загрузки диск не касается никаких деталей дисковода, кроме подставки и маховика, после чего его уже можно раскручивать.

На передней панели привода обычно расположены:

• кнопка Eject для загрузки/выгрузки диска;

• индикатор обращения к диску Busy (в некоторых моделях -Disk On/Busy, индикатор сигнализирует не только об обращении к диску, но также о том, что в приводе находится диск);

• гнездо для подключения наушников с электронным или меха­ническим регулятором громкости.

Для считывания информации с диска используется полупроводни­ковый лазер, излучающий в инфракрасном диапазоне - длина волны составляет около 780 нм. Луч лазера, проходя через фокусирующую линзу, падает на отражающий слой. Отраженный луч регистрируется фотоприемником. По зарегистрированному сигналу определяется прохождение оптической головки над питами и промежутками диска, а также проверяется качество фокусировки пятна лазерного луча на поверх­ности диска и его ориентации по центру дорожки.

На выходе фотоприемника получается цифровой поток бит, который декодируется c удалением дополнительных нуле­вых бит. B результате этого получает­ся битовый поток, который представляет собой исходный поток дан­ных, кодированный по CIRC с добавленными субкодами. Поэтому далее производится отделение субкодовых каналов и CIRC-декодирование. На этапе CIRC-декодирования обнаруживается и ис­правляется большая часть ошибок, вызванных дефектами при штам­повке, неоднородностью материалов диска, царапинами на его по­верхности, нечетким определением лита/промежутка в фотоприемни­ке и т.д. Полученный поток бит представляет собой полезную инфор­мацию, хранящуюся на диске.

DVD-технология

Развитие компьютеров и вычислительных систем позволило начать активное применение мощных алгоритмов сжатия, позволяющих вместить на один диск не час с четвертью, а от 5 до 10 часов музыки практически без потери качества. Однако для видеоиндустрии размер одного диска оказался маловат даже при использовании сжатия, да и компьютерные приложения уже переросли воз­можности накопителей на CD-дисках. Решить все эти проблемы была призвана DVD-технология.

В соответствии с этим был принят единый стандарт, названный DVD, или Digital Video Disc (впоследствии приняли расшифровку Digital Versatile Disc - цифровой многоцелевой диск). Далее была опуб­ликована первая версия спецификации для DVD-ROM и DVD-Video и принята схема защиты цифровой копии от несанкциони­рованного тиражирования.

В настоящее время существуют стандарты для DVD-Video, DVD-ROM, DVD-Audio. Звуковое сопровождение на DVD поддерживается стандартами Mono, PCM Stereo, Dolby Surround (Prologic), Dolby Digital AC-3, THX, DTS. Звуковые стандарты Dolbv Digital AC-3, THX, DTS определяют шестиканальный звук, т.е. звуковое сопровождение по схеме: фронтальные колонки, центр, тыловые ко­лонки и саббуффер. Обычно для обозначения шестиканального звука используется аббревиатура «5.1», что означает использование основ­ных пяти источников звука и отдельно - низкочастотного блока - саббуффера. Dolby ProLogic и Doiby Digital АС-3 отличаются тем, что Dolby Digital АС-3 имеет шесть независимо записанных звуковых до­рожек, a Dolby ProLogic лишь специальным образом обрабатывает стереосигнал и является имитацией шестиканального звука.

Таким образом, звук на DVD-дисках записывается в самых различных форматах, все они воспроизводят несколько независимых каналов пространственного компрессированного звука, создавая тем самым реалистичную картину происходящего.

DVD-видео - это цифровое видео, сжатое по алгоритму MPEG-2 и записанное на DVD-диск. Формат - 25 кадров в секунду с разрешением 720 х 576 то­чек при глубине цвета 24-бит (PAL) или 30 кадров 720 х 480 х 24-бит (NTSC). В несжатом виде это поток 3О МБайт в секунду, а двухчасовой фильм будет занимать более 100 гигабайт.

DVD-диски имеют емкость от 4,7Gb до 17Gb в зависимости от типа. При этом меняется не плотность записи, а тип размещения информа­ции. Диски бывают односторонние однослойные, односторонние двух­слойные, двухсторонние однослойные и двухсторонние двухслойные. Кроме того, бывают комбинированные диски, у которых с одной стороны два слоя, а с другой - один.

Способ хранения информации на DVD-ROM практически такой же, как и у CD-ROM: вдоль металлической подложки по спирали располо­жены канавки, составляющие так называемые треки. Эти канавки не­сут в себе информацию, которая считывается лучом лазера, преобра­зовывая канавки в единички и нули. Сама отражающая подложка покрыта защитным слоем пластика, предохраняющего диск от повреж­дения.

Отличие DVD-диска от CD - плотность записанной информа­ции. Так, например, односторонний и одноуровневый DVD-диск хранит приблизительно 4,7 Гбайт информации (технология DVD-5), а обычный CD-диск - лишь 650 Мбайт. Был разра­ботан новый полупроводниковый лазерный излучатель, использующий для работы меньшую длину волны (650-635 нм), чем лазер дис­ковода CD-ROM (780 нм). После этого расстояние между треками ста­ло меньше, да и сами канавки на диске (хранители информации) значительно уменьшились в размерах.

Вслед за одноуровневыми дисками появились двухуровневые, вмещающие до 8,54 Гбайт информации. Здесь первый уровень нахо­дился под вторым, а считывание происходило путем фокусировки лу­ча лазера по уровням (технология DVD-9). По технологии DVD-10 счи­тывание происходит с двух сторон по одному уровню. Хранимый объ­ем достиг 9,4 Гбайт. Двухуровневый DVD-18 обеспечивает хранение 17,08 Гбайт. Чтение происходит с двух сторон, каждая из которых имеет два уровня.

Существенными являются такие характеристики привода, как Access Time (время доступа), CPU Utilization (загрузка центрального процессора), Transfer Rate Inside/Outside (внутренняя и внешняя ско­рость передачи данных).

Показатель Access Time (время доступа) отражает сумму среднего времени поиска, необходимую приводу DVD-ROM для позициониро­вания на нужный трек и среднего времени «запаздывания» (латентности), в течение которого диск подводится под нужный сектор для счи­тывания. Соответственно, чем ниже значение Access Time, тем лучше. Показатель CPU Utilization (загрузка CPU) говорит о том, насколько DVD-ROM использует ресурсы процессора.

Скорость передачи данных характеризуется двумя показателями: внутренней (Inside) и внешней (outside) скоростью. Внутренняя скорость передачи представляет со­бой передачу между DVD-диском и внутренним буфером DVD-ROM непосредственно.

Она определяется многими параметрами: качеством и плотностью записи, скоростью вращения и т. д. На эти параметры влияет конст­руктивная особенность привода. Внешняя же скорость передачи дан­ных полностью зависит от ис­пользуемого режима передачи.