Методические указания по использованию программы исследования статистических свойств сигнала звукового вещания «ESTIM»
.pdfподход. Тенденция усложнения тестовых сигналов для оценки все новых искажений привела к идее использования реальных вещательных сигналов,
которые применяются при тех же ССИ. Именно с музыкальных и речевых сигналов начиналась в 50-е годы работа под руководством И.Е. Горона,
результатом которой стал ГОСТ 11515.
Изучение статистических свойств вещательных сигналов началось под руководством В.А. Нюренберга [2]. Тогда впервые была проведена грань между параметрами вещательных каналов и параметрами вещательных сигналов, где под последними понимались:
1.функция распределения мгновенных значений;
2.относительная средняя мощность за длительное время и за короткие отрезки времени;
3.энергетический спектр.
Вцелом проблема объективной оценки параметров качества передачи в каналах звукового вещания с адаптацией параметров к свойствам сигнала,
получателю, акустической обстановке в точке прослушивания - сложная задача, не нашедшая пока решения. За последние несколько лет проблема измерений СЗВ поднималась на целом ряде съездов и конференций, на которых были предложены новые наборы тестовых сигналов и методики измерений, характерные для систем обработки, представления и передачи звука.
1.3. ПСИХОАКУСТИЧЕСКИЕ МЕТОДЫ ОЦЕНКИ
Психоакустические (perceptual) методы оценки направлены на имитацию с помощью технических и программных средств алгоритма человеческого слухового восприятия.
Прообразом психоакустического подхода стало использование взвешивающих фильтров при измерениях шумов. Это были объективные измерения, но уже с привязкой к особенностям восприятия звука человеком.
К началу 1990-х годов на Западе сформировалось стойкое убеждение, что объективные методы оценки качества ЗС уже более не способны адекватно отражать изменения сигнала. Решающую роль в этом вопросе безусловно сыграло стремительное развитие алгоритмов устранения психофизической избыточности цифрового ЗС (алгоритмы «сжатия» сигнала) – MUSICAM, MPEG и др. В эпоху цифрового хранения, обработки и передачи информации подобные системы сжатия наряду с компьютерами и мобильными средствами связи стали одним из самых развивающихся и «доходных» направлений. Неудивительно, что мгновенно магазины заполнились новым носителем «вашей любимой музыки»: диски с пометкой MPEG-3. Факт остается фактом, но современные ГОСТы и DINы оказались беспомощными перед психоакустическим кодированием.
В связи с этим возрастает интерес к тому, как и что мы слышим. Здесь главной работой стали работа немецких ученых Цвиккера и Фельдкеллера2,
которая и по сей день является основой «творчества» в этой области.
Большинство психоакустических методов для оценки качества передачи звукового сигнала основаны на сравнении (неискаженный) сигнал источника
иискаженный выходной сигнал системы передачи. Как правило,
инструментальные подходы включают несколько этапов.
Первый этап обычно исключает различия в сигналах, которые не существенны в моделируемом тесте для аудитории (например, общая задержка и разница в уровнях).
На втором этапе оба сигнала преобразуются к внутреннему представлению с использованием психоакустических моделей для восприятия звуков человеком. Вычисляется разброс (включая многомерные аспекты) между обоими сигналами до обработки, который затем используется для оценки значения качества. При этом способе современные инструментальные подходы, основанные на психоакустических и
2 Цвиккер Э., Фельдкеллер Р. Ухо как приемник информации. - М.: Связь, 1971. - 256 с
познавательных сведениях, являются моделями тестов для аудитории. На выходе модели восприятия звука мы получаем так называемое «внутреннее представление» ("internal representation") звукового сигнала. Чтобы получить адекватную картину звукового восприятия, мы должны после сравнения двух сигналов и получения параметров разностного сигнала оценить («взвесить»)
результат с позиции мозга человека. Эту задачу решает последний блок на рис 1.1, сложность которого может варьироваться от несложной взвешивающей функции до когнитивного моделирования.
Первые редкие статьи по поводу использования психоакустических моделей для оценки качества передачи звучания речи и музыки по каналам и трактам приходятся на середину 80-х годов XX века. Но настоящий расцвет интереса к этой задаче пришелся на начало 1990-х годов.
|
|
|
|
|
|
Модель |
|
|
|
|
|
Предсказ |
|
Входной |
Тестируемая |
|
|
|
|
|
|
|
|||
|
|
|
восприятия |
|
|
|
|
|
||||
|
|
система |
|
|
|
|
|
|
|
анная |
||
|
|
|
|
звука |
|
|
|
|
|
|||
|
|
|
|
|
|
|
|
Отличие/схожесть |
|
Взвешивающая |
величин |
|
|
|
|
|
|
|
|
|
|||||
|
|
|
|
|
|
|
|
|
|
а |
||
|
Выходной сигнал |
|
|
|
|
характеристик |
|
функция |
||||
|
|
|
|
|
|
|
|
сигнала |
|
(когнитивное |
|
|
|
|
|
|
|
|
Модель |
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|||
|
|
|
|
|
|
восприятия |
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
звука |
|
|
|
|
||
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
Рис. 1.1. Обобщенная схема оценки качества на основе моделирования слухового восприятия
Ряд авторов предложил алгоритм PERCEVAL3, который на основе входных исходного (неискаженного) сигнала и шума предсказывает вероятность заметности шума в сигнале. Если мы имеем исходный сигнал и искаженный4, то перед использованием алгоритма необходимо выделить разностный сигнал, который и будет «шумом». Впоследствии на вход алгоритма (PAQM5) предлагается подавать исходный и искаженный сигналы.
Кроме того, в отличие от PERCEVAL, здесь используется психоакустическое
3Perceptual evaluation – психоакустическая оценка
4Вопросы технической реализации – доставки исходного сигнала в точку приема – в статье не рассматриваются.
5Perceptual audio quality measure – психоакустическое измерение качества звучания
представление в каждом канале, что по мнению авторов, лучше коррелированно со слуховым восприятием. Алгоритм PAQM представлен на рис.1.2.
На входы подаются исходный и искаженный сигналы (x(t) и y(t)). На них накладывается временная оконная функция («окно Хана») и через БПФ каждый сигнал переводится в частотную область. Возводим в квадрат, затем переводим функцию от объективных параметров (времени (t) и частоты (f)) в
функцию от параметров восприятия (времени (r) и высоты тона (z)) на основе работы Цвиккера и Фельдкеллера. После всех преобразований мы получаем
«внутреннее представление» обоих сигналов, разница которых дает возможность оценить внесенные искажения в сигнал.
В течение следующих восьми лет в журнале AES было опубликовано множество статей и тезисов выступлений по поводу оценок качества звучания на основе психоакустической модели слуха.
Вопросами международной стандартизации методов психоакустической оценки качества занимаются две группы экспертов в рамках Международной комиссии по электросвязи ITU (International Telecommunications Union).
В рамках телекоммуникационного сектора ITU (ITU-T) в 1996 году Учебная группа 12 (Study Group 12) закончила рекомендации ITU-T P.861,
охватывающие вопросы объективного анализа речевых кодеков. После широкомасштабного сравнения всех предложенных методов в рекомендациях был утвержден алгоритм PSQM (perceptual speech quality measure) научной группы KPN Research. Результаты оценки по методу PSQM
показали высокую корреляцию в 98% с данными, полученными при проведении ССИ. В последующие годы PSQM был успешно внедрен на рынок телекоммуникаций компанией OPTICOM.
Далее работа продолжалась над возможностью использования разработанных алгоритмов оценки качества не только для речевых кодеков,
но и для целых трактов передачи речи со всеми соответствующими искажениями, задержками и потерями. Исходный алгоритм, предлагаемый
ITU-T P.861 не мог быть использован, поскольку в него изначально не был заложен учет временных задержек. Были разработаны дополнения к стандарту: PSQM+, PSQM99 (научная группа KPN Research) и PSQM/IP
(научная группа компании OPTICOM). Все разработки в итоге вылились в новый стандарт. В феврале 2001 алгоритм PESQ (Perceptual Evaluation of Speech Quality) был одобрен в качестве новых рекомендаций ITU-T Rec. P.862.
Тем временем, вторая группа ITU-R (так называемая, группа 10/4)
работала над поиском алгоритмов, позволяющих оценивать качество уже широкополосных аудио кодеков, т.е. оценивать качество передачи не речи, а
музыки. При рассмотрении вариантов рассматривались алгоритмы NMR6,
PAQM, PERCEVAL, POM7 и другие. В 1998 г. родилась новая модель,
вобравшая в себя лучшие элементы предыдущих и представленная в двух вариантах: «базовая версия» с низким уровнем сложности и «усложненная версия» для более точных оценок. После необходимых проверок и тестов новая модель, получившая название Perceptual Evaluation of Audio Quality (PEAQ), получила статус рекомендации ITU-R BS.1387 в 2001 [1]. В
разработке алгоритма PEAQ принимали участие следующие научные группы
иорганизации:
OPTICOM GmbH, Erlangen, Germany - [http://www.opticom.de];
the Fraunhofer Institute for Integrated Circuits, IIS-A, Erlangen, Germany [http://www.iis.fhg.de];
German Telecom BERKOM, Berlin, Germany;
the University of Berlin, Berlin, Germany;
the Institute for Broadcast Technology, IRT, Munich, Germany [http://www.irt.de];
KPN Research, The Hague, the Netherlands - [http://www.kpn.com];
CCETT, France;
6Noise-to-mask relation – отношение шума к маске
7Perceptual objective measurement – объективная психоакустическая оценка
CRC, Canada - [http://www.crc.ca];
Алгоритм получил свое место в Интернете — www.peaq.org.
Повышенный интерес к проблеме психоакустической оценки звучания подтверждается огромным количеством статей и книг, вышедших за последние десять лет.
Рис.1.2. Алгоритм PAQM
2. МЕТОДИКА АНАЛИЗА ИЗМЕНЕНИЙ ЗВУКОВЫХ СИГНАЛОВ НА ОСНОВЕ СТАТИСТИЧЕСКИХ РАСПРЕДЕЛЕНИЙ ИХ
ПАРАМЕТРОВ
Выбор информативных параметров сигнала
Так как на данный момент не существует других способов адекватной оценки качества передачи ВС кроме субъективного, при выборе объективных параметров сигнала используются результаты оценок качества его передачи квалифицированными слушателями – звукорежиссерами. При проведении ССИ используется ряд определений, характеризующих параметры субъективного восприятия сигнала и его объективных изменений. Основные определения характера звучания и вероятные объективные причины, их обуславливающие, приведены в работе [2]. В данном разделе мы ставим
задачей выделить ряд наиболее информативных параметров вещательного сигнала.
На основе предыдущего опыта выделения информативных статистических параметров сигнала, а также в результате длительных исследований, проводимых на кафедре РВиЭА МТУСИ, удалось выделить три группы наиболее информативных параметров, позволяющих формализовать объективную оценку звукового вещательного сигнала,
совместив ее результаты с результатами субъективно-статистических измерений. Эти группы:
группа энергетических параметров;
группа параметров формы;
группа спектральных параметров.
Использование статистических распределений этих параметров позволяет осуществить формирование интегральной объективной оценки качества передачи по субъективным критериям. Рассмотрим эти группы подробнее.
Энергетические параметры
Известно, что по любому каналу восприятия человека приращение возбуждения, фиксируемое как изменение ощущения, составляет около 1 дБ.
С учетом различной разрешающей способности анализаторов по спектру и уровню возбуждений изменение параметра в среднем должно составлять
2…3 дБ при пороговой заметности 1 дБ. Можно предположить, что заметность изменения по параметру составляет приблизительно 1 дБ (или
10%), а по мощности - около 3%. Известно также, что искажения сигнала фиксируются слухом тогда, когда начинают быть заметны на экране осциллографа, т.е. при величине порядка 2…3%. Одновременно меняются энергетические характеристики сигнала, хорошо отображаемые его относительной средней мощностью (ОСМ).
Вот определения ОСМ, приведенные в ГОСТ 22260-76:
Уровень долговременной средней мощности – величина, равная отношению значения мощности сигнала, усредненной за все время передачи
данной программы в течение суток, к значению мощности синусоидального сигнала нормированного максимального уровня, выраженному в децибелах.
Уровень среднеминутной мощности – величина, равная отношению значения мощности сигнала, усредненной за 1 мин, к значению мощности синусоидального сигнала нормированного максимального уровня,
выраженному в децибелах.
Нормированный максимальный уровень сигнала – уровень сигнала в данной точке тракта, обеспечивающий коэффициент модуляции передатчиков, равный 100%, при заданной диаграмме уровней в канале.
Не оспаривая определение из ГОСТ, при вычислении ОСМ проще пользоваться другим определением, которое было предложено в предшествовавших ГОСТу работах:
Относительной средней мощностью называется отношение измеренной мощности сигнала Р за заданный отрезок времени к мощности синусоидального сигнала Р0 с напряжением, равным наибольшему значению напряжения вещательного сигнала.
P |
P |
. |
(2.1) |
îòí P0
Однако мы помним, что в нашем случае речь о сравнении двух сигналов,
в общем случае не равных (со входа и выхода канала передачи). Если мы решили отказаться от строгого определения ГОСТ, мы обязаны позаботиться
онормировании двух сравниваемых сигналов.
Взависимости от выбора интервала, на котором находится Р0, можно говорить о двух видах ОСМ. Эти названия весьма условны, но они позволяют различать виды ОСМ, что, как будет показано ниже, важно. При традиционном определении ОСМ [2] - назовем ее "канальной" ОСМ (ОСМк) - Р0 это мощность синусоидального колебания с амплитудой, равной максимальному уровню квантования на длительности всего звукового фрагмента. Параметр сигнала, определяемый таким образом (ОСМк),
характеризует загрузку канала и позволяет также оценивать громкостной
динамический диапазон сигнала и прирост средней глубины модуляции.
Если же за Р0 принимается мощность синусоидального колебания с амплитудой, равной максимальному значению сигнала на интервале времени интеграции, то в этом случае речь идет об энергетике собственно сигнала.
Определяемую таким образом ОСМ логично именовать "сигнальной"
(ОСМс). Очевидно, что при выборе интервала Tокна равному всей длине фрагмента различие между ОСМс и ОСМк исчезает.
Различие между ОСМс и ОСМк можно проиллюстрировать следующим рисунком (рис. 2.1).
Рис. 2.1 Иллюстрация различий нахождения ОСМс и ОСМк Здесь, А1 – локальный максимум, т.е. максимальное значение уровня
квантования сигнала на данном интервале интеграции, А2 – глобальный максимум, т.е. максимальное значение уровня квантования на длительности всего звукового фрагмента. Для данного рисунка средняя мощность на интервале интеграции, нормируемая к мощности синусоидального сигнала с амплитудой А1, будет сигнальной, тогда как мощность, нормируемая к мощности синусоидального сигнала с амплитудой А2, — канальной, по определению. В наших исследованиях время интеграции выбирается равным
200 мс, что согласуется, с одной стороны, с временем интеграции слухового анализатора [2], а с другой— с таким параметром как RMS8, где рекомендуется время интеграции 200 мс.
Рассмотрим подробнее особенности ОСМ, введенных таким образом.
Среднее значение как того, так и другого вида ОСМ определяется, в
первую очередь, временной структурой сигнала. Чем меньше пауз в сигнале,
тем выше ОСМ. ОСМ постоянного напряжения максимальна, ОСМ
8 RMS – «root mean square» (англ.) — американский аналог ОСМ, выражаемый в децибелах.
синусоидального сигнала равна единице. ОСМ реальных вещательных сигналов лежит в диапазоне от 0 до 0,4.
Особенность ОСМс в том, что изменения малоуровневых сигналов фиксируются также хорошо, как и изменения высокоуровневых компонент.
Для тестовых сигналов без пауз ОСМс и ОСМк близки (как по среднему, так и по форме распределений), при увеличении процента времени «слабых» фрагментов сигнала в общей временной структуре ЗС, распределения расходятся. С этой точки зрения, различие ОСМс и ОСМк можно использовать для оценки динамики огибающей ЗС, где Tокна — параметр огибающей. При постоянной (при данном времени интеграции) огибающей ОСМс и ОСМк полностью совпадают, во всех остальных случаях локальный максимум меньше глобального, следовательно, среднее ОСМс всегда больше среднего ОСМк.
С учетом введенного понятия «распределения относительной частоты появления значений» мы можем проиллюстрировать различия ОСМ следующими графиками (рис.2.2).
На рис.2.2 представлены два распределения, соответствующие одному и тому же звуковому фрагменту (длительность фрагмента 4 мин 10 с).
Распределение ОСМс Распределение ОСМк
Рис. 2.2 Различие распределений ОСМс и ОСМк
Два основных отличия распределений частот появления ОСМс и ОСМк:
