Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:
Информационная энтропия и неравномерное кодирование. Учебное пособие.pdf
Скачиваний:
0
Добавлен:
12.08.2026
Размер:
872 Кб
Скачать

Глава 1. ИНФОРМАЦИОННАЯ ЭНТРОПИЯ

§ 1.1. ЭНТРОПИЯИСТОЧНИКА ИНФОРМАЦИИ

Рассмотрим источник дискретных сообщений, генерирующий символы из некоторого заранее фиксированного конечного множества X. Символы источника будем обозначать маленькими латинскими буквами x, y, z и т. д. Множество X далее будем называть алфавитом источника.

Для описания информационных характеристик источников сообщений удобно использовать следующую модель. Будем считать, что появление очередного символа источника является случайным событием. В этом случае с каждым символом x X естественно связать вероятность его появления p(x). В рамках настоящего раздела будем считать, что вероятности всех символов источника заранее известны. Также предполагается выполненным условие нормировки

p(x) =1.

x X

Зададимся следующим вопросом: какое количество информации I(x) содержится в отдельном символе x источника? Перед тем как дать ответ на этот вопрос, сформулируем основные требования к функции I(x), которую следует принять в качестве меры информации, содержащейся в символах источника.

Во-первых, мы предполагаем, что I(x) будет определять затраты на хранение и передачу символа x. Следовательно, функция I(x) должна быть неотрицательной для любых x

I(x) 0.

Во-вторых, так как мы не интересуемся конкретным содержанием сообщений источника, I(x) должна зависеть только от частотных свойств символа x, то есть от его вероятности

I(x) = I( p(x)).

5

x, y X

В-третьих, затраты, связанные с передачей последовательности символов, должны складываться из затрат, необходимых для передачи каждого отдельного символа. Поясним это требование подробнее. Рассмотрим последовательность случайных символов x1, x2, …, xn, имеющих одно и то же распределение вероятностей {p(x)} и генерируемых независимо из алфавита X. Вследствие отсутствия статистического влияния символов друг на друга, разумно предположить, что

I(x1, x2 , , xn ) = I(x1) + I(x2 ) + + I(xn ) ,

где через I (х1, х2, … хn) обозначено количество информации, заключенное во всей цепочке x1, x2, …, xn.

Можно показать, что перечисленные требования к количеству информации приводят к следующему определению [1].

ОПРЕДЕЛЕНИЕ 1.1.1. Собственной информацией I(x), содержащейся в символе x X , называется величина, вычисляемая по следующей формуле:

I(x) = −log2 p(x).

(1.1.1)

ЗАМЕЧАНИЕ 1.1.1. На самом деле, перечисленные выше требования не позволяют однозначно зафиксировать основание логарифма в формуле (1.1.1). Выбор основания – это, по сути, выбор единицы измерения количества информации. Здесь выбираем основание, равное 2, для того, чтобы количество информации измерялось в битах.

Из определения (1.1.1) вытекают следующие свойства собственной информации.

СВОЙСТВО 1.1.1. Собственная информация является неотрицательной величиной: I(x) 0, x X .

СВОЙСТВО 1.1.2. Собственная информация является монотонной функцией вероятности: если такие, что p(x) p( y), то I(x) I( y).

6

СВОЙСТВО 1.1.3. Если символы x, y X генерируются источником независимо друг от друга, то количество заключенной в них собственной информации I(x, y) является суммой собственных информаций символов x и y: I(x, y) = I(x) + I( y).

Пример 1.1.1. Рассмотрим двоичный источник, т. е. источник информации с алфавитом X ={0,1}. Допустим, что вероятность появления на выходе источника нуля равна p(0) = 0.99, в то время как вероятность появления единицы – p(1) = 0.01. Тогда, в соответствии с формулой (1.1.1), получаем

I(0) = −log2 0.99 0.015 бит, I(1) = −log2 0.01 6.644 бит. ▲

Так как в рамках рассматриваемой модели появление символа x на выходе источника – случайное событие, величина I(x), определяемая формулой (1.1.1), является случайной величиной. Эта величина характеризует «информативность» символа x или его «меру неожиданности», то есть чем реже появляется символ, тем большее количество информации для нас он несет. Естественно ожидать, что математическое ожидание случайной величины I(x) будет являться характеристикой «информативности» всего источника в целом.

Введем следующее важное определение.

ОПРЕДЕЛЕНИЕ 1.1.2. Информационной энтропией (или просто

энтропией) источника символов с распределением

вероятностей

{p(x), x X} называется величина

 

H( X ) = M[I(x)] = − ∑ p(x)log2 p(x).

(1.1.2)

x X

 

«Физический смысл» понятия информационной энтропии – это априорная мера нашего незнания о том, какой именно символ будет сгенерирован данным источником.

Приведем некоторые полезные свойства энтропии. Они подробнее пояснят ее смысл, а также облегчат решение задачи ее вычисления.

7

СВОЙСТВО 1.1.4. Энтропия является неотрицательной величиной:

H( X ) 0.

СВОЙСТВО 1.1.5. Энтропия ограничена сверху:

H( X ) log2 | X |,

причем равенство имеет место в том и только в том случае, если все символы источника равновероятны.

Чтобы сформулировать следующее свойство, введем одну дополнительную конструкцию.

Пусть имеется два источника информации с алфавитами X и Y и распределениями вероятностей pX (x) и pY ( y) соответственно. Используя эти два источника, мы можем «сконструировать» третий источник, считая, что его алфавит представляет собой декартово произведение XY алфавитов X и Y. Другими словами, «символами» нового источника являются всевозможные упорядоченные пары (x, y), где x X и y Y . Распределение вероятностей pXY (x, y) этого нового источника, вообще говоря, не выражается простым образом через распределения pX (x) и pY ( y). Однако в одном частном случае это может быть сделано, а именно: если появление символов на одном источнике никак не влияет на вероятность появления символов другого источника. Тогда мы можем записать

pXY (x, y) = pX (x) pY ( y).

(1.1.3)

Говорят, что в этом случае источники являются независимыми. Обозначим через H(XY) энтропию источника с алфавитом XY и распре-

делением вероятностей pXY (x, y). Данная энтропия называется взаимной энтропией источников.

8

По определению

H( XY ) = − ∑ ∑ pXY (x, y) log2 pXY (x, y).

(1.1.4)

x X y Y

 

Подставляя в (1.1.4) выражение (1.1.3), нетрудно видеть, что для независимых источников выполняется следующее утверждение.

СВОЙСТВО 1.1.6. Если источники с алфавитами X и Y – независимые, то

H( XY ) = H( X ) + H(Y ).

Пример 1.1.2. Рассмотрим снова двоичный источник с алфавитом X ={0,1}. Обозначим через p вероятность появления нуля, а через 1p – вероятность появления единицы. Тогда энтропия этого источника, рассматриваемая как функция p, будет иметь вид

H( X ) = −p log2 p (1p)log2 (1p) f ( p) .

(1.1.5)

Исследуем функцию f(p). Начнем с ее области определения. Очевидно, что по смыслу вероятности переменнаяp может принимать значения из отрезка [0, 1]. Однакона концах этого отрезка функцияf(p) не определена, так как не определено значение логарифма в нуле (см. формулу(1.1.5)). Тем не менее, функция (1.1.5) имеет конечные пределы в этих точках; с помощью правила Лопиталя можно показать, что

lim f ( p) = lim f ( p) =0 .

p0 p1

Таким образом, мы можем считать, что f(0) = f(1) = 0.

Далее нетрудно убедиться, что функция f(p) является симметричной относительно вертикальной оси p =1/ 2, так как f ( p) = f (1p).

9

Найдем экстремумы функции f(p). Вычисляя производную этой функции, получаем

f ( p) = log2 (1p) log2 p .

Приравнивая полученное выражение к нулю, находим точку экстремума:

pext =1/ 2.

Вычислим теперь вторую производную:

′′

1

f ( p) = − p(1p)ln 2 .

В результате получаем график функцииf(p), приведенный на рис.1.1.1.

Рис. 1.1.1. Энтропия двоичного источника как функция p

В силу того, что 0 p 1, вторая производная всюду отрицательна на интервале (0, 1). Отсюда следует, что точка pext =1/ 2 – это точка максимума функции f(p). Из отрицательности второй производной также следует, что f(p) – строго выпуклая вверх функция. ▲

10

Примеры решения задач

Задача 1.1.1. Имеется дискретный источник информации с алфавитом X ={a,b,c,d}. Найти количество собственной информации, содержащееся в каждом символе, если вероятности их появления равны p(a) =0.4, p(b) =0.2, p(c) = 0.1 и p(d ) =0.3.

Решение. В соответствии с формулой (1.1.1) получаем:

I(a) = −log2 p(a) = −log2 0.4 1.322 бит;

I(b) = −log2 p(b) = −log2 0.2 2.322 бит;

I(c) = −log2 p(c) = −log2 0.1 3.322 бит;

I(d ) = −log2 p(d ) = −log2 0.3 1.737 бит.

Обратите внимание, что наибольшим количеством информации обладает наименее вероятный символ c, в то время как наименьшую информацию несет наиболее частый символ a.

Ответ. Собственная информация символов источника: I(a) =1.322 бит,

I(b) = 2.322 бит, I(c) =3.322 бит, I(d ) =1.737 бит.

Задача

1.1.2.

Для дискретного источника с

алфавитом

X ={a,b,c,d,e, f } и

вероятностями символов p(a) =0.10,

p(b) =0.30,

p(c) =0.10,

p(d ) =0.30, p(e) = 0.05 и p( f ) =0.15 вычислить энтропию ис-

точника H(X).

 

 

Решение. В соответствии с формулой (1.1.2) имеем

 

H( X ) = −[p(a)log2 p(a) + p(b)log2 p(b) + p(c)log2 p(c) + p(d )log2 p(d ) +

+p(e)log2 p(e) + p( f )log2 p( f )]=

=[2 0.10 log2 0.10 +2 0.30 log2 0.30 +0.05 log2 0.05 +0.15 log2 0.15].

11

Вычисляем отдельно логарифмы в квадратных скобках:

log2 0.10 ≈ −3.322;

log2 0.30 ≈ −1.737;

log2 0.05 ≈ −4.322;

log2 0.15 ≈ −2.737 .

Подставляя полученные значения в выражение для энтропии, получаем:

H (X ) ≈ −[2 0.10 3.322 2 0.30 1.737 0.05 4.322 0.15 2.737]2.333 бит.

Ответ. Энтропия источника равна H( X ) 2.333бит.

Задачи для самостоятельного решения

1. Дискретный источник генерирует символы, образующие алфавит X ={a,b,c}. Определить собственную информацию каждого символа, если их вероятности равны:

а) p(a) =0.3, p(b) = 0.1, p(c) =0.6 ;

б) p(a) = p(b) = p(c) = 13 .

2.Известно, что один из N символов дискретного источника содержит собственную информацию 5 бит. Чему равно N, если все сообщения равновероятны?

3.Дискретный источник порождает 4 символа с равными вероятностями. Чему равна энтропия такого источника?

4.Дискретный источник генерирует символы X ={a,b,c,d,e, f , g,h},

вероятности которых даны в следующей таблице:

a

b

c

d

e

f

g

h

0.2500

0.2500

0.1250

0.1250

0.0625

0.0625

0.0625

0.0625

Найти энтропию источника.

12

5. Имеется два источника с алфавитами X ={a,b,c} и Y ={0,1}. Совместное распределение pXY (x, y) вероятностей символов данных источников задается следующей таблицей:

X/Y

0

1

a

0.21

0.09

b

0.28

0.12

c

0.21

0.09

 

 

 

Вычислить взаимную энтропию H( XY ) источников. Являются ли источники с алфавитами X и Y независимыми?

6*. Используя таблицу частотности букв русского языка (прил. А), вычислить энтропию источника информации, порождающего осмысленные тексты на русском языке. Сделать то же самое для источника, порождающего осмысленные английские тексты. Сравнить полученные результаты и сделать вывод.

7*. Источник имеет алфавитX ={a,b,c}. Считая, что вероятность a = p(a) задана, исследовать зависимость энтропии H( X ) от вероятности b = p(b).

Контрольные вопросы

1.Что такое собственная информация дискретного источника информации?

2.Сформулируйте основные свойства собственной информации.

3.Дайте определение энтропии дискретного источника.

4.Каким значением энтропия ограничена сверху? Может ли энтропия быть отрицательной?

5.Как вычислить энтропию H( XY ) источника, составленного из двух

источников с алфавитами X и Y? В каком случае эта энтропия будет равна сумме энтропий H(X) и H(Y)?

6. Какое максимальное значение может принимать энтропия бинарного источника? При каких значениях вероятностей нуля и единицы это будет достигаться?

13

§1.2. УСЛОВНАЯЭНТРОПИЯ

Впредыдущем параграфе мы уже указывали, что энтропия – это средняя мера неосведомленностио том, какой именно символ источника появится на его выходе. Интуитивно ясно, что присутствиевторого источника, который может статистически влиять на первый, уменьшает указанную меру неопределенности. В качестве примера приведем источник, порождающий осмысленный текст, например, на русском языке. Как только мы получили очередную букву, повышается вероятность угадать следующую букву, так как имеется статистическая связь между парами (биграммами) букв в реальных текстах. Для учета статистической связи междуисточниками требуется обобщить понятие энтропии, введенное в предыдущемпараграфе.

Рассмотрим два источника с алфавитами X и Y. Обозначим через

pXY (x, y) совместное распределение вероятностей символов этих источников. Имеют место следующие соотношения:

pX (x) = ∑ pXY (x, y) ,

pY ( y) = ∑ pXY (x, y).

(1.2.1)

y Y

x X

 

Здесь через pX (x) и pY ( y)

обозначены распределения символов ис-

точников X и Y соответственно.

 

 

Для всякого фиксированного символа y Y мы можем рассмотреть условное распределение вероятностей pX (x | y) символов алфавита X. Из курса теории вероятности известно, что данное распределение может быть выражено через совместное распределение pXY (x, y) следующим образом:

pX (x | y) =

pXY (x, y)

.

(1.2.2)

 

 

pY ( y)

 

Здесь предполагается, что pY ( y) 0 .

14

Введем условную информацию символа x X для данного фиксированного y Y в соответствии с формулой

I(x | y) = −log2 pX (x | y) .

Усредняя эту случайную величину по всем символам из алфавита X, получаем условную энтропию источника X при фиксированном символе y Y :

H( X | y) = − ∑ pX (x | y)log2 pX (x | y).

x X

Введенная нами величина H( X | y) – случайная, так как она зависит от случайного символа y. Чтобы получить неслучайную характеристику рассматриваемой пары источников, выполним усреднение H( X | y) по всем символам из алфавита Y:

H( X |Y ) = ∑ pY ( y)H( X | y) = − ∑ ∑ pY ( y) pX (x | y) log2 pX (x | y).

y Y

x X y Y

С помощью формулы (1.2.2) мы можем переписать полученное выражение как

H( X |Y ) = − ∑ ∑ pXY (x, y) log2 pX (x | y).

(1.2.3)

x X y Y

 

ОПРЕДЕЛЕНИЕ 1.2.1. Величина H( X |Y ), определяемая форму-

лой (1.2.3), называется условной энтропией источника X относительно источника Y.

Перечислим некоторые свойства условной энтропии. СВОЙСТВО 1.2.1. Условная энтропия – величина неотрицательная:

H( X |Y ) 0 .

15

СВОЙСТВО 1.2.2. Условная энтропия источника X не превышает его собственную энтропию, т. е.

H( X |Y ) H( X ) ,

причем равенство имеет место тогда и только тогда, когда источники X и Y независимы.

СВОЙСТВО 1.2.3. Имеют место следующие равенства:

H( XY ) = H( X |Y ) + H(Y ) = H(Y | X ) + H( X ).

СВОЙСТВО 1.2.4. Предыдущее свойство может быть обобщено на случай произвольного числа источников (цепочечное правило):

H( X1X2 Xn ) = H( X1) + H( X2 | X1) + + H( Xn | X1 Xn1).

На практике условная энтропия часто используется для описания информационных потерь при передаче данных по каналам связи с помехами. Для этого используются так называемые канальные матрицы.

Пусть некоторый источник информации генерирует символы из алфавита X, которые затем передаются по некоторому каналу связи и достигают приемника. Если в канале связи есть помехи, возможна ситуация, когда посланный символ x X искажается, и приемник получает некоторый другой символ y Y (для простоты считаем, что искаженные символы принадлежат тому же самому алфавиту, то есть Y = X). Для описания потерь со стороны источника используют условную вероятность p( y | x) получения приемником символа y при условии, что был отправлен символ x. Все такие условные вероятности могут быть собраны в таблицу, называемую каналь-

ной матрицей(табл. 1.2.1):

16

 

 

 

 

 

 

Таблица 1.2.1

 

 

Канальная матрица

 

 

 

 

 

 

 

 

 

 

 

p(yj|xi)

y1

y2

yj

 

yn

x1

p(y1|x1)

p(y2|x1)

p(yj|x1)

 

p(yn|x1)

x2

p(y1|x2)

p(y2|x2)

p(yj|x2)

 

p(yn|x2)

 

xi

p(y1|xi)

p(y2|xi)

p(yj|xi)

 

p(yn|xi)

 

xn

p(y1|xn)

p(y2|xn)

p(yj|xn)

 

p(yn|xn)

 

 

 

 

 

 

 

 

Здесь вероятности, расположенные по диагонали данной таблицы, дают вероятности правильного приема символа. Очевидно, что сумма элементов каждой строки равна единице, так как вне зависимости от того, какой символ отправлен, хоть какой-нибудь символ да будет получен. При такой интерпретации величина H(Y | xi ) описывает потери, приходящиеся на передаваемый символ xi , а условная энтропия H(Y | X ) дает среднюю величину потерь при передаче символа источника информации.

Аналогично мы можем анализировать средние потери со стороны приемника. Для этого необходимо рассматривать канальную матрицу, состоящую из условных вероятностей p(xi | y j ), то есть вероятностей от-

правки символа xi, при условии, что получен символ yj. Тогда условная энтропия H( X |Y ) будет обозначать среднюю величину потерь при получении одного символа на приемнике.

Пример решения задачи

Задача. Даны два источника с алфавитами X ={a,b,c} и Y ={0,1}. Совместное распределение pXY (x, y) вероятностей символов данных источников задается следующей таблицей:

pXY (x, y)

 

0

 

1

 

a

0.16

0.04

 

b

0.22

0.08

 

c

0.25

0.25

 

17

Найти собственные энтропии H(X) и H(Y) источников, а также их условные энтропии H( X |Y ) и H(Y | X ).

Решение. Для начала с помощью формул (1.2.1) вычислим вероятности символов источников X и Y:

pX (a) = pXY (a,0) + pXY (a,1) =0.16 +0.04 =0.20; pX (b) = pXY (b,0) + pXY (b,1) =0.22 +0.08 =0.30; pX (c) = pXY (c,0) + pXY (c,1) =0.25 +0.25 =0.50 ;

pY (0) = pXY (a,0) + pXY (b,0) + pXY (c,0) =0.16 +0.22 +0.25 =0.63; pY (1) = pXY (a,1) + pXY (b,1) + pXY (c,1) =0.04 +0.08 +0.25 =0.37 .

Спомощью полученных вероятностей находим энтропии H( X )

иH(Y ):

H( X ) = − ∑ pX (x)log2 pX (x) =

x X

= −(0.2 log2 0.2 +0.3 log2 0.3 +0.5 log2 0.5) 1.486 бит;

H(Y ) = − ∑ pY ( y) log2 pY ( y) = −(0.63 log2 0.63 +0.37 log2 0.37) 0.951бит.

y Y

Далее в соответствии с формулой (1.1.4) вычислим взаимную энтропию источников X и Y:

H( XY ) = − ∑ ∑ pXY (x, y) log2 pXY (x, y) = −(0.16 log2 0.16 +0.04 log2 0.04 +

x X y Y

+ 0.22 log2 0.22 +0.08 log2 0.08 +2 0.25 log2 0.25)2.381 бит.

После этого мы легко можем вычислить условные энтропии H( X |Y ) и H(Y | X ), применив свойство 1.2.3:

H( X |Y ) = H( XY ) H(Y ) 1.430 бит,

H(Y | X ) = H( XY ) H( X ) 0.895 бит.

18

Полезно сравнить между собой энтропии H( X |Y ) и H( X ) , а также энтропии H(Y | X ) и H(Y ):

H( X |Y ) 1.430 < H( X ) 1.486,

H(Y | X ) 0.895 < H(Y ) 0.951.

Полученные неравенства находятся в полном соответствии со свой-

ством 1.2.2.

 

 

Ответ.

Собственные энтропии источников: H( X ) 1.486

бит,

H(Y ) 0.951

бит; условные энтропии источников:H( X |Y ) 1.430

бит,

H(Y | X ) 0.895 бит.

Задачи для самостоятельного решения

1. Даны два источника с алфавитами X ={x1, x2 , x3} и Y ={y1, y2 , y3}. Совместное распределение вероятностей символов данных источников задано следующим образом:

1

/ 6,

i j;

pXY (xi , y j ) =

0,

i = j.

 

Определить H( X ) , H(Y ) , H( X |Y ) и H(Y | X ).

2. Канал связи описан следующей канальной матрицей (со стороны источника):

 

p( y | x)

 

y1

 

y2

 

y3

 

 

x1

 

0.98

 

0.01

 

0.01

 

 

x2

 

0.10

 

0.75

 

0.15

 

 

x3

 

0.20

 

0.30

 

0.50

 

Вероятности появления

символов

на

источнике равны p(x1) =0.7,

p(x2 ) =0.2 и p(x3 ) =0.1.

19

Найти:

а) среднее количество информации, приходящееся на один символ источника;

б) информационные потери при передаче сообщения из 1000 символов алфавита;

в) среднее количество информации, содержащееся в принятом символе. 3. Принимаемый сигнал может иметь амплитудуA1 (событие x1 ) или

A2 (событие x2 ), а также сдвиг фаз ϕ1

(событие y1) или ϕ2 (событие y2 ).

Вероятности

совместных событий

имеют

следующие значения:

p(x1, y1) =0.73,

p(x1, y2 ) =0.21, p(x2 , y1) =0.02 ,

p(x2 , y2 ) =0.04. Вычис-

лить среднее количество информации, получаемой о фазовом сдвиге сигнала, если станет известной его амплитуда.

4. Определить энтропию источника, если вероятности символов на

входе устройства-приемника равны p( y1) =0.1,

p( y2 ) =0.3, p( y3 ) =0.4,

p( y4 ) =0.2, а канальная матрица (со стороны приемника) имеет вид

 

 

 

 

 

 

 

 

 

p(xi | y j )

x1

x2

x3

 

x4

 

 

 

 

 

 

 

 

 

 

y1

0.99

0.01

0.00

 

0.00

 

 

y2

0.02

0.98

0.00

 

0.00

 

 

y3

0.00

0.01

0.98

 

0.01

 

 

y4

0.00

0.00

0.01

 

0.99

 

 

 

 

 

 

 

 

 

5. Определить среднюю величину потерь при передаче одного символа источника информации, если все символы на источникеимеют равные вероятности, а влияние помех в канале описываетсяканальной матрицей вида

p(b | a)

b1

b2

b3

 

 

 

 

a1

0.95

0.03

0.02

a2

0.00

0.95

0.05

a3

0.00

0.06

0.94

20

Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]