Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Элементы теории информации в защите информации. Учебное пособие для академического бакалавриата
.pdf
3.4. Задачи и упражнения
сумма чисел, взятых из случайно выбранной кости игры
«домино»: а) m=7; б) m=4?
3.8. Совершенен ли шифр по модулю m, если его ключевая последовательность образуется как сумма последовательностей совершенного шифра и не совершенного
шифра?
3.9. Для уравнения шифрования y
=(ai⊕4zi) mod26,
i
i=1,…,n, докажите, что шифрование не совершенное.
Решение. Гамма неравновероятная, так как множе-
ство значений функции 4z
Z
, состоит лишь из четных чисел.
m
3.10. Для уравнения шифрования y
, определенной на множестве
i
=(ai⊕czi) modm,
i
i=1,…,n, докажите, что шифрование совершенное
⇔ НОД(c,m)=1.
3.11. Пусть s и g — преобразования множества Z
Для уравнения y
=(s(ai)⊕g(zi)) modm, i=1,…,n, докажите:
i
.
m
1) это уравнение шифрования ⇔ s — подстановка
(биективная функция);
2) шифрование совершенное ⇔ s и g — обе подстановки.
— 51 —

ГЛАВА 4.
Количество информации
и энтропия
Задача количественного измерения информации
связана с изначальным стремлением уменьшить количество электрических сигналов, необходимых для передачи информации в телекоммуникационных системах.
Следовательно, мера информации отражает затраты на ее
передачу и является функцией, монотонно зависящей
от указанных затрат.
4.1. Измерение информации,
генерируемой дискретным источником
Положим, что сообщения ДИОС представляют собой случайные события (с точки зрения получателя
это естественно). Точнее, сообщения ДИОС являются
элементами сигма-алгебры событий, на которой задана
определенная вероятностная мера (аддитивная функция вероятностей, принимающая значения в числовом
сегменте [0,1]). Итак, ДИОС генерирует множество X сообщений, где сообщение x∈X имеет вероятность p(x),
то есть ансамбль сообщений следует рассматривать как
множество пар: X={(x,p(x))}.
Меру информации в сообщениях множества (ансамбля) X обозначим m. Определим ряд естественных (интуитивных) требований к мере m.
1) Так как мера m определяет некие затраты, то поло-
жим m(x)≥0 при любом сообщении x.
— 52 —

4.1. Измерение информации, генерируемой дискретным источником
2) Математическая теория информации не анализирует смысловое содержание информации и способы
использования ее получателем, поэтому для сообщения
x значение функции m зависит только от вероятности p(x);
значит вместо m(x) точнее записать m(p(x)).
k
3) Если источник X генерирует 2
равновероятных
сообщений, то каждое сообщению можно однозначно поставить в соответствие k-мерный двоичный вектор и интерпретировать передачу сообщения как передачу двоичного k-мерного вектора. Значит, передача сообщения,
–k
имеющего вероятность 2
, равносильна передаче k битов.
Следовательно, для меры m естественным является соотношение
k
)=km(p).
m(p
4) Если источник X генерирует независимые сообщения, то получение любого количества сообщений не позволяет получателю предсказать следующие сообщения
с вероятностями, отличными от вероятностей известного
распределения p(x). Поэтому затраты на передачу последовательности {x
, …, xk} независимых сообщений источ-
1
ника X складываются в виде суммы затрат на передачу
отдельных сообщений, то есть в случае независимых сообщений для функции m(p(x)) выполнено свойство аддитивности:
,…,xk)) = m(p(x1))+…+m(p(xk)).
m(p(x
1
Указанные требования однозначно (с точностью
до постоянного множителя) определяют вид функции
m(p(x)), получившей название собственной информации
сообщения x. А именно, собственной информацией сообщения x из ансамбля X={(x,p(x))}, обозначаемой далее
I(x), называется величина:
I(x) = –log p(x). (4.1)
— 53 —

Глава 4. Количество информации и энтропия
Здесь не указано основание логарифма. Далее
по умолчанию считаем, что основание равно 2, что соответствует измерению информации в битах. Если использовать натуральный логарифм, то приходим к измерению
информации в натах. При десятичном логарифме информация измеряется в единицах, называемых хартли
(в честь ученого Хартли, выведшего формулу (4.1) еще
до опубликования ее Шенноном).
Удобство измерения I(x) в битах состоит в том, что
в этом случае показано количество битов, требуемое для
передачи сообщения.
Из формулы (4.1) следует, что «информативность»со-
общения отражает его «степень неожиданности».
Из данных определений следуют свойства собственной информации.
1. Неотрицательность: I(x)≥0 для любого сообщения
x.
2. Монотонность: если p(x
и x
источника, то I(x1)≥I(x2).
2
3. Аддитивность: для последовательности {x
,x
} независимых сообщений источника, то есть при
k
p(x
,…,xk)=p(x1)×…×p(xk), выполнено:
1
I(x
,…,xk)=I(x1)+…+I(xk).
1
)≤p(x2) для сообщений x1
1
1
,…
Пример 4.1. Пусть X={(a;1/2), (b;1/4), (c;1/8),
(d;1/8)}. Тогда I(a)=1, I(b)=2, I(c)=I(d)=3. Здесь сообщения несут разное количество информации. Для передачи
сообщения a потребуется 1 бит, для передачи сообщения
b потребуются 2 бита, для передачи сообщений c и d потребуется по 3 бита.
Пример 4.2. Пусть X={(a;0,07), (b;0,93)}. Тогда
I(a)≈3,8365; I(b)≈0,1047.
Формально следует считать, что на передачу символа
a требуется почти 4 бита, на передачу символа b требуется
0,1047 бит. В том, что на передачу сообщений требуется
— 54 —

4.2. Энтропия и избыточность дискретного источника
xX
не целое число битов, противоречия нет, так как здесь
мы имеем дело с теоретико-информационными битами
(допускающими не целое количество), а не с инженерными битами, которые соответствуют определенным физическим сигналам.
Дальнейшее знакомство с кодами покажет, что тратить целый бит на передачу одной буквы в ряде случаев
не экономно.
4.2. Энтропия и избыточность
дискретного источника
Так как на множестве сообщений источника задана
определенная вероятностная мера, то собственная информация случайного сообщения x является случайной
величиной (см. Приложение 2). Математическое ожидание MI(x) величины I(x) в ансамбле является характеристикой информативности ансамбля в целом. Эта величина
получила название энтропии ансамбля сообщений. Заметим, что понятие энтропии аналогично определено для
любой вероятностной схемы.
Итак, энтропией ДИОС X={(x,p(x))} называется величина
px px
log
H(X) = M(–log p(x)) = –
Энтропию можно рассматривать как меру неопределенности сообщения, порождаемого источником. Чем
больше энтропия вероятностной схемы, тем больше ее неопределенность.
Энтропия обладает следующими свойствами.
1. Неотрицательность: H(X) ≥ 0.
2. Ограниченность: H(X) ≤ logX, где H(X) = logX
⇔ все элементы ансамбля равновероятны.
. (4.2)
— 55 —

Глава 4. Количество информации и энтропия
A
( )
xX
px X
∑
3. Эквивалентность: если ансамбли X и Y совпадают с точностью до порядка следования сообщений, то
H(X) = H(Y).
4. Если ансамбли X и Y независимы, то есть если
p(x,y)=p(x)p(y) для любых (x,y)∈X×Y, то
H(X×Y) = H(XY) = H(X) + H(Y).
5. Для ансамбля X={(x,p(x))} определим ансамбль
X
={(x,p'(x))}, где А⊆X и p'(x) =
А
px
xA
A
p x
xA
,
x
,
Тогда H(X') ≥ H(X). Иными словами, «выравнива-
ние» вероятностей внутри любого непустого подмножества элементов ансамбля не уменьшает энтропию исходного ансамбля.
6. Энтропия есть ∩-выпуклая (выпуклая вверх)
функция распределения вероятностей на элементах ансамбля X (см. Приложение 1).
7. Пусть ансамбль Y={(y,p(x))} получен из ансамбля
X={(x,p(x))} с помощью функции g(x):X→Y, то есть y=g(x),
где функции g(x) задана на множестве сообщений X
и принимает значения во множестве сообщений Y, тогда
H(Y) ≤ H(X), и H(Y) = H(X) ⇔ функция g(x) обратима.
Суть данного утверждения в том, что «обработ-
ка» информации не увеличивает энтропию исходного
ансамбля.
Свойства 1, 3 и 4 доказываются с использованием
свойств функции «логарифм». Докажем свойство 2.
Доказательство. Покажем, что разность левой
и правой частей не положительна. В силу свойства распределения вероятностей верно равенство
logX =
∈
log
,
отсюда получаем:
— 56 —

4.2. Энтропия и избыточность дискретного источника
( ) ( )
( )
log log
xX
px px X
∈
+
∑
pxX
1
1
pxX
( )
xX
∑
1
pxX
1
( )
∑
H(X) – logX = –
В силу свойства натурального логарифма lna≤a–1
(следует из графиков функций lnx и x–1, данных
на рис. 4.1) отсюда получаем при a=
=
logX
∑
xX
∈
px
( )
:
=
log
1
( )
X
.
( )
(
px
H(X) — logX ≤ loge[
Свойство 2 доказано.
∈
= loge[
∑
xXX∈
( )
– 1)] =
—
xX
∈
px
]
= 0.
ство только в точке x=1. Поэтому необходимым и достаточным условием равенства в свойстве 2 является равновероятность всех сообщений ансамбля, то есть p(x)=1/X.
вероятности букв оценим средними частотами их появления в текстах. Вычисления показывают, что энтропия
Рисунок 4.1. Графическое изображение неравенства lnx≤x-1
Замечание. Неравенство lnx≤x-1 обращается в равен-
Рассмотрим в качестве ансамбля буквы алфавита,
— 57 —

Глава 4. Количество информации и энтропия
( )
log
HX
X
русского алфавита принимает значение, близкое к 4,5.
Значит, для кодирования одной буквы требуется в среднем меньше байта и не меньше 4 битов.
Свойство 5 проясняет причину различия энтропии
различных ансамблей, она связана с разбросом вероятностей сообщений ансамбля.
Разброс вероятностей сообщений ансамбля также характеризуется величиной избыточности ансамбля X, обозначаемой c(X):
c(X) = 1 –
Из этой формулы видно, что c(X)≥0 и величина c(X)
тем меньше, чем ближе к равномерному распределение
вероятностей сообщений ансамбля.
Пример 4.3. Найдем энтропию и избыточность источников для двоичных ансамблей X и Y с алфавитами {0,1,2}
при распределении вероятностей {0,2; 0,2; 0,6} и {0,2; 0,4;
0,4} соответственно.
H(X) = –0,2×log0,2 – 0,2×log0,2 – 0,6×log0,6 ≈1,371;
c(X) ≈0,135;
H(Y) = –0,2×log0,2 – 0,4×log0,4 – 0,4×log0,4 ≈1,522;
c(Y) ≈0,04.
. (4.3)
4.3. Энтропия двоичного ансамбля
Двоичные ансамбли играют важную роль как в практике, так и в теории.
Пусть двоичный ансамбль X={(0;1–p), (1;p)}, где p —
вероятность сообщения «1», 0≤p≤1. Энтропия двоичного
ансамбля X зависит только от вероятности p, она обозначается h(p) и равна:
h(p) = H(X) = –plogp – qlogq.
— 58 —

4.3. Энтропия двоичного ансамбля
График функции h(p) на сегменте p∈[0,1] дан на ри-
сунке 4.2.
В точках p=0 и p=1 с помощью правила Лопиталя вы-
числяем: h(0)=h(1)=0.
Заметим, что функция h(p) симметрична относитель-
но оси p=0, так как h(p)=h(1–p). Точка p=
1
/2 есть точка
максимума, и h(1/2)=1.
Отсюда следует, что h(p)<h(p') ⇔ 1/2–p>1/2–p'.
Иначе говоря, энтропия двоичного ансамбля тем больше,
чем ближе к 1/2 вероятность p.
Пример 4.4. Найдем энтропию двоичного ансамбля X
с распределением вероятностей {0,37; 0,63}.
H(X) = –0,37×log0,37 – 0,63×log0,63 ≈0,9508.
Рисунок 4.2. Энтропия двоичного ансамбля
— 59 —

Глава 4. Количество информации и энтропия
( ) ( )
xX
∈
∑
( ) ( ) ( )
∑∑
( ) ( )
∑∑
4.4. Условная энтропия ансамбля
Для эффективного кодирования информации необходимо учитывать статистическую зависимость сообщений
с помощью подсчета информационных характеристик
последовательностей зависимых сообщений.
Рассмотрим пару сообщений из различных ансамблей и декартово произведение этих ансамблей. Пусть
X={(x,p(x))}, Y={(y,p(y))} и XY={((x,y),p(x,y))}.
При любом y∈Y определено условное распределение вероятностей p(x/y) на множестве X. Используя это условное
распределение вероятностей, посчитаем для каждого x∈X
собственную информацию
I(x/y) = –log p(x/y),
называемую условной собственной информацией сообщения x при фиксированном сообщении y. Усредним эту величину по x и получим величину
H(X/y) = M(–logp(x/y)) = –
называемую условной энтропией ансамбля X при фиксированном сообщении y∈Y. Во избежание неопределенности в формуле (4.4) считаются равными 0 все слагаемые,
для которых p(x/y)=0.
Введенная условная энтропия является случайной
величиной, так как она зависит от случайного сообщения
y. Неслучайной информационной характеристикой пары
ансамблей (X,Y) является усредненная условная энтропия ансамбля X. Величина
H(X/Y)=(MH(X/y))= –
, log /
= –
называется условной энтропией ансамбля X при фиксированном ансамбле Y.
xX yY
∈∈
xX yY
∈∈
pxy px y
— 60 —
/ log /
px y px y
pypx y px y
/ log /
, (4.4)
=
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
