Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Элементы теории информации в защите информации. Учебное пособие для академического бакалавриата

.pdf
Скачиваний:
0
Добавлен:
08.09.2026
Размер:
2 Мб
Скачать
☆
3.4. Задачи и упражнения
сумма чисел, взятых из случайно выбранной кости игры «домино»: а) m=7; б) m=4?
3.8. Совершенен ли шифр по модулю m, если его клю­чевая последовательность образуется как сумма после­довательностей совершенного шифра и не совершенного шифра?
3.9. Для уравнения шифрования y
=(ai⊕4zi) mod26,
i
i=1,…,n, докажите, что шифрование не совершенное.
Решение. Гамма неравновероятная, так как множе-
ство значений функции 4z Z
, состоит лишь из четных чисел.
m
3.10. Для уравнения шифрования y
, определенной на множестве
i
=(ai⊕czi) modm,
i
i=1,…,n, докажите, что шифрование совершенное
⇔ НОД(c,m)=1.
3.11. Пусть s и g — преобразования множества Z Для уравнения y
=(s(ai)⊕g(zi)) modm, i=1,…,n, докажите:
i
.
m
1) это уравнение шифрования ⇔ s — подстановка (биективная функция);
2) шифрование совершенное ⇔ s и g — обе подста­новки.
— 51 —
ГЛАВА 4.
Количество информации
и энтропия
Задача количественного измерения информации связана с изначальным стремлением уменьшить коли­чество электрических сигналов, необходимых для пере­дачи информации в телекоммуникационных системах. Следовательно, мера информации отражает затраты на ее передачу и является функцией, монотонно зависящей от указанных затрат.
4.1. Измерение информации,
генерируемой дискретным источником
Положим, что сообщения ДИОС представляют со­бой случайные события (с точки зрения получателя это естественно). Точнее, сообщения ДИОС являются элементами сигма-алгебры событий, на которой задана определенная вероятностная мера (аддитивная функ­ция вероятностей, принимающая значения в числовом сегменте [0,1]). Итак, ДИОС генерирует множество X со­общений, где сообщение x∈X имеет вероятность p(x), то есть ансамбль сообщений следует рассматривать как множество пар: X={(x,p(x))}.
Меру информации в сообщениях множества (ансам­бля) X обозначим m. Определим ряд естественных (интуи­тивных) требований к мере m.
1) Так как мера m определяет некие затраты, то поло-
жим m(x)≥0 при любом сообщении x.
— 52 —
4.1. Измерение информации, генерируемой дискретным источником
2) Математическая теория информации не анали­зирует смысловое содержание информации и способы использования ее получателем, поэтому для сообщения x значение функции m зависит только от вероятности p(x); значит вместо m(x) точнее записать m(p(x)).
k
3) Если источник X генерирует 2
равновероятных сообщений, то каждое сообщению можно однозначно по­ставить в соответствие k-мерный двоичный вектор и ин­терпретировать передачу сообщения как передачу дво­ичного k-мерного вектора. Значит, передача сообщения,
–k
имеющего вероятность 2
, равносильна передаче k битов.
Следовательно, для меры m естественным является соот­ношение
k
)=km(p).
m(p
4) Если источник X генерирует независимые сообще­ния, то получение любого количества сообщений не по­зволяет получателю предсказать следующие сообщения с вероятностями, отличными от вероятностей известного распределения p(x). Поэтому затраты на передачу после­довательности {x
, …, xk} независимых сообщений источ-
1
ника X складываются в виде суммы затрат на передачу отдельных сообщений, то есть в случае независимых со­общений для функции m(p(x)) выполнено свойство адди­тивности:
,…,xk)) = m(p(x1))+…+m(p(xk)).
m(p(x
1
Указанные требования однозначно (с точностью
до постоянного множителя) определяют вид функции m(p(x)), получившей название собственной информации сообщения x. А именно, собственной информацией со­общения x из ансамбля X={(x,p(x))}, обозначаемой далее
I(x), называется величина: I(x) = –log p(x). (4.1)
— 53 —
Глава 4. Количество информации и энтропия
Здесь не указано основание логарифма. Далее по умолчанию считаем, что основание равно 2, что соот­ветствует измерению информации в битах. Если исполь­зовать натуральный логарифм, то приходим к измерению информации в натах. При десятичном логарифме ин­формация измеряется в единицах, называемых хартли (в честь ученого Хартли, выведшего формулу (4.1) еще до опубликования ее Шенноном).
Удобство измерения I(x) в битах состоит в том, что в этом случае показано количество битов, требуемое для передачи сообщения.
Из формулы (4.1) следует, что «информативность»со- общения отражает его «степень неожиданности».
Из данных определений следуют свойства собствен­ной информации.
1. Неотрицательность: I(x)≥0 для любого сообщения
x.
2. Монотонность: если p(x
и x
источника, то I(x1)≥I(x2).
2
3. Аддитивность: для последовательности {x
,x
} независимых сообщений источника, то есть при
k
p(x
,…,xk)=p(x1)×…×p(xk), выполнено:
1
I(x
,…,xk)=I(x1)+…+I(xk).
1
)≤p(x2) для сообщений x1
1
1
,…
Пример 4.1. Пусть X={(a;1/2), (b;1/4), (c;1/8), (d;1/8)}. Тогда I(a)=1, I(b)=2, I(c)=I(d)=3. Здесь сообще­ния несут разное количество информации. Для передачи сообщения a потребуется 1 бит, для передачи сообщения b потребуются 2 бита, для передачи сообщений c и d по­требуется по 3 бита.
Пример 4.2. Пусть X={(a;0,07), (b;0,93)}. Тогда I(a)≈3,8365; I(b)≈0,1047.
Формально следует считать, что на передачу символа a требуется почти 4 бита, на передачу символа b требуется
0,1047 бит. В том, что на передачу сообщений требуется
— 54 —
4.2. Энтропия и избыточность дискретного источника
xX

не целое число битов, противоречия нет, так как здесь мы имеем дело с теоретико-информационными битами (допускающими не целое количество), а не с инженерны­ми битами, которые соответствуют определенным физи­ческим сигналам.
Дальнейшее знакомство с кодами покажет, что тра­тить целый бит на передачу одной буквы в ряде случаев не экономно.
4.2. Энтропия и избыточность дискретного источника
Так как на множестве сообщений источника задана определенная вероятностная мера, то собственная ин­формация случайного сообщения x является случайной величиной (см. Приложение 2). Математическое ожида­ние MI(x) величины I(x) в ансамбле является характери­стикой информативности ансамбля в целом. Эта величина получила название энтропии ансамбля сообщений. Заме­тим, что понятие энтропии аналогично определено для любой вероятностной схемы.
Итак, энтропией ДИОС X={(x,p(x))} называется вели­чина
px px
log
H(X) = M(–log p(x)) = –
Энтропию можно рассматривать как меру неопре­деленности сообщения, порождаемого источником. Чем больше энтропия вероятностной схемы, тем больше ее не­определенность.
Энтропия обладает следующими свойствами.
1. Неотрицательность: H(X) ≥ 0.
2. Ограниченность: H(X) ≤ logX, где H(X) = logX
⇔ все элементы ансамбля равновероятны.

. (4.2)
— 55 —
Глава 4. Количество информации и энтропия

A
( )
xX
px X
∑
3. Эквивалентность: если ансамбли X и Y совпада­ют с точностью до порядка следования сообщений, то H(X) = H(Y).
4. Если ансамбли X и Y независимы, то есть если
p(x,y)=p(x)p(y) для любых (x,y)∈X×Y, то
H(X×Y) = H(XY) = H(X) + H(Y).
5. Для ансамбля X={(x,p(x))} определим ансамбль
X
={(x,p'(x))}, где А⊆X и p'(x) =
А
 
 
px
xA
A
p x

xA
,
x
,
Тогда H(X') ≥ H(X). Иными словами, «выравнива-
ние»вероятностей внутри любого непустого подмноже­ства элементов ансамбля не уменьшает энтропию исход­ного ансамбля.
6. Энтропия есть ∩-выпуклая (выпуклая вверх) функция распределения вероятностей на элементах ан­самбля X (см. Приложение 1).
7. Пусть ансамбль Y={(y,p(x))} получен из ансамбля X={(x,p(x))} с помощью функции g(x):X→Y, то есть y=g(x), где функции g(x) задана на множестве сообщений X и принимает значения во множестве сообщений Y, тогда H(Y) ≤ H(X), и H(Y) = H(X) ⇔ функция g(x) обратима.
Суть данного утверждения в том, что «обработ-
ка»информации не увеличивает энтропию исходного ансамбля.
Свойства 1, 3 и 4 доказываются с использованием
свойств функции «логарифм». Докажем свойство 2.
Доказательство. Покажем, что разность левой и правой частей не положительна. В силу свойства рас­пределения вероятностей верно равенство
logX =
∈
log
,
отсюда получаем:
— 56 —
4.2. Энтропия и избыточность дискретного источника
( ) ( )
( )
log log
xX
px px X
∈
+
∑
pxX
1
1
pxX
( )
xX
∑
1
pxX
1
( )
∑
H(X) – logX = –
В силу свойства натурального логарифма lna≤a–1
(следует из графиков функций lnx и x–1, данных
на рис. 4.1) отсюда получаем при a=
=
logX
∑
xX
∈
px
( )
:
=
log
1
( )
X
.
( )
(
px
H(X) — logX≤ loge[
Свойство 2 доказано.
∈
= loge[
∑
xXX∈
( )
– 1)] =
—
xX
∈
px
]
= 0.
ство только в точке x=1. Поэтому необходимым и доста­точным условием равенства в свойстве 2 является равно­вероятность всех сообщений ансамбля, то есть p(x)=1/X.
вероятности букв оценим средними частотами их появ­ления в текстах. Вычисления показывают, что энтропия
Рисунок 4.1. Графическое изображение неравенства lnx≤x-1
Замечание. Неравенство lnx≤x-1 обращается в равен-
Рассмотрим в качестве ансамбля буквы алфавита,
— 57 —
Глава 4. Количество информации и энтропия
( )
log 
HX
X
русского алфавита принимает значение, близкое к 4,5. Значит, для кодирования одной буквы требуется в сред­нем меньше байта и не меньше 4 битов.
Свойство 5 проясняет причину различия энтропии различных ансамблей, она связана с разбросом вероятно­стей сообщений ансамбля.
Разброс вероятностей сообщений ансамбля также ха­рактеризуется величиной избыточности ансамбля X, обо­значаемой c(X):
c(X) = 1 –
Из этой формулы видно, что c(X)≥0 и величина c(X) тем меньше, чем ближе к равномерному распределение вероятностей сообщений ансамбля.
Пример 4.3. Найдем энтропию и избыточность источ­ников для двоичных ансамблей X и Y с алфавитами {0,1,2} при распределении вероятностей {0,2; 0,2; 0,6} и {0,2; 0,4; 0,4} соответственно.
H(X) = –0,2×log0,2 – 0,2×log0,2 – 0,6×log0,6 ≈1,371;
c(X) ≈0,135;
H(Y) = –0,2×log0,2 – 0,4×log0,4 – 0,4×log0,4 ≈1,522;
c(Y) ≈0,04.
. (4.3)
4.3. Энтропия двоичного ансамбля
Двоичные ансамбли играют важную роль как в прак­тике, так и в теории.
Пусть двоичный ансамбль X={(0;1–p), (1;p)}, где p — вероятность сообщения «1», 0≤p≤1. Энтропия двоичного ансамбля X зависит только от вероятности p, она обозна­чается h(p) и равна:
h(p) = H(X) = –plogp – qlogq.
— 58 —
4.3. Энтропия двоичного ансамбля
График функции h(p) на сегменте p∈[0,1] дан на ри-
сунке 4.2.
В точках p=0 и p=1 с помощью правила Лопиталя вы-
числяем: h(0)=h(1)=0.
Заметим, что функция h(p) симметрична относитель-
но оси p=0, так как h(p)=h(1–p). Точка p=
1
/2 есть точка
максимума, и h(1/2)=1.
Отсюда следует, что h(p)<h(p') ⇔ 1/2–p>1/2–p'.
Иначе говоря, энтропия двоичного ансамбля тем больше, чем ближе к 1/2 вероятность p.
Пример 4.4. Найдем энтропию двоичного ансамбля X
с распределением вероятностей {0,37; 0,63}.
H(X) = –0,37×log0,37 – 0,63×log0,63 ≈0,9508.
Рисунок 4.2. Энтропия двоичного ансамбля
— 59 —
Глава 4. Количество информации и энтропия
( ) ( )
xX
∈
∑
( ) ( ) ( )
∑∑
( ) ( )
∑∑
4.4. Условная энтропия ансамбля
Для эффективного кодирования информации необхо­димо учитывать статистическую зависимость сообщений с помощью подсчета информационных характеристик последовательностей зависимых сообщений.
Рассмотрим пару сообщений из различных ансам­блей и декартово произведение этих ансамблей. Пусть
X={(x,p(x))}, Y={(y,p(y))} и XY={((x,y),p(x,y))}.
При любом y∈Y определено условное распределение веро­ятностей p(x/y) на множестве X. Используя это условное распределение вероятностей, посчитаем для каждого x∈X собственную информацию
I(x/y) = –log p(x/y),
называемую условной собственной информацией сообще­ния x при фиксированном сообщении y. Усредним эту ве­личину по x и получим величину
H(X/y) = M(–logp(x/y)) = –
называемую условной энтропией ансамбля X при фикси­рованном сообщении y∈Y. Во избежание неопределенно­сти в формуле (4.4) считаются равными 0 все слагаемые, для которых p(x/y)=0.
Введенная условная энтропия является случайной величиной, так как она зависит от случайного сообщения y. Неслучайной информационной характеристикой пары ансамблей (X,Y) является усредненная условная энтро­пия ансамбля X. Величина
H(X/Y)=(MH(X/y))= –
, log /
= –
называется условной энтропией ансамбля X при фиксиро­ванном ансамбле Y.
xX yY
∈∈
xX yY
∈∈
pxy px y
— 60 —
/ log /
px y px y
pypx y px y
/ log /
, (4.4)
=
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]