Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Элементы теории информации в защите информации. Учебное пособие для академического бакалавриата
.pdf
5.5. Обратная теорема равномерного кодирования
n
22
( )
1
xT
px
∈
∑
1
1
( )
xT
∑
и, с другой стороны, оберегает специалистов от непродуктивных попыток создать код с желательными, но в принципе недостижимыми характеристиками.
Покажем, что если скорость кода на любую небольшую положительную величину меньше энтропии, то вероятность ошибки не может быть сколь угодно малой.
Теорема 5.2. Для ДПИ с энтропией H существует
число e>0 такое, что для любого d>0 и для любого равномерного кода со скоростью R<H–d вероятность ошибки
кодирования Р
≥e.
е
Доказательство. Укажем для заданного ДПИ не за-
висящую от длины кодируемых блоков положительную
константу e, ограничивающую снизу вероятность ошибки
кодирования, если скорость кода R≤H–d, где d>0.
Код определяется множеством Т
однозначно кодиру-
1
емых блоков. По определению скорость кода (см. (6.2))
log T
R =
1
.
Следовательно, для количества кодовых слов верна
оценка:
Т
Оценим вероятность P
≤
1
nR nH
безошибочного кодирова-
код
. (5.8)
ния:
P
= 1 – Pе =
код
.
Разобьем сумму в правой части на две суммы:
где Т = Т(d
ства всех блоков длины n.
P
=
код
), Тс — дополнение множества Т(d0) до множе-
0
xT T
px
+
xT T
px
c
Оценим вторую сумму:
px
xT T
1
≤
c
∈
px
= Р(Тc) = Р{x∉Т}.
c
Отсюда в соответствии с (5.6) получаем:
— 81 —
,

Глава 5. Равномерное кодирование источника сообщений
1
0
1
px
px
( )
1
22
2
2
0
px
xT T
≤
c
n
.
2
Оценим первую сумму с учетом неравенства
DIx
Т
∩Т≤Т1:
1
px
xT T
≤ Т1∩Т max
xT T
1
≤ Т1 max
xT T
1
.
Расширив область, по которой берется максимум,
получаем:
px
xT T
1
≤ Т1
maxxTpx
∈
.
Подставив в правую часть оценку (5.8) для величины
Т
и оценку максимальной вероятности (5.4), имеем:
1
px
xT T
≤
nH nH
0
=
n
0
.
Используя оценки обеих сумм, получаем оценку ве-
роятности P
безошибочного кодирования:
с
n
≤
P
код
DIx
0
+
2
n
.
Теперь выберем: d — произвольное положительное
число, d
n стремится к 0, то есть вероятность P
=d/2. Тогда правая часть оценки P
0
ошибки кодирова-
е
с ростом
код
ния стремится к 1. Осталось показать, что при конечных
длинах кодируемых блоков вероятность P
ограничена
е
снизу положительной константой.
Обозначим: n
кая, что при любом n≥n
P
≤1/2); e0 — наименьшая вероятность ошибочного ко-
код
дирования при всех n=1,2,…,n
Во-первых, P
(при P
=0) выполнено Т1≥Xn, откуда следует, что
е
— длина кодируемых блоков та-
0
>0 при любом натуральном n, иначе
е
верна оценка Pе ≥1/2 (при этом
0
–1; e=min{e0,1/2}.
0
скорость кода R≥logX, что влечет неравенство R≥H,
противоречащее условию теоремы. Следовательно, e
>0,
0
отсюда e>0. Значит, в силу сделанных построений при
любом натуральном n
— 82 —

5.6. Свойства типичных последовательностей для ДПИ
lim
2
2
2
2
( )
2
nH X
2
( )
2
Pе ≥ e > 0
для всех кодов со скоростью R ≤H – d, где d> 0. Теорема
доказана.
5.6. Свойства типичных
последовательностей для ДПИ
Установим свойства множества Тn(d) типичных последовательностей.
Теорема 5.3. При любом d>0:
1)
2) При любом натуральном n
3) Для любого e>0 существует натуральное число n
такое, что при всех n≥n
4) Для любой последовательности x∈Т
оценки:
Доказательство. Первое утверждение следует
из (5.6) и (5.7). Тем самым установлено, что «почти
все»порожденные источником блоки длины n принадлежат множеству Т
Второе утверждение следует из (5.7) и равенства
Т ≤
мы 5.1. То есть утверждается, что при любом d> 0 порядок множества Т
числа
Четвертое утверждение следует из (5.4). Его можно
трактовать как асимптотическую равновероятность всех
блоков из Т
P(Тn(d)) = 1.
n→∞
nHX
Т
(d) ≤
n
0
Тn(d) ≥ (1 – e)
nHX
2
(d), то есть являются типичными.
n
nH
0
, полученного при доказательстве теоре-
nHX
n
n
.
(d), их вероятности примерно равны
≤ p(x) ≤
(d) близок к числу
nHX
nHX
.
0
.
(d) верны
n
.
и не больше
nH X−
.
— 83 —

Глава 5. Равномерное кодирование источника сообщений
xT
n
2
( )
2
nH X
2
( )
2
nH X
2
2
( )
2
nH X
( )
2
Обратимся к третьему утверждению. Из утвержде-
ния 1 следует, что для любого e>0 найдется натуральное
число n
такое, что P(Тn(d))≥1 – e при любом n≥n0. Тогда,
0
используя утверждение 4, имеем:
(d)) ≤ Тn(d)
P(Т
n
max
Отсюда и из оценки P(Т
≤
px
( )
(d))≥1–e получаем утвержде-
n
nHX
.
ние 3. Тем самым утверждается, что при любом d>0 порядок множества Т
nHX
числа (1–e)
(d) близок к числу
n
.
и не меньше
Утверждения 2 и 3 устанавливают связь мощности
множества типичных последовательностей с энтропией
ансамбля.
Из утверждения 1 следует, что для получения малой
вероятности ошибки кодирования достаточно однозначно
кодировать все блоки из множества Т
примерно
(утверждения 2 и 3), поэтому для пере-
(d). Таких блоков
n
дачи номера блока достаточно передать nH(x) бит, то есть
H(x) бит на одну букву.
Это дополнительно разъясняет содержание прямой
теоремы кодирования. Справедливость обратной теоремы
тоже разъясняется с учетом того, что при однозначном
кодировании М блоков из Т
однозначно кодируемых блоков имеет порядок М
(d) суммарная вероятность
n
nH X−
( )
.
Значит, вероятность ошибки кодирования примерно рав-
nH X−
( )
на 1-М
. Отсюда если М<
кода меньше H(x)), то произведение М
(при этом скорость
nH X−
невелико,
а вероятность ошибки большая.
Определим структуру типичных блоков (последовательностей). Обозначим v
(x) частоту буквы a в последова-
a
тельности x. Набор частот
v(x) = {v
(x), a∈X}
a
— 84 —

5.7. Задачи и упражнения
( )
1
∏
( )
vx
∏
n
( )
vx
n
( )
a
vx
n
называется вариационным рядом или маркировкой последовательности x.
Вероятность последовательности x=(x
,…,xn), генери-
1
руемой ДПИ, равна с учетом возможности любой перестановки перемножаемых вероятностей букв:
p(x) =
≤≤
in
px
=
i
∈
aX
()
pa
a
.
Собственная информация блока в расчете на букву
равна
1
Ix
( )
= –
∑
∈
aX
a
logp(a).
Эта величина близка к энтропии H(x), если
≈ p(а). Таким образом, типичными являются те бло-
ки, в которых относительная частота встречаемости каждого символа близка к вероятности этого символа.
В завершение темы заметим, что аналогичные вопросы для ДИОС с зависимыми символами разобраны
в фундаментальных учебниках по теории информации
[2, 5, 10].
5.7. Задачи и упражнения
5.1. Для источников независимых букв над алфавитом А={a,b,c} определите при нулевой вероятности
ошибки скорость R равномерного кодирования и длину
n двоичных комбинаций, кодирующих блоки длины
N∈{2,3,4,5}:
а) p(a)=0,3; p(b)=0,5; p(c)=0,2;
б) p(a)=p(b)=1/4; p(c)=1/2;
в) p(a)=1/5; p(b)=13/25; p(c)=7/25.
Сравните скорость равномерного кодирования с эн-
тропией источника.
— 85 —

Глава 5. Равномерное кодирование источника сообщений
Решение. а) При нулевой вероятности ошибки 2n≥3N,
и R=n/N. Отсюда:
N
n
R
2 3 4 5
4 5 7 8
2 1,67 1,75 1,6
5.2. Для источников из задачи 5.1 найдите скорости
равномерного кодирования при длине кодируемых блоков N = 2, 3, 4, 5 и при вероятности ошибки не превышающей:
а) 0,1; б) 0,05.
5.3. Какой следует взять длину N кодируемого блока в алфавите порядка m, чтобы использовать двоичные
кодовые слова длины n для равномерного кодирования
с нулевой вероятностью ошибки:
а) (m,n)=(4,8); б) (m,n)=(5,8); в) (m,n)=(6,16).
5.4. Какой следует взять длину N кодируемого блока в алфавите порядка 3, чтобы использовать двоичные
кодовые слова длины n для равномерного кодирования
вероятностью ошибки, не превышающей: 0,2; 0,04?
а) n=5; б) n=6.
5.5. Блоки сообщений длины 3 независимых букв
алфавита А={a,b,c} кодируются равномерным двоичным
кодом длины 4. Определите множество однозначно кодируемых блоков и минимально возможную вероятность
ошибки Р
, если (p(a),p(b),p(c)) равны:
е
а) (0,6; 0,3; 0,1);
б) (4/9; 1/3; 2/9);
в) (0,44; 0,33; 0,23).
Решение. а) Определим вероятности p всех блоков
длины 3 в алфавите А:
— 86 —

5.7. Задачи и упражнения
0,4 0,35 0,25
0,3 0,7 0
0,25 0, 45 0,3
блок
a,a,a 0,216 b,a,a 0,108 c,a,a 0,036
a,a,b 0,108 b,a,b 0,054 c,a,b 0,018
a,a,c 0,036 b,a,c 0,018 c,a,c 0,006
a,b,a 0,108 b,b,a 0,054 c,b,a 0,018
a,b,b 0,054 b,b,b 0,027 c,b,b 0,009
a,b,c 0,018 b,b,c 0,009 c,b,c 0,003
a,c,a 0,036 b,c,a 0,018 c,c,a 0,006
a,c,b 0,018 b,c,b 0,009 c,c,b 0,003
a,c,c 0,006 b,c,c 0,003 c,c,c 0,001
p
блок
p
блок
p
Так как из 27 блоков однозначно кодируются 16 блоков, то в таблице выделены темным фоном 9 блоков с наименьшими вероятностями, не относящиеся к однозначно
кодируемым. Сумма этих 9 вероятностей равна Р
=0,046.
е
Вместо блока (b,c,b) можно взять блок (b,b,c), что не изменит вероятность Р
.
е
5.6. Имеется источник над алфавитом А={0,1,2}
с марковски зависимыми буквами с матрицей переходных вероятностей P и начальным распределением (0,25;
0,35; 0,4), где:
0,4 0 0, 6
a) P =
0,7 0,3 0
; б) P =
.
0,5 0,2 0,3
Блоки сообщений длины 3 кодируются равномерным
двоичным кодом длины 4. Определите скорость равномерного кода и множество однозначно кодируемых блоков
при минимально возможной вероятности ошибки Р
.
е
5.7. Для источника над алфавитом А={a,b,c,d,e}
с независимыми биграммами блоки сообщений длины 2
— 87 —

Глава 5. Равномерное кодирование источника сообщений
12042
37102
10321
52110
04213
12032
31102
10021
12110
02213
кодируются равномерным двоичным кодом длины 4, где
вероятности биграмм заданы матрицей:
а) (1/48);
Определите скорость равномерного кода и множество
однозначно кодируемых блоков при минимально возможной вероятности ошибки Р
5.8. Равномерный код из двоичных слов длины n кодирует N-граммы над алфавитом А порядка m. Сколько
имеется запретных N-грамм над алфавитом А, если вероятность ошибки кодирования равна 0:
а) N=2, m=6, n=5;
б) N=3, m=7, n=8;
в) N=4, m=3, n=6?
Решение. а) При нулевой вероятности ошибки ко-
дирования число запретных N-грамм не меньше m
N
если m
≥2n. Значит, не меньше 4.
5.9. Дайте определение множества T
последовательностей длины n ансамбля X, где d > 0 —
константа.
5.10. Пусть А={0,1,2,3} — ансамбль с независимыми
символами, вероятности которых равны 0,13, 0,34, 0,23
и 0,3 соответственно. Оцените T
1) (n; d)=(100; 0,01);
2) (n; d)=(1000; 0,01);
3) (n; d)=(1000; 0,001).
5.11. В ансамбле А={a,b,c} с независимыми символами, вероятности которых равны 0,25, 0,35 и 0,4
б) (1/32)
.
е
— 88 —
(d) при:
n
N
– 2n,
(d) типичных
n
.

5.7. Задачи и упражнения
соответственно, оцените вероятности p(x) типичных последовательностей x∈T
n
(d):
(n,d) ∈ {100; 400; 700; 1500}×{0,001; 0,005; 0,01; 0,03;
0,05; 0,1}.
5.12. Докажите, что случайная равновероятная дво-
ичная последовательность длины n независимых символов является d-типичной при любом n∈N и любом d≥0.
5.13 При каких d является d-типичной двоичная по-
следовательность длины n независимых символов с числом нулей n
(n, n
и вероятностью единицы p:
0
, p) ∈ {100; 200}×{51; 75; 80}×{0,3; 0,6; 0,7}?
0
— 89 —

ГЛАВА 6.
Теоретические основы
неравномерного кодирования
В предыдущих разделах показано, что ДИОС как правило являются избыточными. Значит, возможно уменьшение затрат на передачу или хранение информации,
генерируемой источниками. Чем меньше энтропия источника, тем меньше потребуется битов для представления
информации. Значит, наиболее эффективным является
кодирование тех источников, где генерируемые сообщения неравновероятны. Из соображения сокращения
затрат на кодирование информации в таких источниках
наиболее часто генерируемым сообщениям естественно
сопоставить короткие кодовые комбинации и наоборот,
редким сообщениям сопоставить более длинные кодовые
комбинации.
Оптимальным с точки зрения затрат на кодирование
является код Хаффмена, с которым познакомимся ниже.
Однако ряд соображений практического характера,
в частности, связанных с вычислительной сложностью
кодирования, вынуждают использовать другие коды.
К таким выводам несложно прийти по результатам изучения кодов Шеннона, Гилберта-Мура и арифметического
кодирования.
6.1. Неравномерное побуквенное кодирование
с помощью префиксных кодов
Рассмотрим задачу построения эффективного нерав-
номерного кода над алфавитом A для некоторого ДИОС
— 90 —
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
