Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Элементы теории информации в защите информации. Учебное пособие для академического бакалавриата
.pdf
ГЛАВА 2.
Математические модели
источников
открытых сообщений
Математические модели источников открытых сообщений определяют свойства ряда методов как кодирования, так и дешифрования сообщений.
2.1. Дискретные источники
открытых сообщений
Источником информации или открытых сообщений
(ИОС) может быть отдельный пользователь или группа
пользователей, радиостанция, абонент телефонной сети
и т.д. Математическая модель ИОС представляет собой
совокупность свойств генерируемых им открытых сообщений.
К важным свойствам модели ИОС относятся:
1) языки общения, на которых генерируются сооб-
щения;
2) тематика генерируемых открытых сообщений;
3) набор используемых алфавитов;
4) частотные (вероятностные) характеристики эле-
ментов ОС и др.
ДИОС генерируют последовательности символов,
взятых из конечного множества X, называемого алфавитом текста. Тогда говорят, что открытый текст записан в алфавите X. Если при шифровании открытый тест
отображается в последовательность символов алфавита
— 21 —

Глава 2. Математические модели источников открытых сообщений
Y, то говорят, что шифрованный текст записан в алфавите Y.
Алфавит может содержать символ пробела, знаки
препинания и пр.
Элемент алфавита называется буквой, элемент мно-
жества X
s
называется s-граммой (при s=2 — биграммой,
при любом s>1 — мультиграммой) алфавита X.
Число букв в алфавите называется порядком алфави-
та. Длиной текста в алфавите X называется число букв
алфавита X в записи текста. Длина текста зависит от используемого алфавита (букв, биграмм и др.). Приведем
примеры алфавитов на основе английского языка.
1. Алфавит A
Z}, |A
| = 26. В алфавитах этого типа записывается текст,
1
прописных букв, A1 = {A, B, C, ..., X, Y,
1
не содержащий сложных символов. Текст в алфавите A
удобен для перевода в телеграфный код для последующей
передачи по телеграфу или по радиоканалам.
2. Прописные и строчные буквы, целые числа, про-
бел и знаки препинания (порядок алфавита ≈70): A
= {A,
2
B, C, ..., Y, Z, a, b, c, ..., y, z, 0, 1, ..., 9, пробел, зпт, тчк, :,
;, “, ?, ! }. В алфавите A
тексты записаны с помощью сим-
2
волов клавиатуры телетайпа (компьютера).
3. V
— элементы множества {0,1}. Данные в инфор-
1
мационных системах отображают с помощью производного от V
алфавита Vn (множества двоичных n-мерных
1
векторов). Например, телеграфные коды (ASCII, МТК-2
и др.) используют алфавит V
, где 5 ≤ n ≤ 8.
n
При шифровании над символами текста часто выполняются вычисления, поэтому алфавит удобно представлять как множество чисел или векторов.
В этой главе рассматриваем алфавит Z
m – 1} — кольцо вычетов по модулю
зуем также производный алфавит Z
s-грамм в алфавите Z
, s ≥ 2.
m
m. Кроме Zm исполь-
— множество всех
ms
= {0, ...,
m
1
— 22 —

2.2. Детерминированные модели дискретных источников открытых сообщений
2.2. Детерминированные модели
дискретных источников открытых сообщений
Каждый ДИОС порождает тексты в соответствии
с правилами грамматики некоторого языка, что находит отражение и в статистических характеристиках
сообщений. Например, в английских текстах за буквой
«q» всегда следует буква «u», в русских текстах буквы
«ь»и «ъ»никогда не следуют за гласными буквами, не соседствуют друг с другом. Таким образом, все мультиграммы делятся на допустимые (разрешенные), т.е. встречающиеся в некоторых текстах в алфавите X, и запрещенные
(запретные), т.е. не встречающиеся ни в каких текстах
в алфавите X. Заметим, что если мультиграмма x
запретная, то запретная и любая мультиграмма, содержащая x
простым запретом, если (s–1)-граммы x
,…,xs как свою часть.
1
Запретную s-грамму x
,…,xs в алфавите X назовем
1
,…,x
1
s–1
не являются запретными.
Всякий язык и всякий ДИОС можно характеризовать
разбиением множества всех s-грамм заданного алфавита X, s=2,3,..., на разрешенные и запрещенные.
Детерминированная модель ДИОС определяется разбиением на допустимые и запрещенные множества всех
генерируемых ДИОС мультиграмм заданного алфавита X.
В такой модели открытый текст есть последовательность
над X, не содержащая запретных s-грамм. На практике
при построении детерминированной модели ограничиваются использованием s-грамм, где s не превышает определенный порог, например, s≤4.
Немаловажно, что разбиение множества мультиграмм на допустимые и запрещенные весьма условно
в силу динамичности языка, его способности к развитию, в частности, появляются новые аббревиатуры,
,…,xs
1
и x2,…,xs
— 23 —

Глава 2. Математические модели источников открытых сообщений
( )
01
∑
( )
( )
01 1
,,
1
,, ,,,
nn s
n
aa Z
ns m
Pa a a a
−−
…∈
−
……
∑
включающие мультиграммы, которые ранее были отнесены к запретным.
Детерминированные модели разных ДИОС могут
различаться, несмотря на общность языка. Например,
заметно различаются детерминированные модели литературных текстов и текстов математических статей.
2.3. Стационарные вероятностные модели
дискретных источников сообщений
Вероятностной модели ДИОС соответствует источник
случайных последовательностей над конечным алфа-
}.
, ..., a
0
текст
m
n–1
)
витом. Пусть источник генерирует в алфавите Z
конечной или бесконечной длины. При моделировании
полагается, что источник генерирует последовательность
случайных переменных x
значения в Z
,...,a
(a
0,a1
, n>0. Вероятность случайного сообщения
m
) определяется как вероятность совместного
n–1
, x1, ..., x
0
, ..., принимающих
n–1
наступления (последовательности) событий:
P(a
0,a1
,...,a
) = P{x0=a0,…,x
n–1
n–1=an–1
Множество случайных сообщений образует вероятностное пространство, если при любом n>0 выполнены
условия:
(a
,...,a
0
1) Р(a
2)
,...,a
0
);
n–1
,,
aa Z
…∈
( )
01
nm
−
) ≥ 0 для любого случайного сообщения
n – 1
,,
Pa a
n
…
= 1;
n
−
3) для любого случайного сообщения (a
и любого s>n
,...,a
Р(a
0
) =
n–1
,
— 24 —

2.4. Модели независимых букв алфавита
( )
0iin
∏
( )
m
∑
т.е. вероятность всякого случайного сообщения длины
n есть сумма вероятностей всех продолжений этого сообщения до длины s.
Текст, порождаемый таким источником, является
вероятностным аналогом языка. Он обладает одинаковыми с языком частотными характеристиками букв и мультиграмм. Построение конкретной вероятностной модели
ДИОС происходит при задании конкретного вероятностного распределения на множестве открытых текстов.
Наиболее простыми для использования являются
стационарные вероятностные модели ДИОС. Стационарность модели означает, что для любого случайного слова
(a
,...,a
0
) и любых натуральных n и t выполнено:
n–1
P{x
= a0, …, x
0
n–1
= a
} = P{xt = a0, …, x
n–1
t+n–1
= a
n–1
},
то есть вероятность любого слова не зависит от его местоположения в тексте.
В теории информации стационарные вероятностные
модели ДИОС часто называют дискретными постоянными источниками (ДПИ).
2.4. Модели независимых букв алфавита
Эта модель предполагает, что вероятности сообщений полностью определены вероятностями встречаемости
в случайном тексте отдельных букв алфавита, межзнаковые зависимости в тексте полностью игнорируются:
P(a
,...,a
0
где Р(a)>0 для любого a∈Z
aZ
∈
n – 1
m
Pa
) =
и
≤<
= 1.
Pa
,
Открытый текст такого источника есть реализация последовательности независимых испытаний в полиномиаль-
— 25 —

Глава 2. Математические модели источников открытых сообщений
ной вероятностной схеме с числом исходов, равным m, где
множество исходов биективно соответствует множеству
всех символов алфавита.
Данная модель наиболее проста в применении, она
позволяет разделить буквы алфавита на классы высокой,
средней и низкой частот использования. Недостатком модели следует считать то, что некоторые свойства данной
модели противоречат свойствам языков. Например, эта
модель не выявляет запретные мультиграммы, так как
вероятность любого сообщения, в том числе содержащего
запретную мультиграмму, является положительной.
В табл. 2.1 приведены буквы высокой частоты использования для некоторых европейских языков (частота
указана в процентах).
Таблица 2.1
Буквы высокой частоты европейских языков
Язык Буква алфавита/частота появления буквы в текстах, %
Английский
Испанский
Итальян-
ский
Немецкий
Француз-
ский
Русский
E/ 12,86 T/ 9,72 A/ 7,96 I/ 7,77 N/ 7,51 R/ 7,03
E/ 14,15 A/ 12,90 O/ 8,84 S/ 7,64 I/ 7,01 R/ 6,95
I/ 12,04 E/ 11,63 A/ 11,12 O/ 8,92 N/ 7,68 T/ 7,07
E/ 19,18 N/ 10,20 I/ 8,21 S/ 7,07 R/ 7,01 T/ 5,86
E/ 17,76 S/ 8,23 A/ 7,68 N/ 7,61 T/ 7,30 I/ 7,23
О/ 11,0 И/ 8,9 Е/ 8,3 А/ 7,9 Н/ 6,9 Т/ 6,0
Для сравнения частот редких букв с частотами букв,
данными в таблице 2.1, укажем, что, например, в английском языке редкими буквами являются буквы J, Q, Z,
а их частоты в процентах оцениваются как 0,13, 0,12
и 0,08 соответственно. Из табл. 2.1 видно, что не случайно итальянский и испанский языки считаются певучими:
суммарная частота гласных букв весьма высокая.
— 26 —

2.5. Модели независимых биграмм алфавита
( )
ii
∏
( )
∑
Данная модель строится для любого ДИОС с помощью эмпирического сбора статистики, определяющей частоты встречаемости букв с использованием относительно
небольшого количества материала. Эта модель удобна для
ряда практических применений, например, она эффективно используется при дешифровании текстов, защищаемых шифром простой замены.
Ограниченность модели снижает эффективность
ее применения при анализе широкого класса последовательностей зависимых символов.
2.5. Модели независимых биграмм алфавита
Эта модель несколько более громоздка, но точнее предыдущей модели отражает свойства языков. Открытый
текст такого источника является реализацией последовательности независимых испытаний в полиномиальной
вероятностной схеме с числом исходов не более m
прещенные биграммы можно не включать в множество
исходов, значит, множество исходов взаимно однозначно
соответствует множеству всех разрешенных биграмм алфавита.
Для удобства рассмотрим тексты четной длины. Вероятность сообщения (a
0,a1
,...,a
2n–2,a2n–1
) в этой модели
задается равенством:
2
. За-
P(a
где Р(a,b)≥0 для всех a,b∈Z
0,a1
,...,a
2n–2,a2n–1
m
и
) =
0
,,ab Z
∈
≤<
Pa a
in
P ab
m
,
2 21
+
= 1.
Вероятности биграмм оцениваются как относительные частоты их встречаемости в текстах, они вычисляются экспериментально на большом количестве текстового
материала. Вероятности биграмм в алфавите Z
— 27 —
,
сводятся
m

Глава 2. Математические модели источников открытых сообщений
в матрицу (p
нумерованы числами 0, 1, …, m–1, где p
) порядка m, строки и столбцы которой за-
i,s
— вероятность
i,s
размещения биграммы (i,s) на случайно выбранной четной позиции в случайном тексте. Вероятность запретной
биграммы равна 0.
В матрице вероятностей биграмм криптоаналитик находит ряд полезных свойств ИОС и языка в целом. Например, в английском языке все биграммы с первой буквой q
имеют нулевую вероятность, за исключением биграммы
(q,u), вероятность которой равна приблизительно 0,0011.
Биграммы вида (a,*) имеют ненулевую вероятность за исключением биграммы (a,q) и др.
Модель независимых биграмм классифицирует все
биграммы источника сообщений по вероятности их появления в тексте. По сравнению с предыдущей моделью она
точнее отражает особенности языка и источника сообщений. Согласно этой модели всякое сообщение, у которого
на четном месте располагается первая буква запретной
биграммы, имеет нулевую вероятность. В то же время
моделью игнорируются запретные биграммы, где первая
буква располагается на нечетном месте, а также свойственные языкам зависимости между соседними биграммами. Например, вероятность запретной в английском
языке 4-граммы «ququ» в данной модели оценивается
величиной 1,21×10
–6
.
2.6. Модели марковски зависимых букв
алфавита, глубина зависимости
Недостатки модели независимых биграмм в меньшей
степени присущи модели марковски зависимых букв. Открытый текст такого источника является реализацией последовательности испытаний, связанных, например, однородной цепью Маркова с m состояниями (однородность
— 28 —

2.6. Модели марковски зависимых букв алфавита, глубина зависимости
цепи Маркова соответствует стационарности источника
сообщений).
Простая однородная цепь Маркова. Простая цепь
Маркова учитывает для каждого символа последовательности (кроме первого символа) зависимость его вероятности только от вероятности одного предыдущего
символа.
Данная модель и соответствующая цепь Маркова
полностью определены стохастической матрицей P переходных вероятностей (стохастичность означает, что сумма элементов любой строки матрицы равна 1) и вектором
v начального распределения вероятностей, которому подчиняются первые знаки всех сообщений:
P = (p(a/b)), 0≤a,b<m, v = (v(a)),
где p(a/b) — вероятность встречаемости в случайной
(кроме первой) позиции текста буквы a при условии, что
в предыдущей позиции встретилась буква b, v(a) — вероятность знака a на первой позиции случайного текста. Вероятность случайного сообщения (a
, a1, ..., a
0
) выража-
n – 1
ется формулой
P(a
0,a1
,...,a
) = v(a0)p(a1/a0) p(a2/a1)…p(a
n – 1
n-1/an-2
).
Вероятности матрицы P и вектора v удовлетворяют
условиям:
1) p(a/b),v(a) ≥ 0 для всех a,b∈Z
;
m
2) p(a/b)=0 ⇔ биграмма (b,a) запретная;
3) v(0) + v(1) + ... + v(m — 1) = 1;
4) p(0/b)+p(1/b)+...+p((m — 1)/b)=1, b∈Z
,
m
то есть b-я строка матрицы P есть условное распределение
вероятностей букв алфавита (при условии, что предыдущая буква равна b.
В данной модели представляет интерес распределение вероятностей на множестве букв алфавита, называемое стационарным распределением знаков алфавита. Это
— 29 —

Глава 2. Математические модели источников открытых сообщений
( ) ( ) ( )
/, 0 ;
wa wb pa b a m
∑
распределение полностью определено матрицей P и вектором v.
Вектор w=(w(0),w(1),...,w(m-1)) стационарного распределения знаков алфавита в случайном тексте определяется как решение системы уравнений
w w wm
= ≤<
0
bm
≤<
0 1 1 1.
+ +…+ − =
( ) ( ) ( )
Эта модель учитывает все запретные биграммы,
то есть вероятность любого слова, содержащего запретную биграмму, равна 0. Однако если текст содержит простую запретную s-грамму при s>2, то вероятность слова
может быть положительной. Это может быть, например,
если запретная 4-грамма составлена из двух разрешенных биграмм.
Однородная цепь Маркова с глубиной зависимости s>1. Открытый текст данного ДИОС является ре-
ализацией последовательности испытаний, связанных
однородной цепью Маркова с m состояниями, в которой
вероятность каждого символа последовательности (кроме
первых s символов) зависит от вероятности предыдущего
слова длины s.
Данная модель (и соответствующая цепь Маркова)
полностью определяется стохастической матрицей P переходных вероятностей размера m
s
m
начального распределения вероятностей всех s-грамм,
s
×m и вектором v длины
которому начальные s-граммы всех сообщений длины
не меньшей s:
P = (p(a/w)), 0≤a<m, w∈
s
Z ,
m
v = (v(w)),
где p(a/w) — вероятность встречаемости в случайной позиции текста (кроме первых s позиций) буквы a при условии, что в предыдущих s позициях встретилась s-грамма
— 30 —
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
