Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Элементы теории информации в защите информации. Учебное пособие для академического бакалавриата

.pdf
Скачиваний:
0
Добавлен:
08.09.2026
Размер:
2 Мб
Скачать
☆
ГЛАВА 2.
Математические модели
источников
открытых сообщений
Математические модели источников открытых сооб­щений определяют свойства ряда методов как кодирова­ния, так и дешифрования сообщений.
2.1. Дискретные источники открытых сообщений
Источником информации или открытых сообщений (ИОС) может быть отдельный пользователь или группа пользователей, радиостанция, абонент телефонной сети и т.д. Математическая модель ИОС представляет собой совокупность свойств генерируемых им открытых сооб­щений.
К важным свойствам модели ИОС относятся:
1) языки общения, на которых генерируются сооб-
щения;
2) тематика генерируемых открытых сообщений;
3) набор используемых алфавитов;
4) частотные (вероятностные) характеристики эле-
ментов ОС и др.
ДИОС генерируют последовательности символов, взятых из конечного множества X, называемого алфа­витом текста. Тогда говорят, что открытый текст запи­сан в алфавите X. Если при шифровании открытый тест отображается в последовательность символов алфавита
— 21 —
Глава 2. Математические модели источников открытых сообщений
Y, то говорят, что шифрованный текст записан в алфа­вите Y.
Алфавит может содержать символ пробела, знаки
препинания и пр.
Элемент алфавита называется буквой, элемент мно-
жества X
s
называется s-граммой (при s=2 — биграммой,
при любом s>1 — мультиграммой) алфавита X.
Число букв в алфавите называется порядком алфави- та. Длиной текста в алфавите X называется число букв алфавита X в записи текста. Длина текста зависит от ис­пользуемого алфавита (букв, биграмм и др.). Приведем примеры алфавитов на основе английского языка.
1. Алфавит A
Z}, |A
| = 26. В алфавитах этого типа записывается текст,
1
прописных букв, A1 = {A, B, C, ..., X, Y,
1
не содержащий сложных символов. Текст в алфавите A удобен для перевода в телеграфный код для последующей передачи по телеграфу или по радиоканалам.
2. Прописные и строчные буквы, целые числа, про-
бел и знаки препинания (порядок алфавита ≈70): A
= {A,
2
B, C, ..., Y, Z, a, b, c, ..., y, z, 0, 1, ..., 9, пробел, зпт, тчк, :, ;, “, ?, ! }. В алфавите A
тексты записаны с помощью сим-
2
волов клавиатуры телетайпа (компьютера).
3. V
— элементы множества {0,1}. Данные в инфор-
1
мационных системах отображают с помощью произво­дного от V
алфавита Vn (множества двоичных n-мерных
1
векторов). Например, телеграфные коды (ASCII, МТК-2 и др.) используют алфавит V
, где 5 ≤ n ≤ 8.
n
При шифровании над символами текста часто выпол­няются вычисления, поэтому алфавит удобно представ­лять как множество чисел или векторов.
В этой главе рассматриваем алфавит Z m – 1} — кольцо вычетов по модулю зуем также производный алфавит Z s-грамм в алфавите Z
, s ≥ 2.
m
m. Кроме Zm исполь-
— множество всех
ms
= {0, ...,
m
1
— 22 —
2.2. Детерминированные модели дискретных источников открытых сообщений
2.2. Детерминированные модели
дискретных источников открытых сообщений
Каждый ДИОС порождает тексты в соответствии с правилами грамматики некоторого языка, что нахо­дит отражение и в статистических характеристиках сообщений. Например, в английских текстах за буквой «q»всегда следует буква «u», в русских текстах буквы «ь»и «ъ»никогда не следуют за гласными буквами, не со­седствуют друг с другом. Таким образом, все мультиграм­мы делятся на допустимые (разрешенные), т.е. встречаю­щиеся в некоторых текстах в алфавите X, и запрещенные (запретные), т.е. не встречающиеся ни в каких текстах в алфавите X. Заметим, что если мультиграмма x запретная, то запретная и любая мультиграмма, содержа­щая x
простым запретом, если (s–1)-граммы x
,…,xs как свою часть.
1
Запретную s-грамму x
,…,xs в алфавите X назовем
1
,…,x
1
s–1
не являются запретными.
Всякий язык и всякий ДИОС можно характеризовать разбиением множества всех s-грамм заданного алфави­та X, s=2,3,..., на разрешенные и запрещенные.
Детерминированная модель ДИОС определяется раз­биением на допустимые и запрещенные множества всех генерируемых ДИОС мультиграмм заданного алфавита X. В такой модели открытый текст есть последовательность над X, не содержащая запретных s-грамм. На практике при построении детерминированной модели ограничива­ются использованием s-грамм, где s не превышает опреде­ленный порог, например, s≤4.
Немаловажно, что разбиение множества мульти­грамм на допустимые и запрещенные весьма условно в силу динамичности языка, его способности к разви­тию, в частности, появляются новые аббревиатуры,
,…,xs
1
и x2,…,xs
— 23 —
Глава 2. Математические модели источников открытых сообщений
( )
01
∑
( )
( )
01 1
,,
1
,, ,,,
nn s
n
aa Z
ns m
Pa a a a
−−
…∈
−
……
∑
включающие мультиграммы, которые ранее были отнесе­ны к запретным.
Детерминированные модели разных ДИОС могут различаться, несмотря на общность языка. Например, заметно различаются детерминированные модели лите­ратурных текстов и текстов математических статей.
2.3. Стационарные вероятностные модели дискретных источников сообщений
Вероятностной модели ДИОС соответствует источник
случайных последовательностей над конечным алфа-
}.
, ..., a
0
текст
m
n–1
)
витом. Пусть источник генерирует в алфавите Z конечной или бесконечной длины. При моделировании полагается, что источник генерирует последовательность случайных переменных x значения в Z
,...,a
(a
0,a1
, n>0. Вероятность случайного сообщения
m
) определяется как вероятность совместного
n–1
, x1, ..., x
0
, ..., принимающих
n–1
наступления (последовательности) событий:
P(a
0,a1
,...,a
) = P{x0=a0,…,x
n–1
n–1=an–1
Множество случайных сообщений образует вероят­ностное пространство, если при любом n>0 выполнены условия:
(a
,...,a
0
1) Р(a
2)
,...,a
0
);
n–1
,,
aa Z
…∈
( )
01
nm
−
) ≥ 0 для любого случайного сообщения
n – 1
,,
Pa a
n
…
= 1;
n
−
3) для любого случайного сообщения (a
и любого s>n
,...,a
Р(a
0
) =
n–1
,
— 24 —
2.4. Модели независимых букв алфавита
( )
0iin
∏
( )
m
∑
т.е. вероятность всякого случайного сообщения длины n есть сумма вероятностей всех продолжений этого сооб­щения до длины s.
Текст, порождаемый таким источником, является вероятностным аналогом языка. Он обладает одинаковы­ми с языком частотными характеристиками букв и муль­тиграмм. Построение конкретной вероятностной модели ДИОС происходит при задании конкретного вероятност­ного распределения на множестве открытых текстов.
Наиболее простыми для использования являются стационарные вероятностные модели ДИОС. Стационар­ность модели означает, что для любого случайного слова (a
,...,a
0
) и любых натуральных n и t выполнено:
n–1
P{x
= a0, …, x
0
n–1
= a
} = P{xt = a0, …, x
n–1
t+n–1
= a
n–1
},
то есть вероятность любого слова не зависит от его место­положения в тексте.
В теории информации стационарные вероятностные модели ДИОС часто называют дискретными постоянны­ми источниками (ДПИ).
2.4. Модели независимых букв алфавита
Эта модель предполагает, что вероятности сообще­ний полностью определены вероятностями встречаемости в случайном тексте отдельных букв алфавита, межзнако­вые зависимости в тексте полностью игнорируются:
P(a
,...,a
0
где Р(a)>0 для любого a∈Z
aZ
∈
n – 1
m
Pa
) =
и
≤<
= 1.
Pa
,
Открытый текст такого источника есть реализация после­довательности независимых испытаний в полиномиаль-
— 25 —
Глава 2. Математические модели источников открытых сообщений
ной вероятностной схеме с числом исходов, равным m, где множество исходов биективно соответствует множеству всех символов алфавита.
Данная модель наиболее проста в применении, она позволяет разделить буквы алфавита на классы высокой, средней и низкой частот использования. Недостатком мо­дели следует считать то, что некоторые свойства данной модели противоречат свойствам языков. Например, эта модель не выявляет запретные мультиграммы, так как вероятность любого сообщения, в том числе содержащего запретную мультиграмму, является положительной.
В табл. 2.1 приведены буквы высокой частоты ис­пользования для некоторых европейских языков (частота указана в процентах).
Таблица 2.1
Буквы высокой частоты европейских языков
Язык Буква алфавита/частота появления буквы в текстах, %
Английский Испанский Итальян-
ский Немецкий Француз-
ский Русский
E/ 12,86 T/ 9,72 A/ 7,96 I/ 7,77 N/ 7,51 R/ 7,03
E/ 14,15 A/ 12,90 O/ 8,84 S/ 7,64 I/ 7,01 R/ 6,95
I/ 12,04 E/ 11,63 A/ 11,12 O/ 8,92 N/ 7,68 T/ 7,07
E/ 19,18 N/ 10,20 I/ 8,21 S/ 7,07 R/ 7,01 T/ 5,86
E/ 17,76 S/ 8,23 A/ 7,68 N/ 7,61 T/ 7,30 I/ 7,23
О/ 11,0 И/ 8,9 Е/ 8,3 А/ 7,9 Н/ 6,9 Т/ 6,0
Для сравнения частот редких букв с частотами букв, данными в таблице 2.1, укажем, что, например, в англий­ском языке редкими буквами являются буквы J, Q, Z, а их частоты в процентах оцениваются как 0,13, 0,12 и 0,08 соответственно. Из табл. 2.1 видно, что не случай­но итальянский и испанский языки считаются певучими: суммарная частота гласных букв весьма высокая.
— 26 —
2.5. Модели независимых биграмм алфавита
( )
ii
∏
( )
∑
Данная модель строится для любого ДИОС с помо­щью эмпирического сбора статистики, определяющей ча­стоты встречаемости букв с использованием относительно небольшого количества материала. Эта модель удобна для ряда практических применений, например, она эффек­тивно используется при дешифровании текстов, защища­емых шифром простой замены.
Ограниченность модели снижает эффективность ее применения при анализе широкого класса последова­тельностей зависимых символов.
2.5. Модели независимых биграмм алфавита
Эта модель несколько более громоздка, но точнее пре­дыдущей модели отражает свойства языков. Открытый текст такого источника является реализацией последо­вательности независимых испытаний в полиномиальной вероятностной схеме с числом исходов не более m прещенные биграммы можно не включать в множество исходов, значит, множество исходов взаимно однозначно соответствует множеству всех разрешенных биграмм ал­фавита.
Для удобства рассмотрим тексты четной длины. Ве­роятность сообщения (a
0,a1
,...,a
2n–2,a2n–1
) в этой модели
задается равенством:
2
. За-
P(a
где Р(a,b)≥0 для всех a,b∈Z
0,a1
,...,a
2n–2,a2n–1
m
и
) =
0
,,ab Z
∈
≤<
Pa a
in
P ab
m
,
2 21
+
= 1.
Вероятности биграмм оцениваются как относитель­ные частоты их встречаемости в текстах, они вычисляют­ся экспериментально на большом количестве текстового материала. Вероятности биграмм в алфавите Z
— 27 —
,
сводятся
m
Глава 2. Математические модели источников открытых сообщений
в матрицу (p нумерованы числами 0, 1, …, m–1, где p
) порядка m, строки и столбцы которой за-
i,s
— вероятность
i,s
размещения биграммы (i,s) на случайно выбранной чет­ной позиции в случайном тексте. Вероятность запретной биграммы равна 0.
В матрице вероятностей биграмм криптоаналитик на­ходит ряд полезных свойств ИОС и языка в целом. Напри­мер, в английском языке все биграммы с первой буквой q имеют нулевую вероятность, за исключением биграммы (q,u), вероятность которой равна приблизительно 0,0011. Биграммы вида (a,*) имеют ненулевую вероятность за ис­ключением биграммы (a,q) и др.
Модель независимых биграмм классифицирует все биграммы источника сообщений по вероятности их появ­ления в тексте. По сравнению с предыдущей моделью она точнее отражает особенности языка и источника сообще­ний. Согласно этой модели всякое сообщение, у которого на четном месте располагается первая буква запретной биграммы, имеет нулевую вероятность. В то же время моделью игнорируются запретные биграммы, где первая буква располагается на нечетном месте, а также свой­ственные языкам зависимости между соседними биграм­мами. Например, вероятность запретной в английском языке 4-граммы «ququ»в данной модели оценивается величиной 1,21×10
–6
.
2.6. Модели марковски зависимых букв алфавита, глубина зависимости
Недостатки модели независимых биграмм в меньшей степени присущи модели марковски зависимых букв. От­крытый текст такого источника является реализацией по­следовательности испытаний, связанных, например, од­нородной цепью Маркова с m состояниями (однородность
— 28 —
2.6. Модели марковски зависимых букв алфавита, глубина зависимости
цепи Маркова соответствует стационарности источника сообщений).
Простая однородная цепь Маркова. Простая цепь Маркова учитывает для каждого символа последова­тельности (кроме первого символа) зависимость его ве­роятности только от вероятности одного предыдущего символа.
Данная модель и соответствующая цепь Маркова полностью определены стохастической матрицей P пере­ходных вероятностей (стохастичность означает, что сум­ма элементов любой строки матрицы равна 1) и вектором v начального распределения вероятностей, которому под­чиняются первые знаки всех сообщений:
P = (p(a/b)), 0≤a,b<m, v = (v(a)),
где p(a/b) — вероятность встречаемости в случайной (кроме первой) позиции текста буквы a при условии, что в предыдущей позиции встретилась буква b, v(a) — веро­ятность знака a на первой позиции случайного текста. Ве­роятность случайного сообщения (a
, a1, ..., a
0
) выража-
n – 1
ется формулой
P(a
0,a1
,...,a
) = v(a0)p(a1/a0) p(a2/a1)…p(a
n – 1
n-1/an-2
).
Вероятности матрицы P и вектора v удовлетворяют условиям:
1) p(a/b),v(a) ≥ 0 для всех a,b∈Z
;
m
2) p(a/b)=0 ⇔ биграмма (b,a) запретная;
3) v(0) + v(1) + ... + v(m — 1) = 1;
4) p(0/b)+p(1/b)+...+p((m — 1)/b)=1, b∈Z
,
m
то есть b-я строка матрицы P есть условное распределение вероятностей букв алфавита (при условии, что предыду­щая буква равна b.
В данной модели представляет интерес распределе­ние вероятностей на множестве букв алфавита, называе­мое стационарным распределением знаков алфавита. Это
— 29 —
Глава 2. Математические модели источников открытых сообщений
( ) ( ) ( )
/, 0 ;
wa wb pa b a m
∑
распределение полностью определено матрицей P и век­тором v.
Вектор w=(w(0),w(1),...,w(m-1)) стационарного рас­пределения знаков алфавита в случайном тексте опреде­ляется как решение системы уравнений
 
w w wm
= ≤<
0
bm
≤<
0 1 1 1.
+ +…+ − =
( ) ( ) ( )
Эта модель учитывает все запретные биграммы, то есть вероятность любого слова, содержащего запрет­ную биграмму, равна 0. Однако если текст содержит про­стую запретную s-грамму при s>2, то вероятность слова может быть положительной. Это может быть, например, если запретная 4-грамма составлена из двух разрешен­ных биграмм.
Однородная цепь Маркова с глубиной зависимо­сти s>1. Открытый текст данного ДИОС является ре-
ализацией последовательности испытаний, связанных однородной цепью Маркова с m состояниями, в которой вероятность каждого символа последовательности (кроме первых s символов) зависит от вероятности предыдущего слова длины s.
Данная модель (и соответствующая цепь Маркова) полностью определяется стохастической матрицей P пе­реходных вероятностей размера m
s
m
начального распределения вероятностей всех s-грамм,
s
×m и вектором v длины
которому начальные s-граммы всех сообщений длины не меньшей s:
P = (p(a/w)), 0≤a<m, w∈
s
Z ,
m
v = (v(w)),
где p(a/w) — вероятность встречаемости в случайной по­зиции текста (кроме первых s позиций) буквы a при усло­вии, что в предыдущих s позициях встретилась s-грамма
— 30 —
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]