- •Оглавление
- •ВВЕДЕНИЕ
- •1.1. Предмет криптографии и основные определения
- •1.2. Математические основы криптографии
- •1.3. Математическая модель шифра
- •1.4. Классификация шифров
- •1.5. Обзор истории криптографии
- •Появление шифров
- •Становление криптографии как науки
- •Криптография в Новое время
- •Научная криптология
- •2.1. Понятие подстановки
- •2.2. Математическая модель шифра подстановок
- •2.3. Сравнимость
- •2.4. Примеры классических шифров подстановок
- •2.5. Математическая модель шифра перестановок
- •2.6. Маршрутные перестановки как пример шифра перестановок
- •ГЛАВА 3 Характеристики открытых текстов. Вероятностный подход
- •3.2. Вероятностный подход к анализу текстов
- •Частоты букв европейских языков, в %
- •Частоты символов русского языка, в %
- •Сочетаемость букв русского языка
- •Чередование гласных и согласных для текста длиной 105 знаков
- •Буква
- •Буква
- •4.1. Теоретико-информационный подход к анализу текстов
- •4.2. Комбинаторный подход к анализу текстов
- •Современные симметричные криптосистемы
- •5.1. Математическая модель шифра замены
- •5.2. Классификация шифров замены
- •ГЛАВА 6 Принципы построения симметричных шифров
- •6.1. Принципы построения поточных шифров
- •6.2. Принципы построения блочных шифров
- •ГЛАВА 7 Математические основы асимметричной криптографии
- •7.1. История и основные определения асимметричной криптографии
- •7.2. Основы теории простых чисел
- •7.3. Функция Эйлера
- •ГЛАВА 8 Теоремы асимметричной криптографии и алгоритм RSA
- •8.1. Основные теоремы асимметричной криптографии
- •8.2. Алгоритм RSA
- •9.1. Задачи асимметричной криптографии
- •10.1. Понятие электронной подписи
- •10.2. Алгоритм электронной подписи на основе алгоритма RSA
- •ГЛАВА 11 Управление криптографическими ключами
- •11.1. Задачи управления криптографическими ключами
- •11.2. Генерация ключей
- •11.3. Хранение ключей
- •Заключение
- •Список рекомендованной литературы
1)повторяемость букв;
2)повторяемость пар букв (биграмм), троек (триграмм) и вообще последовательностей из n букв (n-грамм);
3)сочетаемость букв друг с другом;
Эти и другие характеристики изучаются на основе наблюдений текстов большой длины, однако не являются полными характеристиками, так как значительно зависят от тематики текста. Например, в научном тексте,
изобилующем словами функция, дифференциал, коэффициент, диффузия,
буква ф встречается гораздо чаще среднего.
Табл. 3.1 содержит частоты букв в основных европейских языках, а табл. 3.2 – в русском языке.
Таблица 3.1
Частоты букв европейских языков, в %
Буква |
Франц. |
Нем. |
Англ. |
Исп. |
Итал. |
A |
7,68 |
5,52 |
7,96 |
12,90 |
11,12 |
B |
0,80 |
1,56 |
1,60 |
1,03 |
1,07 |
C |
3,32 |
2,94 |
2,84 |
4,42 |
4,11 |
D |
3,60 |
4,91 |
4,01 |
4,67 |
3,54 |
E |
17,76 |
19,18 |
12,86 |
14,15 |
11,63 |
F |
1,06 |
1,96 |
2,62 |
0,70 |
1,15 |
G |
1,10 |
3,60 |
1,99 |
1,00 |
1,73 |
H |
0,64 |
5,02 |
5,39 |
0,91 |
0,83 |
I |
7,23 |
8,21 |
7,77 |
7,01 |
12,04 |
J |
0,19 |
0,16 |
0,16 |
0,24 |
0,00 |
K |
0,00 |
1,33 |
0,41 |
0,00 |
0,00 |
L |
5,89 |
3,48 |
3,51 |
5,52 |
5,95 |
M |
2,72 |
1,69 |
2,43 |
2,55 |
2,65 |
N |
7,61 |
10,20 |
7,51 |
6,20 |
7,68 |
O |
5,34 |
2,14 |
6,62 |
8,84 |
8,39 |
P |
3,24 |
0,54 |
1,81 |
3,26 |
2,66 |
Q |
1,34 |
0,01 |
0,17 |
1,55 |
0,48 |
R |
6,81 |
7,01 |
6,83 |
6,95 |
6,56 |
S |
8,23 |
7,07 |
6,62 |
7,64 |
4,81 |
T |
7,30 |
5,86 |
9,72 |
4,36 |
7,07 |
U |
6,05 |
4,22 |
2,48 |
4,00 |
3,09 |
V |
1,27 |
0,84 |
1,15 |
0,67 |
1,67 |
W |
0,00 |
1,38 |
1,80 |
0,00 |
0,00 |
X |
0,54 |
0,00 |
0,17 |
0,07 |
0,00 |
Y |
0,21 |
0,00 |
1,52 |
1,05 |
0,00 |
Z |
0,07 |
1,17 |
0,05 |
0,31 |
1,24 |
33
Таблица 3.2
Частоты символов русского языка, в %
_ |
17,5 |
К |
2,8 |
Х |
0,9 |
А |
6,2 |
Л |
3,5 |
Ц |
0,4 |
Б |
1,4 |
М |
2,6 |
Ч |
1,2 |
В |
3,8 |
Н |
5,3 |
Ш |
0,6 |
Г |
1,3 |
О |
9,0 |
Щ |
0,3 |
Д |
2,5 |
П |
2,3 |
Ъ, Ь |
1,4 |
Е, Ё |
7,2 |
Р |
4,0 |
Ы |
1,6 |
Ж |
0,7 |
С |
4,5 |
Э |
0,3 |
З |
1,6 |
Т |
5,3 |
Ю |
0,6 |
И |
6,2 |
У |
2,1 |
Я |
1,8 |
Й |
1,0 |
Ф |
0,2 |
|
|
За счет повторяемости корней, суффиксов, окончаний существенными характеристиками являются также частотные характеристики биграмм и триграмм осмысленных текстов. Так, в русском языке наиболее часто встречающимися являются следующие биграммы и триграммы:
СТ, НО, ЕН, ТО, НА, ОВ, НИ, РА, КО, ВО СТО, ЕНО, НОВ, ТОВ, ОВО, ОВА.
Полезной является информация о сочетаемости букв. В табл. 3.3 в центральном столбце расположены буквы русского алфавита. Слева и справа – наиболее частые «соседи» в порядке убывания частоты.
Таблица 3.3
Сочетаемость букв русского языка
Слева |
Буква |
Справа |
л, д, к, т, в, р, н |
А |
л, н, с, т, р, в, к, м |
я, е, у, и, а, о |
Б |
о, ы, е, а, р, у |
я, т, а, е, и, о |
В |
о, а, и, ы, с, н, л, р |
р, у, а, и, е, о |
Г |
о, а, р, л, и, в |
р, я, у, а, и, е, о |
Д |
е, а, и, о, н, у, р, в |
м, и, л, д, т, р, н |
Е, Ё |
н, т, р, с, л, в, м, и |
р, е, и, а, у, о |
Ж |
е, и, д, а, н |
о, е, а, и |
З |
а, н, в, о, м, д |
р, т, м, и, о, л, н |
И, Й |
с, н, в, и, е, м, к, з |
ь, в, е, о, а, и, с |
К |
о, а, и, р, у, т, л, е |
г, в, ы, и, е, о, а |
Л |
и, е, о, а, ь, я, ю, у |
я, ы, а, и, е, о |
М |
и, е, о, у, а, н, п, ы |
д, ь, н, о, а, и, е |
Н |
о, а, и, е, ы, н, у |
р, п, к, в, т, н |
О |
в, с, т, р, и, д, н, м |
34
Слева |
Буква |
Справа |
в, с, у, а, и, е, о |
П |
о, р, е, а, у, и, л |
и, к, т, а, п, о, е |
Р |
а, е, о, и, у, я, ы, н |
с, т, в, а, е, и, о |
С |
т, к, о, я, е, ь, с, н |
ч, у, и, а, е, о, с |
Т |
о, а, е, и, ь, в, р, с |
п, т, к, д, н, м, р |
У |
т, п, с, д, н, ю, ж |
н, а, е, о, и |
Ф |
и, е, о, а |
у, е, о, а, ы, и |
Х |
о, и, с, н, в, п, р |
е, ю, н, а, и |
Ц |
а, е, и, у |
е, а, у, и, о |
Ч |
и, е, а, ы |
ь, у, ы, е, о, а, и. в |
Ш |
е, и, т, н |
е, б, а, я, ю |
Щ |
е, и, а |
м, р, т, с, б, в, н |
Ы |
л, х, е, м, и, в, с, н |
н, с, т, л |
Ь, Ъ |
н, к, в, п, с, е, о, и |
с, ы, м, л, д, т, р, н |
Э |
н, т, р, с, к |
ь, о, а, и, л, у |
Ю |
д, т, щ, ц, н, п |
о, н, р, л, а, и, с |
Я |
в, с, т, п, д, к, м, л |
Возможно также применение данных о частоте встречаемости биграмм вида гласная-гласная (Г-Г), гласная-согласная (Г-С), согласная-гласная (С-Г), согласная-согласная (С-С), которые приведены в табл. 3.4.
Таблица 3.4
Чередование гласных и согласных для текста длиной 105 знаков
|
Г |
С |
Всего |
Г |
6588 |
38310 |
44898 |
С |
38296 |
16806 |
55102 |
Систематическими исследованиями зависимостей букв в текстах занимался российский ученый Андрей Андреевич Марков (1856–1922 гг.). Состоят они в следующем.
Пусть имеется алфавит AN = {a1, a2, a3, …, aN} мощности N и некоторая последовательность символов с1 с2 с3…сn, называемая иначе n-граммой.
Требуется определить вероятность появления в тексте, составленном на основе алфавита AN, этой n-граммы. Искомую вероятность будем обо-
значать p(c1 c2 c3…cn).
Для построения самой простой модели предположим, что символы в тексте появляются независимо от предыдущих. Вероятность появления каждого символа из ci, i=1, …, n равна p(ci).
35
Тогда
n |
|
p(c1c2 ...cn )= ∏p(ci ), |
(3.1) |
i=1
что следует из теоремы умножения вероятностей для независимых событий.
Такую модель назовем вероятностной моделью текста первого приближения.
Усложним построенную модель, для чего предположим, что каждый символ n-граммы появляется в зависимости от того, какой был предыдущим. В этом случае события появление символа ci-1 и появление символа ci становятся зависимыми. Это значит, что существует вероятность появления символа ci в зависимости от ci-1, которая называется условной вероятностью и обозначается p ( ci | ci-1 ).
Так как первый символ сообщения появляется независимо, а каждый последующий зависит от одного предыдущего, вероятность появления n- граммы c1c2…cn выражается формулой
n |
|
p(c1c2 ...cn )= p(c1) ∏p(ci |ci−1). |
(3.2) |
i=2
Такая модель называется вероятностной моделью текста второго приближения, а последовательность, сгенерированная на основе этой мо-
дели, называется цепью Маркова первого порядка.
Выполним третий шаг построений. Предположим, что вероятность появления символа в тексте зависит от двух предыдущих. Тогда первый символ n-граммы ни от чего не зависит, второй появляется в зависимости от первого, а каждый следующий – в зависимости от двух предыдущих. Тогда вероятность появления n-граммы выражается следующей формулой:
n |
|
p(c1c2 ...cn )= p(c1) p(c2 |c1)∏p(ci |ci−2ci−1) |
(3.3) |
i=3
и называется вероятностной моделью текста третьего приближения.
Последовательность, сгенерированная по этой формуле, называется цепью Маркова второго порядка.
36
Все вероятности, которые используются в формулах (3.1) – (3.3), вычисляются на основе анализа текстов большой длины и могут меняться в зависимости от характера текста.
Приведем пример текстов, сгенерированных с использованием теории марковских цепей. Пример построен на основе русского алфавита со знаком пробела.
Пример 3.1
1) на основе модели первого приближения (генерируемый символ ни от чего не зависит):
ПАВЛНТ И ОАБУТ ЕИИЕТК ЖМЕ КСВИДАИВ;
2) на основе модели второго приближения (каждый генерируемый символ зависит от одного предыдущего):
МОЙ ОГЛЬ ТАМАНУ ЧТЕТОГАНЕ СТА СЛИНА;
3) на основе модели второго приближения (каждый генерируемый символ зависит от двух предыдущих):
КРУЖБЫ И ОТЧАЕТОНЕИСТАК ПЕХ ЭТОГО 3;
4)на основе модели второго приближения (каждый генерируемый символ зависит от трех предыдущих):
ВДЕПАРЫ ЧТО НАСТЯМИ РАСПРОИСХОДИН;
5)на основе модели второго приближения (каждый генерируемый символ зависит от четырех предыдущих):
ПОНЯЛ О ГЛУБОКОЙ СИСТЕМЕ И ДЕЛЕ ВОДЫ.
Уже на пятом шаге мы получили текст, состоящий из осмысленных слов. Однако генератор, выдающий символы для построения текста, основывался только на вероятностной мере появления того или иного символа после определенной n-граммы. Следует отметить, что при длине построенной цепи, приближающейся к 30 символам, зависимость вероятности появления следующего символа от предыдущих исчезает.
37
