Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Разработка моделей криптографической защиты информации. Монография
.pdf
последовательной кластеризации, которая осуществляется в терминах
матрицы расстояний. С помощью дендрограммы можно графически или
геометрически изобразить процедуру кластеризации при условии, что
процедура оперирует только с элементами матрицы расстояний или сходства.
Для решения задачи классификации объектов, когда число классов
неизвестно, применяются в основном иерархические агломеративные
алгоритмы (например, один из них – алгоритм классификации Уорда (см.
рис. 3.2), пример использования которых достаточно подробно рассмотрен в
[61]. Сам же метод Уорда в качестве целевой функции использует
внутригрупповую сумму квадратов расстояний между каждой точкой и
средней по кластеру, содержащему этот объект. Этот метод также
представляет собой последовательную процедуру: на каждом шаге
объединяются такие два кластера, которые приводят к минимальному
увеличению целевой функции. Метод Уорда направлен на объединение
близко расположенных кластеров. В случае, когда число классов и их смысл
известен, удобно использовать алгоритмы эталонного типа [56].
Метод k-средних принадлежит к группе итеративных методов
эталонного типа. Сущность этого метода состоит в том, что процесс
кластеризации начинается с задания k случайно выбранных объектов,
которые будут служить эталонами, то есть центрами кластеров. Далее
происходит пересчет эталонов и распределение объектов по классам
(кластерам) [61]. Классификации методом k-средних проводилась при
заданном количестве разбиений k=3, после чего состав кластеров
сравнивался с результатами классификации иерархическим методом.
Классификация признаков проводилась также и с числом разбиений больше
трех (k=4;5). Установлено, что увеличение числа разбиений не приводило к
увеличению числа кластеров, а способствовало формированию
монокластеров. Результаты классификации признаков с использованием
метода Уорда и метода k-средних изображены на рисунках 3.4 и 3.5. Из
дендрограммы видно, что все пространство признаков разбивается на три
кластера.
В первый кластер вошли следующие признаки: SK_128, SK_192,
SK_256, SSPEED, SMIN_C, L1, R_5, CR1_7, SP_8B, RAM_9, ROM_9.
Во второй кластер вошли следующие признаки: SE_128, SE_192,
91

SE_256, SD_128, SD_192, SD_256, В1, С1, F1, G1
В третий кластер вошли следующие признаки: A3, В3, С3.
Tree Diagram for 24 Variables
Ward`s method
Euclidean distances
30
25
20
15
10
5
Linkage Distance
0
Â1
SD_256
SE_256
SD_192
SE_192
Ñ1
G1
F1
SD_128
Ñ3
Â3
A3
SE_128
RAM_9
R_5
SMIN_C
SP_8B
SSPEED
L1
CR1_7
Рисунок 3.4 – Результаты классификации признаков методом Уорда
Plot of Means for Each Cluster
4
3
2
1
0
-1
-2
L1
F1
Â1
C1
SK_128
SK_192
SK_256
SE_128
SE_192
SE_256
SD_128
SD_192
SD_256
SMIN_C
SSPEED
Variables
A3
Â3
C3
G1
R5
CR1_7
SP_8B
RAM_9
ROM_9
Рисунок 3.5 – График средних значений показателей кластеров в
ROM_9
SK_256
SK_192
SK_128
Cluster
No. 1
Cluster
No. 2
Cluster
No. 3
признаковом пространстве.
92

Этап 4. Проведение корреляционного анализа признаков. Цель данного
этапа – выявить наличие корреляционной связи между признаками внутри
каждого класса и оценить степень ее тесноты (определить значения парных
коэффициентов корреляции и произвести оценку их значимости). Результаты
проведенного анализа размещены в таблицах приложения 3. Они
подтверждают предположение о существовании значимых корреляционных
связей между признаками внутри каждого класса.
Следует отметить, что для решения задачи классификации признаков
необходисы такие признаки, для которых значения коэффициентов парной
корреляции меньше некоторого критического значения (
признаки не должны коррелировать. Критическое значение коэффициента
парной корреляции было определено из формулы
2
nr
t
набл
t
где
табличным значением t-критерия; при
r .– выборочный коэффициент корреляции [52].
в
Этап 5. Отбор признаков из каждого кластера. На основе результатов
корреляционного (приложение Е) и факторного анализов (приложение Ж)
производился выбор оптимальных (предпочтительных) признаков (из
каждого кластера по одному признаку), отвечающих выработанным
– наблюдаемое значение критерия Стьюдента (сравнивается с
набл
в
, (3.3)
2
r
в
rtt
вкрнабл
1
r 0,515), то есть
кр
– значим и наоборот);
требованиям.
Для определения информативности признаков предлагается
использование результатов факторного анализа.
Исходными данными для обоснования информативности признаков
явились:
1. Кластерный анализ признаков, который позволил сформировать
классы однородных признаков. Каждый класс составляет (определяет) один
фактор, т.е. каждый фактор – это набор определенных признаков.
93

2. Каждый признак внутри фактора имеет свой весовой коэффициент
m
1
2
(факторную нагрузку), который определяет вклад признака в фактор.
a
jr
3. Коэффициент информативности набора признаков (фактора)
определяется по формуле [61]:
k
K
2
jr
j
1
и
m
j
2
a
jr
1
}WW{a
32
, (3.4)
где
iW
i
проведения анализа); k – количество
количество
каждого фактора множество значений
подмножества с нечеткими границами:
– весовой коэффициент j-го признака для r-го фактора;
a
jr
)3,2,1(
– подмножества значений
(признаков, входящих в состав фактора). Примечание. Для
a
jr
a
(разбиваются условно в ходе
a
jr
}{
WWa
jr
условно разбивается на четыре
jr
32
W – подмножество незначимых весовых коэффициентов;
W – подмножество значимых весовых коэффициентов;
W – подмножество значимых весовых коэффициентов, не
3
участвующих в формировании названия главной компоненты;
}{
WW
– подмножество значимых весовых коэффициентов,
32
;
– общее
участвующих в формировании названия.
4. Набор объясняющих признаков считается удовлетворительным, если
значения
обоснование
границы допустимых значений коэффициента информативности
информативного признака
K лежат в пределах 0,75…0,95 [61].
и
На основании исходных данных, приведенных выше, произведем
K для каждого информативного признака и определим
и
Лемма 1. Допустимые значения коэффициента информативности
K лежат в интервале
иX
j
94
K .
иX
j
kk /95,0;/75,0 .

Доказательство. Допустим, что признак является информативным, т.е.
Исходные признаки
Главные компоненты
1
2
1
11
12
2
21
22
3
4
41
42
5
6
7
1
4k
его
Набор }{
коэффициент информативности набора может принимать следующие
значения
(весовой коэффициент) принадлежит подмножеству }{
a
jr
WW
состоит из k объясняющих информативных признаков, а
32
K 0,75…0,95. Из этого следует, что kkK
и
Пример 1. Пусть в результате факторного анализа получены следующие
значения весовых коэффициентов:
X
j
X
X
X
31
X
и их весовые коэффициенты
F
a = 0,9
a = 0,8
a = 0,1
a = 0,8
uX
j
F
a = 0,1
a = 0,4
a = 0,8
32
a = 0,3
WW
32
/95,0.../75,0
.
.
X
51
X
61
X
71
m
Выделим для первого фактора
подмножества весовых коэффициентов (см. табл.).
W
71
j
1
2
a
jr
31
71
10
,a
20
,a
a = 0,3
a = 0,7
a = 0,2
2,72
F (первой главной компоненты)
90
11
,a
21
41
80
,a
80
,a
70
W
2
30
,aW
513
WW
32
51
61
a = 0,7
52
a = 0,2
62
a = 0,6
72
1,79
30
,a
,a
4111
6121
8090
,a,a
7080
,a,a
В решающее подмножество }{
,,, XXXX , т.е.
6421
WW
вошли элементарные признаки:
32
. Значение коэффициента информативности дает
95

основание утверждать, что состав подмножества для фактора
1
1
4
надежен:
F достаточно
49,064,064,081,0
K ,
1
и
т.е. значениями признаков
главной компоненты
информативности для признаков
64,0
K ; 18,0
иX
4
Допустимые значения коэффициента информативности
информативного признака
интервале
объясняющий признак
коэффициента информативности попадает в указанный интервал),
72,2
F на 95%. Далее определим коэффициенты
, XX :
64
49,0
235,0
K .
иX
6
K в данном случае должны находиться в
иX
j
72,2
238,0;188,0 . Таким образом, можно сделать вывод, что
X является информативным (значение
,,, XXXX определяется состав
04,049,009,064,001,064,081,0
6421
58,2
72,2
95,0
X -
6
считается неудовлетворительным (малоинформативным).
В результате использования предложенной методики был сформирован
набор признаков классификации {SK_256, SE_256, C3}.
Этап 6. Классификация алгоритмов шифрования. На данном этапе
проводится классификация алгоритмов шифрования в пространстве 24-х
признаков. В дальнейшем результаты данной классификации АШ будут
сравниваться с результатами классификации алгоритмов шифрования по трем
признакам.(SK_256, SE_256, C3). Результаты классификации методом Уорда
и методом k - средних представлены в приложении И.
Этап 7. Окончательная классификация алгоритмов. Проводилась
классификация алгоритмов в пространстве сформированных ранее наборов
признаков. Сравнительный анализ кластеров, полученных при
классификации методами Уорда и k-средних, позволил обнаружить схожесть
(подобие) их структур, что является результатом устойчивой классификации
(см. рис. 3.6 и табл. 3.1).
96

Tree Diagram for 14 Cases
Ward`s method
Euclidean distances
7
6
5
4
3
2
Linkage Distance
1
0
MAG
DEAL
FROG
SAFR
DFC
LOKI
E2
CAST
TWOF
SERP
MARS
RIJN
RC6
CRYP
Рисунок 3.6 – Результат классификации методом Уорда при наборе
признаков {SK_256, SE_256, C3}
Таблица 3.1 – Результат классификации методом k-средних
при наборе признаков { SK_256, SE_256, C3 }
Элементы (члены) кластера 1 (g14_z_r.sta)
TWOF SAFR DEAL MAG
Расстояние
1,474039 0,156334 0,212876
1,60645
Элементы (члены) кластера 2 (g14_z_r.sta)
CRYP RC6 RIJN E2 MARS
Расстояние 0,282469 0,274998 0,149729 0,421642 0,127984
CAST SERP LOKI DFC
Расстояние
0,063595 0,181283 0,391403 0,290936
Элементы (члены) кластера 3 (g14_z_r.sta)
FROG
Расстояние 0,00
97

Этап 8. Формирование обучающих выборок и получение
дискриминантных функций. На данном этапе формируются обучающие
выборки на основе ранее проведенного кластерного анализа (методом kсредних) и выполняется дискриминантный анализ. Дискриминантный анализ,
как раздел многомерного статистического анализа, включает в себя
статистические методы классификации многомерных наблюдений (в нашем
случае алгоритмов шифрования) в ситуации, когда исследователь обладает
так называемыми обучающими выборками [49].
В общем случае задача дискриминации формулируется следующим
образом. Пусть результатом наблюдения над объектом является реализация k-
мерного случайного вектора .),,,(
21
T
xxxX Требуется установить
k
правило, согласно которому по наблюденному значению вектора X объект
относят к одной из возможных совокупностей .,,2,1, li
i
Для
построения правила дискриминации все выборочное пространство R
значений вектора X в
R объект относят к совокупности
i
.
i
Правило дискриминации выбирается в соответствии с определенным
принципом оптимальности на основе априорной информации о
совокупностях
p извлечения объекта из
i
. При этом следует учитывать
i
размер убытка от неправильной дискриминации. Априорная информация
может быть представлена как в виде некоторых сведений о функции kмерного распределения признаков в каждой совокупности, так и в виде
выборок из этих совокупностей. Априорные вероятности могут либо заданы,
либо нет. В нашем случае априорные вероятности не заданы, а известны
выборки, представленные алгоритмами каждого кластера, полученных в
результате проведенного кластерного анализа.
В этом случае задача дискриминации ставится следующим образом
[50].
)(
Пусть
1
nj ,,2,1
; причем каждый j-й объект выборки представлен k-мерным
i
ii
2
вектором параметров
)()(
i
,,,
xxx - выборка из совокупности l,,,i,
n
i
i
)(
j
i
j
1
i
iq
Ti
)()()(
xxxX )(
. Произведено
ik
98
i
21
;

дополнительное наблюдение
1
2
1
2
1
T
xxX ),,(1 над объектом,
k
принадлежащим одной из совокупностей
. Требуется построить правило
i
отнесения наблюдения X к одной из этих совокупностей.
Обычно в задаче различения переходят от вектора признаков,
характеризующих объект, к линейной функции от них, дискриминантной
функции - гиперплоскости, наилучшим образом разделяющей совокупность
выборочных точек.
Наиболее изучен случай, когда известно, что распределение векторов
признаков в каждой совокупности нормально, но нет информации о
параметрах этих распределений. Здесь естественно заменить неизвестные
параметры распределения в дискриминантной функции их наилучшими
оценками. Правило дискриминации можно основывать на отношении
правдоподобия.
Непараметрические методы дискриминации не требуют знаний о
точном функциональном виде распределений и позволяют решать задачи
дискриминации на основе незначительной априорной информации о
совокупностях, что особенно ценно для практических применений [51].
Прежде чем приступить к рассмотрению алгоритма дискриминантного
анализа, обратимся к его геометрической интерпретации.
На рисунке 3.7 изображены объекты, принадлежащие двум различным
множествам
двумя переменными
М и 2М . Каждый объект характеризуется в данном случае
, xx . Если рассматривать проекции объектов (точек)
на каждую ось, то эти множества пересекаются, т.е. по каждой переменной
отдельно некоторые объекты обоих множеств имеют сходные
характеристики. Чтобы наилучшим образом разделить два рассматриваемых
множества, нужно построить соответствующую линейную комбинацию
переменных
, xx . Для двумерного пространства эта задача сводится к
определению новой системы координат. Причем новые оси L и C должны
быть расположены таким образом, чтобы проекции объектов,
принадлежащих разным множествам на ось L, были максимально разделены.
Ось C перпендикулярна L и разделяет два множества точек наилучшим
образом, т.е. чтобы множества оказались по разные стороны от этой прямой.
99

При этом вероятность ошибки классификации должна быть минимальной.
1
221
1
)(x
f
2
1
1
1
2
2
2
cxf)
(
x21x
1
2
M12x
22
x
L
Сформулированные условия должны быть учтены при определении
коэффициентов
)( xaxaxf
Функция
а величины
Пусть
множества (класса). Тогда для множества
a и 2a следующей функции:
. (3.5)
называется канонической дискриминантной функцией,
, xx - дискриминантными переменными.
- среднее значение j- го признака у объектов i- го
x
ij
)(1xf будет равно:
для множества
М среднее значение функции )(2xf равно:
)( xaxaxf .
Геометрическая интерпретация этих функций – две параллельные
М среднее значение функции
xaxa)x(f ;
122111
222211
прямые, проходящие через центры классов (множеств) (рис. 3.7).
x
M
)(1xf
11
)(2xf
1
Рис. 3.7 – Центры разделяемых множеств и константа дискриминации
100
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
