Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Многомерные статистические методы. Ч.2. Учебное пособие

.pdf
Скачиваний:
0
Добавлен:
07.09.2026
Размер:
2 Мб
Скачать
Министерство образования и науки Российской Федерации
Рязанский государственный радиотехнический университет
Е.П. ЧУРАКОВ
Многомерные статистические
методы
Учебное пособие
Рязань 2014
УДК 519.237(075.8) ББК 22.172я73 Многомерные статистические методы: учеб. пособие / Е.П. Чура­ков, Рязан. гос. радиотехн. ун-т; Рязань, 2014. ч.2 48с. Вторая часть пособия является естественным продолжением курса «Многомерные статистические методы», первая часть которого под таким же названием опубликована ранее [13]. Основное внимание во второй части пособия уделено методам кластерного анализа и много­мерного шкалирования. Приводится ряд конкретных исследований, проведенных с использованием этих подходов. Предназначено для студентов специальности 080116 “Математические методы в экономи­ке” и направлений 010400 “Прикладная математика и информатика” с профилем подготовки “Математическое и информационное обеспече­ние экономической деятельности” и 080500 “Бизнес-информатика”.
Библиогр.: 23 назв.
Многомерный анализ, векторные случайные величины, кластерный
анализ, многомерное шкалирование
Печатается по решению редакционно-издательского совета Рязан­ского государственного радиотехнического университета.
Рецензент: кафедра ЭиММ Рязанского государственного радио­технического университета (зав. кафедрой В.К. Клочко)
Ч у р а к о в Евгений Павлович
Многомерные статистические методы
Редактор М.Е.Цветкова Корректор С.В. Макушина Подписано в печать18.07.14. Формат бумаги 60x84 1/16. Бумага писчая. Печать трафаретная. Усл. печ. л 3,0. Тираж 50 экз. Заказ Рязанский государственный радиотехнический университет. 390005, Рязань, ул. Гагарина, 59/1. Редакционно-издательский центр РГРТУ.
© Рязанский государственный радиотехнический университет, 2014
4. Основы кластерного анализа
,,...,,
21 k
XXX
T
k
XXX ],...,,[21X
1
X
2X
3
X
4
X
5
X
6
X
7
X
k
n
n
11 12 1
21 22 2
12
... ...
... ... ... ...
...
n
n
kn
k k kn
x x x x x x
R
x x x
  
  
ij
x
jki ,,1
.,1 n
j
X
4.1. Назначение кластерного анализа Кластерный анализ в настоящее время представляет собой хорошо
развитую методологию решения задач классификации данных и обла­дает разнообразными подходами и обширным алгоритмическим обес­печением. Достаточно цельное изложение существа кластерного ана­лиза содержится в работах [1] – [5]. Кратко изложим наиболее фунда­ментальные положения классификационных проблем, решаемых сред­ствами кластерного анализа. Существо кластерного анализа заключается в следующем. Пусть некоторое экономическое (для определенности) явление характеризу-
ется kпризнаками
т.е. многомерной величиной
. Например:
ботки на одного работника;
мер оборотных производственных средств;
выпуск единицы товарной продукции; ленно-производственного персонала;
ции;
что эти мер, на
уровень энерговооруженности труда и т.п. Далее полагаем,
признаков были зарегистрированы на
предприятиях), т.е. каждый признак измерен nраз. В итоге
уровень среднегодовой выра-
уровень фондоотдачи;
размер затрат на
численность промыш-
рентабельность продук-
объектах (напри-
раз-
формируется матрица Xэкспериментальных данных
X=
(4.1)
где
- значение i-го признака на j-м объекте (при j-м измерении), Произвольный j-й столбец этой матрицы, таким
образом, представляет собой значение вектора Xна
-м объекте. Так
как все компоненты вектора Xмогут иметь различные смысловое со­держание и единицы измерения, элементы матрицы
обычно цен-
трируются и нормируются, т. е. осуществляется переход к стандарти­зованной форме представления данных. Для этого, что уже отмеча-
4
n
j
iji
x
n
x
1
1
2
2
1
1
1
n
i ij i
j
s x x
n

2
ii
ss
.,1 ki
k
kkn
k
kk
k
kk
n
n
s
xx
s
xx
s
xx
s
xx
s
xx
s
xx
s
xx
s
xx
s
xx
...
............
...
...
21
2
22
2
222
2
221
1
11
1
112
1
111
Y
X
, 1, ,
k
i
R i n iY
k
R
n
k
R
Y
k
R
nm
m
i
Y
лось, вычисляются эмпирическое среднее каждого признака, несме­щенная оценка его дисперсии и среднеквадратичное отклонение, соот­ветственно:
С использованием этих величин строится матрица
Каждый столбец этой матрицы, следовательно, является стандарти-
зованным вектором объекте. Пусть
В пространстве рых отображает положение соответствующего ей объекта в простран-
стве
ство Y, состоящее из nточек в пространстве
образов), где
каждая точка ки, отнесенные к разным кластерам, опять же, в определенном смыс-
ле, разнились. Под кластером, таким образом, понимается полученная в результате разбиения группа объектов (векторов, точек), обладаю­щих определенной общностью. Методы построения таких групп и на­зываются кластерным анализом (иногда численной таксономией или распознаванием образов с самообучением).
4.2. Расстояние между объектами Одним из начальных понятий кластерного анализа является “рас-
стояние” между двумя произвольными элементами множества Y. Это понятие может носить различный содержательный смысл, но обычно основывается на аксиоматике метрического пространства и удовле-
,
,
,
(4.2)
. (4.3)
, зарегистрированным на соответствующем
-й столбец матрицы Y(i-й вектор).
эти векторы формируют
точек, каждая из кото-
. Множество этих точек, как и матрицу, обозначим символом
. Задача кластерного анализа заключается в том, чтобы все множе-
, разбить на
однородных в некотором смысле групп (кластеров, таксонов,
в общем случае неизвестно, таким образом, чтобы
была отнесена только к одному кластеру и чтобы точ-
5
,
ij
Y Y Y
ql
k
s
q
q
sjsijiq
yy
1
1
)(),( YY
.1q
si
y
s
.iY
k
R
ji
YY ,
YYY
ji
,
ji
T
Jijijijijie
YYYYYYYYYYYY ,),(
Y
.2q
,,
1
ji
T
JijiM
YYWYYYY
W
EW
E
,
1
ii
wdiag
W
1
W
.,1, kiwii
q
l
.
,1
sup
,
sjsiJi
yy
ks
l
YY
1q
blockcity
(1l
),jiYY
.
s
sjsi
yy
творяет соответствующим аксиомам метрики (например, [6, 7]). Наиболее часто используют следующие определения расстояний меж-
ду элементами
.
1. Гельдерово (или Минковского) расстояние (
Здесь и далее
2. Если пространство
делено скалярное произведение
где здесь и далее символ
расстояние является частным случаем гельдерова при
3. Расстояние Михаланобиса (обобщенное евклидово расстоя-
ние):
где рица. В случае ланобиса совпадает с евклидовым.
4. “Взвешенное” евклидово расстояние следует из предыдущего,
если принять
некоторая симметрическая положительно определенная мат-
-й компонент вектора
, то обычно используют евклидово расстояние:
:
,
является евклидовым, т.е. в нем опре-
означает норму вектора .Y Евклидово
единичная матрица, расстояние Миха-
т.е. если матрица
расстояние):
.
векторов
,
является
диагональной с элементами главной диагонали
5. При
супремум расстояние (
6. При
гельдерово расстояние порождает так называемое
расстояние):
получают так называемое
=
.
расстояние:
6
i
Y
i
Y
.,jiYY
l
S
,mS
,,,
mlml
SSYSYS
l
S
l
n
mm
nS
l
Y
1
,
il
i
l
n
YS
Y
1
jm
mj
m
n

YS
YY
l
S
m
S
min
min
, , .
,
l m i j
i l j m
d 

S S Y Y
Y S Y S
ml
SS ,
Наиболее распространенным в кластерном анализе является евкли­дово расстояние. Это объясняется как наглядностью геометрического смысла евклидова расстояния, так и математическим “комфортом” работы с ним. Его целесообразно применять, если компоненты произ-
вольного вектора
однородны по своему физическому смыслу и все
они одинаково важны при решении вопроса об отнесении вектора к определенному кластеру. Если последние условия не выполняются,
переходят к взвешенному расстоянию или расстоянию Михаланобиса с более гибкими возможностями уравновешивания значимости и со-
держания различных компонентов векторов
4.3. Расстояние между кластерами Вторым важным понятием кластерного анализа является расстоя-
ние между кластерами. Это понятие вводится также не единственным образом и имеет различный содержательный смысл. Снова ограничим рассмотрение наиболее характерными определениями.
Предположим, что на множестве Y выделены два кластера –
и жество. Далее допускаем, что кластер
чек), а кластер
арифметические средние векторов, формирующих кластеры
причем
объектов. Пусть
содержит
пустое мно-
объектов (то-
и
соответственно (“центры тяжестей” кластеров). Наиболее используе­мыми в кластерном анализе оказываются следующие виды расстояний между кластерами.
1. Минимальное локальное расстояние по принципу “ближайше-
го соседа”:
В этом случае на множествах ленные друг от друга точки и расстояние между кластерами отожде-
ствляется с расстоянием между этими точками.
2. Максимальное локальное расстояние по принципу “дальнего
соседа”:
ищутся две минимально уда-
7
max
max
, , .
,
l m i j
i l j m
d 

S S Y Y
Y S Y S
, , .
öò l m l m
d S S Y Y
1
,,
i l j m
ñð l m i j
lm
d
nn



Y S Y S
S S Y Y
, ( ).
T
lm
ñòàò l m l m l m
lm
nn
d
nn
S S Y Y Y Y
i
Y
j
Y
Y
11
1
, , ,
2
nn
d i j i j
ijr

Y Y Y Y Y
d
r
2
1
, 4 / 2
d
r N n
N
,,
i j j i
 Y Y Y Y
, 0.
ii
YY

11
1
,
nn
T
i i i
in

Y
R Y Y Y Y Y Y
Y
Это определение аналогично предыдущему, но основано на наи­более удаленных друг от друга точках.
3. Расстояние по “центрам тяжести”:
4. Среднее расстояние между кластерами (расстояние по принци-
пу “средней связи”):
.
5. Статистическое расстояние между кластерами:
Во всех этих определениях расстояние между точками
и
понимается в одном из рассмотренных выше принципов.
4.4. Индивидуальные свойства кластеров
Третий вид характеристик, используемых в кластерном анализе, направлен на отображение индивидуальных свойств отдельных кла­стеров или всего множества Y в целом. Так как существо этих ха­рактеристик сохраняется и при рассмотрении отдельного кластера, и всего множества
, рассмотрим их применительно к Y.
1. Величина
,
называется общим расстоянием множества .Y
2. Величина
называется средним расстоянием множества Y. В этих определениях традиционно принимается
. и
3. Квадратная матрица размерностью n
называется матрицей рассеивания множества суммы квадратов).
(иногда матрицей
8
Y
R
Y

11
.
nn
TT
ñò i i i i
ii
r Sp Sp



 
Y
R Y Y Y Y Y Y Y Y
Y
R
Y
R
.
d
r YR
Y
Y
12
, ,..., ; , 1, .
mi
imS S S S Y
2
1
1
( , ).
il
m
il
lJ


YS
YY
,
il
YY
1
J
()
ñò
rl
1
J
4. След матрицы
множества
называют статистическим рассеянием
(суммой квадратов отклонений, дисперсий)
5. Определитель
матрицы
называют статистическим
рассеянием, соответствующим определителю, и обозначают
4.5. Целевые функции классификации Разбиение множества
на отдельные классы может быть осуще-
ствлено различными способами. Многие из них описаны в различных документах по применению пакетов прикладных программ (например, [8], [9]). Снова ограничим рассмотрение изложением некоторых доста­точно общих принципов. Чтобы один способ предпочесть остальным, в рассмотрение вводят некую целевую функцию (показатель качества классификации), значе­ние которой явилось бы количественной оценкой степени совершенст­вования того или иного метода классификации. Тогда поиск наилуч­шего варианта разбиения множества на отдельные классы сводится к поиску экстремума этой целевой функции. Разбиение, при котором целевая функция достигает экстремального значения, и будет решени­ем задачи классификации. В настоящее время отсутствует строгая формализованная система рекомендаций по выбору целевой функции. Этот выбор подчиняется интуитивно-эмпирическим соображениями и в каждом частном случае осуществляется индивидуально. Достаточно распространенными ока­зываются следующие целевые функции.
Пусть на множестве
выделены кластеры
Тогда качество классификации можно харак-
теризовать следующими функциями.
1. Сумма внутри классовых дисперсий:
Если расстояние
внутренняя сумма в
есть не что иное, как статистическое рассеяние
понимается в евклидовом смысле, то
l-го кластера (см. соответствующее определение), и
представляет собой сумму статистических рассеяний всех mкласте­ров:
9
 
1
1
.
m
ñò
l
J r l
2
J
2
1,
( , ).
j li
m
ij
l


Y Y S
YY
2
3
1,
1
, ).
i j l j
m
ij
l
l
J
n



Y Y S
(Y Y
1 2 3
,,J J J
Y
( )( )
il
T
l i l i l
YS
R Y Y Y Y
l
1
.
m
l
l
R
4
11
)( )
ll
mm
T
l i l i l
ll
J
 
 
YS
R (Y Y Y Y
1
J
4
J
i
Y
.k
1 2 3 4
, , ,J J J J
m
.m
2. Сумма квадратов попарных внутриклассовых расстояний ме-
жду объектами:
Или:
В большинстве практических задач целевые функции
водят к одним и тем же разбиениям множества
на mклассов.
при-
3. Обобщенная внутриклассовая дисперсия. Пусть
вляется матрицей рассеяния
кластеров опишется матрицей
-го кластера. Тогда рассеяние всех m В качестве целевой функции
принимается:
Из сопоставления с
функцию
.
можно назвать обобщенным
статистическим рассеянием, соответствующим определителю. Эту функцию рекомендуется использовать в случаях, когда возникают
предположения о том, что наблюдения
размерности, меньшей
4. Целевые функции
ном числе
классов, на которое разбивается множество Y. В прак-
принадлежат пространству
используют при априори извест-
тических задачах это число обычно неизвестно и подлежит определе­нию в процессе проведения классификации. В подобных случаях це­левая функция должна быть ориентирована на это обстоятельство и надлежащим образом его учитывать. Одним из приемов формирования целевой функции при неизвестном числе mявляется использование аддитивной структуры, приводящей к построению целевой функции в виде суммы двух слагаемых, одно из которых является невозрастаю­щей функцией числа классов mи характеризует, как правило, внутри­классовый разброс наблюдений, а второе является неубывающей функцией числа классов
В частности, предлагается [10, 11]:
10
5 1 2
,J b b
1
1
( , ),
il
m
il
lb


YS
YY
2
,b cm
0c 
i
Y
5
.J
, 1, ,
k
j
R j nY
где
некоторая константа, определяющая потери при возраста-
нии числа классов. Наилучшее разбиение (выбор числа классов и раз­несение точек
ции
по класссам) соответствует минимуму целевой функ-
4.6. Основные алгоритмы кластерного анализа
Прежде чем рассматривать основные алгоритмы кластерного ана­лиза, еще раз обратим внимание читателя на существование большего числа статистических пакетов прикладных программ, средствами ко­торых успешно решаются многие задачи обработки эксперименталь­ных наблюдений, в том числе и сводящиеся к кластерной методологии. Среди пакетов подобной направленности отметим такие распростра­ненные у нас в стране, как STATISTICA, SPSS, STADIA, STATGRAPHICS и др. Опыт и техника применения этих пакетов для решения задач кластеризации известны из многочисленных публика­ций, часть которых отражена в Internet [4]. Не ставя перед собой цели детального погружения в технологию практической работы с этими пакетами, отметим только одну алгоритмическую особенность, свой­ственную многим из них. Эта особенность проявляется в специфике организации вычислений, направленных на решение задач кластериза­ции. Используемые при этом методы принято делить на ирархические и неиерархические. Среди алгоритмов первой группы выделяются аг-
ломеративные методы и дивизимные алгоритмы. Особенность агломеративных алгоритмов проявляется в том, что на начальной стадии работы алгоритма все n наблюдаемых точек
принимаются за центры n начальных кластеров .
В последующем каждый из построенных таким образом кластеров объединяется с ближайшим к нему уже существующим кластером в рамках используемого понятия близости, что приводит к уменьшению числа кластеров и увеличению числа объектов, их формирующих. Этот процесс продолжают до тех пор, пока все n точек не окажутся объединенными в один кластер. Результаты такого последовательного построения кластеров удобно сопровождать графическими отображе­ниями, что осуществляется использованием так называемых денд- рогрмм, на которых в направлении оси абсцисс откладываются номе­ра объединяемых кластеров, а в направлении оси ординат – результаты кластеризации. Каждый этап такого эволюционного построения кла-
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]