Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Многомерный статистический анализ в экономике. Учебное пособие
.pdf
Запустить анализ. Результаты, сгенерированные программой,
будут представлены в окне вывода. Внимательно рассмотреть
полученные результаты!
Общности. Этот показатель равен доле дисперсии переменной,
обусловленной совокупным влиянием факторов. Общность можно
сравнить с множественным коэффициентом корреляции,
принимающим значение 0 в случае, если факторы не влияют на
переменную, и значение 1, если дисперсия переменной целиком
определяется выделяемыми факторами. Перед началом извлечения
факторов единичное значение общности установлено по умолчанию
для каждой переменной, участвующей в процедуре факторного
анализа.
О чем говорят полученные значения критериев КМО и
Барлетта?
По таблице «Полная объясненная дисперсия» и диаграмме
каменистой осыпи (графику собственных значений) сделать выводы:
Чему равны собственные значения каждой главной компоненты?
Какую долю общей дисперсии объясняет первая главная компонента?
Вторая? Третья? Шестая? Сколько главных компонент оставить?
Какую долю вариации исходных переменных объяснят оставленные
главные компоненты?
Главным итогом факторного анализа является матрица
факторных нагрузок. По матрице факторных нагрузок определить:
• какие главные компоненты оказывают существенную
нагрузку на каждый исходный признак?
• какие исходные признаки вносят существенный вклад в
каждую главную компоненту?
Записать полную систему уравнений = .
Записать полную систему уравнений =
.
3. Повторно провести компонентный анализ, выбрав число
главных компонент равное двум. Запросить график факторов (рис 2.5).
Провести полный анализ результатов.
Рассмотреть график факторов (для удобства он снабжен
таблицей координат). Как видно из графика факторов точки,
соответствующие переменным, расположены на удалении от осей
факторов, т.е. достигнутая структура факторов не дает простой
интерпретации смысла каждого фактора. Это же наблюдается и в
матрице факторных нагрузок. Идеальная простая структура
предполагает, что каждая переменная имеет нулевые значения
51

нагрузок для всех факторов, кроме одного, для которого нагрузка этой
переменной близка к 1 (-1).
Рис. 2.5. Диалоговое окно «Факторный анализ: вращение»
Поэтому требуется осуществить вращение факторов, целью
которого является получение простой факторной структуры, которой
соответствует большое значение нагрузки каждой переменной только
по одному фактору и малое по всем остальным факторам.
4. Провести компонентный анализ, выбрав число главных
компонент равное двум и вращение Varimax (рис. 2.6).
Рис. 2.6. Диалоговое окно «Факторный анализ: вращение»
52

Сохранить индивидуальные значения главных компонент (они
будут доступны в окне редактора данных), для чего в диалоге
Факторный анализ: Значения факторов установить флажок в поле
Сохранить как переменные.
Созданные новые переменные, содержащие индивидуальные
значения главных компонент, можно использовать в дальнейшем
анализе вместо исходных переменных.
Провести полный анализ результатов. Сравните графики
нагрузок до и после вращения. На какие переменные дает нагрузку
первая компонента? Вторая?
5. Дать названия главным компонентам (идентификация).
ТЕМА 3. ЗАДАЧИ МНОГОМЕРНОЙ КЛАССИФИКАЦИИ
Часто при исследовании больших совокупностей объектов
необходимо выявить объекты, близкие между собой в определенном
смысле. Например,
• производитель товаров массового потребления не
ориентируется, как правило, на каждого конкретного потенциального
покупателя, а сегментирует рынок, разделяя покупателей на группы
(или классы), внутри которых покупатели похожи;
• банкам удобно классифицировать заемщиков по уровню
кредитоспособности, которая определяется большим числом
различных показателей, чтобы задавать лимиты кредитов для групп
сходных (близких) между собой заемщиков, а не для каждого
конкретного заемщика;
• в свою очередь, регулирующие организации классифицируют
банки по уровню надежности;
• при сравнении стран, регионов, городов по уровню жизни,
продукцию различных производителей – по качеству, семей – по
структуре потребления и т.п. оказывается удобным отождествлять
близкие друг к другу объекты.
Приведенные примеры иллюстрируют сущность задач
классификации многомерных наблюдений (объектов), которая
заключается в разбиении большого числа объектов на однородные
группы.
53

Целью методов классификации является исследование
внутренней структуры системы n объектов, каждый из которых
характеризуется m-мерным вектором признаков, «сжатие» этой
системы без существенной потери содержащейся в ней информации
путем выявления классов сходных между собой (однородных)
объектов и отождествление объектов внутри каждого класса.
Кластерный анализ решает задачу классификации объектов при
отсутствующей априорной информации о наблюдениях внутри
классов, в дискриминантном анализе предполагается наличие такой
информации.
Среди прикладных задач, решаемых указанными методами,
отметим следующие:
• проведение классификации объектов с учетом большого числа
признаков, отражение их природу;
• выявление структуры изучаемой совокупности объектов;
• снижение объема выборки путем отождествления каждого
класса объектов с его типичным представителем;
• снижения размерности пространства путем отождествления
близких признаков (в этом случае классифицируются не объекты, а
признаки);
• построение отдельных регрессионных моделей в каждом
классе объектов. что позволяет избавиться от гетероскедастичности
(явление, когда дисперсия остатков регрессии сильно изменяется от
класса к классу).
Классификация объектов исследования, проведенная по
факторам или главным компонентам, полученным в результате
снижения размерности исходного пространства признаков,
оказывается более объективной, чем классификация тех же объектов
по исходным признакам.
К
ЛАСТЕРНЫЙ АНАЛИЗ
Кластерный анализ – это совокупность методов, позволяющих
классифицировать многомерные наблюдения, каждое из которых
описывается набором исходных переменных
, , … ,
. Целью
кластерного анализа является образование групп схожих между собой
(однородных) объектов, которые принято называть кластерами. Слово
кластер английского происхождения (cluster), переводится как сгусток,
54

пучок, группа. Родственные понятия, используемые в литературе, класс, таксон, сгущение.
Принцип образования групп (кластеров), используемый в
кластерном анализе, называется политетический подход. Все
группировочные признаки одновременно участвуют в группировке,
т.е. они учитываются все сразу при отнесении наблюдения в ту или
иную группу. При этом, как правило, не указаны четкие границы
каждой группы, а также неизвестно заранее, сколько групп
целесообразно выделить в исследуемой совокупности.
Первые публикации по кластерному анализу появились в конце
30-х годов XX века, но активное развитие этих методов и их широкое
использование началось в конце 60-х – начале 70-х годов. В
дальнейшем это направление многомерного анализа очень интенсивно
развивалось.
Методы кластерного анализа позволяют решать следующие
задачи:
• проведение классификации объектов с учетом признаков,
отражающих сущность, природу объектов. Решение такой задачи, как
правило, приводит к углублению знаний о совокупности
классифицируемых объектов;
• проверка выдвигаемых предположений о наличии некоторой
структуры в изучаемой совокупности объектов, т.е. поиск
существующей структуры;
• построение новых классификаций для слабоизученных
явлений, когда необходимо установить наличие связей внутри
совокупности и попытаться привнести в нее структуру.
Методы кластерного анализа можно разделить на две большие
группы: агломеративные (объединяющие, методы слияния) и
дивизимные (разделяющие, методы дробления). Агломеративные
методы последовательно объединяют отдельные объекты в группы
(кластеры), а дивизимные методы расчленяют группы на отдельные
объекты. В свою очередь, каждый метод как объединяющего, так и
разделяющего типа может быть реализован при помощи различных
алгоритмов.
В кластерном анализе существуют также методы, которые
трудно отнести к первой или ко второй группе. Например,
итеративные методы, в частности метод k-средних и метод поиска
сгущений. Их характерная особенность в том, что кластеры
формируются исходя из задаваемых условий разбиения (параметров),
55

которые в процессе работы алгоритма могут быть изменены
=
=
=
=
/
исследователем для достижения желаемого качества разбиения. В
отличие от агломеративных и дивизимных методов итеративные
методы могут привести к образованию пересекающихся кластеров,
когда один объект может одновременно принадлежать нескольким
кластерам.
Меры сходства. Для проведения классификации необходимо
ввести понятие сходства объектов по наблюдаемым признакам
(переменным). В каждый кластер (класс) должны попасть объекты,
имеющие сходные характеристики.
Однородными, принадлежащими одной и только одной группе
считаются объекты, наблюдаемые признаки которых находятся в
непосредственной близости друг от друга, а неоднородными –
объекты, находящиеся, судя по тем же признакам, на удалении друг от
друга сверх установленной нормы.
В кластерном анализе для количественной оценки сходства
вводится понятие метрики. Сходство или различие между
классифицируемыми объектами устанавливается в зависимости от
метрического расстояния между ними. Если каждый объект
описывается m признаками, то он может быть представлен как точка в
m-мерном пространстве, и сходство с другими объектами будет
определяться как соответствующее расстояние. В кластерном анализе
используются различные меры (метрики) расстояния между
объектами:
евклидово расстояние
взвешенное евклидово
расстояние
хеммингово расстояние
(city-block)
расстояние Минковского
56

Расстояние Чебышева
= max
,
№
п/п
1
32,5
40,3
3,5
2
38,4
46,8
4,3
3
16,7
25,7
2,0
4
42,3
44,0
4,5
№ п/п 1 2 3 4
1 0 8,81
21,55
10,36
2
8,81
0
30,35
30,48
3
21,55
30,35
0
31,57
4
10,36
30,48
31,57
0
где
- расстояние между i-м и j-м объектами;
,
– значение k-го признака (k-й переменной) у i-го и j-го
объекта соответственно;
- вес k-го признака (k-й переменной).
Пример. Определить сходство между 4 предприятиями, если
каждое из них характеризуется тремя признаками:
продукции, млрд. руб.;
фондов, млрд. руб.;
– стоимость основных производственных
– фонд заработной платы промышленно-
– производство
производственного персонала, млрд. руб (табл. 3.1).
Таблица 3.1
Матрица исходных данных
Построим матрицу евклидовых расстояний. Расстояния
между парами объектов при этом представляются обычно в виде
симметричной матрицы D (табл. 3.2).
Таблица 3.2
Матрица близостей
Как видно, самыми «близкими» являются 1-е и 2-е предприятия
= 8,81), а самыми «дальними» - 3-е и 4-е предприятия (
(
31,57).
Однако будет ли адекватным результат кластерного анализа,
если переменные (признаки) имеют различные шкалы измерения?
Оценка сходства между объектами сильно зависит от абсолютного
значения признака и от степени его вариации в совокупности. Чтобы
устранить подобное влияние на процедуру классификации, применяют
процедуру нормирования признаков одним из следующих способов:
57
=

1.
№ п/п
1
0,00205
0,13530
-0,10204
2
0,60718
0,93481
0,71429
3
-1,61846
-1,66052
-1,63215
4
1,00718
0,59041
0,91837
№ п/п 1 2 3 4
1 0 1,29
2,86
1,5
2
1,29
0
13,20
0,56
3
2,86
13,20
0
4,30
4
1,5
0,56
4,30
0
; 2.
=
=
; 3.
=
; 4.
=
.
Посмотрим на нашем примере, как скажется нормирование
исходных переменных на мерах сходства между объектами. Приведем
все переменные к стандартной z-шкале (среднее равно нулю,
стандартное отклонение – единице) по формуле
=
(табл. 3.3).
Таблица 3.3
Матрица стандартизированных значений признаков
Новая матрица расстояний представлена в табл. 3.4.
Таблица 3.4
Матрица близостей с учетом стандартизации признаков
После нормирования значений исходных признаков самыми
близкими стали 2-е и 4-е предприятия (
«дальними» - 2-е и 3-е предприятия (
= 13,2).
= 0,56), а самыми
Вопрос о придании переменным веса должен решаться
исследователем после проведения тщательного анализа изучаемой
совокупности и социально-экономической сущности
классифицируемых переменных. Вес задается пропорционально
степени важности переменных. Например, если для классификации
предприятий используются переменные: :
– выработка продукции на одного работающего;
– прибыль предприятия;
–
среднегодовая стоимость основных производственных фондов, то
можно переменным задать вес пропорционально степени их важности
для эффективности работы предприятия:
= 0,6;
= 0,3;
= 0,1.
Тогда евклидово расстояние между i-м и j- м объектами будет
определяться по формуле
58

=0,6
+ 0,3
+ 0,6
.
При нормализации всех переменных при проведении
кластерного анализа их вес становится одинаковым. В случае, если все
переменные имеют одну и ту же шкалу измерения либо веса
переменных по смыслу должны быть разными, стандартизацию
переменных проводить не нужно.
Выбор меры расстояния и веса для классифицирующих
признаков (переменных) – очень важный этап кластерного анализа,
так как от этих процедур зависят состав и количество формируемых
кластеров, а также степень сходства объектов внутри кластеров.
Для оценки однородности объектов в пространстве разнотипных
признаков (качественных и количественных) обычно используют не
расстояние между объектами, а меру их сходства, в качестве которой
могут быть использованы:
• линейные коэффициенты корреляции;
• коэффициенты ранговой корреляции;
• коэффициенты контингенции и т.д.
Иерархический кластерный анализ. Из всех методов
кластерного анализа самыми распространенными являются
иерархические агломеративные методы. Сущность этих методов
заключается в том, что на нулевом шаге каждый объект выборки
рассматривается как отдельный кластер. Процесс объединения
кластеров происходит последовательно: на основании матрицы
расстояний (или матрицы сходства) объединяются наиболее близкие
объекты (кластеры). Если матрица расстояний первоначально имеет
размерность × , мо полностью процесс кластеризации
завершается за 1 шагов, в итоге все объекты будут объединены в
один кластер.
Последовательность объединения может быть представлена в
виде графа-дерева (дендрограммы). На дендрограмме указываются
номера объединяемых объектов и расстояния (или другая мера
сходства), при котором произошло объединение.
Дендрограмма показывает, что на первом шаге были
объединены в один кластер объекты 2 и 3, расстояние между ними
0,15. На втором шаге к ним присоединился объект 1. Расстояние от 1-го
объекта до кластера, содержащего объекты 2 и 3, было равно 0,3. На
третьем шаге были объединены в один кластер объекты 5 и 6,
59

расстояние между ними 0,34. На втором шаге к ним присоединился
объект 4. Расстояние от 4-го объекта до кластера, содержащего
объекты 5 и 6, было равно 0,5. На последнем, пятом, шаге все объекты
объединились в один кластер, при этом расстояние между первым
(содержащим объекты 1, 2 и 3) и вторым (содержащим объекты 4, 5 и 6)
составляло 0,8.
Множество методов иерархического кластерного анализа
различается не только используемыми мерами сходства, но и
алгоритмами классификации (способами вычисления расстояния
между кластерами).
Наиболее распространены следующие способы измерения
расстояний между кластерами:
• Метод ближнего соседа (метод одиночной связи):
,
= min
,
;
Степень сходства оценивается по степени сходства между
наиболее схожими (ближайшими) объектами объединяемых
кластеров.
• Метод дальнего соседа (метод полных связей):
,
= m
,
;
Степень сходства оценивается по степени сходства между
наиболее отдаленными (несхожими) объектами объединяемых
кластеров.
• метод средней связи (межгрупповые связи):
где
=
,
- количество объектов в кластерах и
;
соответственно.
Степень сходства оценивается как средняя величина степеней
сходства между объектами объединяемых кластеров.
• Центроидный метод (измеряется расстояние между
«центрами тяжести» кластеров):
где
= (
,
- среднее арифметическое векторных наблюдений
=
,
)
:
.
• Метод медианной связи – расстояние между любым
кластером и новым кластером, который получился в результате
60
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
