Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Многомерный статистический анализ в экономике. Учебное пособие

.pdf
Скачиваний:
0
Добавлен:
07.09.2026
Размер:
1 Мб
Скачать
%
R
n
Rn
%
R
rR
D
ср
n
1j
2
jj
ср
ср
2
ср
100100
22
2
=
=
=
Очевидно, что в случае одного кластера величина D будет
иметь значение 0, а в случае наличия n кластеров (т.е. число кластеров k равно числу наблюдений n) D будет равно 100 %. Последнее будет означать получение абсолютно гомогенных кластеров.
Стремление к получению типологии (отделимых друг от друга модельных типов объектов) должно сопровождаться стремлением к максимизации показателя D при одновременной минимизации числа кластеров. Данная метрика, безусловно, не претендует на однозначное определение таких понятий, как «похожесть» объектов, «однородность» групп, но вполне соответствует логике кластерного анализа методом k-средних.
Одним из вариантов использования этой метрики может быть построение достаточно большого числа кластерных решений с одинаковыми параметрами, но разным числом кластеров. Последний параметр должен пробежать значения от 2 до некоторого числа, меньшего n, которое будет определять сам пользователь. Потом можно построить график величины D для каждого из решений и смотреть на динамику этого показателя. Если при переходе от решения с k-1 кластерами к решению с k кластерами показатель продемонстрирует заметный рост, решение с k кластерами будет иметь заметные преимущества в однородности кластеров перед решением с k-1 кластерами. Если же при увеличении числа кластеров величина D возросла незначительно, возможно, подробно рассматривать новое решение не стоит.
Общий алгоритм вычисления «объясняющей» способности проведенной кластеризации состоит в следующем:
1) вычисляется суммарная дисперсия переменных
кластеризации;
2) проводится кластеризация на k кластеров;
3) определяется расстояние от каждого наблюдения до
кластерного центра, это расстояние возводится в квадрат;
4) вычисляется средний квадрат расстояния от наблюдения до
кластерного центра;
81
5) на основе полученных данных вычисляется статистика Dk,
которая будет говорить о том, какая доля суммарной дисперсии признаков объясняется разбиением объектов на группы с k центрами;
6) пункты 2 - 5 могут повторяться несколько раз для оценки
решений с разным числом кластеров.
Лабораторная работа № 4
К
ЛАСТЕРНЫЙ АНАЛИЗ ИЕРАРХИЧЕСКИМИ МЕТОДАМИ
Цель работы: освоение техники кластерного анализа, получение
навыков проведения расчетов в соответствии с алгоритмами метода средней связи и центроидного метода в электронной таблице. Формирование навыков анализа качестра проведенной кластеризации.
Задача. Провести сегментацию марок автомобилей на основе
кластерного анализа. Для этого:
1. В табличном процессоре Excel на листе «Исходные данные»
создать таблицу по образцу (табл. 3.12).
Таблица 3.12
Значения переменных кластеризации по объектам
82
В качестве переменных кластеризации принять следующие:
средняя стоимость автомобиля;
средний возраст водителя;
средний стаж водителя;
средний возраст автомобиля.
Провести кластерный анализ совокупности 22 объектов, характеризующихся 4 признаками методом средней связи и центроидным методом. В качестве метрики выбрать расстояние Евклида.
2. На этом же листе провести z-стандартизацию исходных
данных.
3. На листе «метод средней связи» пошагово провести
кластеризацию по методу средней связи. Для этого:
3.1. Скопировать стандартизованные исходные данные с
листа «Исходные данные на лист «метод средней связи».
3.2. На шаге 1 вычислить матрицу расстояний (табл. 3.13)
между каждой парой объектов (только под главной диагональю).
Таблица 3.13
Шаблон таблицы матрицы расстояний
3.3. В ячейке F53 определить наименьшее расстояние
(используя функцию МИН()).
3.4. В матрице расстояний глазами найти определенное
наименьшее расстояние и выделить красным цветом (для удобства) номера объектов (в строке и столбце), расстояние между которыми оказалось наименьшим.
83
3.5. В строке 54 записать, какие объекты и на каком уровне
объединились на первом шаге.
3.6. На листе «Ход кластеризации» занести в табл. 3.14,
какие объекты и на каком уровне объединились на первом шаге.
Таблица 3.14
Пошаговый ход кластеризации
3.7. На шаге 2 скопировать матрицу расстояний,
полученную на предыдущем шаге.
3.8. В строке, соответствующей меньшему номеру из двух
объединенных на предыдущем шаге объектов, в столбце А записать составной номер (например, 11+19), залить ячейки этой строки, содержащие расстояния, желтым цветом и удалить содержимое этих ячеек.
3.9. Удалить целиком строку, соответствующую большему
номеру объединенных на предыдущем шаге объектов.
3.10. Аналогично, в 29 строке в столбце,
соответствующем меньшему номеру из двух объединенных на предыдущем шаге объектов записать составной номер (например, 11+19), залить ячейки этого столбца, содержащие расстояния, желтым цветом и удалить содержимое этих ячеек.
84
3.11. Удалить ячейки столбца (со сдвигом влево),
соответствующие большему номеру объединенных на предыдущем шаге объектов.
3.12. Вычислить расстояния от каждого объекта до
образованного кластера (в ячейках, залитых желтым цветом).
3.13. В ячейке F111 вычислить наименьшее на текущем
шаге расстояние между объектами.
3.14. В матрице расстояний глазами найти определенное
наименьшее расстояние и выделить красным цветом (для удобства) номера объектов (в строке и столбце), расстояние между которыми оказалось наименьшим.
3.15. В строке 112 записать, какие объекты и на каком
уровне объединились на текущем шаге.
3.16. На листе «Ход кластеризации» занести в таблицу,
какие объекты и на каком уровне объединились на текущем шаге.
3.17. Выполнить шаги 3-21.
4. На основе таблицы, отражающей ход кластеризации,
построить дендрограмму (на листе в клеточку). На горизонтальной оси указать марки автомобилей. Линии дендрограммы не должны
пересекаться.
5. Оценить количество кластеров, исследовав динамику
увеличения расстояний по шагам кластеризации и состав кластеров.
6. Вычислить рекомендуемое пороговое значения расстояния:
= 


(1)
.
7. Выбрать окончательное количество кластеров.
8. На листе «Исходные данные» заполнить столбец «кластер»
(G4:G25).
9. Проверить статистическую значимость различий средних
значений признаков в кластерах. Для этого:
9.1 На лист «Значимость различий» скопировать исходные
данные и распределение по кластерам с листа «Исходные данные»
(A3:G25).
9.2. Ниже составить таблицу распределения стоимости
автомобилей по кластерам (табл. 3.15).
9.3 Провести оценку значимости различия средних значений
стоимости автомобиля в полученных кластерах с помощью процедуры «Однофакторный дисперсионный анализ».
85
Таблица 3.15
Стоимость автомобилей по кластерам
9.4. Аналогично провести оценку значимости различия средних
значений возраста водителей, стажа вождения и возраста автомобиля в полученных кластерах.
9.5. Свести результаты в табл. 3.16.
Таблица 3.16
Сводная таблица оценки значимости различий кластеров
9.6. Сделать выводы.
10. Провести анализ результатов кластеризации. Для этого:
86
10.1. На листе «Анализ кластеризации» вычислить
%,
R
%
R
r
срср
срср
100100
22
2
=
=
=n1j
2
jj
2
n
Rn
R
D
,k...jr
ср
12=+
=
=
,
n
Rn
R
n
1j
2
jj
2
ср
«координаты» общего центра объектов в пространстве выбранных признаков кластеризации (табл. 3.17).
Таблица 3.17
Шаблон таблицы оценки качества кластеризации
10.2. Для каждого кластера заполнить таблицу по образцу с
указанием марок машин, попавших в данный кластер, и их характеристик.
10.3. Вычислить «координаты» центра кластера».
10.4. Вычислить расстояние от каждого объекта до центра
кластера, расстояние от каждого объекта до общего центра и их квадраты.
10.5. Составить сводную таблицу кластеров (табл. 3.18).
10.6. Рассчитать «объясняющую способность» построенной
кластеризации (D-критерий качества кластеризации):
87
где
2
ср
R
2
j
R
j
n
2
ср
r
- сумма средних квадратов отклонений от среднего значения
по всем переменным, участвующим в кластеризации. Она же - средний квадрат расстояния от каждого наблюдения до общего центра (общей средней). Она же - суммарная дисперсия переменных, участвующих в кластеризации (вычисляется по формуле генеральной дисперсии, со знаменателем, равным n);
Таблица 3.18
Сводная таблица качества кластеризации
- сумма квадратов расстояний от центра j-го кластера до общего
центра;
- количество наблюдений, определённых по результатам
кластеризации в j-й кластер; n - общее количество наблюдений;
- средний квадрат расстояния от каждого наблюдения до центра
своего кластера по всем кластерам.
Результаты расчетов занести в табл. 3.19.
88
Таблица 3.19
«Объясняющая способность» проведенной кластеризации
10.8. На листе диаграммы «Профили кластеров» построить
нормированные профили кластеров. Для этого на рабочий лист «Профили кластеров» скопировать центры всех кластеров и общий центр (табл. 3.20).
Таблица 3.20
Данные для построения профилей кластеров
10.9. Ниже рассчитать нормированные значения профилей кластеров. Для этого значение каждой характеристики кластера разделить на значение соответствующей характеристики в общем центре.
10.10. Построить график по нормированным профилям.
89
10.11. Сделать выводы.
11. Составить сравнительное описание кластеров. Подобрать названия кластеров.
Лабораторная работа № 5
К
ЛАСТЕРНЫЙ АНАЛИЗ В ППП IBM SPSS STATISTICS
Цель работы: освоение техники проведения кластерного
анализа в среде ППП
IBM SPSS STATISTICS, получение навыков
анализа результатов расчетов, отраженных в сформированном отчете.
Задача 1. Данные по 20 сельскохозяйственным предприятиям
представлены в файле урожайность.sav. Провести кластерный анализ в
SPSS и интерпретировать результаты.
1. Открыть файл урожайность.sav и просмотреть параметры
переменных (рис. 3.1).
Рис. 3.1. Вкладка «Переменные» окна данных SPSS Statistics
2. В меню Анализ выбрать команду
Классификация/Иерархическая кластеризация
3. В появившемся диалоговом окне (рис. 3.2) указать
переменные, по которым будет осуществляться кластеризация.
4. В диалоговом окне Метод (рис. 3.3) выбрать способ
измерения расстояния между наблюдениями или кластерами и метод формирования кластеров (например, дальнего соседа). Т.к. данные имеют разные шкалы измерения, использовать стандартизацию.
5. В Статистиках выбрать Порядок агломерации и Матрицу
близостей, в Графиках – Дендрограмму, в Сохранить – диапазон
кластеров: минимум 2, максимум – 4.
90
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]