Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Комплексный подход к оценке социально-экономического состояния муниципальных образований. Учебное пособие
.pdf
80
По сути, общим названием «кластерный анализ» объединены
множество алгоритмов классификации. Все их можно разделить на
семь основных групп 70:
1) иерархические агломеративные (от agglomerate – скопление)
методы;
2) иерархические дивизимные (от division – деление) методы;
3) итерационные методы группировки;
4) методы поиска модальных значений плотности;
5) факторные методы;
6) методы сгущений;
7) методы, использующие теорию графов.
В настоящее время большинство используемых методов кластеризации относится к иерархическим агломеративным и итерационным
методам. В агломеративных методах процесс объединения начинается
с создания элементарных кластеров, каждый из которых состоит ровно из одного исходного наблюдения (одной точки), а на каждом последующем шаге происходит объединение двух наиболее близких
кластеров в один. Агломеративные методы кластеризации отличаются
способами оценивания сходства, используемыми метриками, подходами в определении момента остановки процесса объединения. В отличие от агломеративных методов, которые требуют вычисления и
хранения матрицы сходства между объектами, итерационные методы
работают непосредственно с первичными данными. Поэтому с их помощью можно обрабатывать большие объемы данных.
Разнообразие методов кластеризации порождает очень важную
проблему, которая заключается в том, что для одного и того же набора
исходных данных разными кластерными методами можно получить
аспекты формирования конкурентоспособных кластеров в странах с переходной экономикой //Вестник КРСУ, 2002. №3
70
Олдендерфер М.С., Блэшфилд Р.К. Кластерный анализ //Факторный, дискриминантный
и кластерный анализ. – М.: Финансы и статистика, 1988.
81

81
результаты, существенно отличающиеся друг от друга 71. Поэтому результаты вычислительной кластеризации могут быть спорны и часто
служат лишь базой для содержательного анализа. В связи с этим целесообразно проводить классификацию несколькими методами или использовать специальные методики проверки обоснованности решений. Если при этом результаты, получаемые разными методами, оказываются близки или решения удовлетворительно обосновываются, то
совокупность исследуемых объектов можно считать классифицированной. В противном случае любая классификация не является объективной.
Сложность задач кластерного анализа еще состоит в том, что
реальные объекты являются многомерными и объединение объектов в
группы проводится в пространстве многих измерений. Поэтому толчком к началу широкого использования методов кластеризации в науке
послужило развитие средств вычислительной техники. Исследователи
выделяют и вторую, более важную, причину развития методов кластерного анализа. Это фундаментальное значение классификации как
научного метода, привносящего упорядоченность явлений, процессов
в исследованиях. В результате кластерный анализ применяется во
многих областях научных исследований (биологии, археологии, социологии, политологии, психологии, экономике и многих других).
Многообразие различных приложений кластерного анализа можно
свести к четырем основным задачам: 1) разработка типологии или
классификации; 2) исследование полезных концептуальных схем
группировки объектов; 3) порождение гипотез на основе исследования данных; 4) подтверждение гипотез о наличии групп, выделенных
тем или иным способом, в имеющихся данных. Как уже указывалось,
примеры решения задачи типологии региональной экономике можно
71
Олдендерфер М.С., Блэшфилд Р.К. Кластерный анализ //Факторный, дискриминантный
и кластерный анализ. – М.: Финансы и статистика, 1988; Б. Бутс, С. Дробышевский, О.
Кочеткова, Г. Мальгинов, В. Петров, Г. Федоров, А. Хехт, А. Шеховцов, А. Юдин. Типо-
логия российских регионов. – М.: Институт экономики переходного периода, 2002
82

82
найти в работах M. Heidenreich, 2002; А.С. Мартынова, В.Г. Виноградова, 1998; Б. Бутс, С. Дробышевского, О. Кочетковой и др., 2002).
В данном исследовании для получения более объективной типологии муниципальных образований будут использованы обе группы
методов кластерного анализа: иерархические агломеративные и итерационные.
Иерархические агломеративные методы из всех методов кластерного анализа применяются наиболее часто. В большей степени
причинами этого являются, во-первых, относительная простота методов. Так метод одиночной связи не требует от исследователя понимания матричной алгебры или обширной подготовки по многомерной
статистике. Вместо этого указывается правило, определяющее каким
образом, исходя из матрицы сходства, объекты могут объединяться в
кластеры. Второй причиной можно назвать возможность визуально
проследить последовательность объединений кластеров с помощью
древовидной диаграммы или дендрограммы.
Несмотря на относительную простоту агломеративных методов,
они обладают некоторыми недостатками. Во-первых, это необходимость вычисления и хранения матрицы сходства размерностью N´N,
где N – число объектов. Во-вторых, объекты по кластерам распределяются за один проход, и поэтому плохое начальное разбиение множества данных не может быть изменено на последующих шагах процесса кластеризации. В-третьих, методы могут порождать разные решения в результате простого переупорядочения объектов в матрице
сходства, или исключения некоторых объектов из рассмотрения. Кроме того, «узким» местом является процедура интерпретации получаемых решений, а именно, задача определения числа кластеров. В
большинстве случаев число кластеров устанавливается в результате
эвристической процедуры. Этой процедурой может быть субъективный просмотр дендрограммы и «обрезание» дерева на том уровне, где
структура кластеров, по мнению исследователя, уже проявилась. Более формальный способ решения задачи состоит в графическом изо-
83

83
бражении числа получаемых кластеров как функции коэффициента
слияния, равного числу способов объединения различных объектов в
кластер. Заметное уплощение графика свидетельствует о том, что
дальнейшее слияние не дает новой информации и процесс кластеризации можно остановить.
Отличаются иерархические агломеративные методы главным
образом правилами (стратегиями) построения кластеров.
В методе одиночной связи (либо «ближайшего соседа») кластер
образуется по следующему правилу: объект будет присоединен к уже
существующему кластеру, если по крайней мере один из элементов
кластера («ближний сосед») находится на том же уровне сходства, что
и объект, претендующий на сходство 72. Таким образом, присоединение определяется лишь наличием единственной связи между объектом
и кластером. Главное достоинство метода – его инвариантность к монотонным преобразованиям матрицы сходства. Все остальные разновидности иерархических агломеративных методов таким свойством не
обладают. Однако, метод одиночной связи может приводить к появлению цепного эффекта, когда по мере приближения к окончанию
процесса кластеризации образуется один большой кластер, а все остающиеся объекты добавляются к нему один за другим.
Правило построения кластеров методом полных связей (либо
«дальнего соседа») указывает на то, что число связей между кандидатом на включение в существующий кластер и любым элементом этого
кластера не должно быть меньше некоторого порогового уровня. В
этом методе расстояния между кластерами определяются наибольшим
расстоянием между любыми двумя объектами в различных кластерах
(т.е. «дальними соседями»). Метод непригоден, если кластеры имеют
в некотором роде удлиненную форму или их естественный тип является «цепочечным».
72
Олдендерфер М.С., Блэшфилд Р.К. Кластерный анализ //Факторный, дискриминантный
и кластерный анализ. – М.: Финансы и статистика, 1988; Электронный учебник по статистике. Москва, StatSoft. http://www.statsoft.ru/home/textbook/default.htm; Боровиков В.П.
Программа Statistica для студентов и инженеров.-М.: Компьютерпресс, 2001
84

84
В методе средней связи мера сходства между кандидатом и
элементами существующего кластера усредняется несколькими способами 73:
· Невзвешенное попарное среднее (UPGMA). В этом способе
расстояние между двумя различными кластерами вычисляется как
среднее расстояние между всеми парами объектов в них.
· Взвешенное попарное среднее (WPGMA). Метод идентичен
методу невзвешенного попарного среднего, за исключением того, что
при вычислениях размер соответствующих кластеров (т.е. число объектов, содержащихся в них) используется в качестве весового коэффициента. Поэтому метод лучше использовать, когда предполагаются
неравные размеры кластеров;
· Невзвешенный центроидный метод (UPGMC). В этом методе
расстояние между двумя кластерами определяется как расстояние между их центрами тяжести.
· Взвешенный центроидный метод (медиана) (WPGMC). Этот
метод идентичен предыдущему, за исключением того, что при вычислениях используются веса для учёта разницы между размерами кластеров (т.е. числами объектов в них). Поэтому, если имеются (или подозреваются) значительные отличия в размерах кластеров, этот метод
оказывается предпочтительнее предыдущего.
Метод Уорда (Ward’s method) заключается в оптимизации минимальной дисперсии внутри кластеров. Объединяются те группы или
объекты, для которых внутригрупповая сумма квадратов или сумма
квадратов отклонений получает минимальное приращение. В целом
метод представляется весьма эффективным, однако он стремится создавать кластеры малого размера.
Важным отличием друг от друга описанных выше иерархических агломеративных методов является то, как они преобразуют про-
73
Электронный учебник по статистике. Москва, StatSoft.
http://www.statsoft.ru/home/textbook/default.htm
85

85
странство между точками в многомерном пространстве. Сжимающие
пространство методы (например, метод одиночной связи) изменяют
соотношения между точками пространства уменьшая расстояния между любыми группами данных. Когда очередная точка подвергается
обработке таким методом, она скорее всего будет присоединена к существующей группе, а не послужит началом нового кластера. Расширяющие пространство методы (методы полных связей и Уорда) действуют противоположным образом – кластеры «расступаются» и в пространстве образуются небольшие, но отчетливые кластеры. Только
методы средней связи оставляют многомерное пространство без изменений.
Многообразие правил построения кластеров иерархических агломеративных методов дополняется еще и выбором способов оценивания расстояний между объектами. Чаще всего используется евкли-
дово расстояние, являющееся, по сути, геометрическим расстоянием
в многомерном пространстве. Вычисляется по формуле
m
å
=
k
-=
1
2
xxd
)(
,
jkikij
где dij – расстояние между объектами i и j,
xik – значение k-й переменной для i-го объекта,
m – количество переменных, характеризующих объекты i и j.
Чтобы избежать вычислений квадратного корня достаточно часто используют квадрат евклидова расстояния d
2
. Но следствием та-
ij
кого способа будет еще большее расстояние между значительно удаленными друг от друга объектами.
Еще одним вариантом меры расстояния между объектами является так называемое «Манхэттенское расстояние» (или «расстояние
городских кварталов»). Это расстояние является усредненным значением разностей по координатам. В большинстве случаев эта мера расстояния приводит к таким же результатам, как и для обычного евклидова расстояния. Однако для этой меры влияние отдельных больших
86

86
разностей (выбросов) уменьшается (так как они не возводятся в квадрат). Вычисляется манхэттенское расстояние по формуле
m
||
-=
xxd
,
jkikij
1å=
k
где dij – расстояние между объектами i и j,
xik – значение k-й переменной для i-го объекта,
m – количество переменных, характеризующих объекты i и j.
Расстояние Чебышева может оказаться полезным, когда необходимо определить два объекта как различные, хотя они различаются
только по какой-либо одной координате. Расстояние Чебышева вычисляется по формуле
||max
xxd -=
,
jkikij
где dij – расстояние между объектами i и j,
xik – значение k-й переменной для i-го объекта,
m – количество переменных, характеризующих объекты i и j.
Использование степенного расстояния позволяет прогрессивно
увеличить или уменьшить вес, относящийся к переменной, по которой
соответствующие объекты сильно отличаются. Это может быть достигнуто с использованием степенного расстояния. Степенное расстояние вычисляется по формуле
m
å
k
=
xxd
-=
1
1
p
r
)||(
jkikij
,
где dij – расстояние между объектами i и j,
xik – значение k-й переменной для i-го объекта,
m – количество переменных, характеризующих объекты i и j,
r и p – параметры, определяемые пользователем.
Параметр p ответственен за постепенное взвешивание разностей
по отдельным координатам, параметр r ответственен за прогрессивное
87

87
взвешивание больших расстояний между объектами. Если оба параметра - r и p, равны двум, то степенное расстояние совпадает с евклидовым.
Для случаев, когда данные являются категориальными, лучшие
результаты дает использование процента несогласия. Эта мера вычисляется по формуле
m
d
количество
ij
k
1¹==
mxx
)(
jkik
,
где dij – расстояние между объектами i и j,
xik – значение k-й переменной для i-го объекта,
m – количество переменных, характеризующих объекты i и j.
Еще одним вариантом является использование в качестве меры
величины, обратной коэффициенту линейной корреляции (1-Pearson
r). Учитывается степень, с которой значения переменных анализируемых объектов пропорциональны друг другу. Важно, что значение коэффициента корреляции не зависит от масштаба измерения переменных.
Итерационные методы кластеризации существенно отличаются
от агломеративных методов. Наиболее важное отличие заключается в
том, что еще до начала использования итерационных методов исследователь должен иметь гипотезы относительно числа кластеров. Указав это число на «входе» методов, на «выходе» исходная совокупность
объектов будет разбита на заданное количество кластеров, причем,
настолько различных, насколько это возможно. Более строго, итерационные методы выполняют разбиение, позволяющее минимизировать изменчивость внутри кластеров и максимизировать – между кластерами 74.
Итерационные методы основаны на достаточно простом алгоритме:
74
Олдендерфер М.С., Блэшфилд Р.К. Кластерный анализ //Факторный, дискриминантный
и кластерный анализ. – М.: Финансы и статистика, 1988; Электронный учебник по статистике. Москва, StatSoft. http://www.statsoft.ru/home/textbook/default.htm
88

88
1. Начать с исходного разбиения данных на заданное число
кластеров; вычислить центры тяжести этих кластеров.
2. Поместить каждую точку данных в кластер с ближайшим
центром тяжести.
3. Вычислить новые центры тяжести кластеров.
4. Шаги 2 и 3 повторять до тех пор, пока не будут меняться
кластеры.
В соответствии с алгоритмом итерационные методы делают несколько просмотров данных и могут несколько компенсировать последствия плохого начального разбиения данных. Однако полностью
зависимость между начальным разбиением набора данных и результатом кластеризации не устраняется. Более того, плохое исходное разбиение может стать причиной появления субоптимальных (локальных) решений, поскольку итерационные методы могут выбрать лишь
малую часть всех возможных разбиений 75. Для решения указанной
проблемы можно выделить два, непротиворечащих друг другу, подхода. Первый заключается в том, чтобы выполнять кластеризацию совместно с подходящей процедурой проверки результата на достоверность. Одной из лучших таких процедур М. Олдендерфер и Р. Блэшфилд называют тест значимости для независимых признаков 76. Вторым подходом к решению проблемы субоптимальности предусматривается разумный выбор способа получения начального разбиения.
Так, в итерационном методе k-средних, реализованном в пакете статистических программ STATISTICA, возможны несколько способов определения исходного разбиения. Во-первых, объекты могут быть разбиты таким образом, чтобы начальные расстояния между группами
были максимальны. Но при наличии выбросов в данных этот способ
может привести к группам, состоящим из всего одного объекта. Вовторых, все объекты могут быть отсортированы в порядке возрастания
75
Олдендерфер М.С., Блэшфилд Р.К. Кластерный анализ //Факторный, дискриминантный
и кластерный анализ. – М.: Финансы и статистика, 1988.
76
там же
89

89
расстояния между ними, затем весь список разбит на интервалы, количество которых равно заданному числу кластеров. Объекты, находящиеся в середине интервалов, и будут определены как начальные
центры групп. В-третьих, можно жестко задать объекты, которые будут начальными центрами групп. Для этого необходимо объекты, которые, как ожидается, станут центрами будущих кластеров, поместить
в начало файла данных. Третий из указанных способов обеспечивает
исследователя полным контролем над процессом определения начального разбиения. Так, если в качестве начального разбиения указать результаты кластеризации по методу средней связи, можно ожидать повышения точности окончательного решения 77.
Причины, вызывающие получение разными методами кластеризации противоречивых результатов для одних и тех же данных, как
правило обусловлены следующими факторами:
· характеристики кластерной структуры, например, форма и
размеры кластеров;
· степень полноты классификации,
· наличие выбросов в исходных данных,
· степень перекрытия кластеров,
· выбор меры сходства.
Методы, расширяющие пространство (методы полных связей,
Уорда), приводят к созданию приблизительно равных по размерам
кластеров гиперсферической формы. Структуру кластеров, имеющих
растянутую или необычную форму, указанные методы воспроизводят
плохо. Лучшие результаты для таких кластеров дают методы одиночной и средней связи.
Полная классификация является исчерпывающей: все рассматриваемые объекты должны быть размещены по группам. При выполнении указанного условия лучшие решения дают методы средней связи и Уорда.
77
Олдендерфер М.С., Блэшфилд Р.К. Кластерный анализ //Факторный, дискриминантный
и кластерный анализ. – М.: Финансы и статистика, 1988.
90
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
