Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Комплексный подход к оценке социально-экономического состояния муниципальных образований. Учебное пособие

.pdf
Скачиваний:
0
Добавлен:
07.09.2026
Размер:
2 Мб
Скачать
☆
80
По сути, общим названием «кластерный анализ» объединены множество алгоритмов классификации. Все их можно разделить на семь основных групп 70:
1) иерархические агломеративные (от agglomerate – скопление)
методы;
2) иерархические дивизимные (от division – деление) методы;
3) итерационные методы группировки;
4) методы поиска модальных значений плотности;
5) факторные методы;
6) методы сгущений;
7) методы, использующие теорию графов.
В настоящее время большинство используемых методов класте­ризации относится к иерархическим агломеративным и итерационным методам. В агломеративных методах процесс объединения начинается с создания элементарных кластеров, каждый из которых состоит ров­но из одного исходного наблюдения (одной точки), а на каждом по­следующем шаге происходит объединение двух наиболее близких кластеров в один. Агломеративные методы кластеризации отличаются способами оценивания сходства, используемыми метриками, подхо­дами в определении момента остановки процесса объединения. В от­личие от агломеративных методов, которые требуют вычисления и хранения матрицы сходства между объектами, итерационные методы работают непосредственно с первичными данными. Поэтому с их по­мощью можно обрабатывать большие объемы данных.
Разнообразие методов кластеризации порождает очень важную проблему, которая заключается в том, что для одного и того же набора исходных данных разными кластерными методами можно получить
аспекты формирования конкурентоспособных кластеров в странах с переходной эконо­микой //Вестник КРСУ, 2002. №3
70
Олдендерфер М.С., Блэшфилд Р.К. Кластерный анализ //Факторный, дискриминантный
и кластерный анализ. – М.: Финансы и статистика, 1988.
81
81
результаты, существенно отличающиеся друг от друга 71. Поэтому ре­зультаты вычислительной кластеризации могут быть спорны и часто служат лишь базой для содержательного анализа. В связи с этим целе­сообразно проводить классификацию несколькими методами или ис­пользовать специальные методики проверки обоснованности реше­ний. Если при этом результаты, получаемые разными методами, ока­зываются близки или решения удовлетворительно обосновываются, то совокупность исследуемых объектов можно считать классифициро­ванной. В противном случае любая классификация не является объек­тивной.
Сложность задач кластерного анализа еще состоит в том, что реальные объекты являются многомерными и объединение объектов в группы проводится в пространстве многих измерений. Поэтому толч­ком к началу широкого использования методов кластеризации в науке послужило развитие средств вычислительной техники. Исследователи выделяют и вторую, более важную, причину развития методов кла­стерного анализа. Это фундаментальное значение классификации как научного метода, привносящего упорядоченность явлений, процессов в исследованиях. В результате кластерный анализ применяется во многих областях научных исследований (биологии, археологии, со­циологии, политологии, психологии, экономике и многих других). Многообразие различных приложений кластерного анализа можно свести к четырем основным задачам: 1) разработка типологии или классификации; 2) исследование полезных концептуальных схем группировки объектов; 3) порождение гипотез на основе исследова­ния данных; 4) подтверждение гипотез о наличии групп, выделенных тем или иным способом, в имеющихся данных. Как уже указывалось, примеры решения задачи типологии региональной экономике можно
71
Олдендерфер М.С., Блэшфилд Р.К. Кластерный анализ //Факторный, дискриминантный
и кластерный анализ. – М.: Финансы и статистика, 1988; Б. Бутс, С. Дробышевский, О. Кочеткова, Г. Мальгинов, В. Петров, Г. Федоров, А. Хехт, А. Шеховцов, А. Юдин. Типо-
логия российских регионов. – М.: Институт экономики переходного периода, 2002
82
82
найти в работах M. Heidenreich, 2002; А.С. Мартынова, В.Г. Виногра­дова, 1998; Б. Бутс, С. Дробышевского, О. Кочетковой и др., 2002).
В данном исследовании для получения более объективной ти­пологии муниципальных образований будут использованы обе группы методов кластерного анализа: иерархические агломеративные и ите­рационные.
Иерархические агломеративные методы из всех методов кла­стерного анализа применяются наиболее часто. В большей степени причинами этого являются, во-первых, относительная простота мето­дов. Так метод одиночной связи не требует от исследователя понима­ния матричной алгебры или обширной подготовки по многомерной статистике. Вместо этого указывается правило, определяющее каким образом, исходя из матрицы сходства, объекты могут объединяться в кластеры. Второй причиной можно назвать возможность визуально проследить последовательность объединений кластеров с помощью древовидной диаграммы или дендрограммы.
Несмотря на относительную простоту агломеративных методов, они обладают некоторыми недостатками. Во-первых, это необходи­мость вычисления и хранения матрицы сходства размерностью N´N, где N – число объектов. Во-вторых, объекты по кластерам распреде­ляются за один проход, и поэтому плохое начальное разбиение мно­жества данных не может быть изменено на последующих шагах про­цесса кластеризации. В-третьих, методы могут порождать разные ре­шения в результате простого переупорядочения объектов в матрице сходства, или исключения некоторых объектов из рассмотрения. Кро­ме того, «узким» местом является процедура интерпретации получае­мых решений, а именно, задача определения числа кластеров. В большинстве случаев число кластеров устанавливается в результате эвристической процедуры. Этой процедурой может быть субъектив­ный просмотр дендрограммы и «обрезание» дерева на том уровне, где структура кластеров, по мнению исследователя, уже проявилась. Бо­лее формальный способ решения задачи состоит в графическом изо-
83
83
бражении числа получаемых кластеров как функции коэффициента слияния, равного числу способов объединения различных объектов в кластер. Заметное уплощение графика свидетельствует о том, что дальнейшее слияние не дает новой информации и процесс кластери­зации можно остановить.
Отличаются иерархические агломеративные методы главным образом правилами (стратегиями) построения кластеров.
В методе одиночной связи (либо «ближайшего соседа») кластер образуется по следующему правилу: объект будет присоединен к уже существующему кластеру, если по крайней мере один из элементов кластера («ближний сосед») находится на том же уровне сходства, что и объект, претендующий на сходство 72. Таким образом, присоедине­ние определяется лишь наличием единственной связи между объектом и кластером. Главное достоинство метода – его инвариантность к мо­нотонным преобразованиям матрицы сходства. Все остальные разно­видности иерархических агломеративных методов таким свойством не обладают. Однако, метод одиночной связи может приводить к появ­лению цепного эффекта, когда по мере приближения к окончанию процесса кластеризации образуется один большой кластер, а все ос­тающиеся объекты добавляются к нему один за другим.
Правило построения кластеров методом полных связей (либо «дальнего соседа») указывает на то, что число связей между кандида­том на включение в существующий кластер и любым элементом этого кластера не должно быть меньше некоторого порогового уровня. В этом методе расстояния между кластерами определяются наибольшим расстоянием между любыми двумя объектами в различных кластерах (т.е. «дальними соседями»). Метод непригоден, если кластеры имеют в некотором роде удлиненную форму или их естественный тип явля­ется «цепочечным».
72
Олдендерфер М.С., Блэшфилд Р.К. Кластерный анализ //Факторный, дискриминантный
и кластерный анализ. – М.: Финансы и статистика, 1988; Электронный учебник по стати­стике. Москва, StatSoft. http://www.statsoft.ru/home/textbook/default.htm; Боровиков В.П. Программа Statistica для студентов и инженеров.-М.: Компьютерпресс, 2001
84
84
В методе средней связи мера сходства между кандидатом и элементами существующего кластера усредняется несколькими спо­собами 73:
· Невзвешенное попарное среднее (UPGMA). В этом способе расстояние между двумя различными кластерами вычисляется как среднее расстояние между всеми парами объектов в них.
· Взвешенное попарное среднее (WPGMA). Метод идентичен методу невзвешенного попарного среднего, за исключением того, что при вычислениях размер соответствующих кластеров (т.е. число объ­ектов, содержащихся в них) используется в качестве весового коэф­фициента. Поэтому метод лучше использовать, когда предполагаются неравные размеры кластеров;
· Невзвешенный центроидный метод (UPGMC). В этом методе расстояние между двумя кластерами определяется как расстояние ме­жду их центрами тяжести.
· Взвешенный центроидный метод (медиана) (WPGMC). Этот метод идентичен предыдущему, за исключением того, что при вычис­лениях используются веса для учёта разницы между размерами кла­стеров (т.е. числами объектов в них). Поэтому, если имеются (или по­дозреваются) значительные отличия в размерах кластеров, этот метод оказывается предпочтительнее предыдущего.
Метод Уорда (Ward’s method) заключается в оптимизации ми­нимальной дисперсии внутри кластеров. Объединяются те группы или объекты, для которых внутригрупповая сумма квадратов или сумма квадратов отклонений получает минимальное приращение. В целом метод представляется весьма эффективным, однако он стремится соз­давать кластеры малого размера.
Важным отличием друг от друга описанных выше иерархиче­ских агломеративных методов является то, как они преобразуют про-
73
Электронный учебник по статистике. Москва, StatSoft.
http://www.statsoft.ru/home/textbook/default.htm
85
85
странство между точками в многомерном пространстве. Сжимающие пространство методы (например, метод одиночной связи) изменяют соотношения между точками пространства уменьшая расстояния ме­жду любыми группами данных. Когда очередная точка подвергается обработке таким методом, она скорее всего будет присоединена к су­ществующей группе, а не послужит началом нового кластера. Расши­ряющие пространство методы (методы полных связей и Уорда) дейст­вуют противоположным образом – кластеры «расступаются» и в про­странстве образуются небольшие, но отчетливые кластеры. Только методы средней связи оставляют многомерное пространство без из­менений.
Многообразие правил построения кластеров иерархических аг­ломеративных методов дополняется еще и выбором способов оцени­вания расстояний между объектами. Чаще всего используется евкли- дово расстояние, являющееся, по сути, геометрическим расстоянием в многомерном пространстве. Вычисляется по формуле
m
å
=
k
-=
1
2
xxd
)(
,
jkikij
где dij – расстояние между объектами i и j,
xik – значение k-й переменной для i-го объекта,
m – количество переменных, характеризующих объекты i и j.
Чтобы избежать вычислений квадратного корня достаточно час­то используют квадрат евклидова расстояния d
2
. Но следствием та-
ij
кого способа будет еще большее расстояние между значительно уда­ленными друг от друга объектами.
Еще одним вариантом меры расстояния между объектами явля­ется так называемое «Манхэттенское расстояние» (или «расстояние городских кварталов»). Это расстояние является усредненным значе­нием разностей по координатам. В большинстве случаев эта мера рас­стояния приводит к таким же результатам, как и для обычного евкли­дова расстояния. Однако для этой меры влияние отдельных больших
86
86
разностей (выбросов) уменьшается (так как они не возводятся в квад­рат). Вычисляется манхэттенское расстояние по формуле
m
||
-=
xxd
,
jkikij
1å=
k
где dij – расстояние между объектами i и j,
xik – значение k-й переменной для i-го объекта,
m – количество переменных, характеризующих объекты i и j.
Расстояние Чебышева может оказаться полезным, когда необ­ходимо определить два объекта как различные, хотя они различаются только по какой-либо одной координате. Расстояние Чебышева вы­числяется по формуле
||max
xxd -=
,
jkikij
где dij – расстояние между объектами i и j,
xik – значение k-й переменной для i-го объекта,
m – количество переменных, характеризующих объекты i и j.
Использование степенного расстояния позволяет прогрессивно увеличить или уменьшить вес, относящийся к переменной, по которой соответствующие объекты сильно отличаются. Это может быть дос­тигнуто с использованием степенного расстояния. Степенное расстоя­ние вычисляется по формуле
m
å
k
=
xxd
-=
1
1
p
r
)||(
jkikij
,
где dij – расстояние между объектами i и j,
xik – значение k-й переменной для i-го объекта,
m – количество переменных, характеризующих объекты i и j,
r и p – параметры, определяемые пользователем.
Параметр p ответственен за постепенное взвешивание разностей по отдельным координатам, параметр r ответственен за прогрессивное
87
87
взвешивание больших расстояний между объектами. Если оба пара­метра - r и p, равны двум, то степенное расстояние совпадает с евкли­довым.
Для случаев, когда данные являются категориальными, лучшие результаты дает использование процента несогласия. Эта мера вы­числяется по формуле
m
d
количество
ij
k
1¹==
mxx
)(
jkik
,
где dij – расстояние между объектами i и j,
xik – значение k-й переменной для i-го объекта,
m – количество переменных, характеризующих объекты i и j.
Еще одним вариантом является использование в качестве меры величины, обратной коэффициенту линейной корреляции (1-Pearson r). Учитывается степень, с которой значения переменных анализируе­мых объектов пропорциональны друг другу. Важно, что значение ко­эффициента корреляции не зависит от масштаба измерения перемен­ных.
Итерационные методы кластеризации существенно отличаются от агломеративных методов. Наиболее важное отличие заключается в том, что еще до начала использования итерационных методов иссле­дователь должен иметь гипотезы относительно числа кластеров. Ука­зав это число на «входе» методов, на «выходе» исходная совокупность объектов будет разбита на заданное количество кластеров, причем, настолько различных, насколько это возможно. Более строго, итера­ционные методы выполняют разбиение, позволяющее минимизиро­вать изменчивость внутри кластеров и максимизировать – между кла­стерами 74.
Итерационные методы основаны на достаточно простом алго­ритме:
74
Олдендерфер М.С., Блэшфилд Р.К. Кластерный анализ //Факторный, дискриминантный
и кластерный анализ. – М.: Финансы и статистика, 1988; Электронный учебник по стати­стике. Москва, StatSoft. http://www.statsoft.ru/home/textbook/default.htm
88
88
1. Начать с исходного разбиения данных на заданное число
кластеров; вычислить центры тяжести этих кластеров.
2. Поместить каждую точку данных в кластер с ближайшим
центром тяжести.
3. Вычислить новые центры тяжести кластеров.
4. Шаги 2 и 3 повторять до тех пор, пока не будут меняться
кластеры.
В соответствии с алгоритмом итерационные методы делают не­сколько просмотров данных и могут несколько компенсировать по­следствия плохого начального разбиения данных. Однако полностью зависимость между начальным разбиением набора данных и результа­том кластеризации не устраняется. Более того, плохое исходное раз­биение может стать причиной появления субоптимальных (локаль­ных) решений, поскольку итерационные методы могут выбрать лишь малую часть всех возможных разбиений 75. Для решения указанной проблемы можно выделить два, непротиворечащих друг другу, под­хода. Первый заключается в том, чтобы выполнять кластеризацию со­вместно с подходящей процедурой проверки результата на достовер­ность. Одной из лучших таких процедур М. Олдендерфер и Р. Блэш­филд называют тест значимости для независимых признаков 76. Вто­рым подходом к решению проблемы субоптимальности предусматри­вается разумный выбор способа получения начального разбиения. Так, в итерационном методе k-средних, реализованном в пакете стати­стических программ STATISTICA, возможны несколько способов оп­ределения исходного разбиения. Во-первых, объекты могут быть раз­биты таким образом, чтобы начальные расстояния между группами были максимальны. Но при наличии выбросов в данных этот способ может привести к группам, состоящим из всего одного объекта. Во­вторых, все объекты могут быть отсортированы в порядке возрастания
75
Олдендерфер М.С., Блэшфилд Р.К. Кластерный анализ //Факторный, дискриминантный
и кластерный анализ. – М.: Финансы и статистика, 1988.
76
там же
89
89
расстояния между ними, затем весь список разбит на интервалы, ко­личество которых равно заданному числу кластеров. Объекты, нахо­дящиеся в середине интервалов, и будут определены как начальные центры групп. В-третьих, можно жестко задать объекты, которые бу­дут начальными центрами групп. Для этого необходимо объекты, ко­торые, как ожидается, станут центрами будущих кластеров, поместить в начало файла данных. Третий из указанных способов обеспечивает исследователя полным контролем над процессом определения на­чального разбиения. Так, если в качестве начального разбиения ука­зать результаты кластеризации по методу средней связи, можно ожи­дать повышения точности окончательного решения 77.
Причины, вызывающие получение разными методами кластери­зации противоречивых результатов для одних и тех же данных, как правило обусловлены следующими факторами:
· характеристики кластерной структуры, например, форма и
размеры кластеров;
· степень полноты классификации,
· наличие выбросов в исходных данных,
· степень перекрытия кластеров,
· выбор меры сходства.
Методы, расширяющие пространство (методы полных связей, Уорда), приводят к созданию приблизительно равных по размерам кластеров гиперсферической формы. Структуру кластеров, имеющих растянутую или необычную форму, указанные методы воспроизводят плохо. Лучшие результаты для таких кластеров дают методы одиноч­ной и средней связи.
Полная классификация является исчерпывающей: все рассмат­риваемые объекты должны быть размещены по группам. При выпол­нении указанного условия лучшие решения дают методы средней свя­зи и Уорда.
77
Олдендерфер М.С., Блэшфилд Р.К. Кластерный анализ //Факторный, дискриминантный
и кластерный анализ. – М.: Финансы и статистика, 1988.
90
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]