Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Комплексный подход к оценке социально-экономического состояния муниципальных образований. Учебное пособие
.pdf
110
Таблица 13* – Общие результаты кластеризации
тестовой выборки методом Уорда с различными мерами сходства
сходства
1, 2 1,47
3, 5 1,47
4 1,47
6 7 1,67
Н
1 кластер 2 кластер 3 кластер
16
(Брянск, Калинин-
град, Магнитогорск,
Сочи, Ставрополь,
Киров, Мурманск.
Великий Новгород,
Владикавказ, Владимир, Калуга, Орел,
Смоленск, Тамбов,
Тверь, Курск)
9
(Брянск, Калинин-
град, Магнитогорск,
Сочи, Ставрополь,
Киров, Мурманск.
Тверь, Курск)
9
(Брянск, Калинин-
град, Магнитогорск,
Сочи, Ставрополь,
Киров, Мурманск.
Тверь, Курск)
- - - -
7
(Брянск, Калинин-
град, Магнитогорск,
Сочи, Ставрополь,
Киров, Мурманск)
* Таблица составлена авторами по материалам исследования.
Характеристика решения кластеризации Мера
23
(Армавир, Балаково, Батайск, Вели-
кие Луки, Волгодонск, Глазов, Муром, Димитровград, Златоуст, Камышин, Кисловодск, Ковров, Копейск,
Миасс, Невинномысск, Новомосковск, Новотроицк, Новочеркасск,
Новошахтинск, Обнинск, Сарапул,
Шахты, Энгельс)
24
(Армавир, Балаково, Батайск, Вели-
кие Луки, Волгодонск, Глазов, Муром, Димитровград, Златоуст, Камышин, Кисловодск, Ковров, Копейск,
Миасс, Невинномысск, Новомосковск, Новотроицк, Новочеркасск,
Новошахтинск, Обнинск, Сарапул,
Шахты, Энгельс Пятигорск)
24
(Армавир, Балаково, Батайск, Вели-
кие Луки, Волгодонск, Глазов, Муром, Димитровград, Златоуст, Камышин, Кисловодск, Ковров, Копейск,
Миасс, Невинномысск, Новомосковск, Новотроицк, Новочеркасск,
Новошахтинск, Обнинск, Сарапул,
Шахты, Энгельс. Орск)
26
(Армавир, Балаково, Батайск, Вели-
кие Луки, Волгодонск, Глазов, Муром, Димитровград, Златоуст, Камышин, Кисловодск, Ковров, Копейск,
Миасс, Невинномысск, Новомосковск, Новотроицк, Новочеркасск,
Новошахтинск, Обнинск, Сарапул,
Шахты, Энгельс Псков, Новороссийск,
Пятигорск)
- 8
- 14
- 14
5
(Курск,
Великий
Новгород,
Орел, Тамбов, Нальчик)
(Волжский, Кострома, Новороссийск,
Таганрог.
Орск, Псков, Пятигорск, Нальчик)
(Волжский, Кострома, Новороссийск,
Таганрог.
Орск, Великий Новгород, Владикавказ,
Владимир, Калуга,,
Орел, Смоленск,
Тамбов, Псков, Нальчик)
(Волжский, Кострома, Новороссийск,
Таганрог. Великий
Новгород, Владикавказ, Владимир, Калуга,, Орел, Смоленск,
Тамбов, Псков, Нальчик, Пятигорск
14
(Волжский, Костро-
ма, Таганрог.
Владикавказ, Владимир, Калуга, Смоленск, Орск, Тверь)
4 кластер
2. Методы в целом удовлетворительно выявили в тестовой выборке разные по статусу города: центры субъектов РФ и города-«не
центры». Наилучшие результаты показали метод взвешенного попарного среднего (мера сходства – обратный коэффициент корреляции):
15 из 16 городов-центров включены в первый кластер, 26 из 31 городов-«не центров» - во второй; метод полной связи при разбиении на
два кластера в четырех случаях из семи выявил соответственно 14 и
29 городов.
111

111
3. Все полученные решения из трех кластеров можно условно
разделить на две группы, различные по составу третьего кластера:
первая группа решений (получаемая методами полной и средней связи) в третьем кластере содержит более сильные города-центры с более
высокими значениями показателей (Киров, Мурманск, Курск); вторая
группа решений (метод Уорда) формирует третий кластер (в табл. 13
состав кластера представлен в колонке «4 кластер») из «слабых»
представителей городов-центров (Кострома, Псков) и «сильных» не
центров (Новороссийск, Таганрог, Орск, Волжский). Единственное
решение из четырех кластеров (см. табл. 13) необходимо более тщательно исследовать, так как оно соответствует сразу обеим указанным
группам.
Таким образом, при использовании итерационного метода kсредних следует установить значение числа кластеров равное трем как
наиболее вероятное, однако проверить следует разбиение и на четыре
кластера.
Так как метод k-средних чувствителен к начальному разбиению,
проведем исследование трех различных способов его формирования.
В итоговой таблице 14 в колонке «Способ разбиения» цифрами обозначены следующие способы:
1) автоматический подбор начального разбиения с максималь-
ным межгрупповым расстоянием;
2) автоматический подбор начальных центров групп по сорти-
рованному списку объектов;
3) прямое указание начальных центров групп вручную (один
раз способ был применен без изменения исходного алфавитного списка городов – центрами стали Армавир, Балаково и Батайск (в таблице
этот вариант помечен 31); второй раз (обозначение 32) центрами были
указаны Калининград, Димитровград, Псков, так как в дендрограммах
метода Уорда для трех кластеров указанные города чаще всего оказывались примерным геометрическим центром своего кластера)
112

112
Таблица 14* – Общие результаты разбиения на три кластера
тестовой выборки методом k-средних с различными способами
определения начального разбиения
разбиения
1, 32 1,45
2, 31 1,47
Н
1 кластер 2 кластер 3 кластер
10
(Брянск, Калининград,
Киров, Курск, Магнитогорск, Мурманск,
Смоленск, Сочи,
Ставрополь, Тверь)
14
(Брянск, Владикавказ,
Владимир, Калининград, Киров, Курск,
Магнитогорск, Мурманск, Орел, Смоленск, Сочи, Ставрополь, Тамбов, Тверь)
* Таблица составлена авторами по материалам исследования.
Характеристика решения кластеризации Способ
25
Армавир, Балаково, Батайск, Великие
Луки, Волгодонск, Глазов, Димитровград,
Златоуст, Камышин, Кисловодск, Ковров,
Копейск, Миасс, Муром, Невинномысск,
Новомосковск, Новотроицк, Новочеркасск, Новошахтинск, Обнинск, Орск,
Пятигорск, Сарапул, Шахты, Энгельс,
24
Армавир, Балаково, Батайск, Великие
Луки, Волгодонск, Глазов, Димитровград,
Златоуст, Камышин, Кисловодск, Ковров,
Копейск, Миасс, Муром, Невинномысск,
Новомосковск, Новотроицк, Новочеркасск, Новошахтинск, Обнинск, Пятигорск, Сарапул, Шахты, Энгельс
12
Великий Новгород,
Владикавказ, Владимир, Волжский, Ка-
луга, Кострома,
Нальчик, Новороссийск, Орел, Псков,
Таганрог, Тамбов
9
Великий Новгород,
Волжский, Калуга,
Кострома, Нальчик,
Новороссийск, Орск,
Псков, Таганрог
Полученные методом k-средних решения для трех кластеров
дополняют группу решений метода Уорда, когда третий кластер формируют относительно «слабые» представители городов-центров (Кострома, Псков, Великий Новгород и Калуга) и «сильные» не центры
(Новороссийск, Таганрог, Орск, Волжский, Нальчик и Орск).
В таблице 15 представлены решения методом k-средних для четырех кластеров. Аналогичным образом для третьего способа формирования начального разбиения указаны два варианта: 31 – центрами
кластеров являются первые в списке по алфавиту города (Армавир,
Балаково, Батайск и Брянск); 32 – центрами начальных групп стали
примерные геометрические центры по дендрограмме метода Уорда
(Великие Луки, Новочеркасск, Орел и Брянск).
Отдельные решения для четырех кластеров дополнительно к
двум указанным выше группам решений добавляют третью. Особенностью решений (способы 2 и 31 см. табл. 15) является разделение устойчиво сформированных в предыдущих итерациях кластеров на две
части. Способом 31 разбиению подвергся второй кластер. В нем из 24
городов было выделено 7 наиболее отстающих. Способом 2 из четвертого кластера было выделено 2 города, причем неправильно: самый
«лучший» (Новороссийск) и самый «худший» (Нальчик).
113

113
Таблица 15* – Общие результаты разбиения на четыре кластера
тестовой выборки методом k-средних с различными способами
определения начального разбиения
разбиения
1 1,74
2 1,62
31 1,91
32 1,77
Н
1 кластер 2 кластер 3 кластер 4 кластер
9
(Брянск, Владикавказ,
Владимир, Курск,
Магнитогорск, Орел,
Смоленск, Тамбов,
Тверь)
14
(Брянск, Владикавказ,
Владимир, Калинин-
град, Киров, Курск,
Магнитогорск, Мурманск, Орел, Смоленск,
Сочи, Ставрополь,
Тамбов, Тверь)
14
(Брянск, Владикавказ,
Владимир, Калинин-
град, Киров, Курск,
Магнитогорск, Мурманск, Орел, Смоленск,
Сочи, Ставрополь,
Тамбов, Тверь)
8
(Великий Новгород,
Владикавказ, Владимир, Калуга, Смоленск,
Орел, Тамбов, Тверь)
* Таблица составлена авторами по материалам исследования.
Характеристика решения кластеризации Способ
24
Армавир, Балаково, Батайск, Великие Луки, Волгодонск, Глазов, Ди-
митровград, Златоуст, Камышин,
Кисловодск, Ковров, Копейск, Миасс,
Муром, Невинномысск, Новомосковск, Новотроицк, Новочеркасск,
Новошахтинск, Обнинск, Пятигорск,
Сарапул, Шахты, Энгельс
24
Армавир, Балаково, Батайск, Великие Луки, Волгодонск, Глазов, Ди-
митровград, Златоуст, Камышин,
Кисловодск, Ковров, Копейск, Миасс,
Муром, Невинномысск, Новомосковск, Новотроицк, Новочеркасск,
Новошахтинск, Обнинск, Пятигорск,
Сарапул, Шахты, Энгельс
17(+7)
Армавир, Балаково, Батайск, Волгодонск, Димитровград, Златоуст,
Кисловодск, Ковров, Миасс, Невинномысск, Новомосковск, Новотроицк, Новочеркасск, Обнинск, Пятигорск, Шахты, Энгельс
Великие Луки, Глазов, Камышин,
Копейск, Муром, Новошахтинск, Сарапул
24
Армавир, Балаково, Батайск, Великие Луки, Волгодонск, Глазов, Ди-
митровград, Златоуст, Камышин,
Кисловодск, Ковров, Копейск, Миасс,
Муром, Невинномысск, Новомосковск, Новотроицк, Новочеркасск,
Новошахтинск, Обнинск, Пятигорск,
Сарапул, Шахты, Энгельс
5
Калининград,
Киров, Мурманск, Сочи,
Ставрополь
2
7
8
(Брянск,
Калининград,
Киров, Курск,
Магнитогорск,
Мурманск,
Сочи, Ставрополь)
9
Великий Новгород, Волжский,
Калуга, Костро-
ма, Нальчик,
Новороссийск,
Орск, Псков,
Таганрог
7(+2)
Великий Новгород, Волжский,
Калуга, Костро-
ма, Орск, Псков,
Таганрог
Нальчик, Новороссийск
9
Великий Новгород, Волжский,
Калуга, Костро-
ма, Нальчик,
Новороссийск,
Орск, Псков,
Таганрог
9
(Волжский,
Кострома, Нальчик, Новороссийск, Орск,
Псков, Таганрог)
Так как способ 31 (с алфавитным принципом определения центров групп) нельзя назвать научным, и применялся он скорее для контраста со способом 32, то оба решения 2 и 31 следует отвергнуть, несмотря на высокие значения энтропии. Оставшиеся решения (способы
1 и 32) в общем схоже разбивают тестовую выборку на четыре группы:
«лидеры» (кластер №3), «средние» («сильные» – кластер №1, «сла-
бые» – кластер № 4), «аутсайдеры» (кластер №2). Для выбора лучшего
их двух решений следует проанализировать их более подробно. На
рисунке 4 представлены совместные графики решений, в которых ли-
114

114
ниями соединены средние значения каждого из 12 частных индикаторов (v1-v12) для всех четырех кластеров.
а)
б)
Рисунок 4* – Графическая характеристика кластеров, полученных
разными способами метода k-средних: а) автоматический подбор началь-
ного разбиения по максимуму межгруппового расстояния (способ 1); б) определе-
ние центров групп начального разбиения вручную (способ 32).
* Рисунок получен авторами в ходе эксперимента
115

115
Сравнение графиков (см. рис. 4) позволяет установить определенное сходство полученных кластерных решений, однако следует
отметить и отличия, в частности, решение, полученное по начальному
разбиению с максимальным межгрупповым расстоянием (способ 1,
см. рис. 4а), хуже разделяет города по индикатору v8 и v9 (строительство, услуги пассажирского транспорта), чем это делает другое решение (способ 32, см. рис. 4б), но несколько лучше выполняет разбиение
по индикатору v12 (инвестиционная активность).
Более точно сопоставить полученные решения можно также по
показателям дисперсии. В таблице 16 представлен стандартный отчет
дисперсионного анализа двух сравниваемых группировок городов по
12 показателям (v1-v12).
Таблица 16*– Результаты дисперсионного анализа группировок
городов, построенных разными способами:
1- автоматический подбор начального разбиения по максимуму меж-
группового расстояния; 32 - определение центров групп начального
разбиения вручную
Способ 1 Способ 32
D
df1 D
факт
3458,86 3 1936,267 43 25,6044 0,000 3549,68 3 1845,445 43 27,5699 0,000
v1
1203,87 3 5244,896 43 3,28997 0,029 1344,19 3 5104,579 43 3,7744 0,017
v2
1518,31 3 874,242 43 24,8929 0,000 1558,95 3 833,606 43 26,8051 0,000
v3
18536,33 3 4082,867 43 65,0738 0,000 18826,7 3 3792,515 43 71,1531 0,000
v4
9471,23 3 3495,403 43 38,8379 0,000 10058,1 3 2908,555 43 49,5661 0,000
v5
419,08 3 4260,463 43 1,40988 0,253 325,64 3 4353,897 43 1,0720 0,371
v6
2548,05 3 1213,243 43 30,1029 0,000 2403,32 3 1357,977 43 25,3668 0,000
v7
4036,14 3 1504,124 43 38,4618 0,000 3738,29 3 1801,969 43 29,7353 0,000
v8
7060,86 3 2631,603 43 38,4578 0,000 6871,04 3 2821,432 43 34,9060 0,000
v9
19681,54 3 2947,538 43 95,7077 0,000 19871,2 3 2757,853 43 103,276 0,000
v10
8251,31 3 4113,792 43 28,7493 0,000 8112,03 3 4253,069 43 27,3385 0,000
v11
4614,19 3 3037,610 43 21,7726 0,000 4090,78 3 3561,027 43 16,4656 0,000
v12
df2 F p D
ост
df1 D
факт
df2 F p
ост
* Таблица составлена авторами по материалам исследования.
Сравнивая по таблице (см. табл. 16) значения сумм квадратов
отклонения, можно сделать вывод, что межгрупповая вариация (D
факт
)
больше внутригрупповой (D
) для всех индикаторов кроме v2 и v6
ост
(труд, законопослушность). Сопоставляя представленные значения F-
критерия с критическим (F
=2,82 для df1=3, df2=43 p=0,05)
крит
85
следует
сделать вывод, что в обоих случаях (1 и 32) влияние на формирование
85
Елисеева И.И., Юзбашев М.М. Общая теория статистики – М.: ФиС, 2001
116

116
групп всех индикаторов, за исключением v6, является существенным,
то есть статистически значимым, так как F>F
. Примечательно, что
крит
если совсем исключить из анализа индикатор v6, то оказывается, что
состав кластеров не изменяется.
Однако, как указывают М.С. Олдендерфер и Р.К. Блэшфилд, для
проверки обоснованности кластерного решения приведенный анализ
значимости не подходит, так как он всегда будет давать положительные результаты, независимо от того, есть ли в исходных данных кластеры или нет 86. Для более достоверной проверки обоснованности
решения следует провести повторную выборку, либо применить процедуры Монте-Карло. Но одним из лучших способов проверить обоснованность решения указанные авторы называют тесты значимости
для внешних признаков. Для этого необходимо сравнить кластеры по
признакам, не применявшимся при получении кластерного решения.
В качестве таких «внешних» признаков предлагается использовать
значения удельного веса социально-экономических показателей городов в идентичных показателях соответствующего субъекта РФ. В частности, в официальных публикациях Росстата 87 используются ряд
показателей, характеризующих вклад городов в общие социальноэкономические показатели субъекта РФ: численность населения,
среднегодовая численность работающих в организациях, основные
фонды организаций, объемы промышленной продукции и работ, выполненных по договорам строительного подряда, ввод в действие жилых домов, оборот розничной торговли, инвестиции в основной капитал. Указанные показатели на самом деле являются внешними, так как
характеризуют город как часть более общей социальноэкономической системы – субъекта РФ. К тому же значения показателей уже являются относительными, что избавляет от необходимости
их нормировать.
86
Олдендерфер М.С., Блэшфилд Р.К. Кластерный анализ //Факторный, дискриминантный
и кластерный анализ. – М.: Финансы и статистика, 1988.
87
Регионы России: социально-экономическое положение городов. 2004: Стат. сб. - М.:
Росстат, 2004
117

117
В таблице 17 представлены результаты проверки значимости
внешних показателей для группировки городов двумя способами. В
столбце «k» также даны значения коэффициента линейной корреляции
каждого показателя с номером кластера, причем номера кластеров в
данном случае были заданы следующей иерархией: 1 – «аутсайдеры»,
2 – средние «слабые», 3 – средние «сильные», 4 – «лидеры». То есть,
проверялась гипотеза о том, что более высокие значения показателей
предопределяют попадание города в кластер с большим номером. Наличие сильной связи между номером кластера и каждым из показателей свидетельствует о подтверждении выдвинутой гипотезы.
Таблица 17* – Результаты проверки обоснованности двух кла-
стерных решений тестом значимости для внешних показателей
Способ 1 начального разбиения
Внешние показатели
Численность населения (% субъекта) 0,72 4936,97 1645,66 21,374 0,00000
Среднегодовая численность работающих (% субъекта) 0,72 6719,98 2239,99 23,480 0,00000
Основные фонды организаций (% субъекта) 0,67 11761,44 3920,48 17,523 0,00000
Объем промышленной продукции (% субъекта) 0,62 9462,95 3154,32 14,783 0,00001
Объем работ по дог. строит. подряда (% субъекта) 0,66 11875,00 3958,33 18,814 0,00000
Ввод в действие жилых домов (% субъекта) 0,67 13289,77 4429,92 17,551 0,00000
Оборот розничной торговли (% субъекта) 0,74 16549,08 5516,36 25,431 0,00000
Инвестиции в основной капитал (% субъекта) 0,70 12820,98 4273,66 16,819 0,00000
k D
D
факт
F p
ост
Способ 32 начального разбиения
Внешние показатели
Численность населения (% субъекта) 0,73 5270,36 1756,79 25,374 0,00000
Среднегодовая численность работающих (% субъекта) 0,75 7225,78 2408,59 28,797 0,00000
Основные фонды организаций (% субъекта) 0,69 11961,20 3987,07 18,198 0,00000
Объем промышленной продукции (% субъекта) 0,67 10344,87 3448,29 17,879 0,00000
Объем работ по дог. строит. подряда (% субъекта) 0,71 12066,45 4022,15 19,530 0,00000
Ввод в действие жилых домов (% субъекта) 0,67 13116,97 4372,32 17,051 0,00000
Оборот розничной торговли (% субъекта) 0,77 17158,43 5719,48 28,209 0,00000
Инвестиции в основной капитал (% субъекта) 0,69 12848,08 4282,69 16,896 0,00000
k D
* Таблица составлена авторами по материалам исследования.
D
факт
F p
ост
Результаты теста значимости показывают, что полученные разными способами кластеры достоверно различаются и по внешним показателям (D
факт>Dост
и F>F
). Следовательно, оба кластерных ре-
крит
шения следует считать обоснованными.
Таким образом, проведенное экспериментальное исследование
методов кластеризации не позволило выявить только один наилучший
118

118
метод. Примерно равными характеристиками, но лучшими по сравнению с решениями остальных методов, обладают две разновидности
итерационного метода k-средних с автоматическим подбором начального разбиения по максимуму межгруппового расстояния и определением центров групп начального разбиения вручную, по дендрограмме.
Следовательно, после определения примерных центров кластеров по
дендрограмме метода Уорда с обратным коэффициентом корреляции
в качестве меры сходства, указанные разновидности метода k-средних
в данном исследовании следует использовать совместно. Окончательное решение можно будет принять только в результате анализа устойчивости кластеризации по имеющимся статистическим данным за четыре года и содержательного анализа кластеров каждой из групп городов.
2.3. Кластеризация и формирование типов больших городов
После того, как была выполнена кластеризация тестовой выборки городов по данным за 2003 год, метод Уорда с обратным коэффициентом корреляции в качестве меры сходства был применен еще три
раза для той же выборки, но данные использовались за 2000, 2001 и
2002 годы. Аналогичным образом выполнена кластеризация других
групп городов по данным за 2000-2003 годы. Цель применения метода
Уорда с обратным коэффициентом корреляции в качестве меры сходства заключается в получении разбиения на четыре кластера и определении по дендрограмме городов, находящихся ближе всех к центрам кластеров. Полученная таким образом информация используется
затем в методе k-средних для указания центров групп начального разбиения. Как было отмечено выше указанный способ кластеризации
дает одинаково хорошие результаты с методом k-средних с автоматическим подбором начального разбиения по максимуму межгруппового расстояния. Для возможности сравнить получаемые решения потребовалось реализовать оба варианта метода k-средних для всех
имеющихся групп городов и периодов времени. Так как использован-
119

119
n
n
ные в работе формальные методы сравнения решений (по значению
энтропии, по тесту значимости внешних признаков) не помогли однозначно выбрать лучшее, то для возможности содержательного анализа
был выполнен расчет сводного индекса социально-экономического
состояния городов, как среднего арифметического значений 12 частных индикаторов. Предложенный способ расчета сводного индекса
является довольно грубым, но, тем не менее, часто используемым на
практике. Использование единого показателя для характеристики социально-экономического состояния города удобно, так как, вопервых, вся иерархия городов становится в большей степени обозримой, во-вторых, облегчается процесс сопоставления вариантов кластерных решений..
Реализуя появившуюся возможность сравнения кластерных решений по значениям сводного индекса попадающих в один кластер
городов, было сформировано итоговое разбиение. Следует отметить,
что примерно 80% итогового разбиения было составлено по решениям
с автоматическим подбором начального разбиения по максимуму
межгруппового расстояния. Лишь примерно в 20% случаев способ определения центров групп начального разбиения вручную дал лучшие
решения.
Для оценки устойчивости полученной кластерной структуры
при использовании данных за разные годы был использован квадратический коэффициент изменения рангов KRK, основанный на коэффициенте корреляции рангов Спирмена 88. В статистических исследованиях показатель KRK позволяет оценить структурные сдвиги в ранжированных списках.
Расчет показателя KRK выполняется по формуле
n
()
3
-
120
-
3
å
i
=
KRK
88
Елисеева И.И., Юзбашев М.М. Общая теория статистики – М.: ФиС, 2001, с. 463
1
=
2
iRiR
01
,
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
