Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Комплексный подход к оценке социально-экономического состояния муниципальных образований. Учебное пособие

.pdf
Скачиваний:
0
Добавлен:
07.09.2026
Размер:
2 Мб
Скачать
☆
110
Таблица 13* – Общие результаты кластеризации
тестовой выборки методом Уорда с различными мерами сходства
сходства
1, 2 1,47
3, 5 1,47
4 1,47
6 ­7 1,67
Н
1 кластер 2 кластер 3 кластер
16 (Брянск, Калинин-
град, Магнитогорск, Сочи, Ставрополь, Киров, Мурманск.
Великий Новгород, Владикавказ, Влади­мир, Калуга, Орел, Смоленск, Тамбов, Тверь, Курск)
9 (Брянск, Калинин-
град, Магнитогорск, Сочи, Ставрополь, Киров, Мурманск.
Тверь, Курск)
9 (Брянск, Калинин-
град, Магнитогорск, Сочи, Ставрополь, Киров, Мурманск.
Тверь, Курск)
- - - -
7 (Брянск, Калинин-
град, Магнитогорск, Сочи, Ставрополь, Киров, Мурманск)
* Таблица составлена авторами по материалам исследования.
Характеристика решения кластеризации Мера
23 (Армавир, Балаково, Батайск, Вели-
кие Луки, Волгодонск, Глазов, Му­ром, Димитровград, Златоуст, Камы­шин, Кисловодск, Ковров, Копейск, Миасс, Невинномысск, Новомос­ковск, Новотроицк, Новочеркасск, Новошахтинск, Обнинск, Сарапул, Шахты, Энгельс)
24 (Армавир, Балаково, Батайск, Вели-
кие Луки, Волгодонск, Глазов, Му­ром, Димитровград, Златоуст, Камы­шин, Кисловодск, Ковров, Копейск, Миасс, Невинномысск, Новомос­ковск, Новотроицк, Новочеркасск, Новошахтинск, Обнинск, Сарапул, Шахты, Энгельс Пятигорск)
24 (Армавир, Балаково, Батайск, Вели-
кие Луки, Волгодонск, Глазов, Му­ром, Димитровград, Златоуст, Камы­шин, Кисловодск, Ковров, Копейск, Миасс, Невинномысск, Новомос­ковск, Новотроицк, Новочеркасск, Новошахтинск, Обнинск, Сарапул, Шахты, Энгельс. Орск)
26 (Армавир, Балаково, Батайск, Вели-
кие Луки, Волгодонск, Глазов, Му­ром, Димитровград, Златоуст, Камы­шин, Кисловодск, Ковров, Копейск, Миасс, Невинномысск, Новомос­ковск, Новотроицк, Новочеркасск, Новошахтинск, Обнинск, Сарапул, Шахты, Энгельс Псков, Новороссийск,
Пятигорск)
- 8
- 14
- 14
5
(Курск, Великий Новгород, Орел, Там­бов, Наль­чик)
(Волжский, Костро­ма, Новороссийск, Таганрог.
Орск, Псков, Пяти­горск, Нальчик)
(Волжский, Костро­ма, Новороссийск, Таганрог.
Орск, Великий Нов­город, Владикавказ, Владимир, Калуга,, Орел, Смоленск, Тамбов, Псков, Наль­чик)
(Волжский, Костро­ма, Новороссийск, Таганрог. Великий
Новгород, Владикав­каз, Владимир, Калу­га,, Орел, Смоленск, Тамбов, Псков, Наль­чик, Пятигорск
14 (Волжский, Костро-
ма, Таганрог.
Владикавказ, Влади­мир, Калуга, Смо­ленск, Орск, Тверь)
4 кластер
2. Методы в целом удовлетворительно выявили в тестовой вы­борке разные по статусу города: центры субъектов РФ и города-«не центры». Наилучшие результаты показали метод взвешенного попар­ного среднего (мера сходства – обратный коэффициент корреляции): 15 из 16 городов-центров включены в первый кластер, 26 из 31 горо­дов-«не центров» - во второй; метод полной связи при разбиении на два кластера в четырех случаях из семи выявил соответственно 14 и 29 городов.
111
111
3. Все полученные решения из трех кластеров можно условно
разделить на две группы, различные по составу третьего кластера: первая группа решений (получаемая методами полной и средней свя­зи) в третьем кластере содержит более сильные города-центры с более высокими значениями показателей (Киров, Мурманск, Курск); вторая группа решений (метод Уорда) формирует третий кластер (в табл. 13 состав кластера представлен в колонке «4 кластер») из «слабых» представителей городов-центров (Кострома, Псков) и «сильных» не центров (Новороссийск, Таганрог, Орск, Волжский). Единственное решение из четырех кластеров (см. табл. 13) необходимо более тща­тельно исследовать, так как оно соответствует сразу обеим указанным группам.
Таким образом, при использовании итерационного метода k­средних следует установить значение числа кластеров равное трем как наиболее вероятное, однако проверить следует разбиение и на четыре кластера.
Так как метод k-средних чувствителен к начальному разбиению, проведем исследование трех различных способов его формирования. В итоговой таблице 14 в колонке «Способ разбиения» цифрами обо­значены следующие способы:
1) автоматический подбор начального разбиения с максималь-
ным межгрупповым расстоянием;
2) автоматический подбор начальных центров групп по сорти-
рованному списку объектов;
3) прямое указание начальных центров групп вручную (один раз способ был применен без изменения исходного алфавитного спи­ска городов – центрами стали Армавир, Балаково и Батайск (в таблице этот вариант помечен 31); второй раз (обозначение 32) центрами были указаны Калининград, Димитровград, Псков, так как в дендрограммах метода Уорда для трех кластеров указанные города чаще всего оказы­вались примерным геометрическим центром своего кластера)
112
112
Таблица 14* – Общие результаты разбиения на три кластера
тестовой выборки методом k-средних с различными способами
определения начального разбиения
разбиения
1, 32 1,45
2, 31 1,47
Н
1 кластер 2 кластер 3 кластер
10
(Брянск, Калининград,
Киров, Курск, Магни­тогорск, Мурманск, Смоленск, Сочи, Ставрополь, Тверь)
14
(Брянск, Владикавказ,
Владимир, Калинин­град, Киров, Курск, Магнитогорск, Мур­манск, Орел, Смо­ленск, Сочи, Ставро­поль, Тамбов, Тверь)
* Таблица составлена авторами по материалам исследования.
Характеристика решения кластеризации Способ
25
Армавир, Балаково, Батайск, Великие Луки, Волгодонск, Глазов, Димитровград, Златоуст, Камышин, Кисловодск, Ковров, Копейск, Миасс, Муром, Невинномысск, Новомосковск, Новотроицк, Новочер­касск, Новошахтинск, Обнинск, Орск, Пятигорск, Сарапул, Шахты, Энгельс,
24
Армавир, Балаково, Батайск, Великие Луки, Волгодонск, Глазов, Димитровград, Златоуст, Камышин, Кисловодск, Ковров, Копейск, Миасс, Муром, Невинномысск, Новомосковск, Новотроицк, Новочер­касск, Новошахтинск, Обнинск, Пяти­горск, Сарапул, Шахты, Энгельс
12
Великий Новгород,
Владикавказ, Влади­мир, Волжский, Ка-
луга, Кострома, Нальчик, Новорос­сийск, Орел, Псков, Таганрог, Тамбов
9
Великий Новгород, Волжский, Калуга, Кострома, Нальчик, Новороссийск, Орск, Псков, Таганрог
Полученные методом k-средних решения для трех кластеров дополняют группу решений метода Уорда, когда третий кластер фор­мируют относительно «слабые» представители городов-центров (Ко­строма, Псков, Великий Новгород и Калуга) и «сильные» не центры (Новороссийск, Таганрог, Орск, Волжский, Нальчик и Орск).
В таблице 15 представлены решения методом k-средних для че­тырех кластеров. Аналогичным образом для третьего способа форми­рования начального разбиения указаны два варианта: 31 – центрами кластеров являются первые в списке по алфавиту города (Армавир, Балаково, Батайск и Брянск); 32 – центрами начальных групп стали примерные геометрические центры по дендрограмме метода Уорда (Великие Луки, Новочеркасск, Орел и Брянск).
Отдельные решения для четырех кластеров дополнительно к двум указанным выше группам решений добавляют третью. Особен­ностью решений (способы 2 и 31 см. табл. 15) является разделение ус­тойчиво сформированных в предыдущих итерациях кластеров на две части. Способом 31 разбиению подвергся второй кластер. В нем из 24 городов было выделено 7 наиболее отстающих. Способом 2 из четвер­того кластера было выделено 2 города, причем неправильно: самый «лучший» (Новороссийск) и самый «худший» (Нальчик).
113
113
Таблица 15* – Общие результаты разбиения на четыре кластера
тестовой выборки методом k-средних с различными способами
определения начального разбиения
разбиения
1 1,74
2 1,62
31 1,91
32 1,77
Н
1 кластер 2 кластер 3 кластер 4 кластер
9
(Брянск, Владикавказ, Владимир, Курск, Магнитогорск, Орел, Смоленск, Тамбов, Тверь)
14
(Брянск, Владикавказ, Владимир, Калинин-
град, Киров, Курск, Магнитогорск, Мур­манск, Орел, Смоленск, Сочи, Ставрополь,
Тамбов, Тверь)
14
(Брянск, Владикавказ, Владимир, Калинин-
град, Киров, Курск, Магнитогорск, Мур­манск, Орел, Смоленск, Сочи, Ставрополь,
Тамбов, Тверь)
8 (Великий Новгород,
Владикавказ, Влади­мир, Калуга, Смоленск, Орел, Тамбов, Тверь)
* Таблица составлена авторами по материалам исследования.
Характеристика решения кластеризации Способ
24
Армавир, Балаково, Батайск, Вели­кие Луки, Волгодонск, Глазов, Ди-
митровград, Златоуст, Камышин, Кисловодск, Ковров, Копейск, Миасс, Муром, Невинномысск, Новомос­ковск, Новотроицк, Новочеркасск, Новошахтинск, Обнинск, Пятигорск, Сарапул, Шахты, Энгельс
24
Армавир, Балаково, Батайск, Вели­кие Луки, Волгодонск, Глазов, Ди-
митровград, Златоуст, Камышин, Кисловодск, Ковров, Копейск, Миасс, Муром, Невинномысск, Новомос­ковск, Новотроицк, Новочеркасск, Новошахтинск, Обнинск, Пятигорск, Сарапул, Шахты, Энгельс
17(+7)
Армавир, Балаково, Батайск, Волго­донск, Димитровград, Златоуст, Кисловодск, Ковров, Миасс, Невин­номысск, Новомосковск, Новотро­ицк, Новочеркасск, Обнинск, Пяти­горск, Шахты, Энгельс
Великие Луки, Глазов, Камышин, Копейск, Муром, Новошахтинск, Сара­пул
24
Армавир, Балаково, Батайск, Вели­кие Луки, Волгодонск, Глазов, Ди-
митровград, Златоуст, Камышин, Кисловодск, Ковров, Копейск, Миасс, Муром, Невинномысск, Новомос­ковск, Новотроицк, Новочеркасск, Новошахтинск, Обнинск, Пятигорск, Сарапул, Шахты, Энгельс
5
Калининград, Киров, Мур­манск, Сочи, Ставрополь
2
7
8 (Брянск,
Калининград, Киров, Курск,
Магнитогорск,
Мурманск, Сочи, Став­рополь)
9
Великий Новго­род, Волжский, Калуга, Костро- ма, Нальчик, Новороссийск,
Орск, Псков, Таганрог
7(+2)
Великий Новго­род, Волжский, Калуга, Костро-
ма, Орск, Псков, Таганрог
Нальчик, Ново­российск
9
Великий Новго­род, Волжский, Калуга, Костро- ма, Нальчик, Новороссийск,
Орск, Псков, Таганрог
9
(Волжский,
Кострома, Наль­чик, Новорос­сийск, Орск,
Псков, Таган­рог)
Так как способ 31 (с алфавитным принципом определения цен­тров групп) нельзя назвать научным, и применялся он скорее для кон­траста со способом 32, то оба решения 2 и 31 следует отвергнуть, не­смотря на высокие значения энтропии. Оставшиеся решения (способы
1 и 32) в общем схоже разбивают тестовую выборку на четыре группы: «лидеры» (кластер №3), «средние» («сильные» – кластер №1, «сла-
бые» – кластер № 4), «аутсайдеры» (кластер №2). Для выбора лучшего их двух решений следует проанализировать их более подробно. На рисунке 4 представлены совместные графики решений, в которых ли-
114
114
ниями соединены средние значения каждого из 12 частных индикато­ров (v1-v12) для всех четырех кластеров.
а)
б)
Рисунок 4* – Графическая характеристика кластеров, полученных
разными способами метода k-средних: а) автоматический подбор началь-
ного разбиения по максимуму межгруппового расстояния (способ 1); б) определе-
ние центров групп начального разбиения вручную (способ 32).
* Рисунок получен авторами в ходе эксперимента
115
115
Сравнение графиков (см. рис. 4) позволяет установить опреде­ленное сходство полученных кластерных решений, однако следует отметить и отличия, в частности, решение, полученное по начальному разбиению с максимальным межгрупповым расстоянием (способ 1, см. рис. 4а), хуже разделяет города по индикатору v8 и v9 (строитель­ство, услуги пассажирского транспорта), чем это делает другое реше­ние (способ 32, см. рис. 4б), но несколько лучше выполняет разбиение по индикатору v12 (инвестиционная активность).
Более точно сопоставить полученные решения можно также по показателям дисперсии. В таблице 16 представлен стандартный отчет дисперсионного анализа двух сравниваемых группировок городов по 12 показателям (v1-v12).
Таблица 16*– Результаты дисперсионного анализа группировок
городов, построенных разными способами:
1- автоматический подбор начального разбиения по максимуму меж-
группового расстояния; 32 - определение центров групп начального
разбиения вручную
Способ 1 Способ 32
D
df1 D
факт
3458,86 3 1936,267 43 25,6044 0,000 3549,68 3 1845,445 43 27,5699 0,000
v1
1203,87 3 5244,896 43 3,28997 0,029 1344,19 3 5104,579 43 3,7744 0,017
v2
1518,31 3 874,242 43 24,8929 0,000 1558,95 3 833,606 43 26,8051 0,000
v3
18536,33 3 4082,867 43 65,0738 0,000 18826,7 3 3792,515 43 71,1531 0,000
v4
9471,23 3 3495,403 43 38,8379 0,000 10058,1 3 2908,555 43 49,5661 0,000
v5
419,08 3 4260,463 43 1,40988 0,253 325,64 3 4353,897 43 1,0720 0,371
v6
2548,05 3 1213,243 43 30,1029 0,000 2403,32 3 1357,977 43 25,3668 0,000
v7
4036,14 3 1504,124 43 38,4618 0,000 3738,29 3 1801,969 43 29,7353 0,000
v8
7060,86 3 2631,603 43 38,4578 0,000 6871,04 3 2821,432 43 34,9060 0,000
v9
19681,54 3 2947,538 43 95,7077 0,000 19871,2 3 2757,853 43 103,276 0,000
v10
8251,31 3 4113,792 43 28,7493 0,000 8112,03 3 4253,069 43 27,3385 0,000
v11
4614,19 3 3037,610 43 21,7726 0,000 4090,78 3 3561,027 43 16,4656 0,000
v12
df2 F p D
ост
df1 D
факт
df2 F p
ост
* Таблица составлена авторами по материалам исследования.
Сравнивая по таблице (см. табл. 16) значения сумм квадратов отклонения, можно сделать вывод, что межгрупповая вариация (D
факт
)
больше внутригрупповой (D
) для всех индикаторов кроме v2 и v6
ост
(труд, законопослушность). Сопоставляя представленные значения F- критерия с критическим (F
=2,82 для df1=3, df2=43 p=0,05)
крит
85
следует
сделать вывод, что в обоих случаях (1 и 32) влияние на формирование
85
Елисеева И.И., Юзбашев М.М. Общая теория статистики – М.: ФиС, 2001
116
116
групп всех индикаторов, за исключением v6, является существенным, то есть статистически значимым, так как F>F
. Примечательно, что
крит
если совсем исключить из анализа индикатор v6, то оказывается, что состав кластеров не изменяется.
Однако, как указывают М.С. Олдендерфер и Р.К. Блэшфилд, для проверки обоснованности кластерного решения приведенный анализ значимости не подходит, так как он всегда будет давать положитель­ные результаты, независимо от того, есть ли в исходных данных кла­стеры или нет 86. Для более достоверной проверки обоснованности решения следует провести повторную выборку, либо применить про­цедуры Монте-Карло. Но одним из лучших способов проверить обос­нованность решения указанные авторы называют тесты значимости для внешних признаков. Для этого необходимо сравнить кластеры по признакам, не применявшимся при получении кластерного решения. В качестве таких «внешних» признаков предлагается использовать значения удельного веса социально-экономических показателей горо­дов в идентичных показателях соответствующего субъекта РФ. В ча­стности, в официальных публикациях Росстата 87 используются ряд показателей, характеризующих вклад городов в общие социально­экономические показатели субъекта РФ: численность населения, среднегодовая численность работающих в организациях, основные фонды организаций, объемы промышленной продукции и работ, вы­полненных по договорам строительного подряда, ввод в действие жи­лых домов, оборот розничной торговли, инвестиции в основной капи­тал. Указанные показатели на самом деле являются внешними, так как характеризуют город как часть более общей социально­экономической системы – субъекта РФ. К тому же значения показате­лей уже являются относительными, что избавляет от необходимости их нормировать.
86
Олдендерфер М.С., Блэшфилд Р.К. Кластерный анализ //Факторный, дискриминантный
и кластерный анализ. – М.: Финансы и статистика, 1988.
87
Регионы России: социально-экономическое положение городов. 2004: Стат. сб. - М.:
Росстат, 2004
117
117
В таблице 17 представлены результаты проверки значимости внешних показателей для группировки городов двумя способами. В столбце «k» также даны значения коэффициента линейной корреляции каждого показателя с номером кластера, причем номера кластеров в данном случае были заданы следующей иерархией: 1 – «аутсайдеры», 2 – средние «слабые», 3 – средние «сильные», 4 – «лидеры». То есть, проверялась гипотеза о том, что более высокие значения показателей предопределяют попадание города в кластер с большим номером. На­личие сильной связи между номером кластера и каждым из показате­лей свидетельствует о подтверждении выдвинутой гипотезы.
Таблица 17* – Результаты проверки обоснованности двух кла-
стерных решений тестом значимости для внешних показателей
Способ 1 начального разбиения
Внешние показатели
Численность населения (% субъекта) 0,72 4936,97 1645,66 21,374 0,00000 Среднегодовая численность работающих (% субъекта) 0,72 6719,98 2239,99 23,480 0,00000 Основные фонды организаций (% субъекта) 0,67 11761,44 3920,48 17,523 0,00000 Объем промышленной продукции (% субъекта) 0,62 9462,95 3154,32 14,783 0,00001 Объем работ по дог. строит. подряда (% субъекта) 0,66 11875,00 3958,33 18,814 0,00000 Ввод в действие жилых домов (% субъекта) 0,67 13289,77 4429,92 17,551 0,00000 Оборот розничной торговли (% субъекта) 0,74 16549,08 5516,36 25,431 0,00000 Инвестиции в основной капитал (% субъекта) 0,70 12820,98 4273,66 16,819 0,00000
k D
D
факт
F p
ост
Способ 32 начального разбиения
Внешние показатели
Численность населения (% субъекта) 0,73 5270,36 1756,79 25,374 0,00000 Среднегодовая численность работающих (% субъекта) 0,75 7225,78 2408,59 28,797 0,00000 Основные фонды организаций (% субъекта) 0,69 11961,20 3987,07 18,198 0,00000 Объем промышленной продукции (% субъекта) 0,67 10344,87 3448,29 17,879 0,00000 Объем работ по дог. строит. подряда (% субъекта) 0,71 12066,45 4022,15 19,530 0,00000 Ввод в действие жилых домов (% субъекта) 0,67 13116,97 4372,32 17,051 0,00000 Оборот розничной торговли (% субъекта) 0,77 17158,43 5719,48 28,209 0,00000 Инвестиции в основной капитал (% субъекта) 0,69 12848,08 4282,69 16,896 0,00000
k D
* Таблица составлена авторами по материалам исследования.
D
факт
F p
ост
Результаты теста значимости показывают, что полученные раз­ными способами кластеры достоверно различаются и по внешним по­казателям (D
факт>Dост
и F>F
). Следовательно, оба кластерных ре-
крит
шения следует считать обоснованными.
Таким образом, проведенное экспериментальное исследование методов кластеризации не позволило выявить только один наилучший
118
118
метод. Примерно равными характеристиками, но лучшими по сравне­нию с решениями остальных методов, обладают две разновидности итерационного метода k-средних с автоматическим подбором началь­ного разбиения по максимуму межгруппового расстояния и определе­нием центров групп начального разбиения вручную, по дендрограмме. Следовательно, после определения примерных центров кластеров по дендрограмме метода Уорда с обратным коэффициентом корреляции в качестве меры сходства, указанные разновидности метода k-средних в данном исследовании следует использовать совместно. Окончатель­ное решение можно будет принять только в результате анализа устой­чивости кластеризации по имеющимся статистическим данным за че­тыре года и содержательного анализа кластеров каждой из групп го­родов.
2.3. Кластеризация и формирование типов больших горо­дов
После того, как была выполнена кластеризация тестовой выбор­ки городов по данным за 2003 год, метод Уорда с обратным коэффи­циентом корреляции в качестве меры сходства был применен еще три раза для той же выборки, но данные использовались за 2000, 2001 и 2002 годы. Аналогичным образом выполнена кластеризация других групп городов по данным за 2000-2003 годы. Цель применения метода Уорда с обратным коэффициентом корреляции в качестве меры сход­ства заключается в получении разбиения на четыре кластера и опре­делении по дендрограмме городов, находящихся ближе всех к цен­трам кластеров. Полученная таким образом информация используется затем в методе k-средних для указания центров групп начального раз­биения. Как было отмечено выше указанный способ кластеризации дает одинаково хорошие результаты с методом k-средних с автомати­ческим подбором начального разбиения по максимуму межгруппово­го расстояния. Для возможности сравнить получаемые решения по­требовалось реализовать оба варианта метода k-средних для всех имеющихся групп городов и периодов времени. Так как использован-
119
119
n
n
ные в работе формальные методы сравнения решений (по значению энтропии, по тесту значимости внешних признаков) не помогли одно­значно выбрать лучшее, то для возможности содержательного анализа был выполнен расчет сводного индекса социально-экономического состояния городов, как среднего арифметического значений 12 част­ных индикаторов. Предложенный способ расчета сводного индекса является довольно грубым, но, тем не менее, часто используемым на практике. Использование единого показателя для характеристики со­циально-экономического состояния города удобно, так как, во­первых, вся иерархия городов становится в большей степени обозри­мой, во-вторых, облегчается процесс сопоставления вариантов кла­стерных решений..
Реализуя появившуюся возможность сравнения кластерных ре­шений по значениям сводного индекса попадающих в один кластер городов, было сформировано итоговое разбиение. Следует отметить, что примерно 80% итогового разбиения было составлено по решениям с автоматическим подбором начального разбиения по максимуму межгруппового расстояния. Лишь примерно в 20% случаев способ оп­ределения центров групп начального разбиения вручную дал лучшие решения.
Для оценки устойчивости полученной кластерной структуры при использовании данных за разные годы был использован квадра­тический коэффициент изменения рангов KRK, основанный на коэф­фициенте корреляции рангов Спирмена 88. В статистических исследо­ваниях показатель KRK позволяет оценить структурные сдвиги в ран­жированных списках.
Расчет показателя KRK выполняется по формуле
n
()
3
-
120
-
3
å
i
=
KRK
88
Елисеева И.И., Юзбашев М.М. Общая теория статистики – М.: ФиС, 2001, с. 463
1
=
2
iRiR
01
,
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]