Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Статистика. Учебник
.pdf
Оценкипараметровстепенноймоделиlnaиbмогутбытьполуче-
ii
ii
∑∑
ныизследующейсистемыуравнений:
ln ln ln ;
y an b x
= ⋅+⋅
ln ln ln ln (ln ) .
y x a xb x
∑ ∑∑
i ii
= ⋅ +⋅
ii i i
2
.Крупнейшимистранами–производителямипервич-
ногоникеляявляютсяРоссия,Япония,АвстралияиКанада.Ктрадиционно«никелевым»странам «подтянулся»Китай.Предложенияна
мировомрынкеникеляв2003–2007гг.представленывтабл.1.29.
Таблица 1.29
Год 2003 2004 2005 2006 2007
Производствопервичного
никеля,тыс.т
1189 1251 1301 1355 1430
Цены на никель формируются на Лондонской бирже металлов
(ЛБМ).Беспрецедентныйростцен,начавшийсявконце2005г.,продолжалсяв течениевсего2006г. идосередины2007г.Вмае2007г.
ценыдостигли52,2тыс.долл.СШАзатонну.Однакок августуони
упалипочтивдвараза–до27,7тыс.долл/т,акконцугодаснизились
до26тыс.долл/т.Ивсежесреднегодоваяцена2007г.нарафинированныйникельнаЛБМвырослаотносительно2006г.на52,5%–с24416
до37230долл/т(рис.1.3).
Рис.10.1.Мировыеценынаникель,долл.СШАзатонну,погодам
81

Определитькорреляционную связьилинейнуюзависимость про-
5 134 281 025 6526 99 871
5
⋅ −⋅
ˆ
128627 113,8533 .yx=−+
22
5 134 281 025 99 871 6526
⋅ −⋅
изводствапервичногоникеляxиценнаникельyнаЛондонскойбиржеметаллов.Построитьдиаграммурассеяния.
Решение
Дляопределенияпараметровлинейнойрегрессиисоставимтабл.1.30.
Таблица 1.30
Год x,тыс.т y,долл/т x
2003 1189 9640 1413721 11461960 92929600
2004 1251 13852 1565001 17328852 191877904
2005 1301 14733 1692601 19167633 217061289
2006 1355 24416 1836025 33083680 596141056
2007 1430 37230 2044900 53238900 1386072900
Сумма 6526 99871 8552248 134281025 2484082749
2
xy y
2
Объемвыборкиn = 5.
Параметрылинейнойрегрессии:
b
a
Следовательно,линейнаярегрессияимеетвид
Коэффициенткорреляции:
r
= =
5 2 484 082 749 (99 871 ) 5 8 552 248 (6526 )
⋅ − ⋅⋅ −
Коэффициентдетерминации:
КоэффициенткорреляцииПирсонаr близоккединице,чтосвиде-
тельствуетосильнойпрямойсвязимеждупеременными.
КоэффициентдетерминацииR2 позволяетсделатьвыводотом,что
зависимостьобъясняет91,4%вариации,остальные8,6%объясняютсядругимифакторами,не включеннымивмодель.
82
= =
5 8 552 248 (6526)
⋅−
99871 113,8533 6526
= = −
−⋅
2
113,8533;
12 8627.
2
0,9144.R =
(1.10)
0,9562;

В табл. 1.31 приведенырезультатырасчетапрогнозных значений
ˆ
,y
ˆˆ
yyyy−−
ˆyˆ
yy−
ˆ
()yy
23
n
−
∑
41 000
Цена, долл/т
ошибок
Год x y
2003 1189 9640 6745 2895 8381025
2004 1251 13852 13803 49 2401
2005 1301 14733 19496 –4763 22686169
2006 1355 24416 25644 –1228 1507984
2007 1430 37230 34183 3047 9284209
Сумма 6526 99871 – 0 41861788
,( )
2
.
Таблица 1.31
−
Дисперсияраспределенияостатковвдольлиниирегрессии:
2
ˆ
()
−
2
s
yy
= = =
41 861 788
13 953,9.
Стандартнаяошибкаs =3735,5долл/т.
Поданнымтабл.1.31построимдиаграммурассеяния(рис.1.4).
2
36 000
31 000
26 000
21 000
16 000
11 000
6000
1100 1200 1300 1400 1500
Поформуле(1.10)можнопрогнозировать мировыеценынаникель
взависимостиотобъемаегопроизводства.
Сильная корреляция между переменными не обязательно указываетнапричину и следствие. Просторост производствапервичного
никеля у и цен на никель x на Лондонской бирже металлов связан
y = 113,85x ‒ 128 627
R2 = 0,9144
Объем прои зв одства, ты с. т
(зависимостьмировыхценнаникельотобъемапроизводства)
Рис.1.4.Диаграммарассеяния
83

с увеличениемуровня спроса и невозможностью его полного удов-
ˆ
y
( )
()
yy
летворения. Выявленная тенденция роста производства первичного
никеляуи цен наникельx изменится, как тольконебудетдефицитаникеля.Впользуэтогосвидетельствуеттотфактвусловиизадачи
1.22,чтовмае2007г.ценыдостигли52,2тыс.долл/т.,однакокавгустуониупалипочтив двараза–до27,7тыс.долл/т, а кконцугода
снизились до 26 тыс. долл/т. Поэтому при анализе экономических
явленийпроводится исследование по выявлению всехфакторов,которыеоказываютнанихвлияние.Неучеттакихфакторовможетпривестикложнойкорреляциии,следовательно,ложнымвыводам.
Примером ложной корреляции является установление
сильнойсвязимеждузарплатойпреподавателейвузаипродажейспиртныхнапитков.Однаконеверноделатьвыводотом,чтопреподаватели
большепьютс ростомзарплаты.Простообевеличины связаны через
другуюпеременную:среднийуровеньдушевогодоходанаселения.
Следуетпонимать,чтопричинно-следственнаясвязьикорреляция −
неодноитоже.
.Для10случайновыбранныхстудентовНИТУ«МИСиС»
наосновании x
стике,иy
−числа пропущенных занятий в семестрепо стати-
i
−оценкинаэкзаменепостатистикевычислитькоэффици-
i
енткорреляциимеждуэтимифакторамииоценкуегостатистической
значимости,построитьуравнениепарнойлинейнойрегрессии.
Решение
Данныепредставленыв1-йи2-йграфахтабл. 1.32.
Таблица 1.32
Номер
наблюдения
x
iyi
2
x
i
xi y
2
y
i
i
e
i
i
2
e
i
1 2 3 4 5 6 7 8 9 10
yy−
2
ˆ
−
i
i
1 3 4 9 12 16 3,8238 0,1762 0,03104 0,17978 0,36
2 4 3 16 12 9 3,4978 –0,4978 0,24780 0,00960 0,16
3 1 5 1 5 25 4,4758 0,5242 0,27479 1,15778 2,56
4 2 4 4 8 16 4,1498 –0,1498 0,02244 0,56220 0,36
5 10 2 100 20 4 1,5418 0,4582 0,20995 3,45212 1,96
6 6 3 36 18 9 2,8458 0,1542 0,02378 0,30692 0,16
7 2 4 4 8 16 4,1498 –0,1498 0,02244 0,56220 0,36
8 5 3 25 15 9 3,1718 –0,1718 0,02952 0,05198 0,16
9 3 4 9 12 16 3,8338 0,1762 0,03106 0,17978 0,36
10 7 2 49 14 4 2,5198 –0,5198 0,27019 0,77475 1,96
Итого 43 34 253 124 124 34,002 0 1,16300 7,237 8,40
84
2

Длявыборочныхоценоксреднихидисперсийрядовпризнаковx и
∑
22
ˆ
ii
y a bx= +⋅
3,4 ( 0, 326) 4,3 4,802.a = −− ⋅ =
ˆ
4,802 0,326 .yx= −
ˆ
i
y
y полученыследующиезначения:
x xn y= = = = =
2 2 22 2
s x x nx x
( ) ( ) 253 / 10 – 4,3 6,81;
= − =−= =
∑
xi
43 /10 4,3, 34 /10 3,4;
i
( )
22
124 /10 – 3, 4 0,84.
s
= =
( )
y
Выборочныйкоэффициенткорреляции
( ) ( ) [ 124 /10 – 4,3 3,4] / ( 6,81 0,84)
r xy x y s s= −⋅ ⋅ = ⋅ ⋅ =
xy x y
,
(12,4 – 4,3 3,4) / (2,6096 0,9165) – 0,928.
= ⋅ ⋅=
22
( )
Связьмеждучисломпропущенныхзанятий в семестреи оценкамипостатистикетеснаяобратная(выборочныйкоэффициенткорреляцииблизокк–1). Следовательно,чем больше пропущено занятий
всеместре,темнижерезультатыаттестации.
Корреляционнаясвязьявляетсястатистическизначимой приуровнезначимостиα =0,95,таккаквыполненонеравенство
rn r t− −= ⋅ − = > =
, , 0,95;8
xy xy
2 / 1 0,928 8 / 1 0,928 7, 04 2,31.
Длявыборочногоуравненияпарнойлинейнойрегрессии
значенияоценокпараметровравны:
Уравнениепарнойрегрессии:
Значения
значимостьфактораx регрессии подтверждаетсяданнымитабл.1.33
(10 124 43 34) (10 253 43 ) – 0,326; b = ⋅ −⋅ ⋅ − =
приведены в 6-й графе табл. 1.32. Статистическая
2
85

результатовдисперсионного анализа:
FF
>
2
( ) 7, 237
i
yyΣ− =
7,237 0,145 49, 9,
F = =
5,32F =
yy
yy
γ− −
. (Для проведения
; 1,k nk
дисперсионногоанализаиспользуютсяитоговыезначенияграф8,9и
10табл.1.32).
Таблица 1.33
Источник
Pегрессия
Необусловленныйрегрессией
Общая
дисперсия
Суммаквадратов
2
( ) 1,163
Σ− =
ii
2
( ) 8,400
Σ− =
i
Число
степеней
свободы
n–1=1 7,237/1=7,237
n–k=8 1,163/8=0,145
n–1=9 8,400/9=0,933
Несмещенная
оценка
дисперсии
Результаты
0 ,9 5;1 ,8
Кластерный анализ предназначен для разбиения совокупности
объектов на однородные группы (кластеры, или классы). По сути,
этозадачамногомернойклассификацииданных[8,13].
Существует около 100 разных алгоритмов кластеризации, однако наиболее часто используются иерархический кластерный анализ
икластеризацияметодовK-средних.
Кластерныйанализисплользуетсявследующихнаправлениях:
• вмаркетингедлясегментацииконкурентовипотребителей;
• вменеджментеиэкономикедляразбиенияперсоналанаразличныепоуровню мотивации группы, классификациипоставщиков,выявлениясхожихпроизводственныхситуаций,прикоторыхвозникаетбрак;
• вмедицинедляклассификациисимптомов,пациентов,препаратов;
• всоциологиидляразбиенияреспондентовнаоднородныегруппы.
Кластерный анализ хорошо зарекомендовал себя во всех сферах
жизнедеятельности человека. Он «работает» даже тогда, когда данных мало и не выполняются требования нормальности распределений случайных величини другие требованияклассических методов
статистическогоанализа.
. Проведено анкетирование сотрудников предприятия
минерально-сырьевого комплекса. Требуется определить наиболее
эффективныеметодыуправленияперсоналом.
86

Решение
Необходимо разделить сотрудников на группы и для каждой из них выделить наиболее эффективные рычаги управления.
Приэтомразличиямеждугруппамидолжныбытьочевидными,авнутригруппыреспондентыдолжныбытьмаксимальнопохожи.
В результате применения иерархического кластерного анализа
получается «дерево», глядя на которое необходимо определить, на
сколько классов (кластеров) следует разбить персонал. Например,
если персоналразбивается натри группы,то для изученияреспондентов, попавших вкаждый кластер, необходимоиспользовать данные,представленныевтабл. 1.34.
Таблица 1.34
Впроцентах
30–50
>50
Кластер Мужчины
1 83 89 5 67 12 15 94 32 31
2 41 37 45 14 63 74 62 44 21
3 52 72 10 7 31 22 71 23 53
лет
лет
Руково-
дители
Меди-
цина
Льготы
Заработ-
наяплата
Стаж
Обра-
зование
Табл.1.34 сформирована следующим образом: в первом столбце
расположенномеркластера.Первыйкластерна83%составляютмужчины,89%первогокластерапопадаютв возрастнуюкатегориюот30
до50лет,15%респондентовсчитают,чтольготыоченьважныит.д.
Далеесоставляютсяпортретыреспондентовкаждогокластера.
Первый кластер − в основноммужчины зрелого возраста, зани-
мающие руководящие позиции.Социальный пакет (медицина, льготы)ихнеинтересует.Онипредпочитаютполучатьхорошуюзаработнуюплату,анепомощьотработодателя.
Второй кластер – наоборот, отдает предпочтение социальному
пакету. Состоитон в основномизлюдей«ввозрасте», занимающих
невысокие посты.Дляреспондентовэтогокластеразаработнаяплата
являетсяважнымпоказателем,ноестьидругиеприоритеты.
Третий кластернаиболее«молодой». Вотличиеотпредыдущих
двух,очевиденинтересквозможностямобучения и профессиональногороста.Уэтойкатегориисотрудниковестьхорошийшанс вскоромвременипополнитьпервуюгруппу.
Таким образом, очевидно, что при планировании кампании по
внедрениюэффективныхметодовуправленияперсоналомможноуве-
87

личитьсоциальныйпакетувторойгруппывущерб,кпримеру, заработнойплате.
Если говорить о том, каких специалистов следует направлять
наобучение,томожнооднозначнорекомендоватьобратитьвнимание
натретьюгруппу.
Кластерный анализ – этомногомерная статистическая процедура,выполняющаясбор данных,содержащихинформациюовыборке
объектов, и затем упорядочивающая объекты в сравнительно однородныегруппы (кластеры).Кластер –группаэлементов,характеризуемыхобщимсвойством,главнаяцелькластерногоанализа–нахождениегруппсхожихобъектовввыборке.
Спектр применений кластерного анализа очень широк. Однако
универсальностьегоприменения привелакпоявлениюбольшогоколичества несовместимыхтерминов,методовиподходов,затрудняющих использование кластерного анализа и корректную интерпретациюегорезультатов.
Кластерныйанализвыполняетследующиеосновныезадачи:
• разработкатипологиииликлассификации;
• исследование полезных концептуальных схем группирования
объектов;
• порождениегипотезнаосновеисследованияданных;
• проверка гипотез или исследования для определения, действительнолитипы(группы),выделенныетем илиинымспособом,присутствуютвимеющихсяданных.
Применениекластерногоанализапредполагаетследующиеэтапы:
• отборвыборкидлякластеризации;
• определение множествапеременных, покоторым будутоцениватьсяобъектыввыборке;
• вычисление значенийтой или иной меры сходствамежду объ-
ектами;
• применение метода кластерного анализа для создания групп
сходныхобъектов;
• проверкадостоверностирезультатовкластерногорешения.
Кластерныйанализпредъявляетследующиетребования к данным:
• показателидолжныбытьнекоррелированнымимеждусобой;
• показателидолжныбытьбезразмерными;
• распределение показателейдолжнобытьблизкокнормальному
(Гауссову)распределению;
88

• показатели должны отвечать требованию «устойчивости», под
которой понимается отсутствие влияния на их значения случайных
факторов;
• выборкадолжнабытьоднородна,несодержать«выбросов».
Применение метода иерархического агломеративного семейства,
или метода Уорда, означает оптимизацию минимальной дисперсии
внутрикластеров,когдавитогесоздаютсякластерыприблизительно
равныхразмеров.МетодУорданаиболееудачендляанализаданных.
Вкачествемерыразличияиспользуетсяквадратичноеевклидоворасстояние,котороеспособствуетувеличениюконтрастностикластеров.
Результатом иерархического кластерного анализа является дендрограмма,или«сосульчатаядиаграмма».Приееинтерпретацииисследователисталкиваются с проблемойтогожерода,что и при толкованиирезультатовфакторногоанализа−отсутствиемоднозначных
критериев выделения кластеров. Рекомендуется использовать два
способа интерпретации− визуальный анализдендрограммы и сравнениерезультатовкластеризации, выполненной различными методами.Дендрограмма−этографическоеизображениеспомощью«дерева»объединениякластеров.
Визуальныйанализдендрограммыпредполагает«обрезаниедерева»наоптимальномуровнесходстваэлементоввыборки.Олдендерфер и Блэшфилд считают,что целесообразно«обрезать»на отметке
5шкалыобъединениякластеров(Rescaled DistanceClusterCombine),
такимобразом,будетдостигнут80%-ныйуровеньсходства.
Возникаетвопрос устойчивостипринятогокластерногорешения.
Посути,проверкаустойчивостикластеризации сводитсяк проверке
еедостоверности. Здесь существуетэмпирическоеправило − устойчиваятипологиясохраняетсяприизмененииметодовкластеризации.
Результаты иерархического кластерного анализа можно проверять
итеративнымкластерныманализомпометодуK-средних.Еслисравниваемыеклассификациигруппреспондентов имеют долю совпаденийболее70 % (более2/3совпадений),токластерноерешениепринимается.
Проверить адекватность решения, не прибегая к помощи другоговида анализа,нельзя.Покрайнеймере втеоретическомплане эта
проблемане решена. В классическойработеОлдендерфераи Блэшфилда «Кластерный анализ» подробно рассматриваются и в итоге
89

отвергаются дополнительные пять методов проверки устойчивости:
кофенетическая корреляция (не рекомендуется и ограничена в использовании); тесты значимости дисперсионного анализа (всегда
даютрезультат);методикаповторных(случайных)выборок,чтотем
не менее не доказывает обоснованность решения; тесты значимостидля внешних признаков(пригоднытолькодляповторныхизмерений);методыМонте-Карло(сложныидоступнытолькоопытным
математикам).
МетодK-среднихсущественноотличается отагломеративныхме-
тодов. Предполагается, что уже есть гипотезы относительно числа
кластеров(понаблюдениямилипопеременным). Тогдаможнообра-
зоватьровноKкластеров так, чтобыонибылинастолькоразличны,
насколькоэто возможно.ЭтузадачурешаетметодK-средних.Вобщем случае методK-средних строитровно Kразличных кластеров,
расположенныхнавозможнобόльшихрасстоянияхдруготдруга.
Свычислительнойточкизренияэтотметодможетрассматривать-
ся как дисперсионныйанализ «наоборот».Программа начинает с K
случайно выбранных кластеров, а затем изменяет принадлежность
объектовкним,чтобы:
• минимизироватьизменчивостьвнутрикластеров;
• максимизироватьизменчивостьмеждукластерами.
Данный способ аналогичен методу «обратного дисперсионного
анализа»втомсмысле,чтокритерийзначимостивдисперсионном
анализе сравнивает межгрупповую изменчивость с внутригрупповойприпроверкегипотезыотом,чтосредниевгруппахотличаются
друготдруга.
Вкластеризации методомK-среднихпрограммаперемещаетобъ-
екты(т.е.наблюдения)изоднихгрупп(кластеров)вдругиедлятого,
чтобы получить наиболее значимый результатпри проведении дисперсионногоанализа.
.Пятьпроизводственныхобъектовминерально-сырье-
вогокомплексахарактеризуютсядвумяпризнаками:объемомпродаж
и среднегодовой стоимостью основных производственных фондов.
Данныеприведенывтабл.1.35.Провести классификацию этих объектовспомощьюпринципа«ближайшегососеда».
90
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
