Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Статистика. Учебник

.pdf
Скачиваний:
0
Добавлен:
08.09.2026
Размер:
2 Мб
Скачать
☆
Оценкипараметровстепенноймоделиlnaиbмогутбытьполуче-
ii
ii
∑∑
ныизследующейсистемыуравнений:
ln ln ln ;
y an b x
= ⋅+⋅  
ln ln ln ln (ln ) .
y x a xb x
∑ ∑∑
i ii
= ⋅ +⋅
ii i i
2
.Крупнейшимистранами–производителямипервич-
ногоникеляявляютсяРоссия,Япония,АвстралияиКанада.Ктради­ционно«никелевым»странам «подтянулся»Китай.Предложенияна мировомрынкеникеляв2003–2007гг.представленывтабл.1.29.
Таблица 1.29
Год 2003 2004 2005 2006 2007 Производствопервичного
никеля,тыс.т
1189 1251 1301 1355 1430
  Цены на никель формируются на Лондонской бирже металлов (ЛБМ).Беспрецедентныйростцен,начавшийсявконце2005г.,про­должалсяв течениевсего2006г. идосередины2007г.Вмае2007г. ценыдостигли52,2тыс.долл.СШАзатонну.Однакок августуони упалипочтивдвараза–до27,7тыс.долл/т,акконцугодаснизились до26тыс.долл/т.Ивсежесреднегодоваяцена2007г.нарафинирован­ныйникельнаЛБМвырослаотносительно2006г.на52,5%–с24416 до37230долл/т(рис.1.3).
Рис.10.1.Мировыеценынаникель,долл.СШАзатонну,погодам
81
Определитькорреляционную связьилинейнуюзависимость про-
5 134 281 025 6526 99 871
5
⋅ −⋅
ˆ
128627 113,8533 .yx=−+
22
5 134 281 025 99 871 6526
⋅ −⋅
изводствапервичногоникеляxиценнаникельyнаЛондонскойбир­жеметаллов.Построитьдиаграммурассеяния.
Решение
Дляопределенияпараметровлинейнойрегрессиисоставимтабл.1.30.
Таблица 1.30
Год x,тыс.т y,долл/т x 2003 1189 9640 1413721 11461960 92929600 2004 1251 13852 1565001 17328852 191877904 2005 1301 14733 1692601 19167633 217061289 2006 1355 24416 1836025 33083680 596141056 2007 1430 37230 2044900 53238900 1386072900
Сумма 6526 99871 8552248 134281025 2484082749
2
xy y
2
Объемвыборкиn = 5.
Параметрылинейнойрегрессии:
b
a
Следовательно,линейнаярегрессияимеетвид
Коэффициенткорреляции:
r
= =
5 2 484 082 749 (99 871 ) 5 8 552 248 (6526 )
⋅ − ⋅⋅ −
Коэффициентдетерминации:

КоэффициенткорреляцииПирсонаr близоккединице,чтосвиде-
тельствуетосильнойпрямойсвязимеждупеременными.
КоэффициентдетерминацииR2 позволяетсделатьвыводотом,что зависимостьобъясняет91,4%вариации,остальные8,6%объясняют­сядругимифакторами,не включеннымивмодель.
82
= =
5 8 552 248 (6526)
⋅−
99871 113,8533 6526
= = −
−⋅
2
113,8533;
12 8627.
2
0,9144.R =

(1.10)
0,9562;
В табл. 1.31 приведенырезультатырасчетапрогнозных значений
ˆ
,y
ˆˆ
yyyy−−
ˆyˆ
yy−
ˆ
()yy
23
n
−
∑
41 000
Цена, долл/т
ошибок
Год x y
2003 1189 9640 6745 2895 8381025 2004 1251 13852 13803 49 2401 2005 1301 14733 19496 –4763 22686169 2006 1355 24416 25644 –1228 1507984 2007 1430 37230 34183 3047 9284209
Сумма 6526 99871 – 0 41861788
,( )
2
.
Таблица 1.31
−
Дисперсияраспределенияостатковвдольлиниирегрессии:
2
ˆ
()
−
2
s
yy
= = =
41 861 788
13 953,9.
Стандартнаяошибкаs =3735,5долл/т. Поданнымтабл.1.31построимдиаграммурассеяния(рис.1.4).
2
36 000
31 000
26 000
21 000
16 000
11 000
6000
1100 1200 1300 1400 1500
Поформуле(1.10)можнопрогнозировать мировыеценынаникель
взависимостиотобъемаегопроизводства.
Сильная корреляция между переменными не обязательно указы­ваетнапричину и следствие. Просторост производствапервичного никеля у и цен на никель x на Лондонской бирже металлов связан
y = 113,85x ‒ 128 627
R2 = 0,9144
Объем прои зв одства, ты с. т
(зависимостьмировыхценнаникельотобъемапроизводства)
Рис.1.4.Диаграммарассеяния
83
с увеличениемуровня спроса и невозможностью его полного удов-
ˆ
y
( )
()
yy
летворения. Выявленная тенденция роста производства первичного никеляуи цен наникельx изменится, как тольконебудетдефици­таникеля.Впользуэтогосвидетельствуеттотфактвусловиизадачи
1.22,чтовмае2007г.ценыдостигли52,2тыс.долл/т.,однакокавгу­стуониупалипочтив двараза–до27,7тыс.долл/т, а кконцугода снизились до 26 тыс. долл/т. Поэтому при анализе экономических явленийпроводится исследование по выявлению всехфакторов,ко­торыеоказываютнанихвлияние.Неучеттакихфакторовможетпри­вестикложнойкорреляциии,следовательно,ложнымвыводам.
 Примером ложной корреляции является установление
сильнойсвязимеждузарплатойпреподавателейвузаипродажейспирт­ныхнапитков.Однаконеверноделатьвыводотом,чтопреподаватели большепьютс ростомзарплаты.Простообевеличины связаны через другуюпеременную:среднийуровеньдушевогодоходанаселения.
Следуетпонимать,чтопричинно-следственнаясвязьикорреляция −
неодноитоже.
.Для10случайновыбранныхстудентовНИТУ«МИСиС»
наосновании x
стике,иy
−числа пропущенных занятий в семестрепо стати-
i
−оценкинаэкзаменепостатистикевычислитькоэффици-
i
енткорреляциимеждуэтимифакторамииоценкуегостатистической значимости,построитьуравнениепарнойлинейнойрегрессии.
Решение Данныепредставленыв1-йи2-йграфахтабл. 1.32.
Таблица 1.32
Номер
наблюдения
x
iyi
2
x
i
xi y
2
y
i
i
e
i
i
2
e
i
1 2 3 4 5 6 7 8 9 10
yy−
2
ˆ
−
i
i
1 3 4 9 12 16 3,8238 0,1762 0,03104 0,17978 0,36 2 4 3 16 12 9 3,4978 –0,4978 0,24780 0,00960 0,16 3 1 5 1 5 25 4,4758 0,5242 0,27479 1,15778 2,56 4 2 4 4 8 16 4,1498 –0,1498 0,02244 0,56220 0,36 5 10 2 100 20 4 1,5418 0,4582 0,20995 3,45212 1,96 6 6 3 36 18 9 2,8458 0,1542 0,02378 0,30692 0,16 7 2 4 4 8 16 4,1498 –0,1498 0,02244 0,56220 0,36 8 5 3 25 15 9 3,1718 –0,1718 0,02952 0,05198 0,16 9 3 4 9 12 16 3,8338 0,1762 0,03106 0,17978 0,36
10 7 2 49 14 4 2,5198 –0,5198 0,27019 0,77475 1,96
Итого 43 34 253 124 124 34,002 0 1,16300 7,237 8,40
84
2
Длявыборочныхоценоксреднихидисперсийрядовпризнаковx и
∑
22
ˆ
ii
y a bx= +⋅
3,4 ( 0, 326) 4,3 4,802.a = −− ⋅ =
ˆ
4,802 0,326 .yx= −
ˆ
i
y
y полученыследующиезначения:
x xn y= = = = =
2 2 22 2
s x x nx x
( ) ( ) 253 / 10 – 4,3 6,81;
= − =−= =
∑
xi
43 /10 4,3, 34 /10 3,4;
i
( )
22
124 /10 – 3, 4 0,84.
s
= =
( )
y
Выборочныйкоэффициенткорреляции
( ) ( ) [ 124 /10 – 4,3 3,4] / ( 6,81 0,84)
r xy x y s s= −⋅ ⋅ = ⋅ ⋅ =
xy x y
,
(12,4 – 4,3 3,4) / (2,6096 0,9165) – 0,928.
= ⋅ ⋅=
22
( )
Связьмеждучисломпропущенныхзанятий в семестреи оценка­мипостатистикетеснаяобратная(выборочныйкоэффициенткорре­ляцииблизокк–1). Следовательно,чем больше пропущено занятий всеместре,темнижерезультатыаттестации.
Корреляционнаясвязьявляетсястатистическизначимой приуров­незначимостиα =0,95,таккаквыполненонеравенство
rn r t− −= ⋅ − = > =
, , 0,95;8
xy xy
2 / 1 0,928 8 / 1 0,928 7, 04 2,31.
Длявыборочногоуравненияпарнойлинейнойрегрессии
значенияоценокпараметровравны:
Уравнениепарнойрегрессии:
Значения значимостьфактораx регрессии подтверждаетсяданнымитабл.1.33
(10 124 43 34) (10 253 43 ) – 0,326; b = ⋅ −⋅ ⋅ − =
приведены в 6-й графе табл. 1.32. Статистическая
2
85
результатовдисперсионного анализа:
FF
>
2
( ) 7, 237
i
yyΣ− =
7,237 0,145 49, 9,
F = =
5,32F =
yy
yy
γ− −
. (Для проведения
; 1,k nk
дисперсионногоанализаиспользуютсяитоговыезначенияграф8,9и 10табл.1.32).
Таблица 1.33
Источник
Pегрессия
Необусловлен­ныйрегрессией
Общая
дисперсия
Суммаквадратов
2
( ) 1,163
Σ− =
ii
2
( ) 8,400
Σ− =
i
Число
степеней
свободы
n–1=1 7,237/1=7,237
n–k=8 1,163/8=0,145
n–1=9 8,400/9=0,933
Несмещенная
оценка
дисперсии
Результаты
0 ,9 5;1 ,8

Кластерный анализ предназначен для разбиения совокупности объектов на однородные группы (кластеры, или классы). По сути, этозадачамногомернойклассификацииданных[8,13].
Существует около 100 разных алгоритмов кластеризации, одна­ко наиболее часто используются иерархический кластерный анализ икластеризацияметодовK-средних.
Кластерныйанализисплользуетсявследующихнаправлениях:
• вмаркетингедлясегментацииконкурентовипотребителей;
• вменеджментеиэкономикедляразбиенияперсоналанаразлич­ныепоуровню мотивации группы, классификациипоставщиков,выяв­лениясхожихпроизводственныхситуаций,прикоторыхвозникаетбрак;
• вмедицинедляклассификациисимптомов,пациентов,препаратов;
• всоциологиидляразбиенияреспондентовнаоднородныегруппы.
Кластерный анализ хорошо зарекомендовал себя во всех сферах жизнедеятельности человека. Он «работает» даже тогда, когда дан­ных мало и не выполняются требования нормальности распределе­ний случайных величини другие требованияклассических методов статистическогоанализа.
. Проведено анкетирование сотрудников предприятия минерально-сырьевого комплекса. Требуется определить наиболее эффективныеметодыуправленияперсоналом.
86
Решение
Необходимо разделить сотрудников на группы и для каж­дой из  них выделить наиболее эффективные рычаги управления. Приэтомразличиямеждугруппамидолжныбытьочевидными,авну­тригруппыреспондентыдолжныбытьмаксимальнопохожи.
В результате применения иерархического кластерного анализа получается «дерево», глядя на которое необходимо определить, на сколько классов (кластеров) следует разбить персонал. Например, если персоналразбивается натри группы,то для изученияреспон­дентов, попавших вкаждый кластер, необходимоиспользовать дан­ные,представленныевтабл. 1.34.
Таблица 1.34
Впроцентах
30–50
>50
Кластер Мужчины
1 83 89 5 67 12 15 94 32 31 2 41 37 45 14 63 74 62 44 21 3 52 72 10 7 31 22 71 23 53
лет
лет
Руково-
дители
Меди-
цина
Льготы
Заработ-
наяплата
Стаж
Обра-
зование
Табл.1.34 сформирована следующим образом: в первом столбце расположенномеркластера.Первыйкластерна83%составляютмуж­чины,89%первогокластерапопадаютв возрастнуюкатегориюот30 до50лет,15%респондентовсчитают,чтольготыоченьважныит.д.
Далеесоставляютсяпортретыреспондентовкаждогокластера.
Первый кластер − в основноммужчины зрелого возраста, зани- мающие руководящие позиции.Социальный пакет (медицина, льго­ты)ихнеинтересует.Онипредпочитаютполучатьхорошуюзаработ­нуюплату,анепомощьотработодателя.
Второй кластер – наоборот, отдает предпочтение социальному пакету. Состоитон в основномизлюдей«ввозрасте», занимающих невысокие посты.Дляреспондентовэтогокластеразаработнаяплата являетсяважнымпоказателем,ноестьидругиеприоритеты.
Третий кластернаиболее«молодой». Вотличиеотпредыдущих двух,очевиденинтересквозможностямобучения и профессиональ­ногороста.Уэтойкатегориисотрудниковестьхорошийшанс вско­ромвременипополнитьпервуюгруппу.
Таким образом, очевидно,  что при планировании кампании по внедрениюэффективныхметодовуправленияперсоналомможноуве-
87
личитьсоциальныйпакетувторойгруппывущерб,кпримеру, зара­ботнойплате.
 Если говорить о том, каких специалистов следует направлять наобучение,томожнооднозначнорекомендоватьобратитьвнимание натретьюгруппу.
Кластерный анализ – этомногомерная статистическая процеду­ра,выполняющаясбор данных,содержащихинформациюовыборке объектов, и затем упорядочивающая объекты в сравнительно одно­родныегруппы (кластеры).Кластер –группаэлементов,характери­зуемыхобщимсвойством,главнаяцелькластерногоанализа–нахож­дениегруппсхожихобъектовввыборке.
Спектр применений кластерного анализа очень широк. Однако универсальностьегоприменения привелакпоявлениюбольшогоко­личества несовместимыхтерминов,методовиподходов,затрудняю­щих использование кластерного анализа и корректную интерпрета­циюегорезультатов.
Кластерныйанализвыполняетследующиеосновныезадачи:
• разработкатипологиииликлассификации;
• исследование полезных концептуальных схем группирования
объектов;
• порождениегипотезнаосновеисследованияданных;
• проверка гипотез или исследования для определения, действи­тельнолитипы(группы),выделенныетем илиинымспособом,при­сутствуютвимеющихсяданных.
Применениекластерногоанализапредполагаетследующиеэтапы:
• отборвыборкидлякластеризации;
• определение множествапеременных, покоторым будутоцени­ватьсяобъектыввыборке;
• вычисление значенийтой или иной меры сходствамежду объ-
ектами;
• применение метода кластерного анализа для создания групп
сходныхобъектов;
• проверкадостоверностирезультатовкластерногорешения.
Кластерныйанализпредъявляетследующиетребования к данным:
• показателидолжныбытьнекоррелированнымимеждусобой;
• показателидолжныбытьбезразмерными;
• распределение показателейдолжнобытьблизкокнормальному
(Гауссову)распределению;
88
• показатели должны отвечать требованию «устойчивости», под которой понимается отсутствие влияния на их значения случайных факторов;
• выборкадолжнабытьоднородна,несодержать«выбросов».
Применение метода иерархического агломеративного семейства, или метода Уорда, означает оптимизацию минимальной дисперсии внутрикластеров,когдавитогесоздаютсякластерыприблизительно равныхразмеров.МетодУорданаиболееудачендляанализаданных. Вкачествемерыразличияиспользуетсяквадратичноеевклидоворас­стояние,котороеспособствуетувеличениюконтрастностикластеров.
Результатом иерархического кластерного анализа является ден­дрограмма,или«сосульчатаядиаграмма».Приееинтерпретацииис­следователисталкиваются с проблемойтогожерода,что и при тол­кованиирезультатовфакторногоанализа−отсутствиемоднозначных критериев выделения кластеров. Рекомендуется использовать два способа интерпретации− визуальный анализдендрограммы и срав­нениерезультатовкластеризации, выполненной различными метода­ми.Дендрограмма−этографическоеизображениеспомощью«дере­ва»объединениякластеров.
Визуальныйанализдендрограммыпредполагает«обрезаниедере­ва»наоптимальномуровнесходстваэлементоввыборки.Олдендер­фер и Блэшфилд считают,что целесообразно«обрезать»на отметке 5шкалыобъединениякластеров(Rescaled DistanceClusterCombine), такимобразом,будетдостигнут80%-ныйуровеньсходства.
Возникаетвопрос устойчивостипринятогокластерногорешения. Посути,проверкаустойчивостикластеризации сводитсяк проверке еедостоверности. Здесь существуетэмпирическоеправило − устой­чиваятипологиясохраняетсяприизмененииметодовкластеризации. Результаты иерархического кластерного анализа можно проверять итеративнымкластерныманализомпометодуK-средних.Еслисрав­ниваемыеклассификациигруппреспондентов имеют долю совпаде­нийболее70 % (более2/3совпадений),токластерноерешениепри­нимается.
Проверить адекватность решения, не прибегая к помощи друго­говида анализа,нельзя.Покрайнеймере втеоретическомплане эта проблемане решена. В классическойработеОлдендерфераи Блэш­филда «Кластерный анализ» подробно рассматриваются и в итоге
89
отвергаются дополнительные пять методов проверки устойчивости: кофенетическая корреляция (не рекомендуется и ограничена в ис­пользовании); тесты значимости дисперсионного анализа (всегда
даютрезультат);методикаповторных(случайных)выборок,чтотем
не менее не доказывает обоснованность решения; тесты значимо­стидля внешних признаков(пригоднытолькодляповторныхизме­рений);методыМонте-Карло(сложныидоступнытолькоопытным математикам).
МетодK-среднихсущественноотличается отагломеративныхме- тодов. Предполагается, что уже есть гипотезы относительно числа кластеров(понаблюдениямилипопеременным). Тогдаможнообра-
зоватьровноKкластеров так, чтобыонибылинастолькоразличны, насколькоэто возможно.ЭтузадачурешаетметодK-средних.Воб­щем случае методK-средних строитровно Kразличных кластеров, расположенныхнавозможнобόльшихрасстоянияхдруготдруга.
Свычислительнойточкизренияэтотметодможетрассматривать-
ся как дисперсионныйанализ «наоборот».Программа начинает с K случайно выбранных кластеров, а затем изменяет принадлежность объектовкним,чтобы:
• минимизироватьизменчивостьвнутрикластеров;
• максимизироватьизменчивостьмеждукластерами.
Данный способ аналогичен методу «обратного дисперсионного
анализа»втомсмысле,чтокритерийзначимостивдисперсионном анализе сравнивает межгрупповую изменчивость с внутригруппо­войприпроверкегипотезыотом,чтосредниевгруппахотличаются друготдруга.
Вкластеризации методомK-среднихпрограммаперемещаетобъ-
екты(т.е.наблюдения)изоднихгрупп(кластеров)вдругиедлятого, чтобы получить наиболее значимый результатпри проведении дис­персионногоанализа.
.Пятьпроизводственныхобъектовминерально-сырье-
вогокомплексахарактеризуютсядвумяпризнаками:объемомпродаж и среднегодовой стоимостью основных производственных фондов. Данныеприведенывтабл.1.35.Провести классификацию этих объ­ектовспомощьюпринципа«ближайшегососеда».
90
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]