Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Программные системы статистического анализа. Обнаружение закономерностей в данных с использованием системы R и языка Python. Учебное пособие

.pdf
Скачиваний:
0
Добавлен:
07.09.2026
Размер:
1 Мб
Скачать
☆
Таким образом, можно сформулировать следующие правила выбо-
ра критерия проверки гипотезы об однородности средних:
если две выборки независимые, то используется параметриче-
ский (требующий выполнения предположения нормальности) крите­рий Стьюдента или непараметрический его аналог – критерий Манна– Уитни;
если две выборки парные (зависимые), то используется либо
критерий Стьюдента для парных выборок (параметрический случай), либо критерий Вилкоксона (непараметрический случай);
если выборок больше двух, при их независимости используются
критерии Краскелла–Уоллиса (непараметрический подход), и при ис­пользовании параметрического подхода – однофакторный дисперси­онный анализ;
для трех и более зависимых выборок используется критерий
Фридмана.
Приведенные правила позволят получить корректный результат проверки предположений о зависимости одного или нескольких иссле­дуемых показателей от других данных.
2.3. ПРИМЕР ПРОВЕРКИ СТАТИСТИЧЕСКИХ ГИПОТЕЗ
Рассмотрим в качестве примера набор данных, описанный в первой главе. Данные хранятся в переменной data. Зададимся уровнем значи­мости = 0.05. В первой главе было сделано предположение о том, что в наборе данных Income.csv есть зависимость между переменными, характеризующими доход и возраст.
Прежде всего проверим наличие корреляции между переменными, для этого воспользуемся линейным к
оэффициентом корреляции Пирсона:
>cor.test(data$age,data$income)
Pearson's product-moment correlation
data: data$age and data$income
t = 28.458, df = 6398, p-value < 2.2e-16
alternative hypothesis: true correlation is not equal to 0
95 percent confidence interval:
0.3132728 0.3567708
sample estimates:
cor
0.3352004
31
Значение p-value – достигнутый уровень значимости, меньше за­данного уровня значимости , что говорит о том, что гипотеза о равен­стве коэффициента корреляции нулю отвергается, и между доходом и возрастом есть зависимость, хотя само значение корреляции на уровне
0.3352 далеко от значения единицы, которое характеризует строгую линейную связь. Чтобы более подробно исследовать вопрос нез
ависи­мости, проверить утверждение о независимости дохода и возраста, можно использовать критерий хи-квадрат Пирсона. Для этого по дан­ным возраста и пола составим таблицу сопряженности:
>tmp = with(data, table(cut(data$income,
quantile(data$income)), cut(data$age, quantile(data$age))))
>tmp
(18,33] (33,41] (41,51] (51,77] (9,28] 872 277 157 321 (28,45] 557 467 356 229 (45,79] 261 494 502 274 (79,1.12e+03] 58 278 612 647
Первая строка и столбец представляют собой интервалы значений по переменным: возраст (первая строка) и доход (первый столбец). Сами значения элементов таблицы представляют собой частоты попа­даний значений в соответствующие интервалы. Далее проверим гипо­тезу о независимости возраста и дохода:
>chisq.test(tmp)
Pearson's Chi-squared test
data: tmp
X-squared = 1540.5, df = 9, p-value < 2.2e-16
Полученный достигнутый уровень значимости существенно мень­ше , следовательно, гипотеза о независимости отвергается. Наглядно выглядит и таблица сопряженности – из нее мы видим, что в целом больше всего людей с наименьшим доходом среди людей молодого возраста и, наоборот, самый большой доход чаще всего у более взрос­лых людей. Кроме того, можно заметить, что данную за
висимость нельзя назвать строго линейной, например, группа людей в возрасте от 33 лет до 41 года выбивается из общей картины, что согласуется с вы­водом, сделанным с помощью коэффициента корреляции.
32
Далее проверим однородность доходов по гендерному признаку. Чтобы определиться с тем, какой критерий использовать, для начала разделим данные по переменной пол на две выборки и проверим их на нормальность:
>dataM<- data[which(data$gender=="m"),]$income >dataF<- data[which(data$gender=="f"),]$income >ad.test(dataM)
Anderson-Darling normality test
data: dataM
A = 329.94, p-value < 2.2e-16
>ad.test(dataF)
Anderson-Darling normality test
data: dataF
A = 318.01, p-value< 2.2e-16
Гипотеза о нормальности выборок дохода для мужчин и женщин отвергается, поэтому следует воспользоваться непараметрическим критерием Манна–Уитни:
>wilcox.test(dataM,dataF)
Wilcoxon rank sum test with continuity correction
data: dataM and dataF
W = 5122300, p-value = 0.9724
alternative hypothesis: true location shift is not equal to 0
Приведенный вызов функции wilcox.test без дополнительных пара­метров соответствует критерию Манна–Уитни для количественных переменных. Согласно полученному значению p-value гипотеза об од­нородности не отвергается, что свидетельствует о том, что средние доходы у мужчин и женщин статистически не отличаются.
Проверим зависимость дохода от уровня образования. Вследствие того, что уровней образования четыре, необходимо подготовить дан­ные:
>data1 <- data[which(data$ed==1),]$income >data2 <- data[which(data$ed==2),]$income >data3 <- data[which(data$ed==3),]$income > data4 <- data[which(data$ed==4),]$income
33
Для выбора критерия однородности проверим гипотезу о нормаль­ности:
>ad.test(data1)
Anderson-Darling normality test
data: data1
A = 127.02, p-value < 2.2e-16
>ad.test(data2)
Anderson-Darling normality test
data: data2
A = 187.11, p-value < 2.2e-16
>ad.test(data3)
Anderson-Darling normality test
data: data3
A = 146.7, p-value < 2.2e-16
>ad.test(data4)
Anderson-Darling normality test
data: data4
A = 143.31, p-value < 2.2e-16
Видно, что все наборы данных не принадлежат нормальному зако­ну распределения, и стоит использовать критерий Краскелла–Уоллиса:
>kruskal.test(list(data1, data2, data3, data4))
Kruskal-Wallis rank sum test
data: list(data1, data2, data3, data4)
Kruskal-Wallis chi-squared = 60.295, df = 3, p-value = 5.083e-13
Гипотеза об однородности отвергается, так как p-value <, что свидетельствует о статистически значимых отличиях в размере дохода при различном уровне образования. Посмотрим на значения средних в соответствующих наборах данных:
> y = c(data1, data2, data3, data4) >group = rep(1:4, c(length(data1), length(data2),
length(data3), length(data4)))
>aggregate(y, by=list(group), FUN=mean)
34
Group.1 x
1 1 59.86619
2 2 66.20713
3 3 70.13456
4 4 78.65018
Действительно, можно увидеть, что чем выше уровень образова­ния, тем выше уровень дохода.
2.4. УПРАЖНЕНИЯ
1. Проверить сформированные в ходе предварительного анализа
гипотезы.
2. Обосновать выбор используемых для проверки гипотез крите-
риев.
3. Проверить дополнительные гипотезы (перечень приведен ниже).
Варианты дополнительных гипотез
1. На основе данных из первой главы (пакет R, набор iris3) прове­рить, зависят ли между собой длина и ширина чашелистиков и лепест­ков для каждого вида ириса. Являются ли подобными длина и чашелистиков и лепестков у каждого вида ириса?
2. На основе данных из первой главы (пакет R, набор ustralia. soybean) проверить, зависит ли урожайность от размера, белка, масла.
Проверить, является ли сопоставимой урожайность для разных лет, для разных локаций.
3. На основе данных из первой главы (пакет R, набор lasrosas.corn) проверить, зависит ли урож
айность от года, нитрогена, топографиче­ского фактора, значения яркости, типа азотного удобрения. Проверить является ли сопоставимой урожайность для разных лет, для разных локаций.
4. На основе данных из первой главы (пакет R, набор
harris.wateruse) проверить, зависит ли количество дней дерева от его
возраста, вида и других факторов. Проверить является ли сопостави­мым количество дней для разных видо
в деревьев.
5. На основе данных из первой главы (файл Employee.xls) прове­рить, зависит ли уровень дохода от возраста, стажа, дохода, профессии и пола. Проверить является ли сопоставимым уровень дохода для мужчин и женщин.
6. На основе данных из первой главы (файл Hospital.xls) проверить, зависят ли уровни дохода, зарпла
ты и расходов от количества коек,
лечебных дней и расположения лечебниц. Проверить, является ли
ширина
35
сопоставимым уровень ключевых характеристик для различно распо­ложенных лечебниц.
7. На основе данных из первой главы (файл House.xls) проверить, зависит ли цена дома от его площади, возраста, типа (угловой или не­угловой), ежегодного налога. Проверить, являются ли сопоставимыми цены для угловых и неугловых домов.
8. На основе данных из первой главы (файл Apartaments.xlsx) про-
в
верить, за
исит ли цена квартиры от ее общей площади, жилой площа­ди, площади кухни, наличия балкона и числа месяцев до окончания срока строительства. Проверить, являются ли сопоставимыми цены для квартир с балконом и без.
9. На основе данных из первой главы (файл Salary.xlsx) проверить,
зависит ли уровень зарплаты от научной степ
ени, должности при при­ёме, наличия степени при приеме, пола, возраста и стажа. Проверить, является ли сопоставимым уровень зарплаты для мужчин и женщин, для различных научных степеней.
10. На основе данных из первой главы (файл ApartSale.xlsx) прове­рить, зависит ли цена квартиры от ее общей площади, жилой площади, площади кухни, этажа
, этажности дома и района. Проверить, являются
ли сопоставимыми цены для квартир из разных районов.
11. На основе данных из первой главы (файл Recycling.xlsx) прове­рить, зависит ли количество перерабатываемого мусора от количества производственных и непроизводственных отходов, от времени их пе­реработки. Проверить, является ли сопоставимым количество перера­батываемого мусора для высоких и низких значений наибол
ее значи-
мого фактора.
36
x
y
j
f
3. ПОСТРОЕНИЕ МОДЕЛЕЙ РЕГРЕССИИ
Регрессионный анализ – статистический метод исследования влия-
,1,
iq
ния одной или нескольких независимых переменных висимую переменную
. Регрессионный анализ служит для определе-
y
i
ния вида этого влияния и предоставляет возможность прогнозирования значений зависимой переменной по значениям независимых. Различа­ют простую и множественную регрессию: различие состоит в том, что в первом случае рассматривают одну независимую переменную, а во втором – несколько.
Запишем линейную (по параметрам) регрессионную модель в об-
щем виде:
, на за-
bbfxxbfxx bfxx 
0111 221 1
где
– число независимых переменных; m– число регрессоров,
q
включенных в модель. Регрессоры
( ,..., ) ( ,..., ) ... ( ,..., )
qqmmq
( ,..., )
xx
1
могут представлять
q
,
собой как степенные функции от отдельных переменных (и в целом нелинейные функции от них), так и взаимодействия нескольких переменных.
В регрессионной модели зависимости могут выражаться линейны­ми или нелинейными функциями. Многие связи определяются по сво­ей природе, либо являются собственно линейными, либо их можно привести к линейному виду, используя стандартные преобразовани
я (возведение в степень, логарифмирование и пр.). Причем эти процеду­ры часто применяют не только к исходным независимым переменным, но и к предсказываемой зависимой переменной: так, логарифмирова- ние отклика – это часто используемый в эконометрике прием, позво­ляющий одновременно и линеаризировать связи с независимыми пе­ременными, и приблизить распределение наблюдений к нормальному закону.
37
3.1. ОТБОР РЕГРЕССОРОВ
x
x
Существует два принципиально различных подхода к процедуре формирования модели по множеству рассматриваемых регрессоров. Первый, традиционный, заключается в том, что все регрессоры одно­временно включаются в модель, и определяется их значимость, в зави­симости от которой делаются выводы о качестве построенной модели. В этом случае на первоначальных этапах анализа необходимо опреде­лить, есть ли среди
рассматриваемых переменных
взаимозависимые.
i
При обнаружении коррелированных предикторных переменных (ситуация мультиколлинеарности) необходимо решить вопрос о про-
цедуре их включения в модель. Возможные варианты решения про­блемы – это либо выделение групп независимых переменных среди множества исходных, либо сокращение пространства исходных пере­менных с использованием методов факторного анализа.
3.1.1. Факторный анализ
Главными целями факторного анализа являются сокращение числа переменных и определение структуры взаимосвязей между перемен­ными, т. е. классификация переменных. Поэтому факторный анализ используется или как метод сокращения данных, или как метод клас­сификации. При этом второе направление – определение структуры взаимосвязей между переменными, приводящее к возможности их классификации, часто, особенно в сфере анализа социологических данных, имеет самостоят ванием результатов для проведения регрессионного анализа) значение, когда осуществляется поиск латентных (скрытых) переменных, кото­рые могут быть измерены только через группу взаимосвязанных явных переменных.
Для выявления же наиболее значимых факторов, используемых по­том в качестве регрессоров для регрессионного анализа, наиболее оправданно применять м стемы зависимых между собой переменных (представляющих собой некоторое пространство векторов) он предлагает нахождение такого ортогонального подпространства меньшей размерности, чтобы в про­екции на него исходной системы точек (многомерных наблюдений) искажения их конфигураций были минимальными. Поэтому, с тех пор как Хотеллинг дал статистическое обоснование для такого подхода,
ельное (без связи с последующим использо-
етод главны
х компонент, поскольку для си-
i
38
именно метод главных компонент, среди всех методов, относимых к факторному анализу, традиционно используется как метод для обра­ботки данных, предшествующий регрессионному анализу, если обна­руживается, что исходных предикторных переменных слишком много по сравнению с количеством наблюдений и, что важнее, эти перемен­ные сильно коррелированы между собой. При анализе в один фактор (называем сильно коррелированные между собой переменные, и при повторении процедуры выделения очередного фактора, как следствие, происходит перераспределение исходной дисперсии между компонентами и полу­чается максимально простая и наглядная структура ортогональных между собой факторов.
ый в данном методе также компонентом) объединяются
3.1.2. Метод включения или исключения переменных
Другим вариантом отбора переменных при построении модели яв­ляется метод пошагового включения переменных в регрессионную мо­дель (Forward stepwise) или пошагового исключения переменных из модели (Backward stepwise).
Метод пошагового включения переменных состоит в выборе из всего возможного набора факторных переменных именно тех, которые оказывают существенное влияние на результативную переменную. Сначала уравнение регрессии не содержит предикатов, они вводят по одному, если удовлетворяют определенному критерию. В основе порядка введения включаемых переменных лежит вклад переменной в объясняемую вариацию. В методе пошагового исключения все преди­каты включаются в уравнение регрессии, а затем по очереди выводятся из уравнения, исходя из их соответствия критерию. Кроме того, на практике может применяться метод пошагового отбора, который яв­ляется комбинацией методов включения и исключения. Факторы по­следовательно (поочередно) включаются в уравнение регрессии, и проверяется их значимость.
При проверке значимости введенного фактора определяется, насколько уменьшается сумма квадратов остатков и увеличивается ве­личина множественного коэффициента корреляции используется и обратный метод, т. е. исключение факторов, ставших незначимыми. Фактор является незначимым, если его включение в уравнение регрессии только изменяет значение коэффициентов регрес­сии, не уменьшая значительно суммы квадратов остатков. Если при
. Одновременно
ся
39
включении в модель соответствующего факторного признака величина множественного коэффициента корреляции значимо увеличивается, а коэффициент регрессии не изменяется (или меняется несущественно), то данный признак статистически значим, и его включение в уравне­ние регрессии необходимо.
3.2. ПРОВЕРКА КАЧЕСТВА И АДЕКВАТНОСТИ МОДЕЛИ
Определив вид регрессионной модели и получив оценки парамет­ров при соответствующих регрессорах, необходимо проверить каче­ство и адекватность построенной модели. Для контроля качества моде­ли рассмотрим метод скользящего контроля или кросс-валидации. Цель кросс-валидации в том, чтобы оценить ожидаемый уровень соот­ветствия модели данным, независимым от тех данных, на которых мо­дель тренировалась. Она может личественной меры соответствия, подходящей для данных и модели. Обычно кросс-валидация используется в ситуациях, где целью являет­ся предсказание, и хотелось бы оценить, насколько предсказывающая модель способна работать на практике. Например, для задачи бинар­ной классификации, каждый случай в тестовом наборе будет предска­зан прави ки может быть использован в качестве оценки соответствия, хотя мо­гут использоваться и другие оценки. Если предсказываемое значение распределено непрерывно, для оценки соответствия может использо­ваться среднеквадратичная ошибка, корень из среднеквадратичной ошибки или медианное абсолютное отклонение. Один цикл кросс­валидации включает разбиение набора данных на части, зате ение модели на одной части (называемой обучающей выборкой) и ва­лидацию модели на другой части (называемой тестовой выборкой). Чтобы уменьшить разброс результатов, разные циклы кросс-валидации проводятся на разных разбиениях, а результаты валидации усредняют­ся по всем циклам. Можно выделить следующие типы кросс­валидации.
этот метод случайным образом разбивает набор данных на обучающую и тестовую выборки. Для каждого такого разбиения модель подгоняет­ся под обучающие данные, а точность предсказания оценивается на тестовом наборе. Результаты затем усредняются по всем разбиениям.
льно или неправильно. В этой ситуации коэффициент ошиб-
Валидация случайным сэмплированием (random subsampling),
использоваться для оценки любой ко-
м постро-
40
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]