Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Программные системы статистического анализа. Обнаружение закономерностей в данных с использованием системы R и языка Python. Учебное пособие
.pdf
Таким образом, можно сформулировать следующие правила выбо-
ра критерия проверки гипотезы об однородности средних:
если две выборки независимые, то используется параметриче-
ский (требующий выполнения предположения нормальности) критерий Стьюдента или непараметрический его аналог – критерий Манна–
Уитни;
если две выборки парные (зависимые), то используется либо
критерий Стьюдента для парных выборок (параметрический случай),
либо критерий Вилкоксона (непараметрический случай);
если выборок больше двух, при их независимости используются
критерии Краскелла–Уоллиса (непараметрический подход), и при использовании параметрического подхода – однофакторный дисперсионный анализ;
для трех и более зависимых выборок используется критерий
Фридмана.
Приведенные правила позволят получить корректный результат
проверки предположений о зависимости одного или нескольких исследуемых показателей от других данных.
2.3. ПРИМЕР ПРОВЕРКИ СТАТИСТИЧЕСКИХ
ГИПОТЕЗ
Рассмотрим в качестве примера набор данных, описанный в первой
главе. Данные хранятся в переменной data. Зададимся уровнем значимости = 0.05. В первой главе было сделано предположение о том, что
в наборе данных Income.csv есть зависимость между переменными,
характеризующими доход и возраст.
Прежде всего проверим наличие корреляции между переменными,
для этого воспользуемся линейным к
оэффициентом корреляции Пирсона:
>cor.test(data$age,data$income)
Pearson's product-moment correlation
data: data$age and data$income
t = 28.458, df = 6398, p-value < 2.2e-16
alternative hypothesis: true correlation is not equal to 0
95 percent confidence interval:
0.3132728 0.3567708
sample estimates:
cor
0.3352004
31

Значение p-value – достигнутый уровень значимости, меньше заданного уровня значимости , что говорит о том, что гипотеза о равенстве коэффициента корреляции нулю отвергается, и между доходом и
возрастом есть зависимость, хотя само значение корреляции на уровне
0.3352 далеко от значения единицы, которое характеризует строгую
линейную связь. Чтобы более подробно исследовать вопрос нез
ависимости, проверить утверждение о независимости дохода и возраста,
можно использовать критерий хи-квадрат Пирсона. Для этого по данным возраста и пола составим таблицу сопряженности:
>tmp = with(data, table(cut(data$income,
quantile(data$income)), cut(data$age,
quantile(data$age))))
>tmp
(18,33] (33,41] (41,51] (51,77]
(9,28] 872 277 157 321
(28,45] 557 467 356 229
(45,79] 261 494 502 274
(79,1.12e+03] 58 278 612 647
Первая строка и столбец представляют собой интервалы значений
по переменным: возраст (первая строка) и доход (первый столбец).
Сами значения элементов таблицы представляют собой частоты попаданий значений в соответствующие интервалы. Далее проверим гипотезу о независимости возраста и дохода:
>chisq.test(tmp)
Pearson's Chi-squared test
data: tmp
X-squared = 1540.5, df = 9, p-value < 2.2e-16
Полученный достигнутый уровень значимости существенно меньше , следовательно, гипотеза о независимости отвергается. Наглядно
выглядит и таблица сопряженности – из нее мы видим, что в целом
больше всего людей с наименьшим доходом среди людей молодого
возраста и, наоборот, самый большой доход чаще всего у более взрослых людей. Кроме того, можно заметить, что данную за
висимость
нельзя назвать строго линейной, например, группа людей в возрасте от
33 лет до 41 года выбивается из общей картины, что согласуется с выводом, сделанным с помощью коэффициента корреляции.
32

Далее проверим однородность доходов по гендерному признаку.
Чтобы определиться с тем, какой критерий использовать, для начала
разделим данные по переменной пол на две выборки и проверим их на
нормальность:
>dataM<- data[which(data$gender=="m"),]$income
>dataF<- data[which(data$gender=="f"),]$income
>ad.test(dataM)
Anderson-Darling normality test
data: dataM
A = 329.94, p-value < 2.2e-16
>ad.test(dataF)
Anderson-Darling normality test
data: dataF
A = 318.01, p-value< 2.2e-16
Гипотеза о нормальности выборок дохода для мужчин и женщин
отвергается, поэтому следует воспользоваться непараметрическим
критерием Манна–Уитни:
>wilcox.test(dataM,dataF)
Wilcoxon rank sum test with continuity correction
data: dataM and dataF
W = 5122300, p-value = 0.9724
alternative hypothesis: true location shift is not equal to 0
Приведенный вызов функции wilcox.test без дополнительных параметров соответствует критерию Манна–Уитни для количественных
переменных. Согласно полученному значению p-value гипотеза об однородности не отвергается, что свидетельствует о том, что средние
доходы у мужчин и женщин статистически не отличаются.
Проверим зависимость дохода от уровня образования. Вследствие
того, что уровней образования четыре, необходимо подготовить данные:
>data1 <- data[which(data$ed==1),]$income
>data2 <- data[which(data$ed==2),]$income
>data3 <- data[which(data$ed==3),]$income
> data4 <- data[which(data$ed==4),]$income
33

Для выбора критерия однородности проверим гипотезу о нормальности:
>ad.test(data1)
Anderson-Darling normality test
data: data1
A = 127.02, p-value < 2.2e-16
>ad.test(data2)
Anderson-Darling normality test
data: data2
A = 187.11, p-value < 2.2e-16
>ad.test(data3)
Anderson-Darling normality test
data: data3
A = 146.7, p-value < 2.2e-16
>ad.test(data4)
Anderson-Darling normality test
data: data4
A = 143.31, p-value < 2.2e-16
Видно, что все наборы данных не принадлежат нормальному закону распределения, и стоит использовать критерий Краскелла–Уоллиса:
>kruskal.test(list(data1, data2, data3, data4))
Kruskal-Wallis rank sum test
data: list(data1, data2, data3, data4)
Kruskal-Wallis chi-squared = 60.295, df = 3, p-value = 5.083e-13
Гипотеза об однородности отвергается, так как p-value <, что
свидетельствует о статистически значимых отличиях в размере дохода
при различном уровне образования. Посмотрим на значения средних в
соответствующих наборах данных:
> y = c(data1, data2, data3, data4)
>group = rep(1:4, c(length(data1), length(data2),
length(data3), length(data4)))
>aggregate(y, by=list(group), FUN=mean)
34

Group.1 x
1 1 59.86619
2 2 66.20713
3 3 70.13456
4 4 78.65018
Действительно, можно увидеть, что чем выше уровень образования, тем выше уровень дохода.
2.4. УПРАЖНЕНИЯ
1. Проверить сформированные в ходе предварительного анализа
гипотезы.
2. Обосновать выбор используемых для проверки гипотез крите-
риев.
3. Проверить дополнительные гипотезы (перечень приведен ниже).
Варианты дополнительных гипотез
1. На основе данных из первой главы (пакет R, набор iris3) проверить, зависят ли между собой длина и ширина чашелистиков и лепестков для каждого вида ириса. Являются ли подобными длина и
чашелистиков и лепестков у каждого вида ириса?
2. На основе данных из первой главы (пакет R, набор ustralia.
soybean) проверить, зависит ли урожайность от размера, белка, масла.
Проверить, является ли сопоставимой урожайность для разных лет, для
разных локаций.
3. На основе данных из первой главы (пакет R, набор lasrosas.corn)
проверить, зависит ли урож
айность от года, нитрогена, топографического фактора, значения яркости, типа азотного удобрения. Проверить
является ли сопоставимой урожайность для разных лет, для разных
локаций.
4. На основе данных из первой главы (пакет R, набор
harris.wateruse) проверить, зависит ли количество дней дерева от его
возраста, вида и других факторов. Проверить является ли сопоставимым количество дней для разных видо
в деревьев.
5. На основе данных из первой главы (файл Employee.xls) проверить, зависит ли уровень дохода от возраста, стажа, дохода, профессии
и пола. Проверить является ли сопоставимым уровень дохода для
мужчин и женщин.
6. На основе данных из первой главы (файл Hospital.xls) проверить,
зависят ли уровни дохода, зарпла
ты и расходов от количества коек,
лечебных дней и расположения лечебниц. Проверить, является ли
ширина
35

сопоставимым уровень ключевых характеристик для различно расположенных лечебниц.
7. На основе данных из первой главы (файл House.xls) проверить,
зависит ли цена дома от его площади, возраста, типа (угловой или неугловой), ежегодного налога. Проверить, являются ли сопоставимыми
цены для угловых и неугловых домов.
8. На основе данных из первой главы (файл Apartaments.xlsx) про-
в
верить, за
исит ли цена квартиры от ее общей площади, жилой площади, площади кухни, наличия балкона и числа месяцев до окончания
срока строительства. Проверить, являются ли сопоставимыми цены
для квартир с балконом и без.
9. На основе данных из первой главы (файл Salary.xlsx) проверить,
зависит ли уровень зарплаты от научной степ
ени, должности при приёме, наличия степени при приеме, пола, возраста и стажа. Проверить,
является ли сопоставимым уровень зарплаты для мужчин и женщин,
для различных научных степеней.
10. На основе данных из первой главы (файл ApartSale.xlsx) проверить, зависит ли цена квартиры от ее общей площади, жилой площади,
площади кухни, этажа
, этажности дома и района. Проверить, являются
ли сопоставимыми цены для квартир из разных районов.
11. На основе данных из первой главы (файл Recycling.xlsx) проверить, зависит ли количество перерабатываемого мусора от количества
производственных и непроизводственных отходов, от времени их переработки. Проверить, является ли сопоставимым количество перерабатываемого мусора для высоких и низких значений наибол
ее значи-
мого фактора.
36

x
y
j
f
3. ПОСТРОЕНИЕ МОДЕЛЕЙ РЕГРЕССИИ
Регрессионный анализ – статистический метод исследования влия-
,1,
iq
ния одной или нескольких независимых переменных
висимую переменную
. Регрессионный анализ служит для определе-
y
i
ния вида этого влияния и предоставляет возможность прогнозирования
значений зависимой переменной по значениям независимых. Различают простую и множественную регрессию: различие состоит в том, что
в первом случае рассматривают одну независимую переменную, а во
втором – несколько.
Запишем линейную (по параметрам) регрессионную модель в об-
щем виде:
, на за-
bbfxxbfxx bfxx
0111 221 1
где
– число независимых переменных; m– число регрессоров,
q
включенных в модель. Регрессоры
( ,..., ) ( ,..., ) ... ( ,..., )
qqmmq
( ,..., )
xx
1
могут представлять
q
,
собой как степенные функции от отдельных переменных (и в целом
нелинейные функции от них), так и взаимодействия нескольких
переменных.
В регрессионной модели зависимости могут выражаться линейными или нелинейными функциями. Многие связи определяются по своей природе, либо являются собственно линейными, либо их можно
привести к линейному виду, используя стандартные преобразовани
я
(возведение в степень, логарифмирование и пр.). Причем эти процедуры часто применяют не только к исходным независимым переменным,
но и к предсказываемой зависимой переменной: так, логарифмирова-
ние отклика – это часто используемый в эконометрике прием, позволяющий одновременно и линеаризировать связи с независимыми переменными, и приблизить распределение наблюдений к нормальному
закону.
37

3.1. ОТБОР РЕГРЕССОРОВ
x
x
Существует два принципиально различных подхода к процедуре
формирования модели по множеству рассматриваемых регрессоров.
Первый, традиционный, заключается в том, что все регрессоры одновременно включаются в модель, и определяется их значимость, в зависимости от которой делаются выводы о качестве построенной модели.
В этом случае на первоначальных этапах анализа необходимо определить, есть ли среди
рассматриваемых переменных
взаимозависимые.
i
При обнаружении коррелированных предикторных переменных
(ситуация мультиколлинеарности) необходимо решить вопрос о про-
цедуре их включения в модель. Возможные варианты решения проблемы – это либо выделение групп независимых переменных среди
множества исходных, либо сокращение пространства исходных переменных с использованием методов факторного анализа.
3.1.1. Факторный анализ
Главными целями факторного анализа являются сокращение числа
переменных и определение структуры взаимосвязей между переменными, т. е. классификация переменных. Поэтому факторный анализ
используется или как метод сокращения данных, или как метод классификации. При этом второе направление – определение структуры
взаимосвязей между переменными, приводящее к возможности их
классификации, часто, особенно в сфере анализа социологических
данных, имеет самостоят
ванием результатов для проведения регрессионного анализа) значение,
когда осуществляется поиск латентных (скрытых) переменных, которые могут быть измерены только через группу взаимосвязанных явных
переменных.
Для выявления же наиболее значимых факторов, используемых потом в качестве регрессоров для регрессионного анализа, наиболее
оправданно применять м
стемы зависимых между собой переменных (представляющих собой
некоторое пространство векторов) он предлагает нахождение такого
ортогонального подпространства меньшей размерности, чтобы в проекции на него исходной системы точек (многомерных наблюдений)
искажения их конфигураций были минимальными. Поэтому, с тех пор
как Хотеллинг дал статистическое обоснование для такого подхода,
ельное (без связи с последующим использо-
етод главны
х компонент, поскольку для си-
i
38

именно метод главных компонент, среди всех методов, относимых к
факторному анализу, традиционно используется как метод для обработки данных, предшествующий регрессионному анализу, если обнаруживается, что исходных предикторных переменных слишком много
по сравнению с количеством наблюдений и, что важнее, эти переменные сильно коррелированы между собой. При анализе в один фактор
(называем
сильно коррелированные между собой переменные, и при повторении
процедуры выделения очередного фактора, как следствие, происходит
перераспределение исходной дисперсии между компонентами и получается максимально простая и наглядная структура ортогональных
между собой факторов.
ый в данном методе также компонентом) объединяются
3.1.2. Метод включения или исключения переменных
Другим вариантом отбора переменных при построении модели является метод пошагового включения переменных в регрессионную модель (Forward stepwise) или пошагового исключения переменных из
модели (Backward stepwise).
Метод пошагового включения переменных состоит в выборе из
всего возможного набора факторных переменных именно тех, которые
оказывают существенное влияние на результативную переменную.
Сначала уравнение регрессии не содержит предикатов, они вводят
по одному, если удовлетворяют определенному критерию. В основе
порядка введения включаемых переменных лежит вклад переменной в
объясняемую вариацию. В методе пошагового исключения все предикаты включаются в уравнение регрессии, а затем по очереди выводятся
из уравнения, исходя из их соответствия критерию. Кроме того, на
практике может применяться метод пошагового отбора, который является комбинацией методов включения и исключения. Факторы последовательно (поочередно) включаются в уравнение регрессии, и
проверяется их значимость.
При проверке значимости введенного фактора определяется,
насколько уменьшается сумма квадратов остатков и увеличивается величина множественного коэффициента корреляции
используется и обратный метод, т. е. исключение факторов, ставших
незначимыми. Фактор является незначимым, если его включение в
уравнение регрессии только изменяет значение коэффициентов регрессии, не уменьшая значительно суммы квадратов остатков. Если при
. Одновременно
ся
39

включении в модель соответствующего факторного признака величина
множественного коэффициента корреляции значимо увеличивается, а
коэффициент регрессии не изменяется (или меняется несущественно),
то данный признак статистически значим, и его включение в уравнение регрессии необходимо.
3.2. ПРОВЕРКА КАЧЕСТВА И АДЕКВАТНОСТИ
МОДЕЛИ
Определив вид регрессионной модели и получив оценки параметров при соответствующих регрессорах, необходимо проверить качество и адекватность построенной модели. Для контроля качества модели рассмотрим метод скользящего контроля или кросс-валидации.
Цель кросс-валидации в том, чтобы оценить ожидаемый уровень соответствия модели данным, независимым от тех данных, на которых модель тренировалась. Она может
личественной меры соответствия, подходящей для данных и модели.
Обычно кросс-валидация используется в ситуациях, где целью является предсказание, и хотелось бы оценить, насколько предсказывающая
модель способна работать на практике. Например, для задачи бинарной классификации, каждый случай в тестовом наборе будет предсказан прави
ки может быть использован в качестве оценки соответствия, хотя могут использоваться и другие оценки. Если предсказываемое значение
распределено непрерывно, для оценки соответствия может использоваться среднеквадратичная ошибка, корень из среднеквадратичной
ошибки или медианное абсолютное отклонение. Один цикл кроссвалидации включает разбиение набора данных на части, зате
ение модели на одной части (называемой обучающей выборкой) и валидацию модели на другой части (называемой тестовой выборкой).
Чтобы уменьшить разброс результатов, разные циклы кросс-валидации
проводятся на разных разбиениях, а результаты валидации усредняются по всем циклам. Можно выделить следующие типы кроссвалидации.
этот метод случайным образом разбивает набор данных на обучающую
и тестовую выборки. Для каждого такого разбиения модель подгоняется под обучающие данные, а точность предсказания оценивается на
тестовом наборе. Результаты затем усредняются по всем разбиениям.
льно или неправильно. В этой ситуации коэффициент ошиб-
Валидация случайным сэмплированием (random subsampling),
использоваться для оценки любой ко-
м постро-
40
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
