Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Программные системы статистического анализа. Обнаружение закономерностей в данных с использованием системы R и языка Python. Учебное пособие
.pdf
Рис. 12. Гистограмма для age
Рис. 13. Гистограмма для income
Рис. 14. Эмпирическая функция распределения для age
работы прослеживается, но для более точного вывода необходимо
проверять соответствующие гипотезы. Из рис. 17 и рис. 18 мы не можем проследить явной линейной зависимости между доходом и образованием. При том, что объем значений, соответствующих высокому
доходу, в целом увеличивается при повышении уровня образования, на
самом высоком уровне 5 тенденция меняется. Возможно, это связано с
возрастным
и характеристиками обладателей уровня 5 образования, но
для проверки этого предположения надо использовать дополнитель-
21

ный статистический инструментарий, рассмотрение которого будет
происходить в следующих главах (например, таблицы сопряженности
для проверки независимости номинальных переменных).
Рис. 15. Корреляционное поле
для income и age
Рис. 16. Корреляционное поле
для income и employ
Рис. 17. «Ящики с усами» для income в зависимости от значений ed
На рис. 19 представлены диаграммы размахов для переменной дохода (income) в зависимости от пола (gender). В данном случае по
графикам можно сделать вывод, что доход в средних своих показателях не зависит от пола, но среди экстремально больших значений
дохода мужчины представлены больше, чем женщины.
22

Рис. 18. «Ящики с усами» для income в зависимости от значений
jobsat
Рис. 19. «Ящики с усами» для income
в зависимости от значений gender
Рис. 20. Корреляционное поле
для income и car
Если мы рассматриваем зависимость стоимости автомобиля от дохода, получаем рис. 20. В данном случае прослеживается сильная
неоднородность данных – есть две группы респондентов. К первой
относятся те, которые покупают себе настолько дорогую машину,
насколько это позволяет их уровень дохода. В этой группе зависимость
сильная, линейная, и отдельные наблюдения практически не различимы на сплошной лин
ии. Вторую группу составляют очень состоятельные люди, которые покупают себе пусть и не самые, но
достаточно дорогие автомобили, и множество этих респондентов
представляет собой «облако», по которому можно было бы судить о
том, что для входящих в него наблюдений линейной зависимости не
23

наблюдается. Однако в большей степени это скорее эффект наличия
«потолка» стоимости машин элитного уровня. И если судить по обеим
группам, зависимость (хоть и не линейная) есть, и весьма сильная.
1.4. УПРАЖНЕНИЯ
Для предварительного анализа данных необходимо:
определить типы переменных и при необходимости выполнить
перекодировку значений (изменить шкалу наблюдений переменной);
провести анализ пропущенных значений и принять решение о
способе их обработки (замена или удаление);
получить общую информацию по описательным статистикам,
сделать выводы;
по каждому признаку в наборе данных построить гистограммы,
для количественных признаков построить «ящики с усами» и графики
эмпирических распределений, для пар наиболее перспективных для
дальнейшего анализа переменных построить корреляционные поля.
Cформулировать гипотезы относительно законов распределения количественных признаков, наличия зависимостей между признаками;
при необходимости выполнить отбраковку аномальных наблю-
дений; описать выявленные неоднородности данных, попытаться
определить, исходя из особенностей предметной области, причину их
появления, степень необходимости их устранения путем, например,
перегруппировки данных.
Варианты данных
1. Набор представляет собой данные о параметрах ирисов. Представленные величины: длина и ширина чашелистика, а также длина и
ширина лепестков в сантиметрах. В исследовании были задействованы
50 цветов из трех видов ириса setosa, versicolor и virginica. Данные
представлены в файле iris3 стандартного пакета
2. Набор данных представляет собой информацию об урожайности,
расположении, размере, энергетической ценности (процент белков, жиров) и других характеристик 58 сортов соевых бобов, выращенных на четырех различных территориях в течение двух лет в Австралии. Данные
расположены в файле australia.soybean стандартного пакета
3. В варианте рассматриваются данные об исследовании урожайности
кукурузы в Аргентине с переменным применением азотных удобрений. В
файле lasrosas.corn стандартного пакета
наблюдения и 8 переменных, в числе которых год, расположение, урожайность, масса использованных азотных удобрений и другие факторы.
R datasets представлены 3443
R datasets.
R datasets.
24

4. Таблица с данными представляет собой 1040 наблюдений об ис-
пользовании воды садовыми деревьями. В качестве переменных выступают место расположения деревьев, возраст, вид дерева и прочие
факторы. Информация расположена в файле harris.wateruse стандартного пакета
R datasets.
5. В данном наборе данных (файл Employee.xls) представлена ин-
формация о результатах опроса пользователей интернета с различным
стажем работы. Респонденты были разделены на две группы: первая –
со стажем работы менее года, вторая – один год и более. В таблице
присутствуют данные о номере группы, возрасте, стаже, доходе и пр.
Также данные приведены в приложении.
6. В файле Hospital.xls предста
в
лена информация о лечебницах городского и загородного типа. Исследование включает данные о числе
коек, лечебных дней (койко-дни), доходах, расходах и зарплатах персонала больниц. Также данные приведены в приложении.
7. Набор данных включает в себя информацию о домах, продавае-
мых в США. В качестве переменн
ы
х представлены стоимость продажи, площадь дома, тип и другие факторы. Данные расположены в файле House.xls, также значения приведены в приложении.
8. В файле Apartaments.xlsx представлены данные о предложениях
по продаже квартир в строящихся домах. Переменные включают общую площадь квартиры, жилую площадь, площадь кухни, наличие
балкона, число месяцев для окончания срока строите
л
ьства, а также
цену квартиры в у.е. Также данные приведены в приложении.
9. В файле Salary.xlsx представлены данные по зарплате сотрудников кафедр российского вуза. Переменными являются пол, возраст,
стаж, должность, наличие степени, кафедра и заработная плата сотрудников. Также данные приведены в приложении.
10. Набор данных включает в се
бя информацию по предложениям
для продажи однокомнатных квартир г. Новосибирска. В работе необходимо рассмотреть следующие факторы: район, этаж, этажность, общая площадь, жилая площадь, площадь кухни, цена общая и цена за
один кв. м. Вся необходимая информация представлена в файле
ApartSale.xlsx. Также данные приведены в приложении.
11. В файле Recycling.xlsx приведены данные о переработке му
в год. В ка
честве переменных используется информация об объеме
сора
производственных и непроизводственных отходов в месяц, времени на
переработку производственных и непроизводственных отходов, а также количество перерабатываемого мусора в год. Также данные приведены в приложении.
25

2. ПРОВЕРКА СТАТИСТИЧЕСКИХ ГИПОТЕЗ
При проведении предварительного анализа данных за выбор
используемых методов отвечает исследователь. Приступая к анализу,
надо определиться: что именно мы хотим узнать о данных, какова проверяемая гипотеза? Возникающие на практике вопросы можно разделить на две большие группы – о распределениях исходных данных и о
выявлении зависимостей между ними.
2.1. АНАЛИЗ РАСПРЕДЕЛЕНИЙ ПЕРЕМЕННЫХ
Для характеристики поведения значений переменной, построения
доверительных интервалов для оценок среднего, дисперсии и других
показателей важно установить закон, по которому распределены
наблюдения определенной переменной. Данная задача называется
идентификацией закона распределения переменной. Для корректной
идентификации закона распределения необходимо сначала выдвинуть
предположение о виде распределения (такие предположения должны
быть сделаны в ходе предварительного анализа), а потом проверить
данное предположени
но закона распределения) критериев согласия: Колмогорова, Крамера–
Мизеса–Смирнова, Андерсона–Дарлинга, хи-квадрат и других.
В ситуации проверки простых гипотез предельные распределения
статистик универсальных критериев согласия известны и не зависят от
вида наблюдаемого закона распределения и, в частности, от его параметров.
При проверке слож
теряют свойство «свободы от распределения», предельные распределения статистик изменяются в зависимости от вида закона, с которым
проверяется согласие, типа оцениваемого параметра, числа оцениваемых параметров и т. д. Игнорирование того, что сложные гипотезы
е с использованием универсальных (относитель-
ных гипотез универсальные критерии согласия
26

могут быть различными, приводит к некорректному применению универсальных критериев согласия и, как следствие, к неверным статистическим выводам. Различия в предельных распределениях статистик
при проверке простых и сложных гипотез настолько существенны, что
пренебрегать этим абсолютно недопустимо.
Частным случаем проверки гипотезы о виде распределения является проверка гипотезы о согласии данных с нормаль
ем (гипотеза нормальности). Иными словами, исследователи задаются
вопросом: принадлежат ли значения переменной (возможно, внутри
какой-либо группы) нормальному закону распределения? Принадлежность наблюдаемых данных нормальному закону является необходимой предпосылкой для корректного применения большинства классических методов математической статистики, используемых в задачах
обработки измерений, стандартизации и контроля качества. Поэтому
проверка нормаль
ческого анализа.
Для проверки нормальности существует ряд специализированных
критериев: Андерсона–Дарлинга, Шапиро–Уилка, Манна–Уитни, Вилкоксона и другие. Корректность применения критерия нормальности
играет существенную роль в ходе статистического анализа, так как результат проверки нормальности во многом определяет дальнейшую
методику исследов
измерений, связанные с приборами, построенными на конкретных физических принципах, или ошибки наблюдений контролируемого показателя подчиняются нормальному закону. В таких случаях применение
классического аппарата, опирающегося на предположение о нормальности наблюдаемого закона, оказывается некорректным и может приводить к неверным выводам.
ности является частой процедурой в ходе статисти-
ания данных. Например, далеко не всегда ошибки
ным распределени
-
2.2. ВЫЯВЛЕНИЕ ЗАВИСИМОСТЕЙ
МЕЖДУ ПЕРЕМЕННЫМИ
Формулировка вопроса, касающегося выявления зависимостей в
данных, существенно зависит от особенностей данных и цели исследования. Например, если две переменные измерены в номинальной шкале, проверить гипотезу о независимости этих переменных можно только с использованием таблиц сопряженности и связанных с ними критериев, например, критерия хи-квадрат проверки гипотезы о независимости.
27

Таблица сопряженности является наиболее универсальным средством изучения статистических связей, так как в ней могут быть
представлены переменные с любым уровнем измерения. Строки таблицы сопряженности соответствуют значениям одной переменной,
столбцы – значениям другой переменной (количественные шкалы
предварительно должны быть сгруппированы в интервалы). На пересечении строки и столбца указывается частота совместного появления соответству
строке называется маргинальной частотой строки; сумма частот по
столбцу – маргинальной частотой столбца. Сумма маргинальных частот равна объему выборки; их распределение представляет собой
одномерное распределение переменной, образующей строки или
столбцы таблицы.
Если же одна из переменных количественная, а другая качественная (номинальн
переменной от качественной можно подтвердить, проверив гипотезу
об однородности средних. Действительно, если в средних значениях
количественной переменной, измеренной на разных уровнях (при разных значениях качественной переменной), нет значимых различий, то
количественная переменная не зависит от качественной.
ющих значений двух признаков. Сумма частот по
а
я или порядковая), то зависимость количественной
2.2.1. Корреляционный анализ
В ситуации, когда обе переменные количественные, для выявления
между ними зависимости используют корреляционный анализ.
Задачи корреляционного анализа
Измерение степени связности (тесноты, силы, строгости, интен-
сивности) двух и более явлений.
Отбор факторов, оказывающих наиболее существенное влияние
на результативный признак, на основании измерения степени связности между явлениями. Существенные в данном аспекте факторы используют далее в регрессионном анализе.
Обнаружение неизвестных причинных связей.
Формы проявления взаимосвязей весьма разнообразны. В качестве
самых общих их видов выделяют функциональную (полную) и корреляционную (неполную) связи. Связь называется функциональной, если
каждому значению факторного признака соответствует вполне определенное неслучайное значение результативного признака. А вот корреляционная зависимость (корреляция) между случайными величинами –
28

это связь, не имеющая, вообще говоря, строго функционального характера. Корреляция, как правило, рассматривается тогда, когда одна из
величин зависит не только от данной другой, но и от ряда случайных
факторов. Вспомогательным средством при анализе выборочных двумерных данных является корреляционное поле, описание которого
можно найти в первой главе. По расположению точек можно судить о
наличии свя
Известно, что если две переменные не коррелированы и имеют совместное нормальное распределение, то, значит, они независимы.
В противном случае, если переменные не коррелированы и не принадлежат нормальному закону, нельзя сделать вывод об их независимости,
можно говорить только об отсутствии линейной зависимости. И наконец, ес
утверждать, что переменные зависимы, а если коэффициент корреляции
при этом равен (или очень близок к) единице, то и линейно зависимы.
При этом стоит учитывать вид корреляционного поля – не противоречит
ли сделанный вывод виду поля, поскольку корреляционный анализ, как
и любой параметрический,
Стоит заметить, что количественную переменную всегда можно
свести к качественной путем группировки наблюдений в заданные исследователем интервалы, поэтому при проверке независимости двух
количественных переменных можно использовать и корреляционный
анализ, и гипотезу об однородности средних (сгруппировав предварительно одну из двух переменных), и анализ с использованием таблиц
сопряженно
неверно – некорректно вычислять и интерпретировать коэффициент
корреляции Пирсона для качественных (т.е. бинарных, номинальных,
порядковых) переменных.
зи.
ли гипотеза о равенстве корреляции нулю отвергается, то можно
крайне чувствителен к выбросам.
сти (сгруппировав обе переменные). Тогда как обратное
2.2.2. Проверка гипотез об однородности средних
Основное назначение критериев проверки гипотез об однородности
средних – определение степени влияния фактора, измеренного в номинальной или порядковой шкале, на величину некоторого количественного показателя. Выбор статистического метода для выявления такого
влияния зависит от нескольких составляющих.
Во-первых, являются ли рассматриваемые переменные зависимыми
по построению, т. е. представлены ли они парными выборками. В это
случае имеются пары наблюдений одного и того же объекта, т. е. два
29
м

раза измеряется один показатель. Парные выборки чаще всего появляются тогда, когда они представляют собой повторные наблюдения, т. е.
измерения, полученные для одних и тех же объектов, но с определенным интервалом, либо полученные до и после определенного воздействия. При этом данные обычно организованы в виде двух столбцов.
В одном столбце содерж
атся «первые» измерения для каждого объекта, во втором столбце – «вторые» измерения. В общем случае моментов измерений может быть и больше двух, их количество определяет
число уровней качественной переменной. Если же выборки по характеру проводимого эксперимента нельзя отнести к парным, их можно
считать независимыми и использовать критерии для независимых выборок.
вторых, выполняется ли предположение о нормальности. Тра-
Водиционно выполнение данного предположения выступало границей
между параметрическими (зачастую разработанными в условиях нормальности) и непараметрическими критериями, обычно обладающими
свойством «свободы от распределения». Однако в последнее время
проведено множество исследований, посвященных вопросам применимости различных параметрических критериев в условиях нару
нормаль
ности. Эти исследования показали, что в целом, если с по-
шения
мощью рассматриваемого критерия проверяется гипотеза, касающаяся
средних показателей (однородности средних, равенства коэффициента
корреляции нулю), то распределение статистики практически не меняется, за исключением случаев крайне асимметричных или островершинных распределений исходных данных.
В-третьих, выбор метода проверки однородности средних опреде-
ниваемых выборок (уровней качественного фак-
ляет количество сра
в
тора) – две или больше двух. При этом если сравнивается больше двух
выборок, то большинство применяемых критериев способно лишь ответить на вопрос: есть ли между средними показателя на уровнях хоть
какие-то различия. А для того, чтобы выяснить, между какими именно
уровнями наблюдаются знач
имые различия, нужно использовать специализированную группу критериев – методы множественного срав-
нения. Следует отметить, что критерий Тьюки (один из наиболее востребованных методов множественных сравнений) весьма чувствителен
к нарушению предположений нормальности, и чем больше число
сравниваемых одновременно выборок, тем в большей степени результат проверки зависим от нормальности распределений исследуемых
переменных.
30
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
