Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Программные системы статистического анализа. Обнаружение закономерностей в данных с использованием системы R и языка Python. Учебное пособие

.pdf
Скачиваний:
0
Добавлен:
07.09.2026
Размер:
1 Мб
Скачать
☆
Рис. 12. Гистограмма для age
Рис. 13. Гистограмма для income
Рис. 14. Эмпирическая функция распределения для age
работы прослеживается, но для более точного вывода необходимо проверять соответствующие гипотезы. Из рис. 17 и рис. 18 мы не мо­жем проследить явной линейной зависимости между доходом и обра­зованием. При том, что объем значений, соответствующих высокому доходу, в целом увеличивается при повышении уровня образования, на самом высоком уровне 5 тенденция меняется. Возможно, это связано с возрастным
и характеристиками обладателей уровня 5 образования, но
для проверки этого предположения надо использовать дополнитель-
21
ный статистический инструментарий, рассмотрение которого будет происходить в следующих главах (например, таблицы сопряженности для проверки независимости номинальных переменных).
Рис. 15. Корреляционное поле
для income и age
Рис. 16. Корреляционное поле
для income и employ
Рис. 17. «Ящики с усами» для income в зависимости от значений ed
На рис. 19 представлены диаграммы размахов для переменной до­хода (income) в зависимости от пола (gender). В данном случае по графикам можно сделать вывод, что доход в средних своих пока­зателях не зависит от пола, но среди экстремально больших значений дохода мужчины представлены больше, чем женщины.
22
Рис. 18. «Ящики с усами» для income в зависимости от значений
jobsat
Рис. 19. «Ящики с усами» для income
в зависимости от значений gender
Рис. 20. Корреляционное поле
для income и car
Если мы рассматриваем зависимость стоимости автомобиля от до­хода, получаем рис. 20. В данном случае прослеживается сильная неоднородность данных – есть две группы респондентов. К первой относятся те, которые покупают себе настолько дорогую машину, насколько это позволяет их уровень дохода. В этой группе зависимость сильная, линейная, и отдельные наблюдения практически не разли­чимы на сплошной лин
ии. Вторую группу составляют очень состоя­тельные люди, которые покупают себе пусть и не самые, но достаточно дорогие автомобили, и множество этих респондентов представляет собой «облако», по которому можно было бы судить о том, что для входящих в него наблюдений линейной зависимости не
23
наблюдается. Однако в большей степени это скорее эффект наличия «потолка» стоимости машин элитного уровня. И если судить по обеим группам, зависимость (хоть и не линейная) есть, и весьма сильная.
1.4. УПРАЖНЕНИЯ
Для предварительного анализа данных необходимо:
определить типы переменных и при необходимости выполнить
перекодировку значений (изменить шкалу наблюдений переменной);
провести анализ пропущенных значений и принять решение о
способе их обработки (замена или удаление);
получить общую информацию по описательным статистикам,
сделать выводы;
по каждому признаку в наборе данных построить гистограммы,
для количественных признаков построить «ящики с усами» и графики эмпирических распределений, для пар наиболее перспективных для дальнейшего анализа переменных построить корреляционные поля. Cформулировать гипотезы относительно законов распределения коли­чественных признаков, наличия зависимостей между признаками;
при необходимости выполнить отбраковку аномальных наблю-
дений; описать выявленные неоднородности данных, попытаться определить, исходя из особенностей предметной области, причину их появления, степень необходимости их устранения путем, например, перегруппировки данных.
Варианты данных
1. Набор представляет собой данные о параметрах ирисов. Пред­ставленные величины: длина и ширина чашелистика, а также длина и ширина лепестков в сантиметрах. В исследовании были задействованы 50 цветов из трех видов ириса setosa, versicolor и virginica. Данные представлены в файле iris3 стандартного пакета
2. Набор данных представляет собой информацию об урожайности, расположении, размере, энергетической ценности (процент белков, жи­ров) и других характеристик 58 сортов соевых бобов, выращенных на че­тырех различных территориях в течение двух лет в Австралии. Данные расположены в файле australia.soybean стандартного пакета
3. В варианте рассматриваются данные об исследовании урожайности кукурузы в Аргентине с переменным применением азотных удобрений. В файле lasrosas.corn стандартного пакета наблюдения и 8 переменных, в числе которых год, расположение, уро­жайность, масса использованных азотных удобрений и другие факторы.
R datasets представлены 3443
R datasets.
R datasets.
24
4. Таблица с данными представляет собой 1040 наблюдений об ис-
пользовании воды садовыми деревьями. В качестве переменных вы­ступают место расположения деревьев, возраст, вид дерева и прочие факторы. Информация расположена в файле harris.wateruse стандарт­ного пакета
R datasets.
5. В данном наборе данных (файл Employee.xls) представлена ин-
формация о результатах опроса пользователей интернета с различным стажем работы. Респонденты были разделены на две группы: первая – со стажем работы менее года, вторая – один год и более. В таблице присутствуют данные о номере группы, возрасте, стаже, доходе и пр. Также данные приведены в приложении.
6. В файле Hospital.xls предста
в
лена информация о лечебницах го­родского и загородного типа. Исследование включает данные о числе коек, лечебных дней (койко-дни), доходах, расходах и зарплатах пер­сонала больниц. Также данные приведены в приложении.
7. Набор данных включает в себя информацию о домах, продавае-
мых в США. В качестве переменн
ы
х представлены стоимость прода­жи, площадь дома, тип и другие факторы. Данные расположены в фай­ле House.xls, также значения приведены в приложении.
8. В файле Apartaments.xlsx представлены данные о предложениях по продаже квартир в строящихся домах. Переменные включают об­щую площадь квартиры, жилую площадь, площадь кухни, наличие балкона, число месяцев для окончания срока строите
л
ьства, а также
цену квартиры в у.е. Также данные приведены в приложении.
9. В файле Salary.xlsx представлены данные по зарплате сотрудни­ков кафедр российского вуза. Переменными являются пол, возраст, стаж, должность, наличие степени, кафедра и заработная плата сотруд­ников. Также данные приведены в приложении.
10. Набор данных включает в се
бя информацию по предложениям для продажи однокомнатных квартир г. Новосибирска. В работе необ­ходимо рассмотреть следующие факторы: район, этаж, этажность, об­щая площадь, жилая площадь, площадь кухни, цена общая и цена за один кв. м. Вся необходимая информация представлена в файле
ApartSale.xlsx. Также данные приведены в приложении.
11. В файле Recycling.xlsx приведены данные о переработке му
в год. В ка
честве переменных используется информация об объеме
сора
производственных и непроизводственных отходов в месяц, времени на переработку производственных и непроизводственных отходов, а так­же количество перерабатываемого мусора в год. Также данные приве­дены в приложении.
25
2. ПРОВЕРКА СТАТИСТИЧЕСКИХ ГИПОТЕЗ
При проведении предварительного анализа данных за выбор используемых методов отвечает исследователь. Приступая к анализу, надо определиться: что именно мы хотим узнать о данных, какова про­веряемая гипотеза? Возникающие на практике вопросы можно разде­лить на две большие группы – о распределениях исходных данных и о выявлении зависимостей между ними.
2.1. АНАЛИЗ РАСПРЕДЕЛЕНИЙ ПЕРЕМЕННЫХ
Для характеристики поведения значений переменной, построения доверительных интервалов для оценок среднего, дисперсии и других показателей важно установить закон, по которому распределены наблюдения определенной переменной. Данная задача называется идентификацией закона распределения переменной. Для корректной идентификации закона распределения необходимо сначала выдвинуть предположение о виде распределения (такие предположения должны быть сделаны в ходе предварительного анализа), а потом проверить данное предположени но закона распределения) критериев согласия: Колмогорова, Крамера– Мизеса–Смирнова, Андерсона–Дарлинга, хи-квадрат и других.
В ситуации проверки простых гипотез предельные распределения статистик универсальных критериев согласия известны и не зависят от вида наблюдаемого закона распределения и, в частности, от его пара­метров.
При проверке слож теряют свойство «свободы от распределения», предельные распреде­ления статистик изменяются в зависимости от вида закона, с которым проверяется согласие, типа оцениваемого параметра, числа оценивае­мых параметров и т. д. Игнорирование того, что сложные гипотезы
е с использованием универсальных (относитель-
ных гипотез универсальные критерии согласия
26
могут быть различными, приводит к некорректному применению уни­версальных критериев согласия и, как следствие, к неверным статисти­ческим выводам. Различия в предельных распределениях статистик при проверке простых и сложных гипотез настолько существенны, что пренебрегать этим абсолютно недопустимо.
Частным случаем проверки гипотезы о виде распределения являет­ся проверка гипотезы о согласии данных с нормаль ем (гипотеза нормальности). Иными словами, исследователи задаются вопросом: принадлежат ли значения переменной (возможно, внутри какой-либо группы) нормальному закону распределения? Принадлеж­ность наблюдаемых данных нормальному закону является необходи­мой предпосылкой для корректного применения большинства класси­ческих методов математической статистики, используемых в задачах обработки измерений, стандартизации и контроля качества. Поэтому проверка нормаль ческого анализа.
Для проверки нормальности существует ряд специализированных критериев: Андерсона–Дарлинга, Шапиро–Уилка, Манна–Уитни, Вил­коксона и другие. Корректность применения критерия нормальности играет существенную роль в ходе статистического анализа, так как ре­зультат проверки нормальности во многом определяет дальнейшую методику исследов измерений, связанные с приборами, построенными на конкретных фи­зических принципах, или ошибки наблюдений контролируемого пока­зателя подчиняются нормальному закону. В таких случаях применение классического аппарата, опирающегося на предположение о нормаль­ности наблюдаемого закона, оказывается некорректным и может при­водить к неверным выводам.
ности является частой процедурой в ходе статисти-
ания данных. Например, далеко не всегда ошибки
ным распределени
-
2.2. ВЫЯВЛЕНИЕ ЗАВИСИМОСТЕЙ МЕЖДУ ПЕРЕМЕННЫМИ
Формулировка вопроса, касающегося выявления зависимостей в данных, существенно зависит от особенностей данных и цели исследо­вания. Например, если две переменные измерены в номинальной шка­ле, проверить гипотезу о независимости этих переменных можно толь­ко с использованием таблиц сопряженности и связанных с ними кри­териев, например, критерия хи-квадрат проверки гипотезы о независи­мости.
27
Таблица сопряженности является наиболее универсальным сред­ством изучения статистических связей, так как в ней могут быть представлены переменные с любым уровнем измерения. Строки таб­лицы сопряженности соответствуют значениям одной переменной, столбцы – значениям другой переменной (количественные шкалы предварительно должны быть сгруппированы в интервалы). На пере­сечении строки и столбца указывается частота совместного появле­ния соответству строке называется маргинальной частотой строки; сумма частот по столбцу – маргинальной частотой столбца. Сумма маргинальных ча­стот равна объему выборки; их распределение представляет собой одномерное распределение переменной, образующей строки или столбцы таблицы.
Если же одна из переменных количественная, а другая качествен­ная (номинальн переменной от качественной можно подтвердить, проверив гипотезу об однородности средних. Действительно, если в средних значениях количественной переменной, измеренной на разных уровнях (при раз­ных значениях качественной переменной), нет значимых различий, то количественная переменная не зависит от качественной.
ющих значений двух признаков. Сумма частот по
а
я или порядковая), то зависимость количественной
2.2.1. Корреляционный анализ
В ситуации, когда обе переменные количественные, для выявления между ними зависимости используют корреляционный анализ.
Задачи корреляционного анализа
Измерение степени связности (тесноты, силы, строгости, интен-
сивности) двух и более явлений.
Отбор факторов, оказывающих наиболее существенное влияние
на результативный признак, на основании измерения степени связно­сти между явлениями. Существенные в данном аспекте факторы ис­пользуют далее в регрессионном анализе.
Обнаружение неизвестных причинных связей.
Формы проявления взаимосвязей весьма разнообразны. В качестве самых общих их видов выделяют функциональную (полную) и корре­ляционную (неполную) связи. Связь называется функциональной, если каждому значению факторного признака соответствует вполне опреде­ленное неслучайное значение результативного признака. А вот корре­ляционная зависимость (корреляция) между случайными величинами –
28
это связь, не имеющая, вообще говоря, строго функционального харак­тера. Корреляция, как правило, рассматривается тогда, когда одна из величин зависит не только от данной другой, но и от ряда случайных факторов. Вспомогательным средством при анализе выборочных дву­мерных данных является корреляционное поле, описание которого можно найти в первой главе. По расположению точек можно судить о наличии свя
Известно, что если две переменные не коррелированы и имеют сов­местное нормальное распределение, то, значит, они независимы. В противном случае, если переменные не коррелированы и не принад­лежат нормальному закону, нельзя сделать вывод об их независимости, можно говорить только об отсутствии линейной зависимости. И нако­нец, ес утверждать, что переменные зависимы, а если коэффициент корреляции при этом равен (или очень близок к) единице, то и линейно зависимы. При этом стоит учитывать вид корреляционного поля – не противоречит ли сделанный вывод виду поля, поскольку корреляционный анализ, как и любой параметрический,
Стоит заметить, что количественную переменную всегда можно свести к качественной путем группировки наблюдений в заданные ис­следователем интервалы, поэтому при проверке независимости двух количественных переменных можно использовать и корреляционный анализ, и гипотезу об однородности средних (сгруппировав предвари­тельно одну из двух переменных), и анализ с использованием таблиц сопряженно неверно – некорректно вычислять и интерпретировать коэффициент корреляции Пирсона для качественных (т.е. бинарных, номинальных, порядковых) переменных.
зи.
ли гипотеза о равенстве корреляции нулю отвергается, то можно
крайне чувствителен к выбросам.
сти (сгруппировав обе переменные). Тогда как обратное
2.2.2. Проверка гипотез об однородности средних
Основное назначение критериев проверки гипотез об однородности средних – определение степени влияния фактора, измеренного в номи­нальной или порядковой шкале, на величину некоторого количествен­ного показателя. Выбор статистического метода для выявления такого влияния зависит от нескольких составляющих.
Во-первых, являются ли рассматриваемые переменные зависимыми по построению, т. е. представлены ли они парными выборками. В это случае имеются пары наблюдений одного и того же объекта, т. е. два
29
м
раза измеряется один показатель. Парные выборки чаще всего появля­ются тогда, когда они представляют собой повторные наблюдения, т. е. измерения, полученные для одних и тех же объектов, но с определен­ным интервалом, либо полученные до и после определенного воздей­ствия. При этом данные обычно организованы в виде двух столбцов. В одном столбце содерж
атся «первые» измерения для каждого объек­та, во втором столбце – «вторые» измерения. В общем случае момен­тов измерений может быть и больше двух, их количество определяет число уровней качественной переменной. Если же выборки по харак­теру проводимого эксперимента нельзя отнести к парным, их можно считать независимыми и использовать критерии для независимых вы­борок.
вторых, выполняется ли предположение о нормальности. Тра-
Во­диционно выполнение данного предположения выступало границей между параметрическими (зачастую разработанными в условиях нор­мальности) и непараметрическими критериями, обычно обладающими свойством «свободы от распределения». Однако в последнее время проведено множество исследований, посвященных вопросам приме­нимости различных параметрических критериев в условиях нару нормаль
ности. Эти исследования показали, что в целом, если с по-
шения
мощью рассматриваемого критерия проверяется гипотеза, касающаяся средних показателей (однородности средних, равенства коэффициента корреляции нулю), то распределение статистики практически не меня­ется, за исключением случаев крайне асимметричных или островер­шинных распределений исходных данных.
В-третьих, выбор метода проверки однородности средних опреде-
ниваемых выборок (уровней качественного фак-
ляет количество сра
в тора) – две или больше двух. При этом если сравнивается больше двух выборок, то большинство применяемых критериев способно лишь от­ветить на вопрос: есть ли между средними показателя на уровнях хоть какие-то различия. А для того, чтобы выяснить, между какими именно уровнями наблюдаются знач
имые различия, нужно использовать спе­циализированную группу критериев – методы множественного срав- нения. Следует отметить, что критерий Тьюки (один из наиболее вос­требованных методов множественных сравнений) весьма чувствителен к нарушению предположений нормальности, и чем больше число сравниваемых одновременно выборок, тем в большей степени резуль­тат проверки зависим от нормальности распределений исследуемых переменных.
30
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]