Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Программные системы статистического анализа. Обнаружение закономерностей в данных с использованием системы R и языка Python. Учебное пособие
.pdf
Министерство образования и науки Российской Федерации
НОВОСИБИРСКИЙ ГОСУДАРСТВЕННЫЙ ТЕХНИЧЕСКИЙ УНИВЕРСИТЕТ
__________________________________________________________________________
ПРОГРАММНЫЕ СИСТЕМЫ
СТАТИСТИЧЕСКОГО АНАЛИЗА
ОБНАРУЖЕНИЕ ЗАКОНОМЕРНОСТЕЙ
В ДАННЫХ С ИСПОЛЬЗОВАНИЕМ
СИСТЕМЫ R И ЯЗЫКА PYTHON
Утверждено Редакционно-издательским советом университета
в качестве учебного пособия
НОВОСИБИРСК
2017

УДК 004.438
П 784
Рецензенты:
канд. техн. наук, доцент Т.А. Гультяева
канд. экон. наук, доцент А.Ю. Тимофеева
Работа подготовлена на кафедре теоретической и прикладной
информатики для студентов ФПМИ дневного отделения направления
01.04.02 «Прикладная математика и информатика»
П 784 Программные системы статистического анализа. Обнару-
жение закономерностей в данных с использованием системы R и языка Python: учебное пособие / В.М. Волкова,
М.А. Семёнова, Е.С. Четвертакова, С.С. Вожов. – Новосибирск:
Изд-во НГТУ, 2017. – 74 с.
ISBN 978-5-7782-3183-2
Рассмотрены методы анализа данных в той последовательности, как
они должны применяться при использовании анализа данных на практике: методы, использующиеся при предварительном анализе данных,
при проверке статистических гипотез о нормальности, об однородности
средних, о независимости, об однородности дисперсий, о незначимости
коэффициента корреляции, методы построения моделей регрессии,
проверки на адекватность полученной модели, оценки качества модели
и ее способности давать точный прогноз. Приводится информация о
функциях, представленных в системе R и библиотеках и пакетах, реализованных средствами языка программирования Python.
Учебное пособие может быть полезно также всем, интересующимся методами статистического анализа данных и современными программными средствами, позволяющими осуществлять анализ данных
на профессиональном уровне.
ISBN 978-5-7782-3183-2 © Волкова В.М., Семёнова М.А.,
Четвертакова Е.С., Вожов С.С., 2017
© Новосибирский государственный
технический университет, 2017
УДК 004.438
2

ОГЛАВЛЕНИЕ
Введение .................................................................................................................. 4
1. Предварительный анализ данных ................................................................. 5
1.1. Инструменты предварительного анализа данных ................................... 7
1.1.1. Обработка пропущенных значений ................................................. 7
1.1.2. Описательные статистики ............................................................... 10
1.1.3. Графические инструменты ............................................................. 11
1.2. Среда статистического анализа данных R ............................................. 14
1.3. Пример предварительного анализа данных ........................................... 16
1.4. Упражнения ............................................................................................... 24
2. Проверка статистических гипотез ............................................................... 26
2.1. Анализ распределений переменных ........................................................ 26
2.2. Выявление зависимостей между переменными .................................... 27
2.2.1. Корреляционный анализ ................................................................. 28
2.2.2. Проверка гипотез об однородности средних ................................ 29
2.3. Пример проверки статистических ги
2.
4. Упражнения ............................................................................................... 35
3. Построение моделей регрессии ..................................................................... 37
3.1. Отбор регрессоров ..................................................................................... 38
3.1.1. Факторный анализ ........................................................................... 38
3.1.2. Метод включения или исключения переменных .......................... 39
3.2. Проверка качества и адекватности модели ............................................ 40
3.3. Регрессионный анализ в системе R .......................................................... 42
3.4. Упражнения ............................................................................................... 44
4. Проведение статистического анализа с использованием Python ........... 45
4.1. Установка и необходимые дистрибутивы .............................................. 45
4.2. Пакеты для работы с данными ................................................................. 46
4.3. Упражнения ............................................................................................... 47
Библиографический список ................................................................................. 48
Приложение. Наборы данных .............................................................................. 49
потез ............................................. 31
3

ВВЕДЕНИЕ
Пособие посвящено рассмотрению системы R и языка Python, используемых для статистического анализа. Существенным преимуществом данных систем является, с одной стороны, возможность открытого использования благодаря тому, что их код разрабатывается либо в
рамках проекта GNU, либо под лицензией, совместимой с GNU. С другой стороны, к данному моменту этими системами накоплен потенциал
к решению различных задач в обл
И здесь R выступает как более мощный инструмент в плане реализованных статистических методов, а Python – как более мощный программный инструментарий, в том числе в плане возможностей, связанных с оперированием данными и процессами. Однако в целом оба они
представляют на данный момент достаточный набор методов для проведения наиб
достатком является, пожалуй, то, что методическое обеспечение, позволяющее осваивать эти системы, запаздывает относительно момента
выхода в свет собственно программного обеспечения, что тормозит их
внедрение в практику использования. И это является одной из причин,
побудившей авторов написать данное учебное пособие.
Второй причиной
яснения студентам-магистрантам, будущим специалистам в области статистического анализа данных, о том, в какой последовательности и в каких условиях (определяемых особенностями данных) лучше применять те
или иные статистические методы, чтобы в итоге получать максимально
корректные и адекватные данным статистические выводы. Ведь большинство у
уделяет внимания выбору метода, предпосылкам, в которых имеет смысл
использовать тот или иной метод. И еще меньше внимания уделяется вопросу построения серии исследований данных с момента проведения
предварительного анализа и выдвижения первых предположений об особенностях, заключенных в данных, до момента построения моделей зависимости и предсказаний. Именно эт
восполнить настоящее учебное пособие.
олее востребованных статистических исследований. Не-
создания пособия является потребность дать разъ-
ебников, посвященных статистическому анализу данных, мало
ч
асти статистического анализа.
от дефицит информации призвано
4

1. ПРЕДВАРИТЕЛЬНЫЙ АНАЛИЗ ДАННЫХ
На разных этапах статистического исследования возникает необходимость в формулировании и экспериментальной проверке некоторых предположительных утверждений (гипотез), от которых зависят
правомерность и эффективность применяемых методов анализа,
например:
можно ли считать обрабатываемые данные результатами незави-
симых наблюдений случайной величины;
при наличии нескольких групп исходных данных можно ли счи-
тать, что они извлечены из одной генеральной совоку
какую модель надо выбрать для описания эмпирических данных;
какова природа и форма представления неизвестных параметров
рассматриваемой модели и т. д.
Для начала необходимо разобраться с природой рассматриваемых
переменных, т. е. с точки зрения математической статистики необходимо определить шкалу измерения каждой переменной. Наиболее
сто используется на практике следующее разделение переменных по
шкалам:
Номинальные. Переменную можно рассматривать как номинальную, когда ее значения представляют категории без естественного
упорядочения. Номинальные переменные используются для качественной классификации. Это означает, что данные переменные могут
быть измерены только в терминах принадлежности к некоторым, существенно различным кл
количество или упорядочить эти классы. Например, вы сможете сказать, что два индивидуума различимы в терминах переменной А
(например, индивидуумы принадлежат к разным национальностям).
Типичные примеры номинальных переменных – пол, национальность,
цвет, город и т. д. Частным случаем номинальных переменных являются бинарные переменные – переменные, которые принимают только
два значения. Это наименее информативный тип шка
ассам; при этом вы не сможете определить
пности;
ча-
лы.
5

Порядковые. Переменную можно рассматривать как порядко-
вую, когда ее значения представляют категории с некоторым естественным для них упорядочением. Порядковые переменные позволяют
ранжировать (упорядочить) объекты, указав, какие из них в большей
или меньшей степени обладают качеством, выраженным данной переменной. Однако они не позволяют сказать «на сколько больше» или
«на ско
социоэкономический статус семьи. Мы понимаем, что верхний уровень выше среднего уровня, однако сказать, чему равна разница между
ними, мы не сможем.
ственную, когда ее значения представляют упорядоченные категории с
осмысленной метрикой, так что уместно сравнивать расстояния между
значениями. Это наиболее информативный тип шкалы.
зависимые и независимые переменные. Независимыми перем
называются переменные, которые варьируются исследователем, тогда
как зависимые переменные – это переменные, которые измеряются или
регистрируются. Термины «зависимая» и «независимая» переменная
применяются в основном в экспериментальном исследовании, где экспериментатор манипулирует некоторыми переменными, и в этом
смысле они «независим
объектам исследования. Другие же переменные, как предполагается,
должны «зависеть» от действий экспериментатора или от экспериментальных условий. Иными словами, зависимость проявляется в ответной реакции исследуемого объекта на посланное на него воздействие.
Например, если в эксперименте мужчины сравни
относительно уровня образования, то пол можно назвать независимой
переменной, а уровень образования – зависимой переменной.
ны (зависимы) между собой, если наблюдаемые значения этих переменных распределены согласованным образом. Другими словами, переменные зависимы, если их значения систематическим образом согласованы
переменные пол и уровень образования могли бы рассматриваться как
зависимые, если бы большинство мужчин имели высокий уровень образования, а большинство женщин – низкий, или наоборот. Рост связан
с весом, потому что обычно высокие индивиды тяжелее низких; длительность жизни связана с наличием хронических заболе
лько меньше». Типичный
Количественные. Переменную можно рассматривать как количе-
Кроме того, в ходе предварительного анализа данных определяют
ы» от реакций, свойств, намерений, присущих
Независимо от шкалы измерения две или более переменных связа-
друг с другом в имеющихся у нас наблюдениях. Например,
пример порядковой переменной –
енными
ваются с женщинами
ваний и т. д.
6

Вообще говоря, конечная цель всякого исследования или научного
анализа состоит в нахождении связей (зависимостей) между переменными. Не существует иного способа представления знания, кроме как в
терминах зависимостей между количествами или качествами, выраженными какими-либо переменными. Например, отмеченное выше
экспериментальное сравнение уровня образования у мужчин и женщин
может быть описано как поиск свя
вень образования. Назначение статистики состоит в том, чтобы помочь
объективно оценить зависимости между переменными.
зи между переменными: пол и
уро-
1.1. ИНСТРУМЕНТЫ ПРЕДВАРИТЕЛЬНОГО
АНАЛИЗА ДАННЫХ
1.1.1. Обработка пропущенных значений
Во многих исследованиях, основывающихся на массовых экспериментах или опросах, некоторые переменные имеют пропущенные значения, которые ведут к снижению вероятности нахождения реальных
закономерностей в данных, а также могут быть причиной систематических ошибок.
Обработка пропущенных значений является достаточно развитой
исследовательской областью с общепринятой терминологией и множеством решений для различных дисциплин и
С попыткой широкого обобщения основ обработки пропущенных данных в социальных науках можно ознакомиться, например, в работе
Даниэля Ньюмана. Мы обратимся к главным понятиям этой теории, а
также основным методам решения проблемы пропущенных значений.
Принято выделять три вида пропусков – полностью случайные,
случайные и неслучайные пропуски (данная терминология ведет св
начало от известной работы Дональда Рубина). Полностью случайные
пропуски имеют место в тех случаях, когда подвыборка имеющихся
значений по переменной, подлежащей изучению, по-прежнему является моделью генеральной совокупности. Примером может служить случай, когда пропуски по некоторой переменной (например, политические предпочтения) не зависят от значений переменных-предикторов
(например, пол, возраст, регион проживания и
ний самих пропусков (например, не возникает ситуации, когда респонденты с определенной политической позицией чаще других не дают
ответа на соответствующий вопрос).
конкретных исследований.
ое
т. д.), а также от значе-
7

При случайных пропусках их значения зависят от значений переменных-предикторов и не зависят от собственных значений пропусков.
Так, если пропуски в ответах на вопрос о политических предпочтениях
чаще встречаются среди людей старшего возраста (но внутри этой
группы они распределены случайно), то речь идет о случайных пропусках. В этом случае возникает вероятность смещения резу
оценивания параметров по выборке в целом (если значение по соответствующей подгруппе отличается от общего среднего).
Если же вероятность пропусков по определенным переменным зависит от величины самих пропущенных значений по этим переменным, то говорят о неслучайных пропусках. Например, люди с левыми
политическими взглядами с меньшей вероятностью склонны сообщать
соответствую
ские ошибки в результаты анализа.
Методы обработки пропущенных значений делятся на традиционные и современные. К первым относят построчное и попарное удаление наблюдений, замещение средним и замещение с использованием
регрессии. Ко вторым – замещение с использованием оценки максимального правдоподобия, множественное заме
модель и модель смешанных паттернов.
При построчном удалении из массива исключаются любые наблюдения, в значениях переменных которых присутствует хотя бы один
пропуск. Такой подход может использоваться только при полностью
случайных пропусках. Но даже в такой ситуации его использование
ведет к снижению объема информации, заключенной в данных. Как и
при построчном у
но для полностью случайных пропусков. Попарное удаление заключается в том, что в каждом конкретном случае анализа из него удаляются
только те наблюдения, в которых присутствует хотя бы один пропуск
по релевантным для данного анализа переменным.
Использование замещения пропущенных значений выборочным
средним наиболее часто встреч
обработки пропусков ведет к смещенным оценкам (поскольку уменьшает дисперсию переменных и ковариацию между ними), независимо
от используемого допущения. Исключением является оценка самого
среднего значения.
Замещение с использованием регрессии (вместо пропущенных используются предсказанные значения) имеет схожие с предыдущим
щую информацию. Такие пропуски вносят систематиче-
щение, селективную
далении, попарное удаление подходит исключитель-
ается на практике. Однако такой способ
льтатов
8

способом проблемы. Так, получаемые значения становятся частью одной регрессионной прямой, что может вносить смещение. Частично
эта проблема может быть решена посредством добавления случайных
остаточных значений к предсказанным величинам. В целом же данный
способ замещения подходит для случайных пропусков.
Замещение с использованием оценки максимального правдоподобия, представляет собой итерационный процесс, каждая итерация которог
о включает два этапа: 1) средние значения переменных и ковариационная матрица используются для расчета регрессионных уравнений, предсказывающих пропущенные значения; 2) полученный
массив используется для расчета обновленных средних значений и
ковариационной матрицы. Эти этапы повторяются до тех пор, пока
средние значения и ковариационная матрица не перестанут изменяться. Можно сказать, что в данном случае
ный подход. В случае множественного замещения создается набор
альтернативных массивов данных (от пяти и более), в которых пропущенные значения замещаются предсказанными посредством регрессии с добавлением случайного элемента. После этого средние
значения переменных и ковариационные матрицы обобщаются с
целью получения итоговой оценки. Этот подход можн
курентным. Как замещение посредством максимального правдоподобия, так и множественное замещение подходит для ситуаций, в которых исследователь исходит из полностью случайных пропусков или
случайных пропусков.
Для неслучайных пропусков предназначены селективная модель и
модель смешанных паттернов. Селективная модель соединяет основное регрессионное уравнение с дополнительным регрессионным уравнением, пре
связываются посредством коррелируемых остатков (correlated
residuals), и с помощью этой связи корректируются смещения модели,
связанные с пропусками.
Модель смешанных паттернов предполагает формирование подгрупп наблюдений, в которых обнаруживаются одинаковые паттерны
пропусков данных, с дальнейшей оценкой интересующих параметров в
каждой подгруппе. После чего находится средневзвешенная оценка
этих параметров. Стоит отметить, что методы
пропусков не получили достаточно широкого признания.
дсказывающим вероятность ответов. Две части модели
используется последователь-
о назвать кон-
обработки неслучайных
9

1.1.2. Описательные статистики
x
x
x
Описательные статистики необходимы для обработки, систематизации, наглядного представления и количественного описания исследуемых переменных, при этом описательная статистика не делает выводов о генеральной совокупности на основании результатов исследования частных случаев. Рассмотрим наиболее часто используемые
описательные статистики.
n
Среднее значение переменной
принимаемые исследуемой переменной;
ременной.
Доверительный интервал для среднего представляет интервал значений оценки, где с данным уровнем доверия находится «истинное»
(неизвестное) среднее значение переменной.
Медиана – такое значение переменной, что ровно половина из эле-
ментов выборки
1
,...,
больше его, а другая половина меньше. В бо-
x
n
лее общем случае медиану можно найти, упорядочив элементы выборки
по возрастанию или убыванию и взяв средний элемент. Например, выборка {27, 15, 8, 12, 14} после упорядочивания превращается в {8, 12,
14, 15, 27} и ее медианой является число 14. Если в выборке четное число элементов, медиана может быть не определена однозначно: для числовых да
нных чаще всего используют полусумму двух соседних значе-
ний (т. е. медиану набора {1, 3, 5, 7} принимают равной 4).
Мода – значение переменной, которое встречается в выборке
наиболее часто. Некоторые наборы данных не имеют моды, потому
что каждое значение встречается только один раз. Иногда бывает более
одной моды. Это происходит тогда, когда два з
встреч
аются одинаковое число раз и встречаемость каждого из этих
значений больше, чем любого другого значения. Как обобщающую
характеристику моду используют редко.
Размах – это разность между максимальным и минимальным зна-
чениями переменной в наборе данных.
Квартили – значения, которые делят выборку (или ее часть) на четыре группы, содержащие приблизит
дений. Так, 25 % данных находится ниже первого (нижнего) квартиля,
75 % данных находится ниже третьего (квартиля) квартиля, второй
квартиль совпадает с медианой.
1
, где
x
i
n
1
i
– количество значений пе-
n
ельно равно
– значения,
,...,
x
1
n
начения или больше
е количество наблю-
10
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
