Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Программные системы статистического анализа. Обнаружение закономерностей в данных с использованием системы R и языка Python. Учебное пособие

.pdf
Скачиваний:
0
Добавлен:
07.09.2026
Размер:
1 Мб
Скачать
☆
Министерство образования и науки Российской Федерации
НОВОСИБИРСКИЙ ГОСУДАРСТВЕННЫЙ ТЕХНИЧЕСКИЙ УНИВЕРСИТЕТ
__________________________________________________________________________
ПРОГРАММНЫЕ СИСТЕМЫ
СТАТИСТИЧЕСКОГО АНАЛИЗА
ОБНАРУЖЕНИЕ ЗАКОНОМЕРНОСТЕЙ
СИСТЕМЫ R И ЯЗЫКА PYTHON
Утверждено Редакционно-издательским советом университета
в качестве учебного пособия
НОВОСИБИРСК
2017
УДК 004.438
П 784
Рецензенты:
канд. техн. наук, доцент Т.А. Гультяева
канд. экон. наук, доцент А.Ю. Тимофеева
Работа подготовлена на кафедре теоретической и прикладной
информатики для студентов ФПМИ дневного отделения направления
01.04.02 «Прикладная математика и информатика»
П 784 Программные системы статистического анализа. Обнару-
жение закономерностей в данных с использованием систе­мы R и языка Python: учебное пособие / В.М. Волкова,
М.А. Семёнова, Е.С. Четвертакова, С.С. Вожов. – Новосибирск: Изд-во НГТУ, 2017. – 74 с.
ISBN 978-5-7782-3183-2
Рассмотрены методы анализа данных в той последовательности, как они должны применяться при использовании анализа данных на прак­тике: методы, использующиеся при предварительном анализе данных, при проверке статистических гипотез о нормальности, об однородности средних, о независимости, об однородности дисперсий, о незначимости коэффициента корреляции, методы построения моделей регрессии, проверки на адекватность полученной модели, оценки качества модели и ее способности давать точный прогноз. Приводится информация о функциях, представленных в системе R и библиотеках и пакетах, реали­зованных средствами языка программирования Python.
Учебное пособие может быть полезно также всем, интересующим­ся методами статистического анализа данных и современными про­граммными средствами, позволяющими осуществлять анализ данных на профессиональном уровне.
ISBN 978-5-7782-3183-2 © Волкова В.М., Семёнова М.А.,
Четвертакова Е.С., Вожов С.С., 2017
© Новосибирский государственный
технический университет, 2017
УДК 004.438
2
ОГЛАВЛЕНИЕ
Введение .................................................................................................................. 4
1. Предварительный анализ данных ................................................................. 5
1.1. Инструменты предварительного анализа данных ................................... 7
1.1.1. Обработка пропущенных значений ................................................. 7
1.1.2. Описательные статистики ............................................................... 10
1.1.3. Графические инструменты ............................................................. 11
1.2. Среда статистического анализа данных R ............................................. 14
1.3. Пример предварительного анализа данных ........................................... 16
1.4. Упражнения ............................................................................................... 24
2. Проверка статистических гипотез ............................................................... 26
2.1. Анализ распределений переменных ........................................................ 26
2.2. Выявление зависимостей между переменными .................................... 27
2.2.1. Корреляционный анализ ................................................................. 28
2.2.2. Проверка гипотез об однородности средних ................................ 29
2.3. Пример проверки статистических ги
2.
4. Упражнения ............................................................................................... 35
3. Построение моделей регрессии ..................................................................... 37
3.1. Отбор регрессоров ..................................................................................... 38
3.1.1. Факторный анализ ........................................................................... 38
3.1.2. Метод включения или исключения переменных .......................... 39
3.2. Проверка качества и адекватности модели ............................................ 40
3.3. Регрессионный анализ в системе R .......................................................... 42
3.4. Упражнения ............................................................................................... 44
4. Проведение статистического анализа с использованием Python ........... 45
4.1. Установка и необходимые дистрибутивы .............................................. 45
4.2. Пакеты для работы с данными ................................................................. 46
4.3. Упражнения ............................................................................................... 47
Библиографический список ................................................................................. 48
Приложение. Наборы данных .............................................................................. 49
потез ............................................. 31
3
ВВЕДЕНИЕ
Пособие посвящено рассмотрению системы R и языка Python, ис­пользуемых для статистического анализа. Существенным преимуще­ством данных систем является, с одной стороны, возможность откры­того использования благодаря тому, что их код разрабатывается либо в рамках проекта GNU, либо под лицензией, совместимой с GNU. С дру­гой стороны, к данному моменту этими системами накоплен потенциал к решению различных задач в обл И здесь R выступает как более мощный инструмент в плане реализо­ванных статистических методов, а Python – как более мощный про­граммный инструментарий, в том числе в плане возможностей, связан­ных с оперированием данными и процессами. Однако в целом оба они представляют на данный момент достаточный набор методов для про­ведения наиб достатком является, пожалуй, то, что методическое обеспечение, поз­воляющее осваивать эти системы, запаздывает относительно момента выхода в свет собственно программного обеспечения, что тормозит их внедрение в практику использования. И это является одной из причин, побудившей авторов написать данное учебное пособие.
Второй причиной яснения студентам-магистрантам, будущим специалистам в области ста­тистического анализа данных, о том, в какой последовательности и в ка­ких условиях (определяемых особенностями данных) лучше применять те или иные статистические методы, чтобы в итоге получать максимально корректные и адекватные данным статистические выводы. Ведь боль­шинство у уделяет внимания выбору метода, предпосылкам, в которых имеет смысл использовать тот или иной метод. И еще меньше внимания уделяется во­просу построения серии исследований данных с момента проведения предварительного анализа и выдвижения первых предположений об осо­бенностях, заключенных в данных, до момента построения моделей зави­симости и предсказаний. Именно эт восполнить настоящее учебное пособие.
олее востребованных статистических исследований. Не-
создания пособия является потребность дать разъ-
ебников, посвященных статистическому анализу данных, мало
ч
асти статистического анализа.
от дефицит информации призвано
4
1. ПРЕДВАРИТЕЛЬНЫЙ АНАЛИЗ ДАННЫХ
На разных этапах статистического исследования возникает необ­ходимость в формулировании и экспериментальной проверке некото­рых предположительных утверждений (гипотез), от которых зависят правомерность и эффективность применяемых методов анализа, например:
можно ли считать обрабатываемые данные результатами незави- симых наблюдений случайной величины;
при наличии нескольких групп исходных данных можно ли счи- тать, что они извлечены из одной генеральной совоку
какую модель надо выбрать для описания эмпирических данных;
какова природа и форма представления неизвестных параметров
рассматриваемой модели и т. д.
Для начала необходимо разобраться с природой рассматриваемых переменных, т. е. с точки зрения математической статистики необхо­димо определить шкалу измерения каждой переменной. Наиболее сто используется на практике следующее разделение переменных по шкалам:
Номинальные. Переменную можно рассматривать как номиналь­ную, когда ее значения представляют категории без естественного упорядочения. Номинальные переменные используются для каче­ственной классификации. Это означает, что данные переменные могут быть измерены только в терминах принадлежности к некоторым, су­щественно различным кл количество или упорядочить эти классы. Например, вы сможете ска­зать, что два индивидуума различимы в терминах переменной А (например, индивидуумы принадлежат к разным национальностям). Типичные примеры номинальных переменных – пол, национальность, цвет, город и т. д. Частным случаем номинальных переменных явля­ются бинарные переменные – переменные, которые принимают только два значения. Это наименее информативный тип шка
ассам; при этом вы не сможете определить
пности;
ча-
лы.
5
Порядковые. Переменную можно рассматривать как порядко- вую, когда ее значения представляют категории с некоторым есте­ственным для них упорядочением. Порядковые переменные позволяют ранжировать (упорядочить) объекты, указав, какие из них в большей или меньшей степени обладают качеством, выраженным данной пере­менной. Однако они не позволяют сказать «на сколько больше» или «на ско социоэкономический статус семьи. Мы понимаем, что верхний уро­вень выше среднего уровня, однако сказать, чему равна разница между ними, мы не сможем.
ственную, когда ее значения представляют упорядоченные категории с осмысленной метрикой, так что уместно сравнивать расстояния между значениями. Это наиболее информативный тип шкалы.
зависимые и независимые переменные. Независимыми перем называются переменные, которые варьируются исследователем, тогда как зависимые переменные – это переменные, которые измеряются или регистрируются. Термины «зависимая» и «независимая» переменная применяются в основном в экспериментальном исследовании, где экс­периментатор манипулирует некоторыми переменными, и в этом смысле они «независим объектам исследования. Другие же переменные, как предполагается, должны «зависеть» от действий экспериментатора или от эксперимен­тальных условий. Иными словами, зависимость проявляется в ответ­ной реакции исследуемого объекта на посланное на него воздействие. Например, если в эксперименте мужчины сравни относительно уровня образования, то пол можно назвать независимой переменной, а уровень образования – зависимой переменной.
ны (зависимы) между собой, если наблюдаемые значения этих пере­менных распределены согласованным образом. Другими словами, пе­ременные зависимы, если их значения систематическим образом со­гласованы переменные пол и уровень образования могли бы рассматриваться как зависимые, если бы большинство мужчин имели высокий уровень об­разования, а большинство женщин – низкий, или наоборот. Рост связан с весом, потому что обычно высокие индивиды тяжелее низких; дли­тельность жизни связана с наличием хронических заболе
лько меньше». Типичный
Количественные. Переменную можно рассматривать как количе-
Кроме того, в ходе предварительного анализа данных определяют
ы» от реакций, свойств, намерений, присущих
Независимо от шкалы измерения две или более переменных связа-
друг с другом в имеющихся у нас наблюдениях. Например,
пример порядковой переменной –
енными
ваются с женщинами
ваний и т. д.
6
Вообще говоря, конечная цель всякого исследования или научного анализа состоит в нахождении связей (зависимостей) между перемен­ными. Не существует иного способа представления знания, кроме как в терминах зависимостей между количествами или качествами, выра­женными какими-либо переменными. Например, отмеченное выше экспериментальное сравнение уровня образования у мужчин и женщин может быть описано как поиск свя вень образования. Назначение статистики состоит в том, чтобы помочь объективно оценить зависимости между переменными.
зи между переменными: пол и
уро-
1.1. ИНСТРУМЕНТЫ ПРЕДВАРИТЕЛЬНОГО АНАЛИЗА ДАННЫХ
1.1.1. Обработка пропущенных значений
Во многих исследованиях, основывающихся на массовых экспери­ментах или опросах, некоторые переменные имеют пропущенные зна­чения, которые ведут к снижению вероятности нахождения реальных закономерностей в данных, а также могут быть причиной систематиче­ских ошибок.
Обработка пропущенных значений является достаточно развитой исследовательской областью с общепринятой терминологией и множе­ством решений для различных дисциплин и С попыткой широкого обобщения основ обработки пропущенных дан­ных в социальных науках можно ознакомиться, например, в работе Даниэля Ньюмана. Мы обратимся к главным понятиям этой теории, а также основным методам решения проблемы пропущенных значений.
Принято выделять три вида пропусков – полностью случайные, случайные и неслучайные пропуски (данная терминология ведет св начало от известной работы Дональда Рубина). Полностью случайные пропуски имеют место в тех случаях, когда подвыборка имеющихся значений по переменной, подлежащей изучению, по-прежнему являет­ся моделью генеральной совокупности. Примером может служить слу­чай, когда пропуски по некоторой переменной (например, политиче­ские предпочтения) не зависят от значений переменных-предикторов (например, пол, возраст, регион проживания и ний самих пропусков (например, не возникает ситуации, когда респон­денты с определенной политической позицией чаще других не дают ответа на соответствующий вопрос).
конкретных исследований.
ое
т. д.), а также от значе-
7
При случайных пропусках их значения зависят от значений пере­менных-предикторов и не зависят от собственных значений пропусков. Так, если пропуски в ответах на вопрос о политических предпочтениях чаще встречаются среди людей старшего возраста (но внутри этой группы они распределены случайно), то речь идет о случайных про­пусках. В этом случае возникает вероятность смещения резу оценивания параметров по выборке в целом (если значение по соответ­ствующей подгруппе отличается от общего среднего).
Если же вероятность пропусков по определенным переменным за­висит от величины самих пропущенных значений по этим перемен­ным, то говорят о неслучайных пропусках. Например, люди с левыми политическими взглядами с меньшей вероятностью склонны сообщать соответствую ские ошибки в результаты анализа.
Методы обработки пропущенных значений делятся на традицион­ные и современные. К первым относят построчное и попарное удале­ние наблюдений, замещение средним и замещение с использованием регрессии. Ко вторым – замещение с использованием оценки макси­мального правдоподобия, множественное заме модель и модель смешанных паттернов.
При построчном удалении из массива исключаются любые наблю­дения, в значениях переменных которых присутствует хотя бы один пропуск. Такой подход может использоваться только при полностью случайных пропусках. Но даже в такой ситуации его использование ведет к снижению объема информации, заключенной в данных. Как и при построчном у но для полностью случайных пропусков. Попарное удаление заключа­ется в том, что в каждом конкретном случае анализа из него удаляются только те наблюдения, в которых присутствует хотя бы один пропуск по релевантным для данного анализа переменным.
Использование замещения пропущенных значений выборочным средним наиболее часто встреч обработки пропусков ведет к смещенным оценкам (поскольку умень­шает дисперсию переменных и ковариацию между ними), независимо от используемого допущения. Исключением является оценка самого среднего значения.
Замещение с использованием регрессии (вместо пропущенных ис­пользуются предсказанные значения) имеет схожие с предыдущим
щую информацию. Такие пропуски вносят систематиче-
щение, селективную
далении, попарное удаление подходит исключитель-
ается на практике. Однако такой способ
льтатов
8
способом проблемы. Так, получаемые значения становятся частью од­ной регрессионной прямой, что может вносить смещение. Частично эта проблема может быть решена посредством добавления случайных остаточных значений к предсказанным величинам. В целом же данный способ замещения подходит для случайных пропусков.
Замещение с использованием оценки максимального правдоподо­бия, представляет собой итерационный процесс, каждая итерация ко­торог
о включает два этапа: 1) средние значения переменных и кова­риационная матрица используются для расчета регрессионных урав­нений, предсказывающих пропущенные значения; 2) полученный массив используется для расчета обновленных средних значений и ковариационной матрицы. Эти этапы повторяются до тех пор, пока средние значения и ковариационная матрица не перестанут изменять­ся. Можно сказать, что в данном случае ный подход. В случае множественного замещения создается набор альтернативных массивов данных (от пяти и более), в которых про­пущенные значения замещаются предсказанными посредством ре­грессии с добавлением случайного элемента. После этого средние значения переменных и ковариационные матрицы обобщаются с целью получения итоговой оценки. Этот подход можн курентным. Как замещение посредством максимального правдоподо­бия, так и множественное замещение подходит для ситуаций, в кото­рых исследователь исходит из полностью случайных пропусков или случайных пропусков.
Для неслучайных пропусков предназначены селективная модель и модель смешанных паттернов. Селективная модель соединяет основ­ное регрессионное уравнение с дополнительным регрессионным урав­нением, пре связываются посредством коррелируемых остатков (correlated residuals), и с помощью этой связи корректируются смещения модели, связанные с пропусками.
Модель смешанных паттернов предполагает формирование под­групп наблюдений, в которых обнаруживаются одинаковые паттерны пропусков данных, с дальнейшей оценкой интересующих параметров в каждой подгруппе. После чего находится средневзвешенная оценка этих параметров. Стоит отметить, что методы пропусков не получили достаточно широкого признания.
дсказывающим вероятность ответов. Две части модели
используется последователь-
о назвать кон-
обработки неслучайных
9
1.1.2. Описательные статистики
x
x
x
Описательные статистики необходимы для обработки, системати­зации, наглядного представления и количественного описания иссле­дуемых переменных, при этом описательная статистика не делает вы­водов о генеральной совокупности на основании результатов исследо­вания частных случаев. Рассмотрим наиболее часто используемые описательные статистики.
n
Среднее значение переменной
принимаемые исследуемой переменной; ременной.
Доверительный интервал для среднего представляет интервал зна­чений оценки, где с данным уровнем доверия находится «истинное» (неизвестное) среднее значение переменной.
Медиана – такое значение переменной, что ровно половина из эле- ментов выборки
1
,...,
больше его, а другая половина меньше. В бо-
x
n
лее общем случае медиану можно найти, упорядочив элементы выборки по возрастанию или убыванию и взяв средний элемент. Например, вы­борка {27, 15, 8, 12, 14} после упорядочивания превращается в {8, 12, 14, 15, 27} и ее медианой является число 14. Если в выборке четное чис­ло элементов, медиана может быть не определена однозначно: для чис­ловых да
нных чаще всего используют полусумму двух соседних значе-
ний (т. е. медиану набора {1, 3, 5, 7} принимают равной 4).
Мода – значение переменной, которое встречается в выборке наиболее часто. Некоторые наборы данных не имеют моды, потому что каждое значение встречается только один раз. Иногда бывает более одной моды. Это происходит тогда, когда два з встреч
аются одинаковое число раз и встречаемость каждого из этих значений больше, чем любого другого значения. Как обобщающую характеристику моду используют редко.
Размах – это разность между максимальным и минимальным зна-
чениями переменной в наборе данных.
Квартили – значения, которые делят выборку (или ее часть) на че­тыре группы, содержащие приблизит дений. Так, 25 % данных находится ниже первого (нижнего) квартиля, 75 % данных находится ниже третьего (квартиля) квартиля, второй квартиль совпадает с медианой.
1
, где
x
i
n
1
i
– количество значений пе-
n
ельно равно
– значения,
,...,
x
1
n
начения или больше
е количество наблю-
10
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]