Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Программные системы статистического анализа. Обнаружение закономерностей в данных с использованием системы R и языка Python. Учебное пособие
.pdf
Квартили вычисляются следующим образом: вычисляется f-значе-
x
ние каждого значения из таблицы упорядоченных по возрастанию дан-
ных:
f
i
n
,
1
1,...,in
– индекс значения. Первый квартиль вычис-
1
i
ляется путем интерполяции между f-значениями, которые находятся
непосредственно ниже и выше 0.25. Третий квартиль вычисляется путем интерполяции между f-значениями, которые находятся непосредственно ниже и выше 0.75.
В качестве оценки математического ожидания можно использовать полученные средние значения или медианы, а разность между
третьим и перв
ым кварти
лям (квартильный размах) – в качестве оценки степени разброса значений переменных вокруг показателей среднего. Более привычным способом оценивания степени разброса значений
является вычисление оценки дисперсии распределения исследуемой
характеристики по данным: выборочная несмещенная дисперсия мо-
n
жет быть вычислена по следующей формуле:
n
1
1
i
1
2
2
.
x
i
Среднеквадратическое отклонение – корень из выборочной дисперсии, также показывает рассеивание значений переменной относительно ее среднего значения.
1.1.3. Графические инструменты
Более наглядным является представление исследуемых данных посредством построения различных графиков и диаграмм.
Диаграммы размахов («ящик с усами») – график, компактно изображающий одномерное распределение вероятностей (рис. 1).
Подобные графики получили свое название за характерный вид:
точку или линию, соответствующую медиане или среднему арифметическому, окружает прямоугольник («ящик»), длина которого соответствует одному из показателей разброса ил
и точно
сти оценки генерального параметра. Дополнительно от этого прямоугольника отходят
«усы», также соответствующие по длине одному из показателей разброса или точности. Графики этого типа очень популярны, поскольку
позволяют дать полную статистическую характеристику анализируемой совокупности. Кроме того, диаграммы размаха можно использо-
я и более
вать для визуальной экспресс-оценки разницы между дву
м
11

группами (например, между датами отбора проб, экспериментальными
группами, участками пространства, и т.п.).
Рис. 1. Диаграмма размахов
(«ящик с усами»)
Визуально оценить справедливость предположений относительно
распределения данных можно, построив гистограммы (рис. 2) и графики эмпирических функций распределения (рис. 3).
Рис. 2. Гистограмма
Рис. 3. Эмпирическая функция рас-
пределения
Гистограмма представляет статистические данные в виде столбчатой диаграммы. Она отображает распределение отдельных измерений
12

параметров изделия или процесса. Иногда ее называют частотным распределением, так как гистограмма показывает частоту появления измеренных значений параметров объекта.
Высота каждого столбца указывает на частоту появления значений
параметров в выбранном диапазоне, а количество столбцов – на число
выбранных диапазонов.
Важное преимущество гистограммы заключается в том, что она
е
позволяет зрительно оценить закон распред
ления изучаемых параметров объекта: дает возможность быстро определить центр, разброс и
форму распределения случайной величины. Также гистограмма может
быть очень полезна для выявления полимодальности распределения,
т. е. наличием в распределении нескольких мод. Визуально модам соответствуют точки максимумов гистограммы. Зачастую природное
распределение является полимодальным. Обычно оно образовано одной главной (интенсивной) модой и одной или несколькими второстепенными мод
ами. Второстепенные моды часто образованы малым
числом случаев, поэтому они часто бывают интересны в большей степени как совокупности аномальных значений. Но иногда среди выявленных мод трудно выявить главную, и тогда речь идет уже скорее о
неоднородности выборки, когда она представляет собой смес
ь из двух
или более групп наблюдений с различными распределениями. Обнаружение таких групп позволяет улучшить качество статистического
анализа. Обнаружить их можно, используя категоризированные гистограммы, ящики с усами и другие графики. При построении категоризированных графиков анализируемые данные разбиваются на отдельные категории (например, в соответствии с уровнями какого-
то фактора), для каждой из которых строится свой график определенного типа.
Все эти графики затем объединяются на одном рисунке, что существенно облегчает выявление статистических закономерностей и
структур в данных.
Эмпирической функцией распределения (функцией распределения
выборки) называют функцию, определяющую для каждого значения x
относительную частоту того, что исследуемая пе
ременная окажется
меньше x.
Помимо получения информации о распределении отдельных переменных на практике часто возникает задача выявления зависимостей
между переменными, для этого строят диаграммы рассеяния (корреляционные поля), рис. 4.
13

2
2
1
0
-4 -3 -2 -1 0 1 2 3 4
-4 -3 -2 -1 0 1 2 3 4
1
0
Рис. 4. Диаграммы рассеяния (корреляционные поля)
Корреляционное поле – это графическое представление статистических данных в прямоугольной системе координат, где каждой паре
на плоскости соответствует точка. Построенное корреляционное поле
позволяет сделать предварительный вывод как о наличии зависимости
между рассматриваемыми признаками, так и о виде этой зависимости,
и выдвинуть соответствующие гипотезы.
1.2. СРЕДА СТАТИСТИЧЕСКОГО АНАЛИЗА
ДАННЫХ R
R – это язык программирования, предназначенный для статистической обработки данных и работы с графикой. Создание данной программной среды относится к «open source» проектам, каждый может
скачать и установить себе актуальную версию R. Язык R был разработан сотрудниками статистического факультета Оклендского университета, поддерживается и развивается организацией «R Foundation», широко используется как статистическое программное обеспечение для
анализ
Распространяется R в виде исходных кодов, а также откомпилированных приложений под ряд операционных систем, поддерживает широкий спектр статистических и численных методов и обладает хорошей
расширяемостью с помощью пакетов. Пакеты в свою очередь пред-
а данных и является стандартом для статистических программ.
14

ставляют собой библиотеки для работы специфических функций или
специальных областей применения. Кроме этого, особенностью R являются графические возможности, заключающиеся в создании качественной графики, которая может включать математические символы.
Однако, несмотря на наличие ряда графических интерфейсов пользо-
вателя, например, пакетов «R Commander», «RK Ward», «RStudio»,
«Weka», а также возможности интеграции в офисные пакеты, основным недостатком для пользователей принято считать использование в
R интерфейса командной строки. С одной стороны, данный факт
усложняет взаимодействие пользователя с системой, с другой стороны
– предоставляет возможности для исследования закономерностей и
создания новых продук
тов, поэтому чаще всего R используется в обра-
зовательных и исследовательских целях.
Для того, чтобы скачать установочный пакет, необходимо перейти
на сайт проекта https://www.r-project.org и выбрать версию системы в
зависимости от операционной системы рабочего ПК (особенности
установки и запуска в зависимости технических характеристик можно
найти в дополнительной литературе). Рассмотренные далее примеры
иллюстрируют работу в сред
е разработки RStudio (версия RStudi
o
Desktop).
Для демонстрации возможностей среды R используется набор данных о доходах населения, представленный в файле Income.csv. Он
включает в себя информацию о 6400 респондентах, для каждого из которых собрана информация по следующим показателям: age(возраст),
marital (семейное положение), address (количество лет проживания по
текущему адресу), income (доход в тысячах у.е.), car (стоимость автомобиля), ed (уровень образования), em
ploy (текущий стаж работы), re-
tire (достижение пенсионного возраста), jobsat (удовлетворенность ра-
ботой), gender (пол), reside (количество человек в семье). Эти показатели далее рассматриваются как переменные в модели, содержащей
6400 наблюдений.
При работе с данными в первую очередь необходимо установить в
качестве текущей директории ту, в которой будут находиться файлы с
исходными данными и результатам
и: с помощью функции
getwd()
можно проверить, какая директория является текущей, с помощью
функции
setwd() можно установить нужную директорию в качестве
рабочей. На рис. 5 представлен внешний вид программной среды с
примененными командами
getwd() и setwd().
15

Рис. 5. Рабочее окно RStudio
На рис. 6 представлено использование функции read.csv2(), позволяющей осуществить ввод данных из файла, который находится в текущей директории. В качестве параметров функции выступают:
income.csv – название файла с данными, header – параметр, определяющий наличие заголовков таблицы в первой строке исходного файла,
sep – параметр, определяющий вид разделителя элементов таблицы.
Полученная таблица сохранена в переменную data.
После ввода и сохранения данных можно приступ
ать к их анализу.
1.3. ПРИМЕР ПРЕДВАРИТЕЛЬНОГО
АНАЛИЗА ДАННЫХ
Для проверки наличия пропущенных и отсутствующих значений в
R существует функция
видно из рис. 7, пропущенных или отсутствующих переменных не
найдено.
is.na(). В рассматриваемом примере, как это
16

Рис. 6. Чтение таблицы
Рис. 7. Анализ пропущенных наблюдений
В случае, когда исследователь решил удалить пропущенные значе-
ния, он может воспользоваться функцией
na.omit(), которая удаляет
все строки, где есть хотя бы одно пропущенное значение. Аналогично,
17

у большей части числовых функций есть параметр
na.rm=TRUE, кото-
рый также удаляет пропущенные значения перед вычислениями и позволяет применить функцию к оставшимся элементам:
data[is.na(data)] <- mean(data, na.rm = TRUE)
В R реализован ряд функций, которые позволяют определить тип
данных и преобразовать их в другой формат. Эти преобразования происходят в R сходным с другими языками программирования образом.
Для проверки типа данных и преобразования их в другой формат можно использовать функции, перечисленные в табл. 1.
Таблица 1
Функции, используемые для изменения формата данных
Название типа Проверка Преобразование
Количественный is.numeric() as.numeric()
Текстовый is.character() as.character()
Номинальный или
порядковый
Логический is.logical() as.logical()
Вектор is.vector() as.vector()
Матрица is.matrix() as.matrix()
is.factor() as.factor()
Например, тип переменной gender, имея текстовый формат, будет
изменен на номинальный (рис. 8). Естественно, преобразование типов
может осуществляться только в условиях ненарушения принципов понижения информации при переходе от одного типа шкалы переменной
к другому.
Для получения общей информации по описательным статистикам
рассматриваемых переменных можно воспользоваться функцией
mary()
, которая предоставляет информацию о значениях минимума,
sum-
максимума, среднего, медианы и первом и третьем квартилях для количественных переменных, о частотах – для качественных (рис. 9).
18

Рис. 8. Преобразование типов переменных
Рис. 9. Описательные статистики
19

В качестве оценки математического ожидания можно использовать
полученные средние значения или медианы, а разность между третьим
и первым квартилями (квартильный размах) – в качестве оценки степени разброса значений переменных вокруг показателей среднего.
Как видно из полученных результатов, для переменных address, in-
come, car и employ среднее значение больше медианы, следовательно,
льну
распределения этих переменных имеют положите
ю асимметрию.
При помощи диаграммы размахов («ящик с усами») визуализируем
значения описательных статистик, полученных для переменных income
(рис. 10) и car (рис. 11). По полученным диаграммам можно легко оценить медианы, квартили и асимметрию распределения данных.
Рис. 10. «Ящик с усами»
для income
Рис. 11. «Ящик с усами» для car
Предположив, что данные о возрасте и доходе имеют нормальный
закон распределения, можно визуально оценить справедливость выдвинутых предположений, построив гистограммы по переменным age
(рис. 12) и income (рис. 13). Гистограммы были получены с использованием функции
hist(). Как видно из диаграмм, наши предположения
не подтвердились в отношении переменной income в отличие от переменной age, распределение которой, судя по гистограмме, близко к
нормальному, хотя и имеет легкую асимметрию.
Построение эмпирической функции с помощью функции
ecdf()
продемонстрируем на примере переменной age (рис. 14).
Кроме того, логично предположить зависимость дохода (income) от
возраста (age), уровня образования (ed), стажа работы (employ) и удо-
влетворенности работой (jobsat). Корректность выдвинутых предпо-
ложений позволяют оценить корреляционные поля, построенные для
различных пар переменных. Как видно из рис. 15 и рис. 16, некоторая
зависимость между доходом и возрастом, а такж
е доходом и стажем
20
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
