Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Статистическая обработка экспериментальных данных. Дисперсионный и ковариационный анализы в языке R. Учебное пособие

.pdf
Скачиваний:
0
Добавлен:
11.08.2026
Размер:
629 Кб
Скачать

Е.С. Геращенко, В.Ю. Потапова, А.С. Тарасов, М.Б. Никифоров

Статистическая обработка экспериментальных данных

Дисперсионный и ковариационный анализы в языке R

Учебное пособие для магистрантов и аспирантов

Рекомендовано Научно-методическим советом ФГБОУ ВО

«Рязанский государственный радиотехнический университет» в качестве учебного пособия для студентов

высших учебных заведений, обучающихся по направлениям подготовки

09.06.01 и 09.04.01 «Информатика и вычислительная техника», 02.06.01 «Компьютерные и информационные науки»

и

02.04.03 «Математическое обеспечение и администрирование информационных систем»

Рязань

BOOKJET 2018

УДК 004.9

ББК 30Ф

Рецензент: доктор технических наук, профессор, зав. кафедрой ЭВМ ФГБОУ ВО «Рязанский государственный радиотехнический университет» Б.В. Костров

Авторы: Е. С. Геращенко, В. Ю. Потапова, А. С. Тарасов, М. Б. Никифоров

Статистическая обработка экспериментальных данных. Дисперсионный и ковариационный анализы в языке R

Учебное пособие / Е. С. Геращенко, В. Ю. Потапова,

А. С. Тарасов и др. – Рязань: ИП Коняхин А.В. (Bookjet), 2018. – 32с.: ил.

ISBN 978-5-6041320-5-0

Рассмотрены основные методы, используемые при статистической обработке данных. Приведены возможности среды разработки RGui для написания запросов на языке R применительно к обработке статистической информации.

Для студентов, обучающихся по направлениям 09.06.01 и 09.04.01 «Информатика и вычислительная техника», 02.06.01 «Компьютерные и информационные науки» и 02.04.03 «Математическое обеспечение и администрирование информационных систем»

ББК 30Ф

Адрес издательства в Интернете bookjet.ru Учебное издание

Геращенко Екатерина Сергеевна, Потапова Валентина Юрьевна, Тарасов Андрей Сергеевич, Никифоров Михаил Борисович

СТАТИСТИЧЕСКАЯ ОБРАБОТКА ЭКСПЕРИМЕНТАЛЬНЫХ ДАННЫХ ДИСПЕРСИОННЫЙ И КОВАРИАЦИОННЫЙ АНАЛИЗЫ В ЯЗЫКЕ R

Учебное пособие для вузов

Подписано в печать 06.07.18. Печать цифровая. Формат 60х84/16 Уч. изд. л.2,0 Тираж 500 экз. Изд. № 1542

ISBN 978-5-6041320-5-0

© Е.С. Геращенко, В.Ю. Потапова,

 

А.С. Тарасов, М.Б. Никифоров, 2018

 

© ИП Коняхин А.В. (BOOKJET), 2018

Дисперсионный и ковариационный анализ в языке R

Цель занятия: изучить методы дисперсионного и ковариационного анализа и их реализацию с помощью языка R.

В теоретической (лекционной) части описаны понятия дисперсионного и ковариационного анализа, приведены примеры однофакторного дисперсионного анализа для независимых переменных, однофакторного дисперсионного анализа для повторных измерений, многофакторного дисперсионного анализа, однофакторного ковариационного анализа. Практическая часть содержит следующие задания: определение того, сбалансирован ли эксперимент; определение средних значений и стандартных отклонений для групп; выполнение однофакторного дисперсионного анализа, двухфакторного дисперсионного анализа, однофакторного ковариационного анализа.

Занятия по изучению языка R и его применению для решения задач статистической обработки результатов эксперимента могут проводиться в виде лабораторных работ либо практических занятий. Для работы достаточно располагать компьютерным классом с установленным RGui. Язык программирования R, а так же и среда RGui 3.4 являются свободно-распространяемым программным обеспечением, и лицензируется в соответствии с GNU General Public License от 23 июня 2007 года. Полный текст лицензионного соглашения представлен на сайте: https://www.r- project.org/Licenses/GPL.

3

1.Теоретическая часть

1.1.Дисперсионный анализ

На предыдущем занятии [1] рассматривался метод регрессионного анализа, который используется для обнаружения зависимых и независимых переменных, описания их взаимосвязи с помощью уравнения с числовыми коэффициентами и предсказания значений зависимой переменной с использованием полученного уравнения.

Рассмотрим понятие дисперсионного анализа.

Дисперсионный анализ (ANOVA, ANalysis Of VAriance) –

метод в математической статистике для обнаружения зависимостей в экспериментальных данных посредством исследования значимости различий в средних значениях. Позволяет выполнять сравнения для трёх и более групп. В зависимости от типа и количества переменных выделяют следующие виды дисперсионного анализа:

-по количеству независимых переменных: однофакторный и многофакторный;

-по количеству зависимых переменных: одномерный и многомерный;

-с повторными измерениями;

-с постоянными/случайными факторами, а также смешанные

модели.

Для применения дисперсионного анализа необходимо выполнение следующих исходных положений:

-нормальное распределение значений изучаемого признака в генеральной совокупности;

4

-равенство дисперсий в сравниваемых генеральных совокупностях;

-случайный и независимый характер выборки.

Введем некоторые понятия из языка R, необходимые для дальнейшего рассмотрения темы.

В терминологии языка R выделяют следующие виды переменных:

-непрерывные данные могут принимать любое значение в пределах определенного диапазона. Их значения можно упорядочить и понять, насколько одно больше другого. В качестве примера можно привести возраст человека, рост, вес, температуру;

-номинальные данные - это категориальные данные, которые нельзя упорядочить. В качестве примера приведем один из вариантов классификации транзисторов по структуре: биполярный и полевой транзисторы. Если мы обозначим эти типы цифрами 1 и 2 (например, 1– биполярный, 2 – полевой), то всё равно не сможем их сравнить или упорядочить;

-порядковые данные - категориальные данные, которые можно упорядочить, но нельзя оценить количественно.

Категориальные данные (т. е. характеризующие исследуемый процесс или объект качественно и не имеющие количественного выражения) в языке R также называются факторами. В приведённой выше классификации категориальные данные – это номинальные и порядковые.

Дисперсионный анализ исследует, как один или несколько факторов влияют на одну или несколько зависимых переменных. В качестве независимых переменных могут выступать как непрерывные, так и категориальные значения.

5

Модели ANOVA можно анализировать с помощью функций lm (построение линейной модели) или aov (выполнение дисперсионного анализа), так как с функциональной точки зрения ANOVA и регрессия

– два частных случая линейной модели. В данной работе будет применяться функция aov.

Функция aov имеет следующий синтаксис:

aov (формула, data=таблица_данных)

В таблице 1 представлены символы, которые можно использовать в формуле. Зависимая переменная обозначена как y, факторы – как буквы A, B, C.

Таблица 1 – Специальные символы в формулах языка R

Символ

Использование

Пример

 

 

 

 

Разделяет

 

 

зависимые

 

 

переменные в

 

~

левой части

y~A

 

уравнения и

 

 

независимые в

 

 

правой

 

 

 

 

 

Разделяет

 

+

независимые

y~A + B+ C

 

переменные

 

 

 

 

 

Обозначает

 

:

взаимодействие

y~A + B + A:B

между

 

 

 

переменными

 

 

 

 

6

 

Обозначает все

 

*

возможные

y~A*B*C=Y~A+B+C+A:B+B:C+A:B:C

сочетания

 

 

 

переменных

 

 

 

 

 

Обозначает

 

 

сочетание

 

^

определенного

y~(A+B+C)^2=Y~A+B+C+A:B+A:C+B:C

 

числа

 

 

переменных

 

 

 

 

 

Обозначает все

 

.

независимые

y~.=Y~A+B+C

 

переменные

 

 

 

 

Для лучшего понимания рассмотрим дисперсионный анализ на примере, ориентируясь на дальнейшую реализацию метода с помощью языка R.

Пример 1

Предметная область – технологии запоминания информации. Требуется определить, какой метод эффективнее: составление ментальных карт или многократное прослушивание. Группа для исследования состоит из 10 человек.

Рассмотрим однофакторный дисперсионный анализ. На рисунке 1 представлен дизайн эксперимента1 для этого варианта. Под дизайном эксперимента понимается выбор факторов, зависимых и независимых переменных. Пусть мы хотим определить, какой метод

1 Термин «дизайн эксперимента введён Р. Кабаковым в книге «R в действии. Анализ и визуализация данных в программе R» [3]

7

запоминания работает лучше: ментальные карты или многократное прослушивание. Мы случайным образом распределяем 10 человек на две группы. В течение некоторого времени одна группа учит большой объём информации путём построения ментальных карт, а другая – путём многократного прослушивания материала. По окончании этого времени каждую группу просят пройти тест, чтобы оценить уровень запоминания материала.

Рисунок 1 - Дизайн эксперимента для однофакторного дисперсионного анализа

На рисунке 2 приведены исходные данные для реализации примера на языке R. Важно отметить, что представленные в тексте примеры предназначены для демонстрации применения метода, и исходные данные в них придуманы. Переменная person – уникальный идентификатор участника эксперимента. Переменная method представляет собой фактор с двумя уровнями: 1 и 2. Переменная res5weeks – результат тестирования через 5 недель после обучения в процентах.

8

Рисунок 2 – Исходные данные для однофакторного дисперсионного анализа

Чтобы лучше понять свойства данных, визуализируем их. На рисунке 3 представлены значения по группам. Прямоугольными метками показаны средние значения в каждой группе. Средний результат теста для первого метода запоминания составляет 76 процентов, для второго – 92.

Рисунок 3 – Исходные данные и средние значения по группам

9

Из рисунка видно, что и сами данные, и средние значения достаточно близки для двух групп: разница между средними значениями составляет 16 единиц.

Для рассматриваемого случая можно сформулировать следующую нулевую гипотезу: метод запоминания не оказывает существенного влияния на результат теста. Иначе говоря, различия между средними значениями по группам несущественны и вызваны влиянием случайных факторов. Для того, чтобы сделать вывод о том, верна гипотеза или нет, требуется статистический критерий, который количественно характеризует отличие между группами.

Для большей наглядности представим, что имеются другие исходные данные по этому же эксперименту. Они представлены на рисунке 4.

Рисунок 4 – Альтернативный вариант исходных данных

Визуальное представление этих данных и средних значений по группам показано на рисунке 5. Средний результат для первого метода составляет 90.6 процента, для второй –31.4

10

Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]