Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Статистическая обработка экспериментальных данных. Дисперсионный и ковариационный анализы в языке R. Учебное пособие

.pdf
Скачиваний:
0
Добавлен:
11.08.2026
Размер:
629 Кб
Скачать

Рисунок 5 – Исходные данные и средние значения по группам

Из рисунка 5 видно, что в данном случае экспериментальные группы сильнее отличаются по результатам теста. Здесь мы наблюдаем, что разброс между средними значениями по группам составляет 59.2 и в целом превышает разброс значений внутри каждой группы, в то время как на рисунке 3 ситуация прямо противоположная.

Таким образом, можно сформулировать основную идею дисперсионного анализа: для того, чтобы оценить различия между группами, нужно сравнить разброс средних значений между группами с разбросом значений внутри групп.

Существует два способа оценки дисперсии генеральной совокупности:

-вычислить дисперсию для каждой группы;

-вычислить разброс групповых средних значений.

Если оба варианта дают близкие результаты, мы не можем отвергнуть нулевую гипотезу. Иначе можно принять альтернативную

11

гипотезу: метод запоминания оказывает значимое влияние на результаты тестирования.

Введем формулы для вычисления дисперсии. Пусть

x

ij

 

наблюдение j в группе i,

xij

– среднее значение в группе i,

 

– общее

X

среднее значение по всем наблюдениям. Тогда каждое наблюдение можно описать формулой (1):

 

xij

= X + (xi

X ) + (xij xi ) ,

(1)

где: (xi X )

отклонение среднего значения в группе от общего

среднего значения, (xij xi )

– отклонение наблюдений от среднего

значения группы, в которую они входят.

Разброс наблюдений внутри группы обозначим как SSW (W – от англ. within – внутри) и рассчитаем по формуле (2):

SSW = (xij

i j

 

x

i

 

)

2

 

,

(2)

где: i – номер группы, j – номер наблюдения.

Разброс между средними значениями по группам обозначим как SSB (B – от англ. between – между) и рассчитаем по формуле (3):

SS B

= (xi

 

i j

 

X )

2

 

.

(3)

Нормализовав полученные величины по соответствующим степеням свободы (нормализация не рассматривается в рамках данной лабораторной работы), получим внутригрупповую и межгрупповую дисперсии (4), (5).

MSW = SSW /(N k),

(4)

12

MS B = SSB /(k 1)

,

(5)

где: N – общее число наблюдений, k – количество групп. MS означает средние квадраты (mean squares), т.е. усреднённые суммы квадратов отклонений.

Т.к. проведена нормализация по степеням свободы,

SSW

и

SSB

являются сравнимыми величинами. Сравнение выполняется с помощью критерия Фишера (F-критерия):

F = MS B / MSW .

(6)

Чем ближе значение F к 1, тем меньше отличаются внутригрупповые и межгрупповые дисперсии, т.е. тем меньше оснований отклонить исходную нулевую гипотезу (о том, что метод запоминания не влияет на результат теста). Обычно гипотеза отклоняется при достижении определенного порога, который определяется по распределению Фишера и уровню значимости. Далее под термином «F-тест» понимается проверка с помощью формулы (6).

При таком дизайне эксперимента способ запоминания (многократное прослушивание или ментальные карты) – это межгрупповой фактор с двумя уровнями. Он называется межгрупповым, так как каждый человек может быть отнесён только к одной из двух групп. Результат теста – это зависимая переменная, тип запоминания – независимая переменная.

Так как в каждой группе одинаковое количество испытуемых, это сбалансированный дизайн эксперимента.

13

Реализация однофакторного дисперсионного анализа для независимых переменных на языке R.

mem1=read.table("memory1.txt",header=TRUE)

attach(mem1)

aggregate(res5weeks, by=list(method), FUN=mean)

aggregate(res5weeks, by=list(method), FUN=sd)

fit<-aov(res5weeks~method, data=mem1)

summary(fit)

Команда read.table осуществляет считывание информации в переменную mem из внешнего файла. Функция attach добавляет данные в пути поиска языка R, так что становится возможным обращаться к столбцам таблицы mem по их именам. Функция aggregate разбивает столбец результатов тестирования через 5 недель (res5weeks) на группы в зависимости от применяемого метода (method), а затем применяет к каждой группе функцию FUN. В первом случае FUN=mean, что означает вычисление средних значений по группам. Во втором FUN=sd – вычисление стандартных (среднеквадратических) отклонений. На рисунке 6 приведены результаты выполнения этих команд.

а) б)

Рисунок 6 – а) среднее значение по группам б) стандартное отклонение по группам

14

Функция aov выполняет однофакторный дисперсионный анализ данных. С помощью функции summary осуществляется вывод основной информации о полученной модели. Он представлен на рисунке 7.

Рисунок 7 – Результат вывода функции summary(fit)

Рассмотрим полученный результат. Строка method соответствует источнику дисперсии в данных – выбранному нами влияющему фактору, т.е. способу запоминания. Строка Residuals описывает внутригрупповую дисперсию (она также называется шумовой или остаточной, поскольку не связана с влиянием экспериментального фактора). Столбец Df содержит значения степеней свободы, столбец Sum Sq – значения SSB и SSW, столбец Mean Sq – значения MSB и MSW. Столбец F value – значение F- критерия. Столбец Pr(>F) – вероятность получить значение F- критерия, равное или больше полученного значения, при условии, что нулевая гипотеза верна. В данном случае эта вероятность превышает выбранный нами 5% уровень значимости (0.111 > 0.05). Напомним определение: уровень значимости – допустимая вероятность ошибки первого рода (ложноположительного решения), то есть вероятность отклонить нулевую гипотезу, когда на самом деле она верна. Следовательно, в данном случае мы с высокой степенью уверенности можем принять нулевую гипотезу о том, что метод запоминания не влияет на результат теста.

15

Рассмотренный пример описывает однофакторный дисперсионный анализ для независимых переменных. В нем используется только межгрупповой фактор – метод запоминания.

Пример 2

Опишем теперь дизайн, соответствующий однофакторному дисперсионному анализу для зависимых наблюдений, который иначе называется дисперсионным анализом для повторных измерений (рисунок 8).

Рисунок 8 – Дизайн эксперимента, соответствующий однофакторному дисперсионному анализу для зависимых наблюдений

Здесь время является внутригрупповым фактором с двумя уровнями, поскольку измерения проводятся дважды для всех участников группы. В качестве независимой переменной выступает результат тестирования, в качестве зависимой – время.

На рисунке 9 представлены исходные данные для приведенного дизайна эксперимента (в два столбца).

16

Рисунок 9 – Исходные данные для однофакторного дисперсионного анализа для повторных измерений

Реализация однофакторного дисперсионного анализа для повторных измерений на языке R.

mem2=read.table("memory2.txt",header=TRUE)

attach(mem2)

aggregate(res, by=list(time), FUN=mean)

aggregate(res, by=list(time), FUN=sd)

fit<-aov(res~time+Error(person/time), data=mem2)

summary(fit)

Все команды, используемые в коде, уже были описаны в примере 1. Команда aov отличается синтаксисом записи зависимых и независимых переменных (см. таблицу 2 в конце методических указаний). Результаты вывода команд aggregate представлены на рисунке 10 , результат вывода команды summary(fit) – на рисунке 11.

17

а)

 

б)

 

 

Рисунок 10 – а) среднее значение по группам;

 

б) стандартное отклонение по группам

Рисунок 11 - Результат вывода функции summary(fit)

В данном случае из рисунка 11 видно, что Pr(>F)=0.00713<0.05, что означает наличие статистически значимого влияния времени, через которое проводится тестирование, на результат.

Пример 3

Если исследователя интересует разница между методами запоминания и изменением качества запоминания с течением времени,

можно применить модель многофакторного дисперсионного анализа с повторными измерениями. В данном случае нужно разделить пациентов по двум равным группам, каждая из которых будет изучать одну и ту же информацию различными методами, и проверить уровень их знаний сначала через 5 недель, потом через 6

18

месяцев. Соответствующий дизайн эксперимента представлен на рисунке 12.

Рисунок 12 – Дизайн эксперимента, соответствующий двухфакторному дисперсионному анализу

\

В представленном дизайне эксперимента используются два фактора: время и способ запоминания. Это позволяет изучить влияние на результат:

-способа запоминания, усреднённого по времени;

-времени, усреднённого по способу запоминания;

-взаимодействие между этими двумя факторами.

Два первых варианта называются главными эффектами, третий – эффектом взаимодействия. Под взаимодействием в данном случае понимается различное поведение зависимой переменной при разных сочетаниях факторов.

Кроме того, в данном случае дизайн эксперимента включает как межгрупповой фактор (время), так и внутригрупповой (способ запоминания), и поэтому он также называется смешанной моделью дисперсионного анализа. Таким образом, полное название эксперимента – двухфакторный дисперсионный анализ со смешанными эффектами. Он также является полнофакторным,

19

поскольку в нем появляются все возможные сочетания уровней факторов.

Здесь проводится три F-теста. Достоверный результат теста для способа запоминания означает, что разные методы по-разному влияют на уровень запомненной информации. Достоверный результат для времени показывает, что уровень запомненной информации отличается спустя 5 недель и 6 месяцев. Достоверный результат для взаимодействия показывает, что разные методы запоминания поразному влияют на уровень запомненной информации по прошествии времени.

На рисунке 13 представлены исходные данные для описанного дизайна эксперимента. Столбец person – уникальный id участника эксперимента, method – метод запоминания, time – время (5w – 5 недель, 6m – 6 месяцев), res – результат теста. Зависимая переменная – res, независимые – method и time.

Рисунок 13 – Исходные данные для двухфакторного дисперсионного анализа для повторных измерений

20

Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]