Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Компьютерная обработка статистических данных. Учебное пособие
.pdf
при помощи функции FРАСПОБР(вероятность;
степени_свободы1;степени_свободы2), где вероятность –
уровень значимости.
Кроме того, для определения вероятности выполнения
гипотезы о равенстве дисперсий может быть использована
функция ФТЕСТ(массив1;массив2), которая возвращает
одностороннюю (для простой альтернативной гипотезы)
вероятность того, что дисперсии аргументов массив1 и
массив2 различаются несущественно.
Критерий Фишера можно применять и для
логнормального распределения, проверяя гипотезу о
равенстве дисперсий логарифмов значений признака.
Непараметрическим аналогом критерия Фишера является
критерий Сиджела-Тьюки. Он применим для распределений
любого вида и не чувствителен к аномальным значениям,
успешно применяется к выборкам малого объема.
Применение критерия Сиджела-Тьюки требует равенства
центров распределения сравниваемых совокупностей. В
случае несоблюдения этого условия исходные данные по
каждой выборке необходимо центрировать относительно их
медиан, то есть сравнивать не сами значения изучаемых
параметров, а их отклонения от медиан.
Значения сравниваемых выборочных совокупностей
объединяются в общую выборку и записываются в виде
вариационного ряда в порядке их возрастания:
х1<х2<...<х
, где n=n1+n2 – объем общей выборки; n1 –объем
n-1
меньшей выборки. Члены вариационного ряда, в свою
очередь, ранжируются следующим образом: ранг 1
приписывается наименьшему члену ряда х1, ранг 2 –
наибольшему, то есть хN; ранг 3 – значению х2 и т.д. Если n
нечетно, то медианному значению ранг не присваивается.
Далее рассчитывается значение критерия, равное сумме
41

рангов, присвоенных членам меньшей выборки:
1
1
n
i
i
Wd
В случае равенства дисперсий эта величина будет обладать
всеми свойствами рассмотренного выше критерия
Вилкоксона (W). Далее находят критические значения W1 и
W2 по описанной выше процедуре и сравнивают с ними
рассчитанное значение W.
Пример 3.4. Проверить гипотезу о равенстве дисперсий
содержания Na2O во второй гранитной интрузии при
обследовании различными методами (табл. 3.1. и 3.3) при
помощи критерия Сиджела-Тьюки.
Решение
Внесем данные из таблиц 3.1 и 3.3 в столбец А, а
индикатор выборки (1 и 2) – в столбец В.
Вычислим медианальные значения выборок в ячейках С2
и С5 при помощи функции МЕДИАНА. В столбце D
вычислим центрированные значения: введем в ячейку D2
формулу: =А2-С$2 и растянем результат до ячейки D81.
Аналогично, в ячейку D82 введем формулу =А82-С$5 и
растянем результат до ячейки D181.
Выделим полученный диапазон D2:D181 и скопируем в
столбец Е, использовав опцию «специальная вставка» «значения».
В столбец F скопируем индикаторы выборок из столбца
В. Теперь выделим диапазон E2:F181 (начиная с ячейки E2) и
отсортируем данные по возрастанию.
Присвоим ранги отсортированным значениям: в ячейке
G2 введем 1, в ячейке G3 введем 3 и выполним
автозаполнение, выделив эти ячейки и «растянув» их до
ячейки G81, в которую попадет значение 159. Затем в ячейке
G82введем 160, в ячейке G83 – 158 и выполним
автозаполнение до ячейки G161, в которой окажется
значение 2.
42

Вычислим значение критерия Сиджела-Тьюки, введя в
ячейке Н2 формулу =СУММЕСЛИ(F2:F161;1;G2:G161)
Критические значения W1 и W2 вычислим по формулам
для критерия Вилкоксона без совпадающих значений.
Результаты вычислений будут выглядеть так:
Рис.3.5. Применение критерия Сиджела-Тьюки
Поскольку значение критерия лежит между
критическими, нет оснований считать различия дисперсий
достоверными.
Задание 3
3.1. Проверить соответствие выборочных данных
эмпирического распределения содержания К2O в
гранитных интрузиях (табл. 3.1, 3.2, 3.3) нормальному
закону распределения.
3.2. Проверить гипотезу о равенстве дисперсий данных
геохимических проб по содержанию К2О: а) в первой и
второй гранитных интрузиях (табл. 3.1 и 3.2); б) в первой
гранитной интрузии при обследовании разными
методами (табл. 3.1 и 3.3). .
3.3. Исходя из результатов задач 1 и 2 выбрать подходящий
метод и проверить. достоверны ли отличия при
сравнении данных геохимических проб по содержанию
К2O: а) в первой и второй интрузиях (таблицы 3.1.и 3.2);
б) в первой гранитной интрузии при обследовании
разными методами (табл. 3.1 и 3.3).
43

4. Дисперсионный анализ
Критерии различия (Стьюдента, Вилкоксона и т.п.)
позволяют сравнить среднее для двух выборок. Если же
требуется сравнить три или более выборки, использовать их
не следует, так как при попарном сравнении выборок при
помощи критериев различия накапливается
неконтролируемая ошибка. Поэтому для сравнения средних
более чем в двух выборках используют специально
разработанный метод, называемый дисперсионным
анализом.
При помощи дисперсионного анализа обычно решают
вопрос о влиянии одного (однофакторный дисперсионный
анализ) или нескольких (многофакторный дисперсионный
анализ) факторов на значение изучаемо признака. Например,
типа корма на удой, региона проживания на
продолжительность жизни, способа отбора проб на их
достоверность и представительность и т.п. При этом
рассматривается нулевая гипотеза: фактор не влияет на
признак, средние выборок принадлежат одной генеральной
совокупности. Если нулевая гипотеза отвергается при уровне
значимости , то с доверительной вероятностью 1- можно
сделать вывод, что фактор влияет на признак.
В случае, если есть основания считать выборки
нормально распределенными, а их дисперсии одинаковыми,
выполняется собственно дисперсионный анализ,
использующий F-критерий Фишера (параметрический).
Следует отметить, что F-критерий по выборкам достаточно
большого объем устойчив как к умеренным отклонениям от
нормального закона, так и к умеренному различию в
дисперсиях. Если возможность применения F-критерия все
же вызывает сомнения, следует использовать
непараметрические аналоги дисперсионного анализа,
например критерий Краскала-Уоллиса.
44

Однофакторный дисперсионный анализ
Номер
измерения
Уровень фактора
A1
A2 … Ap
1
x11
x12 … x1p 2 x21
x22 … x2p … … … … … q
xq1
xq2 … xqp
Групповые
средние
1
гр
x
2
гр
x
…
p
гр
x
x
2
11
()
pq
общ ij
ji
C x x
2
1
()
p
факт гр j
j
C q x x
ост общ факт
C СС
При равномерном однофакторном дисперсионном
анализе число замеров значений изучаемого признака на
разных уровнях (при разных значениях) факторного
признака одинаковое. Данные замеров сводятся в таблицу:
Таблица 4.1. Данные для равномерного однофакторного дисперсионного
анализа
По этим данным рассчитываются следующие
статистики:
1) Общая сумма квадратов отклонений наблюдаемых
значений признака от общей средней
:
;
факторная сумма квадратов отклонений групповых средних
от общей средней, характеризующая рассеяние между
группами:
остаточная сумма квадратов отклонений наблюдаемых
значений от своей групповой средней, характеризующая
рассеяние внутри групп:
2) общая, факторная и остаточная дисперсии:
;
.
45

2
( 1)
общ общ
S C pq
;
2
( 1)
факт факт
SCp
2
( 1)
ост ост
S C p q
22
факт ост
F S S
2
1 2 1 2
... ( ... )
общ p p
C P P P R R R n
2
12
11
, , ...
jj
qq
j ij j ij p
ii
P x R x n q q q
2 2 2
1 1 1
( ) ... ( ) ( ... )
факт p p p
C R q R q R R n
ост общ факт
C СС
2
( 1)
общ общ
S C n
2
( 1)
факт факт
SCp
2
()
ост ост
S C n p
22
факт ост
F S S
;
;
3) значение критерия Фишера:
.
Значение критерия Фишера сравнивается с критическим
для заданного уровня значимости α и числа степеней
свободы k1 = p – 1 и k2 = p(q – 1). Если F>Fкр, то гипотеза об
отсутствии влияния фактора на признак отвергается с
доверительной вероятностью 1- α.
При неравномерном однофакторном дисперсионном
анализе число измерений изучаемого признака на разных
уровнях факторного признака различно. Обозначим qj –
количество измерений на уровне Aj. Тогда:
1)
где
.
2)
;
.
3)
; k1 = p – 1 и k2 = n – p.
В таблицах Excel для проведения однофакторного
равномерного или неравномерного дисперсионного анализа
организуются вычисления по приведенным формулам с
использованием функций СРЗНАЧ, СУММ, СУММКВ.
Критическое значение критерия Фишера вычисляется при
помощи функции FРАСПОБР.
46
,
;
;
;

Пример 4.1. Проверить, существенны ли различия
№
Уровни замеров
1 2 3
1
1,17
2,28
1,80
2
1,52
2,46
2,38
3
1,90
0,88
2,62 4 1,76
2,03
2,91
5
1,54
1,22
1,60
6
0,63
2,29
2,83
7
2,30
1,80
2,13
8
1,32
1,79
2,06
9
0,94
1,61
2,23
10
1,15
2,30
3,06
11
0,75
2,60
1,86
12
2,49
1,76
1,92
13
2,14
2,14
2,16
14
1,62
2,73
2,27
15
1,40
2
ii
Rq
содержания загрязняющего вещества на трех уровнях
(глубинах взятия проб)
Решение. Откроем таблицы Excel и внесем данные из
таблицы. Поскольку число измерений на разных уровнях
неодинаково, требуется выполнить неравномерный
дисперсионный анализ.
В строке 17 укажем число измерений на уровнях. Общее
число измерений n вычислим, просуммировав результаты в
ячейке Е17 (функция СУММ).
В строке 18 вычислим величины Pi при помощи функции
СУММКВ и в ячейке Е18 их сумму. В строке 19 вычислим
величины Ri при помощи функции СУММ и в ячейке Е19 –
их сумму. В строке 20 вычислим величины
ячейке Е20 – их сумму.
В ячейке F2 вычислим значение С
, введя формулу
общ
=E18-E19^2/E17.
47
и в

В ячейке G2 – значении С
2
факт
S
2
ост
S
И в ячейке Н2 – значение С
: =E20-E19^2/E17.
факт
: =F2-G2.
ост:
Далее, в ячейке G5 вычисляем значение
, учитывая,
что р=3, и в ячейке Н5 – значение
, введя формулу
=H2/(E17-3).
Значение F-статистики вычислим в ячейке G8. Для
вычисления критического значения выберем уровень
значимости и внесем его в ячейку Н8. Критическое значение
F-критерия в ячейке I8 вычисляем (с учетом того, что р=3),
введя формулу
=FРАСПОБР(H8;2;E17-3).
Итог вычислений выглядит следующим образом (рис.4.1):
Рис.4.1. Применение неравномерного дисперсионного анализа.
Поскольку F>Fкр, делаем вывод, что различия на разных
уровнях существенные.
48

Следует отметить, однако, что уверенности в
j
i
d
1
i
q
j
i
i
j
Rd
22
11
12 ( ( 1)) ... 3( 1)
pp
H n n R q R q n
3
*
1 ( )
H
H
T n n
3
1
()
k
ii
i
T t t
обоснованности применения параметрического
дисперсионного анализа у нас нет, поскольку нет оснований
считать данные в выборках нормально распределенными, а
объем выборок не позволяет проверить гипотезу о
соответствии данных нормальному закону.
Однофакторный непараметрический дисперсионный
анализ
Непараметрическим аналогом однофакторного
дисперсионного анализа является критерий КраскалаУоллиса (в русскоязычной литературе его также называют
критерием Краскела-Уоллеса, Крускала-Уоллеса). Этот
критерий является многовыборочным обобщением критерия
Уилкоксона (или Манна-Уитни).
Для применения критерия Краскала-Уоллиса следует
проранжировать совмещенную выборку (из всех измерений
при различных уровнях фактора); обозначим ранг i-го
элемента выборки на j-м уровне фактора
суммы рангов R1,…,Rp для каждого уровня фактора:
При отсутствии связанных рангов статистика критерия
Краскала-Уоллиса имеет вид:
При наличии связанных рангов используют
модифицированную статистику:
, где ti – число элементов в i-й связке,
k – число связок,
Нулевая гипотеза (об отсутствии влияния фактора на
49
. Далее находят

признак) отклоняется, если рассчитанное значение критерия
превышает критическое H для заданного уровня
значимости. Для малых выборок (p5, qi8) критические
значения критерия Краскала-Уоллиса определяются по
таблицам. При достаточно большом объеме выборки
критическое значение определяется исходя из 2
распределения с p-1 степенями свободы. При организации
вычислений в Excel для этого применяют функцию
ХИ2ОБР(;р-1).
Пример 4.2. Решить задачу 4.1. при помощи критерия
Краскала-Уоллиса.
Решение. На новом листе Excel внесем в столбец А
совмещенную выборку данных из таблицы 4.1, в столбце В
для каждого данного укажем, к какому уровню факторного
признака оно относится. Проведем предварительные расчеты
как для критерия Вилкоксона (ранги, длины связок t,
согласованные ранги, величины t2-1, которые затем сложим в
ячейке G2, вычисляя величину Т. Результат вычислений
представлен на рис.4.2:
Рис.4.2. Применение критерия Краскала-Уоллиса, начало.
Вычислим в ячейке I2 величину R1 – сумму согласованных
рангов данных, относящихся к 1 уровню факторного
признака: =СУММЕСЛИ($B2:$B44;1;$E2:$E44)
В этой формуле массивы зафиксированы для того, чтобы
50
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
