Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Специальные разделы высшей математики. Теория вероятностей и математическая статистика для инженера-исследователя. Учебное пособие
.pdf
4.3. Критерии согласия 101
1. Находим значения 𝐹𝑥
то есть 𝐹𝑥
(𝑖)
−
𝑖−1
𝑛
и
𝑖
− 𝐹𝑥
𝑛
(𝑖)
− 𝐹
(𝑖)
*
𝑥
(𝑖)
, 𝑖 = 1,𝑛;
и 𝐹𝑥
(𝑖)
− 𝐹
*
𝑥
+ 0, 𝑖 = 1,𝑛,
(𝑖)
2. sup𝑥|𝐹*(𝑥) −𝐹1(𝑥)| равно наибольшему из полученных значений.
Пример 4.6. Дана выборка объема 10: 0,8600; 2,4244; 1,1861; 0,3364; 1,7713;
-0,0596; 0,0132; 2,0581; 1,9927; 0,3717.
Согласуются ли эмпирические данные с гипотезой о том, что генеральная
совокупность подчинена стандартному нормальному закону при уровне доверия
0,95.
Для вычисления статистики критерия заполним таблицу 4.12.
𝑖 𝑥
Таблица 4.12 – Вычисление статистики критерия
(𝑖)
𝐹
𝑥
0
(𝑖)
𝑖−1
𝑛
𝑖
|(3) −(4)| |(5) − (3)| max {(6) , (7)}
𝑛
(1) (2) (3) (4) (5) (6) (7) (8)
1 -0,0596 0,144663 0 0,1 0,144663 0,044660 0,144663
2 0,0132 0,161870 0,1 0,2 0,061870 0,038130 0,061870
3 0,3364 0,253473 0,2 0,3 0,053473 0,046527 0,053473
4 0,3717 0,264904 0,3 0,4 0,035100 0,135096 0,135096
5 0,8600 0,444330 0,4 0,5 0,044330 0,055670 0,055670
6 1,1861 0,573817 0,5 0,6 0,073817 0,026183 0,073817
7 1,7713 0,779736 0,6 0,7 0,179736 0,079740 0,179736
8 1,9927 0,839572 0,7 0,8 0,139572 0,039570 0,139572
9 2,0581 0,854995 0,8 0,9 0,054995 0,045005 0,054995
10 2,4244 0,923135 0,9 1 0,023135 0,077165 0,077165
𝐷
𝑛
0,179736
Из таблицы приложения П.5 находим, что критическое значение
𝐷
10;0,95
= 0,409. Так как 0,179736 < 0,409, то согласно критерию Колмогорова,
гипотеза о том, что выборка получена из нормального распределения с параметрами (0;1) не противоречит эмпирическим данным. Следовательно, можно
считать, что генеральная совокупность подчинена нормальному закону с параметрами (0;1), вероятность ошибки при этом составляет 5%.

102 Глава 4. ПРОВЕРКА СТАТИСТИЧЕСКИХ ГИПОТЕЗ
4.3.4 Критерий Мизеса–Смирнова
Другой мерой уклонения теоретической и эмпирической функций распре-
деления служит величина, предложенная Мизесом,
∞
2
𝜔
=
𝑛
или, если 𝐹0(𝑥) непрерывная функция, эта же величина в равна:
(𝐹*(𝑥) −𝐹0(𝑥)) 𝑑𝐹0(𝑥) ,
−∞
𝜔
𝑛
=
1
12𝑛
2
2
𝑛
+
1
𝑛
𝑖=1
𝐹
*
𝑥
(𝑖)
2𝑖 −1
−
, (4.17)
2𝑛
точный вид распределения которой получил Н. В. Смирнов.
Аналогично критерию Колмогорова известен следующий результат. Пусть
𝐹*(𝑥) — эмпирическая функция распределения результатов 𝑛 независимых на-
блюдений над случайной величиной 𝑋 с непрерывной функцией распределения
𝐹 (𝑥). Тогда при 𝑥 > 0 lim
𝑛→∞
𝑃𝑛𝜔
2
< 𝑥= 𝑀 (𝑥).
𝑛
Функция 𝑀 (𝜆) имеет весьма сложный вид, поэтому ее явный вид здесь
не приводится. Квантили распределения Мизеса табулированы. И если через
𝑤
обозначить квантиль распределения случайной величины 𝑛𝜔
𝛾,𝑛
2
уровня 𝛾,
𝑛
то получим критерий Мизеса–Смирнова, который часто называют критерием
омега–квадрат (𝜔2):
— если 𝑛𝜔
— если 𝑛𝜔
2
𝑛
2
𝑛
< 𝑤
≥ 𝑤
, то гипотеза 𝐻0принимается;
1−𝛼,𝑛
, то гипотеза 𝐻0отвергается.
1−𝛼,𝑛
При больших значениях 𝑛 квантиль 𝑤
можно заменять квантилем пре-
𝛾,𝑛
дельного распределения Мизеса.
Различие в мерах уклонения 𝐷𝑛и 𝜔
𝐷𝑛все точки 𝑥 одинаково важны, в то время как для величины 𝜔
2
состоит в том, что для величины
𝑛
2
важнее
𝑛
наиболее вероятные точки и менее важны маловероятные. Нетрудно видеть,
что из малости 𝐷𝑛следует и малость 𝜔
2
, обратное утверждение, вообще говоря,
𝑛
не верно.
Важное с теоретической точки зрения свойство критериев, основанных на
𝐷𝑛и 𝜔
2
: они состоятельны против любой альтернативной гипотезы 𝐻1: 𝐹 (𝑥) =
𝑛
𝐹0(𝑥). Статистический критерий для проверки гипотезы 𝐻0называют состоя-
тельным против альтернативной гипотезы 𝐻1, если вероятность отвергнуть 𝐻0,

4.3. Критерии согласия 103
когда на самом деле верна 𝐻1, стремится к 1 при неограниченном увеличении
объема наблюдений.
Контрольные вопросы
1. Что называется статистической гипотезой?
2. Чем отличаются простая и сложная статистические гипотезы?
3. Что такое альтернативная или конкурирующая гипотеза?
4. Что называется статистическим критерием?
5. Что такое ошибки первого и второго рода?
6. Что такое критическая область?
7. Какие бывают виды критических областей?
8. Какие законы распределения можно применить для построения критической области в случае проверки гипотезы о равенстве математических ожиданий?
9. Какой закон распределения применяется для построения критической
области в случае проверки гипотезы о равенстве дисперсий?
10. Какова основная идея критерия 𝜒2проверки гипотез о законах распределения?
11. Каковы предпосылки применения критерия согласия Колмогорова?
12. В чем состоят преимущества критерия Колмогорова?
13. В чем состоит принципиальная разница между критерием Колмогорова
и 𝜔2–критерием?

Глава 5
ДИСПЕРСИОННЫЙ
АНАЛИЗ
5.1 Основные понятия дисперсионного анализа
Дисперсионный анализ (в англоязычной аббревиатуре ANOVA — Analysis
of Variance) применяется для изучения влияния одной или нескольких количественных или качественных независимых переменных (факторов) на одну
зависимую количественную переменную (переменную отклика).
Основной целью дисперсионного анализа является исследование значимости различия между средними с помощью сравнения дисперсий. Сущностью
дисперсионного анализа является разложение общей суммы квадратов отклонений и общего числа степеней на части — компоненты, соответствующие структуре эксперимента, и оценка значимости действия и взаимодействия изучаемых
факторов по F-критерию.
Дисперсионный анализ разработан в 20-х годах XX-го века английским математиком и генетиком Рональдом Фишером.
В зависимости от количества факторов дисперсионный анализ может
быть:
— однофакторным;
— двухфакторным;
— многофакторным (количество факторов больше двух, в этом случае, чтобы сократить объем эмпирических данных применяют специальные планы эксперимента);
В зависимости от количества зависимых переменных различают:
— одномерный;
— многомерный дисперсионный анализ.
104

5.1. Основные понятия дисперсионного анализа 105
— дисперсионный анализ с повторными измерениями (для зависимых выборок);
Основные предположения дисперсионного анализа
1. Каждая выборка независима от остальных и извлечена случайным обра-
зом из исследуемой совокупности.
2. Количественные признаки нормально распределенные.
3. Дисперсии всех выборок равны (гомоскедастичность).
При нарушении любого из этих условий необходимо использовать непараметрические методы анализа (например, критерий Краскела-Уоллиса, критерий Фридмана, ковариационный анализ).
Замечание: дисперсионный анализ устойчив к нарушению 3-го условия (равенство дисперсий) при большом числе наблюдений и равенстве количества наблюдений при каждом уровне фактора (объемов выборок).
При дисперсионном анализе определяют удельный вес суммарного воздействия одного или нескольких факторов. Чтобы решить задачу влияния факторов, все они разбиваются на уровни. Существенность влияния фактора определяется путём проверки гипотез:
𝐻0: условные математические ожидания на всех уровнях факторов равны;
𝐻1: хотя бы на двух уровнях факторов средние значения разнятся.
Если влияние фактора не существенно, то несущественна и разница между
уровнями этого фактора, и в ходе дисперсионного анализа нулевая гипотеза
𝐻0не отвергается. Если влияние фактора существенно, то нулевая гипотеза 𝐻
отвергается.
Схема выбора комбинаций уровней факторов, при которых следует делать
0
измерения, называется планом эксперимента. Если перебираются все возможные комбинации уровней факторов, то план эксперимента называют полным
факторным планом. Но при большом количестве факторов число опытов в эксперименте может оказаться достаточно большим, что сопряжено со значительными временными и материальными затратами. Чтобы сократить требуемый
объём выборки, применяют другие специальные планы проведения эксперимента.

106 Глава 5. ДИСПЕРСИОННЫЙ АНАЛИЗ
5.2 Однофакторный дисперсионный анализ
Пусть исследуется влияние некоторого фактора 𝐴, имеющего 𝑘 ≥ 3 уровней 𝐴1, . . . ,𝐴𝑘, на некоторую нормально распределенную величину 𝑋, теоретические дисперсии которой на каждом уровне фактора неизвестны, но, тем не
менее, одинаковы. Анализ основан на расчете 𝐹-статистики (статистика Фишера), которая представляет собой отношение двух дисперсий: межгрупповой
и внутригрупповой. 𝐹 -тест в однофакторном дисперсионном анализе устанавливает значимо ли отличаются средние нескольких независимых выборок. Он
обобщает 𝑡-тест о равенстве средних двух независимых выборок. При наличии
двух уровней результаты обоих тестов дают один и тот же результат.
Предположим, что в нашем распоряжении имеются эмпирические данные
𝑥𝑖𝑗, 𝑖 = 1,𝑘, 𝑗 = 1,𝑛𝑖. Зависимость исследуемой величины 𝑋 от фактора 𝐴
можно обнаружить при сравнении оценок 𝑚
*
математических ожиданий 𝑚
𝑖
на всех уровнях𝑖 = 1,𝑘с оценкой 𝑚*общего математического ожидания 𝑚.
Идея однофакторного дисперсионного анализа состоит в том, что общая сумма
квадратов отклонений раскладывается на сумму двух компонент. Итак
=
𝑘
𝑖=1
𝑘
𝑖=1
𝑛
𝑖
(𝑥𝑖𝑗− 𝑚*)2=
𝑗=1
𝑛
𝑖
(𝑥𝑖𝑗− 𝑚
𝑗=1
+
*
)2+ 2
𝑖
𝑘
𝑖=1
𝑘
𝑖=1
𝑛
𝑖
𝑗=1
𝑛
𝑗=1
𝑘
𝑖=1
(𝑚
𝑖
((𝑥𝑖𝑗− 𝑚
𝑛
𝑖
(𝑥𝑖𝑗− 𝑚
𝑗=1
*
− 𝑚*)2.
𝑖
*
) −(𝑚
𝑖
*
𝑖
*
− 𝑚*))2=
𝑖
*
) (𝑚
𝑖
− 𝑚*) +
.
Учитывая, что второе слагаемое в последнем равенстве равно нулю (в силу
независимости наблюдений случайной величины 𝑋), получим:
SST = SSB + SSW , (5.1)
𝑖
называемое основным тождеством однофакторного дисперсионного
анализа.
В равенстве (5.1) обозначено:
— 𝑆𝑆𝑇 =
𝑘
𝑖=1
𝑛
𝑖
(𝑥𝑖𝑗− 𝑚*)2— общая сумма квадратов отклонений
𝑗=1
(Sum Square Total);
— 𝑆𝑆𝐵 =
𝑘
𝑖=1
𝑛
𝑖
𝑗=1
*
(𝑚
− 𝑚*)2— межгрупповая сумма квадратов откло-
𝑖
нений (Sum Square Between Groups), которая характеризует влияние фактора
𝐴 на исследуемую величину. Ее еще называют рассеиванием по фактору;

5.2. Однофакторный дисперсионный анализ 107
— 𝑆𝑆𝑊 =
𝑘
𝑖=1
𝑛
𝑖
(𝑥𝑖𝑗− 𝑚
𝑗=1
*
)2— внутригрупповая сумма квадратов от-
𝑖
клонений (Sum Square Within Groups), характеризует рассеивание случайной
величины 𝑋 внутри уровней фактора. Эту сумму также называют остаточным
рассеиванием, так как эта компонента связана с влиянием на величину X некоторых других факторов.
Процедура выполнения однофакторного дисперсионного анализа.
1 этап. Выдвижение гипотезы.
Выдвигается нулевая гипотеза 𝐻0: 𝑚1= . . . = 𝑚𝑘= 𝑚𝑥,
Против альтернативы 𝐻1: хотя бы для одной пары 𝑚𝑖= 𝑚𝑗.
2 этап. Сбор данных и подготовка их для анализа. Для этого заполняют
таблицу 5.1.
Таблица 5.1 – Данные для дисперсионного анализа
Уровень
Номер наблюдения Объем Сред-
Диспер-
Общее
фактора
𝐴
1
𝐴
2
1 . . . 𝑛
𝑥
𝑥
11
21
. . . 𝑥
. . . 𝑥
1
1𝑛
2𝑛
1
1
. . . 𝑛
. . . 𝑥
𝑘
2𝑛
𝑘
. . . 𝑛
. . . 𝑥
2
2𝑛
𝑛
1
𝑛
2
2
нее
𝑚
𝑚
сии
*
1
*
2
2
𝑆
1
2
𝑆
2
среднее
*
𝑚
𝑥
. . . . . . . . . . . . . . . . . . . . . . . . . . . . . .
𝐴
𝑘
𝑥
𝑘1
. . . 𝑥
𝑘𝑛
1
. . . 𝑥
𝑘𝑛
𝑛
𝑘
𝑘
𝑚
Предварительно вычислим оценки для средних: общего 𝑚
нях факторов 𝑚
*
, 𝑖 = 1,𝑘.
𝑖
*
𝑚
=
𝑖
𝑛
𝑛
𝑖
1
𝑥𝑖𝑗, 𝑚
𝑖
𝑗=1
1
*
=
𝑥
𝑛
𝑘
𝑖=1
𝑛
𝑖
𝑗=1
𝑥𝑖𝑗=
1
𝑘
*
𝑘
𝑘
𝑖=1
𝑆
𝑛𝑖𝑚
2
𝑘
*
и на всех уров-
𝑥
*
𝑖
(5.2)
3 этап. Проверка однородности дисперсий.
При сравнении дисперсий нескольких (больше двух) групп применяется
критерий Кохрена (Cochren) в случае, если количество наблюдений во всех
группах одинаково, т. е. 𝑛𝑖= 𝑙.
Итак, его суть состоит в том, что выдвигается основная гипотеза о стати-
стической неразличимости всех дисперсий
𝐻0: 𝜎
2
1
= 𝜎
2
= . . . = 𝜎
2
2
= 𝜎2;
𝑘
Альтернативная гипотеза состоит в том, что основная гипотеза не выпол-
няется,

108 Глава 5. ДИСПЕРСИОННЫЙ АНАЛИЗ
𝐻1: 𝜎
2
= 𝜎2, хотя бы для одного 𝑖.
𝑖
В качестве статистики критерия используют случайную величину:
𝐺 =
max(𝑆
𝑆
2
, . . . ,𝑆
1
2
+ . . . + 𝑆
1
По таблице П.6 находят критическое значение 𝐺
2
)
𝑘
. (5.3)
2
𝑘
= 𝐺𝛼(𝑙 − 1,𝑘).
крит
Правило принятия решения имеет вид:
— если 𝐺 < 𝐺
— если 𝐺 > 𝐺
, то гипотеза 𝐻0принимается;
крит
, то гипотеза 𝐻0отвергается.
крит
Критерий Бартлетта (Bartlett) применяется для сравнения 𝑘 (𝑘 > 2)
нескольких дисперсий по выборкам различного объема. Главное условие применения критерия согласия Бартлетта — объем выборок должен быть не менее 3.
При этом, некоторые объемы могут быть одинаковыми; если же на всех уровнях
количество наблюдений одинаково, то следует использовать критерий Кохрена.
Итак, выдвигается основная гипотеза о статистической неразличимости
всех дисперсий
𝐻0: 𝜎
2
1
= 𝜎
2
= . . . = 𝜎
2
2
= 𝜎2;
𝑘
Альтернативная гипотеза, по-прежнему, состоит в том, что основная гипо-
теза не выполняется,
𝐻1: 𝜎
Обозначим 𝑛 =
2
= 𝜎2, хотя бы для одного 𝑖.
𝑖
𝑘
𝑛𝑖— общий объем выборки, 𝑆
𝑖=1
=
1
𝑛−𝑘
2
𝑝
𝑘
(𝑛𝑖− 1) 𝑆
𝑖=1
оценка общей дисперсии.
В качестве статистики критерия используют случайную величину:
𝑀
𝐵 =
, (5.4)
𝐶
где
𝑘
𝑀 = (𝑛 − 𝑘) ln 𝑆
1
𝐶 = 1 +
3 (𝑘 − 1)
2
𝑝
−
𝑘
𝑖=1
(𝑛𝑖− 1) ln 𝑆
𝑖=1
1
𝑛𝑖− 1
−
𝑛 −𝑘
2
, (5.5)
𝑖
1
. (5.6)
2
—
𝑖
Бартлетт установил, что статистика (5.4) при условии справедливости нулевой гипотезы и, если все 𝑛𝑖> 3, имеет асимптотически 𝜒2-распределение с
(𝑘 − 1) степенями свободы.

5.2. Однофакторный дисперсионный анализ 109
Если случайная величина нормально распределена, то распределение статистики (5.4) практически не зависит от объема выборки, т. е. результаты тестирования остаются адекватными при малых объемах выборок. Но распределение
статистики (5.4) очень чувствительно к отклонению от нормального закона.
Таким образом, критическое значение критерия 𝜒
2
(𝑘 − 1) находят, как
1−𝛼
квантиль 𝜒2-распределения с (𝑘 − 1) степенями свободы уровня 1 −𝛼.
Правило принятия решения имеет вид:
— если 𝜒2< 𝜒
— если 𝜒2≥ 𝜒
2
(𝑘 − 1), то гипотеза 𝐻0принимается;
1−𝛼
2
(𝑘 − 1), то гипотеза 𝐻0отвергается.
1−𝛼
Если гипотеза 𝐻0принимается, то делается вывод об однородности дисперсий на различных уровнях и продолжают проведение дисперсионного анализа.
В противном случае следует повторить эксперимент, увеличив при этом число
наблюдений для каждого уровня фактора или улучшив чистоту эксперимента.
4 этап. Для изучения различий между зависимыми переменными проводится разложение полной дисперсии согласно (5.1):
На практике суммы квадратов отклонений, входящих в (5.1), вычисляют
по следующим формулам.
Общая сумма квадратов отклонений
𝑛
𝑘
𝑆𝑆𝑇 =
𝑖=1
𝑖
𝑗=1
2
𝑥
− 𝑛 (𝑚*)2, (5.7)
𝑖𝑗
которая имеет 𝐷𝐹𝑇 = 𝑛 − 1 степеней свободы (Degrees of Freedom), следовательно, общий средний квадрат (Mean Square) или общая дисперсия равна
𝑀𝑆𝑇 =
𝑆𝑆𝑇
𝐷𝐹 𝑇
=
1
𝑛 −1
𝑘
𝑖=1
𝑛
𝑖
𝑗=1
2
𝑥
− 𝑛 (𝑚*)
𝑖𝑗
2
. (5.8)
Межгрупповая сумма квадратов отклонений
𝑘
𝑆𝑆𝐵 =
𝑛𝑖(𝑚
𝑖=1
*
)2− 𝑛 (𝑚*)2, (5.9)
𝑖
которая имеет 𝐷𝐹𝐵 = 𝑘 − 1 степеней свободы (Degrees of Freedom), следовательно, средний квадрат (Mean Square) или межгрупповая дисперсия равна
𝑀𝑆𝑇 =
𝑆𝑆𝐵
𝐷𝐹 𝐵
=
1
𝑘 − 1
𝑘
𝑖=1
𝑛𝑖(𝑚
*
)2− 𝑛 (𝑚*)
𝑖
2
. (5.10)

110 Глава 5. ДИСПЕРСИОННЫЙ АНАЛИЗ
Внутригрупповая сумма квадратов отклонений
𝑆𝑆𝑊 = 𝑆𝑆𝑇 − 𝑆𝑆𝐵, (5.11)
которая имеет 𝐷𝐹𝑊 = 𝑛−𝑘 степеней свободы, следовательно, средний квадрат
или внутригрупповая дисперсия равна
𝑀𝑆𝑊 =
𝑆𝑆𝑊
𝐹 𝐷𝑊
=
𝑆𝑆𝑊
. (5.12)
𝑛 −𝑘
5 этап. Рассчет значения статистики критерия производится по формуле
𝑀𝑆𝐵
𝐹 =
, (5.13)
𝑀𝑆𝑊
которая, при условии справедливости нулевой гипотезы, имеет распределение
Фишера с (𝐹 𝐷𝐵,𝐹𝐷𝑊 ) = (𝑘 − 1,𝑛 −𝑘) степенями свободы.
6 этап. Нахождение критического значения по таблице распределения Фишера, как квантиля 𝐹
(𝑘 − 1,𝑛 − 𝑘) 𝐹 -распределения с (𝑘 −1,𝑛 − 𝑘) степе-
1−𝛼
нями свободы уровня 1 − 𝛼.
7 этап. Правило принятия решения
— если 𝐹 < 𝐹
— если 𝐹 ≥ 𝐹
(𝑘 − 1,𝑛 − 𝑘), то гипотеза 𝐻0принимается;
1−𝛼
(𝑘 − 1,𝑛 − 𝑘), то гипотеза 𝐻0отвергается.
1−𝛼
Если гипотезу 𝐻0принимают, то говорят, что фактор не оказывает существенного влияния на признак 𝑋. Отклонение же гипотезы 𝐻0свидетельствует
о существенном влиянии фактора на 𝑋.
Обычно результаты принято представлять в виде ANOVA таблицы 5.2.
Таблица 5.2 – ANOVA таблица
Источник
вариации
Между
группа-
ми
Внутри
групп
Общая 𝑆𝑆𝑇 𝐷𝐹 𝑇 𝑀 𝑆𝑇
Сумма
квадра-
тов
𝑆𝑆𝐵 𝐷𝐹 𝐵 𝑀𝑆𝐵 𝐹 =
𝑆𝑆𝑊 𝐷𝐹 𝑊 𝑀𝑆𝑊
Количество
степеней
свободы
Средний
квадрат
𝐹 -статистика Критическое зна-
𝑀𝑆𝐵
𝑀𝑆𝑊
чение
𝐹
(𝑛 − 1,𝑛 −𝑘)
1−𝛼
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
