Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Специальные разделы высшей математики. Теория вероятностей и математическая статистика для инженера-исследователя. Учебное пособие

.pdf
Скачиваний:
0
Добавлен:
07.09.2026
Размер:
1 Мб
Скачать
☆
4.3. Критерии согласия 101
1. Находим значения 𝐹𝑥
то есть 𝐹𝑥
(𝑖)
−
𝑖−1
𝑛
и
𝑖
− 𝐹𝑥
𝑛
(𝑖)
− 𝐹
(𝑖)
*
𝑥
(𝑖)
, 𝑖 = 1,𝑛;
и 𝐹𝑥
(𝑖)
− 𝐹
*
𝑥
+ 0, 𝑖 = 1,𝑛,
(𝑖)
2. sup𝑥|𝐹*(𝑥) −𝐹1(𝑥)| равно наибольшему из полученных значений.
Пример 4.6. Дана выборка объема 10: 0,8600; 2,4244; 1,1861; 0,3364; 1,7713;
-0,0596; 0,0132; 2,0581; 1,9927; 0,3717.
Согласуются ли эмпирические данные с гипотезой о том, что генеральная совокупность подчинена стандартному нормальному закону при уровне доверия 0,95.
Для вычисления статистики критерия заполним таблицу 4.12.
𝑖 𝑥
Таблица 4.12 – Вычисление статистики критерия
(𝑖)
𝐹
𝑥
0
(𝑖)
𝑖−1
𝑛
𝑖
|(3) −(4)| |(5) − (3)| max {(6) , (7)}
𝑛
(1) (2) (3) (4) (5) (6) (7) (8)
1 -0,0596 0,144663 0 0,1 0,144663 0,044660 0,144663 2 0,0132 0,161870 0,1 0,2 0,061870 0,038130 0,061870 3 0,3364 0,253473 0,2 0,3 0,053473 0,046527 0,053473 4 0,3717 0,264904 0,3 0,4 0,035100 0,135096 0,135096 5 0,8600 0,444330 0,4 0,5 0,044330 0,055670 0,055670 6 1,1861 0,573817 0,5 0,6 0,073817 0,026183 0,073817 7 1,7713 0,779736 0,6 0,7 0,179736 0,079740 0,179736 8 1,9927 0,839572 0,7 0,8 0,139572 0,039570 0,139572 9 2,0581 0,854995 0,8 0,9 0,054995 0,045005 0,054995
10 2,4244 0,923135 0,9 1 0,023135 0,077165 0,077165
𝐷
𝑛
0,179736
Из таблицы приложения П.5 находим, что критическое значение
𝐷
10;0,95
= 0,409. Так как 0,179736 < 0,409, то согласно критерию Колмогорова, гипотеза о том, что выборка получена из нормального распределения с пара­метрами (0;1) не противоречит эмпирическим данным. Следовательно, можно считать, что генеральная совокупность подчинена нормальному закону с пара­метрами (0;1), вероятность ошибки при этом составляет 5%.
102 Глава 4. ПРОВЕРКА СТАТИСТИЧЕСКИХ ГИПОТЕЗ
4.3.4 Критерий Мизеса–Смирнова
Другой мерой уклонения теоретической и эмпирической функций распре-
деления служит величина, предложенная Мизесом,
∞
2
𝜔
=
𝑛
или, если 𝐹0(𝑥) непрерывная функция, эта же величина в равна:
(𝐹*(𝑥) −𝐹0(𝑥)) 𝑑𝐹0(𝑥) ,
−∞
𝜔
𝑛
=
1
12𝑛
2
2
𝑛
+
1
𝑛
𝑖=1
𝐹
*
𝑥
(𝑖)
2𝑖 −1
−
, (4.17)
2𝑛
точный вид распределения которой получил Н. В. Смирнов.
Аналогично критерию Колмогорова известен следующий результат. Пусть
𝐹*(𝑥) — эмпирическая функция распределения результатов 𝑛 независимых на- блюдений над случайной величиной 𝑋 с непрерывной функцией распределения 𝐹 (𝑥). Тогда при 𝑥 > 0 lim
𝑛→∞
𝑃𝑛𝜔
2
< 𝑥= 𝑀 (𝑥).
𝑛
Функция 𝑀 (𝜆) имеет весьма сложный вид, поэтому ее явный вид здесь
не приводится. Квантили распределения Мизеса табулированы. И если через
𝑤
обозначить квантиль распределения случайной величины 𝑛𝜔
𝛾,𝑛
2
уровня 𝛾,
𝑛
то получим критерий Мизеса–Смирнова, который часто называют критерием
омега–квадрат (𝜔2):
— если 𝑛𝜔 — если 𝑛𝜔
2
𝑛
2
𝑛
< 𝑤
≥ 𝑤
, то гипотеза 𝐻0принимается;
1−𝛼,𝑛
, то гипотеза 𝐻0отвергается.
1−𝛼,𝑛
При больших значениях 𝑛 квантиль 𝑤
можно заменять квантилем пре-
𝛾,𝑛
дельного распределения Мизеса.
Различие в мерах уклонения 𝐷𝑛и 𝜔
𝐷𝑛все точки 𝑥 одинаково важны, в то время как для величины 𝜔
2
состоит в том, что для величины
𝑛
2
важнее
𝑛
наиболее вероятные точки и менее важны маловероятные. Нетрудно видеть, что из малости 𝐷𝑛следует и малость 𝜔
2
, обратное утверждение, вообще говоря,
𝑛
не верно.
Важное с теоретической точки зрения свойство критериев, основанных на
𝐷𝑛и 𝜔
2
: они состоятельны против любой альтернативной гипотезы 𝐻1: 𝐹 (𝑥) =
𝑛
𝐹0(𝑥). Статистический критерий для проверки гипотезы 𝐻0называют состоя- тельным против альтернативной гипотезы 𝐻1, если вероятность отвергнуть 𝐻0,
4.3. Критерии согласия 103
когда на самом деле верна 𝐻1, стремится к 1 при неограниченном увеличении объема наблюдений.
Контрольные вопросы
1. Что называется статистической гипотезой?
2. Чем отличаются простая и сложная статистические гипотезы?
3. Что такое альтернативная или конкурирующая гипотеза?
4. Что называется статистическим критерием?
5. Что такое ошибки первого и второго рода?
6. Что такое критическая область?
7. Какие бывают виды критических областей?
8. Какие законы распределения можно применить для построения крити­ческой области в случае проверки гипотезы о равенстве математических ожи­даний?
9. Какой закон распределения применяется для построения критической области в случае проверки гипотезы о равенстве дисперсий?
10. Какова основная идея критерия 𝜒2проверки гипотез о законах распре­деления?
11. Каковы предпосылки применения критерия согласия Колмогорова?
12. В чем состоят преимущества критерия Колмогорова?
13. В чем состоит принципиальная разница между критерием Колмогорова и 𝜔2–критерием?
Глава 5
ДИСПЕРСИОННЫЙ
АНАЛИЗ
5.1 Основные понятия дисперсионного анализа
Дисперсионный анализ (в англоязычной аббревиатуре ANOVA — Analysis of Variance) применяется для изучения влияния одной или нескольких коли­чественных или качественных независимых переменных (факторов) на одну зависимую количественную переменную (переменную отклика).
Основной целью дисперсионного анализа является исследование значимо­сти различия между средними с помощью сравнения дисперсий. Сущностью дисперсионного анализа является разложение общей суммы квадратов откло­нений и общего числа степеней на части — компоненты, соответствующие струк­туре эксперимента, и оценка значимости действия и взаимодействия изучаемых факторов по F-критерию.
Дисперсионный анализ разработан в 20-х годах XX-го века английским ма­тематиком и генетиком Рональдом Фишером.
В зависимости от количества факторов дисперсионный анализ может
быть:
— однофакторным;
— двухфакторным;
— многофакторным (количество факторов больше двух, в этом случае, что­бы сократить объем эмпирических данных применяют специальные планы экс­перимента);
В зависимости от количества зависимых переменных различают:
— одномерный;
— многомерный дисперсионный анализ.
104
5.1. Основные понятия дисперсионного анализа 105
— дисперсионный анализ с повторными измерениями (для зависимых вы­борок);
Основные предположения дисперсионного анализа
1. Каждая выборка независима от остальных и извлечена случайным обра-
зом из исследуемой совокупности.
2. Количественные признаки нормально распределенные.
3. Дисперсии всех выборок равны (гомоскедастичность).
При нарушении любого из этих условий необходимо использовать непара­метрические методы анализа (например, критерий Краскела-Уоллиса, крите­рий Фридмана, ковариационный анализ).
Замечание: дисперсионный анализ устойчив к нарушению 3-го условия (ра­венство дисперсий) при большом числе наблюдений и равенстве количества на­блюдений при каждом уровне фактора (объемов выборок).
При дисперсионном анализе определяют удельный вес суммарного воздей­ствия одного или нескольких факторов. Чтобы решить задачу влияния факто­ров, все они разбиваются на уровни. Существенность влияния фактора опреде­ляется путём проверки гипотез:
𝐻0: условные математические ожидания на всех уровнях факторов равны;
𝐻1: хотя бы на двух уровнях факторов средние значения разнятся.
Если влияние фактора не существенно, то несущественна и разница между уровнями этого фактора, и в ходе дисперсионного анализа нулевая гипотеза
𝐻0не отвергается. Если влияние фактора существенно, то нулевая гипотеза 𝐻
отвергается.
Схема выбора комбинаций уровней факторов, при которых следует делать
0
измерения, называется планом эксперимента. Если перебираются все возмож­ные комбинации уровней факторов, то план эксперимента называют полным факторным планом. Но при большом количестве факторов число опытов в экс­перименте может оказаться достаточно большим, что сопряжено со значитель­ными временными и материальными затратами. Чтобы сократить требуемый объём выборки, применяют другие специальные планы проведения эксперимен­та.
106 Глава 5. ДИСПЕРСИОННЫЙ АНАЛИЗ
5.2 Однофакторный дисперсионный анализ
Пусть исследуется влияние некоторого фактора 𝐴, имеющего 𝑘 ≥ 3 уров­ней 𝐴1, . . . ,𝐴𝑘, на некоторую нормально распределенную величину 𝑋, теорети­ческие дисперсии которой на каждом уровне фактора неизвестны, но, тем не менее, одинаковы. Анализ основан на расчете 𝐹-статистики (статистика Фи­шера), которая представляет собой отношение двух дисперсий: межгрупповой и внутригрупповой. 𝐹 -тест в однофакторном дисперсионном анализе устанав­ливает значимо ли отличаются средние нескольких независимых выборок. Он обобщает 𝑡-тест о равенстве средних двух независимых выборок. При наличии двух уровней результаты обоих тестов дают один и тот же результат.
Предположим, что в нашем распоряжении имеются эмпирические данные
𝑥𝑖𝑗, 𝑖 = 1,𝑘, 𝑗 = 1,𝑛𝑖. Зависимость исследуемой величины 𝑋 от фактора 𝐴 можно обнаружить при сравнении оценок 𝑚
*
математических ожиданий 𝑚
𝑖
на всех уровнях𝑖 = 1,𝑘с оценкой 𝑚*общего математического ожидания 𝑚. Идея однофакторного дисперсионного анализа состоит в том, что общая сумма квадратов отклонений раскладывается на сумму двух компонент. Итак
=
𝑘 𝑖=1
𝑘 𝑖=1
𝑛
𝑖
(𝑥𝑖𝑗− 𝑚*)2=
𝑗=1
𝑛
𝑖
(𝑥𝑖𝑗− 𝑚
𝑗=1
+
*
)2+ 2
𝑖
𝑘 𝑖=1
𝑘 𝑖=1
𝑛
𝑖
𝑗=1
𝑛
𝑗=1 𝑘 𝑖=1
(𝑚
𝑖
((𝑥𝑖𝑗− 𝑚
𝑛
𝑖
(𝑥𝑖𝑗− 𝑚
𝑗=1
*
− 𝑚*)2.
𝑖
*
) −(𝑚
𝑖
*
𝑖
*
− 𝑚*))2=
𝑖
*
) (𝑚
𝑖
− 𝑚*) +
.
Учитывая, что второе слагаемое в последнем равенстве равно нулю (в силу
независимости наблюдений случайной величины 𝑋), получим:
SST = SSB + SSW , (5.1)
𝑖
называемое основным тождеством однофакторного дисперсионного анализа.
В равенстве (5.1) обозначено:
— 𝑆𝑆𝑇 =
𝑘 𝑖=1
𝑛
𝑖
(𝑥𝑖𝑗− 𝑚*)2— общая сумма квадратов отклонений
𝑗=1
(Sum Square Total);
— 𝑆𝑆𝐵 =
𝑘 𝑖=1
𝑛
𝑖
𝑗=1
*
(𝑚
− 𝑚*)2— межгрупповая сумма квадратов откло-
𝑖
нений (Sum Square Between Groups), которая характеризует влияние фактора 𝐴 на исследуемую величину. Ее еще называют рассеиванием по фактору;
5.2. Однофакторный дисперсионный анализ 107
— 𝑆𝑆𝑊 =
𝑘 𝑖=1
𝑛
𝑖
(𝑥𝑖𝑗− 𝑚
𝑗=1
*
)2— внутригрупповая сумма квадратов от-
𝑖
клонений (Sum Square Within Groups), характеризует рассеивание случайной величины 𝑋 внутри уровней фактора. Эту сумму также называют остаточным рассеиванием, так как эта компонента связана с влиянием на величину X неко­торых других факторов.
Процедура выполнения однофакторного дисперсионного анализа.
1 этап. Выдвижение гипотезы. Выдвигается нулевая гипотеза 𝐻0: 𝑚1= . . . = 𝑚𝑘= 𝑚𝑥, Против альтернативы 𝐻1: хотя бы для одной пары 𝑚𝑖= 𝑚𝑗. 2 этап. Сбор данных и подготовка их для анализа. Для этого заполняют
таблицу 5.1.
Таблица 5.1 – Данные для дисперсионного анализа
Уровень
Номер наблюдения Объем Сред-
Диспер-
Общее
фактора
𝐴
1
𝐴
2
1 . . . 𝑛
𝑥
𝑥
11
21
. . . 𝑥
. . . 𝑥
1
1𝑛
2𝑛
1
1
. . . 𝑛
. . . 𝑥
𝑘
2𝑛
𝑘
. . . 𝑛
. . . 𝑥
2
2𝑛
𝑛
1
𝑛
2
2
нее
𝑚
𝑚
сии
*
1
*
2
2
𝑆
1
2
𝑆
2
среднее
*
𝑚
𝑥
. . . . . . . . . . . . . . . . . . . . . . . . . . . . . .
𝐴
𝑘
𝑥
𝑘1
. . . 𝑥
𝑘𝑛
1
. . . 𝑥
𝑘𝑛
𝑛
𝑘
𝑘
𝑚
Предварительно вычислим оценки для средних: общего 𝑚
нях факторов 𝑚
*
, 𝑖 = 1,𝑘.
𝑖
*
𝑚
=
𝑖
𝑛
𝑛
𝑖
1
𝑥𝑖𝑗, 𝑚
𝑖
𝑗=1
1
*
=
𝑥
𝑛
𝑘
𝑖=1
𝑛
𝑖
𝑗=1
𝑥𝑖𝑗=
1
𝑘
*
𝑘
𝑘
𝑖=1
𝑆
𝑛𝑖𝑚
2
𝑘
*
и на всех уров-
𝑥
*
𝑖
(5.2)
3 этап. Проверка однородности дисперсий.
При сравнении дисперсий нескольких (больше двух) групп применяется
критерий Кохрена (Cochren) в случае, если количество наблюдений во всех группах одинаково, т. е. 𝑛𝑖= 𝑙.
Итак, его суть состоит в том, что выдвигается основная гипотеза о стати-
стической неразличимости всех дисперсий
𝐻0: 𝜎
2 1
= 𝜎
2
= . . . = 𝜎
2
2
= 𝜎2;
𝑘
Альтернативная гипотеза состоит в том, что основная гипотеза не выпол-
няется,
108 Глава 5. ДИСПЕРСИОННЫЙ АНАЛИЗ
𝐻1: 𝜎
2
= 𝜎2, хотя бы для одного 𝑖.
𝑖
В качестве статистики критерия используют случайную величину:
𝐺 =
max(𝑆
𝑆
2
, . . . ,𝑆
1
2
+ . . . + 𝑆
1
По таблице П.6 находят критическое значение 𝐺
2
)
𝑘
. (5.3)
2
𝑘
= 𝐺𝛼(𝑙 − 1,𝑘).
крит
Правило принятия решения имеет вид: — если 𝐺 < 𝐺 — если 𝐺 > 𝐺
, то гипотеза 𝐻0принимается;
крит
, то гипотеза 𝐻0отвергается.
крит
Критерий Бартлетта (Bartlett) применяется для сравнения 𝑘 (𝑘 > 2)
нескольких дисперсий по выборкам различного объема. Главное условие приме­нения критерия согласия Бартлетта — объем выборок должен быть не менее 3. При этом, некоторые объемы могут быть одинаковыми; если же на всех уровнях количество наблюдений одинаково, то следует использовать критерий Кохрена.
Итак, выдвигается основная гипотеза о статистической неразличимости
всех дисперсий
𝐻0: 𝜎
2 1
= 𝜎
2
= . . . = 𝜎
2
2
= 𝜎2;
𝑘
Альтернативная гипотеза, по-прежнему, состоит в том, что основная гипо-
теза не выполняется,
𝐻1: 𝜎 Обозначим 𝑛 =
2
= 𝜎2, хотя бы для одного 𝑖.
𝑖
𝑘
𝑛𝑖— общий объем выборки, 𝑆
𝑖=1
=
1
𝑛−𝑘
2
𝑝
𝑘
(𝑛𝑖− 1) 𝑆
𝑖=1
оценка общей дисперсии.
В качестве статистики критерия используют случайную величину:
𝑀
𝐵 =
, (5.4)
𝐶
где
𝑘
𝑀 = (𝑛 − 𝑘) ln 𝑆
1
𝐶 = 1 +
3 (𝑘 − 1)
2
𝑝
−
𝑘
𝑖=1
(𝑛𝑖− 1) ln 𝑆
𝑖=1
1
𝑛𝑖− 1
− 𝑛 −𝑘
2
, (5.5)
𝑖
1
. (5.6)
2
—
𝑖
Бартлетт установил, что статистика (5.4) при условии справедливости ну­левой гипотезы и, если все 𝑛𝑖> 3, имеет асимптотически 𝜒2-распределение с (𝑘 − 1) степенями свободы.
5.2. Однофакторный дисперсионный анализ 109
Если случайная величина нормально распределена, то распределение стати­стики (5.4) практически не зависит от объема выборки, т. е. результаты тести­рования остаются адекватными при малых объемах выборок. Но распределение статистики (5.4) очень чувствительно к отклонению от нормального закона.
Таким образом, критическое значение критерия 𝜒
2
(𝑘 − 1) находят, как
1−𝛼
квантиль 𝜒2-распределения с (𝑘 − 1) степенями свободы уровня 1 −𝛼.
Правило принятия решения имеет вид:
— если 𝜒2< 𝜒
— если 𝜒2≥ 𝜒
2
(𝑘 − 1), то гипотеза 𝐻0принимается;
1−𝛼 2
(𝑘 − 1), то гипотеза 𝐻0отвергается.
1−𝛼
Если гипотеза 𝐻0принимается, то делается вывод об однородности диспер­сий на различных уровнях и продолжают проведение дисперсионного анализа. В противном случае следует повторить эксперимент, увеличив при этом число наблюдений для каждого уровня фактора или улучшив чистоту эксперимента.
4 этап. Для изучения различий между зависимыми переменными прово­дится разложение полной дисперсии согласно (5.1):
На практике суммы квадратов отклонений, входящих в (5.1), вычисляют по следующим формулам.
Общая сумма квадратов отклонений
𝑛
𝑘
𝑆𝑆𝑇 =
𝑖=1
𝑖
𝑗=1
2
𝑥
− 𝑛 (𝑚*)2, (5.7)
𝑖𝑗
которая имеет 𝐷𝐹𝑇 = 𝑛 − 1 степеней свободы (Degrees of Freedom), следова­тельно, общий средний квадрат (Mean Square) или общая дисперсия равна
𝑀𝑆𝑇 =
𝑆𝑆𝑇
𝐷𝐹 𝑇
=
1
𝑛 −1
𝑘
𝑖=1
𝑛
𝑖
𝑗=1
2
𝑥
− 𝑛 (𝑚*)
𝑖𝑗
2
. (5.8)
Межгрупповая сумма квадратов отклонений
𝑘
𝑆𝑆𝐵 =
𝑛𝑖(𝑚
𝑖=1
*
)2− 𝑛 (𝑚*)2, (5.9)
𝑖
которая имеет 𝐷𝐹𝐵 = 𝑘 − 1 степеней свободы (Degrees of Freedom), следова­тельно, средний квадрат (Mean Square) или межгрупповая дисперсия равна
𝑀𝑆𝑇 =
𝑆𝑆𝐵
𝐷𝐹 𝐵
=
1
𝑘 − 1
𝑘
𝑖=1
𝑛𝑖(𝑚
*
)2− 𝑛 (𝑚*)
𝑖
2
. (5.10)
110 Глава 5. ДИСПЕРСИОННЫЙ АНАЛИЗ
Внутригрупповая сумма квадратов отклонений
𝑆𝑆𝑊 = 𝑆𝑆𝑇 − 𝑆𝑆𝐵, (5.11)
которая имеет 𝐷𝐹𝑊 = 𝑛−𝑘 степеней свободы, следовательно, средний квадрат или внутригрупповая дисперсия равна
𝑀𝑆𝑊 =
𝑆𝑆𝑊
𝐹 𝐷𝑊
=
𝑆𝑆𝑊
. (5.12)
𝑛 −𝑘
5 этап. Рассчет значения статистики критерия производится по формуле
𝑀𝑆𝐵
𝐹 =
, (5.13)
𝑀𝑆𝑊
которая, при условии справедливости нулевой гипотезы, имеет распределение Фишера с (𝐹 𝐷𝐵,𝐹𝐷𝑊 ) = (𝑘 − 1,𝑛 −𝑘) степенями свободы.
6 этап. Нахождение критического значения по таблице распределения Фи­шера, как квантиля 𝐹
(𝑘 − 1,𝑛 − 𝑘) 𝐹 -распределения с (𝑘 −1,𝑛 − 𝑘) степе-
1−𝛼
нями свободы уровня 1 − 𝛼.
7 этап. Правило принятия решения
— если 𝐹 < 𝐹
— если 𝐹 ≥ 𝐹
(𝑘 − 1,𝑛 − 𝑘), то гипотеза 𝐻0принимается;
1−𝛼
(𝑘 − 1,𝑛 − 𝑘), то гипотеза 𝐻0отвергается.
1−𝛼
Если гипотезу 𝐻0принимают, то говорят, что фактор не оказывает суще­ственного влияния на признак 𝑋. Отклонение же гипотезы 𝐻0свидетельствует о существенном влиянии фактора на 𝑋.
Обычно результаты принято представлять в виде ANOVA таблицы 5.2.
Таблица 5.2 – ANOVA таблица
Источник
вариации
Между
группа-
ми
Внутри
групп
Общая 𝑆𝑆𝑇 𝐷𝐹 𝑇 𝑀 𝑆𝑇
Сумма
квадра-
тов
𝑆𝑆𝐵 𝐷𝐹 𝐵 𝑀𝑆𝐵 𝐹 =
𝑆𝑆𝑊 𝐷𝐹 𝑊 𝑀𝑆𝑊
Количество
степеней
свободы
Средний
квадрат
𝐹 -статистика Критическое зна-
𝑀𝑆𝐵
𝑀𝑆𝑊
чение
𝐹
(𝑛 − 1,𝑛 −𝑘)
1−𝛼
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]