Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Прикладная математическая статистика. Учебное пособие
.pdf
61
0
H
x A
≤
x B
≥
1
H
A x B
< <
n
n
− α α
β −β
β − β
− α α
β −β
− α α
( )cW x
2 2
0 1
σ + σ
ln , , ;
ln , , .
− ασ = σ α β
σ = σ β α
≪
n
1
n
−
µ
0,01
α =
0,1
β =
25
σ = σ =
49
σ = σ =
0,9
n
0,9
γ =
ln 234,029 34,348
A n
= ⋅ = − + ⋅
ln 459,354 34,348
B n
= ⋅ = + ⋅
n
Гипотеза
Если
Здесь
Средние объемы выборок, необходимые для завершения последовательной проверки, равны
A
принимается, если
n
2
∑
i
=
i
1
2
⋅σ σ β σ
=
2 2
σ − σ − α σ
1 0 0
, то испытания продолжаются.
2 2
0 1 1
ln
1
∑
=
i
2
i
1
;
; если
2 1
B
⋅σ σ − β σ
=
2 2
σ − σ α σ
1 0 0
1
(1 ) ln ln
− α ⋅ + α ⋅
2
σ =
( ) 2
n
0
2
σ σ
0 1
+ ⋅ −
2 ln 1
σ σ
1 0
1
;
σ =
( ) 2
n
n
2
∑
i
=
i
1
2 2
0 1 1
ln
ln (1 ) ln
2
1
β⋅ + − β ⋅
1
σ σ
1 1
σ σ
0 0
, принимается гипотеза
.
1
2
− − ⋅
1 2 ln
;
.
1
ln ln
n
= −
max
1
ln
⋅
σ
1
σ
0
.
2
2
Вероятностные оценки необходимого числа испытаний могут быть найдены по аналогии с
критерием для проверки гипотезы о среднем значении, с помощью таблицы распределения
2
σ −
2
Вальда
=
K
Если значение среднего µ неизвестно, то все приведенные соотношения сохраняются при
замене
Пример 5.3.
средним
значений параметра прибора равна
Найти контрольные границы и средние объемы выборок для последовательной проверки
гипотез. Определить объем выборки
процедура последовательного анализа закончится принятием решения по гипотезе.
Определить вероятность того, что последовательная процедура потребует не более 20
испытаний.
Решение.
Находим
2 25 49 0,9 7
⋅ ⋅
49 25 0,01 5
см. табл. 10 в приложении) при
1
если
β
− β
1
если
α
на
Предположим, что параметр прибора распределен нормально с известным
. Необходимо проверить при
⋅ ⋅
2 25 49 0,1 7
49 25 0,99 5
−
2 2
0
2 2
.
−
≪
1
2 2
n
n
c K
=
и
0
, для которого с вероятностью не менее
, против альтернативы
2 2
σ − σ
1 0
гипотезу о том, что дисперсия
.
, где
;
2
1
.

62
234,029 34,348
x n
≤ − + ⋅
25
σ = σ =
459,354 34,348
x n
≥ + ⋅
49
σ = σ =
234,029 34,348 459,354 34,348
n x n
− + ⋅ < < + ⋅
(25) 2 25
= ⋅ =
(49) 2 27
= ⋅ =
46
= − =
α β
≪
ln 2,292
2,292 1,146
49 25
+
( ) 0,9
=
2,12
n
(25) 2.12 53
= ⋅ =
20
n
≤
0,8
25
n
1,146
c
=
0,8
x
=
(0,8) 0,56
=
25
σ = σ =
0 0
λ = λ
1/
v
λ =
v
1 1 0
λ = λ > λ
n
∑
=
i
n
∑
=
i
2
i
1
2
i
1
, то принимается гипотеза о том, что
, то принимается гипотеза о том, что
n
2
∑
i
=
i
1
Если
если
случае
Далее вычисляем средние объемы выборок
0,99 0,01
⋅ + ⋅
0,99 ln 0,01 ln
n
0,1 0,9
2
5 7
+ ⋅ −
2 ln 1
7 5
0,1 0,9
0,1 ln 0,9 ln
⋅ + ⋅
n
0,99 0,01
2
7 7
− − ⋅
1 2 ln
5 5
;
0,1 0,9
ln ln
n
max
⋅
0,99 0,01
2
7
5
2
ln
.
2 2
0
2 2
1
испытания продолжаются.
;
;
. В
В нашем случае
, тогда находим
K = =
и
0,1
25 49
0,99
25
−
c
= ⋅ =
2
.
−
Из таблицы распределения Вальда имеем
n n
0,9
Теперь определим вероятность окончания последовательной процедуры при
20
n
= = =
x
W
1,146
процедуры потребуется не более 20 испытаний, при условии, что
.
. Из таблицы распределения Вальда для
. Следовательно с вероятностью 0,56 для окончания последовательной
W x
1,146
при
x
= ≈
и
2 2
0
, тогда
получим
.►
n
0,9
5.6 Проверка гипотезы о параметре экспоненциального распределения
Проверяется гипотеза
:H
(напомним, что
– средняя наработка до
. Имеем
отказа,
Введем обозначения
– интенсивность отказов), против альтернативы
:H
.

63
n
n
x A
≤
0
H
x B
≥
1
H
A x B
< <
− α α
β −β
− β β
α − α
− α α
β −β
1 1 0
λ λ − λ
ln , , ;
ln , , .
− α
λ = λ α β
λ = λ β α
≪
0,2
α =
0,05
β =
0
H
100
λ = λ =
: 150
λ = λ =
20
n
=
ln 0,00811 0,0312
ln 0,00811 0,0554
(100) 21
100 100
= =
(150) 19
150 100
= =
A
n
= ⋅ ⋅
λ −λ λ − β
1 0 0
n
Если
∑
i
i
1
=
n
∑
i
i
1
=
Средние объемы выборок, необходимые для завершения процедуры
последовательного анализа, вычисляются по формулам
λ α
1
ln
1
, принимается гипотеза
, то испытания продолжаются.
1/
n
;
B
= ⋅ ⋅
λ −λ λ β
1 0 0
; если
ln
∑
i
n
1
=
1
λ − α
1
i
1
(1 ) ln ln
( )
n
λ =
0
− α ⋅ + α ⋅
λ λ
1 1
− −
1 ln
λ λ
0 0
1
;
( ) 2
n
λ = σ
1
(1 ) ln ln
2
1
ln ln
= −
n
max
Параметр распределения Вальда вычисляются по формулам
ln
⋅
λ
1
λ
0
1
2
1/
.
, принимается гипотеза
1
− β ⋅ + β ⋅
1
λ λ
0 1
− +
1 ln
λ λ
1 0
.
; если
;
1
=
c K
ln
−
λ
0
λ −λ
1 0
2
, где
2
2
Пример 5.4.
для проверки гипотезы
равна
объемы выборок, необходимых для окончания последовательного анализа. Найти
вероятность того, что последовательная процедура позволит принять решение уже после
Решение. Находим
= ⋅ ⋅ = ⋅ −
A n
150 100 100 0,95
= ⋅ ⋅ = ⋅ −
B n
150 100 100 0,05
Далее вычисляем
Найти параметры плана последовательных испытаний при
о том, что средняя наработка на отказ электронного прибора
0
испытаний.
n
−
n
−
ч. против альтернативы
150 0,2
150 0,8
0,8 0, 2
⋅ + ⋅
0,8 ln 0,2 ln
n
0,05 0,95
150 150
− −
1 ln
K
=
1
− β
α
1/
n
1/
n
если
β
если
H
1 1
0
.
≪
1
и
ч. Вычислить средние
;
.
0,05 0,95
⋅ + ⋅
0,05 ln 0,95 ln
;
n
0,8 0, 2
100 150
− +
1 ln
;

64
27
= − =
β α
≪
150
λ = λ =
ln 1,558
1,558 0,061
−
1
= = ≈
1
x
=
0,061
c
=
( ) 0,85
=
20
n
=
150
λ = λ =
0 0
H p p
=
1 1
H p p
>
1 0 1 0
p p p p
p p p p
1 0 1 0
p p p p
p p p p
x
x A
≤
0
H
x B
≥
1
H
A x B
< <
1 0
0 1
p p
p p
β − β
1 0
0 1
p p
p p
β − β
p p
p p
− β β
α − α
0,8 0,2
ln ln
n
max
Теперь найдем, учитывая, что
⋅
0,05 0,95
2
ln
150
100
.
0,95
и
,
1
K
= =
0,2
и
150 150 100
ln
= =
c
Имеем
x
n
Таким образом, с вероятностью 0,85 процедура последовательного анализа закончится при
, если
5.7 Проверка гипотезы о параметре биномиального распределения
Проверяется гипотеза
−
100 2
−
150 100
( )
2
n
λ
20
19
1
1
2
и из табл. Вальда для
.►
:
.
против альтернативы
и
имеем
:
.
W x
c
.
Введем обозначения
β
ln
− α
1
= + ⋅
A n
ln ln ln ln
= + ⋅
B n
ln ln ln ln
Пусть
приборов в партии). Если
гипотеза
Средние объемы выборок равны
=
( )
n p
0
1 1
− −
+ +
1 1
0 1 0 1
1
ln
− −
− β
α
1 1
− −
+ +
1 1
0 1 0 1
– число поступлений наблюдаемого события (например, количество дефектных
; в случае
− α ⋅ + α ⋅
(1 ) ln ln
− −
, то принимается гипотеза
испытания продолжаются.
− α α
1
p p
⋅ − − ⋅
ln (1 ) ln
0 0
ln
ln
1
−
1
−
1
−
1
p
0
−
1
p
1
−
1
p
0
−
1
p
1
;
.
; если
, принимается
1
β⋅ + − β ⋅
ln (1 ) ln
− α α
;
( )
n p
=
1
p p
1
⋅ − − ⋅
ln (1 ) ln
1 1
;
−
1
−
1
1
ln ln
= −
n
max
ln ln
⋅
1
−
1 0
0 1
1
⋅
−
1
.

65
ln , , ;
ln , , .
− α= α β
= β α
≪
0
H
0,01
= =
: 0,02
= =
0,95
γ =
0,1
α =
0,01
β =
6,399 0,0144
A n n
= + ⋅ = − + ⋅
3,26 0,0144
B n n
= + ⋅ = + ⋅
(0,01) 1225
(0,02) 569
1466
c
β α
≪
0,02
= =
Параметр распределения Вальда находится по формуле
p p
c K
= ⋅
p p
1 1
Пример 5.5.
проверки гипотезы
альтернативы
вероятностью
Заданы ошибка первого рода
Решение. Находим
0,02 0,99 0,02 0,99
ln ln ln ln
0,01 0,98 0,01 0,98
0,02 0,99 0,02 0,99
ln ln ln ln
0,01 0,98 0,01 0,98
Далее
1 1
⋅ − ⋅ +
ln ln
p p
0 1
p p
(1 ) ln ln
Необходимо найти параметры плана последовательных испытаний для
H p p
1 1
0,01 0,99
0,9 0,98
1 0
p p
0 1
о том, что доля дефектных изделий в партии
последовательная процедура закончится принятием решения.
+ +
0,99 0,99
ln ln
0,1 0,98
+ +
p p
1 0
ln (1 ) ln
⋅ − − ⋅
1
1
1
1
. Определить количество испытаний, для которого с
и ошибка второго рода
−
−
=
K
, где
−
−
1
если p p
β
− β
1
если p p
α
p p
.
0
.
≪
1
0
против
;
.
0,9 ln 0,1 ln
n
= =
0,01 ln 0,99 ln
0,01 0,99
⋅ − ⋅
0,01 0,99
⋅ + ⋅
0,01 ln 0,99 ln
n
= =
0,02 ln 0,98 ln
0,02 0,99
⋅ − ⋅
0,01 0,99
⋅ + ⋅
0,99 0,01
ln ln
0,1 0,9
= − =
n
max
Вычисляем параметр
0,02 0,99
ln ln
0,01 0,98
⋅
⋅
0,9 0,1
0,9 0,98
0,9 0,1
0,01 0,98
.
(при
и
p p
;
;
1
):

66
ln ln 2,2925
2,2925 0,65
0,95
n
n
( ) 0,95
( ) 0,95
=
3,5
x
≈
569 3,5 1992
= ⋅ =
0,02
= =
1 0,99
K
c
α
= ⋅ =
− β
= = =
0,02 0,98 ln ln
0,1
0,02 0,99
0,02 ln 0,98 ln
⋅ − ⋅
0,01 0,98
0,02 0,99
⋅ ⋅ +
0,01 0,98
,
.
Из таблицы Вальда находим
W x
0,65
вероятностью 0,95 при
более 1992 испытаний.►
1.
Проверка гипотез о значениях параметров распределений.
2. Проверка простой гипотезы против простой альтернативы.
3. Последовательные методы проверки гипотез о значениях параметров распределений
4.
Проверка гипотезы о числовом значении математического ожидания нормального
распределения при известной дисперсии (случаи равных дисперсий).
5. Проверка гипотезы о числовом значении дисперсии нормального распределения
6.
Проверка гипотезы о числовом значении параметра экспоненциального распределения
7. Проверка гипотезы о числовом значении параметра биномиального распределения
при
p p
x
=
. Отсюда,
1
, соответствующее условию
n
0,95
процедура последовательного анализа потребует не
Вопросы для самопроверки
W x =
c
. Следовательно, с
. Имеем

67
Тема 6. Дисперсионный анализ зависимостей
6.1 Основные положения
В предыдущих главах были рассмотрены различные методы и приемы математической
статистики, позволяющие оценить параметры статистических совокупностей, сравнивать их
между собой. При этом, как правило, предполагалась взаимная независимость сравниваемых
совокупностей. В настоящей главе рассматриваются вопросы оценки связей между
статистическими совокупностями.
Для оценки связей между статистическими совокупностями используются методы
дисперсионного, корреляционного и регрессионного анализов, являющиеся
последовательными ступенями при исследовании связей между случайными величинами.
Методами дисперсионного анализа устанавливается наличие влияния заданного фактора
на изучаемый процесс, отображаемый наблюдаемой статистической совокупностью
выборочных данных. Корреляционный анализ позволяет оценить силу такой связи, а
методами регрессионного анализа можно выбрать конкретную математическую модель и
оценить адекватность отражения ею установленной взаимосвязи случайных величин.
В последние годы стремительно развивается самостоятельное прикладное направление
математической статистики – математическая теория активного эксперимента. Базируясь на
комбинации методов дисперсионного и регрессионного анализов, методы математического
планирования эксперимента дополняют их.
Для установления самого факта наличия (или отсутствия) статистически значимой связи
между результирующими показателями Y и объясняющими переменными X могут быть
использованы параметрический и непараметрический подходы.
Предполагают, что все наблюдения принадлежат некоторому семейству распределений
(т.е. изменяется только т при изменении уровня фактора). Если в качестве такого
распределения рассматривается нормальное, то для обработки данных могут применяться
методы дисперсионного анализа. Если предположение о нормальности не является
правомерным, тогда используют различные методы непараметрического анализа.
Если проводить наблюдения над каким-либо явлением, характеризуемым случайной
величиной Y, то значение этой наблюдаемой величины может изменяться от каких-то
определенных факторов A, качественных или количественных, а также от совокупности
случайных воздействий, делающих фактически эту величину случайной. Как правило,
влияние случайных факторов не приводит к смещению среднего значения наблюдаемой
величины (изменяется только дисперсия), влияние же определенных факторов отмечается
таким смещением. Исследование влияния факторов на изменчивость средних значений
является основной задачей дисперсионного анализа. Для оценки этого влияния используется
свойство аддитивности дисперсии изучаемой случайной величины, обусловленной
действием независимых факторов. В 1938 г. Р.Н. Фишер впервые определил дисперсионный
анализ как отделение дисперсии, приписываемой одной группе причин, от дисперсии,
приписываемой другим группам. Исходя из этого определения, в зависимости от числа
источников дисперсии различают однофакторный и двух-факторный дисперсионный анализ.
Дисперсионный анализ состоит в выделении и оценке отдельных факторов, вызывающих
изменчивость изучаемой величины. Для этого производится разложение суммарной
выборочной дисперсии на составляющие, обусловленные независимыми факторами. Каждая
из этих составляющих представляет собой оценку генеральной дисперсии. Для определения
значимости влияния того или иного определенного фактора дается оценка отношения
выборочной дисперсии, соответствующей этому фактору, к дисперсии, обусловленной
случайными факторами (дисперсия воспроизводимости). Оценка осуществляется по
критерию Фишера.
При этом делаются следующие допущения:
• случайные ошибки наблюдения распределены нормально;

68
X
i
n
, 1,...,
x e i n
= µ + α + =
i
α
ji
e
ji
x
Уровни фактора
A
1
A
2
A
i
A
k
A
11
x
12
x
1
i
x
1
k
x
21
x
22
x
2
i
x
2
k
x
j
1
j
x
2
j
x
ji
x
jk
x
n
1
1
n
x
2
2
n
x
i
n i
x
k
n k
x
1
x
2
x
i
x
k
x
• в эксперименте используются равноточные методы измерения;
• факторы влияют только на изменение средних значений, а дисперсия наблюдаемой
величины считается постоянной.
Понятие «определенный фактор» обусловлено следующим:
• это исследуемый фактор, т.е. априори установленный;
• этот фактор имеет количественную или качественную шкалу измерения;
• эта шкала разделена на уровни.
Например, исследуется влияние климатических условий на урожайность. Климатические
условия включают в себя три фактора: световой, температурный и влажностный. Первый
фактор определяется тремя значениями: солнечной, переменной и пасмурной погодой;
второй — средней температурой в пределах: 5-10 °С, 10-15 °С, 15-20 °С, 20-25 °С, 25 30 °С;
третий также имеет три уровня, соответствующих понятиям: дождливая погода, нормальная
погода, сухая погода. Первый и третий имеют качественную оценку уровней, а второй —
количественную.
6.2. Однофакторный анализ
6.2.1.0днофакторный дисперсионный анализ
Рассмотрим влияние фактора A на исследуемый процесс
, принимающего k
различных значений — уровней фактора. На каждом i-м уровне производится
наблюдений, результаты которых занесены в таблицу 6.1.
Результат каждого наблюдения может быть представлен в виде модели:
ji i ji
где µ – суммарный эффект во всех опытах;
ошибка определения
на i-м уровне.
, (6.1)
– эффект фактора A на i-м уровне;
Таблица 6.1. Форма представления экспериментальных
данных однофакторной модели
Номер
Наблюдения
1
–
2
…. …. …. …. ….
…. …. ….. ….. …..
Средние
значения по
уровням

69
( )
i
µ + α
2
σ
i
N n
∑
X
0
H
ij
x
H m m m m
= = = =
n n n n
= = = =
N k n
= ×
ji
x x
∑
ji
x x x
∑ ∑∑
2
s const
2
i
s
2
i
s
ji
x
2
= = − =
2
i
s
1
n
−
2
сл
s
( 1)
v k n N k
= − = −
2
Предположим, что наблюдения на i-м фиксированном уровне фактора нормально
распределены относительно среднего значения
с общей дисперсией
.
Общее число опытов
k
=
. (6.2)
1
i
=
Следует установить, оказывает ли влияние фактор A на исследуемый процесс
Сформулируем гипотезу
о том, что расхождение наблюдений в сериях опытов для
различных уровней факторов можно объяснить только случайными причинами. На
статистическом языке это предположение означает, что все данные таблицы
принадлежат одному и тому же распределению.
Осуществим проверку нулевой гипотезы равенства средних значений на различных
уровнях фактора A:
: ...
0 1 2
k
.
Наиболее часто расчет проводится при равном числе опытов на каждом уровне A, т.е.
1 2
...
. При этом общее число наблюдений
k
.
Среднее значение результатов наблюдений на i-м уровне:
n
1
=
i
n
. (6.3)
1
j
=
Общее среднее значение для всей выборки из N наблюдений:
k k n
1 1
= =
k N
i
1 1 1
i i j
= = =
. (6.4)
Выборочная дисперсия на каждом уровне:
.
n n n
1 1 1
2 2 2
s x x x x
= − = −
i ji ji ji
n n n
− −
При выполнении условия
различий (однородность дисперсий
дисперсии, характеризующей рассеяние значений
( )
∑ ∑ ∑
1 1
1 1 1
= = =
j j j
i
2
=
i
, т.е. между дисперсиями
определяется по критерию Кохрена), находим оценку
вне влияния фактора A (т.е.
дисперсии, характеризующей фактор случайности) по формуле
k k n
1 1
2 2
s s x x
сл i ji
∑ ∑∑
k k n
= = =
i i j
1 1 1
1 1
= −
k n n
−
( 1)
Легко видеть, что если при оценке
имеет
степеней свободы.
−
( )
( 1)
k n k n
∑∑ ∑ ∑
= = = =
1 1 1 1
i j i j
2
x x
ji ji
мы имеем (
2
i
Общая выборочная дисперсия всех наблюдений равна:
. (6.5)
нет значимых
. (6.6)
) степеней свободы, то оценка
k n k n k n
2 2 2
s x x x x
0
1 1 1
= − = −
N N N
∑∑ ∑∑ ∑∑
− −
1 1
= = = = = =
1 1 1 1 1 1
i j i j i j
( )
ji ji ji
. (6.7)

70
2
0
σ
2
A
σ
2
сл
σ
2 2 2
A сл
σ = σ + σ
2 2 2
A сл
s s s
= +
2
A
s
i
x
2 2 2
( ) ( )
s x x x x
1
v k
= −
2
A
s
2
сл
s
2
A
s
2
сл
s
H m m m m
= = = =
( , ), 1; ( 1)
= > = − = − = −
1 2
( , )
F v v
2
0
s
A
m m m m
= = = =
i
m
0
H
ji
x
ji
x
ji
r
Исходя из свойства аддитивности дисперсии можно общую дисперсию
представить как сумму составляющих этой дисперсии:
фактора A и
— характеризующий фактор случайности (совокупность случайных
— характеризующий вклад
факторов):
0
.
Тогда с учетом выборочных оценок дисперсии
. (6.8)
, связанное
Введем теперь оценку дисперсии
0
, характеризующей изменение средних
с влиянием фактора A
n k k
1
= − = −
∑ ∑ ∑
A
k k
− −
1 1 1
= = =
j i i
с числом степеней свободы
i i
1 1
.
n
(6.9)
Теперь проверка влияния фактора A на изменение средних может быть сведена к сравнению
дисперсий
и
. Если дисперсия
значимо отличается от
то нулевая гипотеза
: ...
0 1 2
k
отвергается и влияние фактора A считается существенным. Для
проверки гипотезы применяется односторонний критерий Фишера: влияние A считается
значимым, если
2
s
F F v v v k v N k k n
Если отношение
При этом общая дисперсия
A
2
s
сл
q
1 2 1 2
2
s
A
≤
2
s
сл
q
, то влияние фактора A следует считать незначимым.
. (6.10)
будет связана только с фактором случайности и ее можно
считать однородной.
При значимости влияния фактора
1 2
...
k
, можно выяснить, какие именно средние
, т.е. при значимости различия между
различны. Для этого
используют критерии Стьюдента или ранговый критерий Дункана.
6.2.2. Непараметрические методы однофакторного анализа
Если предположение о нормальности распределения выборки не является правомерным
или наблюдаются качественные показатели, следует использовать различные методы
непараметрического анализа, среди которых наиболее развиты ранговые методы.
Рассмотрим таблицу наблюдений (см. табл. 6.1) (однофакторный дисперсионный анализ).
Сформулируем гипотезу
о том, что расхождение наблюдений в сериях опытов для
различных уровней факторов можно объяснить только случайными причинами. На
статистическом языке это предположение означает, что все данные таблицы
принадлежат
одному и тому же распределению. Рассмотрим ранговый однофакторный анализ.
Если мы ничего не знаем о распределении
выводах на отношения «больше — меньше» между наблюдениями, так как они не зависят от
распределения наблюдений. При этом вся информация содержится в тех рангах
, то в этом случае проще опираться в своих
, что
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
