Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Многомерный статистический анализ эколого-геохимических измерений. Часть I. Математические основы. Учебное пособие
.pdf
Другим способом представления эмпирического закона распреде-
p
x
x
x
x
x
x
x
x
p
p
p
ления являются накопленные частоты
j
n
(или
i
i
1
j
– накопленные
i
i
1
относительные частоты):
Таблица 1.7
Группированный статистический ряд накопленных частот Х
j–1
in
ip
j
j
1
1
j
i
i
0
1
n
n
1
р1+р2 … 1
р
1
1
2
…
1+n2
…
k–1
k
k
n
i
i
1
Накопленные относительные частоты порождают эмпирическую
функцию распределения – оценку функции распределения дискретной
случайной величины Х, вычисляемую по формуле (1.2)
j
F(х) =
i
i
1
и являющуюся разрывной ступенчатой, равной нулю левее наименьшего наблюдаемого значения, испытывающей скачок величиной р
при пе-
j
реходе через левую границу j-го интервала и в итоге достигающей единицы правее наибольшего наблюдаемого значения.
Система STATISTICA [6, 7, 39] позволяет по выборке микроэле-
мента (см. приложение 1) построить таблицу частот n
(например, для La
см. табл. 1.8), а также нарисовать гистограммы час-
И
, pj,
j
i
j
n
1
j
и
i
i
i
1
тот (см. рис. 1.16).
Таблица 1.8
Частоты распределения содержания La
И
j
j
Интервалы
n
j
n
i
1
pj, %
i
j
, %
i
i
1
1 10,0 < x ≤ 15,0 1 1 1,0989 1,0989
2 15,0 < x ≤ 20,0 8 9 8,7912 9,8901
31

Окончание табл. 1.8
p
j
Интервалы
j
n
j
i
1
in
pj, %
j
, %
i
1
ip
3 20,0 < x ≤ 25,0 19 28 20,8791 30,7692
4 25,0 < x ≤ 30,0 35 63 38,4615 69,2308
Интервалы
j
nj
j
1
in
, %
j
i
j
, %
i
1
ip
5 30,0 < x ≤ 35,0 25 88 27,4725 96,7033
6 35,0 < x ≤ 40,0 2 90 2,1978 98,9011
7 40,0 < x ≤ 45,0 1 91 1,0989 100,0000
∑ 91 100,0000
Гистограммы частот n
и
j
in
Переменная: La
40
35
30
25
20
15
10
5
Количество наблюдений
0
10 15 20 25 30 35 40 45
Категории
Рис. 1.16. Гистограмма частот
nj распределения LaИ
И
j
имеет вид (рис. 1.16):
i
1
Переменная: La
И
100
80
60
40
20
Количество наблюдений
0
10 15 20 25 30 35 40 45
Категории
Рис. 1.16*. Гистограмма
накопленных частот распределения La
И
32

Характеристики случайной величины, построенные на основании
K
x
x
s
s
выборочных данных, называются выборочными или точечными оценками. Свойства случайной величины могут характеризоваться различ-
ными начальными и центральными моментами, вычисляемыми в случае
дискретной случайной величины по формулам:
i
K
p
ii
i
K
.
p
1
= mX
и
Начальный момент порядка K:
Центральный момент порядка K:
Ki i
Важнейшие из них – математическое ожидание М(Х)
дисперсия D(Х)
2(Х), где через обозначено стандартное откло-
=
нение, – являются частными случаями моментов:
,
D
x
1
, D (1.16)
2
Выделяют также несмещенную выборочную дисперсию
n
Если
выборочное математическое ожидание случайной величины
2
D
. (1.17)
n
1
дает нам «её среднее значение» или точку на координатной прямой,
«вокруг которой разбросаны» значения рассматриваемой случайной ве-
личины, то
значений случайной величины
выборочная дисперсия характеризует «степень разброса»
Х.
Используются также оценки коэффициента асимметрии (1.8)
A
3
3
и коэффициента эксцесса (1.9)
4
3E
как степени отклоне-
4
s
ния полигона частот от плотности нормального распределения непрерывной случайной величины, для которой они равны нулю.
Система STATISTICA позволяет по выборке микроэлемента вычислить точечные оценки, например, для La
Выборочные числовые характеристики распределения содержания LaИ.
:
И
Таблица 1.9
s A E
n
LaИ
x
91 27,02527 5,039656 –0,205849 0,082287
Выборочные числовые характеристики или точечные оценки случайной величины – приближенные значения параметров распределения.
Чтобы охарактеризовать погрешность этих значений, нужно указать
33

граничные значения, за которые не выходит оцениваемый параметр.
x
x
x
x
x
x
Поскольку все расчёты производятся на основании случайных результатов опыта, то и граничные значения – также случайные величины. Таким образом, речь идёт о построении интервала со случайными границами, который с заданной вероятностью содержал бы неизвестное
значение параметра распределения.
Для определения погрешности полученных
значений используют
интервальные оценки, применяя понятие «доверительного интервала» – интервала, внутри которого параметр, как ожидается, найдёт-
ся с некоторой доверительной вероятностью (надежностью) . Иногда
вместо используют величину ,
1 – , называемую уровнем зна-
=
чимости.
Рассмотрим нахождение доверительного интервала для математического ожидания m
Ширина 2 такого интервала (
носительно
– выборочного значения mx, – находится из условия
()Px x
причем сама вероятность
ления Стьюдента (1.13) со степенью свободы k
неизвестна, а лишь подсчитано ее несмещенное значение
. По заданным
t
);( kxF
нормально распределенной случайной величины.
x
-,x+), обладающего симметрией от-
, (1.18)
()Px x
=
определяется законом распреде-
n – 1, если дисперсия
=
р и числу степеней свободы (ст. св.) k
2
s
калькулятор распределения вероятности распределения Стьюдента
(см. рис. 1.13) позволяет найти соответствующее значение t
ловия x
=
доверительный интервал (
/ns
можно найти
=
/xsn. В результате можно построить
– , x+ ), содержащий параметр m
= x
. Из ус-
с веро-
x
ятностью согласно (1.18).
:
В случае с La
Тогда
=
держащий параметр m
при
И
= р =
0,95 имеем t = x = 1,986675 (рис. 1.17).
1,04955 и доверительный интервал (25,9757; 28,0748), со-
с вероятностью (надежностью)
x
0,95. Иными
=
словами, погрешность вычисления математического ожидания по приближенному значению
не значимости
Величина
и равна при x
0,68 при k = 90.
=
0,05.
=
/sn
=
1, чему соответствует не очень высокая надежность
=
Практически доверительный интервал (
27,02527 не превышает
=
0,5283 называется стандартной ошибкой Х
– , x+ ) можно постро-
ить с помощью точечных оценок распределения содержания La
из табл. 1.9
27,02527; s = 5,039656 и значения t = x = 1,986675
=
34
1,04956 при уров-
=
И

(см. рис. 1.17), позволяющих рассчитать радиус доверительного интер-
x
вала
=
/xsn и, как следствие, его границы
.
Рис. 1.17. Доверительный интервал для mx распределения La
И
1.2.2. Проверка статистических гипотез
Во многих случаях результаты наблюдений используются для проверки предположений (гипотез) относительно тех или иных свойств
распределения случайной величины. В частности, такого рода задачи
возникают при сравнении методов обработки по определённым измеряемым признакам и т. д.
К основным задачам математической статистики относится статистическая проверка гипотез о законах распределения и
о параметрах
распределения случайной величины. При исследовании различных случайных величин на определённом его этапе появляется возможность
выдвинуть ту или иную гипотезу о свойствах изучаемой величины, например, сделать предположение о законе распределения её, или, если
закон распределения известен, но неизвестен его параметр, то сделать
предположение о его значении. Наиболее
соображениям гипотезу называют нулевой (основной) и обозначают
правдоподобную по каким-то
H
0
Наряду с основной гипотезой рассматривают другую (альтернативную)
H
гипотезу
, противоречащую основной. Выдвинутая нулевая гипотеза
1
нуждается в дальнейшей проверке. При этом могут быть допущены
ошибки двух типов:
ошибка первого рода – отвергнута правильная гипотеза,
ошибка второго рода – принята неправильная гипотеза.
.
35

Вероятность совершить ошибку первого рода (вероятность отверг-
нуть правильную гипотезу) обычно обозначают и называют уровнем
значимости. Случайную величину Z, служащую для проверки гипотезы, называют критерием. Совокупность значений критерия, при которых нулевую гипотезу отвергают, называют критической областью.
Граничные точки критической области z
называют критическими
kp
точками. Различают три вида критической области:
правосторонняя, определяемая неравенством Z > z
левосторонняя, определяемая неравенством Z < z
двусторонняя, определяемая неравенством Z < z
> 0;
kp
< 0;
kp
< z2 < Z. В частно-
1
сти, если критические точки симметричны относительно нуля, то
двусторонняя критическая область имеет вид Z > z
> 0.
kp
При отыскании критической области задаются уровнем значимости
и ищут критические точки, исходя из требования, чтобы вероятность
того, что критерий Z примет значения, лежащие в критической области,
была равна принятому уровню значимости. В результате получаем
для правосторонней критической области P(Z > z
для левосторонней критической области P(Z < z
для двусторонней симметричной области P(Z > z
кp) =
кp) =
кp) =
;
;
/2.
Основной принцип статистической проверки гипотез заключается в
следующем: если наблюдаемое значение критерия Z
, вычисленное
набл
по данным выборки, принадлежит критической области, то гипотезу отвергают; если наблюдаемое значение не принадлежит критической области, то нет оснований отвергать гипотезу.
Для многих критериев Z с учетом законов их распределения калькуля-
тор распределения вероятности системы STATISTICA позволяет по най-
ти критические точки z
и наоборот (определить уровень значимости
кp
значения критерия Z). Степень значимости отличия сравниваемых законов
распределения или параметров распределения качественно определяется
по уровню значимости (Боровиков, 2003): не значимые ( ≥ 0,100), слабо
значимые (0,100 > ≥ 0,050), статистически значимые (0,050 > ≥ 0,010),
сильно значимые (0,010 > ≥ 0,001), высоко значимые (0,001 > ).
Рассмотрим проверку гипотезы о законе распределении.
Пусть дана
Проверяется гипотеза H
выборка наблюдений случайной величины Х: {x1, x2, , xn}.
, утверждающая, что Х имеет функцию распре-
0
деления F(x) или плотность распределения f(x). По выборке наблюдений находят оценки неизвестных параметров (если таковые есть) предполагаемого закона распределения случайной величины Х. Далее,
интервал возможных значений случайной величины Х разбивается
на k непересекающихся подынтервалов
36
, bi), i = 1,2,…,k – n. Чис-
i = (ai

ло k определяется с учетом эмпирической формулы k = 1+4lg(n). Пусть
p
j
– число элементов выборки, принадлежащих подынтервалу
n
i
k
видно, что
случайной величины Х, находят вероятности p
принадлежит подинтервалу
()()()()
nn
1
i
PX f xdx Fb Fa
ii ii
. Используя предполагаемый закон распределения
i
того, что значение Х
i
:
i
k
,
i
i
1
1
p
i
.
. Оче-
i
Далее вычисляют наблюденное статистическое значение критерия
по формуле
22
Н i
По теореме Пирсона величина
условии
min 5
np
i
i
) по закону (1.12)
k
i
k
()
nnp
1
ii
i
np
1
2
должна быть распределена (при
Н
2
2
. (1.19)
i
(см. рис. 1.9, 1.10) с k – L – 1
степенями свободы, где L – число неизвестных параметров распределения, оцениваемых по выборке, а сам критерий проверки гипотезы о соответствии эмпирического распределения теоретическому закону носит
название критерия Пирсона.
При заданном уровне значимости гипотезу о распределении Х по
закону
2
<
Н
F(x) отвергают, если
2
кр
, где
2
определяется с помощью калькулятора распределе-
кр
2
Н
ния вероятности (см. рис. 1.11) по закону
22
()
ды так, чтобы
P
кр
Н
.
>
2
, и нет оснований отвергать, если
кр
2
с k – L – 1 степенями свобо-
С учетом чувствительности критерия Пирсона к разбиению выборки на
онной формуле Лагранжа для N целочисленных точек k
к значению
α(k)
где α
k интервалов можно (k) вычислять, например, по интерполяци-
, ближайших
j
k,
1+4lg(n):
=
N
=
1
j
α(kj) вычисляется системой STATISTICA.
j =
( )...( )( )...( )
kk kk kk kk
j
( )...( )( )...( )
kk kk kk kk
111
111
jj N
jj jj jN
, (1.20)
Наряду с критерием Пирсона, основанным на сравнении эмпирических и теоретических частот, применяется также критерий Колмогорова – Смирнова, основанный на сравнении накопленных частот. В случае
37

критерия Колмогорова – Смирнова уровень значимости α
A
E
A
A
E
E
x
s
s
рассчиты-
K-S
вался приближенно (для 0,01 < α < 0,2 и n > 10) по формуле [4]
19 19
KS
2exp 1 18 1
22 62
22
nnd n
2
. (1.21)
n
Здесь D – статистическое значение критерия Колмогорова – Смирнова [25],
j
вычисляемое по формуле
max max
dd FF
jjj
, где
F
j
n
i
1
i
– вы-
n
борочная функция распределения (накопленные частоты), вычисленная
j
с учётом найденных выше частот
ция распределения, вычисленная с учетом найденных выше
n , а F
i
j =
– теоретическая функ-
i
1
ip
p
[25].
i
В качестве критерия соответствия эмпирического распределения
теоретическому нормальному закону распределения используют также
отношения коэффициентов асимметрии
и
ным отклонениям
соответственно:
t
=
1
,
t
A и эксцесса E к их стандарт-
=
2
(1.22)
Если эти отношения по абсолютной величине превышают 3, то гипотеза
о нормальном распределении отвергается.
Рассмотрим гипотезы о параметрах нормального или логнормального распределения. Пусть имеются две серии опытов, регистрирующих
значения некоторой случайной величины и определяющие две выборки
объемов n
и nY.
X
Рассмотрим сравнение двух дисперсий.
Рассмотрим тестирование гипотезы H
D
X = DY
при неизвестных математических ожиданиях. Пусть даны две
о равенстве дисперсий
0
случайные величины Х и Y, распределенные по нормальному закону.
По данным выборок объёмом n
правленные выборочные дисперсии
и nY соответственно подсчитаны ис-
X
2
и
2
. Требуется при заданном
y
уровне значимости проверить нулевую гипотезу, состоящую в том,
что D
X = DY
. Такая задача возникает при сравнении точности двух приборов, при сравнении различных методов измерений. Обычно выборочные дисперсии оказываются различными. Возникает вопрос: существенно или нет они различаются? Если различие незначимо, то
принимается нулевая гипотеза, следовательно, методы имеют одинако-
38

вую точность, а различие эмпирических дисперсий объясняется случай-
M
s
s
x
X
ными причинами, в частности случайным отбором объектов выборки.
По данным выборок объёмом n
тистическое значение критерия F
и nY вычисляют наблюденное ста-
X
, как отношение большей дисперсии к
Н
меньшей.
2
F
Н
Б
. (1.23)
2
Критическая область строится в зависимости от вида конкурирую-
щей гипотезы H
следующим образом: с помощью калькулятора рас-
1
пределения вероятности (см. рис. 1.14) по закону распределения Фише-
ра по заданному уровню значимости и вычисленным степеням
свободы k
для H
1
и k2 находят F
1
: DX DY. Если FН > Fкp, то H0 отвергают, а при FН < Fкp нет ос-
нований отвергать H
.
0
кp
(, k
, k2) для H1: DX > DY или F
1
(/2, k
кp
, k2)
1
Величина F удовлетворяет распределению (1.14) Фишера (см.
рис. 1.13–1.15) со степенями свободы: k
ема выборки с большей дисперсией и единицы, и k
, определенной разностью объ-
1
, определенной раз-
2
ностью объема выборки с меньшей дисперсией и единицы.
Рассмотрим сравнение математических ожиданий.
Для проверки подобия выборок (соответствия их распределению
одной и той же случайной величины) рассмотрим вопрос о значимости
расхождения между выборочными значениями математических ожиданий
ний m
и y: выдвинем в качестве H0 равенство математических ожида-
X = mY
. Тестирование такой гипотезы основано на нормальном
(1.10) распределении (см. рис. 1.4, 1.5) в случае большого объема выбо-
рок (n > 30), когда дисперсии считаются известными, и на распределе-
нии (1.13) Стьюдента (см. рис. 1.12) в случае малых выборок (n < 30),
когда дисперсии считаются неизвестными.
Рассмотрим первый случай. Для того чтобы проверить нулевую гипотезу H
нормальных выборок с известными дисперсиями D
: mX = mY о равенстве математических ожиданий двух больших
0
и DY, надо вычис-
X
лить наблюденное значение критерия
Z
Н
xy
Dn Dn
XYY
. (1.24)
Далее следует построить критическую область в зависимости
от конкурирующей гипотезы следующим образом.
При заданном уровне значимости и конкурирующей гипотезе H
mY (двусторонняя критическая область) или H1: mX > mY (mX < mY)
m
X
39
:
1

(односторонняя) с помощью калькулятора распределения вероятности
x
x
s
x
s
s
x
x
s
s
x
s
s
(см. рис. 1.6) по нормальному закону найти критическую точку z
Если Z
Если Z
< z
Н
> z
Н
, то нет оснований отвергать нулевую гипотезу.
кp
, то нулевую гипотезу отвергают.
кp
кp
.
Рассмотрим второй случай. Пусть имеются две выборки объёмов
n
и nY, на основании которых подсчитаны выборочные значения мате-
X
матических ожиданий
и
2
. Для того чтобы при заданном уровне значимости проверить
y
2
s
и y и исправленные выборочные дисперсии
нулевую гипотезу H
двух малых нормальных выборок с неизвестными дисперсиями D
D
, надо предварительно проверить гипотезу о равенстве дисперсий
Y
(1.23) по подсчитанным исправленным выборочным дисперсиям
2
и
. Если не будет оснований отвергать гипотезу о равенстве диспер-
y
: mX = mY о равенстве математических ожиданий
0
X
и
2
сий, то есть дисперсии хотя и неизвестны, но предполагаются одинаковыми, то надо вычислить наблюденное значение критерия
xy nnn n
T
Н
(1)(1)
nsns
XXYY
22
(2)
XY X Y
nn
XY
. (1.25)
Затем построить критическую область в зависимости от конкурирующей гипотезы следующим образом.
При конкурирующей гипотезе H
ская область) или H
: mX > mY (mX < mY) (односторонняя критическая
1
: mX mY (двусторонняя критиче-
1
область) с помощью калькулятора распределения вероятности (1.13)
Стьюдента (см. рис. 1.1) по заданному уровню значимости и числу степеней свободы k
Если T
Если T
< t
Н
> t
Н
+ nY – 2 найти критическую точку tкp.
= nX
, то нет оснований отвергать нулевую гипотезу.
кp
, то нулевую гипотезу отвергают.
кp
Вернемся ко второму случаю и рассмотрим далее второй вариант,
когда гипотеза о равенстве дисперсий (1.23) отвергается. Пусть имеются
две выборки объёмов n
рочные значения математических ожиданий
борочные дисперсии
и nY, на основании которых подсчитаны выбо-
X
и y и исправленные вы-
2
2
и
. Для того, чтобы при заданном уровне зна-
y
чимости
проверить нулевую гипотезу H0: mX = mY о равенстве
математических ожиданий двух малых нормальных выборок с неиз-
вестными дисперсиями D
и DY, надо предварительно проверить гипо-
X
тезу о равенстве дисперсий (1.23) по подсчитанным исправленным выборочным дисперсиям
2
и
2
. Пусть гипотеза о равенстве дисперсий
y
40
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
