Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Многомерный статистический анализ эколого-геохимических измерений. Часть I. Математические основы. Учебное пособие

.pdf
Скачиваний:
0
Добавлен:
07.09.2026
Размер:
1 Мб
Скачать
Другим способом представления эмпирического закона распреде-
p
x
x
x
x
x
x
x
x
p
p
p
ления являются накопленные частоты
j
n
(или
i
i
1
j
накопленные
i
i
1
относительные частоты):
Таблица 1.7
Группированный статистический ряд накопленных частот Х
j–1
in
ip
j
j
1
1
j
i
i
0
1
n
n
1
р1+р2 … 1
р
1
1
2
1+n2
k–1
k
k
n
i
i
1
Накопленные относительные частоты порождают эмпирическую функцию распределения – оценку функции распределения дискретной
случайной величины Х, вычисляемую по формуле (1.2)
j
F(х) =
i
i
1
и являющуюся разрывной ступенчатой, равной нулю левее наименьше­го наблюдаемого значения, испытывающей скачок величиной р
при пе-
j
реходе через левую границу j-го интервала и в итоге достигающей еди­ницы правее наибольшего наблюдаемого значения.
Система STATISTICA [6, 7, 39] позволяет по выборке микроэле-
мента (см. приложение 1) построить таблицу частот n
(например, для La
см. табл. 1.8), а также нарисовать гистограммы час-
И
, pj,
j
i
j
n
1
j
и
i
i
i
1
тот (см. рис. 1.16).
Таблица 1.8
Частоты распределения содержания La
И
j
j
Интервалы
n
j
n
i
1
pj, %
i
j
, %
i
i
1
1 10,0 < x 15,0 1 1 1,0989 1,0989
2 15,0 < x 20,0 8 9 8,7912 9,8901
31
Окончание табл. 1.8
p
j
Интервалы
j
n
j
i
1
in
pj, %
j
, %
i
1
ip
3 20,0 < x 25,0 19 28 20,8791 30,7692
4 25,0 < x 30,0 35 63 38,4615 69,2308
Интервалы
j
nj
j
1
in
, %
j
i
j
, %
i
1
ip
5 30,0 < x 35,0 25 88 27,4725 96,7033
6 35,0 < x 40,0 2 90 2,1978 98,9011
7 40,0 < x 45,0 1 91 1,0989 100,0000
91 100,0000
Гистограммы частот n
и
j
in
Переменная: La
40 35 30 25 20 15 10
5
Количество наблюдений
0
10 15 20 25 30 35 40 45
Категории
Рис. 1.16. Гистограмма частот
nj распределения LaИ
И
j
имеет вид (рис. 1.16):
i
1
Переменная: La
И
100
80
60
40
20
Количество наблюдений
0
10 15 20 25 30 35 40 45
Категории
Рис. 1.16*. Гистограмма
накопленных частот распределения La
И
32
Характеристики случайной величины, построенные на основании
K
x
x
s
s
выборочных данных, называются выборочными или точечными оцен­ками. Свойства случайной величины могут характеризоваться различ-
ными начальными и центральными моментами, вычисляемыми в случае дискретной случайной величины по формулам:
i
K
p
ii
i
K
.
p 
1
= mX
и
Начальный момент порядка K:
Центральный момент порядка K:
Ki i
Важнейшие из них – математическое ожидание М(Х) дисперсия D(Х)
2(Х), где черезобозначено стандартное откло-
=
нение, – являются частными случаями моментов:
,
D
x
1
 , D (1.16)
2
Выделяют также несмещенную выборочную дисперсию
n
Если
выборочное математическое ожидание случайной величины
2
D
. (1.17)
n
1
дает нам «её среднее значение» или точку на координатной прямой, «вокруг которой разбросаны» значения рассматриваемой случайной ве-
личины, то значений случайной величины
выборочная дисперсия характеризует «степень разброса»
Х.
Используются также оценки коэффициента асимметрии (1.8)
A
3
3
и коэффициента эксцесса (1.9)
4
3E
как степени отклоне-
4
s
ния полигона частот от плотности нормального распределения непре­рывной случайной величины, для которой они равны нулю.
Система STATISTICA позволяет по выборке микроэлемента вы­числить точечные оценки, например, для La
Выборочные числовые характеристики распределения содержания LaИ.
:
И
Таблица 1.9
s A E
n
LaИ
x
91 27,02527 5,039656 –0,205849 0,082287
Выборочные числовые характеристики или точечные оценки слу­чайной величины – приближенные значения параметров распределения. Чтобы охарактеризовать погрешность этих значений, нужно указать
33
граничные значения, за которые не выходит оцениваемый параметр.
x
x
x
x
x
x
Поскольку все расчёты производятся на основании случайных результа­тов опыта, то и граничные значения – также случайные величины. Та­ким образом, речь идёт о построении интервала со случайными грани­цами, который с заданной вероятностью содержал бы неизвестное значение параметра распределения.
Для определения погрешности полученных
значений используют
интервальные оценки, применяя понятие «доверительного интер­вала» – интервала, внутри которого параметр, как ожидается, найдёт-
ся с некоторой доверительной вероятностью (надежностью) . Иногда вместо используют величину ,
1 – , называемую уровнем зна-
=
чимости.
Рассмотрим нахождение доверительного интервала для математи­ческого ожидания m
Ширина 2 такого интервала (
носительно
выборочного значения mx, – находится из условия
()Px x
причем сама вероятность
ления Стьюдента (1.13) со степенью свободы k неизвестна, а лишь подсчитано ее несмещенное значение
. По заданным
t
);( kxF
нормально распределенной случайной величины.
x
-,x+), обладающего симметрией от-
 , (1.18)
()Px x
=

определяется законом распреде-
n – 1, если дисперсия
=
р и числу степеней свободы (ст. св.) k
2
s
калькулятор распределения вероятности распределения Стьюдента (см. рис. 1.13) позволяет найти соответствующее значение t
ловия x
 =
доверительный интервал (
/ns
можно найти
=
/xsn. В результате можно построить
, x+ ), содержащий параметр m
= x
. Из ус-
с веро-
x
ятностью согласно (1.18).
:
В случае с La
Тогда
=
держащий параметр m
при
И
= р =
0,95 имеем t = x = 1,986675 (рис. 1.17).
1,04955 и доверительный интервал (25,9757; 28,0748), со-
с вероятностью (надежностью)
x
0,95. Иными
=
словами, погрешность вычисления математического ожидания по при­ближенному значению
не значимости
Величина
и равна при x
0,68 при k = 90.
=
0,05.
=
/sn
=
1, чему соответствует не очень высокая надежность
=
Практически доверительный интервал (
27,02527 не превышает
=
0,5283 называется стандартной ошибкой Х
, x+ ) можно постро-
ить с помощью точечных оценок распределения содержания La из табл. 1.9
27,02527; s = 5,039656 и значения t = x = 1,986675
=
34
1,04956 при уров-
=
И
(см. рис. 1.17), позволяющих рассчитать радиус доверительного интер-
x
вала
=
/xsn и, как следствие, его границы
.
Рис. 1.17. Доверительный интервал для mx распределения La
И
1.2.2. Проверка статистических гипотез
Во многих случаях результаты наблюдений используются для про­верки предположений (гипотез) относительно тех или иных свойств распределения случайной величины. В частности, такого рода задачи возникают при сравнении методов обработки по определённым изме­ряемым признакам и т. д.
К основным задачам математической статистики относится стати­стическая проверка гипотез о законах распределения и
о параметрах распределения случайной величины. При исследовании различных слу­чайных величин на определённом его этапе появляется возможность выдвинуть ту или иную гипотезу о свойствах изучаемой величины, на­пример, сделать предположение о законе распределения её, или, если закон распределения известен, но неизвестен его параметр, то сделать предположение о его значении. Наиболее соображениям гипотезу называют нулевой (основной) и обозначают
правдоподобную по каким-то
H
0
Наряду с основной гипотезой рассматривают другую (альтернативную)
H
гипотезу
, противоречащую основной. Выдвинутая нулевая гипотеза
1
нуждается в дальнейшей проверке. При этом могут быть допущены ошибки двух типов:
ошибка первого рода – отвергнута правильная гипотеза, ошибка второго рода – принята неправильная гипотеза.
.
35
Вероятность совершить ошибку первого рода (вероятность отверг-
нуть правильную гипотезу) обычно обозначают и называют уровнем
значимости. Случайную величину Z, служащую для проверки гипоте­зы, называют критерием. Совокупность значений критерия, при кото­рых нулевую гипотезу отвергают, называют критической областью. Граничные точки критической области z
называют критическими
kp
точками. Различают три вида критической области:
правосторонняя, определяемая неравенством Z > zлевосторонняя, определяемая неравенством Z < zдвусторонняя, определяемая неравенством Z < z
> 0;
kp
< 0;
kp
< z2 < Z. В частно-
1
сти, если критические точки симметричны относительно нуля, то
двусторонняя критическая область имеет вид Z > z
> 0.
kp
При отыскании критической области задаются уровнем значимости
и ищут критические точки, исходя из требования, чтобы вероятность
того, что критерий Z примет значения, лежащие в критической области, была равна принятому уровню значимости. В результате получаем
для правосторонней критической области P(Z > zдля левосторонней критической области P(Z < zдля двусторонней симметричной области P(Z > z
кp) =
кp) =
кp) =
;
;
/2.
Основной принцип статистической проверки гипотез заключается в
следующем: если наблюдаемое значение критерия Z
, вычисленное
набл
по данным выборки, принадлежит критической области, то гипотезу от­вергают; если наблюдаемое значение не принадлежит критической об­ласти, то нет оснований отвергать гипотезу.
Для многих критериев Z с учетом законов их распределения калькуля-
тор распределения вероятности системы STATISTICA позволяет по най-
ти критические точки z
и наоборот (определить уровень значимости
кp
значения критерия Z). Степень значимости отличия сравниваемых законов распределения или параметров распределения качественно определяется
по уровню значимости (Боровиков, 2003): не значимые ( ≥ 0,100), слабо значимые (0,100 > ≥ 0,050), статистически значимые (0,050 > ≥ 0,010), сильно значимые (0,010 >  ≥ 0,001), высоко значимые (0,001 > ).
Рассмотрим проверку гипотезы о законе распределении. Пусть дана
Проверяется гипотеза H
выборка наблюдений случайной величины Х: {x1, x2, , xn}.
, утверждающая, что Х имеет функцию распре-
0
деления F(x) или плотность распределения f(x). По выборке наблюде­ний находят оценки неизвестных параметров (если таковые есть) пред­полагаемого закона распределения случайной величины Х. Далее,
интервал возможных значений случайной величины Х разбивается на k непересекающихся подынтервалов
36
, bi), i = 1,2,…,k – n. Чис-
i = (ai
ло k определяется с учетом эмпирической формулы k = 1+4lg(n). Пусть
p
j
число элементов выборки, принадлежащих подынтервалу
n
i
k
видно, что
случайной величины Х, находят вероятности p
принадлежит подинтервалу
()()()()
nn
1
i
PX f xdx Fb Fa
  
ii ii
. Используя предполагаемый закон распределения
i
того, что значение Х
i
:
i
k
,
i
i
1
1
p
i
.
. Оче-
i
Далее вычисляют наблюденное статистическое значение критерия
по формуле
22
 
Н i
По теореме Пирсона величина
условии
min 5
np
i
i
) по закону (1.12)
k
i
k
()
nnp
1
ii
i
np
1
2
должна быть распределена (при
Н
2
2
. (1.19)
i
(см. рис. 1.9, 1.10) с k – L – 1
степенями свободы, где L – число неизвестных параметров распределе­ния, оцениваемых по выборке, а сам критерий проверки гипотезы о со­ответствии эмпирического распределения теоретическому закону носит название критерия Пирсона.
При заданном уровне значимости гипотезу о распределении Х по
закону
2
<
Н
F(x) отвергают, если
2
кр
, где
2
определяется с помощью калькулятора распределе-
кр
2
Н
ния вероятности (см. рис. 1.11) по закону
22
()
ды так, чтобы
P
 
кр
Н
.
>
2
, и нет оснований отвергать, если
кр
2
с k – L – 1 степенями свобо-
С учетом чувствительности критерия Пирсона к разбиению выбор­ки на онной формуле Лагранжа для N целочисленных точек k
к значению
α(k)
где α
k интервалов можно (k) вычислять, например, по интерполяци-
, ближайших
j
k,
1+4lg(n):
=
N
=
1
j
α(kj) вычисляется системой STATISTICA.
j =
( )...( )( )...( )
kk kk kk kk
 
j
( )...( )( )...( )
kk kk kk kk
111
 
111

jj N
jj jj jN

, (1.20)
Наряду с критерием Пирсона, основанным на сравнении эмпириче­ских и теоретических частот, применяется также критерий Колмогоро­ва – Смирнова, основанный на сравнении накопленных частот. В случае
37
критерия КолмогороваСмирнова уровень значимости α
A
E
A
A
E
E
x
s
s
рассчиты-
K-S
вался приближенно (для 0,01 < α < 0,2 и n > 10) по формуле [4]

19 19
  
KS
2exp 1 18 1
 

     
22 62
  
22
nnd n
2
. (1.21)
n
Здесь D – статистическое значение критерия КолмогороваСмирнова [25],
j
вычисляемое по формуле
max max
dd FF
 
jjj
, где
F
j
n
i
1
i
вы-
n
борочная функция распределения (накопленные частоты), вычисленная
j
с учётом найденных выше частот
ция распределения, вычисленная с учетом найденных выше
n , а F
i
j =
теоретическая функ-
i
1
ip
p
[25].
i
В качестве критерия соответствия эмпирического распределения теоретическому нормальному закону распределения используют также отношения коэффициентов асимметрии
и
ным отклонениям
соответственно:
t
=
1
,
t
A и эксцесса E к их стандарт-
=
2
(1.22)
Если эти отношения по абсолютной величине превышают 3, то гипотеза о нормальном распределении отвергается.
Рассмотрим гипотезы о параметрах нормального или логнормаль­ного распределения. Пусть имеются две серии опытов, регистрирующих значения некоторой случайной величины и определяющие две выборки объемов n
и nY.
X
Рассмотрим сравнение двух дисперсий.
Рассмотрим тестирование гипотезы H
D
X = DY
при неизвестных математических ожиданиях. Пусть даны две
о равенстве дисперсий
0
случайные величины Х и Y, распределенные по нормальному закону. По данным выборок объёмом n
правленные выборочные дисперсии
и nY соответственно подсчитаны ис-
X
2
и
2
. Требуется при заданном
y
уровне значимости проверить нулевую гипотезу, состоящую в том,
что D
X = DY
. Такая задача возникает при сравнении точности двух при­боров, при сравнении различных методов измерений. Обычно выбороч­ные дисперсии оказываются различными. Возникает вопрос: сущест­венно или нет они различаются? Если различие незначимо, то принимается нулевая гипотеза, следовательно, методы имеют одинако-
38
вую точность, а различие эмпирических дисперсий объясняется случай-
M
s
s
x
X
ными причинами, в частности случайным отбором объектов выборки.
По данным выборок объёмом n
тистическое значение критерия F
и nY вычисляют наблюденное ста-
X
, как отношение большей дисперсии к
Н
меньшей.
2
F
Н
Б
. (1.23)
2
Критическая область строится в зависимости от вида конкурирую-
щей гипотезы H
следующим образом: с помощью калькулятора рас-
1
пределения вероятности (см. рис. 1.14) по закону распределения Фише-
ра по заданному уровню значимости и вычисленным степеням
свободы k для H
1
и k2 находят F
1
: DX  DY. Если FН > Fкp, то H0 отвергают, а при FН < Fкp нет ос-
нований отвергать H
.
0
кp
(, k
, k2) для H1: DX > DY или F
1
(/2, k
кp
, k2)
1
Величина F удовлетворяет распределению (1.14) Фишера (см. рис. 1.13–1.15) со степенями свободы: k ема выборки с большей дисперсией и единицы, и k
, определенной разностью объ-
1
, определенной раз-
2
ностью объема выборки с меньшей дисперсией и единицы.
Рассмотрим сравнение математических ожиданий.
Для проверки подобия выборок (соответствия их распределению одной и той же случайной величины) рассмотрим вопрос о значимости расхождения между выборочными значениями математических ожида­ний
ний m
и y: выдвинем в качестве H0 равенство математических ожида-
X = mY
. Тестирование такой гипотезы основано на нормальном
(1.10) распределении (см. рис. 1.4, 1.5) в случае большого объема выбо-
рок (n > 30), когда дисперсии считаются известными, и на распределе- нии (1.13) Стьюдента (см. рис. 1.12) в случае малых выборок (n < 30), когда дисперсии считаются неизвестными.
Рассмотрим первый случай. Для того чтобы проверить нулевую ги­потезу H нормальных выборок с известными дисперсиями D
: mX = mY о равенстве математических ожиданий двух больших
0
и DY, надо вычис-
X
лить наблюденное значение критерия
Z
Н
xy
Dn Dn
XYY
. (1.24)
Далее следует построить критическую область в зависимости от конкурирующей гипотезы следующим образом.
При заданном уровне значимости и конкурирующей гипотезе H
 mY (двусторонняя критическая область) или H1: mX > mY (mX < mY)
m
X
39
:
1
(односторонняя) с помощью калькулятора распределения вероятности
x
x
s
x
s
s
x
x
s
s
x
s
s
(см. рис. 1.6) по нормальному закону найти критическую точку z
Если Z
Если Z
< z
Н
> z
Н
, то нет оснований отвергать нулевую гипотезу.
кp
, то нулевую гипотезу отвергают.
кp
кp
.
Рассмотрим второй случай. Пусть имеются две выборки объёмов n
и nY, на основании которых подсчитаны выборочные значения мате-
X
матических ожиданий
и
2
. Для того чтобы при заданном уровне значимости проверить
y
2
s
и y и исправленные выборочные дисперсии
нулевую гипотезу H двух малых нормальных выборок с неизвестными дисперсиями D
D
, надо предварительно проверить гипотезу о равенстве дисперсий
Y
(1.23) по подсчитанным исправленным выборочным дисперсиям
2
и
. Если не будет оснований отвергать гипотезу о равенстве диспер-
y
: mX = mY о равенстве математических ожиданий
0
X
и
2
сий, то есть дисперсии хотя и неизвестны, но предполагаются одинако­выми, то надо вычислить наблюденное значение критерия
xy nnn n
T
Н
(1)(1)
nsns

XXYY

22
(2)
XY X Y
nn
XY
. (1.25)
Затем построить критическую область в зависимости от конкури­рующей гипотезы следующим образом.
При конкурирующей гипотезе H ская область) или H
: mX > mY (mX < mY) (односторонняя критическая
1
: mX  mY (двусторонняя критиче-
1
область) с помощью калькулятора распределения вероятности (1.13) Стьюдента (см. рис. 1.1) по заданному уровню значимости и числу сте­пеней свободы k
Если T
Если T
< t
Н
> t
Н
+ nY – 2 найти критическую точку tкp.
= nX
, то нет оснований отвергать нулевую гипотезу.
кp
, то нулевую гипотезу отвергают.
кp
Вернемся ко второму случаю и рассмотрим далее второй вариант, когда гипотеза о равенстве дисперсий (1.23) отвергается. Пусть имеются две выборки объёмов n рочные значения математических ожиданий
борочные дисперсии
и nY, на основании которых подсчитаны выбо-
X
и y и исправленные вы-
2
2
и
. Для того, чтобы при заданном уровне зна-
y
чимости
проверить нулевую гипотезу H0: mX = mY о равенстве
математических ожиданий двух малых нормальных выборок с неиз-
вестными дисперсиями D
и DY, надо предварительно проверить гипо-
X
тезу о равенстве дисперсий (1.23) по подсчитанным исправленным вы­борочным дисперсиям
2
и
2
. Пусть гипотеза о равенстве дисперсий
y
40
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]