Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Математическая статистика. Учебное пособие по курсу «Теория вероятностей и математическая статистика»

.pdf
Скачиваний:
0
Добавлен:
12.08.2026
Размер:
826 Кб
Скачать

D0 D1

0

0.2

0.6

Рис. 2.8. Допустимая и критическая области принятия решения

Таким образом, Н0 принимается, если значение U = |m/100 – 0.6| 0.2, и отвергается, если U > 0.2. Области D0 и D1 показаны на рис. 2.8.

Выборка S является случайной, поэтому и значение U(S , H0) является случайной величиной. Следовательно, принятие или отклонение гипотезы – случайные события, поэтому при проверке гипотез возможны следующие ошибки.

1.Гипотеза верна, но отвергается (ошибка первого рода).

2.Гипотеза неверна, но принимается (ошибка второго рода).

Вероятность ошибки первого рода называют уровнем значимости критерия. Таким образом, уровень значимости есть вероятность отвергнуть

истинную гипотезу.

Если – вероятность ошибки второго рода, то 1 – называется мощностью критерия. Это вероятность отвержения неверной гипотезы.

Вероятности обеих ошибок желательно минимизировать, но оказывается, что попытка уменьшить вероятность одной ошибки приводит к увеличению вероятности другой. Поэтому вероятность одной из ошибок задается, а вероятность второй ошибки стараются сделать минимальной.

2.7. Критерий хи-квадрат

Чаще всего для проверки гипотез о законах распределения применяется критерий согласия χ2 (хи-квадрат), предложенный К. Пирсоном. Рассмотрим этот критерий.

Пусть имеется группированная выборка S и выдвинута гипотеза H0, что случайная величина Х имеет функцию распределения F(x). Если бы гипотеза Н0 была верна, то вероятность попадания значения Х в i-й

частичный интервал [ai ; ai+1) была бы равна

 

Pi = F(ai+1) – F(ai) ,

(2.27)

- 21 -

Fr(x)

а математическое ожидание числа попаданий Х в этот полуинтервал, то есть

ожидаемая или теоретическая частота, была бы равна

ni = nРi ,

(2.28)

где n = m1 + m2 + … + mk. Критерий χ2 оценивает меру расхождения

теоретических nPi и статистических (или выборочных) частот m i:

χ 2 = mi

- nPi

2

(2.29)

.

 

k

 

 

 

 

i=1

nPi

 

 

Чем больше отличаются mi

от nPi, тем больше значение χ 2 .

 

Замечание 1. Границы теоретического распределения могут

отличаться от границ a1

и ak 1

гистограммы. Например,

нормальная

случайная величина распределена на всей числовой прямой. Поэтому при вычислении вероятностей по формуле (2.27) левая граница a1 первого частичного интервала полагается равной левой границе теоретического распределения, а правая граница ak 1 последнего частичного интервала –

правой границе теоретического распределения. Гистограмму при этом переделывать не нужно.

К. Пирсон доказал, что при истинности гипотезы H0 распределение случайной величины (2.29) при n неограниченно приближается к так называемому 2-распределению (хи-квадрат распределению), независимо от вида распределения F(x). Это приближение к 2-распределению можно считать удовлетворительным, если все частоты mi достаточно велики. Будем

поэтому предполагать, что все mi .

Распределением хи-квадрат с r степенями свободы называется распределение случайной величины, равной сумме квадратов r независимых стандартных нормальных величин. Функция распределения вероятностей случайной величины 2 полностью определяется числом степеней свободы r, в зависимости от которого и составляются таблицы этой функции.

Следует отметить, что между теоретическими частотами ni = nPi и статистическими частотами mi имеются некоторые связи. Одна связь имеется всегда:

n1 + n2 + … + nk = m1 + m2 + … + mk = n .

(2.30)

- 22 -

Другие связи появляются при оценке параметров теоретического распределения по выборке. Если, например, приравнены теоретическое и выборочное средние, то имеется одна дополнительная связь. Если приравнены еще и дисперсии, то дополнительных связей будет две. Эти связи приводят к зависимости слагаемых в выражении (2.29) между собой.

Наличие связей учитывается определением числа независимых слагаемых в выражении (2.29), называемом числом степеней свободы, которое определяется по формуле:

r = k – 1 – s ,

(2.31)

где k – число частичных интервалов группированной выборки, s – число дополнительных связей (кроме связи (2.30)) между теоретическим распределением и выборкой. Число s равно количеству параметров теоретического распределения, определенных именно по выборке. В это число не входят параметры, определенные по каким-либо соображениям независимо от выборки. Например, может быть известно заранее, что X имеет нулевое математическое ожидание. Тогда при гипотезе о нормальном распределении будет наложена только одна дополнительная связь – приравниваются теоретическая и выборочная дисперсии. Дополнительных связей может и вообще не быть (s = 0), если, к примеру, без предварительного анализа выборки (или даже до ее получения) выдвинуть гипотезу о теоретическом распределении с фиксированными значениями входящих в него параметров.

Пусть число степеней свободы r определено. Допустим, что 2α удовлетворяет равенству: Fr( χα2 ) = 1 . Это означает, что

P( χα2 ) = , (2.32)

то есть вычисленное по формуле (2.29) значение (в случае истинности

гипотезы Н0) превосходит значение χα2

с вероятностью .

 

 

 

 

 

 

Таким образом, если гипотезу

Н0 принимать в случае

 

 

 

χ

2

и

 

α

отвергать при > χα2 , то верная

гипотеза Н0 будет отвергаться

с

вероятностью , то есть является уровнем значимости сформулированного критерия. Критические значения χα2 даны в Приложении 2 в зависимости от

уровня значимости и числа степеней свободы r.

Итак, применение критерия сводится к следующему. Выбирается (или задается) уровень значимости . По группированной выборке с частотами mi (все они не менее шести) вычисляется значение по формуле (2.29). Отметим, что, если в имеющейся группированной выборке

- 23 -

встречаются частоты, которые меньше шести, то следует объединить некоторые соседние интервалы, чтобы все частоты mi были не менее шести. По найденному числу степеней свободы r и заданному находится

критическое значение χα2 из таблицы в Приложении 2. И, наконец, применяется решающее правило:

χα2 принимается,

(2.33)

χα2 отвергается.

Если некоторая гипотеза о теоретическом распределении F(x) в результате применения критерия была принята, то F(x) может использоваться в дальнейшем для решения различных задач о случайной величине Х (но до тех пор, пока не будут получены экспериментальные данные, которым гипотеза Н0 противоречит). Если же Н0 оказалась отвергнутой, то следует подобрать и проверить гипотезу о другом теоретическом распределении, которая выглядит достаточно правдоподобно на фоне имеющихся экспериментальных данных.

Замечание 2. Если гипотеза H0 оказалось принятой, то это еще не значит, что она верна, так как имеется некоторая вероятность ошибки второго рода (принять неверную гипотезу). Гипотеза H0 принята не потому, что она верна (так это или не так, нам неизвестно), а потому, что она выглядит правдоподобной при имеющейся выборке S. Аналогично, если гипотеза H0 отвергнута, то не следует категорически утверждать, что она ложна, так как возможна ошибка первого рода (отвергнуть верную

гипотезу). Уровень значимости и есть вероятность такой ошибки. Мы отвергаем гипотезу потому, что она выглядит неправдоподобной при имеющихся наблюдениях, то есть выборке S. Напомним, что ошибки в проверке гипотез проистекают из-за случайности значений выборки, так как эти значения – результаты испытаний случайной величины.

Разумеется, есть еще один источник ошибок при тестировании гипотез

– погрешности производимых вычислений, но в теории предполагается, что все вычисления делаются квалифицированным персоналом без ошибок.

Следует отметить, что определяемое по данному уровню значимости критическое значение χα2 содержит некоторую погрешность, так как

распределение величины (2.29) несколько отличается от распределения . Это отличие вызвано конечностью объема выборки и способом выбора значений параметров теоретического распределения. Более корректным в данной ситуации является метод минимума , состоящий в том, что параметры теоретического распределения выбираются так, чтобы величина (2.29) приняла минимально возможное значение. Однако этот метод трудно реализуем и поэтому применяется редко.

- 24 -

3. СИСТЕМЫ СЛУЧАЙНЫХ ВЕЛИЧИН. ЛИНЕЙНАЯ СРЕДНЕКВАДРАТИЧЕСКАЯ РЕГРЕССИЯ

В предыдущих разделах две случайные величины X и Y рассматривались отдельно друг от друга, для чего совместная выборка (2.1) была разделена на две индивидуальные (2.2) и (2.3). Перейдем теперь к совместному анализу величин X и Y, рассматривая их как систему случайных величин (X , Y).

Система двух (мы будем рассматривать только этот случай) случайных величин (X, Y) полностью характеризуется в теоретическо-вероятностном

смысле совместной функцией распределения

Fxy(x , y) = P(X x ; Y y) ,

(3.1)

которая при любых х и y равна вероятности того, что произойдут оба события X x и Y y. Ранее рассмотренные функции распределения

Fx(x) = P(X x) и Fy(y) = P(Y y)

(3.2)

отдельно друг от друга взятых величин Х и Y называются частными

функциями распределения, при этом

 

Fx(x) = Fxy(x , + ) и Fy(y) = Fxy(+ , y) .

(3.3)

Система (X, Y) может быть определена также совместной плотностью распределения вероятностей fxy(x, y), которая связана с частными плотностями распределения вероятностей fx(x) и fy(y) равенствами [1, 2]:

 

+

 

 

 

fx(x) =

fxy x, y dy ,

fy(y) = fxy x, y dx .

(3.4)

 

-

 

 

 

 

x

y

 

 

 

 

 

Fxy(x, y) =

fxy u, v dudv ,

(3.5)

 

 

 

 

 

 

 

 

 

2F (x, y)

 

 

fxy(x, y) =

xy

 

.

(3.6)

 

x

 

 

 

 

y

 

Систему

случайных величин (X,

Y) можно рассматривать

как

случайную точку на плоскости со случайными координатами Х и Y. Если х

- 25 -

и y – стороны прямоугольника R (рис. 3.1), содержащего точку (x0, y0), то вероятность попадания случайной точки (X , Y) в R эквивалентна

fxy(x0 , y0) x y

при стремлении х и y к нулю. Из этого следует, что вероятность попадания (X, Y) в область D на плоскости (рис. 3.1) может быть найдена по формуле

P((x, y) D) = fxy (x, y)dxdy .

(3.7)

D

 

Таким образом, если результат каждого i-го наблюдения (xi , yi ) системы случайных величин (Х , Y) отмечать точкой на плоскости, то полученные точки с большей вероятностью будут попадать в те области плоскости, где больше значения функции fxy(x, y). Отсюда и название функции – плотность распределения вероятностей.

y

y (x0 , y0)

x

D

0

x

Рис. 3.1. Геометрическое представление системы случайных

величин (X, Y) на плоскости

В результате (при большом объеме выборки) полученные точки будут расположены гуще, плотнее в областях больших значений fxy(x, y). На рис. 3.2 приведен пример такого распределения точек на плоскости.

Создается впечатление, что точки группируются вдоль некоторой прямой, изображенной на рисунке пунктиром. Это наводит на мысль о том, что зависимость случайной величины Y от величины Х может быть приближенно выражена линейным уравнением y = ax + b. При этом параметры этого уравнения нужно подобрать так, чтобы это уравнение описывало зависимость между Х и Y «как можно точнее».

- 26 -

Y

0

X

Рис. 3.2. Пример возможного распределения случайных точек на плоскости

Линейной среднеквадратической регрессией Y на X называется

уравнение

(3.8)

y = ax + b

со значением параметров a и b, при которых функция

 

(a, b) = M[((aX + b) –Y)2]

(3.9)

принимает минимальное значение. Другими словами, среди всех прямых вида y = ax + b выбирается та, для которой ((ax + b) – y)2 в среднем имеет наименьшее значение, то есть минимален средний квадрат отклонения Y от

aX + b.

Приравнивая к нулю частные производные функции

(a, b) = M[Y2] + a2M[X2] + b2 – 2 a M[X Y] – 2 b my + 2 a b mx

и решая полученную систему уравнений, находим точку минимума:

 

 

a = ρ

σ

y

; b = my ρ

σy

mx ,

(3.10)

 

 

 

 

 

 

 

σx

 

 

 

 

 

 

σx

 

 

где mx и my – математические ожидания X и

Y; σx2 и σy2 – дисперсии X и

Y,

 

 

 

 

 

 

 

 

=

K xy

; Kxy = M[XY] – mxmy = M[(X – mx)(Y – mx)].

(3.11)

 

 

σxσy

 

 

 

 

 

 

Таким образом, уравнением линейной среднеквадратической регрессии Y на X будет:

- 27 -

 

 

y =

σy

(x – mx) + my .

(3.12)

 

 

 

 

 

 

 

σx

 

Аналогично, из условия минимума:

 

 

 

M[( Y + – X)2]

(3.13)

получаем уравнение линейной среднеквадратической регрессии X на Y:

 

 

x =

σx

(y – my) + mx .

(3.14)

 

 

 

 

 

σy

 

 

Замечание 1. Разрешим уравнение (3.12)

относительно x:

x =

σx

(y my ) + mx , что отличается от (3.14). Поэтому выражения (3.12)

 

 

ρσy

 

и (3.14) определяют, вообще говоря, разные прямые. Объясняется это тем, что в выражении (3.9) расстояние между Y и aX + b измеряются вдоль оси Y, то есть по вертикали, а в выражении (3.13) расстояние между Х и Y + измеряется вдоль оси х, то есть по горизонтали.

Число Кxy в выражении (3.11) называется ковариацией случайных величин X и Y, а число = Kxy σx σy – их коэффициентом корреляции.

Отметим, что для любой системы случайных величин коэффициент корреляции удовлетворяет соотношению –1 1 и служит мерой точности линейной связи между Х и Y.

Замечание 2. Уравнение регрессии y = ax + b означает, что при значении величины X = x величина Y в среднем (приблизительно) равна ax+b. Кроме того, при увеличении X на единицу значение Y изменяется в среднем на a.

Если = 0, то Х и Y называются некоррелированными. В частности,

некоррелированными являются независимые случайные величины. При = 0 из выражений (3.12) и (3.14) получаем y = my и x = mx, то есть эти уравнения показывают, что линейной зависимости (даже приближенной) между X и Y нет. Напротив, если = 1, то уравнения (3.12) и (3.14) выражают точную (не приближенную) зависимость. В этом случае мы имеем жесткую линейную связь между Х и Y, а все точки (xi , yi ) будут лежать на прямой y = ax + b. Остальные случаи являются промежуточными. Чем ближе | | к единице, тем более выражена линейная связь между X и Y. Если 0, то угловой коэффициент в уравнении прямых регрессии положителен. Это означает, что с ростом одной из величин и другая в среднем увеличивается. Говорят, что между X и Y корреляция положительна. Соответственно, при

- 28 -

отрицательной корреляции ( 0) увеличение одной из величин ведет в среднем к уменьшению другой. Положительная корреляция имеет место, например, между ростом и весом людей, а отрицательная между успеваемостью и продолжительностью досуга учащихся.

На рис. 3.3 приведены различные возможные графики линейной регрессии при различных значениях коэффициента корреляции.

Y Y

<0

 

>0

 

 

0

X

0

X

Y

=+1

Y

 

 

 

=0

 

 

 

= –1

0

X

0

X

Рис. 3.3. Графики линейной регрессии при 0, 0, = 1, = 0

- 29 -

4. СТАТИСТИЧЕСКИЙ АНАЛИЗ НАБЛЮДЕНИЙ СИСТЕМЫ ДВУХ СЛУЧАЙНЫХ ВЕЛИЧИН

4.1.Выборочная линейная среднеквадратическая регрессия

Вуравнении регрессии (3.11) и (3.13) входят mx, my, x, y и , которые можно найти, если известна совместная функция распределения Fxy(x , y) или плотность fxy(x, y). Если же имеется только выборка, то точные значения указанных величин приходится заменять их оценками, рассмотренными в подразделе 2.3. Для оценки ковариации по выборке применяется формула

 

 

n

1

n

 

 

 

Kxy

=

 

 

 

 

xi yi mx my

 

,

(4.1)

n 1

 

 

 

n i=1

 

 

 

откуда получаем оценку коэффициента корреляции:

 

ρ Kxy

(σx σy ).

(4.2)

Отметим, что при больших n коэффициентом n n 1

в (4.1) можно

пренебречь.

 

 

Таким образом, окончательно получаем выборочные уравнения

линейной среднеквадратической регрессии Y на X:

 

y = *

σy

(x – mx ) + my

(4.3)

σ

и X на Y:

 

x

 

 

 

σx

 

 

 

x = *

 

 

(4.4)

 

 

 

(y – my

) + mx .

σ

 

 

 

 

 

 

y

 

 

 

Отметим также, что прямые (4.3) и (4.4) получены по выборке, поэтому они, вообще говоря, отличаются от прямых (3.11) и (3.12). Однако

сходимость оценок mx , my , σx , σy , * к их точным значениям при n

обеспечивает сходимость выборочных уравнений регрессии (4.3) и (4.4) к (3.12) и (3.14). Уравнения (4.3) и (4.4) можно получить другим способом, применяя метод наименьших квадратов из условия минимума средних квадратов отклонений точек выборки (xi , yi ) от линии регрессии y = ax + b

или от линии x = y + :

- 30 -

Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]