Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Математическая статистика и анализ данных. Учебное пособие-1

.pdf
Скачиваний:
0
Добавлен:
15.08.2026
Размер:
1 Мб
Скачать

Рис.1.4. Плотность распределения Стьюдента c n степенями свободы. Заштрихованы периферийные области с суммарной вероятностью

P(t >ta2,n) +P(t < -ta2,n) = a

Недостаток точечной оценки в том, что из нее не видно, насколько отличается оценка от истинного значения параметра генеральной совокупности. Интервальная оценка определяет границы интервала, в который истинное значение параметра генеральной совокупности попадает с заданной вероятностью Р, называемой доверительной. Очевидно, что эта вероятность должна быть достаточно большой:

P = 0,9 или P = 0,95.

Наиболее употребительна интервальная оценка математического ожидания mx . Она основана на том, что величина

T= x -mx sx n

подчиняется распределению Стьюдента с n = n -1 степенями свободы (ч.с.с. дисперсии sx2 ). Выберем доверительную вероятность Р, и пусть a =1- P . Плотность распределения Стьюдента ws (t) симметрична относительно t = 0, поэтому найдем положительное зна-

чение ta/2,n , такое, что случайная величина Т находится в интервале

(-ta/2,n;ta/2,n ) с вероятностью Р (рис. 1.4). Тогда математическое ожи-

дание mx с той же доверительной вероятностью Р находится внутри

доверительного интервала (x -Dx ; x + Dx ) , где

 

Dx = ta/2,nsx .

(1.11)

n

 

11

(Замечание. Величина, обозначенная на рис. 1.4 и в предыдущем абзаце как ta/2,n – это квантиль t1-a/2 распределения Стьюдента с n степенями свободы, а величина -ta/2,n – это квантиль ta/2 . Таблицы математической статистики почти всегда составляются только для правых половин распределений; аргументами в таблицах обычно являются не вероятности P = F(xP ) , а величины a =1- P . Поэтому далее в качестве аргументов обратных функций распределения (т.е. аргументов табличных значений критериев) приводятся не величины вероятностей Р, а величины a =1- P вместе с ч.с.с. n.)

При первичном анализе данных кроме точечных и интервальных оценок рассчитывается и строится гистограмма распределения, дающая наглядное представление о распределении данных. Для этого диапазон изменения выборки разбивается на m равных интервалов и подсчитывается число данных в каждом интервале n1,n2,...,nm . Далее строится график, обычно столбчатая диаграмма, где границы интервалов откладываются по горизонтальной оси, а величины ni – по вертикальной (рис. 1.5).

Проверка вида распределения

Часто необходимо проверить гипотезу о том, что анализируемая выборка x1,x2,...,xn является выборкой из генеральной совокупности с некоторым известным распределением. Проверка гипотез о виде распределения проводится с помощью критериев согласия. Как и другие статистические критерии, эти критерии отвечают на вопрос, противоречит ли выдвинутая гипотеза наблюдениям или не противоречит.

Универсальным критерием для проверки гипотезы о виде распределения является критерий Пирсона (c2 -критерий). Для применения этого критерия диапазон изменения выборки x1,x2,...,xn разбивают на m интервалов и рассчитывают количество попаданий данных в каж-

m

дый интервал n1,n2,...,n , (nj = n ). По этой же выборке оценивают

j=1

параметры проверяемого распределения с плотностью вероятности w(x) . Далее вычисляют вероятность попадания случайной величины Х в каждый интервал

l j

p j = w(x)dx = F(l j ) - F(l j-1) ,

l j -1

где l j-1,l j – левая и правая границы j-го интервала.

12

Взвешенная сумма квадратов разностей между наблюдаемым числом попаданий данных в интервал – nj и рассчитанным по проверяемому распределению числом попаданий – npj

 

m

(n

j

-np

j

)2

 

c2

=

 

 

 

(1.12)

 

 

np j

 

 

 

j=1

 

 

 

 

 

является случайной величиной подчиняющейся распределению Пирсона с числом степеней свободы

n = m -l -1,

(1.13)

где l – количество оцененных по выборке параметров распределения. Чем больше различаются наблюдаемые nj и вычисленные по распределению npj числа данных в интервалах, тем больше величина критерия c2 (1.12) и тем меньше шансов на то, что выборка x1,x2,...,xn принадлежит проверяемому распределению.

Для любого положительного c2 можно вычислить вероятность p(c2 )того, что случайная величина, имеющая распределение Пирсона, превосходит значение c2. Вероятность p(c2 )монотонно убывает с возрастанием величины c2. Следовательно, можно решить и обратную задачу – по заданной вероятности a найти такое значение ca2,n , что p(ca2,n )= a. Индекс n указывает, что распределение критерия c2 зависит еще и от числа степенней свободы n (1.13). Величины ca2,n приводятся в таблицах критических значений (иначе, процентных точек) c2 – распределения. Пусть вычисленное в (1.12) значение c2 превосходит некоторое табличное значение ca2,n (попадает в критическую область)

c2 > ca2

,n .

(1.14)

Тогда при условии, что выборка x1,x2,...,xn принадлежит проверяемому распределению, вероятность получить такое значение критерия c2 будет меньше, чем a:

p(c2 )< a.

(1.15)

Если заданная вероятность a мала, например,

a = 0,05 или 0,01,

то и вероятность выполнения неравенства (1.14) при условии, что выборка x1,x2,...,xn взята из проверяемого распределения, мала. Тогда

13

гипотеза о принадлежности выборки x1,x2,...,xn проверяемому распределению признается недостоверной и отвергается, т.е. делается вывод, что выборка x1,x2,...,xn не принадлежит проверяемому распределению. При этом остается риск ошибки такого вывода, не больший, чем a. Эта заданная (малая) вероятность ошибки a называется

уровнем значимости критерия.

При противоположном знаке неравенства (1.14) меняется и знак неравенства (1.15). Тогда риск ошибочного отклонения гипотезы о принадлежности выборки проверяемому распределению считается достаточно большим и проверяемая гипотеза не отклоняется.

Уровни значимости статистических критериев обычно выбираются из интервала 0,1≥a ≥ 0,01. При малых величинах уровня значимости a (малом риске ошибки, больших табличных значениях ca2,n ) критерий будет реагировать только на большие отклонения выборочного распределения от теоретического. Проверяемая гипотеза о виде распределения будет отклоняться редко, и недостоверная гипотеза будет отклоняться с меньшей вероятностью. При более высоких значениях риска a (меньших табличных значениях ca2,n ) критерий будет более чувствителен к малым отклонениям выборочного распределения от теоретического. Проверяемая гипотеза будет отклоняться чаще, и возрастет вероятность отклонения верной гипотезы. Наиболее употребителен уровень значимости a = 0,05. Логика применения других (рассмотренных ниже) статистических критериев аналогична.

К разбиению выборки на интервалы для применения критерия Пирсона предъявляются определенные требования. Диапазон изменения выборки желательно разбивать на семь и более интервалов, так чтобы в каждом было не менее пяти наблюдений. При этом интервалы могут иметь разный размер; наилучшим является разбиение, при котором в каждый интервал попадает одинаковое число данных. При этом границы каждого интервала необходимо определять индивидуально. Вместо применения этой трудоемкой процедуры ограничиваются только объединением соседних интервалов, если в одном из них менее пяти данных. Кроме того левая граница первого содержащего данные интервала расширяется до -∞ , а правая граница последнего содержащего данные интервала расширяется до .

14

1.2. Задание

1.  Рассчитать точечные оценки: выборочное среднее x , дисперсию sx2 и стандартное отклонение sx .

2.  Определить выборочную медиану распределения mx.

3.  Произвести интервальную оценку среднего – построить доверительный интервал для истинного среднего с доверительной вероятностью P = 0,95.

4.  Определить размер интервала разбиения, вычислить границы интервалов, рассчитать число попаданий в каждый интервал и построить гистограмму распределения выборки.

5.  Нанести на гистограмму график проверяемого нормального распределения, сравнить вид проверяемого распределения и экспериментальной гистограммы.

6.  Для нормального распределения с параметрами x и sx рассчитать значение критерия c2 и, сравнив его с табличным значением с уровнем значимости a = 0,05, проверить гипотезу о нормальном распределении экспериментальных данных.

1.3. Порядок выполнения задания

Задание 1 1.1.  Перестроить данные в вариационный ряд по возрастанию.

(Это можно сделать из меню программы EXCEL: «Данные/сортировка/по возрастанию/ОК».)

 

 

n

n

 

 

 

 

 

 

 

 

 

 

1.2.  Рассчитать суммы C = xi , C2 = xi2 .

 

 

 

 

 

 

 

 

 

 

i=1

i=1

 

 

 

 

 

 

 

 

 

 

1.3.  Рассчитать среднее

 

C

, дисперсию

2

 

1

 

 

1

 

2

 

,

x =

 

sx

=

 

 

C2-

 

C

 

 

n

n -1

n

 

 

 

 

 

 

 

 

 

 

 

стандартное отклонение sx = sx2 . (Здесь используется формула для

 

 

 

1

n

 

1

 

n

2

 

дисперсии

sx2

=

xi2

-

 

xi

 

.)

n-1

n

 

 

 

 

i=1

 

 

i=1

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

Задание 2 2.1. Используя формулы (1.10а) или (1.10б), определить выбороч-

ную медиану m, найти минимальное (хmin) и максимальное (xmax) значения выборки.

15

Задание 3

3.1.В таблице процентных точек t-распределения Стьюдента най-

ти значение (ta/2,n ) для числа степеней свободы n = n -1 и уровня значимости a =1- P = 0,05.

3.2.Рассчитать по (1.11) полуширину 95%-ного доверительного интервала Dx .

3.3.Определить нижнюю (x -Dx ) и верхнюю (x + Dx ) 95%-ные доверительные границы для математического ожидания.

Задание 4

4.1. Определить ориентировочную длину интервала разбиения h по формуле

h =

xmax - xmin

.

 

1+3,322lgn

 

Например, в выборке, состоящей из n =105 значений с xmin =11,9, xmax = 42,4, получим h =3,95. Окончательную длину интервала разбиения следует избрать такой, чтобы получившаяся гистограмма была удобна для анализа. В данном случае можно выбрать окончательную длину интервала h = 4.

 

25

 

 

 

 

 

 

 

 

20

 

 

 

 

 

 

 

а

15

 

 

 

 

 

 

 

10

 

 

 

 

 

 

 

Да

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

5

 

 

 

 

 

 

 

 

0

 

 

 

 

 

 

 

 

(11;15]

(15;19]

(19;23]

(23;27]

(27;31]

(31;35]

(35;39]

(39;43]

 

 

 

 

И а

 

 

 

 

Рис. 1.5. Гистограмма распределения выборки (столбцы)

ирасчетное число попаданий нормально распределенной выборки

винтервалы гистограммы (линия)

16

4.2.За начало первого интервала а0 принять величину, меньшую, чем xmin . В рассматриваемом примере примем a0 =11. Далее рассчитать границы интервалов ai+1 = ai + h до тех пор, пока последнее значение ak не превзойдет максимальное значение выборки (табл. 1.1, ст. 1).

4.3.Подсчитать число ni значений выборки, попавших в каждый интервал (ai-1;ai ]. Значение, равное границе интервалов относить к левому интервалу – интервалу с меньшим номером (табл. 1.1, ст. 2).

4.4.Построить столбчатую диаграмму, где границы интервалов аi откладываются по горизонтальной оси, а значения ni – по вертикальной (рис. 1.5, столбцы).

Задание 5 5.1. Чтобы рассчитать теоретическое число данных в интервалах,

при условии, что данные распределены нормально со средним x , например, x = 25,03, стандартным отклонением s = 6,98 надо предварительно вычислить в точках границ интервалов значения функции распределения (1.2), где w(t) – плотность вероятности нормального распределения (1.6) с эмпирическими параметрами x и s. Таблицы нормального распределения составлены для стандартных условий m = 0, s =1. Поэтому надо привести границы интервалов аi к стандартным условиям

ai* = ai s- x .

Результаты расчетов занести в таблицу (табл. 1.1, ст. 3).

 

 

 

 

 

Таблица 1.1

 

 

 

 

 

 

Границы

Данных

Стандартизо-

Функция

Вероятность

Расчетное

интер-

в интер-

ванные грани-

нормального

попадания

число данных

валов

вале

цы интевалов

распределения

в интервал

в интервале

 

 

 

 

 

 

1

2

3

4

5

6

11

0

–2,01

0,022

 

 

15

7

–1,44

0,075

0,053

5,58

19

15

–0,86

0,194

0,119

12,43

23

21

–0,29

0,386

0,192

20,13

27

23

0,28

0,611

0,225

23,67

31

21

0,85

0,804

0,193

20,23

35

8

1,43

0,923

0,119

12,56

39

6

2,00

0,977

0,054

5,67

43

4

2,57

0,995

0,018

1,86

17

5.2.Найти значения функции нормального распределения (табл. 2 приложения), в точках границ интервалов Fi = F(ai ) (ст. 4 табл. 1.1).

Вкачестве аргументов функции распределения брать стандартизованные значения границ интервалов (данные ст. 3).

5.3.Рассчитать вероятность попадания в интервал (ст. 5 табл. 1.1):

pi = Fi - Fi-1.

5.4. Вычислить расчетное (теоретическое) число данных в интервале (ст. 6 табл. 1.1)

ui = npi .

5.5. Построить кривую теоретического распределения данных по интервалам гистограммы, относя каждое значение ui к середине соответствующего интервала (гладкая кривая на рис. 1.5). Сравнить эмпирическую гистограмму и теоретическую кривую распределения данных по интервалам. Проанализировать сходства и различия.

Задание 6 6.1. С учетом требований к разбиению на интервалы для критерия

Пирсона расширить крайний левый интервал с (11; 15] до (-∞ ;15], а крайний правый интервал – с (39;43] до (39;). Поскольку в интервале (39;) имеется менее 5 данных, объединить его с соседним интервалом (35;39], получив окончательно крайний правый интервал (35; ). (Если во всех интервалах не менее пяти данных, то объединять интервалы не надо). Результаты представить в табл. 1.2.

 

 

 

 

 

 

Таблица 1.2

Границы

Данных

Стандарти-

Функция

Вероят-

Расчетное

Взвешен-

интер-

в ин-

зованные

нормально-

ность по-

число

ный

валов

тервале

границы

го распре-

падания в

данных в

квадрат от-

 

 

интевалов

деления

интервал

интервале

клонения

1

2

3

4

5

6

7

-∞

 

 

0

 

 

 

15

7

–1,44

0,075

0,075

7,92

0,106

19

15

–0,86

0,194

0,118

12,43

0,529

23

21

–0,29

0,386

0,192

20,13

0,038

27

23

0,28

0,611

0,225

23,67

0,019

31

21

0,85

0,804

0,193

20,23

0,029

35

8

1,43

0,923

0,120

12,56

1,658

10

 

1

0,077

8,06

0,469

18

6.2.Повторить расчет пп. 5.2–5.4 с новыми границами интервалов. Использовать данные предыдущей таблицы там, где границы интервалов не менялись.

6.3.Рассчитать взвешенные квадраты отклонения в интервалах (ст. 7

табл. 1.2)

qi2 = (ui -ni )2 . ui

6.4. Рассчитать величину критерия Пирсона – сумму взвешенных квадратов отклонений в интервалах

n

c2 = qi2 .

i=1

Врассматриваемом примере получим c2 = 2,85.

6.5. Сравнить рассчитанное значение критерия Пирсона с табличным значением (табл. 3 приложения) с числом степеней свободы (1.13) и уровнем значимости a = 0,05 и сделать вывод, можно ли считать распределение выборки нормальным. В рассматриваемом примере число интервалов m = 7, число параметров нормального распределения l = 2 , число степеней свободы n = 7-3= 4. Табличное значение ca2,n = c0,05,2 4 =9,49 . Следовательно, гипотеза нормального распределения выборки не противоречит наблюдениям.

19

2.СРАВНЕНИЕ СРЕДНИХ И ДИСПЕРСИЙ

2.1.Теоретическое введение

Сравнение двух дисперсий

Цель сравнения дисперсий двух выборок x1,x2,...,xn и y1,y2,...,yk – ответ на вопрос, является ли различие выборочных дисперсий sx2 и s2y случайным, в то время как истинные дисперсии (т.е. дисперсии генеральных совокупностей) совпадают: s2x = s2y , или действительно s2x ≠ s2y . Формально проверяется гипотеза о равенстве истинных дисперсий s2x = s2y . Если генеральные совокупности распределены нормально, критерием является отношение

 

s2

 

F =

x

.

(2.1)

 

 

sy2

 

Отношение F (F-критерий) – случайная переменная, подчиняющаяся распределению Фишера с nx = n -1 степенями свободы дисперсии в числителе и ny = k -1 степенями свободы дисперсии в знаменателе. Область значений F-критерия 0< F < ∞. Так как по смыслу задачи обе выборки равноправны, то альтернативной проверяемой гипотезе является гипотеза s2x ≠ s2y . F-критерий может принимать любые значения из интервала 0< F < ∞ и является двусторонним – имеет две критические области. Но, всегда помещая в числитель отношения (2.1) бóльшую из двух дисперсий (т.е. считая sx2 > s2y ), мы ограничиваем практическое применение критерия интервалом 1< F < ∞ с единственной (правой) критической областью

F> Fa/2,nx ,ny , где a – уровень значимости F-критерия (рис. 2.1). Очевидно, что чем больше отношение (2.1), тем меньше вероят-

ность того, что дисперсии генеральных совокупностей s2x и s2y совпадают. Если вычисленное значение F (2.1) превосходит критическое (табличное) значение двустороннего критерия Фишера

F > Fa/2,nx ,ny ,

(2.2)

то с риском ошибки не большим, чем a утверждается, что дисперсии генеральных совокупностей s2x и s2y различны. Иначе это формулируется: дисперсии sx2 и s2y различаются значимо. Если знак неравенства (2.2) противоположный, говорят, что дисперсии sx2 и s2y различа-

ются незначимо.

20

Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]