Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Теория вероятностей и математическая статистика. Сборник задач-1

.pdf
Скачиваний:
0
Добавлен:
15.08.2026
Размер:
953 Кб
Скачать

x, y

nxy раз. Поэтому данные наблюдений группируют, т.е. под-

считывают частоты

nx ,ny ,nxy

и записывают все данные в виде кор-

реляционной таблицы. Приведем пример такой таблицы.

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

X

 

Y

 

10

 

20

 

30

 

40

ny

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

0,4

 

5

 

 

7

 

14

26

0,6

 

 

2

 

6

 

4

12

0,8

 

3

 

19

 

 

22

 

 

 

 

 

 

 

 

 

 

nx

 

8

 

21

 

13

 

18

n 60

 

 

 

 

 

 

 

 

 

 

В первой строке таблицы указаны наблюдаемые значения

(10;20;30;40) величины X , а в первом столбце — наблюдаемые зна-

чения (0,4;0,6;0,8) величины Y . На пересечении строк и столбцов приведены частоты nxy наблюдаемых пар. Например, частота 5 ука-

зывает, что пара чисел (10;0,4) наблюдалась 5 раз. Все частоты поме-

щены в прямоугольнике, стороны которого изображены жирными линиями. Прочерк означает, что соответствующая пара чисел, напри-

мер, (20;0,4), не наблюдалась.

В последнем столбце приведены суммы частот строк. Например,

сумма частот первой строки «жирного» прямоугольника равна ny 5 7 14 26 ; это число показывает, что значение Y 0,4 в

сочетании с различными значениями X наблюдалось 26 раз.

61

В последней строке записаны суммы частот столбцов. Например,

число 8 указывает, что значение X 10 в сочетании с различными значениями Y наблюдалось 8 раз.

В правом нижнем углу приводится сумма всех частот (объем вы-

борки n ). Для проверки следует иметь в виду, что nx ny n . В

нашем случае

nx 8 21 13 18 60 и ny

268 12 22 60 .

Если данные сгруппированы в виде корреляционной таблицы, то все суммы, входящие в (*), можно записать так:

x nx, y n y, x2 nx2 , xy nxy xy,

 

 

1

 

 

1

 

 

1

 

 

 

 

 

 

 

 

 

 

 

 

 

где обозначено x

 

x,

y

 

y,

x2

 

x2 .

n

n

n

С учетом этих соотношений уравнение прямой регрессии прини-

мает вид:

y y x x .

Таким образом, прямая линейной регрессии Y на X проходит через точку x, y , а ее угловой коэффициент yx .

Для yx справедливо соотношение:

 

 

 

 

 

 

 

 

yx

 

nxy xy nx y

,

 

 

 

 

 

n 2

 

 

 

x

 

 

 

62

 

 

 

 

 

 

 

 

 

 

 

 

 

 

2

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

x2

 

x2

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

где

x

— выборочная дисперсия случайной величи-

ны X .

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

При этом выборочный коэффициент корреляции r

 

 

 

x

ока-

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

B

 

 

 

yx y

зывается равным:

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

rB

nxy xy nx y

.

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

n x y

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

где

x

,

y

— выборочные с.к.о. (

x

 

2 ,

y

 

2

).

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

x

 

 

 

y

 

 

 

 

Замечание. Выборочное уравнение прямой линии регрессии X на

Y имеет вид:

x x xy y y ,

 

 

 

 

 

где

 

r

x

.

 

xy

B y

При подготовке к данному практическому занятию необходимо изучить теоретический материал [3]: п. 2.6.

Задача 1. Дана таблица результатов наблюдений:

 

2

4

6

8

10

 

 

 

 

 

 

 

3,5

6,0

7,0

6,0

7,5

Найти выборочный коэффициент корреляции.

63

Pадача 2. Через 1 обозначен предел текучести стали, через 2 – предел прочности стали; — процентное содержание углерода в стали. В результате 79 опытов получена корреляционная таблица ве-

личин 1 и :

2

0,5

0,6

0,7

0,8

0,5

0

2

0

8

 

 

 

 

 

0,6

0

4

2

9

 

 

 

 

 

0,7

2

12

3

1

 

 

 

 

 

0,8

21

14

0

0

 

 

 

 

 

0,9

1

0

0

0

Целые числа, приведенные в таблице, являются кратностями значений соответствующих случайных точек. Например, число 14 показывает, что в 14 опытах случайная точка , приняла значение0,8;0,6 . Требуется определить выборочный коэффициент корреляции и записать уравнение линейной регрессии на .

Задача 3. С целью анализа взаимного влияния зарплаты и текучести рабочей силы на пяти однотипных фирмах с одинаковым числом работников проведены измерения уровня месячной зарплаты X и числа уволившихся за год рабочих Y :

X

100

150

200

250

300

Y

60

35

20

20

15

Найти линейную регрессию Y на X и выборочный коэффициент корреляции.

64

Задача 4. На основании полученных измерений величин X и Y

 

X

 

3

 

5

 

 

7

 

9

 

10

 

12

 

 

 

Y

 

14

 

10

 

 

9

 

9

 

6

 

5

 

 

найти уравнение линейной регрессии X на

Y .

 

 

 

 

 

Задача 5. В магазине постельных принадлежностей были прове-

дены в течение пяти дней подсчеты числа покупок простыней

X и

подушек Y :

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

X

 

 

10

 

20

 

25

 

28

 

 

30

 

 

 

 

 

Y

 

 

5

 

8

 

7

 

12

 

 

14

 

 

 

(В данной таблице значения X расставлены в возрастающем по-

рядке). Найти выборочное уравнение линейной регрессии Y на

X и

выборочный коэффициент корреляции.

 

 

 

 

 

 

 

 

 

 

Тема 16. Проверка статистических гипотез о виде неизвестного распределения или о величине параметра известно-

го распределения. Эмпирические критерии. Критерий Пирсона

Краткая теоретическая справка

1. Общая постановка задачи теории проверки статистических ги-

потез такова. Имеются две противоположные гипотезы H0 и H1 и

некоторая связанная с ними случайная величина Y . Пусть y — чис-

ловое значение Y , полученное в результате испытания, а — мно-

жество всех возможных значений случайной величины Y . Требуется

65

на основании наблюдений произвести проверку нулевой гипотезы

H0 относительно альтернативной гипотезы H1 .

В теории проверки статистических гипотез принято разбивать все множество возможных значений Y на два подмножества 0 и 1 .

Если y 0 , принимается нулевая гипотеза H0 , если же

y 1 , то

принимается альтернативная гипотеза.

 

Главный вопрос теории — каким образом множество

разбить

на подмножества 0 и 1 ? Ответ на этот вопрос зависит от наличия вероятностных данных в задаче.

2. Статистические гипотезы могут быть самыми разнообразными.

Например, хорошо известен факт, что в природе и всевозможных приложениях довольно широкое распространение имеют случайные величины, распределенные по нормальному закону. В конкретном опыте исследователь получил некоторую выборку эксперименталь-

ных данных и хочет выяснить, удовлетворяют ли эти данные нор-

мальному закону. Тогда нулевая гипотеза H0 состоит в том, что наблюдается выборка нормальных величин, а альтернативная гипоте-

за H1 — экспериментальные данные не подчиняются нормальному распределению. В этом случае мы имеем дело с проверкой гипотезы о виде распределения.

Другой пример. Лаборатория собирается купить дорогой прибор.

Фирма-изготовитель прибора в рекламном проспекте указывает его точностные характеристики. Представитель лаборатории с помощью прибора делает серию контрольных измерений и по полученным дан-

66

ным хочет выяснить, имеет ли данный прибор заявленные характери-

стики. Из общих соображений ясно, что ошибки измерения прибора подчиняются нормальному закону, т.к. существует множество при-

чин, влияющих на точность измерений: тепловые шумы, колебания температуры, давления и влажности воздуха, вибрация и качка ко-

рабля (если речь идет о судовой лаборатории), флуктуации питающих напряжений и т.д. и т.п. Тогда гипотеза H0 состоит в том, что дис-

персия ошибок измерения равна 02 (заявленной точности измере-

ний), а гипотеза H1 — дисперсия ошибок превышает 02 . В этом случае проверятся не закон распределения (он известен), а его пара-

метр — дисперсия, характеризующая точность измерений прибора.

3. Теория проверки статистических гипотез должна дать ответ на вопрос: как по наблюдаемой выборке принимать решение о справед-

ливости основной или альтернативной гипотезы. Классическим явля-

ется так называемый байесовский алгоритм принятия решений (метод минимизации среднего риска). Он довольно сложен, требует полного

статистического описания проблемы и поэтому на практике трудно осуществим. Но его теоретическое значение огромно, т.к. он опреде-

ляет потенциальные возможности решения проблемы. Один пример построения байесовского алгоритма приведен в [4].

4. На практике задача проверки статистических гипотез о виде закона распределения решается с помощью так называемых эмпири-

ческих методов (критериев согласия), которые были предложены раз-

личными исследователями: это критерии Пирсона, Колмогорова,

Фишера (F критерий) и др.

67

5. Критерий Пирсона (критерий 2 ) состоит в следующем.

Пусть в результате эксперимента получена выборка x1 , x2 ,...,xn

объ-

ема n . Имеется некоторое теоретическое распределение F0 x ,

и мы

хотим проверить, удовлетворяют ли наши экспериментальные дан-

ные этому распределению. Таким образом, мы собираемся проверить

гипотезу H0 : выборка x1 , x2 ,...,xn принадлежит распределению

F0 x . Разумеется, что гипотеза может быть либо принята, либо от-

вергнута.

Разобьем всю числовую ось на интервалы zk 1 , zk и вычислим теоретические частоты n10 ,n20 ,...,nm0 и опытные частоты n1 ,n2 ,...,nm

попадания в указанные интервалы разбиения (всего m интервалов).

Очевидно,

n0

n0

... n0

n

n

... n

n, где

n

объем

 

1

2

m

1

2

m

 

 

 

наблюдаемой выборки. В критерии Пирсона (критерии

2 )

за меру

расхождения опытного и теоретического рядов частот принимают ве-

личину

 

2

m

n

n0

2

(*)

 

 

i

i

.

 

 

 

 

0

 

 

i 1 ni

Она равна нулю лишь при совпадении всех соответствующих эм-

пирических и теоретических частот, а в остальных случаях положи-

тельна и тем больше, чем больше расхождение между распределени-

ями.

Величина 2 является случайной. В некоторых случаях (далеко

не всегда!) ее закон распределения известен. К примеру, если распре-

68

деление F0 x – нормальное, то эта величина распределена по так называемому 2 — распределению с m степенями свободы (для него имеются специальные таблицы).

В литературе по теории вероятностей и математической стати-

стики обычно приводятся критические точки распределения 2 , т.е.

значения 2 , удовлетворяющие равенству

f x dx .

2

Величина называется уровнем значимости. Если величина

выбрана достаточно малой (0,01 или 0,05) и наблюдаемая в экспери-

менте величина 2 (вычисленная по формуле (*)) удовлетворяет не-

равенству 2 2 , то это означает, что вероятность больших откло-

нений экспериментальных данных от теоретических мала и нет осно-

ваний отвергать гипотезу H

0

. В случае

2

2

большие отклонения

 

 

 

 

 

имеют заметную вероятность; скорее всего, это связано с тем, что выдвинута неверная гипотеза о виде распределения, поэтому она должна быть отвергнута.

Таким образом, при применении критерия согласия Пирсона ис-

пользуют следующую схему вычислений.

1) По формуле (*) находят величину 2 .

2) Определяют число степеней m , равное количеству частичных интервалов. При этом надо следить за тем, чтобы не оказалось очень

69

малых частот (в областях малых частот следует укрупнять интерва-

лы).

3) Задаются уровнем значимости (0,01 или 0,05). Пользуясь

упомянутыми

выше таблицами, определяют, какое из неравенств

2

2

или

2

2

выполняется. В первом случае гипотеза

H

0

 

 

 

 

 

 

 

принимается, а во втором отвергается с уровнем значимости .

Заметим, что критерий Пирсона имеет достаточно универсальный характер и используется на практике для проверки гипотез при раз-

личных законах распределения наблюдаемых данных.

При подготовке к данному практическому занятию необходимо изучить теоретический материал [3]: п. 2.5 и ознакомиться с решени-

ем задачи [4]: 9.1.

Задача 1. Отдел технического контроля проверил n 200 партий одинаковых изделий и получил следующее эмпирическое распреде-

ление (в первой строке указано количество

xi

нестандартных изде-

лий в одной партии, во второй — частота ni

появления значения xi в

отобранных партиях):

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

xi

0

1

2

 

3

 

4

 

 

 

 

 

 

 

 

 

 

 

 

ni

116

56

22

 

4

 

2

 

Требуется при уровне значимости 0,05 проверить гипотезу о том, что число нестандартных изделий распределено по закону Пуассона.

Задача 2. По 100 независимым испытаниям найдена относительная частота m/n=0,20. При уровне значимости 0,05 требуется прове-

70

Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]