Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Теория вероятностей и математическая статистика с применением Excel и Maxima. Учебное пособие
.pdf
2. Они не случайны, опытное и теоретическое распределения
не согласуются, они противоречат друг другу. Предположение о
распределении признака в соответствии с выбранным законом необходимо признать ошибочным.
Возможность сделать первый или второй вывод и позволяют
критерии согласия, т.е. предложения (правила), устанавливающие,
когда полученное в действительности расхождение между предполагаемым теоретическим
и опытным распределениями следует
признать несущественным, случайным, а когда — существенным,
неслучайным.
Итак, рассмотрим случайную величину X, которая характеризует некоторый вид или функцию расхождений между предполагаемым теоретическим и опытным распределениями признака.
Тогда по имеющемуся опытному распределению можно определить значение х
, которое приняла случайная величина X. Если
0
известен ее закон распределения, то нетрудно найти вероятность
β того, что случайная величина X примет какое-нибудь значение,
не меньше х
: Р(X ³ х0) = β. Согласно принципу практической уве-
0
ренности, при однократном наблюдении маловероятное событие
не происходит.
Поэтому если величина х0 получена как результат наблюдения именно случайной величины X, т.е. при распределении рассматриваемого признака по предполагаемому теоретическому закону, то вероятность β не должна быть малой.
Если же вероятность β оказалась малой, то это объясняется,
по видимому, тем, что фактически получено значение не случайной величины Х, а какой-
то другой с другим законом распределения, т.е. изучаемый признак распределен не по предполагаемому
закону.
Таким образом, в случае, когда вероятность β не мала, расхождения между эмпирическим и теоретическим распределениями следует признать несущественными, случайными, а опытное и
теоретическое распределения — не противоречащими, согласующими друг с другом.
211

Если же вероятность β мала, то расхождения между опытным
и теоретическим распределениями существенны, объяснить их
случайностью нельзя, а гипотезу о распределении признака по
предполагаемому теоретическому закону следует считать не подтвердившейся, она не согласуется с опытными данными (вероятость β 0,01 считается малой).
Существуют различные критерии согласия. Мы рассмотрим
2
лишь один: критерий c
(критерий Пирсона).
12.7 Критерий согласия χ
2
(Пирсона) относительно
закона распределения
Пусть анализ опытных данных привел к выбору некоторого
теоретического закона распределения в качестве предполагаемого
для рассматриваемого признака, а по опытным данным, полученным в результате n наблюдений, найдены его параметры (если они
не были известны ранее). С помощью выбранного закона вычисле-
*
ны теоретические частоты n*
ным частотам n
В критерии согласия c
, n2…, nm, причем n*1+n
1
2
за меру расхождения теоретического и
, n
1
…, n
2
*
соответствующие опыт-
m
*
2
+…+n
*
=n1+n2+…+nm= n
m
эмпирического рядов частот принимают величину
m
2
i
1
*2
()
nn
ii
.
*
n
i
Она равна нулю лишь при совпадении всех соответствую-
*
=n
щих эмпирических и теоретических частот: n
(i=1, 2,…,m), а
i
i
в остальных случаях отлична от нуля и тем больше, чем больше
расхождения между указанными частотами.
Величина χ
2
является случайной и имеет χ2(к) – распределе-
ние. В выражении плотности вероятности этого закона параметр k
назван числом степеней свободы. При этом k = m–s, где m – число
групп эмпирического распределения, а s – число параметров теоретического закона, найденных с помощью этого распределения,
вместе с числом дополнительных соотношений, которым подчи-
212

нены эмпирические частоты. Если же эмпирическое распределение не использовалось для нахождения параметров теоретического закона и теоретических частот, а эмпирические частоты не
связаны никакими дополнительными соотношениями, то k равно
числу групп эмпирического распределения, причем в обоих случаях наблюдаемые частоты должны быть не малы (5). С целью
укрупнения групп малые частоты
следует объединить с соседни-
ми (это будет показано на приведенном ниже примере).
2
При применении критерия согласия χ
используют следую-
щую схему вычислений.
1. По опытным данным выбирают в качестве предполагаемо-
го закон распределения признака и находят его параметры.
2. С помощью полученного распределения определяют те-
оретические частоты, соответствующие опытным частотам.
Малочисленные опытные частоты, если они есть, объединяют с
соседними.
3. По формуле вычисляют величину χ
равной χ
2
.
0
2
. Пусть она оказалась
►. Определяют число степеней свободы k.
5. Из таблицы 5 приложения, используя полученные значе-
2
ния χ
имеющая χ
меньше χ
и k, находят вероятность β того, что случайная величина,
0
2
– распределение, примет какое-нибудь значение не
2
.
0
6. Формулируют вывод, руководствуясь общим принципом
применения критериев согласия, а именно: если вероятность
больше 0,01, то имеющиеся расхождения между теоретическими и опытными частотами признаются несущественными, а
опытное распределение – согласующимся с теоретическим, в
противном случае (β0,01) – неслучайными, а закон распределения, избранный в качестве предполагаемого теоретического,
отвергается.
►Пример 37. Рост мужчин
является случайной величиной.
Для нахождения закона ее распределения измерен рост отобранных случайно 1000 мужчин. Результаты представлены в таблице
213

Рост,см
Середина
интервала
Число мужчин,
n
i
143-146 144,5 1
146-149 147,5 2
149-152 150,5 8
152-155 153,5 26
155-158 156,5 65
158-161 159,5 120
161-164 162,5 181
164-167 165,5 201
167-170 168,5 170
170-173 171,5 120
173-176 174,5 64
176-179 177,5 28
179-182 180,5 10
182-185 183,5 3
185-188 186,5 1
Всего n 1000
Используя эти данные, выбрать закон распределения случайной величины, которая характеризует рост мужчин, найти его
параметры и вычислить соответствующий теоретический ряд
частот. Пользуясь критерием χ
2
, проверить, согласуются ли полу-
ченные данные с выбранным законом распределения случайной
величины.
Решение.
На основании теоремы Ляпунова можно предположить, что
рост мужчин является случайной величиной, распределенной по
нормальному закону:
()
x е
1
.
2
22
()/(2)
xa
Будем считать,что
xc
i
i
xhcD hxc
BB B
214
n
h
nn
ax , s=s
B
i
,()
. Найдем
B
xc
i
h
i
x и D
B
2
n
i
22
по формулам
B
,

где n=1000, h=3 и возьмем с=165,5 – середина интервала, которому соответствует наибольшая частота и одновременно приближенное значение средней арифметической. Результаты промежуточных вычислений поместим в таблицу
Рост,см
Середина
интерва-
ла
x
i
Число
мужчин
n
i
xi-c
xc
i
h
xc
i
h
ni
xc
i
h
2
1234567
143-146 144,5 1 -21 -7 -7 49
146-149 147,5 2 -18 -6 -12 72
149-152 150,5 8 -15 -5 -40 200
152-155 153,5 26 -12 -4 -104 416
155-158 156,5 65 -9 -3 -195 585
158-161 159,5 120 -6 -2 -240 480
161-164 162,5 181 -3 -1 -181 181
164-167 165,5 201 0 0 0 0
167-170 168,5 170 3 1 170 170
170-173 171,5 120 6 2 240 480
173-176 174,5 64 9 3 192 576
176-179 177,5 28 12 4 112 448
179-182 180,5 10 15 5 50 250
182-185 183,5 3 18 6 18 108
185-188 186,5 1 21 7 7 49
Всего Σ 1000 Σ 10 4064
Тогда
x =(10/1000)×3+165,5=165,53 см.
B
D
(X)=(4064/1000)×32-(165,53-165,5)2=36,5751.
B
Следовательно, s =
Подставляя найденные значения для
36,5751 6,048 см.
x и σ
B
в формулу для
В
φ(х) получим выражение плотности вероятности случайной величины, характеризующей рост мужчин:
6,048 2
1
() ,
x е
2
( 165,53 ) / (2 36,5751)
x
n
i
215

а функция распределения этой случайной величины:
B
F(x)= 0,5+Ф
6,048
.
165,53
x
Теоретические частоты найдем по формуле
*
n
= nh/σв×φ(ui) ,
i
где n =1000, h=3, σ
=6,048; ui = (xi –165,53)/6,048 (xi — середина
в
i-го частичного интервала),
j(u) =
1
2
e
2
-
/ 2
u
,
Результаты вспомогательных вычислений приведены в табли-
це
Интерва-
лы
Середина
интервала
x
i
xx
i
u
i
xx
iB
B
φ(ui)
hu
6,048
143-146 144,5 -21,03 -3,477 0,0009 0,0004 0 1
146-149 147,5 -18,03 -2,981 0,0047 0,0023 2 2
149-152 150,5 -15,03 -2,485 0,0182 0,0090 9 8
152-155 153,5 -12,03 -1,989 0,0552 0,0274 27 26
155-158 156,5 -9,03 -1,493 0,1309 0,0649 65 65
158-161 159,5 -6,03 -0,997 0,2427 0,1204 120 120
161-164 162,5 -3,03 -0,501 0,3519 0,1746 175 181
164-167 165,5 0 -0,005 0,3989 0,1979 198 201
167-170 168,5 2,97 0,491 0,3536 0,1754 175 170
170-173 171,5 5,97 0,987 0,2451 0,1216 122 120
173-176 174,5 8,97 1,483 0,1328 0,0659 66 64
176-179 177,5 11,97 1,979 0,0563 0,0279 28 28
179-182 180,5 14,97 2,475 0,0186 0,0092 9 10
182-185 183,5 17,97 2,971 0,0048 0,0024 2 3
185-188 186,5 20,97 3,467 0,0010 0,0005 0 1
Всего Σ 998 1000
()
i
Тео-
рет.
част
ni*
Набл.
част.n
i
Значение функции φ(ui) получены из таблицы 1 приложения.
216

Проверим теперь, пользуясь критерием Пирсона, согласуются
или нет полученные данные с предположением о том, что рост
мужчин является нормально распределенной случайной величиной. Чтобы не было малочисленных групп, три начальные и три
последние наблюдаемые и теоретические частоты объединим в
самостоятельные группы. После этого всего окажется k=11 групп.
Результаты промежуточных вычислений при подсчете
2
приведены в таблице.
χ
Наблюдаемые
частоты ni
11 11 0 0 0
26 27 -1 1 0,0370
65 65 0 0 0
120 120 0 0 0
181 175 6 36 0,2057
201 198 3 9 0,0455
170 175 -5 25 0,1429
120 122 -2 4 0,0328
64 66 -2 4 0,0606
28 28 0 0 0
14 11 3 9 0,8182
Теоретические
частоты n*
i
Разности
ni- n*
i
(ni- n*i)
величины
()
nn
ii
2
å 1,3427
*
n
i
*2
Таким образом, χ
2
=1,3427.
0
Эмпирические частоты использованы для нахождения двух
параметров теоретического нормального закона распределения:
математического ожидания и дисперсии. За первый параметр
приняли найденную по опытным частотам среднюю арифметическую
x =165,53 см, а за второй – дисперсию вариационного ряда
B
2
σ
=36,5751.
В
Кроме того, сумма эмпирических частот должна равняться
объему совокупности, т. е. 1000.
217

Следовательно, s = 3, а число степеней свободы k = 11 –3 = 8.
2
Из таблицы 5 приложения при χ
ность того, что случайная величина, имеющая χ
примет какое-нибудь значение, не меньше χ
= 1,3427 и k = 8 находим вероят-
0
2
– распределение,
2
; имеем Р(χ2≥1,3427)
0
= 0,99.
Полученная вероятность значительно больше 0,01.
Следовательно, имеющиеся расхождения между теоретическими и опытными частотами случайны, а предположение о том, что
рост мужчины распределен по нормальному закону, хорошо согласуется с наблюдениями.
Заметим, что если бы эмпирическое распределение не использовалось для нахождения параметров нормального закона, то
число степеней свободы было
бы равно 11 – 1 = 10. В этом случае
сохранилась бы лишь одна связь между опытными частотами: их
сумма должна давать объем совокупности.3
13. Элементы теории корреляции
13.1 Функциональная, статистическая и корреляционная
зависимости
Во многих задачах требуется установить и оценить зависимость изучаемой случайной величины Y от одной или нескольких других величин. Рассмотрим сначала зависимость Y от одной
случайной (или неслучайной) величины Х, а затем от нескольких
величин.
Две случайные величины могут быть связаны либо функциональной зависимостью, либо
зависимостью другого рода, называ-
емой статистической, либо быть независимыми.
Строгая функциональная зависимость реализуется редко, так
как обе величины или одна из них подвержены еще действию случайных факторов, причем среди них могут быть и общие для обеих величин (под “общими” здесь подразумеваются такие факторы,
218

которые воздействуют и на Y и на Х). В этом случае возникает
статистическая зависимость.
Например, если Y зависит от случайных факторов Z
V
, а Х зависит от случайных факторов Z1, Z2, U1, то между Y и
2
, Z2, V1,
1
Х имеется статистическая зависимость, так как среди случайных
факторов есть общие, а именно: Z
и Z2.
1
Статистической называют зависимость, при которой изме-
нение одной из величин влечет изменение распределения другой.
В частности, статистическая зависимость проявляется в том, что
при изменении одной из величин изменяется среднее значение
другой; в этом случае статическую зависимость называют корре-
ляционной.
Приведем пример случайной величины Y, которая не связана
с величиной Х
функционально, а связана корреляционно. Пусть
Y – урожай зерна, Х – количество удобрений. С одинаковых по
площади участков земли при равных количествах внесенных удобрений снимают различный урожай, т.е. Y не является функцией от Х. Это объясняется влиянием случайных факторов (осадки,
температура воздуха и др.). Вместе с тем, как показывает опыт,
средний
урожай является функцией от количества удобрений, т.е.
Y связан с Х корреляционной зависимостью.
Корреляционный анализ – это изучение корреляции и ре-
грессии между зависимыми случайными величинами по данной
многомерной выборки.
13.2 Сглаживание экспериментальных зависимостей
по методу наименьших квадратов
Пусть производится эксперимент, в результате которого мы
хотим выяснить какая зависимость существует между случайны
ми величинами Y и X.
Метод наименьших квадратов как раз и применяется при обработке данных опыта. Наиболее важным приложением метода
является решение задачи сглаживания экспериментальной зависимости, т.е. изображения опытной функциональной зависимо-
219
-

сти аналитической формулой. Метод не решает вопроса о выборе
вида функции, но дает возможность при заданном типе функции
y = f(x) подобрать в определенном смысле оптимальные значения
для неизвестных параметров этой функции.
Пусть получено n экспериментальных точек (x
(x
).
n;yn
) , (x2;y2),...,
1;y1
Рис. 21
Из всех кривых вида y = f(x) надо выбрать ту кривую, которая
наилучшим образом отображает данный эксперимент, т.е. чтобы
отклонения наблюденных значений y
чений f(x
) были бы минимальными. В этом случае параметры
i
от соответствующих зна-
i
функции y = f(x) подбираются так, чтобы достигался минимум
n
Syfx
функции
ii
1
i
ний экспериментальных значений y
меньшей. Для отыскания минимума функции
220
2
, т.е. чтобы сумма квадратов отклоне-
от значений f(xi) была наи-
i
n
Syfx
1
i
2
ii
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
