Математическая статистика. Учебное пособие по курсу «Теория вероятностей и математическая статистика»
.pdf
Таблица 7.6. Расчет значения для X
№ |
Границы |
mi |
F(ai) |
F(ai+1) |
Pi |
nPi |
mi – nPi |
(mi -nPi) |
2 |
mi - nPi |
2 |
|
|
||||||||||
|
интервала |
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
nPi |
|
|
|
|
|
|
|
|
|
|
|
|
|
1 |
16.4-20 |
8 |
0.000 |
0.056 |
0.056 |
5.6 |
2.4 |
5.76 |
|
1.029 |
|
2 |
20-30 |
12 |
0.056 |
0.213 |
0.157 |
15.7 |
–3.7 |
13.69 |
|
0.872 |
|
3 |
30-35 |
10 |
0.213 |
0.292 |
0.079 |
7.9 |
2.1 |
4.41 |
|
0.558 |
|
4 |
35-40 |
8 |
0.292 |
0.370 |
0.078 |
7.8 |
0.2 |
0.04 |
|
0.005 |
|
5 |
40-45 |
8 |
0.370 |
0.448 |
0.078 |
7.8 |
0.2 |
0.04 |
|
0.005 |
|
6 |
45-50 |
13 |
0.448 |
0.527 |
0.079 |
7.90 |
5.1 |
26.01 |
|
3.292 |
|
7 |
50-55 |
8 |
0.527 |
0.605 |
0.078 |
7.8 |
0.2 |
0.04 |
|
0.005 |
|
8 |
55-60 |
10 |
0.605 |
0.683 |
0.078 |
7.8 |
2.2 |
4.84 |
|
0.621 |
|
9 |
60-70 |
11 |
0.683 |
0.840 |
0.157 |
15.7 |
–4.7 |
22.09 |
|
1.407 |
|
10 |
70-80.2 |
12 |
0.840 |
1.000 |
0.160 |
16.0 |
–4.0 |
16.0 |
|
1.000 |
|
Σ |
|
100 |
|
|
1.000 |
100 |
0 |
|
|
8.794 |
|
Итак, получили = 8.794. Поскольку 8.794 18.5, гипотеза о выбранном равномерном теоретическом распределении принимается.
Проделаем аналогичные вычисления для случайной величины Y.
Таблица 7.7. Вариационный ряд для Y
51 |
63 |
67 |
75 |
75 |
79 |
89 |
90 |
91 |
94 |
96 |
96 |
97 |
99 |
100 |
100 |
100 |
100 |
102 |
102 |
103 |
104 |
105 |
105 |
105 |
106 |
107 |
107 |
108 |
109 |
109 |
109 |
111 |
111 |
112 |
112 |
113 |
113 |
114 |
114 |
114 |
115 |
115 |
116 |
116 |
118 |
118 |
119 |
119 |
119 |
120 |
121 |
123 |
125 |
125 |
125 |
125 |
126 |
126 |
127 |
127 |
128 |
128 |
128 |
128 |
129 |
130 |
130 |
130 |
130 |
131 |
133 |
134 |
134 |
135 |
137 |
137 |
141 |
141 |
141 |
141 |
142 |
143 |
144 |
147 |
148 |
149 |
152 |
152 |
155 |
156 |
156 |
156 |
161 |
162 |
164 |
165 |
169 |
169 |
191 |
После этого построим группированную выборку (первые три колонки таблицы 7.8) и для каждого из девяти интервалов вычислим представитель интервала, относительную частоту и плотность частоты (последние три колонки таблицы 7.8).
- 41 -
Таблица 7.8. Группированная выборка для Y
№ |
Границы |
Частоты |
Представитель |
Относительная |
Плотность |
|
интервала |
mi |
интервала zi |
частота Pi* |
относительной |
|
|
|
|
|
частоты fi* |
1. |
50-100 |
14 |
75.0 |
0.14 |
0.0028 |
2. |
100-105 |
8 |
102.0 |
0.08 |
0.0160 |
3. |
105-110 |
10 |
107.0 |
0.10 |
0.0200 |
4. |
110-115 |
9 |
112.0 |
0.09 |
0.0180 |
5. |
115-120 |
9 |
117.0 |
0.09 |
0.0180 |
6. |
120-130 |
16 |
125.0 |
0.16 |
0.0160 |
7. |
130-140 |
11 |
135.0 |
0.11 |
0.0110 |
8. |
140-150 |
10 |
145.0 |
0.10 |
0.0100 |
9. |
150-200 |
13 |
175.0 |
0.13 |
0.0026 |
Найдем точечные оценки математического ожидания и дисперсии случайной величины Y по исходной и группированной выборкам (формулы
(2.12), (2.14) и (2.15), (2.16) соответственно):
my |
|
|
|
1 |
n |
|
|
|
|
|
|
|
|
|||||
= |
yi |
= 0.01 12127 = 121.27, |
||||||||||||||||
|
|
|||||||||||||||||
|
|
|
|
|
|
n i=1 |
|
|
|
|
||||||||
|
|
|
1 |
|
k |
|
|
|
|
|
|
|
|
|||||
my# |
= |
|
mi zi |
= 0.01 12225 = 122.25, |
||||||||||||||
|
|
|
||||||||||||||||
|
|
|
|
n i=1 |
|
|
|
|
|
|
|
|
||||||
(σy )2 |
|
|
|
|
|
n |
|
|
|
1 |
n |
|
|
|||||
= |
|
|
|
|
|
|
|
|
yi2 (my )2 |
|
= 592.44, |
|||||||
|
n |
|
|
|
||||||||||||||
|
|
|
|
|
|
|
1 n i=1 |
|
|
|||||||||
|
|
|
|
|
|
|
|
|
|
|
|
|
|
σy = 24.34, |
|
|
||
σy# |
2 |
|
|
|
|
|
n |
1 |
k |
|
|
|||||||
|
= |
|
|
|
|
|
|
|
|
|
|
mi zi2 (m#y )2 |
= 816.86, |
|||||
|
|
|
n 1 |
|
||||||||||||||
|
|
|
|
|
n i=1 |
|
|
|||||||||||
σ#y = 28.58.
- 42 -
Найдем интервальные оценки математического ожидания случайной величины Y, то есть построим доверительные интервалы с доверительными
вероятностями γ = 0.95 и γ = 0.99 (формула (2.23)):
I0.95 = (122.25 – 1.96 2.858 ; 122.25 + 1.96 2.858) (116.65 ; 127.85),
I0.99 = (122.25 – 2.58 2.858 ; 122.25 + 2.58 2.058) (114.08 ; 129.62).
Используя данные, полученные для группированной выборки (таблица 7.8), построим на одном графике гистограмму и полигон (рис. 7.2).
f |
1 |
|
|
0.02 |
2 |
|
|
0.015 |
|
3
0.01
0.005
50 |
100 |
120 |
140 |
160 |
180 |
200 |
Y |
Рис. 7.2. Гистограмма, полигон и плотность для случайной величины Y
Гистограмма имеет относительно высокие прямоугольники в середине, влево и вправо от нее высоты прямоугольников уменьшаются, имеются два «хвоста». Можно предположить, что случайная величина Y имеет нормальное распределение с плотностью (Приложение 1)
f(y) = |
|
1 |
|
exp y m |
2 |
2σ2 |
|
|
|
|
|||||
|
|
|
|
||||
2πσ |
|
||||||
и функцией распределения
Fy(y) = 0.5 + ((y – m)/ ),
где 0(у) – функция Лапласа [1, 2].
Оценка математического ожидания по группированной выборке равна m# = 122.25, а оценка дисперсии равна σ# 2 = 816.86 (σ# = 28.58).
- 43 -
По методу моментов выбираем параметры m = m# и = #. Таким образом, выбираем теоретическое распределение
f(y) = |
|
1 |
exp( (y 122.25)2/1633.72), |
||
|
|
|
|||
2π 28.58 |
|||||
|
|
|
|||
Fy(y) = 0 ((y – 122.25)/28.58) + 0.5.
График плотности f(y) изобразим на рис. 7.2 (линия 3).
Чтобы использовать критерий , найдем число степеней свободы:
r |
= 9 – 2 – 1 = 6. |
Если |
|
уровень значимости = 0.01, то χα2 |
=16.8. Для |
|||||||||
вычисления составляем таблицу 7.9. |
|
|
|
|
|
|
|
|||||||
Таблица 7.9. Расчет значения для Y |
|
|
|
|
|
|
|
|||||||
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
№ |
Границы |
mi |
F(ai) |
|
F(a ) |
Pi |
|
nPi |
mi –nPi |
(mi – nPi)2 |
|
(mi nPi ) |
2 |
|
|
интервала |
|
i+1 |
|
|
|
|
|
|
|||||
|
|
|
|
|
|
|
|
|
|
|
|
nPi |
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
1 |
- -100 |
14 |
0.000 |
|
0.218 |
0.218 |
|
21.8 |
-7.8 |
|
60.84 |
2.790 |
|
|
2 |
100-105 |
8 |
0.218 |
|
0.274 |
0.056 |
|
5.6 |
2.4 |
|
5.76 |
1.030 |
|
|
3 |
105-110 |
10 |
0.274 |
|
0.334 |
0.060 |
|
6.0 |
4.1 |
|
16.81 |
2.850 |
|
|
4 |
110-115 |
9 |
0.334 |
|
0.401 |
0.067 |
|
6.7 |
2.3 |
|
4.84 |
0.710 |
|
|
5 |
115-120 |
9 |
0.401 |
|
0.468 |
0.067 |
|
6.7 |
2.3 |
|
5.29 |
0.790 |
|
|
6 |
120-130 |
16 |
0.468 |
|
0.607 |
0.149 |
|
14.9 |
1.1 |
|
1.21 |
0.081 |
|
|
7 |
130-140 |
11 |
0.607 |
|
0.732 |
0.125 |
|
12.5 |
–1.5 |
2.25 |
0.180 |
|
||
8 |
140-150 |
10 |
0.732 |
|
0.834 |
0.101 |
|
10.1 |
–0.1 |
0.01 |
0.001 |
|
||
9 |
150- |
13 |
0.834 |
|
1.000 |
0.167 |
|
16.7 |
–3.7 |
13.69 |
0.820 |
|
||
Σ |
|
10 |
|
|
|
1.000 |
|
100 |
0 |
|
|
9.252 |
|
|
|
|
0 |
|
|
|
|
|
|
|
|
|
|
|
|
|
Итак, |
получили |
2 = 9.252. Поскольку |
9.252 16.8, |
гипотеза о |
|||||||||
нормальном теоретическом распределении принимается. |
|
|
|
|||||||||||
Рассмотрим теперь случайные величины X и Y совместно. Отметим точками на плоскости OXY все 100 пар значений системы этих величин (рис. 7.3). Найдем оценку ковариации по формуле (4.1):
- 44 -
|
|
|
n |
|
|
|
1 |
|
|
n |
|
|
|
|
|
|
|
Kxy |
= |
|
|
|
|
|
|
|
xi yi mx |
my |
321.58, |
||||
|
n 1 |
|
|
|
||||||||||||
|
|
|
n i=1 |
|
|
|
|
|
||||||||
так как mx |
= 46.50, my = 121.27, |
σx = 16.13 и σy = 24.34. Соответственно |
||||||||||||||
оценка коэффициента корреляции (формула (4.2)): |
|
|||||||||||||||
|
|
* = |
Kxy |
|
|
321.58 |
|
|
|
0.82. |
||||||
|
|
|
|
|
16.13 24.34 |
|||||||||||
|
|
|
|
|
|
|
|
|||||||||
|
|
|
|
σx |
σy |
|
|
|
|
|
|
|
||||
Выборочное уравнение линейной среднеквадратической регрессии Y на X находим по формуле (4.3):
y = ρ |
σy |
(x mx ) + my = 1.24x + 63.73. |
|
σx |
|||
|
|
Построим график линейной среднеквадратической регрессии Y на X
(рис. 7.3):
Y
150
50
0 |
20 |
40 |
60 |
80 |
X |
Рис. 7.3. График линейной среднеквадратической регрессии Y на X
Проверим с уровнем значимости = 0.01 гипотезу о значимости полученного значения коэффициента корреляции * = 0.82. Вычислим по формуле (4.6 ) наблюдаемое значение
- 45 -
tнабл = |
ρ |
|
|
|
|
|
0,82 |
|
|
|
||
n 2 |
|
|
100 2 |
14,18. |
||||||||
|
|
|
|
|
|
|
|
|
||||
1 (ρ )2 |
1 0,822 |
|||||||||||
|
|
|
|
|||||||||
Из таблицы критических точек распределения Стьюдента (Приложение 2) по уровню значимости = 0.01 и числу степеней свободы r = 100 – 2 = 98
находим t0.01 2,37 . Оказалось, что tнабл 14,18 2,37 t0.01 , |
поэтому |
гипотеза = ( = 0) отвергается, то есть найденное * = 0.82 |
считается |
значимым. Другими словами, есть основания считать, что имеется
корреляция между изучаемыми случайными величинами Х и Y.
О существовании причинно-следственной связи. Неравенство коэффициента корреляции нулю означает только наличие статистической связи, зависимости между Х и Y. Но в рассматриваемом случае рост возраста Х означает старение, что отрицательно сказывается на общем состоянии организма, в частности, и на росте артериального давления Y. Это медицинский факт. Таким образом, проведенное здесь исследование еще раз подтверждает эту зависимость, то есть эту связь можно считать не только статистической, но и причинно-следственной.
- 46 -
ЗАКЛЮЧЕНИЕ
Данное учебное пособие составлено с целью помощи студентам освоить основные теоретические понятия математической статистики и научиться выполнять часто применяемые статистические методы обработки данных. В качестве примера подробно рассмотрено выполнение задания на расчетно-графическую работу следующего содержания.
Студент должен самостоятельно собрать данные по n объектам, характеризующимся двумя случайными параметрами X и Y. Источником этих данных могут быть справочники, Интернет, собственные наблюдения или эксперименты.
Применяя методы обработки данных, следует ответить на вопросы: какие законы распределения вероятностей имеют X и Y, имеется ли линейная зависимость между ними и насколько обоснованы ответы на эти вопросы.
Особое внимание уделено содержательному смыслу полученных результатов обработки собранных данных
В пособии даны необходимые сведения из теории вероятностей и математической статистики. Сформулированы контрольные вопросы, на которые нужно уметь ответить при защите работы.
- 47 -
ПРИЛОЖЕНИЕ 1
Список законов распределения
Здесь приведены законы распределения вероятностей случайных величин, которые следует использовать в расчетно-графической работе при выборе типа распределения в критерии хи-квадрат.
1. Равномерное распределение
1/(b – a), x [a , b], b a,
f(x) =
0, x a, x b,
|
|
|
|
|
|
|
0, |
x < a |
|||
|
|
|
|
|
b a |
|
, a x b |
||||
F |
|
x |
|
= |
x a |
|
|
|
|||
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
1, |
x > b |
|||
|
|
|
|
|
|
|
|||||
m = (a + b)/2, σx2 = (b – a)2/12.
2 1
1
b a
0 |
a |
b |
x |
Рис. П1.1. (1 – плотность вероятностей, 2 – гистограмма)
- 48 -
Продолжение приложения 1
2. Распределение Рэлея
1 2
σ е |
1 |
|
0 |
|
x |
Рис. П1.2. (1 – плотность вероятностей, 2 – гистограмма)
(x/ 2) exp(–x2/(2 2)), x ≥ 0,
f(x) =
0, x < 0,
1 – exp(–x2/(2 2)), x ≥ 0,
F(x) =
0, x < 0.
|
|
|
|
|
|
π |
|
|
. |
|
2 |
|
|
2 |
|||||||
mx = 2πσ; σx |
= |
2 |
|
|
σ |
|
||||
|
|
|||||||||
|
|
|
|
|
|
2 |
|
|
|
|
- 49 -
Продолжение приложения 1
3. Показательное или экспоненциальное распределение
exp(- x), x > 0,
f(x) =
0, x < 0.
1 – exp(- x), x > 0,
F(x) =
0, x < 0,
m = = 1/ .
1
2
0 |
x |
Рис. П.1.3. ( 1 – плотность вероятностей, 2 – гистограмма)
- 50 -
