Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Теория вероятностей и математическая статистика. Ч.2. Учебно-методическое пособие

.pdf
Скачиваний:
0
Добавлен:
08.09.2026
Размер:
2 Мб
Скачать
☆
*
x
x
n
Fx
n

,
x
{}x
n 
P x F x

*
Fx
     
12
, , ....,
n
x x x
 
1, 2,...
i
x i n
1
n
*
Fx
Fx
1
x
2
x
…
i
x
…
k
x
1
2
…
i
…
k
*
Fx
1, 2,...
i
x i n
i
1
x
2
x
3
x
1ix
i
x
n
x
1 n
 
*
Fx
x
y
1
 
Fx
где
– частота события
, которая в соответствии с законом больших
чисел в форме Бернулли сходится по вероятности (при
.
Эмпирическая функция
имеет вид ступенчатой функции.
Если наблюдается непрерывная случайная величина
получили реализацию вариационного ряда
происходят в точках
, а величина скачков равна
что сумма всех скачков равна единице). Функция
непрерывной случайной величины
изображена функция распределения
показана на рис. 4. На этом же рисунке
.
) к вероятности
и при этом мы
, то скачки
(отметим,
для некоторой
Рисунок 4 - Эмпирическая функция распределения некоторой
непрерывной случайной величины
Если наблюдается дискретная случайная величина и мы получили статистическое распределение
то скачки у функции
скачков равны
(сумма скачков также равна единице).
происходят в точках
, а величины
10
Пример 3. В условиях примера 1 построим эмпирическую функцию
*
Fx
1, 2, 3, 4, 5
i
i
i
1, 2, 3, 4, 5
i
xi
M
12
1
.... 1
n
n
i
i
x x x
Xx
nn

1
1
k
ii
i
X x n
n
2
2
1
1
1
n
i
i
S x X
n

x
y
 
*
Fx
4
распределения
Решение. Частоты
.
были ранее вычислены в примере 1.
Строим ступенчатую функцию. Скачки величиной
.
имеют место в точках
Рисунок 5 - Эмпирическая функция распределения к примеру 3
Выборочные числовые характеристики
Оценка неизвестного математического ожидания
величины
называется выборочным средним значением и вычисляется по
формуле
Для группированной случайной величины эту формулу можно
упростить следующим образом
Для оценки дисперсии используют две статистики. Корректной
оценкой является несмещенная оценка дисперсии
случайной
.
.
11
.
В некоторых случаях используют так называемую выборочную
2
1
1
n
Bi
i
D x X
n

n
2
2
1
1
1
k
ii
i
S x X n
n

2
1
1
k
B i i
i
D x X n
n

n
X
2
S
m
2

2
SS
BB
D
X
3 4 5 10 7 25 9 8 11 3 342
6,84
4 10 25 8 3 50
X
B
D
2
2
В
D X X
22
1
1
n
ii
i
X x n
n
B
D
i
x
3 5 7 9 11
2
i
x
9
25
49
81
121
дисперсию
, которая всегда дает заниженную оценку
реальной дисперсии. Особенно существенно различие при малых
Для группированных данных имеем
соответственно.
При достаточно больших
дисперсия
дисперсии
мало отличаются от математического ожидания
. Лучшей оценкой
квадратическое отклонение равно по определению
выборочное среднее
является
. Выборочное среднее
и несмещенная
.
Пример 4. В условиях примера 1 найдем точечные оценки вероятностных характеристик случайной величины .
.
и
и
Решение. Точечной оценкой математического ожидания является
выборочное среднее
. Находим
Для нахождения наилучшей точечной оценки дисперсии определим
сначала выборочную дисперсию
следующая формула:
где
Покажем, как вычислить
Для этого составим таблицу
.
. Для ее вычисления часто используется
,
.
по сгруппированным данным.
12
Вычислим
2
X
2
9 4 25 10 49 25 81 8 121 3 2522
50,44;
50 50
X
22
( ) (6,84) 46,7856 46,79.X
50,44 46,79 3,65.
B
D
2
S
В
D
2
S
2
1
В
n
SD
n
2
50
3,65 3,72
49
S
В
D
2
S
1,91
B В
D

2
1,93SS
2
S
M
D

:
Таким образом,
Вычислим теперь несмещенную оценку дисперсии
выборочная дисперсия
, то для вычисления
следующей формулой:
.
Таким образом,
Полученные результаты иллюстрируют тот факт, что
заниженную оценку дисперсии в отличие от оценки
Вычислим теперь точечные оценки для среднего квадратического
отклонения:
. Если известна
можно воспользоваться
.
дает
.
Найденные оценки X,
и
, S являются несмещенными точечными
.
оценками соответствующих неизвестных вероятностных характеристик
и
случайной величины .
Точечное и интервальное оценивание
Описанные выше оценки неизвестных математического ожидания,
дисперсии и среднего квадратического отклонения дают некоторые
приближенные оценки неизвестных значений этих величин. Такие оценки называются точечными.
Отметим, что для одних и тех же параметров можно подобрать
различные точечные оценки. Например, оценками для неизвестной
13
,
дисперсии случайной величины являются
В
D
2
S
n
n 
n
n
n
M
lim
n
n
M

n
X
M

В
D
2
S
D

В
D
2
S
n
X
M
2
S
D
и
. Поэтому важно знать
основные свойства «хороших» точечных оценок: состоятельность,
несмещенность и эффективность.
Оценка
она сходится по вероятности (при
неизвестного параметра называется состоятельной, если
) к
.
Свойство состоятельности является обязательным для любого правила
оценивания, т.к. оно гарантирует, что с ростом
точечная оценка все лучше
приближается к истинному значению неизвестного параметра.
Оценка
она в среднем совпадает с оцениваемым параметром, т.е.
неизвестного параметра называется несмещенной, если
.
Часто требование несмещенности бывает невыполненным, однако его
можно заменить более слабым – асимптотической несмещенностью, т.е.:
.
Например, оценка
является состоятельной и несмещенной
оценкой неизвестного математического ожидания
Оценки
дисперсии
оценка, а
Несмещенная оценка
– несмещенная оценка дисперсии.
и
,
являются состоятельными оценками неизвестной – смещенная, но асимптотически несмещенная
неизвестного параметра
.
называется
эффективной, если она обладает наименьшей дисперсией среди всех
несмещенных оценок
В частности,
случае эффективной оценкой
.
– эффективная оценка
.
, но
не является в общем
Другой важный подход к оцениванию параметров состоит в том, чтобы
указать область значений, в которую оцениваемая характеристика попадает с
заданной большой вероятностью. Это доверительное или интервальное
оценивание.
14
Доверительным интервалом для параметра
12
,

12
,

12
P
,
nn

n
P
2
 
2
2
1
2
t
x
t e dx


1
2
u
1
2
1
2
u


 
11
22
,X u X u
nn





 
2
64n
4X
0,95
1
2
1
0,975
2
u

 
 
t
1
2
1,96u
1
2
1,96 2
0,49
64
u
n
с доверительной
вероятностью  называется интервал
со случайными концами
, зависящими от выборки. Этот интервал накрывает неизвестный
параметр с вероятностью
, т.е. выполняется равенство
.
В частном случае интервал
интервалом для параметра
с доверительной вероятностью :
является доверительным
.
Рассмотрим для примера доверительный интервал для оценки
математического ожидания нормально распределенной случайной величины
при известной дисперсии
При заданном
.
с помощью таблиц функции Лапласа
находим
из равенства
.
Тогда доверительный интервал будет иметь вид
.
Пример 5. Нормально распределенная случайная величина имеет
среднее квадратическое отклонение
. Найти значение доверительного
интервала для неизвестного математического ожидания m, если заданы
объем выборки
вероятность
Решение. Из равенства
находим
, выборочное среднее значение
.
.
, доверительная
по таблице для
Точность оценки
.
15
Доверительный интервал для
m
0,49; 0.49XX
4 0,49 3,51;X
4 0,4 9 4,49X
ii
Y,X
ni 1

n
i
i
n
i
i
n
i
ii
YYXX
YYXX
r
1
2
1
2
1
Значение модуля коэффициента
корреляции
r
Теснота связи
0,1 0,3
Слабая
0,3 0,5
Умеренная
0,5 0,7
Заметная
0,7 0,9
Высокая
0,9 0,99
Весьма высокая
01
ˆˆ
yx


Y
Границы доверительного интервала, соответствующие нашим
наблюдениям, равны
имеет вид
.
.
Элементы корреляционного и регрессионного анализа
Для оценки связи между наблюдаемыми в эксперименте случайными
величинами широко используются методы корреляционного и
регрессионного анализа. В случае парных количественных наблюдений
,
применяется коэффициент выборочной корреляции Пирсона
,
который показывает, насколько хорошо зависимость между случайными
величинами может быть описана линейной функцией. Для качественной
оценки тесноты связи измеряемых величин используют шкалу Чеддока,
приведенную в табл. 1. Таблица 1 - Шкала Чеддока для оценки линейной связи двух случайны величин
Если в результате нахождения выборочной корреляции
обнаруживается линейная зависимость между наблюдаемыми переменными,
можно найти уравнение этой прямой – это будет уравнение простой прямолинейной регрессии. Оно имеет вид
и позволяет найти
среднее значение переменной
при заданном значении x переменной X.
16
Оценки коэффициентов регрессии по результатам парных
ii
Y,X
ni 1
2
0
2
XY
X
Q
ˆ
YX
Q

2
1
2
XY
X
Q
ˆ
Q
2
2
1
n
Xj
j
Q x X

2
1
n
XY j j
j
Q x X y Y
22
100
ˆ
R r %
ˆ
r
2
R
2
100R%
i
y
j
x
in
30
35
40
45
50
55
18 4 6 0 0 0 0
10
28 0 8
10 0 0 0 18
38 0 0 4 35 5 0
44
48 0 0 4 12 6 0
22
58 0 0 0 1 3 2
6
jn
4
14
18
48
14
2
100n
in
i
y
jn
j
x
34
05, x x
наблюдений
где
,
и
равны
и
,
.
Качество подобранной регрессии может быть оценено с помощью так
называемого коэффициента детерминации
выше выборочный коэффициент корреляции Пирсона. Величина
, где
– введенный
показывает долю разброса данных около среднего значения, которая может
быть описана регрессией. При
значения точно ложатся на
построенную прямую.
Пример 6. Результаты наблюдений над дискретными случайными величинами сведены в таблицу
На пересечении строки и столбца стоит количество наблюдений, в
которых наблюдалась данная пара значений. Например, пара значений (40; 38) встречалась четыре раза и т.д. В последнем столбце записаны
значения
значения
прямолинейной регрессии, оценим ее качество, найдем предсказанное
значение при
Решение. Найдем вспомогательные суммы первого и второго порядков:
числа появлений значения
числа появлений значения
.
17
. В последней строке указаны
. Построим уравнение
5
1
10 18 18 28 44 38 22 48 6 58 3760
i* i
i
ny
,
6
1
4 30 14 35 18 40 48 45 14 50 2 55 4300
* j j
j
nx
5
2 2 2 2 2 2
1
10 18 18 28 44 38 22 48 6 58 151760
i* i
i
ny
6
2 2 2 2 2 2 2
1
4 30 14 35 18 40 48 45 14 50 2 55 187800
* j j
j
nx
65
11
4 30 18 6 35 18 8 35 28 3 50 58 2 55 58 166100
ij j i
ji
n x y ...

 

56
11
100
i* * j
ij
n n n


6
11
100
1
4300 43
* j j
n
j
X n x
5
11
100
1
3760 37 6
i* i
n
i
Y n y ,
6
2
2 2 2
1
187800 100 43 2900
X * j j
j
Q n x n X
5
2
2 2 2
1
151760 100 37 6 10384
Y i* i
i
Q n y n Y ,
65
2
11
166100 100 43 37 6 4420
XY ij j i
ji
Q n x y n X Y ,


22
11
1 99
2900 29 2929
XX
n
S Q ,
22
11
1 99
10384 104 889
YY
n
S Q ,
2
22
4420
0 805
2900 10384
XY
XY
Q
ˆ
r,
QQ
X
.
Оценки числовых характеристик получаем в виде
,
,
,
,
– оценка среднего для массива X,
– оценка среднего для массива Y,
,
,
,
– оценка дисперсии для массива X,
– оценка дисперсии для массива Y,
- выборочный коэффициент
корреляции, показывает высокую линейную связь признаков, причем
увеличение признака
влечет за собой увеличение признака Y.
18
Найдем параметры уравнения регрессии:
2
1
2
4420
1 524
2900
XY
X
Q
ˆ
,
Q
2
01
2
37 6 1 524 43 27 932
XY
X
Q
ˆˆ
Y X Y X , , ,
Q

 
X
27 932 1524y , , x 
22
100 64 8
ˆ
R r ,
X ,Y
34
0 5 0 5 40 45 42 5, x x , ,
27 932 1524 42 5 36 838y , , , , 
Характеристика
Название в
блоке анализа
данных Excel
Обозна-
чение
Формула для вычисления
Выборочное среднее
Среднее
x
1
1
n
i
n
i
xx
.
Таким образом, мы получили уравнение прямолинейной регрессии,
,
описывающей связь признаков
и Y:
.
Качество аппроксимации исходного двумерного массива данной
функцией оценим по коэффициенту детерминации:
образом, из общего разброса данных относительно точки
. Таким
примерно
64,8% описываются построенной линейной зависимостью и оставшиеся
35,2% объясняются другими случайными факторами. Данный результат
говорит о хорошей аппроксимации исходного массива построенной
прямолинейной зависимостью.
Так как
, для предсказания значения Y
в этой точке подставим данное значение в уравнение регрессии и получим
.
Выполнение расчетов в Excel
При проведении статистических вычислений рекомендуется использовать стандартные программы, например, Excel. К сожалению, при
русифицировании программ были использованы нестандартные названия.
Для того чтобы устранить возможные неясности, приведём в Таблице 2
сравнение названий характеристик в математической статистике и названий в
блоке анализа данных Excel вместе с формулами для их вычисления.
Таблица 2 - Основные описательные статистики
19
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]