Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Теория вероятностей и математическая статистика. Учебное пособие-1

.pdf
Скачиваний:
0
Добавлен:
07.09.2026
Размер:
2 Мб
Скачать
☆
41
n
n
Для статистической значимости выборочных оценок генеральной совокупности важным является репрезентативность (представительность) выборки. Репрезентативность выборочных данных определяется независимостью и однородностью элементов выборки X1, X2,…, Xn, а также ее объемом n.
3.1.1. Предварительная обработка данных
Здесь мы предполагаем, что генеральная совокупность описывает количественный признак. В этом случае прежде всего выборочные данные требуется упорядочить – ранжировать. Тогда мы получаем вариационный ряд х1<х2<…<хn, каждое значение которого хi называется вариантой.
Варианты хi могут повторяться в выборке с некоторой частотой ni. Статистическим рядом называется последовательность вариант и их частот:
х1 х2… х
n1 n2… ns
Сама по себе частота является абсолютной характеристикой. Более информативной является относительная частота – отношение частоты
варианты к объему всей выборки:
Отметим, что сумма относительных частот равна единице:
*
2
1
**
. С другой стороны они неотрицательны. Значит, можно
1...
ppp
s
записать выборочное распределение – распределение некоторой дискретной случайной величины Х*:
P(X*=x
Характеристики случайной величины Х* будут обсуждаться в следующем подразделе.
При большом числе вариант строится интервальный вариационный ряд. Такой подход особенно важен в случае предположения о непрерывном распределении генеральной совокупности. Есть несколько методов определения числа интервалов. Наиболее распространенной является формула Г. Стёрджеса:
m=1+[log2n].
)=𝑝
k
s
n
1
∗
, k=1,…,s.
n
*
p
,
1
*
2
p
2
,…,
n
*
s
p
s
n
.
Здесь m – число интервалов, а n – объем выборки. После этого находим размах выборки – разницу между наибольшим и наименьшим значениями выборки: d=x
max-xmin
m+1 граничную точку для m интервалов длины l: x1= x x
= xm+l. Интервальный ряд имеет вид
m+1
и длину интервалов l=d/m. Соответственно получаем
, x2= x1+l, x3= x2+l,…,
min
42
[x1; x2) [x2; x3) … … [xm; x
n1 n2 … … nm
Здесь ni – число вариант, попавших на интервал [xi; x
i+1
).
Визуализациями вариационного ряда и интервального ряда служат полигон частот и гистограмма соответственно. Полигон частот – это ломаная, которая соединяет точки с координатами (xi,ni). Гистограмма частот – это набор прямоугольников, построенных на отрезках интервального ряда с высотами равными соответствующим частотам ni. Наряду с полигоном и гистограммой частот используются полигон и гистограмма относительных частот. В этом случае вместо частот ni используют относительные частоты
*
p
i
Заметим, что от интервального ряда можно перейти к вариационному ряду. Для этого в качестве вариант берутся середины интервалов, а в качестве частот – частоты соответствующих интервалов. В полученном вариационном ряде расстояние между вариантами будет одинаково.
3.1.2. Выборочное распределение
m+1
]
В предыдущем пункте было введено выборочное распределение Х*: P(X*=x
)= 𝑝
k
∗
, k=1,…,s.
Найдем числовые характеристики распределения Х* – математическое ожидание и дисперсию. Получаем:
s
1
s
nx
.
ii
nn
i
1
МХ*=
*
22
11
**
1
хpхpхpх
1
n
2
х
2
n
n
n
n
х
......
sss
Таким образом, математическое ожидание Х* – это среднее арифметическое всех вариант. Его называют выборочное среднее и
обозначают
формула для выборочного среднего имеет вид:
х
или без индекса внизу х. Когда все варианты различны
в
n
1
х
x
.
i
n
i
1
Найдем дисперсию выборочного распределения:
s
1
222
n
1
i
2
)(
.
iii
DХ*=
s
)()( хnx
i
1
i
МXpхx
s
1
2*2
ii
n
1
i
)()(
хnхx
43
7170
14570
14370
7170
35370
Таким образом, дисперсия Х* – это разница между средним арифметическим квадратов всех вариант и квадратом среднего арифметического. Ее называют выборочной дисперсией среднее и
обозначают
Выборочным средним квадратическим отклонением называют квадратный корень из выборочной дисперсии:
Функция распределения случайной величины Х* называется эмпирической функцией распределения и обозначается F*(x). Она имеет вид:
Другими словами, значение F*(x) – это доля в выборке вариант меньших х.
Пример 3.1. По каналу связи передаются пакеты. Генеральная совокупность – это число переданных за час пакетов. Имеются данные о почасовой передаче пакетов за 70 часов. Эти данные образуют выборку объема n=70: х1, х2,…, х сообщения не передавались; 25 часов, в которые передавалось по одному сообщению за час; 15 часов, в которые передавалось по два сообщения; 10 часов, в которые передавалось по три сообщения; 6 часов, в которые передавалось по четыре сообщения; три часа, в которые передавалось по пять сообщений; и был час, в который передавалось семь сообщений. Эти данные можно записать в виде следующего статистического ряда:
Найдем относительные частоты для вариант этой выборки:
*
1
D :
В
22
)(xxD
В
.
D
.
ВВ
*
1
xXPхF
)*()(
n
i
3.1.3. Примеры обработки выборочных данных
Среди 70 часов было 10 часов, в которые
70.
хi 0 1 2 3 4 5 7
n
10
p
25
*
,
2
10 25 15 10 6 3 1
i
15
p
*
,
p
3
*
,
4
n
.
i
xx
10
p
,
6
*
p
5
,
44
70
70
701703353711431457
7
14
14
7
35
70
70
70
70
3
*
p
,
6
Заметим, что сумма относительных частот равна 1:
1
*
p
.
7
1
Таким образом, закон выборочного распределения Х* можно записать следующим образом:
хi 0 1 2 3 4 5 7
*
p
1
5
3
i
Найдем числовые характеристики выборочного распределения – выборочное среднее, выборочную дисперсию и выборочное среднее квадратическое отклонение:
*
*
1
70
70
70
1
17161
4975969060250
­4900
1
131
7+15+24+30+30+25
=
10489
=
2;
4900
3
2,14;
1
.
3
1
=1)7+35+64+103+152+251+10(0
хМХ
2
131
2222222
- 1)7+35+64+103+152+251+10(0
ВDDХ
 
70
=
 
Найдем эмпирическую функцию распределения F*(x). Получаем:
10489
4900
ВВD
1,46.
45
⎩
⎩
0,при 𝑥≤ 0
,при 0<𝑥≤1
+
,при 1<𝑥≤2

+
,при 2<𝑥≤3


+
+

+
+
+
,при 3<𝑥≤4

+
+
,при 4<𝑥≤ 5



+
,при 5<𝑥≤7

+
+

,при 𝑥> 7

+
+
F*(x)=
+
+

+

+
+

 

+
+


Построим график эмпирической функции распределения:
0,при 𝑥≤ 0
,при 0<𝑥≤ 1
,при 1<𝑥≤ 2
,при 2<𝑥≤ 3
=
,при 3<𝑥≤ 4

,при 4<𝑥≤5


,при 5<𝑥≤7

1,при 𝑥> 7
Построим полигон частот для этих данных. Получаем следующую ломаную:
46
Полигон частот
30 25 20 15 10
частоты
5 0
0 2 4 6 8
Варианты
Аналогично можем построить полигон относительных частот. Получаем
следующую ломаную:
Полигон относительных частот
0,4
0,3
0,2
0,1
0
0 2 4 6 8
относительные частоты
Заметим, что если сгладить последнюю ломаную, то мы получим кривую,
которая характерна для распределения вероятностей закона Пуассона (см. п.
2.5). Действительно, сглаженная кривая имеет следующий вид:
Варианты
47
Сглаженная кривая
0,4
0,3
0,2
0,1
0
0 2 4 6 8
Однако закон распределения Пуассона зависит от параметра. Закону распределения Пуассона с каким значением больше всего соответствует эта кривая? Этот вопрос будет рассматриваться в следующем подразделе.
Пример 3.2. Сортируется массив из 100 чисел. Генеральная совокупность – это число необходимых сравнений при сортировке. Имеются данные о числе сравнений при сортировке 50 массивов. Эти данные образуют выборку объема n=50: х1, х2,…, х сортировки которых оказалось достаточно пяти сравнения; 13 массивов, для сортировки которых понадобилось шесть сравнений; 14 массивов, для сортировки которых понадобилось семь сравнений и 12 массивов, для сортировки которых понадобилось восемь сравнений. Эти данные можно записать в виде следующего статистического ряда:
Построим полигон частот для этого статистического ряда. Получаем следующую ломаную:
Среди 50 массивов было 11 массивов, для
50.
хi 5 6 7 8 ni 11 13 14 12
48
Полигон частот
16 14 12 10
8 6
Частоты
4 2 0
0 2 4 6 8 10
Варианты
Заметим, что эта ломаная близка к прямому отрезку, что характерно для равномерного распределения на отрезке (см. п. 2.5). Равномерное распределение на отрезке зависит от двух параметров – начала и конца отрезка. Оценка этих параметров будет рассматриваться в следующем подразделе.
Пример 3.3. На сервер передаются одинаковые пакеты из нулей и единиц. Генеральная совокупность – это число ошибок при передаче одного пакета из нулей и единиц. Имеются данные о количестве ошибок при передаче 100 пакетов. Эти данные образуют выборку объема n=100: х1, х2,…,
х
При этом данные собраны в виде следующего интервального ряда:
100.
[хi-х
] [0–2) [2–4) [4–6) [6–8) [8–10) [10–12) [12–14) [14–16]
i+1
ni 1 2 6 11 20 30 20 10
Построим гистограмму частот для этого интервального ряда. Получаем следующее:
49
Гистограмма частот
30
20
11
6
2
1
0 2 4 6 8 10 12 14 16
Если взять за варианты середины интервалов, то получим следующий статистический ряд:
хi 1 3 5 7 9 11 13 15 ni 1 2 6 11 20 30 20 10
Построим полигоны частот и относительных частот для этого статистического ряда. Получаем следующие ломаные:
20
10
n
35 30 25 20 15 10 5 0
Полигон частот
40 30 20
частоты
10
0
0 5 10 15 20
Варианты
50
Полигон относительных
частот
0,4 0,2
0
0 5 10 15 20
частоты
относительные
Заметим, что если сгладить последнюю ломаную, то мы получим кривую, которая характерна для нормального распределения (см. п. 2.5). Действительно, сглаженная кривая имеет следующий вид:
Варианты
Сглаженная кривая
0,4 0,3 0,2 0,1
0
0 5 10 15 20
Нормальный закон распределения зависит от двух параметров. Оценка этих параметров будет рассматриваться в следующем подразделе.
На модификациях этих трех примеров мы будем в дальнейшем иллюстрировать большинство методов статистического анализа. Заметим, что в каждом из них генеральная совокупность может принимать только целые значения. При этом в третьем примере генеральная совокупность, которая принимает только целые неотрицательные значения, хорошо описывается непрерывным (нормальным) распределением. Это характерно для многих задач, связанных с анализом компьютерных данных.
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]