Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Теория вероятностей и математическая статистика. Учебное пособие-1
.pdf
41
n
n
Для статистической значимости выборочных оценок генеральной
совокупности важным является репрезентативность (представительность)
выборки. Репрезентативность выборочных данных определяется
независимостью и однородностью элементов выборки X1, X2,…, Xn, а также ее
объемом n.
3.1.1. Предварительная обработка данных
Здесь мы предполагаем, что генеральная совокупность описывает
количественный признак. В этом случае прежде всего выборочные данные
требуется упорядочить – ранжировать. Тогда мы получаем вариационный
ряд х1<х2<…<хn, каждое значение которого хi называется вариантой.
Варианты хi могут повторяться в выборке с некоторой частотой ni.
Статистическим рядом называется последовательность вариант и их частот:
х1 х2… х
n1 n2… ns
Сама по себе частота является абсолютной характеристикой. Более
информативной является относительная частота – отношение частоты
варианты к объему всей выборки:
Отметим, что сумма относительных частот равна единице:
*
2
1
**
. С другой стороны они неотрицательны. Значит, можно
1...
ppp
s
записать выборочное распределение – распределение некоторой дискретной
случайной величины Х*:
P(X*=x
Характеристики случайной величины Х* будут обсуждаться в следующем
подразделе.
При большом числе вариант строится интервальный вариационный ряд.
Такой подход особенно важен в случае предположения о непрерывном
распределении генеральной совокупности. Есть несколько методов
определения числа интервалов. Наиболее распространенной является
формула Г. Стёрджеса:
m=1+[log2n].
)=𝑝
k
s
n
1
∗
, k=1,…,s.
n
*
p
,
1
*
2
p
2
,…,
n
*
s
p
s
n
.
Здесь m – число интервалов, а n – объем выборки. После этого находим
размах выборки – разницу между наибольшим и наименьшим значениями
выборки: d=x
max-xmin
m+1 граничную точку для m интервалов длины l: x1= x
x
= xm+l. Интервальный ряд имеет вид
m+1
и длину интервалов l=d/m. Соответственно получаем
, x2= x1+l, x3= x2+l,…,
min

42
[x1; x2) [x2; x3) … … [xm; x
n1 n2 … … nm
Здесь ni – число вариант, попавших на интервал [xi; x
i+1
).
Визуализациями вариационного ряда и интервального ряда служат
полигон частот и гистограмма соответственно. Полигон частот – это
ломаная, которая соединяет точки с координатами (xi,ni). Гистограмма
частот – это набор прямоугольников, построенных на отрезках
интервального ряда с высотами равными соответствующим частотам ni.
Наряду с полигоном и гистограммой частот используются полигон и
гистограмма относительных частот. В этом случае вместо частот ni
используют относительные частоты
*
p
i
Заметим, что от интервального ряда можно перейти к вариационному
ряду. Для этого в качестве вариант берутся середины интервалов, а в
качестве частот – частоты соответствующих интервалов. В полученном
вариационном ряде расстояние между вариантами будет одинаково.
3.1.2. Выборочное распределение
m+1
]
В предыдущем пункте было введено выборочное распределение Х*:
P(X*=x
)= 𝑝
k
∗
, k=1,…,s.
Найдем числовые характеристики распределения Х* – математическое
ожидание и дисперсию. Получаем:
s
1
s
nx
.
ii
nn
i
1
МХ*=
*
22
11
**
1
хpхpхpх
1
n
2
х
2
n
n
n
n
х
......
sss
Таким образом, математическое ожидание Х* – это среднее
арифметическое всех вариант. Его называют выборочное среднее и
обозначают
формула для выборочного среднего имеет вид:
х
или без индекса внизу х. Когда все варианты различны
в
n
1
х
x
.
i
n
i
1
Найдем дисперсию выборочного распределения:
s
1
222
n
1
i
2
)(
.
iii
DХ*=
s
)()( хnx
i
1
i
МXpхx
s
1
2*2
ii
n
1
i
)()(
хnхx

43
7170
14570
14370
7170
35370
Таким образом, дисперсия Х* – это разница между средним
арифметическим квадратов всех вариант и квадратом среднего
арифметического. Ее называют выборочной дисперсией среднее и
обозначают
Выборочным средним квадратическим отклонением называют
квадратный корень из выборочной дисперсии:
Функция распределения случайной величины Х* называется
эмпирической функцией распределения и обозначается F*(x). Она имеет вид:
Другими словами, значение F*(x) – это доля в выборке вариант меньших х.
Пример 3.1. По каналу связи передаются пакеты. Генеральная
совокупность – это число переданных за час пакетов. Имеются данные о
почасовой передаче пакетов за 70 часов. Эти данные образуют выборку
объема n=70: х1, х2,…, х
сообщения не передавались; 25 часов, в которые передавалось по одному
сообщению за час; 15 часов, в которые передавалось по два сообщения; 10
часов, в которые передавалось по три сообщения; 6 часов, в которые
передавалось по четыре сообщения; три часа, в которые передавалось по
пять сообщений; и был час, в который передавалось семь сообщений. Эти
данные можно записать в виде следующего статистического ряда:
Найдем относительные частоты для вариант этой выборки:
*
1
D :
В
22
)(xxD
В
.
D
.
ВВ
*
1
xXPхF
)*()(
n
i
3.1.3. Примеры обработки выборочных данных
Среди 70 часов было 10 часов, в которые
70.
хi 0 1 2 3 4 5 7
n
10
p
25
*
,
2
10 25 15 10 6 3 1
i
15
p
*
,
p
3
*
,
4
n
.
i
xx
10
p
,
6
*
p
5
,

44
70
70
701703353711431457
7
14
14
7
35
70
70
70
70
3
*
p
,
6
Заметим, что сумма относительных частот равна 1:
1
*
p
.
7
1
Таким образом, закон выборочного распределения Х* можно записать
следующим образом:
хi 0 1 2 3 4 5 7
*
p
1
5
3
i
Найдем числовые характеристики выборочного распределения –
выборочное среднее, выборочную дисперсию и выборочное среднее
квадратическое отклонение:
*
*
1
70
70
70
1
17161
4975969060250
4900
1
131
7+15+24+30+30+25
=
10489
=
2;
4900
3
2,14;
1
.
3
1
=1)7+35+64+103+152+251+10(0
хМХ
2
131
2222222
- 1)7+35+64+103+152+251+10(0
ВDDХ
70
=
Найдем эмпирическую функцию распределения F*(x). Получаем:
10489
4900
ВВD
1,46.

45
⎩
⎩
0,при 𝑥≤ 0
,при 0<𝑥≤1
+
,при 1<𝑥≤2
+
,при 2<𝑥≤3
+
+
+
+
+
,при 3<𝑥≤4
+
+
,при 4<𝑥≤ 5
+
,при 5<𝑥≤7
+
+
,при 𝑥> 7
+
+
F*(x)=
+
+
+
+
+
+
+
Построим график эмпирической функции распределения:
0,при 𝑥≤ 0
,при 0<𝑥≤ 1
,при 1<𝑥≤ 2
,при 2<𝑥≤ 3
=
,при 3<𝑥≤ 4
,при 4<𝑥≤5
,при 5<𝑥≤7
1,при 𝑥> 7
Построим полигон частот для этих данных. Получаем следующую ломаную:

46
Полигон частот
30
25
20
15
10
частоты
5
0
0 2 4 6 8
Варианты
Аналогично можем построить полигон относительных частот. Получаем
следующую ломаную:
Полигон относительных частот
0,4
0,3
0,2
0,1
0
0 2 4 6 8
относительные частоты
Заметим, что если сгладить последнюю ломаную, то мы получим кривую,
которая характерна для распределения вероятностей закона Пуассона (см. п.
2.5). Действительно, сглаженная кривая имеет следующий вид:
Варианты

47
Сглаженная кривая
0,4
0,3
0,2
0,1
0
0 2 4 6 8
Однако закон распределения Пуассона зависит от параметра. Закону
распределения Пуассона с каким значением больше всего соответствует эта
кривая? Этот вопрос будет рассматриваться в следующем подразделе.
Пример 3.2. Сортируется массив из 100 чисел. Генеральная совокупность
– это число необходимых сравнений при сортировке. Имеются данные о
числе сравнений при сортировке 50 массивов. Эти данные образуют выборку
объема n=50: х1, х2,…, х
сортировки которых оказалось достаточно пяти сравнения; 13 массивов, для
сортировки которых понадобилось шесть сравнений; 14 массивов, для
сортировки которых понадобилось семь сравнений и 12 массивов, для
сортировки которых понадобилось восемь сравнений. Эти данные можно
записать в виде следующего статистического ряда:
Построим полигон частот для этого статистического ряда. Получаем
следующую ломаную:
Среди 50 массивов было 11 массивов, для
50.
хi 5 6 7 8
ni 11 13 14 12

48
Полигон частот
16
14
12
10
8
6
Частоты
4
2
0
0 2 4 6 8 10
Варианты
Заметим, что эта ломаная близка к прямому отрезку, что характерно для
равномерного распределения на отрезке (см. п. 2.5). Равномерное
распределение на отрезке зависит от двух параметров – начала и конца
отрезка. Оценка этих параметров будет рассматриваться в следующем
подразделе.
Пример 3.3. На сервер передаются одинаковые пакеты из нулей и
единиц. Генеральная совокупность – это число ошибок при передаче одного
пакета из нулей и единиц. Имеются данные о количестве ошибок при
передаче 100 пакетов. Эти данные образуют выборку объема n=100: х1, х2,…,
х
При этом данные собраны в виде следующего интервального ряда:
100.
[хi-х
] [0–2) [2–4) [4–6) [6–8) [8–10) [10–12) [12–14) [14–16]
i+1
ni 1 2 6 11 20 30 20 10
Построим гистограмму частот для этого интервального ряда. Получаем
следующее:

49
Гистограмма частот
30
20
11
6
2
1
0 2 4 6 8 10 12 14 16
Если взять за варианты середины интервалов, то получим следующий
статистический ряд:
хi 1 3 5 7 9 11 13 15
ni 1 2 6 11 20 30 20 10
Построим полигоны частот и относительных частот для этого
статистического ряда. Получаем следующие ломаные:
20
10
n
35
30
25
20
15
10
5
0
Полигон частот
40
30
20
частоты
10
0
0 5 10 15 20
Варианты

50
Полигон относительных
частот
0,4
0,2
0
0 5 10 15 20
частоты
относительные
Заметим, что если сгладить последнюю ломаную, то мы получим кривую,
которая характерна для нормального распределения (см. п. 2.5).
Действительно, сглаженная кривая имеет следующий вид:
Варианты
Сглаженная кривая
0,4
0,3
0,2
0,1
0
0 5 10 15 20
Нормальный закон распределения зависит от двух параметров. Оценка
этих параметров будет рассматриваться в следующем подразделе.
На модификациях этих трех примеров мы будем в дальнейшем
иллюстрировать большинство методов статистического анализа. Заметим,
что в каждом из них генеральная совокупность может принимать только
целые значения. При этом в третьем примере генеральная совокупность,
которая принимает только целые неотрицательные значения, хорошо
описывается непрерывным (нормальным) распределением. Это характерно
для многих задач, связанных с анализом компьютерных данных.
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
