Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Специальные разделы высшей математики. Теория вероятностей и математическая статистика для инженера-исследователя. Учебное пособие
.pdf
2.2. Выборка 41
тор с независимыми компонентами, одинаково распределенными со случайной
величиной 𝑋.
Определение 2.3. Объем выборки — это число элементов выборочной со-
вокупности.
Чтобы по данным выборки можно было судить о всей генеральной совокупности, необходимо чтобы члены выборки представляли её достаточно правильно, другими словами, она должна хорошо сохранять пропорции
генеральной совокупности. Такая выборка называется репрезентативной
(представительной). Для того, чтобы выборка была репрезентативной необходимо выполнение следующих требований.
1. Случайность отбора элементов в выборку.
2. Равновероятность попадания в выборку любого элемента генеральной
совокупности.
3. Достаточно большой объем выборки.
Выборка может быть повторной, при которой отобранный объект (перед
отбором следующего) возвращается в генеральную совокупность, и бесповтор-
ной, при которой отобранный объект не возвращается в генеральную совокупность. Стоит заметить, что на практике объем генеральной совокупности гораздо больше, чем объем выборки, поэтому различие между повторной и бесповторной выборками стирается.
Применяют различные способы получения выборки.
1. Простой отбор — случайное извлечение объектов из генеральной сово-
купности с возвратом или без возврата.
2. Типический отбор, когда объекты отбираются не из всей генеральной
совокупности, а из ее «типической» части.
3. Серийный отбор — объекты отбираются из генеральной совокупности
не по одному, а сериями.
4. Механический отбор — генеральная совокупность «механически» де-
лится на столько частей, сколько объектов должно войти в выборку, и из каждой части выбирается один объект.

42 Глава 2. ОСНОВЫ ВЫБОРОЧНОГО МЕТОДА
2.3 Вариационные ряды
2.3.1 Простой вариационный ряд
Полученные различными способами отбора данные образуют выборку,
обычно это множество чисел, расположенных в порядке их появления. По такой
выборке трудно выявить какую–либо закономерность их изменения (варьирования).
Изменение значения данных называется варьированием. Для обработки
данных используют операцию ранжирования, которая заключается в том, что
результаты наблюдений располагают в порядке неубывания.
Определение 2.4. Простым вариационным рядом называют последо-
вательность элементов выборки 𝑋𝑛= (𝑥1,𝑥2, . . . ,𝑥𝑛), записанных в порядке
неубывания их значений
𝑋
где 𝑥
= min (𝑥1,𝑥2, . . . ,𝑥𝑛) и 𝑥
(1)
(𝑛)
=𝑥
(𝑛)
(1),𝑥(2)
, . . . ,𝑥
(𝑛)
,
= max (𝑥1,𝑥2, . . . ,𝑥𝑛).Элементы простого
вариационного ряда называют порядковыми статистиками.
Пример 2.1. Записать простой вариационный ряд для выборки
𝑋 = (4,1,5,3,2,6,3,1,2,3,2,3,3,1,5,3,5,3,2,6).
После ранжирования элементов выборки получим:
𝑋20= (1,1,1,2,2,2,2,3,3,3,3,3,3,3,4,5,5,5,6,6).
2.3.2 Дискретный вариационный ряд
Определение 2.5. Разность между наибольшим и наименьшим значениями
измерений называют размахом варьирования выборки.
Определение 2.6. Различные значения элементов выборки называются вариантами.
Определение 2.7. Число, которое показывает, сколько раз встречается соответствующая варианта 𝑥𝑖в выборке, называется частотой варианты и обозначается 𝑛𝑖.

2.3. Вариационные ряды 43
Если число вариант в выборке невелико, то сгруппировав одинаковые элементы, получим дискретный вариационный ряд:
Варианта 𝑥𝑖𝑥1𝑥2. . . 𝑥𝑟Итого
частота 𝑛𝑖𝑛1𝑛2. . . 𝑛
𝑟
𝑛
В таблице 𝑥𝑖, 𝑖 = 1,𝑟 — варианты выборки, 𝑛𝑖— частоты соответствующих
вариант, при этом 𝑛1+ 𝑛2+ . . . + 𝑛𝑟= 𝑛.
Отношение частоты данной варианты к общей сумме частот называется
частостью (относительной частотой) соответствующей варианты и обозначается
𝑛
*
𝑝
𝑖
𝑖
=
. Частость является статистической вероятностью появления варианты
𝑛
𝑥𝑖.
Дискретный вариационный ряд частостей можно записать в виде:
Варианта 𝑥𝑖𝑥1𝑥2. . . 𝑥𝑟Итого
Частость 𝑝
𝑝
𝑖
*
𝑝
2
. . . 𝑝
1
*
𝑟
1
*
*
Пример 2.2. Дискретный вариационный ряд для выборки из примера 2.1
будет иметь вид:
𝑥
𝑛
𝑝
2 3 4 5 6 Итого
𝑖
7 7 1 3 2 20
𝑖
*
0,35 0,35 0,05 0,15 0,1 1
𝑖
2.3.3 Интервальный вариационный ряд
Если распределение генеральной совокупности 𝑋 является непрерывным
или число значений ее достаточно велико, то пользоваться простым и дискретным вариационными рядами становится неудобно.
В этом случае используют интервальный вариационный ряд. Его строят
следующим образом. Интервал всех возможных значений распределения генеральной совокупности (варьирования выборки) разбивают на 𝑚, в зависимости
от объема выборки 𝑛, частичных интервалов (𝛼
частичного интервала ℎ:
; 𝛼𝑖]. Затем определяют длину
𝑖−1
ℎ =
𝑥
− 𝑥
(𝑛)
(1)
,
𝑚

44 Глава 2. ОСНОВЫ ВЫБОРОЧНОГО МЕТОДА
где ℎ — шаг; 𝑚 — число интервалов разбиения. Если длина интервала окажется бесконечной дробью, то ее округляют с заданной точностью, при этом
округление производится в большую сторону. Обычно берут интервалы одинаковые по длине, но могут быть интервалы и разной длины.
Затем подсчитывается число элементов 𝑛𝑖, попавших в 𝑖-й интервал 𝑖 = 1,𝑚.
При этом в интервал включают значения, большие нижней границы интервала,
и меньшие или равные – верхней границе.
В случае необходимости, вычисляют и заносят в таблицу середины интервалов, частости и другую информацию, которую представляют в виде таблицы
произвольной формы. Пример такой таблицы представлен ниже.
Номер интервала 𝑖 1 2 .. . 𝑚 Итого
Интервал (𝛼
Середина интервала ˜𝑥
Частота 𝑛
Частость 𝑝
; 𝛼𝑖] (𝛼0; 𝛼1] (𝛼1; 𝛼2] . . . (𝛼
𝑖−1
𝑛
˜𝑥
1
1
*
𝑝
1
𝑖
𝑖
*
𝑖
𝑛
𝑝
˜𝑥
2
2
*
2
. . . ˜𝑥
. . . 𝑛
. . . 𝑝
𝑚−1
; 𝛼𝑚]
𝑚
𝑚
*
𝑚
𝑛
1
При решении практических задач для удобства строки и столбцы таблицы
можно поменять местами.
При построении интервального вариационного ряда важной задачей является определение числа интервалов разбиения. С одной стороны, чем больше
интервалов разбиения, тем меньше информации, содержащейся в выборке, теряется. Но, с другой стороны, слишком большое количество интервалов затрудняет порой выявление закономерности, которая содержится в данных. Число
интервалов зависит от размаха варьирования и от объема выборки:
— чем больше размах выборки, тем больше можно использовать интервалов;
— при небольшом объеме выборки не целесообразно выделять большое количество интервалов.
При решении практических задач используют различные формулы, которые определяют количество интервалов разбиения в зависимости от объема выборки. Все эти формулы для оценки числа интервалов 𝑚 носят эмпирический
характер. Рассмотрим некоторые из них.

2.3. Вариационные ряды 45
1. Формула Стерджесса 𝑚 = 1 + [log2𝑛] — самая распространенная фор-
мула, фигурирующая во многих учебниках по статистике, где [𝑥] — целая часть
𝑥, т. е. наибольшее целое число, не превосходящее 𝑥.
2. Формула квадратного корня 𝑚 = [√𝑛].
Следующие альтернативные формулы определяют длину интервала, после
чего уже вычисляется число требуемых интервалов.
3,5𝑆
𝑥
3. Формула Скотта ℎ =
√
, где ℎ — длина интервала разбиения, 𝑆𝑥—
3
𝑛
выборочное среднее квадратическое отклонение выборки.
2𝐼𝑄
4. Формула Фридмана–Диакониса ℎ =
√
, где h — длина интервала, 𝐼𝑄 —
3
𝑛
интерквартильный размах, т. е. разность между верхним и нижним квартилем.
Пример 2.3. Для изучения колебаний напряжения в сети в течение суток
было сделано 48 измерений. Ниже представлены результаты измерений
221,0 216,2 218,2 215,7 221,0 214,8 215,4 209,3
217,7 213,1 215,9 212,8 216,4 214,6 213,5 218,2
226,3 216,9 208,7 213,7 208,5 209,5 214,3 215,9
214,8 223,7 206,8 219,2 212,8 213,0 216,7 217,2
207,1 214,6 214,4 213,1 221,0 215,0 215,9 207,2
216,8 214,2 216,6 217,6 214,3 215,6 221,4 213,1
Построим интервальный ряд, для этого с помощью формулы Стерджесса
определим число частичных интервалов
𝑚 = 1 + [log2𝑛] = 1 + [log248] = 1 + 5 = 6.
Размах выборки равен 𝑅 = 𝑥
(𝑛)
− 𝑥
= 226,3 − 206,8 = 19,5. Следова-
(1)
тельно, длина частичного интервала будет равна ℎ = 19,5/6 = 3,25. Запишем
соответствующий интервальный ряд

46 Глава 2. ОСНОВЫ ВЫБОРОЧНОГО МЕТОДА
𝑖 (𝛼
; 𝛼𝑖] ˜𝑥
𝑖−1
𝑖
𝑛
𝑖
*
𝑝
𝑖
1 (206,80; 210,05] 208,425 7 0,146
2 (210,05; 213,30] 211,675 6 0,125
3 (213,30; 216,55] 214,925 19 0,396
4 (216,55; 219,80] 218,175 10 0,208
5 (219,80; 223,05] 221,425 4 0,083
6 (223,05; 226,30] 224,675 2 0,042
Итого 48 1
2.4 Графические представления выборки
2.4.1 Эмпирическая функция
Одной из основных характеристик выборки является эмпирическая функция распределения.
Определение 2.8. Функция выборки (𝑥1,𝑥2, . . . ,𝑥𝑛), определяемая формулой
𝜈𝑛(𝑥)
𝐹*(𝑥) =
,
𝑛
где 𝜈𝑛(𝑥) — число значений среди 𝑥1,𝑥2, . . . ,𝑥𝑛, меньших 𝑥 (𝑥 ∈ R), называется эмпирической функцией распределения (функцией распределения
выборки).
Основываясь на понятии простого вариационного ряда, если в выборке нет
повторяющихся элементов, эмпирическую функцию распределения можно записать в виде:
𝐹*(𝑥) =
⎧
⎪
0, 𝑥 ≤ 𝑥
⎪
⎨
𝑘
, 𝑥
𝑛
⎪
⎪
⎩
1, 𝑥 > 𝑥
< 𝑥 ≤ 𝑥
(𝑘)
(1)
(𝑛)
;
;
(𝑘+1)
.
Основные свойства эмпирической функции распределения 𝐹*(𝑥).
1. 0 6 𝐹*(𝑥) 6 1.
2. 𝐹*(𝑥) — неубывающая функция.
3. 𝐹*(𝑥) — непрерывная слева функция.
4. lim
𝑥→−∞
𝐹*(𝑥) = 0, lim
𝑥→+∞
𝐹*(𝑥) = 1.

2.4. Графические представления выборки 47
Эмпирическая функция распределения имеет ступенчатый (кусочно-постоянный) вид. Если генеральная совокупность имеет дискретный вид, то с ростом
объема выборки, эмпирическая функция остается таковой, разве, что могут появиться новые ступеньки. В случае же, если генеральная совокупность распределена непрерывно, то эмпирическая функция будет все больше напоминать
непрерывную функцию. Так как для непрерывных случайных величин вероятность совпадения по величине двух наблюдений случайной величины равна
нулю, то все наблюдения практически всегда оказываются различными (возможные совпадения будут за счет округления результатов наблюдений), и скачки функции 𝐹*(𝑥) будут равны величине 1/𝑛, которая стремится к нулю при
неограниченном росте объема выборки.
При увеличении объема выборки 𝐹*(𝑥) стремится к вероятности события
(𝑋 < 𝑥). Таким образом, 𝐹*(𝑥) является оценкой теоретической функции распределения генеральной совокупности 𝐹 (𝑥). Справедливо утверждение о близости эмпирической и теоретической функций распределения.
Теорема 2.1 (Гливенко–Кантелли). Пусть 𝐹*(𝑥) — эмпирическая функ-
ция распределения результатов 𝑛 независимых наблюдений над случайной ве-
личиной 𝑋 с функцией распределения 𝐹 (𝑥). Тогда при 𝑛 → ∞
𝑃
sup
−∞<𝑥<+∞
|𝐹*(𝑥) −𝐹 (𝑥)| → 0= 1.
Теорему Гливенко–Кантелли называют основной теоремой математической
статистики.
Пример 2.4. Записать эмпирическую функцию распределения построить
ее график по выборке, представленной дискретным вариационным рядом
𝑥
𝑛
𝑝
1 2 3 4 7 Итого
𝑖
2 2 3 1 2 10
𝑖
*
0,2 0,2 0,3 0,1 0,2 1
𝑖
Определение 2.9. Накопленной частотой (частостью) варианты 𝑥𝑖на-
зывают суммарную частоту (частость) членов вариационного ряда со значением
признака меньше или равного 𝑥𝑖.

48 Глава 2. ОСНОВЫ ВЫБОРОЧНОГО МЕТОДА
Добавим в таблицу дискретного вариационного ряда строку накопленных
частостей.
𝑥
1 2 3 4 7 Итого
𝑖
𝑛
2 2 3 1 2 10
𝑖
*
𝑝
0,2 0,2 0,3 0,1 0,2 1
𝑖
𝐹*(𝑥) 0 0,2 0,4 0,7 0,8 1
Таким образом, эмпирическая функция распределения имеет вид:
⎧
⎪
0 при 𝑥 ≤ 0;
⎪
⎪
⎪
⎪
⎪
0,2 при 0 < 𝑥 ≤ 2;
⎪
⎪
⎪
⎨
0,4 при 2 < 𝑥 ≤ 3;
𝐹*(𝑥) =
⎪
0,7 при 3 < 𝑥 ≤ 4;
⎪
⎪
⎪
⎪
⎪
0,8 при 4 < 𝑥 ≤ 7;
⎪
⎪
⎪
⎩
1 при 𝑥 > 7.
Ее график изображен на рис. 2.1.
1.2
𝐹*(𝑥)
1
0.8
0.6
0.4
0.2
𝑥
2 4 6 8
Рис. 2.1 – График эмпирической функции распределения из примера 2.4
2.4.2 Полигон
Полигоном частот называют ломаную, отрезки которой соединяют точки с
координатами (𝑥𝑖,𝑛𝑖); полигоном частостей — с координатами (𝑥𝑖,𝑝
*
), 𝑖 = 1,𝑚.
𝑖

2.4. Графические представления выборки 49
Полигон служит для графического представления дискретного вариационного ряда. Полигон частостей является аналогом многоугольника распределения дискретной случайной величины.
Пример 2.5. Дана выборка наблюдений над случайной величиной 𝑋 объ-
ема 20:
12, 14, 19, 15, 14, 18, 13, 16, 17, 12,
18, 17, 15, 13, 17, 14, 14, 13, 14, 16.
Построим дискретный вариационный ряд и по нему полигон частостей.
Шаг 1. Ранжируем выборку : 12, 12, 13, 13, 13, 14, 14, 14, 14, 14, 15, 15, 16,
16, 17, 17, 17, 18, 18, 19.
Шаг 2. Найдем частоты вариантов и построим дискретный вариационный
ряд.
𝑥𝑖12 13 14 15 16 17 18 19 Итого
𝑛
2 3 5 2 2 3 2 1 20
𝑖
*
𝑝
0,1 0,15 0,25 0,1 0,1 0,15 0,1 0,05 1
𝑖
Шаг 3. По дискретному вариационному ряду построим полигон частостей.
𝐹*(𝑥)
0.3
0.2
0.1
𝑥
12 14 16 18 20
Рис. 2.2 – Полигон частостей из примера 2.5

50 Глава 2. ОСНОВЫ ВЫБОРОЧНОГО МЕТОДА
2.4.3 Гистограмма
Для функции распределения 𝐹 (𝑥) абсолютно непрерывной случайной величины справедливо приближенное равенство:
𝐹 (𝑥 + Δ𝑥) −𝐹 (𝑥) = 𝑓 (𝑥) Δ𝑥,
где 𝑓 (𝑥) — плотность распределения вероятностей.
Потому эмпирическим аналогом плотности 𝑓 (𝑥) естественно считать функцию:
𝑓*(𝑥) =
,
Δ𝑥
здесь 𝐹*(𝑥 + Δ𝑥) − 𝐹*(𝑥) — частость попадания наблюдаемых значений случайной величины 𝑋 в интервал (𝑥; 𝑥 + Δ𝑥]. Таким образом, значение 𝑓*(𝑥)
характеризует плотность частости на этом интервале.
Пусть наблюдаемые значения непрерывной случайной величины представ-
𝐹*(𝑥 + Δ𝑥) −𝐹*(𝑥)
лены в виде интервального вариационного ряда. Полагая, что 𝑝
попадания наблюдаемых значений в интервал (𝑎𝑖,𝑎
], где ℎ𝑖— длина 𝑖-го ча-
𝑖+1
*
— частость
𝑖
стичного интервала, выборочную функцию плотности 𝑓*(𝑥) можно задать соотношением:
⎧
⎪
0, 𝑥 ≤ 𝑎1,
⎪
⎨
*
𝑝
𝑓*(𝑥) =
𝑖
, 𝑎𝑖< 𝑥 ≤ 𝑎
ℎ
𝑖
⎪
⎪
⎩
0, 𝑥 > 𝑎
𝑚+1
, 𝑖 = 1, 𝑚,
𝑖+1
,
где 𝑎
— конец последнего 𝑚-го интервала.
𝑚+1
Так как функция 𝑓*(𝑥) является эмпирическим аналогом плотности распределения вероятностей случайной величины, то площадь области под графиком этой функции равна 1.
Определение 2.10. Гистограммой частот (частостей) называют ступенча-
тую фигуру, состоящую из прямоугольников, основания которых расположены на оси 𝑂𝑥, и длины их равны длинам частичных интервалов ℎ𝑖, а высо-
𝑛
ты равны отношению:
*
𝑝
𝑖
(приведенные частости) — для гистограмм частостей.
ℎ
𝑖
𝑖
(приведенные частоты) — для гистограммы частот,
ℎ
𝑖
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
