Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Специальные разделы высшей математики. Теория вероятностей и математическая статистика для инженера-исследователя. Учебное пособие

.pdf
Скачиваний:
0
Добавлен:
07.09.2026
Размер:
1 Мб
Скачать
☆
2.2. Выборка 41
тор с независимыми компонентами, одинаково распределенными со случайной величиной 𝑋.
Определение 2.3. Объем выборки — это число элементов выборочной со- вокупности.
Чтобы по данным выборки можно было судить о всей генеральной со­вокупности, необходимо чтобы члены выборки представляли её достаточ­но правильно, другими словами, она должна хорошо сохранять пропорции генеральной совокупности. Такая выборка называется репрезентативной (представительной). Для того, чтобы выборка была репрезентативной необ­ходимо выполнение следующих требований.
1. Случайность отбора элементов в выборку.
2. Равновероятность попадания в выборку любого элемента генеральной
совокупности.
3. Достаточно большой объем выборки.
Выборка может быть повторной, при которой отобранный объект (перед отбором следующего) возвращается в генеральную совокупность, и бесповтор- ной, при которой отобранный объект не возвращается в генеральную совокуп­ность. Стоит заметить, что на практике объем генеральной совокупности го­раздо больше, чем объем выборки, поэтому различие между повторной и бес­повторной выборками стирается.
Применяют различные способы получения выборки.
1. Простой отбор — случайное извлечение объектов из генеральной сово-
купности с возвратом или без возврата.
2. Типический отбор, когда объекты отбираются не из всей генеральной
совокупности, а из ее «типической» части.
3. Серийный отбор — объекты отбираются из генеральной совокупности
не по одному, а сериями.
4. Механический отбор — генеральная совокупность «механически» де-
лится на столько частей, сколько объектов должно войти в выборку, и из каж­дой части выбирается один объект.
42 Глава 2. ОСНОВЫ ВЫБОРОЧНОГО МЕТОДА
2.3 Вариационные ряды
2.3.1 Простой вариационный ряд
Полученные различными способами отбора данные образуют выборку, обычно это множество чисел, расположенных в порядке их появления. По такой выборке трудно выявить какую–либо закономерность их изменения (варьиро­вания).
Изменение значения данных называется варьированием. Для обработки данных используют операцию ранжирования, которая заключается в том, что результаты наблюдений располагают в порядке неубывания.
Определение 2.4. Простым вариационным рядом называют последо- вательность элементов выборки 𝑋𝑛= (𝑥1,𝑥2, . . . ,𝑥𝑛), записанных в порядке неубывания их значений
𝑋
где 𝑥
= min (𝑥1,𝑥2, . . . ,𝑥𝑛) и 𝑥
(1)
(𝑛)
=𝑥
(𝑛)
(1),𝑥(2)
, . . . ,𝑥
(𝑛)
,
= max (𝑥1,𝑥2, . . . ,𝑥𝑛).Элементы простого
вариационного ряда называют порядковыми статистиками.
Пример 2.1. Записать простой вариационный ряд для выборки
𝑋 = (4,1,5,3,2,6,3,1,2,3,2,3,3,1,5,3,5,3,2,6).
После ранжирования элементов выборки получим:
𝑋20= (1,1,1,2,2,2,2,3,3,3,3,3,3,3,4,5,5,5,6,6).
2.3.2 Дискретный вариационный ряд
Определение 2.5. Разность между наибольшим и наименьшим значениями измерений называют размахом варьирования выборки.
Определение 2.6. Различные значения элементов выборки называются ва­риантами.
Определение 2.7. Число, которое показывает, сколько раз встречается соот­ветствующая варианта 𝑥𝑖в выборке, называется частотой варианты и обозна­чается 𝑛𝑖.
2.3. Вариационные ряды 43
Если число вариант в выборке невелико, то сгруппировав одинаковые эле­менты, получим дискретный вариационный ряд:
Варианта 𝑥𝑖𝑥1𝑥2. . . 𝑥𝑟Итого
частота 𝑛𝑖𝑛1𝑛2. . . 𝑛
𝑟
𝑛
В таблице 𝑥𝑖, 𝑖 = 1,𝑟 — варианты выборки, 𝑛𝑖— частоты соответствующих вариант, при этом 𝑛1+ 𝑛2+ . . . + 𝑛𝑟= 𝑛.
Отношение частоты данной варианты к общей сумме частот называется частостью (относительной частотой) соответствующей варианты и обозначается
𝑛
*
𝑝
𝑖
𝑖
=
. Частость является статистической вероятностью появления варианты
𝑛
𝑥𝑖.
Дискретный вариационный ряд частостей можно записать в виде:
Варианта 𝑥𝑖𝑥1𝑥2. . . 𝑥𝑟Итого
Частость 𝑝
𝑝
𝑖
*
𝑝
2
. . . 𝑝
1
*
𝑟
1
*
*
Пример 2.2. Дискретный вариационный ряд для выборки из примера 2.1 будет иметь вид:
𝑥
𝑛
𝑝
2 3 4 5 6 Итого
𝑖
7 7 1 3 2 20
𝑖
*
0,35 0,35 0,05 0,15 0,1 1
𝑖
2.3.3 Интервальный вариационный ряд
Если распределение генеральной совокупности 𝑋 является непрерывным или число значений ее достаточно велико, то пользоваться простым и дискрет­ным вариационными рядами становится неудобно.
В этом случае используют интервальный вариационный ряд. Его строят следующим образом. Интервал всех возможных значений распределения гене­ральной совокупности (варьирования выборки) разбивают на 𝑚, в зависимости от объема выборки 𝑛, частичных интервалов (𝛼 частичного интервала ℎ:
; 𝛼𝑖]. Затем определяют длину
𝑖−1
ℎ =
𝑥
− 𝑥
(𝑛)
(1)
,
𝑚
44 Глава 2. ОСНОВЫ ВЫБОРОЧНОГО МЕТОДА
где ℎ — шаг; 𝑚 — число интервалов разбиения. Если длина интервала ока­жется бесконечной дробью, то ее округляют с заданной точностью, при этом округление производится в большую сторону. Обычно берут интервалы одина­ковые по длине, но могут быть интервалы и разной длины.
Затем подсчитывается число элементов 𝑛𝑖, попавших в 𝑖-й интервал 𝑖 = 1,𝑚. При этом в интервал включают значения, большие нижней границы интервала, и меньшие или равные – верхней границе.
В случае необходимости, вычисляют и заносят в таблицу середины интер­валов, частости и другую информацию, которую представляют в виде таблицы произвольной формы. Пример такой таблицы представлен ниже.
Номер интервала 𝑖 1 2 .. . 𝑚 Итого
Интервал (𝛼
Середина интервала ˜𝑥
Частота 𝑛
Частость 𝑝
; 𝛼𝑖] (𝛼0; 𝛼1] (𝛼1; 𝛼2] . . . (𝛼
𝑖−1
𝑛
˜𝑥
1
1
*
𝑝
1
𝑖
𝑖
*
𝑖
𝑛
𝑝
˜𝑥
2
2
*
2
. . . ˜𝑥 . . . 𝑛 . . . 𝑝
𝑚−1
; 𝛼𝑚]
𝑚
𝑚
*
𝑚
𝑛
1
При решении практических задач для удобства строки и столбцы таблицы можно поменять местами.
При построении интервального вариационного ряда важной задачей явля­ется определение числа интервалов разбиения. С одной стороны, чем больше интервалов разбиения, тем меньше информации, содержащейся в выборке, те­ряется. Но, с другой стороны, слишком большое количество интервалов затруд­няет порой выявление закономерности, которая содержится в данных. Число интервалов зависит от размаха варьирования и от объема выборки:
— чем больше размах выборки, тем больше можно использовать интерва­лов;
— при небольшом объеме выборки не целесообразно выделять большое ко­личество интервалов.
При решении практических задач используют различные формулы, кото­рые определяют количество интервалов разбиения в зависимости от объема вы­борки. Все эти формулы для оценки числа интервалов 𝑚 носят эмпирический характер. Рассмотрим некоторые из них.
2.3. Вариационные ряды 45
1. Формула Стерджесса 𝑚 = 1 + [log2𝑛] — самая распространенная фор-
мула, фигурирующая во многих учебниках по статистике, где [𝑥] — целая часть 𝑥, т. е. наибольшее целое число, не превосходящее 𝑥.
2. Формула квадратного корня 𝑚 = [√𝑛].
Следующие альтернативные формулы определяют длину интервала, после чего уже вычисляется число требуемых интервалов.
3,5𝑆
𝑥
3. Формула Скотта ℎ =
√
, где ℎ — длина интервала разбиения, 𝑆𝑥—
3
𝑛
выборочное среднее квадратическое отклонение выборки.
2𝐼𝑄
4. Формула Фридмана–Диакониса ℎ =
√
, где h — длина интервала, 𝐼𝑄 —
3
𝑛
интерквартильный размах, т. е. разность между верхним и нижним квартилем.
Пример 2.3. Для изучения колебаний напряжения в сети в течение суток было сделано 48 измерений. Ниже представлены результаты измерений
221,0 216,2 218,2 215,7 221,0 214,8 215,4 209,3 217,7 213,1 215,9 212,8 216,4 214,6 213,5 218,2 226,3 216,9 208,7 213,7 208,5 209,5 214,3 215,9 214,8 223,7 206,8 219,2 212,8 213,0 216,7 217,2 207,1 214,6 214,4 213,1 221,0 215,0 215,9 207,2 216,8 214,2 216,6 217,6 214,3 215,6 221,4 213,1
Построим интервальный ряд, для этого с помощью формулы Стерджесса определим число частичных интервалов
𝑚 = 1 + [log2𝑛] = 1 + [log248] = 1 + 5 = 6.
Размах выборки равен 𝑅 = 𝑥
(𝑛)
− 𝑥
= 226,3 − 206,8 = 19,5. Следова-
(1)
тельно, длина частичного интервала будет равна ℎ = 19,5/6 = 3,25. Запишем соответствующий интервальный ряд
46 Глава 2. ОСНОВЫ ВЫБОРОЧНОГО МЕТОДА
𝑖 (𝛼
; 𝛼𝑖] ˜𝑥
𝑖−1
𝑖
𝑛
𝑖
*
𝑝
𝑖
1 (206,80; 210,05] 208,425 7 0,146 2 (210,05; 213,30] 211,675 6 0,125 3 (213,30; 216,55] 214,925 19 0,396 4 (216,55; 219,80] 218,175 10 0,208 5 (219,80; 223,05] 221,425 4 0,083 6 (223,05; 226,30] 224,675 2 0,042 Итого 48 1
2.4 Графические представления выборки
2.4.1 Эмпирическая функция
Одной из основных характеристик выборки является эмпирическая функ­ция распределения.
Определение 2.8. Функция выборки (𝑥1,𝑥2, . . . ,𝑥𝑛), определяемая формулой
𝜈𝑛(𝑥)
𝐹*(𝑥) =
,
𝑛
где 𝜈𝑛(𝑥) — число значений среди 𝑥1,𝑥2, . . . ,𝑥𝑛, меньших 𝑥 (𝑥 ∈ R), называ­ется эмпирической функцией распределения (функцией распределения выборки).
Основываясь на понятии простого вариационного ряда, если в выборке нет повторяющихся элементов, эмпирическую функцию распределения можно за­писать в виде:
𝐹*(𝑥) =
⎧ ⎪
0, 𝑥 ≤ 𝑥
⎪
⎨
𝑘
, 𝑥
𝑛
⎪
⎪
⎩
1, 𝑥 > 𝑥
< 𝑥 ≤ 𝑥
(𝑘)
(1)
(𝑛)
;
;
(𝑘+1)
.
Основные свойства эмпирической функции распределения 𝐹*(𝑥).
1. 0 6 𝐹*(𝑥) 6 1.
2. 𝐹*(𝑥) — неубывающая функция.
3. 𝐹*(𝑥) — непрерывная слева функция.
4. lim
𝑥→−∞
𝐹*(𝑥) = 0, lim
𝑥→+∞
𝐹*(𝑥) = 1.
2.4. Графические представления выборки 47
Эмпирическая функция распределения имеет ступенчатый (кусочно-посто­янный) вид. Если генеральная совокупность имеет дискретный вид, то с ростом объема выборки, эмпирическая функция остается таковой, разве, что могут по­явиться новые ступеньки. В случае же, если генеральная совокупность распре­делена непрерывно, то эмпирическая функция будет все больше напоминать непрерывную функцию. Так как для непрерывных случайных величин веро­ятность совпадения по величине двух наблюдений случайной величины равна нулю, то все наблюдения практически всегда оказываются различными (воз­можные совпадения будут за счет округления результатов наблюдений), и скач­ки функции 𝐹*(𝑥) будут равны величине 1/𝑛, которая стремится к нулю при неограниченном росте объема выборки.
При увеличении объема выборки 𝐹*(𝑥) стремится к вероятности события (𝑋 < 𝑥). Таким образом, 𝐹*(𝑥) является оценкой теоретической функции рас­пределения генеральной совокупности 𝐹 (𝑥). Справедливо утверждение о бли­зости эмпирической и теоретической функций распределения.
Теорема 2.1 (Гливенко–Кантелли). Пусть 𝐹*(𝑥) — эмпирическая функ-
ция распределения результатов 𝑛 независимых наблюдений над случайной ве-
личиной 𝑋 с функцией распределения 𝐹 (𝑥). Тогда при 𝑛 → ∞
𝑃
sup
−∞<𝑥<+∞
|𝐹*(𝑥) −𝐹 (𝑥)| → 0= 1.
Теорему Гливенко–Кантелли называют основной теоремой математической статистики.
Пример 2.4. Записать эмпирическую функцию распределения построить ее график по выборке, представленной дискретным вариационным рядом
𝑥
𝑛
𝑝
1 2 3 4 7 Итого
𝑖
2 2 3 1 2 10
𝑖
*
0,2 0,2 0,3 0,1 0,2 1
𝑖
Определение 2.9. Накопленной частотой (частостью) варианты 𝑥𝑖на- зывают суммарную частоту (частость) членов вариационного ряда со значением признака меньше или равного 𝑥𝑖.
48 Глава 2. ОСНОВЫ ВЫБОРОЧНОГО МЕТОДА
Добавим в таблицу дискретного вариационного ряда строку накопленных частостей.
𝑥
1 2 3 4 7 Итого
𝑖
𝑛
2 2 3 1 2 10
𝑖
*
𝑝
0,2 0,2 0,3 0,1 0,2 1
𝑖
𝐹*(𝑥) 0 0,2 0,4 0,7 0,8 1
Таким образом, эмпирическая функция распределения имеет вид:
⎧ ⎪
0 при 𝑥 ≤ 0;
⎪
⎪
⎪
⎪
⎪
0,2 при 0 < 𝑥 ≤ 2;
⎪
⎪
⎪
⎨
0,4 при 2 < 𝑥 ≤ 3;
𝐹*(𝑥) =
⎪
0,7 при 3 < 𝑥 ≤ 4;
⎪
⎪
⎪
⎪
⎪
0,8 при 4 < 𝑥 ≤ 7;
⎪
⎪
⎪
⎩
1 при 𝑥 > 7.
Ее график изображен на рис. 2.1.
1.2
𝐹*(𝑥)
1
0.8
0.6
0.4
0.2
𝑥
2 4 6 8
Рис. 2.1 – График эмпирической функции распределения из примера 2.4
2.4.2 Полигон
Полигоном частот называют ломаную, отрезки которой соединяют точки с координатами (𝑥𝑖,𝑛𝑖); полигоном частостей — с координатами (𝑥𝑖,𝑝
*
), 𝑖 = 1,𝑚.
𝑖
2.4. Графические представления выборки 49
Полигон служит для графического представления дискретного вариацион­ного ряда. Полигон частостей является аналогом многоугольника распределе­ния дискретной случайной величины.
Пример 2.5. Дана выборка наблюдений над случайной величиной 𝑋 объ- ема 20:
12, 14, 19, 15, 14, 18, 13, 16, 17, 12, 18, 17, 15, 13, 17, 14, 14, 13, 14, 16.
Построим дискретный вариационный ряд и по нему полигон частостей.
Шаг 1. Ранжируем выборку : 12, 12, 13, 13, 13, 14, 14, 14, 14, 14, 15, 15, 16, 16, 17, 17, 17, 18, 18, 19.
Шаг 2. Найдем частоты вариантов и построим дискретный вариационный ряд.
𝑥𝑖12 13 14 15 16 17 18 19 Итого
𝑛
2 3 5 2 2 3 2 1 20
𝑖
*
𝑝
0,1 0,15 0,25 0,1 0,1 0,15 0,1 0,05 1
𝑖
Шаг 3. По дискретному вариационному ряду построим полигон частостей.
𝐹*(𝑥)
0.3
0.2
0.1
𝑥
12 14 16 18 20
Рис. 2.2 – Полигон частостей из примера 2.5
50 Глава 2. ОСНОВЫ ВЫБОРОЧНОГО МЕТОДА
2.4.3 Гистограмма
Для функции распределения 𝐹 (𝑥) абсолютно непрерывной случайной ве­личины справедливо приближенное равенство:
𝐹 (𝑥 + Δ𝑥) −𝐹 (𝑥) = 𝑓 (𝑥) Δ𝑥,
где 𝑓 (𝑥) — плотность распределения вероятностей.
Потому эмпирическим аналогом плотности 𝑓 (𝑥) естественно считать функ­цию:
𝑓*(𝑥) =
,
Δ𝑥
здесь 𝐹*(𝑥 + Δ𝑥) − 𝐹*(𝑥) — частость попадания наблюдаемых значений слу­чайной величины 𝑋 в интервал (𝑥; 𝑥 + Δ𝑥]. Таким образом, значение 𝑓*(𝑥) характеризует плотность частости на этом интервале.
Пусть наблюдаемые значения непрерывной случайной величины представ-
𝐹*(𝑥 + Δ𝑥) −𝐹*(𝑥)
лены в виде интервального вариационного ряда. Полагая, что 𝑝 попадания наблюдаемых значений в интервал (𝑎𝑖,𝑎
], где ℎ𝑖— длина 𝑖-го ча-
𝑖+1
*
— частость
𝑖
стичного интервала, выборочную функцию плотности 𝑓*(𝑥) можно задать со­отношением:
⎧ ⎪
0, 𝑥 ≤ 𝑎1,
⎪
⎨
*
𝑝
𝑓*(𝑥) =
𝑖
, 𝑎𝑖< 𝑥 ≤ 𝑎
ℎ
𝑖
⎪
⎪
⎩
0, 𝑥 > 𝑎
𝑚+1
, 𝑖 = 1, 𝑚,
𝑖+1
,
где 𝑎
— конец последнего 𝑚-го интервала.
𝑚+1
Так как функция 𝑓*(𝑥) является эмпирическим аналогом плотности рас­пределения вероятностей случайной величины, то площадь области под графи­ком этой функции равна 1.
Определение 2.10. Гистограммой частот (частостей) называют ступенча- тую фигуру, состоящую из прямоугольников, основания которых расположе­ны на оси 𝑂𝑥, и длины их равны длинам частичных интервалов ℎ𝑖, а высо-
𝑛
ты равны отношению:
*
𝑝
𝑖
(приведенные частости) — для гистограмм частостей.
ℎ
𝑖
𝑖
(приведенные частоты) — для гистограммы частот,
ℎ
𝑖
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]