Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Элементы математической статистики. Учебное пособие-1

.pdf
Скачиваний:
0
Добавлен:
15.08.2026
Размер:
792 Кб
Скачать

частот, превышающая половину всего объема совокупности. В этом случае, для числа xi 78, накопленная частота равна:

miнак 10 15 5 20 5 25 15 30 125 2002 .

Тогда пробеги составят:

а) в одном направлении: 71·10 + 52·15 + 50·5 + 41·20 + 38·5 + 32·25 + 18·15 = = 3820 км;

б) в противоположном направлении: 8·10 + 14·65 = 990 км.

Общий пробег равен 4810 км, то есть он оказался меньше общих пробегов, рассчитанных по предыдущим вариантам.

Простейшей числовой характеристикой признака является вариационный размах R = xmax xmin. Размах выборки дает лишь самое общее представление о размерах вариации, так как показывает насколько отличаются друг от друга крайние значения, но не указывают, насколько велики отклонения вариант друг от друга внутри этого промежутка. Более точным будет такой показатель, который учитывает отклонение каждой из вариант от средней величины.

k

Выделяют среднее линейное отклонение s wi | xi x | либо средне-

i1

квадратичное отклонение (выборочная дисперсия).

 

 

 

 

 

 

 

 

 

 

 

 

 

 

k

 

 

 

 

Выборочной дисперсией называется величина D

mi (xi xB )2

 

, а вы-

i1

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

B

n

 

 

 

 

борочным средним квадратичным отклонением В

 

 

 

 

DB .

 

 

 

 

Так же, как в теории случайных величин, можно доказать, что справедлива

следующая формула для вычисления выборочной дисперсии:

 

 

 

 

 

 

 

 

 

 

D

 

x2

 

(x

В

)2 .

 

 

 

 

 

 

 

 

 

 

 

 

В

 

В

 

 

 

 

 

 

 

 

Так как выборочная дисперсия имеет систематическую ошибку, то для ее

устранения вводят поправку, умножая D

на число

n

. Тогда 2

 

n

 

D

n 1

n 1

называется исправленной дисперсией.

 

В

 

 

 

x

B

 

 

 

 

 

 

 

 

 

 

 

 

Величина

 

 

n

 

 

называется исправленным средним квадратич-

x

n 1

B

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

ным отклонением.

Пример 2. Найти числовые характеристики выборки, заданной вариационным рядом:

xi

2

5

7

8

тi

3

8

7

2

Решение. Объем выборки п = 20.

Наибольшую частоту имеет варианта, равна 5. Следовательно, мода М0 = 5.

11

Так как число вариант четно, то 2k 4 2 2, k 2, тогда Me 5 27 6.

Выборочная средняя (среднее арифметическое) хВ 2 3 5 8 7 7 8 2 5,55. 20

Выборочная дисперсия DB 4 3 25 8 49 7 64 2 5,552 3,3475. 20

Выборочное среднее квадратическое отклонение B

3,3475 1,83.

Исправленная дисперсия 2

20

 

3,3475 3,5237.

 

 

 

20 1

 

 

 

x

 

 

 

 

Исправленное среднее квадратичное отклонение x

20

 

1,83 1,88.

20 1

 

 

 

 

 

Для характеристики совокупности значений признаков, кроме абсолютных показателей, применяются относительные показатели признака.

Коэффициент вариации V V x 100%.

Он используется для сравнения размеров вариации в вариационных рядах с различными средними, а также для сравнения вариаций разных показателей в одной и той же совокупности.

1. V 30% – выборкаимеетдовольнобольшую степеньконцентрацииотносительного среднего.

2.30% V 100% – степень концентрации допустимая.

3.V 100% – делается вывод о неоднородности выборки.

Моментом порядка р распределения вариационного ряда называется

 

k

k

число p

wi (xi

a)p , где a M x xi pi .

 

i1

i1

В зависимости от значения а общая схема моментов разбивается на три подсистемы.

1.Если а = 0, то получаем систему начальных моментов.

2.Если а = x, то получаем систему центральных моментов.

3.Если а = С = const (обычно выбирается С близкое к середине вариационного ряда), то получаем систему условных моментов. Она применяется для упрощения расчетов.

Начальным эмпирическим моментом порядка р называется число

vр mni xiр .

k

mi xi

В частности, M1 v

i 1

 

xB , то есть начальный эмпирический мо-

 

n

 

 

 

мент первого порядка равен выборочной средней.

12

Центральным эмпирическим моментом порядка р называется

h mi (xni хВ )h .

k

mi (xi хВ )2

В частности,

2

 

i 1

 

D

, то есть центральный эмпирический

 

 

 

 

 

n

B

 

 

 

 

 

 

 

момент второго порядка равен выборочной дисперсии.

Центральные моменты 3-го и 4-го порядков используются для характеристики асимметрии и эксцесса распределения вариационного ряда.

Асимметрия – это свойство распределения частот. На практике симметричные полигоны и гистограммы не встречаются, и, чтобы выявить и оценить степень асимметрии, вводят число, называемое коэффициентом асимметрии:

Ass xin x3x 3 mi .

Чтобы упростить вычисление Ass можно использовать следующую фор-

 

 

 

 

 

 

 

k

 

 

 

 

A

3 xВ Md

 

 

 

 

 

 

xi

xВ

 

 

 

 

 

 

 

 

 

мулу:

, где

M

d

i 1

 

 

 

 

среднее отклонение, то есть со-

 

 

 

 

 

 

 

ss

В

 

 

 

 

 

n

 

 

 

 

 

 

 

 

 

 

 

 

вокупность отклонений каждого значения от среднего, взятого по модулю, а В

– выборочное среднее квадратическое отклонение. Асимметрия в этой формуле принимает значения от –3 до +3.

Если Аss 0, то распределение симметрично, если Ass 0 – распределение

асимметрично. При асимметричном распределении соотношение между средней, медианой и модойнарушено.

Принято считать, что асимметрия выше 0,5 (независимо от знака) считается значительной. Если асимметрия меньше 0,25, она считается незначительной.

mi

x

Рис. 3

1.При Ass 0, правосторонняя (правая ветвь кривой длиннее левой)

положительная асимметрия.

2.При Ass 0 распределение – симметричное (среднее, мода и медиана

имеют одно значение).

3. При Ass 0 левосторонняя (левая ветвь кривой длиннее правой) отрицательная асимметрия.

13

Эксцессом вариационного ряда называется число Ex

xi x 4

mi

3.

n 4x

 

 

 

 

Эксцесс – это мера «крутости» кривой распределения вариационного ряда. Эта кривая распределения может быть островершинной, плосковершинной, средневершинной.

Рис. 4

Эксцесс показывает, насколько резкий скачок имеет изучаемое явление. Если показатель эксцесса больше нуля Ex 0, то распределение островер-

шинное и скачок считается значительным, если коэффициент эксцесса меньше нуля Ex 0, то распределение считается плосковершинным (пологим) и скачок

считается незначительным.

Нормальное распределение имеет нулевые значения показателя асимметрии и показателя эксцесса.

4. ТЕОРЕТИЧЕСКИЕ РАСПРЕДЕЛЕНИЯ

Рассмотрим некоторые распределения, связанные с нормальным распределением, и широко применяющиеся в математической статистике.

4. 1. Распределение χ2«хи-квадрат» или распределение Пирсона

Пусть имеется n независимых случайных величин Х1, Х2, ..., Хn, распределенных по нормальному закону с математическим ожиданием, равным нулю, и дисперсией, равной единице. Сумма квадратов независимых случайных величин, име- ющихстандартноенормальноераспределение,называетсяχ2-распределениемслу- чайной величины с п степенями свободы. Число k = n называется числом степеней свободы распределения. Если же слагаемые связаны каким-либо соотношением

(например, Хi nX ), то число степеней свободы k = n – 1.

При n > 1 график плотности распределения случайной величины 2 представляет собой кривую, изображенную на рисунке 9.

Рис. 9

14

Для того чтобы определить вероятность попадания случайной величины 2 в какой-либо промежуток из множества положительных чисел, пользуются таблицей распределения 2. Обычно такая таблица (приложение 1) позволяет по вероятности р и по числу степеней свободы n определить так называемый квантиль р2, если р и p2 связаны соотношением P( 2 > р2) = р.

Этаформулаозначает:вероятностьтого,чтослучайнаявеличина 2 примет значение, большее, чем определенное значение p2, равна р.

 

 

 

 

 

 

 

0,

 

x 0;

 

 

 

 

 

 

 

 

x

 

k

 

 

 

 

 

 

 

1

 

 

 

 

1

 

 

 

 

 

 

 

 

 

 

 

Плотность этого распределения

f (x)

 

 

 

e

 

2 x2

 

,

x 0, здесь

 

k

k

 

 

 

 

 

 

 

 

 

 

 

 

 

 

22

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

2

 

 

 

 

 

 

 

 

 

(x) t x1e t dt – гамма-функция; в частности, Г(п + 1) = п!.

0

Следовательно, распределение «хи-квадрат» определяется одним параметром – числом степеней свободы k.

Замечание 1. С увеличением числа степеней свободы распределение «хиквадрат» постепенно приближается к нормальному.

Замечание 2. С помощью распределения «хи-квадрат» определяются многие другие распределения, встречающиеся на практике, например, распределе-

ние случайной величины 2 – длины случайного вектора (Х1, Х2,…, Хп), координаты которого независимы и распределены по нормальному закону.

Пример. Найти интервал ( 12, 22), в который случайная величина 2, имеющая 10 степеней свободы, попадает с вероятностью, равной 0,9.

Решение. График плотности распределения 2 с 10-ю степенями свободы схематично изображен на рисунке 10.

Рис. 10

Будем считать, что площади заштрихованных областей (правая область не ограничена справа) равны между собой. Примем условия:

P( 2 < 12) = P( 2 > 22) = (1 – 0,9)/2 = 0,05, (1) тогда P( 12 < 2 < 22) = 0,9.

Равенства(1)позволяютпотаблицеприложения1определитьправуюграницу искомого интервала: 22 = 18,3. Для определения левой границы интересующего нас интервала применим очевидное равенство P( 2 > 12) =1 – 0,05 = 0,95. Из таблицы приложения 1 определяем: 12 = 3,94.

15

Значение случайной величины 2 с вероятностью 0,9 принадлежит интер-

валу (3,94; 18,3).

4.2. Распределение Стьюдента

Рассмотрим две независимые случайные величины: Z, имеющую стандартное нормальное распределение (то есть М(Z) = 0, σ(Z) = 1), и V, распределенную

по закону «хи-квадрат» с k степенями свободы. Тогда величина t ZV , имеет

k

распределение, называемое t-распределением или распределением Стьюдента

сk степенями свободы.

Свозрастанием числа степеней свободы распределение Стьюдента быстро приближается к нормальному.

График плотности распределения для закона Стьюдента схематически изображен на рисунке 11.

Рис. 11

Кривая плотности распределения схожа с аналогичной кривой для нормального распределения.

Таблицы распределения Стьюдента (приложение 2) позволяют при данном числе степеней свободы k по вероятности р определить значение tр, для которого

выполняется соотношение P( t > tр) = р.

Пример 1. Найти симметричный интервал, в который случайная величина, распределенная по закону Стьюдента с 12-ю степенями свободы, попадает с вероятностью 0,9.

Решение. Очевидны соотношения: P(–x < t < x) = P(t < x) = 1 – P(t x) = 0,9.

Из последнего равенства следует: P( t x) = 0,1 (n = 12). Определяем из таблицы: x = 1,782.

Пример 2. Найти значение x из условия P(t > x) = 0,995 , где t – случайная величина, распределенная по закону Стьюдента с 12-ю степенями свободы.

Решение. На рисунке 12 изображен график плотности распределения Стьюдента с 12-ю степенями свободы.

Рис. 12

16

Вероятность того, что случайная величина примет значение из области справа от точки x1 равна 0,995 , следовательно, в область левее этой точки случайнаявеличинапопадает свероятностью0,005. Чтобынайти x1,рассмотрим две симметричные области, изображенные на рисунке 13.

Рис. 13

Допустим, что в каждой из этих областей значение случайной величины оказывается с вероятностью 0,005. Тогда получаем: x1= – x, x2 = x, причем x определяетсяизусловияP( t >x)=0,01.Изтаблицынаходим:x =3,055.Теперьможно выписать ответ задачи: P(t > –3,055) = 0,995.

5. ВЫБОРОЧНЫЙ МЕТОД. СТАТИСТИЧЕСКИЕ ОЦЕНКИ ПАРАМЕТРОВ РАСПРЕДЕЛЕНИЯ

Пусть нам необходимо обследовать количественный признак в партии экземпляров некоторого товара. Проверку партии можно проводитьдвумя способами:

1)сплошной контроль всей партии;

2)контроль только части партии.

Первый способ не всегда осуществим, например, из-за большого числа экземпляров в партии, дороговизны проведения операции контроля, из-за того, что контроль связан с разрушением экземпляра (проверка электролампы на долговечность ее работы).

Для второго применяются понятия выборки (выборочной совокупности), генеральной совокупности, объема выборки, изложенные в ведении.

Будем рассматривать бесповторные выборки. Так как благодаря большому (бесконечному) объему генеральной совокупности расчеты и выводы для бесповторной выборки, справедливы для повторных выборок.

6. ТОЧЕЧНЫЕ ОЦЕНКИ ПАРАМЕТРОВ РАСПРЕДЕЛЕНИЯ

ТочечнаяоценканеизвестногопараметраΘ – случайная функция Θ*(Х1,

Х2, ..., Хп), значение которой для любой реализации выборки принимают за приближенное значение параметра Θ: * X1, X2, ..., Xn .

Получивстатистическиеоценкипараметровраспределения(выборочноесреднее, выборочную дисперсию и т. д.), необходимо убедиться, что они в достаточной степени служат приближением соответствующих характеристик генеральной совокупности. Определим требования, которые должны при этом выполняться.

Статистическая оценка Θ* называется несмещенной, если ее математическое ожидание равно оцениваемому параметру Θ при любом объеме выборки:

М(Θ*) = Θ.

17

Если M ( *n ) – в оценке параметра Θ имеется систематическая ошибка.

M ( *n )

Несмещенность оценки гарантирует отсутствие систематической ошибки в оценке параметра. Несмещенных оценок может быть несколько.

Смещеннойназывают оценку, математическое ожидание которойне равно оцениваемому параметру.

Однако несмещенность не является достаточным условием хорошего приближения к истинному значению оцениваемого параметра. Если при этом возможные значения Θ* могут значительно отклоняться от среднего значения, т. е. дисперсия Θ* велика, то значение, найденное по данным одной выборки, может значительно отличаться от оцениваемого параметра. Следовательно, требуется наложить ограничения на дисперсию.

Статистическая оценка называется эффективной, если она при заданном объеме выборки п имеет наименьшую возможную дисперсию (D * min).

При рассмотрении выборок большого объема к статистическим оценкам предъявляется еще и требование состоятельности.

Состоятельной называется статистическая оценка, которая при п→∞ стремится, по вероятности, к оцениваемому параметру (если эта оценка несмещенная, то она будет состоятельной, когда при п→∞ ее дисперсия стремится к

0), т. е. limP * 1.

n

Оценка математического ожидания. На основании теоремы Чебышева в качестве несмещенной, состоятельной оценки математического ожидания может быть использовано среднее арифметическое значение выборки хВ , называе-

мое выборочным средним.

Оценка дисперсии. В качестве состоятельной оценки дисперсии может быть использовано среднее арифметическое квадратов отклонений значений вы-

 

 

 

 

 

 

1

n

 

 

 

 

борки от выборочного среднего:

s2

xi

xВ 2 .

 

 

 

 

 

 

 

 

 

n i1

 

 

 

 

Вводится несмещенная оценка генеральной дисперсии – исправленная вы-

 

 

 

 

 

k

 

 

 

 

 

 

борочная дисперсия s2

n

 

 

 

mi (xi xB )2

 

 

D

i 1

 

 

 

 

.

 

n 1

 

 

n 1

 

 

B

 

 

 

 

 

 

Ей соответствует исправленное среднее квадратичное отклонение

 

 

 

 

 

 

 

 

k

 

 

 

 

 

s

s2

 

mi (xi xB )2

 

 

 

i1

 

 

 

.

 

 

 

n 1

 

 

 

 

 

 

 

 

 

 

 

 

Величины x и s2 являются несмещёнными, состоятельными и эффективными оценками величин M(Х) и D(Х).

18

Относительная частота mi появления события А в п независимых испыта- n

ниях является несмещенной состоятельной и эффективной оценкой неизвест-

ной вероятности р = Р(А) этого события (р – вероятность наступления события А в каждом испытании).

Пример 1. Найти несмещенную оценку математического ожидания, исправленную выборочную дисперсию и исправленное среднее выборочное отклонение для выборок.

а) выборка 1: 3,2; 4,1; 8,1; 8,1; 6,7; 4,4; 4,4; 3,2; 5,0; 6,7; 6,7; 7,5; 3,2; 4,4; 6,7; 6,7; 5,0; 5,0; 4,4; 8,1.

б) выборка 2: 10,8; 11,1; 11,7; 12,2; 13,1; 13,4; 13,9; 14,3; 14,3; 14,4; 14,8; 16,5; 17,7; 18,2; 19,9; 20,0; 20,3; 20,8; 23,1; 24,2; 25,1; 25,1; 25,7; 28,4; 28,5; 29,3; 29,8; 29,9; 30,2; 30,4.

Решение.

Выборка 1.

Объем выборки п = 20. Перепишем варианты в порядке возрастания: 3,2; 3,2; 3,2; 4,4; 4,4; 4,4; 4,4; 4,4; 5,0; 5,0; 5,0; 6,7; 6,7; 6,7; 6,7; 6,7; 7,5; 8,1; 8,1; 8,1.

Составлен дискретный вариационный ряд, который показывает, что выборка состоит из шести вариант (3, 4, 5, 6, 7, 8). Составим статистическое распределение:

 

 

xi

3,2

4,4

5,0

6,7

7,5

8,1

 

 

ni

3

5

3

5

1

3

Тогда xB

3,2 3 4,4 5 5 3 6,7 5 7,5 1 8,1 3

5,595.

 

 

 

 

 

 

 

20

 

 

 

 

s2 (3,2 5,595)2 3 ... (8 5,595)2 3 2,84. 19

s 2,84 1,69.

Выборка 2.

Объем выборки п = 30. Статистическое распределение представим в виде интервального вариационного ряда (см. пример 1 темы 2):

Номер интервала

Границы

Частота

интервала

 

 

1

10,5; 14,5

10

2

14,5; 18,5

4

3

18,5; 22,5

4

4

22,5; 26,5

5

5

26,5; 30,5

7

Будем считать вариантами середины частотных интервалов, то есть определим точечные оценки для выборки.

xi

2,5

16,5

0,5

24,5

28,5

ni

10

4

4

5

7

19

Тогда хВ 12,5 10 16,5 4 20,5 4 24,5 5 28,5 7 19,8. 30

s2 7,32 10 3,32 4 0,72 4 4,72 5 8,72 7 44,17. 29

s 44,17 6,65.

7. ИНТЕРВАЛЬНЫЕ ОЦЕНКИ ПАРАМЕТРОВ РАСПРЕДЕЛЕНИЯ

При выборке малого объема точечная оценка может значительно отличаться от оцениваемого параметра, что приводит к грубым ошибкам. Поэтому в таком случае лучше пользоваться интервальнымиоценками, т. е. указывать интервал, в который с заданной вероятностью попадает истинное значение оцениваемого параметра. Разумеется, чем меньше длина этого интервала, тем точнее оценка параметра. Поэтому, если для оценки Θ* некоторого параметра Θ справедливо неравенство |Θ* – Θ| < , число > 0 характеризует точность оценки (чем меньше , тем точнее оценка). Но статистические методы позволяют говорить только о том, что это неравенство выполняется с некоторой вероятностью.

Наибольшее отклонение оценки Θ* от оцениваемого параметра Θ, в частности, выборочной средней от генеральной средней, которое возможно с заданной доверительной вероятностью γ, называется предельной ошибкой выборки.

Ошибка является ошибкой репрезентативности выборки. Она возникает только вследствие того, что используется не вся совокупность, а лишь часть ее (выборка), отобранная случайно.

Очень часто (но не всегда) доверительный интервал выбирается симметричным относительно несмещенной точечной оценки Θ.

Надежностью (доверительной вероятностью) оценки Θ* параметра Θ называется вероятность γ того, что выполняется неравенство | Θ* – Θ | < . Если заменить это неравенство двойным неравенством – < Θ* – Θ < , тогда:

P ( Θ* – < Θ < Θ* + ) = γ.

Таким образом, γ есть вероятность того, что Θ попадает в интервал

(Θ* – , Θ* + ).

Числа Θ* – и Θ* + называются доверительными границами, интервал

(Θ* – , Θ* + ) – доверительным интервалом для параметра .

Доверительным называется интервал, в который попадает неизвестный параметр с заданной надежностью γ.

Построение доверительных интервалов

1. Доверительный интервал для оценки математического ожидания нормального распределения при известной дисперсии.

Для построения доверительного интервала требуется знать закон распределения исследуемой случайной величины. Пусть эта величина распределена по нормальному закону. Если при этом известно ее среднее квадратическое отклонение σ, то доверительный интервал для математического ожидания имеет вид:

20

Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]