Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Лекции по теории вероятностей и математической статистике (для слушателей Института сокращенных программ). Учебное пособие для бакалавров направлений

.pdf
Скачиваний:
0
Добавлен:
12.08.2026
Размер:
1 Мб
Скачать

Выбор доверительной вероятности γ определяется конкретной ситуацией. Если заранее не оговариваются дополнительные условия, то наиболее часто доверительную вероятность (ещё её называют надежностью критерия) принимают γ=0,95. То есть надежность оценки составляет 95%. Это хороший результат. Лишь 5% на ошибку, на те условия, которые невозможно учесть заранее. Но бывают ситуации, когда точность расчетов должна быть более высокой. Тогда задают γ= 0,98 или γ= 0,99. Возможно и обратное: очень много условий, которые вносят неопределенность в расчеты. Тогда принимают γ = 0,75 или γ = 0,88. Увеличивая доверительную вероятность, мы также увеличиваем и доверительный интервал. Поэтому, надо стараться соблюдать баланс и часто приходится корректировать надежность оценки для получения правдоподобных результатов.

Интервальная оценка математического ожидания при известной дисперсии

Пусть X — случайная величина, распределенная по нормальному закону с параметрами a = E(X), σ = σ(X), причем значение a неизвестно, а значение σ2 известно.

В качестве оценки параметра a возьмем выборочное среднее x . Из курса теории вероятностей известно, что случайная величина x распределена по нормальному за-

кону с параметрами E(x) = a,D(x) = σ2 . n

Зададим доверительную вероятность γ и потребуем,

чтобы выполнялось соотношение: P( a x < ε) = γ . Воспользуемся известной формулой для нормальной

С.В.: P(

 

X a

 

< δ) = 2Φ

δ

,

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

σ

 

 

 

 

 

 

σ

 

 

в которой заменим X на

 

 

; δ на ε, а σ на

 

 

 

.

x

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

n

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

ε

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

n

 

 

 

 

P(

a x

 

< ε) = 2Φ

 

 

 

 

 

.

 

 

 

 

 

 

 

 

 

 

 

 

 

 

σ

 

 

 

Сравнивая последние формулы, видно, что по данной доверительной вероятности γ следует найти значе-

101

ние t функции Лапласа, чтобы выполнялось равенство:

Φ(t) = 2γ .

После этого погрешность доверительного интервала

вычислим по формуле: ε =

t

σ

 

.

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

n

 

 

 

 

 

 

Таким

 

 

образом,

доверительный

интервал

 

 

 

t σ

 

 

 

t σ

 

 

 

γ покрывает неизвест-

 

 

 

 

 

 

 

x

 

 

 

;x

+

 

 

 

с надежностью

 

 

 

 

 

 

 

 

n

 

 

 

 

 

n

 

 

 

 

 

 

 

ный параметр a.

Замечание 1. Из формулы для погрешности следует, что при увеличении n точность оценки увеличится. С другой стороны, если увеличивать надежность γ, то это приведёт к увеличению t, а значит, и к увеличению погрешности ε.

Замечание 2. Если требуется оценить параметр a с заданной погрешностью ε и надежностью γ, то минимальный объём выборки, который обеспечит данную точность,

находят по формуле:

n = t2 σ2

ε2

Замечание 3. Оценки γ и ε используют при больших n (больше 100) и при отсутствии нормального закона распределения, так как из центральной предельной теоремы

 

 

 

 

a

 

следует, что закон распределения С.В. Z =

x

незначи-

σ

 

 

 

 

 

 

 

 

n

 

 

тельно отличается от стандартного нормального закона.

Пример 34

Брокер на бирже изучает выбранную им акцию на протяжении года для того, чтобы найти доверительный интервал для доходности выбранной акции с надежностью 0,95. Изучив фундаментальный анализ, он посчитал стандартное отклонение и выборочное среднее доходности за последний год (52 недели). При этом, стандартное отклонение составило 7 %, а выборочное среднее 20,5 %. Найдите доверительный интервал для доходности акции.

102

Решение

Имеем n = 52; x = 20,5; σ = 7; γ = 0,95.

Из таблицы значений функции Лапласа (смотрите таблицу 2 приложения) находим:

(t) = 0,95 Φ(t) = 0,475 t = 1,96 . По формуле по-

считаем погрешность ε =

t

σ

 

=

1,96 7

≈ 1,9.

 

 

 

 

 

 

 

n

52

 

 

 

 

 

 

Таким образом, с надежностью 0,95 доверительный интервал возможных значений средней доходности выбранной акции:

(x − ε;x + ε) = (20,5 −1,9;20,5 +1,9) = (18,6;22,4).

Если обозначить искомую доходность x0 , то ответ вы-

глядит так:

18,6%< x0 < 22,4%.

Интервальная оценка математического ожидания при неизвестной дисперсии

Пусть X — случайная величина, распределенная по нормальному закону с параметрами a = E(X), σ = σ(X) причем среднее квадратичное отклонение σ неизвестно. В этом случае мы не можем воспользоваться предыдущими результатами.

Рассмотрим С.В. T =

 

a

 

x

,

 

s

 

 

 

 

 

 

n

 

 

где для данной выборки объёма n, x — выборочное среднее и s — исправленное выборочное стандартное отклонение.

Случайная величина T подчиняется специальному закону распределения, а именно, закону Стьюдента с (n – 1) степенями свободы.

По данной доверительной вероятности γ и таблице значений распределения Стьюдента с k = n – 1 степенями свободы (таблица 3 приложения) найдем значение аргумента tγ, при котором выполняется соотношение:

 

 

 

 

 

 

 

 

 

 

 

 

x a

P

< tγ = γ.

 

 

s

 

 

 

 

 

 

 

n

 

103

Тогда, получим следующее равенство:

 

t

s

 

 

 

 

 

 

t

 

s

= γ .

 

 

 

 

P

 

γ

 

 

< a <

 

+

 

γ

 

 

 

 

 

 

 

 

 

x

 

 

x

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

n

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

n

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

t s

 

 

 

t

s

 

 

 

 

 

 

 

 

 

 

 

 

 

Доверительный интервал

x

 

γ

; x +

γ

 

 

 

покрыва-

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

n

 

 

 

 

 

n

 

 

 

ет неизвестный параметр a с надежностью γ.

Заметим, что существуют различные таблицы критических точек распределения Стьюдента. В частности, в данном пособии, в приложении дана таблица с уровнем значимости. Доверительная вероятность (надежность) и уровень значимости — это вероятности противоположных событий. То есть, α = 1− γ . Кроме того, в данной таблице указаны двухсторонняя и односторонняя критическая область. Подробнее об этом в примерах.

В условиях предыдущего примера 34 уточним доверительный интервал для доходности акции, предполагая, что выборочное среднее квадратическое отклонение является исправленным.

Решение примера 34 с учетом поправок

По таблице значений Стьюдента найдем tγ, для которого при числе степеней свободы k = n – 1 = 51; γ = 0,95; α = 1γ = 0,05.

Имеем tγ = 2,01. В данном случае рассматриваем значение уровня значимости при двусторонней критической области, так как берём двусторонний интервал возможных значений, то есть x ± ε .

Это значение мы взяли приближенно, так как в таблице есть значения для k= 40 и k= 60. Эти значения мало отличаются, и мы берём среднее из них. В первой строчке таблицы находим уровень значимости α = 0,05 для двусторонней критической области.

Поэтому точность оценки вычисляется по формуле:

ε = tγ s = 2,01 7 1,95.

n 52

Доверительный интервал (18,55; 22,45) покрывает неизвестный параметр a с надежностью 0,95. То есть, с учетом введенных ранее обозначений, ответ будет следующим:

104

18,55 %< x0 < 22,45 %.

Следует заметить, что интервал возможных значений для средней доходности выбранной акции несколько увеличился. Это связано с меньшей информацией о данной акции (в предыдущем примере предполагается, что дисперсия известна). Для того, чтобы улучшить показатели вычислений, в математической статистике есть единственный способ — это увеличить объём выборочных данных. Чем меньше мы имеем данных, тем хуже будут наши показатели и менее точные расчёты. Поэтому для получения более точных показателей на практике часто проводят серии повторных испытаний.

Доверительный интервал для вероятности

Пусть производятся независимые испытания с неизвестной вероятностью p появления события A в каждом испытании. Требуется оценить неизвестную вероятность

по относительной частоте p = mn .

Из анализа схемы Бернулли известно, что вероятность отклонения относительной частоты от вероятности находят по формуле:

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

δ n

P(

p p

< δ ) = 2Φ

 

 

 

 

 

.

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

p q

Для нахождения погрешности δ оценки вероятности

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

необходимо решить уравнение: δ = t

p q

.

 

Решим неравенство:

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

n

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

<

 

 

 

p q

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

p

 

 

p

 

 

t

 

 

 

 

 

 

.

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

n

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

При больших n получаем следующие формулы:

p = p t

p q

 

, p

= p + t

 

 

 

 

p q

 

.

 

 

 

 

 

 

 

 

1

 

 

 

 

 

n

 

 

 

 

2

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

n

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

Таким образом, доверительный интервал для вероят-

ности имеет вид:

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

p q

 

 

+

 

 

 

 

 

 

p q

 

p

 

 

p

t

 

 

 

 

 

; p

 

t

 

 

 

 

 

 

 

 

 

 

 

 

 

.

 

 

 

n

 

 

 

 

 

 

n

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

105

Пример 35

Фирма разослала 1000 новых рекламных каталогов и получила 120 заказов. Построить доверительный интервал для эффективности рекламы (вероятности отклика) с надежностью 0,95.

Решение

Число испытаний n= 1000 достаточно велико, поэтому, p1 = p t pnq , p2 = p + t pnq .

Значение t находим из соотношения: Φ(t) = 2γ = 0,475

по таблице значений функции Лапласа (таблица 2 приложения): t= 1,96. Относительная частота p = 1000120 = 0,12 .

 

 

 

 

 

 

 

 

p1 = 0,12 −1,96

 

0,12 0,88

 

≈ 0,1;

1000

 

 

 

 

 

 

 

 

 

 

 

 

 

p2 = 0,12 +1,96

0,12 0,88

 

≈ 0,14.

1000

Итак, доверительный интервал для эффективности

рекламы:

p (0,1;0,14).

Для полного исследования статистических данных

ипринятия решения о дальнейших действиях (например, стоит ли покупать в ближайшее время акции интересующей компании) не достаточно знать выборочные данные

иуметь находить их оценки. Важно также уметь сравнивать параметры распределения и делать выводы о согласованности неизвестного распределения с известными законами. Для этого выдвигаются статистические гипотезы, которые проверяются статистическими методами.

106

Глава 15. Проверка статистических гипотез

Определение. Статистической называют гипотезу о виде неизвестного распределения, или о параметрах известных распределений.

Например, статистической гипотезой является:

1)Генеральная совокупность распределена по нормальному закону;

2)Дисперсии двух нормальных совокупностей равны между собой.

Гипотеза «Лох-Несское чудовище существует» не является статистической, так как относится к псевдонауке

ив ней ни о каком распределении или параметрах распределения речи нет.

Наряду с выдвинутой (основной) гипотезой рассматривают и противоречащую ей (конкурирующую с ней) гипотезу. Если выдвинутая гипотеза будет отвергнута, то имеет место противоречащая ей гипотеза. По этой причине эти гипотезы следует различать.

Нулевой (основной) называют выдвинутую гипотезу

иобозначают её H0. Конкурирующей (альтернативной) называют гипотезу, которая противоречит основной и её

обозначают H1.

Кроме того, гипотеза бывает простой или сложной. Простой называют гипотезу, содержащую только одно предположение. Сложной называют гипотезу, которая состоит из конечного или бесконечного числа простых

гипотез.

Например, если σ2 — дисперсия выбранной акции, то

H0: σ2 = 5 — простая гипотеза

H1: σ2 >5 состоит из бесчисленного множества простых гипотез вида Hi: σ2 = bi, bi >5 — это сложная гипотеза.

Выдвинутая гипотеза может быть правильной или неправильной, поэтому возникает необходимость её проверки. Поскольку проверку производят статистическими методами, её называют статистической. В итоге статистической проверки гипотезы в двух случаях может быть принято неправильное решение, то есть могут быть допущены ошибки двух родов.

107

Ошибка I рода состоит в том, что будет отвергнута правильная гипотеза.

Ошибка II рода состоит в том, что будет принята неправильная гипотеза.

Последствия этих ошибок могут оказаться весьма различными. Например, рассмотрим гипотезу «продолжать строительство дома». Если в некоторый момент выясняются ошибки при строительстве и необходимо принимать решение, то последствия ошибок могут быть совершенно несоизмеримыми.

Вслучае ошибки первого рода: мы отвергаем правильную гипотезу о продолжении строительства. Это приведет

кфинансовым потерям.

Вслучае ошибки второго рода: будет принята неправильная гипотеза о продолжении строительства. Результатом могут быть обрушения и человеческие жертвы.

Правильное решение может быть принято также

вдвух случаях:

1)Гипотеза принимается, причем в действительности она правильная;

2)Гипотеза отвергается, причем в действительности она неверна.

Вероятность ошибки I рода называют уровнем значимости критерия и обозначают α. Вероятность ошибки II рода обозначают β, а величина 1 – β называется мощностью критерия.

Для проверки нулевой гипотезы используют специально подобранную случайную величину, точное или приближенное распределение которой известно. Случайные величины с определёнными законами распределения имеют вполне определённые обозначения.

Обозначения:

U или Z, если величина распределена нормально; F или v2 — по закону Фишера-Снедекора;

T — по закону Стьюдента;

χ2 — по закону «хи-квадрат».

В общем случае случайную величину, которая служит для проверки статистического критерия обозначают K.

108

Статистическим критерием (или просто критерием) называют случайную величину K, которая служит для проверки нулевой гипотезы.

Например, если проверяют гипотезу о равенстве математических ожиданий двух нормальных генеральных совокупностей, то при известных дисперсиях этих совокупностей в качестве критерия K принимают случайную величину вида:

Z =

 

X

Y

 

 

 

,

 

 

 

 

 

 

 

 

σx2

+

σy2

 

 

 

m

n

 

 

 

 

 

 

 

 

 

где X и Y — выборочные средние, σx2 и σy2 — известные дисперсии, m и n — соответствующие объёмы выборочных данных. Эта случайная величина имеет нормальное распределение.

Наблюдаемым значением Kнабл. называют значение критерия, вычисленное по выборкам. Например, если по выборочным данным известно X = 20, Y = 18 , m = 25, n = 20. При известных дисперсиях σx2 = 5, σy2 = 8 найдем

наблюдаемое значение:

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

Zнабл. =

 

X

Y

 

 

=

20 −18

 

 

=

2

≈ 2,58.

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

σx2

σy2

 

5

+

8

 

0,775

 

 

 

+

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

25

20

 

 

 

 

 

 

 

m

n

 

 

 

 

 

 

 

 

После выбора определенного критерия множество всех его возможных значений разбивают на два непересекающихся класса: одно из них содержит значения критерия, при которых нулевая гипотеза отвергается, а другая – при которых она принимается.

Критической областью называют совокупность значений критерия, при которых нулевую гипотезу отвергают.

Областью принятия гипотезы (областью допустимых значений) называют совокупность значений критерия, при которых гипотезу принимают (рисунок 14).

109

Рисунок 14. Область принятия гипотезы.

Основной принцип проверки статистической гипотезы: если наблюдаемое значение критерия принадлежит критической области — гипотезу отвергают, если наблюдаемое значение критерия принадлежит области принятия гипотезы — гипотезу принимают.

Критическими точками (границами) Kкр. называют точки, отделяющие критическую область от области принятия гипотезы.

Для нахождения критических точек задают достаточно малую вероятность — уровень значимости α — вероятность попадания наблюдаемого значения в критическую область. Затем ищут критическую точку Kкр., исходя из требования, чтобы при условии справедливости нулевой гипотезы: P(K > Kкр.)= α для правосторонней критической области.

Если уровень значимости уже выбран, то критическую область следует строить так, чтобы мощность критерия была максимальной.

Выполнение этого требования должно обеспечить минимальную ошибку II рода. Ясно, что чем меньше вероятности ошибок I и II рода, тем критическая область «лучше». Однако, при заданном объёме выборки уменьшить одновременно α и β невозможно.

Замечание. Единственный способ одновременного уменьшения вероятностей ошибок I и II-го рода состоит в увеличении объёма выборок.

Проверка гипотезы об определенном значении параметра нормального распределения.

Пусть X1, …, Xn– выборка из распределения N(m, σ2). Гипотеза об определенном значении генерального среднего

110

Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]