Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:
Элементы стохастики – компетентностный подход. Учебное пособие.pdf
Скачиваний:
0
Добавлен:
15.08.2026
Размер:
1 Мб
Скачать

Глава 4. ЭЛЕМЕНТЫ МАТЕМАТИЧЕСКОЙ СТАТИСТИКИ

ОБУЧАЮЩИЙ МОДУЛЬ

1.СТАТИСТИЧЕСКОЕ РАСПРЕДЕЛЕНИЕ ВЫБОРКИ

1.1.Генеральная совокупность и выборка. Пусть имеется множество,

состоящее из конечного (но достаточно большого) числа некоторых объектов, при-

чём каждый объект характеризуется единственным значением xi некоторого количественного признака Х. Такое множество называется генеральной совокупностью;

всвою очередь совокупность из n случайно отобранных объектов называется

выборкой объёма n. Извлечённые выборки позволяют получить представление о распределении количественного признака Х как некоторой случайной величины.

Вподобных случаях говорят об эмпирическом распределении Х.

1.2.Пусть n1 объектов из выборки характеризуются значением х1, n2 объектов – значением х2, ..., nk – объектов – значением xk. Числа х1, х2, ..., xk называются вариантами, а числа n1, n2, …, nk частотами соответствующих вариант. Соответствие между вариантами и соответствующими им частотами называется статистическим распределением выборки, а таблица вида

xi

x1

x2

...

xk

ni

n1

n2

...

nk

называется вариационным рядом; очевидно, что

n1 + n2 + ... +nk = n.

Относительными частотами значений xi называются соответствующие чис-

ла вида wi nni ; справедливо соотношение

w1 + w2 + ... + wk = 1.

Модой Мо называют варианту, имеющую наибольшую частоту. Медианой me называют варианту, которая находится в середине вариационного ряда, если число вариант нечётно; медиана me равна среднему арифметическому двух ближайших к «середине» вариант, если их число чётно. Размахом варьирования R называют разность между наибольшей и наименьшей вариантами.

1.3. Выборочной средней xв называется среднее арифметическое всех наблюдаемых (в выборке) значений:

x

(x1 ... x1) (x2 ... x2 ) (xk ... xk )

,

 

 

 

 

 

в

 

 

 

n

 

 

 

 

 

 

 

 

 

 

причём в первой скобке имеется n1

слагаемых, во второй – n2 , …, в последней – nk

слагаемых. Установим, что

 

 

 

 

 

 

 

 

 

n1

 

n2

 

 

nk

k

xв x1

x2

 

... xk

или xв xi wi .

n

n

n

 

 

 

 

i 1

 

 

 

 

 

 

 

 

63

Действительно,

x

в

 

x1п1 x2п2 ... xk nk

 

x1n1

 

x2n2

...

xk nk

 

n

n

n

n

 

 

 

 

 

 

 

 

 

 

 

 

 

x1w1 x2 w2 xk wk .

Возникает вопрос о количественной характеристике степени рассеивания наблюдаемых значений относительно их среднего. Первое, что естественно сде-

лать – это рассмотреть среднее арифметическое самих уклонений х xв , т.е.

((x1 xв ) ... (x1 xв )) ((xk xв ) ... (xk xв ))

n

,

или, что то же самое,

1 k

n (xi xв )wi ,

i 1

однако такая сумма равна нулю для всякого статистического распределения выборки (и следовательно, подобно случаю теоретических распределений ДСВ, не может служить характеристикой рассеяния):

k

k

k

(xi xв )wi xi wi xв wi xв xв 0 .

i 1

i 1

i 1

Очевидно, что нулевое значение вычисленной суммы получается за счёт взаимного погашения отрицательных и положительных уклонений. В этом случае естественно перейти к рассмотрению среднего арифметического квадратов уклонений значений хi относительно их средней xв , называемого выборочной дисперсией Dв .

Итак, выборочная дисперсия определяется в виде

k

Dв (xi xв )2 wi ,

i 1

которую удобнее вычислять по формуле (доказываемой способом, аналогичным приведённому в п. 1.4)

Dв (x1)2 nn1 (x2 )2 nn2 ... (xk )2 nnk (xв )2 .

Выборочным средним квадратическим отклонением называется величина

( X ) Dв .

1.4. Поскольку с ростом п относительные частоты wi = w( Х хi )

становятся близкими к соответствующим вероятностям

рi Р( Х хi ) ,

то значения выборочных средних xв становятся близкими к математическому ожиданию М М ( Х ) количественного признака Х . Точно также значения выбороч-

64

ных дисперсий Dв становятся (с ростом п) близкими к дисперсии количественного признака 2 D( X ). Точные формы этих утверждений используют понятие сходимости по вероятности и выходят за рамки настоящего материала.

2.СТАТИСТИЧЕСКИЕ ОЦЕНКИ ПАРАМЕТРОВ РАСПРЕДЕЛЕНИЯ

2.1.Предположим, что нас интересует неизвестное значение некоторого параметра, характеризующего количественный признак Х генеральной совокупно-

сти. Оценкой параметра называют значения некоторой функции от наблюдаемых (в выборках) значений, дающие первоначальное представление о величине .

Точечной оценкой параметра называют оценку, которая определяется одним числом; так, например, точечной оценкой математического ожиданияМ ( Х ) количественного признака Х генеральной совокупности является значе-

ние выборочной средней.

2.2. Пусть известен вид функции распределения F(x, ) количественного при-

знака Х генеральной совокупности, но единственный параметр распределения остаётся неизвестным. Для его оценки достаточно иметь одно уравнение относительно этого параметра. Поскольку математическое ожидание случайной величи-

ны Х также зависит от этого параметра, т.е. М ( Х , ) , то имеем (см. п. 2.1) следующее приближённое равенство для нахождения :

xв М ( Х , )

Если функция распределения определяется двумя неизвестными параметрами, т.е. имеет вид F (x, 1, 2 ) , то для их оценки необходимы два уравнения. В этом слу-

чае следует пользоваться системой двух приближённых равенств

xв M ( X , 1, 2 );

Dв D( X , 1, 2 ).

Указанный способ нахождения неизвестных параметров распределения называется методом моментов.

Найдём, например, методом моментов оценку параметров a и b равномерного распределения равномерно распределённого количественного признака генеральной совокупности. Имеем систему

xв M ( X , a,b);

Dв D( X , a,b),

или, учитывая, что для равномерного распределения

M ( X )

a b

 

D( X )

(b a)2

 

 

 

 

 

и

 

,

 

2

 

 

 

12

 

 

 

 

 

 

 

 

 

 

имеем

 

 

 

 

 

 

 

 

 

 

 

 

 

 

1

 

(a b) xв ;

 

 

 

 

 

2

 

 

 

 

 

 

 

 

 

 

 

 

 

 

1

 

 

 

 

2

 

 

 

 

 

 

(b a)

Dв.

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

12

 

 

 

 

 

 

 

 

65

Решив эту систему, получим искомые оценки:

a* xв в 3 , b* xв в 3 , где в Dв .

2.3. Интервальной называют оценку, которая определяется двумя числами – концами интервала. Надёжностью (доверительной вероятностью) оценки называют вероятность , с которой отклонение | * | оказывается задано малым.

Наиболее часто задают надёжность, равную 0,95; 0,99; 0,995. Интервал ( – ,+ ) называют доверительным интервалом для оценки параметра .

Рассмотрим так называемые доверительные интервалы для оценки матема-

тического ожидания нормального распределения при известном среднем квадратическом отклонении . Пусть количественный признак Х генеральной совокупности распределен с плотностью

f (x)

 

1

 

e

 

 

 

 

 

 

 

 

 

2

( x a)2

2 2

(нормальное распределение); здесь параметр а есть значение математического ожидания, а – среднее квадратическое отклонение случайной величины Х. Предположим, что среднее квадратическое отклонение этого распределения известно, и извлечена выборка объёма n. Требуется оценить неизвестное математическое ожидание а по выборочной средней с заданной надёжностью . Если

P(| xв a| < ) = ,

то значение (радиус доверительного интервала) определяется в виде = t n ,

где число t может быть найдено из соотношения Ф(t) 2 , по табл. П.1. Следова-

тельно, с надёжностью доверительный интервал

 

 

 

 

 

 

 

xв t

 

 

 

, xв t

 

 

 

 

 

 

 

 

 

 

 

n

 

 

 

 

 

 

 

n

покрывает неизвестный параметр а; точность оценки есть t n .

3.МЕТОД НАИМЕНЬШИХ КВАДРАТОВ

3.1.Предположим, что эмпирическим путём выявлена зависимость между величинами X и Y, где Y – случайная величина. Например, эксперимент может состо-

ять

в измерении значений у1, у2 , ..., уп случайной величины Y в точках

х1,

х2 , ..., хп . Полученная на координатной плоскости система точек (хi, yj), j = 1…n,

называется диаграммой рассеяния. При этом по характеру расположения точек может быть сделан вывод о возможном виде объективно имеющейся функциональной зависимости у (х) ; последнее уравнение называется уравнением регрессии.

Например, речь может идти о регрессии (зависимости) линейной y ax b , квадратичной y ax 2 bx c и др. Однако значения параметров a, b, ... остаются неиз-

66

вестными; на основе полученных экспериментальных данных можно говорить лишь о точечных оценках , , ... параметров a, b, ... Итак, мы ищем зависимость

y (x; , , ...), «наилучшим образом» описывающую расположение точек на диа-

грамме рассеяния (так называемое выборочное уравнение регрессии). Пользуясь вышеприведёнными (см. п. 1.3) рассуждениями о целесообразности рассмотрения квадратов уклонений, которые (уклонения) в данном случае имеют вид

j y j (x j ; , , ...) ,

выберем значения , , ... так, чтобы сумма

n

( , , ...) ( y j (x j ; , , ...))2

j 1

принимала наименьшее значение (оно, очевидно, должно существовать, поскольку множество всех значений такой суммы ограничено снизу нулём).

Y

y1

y = φ(х; а, b, …)

y2

X

x1 x2

Согласно необходимому условию экстремума функции ( , , ...) все её частные производные по переменным , , ... должны обратиться в ноль:

 

n

 

( y j (x j ; , , ...))2

0 ;

 

 

j 1

 

 

n

 

 

( y j (x j ; , , ...))2

0 ,

 

j 1

 

Если числа , , ... (решение этой системы) определятся однозначным образом, то они и будут искомыми точечными оценками параметров a, b, ...; тем самым задача о поиске выборочного уравнения регрессии y (x; , , ...) будет решена.

3.2. В случае линейной регрессии y = ax + b система уравнений п. 3.1 для получения точечных оценок , параметров a, b принимает вид

 

 

n

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

2 y j ( x j )

 

 

( x j )

0;

 

 

 

j 1

 

 

 

 

 

 

n

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

2

y j ( x j )

 

 

( x j )

0,

 

 

 

j 1

 

 

 

 

 

 

 

 

 

 

 

67

Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]