Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Элементы математической статистики. Учебное пособие-1

.pdf
Скачиваний:
0
Добавлен:
15.08.2026
Размер:
792 Кб
Скачать

 

 

 

 

 

xB

t

a xB

t

(для повторной выборки) или

 

 

 

 

 

 

 

 

 

 

 

 

 

 

n

 

 

 

 

n

xB

 

t

1

n

a xB

t

1

n

 

(для бесповторной выборки), где а – оце-

n

N

n

N

 

 

 

 

 

 

 

xB – выборочная средняя; п – объем вы-

ниваемое математическое ожидание;

борки; t – такое значение аргумента функции Лапласа Ф (t), при котором

Ф(t) 2 ,приn 30 или t t -критическаяточкараспределенияСтьюдента,при

n 30; N – объем генеральной совокупности.

Для любого числа [0; 1] можно по таблице (приложение 3) найти такое число t, что (t)= /2.

Можно сказать иначе: точечная оценка x определяет значение параметра а

с точностью d

t

и надежностью .

n

 

 

Пример 1. Найти доверительный интервал для математического ожидания нормально распределенной случайной величины, если объем выборки п = 49, xB 2,8, σ = 1,4, а доверительная вероятность γ = 0,9.

Решение. Определим t, при котором Ф(t) = 0,9:2 = 0,45. Следовательно, по таблице приложения 3 найдем t = 1,645.

Тогда 2,8

1,645 1,4

a 2,8

1,645 1,4

, или 2,471 < a < 3,129. Найден

49

49

 

 

 

доверительный интервал, в который попадает математическое ожидание а с надежностью 0,9.

2. Доверительный интервал для оценки математического ожидания нормального распределения при неизвестной дисперсии.

Принеизвестномсреднемквадратическомотклонениидоверительныйинтервал для математического ожидания при заданной надежности γ задается так:

 

xB

t s

 

a xB

t s

(для повторной выборки) или

 

n

 

 

 

 

 

 

 

 

 

 

n

 

 

 

 

 

xB

t s

 

1

 

n

a xB

 

 

t s

1

 

n

(для бесповторной выборки),

n

 

N

 

 

n

N

 

 

 

 

 

 

 

 

 

 

 

где s – исправленное выборочное среднее квадратичное отклонение, а t t (n, ) критическая точка распределения Стьюдента, значение которой

можно найти из таблиц (приложение 2) по известным п и γ.

Пример 2. Пусть объем выборки п = 25, хВ = 3, s = 1,5. Найдем доверительный интервал для а при γ = 0,99.

21

Решение. Из таблицы находим, что при п = 25, γ = 0,99 величина tγ = 2,797.

Тогда 3

2,797 1,5

a 3

2,797 1,5

, или 2,161< a < 3,839 – доверительный

25

25

 

 

 

интервал, в который попадает а с вероятностью 0,99.

3. Доверительные интервалы для оценки среднего квадратичного отклонения нормального распределения.

Дляоценкигенеральногосреднегоквадратичногоотклоненияσпризаданной надежности γ можно построить доверительный интервал вида

s(1 q) s(1 q),

где s – исправленное выборочное среднее квадратическое отклонение, а q = q (n, γ) – значение, определяемое из таблиц (приложение 4).

Пример 3. Пусть п = 20, s = 1,3. Найдем доверительный интервал для σ при заданной надежности γ = 0,95.

Решение. Из соответствующей таблицы находим при n = 20, γ = 0,95 значение q = 0,37. Следовательно, границы доверительного интервала: 1,3(1 – 0,37) = 0,819 и 1,3(1 + 0,37) = 1,781. Итак, 0,819 < σ < 1,781 с вероятностью 0,95.

Пример 4. Дана выборка значений нормально распределенной случайной величины: 2, 3, 3, 4, 2, 5, 5, 5, 6, 3, 6, 3, 4, 4, 4, 6, 5, 7, 3, 5. Найти с доверительной вероятностью γ = 0,95 границы доверительных интервалов для математического ожидания и дисперсии.

Решение. Объем выборки п = 20. Найдем хВ = 4,25, s = 1,37. По таблицам

определим t (0,95; 20) = 2,093; q (0,95; 20) = 0,37.

 

 

Тогда 4,25

2,093 1,37

a 4,25

2,093 1,37

;

3,64 a 4,86 довери-

20

20

 

 

 

 

тельный интервал для математического ожидания; 1,37(1 0,37) 1,37(1 0,37);

0,86 1,88. Возведем все части неравенства в квадрат, т. к. D 2 . Тогда 0,74 D 3,52 доверительный интервал для дисперсии.

Квантилем или нормированным отклонением называется отношение предельной ошибки к средней ошибке выборки.

txВ ,

x0

где x

 

 

 

- средняя ошибка; x

t

s2

 

 

n

- предельная ошибка;

 

ген

 

1

 

 

 

n

n

 

0

 

 

 

 

 

 

N

 

 

 

 

 

 

 

 

 

 

 

 

 

ген

 

n

 

выбор.

,

t – квантиль нормального закона распределения (при

n 1

 

 

 

 

 

0,05, t 1,96);

N – объем генеральной совокупности; п – объем выборки; s2

– исправленная выборочная дисперсия.

22

Квантиль вычисляется по соответствующему уровню значимости (при n 30 t -квантиль нормального закона распределения, при n 30, t -квантиль распределения Стьюдента).

Важной является задача определения объема выборочной совокупности п при заданном уровне значимости. В случае бесповторной выборки необходимый

объем выборки определяется по формуле

n

t2

s2 N

и в случае повторной

t2s2 2

N

 

 

 

x

выборки n t2s2 .

2xB

КОМПЛЕКСНАЯ ЗАДАЧА

Дано распределение 60 абитуриентов по числу баллов, полученных ими на приемных экзаменах:

20

19

22

24

21

18

23

17

20

16

15

23

21

24

21

18

23

21

19

20

24

21

20

18

17

22

20

16

22

18

20

17

21

17

19

20

20

21

18

22

23

21

25

22

20

19

21

24

25

23

21

19

22

21

19

20

23

22

21

21

Провести статистическое исследование данной выборки. Для этого:

1)составить интервальный вариационный ряд;

2)построить:

а) гистограмму (для интервального вариационного ряда), б) полигон (для середин частотных интервалов), в) кумуляту (для интервального вариационного ряда), г) огиву (для середин частотных интервалов);

3)определить выборочные характеристики: а) моду, б) медиану,

в) среднее арифметическое, г) дисперсию,

д) среднее квадратичное отклонение, е) коэффициент вариации, ж) асимметрию, з) эксцесс.

4)найти точечные оценки параметров:

а) несмещенную оценку математического ожидания, б) исправленную выборочную дисперсию, в) исправленное среднее выборочное отклонение.

5)учитывая,чтопроводилась10%-наяслучайнаявыборка,приуровнезна- чимости 0,05 определить:

23

а) доверительный интервал для математического ожидания с доверительной вероятностью 1 ,

б) объем выборки, при котором с доверительной вероятностью1 предельная ошибка выборки уменьшится в 2 раза при сохранении

уровня остальных характеристик.

Решение.1)Составиминтервальныйвариационныйряд(см.пунктПервичная обработка результатов).

По условию объем выборки n 60.

Из всех данных значений выберем наименьшее и наибольшее: xmin 15,

xmax 25.

 

 

 

 

 

 

 

 

 

xmax xmin

 

 

 

 

 

По

формуле Стерджеса h

 

 

 

при значении

n 60 найдём

1

3,322lgn

 

 

 

 

 

 

 

 

 

 

 

 

 

длину частотного интервала h

 

 

 

25 15

1,45. Примем h 1,5.

1

3,322lg60

 

 

 

 

 

 

 

 

 

 

 

За начало первого интервала возьмём величину х

х

 

h

, то есть ве-

 

 

 

 

1,5

 

 

 

 

 

 

 

 

нач

min

2

 

личину x

 

15

14,25.

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

нач

2

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

Исходные данные разобьём на восемь интервалов: [14,25; 15,75), [15,75; 17,25), [17,25; 18,75), [18,75; 20,25), [20,25; 21,75), [21,75; 23,25), [23,25; 24,75), [24,75; 26,25].

Для нахождения частот, накопленных частот, частостей и накопленных частостей составим вспомогательную таблицу:

Номер

Границы

Ча-

Накопленная ча-

Частость,

Накопленная

стота,

интервала

интервала

стота,

wi

частость, wiнак

mi

 

 

 

 

 

1

14,25; 15,75

1

1

1/60

1/60

2

15,75; 17,25

6

7

1/10

7/60

3

17,25; 18,75

5

12

1/12

1/5

4

18,75; 20,25

16

28

4/15

7/15

5

20,25; 21,75

13

41

13/60

41/60

6

21,75; 23,25

13

54

13/60

27/30

7

23,25; 24,75

4

58

1/15

29/30

8

24,75; 26,25

2

60

1/30

1

2) Построим требуемые графики (см. Графическое изображение вариационных рядов).

а) Гистограмма. По горизонтали отложим границы интервалов, а по вертикали – частоты. Далее на каждом частотном интервале построим прямоугольник с высотой, равной величине соответствующей этому интервалу частоты.

24

mi

 

 

 

 

 

 

 

 

 

16

 

 

 

 

 

 

 

 

 

13

 

 

 

 

 

 

 

 

 

6

 

 

 

 

 

 

 

 

 

5

 

 

 

 

 

 

 

 

 

2

 

 

 

 

 

 

 

 

 

14,25

15,75

17,25

18,75

20,25

21,75

23,25

24,75

26,25

хi

 

 

 

 

Рис. 5

 

 

 

 

 

б) Полигон частот. Для каждого частотного интервала найдём его серединуиотложимнайденныезначенияпогоризонтали.Частоты,соответствующие интервалам, откладываем по вертикали. Получим точки, которые соединим отрезками последовательно слева направо. Из первой и последней точки опустим перпендикуляры на горизонтальную ось.

mi

16

13

6

5

4

2

1

0

15

 

16,5

 

18

 

19,5

 

21

 

22,5

24

25,5

хi

Рис. 6

в) Кумулята. По горизонтали отложим границы интервалов, а по вертикали

– накопленные частоты и построим соответствующие точки. Первая точка имеет абсциссу, равную началу первого интервала (14,25), а ординату – накопленной частоте,равнойнулю.Остальныеточкиимеютабсциссы,равныеконцаминтервалов, а ординаты – соответствующим значениям накопленной частоты.

Построенные точки соединяем ломаной.

miнак

60

58

54

41

28

12

7

1

0 14,25 15,75 17,25 18,75 20,25 21,75 23,25 24,75 26,25 хi

Рис. 7

25

г) Огива. Огива строится аналогично кумуляте с той лишь разницей, что накопленные частоты помещают на оси абсцисс, а значения признака — на оси ординат.

хi

26,25

24,75

23,25

21,75

20,25

18,75

17,25

15,75

14,25

0

1

 

7

 

12

28

41

54 58 60

 

miнак

 

 

 

 

 

 

Рис. 8

3) Определим выборочные характеристики (см. пункт Числовые характеристики вариационного ряда).

а) Мода. С помощью таблицы пункта 1 находим максимальное значение частоты mmax 16, которое соответствует интервалу [18,75; 20,25).

Применимформулу М0 x0 h

 

mi mi1

 

 

,где x0 –началомо-

m

m

m

m

 

 

i

i1

i

i1

 

 

дального (содержащего моду) интервала; h – длина частичного интервала; mi

частота модального интервала; mi1

– частота предмодального интервала; mi1

частота постмодального интервала.

h 1,5,mi 16,mi 1 5,mi 1 13, тогда мода

В нашем случае x0

18,75,

данной выборки составит:

16 5

 

 

1,5 11 18,75 1,18 19,93.

 

Mo 18,75 1,5

 

 

18,75

 

16

5 16 13

 

 

 

14

 

б) Медиана. Для нахождения медианы интервального вариационного ряда сначала определим медианный интервал [xMe ;xMe h], содержащий накоплен-

ную частоту, которая больше величины n2 , где п – объем выборки.

Так как объем выборки п = 60, то n2 602 30, значит находим интервал,

соответствующий накопленной частоте большей 30. Это miнак 41.

Следовательно, медиана расположена в интервале [20,25; 21,75). Величину медианы найдём по формуле:

26

 

 

 

 

 

n

mнак

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

M

e

x h

2

 

i 1

, где mнак – накопленная частота интервала, предше-

 

 

 

 

 

 

 

 

 

0

 

mi

l 1

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

ствующего медианному; mi

– частота медианного интервала.

 

 

 

 

 

 

 

 

 

Тогда по нашим расчётам: x

 

20,25, mнак

28, m

13. Отсюда:

 

 

 

 

 

 

 

 

 

 

 

 

 

0

 

 

i 1

 

 

 

 

i 1

 

 

 

 

 

 

 

 

 

 

 

Me

20,25 1,5

0,5 60 28

 

20,25 1,5

 

2

 

20,25 0,23 20,48.

 

 

 

 

 

 

 

13

 

 

 

 

 

 

 

 

 

 

 

 

 

 

13

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

Для нахождения остальных характеристик составим вспомогательную таб-

 

лицу, первые три столбца которой берутся из таблицы пункта 1. Остальные

 

столбцы заполняем, выполнив предварительные вычисления.

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

Среднее

Ча-

 

 

 

 

 

 

 

 

 

xi x

 

x x 3

 

x

x 4

 

Границы

 

значение

x m

 

x x

x x

2

m

 

 

m

m

 

 

 

 

 

 

стота,

 

 

 

 

 

 

 

i

 

 

i

 

 

интервала

интервала,

mi

i i

 

i

i

 

i

 

 

 

 

 

i

 

 

 

i

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

xi

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

14,25

15,75

15

 

1

 

15

 

 

5,48

29,98

 

 

2,34

 

 

12,81

 

 

29,97

 

15,75

17,25

16,5

 

6

 

99

 

 

3,98

94,80

 

 

1,70

 

 

29,41

 

 

49,96

 

17,25

18,75

18

 

5

 

90

 

 

2,48

30,63

 

 

1,06

 

 

5,92

 

 

 

6,26

 

18,75

20,25

19,5

 

16

 

312

 

 

0,98

15,21

 

 

0,42

 

 

1,16

 

 

 

0,48

 

20,25

21,75

21

 

13

 

273

 

 

0,52

3,58

 

 

 

0,22

 

 

 

0,15

 

 

 

0,03

 

21,75

23,25

22,5

 

13

 

292,5

 

 

2,03

53,31

 

 

0,87

 

 

 

8,43

 

 

 

7,29

 

23,25

24,75

24

 

4

 

96

 

 

3,53

49,70

 

 

1,51

 

 

 

13,67

 

 

 

20,60

 

24,75

26,25

25,5

 

2

 

51

 

 

5,03

50,50

 

 

2,15

 

 

 

19,81

 

 

 

42,53

 

Итого

 

 

 

 

60

 

1228,5

 

 

1,8

327,71

 

 

 

 

 

 

7,24

 

 

157,12

 

в) Среднее арифметическое найдём после заполнения четвёртого столбца: x nxi mi 1228,560 20,48.

г) Дисперсию вычислим после заполнения пятого и шестого столбцов:

 

k

 

 

 

 

 

 

 

D

mi (xi xB )2

 

327,71

5,46.

 

 

 

 

i 1

 

 

 

 

 

 

 

 

 

 

B

n

60

 

 

 

 

 

 

 

 

 

 

 

д) Среднее квадратичное отклонение:

D

5,46 2,34.

е) Коэффициент вариации V 100%

 

2,34

 

100% 11,4%.

20,48

 

 

 

 

 

x

 

 

 

ж) Асимметрию найдём после заполнения седьмого и восьмого столбца:

 

x

x 3

mi

 

 

 

 

i

 

 

 

7,24

 

 

 

 

 

А

 

 

 

 

 

 

0,12.

 

 

 

 

 

 

 

ss

 

 

n

 

 

60

 

 

 

 

 

 

 

 

27

з) Эксцесс найдём после заполнения девятого столбца:

 

x

x 4

mi

 

 

 

 

 

i

 

 

 

 

 

 

 

 

 

157,12

 

Ex

 

 

 

 

 

3

3 0,38.

 

 

 

n

 

 

60

 

 

 

 

 

 

 

Найденное значение коэффициента асимметрии указывает на то, что распределение частот имеет левостороннюю асимметрию. Эксцесс также отличен от нуля, что говорит о возможном отличии данного распределения от нормального распределения.

Такимобразом,среднееколичествобаллов,набранныхабитуриентамипоисследуемой совокупности баллов, составляет 20,48. Плотность результатов в среднем колебалась в промежутке x =20,48 2,34, то есть от 18,14 до 22,82. Интер-

вал 18,14; 22,82 , а также коэффициент вариации показывает, что имеются боль-

шие различия в результатах абитуриентов, полученных на приемных экзаменах. 4) Найдём точечные оценки параметров (см. пункт Точечные оценки пара-

метров распределения).

а) В математической статистике доказана теорема: «Выборочная средняя xB является несмещённой, состоятельной и эффективной оценкой математиче-

ского ожидания».

Поэтому выборочная средняя (она же среднее арифметическое) будет являться несмещенной оценкой математического ожидания, то есть

M (X ) xB 20,48.

б) В математической статистике доказана теорема: «Исправленная диспер-

сия s2 nn 1DB является несмещённой, эффективной и состоятельной оценкой

генеральной дисперсии DГ ».

Зная выборочную дисперсию DB 5,46, найдём исправленную выбороч-

ную дисперсию: s2

60

 

5,46 5,55.

 

60 1

 

 

 

 

в) Исправленное среднее выборочное отклонение: s

5,55 2,36.

5) Оценим параметры генеральной совокупности (см. пункт Интервальные оценки параметров распределения).

Учитывая, что проводилась 10 %-ная выборка, найдем объем генеральной совокупности, N 60 10 600.

Несмещенной оценкой математического ожидания является выборочная средняя xB 20,48.

Найдем доверительный интервал для оценки выборочной средней:

x x

x0 x x , где x

t

s2

 

 

n

 

1

 

.

n

 

 

 

 

 

 

N

По условию уровень значимости 0,05.

28

Так как объём выборки n 60 30, то величина t будет равна значению аргумента функции Лапласа (t), при котором (t) 2 или 2 (t) 1 .

Тогда 2 (t) 1 0,05 0,95, то есть (t) 0,475.

С помощью таблицы

приложения

3,

зная

y (t) 0,475, найдём

t x 1,96.

 

 

 

 

 

 

 

 

 

 

Учитывая, что t 1,96,

s2 5,55, n 60

и

 

N 600, вычислим предельную

ошибку выборки:

 

 

 

 

 

 

 

 

 

 

 

5,55

 

 

60

 

4,995

 

 

 

x 1,96

 

1

 

 

1,96

 

 

1,96

0,08325 0,5684.

60

600

60

 

 

 

 

 

 

 

Следовательно, можно найти доверительный интервал для математиче-

ского ожидания M (X ) xB 20,48

с доверительной вероятностью

1 0,05 0,95:

 

20,48 0,5684 x0 20,48 0,5684

или 19,9116 x0 21,0484.

Значит, с доверительной вероятностью 0,95, можно утверждать, что среднее количество баллов во всей генеральной совокупности находится в гра-

ницах xB xB 20,48 0,5684, то есть от 19,9116 до 21,0484.

б) Исследуемая выборка является бесповторной, поэтому необходимый

объём выборки определяется по формуле n

t2

s2

N

.

t2s2

2

N

 

 

x

По условию предельная ошибка выборки уменьшится в 2 раза, то есть составит 0,5 xB , остальные характеристики сохранят свои значения: t 1,96,

s2 5,55,

N 600 и 1 0,05 0,95.

 

 

 

Подставив эти значения в формулу, получим:

 

n

1,962 5,55 600

 

12792,528

183,32 183.

1,962 5,55 (0,5 0,5684)2 600

69,782664

 

 

 

Значит, для уменьшения предельной ошибки в два раза объем совокупности необходимо увеличить примерно в три раза (так как 183:60 3).

8. ЭЛЕМЕНТЫ КОРРЕЛЯЦИОННОГО И РЕГРЕССИОННОГО АНАЛИЗА

Наиболее простым видом связи между величинами является функциональная зависимость. В этом случае каждому значению одной величины соответствует вполне определенное одно или несколько значений другой величины. Однако существуют такие связи между величинами, которые нельзя отнести к типу функциональных зависимостей. Такова, например, связь между осадками и урожаем,междутолщинойснеговогопокровазимойиобъемомстокапоследующего половодья. Здесь каждому значению одной величины соответствует множество возможных значений другой, число этих значений не является постоянным, а сами значения не отражают определенной закономерности.

29

Рассеяние этих возможных значений объясняется влиянием большого количества дополнительных факторов. Например, связь между урожайностью и удобрениями имеется, однако есть еще ряд факторов, влияющих на урожайность: объективные – климат, осадки, почва, рельеф поверхности и т.д. и ряд субъективных факторов – севообороты, качество и глубина заделки семян, предшественники, агротехника и т. д.

Случайные величины связаны статистически (вероятностно, стохастически), если при изменении одной величины другая величина изменяет свой закон распределения.

Частным случаем статистической зависимости является корреляционная связь. В этом случае при изменении одной величины изменяется среднее значение другой величины.

Изучениемтакихсвязейзанимаетсякорреляционныйирегрессионныйанализ. Корреляционный анализ измеряет степень связи двух и более явлений. Регрессионный анализ устанавливает форму зависимости между изучае-

мыми явлениями, определяет функцию регрессии, находит точечные и интервальные оценки средних величин и др.

Корреляция и регрессия связаны тесно. Корреляция оценивает силу статистической связи, а регрессия исследует ее форму.

Простейшей является парная линейная корреляция и регрессия.

Парная корреляция связывает две случайные величины уравнением ре-

грессии yx f (x) или xy

(y), где yx и xy условные средние значения.

Если оба уравнения регрессии линейные,

то между величинами x и y

установлена линейная корреляционная связь.

 

 

 

 

 

Для уравнения yx ax b выборочный коэффициент регрессии опреде-

 

n

 

 

 

 

n

 

n

 

(xi x) (yi

y)

 

xi

 

yi

ляется по формуле a

i 1

 

 

, где x

i 1

и y

i 1

выбороч-

 

 

 

 

 

 

n

 

 

 

n

 

n

 

 

(xi x)2

 

 

 

 

i 1

ные средние; n число наблюдений (измерений). Свободный член вычисляется по формуле b y a x .

Для уравнения xy cy d коэффициенты определяются по формулам

n

 

(xi x) (yi y)

 

c i 1

и d x c y .

n

(yi y)2

i 1

Точка пересечения линий yx ax b и xy cy d называется корреляци-

онным центром. Координаты корреляционного центра указывают на оптимальное соотношение величин x и y в заданных условиях.

30

Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]