Добавил:
Upload Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:
Т. ймов. МП для Сам. роб..doc
Скачиваний:
0
Добавлен:
01.07.2025
Размер:
1 Мб
Скачать
☆

Тема: Елементи математичної статистики

Мета: ознайомитись з основними поняттями статистики, вивчити методику статистичного оцінювання параметрів розподілу, розвивати логічне мислення, виховувати вміння самостійно працювати з навчальною літературою

План

1 Предмет математичної статистики

2 Числові характеристики статистичного розподілу вибірки

3 Елементи теорії кореляції

Перелік посилань:

1. Валєєв К. Г., Джалладова І. А. Збірник задач з теорії ймовірностей та математичної статистики: Навч. посіб. — К.: КНЕУ, 2005. — 284 с. [22-27]

  1. Гмурман В.Е. Теория вероятностей и математическая статистика. – М.: Высш. школа, 2004. – 479 с. [55-62]

  2. Гмурман В.Е. Руководство к решению задач по теории вероятностей и математической статистике. – М.: Высш. школа, 2005. – 404 с. [46-61]

  3. Іванюта І.Д. та ін. Елементи теорії ймовірностей та математичної статистики. – К.: Слово, 2003. – 272 с. [40-47]

  4. Шефтель З. Г. Теорія ймовірностей: Підручник для пед. навч. закладів. - 2-е вид.. - К.: Вища шк., 1994. - 193 с.[57-80]

Приклади розв’язку задач

Задача 1. Задано вибірку, яка характеризує місячний прибуток підприємців (у тисячах гривень).

  • Скласти варіаційний ряд вибірки.

  • Побудувати гістограму та полігон частот, розбивши інтервал на чотири-шість рівних підінтервалів.

6, 10, 12, 11, 11, 14, 6, 8, 12, 10, 14, 8, 9, 11, 7, 7,12,10,13,6.

Розв’язання

Для складання варіаційного ряду розподілу проранжуємо вихідну сукупність даних: 6, 10, 12, 11, 11, 14, 6, 8, 12, 10, 14, 8, 9, 11, 7, 7,12,10,13,6.

На основі ранжованих даних складемо дискретний варіаційний ряд розподілу:

Місячний прибуток підприємств(x)

(в тис. грн..)

6

7

8

9

10

11

12

13

14

Кількість підприємств(f)

3

2

2

1

3

3

3

1

2

Для побудови гістограми та полігону частот перетворимо дискретний варіаційний ряд на інтервальний, утворивши чотири рівні інтервали. Величина інтервалу (h) визначається за найбільшим (Xmax=14 тис. грн.) і найменшим (Xmin=6 тис. грн.) значеннями ознаки та кількістю груп (n=4):

h= (тис. грн.)

Отримали наступні границі рівних інтервалів, тис. грн.: І - 6-8; ІІ - 8- 10; ІІІ - 10- 12; IV - 12-14.

Результати інтервального групування покажемо в таблиці:

Місячний прибуток підприємств(x)

(тис. грн..)

6-8

8-10

10-12

12-14

Кількість підприємств(f)

7

4

6

3


Н айбільш поширеним видом графічного зображення інтервальних рядів розподілу є діаграма площин — гістограма. При графічному зображенні інтервального ряду розподілу з рівними інтервалами по осі абсцис відповідно до прийнятого масштабу відкладають нижню і верхню межі інтервалів, а по осі ординат — частоти або частки. Побудуємо гістограму за інтервальним рядом розподілу:

Обчислимо моду та медіану за даними інтервального ряду розподілу.

Мода – це такий варіант, який найчастіше зустрічається у варіаційному ряді. Формула для визначення моди має наступний вигляд:

де х0 і h – границя і ширина модального інтервалу;

fmo, fmo-1, fmo+1 – частоти модального, передмодального та післямодального інтервалів.

Медіана – це величина, що ділить варіаційний ряд навпіл:

де fmе – частота медіанного інтервалу;

Sfme-1 –кумулятивна частота передмедіанного інтервалу.

Модальним визнається інтервал (група), що має найбільшу частоту. Медіанним – той, на який припадає напівсума накопичених частот. Найбільша частота складає fmax=7, вона припадає на перший інтервал, тобто він є модальним. Напівсума накопичених частот дорівнює 20/2=10. Це відповідає накопиченій частоті другого інтервалу (7+4=11). Отже, отримали:

(тис. грн.); (тис. грн.).

Дискретний ряд розподілу не є багатомодальним.

Середнє арифметичне для дискретного варіаційного ряду визначається за формулою середньої арифметичної зваженої:

де n – загальний обсяг сукупності.

Інтервальний варіаційний ряд необхідно спочатку перетворити на дискретний, взявши за основу середини інтервалів, а потім виконати розрахунок середнього значення.

Дисперсія:

Виконаємо проміжні розрахунки для визначення середнього значення за дискретним варіаційним рядом:

Місячний прибуток підприємців, тис. грн. (х)

Кількість підприємців (f)

x·f

6

3

18

7

2

14

8

2

16

9

1

9

10

3

30

11

3

33

12

3

36

13

1

13

14

2

28

Разом

20

197

Виконаємо проміжні розрахунки для визначення середнього значення за інтервальним варіаційним рядом:

Місячний прибуток підприємців, тис. грн.

Кількість підприємців (f)

x·f

Інтервальна оцінка

Середина інтервалу (х)

6-8

7

7

49

8-10

9

4

36

10-12

11

6

66

12-14

13

3

39

Разом

-

20

190

Отримані значення середнього місячного прибутку підприємців за дискретним та інтервальний рядами різняться незначно. Більш точним значенням є те, яке обчислено на основі дискретного ряду, так як розрахунок проводився безпосередньо по вихідних значеннях, а в інтервальному ряді величини ознаки замінено серединою відповідного інтервалу.

Знайдемо дисперсію за даними дискретного варіаційного ряду:

Місячний прибуток підприємців, тис. грн. (х)

Кількість підприємців (f)

6

3

-3,85

44,468

7

2

-2,85

16,245

8

2

-1,85

6,845

9

1

-0,85

0,7225

10

3

0,15

0,0675

11

3

1,15

3,9675

12

3

2,15

13,868

13

1

3,15

9,9225

14

2

4,15

34,445

Разом

20

1,35

130,55

(тис. грн.2)

Знайдемо дисперсію за даними інтервального варіаційного ряду:

Місячний прибуток підприємців, тис. грн.

Кількість підприємців (f)

Інтервальна оцінка

Середина інтервалу (х)

6-8

7

7

-2,5

43,75

8-10

9

4

-0,5

1

10-12

11

6

1,5

13,5

12-14

13

3

3,5

36,75

Разом

-

20

2

95

(тис. грн.2)

Показник ексцесу визначається за формулою:

де 4 – момент четвертого порядку, який визначається наступним чином:

– за дискретним варіаційним рядом:

– за інтервальним варіаційним рядом:

Визначимо показник ексцесу за дискретним варіаційним рядом:

Місячний прибуток підприємців, тис. грн. (х)

Кількість підприємців (f)

6

3

-3,85

659,1195

7

2

-2,85

131,95

8

2

-1,85

23,42701

9

1

-0,85

0,522006

10

3

0,15

0,001519

11

3

1,15

5,247019

12

3

2,15

64,10252

13

1

3,15

98,45601

14

2

4,15

593,229

Разом

20

-

1576,055

Визначимо показник ексцесу за інтервальним варіаційним рядом:

Місячний прибуток підприємців, тис. грн.

Кількість підприємців (f)

Інтервальна оцінка

Середина інтервалу (х)

6-8

7

7

-1,25

17,08984

8-10

9

4

-0,25

0,015625

10-12

11

6

0,75

1,898438

12-14

13

3

1,75

28,13672

Разом

-

20

1

94,28125

В обох випадках коефіцієнт ексцесу Е<3, що вказує на плосковершиність розподілу як дискретного, так і інтервального рядів.

Задача2 За допомогою спектрофотометричного методу визначався вміст сульфату хініну в таблетках. Виконано 6 вимірювань, які дали такі результати: 99,9; 99,8; 99,6; 99,1; 99,2; 99,2 %.

Знайти оцінку вмісту сульфату хініну в таблетках та його дисперсію і стандартне відхилення.

Розв’язання. Оцінкою істинного значення вимірюваної величини Х є її вибіркове середнє, яке розраховується за формулою

де n – об'єм виборки, xi – i-й елемент виборки.

Вибіркове середнє дорівнює

Дисперсія S2 ознаки Х розраховується за формулою

Підставляючи чисельні значення, знаходимо

Стандартне (середньоквадратичне) відхилення S ознаки в окремому вимірюванні розраховується за формулою

Стандартне відхилення усередненої ознаки (стандартне відхилення середнього арифметичного) розраховується за формулою

Воно дорівнює

Зауваження 1. Слід добре розрізняти стандартне відхилення S , яке є характеристикою окремого вимірювання у даній виборці, і стандартне відхилення середнього арифметичного, яке є характеристикою сукупності вимірювань.

Елементи теорії кореляції

Між двома випадковими величинами, можуть бути такі форми залежності:

а) функціональна залежність,

б) стохастична залежність, коли зі зміною значення однієї величини змінюється розподіл другої величини;

в) кореляційна залежність, коли умовне середнє значення однієї величини функціонально залежить від другої величини.

Нехай результати вибірки із двовимірної сукупності подано в табличній формі:

Y

Х

…

…

…

…

…

…

…

…

…

…

…

…

—

…

—

—

Якщо розглядати таблицю за рядками, то кожному значенню відповідає деякий розподіл випадкової величини Обчислимо для цих розподілів умовні середні значення Отже, Аналогічно, розглядаючи таблицю за стовпцями, також визначаємо умовні середні величини Знову маємо залежність виду

Рівняння, які виражають умовні середні, називаються кореляційними рівняннями або рівняннями регресії другого роду. У ко- реляційному аналізі розглядаються такі задачі:

  1. визначити за кореляційною таблицею форму залежності між випадковими величинами, тобто вид функціональної залежності

  2. оцінити тісноту залежності, тобто визначити ступінь розсіяності можливих значень однієї випадкової величини відносно лінії регресії, якщо одна із величин набуває певних значень.

Лінійна кореляційна залежність

Для визначення форми залежності між X i Y за результата- ми розрахунків у кореляційній таблиці в системі координат XOY відкладаємо точки Якщо ці точки розміщені на лінії, яка близька до прямої, то можна вважати, що залежність має лінійний характер, тобто рівняння регресії подається у вигляді , або аналогічно За допомогою методу найменших квадратів можна визначити коефіцієнти рівнянь регресії: Коефіцієнти — коефіцієнти регресії. Отже, лінійні рівняння регресії мають вигляд:

Лінії регресії перетинаються в точці яка називається центром кореляції. Тіснота зв’язку в разі лінійної залежності оцінюється коефіцієнтом кореляції. Коефіцієнтом кореляції випадкових величин називається середнє геометричне значення коефіцієнтів регресії, яке має знак останніх:

Коефіцієнти регресії виражаються через коефіцієнт кореляції за такими формулами:

аналогічно . Тоді рівняння регресії мають вигляд:

Абсолютна величина коефіцієнта кореляції не перевищує оди- ницю. Якщо , то величини не пов’язані лінійною залежні- стю, але при цьому між ними можливий нелінійний кореляційний зв’язок. Якщо r зростає за абсолютною величиною від нуля до одиниці, то тіснота зв’язку зростає, і, якщо то кореляційна залежність перетворюється на функціональну і прямі регресії зливаються в одну пряму.

Обчислення параметрів, які входять у рівняння регресії, спро- щується, якщо перейти до умовних змінних і умовних моментів розподілу.

Приклади розв’язування задач

Задача 75. У результаті обстеження одержано статистичний розподіл 100 підприємств за виробничими фондами Х, млн грн, і добовим виробітком Y, т.:

Y

X

10

15

20

25

30

35

50

2

2

4

60

2

4

5

6

4

21

70

2

7

12

10

4

35

80

10

10

6

26

90

8

6

14

4

8

12

36

24

16

100

Визначити форму залежності між X i Y, знайти рівняння ліній регресії і тісноту зв’язку.

Розв’язання. Знаходимо умовні середні і

Результати обчислень перенесемо в таблицю. У ній перейдемо до умовних змінних, узявши

v

u

–3

–2

–1

0

1

2

–2

2

2

4

12,5

–1

2

4

5

6

4

21

21,4

0

2

7

12

10

4

35

26

1

10

10

6

26

29,2

2

8

6

14

29,3

4

8

12

36

24

16

100

55

60

65,8

75,6

72,5

81,3

Для визначення форм залежності проаналізуємо, як змінюються умовні середні зі зміною випадкових величин. Зі зростанням х умовна середня також зростає, а при зростанні умовна середня в основному зростає. У системі координат XOY відкладемо множину точок значком « », а множину точок — значком « » (рис. 25).

Графіки рівнянь регресії зображено на рис.

Із рис. бачимо, що кожна із груп побудованих точок розміщена приблизно на деякій прямій, дещо відхиляючись від неї.

Рівняння прямих шукаємо у вигляді:

За даними останньої таблиці знаходимо умовні моменти розподілу:

Щоб знайти коефіцієнт кореляції, обчислимо середнє значення добутку умовних змінних:

Знайдемо значення решти параметрів, які входять до рівняння регресії:

Запишемо рівняння ліній регресії:

Нелінійна кореляційна залежність

Якщо відображені на площині групи точок і розміщуються, нагадуючи деякі криві, то доцільно вважати, що між досліджуваними величинами існує нелінійна залеж- ність. Тепер знову виникло завдання дібрати таку криву, яка б на основі методу найменших квадратів мала найменші відхилення від точок, здобутих при спостереженні, знайти її рівняння і визначити тісноту зв’язку.

Розглянемо деякі найпростіші види нелінійної кореляційної залежності. Нехай зі зростанням однієї випадкової величини умовні середні другої спадають, але не на ту саму величину, як це буває в разі лінійної залежності, а розмір зміни ніби згасає. У такому разі можна вважати, що залежність гіперболічна:

Параметри за методом найменших квадратів визначаються із системи рівнянь:

Аналогічно складається система рівнянь у разі, коли гіперболічно залежить від

Нехай зі зростанням однієї випадкової величини умовні серед- ні другої зростають (спадають), досягають максимуму (мінімуму), а потім спадають (зростають). Тоді можна вважати, що між ними існує параболічна залежність виду:

За методом найменших квадратів для визначення значень параметрів потрібно скласти і розв’язати систему рівнянь:

У разі нелінійної кореляційної залежності тіснота зв’язку між величинами характеризується кореляційним відношенням. Кореляційним відношенням називається відношення середніх квадратичних відношень умовних середніх до загального середнього квадратичного відхилення:

де ;

Кореляційне відношення набуває значення на відрізку Якщо кореляційне відношення дорівнює нулю, то кореляційний зв’язок відсутній, якщо то випадкові величини зв’язані функ- ціональною залежністю. Зі зростанням значення  тіснота кореляційного зв’язку збільшується.

Приклади розв’язування задач

Задача 75. У результаті обстеження одержано статистичний розподіл 30 однотипних підприємств по добовому виробленню продукції Х і собівартості одиниці цієї продукції Y. Установити форму залежності між X i Y, знайти рівняння ліній регресії і оцінити тісноту зв’язку.

Розв’язання. Знаходимо умовні середні значення Результати обчислень заносимо в таблицю. У цій самій таблиці зроблено перехід до умовних змінних.

Y

Х

100

110

120

130

50

1

3

4

100

3

3

6

150

6

2

1

9

200

1

4

1

6

250

4

1

5

5

14

6

5

30


Переходячи до умовних змінних, ураховуємо, що

V

u

–1

0

1

2

–2

1

3

4

127,5

–1

3

3

6

155

0

6

2

1

9

114,4

1

1

4

1

6

111,7

2

4

1

5

102

5

14

6

5

30

240

160,7

108,3

100

Якщо зобразимо на координатній площині множини точок і то стане видно,що вони лежать вздовж деякої гіперболи, дещо відхиляючись від неї.

Рівняння гіперболи шукаємо у вигляді Для визначення коефіцієнтів відповідної системи рівнянь складаємо таблицю:

50

4

0,08

0,0016

127,5

510

10,2

100

6

0,06

0,0006

115

690

6,9

150

9

0,06

0,0004

114,4

1030

6,86

200

6

0,03

0,00015

111,7

670

3,35

250

5

0,02

0,00008

102

510

2,04

Сума

30

0,25

0,00283

—

3410

29,35

Невідомі параметри знайдемо із системи рівнянь:

Розв’язок системи Рівняння регресії має вигляд:

Аналогічно можна скласти систему рівнянь і знайти рівняння регресії

Складаючи відповідну систему рівнянь і розв’язуючи її, дістаємо

Тісноту зв’язку між випадковими величинами оцінимо з допомогою кореляційних відношень.

Необхідні для розрахунків параметри знайдемо з допомогою умовних моментів розподілу:

Отже,

З огляду на значення кореляційних відношень можна стверджувати, що між добовим виробітком продукції і собівартістю одиниці продукції існує досить істотна кореляційна залежність.