Элементы математической статистики. Учебное пособие-1
.pdf
|
|
|
|
|
xB |
t |
a xB |
t |
(для повторной выборки) или |
||||||
|
|
|
|
|
|
|
|
||||||||
|
|
|
|
|
|
n |
|
|
|
|
n |
||||
xB |
|
t |
1 |
n |
a xB |
t |
1 |
n |
|
(для бесповторной выборки), где а – оце- |
|||||
n |
N |
n |
N |
||||||||||||
|
|
|
|
|
|
|
xB – выборочная средняя; п – объем вы- |
||||||||
ниваемое математическое ожидание; |
|||||||||||||||
борки; t – такое значение аргумента функции Лапласа Ф (t), при котором
Ф(t) 2 ,приn 30 или t t -критическаяточкараспределенияСтьюдента,при
n 30; N – объем генеральной совокупности.
Для любого числа [0; 1] можно по таблице (приложение 3) найти такое число t, что (t)= /2.
Можно сказать иначе: точечная оценка x определяет значение параметра а
с точностью d |
t |
и надежностью . |
|
n |
|||
|
|
Пример 1. Найти доверительный интервал для математического ожидания нормально распределенной случайной величины, если объем выборки п = 49, xB 2,8, σ = 1,4, а доверительная вероятность γ = 0,9.
Решение. Определим t, при котором Ф(t) = 0,9:2 = 0,45. Следовательно, по таблице приложения 3 найдем t = 1,645.
Тогда 2,8 |
1,645 1,4 |
a 2,8 |
1,645 1,4 |
, или 2,471 < a < 3,129. Найден |
|
49 |
49 |
||||
|
|
|
доверительный интервал, в который попадает математическое ожидание а с надежностью 0,9.
2. Доверительный интервал для оценки математического ожидания нормального распределения при неизвестной дисперсии.
Принеизвестномсреднемквадратическомотклонениидоверительныйинтервал для математического ожидания при заданной надежности γ задается так:
|
xB |
t s |
|
a xB |
t s |
(для повторной выборки) или |
|||||||||
|
n |
|
|
||||||||||||
|
|
|
|
|
|
|
|
n |
|
|
|
|
|
||
xB |
t s |
|
1 |
|
n |
a xB |
|
|
t s |
1 |
|
n |
(для бесповторной выборки), |
||
n |
|
N |
|
|
n |
N |
|||||||||
|
|
|
|
|
|
|
|
|
|
|
|||||
где s – исправленное выборочное среднее квадратичное отклонение, а t t (n, ) критическая точка распределения Стьюдента, значение которой
можно найти из таблиц (приложение 2) по известным п и γ.
Пример 2. Пусть объем выборки п = 25, хВ = 3, s = 1,5. Найдем доверительный интервал для а при γ = 0,99.
21
Решение. Из таблицы находим, что при п = 25, γ = 0,99 величина tγ = 2,797.
Тогда 3 |
2,797 1,5 |
a 3 |
2,797 1,5 |
, или 2,161< a < 3,839 – доверительный |
|
25 |
25 |
||||
|
|
|
интервал, в который попадает а с вероятностью 0,99.
3. Доверительные интервалы для оценки среднего квадратичного отклонения нормального распределения.
Дляоценкигенеральногосреднегоквадратичногоотклоненияσпризаданной надежности γ можно построить доверительный интервал вида
s(1 q) s(1 q),
где s – исправленное выборочное среднее квадратическое отклонение, а q = q (n, γ) – значение, определяемое из таблиц (приложение 4).
Пример 3. Пусть п = 20, s = 1,3. Найдем доверительный интервал для σ при заданной надежности γ = 0,95.
Решение. Из соответствующей таблицы находим при n = 20, γ = 0,95 значение q = 0,37. Следовательно, границы доверительного интервала: 1,3(1 – 0,37) = 0,819 и 1,3(1 + 0,37) = 1,781. Итак, 0,819 < σ < 1,781 с вероятностью 0,95.
Пример 4. Дана выборка значений нормально распределенной случайной величины: 2, 3, 3, 4, 2, 5, 5, 5, 6, 3, 6, 3, 4, 4, 4, 6, 5, 7, 3, 5. Найти с доверительной вероятностью γ = 0,95 границы доверительных интервалов для математического ожидания и дисперсии.
Решение. Объем выборки п = 20. Найдем хВ = 4,25, s = 1,37. По таблицам
определим t (0,95; 20) = 2,093; q (0,95; 20) = 0,37. |
|
|
||||
Тогда 4,25 |
2,093 1,37 |
a 4,25 |
2,093 1,37 |
; |
3,64 a 4,86 довери- |
|
20 |
20 |
|||||
|
|
|
|
|||
тельный интервал для математического ожидания; 1,37(1 0,37) 1,37(1 0,37);
0,86 1,88. Возведем все части неравенства в квадрат, т. к. D 2 . Тогда 0,74 D 3,52 доверительный интервал для дисперсии.
Квантилем или нормированным отклонением называется отношение предельной ошибки к средней ошибке выборки.
txВ ,
x0
где x |
|
|
|
- средняя ошибка; x |
t |
s2 |
|
|
n |
- предельная ошибка; |
|
|
ген |
|
1 |
|
|
||||||
|
n |
n |
|
||||||||
0 |
|
|
|
|
|
|
N |
|
|||
|
|
|
|
|
|
|
|
|
|
|
|
|
ген |
|
n |
|
выбор. |
, |
t – квантиль нормального закона распределения (при |
|
n 1 |
||||||||
|
|
|
|
|
||||
0,05, t 1,96); |
N – объем генеральной совокупности; п – объем выборки; s2 |
|||||||
– исправленная выборочная дисперсия.
22
Квантиль вычисляется по соответствующему уровню значимости (при n 30 t -квантиль нормального закона распределения, при n 30, t -квантиль распределения Стьюдента).
Важной является задача определения объема выборочной совокупности п при заданном уровне значимости. В случае бесповторной выборки необходимый
объем выборки определяется по формуле |
n |
t2 |
s2 N |
и в случае повторной |
||
t2s2 2 |
N |
|||||
|
|
|
||||
x
выборки n t2s2 .
2xB
КОМПЛЕКСНАЯ ЗАДАЧА
Дано распределение 60 абитуриентов по числу баллов, полученных ими на приемных экзаменах:
20 |
19 |
22 |
24 |
21 |
18 |
23 |
17 |
20 |
16 |
15 |
23 |
21 |
24 |
21 |
18 |
23 |
21 |
19 |
20 |
24 |
21 |
20 |
18 |
17 |
22 |
20 |
16 |
22 |
18 |
20 |
17 |
21 |
17 |
19 |
20 |
20 |
21 |
18 |
22 |
23 |
21 |
25 |
22 |
20 |
19 |
21 |
24 |
25 |
23 |
21 |
19 |
22 |
21 |
19 |
20 |
23 |
22 |
21 |
21 |
Провести статистическое исследование данной выборки. Для этого:
1)составить интервальный вариационный ряд;
2)построить:
а) гистограмму (для интервального вариационного ряда), б) полигон (для середин частотных интервалов), в) кумуляту (для интервального вариационного ряда), г) огиву (для середин частотных интервалов);
3)определить выборочные характеристики: а) моду, б) медиану,
в) среднее арифметическое, г) дисперсию,
д) среднее квадратичное отклонение, е) коэффициент вариации, ж) асимметрию, з) эксцесс.
4)найти точечные оценки параметров:
а) несмещенную оценку математического ожидания, б) исправленную выборочную дисперсию, в) исправленное среднее выборочное отклонение.
5)учитывая,чтопроводилась10%-наяслучайнаявыборка,приуровнезна- чимости 0,05 определить:
23
а) доверительный интервал для математического ожидания с доверительной вероятностью 1 ,
б) объем выборки, при котором с доверительной вероятностью1 предельная ошибка выборки уменьшится в 2 раза при сохранении
уровня остальных характеристик.
Решение.1)Составиминтервальныйвариационныйряд(см.пунктПервичная обработка результатов).
По условию объем выборки n 60.
Из всех данных значений выберем наименьшее и наибольшее: xmin 15,
xmax 25. |
|
|
|
|
|
|
|
|
|
xmax xmin |
|
|
|
|
|
||
По |
формуле Стерджеса h |
|
|
|
при значении |
n 60 найдём |
|||||||||||
1 |
3,322lgn |
||||||||||||||||
|
|
|
|
|
|
|
|
|
|
|
|
|
|||||
длину частотного интервала h |
|
|
|
25 15 |
1,45. Примем h 1,5. |
||||||||||||
1 |
3,322lg60 |
||||||||||||||||
|
|
|
|
|
|
|
|
|
|
|
|||||||
За начало первого интервала возьмём величину х |
х |
|
h |
, то есть ве- |
|||||||||||||
|
|||||||||||||||||
|
|
|
1,5 |
|
|
|
|
|
|
|
|
нач |
min |
2 |
|
||
личину x |
|
15 |
14,25. |
|
|
|
|
|
|
|
|
|
|
|
|
||
|
|
|
|
|
|
|
|
|
|
|
|
|
|
||||
нач |
2 |
|
|
|
|
|
|
|
|
|
|
|
|
|
|||
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|||
Исходные данные разобьём на восемь интервалов: [14,25; 15,75), [15,75; 17,25), [17,25; 18,75), [18,75; 20,25), [20,25; 21,75), [21,75; 23,25), [23,25; 24,75), [24,75; 26,25].
Для нахождения частот, накопленных частот, частостей и накопленных частостей составим вспомогательную таблицу:
Номер |
Границы |
Ча- |
Накопленная ча- |
Частость, |
Накопленная |
|
стота, |
||||||
интервала |
интервала |
стота, |
wi |
частость, wiнак |
||
mi |
||||||
|
|
|
|
|
||
1 |
14,25; 15,75 |
1 |
1 |
1/60 |
1/60 |
|
2 |
15,75; 17,25 |
6 |
7 |
1/10 |
7/60 |
|
3 |
17,25; 18,75 |
5 |
12 |
1/12 |
1/5 |
|
4 |
18,75; 20,25 |
16 |
28 |
4/15 |
7/15 |
|
5 |
20,25; 21,75 |
13 |
41 |
13/60 |
41/60 |
|
6 |
21,75; 23,25 |
13 |
54 |
13/60 |
27/30 |
|
7 |
23,25; 24,75 |
4 |
58 |
1/15 |
29/30 |
|
8 |
24,75; 26,25 |
2 |
60 |
1/30 |
1 |
2) Построим требуемые графики (см. Графическое изображение вариационных рядов).
а) Гистограмма. По горизонтали отложим границы интервалов, а по вертикали – частоты. Далее на каждом частотном интервале построим прямоугольник с высотой, равной величине соответствующей этому интервалу частоты.
24
mi |
|
|
|
|
|
|
|
|
|
16 |
|
|
|
|
|
|
|
|
|
13 |
|
|
|
|
|
|
|
|
|
6 |
|
|
|
|
|
|
|
|
|
5 |
|
|
|
|
|
|
|
|
|
2 |
|
|
|
|
|
|
|
|
|
14,25 |
15,75 |
17,25 |
18,75 |
20,25 |
21,75 |
23,25 |
24,75 |
26,25 |
хi |
|
|
|
|
Рис. 5 |
|
|
|
|
|
б) Полигон частот. Для каждого частотного интервала найдём его серединуиотложимнайденныезначенияпогоризонтали.Частоты,соответствующие интервалам, откладываем по вертикали. Получим точки, которые соединим отрезками последовательно слева направо. Из первой и последней точки опустим перпендикуляры на горизонтальную ось.
mi
16
13 

6 
5 
4 
2 
1 
0 |
15 |
|
16,5 |
|
18 |
|
19,5 |
|
21 |
|
22,5 |
24 |
25,5 |
хi |
Рис. 6
в) Кумулята. По горизонтали отложим границы интервалов, а по вертикали
– накопленные частоты и построим соответствующие точки. Первая точка имеет абсциссу, равную началу первого интервала (14,25), а ординату – накопленной частоте,равнойнулю.Остальныеточкиимеютабсциссы,равныеконцаминтервалов, а ординаты – соответствующим значениям накопленной частоты.
Построенные точки соединяем ломаной.
miнак
60
58

54
41
28
12
7 
1
0 14,25 15,75 17,25 18,75 20,25 21,75 23,25 24,75 26,25 хi
Рис. 7
25
г) Огива. Огива строится аналогично кумуляте с той лишь разницей, что накопленные частоты помещают на оси абсцисс, а значения признака — на оси ординат.
хi
26,25
24,75
23,25
21,75
20,25
18,75 
17,25
15,75
14,25
0 |
1 |
|
7 |
|
12 |
28 |
41 |
54 58 60 |
|
|
miнак |
||||||||||
|
|
|
|
|
|
Рис. 8
3) Определим выборочные характеристики (см. пункт Числовые характеристики вариационного ряда).
а) Мода. С помощью таблицы пункта 1 находим максимальное значение частоты mmax 16, которое соответствует интервалу [18,75; 20,25).
Применимформулу М0 x0 h |
|
mi mi1 |
|
|
,где x0 –началомо- |
|
m |
m |
m |
m |
|
||
|
i |
i1 |
i |
i1 |
|
|
дального (содержащего моду) интервала; h – длина частичного интервала; mi |
– |
|||||
частота модального интервала; mi1 |
– частота предмодального интервала; mi1 |
– |
||||
частота постмодального интервала. |
h 1,5,mi 16,mi 1 5,mi 1 13, тогда мода |
|||||
В нашем случае x0 |
18,75, |
|||||
данной выборки составит: |
16 5 |
|
|
1,5 11 18,75 1,18 19,93. |
|
|
Mo 18,75 1,5 |
|
|
18,75 |
|
||
16 |
5 16 13 |
|
||||
|
|
14 |
|
|||
б) Медиана. Для нахождения медианы интервального вариационного ряда сначала определим медианный интервал [xMe ;xMe h], содержащий накоплен-
ную частоту, которая больше величины n2 , где п – объем выборки.
Так как объем выборки п = 60, то n2 602 30, значит находим интервал,
соответствующий накопленной частоте большей 30. Это miнак 41.
Следовательно, медиана расположена в интервале [20,25; 21,75). Величину медианы найдём по формуле:
26
|
|
|
|
|
n |
mнак |
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
||
|
M |
e |
x h |
2 |
|
i 1 |
, где mнак – накопленная частота интервала, предше- |
|
|||||||||||||||||||||
|
|
|
|
|
|||||||||||||||||||||||||
|
|
|
0 |
|
mi |
l 1 |
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
||||||
ствующего медианному; mi |
– частота медианного интервала. |
|
|
|
|
|
|
|
|
||||||||||||||||||||
|
Тогда по нашим расчётам: x |
|
20,25, mнак |
28, m |
13. Отсюда: |
|
|
|
|
||||||||||||||||||||
|
|
|
|
|
|
|
|
|
0 |
|
|
i 1 |
|
|
|
|
i 1 |
|
|
|
|
|
|
|
|
|
|
||
|
Me |
20,25 1,5 |
0,5 60 28 |
|
20,25 1,5 |
|
2 |
|
20,25 0,23 20,48. |
|
|
|
|
||||||||||||||||
|
|
|
13 |
|
|
|
|
|
|||||||||||||||||||||
|
|
|
|
|
|
|
|
|
13 |
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
||
|
Для нахождения остальных характеристик составим вспомогательную таб- |
|
|||||||||||||||||||||||||||
лицу, первые три столбца которой берутся из таблицы пункта 1. Остальные |
|
||||||||||||||||||||||||||||
столбцы заполняем, выполнив предварительные вычисления. |
|
|
|
|
|
|
|
|
|||||||||||||||||||||
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
Среднее |
Ча- |
|
|
|
|
|
|
|
|
|
xi x |
|
x x 3 |
|
x |
x 4 |
|
||||||||
Границы |
|
значение |
x m |
|
x x |
x x |
2 |
m |
|
|
m |
m |
|||||||||||||||||
|
|
|
|
|
|
стота, |
|
|
|
|
|
|
|
i |
|
|
i |
|
|
||||||||||
интервала |
интервала, |
mi |
i i |
|
i |
i |
|
i |
|
|
|
|
|
i |
|
|
|
i |
|||||||||||
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|||||||||||||
|
|
|
|
xi |
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
14,25 |
15,75 |
15 |
|
1 |
|
15 |
|
|
– 5,48 |
29,98 |
|
|
– 2,34 |
|
|
– 12,81 |
|
|
29,97 |
|
|||||||||
15,75 |
17,25 |
16,5 |
|
6 |
|
99 |
|
|
– 3,98 |
94,80 |
|
|
– 1,70 |
|
|
– 29,41 |
|
|
49,96 |
|
|||||||||
17,25 |
18,75 |
18 |
|
5 |
|
90 |
|
|
– 2,48 |
30,63 |
|
|
– 1,06 |
|
|
– 5,92 |
|
|
|
6,26 |
|
||||||||
18,75 |
20,25 |
19,5 |
|
16 |
|
312 |
|
|
– 0,98 |
15,21 |
|
|
– 0,42 |
|
|
– 1,16 |
|
|
|
0,48 |
|
||||||||
20,25 |
21,75 |
21 |
|
13 |
|
273 |
|
|
0,52 |
3,58 |
|
|
|
0,22 |
|
|
|
0,15 |
|
|
|
0,03 |
|
||||||
21,75 |
23,25 |
22,5 |
|
13 |
|
292,5 |
|
|
2,03 |
53,31 |
|
|
0,87 |
|
|
|
8,43 |
|
|
|
7,29 |
|
|||||||
23,25 |
24,75 |
24 |
|
4 |
|
96 |
|
|
3,53 |
49,70 |
|
|
1,51 |
|
|
|
13,67 |
|
|
|
20,60 |
|
|||||||
24,75 |
26,25 |
25,5 |
|
2 |
|
51 |
|
|
5,03 |
50,50 |
|
|
2,15 |
|
|
|
19,81 |
|
|
|
42,53 |
|
|||||||
Итого |
|
|
|
|
60 |
|
1228,5 |
|
|
– 1,8 |
327,71 |
|
|
|
|
|
|
– 7,24 |
|
|
157,12 |
|
|||||||
в) Среднее арифметическое найдём после заполнения четвёртого столбца: x nxi mi 1228,560 20,48.
г) Дисперсию вычислим после заполнения пятого и шестого столбцов:
|
k |
|
|
|
|
|
|
|
D |
mi (xi xB )2 |
|
327,71 |
5,46. |
|
|
|
|
i 1 |
|
|
|
|
||||
|
|
|
|
|
|
|||
B |
n |
60 |
|
|
|
|
|
|
|
|
|
|
|
|
|||
д) Среднее квадратичное отклонение: |
D |
5,46 2,34. |
||||||
е) Коэффициент вариации V 100% |
|
2,34 |
|
100% 11,4%. |
||||
20,48 |
|
|||||||
|
|
|
|
x |
|
|
|
|
ж) Асимметрию найдём после заполнения седьмого и восьмого столбца:
|
x |
x 3 |
mi |
|
|
||||
|
|
i |
|
|
|
7,24 |
|
||
|
|
|
|
||||||
А |
|
|
|
|
|
|
0,12. |
||
|
|
|
|
|
|
|
|||
ss |
|
|
n |
|
|
60 |
|
||
|
|
|
|
|
|
|
|||
27
з) Эксцесс найдём после заполнения девятого столбца:
|
x |
x 4 |
mi |
|
|
|
||||
|
|
i |
|
|
|
|
|
|
||
|
|
|
157,12 |
|
||||||
Ex |
|
|
|
|
|
3 |
3 0,38. |
|||
|
|
|
n |
|
|
60 |
||||
|
|
|
|
|
|
|
||||
Найденное значение коэффициента асимметрии указывает на то, что распределение частот имеет левостороннюю асимметрию. Эксцесс также отличен от нуля, что говорит о возможном отличии данного распределения от нормального распределения.
Такимобразом,среднееколичествобаллов,набранныхабитуриентамипоисследуемой совокупности баллов, составляет 20,48. Плотность результатов в среднем колебалась в промежутке x =20,48 2,34, то есть от 18,14 до 22,82. Интер-
вал 18,14; 22,82 , а также коэффициент вариации показывает, что имеются боль-
шие различия в результатах абитуриентов, полученных на приемных экзаменах. 4) Найдём точечные оценки параметров (см. пункт Точечные оценки пара-
метров распределения).
а) В математической статистике доказана теорема: «Выборочная средняя xB является несмещённой, состоятельной и эффективной оценкой математиче-
ского ожидания».
Поэтому выборочная средняя (она же среднее арифметическое) будет являться несмещенной оценкой математического ожидания, то есть
M (X ) xB 20,48.
б) В математической статистике доказана теорема: «Исправленная диспер-
сия s2 nn 1DB является несмещённой, эффективной и состоятельной оценкой
генеральной дисперсии DГ ».
Зная выборочную дисперсию DB 5,46, найдём исправленную выбороч-
ную дисперсию: s2 |
60 |
|
5,46 5,55. |
|
60 1 |
|
|||
|
|
|
||
в) Исправленное среднее выборочное отклонение: s |
5,55 2,36. |
|||
5) Оценим параметры генеральной совокупности (см. пункт Интервальные оценки параметров распределения).
Учитывая, что проводилась 10 %-ная выборка, найдем объем генеральной совокупности, N 60 10 600.
Несмещенной оценкой математического ожидания является выборочная средняя xB 20,48.
Найдем доверительный интервал для оценки выборочной средней:
x x |
x0 x x , где x |
t |
s2 |
|
|
n |
|
|
1 |
|
. |
||||
n |
|
||||||
|
|
|
|
|
N |
||
По условию уровень значимости 0,05.
28
Так как объём выборки n 60 30, то величина t будет равна значению аргумента функции Лапласа (t), при котором (t) 2 или 2 (t) 1 .
Тогда 2 (t) 1 0,05 0,95, то есть (t) 0,475.
С помощью таблицы |
приложения |
3, |
зная |
y (t) 0,475, найдём |
|||||||
t x 1,96. |
|
|
|
|
|
|
|
|
|
|
|
Учитывая, что t 1,96, |
s2 5,55, n 60 |
и |
|
N 600, вычислим предельную |
|||||||
ошибку выборки: |
|
|
|
|
|
|
|
|
|
|
|
|
5,55 |
|
|
60 |
|
4,995 |
|
|
|
||
x 1,96 |
|
1 |
|
|
1,96 |
|
|
1,96 |
0,08325 0,5684. |
||
60 |
600 |
60 |
|||||||||
|
|
|
|
|
|
|
|||||
Следовательно, можно найти доверительный интервал для математиче-
ского ожидания M (X ) xB 20,48 |
с доверительной вероятностью |
1 0,05 0,95: |
|
20,48 0,5684 x0 20,48 0,5684 |
или 19,9116 x0 21,0484. |
Значит, с доверительной вероятностью 0,95, можно утверждать, что среднее количество баллов во всей генеральной совокупности находится в гра-
ницах xB xB 20,48 0,5684, то есть от 19,9116 до 21,0484.
б) Исследуемая выборка является бесповторной, поэтому необходимый
объём выборки определяется по формуле n |
t2 |
s2 |
N |
. |
|||
t2s2 |
2 |
N |
|||||
|
|
||||||
x
По условию предельная ошибка выборки уменьшится в 2 раза, то есть составит 0,5 xB , остальные характеристики сохранят свои значения: t 1,96,
s2 5,55, |
N 600 и 1 0,05 0,95. |
|
|
|
|
Подставив эти значения в формулу, получим: |
|
||||
n |
1,962 5,55 600 |
|
12792,528 |
183,32 183. |
|
1,962 5,55 (0,5 0,5684)2 600 |
69,782664 |
||||
|
|
|
|||
Значит, для уменьшения предельной ошибки в два раза объем совокупности необходимо увеличить примерно в три раза (так как 183:60 3).
8. ЭЛЕМЕНТЫ КОРРЕЛЯЦИОННОГО И РЕГРЕССИОННОГО АНАЛИЗА
Наиболее простым видом связи между величинами является функциональная зависимость. В этом случае каждому значению одной величины соответствует вполне определенное одно или несколько значений другой величины. Однако существуют такие связи между величинами, которые нельзя отнести к типу функциональных зависимостей. Такова, например, связь между осадками и урожаем,междутолщинойснеговогопокровазимойиобъемомстокапоследующего половодья. Здесь каждому значению одной величины соответствует множество возможных значений другой, число этих значений не является постоянным, а сами значения не отражают определенной закономерности.
29
Рассеяние этих возможных значений объясняется влиянием большого количества дополнительных факторов. Например, связь между урожайностью и удобрениями имеется, однако есть еще ряд факторов, влияющих на урожайность: объективные – климат, осадки, почва, рельеф поверхности и т.д. и ряд субъективных факторов – севообороты, качество и глубина заделки семян, предшественники, агротехника и т. д.
Случайные величины связаны статистически (вероятностно, стохастически), если при изменении одной величины другая величина изменяет свой закон распределения.
Частным случаем статистической зависимости является корреляционная связь. В этом случае при изменении одной величины изменяется среднее значение другой величины.
Изучениемтакихсвязейзанимаетсякорреляционныйирегрессионныйанализ. Корреляционный анализ измеряет степень связи двух и более явлений. Регрессионный анализ устанавливает форму зависимости между изучае-
мыми явлениями, определяет функцию регрессии, находит точечные и интервальные оценки средних величин и др.
Корреляция и регрессия связаны тесно. Корреляция оценивает силу статистической связи, а регрессия исследует ее форму.
Простейшей является парная линейная корреляция и регрессия.
Парная корреляция связывает две случайные величины уравнением ре-
грессии yx f (x) или xy |
(y), где yx и xy – условные средние значения. |
||||||||
Если оба уравнения регрессии линейные, |
то между величинами x и y |
||||||||
установлена линейная корреляционная связь. |
|
|
|
|
|
||||
Для уравнения yx ax b выборочный коэффициент регрессии опреде- |
|||||||||
|
n |
|
|
|
|
n |
|
n |
|
|
(xi x) (yi |
y) |
|
xi |
|
yi |
|||
ляется по формуле a |
i 1 |
|
|
, где x |
i 1 |
и y |
i 1 |
– выбороч- |
|
|
|
|
|
||||||
|
|
n |
|
|
|
n |
|
n |
|
|
|
(xi x)2 |
|
|
|
|
|||
i 1
ные средние; n – число наблюдений (измерений). Свободный член вычисляется по формуле b y a x .
Для уравнения xy cy d коэффициенты определяются по формулам
n |
|
(xi x) (yi y) |
|
c i 1 |
и d x c y . |
n
(yi y)2
i 1
Точка пересечения линий yx ax b и xy cy d называется корреляци-
онным центром. Координаты корреляционного центра указывают на оптимальное соотношение величин x и y в заданных условиях.
30
