Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Специальные разделы высшей математики. Теория вероятностей и математическая статистика для инженера-исследователя. Учебное пособие

.pdf
Скачиваний:
0
Добавлен:
07.09.2026
Размер:
1 Мб
Скачать
☆
6.3. Проверка гипотез в корреляционном анализе 131
Таблица 6.3 – Вспомогательная таблица к примеру 6.1
𝑥 𝑦 𝑥
2
2
𝑦
𝑥𝑦
5,5 1,12 30,25 1,2544 6,16 7,5 0,84 56,25 0,7056 6,3 9,8 0,74 96,04 0,5476 7,252 10,9 0,75 118,81 0,5625 8,175 13,2 0,64 174,24 0,4096 8,448 13,5 0,68 182,25 0,4624 9,18 14,1 0,63 198,81 0,3969 8,883 14,4 0,6 207,36 0,36 8,64 16,1 0,67 259,21 0,4489 10,787
18,1 0,52 327,61 0,2704 9,412 Сумма 123,1 7,19 1650,83 5,4283 83,237 Среднее 12,31 0,72 165,083 0,54283 8,3237
Преобразуем формулу (6.1) к виду:
*
𝑦
𝑦𝑖− 𝑚
*
*
𝑚
𝑥
𝑦
𝑛
𝑦
𝑖=1
2
−𝑚
𝑖
=
2
*
𝑦
.
2
*
𝑦
𝑟𝑥𝑦=
=
1
𝑛
𝑛 𝑖=1
𝑛 𝑖=1
𝑛
(𝑥𝑖− 𝑚
𝑖=1
(𝑥𝑖− 𝑚
1
𝑛
2
𝑥
− (𝑚
𝑖
2
*
)
𝑥
𝑛
𝑥𝑖𝑦𝑖− 𝑚
𝑖=1
*
)
𝑥
*
)𝑦𝑖− 𝑚
𝑥
𝑛 𝑖=1
2
1
𝑛
Используя последнюю формулу, оценим коэффициент корреляции
8,3237 −12,31 ·0,72
𝑟𝑥𝑦=
= −0,9083.
(165,083 −12,312) (0,54283 −0,722)
Для проверки значимости коэффициента корреляции выдвигаем гипотезу
𝐻0: 𝜌𝑥𝑦= 0 против альтернативы 𝐻1: 𝜌𝑥𝑦= 0. Вычислим значение t-статистики
𝑡 =
𝑟
𝑥𝑦
1 −𝑟
√
𝑛 −𝑖 − 2 =
2
𝑥𝑦
−0,9083
1 −(−0,9083)
√
10 −0 −2 = −17,3705.
2
По таблице t-распределения найдем критическое значение, как квантиль
распределения Стьюдента 𝑡
крит
= 𝑡
(8) = 2,3060.
0,975
132 Глава 6. КОРРЕЛЯЦИОННЫЙ И РЕГРЕССИОННЫЙ АНАЛИЗ
Так как |𝑡| > 𝑡
, то гипотеза 𝐻0о незначимости коэффициента корре-
крит
ляции отвергается, т. е. коэффициент корреляции значим. А так как 𝑟𝑥𝑦=
−0,9083 < − 0,9, то между деформацией трубопровода и жесткостью основа- ния существует очень высокая корреляционная связь.
При построения доверительного интервала для коэффициента корреляции
выполним 𝑧-преобразование
1 + 𝑟
𝑧 = 0,5 ln
1 −𝑟
= 0,5 ln
1 −0,9083
1 + 0,9083
= −1,5177.
Тогда, согласно формуле (6.8), вычислим
𝑧1= 𝑧 − 𝑧
1−𝛼/2
𝑧1= 𝑧 + 𝑧
√
𝑛 −3 = −1,5177 − 1,96
√
1−𝛼/2
𝑛 −3 = −1,5177 + 1,96
√
10 −3 = −2,2585,
√
10 −3 = −0,7769.
Далее, согласно формуле (6.9), нижняя и верхняя границы доверительного
интервала для коэффициента корреляции, соответственно, равны
2𝑧
1
𝑒
−1
2𝑧
1
𝑒
+1
=
2·(−2,2585)
𝑒
2·(−2,2585)
𝑒
−1
= −0,9784 и
+1
2𝑧
2
𝑒
−1
2𝑧
2
𝑒
+1
=
2·(−0,7769)
𝑒
2·(−0,7769)
𝑒
−1
= −0,6510.
+1
Таким образом, с вероятностью 0,95 мы можем утверждать, что 𝜌 ∈
(−0,9784; −0,6510).
Пример 6.2. При исследовании влияния на ползучесть (𝑋1) бетона, влаж-
ности среды (𝑋2) и расхода цемента на кубометр бетона (𝑋3) получены следу­ющие статистические данные (см. таблицу 6.4).
Необходимо вычислить выборочные, частные коэффициенты корреляции и коэффициент детерминации, а также проверить их значимость. Положить уровень значимости на уровне 𝛼 = 0,1.
Для нахождения коэффициентов корреляции, заполним таблицу 6.5.
6.3. Проверка гипотез в корреляционном анализе 133
Таблица 6.4 – Статистические данные к примеру 6.2
𝑋
1
𝑋
2
𝑋
3
26 80 350 61 75 300 95 70 250 122 65 200 187 60 150 202 58 130 222 55 120 211 52 110 264 50 90 416 40 70
Используя, результаты таблицы 6.5, вычислим парные коэффициенты кор­реляции по формуле (6.1).
𝑟12= 𝑟21=
= −0,9744,
(44063,6 −180,62) (3794,3 −60,52)
23259 −180,6 ·177
9719,3 −180,6 ·60,5
𝑟13= 𝑟31=
= −0,9064,
(44063,6 −180,62) (39390 −1772)
11716 −60,5 ·177
𝑟23= 𝑟32=
= 0,9692.
(3794,3 −60,52) (39390 −1772)
Следовательно, корреляционная матрица имеет вид:
⎛
⎞
1 −0,9744 −0,9064
𝑅 =
⎜ ⎜
−0,9744 1 0,9692
⎝
⎟ ⎟ ⎠
.
−0,9064 0,9692 1
Вычислим частные коэффициенты корреляции по формуле (6.3).
𝑟
𝑥1,𝑥2/𝑥
𝑟12− 𝑟13𝑟
=
3
1 −𝑟
2
13
23
1 −𝑟
2
23
−0,9744 −(−0,9064) ·0,9692
=
1 −(−0,9064)
2
1 −0,9692
= −0,922,
2
𝑟
𝑥1,𝑥3/𝑥
𝑟12𝑟23− 𝑟
=
2
1 −𝑟
2
12
13
1 −𝑟
2 23
(−0,9744) ·0,9692 −(−0,9064)
=
1 −(−0,9744)
2
1 −0,9692
= −0,6861.
2
134 Глава 6. КОРРЕЛЯЦИОННЫЙ И РЕГРЕССИОННЫЙ АНАЛИЗ
Таблица 6.5 – Вспомогательная таблица к примеру 6.2
𝑋
𝑋
1
𝑋
2
3
𝑋
2
1
𝑋
2
2
𝑋
2
3
𝑋1𝑋
𝑋1𝑋
2
𝑋2𝑋
3
3
26 80 350 676 6400 122500 2080 9100 28000 61 75 300 3721 5625 90000 4575 18300 22500
95 70 250 9025 4900 62500 6650 23750 17500 122 65 200 14884 4225 40000 7930 24400 13000 187 60 150 34969 3600 22500 11220 28050 9000 202 58 130 40804 3364 16900 11716 26260 7540 222 55 120 49284 3025 14400 12210 26640 6600 211 52 110 44521 2704 12100 10972 23210 5720 264 50 90 69696 2500 8100 13200 23760 4500 416 40 70 173056 1600 4900 16640 29120 2800
Сумма 1806 605 1770 440636 37943 393900 97193 232590 117160
Среднее 180,6 60,5 177 44063,6 3794,3 39390 9719,3 23259 11716
Проверим значимость частного коэффициента корреляции. Для проверки
значимости 𝜌
𝐻0: 𝜌
𝐻1: 𝜌
𝑥1,𝑥2/𝑥
𝑥1,𝑥2/𝑥
𝑥1,𝑥2/𝑥
3
3
выдвигаем следующие гипотезы
3
= 0,
= 0.
Статистика критерия находится по формуле (6.6):
𝑡 =
𝑟
𝑥1,𝑥2/𝑥
1 −𝑟
3
2
𝑥1,𝑥2/𝑥
√
𝑛 −𝑖 − 2 =
3
−0,922
1 −(−0,922)
√
10 −1 −2 = −6,30022,
2
которая, при справедливости основной гипотезы, имеет распределение Стью­дента с 𝑛 − 𝑖 − 2 = 7 степенями свободы. Следовательно, критическое значе­ние, найденное по таблице 𝑡-распределения, 𝑡
(7) = 1,8946. В силу того, что
0,95
|𝑡| > 𝑡
(7), гипотеза 𝐻0отвергается и 𝜌
0,95
𝑥1,𝑥2/𝑥
с вероятностью 0,9 признается
3
значимым.
Так как коэффициент частной корреляции по модулю несколько меньше мо­дуля парного коэффициента между этими же переменными, то можно сделать вывод, что переменная 𝑋3слегка искажает взаимосвязь между признаками 𝑋 и 𝑋2в сторону ее увеличения.
Аналогично, проверим значимость коэффициента 𝜌
𝑥1,𝑥3/𝑥
. Для этого вы-
2
1
6.3. Проверка гипотез в корреляционном анализе 135
двинем гипотезы
𝐻0: 𝜌
𝐻1: 𝜌
𝑥1,𝑥3/𝑥
𝑥1,𝑥3/𝑥
= 0,
2
= 0.
2
Вычислим статистику критерия по формуле (6.6):
𝑡 =
𝑟
𝑥1,𝑥2/𝑥
1 −𝑟
3
2
𝑥1,𝑥2/𝑥
√
𝑛 −𝑖 − 2 =
3
−0,6861
1 −(−0,6861)
√
10 −1 −2 = −2,49516,
2
которая, при справедливости основной гипотезы, имеет распределение Стью­дента с 𝑛 − 𝑖 − 2 = 7 степенями свободы. Следовательно, критическое значе­ние находим по таблице 𝑡-распределения 𝑡
|𝑡| > 𝑡
(7), гипотеза 𝐻0отвергается и 𝜌
0,95
𝑥1,𝑥3/𝑥
(7) = 1,8946. В силу того, что
0,95
с вероятностью 0,9 признается
2
значимым.
Так как коэффициент частной корреляции по модулю значительно мень­ше модуля парного коэффициента между этими же переменными, то можно сделать вывод, что переменная 𝑋2заметно искажает взаимосвязь между при­знаками 𝑋1и 𝑋2в сторону ее увеличения.
Множественный коэффициент корреляции результирующего признака 𝑋 вычислим по формуле (6.5):
𝑅1=1 −
|𝑅|
𝐶
11
=1 −
0,0016
= 0,999951.
16,4921
Проверим значимость множественного коэффициента корреляции. Для это­го выдвигаем две гипотезы
𝐻0: 𝑅1= 0,
𝐻1: 𝑅1> 0.
Статистику критерия находим по формуле (6.10):
1
0,999951
𝐹 =
3−1
1
(1 −0,999951)
10−3
= 36072,97.
1
Используя таблицу распределения Фишера, вычислим критическое значе­ние 𝑓
Так как 𝐹 > 𝑓
(𝑘 − 1; 𝑛 − 𝑘) = 𝑓
1−𝛼
(3 −1; 10 −3) = 𝑓
0,9
(2; 7), то гипотеза 𝐻0отвергается и множественный коэф-
0,9
(2; 7) = 3,2574.
0,9
фициент корреляции 𝑅1признается значимым, что указывает на существен-
136 Глава 6. КОРРЕЛЯЦИОННЫЙ И РЕГРЕССИОННЫЙ АНАЛИЗ
ность корреляционной связи между ползучестью бетона с одной стороны и влажностью окружающей среды и расходом цемента с другой.
6.4 Основные определения
регрессионного анализа
Регрессионный анализ (regression analysis) — раздел математической статистики, посвященный разработке и применению методов исследования ре­грессионной зависимости случайной величины 𝑌 от переменных 𝑋𝑖, 𝑖 = 1,𝑘, по данным статистических наблюдений. Зависимая переменная в регрессионном анализе называется объясняемой, а переменные факторы — регрессорами или объясняющими переменными.
Термин «регрессия» (to regress — двигаться в обратном направлении) впер­вые использовал в 1885 году английский исследователь — статистик, географ, антрополог и психолог сэр Фрэнсис Гальтон.
При проведении регрессионного анализа обычно предполагают, что случай­ная величина 𝑌 имеет нормальный закон распределения с условным математи­ческим ожиданием 𝑌*= M (𝑌 |𝑋1, . . . 𝑋𝑘) = 𝑓 (𝑋1, . . . 𝑋𝑘).
Взаимосвязь между средним значением результативной переменной и сред­ними значениями регрессоров выражается в виде уравнения регрессии.
Регрессионный анализ очень тесно связан с корреляционным анализом. В корреляционном анализе исследуется направление и теснота связи между слу­чайными переменными. В регрессионном анализе исследуется форма зависимо­сти между переменными. Таким образом, фактически оба метода изучают одну и ту же взаимосвязь, но с разных сторон, и дополняют друг друга. На практике корреляционный анализ выполняется перед регрессионным. После доказатель­ства наличия взаимосвязи методом корреляционного анализа можно выразить форму этой связи с помощью регрессионного анализа. Как и корреляционный, регрессионный анализ отражает только количественные зависимости между переменными. Причинно-следственные зависимости регрессионный анализ не отражает. Гипотезы о причинно-следственной связи переменных должны фор­мулироваться и обосновываться исходя из теоретического анализа содержания
6.4. Основные определения регрессионного анализа 137
изучаемого явления.
В зависимости от количества объясняющих переменных различают:
— однофакторный регрессионный анализ (одна независимая переменная X )
— многофакторный регрессионный анализ (больше, чем одна независимая переменная 𝑋1, . . . 𝑋𝑘).
В зависимости от вида функции 𝑓 (𝑋1, . . . 𝑋𝑘) регрессионный анализ бывает
— линейным;
— нелинейным.
Целями регрессионного анализа являются.
1. Определение формы зависимости между зависимой переменной и регрес-
сорами.
2. Предсказание значения зависимой переменной с помощью независимых.
3. Определение вклада отдельных независимых переменных в вариацию за-
висимой переменной.
Основные задачи регрессионного анализа следующие:
— определение вида и формы зависимости;
— оценка параметров уравнения модели;
— проверка значимости уравнения регрессии;
— проверка значимости отдельных параметров модели;
— построение доверительных интервалов для параметров модели;
— исследование характеристик точности модели;
— построение точечных и интервальных прогнозов зависимой переменной.
Этапы построения регрессионной модели.
1. Постановка задачи. На этом этапе формируются предварительные гипо-
тезы о зависимости исследуемых явлений.
2. Спецификация независимых переменных 𝑋1, . . . 𝑋𝑘, т.е. определение тех существенных факторов, которые воздействуют на результирующую перемен­ную 𝑌 .
3. Сбор статистических данных.
4. Определение вида функции 𝑓 (𝑋1, . . . 𝑋𝑘) связи между 𝑌 и 𝑋1, . . . 𝑋𝑘.
5. Оценка параметров модели на основе статистических данных. Одним из основных методов для оценки параметров (коэффициентов) регрессионной мо­дели является метод наименьших квадратов (МНК), суть которого заключается
138 Глава 6. КОРРЕЛЯЦИОННЫЙ И РЕГРЕССИОННЫЙ АНАЛИЗ
в том, что минимизируется сумма квадратов отклонений (SSR) реально наблю­даемых значений 𝑦𝑖от их оценок 𝑦
*
, т.е. решается оптимизационная задача
𝑖
𝑆𝑆𝑅 =
𝑛
𝑖=1
2
𝑒
𝑖
=
𝑛
𝑖=1
(𝑦𝑖− 𝑦
*
)2→ min .
𝑖
6. Анализ корректности и правдоподобия полученных результатов. Кор­ректировка модели.
7. Анализ и интерпретация полученных результатов.
6.5 Парная линейная регрессия
Рассмотрим однофакторную регрессионную модель
𝑌 = 𝛽0+ 𝛽1𝑋 + 𝜀, (6.11)
где 𝛽0, 𝛽1— параметры (неслучайные, но, вообще говоря, неизвестные) регрес­сионной модели, 𝜀 — случайная ошибка.
По выборке одновременных наблюдений {(𝑥1,𝑦1) ; (𝑥2,𝑦2) ; . . . ; (𝑥𝑛,𝑦𝑛)} необ-
ходимо оценить уравнение
𝑌*= 𝛽
*
0
*
+ 𝛽
𝑋. (6.12)
1
Оценка параметров. Согласно методу наименьших квадратов оценки 𝛽
*
𝛽
неизвестных пармеметров 𝛽0и 𝛽1находятся из условия
1
𝑆𝑆𝑅 =
𝑛
𝑖=1
2
𝑒
𝑖
=
𝑛
𝑖=1
(𝑦𝑖− 𝑦
*
)2=
𝑖
𝑛
𝑖=1
(𝑦𝑖− 𝛽
*
0
*
− 𝛽
𝑥𝑖)2→ min
1
.
*
*
𝛽
,𝛽
0
1
Неоходимым условием минимума функции является равенство первых част-
ных производных нулю:
𝑛
𝜕𝑆𝑆𝑅
𝜕𝛽
𝜕𝑆𝑆𝑅
*
𝜕𝛽
0
*
0
= −2
= −2
𝑖=1
𝑛
𝑥𝑖(𝑦𝑖− 𝛽
𝑖=1
(𝑦𝑖− 𝛽
*
0
− 𝛽
*
− 𝛽
0
*
𝑥𝑖) = 0,
1
*
𝑥𝑖) = 0.
1
*
и
0
6.5. Парная линейная регрессия 139
Эти равенства называются системой нормальных уравнений, решая кото-
рую получим формулы для оценок коэффициентов модели (6.12):
𝛽
𝑥
2
𝑖
*
0
− (
= 𝑚
𝑛 𝑖=1
𝑛
𝑛
*
𝛽
=
1
𝑛
𝑖=1
𝑥𝑖𝑦𝑖−
𝑛 𝑖=1
*
𝑦
𝑥
𝑖
𝑛 𝑖=1
− 𝛽
𝑛
𝑦
𝑖=1
2
𝑥𝑖)
*
*
𝑚
. (6.14)
1
𝑥
𝑐𝑜𝑣(𝑋,𝑌 )
𝑖
=
(𝜎
, (6.13)
2
*
)
𝑥
Для оценок метода наименьших квадратов справедливо следующее утвер-
ждение.
Теорема 6.1 (Гаусса–Маркова). Пусть выполнены следующие условия
1) процесс, порождающий данные, имеет вид 𝑌 = 𝛽0+ 𝛽1𝑋 + 𝜀;
2) математическое ожидание случайной составляющей в любом наблю-
дении должно быть равно нулю M (𝜀𝑖) = 0, 𝑖 = 1,𝑛.
3) дисперсия случайной составляющей должна быть постоянна для всех
наблюдений D (𝜀𝑖) = 𝜎
2
, 𝑖 = 1,𝑛. Это, так называемое, условие гомоскеда-
𝜀
стичности,
4) отсутствует систематическая связь между значениями случайной
составляющей в любых двух наблюдениях M (𝜀𝑖,𝜀𝑗) = 0, 𝑖,𝑗 = 1,𝑛, 𝑖 = 𝑗.
Тогда МНК–оценки (6.13), (6.14) параметров 𝛽0и 𝛽1имеют наименьшую
дисперсию в классе всех линейных несмещенных оценок (Best Linear Unbiased
Estimator, BLUE).
Оценка дисперсии случайной составляющей 𝜀 определяется формулой
𝑆
𝑛
=
1
𝑛 −2
𝑖=1
2
𝑒
𝑖
2
𝜀
1
=
𝑛 −2
𝑛
𝑖=1
(𝑦𝑖− 𝑦
*
)2. (6.15)
𝑖
Тогда стандартные ошибки коэффициентов регрессии можно вычислить
следующим образом
𝑆
𝑆
*
= 𝑆
𝛽
0
𝜀
𝑛
𝑛
(𝑥𝑖− 𝑚
𝑖=1
𝑛 𝑖=1
2
𝑥
𝑖
2
*
)
𝑥
1
*
𝛽
1
= 𝑆
𝜀
𝑛
(𝑥𝑖− 𝑚
𝑖=1
= 𝑆
2
*
)
𝑥
= 𝑆
𝜀
𝜀
𝑛
𝑛
𝑛 𝑖=1
𝑛 𝑖=1
𝑥
𝑥
2
𝑖
𝑛 𝑖=1
2
𝑖
𝑛
− (
− (
𝑥
2
𝑖
𝑛 𝑖=1
𝑛 𝑖=1
, (6.16)
2
𝑥𝑖)
. (6.17)
2
𝑥𝑖)
140 Глава 6. КОРРЕЛЯЦИОННЫЙ И РЕГРЕССИОННЫЙ АНАЛИЗ
Проверка значимости коэффициентов. Коэффициент регрессионной модели 𝛽𝑗, 𝑗 = 0; 1 считается значимым, если он статистически отличен от нуля. В терминах проверки статистических гипотез определение значимости коэффициента проводится следующим образом.
1. Выдвигается основная гипотеза
𝐻0: 𝛽𝑗= 0 (коэффициент 𝛽𝑗незначим) против альтернативы
𝐻1: 𝛽𝑗= 0 (коэффициент 𝛽𝑗значим).
*
𝛽
|
|
2. Вычисляется значение статистики 𝑡 =
𝑗
, которая, при справедливости
*
𝑆
𝛽
𝑗
гипотезы 𝐻0, имеет распределение Стьюдента с 𝑛 − 2 степенями свободы.
3. По заданному уровню значимости 𝛼 с помощью таблицы t- распределения вычисляется критическое значение 𝑡
крит
= 𝑡
1−𝛼/2
(𝑛 −2).
4. Правило принятия решения, если
|𝑡| < 𝑡
1−𝛼/2
(𝑛 −2) — гипотеза 𝐻0принимается (коэффициент статистически
не значим);
|𝑡| ≥ 𝑡
1−𝛼/2
(𝑛 −2) — гипотеза 𝐻0отклоняется (коэффициент статистически
значим).
Адекватность модели. Средняя относительная ошибка аппроксимации вы­числяется по формуле:
𝐴 =
𝑛
1
𝑛
𝑖=1
 
𝑦𝑖− 𝑦
 
*
𝑖
· 100% =
𝑦
𝑖
1
𝑛
𝑛
𝑖=1
𝑒
𝑖
· 100%. (6.18)
𝑦
𝑖
Если 𝐴 6 7%, то считают, что модель имеет хорошее качество. Коэффициентом детерминации 𝑅2регрессионной модели называют вели-
чину
𝑅2=
𝑛 𝑖=1
𝑛 𝑖=1
*
𝑦
− 𝑚
𝑖
𝑦𝑖− 𝑚
*
𝑦
*
𝑦
2
2
= 1 −
𝑛
𝑖=1 𝑛 𝑖=1
(𝑦𝑖− 𝑦
𝑦𝑖− 𝑚
2
*
)
𝑖
. (6.19)
2
*
𝑦
Коэффициент детерминации характеризует долю дисперсии зависимой пе­ременной 𝑌 , объясняемую регрессией, в общей дисперсии. Соответственно, ве­личина 1 −𝑅2характеризует долю дисперсии 𝑌 , вызванную влиянием осталь­ных не учтенных в модели факторов.
Коэффициент детерминации лежит в интервале 0 ≤ 𝑅2≤ 1. Чем ближе 𝑅 к 1, тем выше качество модели.
2
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]