Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Специальные разделы высшей математики. Теория вероятностей и математическая статистика для инженера-исследователя. Учебное пособие
.pdf
6.5. Парная линейная регрессия 141
Для оценки значимости уравнения регрессии в целом выполняют следующие шаги.
1. Выдвигается основная гипотеза
𝐻0: 𝑅2= 0, модель в целом незначима,
против альтернативы
𝐻1: 𝑅2= 0, модель в целом значима.
2. Вычисляется значение статистики
𝐹 =
𝑅2(𝑛 −2)
1 −𝑅
2
=
𝑛
𝑖=1
𝑦
𝑛
𝑖=1
*
− 𝑚
𝑖
*
𝑦
(𝑦𝑖− 𝑦
2
(𝑛 −2)
2
*
)
𝑖
, (6.20)
которая при справедливости гипотезы 𝐻0имеет распределение Фишера с
(1,𝑛 −2) степенями свободы.
3. По заданному уровню значимости 𝛼 используя таблицы F-распределения
находим критическое значение 𝐹
крит
= 𝐹
(1,𝑛 −2).
1−𝛼
4. Правило принятие решения, если
а) 𝐹 < 𝐹
, то гипотеза 𝐻0принимается, и модель в целом при заданном
крит
уровне 𝛼 признается незначимой;
б) 𝐹 ≥ 𝐹
, то гипотеза 𝐻0отклоняется, и модель в целом при заданном
крит
уровне 𝛼 признается значимой.
Отметим, что для парной линейной регрессии t-критерии для коэффициента корреляции 𝑟𝑥𝑦, коэффициента регрессии 𝛽1и 𝐹 -критерий для модели в
целом совпадают.
Пример 6.3. В условиях примера 6.1 построить линейную регрессионную
модель зависимости деформации трубопровода 𝑌 от жесткости 𝑋 основания
траншеи. И оценить ее значимость при 𝛼 = 0,05.
Итак, пусть переменные 𝑌 и 𝑋 связаны линейной регрессионной зависимостью
𝑌 = 𝛽0+ 𝛽1𝑋 + 𝜀.
По эмпирическим данным, представленным в таблице 6.2, оценим параметры этой модели
𝑌*= 𝛽
*
0
+ 𝛽
*
1
𝑋.

142 Глава 6. КОРРЕЛЯЦИОННЫЙ И РЕГРЕССИОННЫЙ АНАЛИЗ
Согласно методу наименьших квадратов оценки 𝛽
*
0
и 𝛽
*
неизвестных пара-
1
метров 𝛽0и 𝛽1, используя результаты таблицы 6.3, найдем по формулам (6.13)
и (6.14):
8,3237 −12,31 ·0,72
*
𝛽
=
1
165,083 −12,31
= −0,0389, 𝛽
2
*
= 0,72 −0,0389 ·12,31 = 1,19805.
0
Таким образом, оцененное уравнение регрессии имеет вид
𝑌*= 1,19805 −0,0389𝑋.
Нанесем на диаграмму рассеяния прямую, которая соответствует уравнению регрессии (см. рис. 6.3).
1.2
1
0.8
0.6
Деформация, мм
0.4
6 8 10 12 14 16 18
Жесткость основания, кгс/см
2
Рис. 6.3 – Диаграмма рассеяния с линией регрессии
Вычислим оценку дисперсии случайной составляющей 𝜀, согласно формуле
(6.14):
𝑆
2
=
𝜀
1
0,043543 = 0,005443.
10 −2
Используя результаты таблицы 6.6 вычислим остатки 𝑒𝑖модели.
И, наконец, используя формулы (6.16) и (6.17), вычислим стандартные
ошибки коэффициентов регрессии
0,005443 ·1650,83
*
𝑆
=
𝛽
0
100 (165,083 −12,312)
= 0,08144,

6.5. Парная линейная регрессия 143
Таблица 6.6 – Остатки модели
𝑥 𝑦 𝑦
*
𝑒 = 𝑦 −𝑦
*
2
𝑒
5,5 1,12 0,9840 0,1360 0,018496
7,5 0,84 0,9062 -0,0662 0,004382
9,8 0,74 0,8167 -0,0767 0,005883
10,9 0,75 0,7739 -0,0239 0,000571
13,2 0,64 0,6844 -0,0444 0,001971
13,5 0,68 0,6727 0,0073 0,000053
14,1 0,63 0,6493 -0,0193 0,000372
14,4 0,6 0,6377 -0,0377 0,001421
16,1 0,67 0,5715 0,0985 0,009702
18,1 0,52 0,4937 0,0263 0,000692
Сумма 0,043543
0,005443 ·10
*
𝑆
=
𝛽
1
10 ·165,083 −123,1
= 0,00634.
2
Проверим значимость коэффициентов регрессии. Для этого выдвигается
основная гипотеза
𝐻0: 𝛽𝑗= 0, 𝑗 = 0,1,
против альтернативы
𝐻1: 𝛽𝑗= 0.
Вычислим значения статистик
𝑡0=
|𝛽
𝑆
*
|
*
0
1,19805
=
0,08144
= 14,71089, 𝑡1=
0
𝛽
|𝛽
𝑆
*
|
=
*
1
|−0,0389|
= 6,13816,
0,00634
1
𝛽
каждая, из которых, при справедливости гипотезы 𝐻0, имеет распределение
Стьюдента с 𝑛 − 2 = 10 −2 = 8 степенями свободы.
По заданному уровню значимости 𝛼 = 0,05 с помощью таблицы t - распре-
деления вычисляется критическое значение 𝑡
крит
= 𝑡
0,975
(8) = 2,3.
Так как обе статистики 𝑡0и 𝑡1превосходят критическое значение 𝑡
вероятностью 0,95 и 𝛽0, и 𝛽1признаются значимыми.
Вычислим по формуле (6.18) среднюю относительную ошибку аппроксима-
ции: 𝐴 = 7 %, следовательно, модель имеет хорошее качество.
крит
, то с

144 Глава 6. КОРРЕЛЯЦИОННЫЙ И РЕГРЕССИОННЫЙ АНАЛИЗ
Вычислим коэффициент детерминации 𝑅2по формуле (6.19)
𝑅2= 1 −
= 0,825.
10 ·(0,54183 −0,7192)
Таким образом, регрессионная модель объясняет 82,5% дисперсии дефор-
мации трубопровода.
Оценим значимость уравнения регрессии в целом. Для этого выдвинем ос-
новную гипотезу
𝐻0: 𝑅2= 0,
против альтернативы
𝐻1: 𝑅2= 0.
0,043543
Вычислим значение статистики по формуле (6.20)
0,825 (10 −2)
𝐹 =
= 37,7143,
1 −0,825
которая, при справедливости гипотезы 𝐻0, имеет распределение Фишера с
(1,𝑛 −2) = (1,8) степенями свободы.
По заданному уровню значимости 𝛼 = 0,05, используя таблицы F- распре-
деления, находим критическое значение 𝐹
крит
= 𝐹
(1,𝑛 −2) = 𝐹
1−𝛼
0,95
(1,8) =
5,3177.
Так как 𝐹 ≥ 𝐹
, то гипотеза 𝐻0отклоняется, и модель в целом с вероят-
крит
ностью 0,95 признается значимой.

6.6. Множественная линейная регрессия 145
6.6 Множественная линейная регрессия
На практике часто используется множественная линейная модель вида
𝑌 = 𝛽0+ 𝛽1𝑋1+ 𝛽2𝑋2+ . . . + 𝛽𝑘𝑋𝑘+ 𝜀, (6.21)
где 𝛽𝑖, 𝑖 = 0,𝑘 — параметры (вообще говоря неизвестные) регрессионной модели,
𝜀 — случайная ошибка, имеющая нормальное распределение.
Для проведения регрессионного анализа из (𝑘 + 1)–мерной генеральной совокупности 𝑌,𝑋1, . . . 𝑋𝑘извлекается выборка одновременных наблюдений объемом 𝑛, при этом 𝑖–е наблюдение (объект) характеризуется значениями
𝑦𝑖,𝑥𝑖1,𝑥𝑖2, . . . ,𝑥𝑖𝑘, 𝑖 = 1,𝑛
переменных 𝑌,𝑋1, . . . 𝑋𝑘, где 𝑥𝑖𝑗— значение 𝑗–й переменной для 𝑖–го наблюдения 𝑦𝑖, — значение результативного признака для 𝑖–го наблюдения.
Тогда уравнение модели (6.21) можно записать в координатной форме
𝑦𝑖= 𝛽0+ 𝛽1𝑥𝑖1+ 𝛽2𝑥𝑖2+ . . . + 𝛽𝑘𝑥𝑖𝑘+ 𝜀𝑖, (6.22)
или матричном виде
𝑌 = 𝛽𝑋 + 𝜀, (6.23)
где 𝑌 — случайный вектор–столбец размерности 𝑛 × 1 наблюдаемых значений
результативного признака 𝑌 = (𝑦1,𝑦2, . . . ,𝑦𝑛)𝑇, 𝑋 — матрица размерности 𝑛 ×
(𝑘 + 1) наблюдаемых значений регрессоров.
𝑋 =
⎛
1 𝑥
⎜
⎜
. . . . . . . . . . . .
⎜
11
. . . 𝑥
⎜
⎜
1 𝑥
⎜
⎜
. . . . . . . . . . . .
⎝
𝑖1
. . . 𝑥
1𝑘
𝑖𝑘
⎞
⎟
⎟
⎟
⎟
⎟
⎟
⎟
⎠
,
1 𝑥
𝑛1
𝑥
𝑛𝑘
𝛽 — вектор–столбец 𝛽 = (𝛽0,𝛽1, . . . ,𝛽𝑘)𝑇размерности (𝑘 + 1) × 1 неизвестных,
подлежащих оценке параметров модели; 𝜀 — вектор–столбец размерности 𝑛 × 1
случайных ошибок модели.
В дополнение к условиям Гаусса–Маркова потребуем, чтобы матрица 𝑋
удовлетворяла условию 𝑟𝑎𝑛𝑔 (𝑋) = 𝑘.

146 Глава 6. КОРРЕЛЯЦИОННЫЙ И РЕГРЕССИОННЫЙ АНАЛИЗ
Оценивание параметров модели. Оценки 𝛽
0
,𝛽
*
, . . . ,𝛽
1
*
неизвестных ко-
𝑘
*
эффициентов 𝛽0,𝛽1, . . . ,𝛽𝑘модели (6.21) являются решением оптимизационной
задачи МНК
𝑛
𝑆𝑆𝑅 =
(𝑦𝑗− 𝑦𝑗)2→ min
𝑗=1
,...,𝛽
.
*
𝑘
*
*
𝛽
,𝛽
0
1
Ее решение — это вектор столбец, определяемый формулой
𝛽*=𝑋𝑇𝑋
−1
𝑋𝑇𝑌. (6.24)
При построении модели множественной регрессии количество наблюдений
должно не менее чем в 3 раза (лучше в 5-6 раз) превышать число оцениваемых
параметров.
Оценка дисперсии 𝜎
(𝑌 − 𝛽*𝑋)𝑇(𝑌 − 𝛽*𝑋)
2
𝑆
=
𝜀
𝑛 −𝑘 − 1
2
случайного члена 𝜀 определяется формулой
𝜀
𝑛
=
1
𝑛 −𝑘 − 1
𝑖=1
(𝑦𝑖− 𝑦
*
)2=
𝑖
1
=
𝑛 −𝑘 − 1
𝑛
𝑖=1
2
𝑒
. (6.25)
𝑖
Точность коэффициентов модели. Оценка ковариационной матрицы вектора 𝛽*коэффициентов регрессии определяется выражением
𝐶𝑜𝑣 (𝛽*) = 𝑆
2
𝜀
𝑋𝑇𝑋
−1
.
Учитывая, что на главной диагонали ковариационной матрицы находятся дисперсии оценок коэффициентов регрессии, можно выписать стандартные
ошибки оценок коэффициентов.
где
𝑋𝑇𝑋
*
𝑆
= 𝑆
𝛽
𝑗
−1
𝜀
(𝑋𝑇𝑋)
— диагональный элемент матрицы𝑋𝑇𝑋
𝑗𝑗
−1
(6.26)
𝑗𝑗
−1
.
Стандартная ошибка (оценка среднего квадратичного отклонения) для прогноза условного среднего зависимой переменной, если регрессоры равны 𝑋 =
𝑋0, определяется формулой

6.6. Множественная линейная регрессия 147
𝑆
= 𝑆
*
𝑌
0
𝜀
𝑇
𝑋
(𝑋𝑇𝑋)−1𝑋0.
0
Стандартную ошибку для индивидуального прогноза зависимой переменной, если регрессоры равны 𝑋 = 𝑋0, можно вычислить по формуле
𝑆
*
= 𝑆
𝑌
0
𝜀
1 + 𝑋
𝑇
(𝑋𝑇𝑋)−1𝑋0.
0
Оценку качества построенной модели дает коэффициент детерминации 𝑅2,
а также средняя ошибка аппроксимации, которые, как и в парной модели, определяются формулами (6.19) и (6.20).
Однако значение 𝑅2при добавлении в модель нового регрессора возрастает,
независимо от того влияет ли новый регрессор на независимую переменную или
нет. И в связи с этим используют скорректированный (adjusted) коэффициент
детерминации:
𝑛 −1
𝑆
= 1 −1 −𝑅
𝑎𝑑𝑗
2
𝑛 −𝑘 − 1
. (6.27)
Пример 6.4. Рассмотрим линейную модель с двумя регрессорами
𝑌 = 𝛽0+ 𝛽1𝑋1+ 𝛽2𝑋2+ 𝜀.
В данном случае матрицы 𝑋𝑇𝑋 и 𝑋𝑇𝑌 имеют вид
𝑋𝑇𝑋 =
⎛
⎜
⎜
⎝
𝑛
𝑥
𝑖1
𝑥
𝑖1
𝑥
𝑖2
𝑥
𝑥𝑖1𝑥
2
𝑖1
𝑖2
𝑥
𝑥𝑖1𝑥
𝑥
𝑖2
2
𝑖2
𝑖2
⎞
⎟
⎟
⎠
, 𝑋𝑇𝑌 =
⎛
⎜
⎜
⎝
𝑦
𝑦𝑖𝑥
𝑦𝑖𝑥
⎞
𝑖
⎟
⎟
.
𝑖1
⎠
𝑖2
Следовательно, оцененная модель примет вид
𝑌*= 𝛽
*
0
+ 𝛽
*
𝑋1+ 𝛽
1
*
𝑋2,
2
где оценки 𝛽
0
, 𝛽
*
1
и 𝛽
*
коэффициентов регрессии, согласно соотношению
2
*
(6.25), можно вычислить по формулам
𝑆
𝑆
2
− 𝑐𝑜𝑣 (𝑋2,𝑌 ) 𝑐𝑜𝑣 (𝑋1,𝑋2)
𝑥
2
2
2
𝑆
𝑥
2
𝑥
− [𝑐𝑜𝑣 (𝑋1,𝑋2)]
𝑥
2
2
2
− 𝑐𝑜𝑣 (𝑋1,𝑌 ) 𝑐𝑜𝑣 (𝑋1,𝑋2)
𝑥
1
2
𝑆
− [𝑐𝑜𝑣 (𝑋1,𝑋2)]
𝑥
2
2
*
− 𝛽
𝑦
𝑐𝑜𝑣 (𝑋1,𝑌 ) 𝑆
*
𝛽
=
1
𝑐𝑜𝑣 (𝑋2,𝑌 ) 𝑆
*
𝛽
=
2
*
𝛽
= 𝑚
0
2
2
*
*
𝑚
1
𝑥
1
− 𝛽
*
*
𝑚
. (6.30)
2
𝑥
2
, (6.28)
, (6.29)

148 Глава 6. КОРРЕЛЯЦИОННЫЙ И РЕГРЕССИОННЫЙ АНАЛИЗ
*
Стандартные ошибки коэффициентов 𝛽
1
*
и 𝛽
определяются соотношениями
2
2
𝑆
𝜀
𝑆
𝑛𝑆
2
𝑥
𝑖
1 −𝑟
=
𝛽
𝑖
2
𝑥1,𝑥
. (6.31)
2
Оценка значимости коэффициента регрессии 𝛽𝑗осуществляется с использованием критерия Стьюдента.
При этом выдвигается основная гипотеза
𝐻0: 𝛽𝑗= 0;
против двусторонней альтернативы
𝐻1: 𝛽𝑗= 0.
Для выбора одной из этих гипотез вычисляют статистику критерия:
*
𝛽
𝑆
𝑗
,
*
𝛽
𝑗
𝑡 =
которая, при справедливости гипотезы 𝐻0, имеет распределение Стьюдента с
𝑛 −𝑘 − 1 степенями свободы.
Таким образом, при уровне значимости равным 𝛼, если:
а) |𝑡| < 𝑡
1−𝛼/2
(𝑛 −𝑘 − 1) — гипотеза 𝐻0принимается (коэффициент не зна-
чим);
б) |𝑡| ≥ 𝑡
1−𝛼/2
(𝑛 −𝑘 − 1) — гипотеза 𝐻0отклоняется (коэффициент стати-
стически значим).
Здесь 𝑡𝑝(𝑚) — квантиль распределения Стьюдента с 𝑚 степенями свободы
уровня 𝑝.
Значимость уравнения регрессии в целом, т.е. гипотезы
𝐻0: 𝛽1= 0, . . . ,𝛽𝑘= 0;
против альтернативы
𝐻1: хотя бы для одного 𝑖𝑖 = 1,𝑘𝛽𝑖= 0,
проверяется по 𝐹 –критерию Фишера.
Если справедлива основная гипотеза , то статистика критерия

6.6. Множественная линейная регрессия 149
𝐹 =
𝑅2(𝑛 −𝑘 − 1)
(1 −𝑅2) 𝑘
имеет распределение Фишера с (𝑘,𝑛 − 𝑘 − 1) степенями свободы.
Таким образом, если:
а) 𝐹
крит
< 𝑓
(𝑘; 𝑛 − 𝑘 − 1) — гипотеза 𝐻0принимается (множественный
1−𝛼
коэффициент корреляции не значим);
б) 𝐹
крит
≥ 𝑓
(𝑘; 𝑛 − 𝑘 − 1) — гипотеза 𝐻0отклоняется (множественный
1−𝛼
коэффициент корреляции статистически значим).
Здесь 𝑓𝛼(𝑣,𝑤) — квантиль распределения Фишера с (𝑣,𝑤) степенями свободы уровня 𝛼.
Пример 6.5. По статистическим данным примера 6.2 построить линейную
регрессионную модель зависимости ползучести (𝑌 ) бетона от влажности среды
(𝑋1) и расхода цемента на 1 м3 бетона (𝑋2).
Пусть истинная модель зависимости имеет вид
𝑌 = 𝛽0+ 𝛽1𝑋1+ 𝛽2𝑋2+ 𝜀.
Вычислим эмпирические моменты, используя данные таблицы 6.4:
𝑛 −1
𝑛
𝑐𝑜𝑣 (𝑋1,𝑌 ) =
𝑛
1
𝑛
𝑖=1
𝑥1𝑖𝑦𝑖−
1
𝑛
𝑛
𝑖=1
𝑛
1
𝑦
𝑖
𝑛
𝑥1𝑖=
𝑖=1
= 9719,3 −180,6 ·60,5 = −1207,
𝑛 −1
𝑛
𝑐𝑜𝑣 (𝑋2,𝑌 ) =
𝑛
1
𝑛
𝑖=1
𝑥2𝑖𝑦𝑖−
1
𝑛
𝑛
𝑖=1
𝑛
1
𝑦
𝑖
𝑛
𝑥2𝑖=
𝑖=1
= 23259 −180,6 ·177 = −8707,2,
𝑛 −1
𝑛
𝑐𝑜𝑣 (𝑋1,𝑋2) =
1
𝑛
𝑛
𝑖=1
𝑥1𝑖𝑥2𝑖−
1
𝑛
𝑛
𝑖=1
𝑛
1
𝑥
1𝑖
𝑛
𝑥2𝑖=
𝑖=1
𝑛 −1
𝑛
𝑆
= 11716 −60,5 ·177 = 1007,5,
2
1𝑖
−
1
𝑛
𝑛
𝑖=1
𝑛
2
𝑥
1
=
1
𝑛
𝑥
𝑖=1
2
𝑥
= 3794,3 ·60,52= 134,05,
1𝑖

150 Глава 6. КОРРЕЛЯЦИОННЫЙ И РЕГРЕССИОННЫЙ АНАЛИЗ
𝑛 −1
𝑛
𝑆
2
=
𝑥
2
Найдем оценки 𝛽
𝑛
*
0
1
, 𝛽
𝑛
𝑖=1
*
1
2
𝑥
2𝑖
и 𝛽
1
𝑛
−
𝑛
𝑖=1
*
коэффициентов регрессии по формулам (6.28),
2
2
𝑥
= 39390 −1772= 8061.
2𝑖
(6.29), (6.30),
−1207 ·8061 + 8707,2 ·1007,5
*
𝛽
=
1
*
𝛽
=
2
*
𝛽
= 180,6 + 14,6079 ·60,5 −0,7456 ·177 = 932,4082.
0
134,05 ·8061 −1007,5
−8707,2 ·134,05 + 1207 ·1007,5
134,05 ·8061 −1007,5
2
= −14,6079,
2
= 0,7456,
Таким образом, оцененная линейная модель двухфакторной регрессии име-
ет вид
𝑌*= 932,4082 −14,6079𝑋1+ 0,7456𝑋2.
Определим адекватность модели. Вычислим, используя результаты вычислений (табл. 6.7), по формуле (6.18) среднюю относительную ошибку аппроксимации:
1
𝐴 =
· 0,6345 · 100 % = 6,35 %.
10
Так как 𝐴 ≤ 7%, то модель имеет хорошее качество.
Вычислим коэффициент детерминации регрессионной модели
3075,6524
𝑅2= 1 −
= 0,9731.
114472,4
Это означает, что модель объясняет 97,31% изменчивости зависимой переменной.
Проверим значимость уравнения регрессии в целом. Для этого выдвинем
основную гипотезу
𝐻0: 𝛽1= 0,𝛽2= 0;
против альтернативы
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
