Анализ данных в материаловедении. Часть 2. Регрессионный анализ. Учебное пособие
.pdfКоэффициенты левой части системы линейных уравнений (7.5) образуют квадратную матрицу [U], элементы которой
n
ujk = å fik fij . Пусть матрица [C] с элементами cjk – матрица, об-
i=1
ратная матрице [U]:
[C]= [U]-1 .
(Коэффициенты сjj в выражении (6.13) – это диагональные элементы матрицы [C].)
Решение системы (7.5) запишется через элементы матрицы [C]
как
|
n |
|
n |
|
|
n |
|
|
|
bj = cj0 |
å |
yi fi0 + cj1 |
å |
yi |
fi1 +...+ cjp |
å |
yi |
fip . |
(7.6) |
|
|
|
|||||||
|
i=1 |
|
i=1 |
|
|
i=1 |
|
|
|
Это решение существует, если ни одна из функций |
fj (X ) |
не являет- |
|||||||
ся линейной комбинацией других базисных функций и количество базисных функций меньше числа наблюдений: p +1< n .
Исходной информацией для алгоритмов и программ, вычисляю- щих коэффициенты линейной регрессии, является матрица значений
базисных функций с элементами fij = f j (xi ) и вектор-столбец зави-
симой переменной yi. Выбор же самих базисных функций зависит от содержания решаемой задачи и определяется исследователем.
Пример 7.2. Измерены 14 значений относительного удлинения автолистовой стали δ (%) в зависимости от продолжительности на- грева в колпаковой печи t (ч). Построить квадратичную регрессион- ную модель зависимости относительного удлинения от продолжи- тельности нагрева, оценить качество модели. Исходные данные – в
ячейках D5:D18 (t, ч) и С5:С18 (δ, %), табл. 7.4.
Решение. Квадратичная модель
δ= b |
+ b t + b t2 |
|
|
0 |
1 |
2 |
|
включает две базисные функции f1(t) = t |
и f2 (t) = t2 . Рассчитаем в |
||
столбце Е значения второй |
базисной |
функции f2 (t) = t2 (см. |
|
табл. 7.4). |
|
|
|
21
|
|
|
|
|
|
|
|
|
|
|
|
|
Таблица 7.4 |
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
B |
C |
D |
|
E |
F |
|
G |
|
H |
|
I |
|
|
|
|
|
|
|
|
|
|
|
|
|
|
Квантиль |
|
|
|
|
|
|
|
|
|
|
|
|
Ранг |
нормаль- |
||
|
|
|
δ |
t |
t2 |
Модель Остаток |
остат- |
ного рас- |
||||||
|
|
|
|
|
|
|
|
|
|
|
ка |
пределе- |
||
4 |
|
|
|
|
|
|
|
|
|
|
|
|
ния |
|
5 |
|
|
23 |
14 |
196 |
23,29 |
-0,29 |
|
3 |
|
-0,893 |
|
||
6 |
|
|
21,5 |
9 |
|
81 |
21,23 |
|
0,27 |
|
10 |
|
0,452 |
|
|
|
|
22,5 |
11 |
121 |
22,64 |
-0,14 |
|
6 |
|
-0,265 |
|
||
7 |
|
|
|
|
|
|||||||||
|
|
|
22,5 |
10 |
|
100 |
22,03 |
|
0,47 |
|
13 |
|
1,194 |
|
8 |
|
|
|
|
|
|
|
|||||||
9 |
|
|
23 |
11 |
121 |
22,64 |
0,36 |
|
11 |
|
0,656 |
|
||
10 |
|
|
23,5 |
14,5 |
|
210,25 |
23,23 |
0,27 |
9 |
0,265 |
|
|||
11 |
|
|
21,5 |
9,5 |
|
90,25 |
21,65 |
-0,15 |
|
5 |
|
-0,452 |
|
|
12 |
|
|
23 |
15 |
225 |
23,12 |
-0,12 |
|
7 |
|
-0,088 |
|
||
|
|
|
23 |
16 |
256 |
22,76 |
0,24 |
|
8 |
|
0,088 |
|
||
13 |
|
|
|
|
|
|||||||||
|
|
|
23 |
13 |
169 |
23,27 |
-0,27 |
|
4 |
|
-0,656 |
|
||
14 |
|
|
|
|
|
|||||||||
15 |
|
|
24 |
13 |
169 |
23,27 |
0,73 |
|
14 |
|
1,680 |
|
||
16 |
|
|
22,5 |
14 |
196 |
23,29 |
-0,79 |
|
2 |
|
-1,194 |
|
||
17 |
|
|
23,5 |
12 |
|
144 |
23,05 |
|
0,45 |
|
12 |
|
0,893 |
|
18 |
|
|
21 |
10 |
100 |
22,03 |
-1,03 |
|
1 |
|
-1,680 |
|
||
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
19 |
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
Среднее 22,679 12,286 |
|
22,679 |
|
0,000 |
|
|
|
|
|
|||
20 |
|
|
|
|
|
|
|
|
||||||
|
|
Станд. |
|
|
|
|
|
|
|
|
|
|
|
|
21 |
|
отклонение |
0,846 |
2,242 |
|
|
0,685 |
|
0,496 |
|
|
|
|
|
22 |
|
Данных |
14 |
|
|
|
|
|
|
|
|
|
|
|
В диапазон ячеек Е5:Е18 запишем формулу “=D5^2”. Далее ана- логично примеру 7.1 рассчитаем: средние значения в ячейках С20:D20 – функцией “=СРЗНАЧ(C5:C18)”, стандартные отклонения в ячейках С21:D21 – функцией “=СТАНДОТКЛОН(C5:C18)”, коли- чество данных в ячейке С22 – функцией “=СЧЁТ(C5:C18)”. Для рас-
чета параметров квадратичной модели снова используем функцию ЛИНЕЙН (табл. 7.5). Выделим диапазон ячеек С25:Е28, вызовем функцию ЛИНЕЙН и заполним поля ее аргументов: «Известные зна- чения у» – С5:С18, «Известные значения х» – D5:Е18, поле «Конст» оставляем незаполненным, в поле «Статистика» записываем 1. Далее вместо «OK» одновременно нажимаем клавиши Ctrl+Shift+Enter. Функция ЛИНЕЙН возвращает: три коэффициента регрессии – в ячейках С25:Е25 (в порядке, обратном порядку столбцов базисных
22
функций), стандартные ошибки коэффициентов регрессии – в ячей- ках С26:Е26, статистические характеристики модели – в ячейках С27:D28 (см. табл. 7.5).
|
|
|
|
|
|
Таблица 7.5 |
|
|
|
|
|
|
|
|
|
|
|
|
B |
C |
D |
E |
|
|
|
|
|
|
|
|
|
|
24 |
|
|
b2 |
b1 |
b0 |
|
|
25 |
|
Коэффициент регрессии |
-0,097 |
2,645 |
5,280 |
|
|
|
|
Стандартная ошибка коэффициента |
|
|
|
|
|
26 |
|
регрессии |
0,0366 |
0,9057 |
5,4675 |
|
|
|
|
R2 и остаточное стандартное отклоне- |
|
|
|
|
|
27 |
|
ние |
0,6562 |
0,53925 |
#Н/Д |
|
|
28 |
|
F и ч.с.с. остаточной дисперсии |
10,4972 |
11 |
#Н/Д |
|
|
29 |
|
|
|
|
|
|
|
|
t-критерий коэффициента регрессии |
|
|
|
|
|
|
30 |
|
-2,6531 |
2,9210 |
0,9658 |
|
|
|
31 |
|
Уровень значимости t-критерия |
0,0225 |
0,0139 |
0,3549 |
|
|
32 |
|
|
|
|
|
|
|
|
|
Множественный коэффициент корре- |
|
|
|
|
|
33 |
|
ляции R |
0,8101 |
|
|
|
|
34 |
|
Ч.с.с. дисперсии модели |
2 |
|
|
|
|
35 |
|
Уровень значимости F-критерия |
0,0028 |
|
|
|
|
36 |
|
|
|
|
|
|
|
|
|
Минимальный стандартизованный ос- |
-2,075 |
|
|
|
|
37 |
|
таток |
|
|
|
|
|
|
|
|
|
|
||
|
|
|
Максимальный стандартизованный |
|
|
|
|
|
38 |
|
остаток |
1,475 |
|
|
|
Далее, как в примере 7.1:
вячейках С30:Е30 – формула “=C25/C26”,
вячейках С31:Е31 – функция “=СТЬЮДРАСП(ABS(C30);$D$28;2)”,
вячейке C33 – функция “=КОРЕНЬ(C27)”,
вячейке C34 – функция “=C22-D28-1”,
вячейке C35 – функция “=FРАСП(C28;C34;D28)”.
Затем в ячейках F5:F18 (см. табл. 7.4) рассчитаем предсказанные квадратичной моделью значения, используя функцию ТЕНДЕНЦИЯ. Выделим ячейки F5:F18, вызовем из списка функций функцию ТЕНДЕНЦИЯ и заполним поля ее аргументов: «Известные значе- ния у» – С5:С18, «Известные значения х» – D5:E18, «Новые значе- ния х» – D5:E18, поле «Конст» оставим незаполненным. Вместо «OK» одновременно нажимаем клавиши Ctrl+Shift+Enter. В ячейках G5:G18 рассчитаем остатки формулой “=C5-F5”, а в ячейках G20 и
23
G21 – среднее и стандартное отклонение остатков. В ячейках Н5:Н18 вычислим ранги остатков функцией “=РАНГ(G5;G$5:G$18;1)” и в ячейках I5:I18 – квантили нормального распределения функцией
“=НОРМОБР((3*H5-1)/(3*$C$22+1);$G$20;$G$21)/$G$21”. Наконец,
в ячейках С37 и С38 (см. табл. 7.5) рассчитаем минимальный и мак-
симальный стандартизованные остатки функциями
“=МИН(G5:G18)/G21” и “=МАКС(G5:G18)/G21” соответственно.
Также построим график зависимости относительного удлинения от продолжительности нагрева вместе с кривой регрессии (рис. 7.4), график зависимости остатков от фактора (рис. 7.5) и нормальный ве- роятностный график остатков (рис. 7.6).
25 |
|
|
|
|
|
|
|
|
|
24 |
|
|
|
|
|
|
|
|
|
23 |
|
|
|
|
|
|
|
|
|
δ |
|
|
|
|
|
|
|
|
|
22 |
|
|
|
|
|
|
|
|
|
21 |
|
|
|
|
|
|
|
|
|
20 |
|
|
|
|
|
|
|
|
|
8 |
9 |
10 |
11 |
12 |
13 |
14 |
15 |
16 |
17 |
|
|
|
|
|
t |
|
|
|
|
Рис. 7.4. Квадратичная модель зависимости относительного |
|||||||||
удлинения от продолжительности нагрева |
|
||||||||
Остатки
1
0,8
0,6
0,4
0,2
0 –0,2 –0,4 –0,6
–0,8 –1
–1,2
8 |
9 |
10 |
11 |
12 |
13 |
14 |
15 |
16 |
17 |
t
Рис. 7.5. Зависимость фактор – остатки квадратичной модели
24
Квантили нормального распределения
2,0 |
|
|
|
|
|
1,5 |
|
|
|
|
|
1,0 |
|
|
|
|
|
0,5 |
|
|
|
|
|
0,0 |
|
|
|
|
|
–0,5 |
|
|
|
|
|
–1,0 |
|
|
|
|
|
–1,5 |
|
|
|
|
|
–2,0 |
|
|
|
|
|
–1,5 |
–1,0 |
–0,5 |
0,0 |
0,5 |
1,0 |
|
|
Остатки |
|
|
|
Рис. 7.6. Нормальный вероятностный график остатков квадратичной модели
Для сравнения рассчитаем также линейную модель зависимости относительного удлинения от продолжительности нагрева
δ= b0 + b1t .
Функции ЛИНЕЙН и ТЕНДЕНЦИЯ воспринимают столбец аргу- ментов, состоящий из одинаковых чисел, как избыточный, и не учи- тывают в расчетах соответствующую базисную функцию. Поэтому для расчета коэффициентов регрессии и статистических характери- стик линейной модели достаточно проставить число 0 вместо значе- ний базисной функции t2 в ячейках Е5:Е18 (табл. 7.6).
|
|
|
|
|
|
|
|
|
Таблица. 7.6 |
||||
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
B |
|
C |
|
D |
|
E |
|
F |
|
|
G |
|
|
|
|
δ |
|
t |
|
t2 |
|
Модель |
|
Остаток |
||
4 |
|
|
|
|
|
|
|||||||
|
|
23 |
14 |
0 |
23,11 |
|
-0,11 |
|
|||||
5 |
|
|
|
||||||||||
6 |
|
21,5 |
9 |
0 |
21,86 |
|
-0,36 |
|
|||||
7 |
|
22,5 |
11 |
0 |
22,36 |
|
0,14 |
|
|||||
… |
|
|
… |
|
… |
|
… |
|
… |
|
… |
||
|
|
22,5 |
14 |
0 |
23,11 |
|
-0,61 |
|
|||||
16 |
|
|
|
||||||||||
|
|
23,5 |
12 |
0 |
22,61 |
|
0,89 |
|
|||||
17 |
|
|
|
||||||||||
|
|
21 |
10 |
0 |
22,11 |
|
-1,11 |
|
|||||
18 |
|
|
|
||||||||||
19 |
|
|
|
|
|
|
|
|
|
|
|
|
|
20 |
Среднее |
22,679 |
12,286 |
|
|
22,679 |
|
0,000 |
|
||||
21 |
Стандартное отклонение |
0,846 |
2,242 |
|
|
0,559 |
|
0,635 |
|
||||
22 |
Данных |
14 |
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
25 |
||
|
|
|
|
|
|
|
Окончание табл. 7.6 |
||
|
|
|
|
|
|
|
|
|
|
|
|
|
B |
C |
D |
E |
F |
G |
|
|
23 |
|
|
|
|
|
|
|
|
|
24 |
|
|
b2 |
b1 |
b0 |
|
|
|
|
25 |
|
Коэффициент регрессии |
0,000 |
0,249 |
19,617 |
|
|
|
|
|
|
Станд. ошибка коэффици- |
|
|
|
|
|
|
|
26 |
|
ента регрессии |
0,0000 |
0,0818 |
1,0202 |
|
|
|
|
|
|
R2 и остаточное станд. |
|
|
|
|
|
|
|
27 |
|
отклонение |
0,4362 |
0,66115 |
#Н/Д |
|
|
|
|
|
|
F и ч.с.с. остаточной |
|
|
|
|
|
|
|
28 |
|
дисперсии |
9,2836 |
12 |
#Н/Д |
|
|
|
|
29 |
|
|
|
|
|
|
|
|
|
|
|
t-критерий коэффициента |
|
|
|
|
|
|
|
30 |
|
регрессии #ДЕЛ/0! |
3,0469 |
19,2294 |
|
|
|
|
|
|
|
Уровень значимости |
|
|
|
|
|
|
|
31 |
|
t-критерия #ДЕЛ/0! |
0,0101 |
0,0000 |
|
|
|
|
|
32 |
|
|
|
|
|
|
|
|
|
|
|
Множественный коэфф. |
|
|
|
|
|
|
|
33 |
|
корреляции R |
0,6604 |
|
|
|
|
|
|
34 |
|
Ч.с.с. дисперсии модели |
1 |
|
|
|
|
|
|
|
|
Уровень значимости |
|
|
|
|
|
|
|
35 |
|
F-критерия |
0,0101 |
|
|
|
|
|
|
36 |
|
|
|
|
|
|
|
|
|
|
|
Мин. стандартизованный |
-1,746 |
|
|
|
|
|
|
37 |
|
остаток |
|
|
|
|
|
|
|
|
|
Макс. стандартизованный |
|
|
|
|
|
|
|
38 |
|
остаток |
1,800 |
|
|
|
|
|
На график зависимости t – δ нанесем прямую регрессии (рис. 7.7). График зависимости остатков от значений фактора (рис. 7.8) и нормальный вероятностный график остатков перестроятся авто- матически.
Анализ результатов. Построена квадратичная модель зависимо- сти относительного удлинения автолистовой стали δ (%) от продол- жительности нагрева в колпаковой печи t (ч):
δ= 5,280 + 2,645t - 0,097t2 .
Коэффициент корреляции между наблюдаемыми и предсказанными
значениями |
R = 0,810 . Модель описывает зависимость |
значимо |
||
лучше, чем |
|
|
|
= 2,65 и |
среднее δ. Коэффициенты регрессии b1 |
||||
b2 = -0,097 |
значимо отличаются от нуля. (Мы не будем содержа- |
|||
тельно интерпретировать коэффициент b0 – величину относительного
26
удлинения при нулевой продолжительности нагрева – и оценивать значимость его отличия от нуля.) Регулярные отклонения наблюде- ний от квадратичной модели отсутствуют. Зависимость остатков от значений фактора – случайная; видимые закономерности отсутству- ют. Максимальные и минимальные значения остатков не являются выбросами. Точки на нормальном вероятностном графике остатков не отклоняются систематически от прямой. Гипотеза нормального распределения остатков не отвергается, метод наименьших квадра- тов применен корректно.
25 |
|
|
|
|
|
|
|
|
|
24 |
|
|
|
|
|
|
|
|
|
23 |
|
|
|
|
|
|
|
|
|
δ |
|
|
|
|
|
|
|
|
|
22 |
|
|
|
|
|
|
|
|
|
21 |
|
|
|
|
|
|
|
|
|
20 |
|
|
|
|
|
|
|
|
|
8 |
9 |
10 |
11 |
12 |
13 |
14 |
15 |
16 |
17 |
|
|
|
|
|
t |
|
|
|
|
Рис. 7.7. Линейная модель зависимости относительного удлинения |
|||||||||
|
|
от продолжительности нагрева |
|
|
|
||||
Остатки
1,5
1
0,5
0
–0,5
–1
–1,5
8 |
9 |
10 |
11 |
12 |
13 |
14 |
15 |
16 |
17 |
|
|
|
|
|
t |
|
|
|
|
Рис. 7.8. Зависимость фактор – остатки линейной модели
27
Дополнительно сравним линейную и квадратичную модели. По
величинам |
остаточных |
стандартных |
отклонений линейной |
(se = 0,661) |
и квадратичной (se = 0,539) моделей и значениям мно- |
||
жественных |
коэффициентов корреляции |
линейной (R = 0,66) и |
|
квадратичной ( R = 0,81) |
моделей квадратичная модель описывает |
||
наблюдения лучше линейной. Этот вывод подтверждает и сравнение графиков зависимостей рис. 7.4 с рис. 7.7 и графиков остатков рис. 7.5 с рис. 7.8. Хотя коэффициент регрессии линейной модели b1 = 0,249 значимо отличается от нуля, на графике зависимости t – δ с нанесенной на него прямой регрессии (см. рис. 7.7) заметно систе- матическое отклонение наблюдений от модели. Еще более это от- клонение заметно на графике остатков (см. рис. 7.8).
Отношение остаточных дисперсий двух моделей
se2 (линейнаямодель)
F = se2 (квадратичнаямодель) =1,503.
Уровень значимости (т.е. риск ошибочного отклонения гипотезы о
равенстве истинных остаточных дисперсий линейной и квадратичной моделей) этого (одностороннего) F-критерия α(F) = 0,254 . Это вы-
сокий риск, поэтому нельзя утверждать, что квадратичная модель описывает наблюдения значимо лучше, чем линейная.
В такой ситуации исследователь, стоящий перед необходимостью выбора, может предпочесть квадратичную модель, как модель с мень- шим остаточным стандартным отклонением se и отсутствием система- тических отклонений наблюдений от модели. Аргументом в пользу ли- нейной модели может служить бóльшая ее простота и понятность по сравнению с квадратичной (Экстремальная зависимость нуждается в содержательном объяснении.) Если целью исследования не являлось
сравнение двух альтернативных независимых гипотез о линейной и квадратичной зависимостях, дополнительно можно привлечь знания из предметной области, которые подтверждают (или не подтверждают) экстремальную зависимость относительного удлинения от продолжи- тельности нагрева. Если окончательный выбор делать не нужно, то наи- лучшее решение – увеличение числа наблюдений и повторение регрес- сионного анализа с новой совокупностью данных.
7.3. Регрессия двумя функциями
Известны случаи, когда в разных интервалах изменения фактора действуют разные механизмы его влияния на свойство. Поэтому за-
28
висимость свойства Y от фактора Х описывается в этих интервалах разными функциями (рис. 7.9). Значение фактора, при котором одна функция сменяется другой, точно не известно. В этом случае задача регрессионного анализа – определить параметры каждой из функций и граничное значение фактора.
65
60 


55
50
у
45
40
35
30
0 |
5 |
10 |
х |
15 |
20 |
25 |
|
|
|
|
|
|
Рис. 7.9. Различные зависимости в разных интервалах изменения фактора
Рассмотрим случай, когда обе зависимости предполагаются ли- нейными. Упорядочим имеющиеся n пар наблюдений xi, yi по возрас- танию фактора xi. Разделим упорядоченные данные на две группы. Проведем регрессию первых k наблюдений линейной зависимостью
Y= a1 + b1 X ,
аоставшихся n- k наблюдений – зависимостью
Y = a2 + b2 X .
Рассчитаем остаточную дисперсию (6.4) первой линейной модели se21 и остаточную дисперсию второй модели se22 . Далее рассчитаем
сводную дисперсию
s2 = |
(k - 2)s2 |
+ (n- k |
- 2)s2 |
|
|
e1 |
|
e2 |
. |
(7.7) |
|
|
n- 4 |
|
|||
e |
|
|
|
|
|
|
|
|
|
|
|
Сводная дисперсия – |
это остаточная дисперсия регрессии двумя |
||||
линейными функциями, первая из которых построена по первым k наблюдениям, а вторая – по оставшимся n- k наблюдениям. Число ее степеней свободы ν= n- 4 .
29
Наилучшая модель регрессии двумя прямыми (аппроксимация ломаной) получается при наименьшем значении сводной остаточной дисперсии se2 (7.7). Для нахождения минимума будем последова- тельно менять число наблюдений в первой группе k от 3 до n- 3 , каждый раз рассчитывая сводную остаточную дисперсию se2 . Выбе- рем значение k, при котором дисперсия se2 минимальна. При таком числе наблюдений в первой группе регрессия двумя прямыми наи- лучшая. Координата точки пересечения двух прямых
x |
= |
a2 - a1 |
, |
(7.8) |
|
|
|||||
c |
|
b |
- b |
|
|
|
1 |
2 |
|
|
|
где а1, b1, а2, b2 – коэффициенты регрессии линейных моделей при выбранном k. Координата хс точечная оценка значения фактора, при котором происходит смена зависимостей.
Дополнительно убедимся, что аппроксимация ломаной лучше, чем единая линейная модель. Рассчитаем по (6.4) остаточную дис- персию единой линейной модели se2 line с числом степеней свободы νline = n- 2 и F-критерий отношения дисперсий
F = se2 line ,
se2
где в знаменателе дисперсия ломаной se2 (7.7) с ч.с.с. ν= n −4 . Если уровень значимости этого критерия α(F) низкий (например, меньше 0,05), то регрессия двумя прямыми значимо лучше единой линейной модели.
Пример 7.3. Имеется 24 наблюдения независимой переменной х и зависимой переменной у (см. рис. 7.9). Построить регрессионную модель двумя линейными функциями, оценить граничное значение фактора, сравнить регрессию двумя прямыми с единой линейной регрессионной моделью. Данные:
х: 0,55; 1,72; 3,08; 3,87; 5,29; 5,71; 7,19; 7,82; 8,63; 9,68; 11,44; 11,66; 12,96; 14,15; 15,10; 15,79; 17,31; 17,89; 19,16; 19,56; 20,80; 22,08; 23,30; 23,99,
у: 59,91; 59,75; 56,46; 57,77; 54,70; 58,85; 56,53; 58,34; 58,42; 55,40; 54,05; 56,35; 55,40; 52,95; 50,48; 51,53; 47,64; 47,68; 44,09; 40,01;
39,96; 38,40; 38,07; 32,18.
Решение. Поместим наблюдения, упорядоченные по возрастанию значений независимой переменной в ячейках С5:С28 и D5:D28 (табл. 7.7). В ячейках В5:В28 проставим последовательные номера наблюдений.
30
