Анализ данных в материаловедении. Часть 2. Регрессионный анализ. Учебное пособие
.pdf
|
|
|
|
|
|
|
|
Таблица 7.7 |
|
|
|
|
|
|
|
|
|
|
|
|
A |
B |
C |
D |
E |
F |
G |
H |
|
|
|
|
|
|
|
|
|
Последняя |
|
|
|
|
x |
y |
se12 |
se22 |
se2 |
точка пер- |
|
4 |
|
|
|
|
|
|
|
вой модели |
|
5 |
|
1 |
0,55 |
59,91 |
|
|
|
|
|
6 |
|
2 |
1,72 |
59,75 |
|
|
|
|
|
7 |
|
3 |
3,08 |
56,46 |
1,379 |
9,433 |
9,030 |
0 |
|
8 |
|
4 |
3,87 |
57,77 |
1,409 |
8,673 |
7,947 |
0 |
|
… |
… |
… |
… |
… |
… |
… |
… |
… |
|
15 |
|
11 |
11,44 |
54,05 |
2,714 |
2,493 |
2,592 |
0 |
|
16 |
|
12 |
11,66 |
56,35 |
2,541 |
2,507 |
2,524 |
0 |
|
17 |
|
13 |
12,96 |
55,40 |
2,317 |
2,776 |
2,523 |
13 |
|
18 |
|
14 |
14,15 |
52,95 |
2,333 |
3,082 |
2,633 |
0 |
|
19 |
|
15 |
15,10 |
50,48 |
2,854 |
3,187 |
2,971 |
0 |
|
… |
… |
… |
… |
… |
… |
… |
… |
… |
|
24 |
|
20 |
19,56 |
40,01 |
7,266 |
5,427 |
7,082 |
0 |
|
25 |
|
21 |
20,80 |
39,96 |
8,245 |
8,719 |
8,268 |
0 |
|
26 |
|
22 |
22,08 |
38,40 |
|
|
|
|
|
27 |
|
23 |
23,30 |
38,07 |
|
|
|
|
|
28 |
|
24 |
23,99 |
32,18 |
|
|
|
|
|
29 |
|
|
|
|
|
|
|
|
|
30 |
Среднее |
|
12,446 |
51,038 |
|
|
|
|
|
|
Станд. от- |
|
|
|
|
|
|
|
|
31 |
клонение |
|
7,136 |
8,131 |
|
|
|
|
|
В столбце Е в строках 7–25 рассчитаем остаточную дисперсию пер- вой линейной модели se21 с числом наблюдений k, записанным в строке столбца В. Для расчета используем функцию СТОШYX, вычисляющую остаточное стандартное отклонение линейной модели: Е7:Е25 – “=(СТОШYX($D$5:D7;$C$5:C7))^2”. В столбце F аналогичным обра-
зом рассчитаем остаточную дисперсию второй модели se22 с числом на-
блюдений 24 − k : F7:F25 – “=(СТОШYX(D8:$D$28;C8:$C$28))^2”.
В ячейках G7:G25 вычислим сводную остаточную дисперсию se2 (7.7) – “=(B5*E7+($B$28-B9)*F7)/($B$28-4)”. В ячейках Н7:Н25 запишем формулу, которая возвращает номер последнего наблюдения первой модели в строке, где достигается минимум сводной остаточной диспер- сии, и ноль в остальных строках – “=B7*(G7=МИН($G$7:$G$25))”.
Это же число – число наблюдений в первой группе, при котором регрессия двумя прямыми наилучшая, – запишем в ячейке В33 формулой “=СУММ(H8:H25)” (табл. 7.8). В ячейках В36 и С36 рассчитаем коэффициенты регрессии а1 и b1 первой модели, используя функции ОТРЕЗОК и НАКЛОН: В36 – “=ОТРЕЗОК(D5:СМЕЩ(D4;B33;0;1;1);C5:СМЕЩ(C4;B33;0;1;1))”, С36 –
31
“=НАКЛОН(D5:СМЕЩ(D4;B33;0;1;1);C5:СМЕЩ(C4;B33;0;1;1))”.
В ячейках В37 |
и С37 |
аналогичным образом рассчитаем |
коэффициенты |
регрессии а2 |
и b2 второй модели: В37 – |
“=ОТРЕЗОК(СМЕЩ(D4;B33+1;0;1;1):D28;СМЕЩ(C4;B33+1;0;1;1):C28)”, С37 –
“=НАКЛОН(СМЕЩ(D4;B33+1;0;1;1):D28;СМЕЩ(C4;B33+1;0;1;1):C28)”.
Функция смещения СМЕЩ использована здесь для вычисления коэффи- циентов регрессии единственной наилучшей модели. В ячейке В40 рас- считаем координату х точки пересечения двух прямых (7.8) формулой “=(C37-C36)/(D36-D37)”, а в ячейке С40 – координату у этой точки –
“=C36+D36*C40”.
Далее в ячейках I5:I28 |
(табл. 7.9) рассчитаем предсказанные |
||||
моделью значения. Вычисления проведем, |
используя |
единую |
|||
для |
всего |
интервала |
изменения |
фактора |
формулу |
“=($B$36+$C$36*C5)*(B5<=$B$33)+($B$37+$C$37*C5)*(B5>$B$33)”.
Затем, как и в предыдущих примерах, в диапазоне ячеек J5:J28 вы- числим остатки формулой “=D5-I5”, а в ячейках J30 и J31 – среднее и стандартное отклонение остатков функциями “=СРЗНАЧ(J5:J28)” и “=СТАНДОТКЛОН(J5:J28)” соответственно. Затем в ячейках K5:K28 функцией “=РАНГ(J5;J$5:J$28;1)” рассчитаем ранги остатков и в ячейках L5:L28 рассчитаем квантили нормального распределения функцией “=НОРМОБР((3*K5-1)/(3*$B$28+1);$J$30;$J$31)/$J$31”.
|
|
|
|
|
|
|
|
|
|
|
|
|
Таблица 7.8 |
||
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
А |
|
|
В |
|
|
С |
|
||||
|
33 |
|
|
|
Данных в первой группе |
|
13 |
|
|
|
|
|
|||
|
34 |
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
35 |
|
|
|
Коэффициенты регрессии |
|
|
a |
|
|
b |
||||
|
36 |
|
|
|
первая прямая |
59,235 |
-0,314 |
|
|
||||||
|
37 |
|
|
|
вторая прямая |
81,086 |
-1,956 |
|
|
||||||
|
38 |
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
39 |
|
|
|
Точка пересечения |
|
|
х |
|
|
у |
||||
|
40 |
|
|
|
|
|
13,311 |
|
55,055 |
|
|
||||
|
41 |
|
|
|
Множеств. коэфф. корр. R |
|
|
|
|
|
|
|
|
|
|
|
42 |
|
|
|
0,983 |
|
|
|
|
|
|||||
|
43 |
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
44 |
|
|
|
Мин. станд. остаток |
-1,942 |
|
|
|
|
|
|
|||
|
45 |
|
|
|
Макс. станд. остаток |
1,724 |
|
|
|
|
|
||||
|
46 |
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
47 |
|
|
|
Остаточная дисперсия |
|
|
|
|
|
|
|
|
|
|
|
48 |
|
|
|
прямой |
11,024 |
|
|
|
|
|
||||
|
49 |
|
|
|
ломаной |
2,523 |
|
|
|
|
|
||||
50 |
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
51 |
|
|
|
F-критерий |
4,369 |
|
|
|
|
|
||||
|
52 |
|
|
|
Риск α(F) |
0,00078 |
|
|
|
|
|
|
|||
32
|
|
|
|
|
|
|
|
|
|
|
|
|
Таблица 7.9 |
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
I |
|
|
J |
|
|
K |
|
|
L |
|
|
|
|
|
Модель |
|
Остаток |
|
Ранг |
|
Квантиль нормаль- |
||||
|
4 |
|
|
|
|
остатка |
|
ного распределения |
||||||
|
|
|
|
|
|
|
|
|
|
|||||
|
|
59,062 |
|
0,852 |
|
17 |
|
0,482 |
|
|||||
|
5 |
|
|
|
|
|
||||||||
|
6 |
|
58,694 |
|
1,055 |
|
18 |
|
0,601 |
|
||||
|
7 |
|
58,269 |
-1,810 |
|
4 |
|
-1,034 |
|
|||||
|
… |
|
|
… |
|
… |
|
… |
|
… |
||||
|
|
|
37,906 |
0,489 |
|
15 |
0,260 |
|
||||||
|
26 |
|
|
|
||||||||||
|
|
35,511 |
2,554 |
|
24 |
1,921 |
|
|||||||
|
27 |
|
|
|
||||||||||
|
|
34,177 |
-2,001 |
|
3 |
|
-1,229 |
|
||||||
|
28 |
|
|
|
|
|||||||||
|
29 |
|
|
|
|
|
|
|
|
|
|
|
|
|
|
30 |
|
51,038 |
0,000 |
|
|
|
|
|
|
|
|||
|
31 |
|
7,995 |
1,481 |
|
|
|
|
|
|
|
|||
В ячейке В42 (см. табл. 7.8) рассчитаем множественный
коэффициент корреляции как коэффициент корреляции между наблюдаемыми и предсказанными значениями функцией “=КОРРЕЛ(D5:D28;I5:I28)”. В ячейках В44 и В45 вычислим мини-
мальный и максимальный стандартизованные остатки функциями
“=МИН(J5:J28)/J31” и “=МАКС(J5:J28)/J31”. Для сравнения остаточ-
ных дисперсий единой линейной модели и модели регрессии двумя прямыми в ячейке В48 вычислим остаточную дисперсию единой ли- нейной модели функцией “=(СТОШYX(D5:D28;C5:C28))^2”, а в ячей- ке В49 остаточную дисперсию аппроксимации ломаной – “=МИН($G$7:$G$25)”. В ячейке В51 рассчитаем F-критерий – отно- шение остаточных дисперсий – “=B48/B49” и в ячейке В52 – уровень значимости α(F) этого критерия – “=FРАСП(B51;B28-2;B28-4)”.
Также построим точечный график наблюдаемых значений с до- бавленными линиями регрессии (рис. 7.10), график зависимости ос- татков от фактора (рис. 7.11) и нормальный вероятностный график остатков (рис. 7.12).
Анализ результатов. Получены линейные регрессионные моде- ли, связывающие зависимую и независимую переменные
Y = 59,235- 0,324X ,
если x £13,311, и
Y = 81,086-1,956X ,
если x>13,311.
33
65 |
|
|
|
|
|
60 |
|
|
|
|
|
55 |
|
|
|
|
|
50 |
|
|
|
|
|
y |
|
|
|
|
|
45 |
|
|
|
|
|
40 |
|
|
|
|
|
35 |
|
|
|
|
|
30 |
|
|
|
|
|
0 |
5 |
10 |
15 |
20 |
25 |
|
|
|
х |
|
|
Рис. 7.10. Регрессия двумя линейными моделями в разных интервалах |
|||||
|
|
изменения фактора |
|
|
|
Остатки
3
2
1
0
–1
–2
–3
–4
0 |
5 |
10 |
х |
15 |
20 |
25 |
|
|
|
|
|
|
Рис. 7.11. Остатки в зависимости от значений фактора
34
|
|
2,5 |
|
|
|
|
|
|
|
Квантили нормального |
|
2,0 |
|
|
|
|
|
|
|
распределения |
1,5 |
|
|
|
|
|
|
|
|
1,0 |
|
|
|
|
|
|
|
||
0,5 |
|
|
|
|
|
|
|
||
0,0 |
|
|
|
|
|
|
|
||
–0,5 |
|
|
|
|
|
|
|
||
|
|
|
|
|
|
|
|
||
|
|
–1,0 |
|
|
|
|
|
|
|
|
|
–1,5 |
|
|
|
|
|
|
|
|
|
–2,0 |
|
|
|
|
|
|
|
|
|
–4 |
–3 |
–2 |
–1 |
0 |
1 |
2 |
3 |
|
|
|
|
|
Остатки |
|
|
|
|
|
Рис. 7.12. Нормальный вероятностный график остатков |
|
|||||||
Рассчитана точечная оценка граничного значения фактора xc =13,311, при котором происходит смена зависимостей.
Регрессия двумя прямыми значимо лучше единой линейной моде- ли. Среди остатков отсутствуют выбросы. Остатки в зависимости от фактора изменяются случайно. Точки на нормальном вероятностном графике остатков не отклоняются систематически от прямой. Метод наименьших квадратов применен корректно.
Задание для самостоятельной работы
Используя шаблон примера 7.2, построить единую квадратичную модель зависимости свойства Y от фактора X. Рассчитать F-критерий
F = se2квадр . Сделать вывод о значимости различия квадратичной мо- se2
дели и регрессии двумя прямыми.
35
8. ОРТОГОНАЛЬНЫЕ БАЗИСНЫЕ ФУНКЦИИ
8.1. Регрессия ортогональными базисными функциями
Не всегда заранее известно, какой именно моделью описывается зависимость свойства Y от фактора X. В этом случае для построения регрессионной модели используется система базисных функций. Первоначально выбирается простейшая модель, включающая одну первую базисную функцию. Если модель отклоняется от наблюде- ний, то в модель добавляется вторая базисная функция, затем третья, четвертая и т.д. Процедура последовательного усложнения продол- жается до построения наилучшей модели. Критерием наилучшей мо-
дели служит минимум остаточной дисперсии se2 . При этом в модели
не должно быть базисных функций с высоким уровнем значимости t- критериев коэффициентов регрессии. Они вносят малый вклад в мо- дель (из-за близости к нулю их коэффициентов регрессии), но ос- ложняют содержательный анализ модели.
Такой подход использовался в примере 7.2, где рассчитывались линейная и квадратичная модели зависимости относительного удли- нения от времени нагрева:
δ= 19,617 + 0,249t ,
δ=5,28+2,65t −0,097t2 .
Из сравнения моделей видно, что коэффициенты b0 в линейной и квадратичной моделях разные; различаются также и коэффициенты b1 этих моделей. Если из последней модели исключить базисную функцию t, то получим модель
δ= 21,198+ 0,01t2 ,
коэффициенты b0 и b2 которой тоже не совпадают с аналогичными коэффициентами предыдущей модели. В выбранной системе степен- ных базисных функций коэффициенты регрессии изменяются, если изменяется сама модель. Это создает неудобства при анализе модели и оценке значимости коэффициентов регрессии, т.е. оценке вклада в модель соответствующих базисных функций.
36
Можно избежать зависимости коэффициентов регрессии от вида модели, если использовать систему ортогональных базисных функ- ций. Базисная функция fj (X ) ортогональна базисной функции fk (X ) на множестве наблюдений xi, y, (i =1, 2, ..., n ), если
n
å fij fik = 0 , i=1
где fij – значение j-й базисной функции при i-м значении фактора: fij = f j (xi ) . В системе ортогональных базисных функций любая
n
сумма å fij fik = 0 , если j ¹ k . Тогда в матрице коэффициентов
i=1
левой части системы уравнений (7.5) все недиагональные элементы равны нулю, и выражения для коэффициентов регрессии упрощают-
ся до
|
|
n |
|
|
|
|
|
å |
fij |
|
|
|
|
yi |
|
||
b |
= |
i=1 |
|
. |
(8.1) |
n |
|
||||
j |
|
|
|
|
|
|
|
å |
|
|
|
|
|
f 2 |
|
||
|
|
|
ij |
|
|
i=1
Коэффициент регрессии bj (8.1) рассчитывается по значениям соб- ственной базисной функции fij и не изменяется, если в модель вво-
дятся или из модели исключаются другие ортогональные базисные функции. Новая ортогональная базисная функция дополняет пре- дыдущую регрессионную модель, не изменяя самой предыдущей модели.
Стандартная ошибка коэффициента регрессии
sbj = |
s2 |
|
|
e |
|
(8.2) |
|
n |
|
||
|
å |
f 2 |
|
|
|
ij |
|
i=1
зависит только от остаточной дисперсии se2 и значений собственной
базисной функции. Эта ошибка минимальна в модели, остаточная дисперсия которой наименьшая.
37
8.2.Ортогональные полиномы
Впрактике регрессионного анализа часто предполагается, что свойство Y зависит от фактора Х по полиномиальному закону
Y = b + b X + b X 2 |
+ ... + b |
X p , |
(8.3) |
|
0 1 |
2 |
p |
|
|
но степень полинома р заранее неизвестна и должна определяться в процессе расчета и сравнения моделей. В этом случае вместо уравне- ния регрессии (8.3) удобнее воспользоваться моделью
Y = u0Q0 (X ) + u1Q1(X ) + u2Q2 (X ) + ... + upQp (X ), |
(8.4) |
где Q0 (X ), Q1(X ), ..., Qp (X ) – взаимно ортогональные полиномы на множестве значений фактора xi (i =1, 2, ..., n ), а u0 , u1, ..., up – опре-
деляемые коэффициенты регрессии. Ортогональный полином степе- ни р – это полином вида
Q |
(X ) = a( p) + a( p) X + a( p) X 2 |
+ ... + a( p) |
X p-1 |
+ X p . |
(8.5) |
|
p |
0 1 |
2 |
p-1 |
|
|
|
Полином нулевой степени Q0 (X ) º1.
Коэффициенты a0( p), a1( p), ..., a(pp-)1 полинома (8.5) вычисляются из
условия его ортогональности всем предыдущим полиномам
n |
|
|
å |
= 0 , |
(8.6) |
qijqip |
i=1
где qij = Qj (xi ) и j = 0, 1, ..., p-1. Например, для полинома первой
степени
Q1(X ) = a0(1) + X
из условия (8.6) получим (учитывая, что qi0 =1 для всех i)
n |
|
|
n |
|
|
å |
a(1) |
+ |
å |
x |
= 0 , |
|
0 |
|
|
i |
|
i=1 |
|
|
i=1 |
|
|
откуда
n
a0(1) = - 1 å xi = -x
n i=1
38
и полином первой степени Q1(X ) = X - x . Попутно заметим, что
линейная модель (7.4) – это еще и уравнение регрессии в форме ор- тогональных полиномов нулевой и первой степеней. Для расчета ко-
эффициентов |
a0(2) |
и |
a1(2) |
полинома |
второй |
степени |
Q2 (X ) = a0(2) + a1(2) X + X 2 |
необходимо решить систему двух линей- |
|||||
ных уравнений, но на практике в этом нет необходимости, так как
ортогональные полиномы связаны соотношением
Qk+1(X ) = (X + g)Qk (X ) + hQk-1(X ) , |
(8.7) |
|||||||||
где |
|
|
|
|
|
|
|
|
|
|
|
n |
|
|
|
|
n |
|
|
|
|
å |
x q |
2 |
|
|
å |
q2 |
|
|||
|
|
i ik |
|
|
ik |
|
||||
g = - |
i=1 |
|
|
, |
h = - |
i=1 |
. |
(8.8) |
||
n |
|
|
|
|||||||
|
|
|
|
|
n |
|
|
|
|
|
|
åqik2 |
|
|
|
åqik2 |
-1 |
|
|
||
|
i=1 |
|
|
|
|
i=1 |
|
|
|
|
Соотношение (8.7) позволяет рассчитать значения нового поли- нома qik+1 = Qk+1(xi ) через значения двух предыдущих полиномов qik и qik-1 без вычисления коэффициентов a(jk+1) нового полинома.
Оно же позволяет вычислить и сами коэффициенты нового полинома через коэффициенты двух предыдущих:
a(jk+1) = ga(jk) + a(j-k)1 + ha(jk-1) , |
(8.9) |
где j = 0, 1, ..., k +1, а несуществующие коэффициенты полагаются
равными нулю.
После расчета по (8.1) коэффициентов регрессии u0 , u1, ..., up мо- дели (8.4) можно также вычислить и коэффициенты bj полинома
(8.3):
b |
= u |
a( j) + u a( j+1) |
+ ... + u |
a( p) , |
(8.10) |
j |
0 |
j 1 j |
j |
j |
|
где j = 0, 1, ..., p . Если ни один из ортогональных полиномов Qk (X )
не исключался из модели (8.4), то уравнения (8.3) и (8.4) – две раз- ные формы одного и того же уравнения регрессии. Поэтому коэффи- циенты регрессии bj, вычисленные непосредственно (как в приме- рах 7.1, 7.2) и рассчитанные по (8.10), совпадут.
39
Пример 8.1. Провести регрессию ортогональными полиномами данных примера 7.2. Выбрать наилучшую модель.
Решение. Поместим исходные данные в порядке возрастания зна- чений времени нагрева t в ячейках С5:С18 и D5:D18 (табл. 8.1). (Упорядочение по возрастанию необходимо только для построения линии регрессии на графике.) В ячейках С20:D20 – средние значения независимой и зависимой переменных: “=СРЗНАЧ(C5:C18)”, в ячей- ках C21:D21 – их стандартные отклонения
“=СТАНДОТКЛОН(C5:C18)”.
|
|
|
|
|
|
Таблица 8.1 |
|
|
|
|
|
|
|
|
A |
B |
C |
D |
E |
F |
3 |
|
|
Данные |
Модель |
|
|
4 |
|
|
t |
δ |
0 |
1 |
|
|
|
|
|
|
|
5 |
21,860 |
|
9 |
21,5 |
22,68 |
21,860 |
6 |
21,984 |
|
9,5 |
21,5 |
22,68 |
21,984 |
7 |
22,109 |
|
10 |
22,5 |
22,68 |
22,109 |
8 |
22,109 |
|
10 |
21 |
22,68 |
22,109 |
9 |
22,358 |
|
11 |
22,5 |
22,68 |
22,358 |
10 |
22,358 |
|
11 |
23 |
22,68 |
22,358 |
11 |
22,607 |
|
12 |
23,5 |
22,68 |
22,607 |
12 |
22,857 |
|
13 |
23 |
22,68 |
22,857 |
13 |
22,857 |
|
13 |
24 |
22,68 |
22,857 |
14 |
23,106 |
|
14 |
23 |
22,68 |
23,106 |
15 |
23,106 |
|
14 |
22,5 |
22,68 |
23,106 |
16 |
23,230 |
|
14,5 |
23,5 |
22,68 |
23,230 |
17 |
23,355 |
|
15 |
23 |
22,68 |
23,355 |
18 |
23,604 |
|
16 |
23 |
22,68 |
23,604 |
19 |
|
|
|
|
|
|
20 |
|
Среднее |
12,286 |
22,679 |
|
|
21 |
|
Стандартное |
|
|
|
|
|
|
отклонение |
2,242 |
0,846 |
|
|
Соотношение (8.7) позволяет организовать вычисления таким об- разом, чтобы расчеты полиномов второй и более высоких степеней проводились без записи в ячейки новых формул, а только копирова- нием формул из соседнего столбца. В столбце Е будем проводить все расчеты, связанные с полиномом нулевой степени Q0 (X ) , в столбце F – с полиномом первой степени Q1(X ) , в столбце G – с полиномом второй степени Q2 (X ) и т.д. В строке 4, начиная со столбца Е, запи- шем степень модели (она же степень старшего ортогонального поли- нома): «0» в ячейке Е4 и формула “=E4+1” в ячейке F4.
40
