Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Анализ данных в материаловедении. Часть 2. Регрессионный анализ. Учебное пособие

.pdf
Скачиваний:
0
Добавлен:
12.08.2026
Размер:
1 Мб
Скачать

 

 

 

 

 

 

 

 

Таблица 7.7

 

 

 

 

 

 

 

 

 

 

 

A

B

C

D

E

F

G

H

 

 

 

 

 

 

 

 

 

Последняя

 

 

 

 

x

y

se12

se22

se2

точка пер-

4

 

 

 

 

 

 

 

вой модели

5

 

1

0,55

59,91

 

 

 

 

 

6

 

2

1,72

59,75

 

 

 

 

 

7

 

3

3,08

56,46

1,379

9,433

9,030

0

 

8

 

4

3,87

57,77

1,409

8,673

7,947

0

 

15

 

11

11,44

54,05

2,714

2,493

2,592

0

 

16

 

12

11,66

56,35

2,541

2,507

2,524

0

 

17

 

13

12,96

55,40

2,317

2,776

2,523

13

 

18

 

14

14,15

52,95

2,333

3,082

2,633

0

 

19

 

15

15,10

50,48

2,854

3,187

2,971

0

 

24

 

20

19,56

40,01

7,266

5,427

7,082

0

 

25

 

21

20,80

39,96

8,245

8,719

8,268

0

 

26

 

22

22,08

38,40

 

 

 

 

 

27

 

23

23,30

38,07

 

 

 

 

 

28

 

24

23,99

32,18

 

 

 

 

 

29

 

 

 

 

 

 

 

 

 

30

Среднее

 

12,446

51,038

 

 

 

 

 

 

Станд. от-

 

 

 

 

 

 

 

 

31

клонение

 

7,136

8,131

 

 

 

 

 

В столбце Е в строках 7–25 рассчитаем остаточную дисперсию пер- вой линейной модели se21 с числом наблюдений k, записанным в строке столбца В. Для расчета используем функцию СТОШYX, вычисляющую остаточное стандартное отклонение линейной модели: Е7:Е25 – “=(СТОШYX($D$5:D7;$C$5:C7))^2”. В столбце F аналогичным обра-

зом рассчитаем остаточную дисперсию второй модели se22 с числом на-

блюдений 24 k : F7:F25 – “=(СТОШYX(D8:$D$28;C8:$C$28))^2”.

В ячейках G7:G25 вычислим сводную остаточную дисперсию se2 (7.7) – “=(B5*E7+($B$28-B9)*F7)/($B$28-4)”. В ячейках Н7:Н25 запишем формулу, которая возвращает номер последнего наблюдения первой модели в строке, где достигается минимум сводной остаточной диспер- сии, и ноль в остальных строках – “=B7*(G7=МИН($G$7:$G$25))”.

Это же число число наблюдений в первой группе, при котором регрессия двумя прямыми наилучшая, – запишем в ячейке В33 формулой “=СУММ(H8:H25)” (табл. 7.8). В ячейках В36 и С36 рассчитаем коэффициенты регрессии а1 и b1 первой модели, используя функции ОТРЕЗОК и НАКЛОН: В36 – “=ОТРЕЗОК(D5:СМЕЩ(D4;B33;0;1;1);C5:СМЕЩ(C4;B33;0;1;1))”, С36 –

31

“=НАКЛОН(D5:СМЕЩ(D4;B33;0;1;1);C5:СМЕЩ(C4;B33;0;1;1))”.

В ячейках В37

и С37

аналогичным образом рассчитаем

коэффициенты

регрессии а2

и b2 второй модели: В37 –

“=ОТРЕЗОК(СМЕЩ(D4;B33+1;0;1;1):D28;СМЕЩ(C4;B33+1;0;1;1):C28)”, С37 –

“=НАКЛОН(СМЕЩ(D4;B33+1;0;1;1):D28;СМЕЩ(C4;B33+1;0;1;1):C28)”.

Функция смещения СМЕЩ использована здесь для вычисления коэффи- циентов регрессии единственной наилучшей модели. В ячейке В40 рас- считаем координату х точки пересечения двух прямых (7.8) формулой “=(C37-C36)/(D36-D37)”, а в ячейке С40 – координату у этой точки

“=C36+D36*C40”.

Далее в ячейках I5:I28

(табл. 7.9) рассчитаем предсказанные

моделью значения. Вычисления проведем,

используя

единую

для

всего

интервала

изменения

фактора

формулу

“=($B$36+$C$36*C5)*(B5<=$B$33)+($B$37+$C$37*C5)*(B5>$B$33)”.

Затем, как и в предыдущих примерах, в диапазоне ячеек J5:J28 вы- числим остатки формулой “=D5-I5”, а в ячейках J30 и J31 – среднее и стандартное отклонение остатков функциями “=СРЗНАЧ(J5:J28)” и “=СТАНДОТКЛОН(J5:J28)” соответственно. Затем в ячейках K5:K28 функцией “=РАНГ(J5;J$5:J$28;1)” рассчитаем ранги остатков и в ячейках L5:L28 рассчитаем квантили нормального распределения функцией “=НОРМОБР((3*K5-1)/(3*$B$28+1);$J$30;$J$31)/$J$31”.

 

 

 

 

 

 

 

 

 

 

 

 

 

Таблица 7.8

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

А

 

 

В

 

 

С

 

 

33

 

 

 

Данных в первой группе

 

13

 

 

 

 

 

 

34

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

35

 

 

 

Коэффициенты регрессии

 

 

a

 

 

b

 

36

 

 

 

первая прямая

59,235

-0,314

 

 

 

37

 

 

 

вторая прямая

81,086

-1,956

 

 

 

38

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

39

 

 

 

Точка пересечения

 

 

х

 

 

у

 

40

 

 

 

 

 

13,311

 

55,055

 

 

 

41

 

 

 

Множеств. коэфф. корр. R

 

 

 

 

 

 

 

 

 

 

42

 

 

 

0,983

 

 

 

 

 

 

43

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

44

 

 

 

Мин. станд. остаток

-1,942

 

 

 

 

 

 

 

45

 

 

 

Макс. станд. остаток

1,724

 

 

 

 

 

 

46

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

47

 

 

 

Остаточная дисперсия

 

 

 

 

 

 

 

 

 

 

48

 

 

 

прямой

11,024

 

 

 

 

 

 

49

 

 

 

ломаной

2,523

 

 

 

 

 

50

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

51

 

 

 

F-критерий

4,369

 

 

 

 

 

 

52

 

 

 

Риск α(F)

0,00078

 

 

 

 

 

 

32

 

 

 

 

 

 

 

 

 

 

 

 

 

Таблица 7.9

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

I

 

 

J

 

 

K

 

 

L

 

 

 

 

 

Модель

 

Остаток

 

Ранг

 

Квантиль нормаль-

 

4

 

 

 

 

остатка

 

ного распределения

 

 

 

 

 

 

 

 

 

 

 

 

59,062

 

0,852

 

17

 

0,482

 

 

5

 

 

 

 

 

 

6

 

58,694

 

1,055

 

18

 

0,601

 

 

7

 

58,269

-1,810

 

4

 

-1,034

 

 

 

 

 

 

 

 

 

 

37,906

0,489

 

15

0,260

 

 

26

 

 

 

 

 

35,511

2,554

 

24

1,921

 

 

27

 

 

 

 

 

34,177

-2,001

 

3

 

-1,229

 

 

28

 

 

 

 

 

29

 

 

 

 

 

 

 

 

 

 

 

 

 

 

30

 

51,038

0,000

 

 

 

 

 

 

 

 

31

 

7,995

1,481

 

 

 

 

 

 

 

В ячейке В42 (см. табл. 7.8) рассчитаем множественный

коэффициент корреляции как коэффициент корреляции между наблюдаемыми и предсказанными значениями функцией “=КОРРЕЛ(D5:D28;I5:I28)”. В ячейках В44 и В45 вычислим мини-

мальный и максимальный стандартизованные остатки функциями

“=МИН(J5:J28)/J31” и “=МАКС(J5:J28)/J31”. Для сравнения остаточ-

ных дисперсий единой линейной модели и модели регрессии двумя прямыми в ячейке В48 вычислим остаточную дисперсию единой ли- нейной модели функцией “=(СТОШYX(D5:D28;C5:C28))^2”, а в ячей- ке В49 остаточную дисперсию аппроксимации ломаной – “=МИН($G$7:$G$25)”. В ячейке В51 рассчитаем F-критерий отно- шение остаточных дисперсий – “=B48/B49” и в ячейке В52 – уровень значимости α(F) этого критерия “=FРАСП(B51;B28-2;B28-4)”.

Также построим точечный график наблюдаемых значений с до- бавленными линиями регрессии (рис. 7.10), график зависимости ос- татков от фактора (рис. 7.11) и нормальный вероятностный график остатков (рис. 7.12).

Анализ результатов. Получены линейные регрессионные моде- ли, связывающие зависимую и независимую переменные

Y = 59,235- 0,324X ,

если x £13,311, и

Y = 81,086-1,956X ,

если x>13,311.

33

65

 

 

 

 

 

60

 

 

 

 

 

55

 

 

 

 

 

50

 

 

 

 

 

y

 

 

 

 

 

45

 

 

 

 

 

40

 

 

 

 

 

35

 

 

 

 

 

30

 

 

 

 

 

0

5

10

15

20

25

 

 

 

х

 

 

Рис. 7.10. Регрессия двумя линейными моделями в разных интервалах

 

 

изменения фактора

 

 

Остатки

3

2

1

0

–1

–2

–3

–4

0

5

10

х

15

20

25

 

 

 

 

 

 

Рис. 7.11. Остатки в зависимости от значений фактора

34

 

 

2,5

 

 

 

 

 

 

 

Квантили нормального

 

2,0

 

 

 

 

 

 

 

распределения

1,5

 

 

 

 

 

 

 

1,0

 

 

 

 

 

 

 

0,5

 

 

 

 

 

 

 

0,0

 

 

 

 

 

 

 

–0,5

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

–1,0

 

 

 

 

 

 

 

 

 

–1,5

 

 

 

 

 

 

 

 

 

–2,0

 

 

 

 

 

 

 

 

 

–4

–3

–2

–1

0

1

2

3

 

 

 

 

 

Остатки

 

 

 

 

 

Рис. 7.12. Нормальный вероятностный график остатков

 

Рассчитана точечная оценка граничного значения фактора xc =13,311, при котором происходит смена зависимостей.

Регрессия двумя прямыми значимо лучше единой линейной моде- ли. Среди остатков отсутствуют выбросы. Остатки в зависимости от фактора изменяются случайно. Точки на нормальном вероятностном графике остатков не отклоняются систематически от прямой. Метод наименьших квадратов применен корректно.

Задание для самостоятельной работы

Используя шаблон примера 7.2, построить единую квадратичную модель зависимости свойства Y от фактора X. Рассчитать F-критерий

F = se2квадр . Сделать вывод о значимости различия квадратичной мо- se2

дели и регрессии двумя прямыми.

35

8. ОРТОГОНАЛЬНЫЕ БАЗИСНЫЕ ФУНКЦИИ

8.1. Регрессия ортогональными базисными функциями

Не всегда заранее известно, какой именно моделью описывается зависимость свойства Y от фактора X. В этом случае для построения регрессионной модели используется система базисных функций. Первоначально выбирается простейшая модель, включающая одну первую базисную функцию. Если модель отклоняется от наблюде- ний, то в модель добавляется вторая базисная функция, затем третья, четвертая и т.д. Процедура последовательного усложнения продол- жается до построения наилучшей модели. Критерием наилучшей мо-

дели служит минимум остаточной дисперсии se2 . При этом в модели

не должно быть базисных функций с высоким уровнем значимости t- критериев коэффициентов регрессии. Они вносят малый вклад в мо- дель (из-за близости к нулю их коэффициентов регрессии), но ос- ложняют содержательный анализ модели.

Такой подход использовался в примере 7.2, где рассчитывались линейная и квадратичная модели зависимости относительного удли- нения от времени нагрева:

δ= 19,617 + 0,249t ,

δ=5,28+2,65t 0,097t2 .

Из сравнения моделей видно, что коэффициенты b0 в линейной и квадратичной моделях разные; различаются также и коэффициенты b1 этих моделей. Если из последней модели исключить базисную функцию t, то получим модель

δ= 21,198+ 0,01t2 ,

коэффициенты b0 и b2 которой тоже не совпадают с аналогичными коэффициентами предыдущей модели. В выбранной системе степен- ных базисных функций коэффициенты регрессии изменяются, если изменяется сама модель. Это создает неудобства при анализе модели и оценке значимости коэффициентов регрессии, т.е. оценке вклада в модель соответствующих базисных функций.

36

Можно избежать зависимости коэффициентов регрессии от вида модели, если использовать систему ортогональных базисных функ- ций. Базисная функция fj (X ) ортогональна базисной функции fk (X ) на множестве наблюдений xi, y, (i =1, 2, ..., n ), если

n

å fij fik = 0 , i=1

где fij значение j-й базисной функции при i-м значении фактора: fij = f j (xi ) . В системе ортогональных базисных функций любая

n

сумма å fij fik = 0 , если j ¹ k . Тогда в матрице коэффициентов

i=1

левой части системы уравнений (7.5) все недиагональные элементы равны нулю, и выражения для коэффициентов регрессии упрощают-

ся до

 

 

n

 

 

 

 

 

å

fij

 

 

 

yi

 

b

=

i=1

 

.

(8.1)

n

 

j

 

 

 

 

 

 

å

 

 

 

 

 

f 2

 

 

 

 

ij

 

i=1

Коэффициент регрессии bj (8.1) рассчитывается по значениям соб- ственной базисной функции fij и не изменяется, если в модель вво-

дятся или из модели исключаются другие ортогональные базисные функции. Новая ортогональная базисная функция дополняет пре- дыдущую регрессионную модель, не изменяя самой предыдущей модели.

Стандартная ошибка коэффициента регрессии

sbj =

s2

 

 

e

 

(8.2)

n

 

 

å

f 2

 

 

ij

i=1

зависит только от остаточной дисперсии se2 и значений собственной

базисной функции. Эта ошибка минимальна в модели, остаточная дисперсия которой наименьшая.

37

8.2.Ортогональные полиномы

Впрактике регрессионного анализа часто предполагается, что свойство Y зависит от фактора Х по полиномиальному закону

Y = b + b X + b X 2

+ ... + b

X p ,

(8.3)

0 1

2

p

 

 

но степень полинома р заранее неизвестна и должна определяться в процессе расчета и сравнения моделей. В этом случае вместо уравне- ния регрессии (8.3) удобнее воспользоваться моделью

Y = u0Q0 (X ) + u1Q1(X ) + u2Q2 (X ) + ... + upQp (X ),

(8.4)

где Q0 (X ), Q1(X ), ..., Qp (X ) – взаимно ортогональные полиномы на множестве значений фактора xi (i =1, 2, ..., n ), а u0 , u1, ..., up опре-

деляемые коэффициенты регрессии. Ортогональный полином степе- ни р это полином вида

Q

(X ) = a( p) + a( p) X + a( p) X 2

+ ... + a( p)

X p-1

+ X p .

(8.5)

p

0 1

2

p-1

 

 

 

Полином нулевой степени Q0 (X ) º1.

Коэффициенты a0( p), a1( p), ..., a(pp-)1 полинома (8.5) вычисляются из

условия его ортогональности всем предыдущим полиномам

n

 

 

å

= 0 ,

(8.6)

qijqip

i=1

где qij = Qj (xi ) и j = 0, 1, ..., p-1. Например, для полинома первой

степени

Q1(X ) = a0(1) + X

из условия (8.6) получим (учитывая, что qi0 =1 для всех i)

n

 

 

n

 

 

å

a(1)

+

å

x

= 0 ,

 

0

 

 

i

 

i=1

 

 

i=1

 

 

откуда

n

a0(1) = - 1 å xi = -x

n i=1

38

и полином первой степени Q1(X ) = X - x . Попутно заметим, что

линейная модель (7.4) – это еще и уравнение регрессии в форме ор- тогональных полиномов нулевой и первой степеней. Для расчета ко-

эффициентов

a0(2)

и

a1(2)

полинома

второй

степени

Q2 (X ) = a0(2) + a1(2) X + X 2

необходимо решить систему двух линей-

ных уравнений, но на практике в этом нет необходимости, так как

ортогональные полиномы связаны соотношением

Qk+1(X ) = (X + g)Qk (X ) + hQk-1(X ) ,

(8.7)

где

 

 

 

 

 

 

 

 

 

 

n

 

 

 

 

n

 

 

 

 

å

x q

2

 

 

å

q2

 

 

 

i ik

 

 

ik

 

g = -

i=1

 

 

,

h = -

i=1

.

(8.8)

n

 

 

 

 

 

 

 

 

n

 

 

 

 

 

åqik2

 

 

 

åqik2

-1

 

 

 

i=1

 

 

 

 

i=1

 

 

 

 

Соотношение (8.7) позволяет рассчитать значения нового поли- нома qik+1 = Qk+1(xi ) через значения двух предыдущих полиномов qik и qik-1 без вычисления коэффициентов a(jk+1) нового полинома.

Оно же позволяет вычислить и сами коэффициенты нового полинома через коэффициенты двух предыдущих:

a(jk+1) = ga(jk) + a(j-k)1 + ha(jk-1) ,

(8.9)

где j = 0, 1, ..., k +1, а несуществующие коэффициенты полагаются

равными нулю.

После расчета по (8.1) коэффициентов регрессии u0 , u1, ..., up мо- дели (8.4) можно также вычислить и коэффициенты bj полинома

(8.3):

b

= u

a( j) + u a( j+1)

+ ... + u

a( p) ,

(8.10)

j

0

j 1 j

j

j

 

где j = 0, 1, ..., p . Если ни один из ортогональных полиномов Qk (X )

не исключался из модели (8.4), то уравнения (8.3) и (8.4) – две раз- ные формы одного и того же уравнения регрессии. Поэтому коэффи- циенты регрессии bj, вычисленные непосредственно (как в приме- рах 7.1, 7.2) и рассчитанные по (8.10), совпадут.

39

Пример 8.1. Провести регрессию ортогональными полиномами данных примера 7.2. Выбрать наилучшую модель.

Решение. Поместим исходные данные в порядке возрастания зна- чений времени нагрева t в ячейках С5:С18 и D5:D18 (табл. 8.1). (Упорядочение по возрастанию необходимо только для построения линии регрессии на графике.) В ячейках С20:D20 – средние значения независимой и зависимой переменных: “=СРЗНАЧ(C5:C18)”, в ячей- ках C21:D21 – их стандартные отклонения

“=СТАНДОТКЛОН(C5:C18)”.

 

 

 

 

 

 

Таблица 8.1

 

 

 

 

 

 

 

 

A

B

C

D

E

F

3

 

 

Данные

Модель

 

4

 

 

t

δ

0

1

 

 

 

 

 

 

 

5

21,860

 

9

21,5

22,68

21,860

6

21,984

 

9,5

21,5

22,68

21,984

7

22,109

 

10

22,5

22,68

22,109

8

22,109

 

10

21

22,68

22,109

9

22,358

 

11

22,5

22,68

22,358

10

22,358

 

11

23

22,68

22,358

11

22,607

 

12

23,5

22,68

22,607

12

22,857

 

13

23

22,68

22,857

13

22,857

 

13

24

22,68

22,857

14

23,106

 

14

23

22,68

23,106

15

23,106

 

14

22,5

22,68

23,106

16

23,230

 

14,5

23,5

22,68

23,230

17

23,355

 

15

23

22,68

23,355

18

23,604

 

16

23

22,68

23,604

19

 

 

 

 

 

 

20

 

Среднее

12,286

22,679

 

 

21

 

Стандартное

 

 

 

 

 

 

отклонение

2,242

0,846

 

 

Соотношение (8.7) позволяет организовать вычисления таким об- разом, чтобы расчеты полиномов второй и более высоких степеней проводились без записи в ячейки новых формул, а только копирова- нием формул из соседнего столбца. В столбце Е будем проводить все расчеты, связанные с полиномом нулевой степени Q0 (X ) , в столбце F с полиномом первой степени Q1(X ) , в столбце G с полиномом второй степени Q2 (X ) и т.д. В строке 4, начиная со столбца Е, запи- шем степень модели (она же степень старшего ортогонального поли- нома): «0» в ячейке Е4 и формула “=E4+1” в ячейке F4.

40

Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]