Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Анализ данных в материаловедении. Часть 2. Регрессионный анализ. Учебное пособие

.pdf
Скачиваний:
0
Добавлен:
12.08.2026
Размер:
1 Мб
Скачать

Коэффициенты левой части системы линейных уравнений (7.5) образуют квадратную матрицу [U], элементы которой

n

ujk = å fik fij . Пусть матрица [C] с элементами cjk матрица, об-

i=1

ратная матрице [U]:

[C]= [U]-1 .

(Коэффициенты сjj в выражении (6.13) – это диагональные элементы матрицы [C].)

Решение системы (7.5) запишется через элементы матрицы [C]

как

 

n

 

n

 

 

n

 

 

 

bj = cj0

å

yi fi0 + cj1

å

yi

fi1 +...+ cjp

å

yi

fip .

(7.6)

 

 

 

 

i=1

 

i=1

 

 

i=1

 

 

 

Это решение существует, если ни одна из функций

fj (X )

не являет-

ся линейной комбинацией других базисных функций и количество базисных функций меньше числа наблюдений: p +1< n .

Исходной информацией для алгоритмов и программ, вычисляю- щих коэффициенты линейной регрессии, является матрица значений

базисных функций с элементами fij = f j (xi ) и вектор-столбец зави-

симой переменной yi. Выбор же самих базисных функций зависит от содержания решаемой задачи и определяется исследователем.

Пример 7.2. Измерены 14 значений относительного удлинения автолистовой стали δ (%) в зависимости от продолжительности на- грева в колпаковой печи t (ч). Построить квадратичную регрессион- ную модель зависимости относительного удлинения от продолжи- тельности нагрева, оценить качество модели. Исходные данные в

ячейках D5:D18 (t, ч) и С5:С18 (δ, %), табл. 7.4.

Решение. Квадратичная модель

δ= b

+ b t + b t2

 

0

1

2

 

включает две базисные функции f1(t) = t

и f2 (t) = t2 . Рассчитаем в

столбце Е значения второй

базисной

функции f2 (t) = t2 (см.

табл. 7.4).

 

 

 

21

 

 

 

 

 

 

 

 

 

 

 

 

 

Таблица 7.4

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

B

C

D

 

E

F

 

G

 

H

 

I

 

 

 

 

 

 

 

 

 

 

 

 

 

 

Квантиль

 

 

 

 

 

 

 

 

 

 

 

 

Ранг

нормаль-

 

 

 

δ

t

t2

Модель Остаток

остат-

ного рас-

 

 

 

 

 

 

 

 

 

 

 

ка

пределе-

4

 

 

 

 

 

 

 

 

 

 

 

 

ния

5

 

 

23

14

196

23,29

-0,29

 

3

 

-0,893

 

6

 

 

21,5

9

 

81

21,23

 

0,27

 

10

 

0,452

 

 

 

 

22,5

11

121

22,64

-0,14

 

6

 

-0,265

 

7

 

 

 

 

 

 

 

 

22,5

10

 

100

22,03

 

0,47

 

13

 

1,194

 

8

 

 

 

 

 

 

 

9

 

 

23

11

121

22,64

0,36

 

11

 

0,656

 

10

 

 

23,5

14,5

 

210,25

23,23

0,27

9

0,265

 

11

 

 

21,5

9,5

 

90,25

21,65

-0,15

 

5

 

-0,452

 

12

 

 

23

15

225

23,12

-0,12

 

7

 

-0,088

 

 

 

 

23

16

256

22,76

0,24

 

8

 

0,088

 

13

 

 

 

 

 

 

 

 

23

13

169

23,27

-0,27

 

4

 

-0,656

 

14

 

 

 

 

 

15

 

 

24

13

169

23,27

0,73

 

14

 

1,680

 

16

 

 

22,5

14

196

23,29

-0,79

 

2

 

-1,194

 

17

 

 

23,5

12

 

144

23,05

 

0,45

 

12

 

0,893

 

18

 

 

21

10

100

22,03

-1,03

 

1

 

-1,680

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

19

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

Среднее 22,679 12,286

 

22,679

 

0,000

 

 

 

 

 

20

 

 

 

 

 

 

 

 

 

 

Станд.

 

 

 

 

 

 

 

 

 

 

 

 

21

 

отклонение

0,846

2,242

 

 

0,685

 

0,496

 

 

 

 

 

22

 

Данных

14

 

 

 

 

 

 

 

 

 

 

 

В диапазон ячеек Е5:Е18 запишем формулу “=D5^2”. Далее ана- логично примеру 7.1 рассчитаем: средние значения в ячейках С20:D20 – функцией “=СРЗНАЧ(C5:C18)”, стандартные отклонения в ячейках С21:D21 – функцией “=СТАНДОТКЛОН(C5:C18)”, коли- чество данных в ячейке С22 – функцией “=СЧЁТ(C5:C18)”. Для рас-

чета параметров квадратичной модели снова используем функцию ЛИНЕЙН (табл. 7.5). Выделим диапазон ячеек С25:Е28, вызовем функцию ЛИНЕЙН и заполним поля ее аргументов: «Известные зна- чения у» – С5:С18, «Известные значения х» – D5:Е18, поле «Конст» оставляем незаполненным, в поле «Статистика» записываем 1. Далее вместо «OK» одновременно нажимаем клавиши Ctrl+Shift+Enter. Функция ЛИНЕЙН возвращает: три коэффициента регрессии в ячейках С25:Е25 (в порядке, обратном порядку столбцов базисных

22

функций), стандартные ошибки коэффициентов регрессии в ячей- ках С26:Е26, статистические характеристики модели в ячейках С27:D28 (см. табл. 7.5).

 

 

 

 

 

 

Таблица 7.5

 

 

 

 

 

 

 

 

 

 

 

B

C

D

E

 

 

 

 

 

 

 

 

 

24

 

 

b2

b1

b0

 

25

 

Коэффициент регрессии

-0,097

2,645

5,280

 

 

 

 

Стандартная ошибка коэффициента

 

 

 

 

 

26

 

регрессии

0,0366

0,9057

5,4675

 

 

 

 

R2 и остаточное стандартное отклоне-

 

 

 

 

 

27

 

ние

0,6562

0,53925

#Н/Д

 

28

 

F и ч.с.с. остаточной дисперсии

10,4972

11

#Н/Д

 

29

 

 

 

 

 

 

 

 

t-критерий коэффициента регрессии

 

 

 

 

 

30

 

-2,6531

2,9210

0,9658

 

 

31

 

Уровень значимости t-критерия

0,0225

0,0139

0,3549

 

 

32

 

 

 

 

 

 

 

 

 

Множественный коэффициент корре-

 

 

 

 

 

33

 

ляции R

0,8101

 

 

 

 

34

 

Ч.с.с. дисперсии модели

2

 

 

 

 

35

 

Уровень значимости F-критерия

0,0028

 

 

 

 

36

 

 

 

 

 

 

 

 

 

Минимальный стандартизованный ос-

-2,075

 

 

 

 

37

 

таток

 

 

 

 

 

 

 

 

 

 

 

 

Максимальный стандартизованный

 

 

 

 

 

38

 

остаток

1,475

 

 

 

Далее, как в примере 7.1:

вячейках С30:Е30 – формула “=C25/C26”,

вячейках С31:Е31 – функция “=СТЬЮДРАСП(ABS(C30);$D$28;2)”,

вячейке C33 – функция “=КОРЕНЬ(C27)”,

вячейке C34 – функция “=C22-D28-1”,

вячейке C35 – функция “=FРАСП(C28;C34;D28)”.

Затем в ячейках F5:F18 (см. табл. 7.4) рассчитаем предсказанные квадратичной моделью значения, используя функцию ТЕНДЕНЦИЯ. Выделим ячейки F5:F18, вызовем из списка функций функцию ТЕНДЕНЦИЯ и заполним поля ее аргументов: «Известные значе- ния у» – С5:С18, «Известные значения х» – D5:E18, «Новые значе- ния х» – D5:E18, поле «Конст» оставим незаполненным. Вместо «OK» одновременно нажимаем клавиши Ctrl+Shift+Enter. В ячейках G5:G18 рассчитаем остатки формулой “=C5-F5”, а в ячейках G20 и

23

G21 – среднее и стандартное отклонение остатков. В ячейках Н5:Н18 вычислим ранги остатков функцией “=РАНГ(G5;G$5:G$18;1)” и в ячейках I5:I18 – квантили нормального распределения функцией

“=НОРМОБР((3*H5-1)/(3*$C$22+1);$G$20;$G$21)/$G$21”. Наконец,

в ячейках С37 и С38 (см. табл. 7.5) рассчитаем минимальный и мак-

симальный стандартизованные остатки функциями

“=МИН(G5:G18)/G21” и “=МАКС(G5:G18)/G21” соответственно.

Также построим график зависимости относительного удлинения от продолжительности нагрева вместе с кривой регрессии (рис. 7.4), график зависимости остатков от фактора (рис. 7.5) и нормальный ве- роятностный график остатков (рис. 7.6).

25

 

 

 

 

 

 

 

 

 

24

 

 

 

 

 

 

 

 

 

23

 

 

 

 

 

 

 

 

 

δ

 

 

 

 

 

 

 

 

 

22

 

 

 

 

 

 

 

 

 

21

 

 

 

 

 

 

 

 

 

20

 

 

 

 

 

 

 

 

 

8

9

10

11

12

13

14

15

16

17

 

 

 

 

 

t

 

 

 

 

Рис. 7.4. Квадратичная модель зависимости относительного

удлинения от продолжительности нагрева

 

Остатки

1

0,8

0,6

0,4

0,2

0 –0,2 –0,4 –0,6

–0,8 –1

–1,2

8

9

10

11

12

13

14

15

16

17

t

Рис. 7.5. Зависимость фактор остатки квадратичной модели

24

Квантили нормального распределения

2,0

 

 

 

 

 

1,5

 

 

 

 

 

1,0

 

 

 

 

 

0,5

 

 

 

 

 

0,0

 

 

 

 

 

–0,5

 

 

 

 

 

–1,0

 

 

 

 

 

–1,5

 

 

 

 

 

–2,0

 

 

 

 

 

–1,5

–1,0

–0,5

0,0

0,5

1,0

 

 

Остатки

 

 

Рис. 7.6. Нормальный вероятностный график остатков квадратичной модели

Для сравнения рассчитаем также линейную модель зависимости относительного удлинения от продолжительности нагрева

δ= b0 + b1t .

Функции ЛИНЕЙН и ТЕНДЕНЦИЯ воспринимают столбец аргу- ментов, состоящий из одинаковых чисел, как избыточный, и не учи- тывают в расчетах соответствующую базисную функцию. Поэтому для расчета коэффициентов регрессии и статистических характери- стик линейной модели достаточно проставить число 0 вместо значе- ний базисной функции t2 в ячейках Е5:Е18 (табл. 7.6).

 

 

 

 

 

 

 

 

 

Таблица. 7.6

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

B

 

C

 

D

 

E

 

F

 

 

G

 

 

 

 

δ

 

t

 

t2

 

Модель

 

Остаток

4

 

 

 

 

 

 

 

 

23

14

0

23,11

 

-0,11

 

5

 

 

 

6

 

21,5

9

0

21,86

 

-0,36

 

7

 

22,5

11

0

22,36

 

0,14

 

 

 

 

 

 

 

 

 

22,5

14

0

23,11

 

-0,61

 

16

 

 

 

 

 

23,5

12

0

22,61

 

0,89

 

17

 

 

 

 

 

21

10

0

22,11

 

-1,11

 

18

 

 

 

19

 

 

 

 

 

 

 

 

 

 

 

 

 

20

Среднее

22,679

12,286

 

 

22,679

 

0,000

 

21

Стандартное отклонение

0,846

2,242

 

 

0,559

 

0,635

 

22

Данных

14

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

25

 

 

 

 

 

 

 

Окончание табл. 7.6

 

 

 

 

 

 

 

 

 

 

 

 

 

B

C

D

E

F

G

 

 

23

 

 

 

 

 

 

 

 

 

24

 

 

b2

b1

b0

 

 

 

 

25

 

Коэффициент регрессии

0,000

0,249

19,617

 

 

 

 

 

 

Станд. ошибка коэффици-

 

 

 

 

 

 

 

26

 

ента регрессии

0,0000

0,0818

1,0202

 

 

 

 

 

 

R2 и остаточное станд.

 

 

 

 

 

 

 

27

 

отклонение

0,4362

0,66115

#Н/Д

 

 

 

 

 

 

F и ч.с.с. остаточной

 

 

 

 

 

 

 

28

 

дисперсии

9,2836

12

#Н/Д

 

 

 

 

29

 

 

 

 

 

 

 

 

 

 

 

t-критерий коэффициента

 

 

 

 

 

 

 

30

 

регрессии #ДЕЛ/0!

3,0469

19,2294

 

 

 

 

 

 

Уровень значимости

 

 

 

 

 

 

 

31

 

t-критерия #ДЕЛ/0!

0,0101

0,0000

 

 

 

 

32

 

 

 

 

 

 

 

 

 

 

 

Множественный коэфф.

 

 

 

 

 

 

 

33

 

корреляции R

0,6604

 

 

 

 

 

 

34

 

Ч.с.с. дисперсии модели

1

 

 

 

 

 

 

 

 

Уровень значимости

 

 

 

 

 

 

 

35

 

F-критерия

0,0101

 

 

 

 

 

 

36

 

 

 

 

 

 

 

 

 

 

 

Мин. стандартизованный

-1,746

 

 

 

 

 

 

37

 

остаток

 

 

 

 

 

 

 

 

Макс. стандартизованный

 

 

 

 

 

 

 

38

 

остаток

1,800

 

 

 

 

 

На график зависимости t δ нанесем прямую регрессии (рис. 7.7). График зависимости остатков от значений фактора (рис. 7.8) и нормальный вероятностный график остатков перестроятся авто- матически.

Анализ результатов. Построена квадратичная модель зависимо- сти относительного удлинения автолистовой стали δ (%) от продол- жительности нагрева в колпаковой печи t (ч):

δ= 5,280 + 2,645t - 0,097t2 .

Коэффициент корреляции между наблюдаемыми и предсказанными

значениями

R = 0,810 . Модель описывает зависимость

значимо

лучше, чем

 

 

 

= 2,65 и

среднее δ. Коэффициенты регрессии b1

b2 = -0,097

значимо отличаются от нуля. (Мы не будем содержа-

тельно интерпретировать коэффициент b0 величину относительного

26

удлинения при нулевой продолжительности нагрева и оценивать значимость его отличия от нуля.) Регулярные отклонения наблюде- ний от квадратичной модели отсутствуют. Зависимость остатков от значений фактора случайная; видимые закономерности отсутству- ют. Максимальные и минимальные значения остатков не являются выбросами. Точки на нормальном вероятностном графике остатков не отклоняются систематически от прямой. Гипотеза нормального распределения остатков не отвергается, метод наименьших квадра- тов применен корректно.

25

 

 

 

 

 

 

 

 

 

24

 

 

 

 

 

 

 

 

 

23

 

 

 

 

 

 

 

 

 

δ

 

 

 

 

 

 

 

 

 

22

 

 

 

 

 

 

 

 

 

21

 

 

 

 

 

 

 

 

 

20

 

 

 

 

 

 

 

 

 

8

9

10

11

12

13

14

15

16

17

 

 

 

 

 

t

 

 

 

 

Рис. 7.7. Линейная модель зависимости относительного удлинения

 

 

от продолжительности нагрева

 

 

 

Остатки

1,5

1

0,5

0

–0,5

–1

–1,5

8

9

10

11

12

13

14

15

16

17

 

 

 

 

 

t

 

 

 

 

Рис. 7.8. Зависимость фактор остатки линейной модели

27

Дополнительно сравним линейную и квадратичную модели. По

величинам

остаточных

стандартных

отклонений линейной

(se = 0,661)

и квадратичной (se = 0,539) моделей и значениям мно-

жественных

коэффициентов корреляции

линейной (R = 0,66) и

квадратичной ( R = 0,81)

моделей квадратичная модель описывает

наблюдения лучше линейной. Этот вывод подтверждает и сравнение графиков зависимостей рис. 7.4 с рис. 7.7 и графиков остатков рис. 7.5 с рис. 7.8. Хотя коэффициент регрессии линейной модели b1 = 0,249 значимо отличается от нуля, на графике зависимости t δ с нанесенной на него прямой регрессии (см. рис. 7.7) заметно систе- матическое отклонение наблюдений от модели. Еще более это от- клонение заметно на графике остатков (см. рис. 7.8).

Отношение остаточных дисперсий двух моделей

se2 (линейнаямодель)

F = se2 (квадратичнаямодель) =1,503.

Уровень значимости (т.е. риск ошибочного отклонения гипотезы о

равенстве истинных остаточных дисперсий линейной и квадратичной моделей) этого (одностороннего) F-критерия α(F) = 0,254 . Это вы-

сокий риск, поэтому нельзя утверждать, что квадратичная модель описывает наблюдения значимо лучше, чем линейная.

В такой ситуации исследователь, стоящий перед необходимостью выбора, может предпочесть квадратичную модель, как модель с мень- шим остаточным стандартным отклонением se и отсутствием система- тических отклонений наблюдений от модели. Аргументом в пользу ли- нейной модели может служить бóльшая ее простота и понятность по сравнению с квадратичной (Экстремальная зависимость нуждается в содержательном объяснении.) Если целью исследования не являлось

сравнение двух альтернативных независимых гипотез о линейной и квадратичной зависимостях, дополнительно можно привлечь знания из предметной области, которые подтверждают (или не подтверждают) экстремальную зависимость относительного удлинения от продолжи- тельности нагрева. Если окончательный выбор делать не нужно, то наи- лучшее решение увеличение числа наблюдений и повторение регрес- сионного анализа с новой совокупностью данных.

7.3. Регрессия двумя функциями

Известны случаи, когда в разных интервалах изменения фактора действуют разные механизмы его влияния на свойство. Поэтому за-

28

висимость свойства Y от фактора Х описывается в этих интервалах разными функциями (рис. 7.9). Значение фактора, при котором одна функция сменяется другой, точно не известно. В этом случае задача регрессионного анализа определить параметры каждой из функций и граничное значение фактора.

65

60

55

50

у

45

40

35

30

0

5

10

х

15

20

25

 

 

 

 

 

 

Рис. 7.9. Различные зависимости в разных интервалах изменения фактора

Рассмотрим случай, когда обе зависимости предполагаются ли- нейными. Упорядочим имеющиеся n пар наблюдений xi, yi по возрас- танию фактора xi. Разделим упорядоченные данные на две группы. Проведем регрессию первых k наблюдений линейной зависимостью

Y= a1 + b1 X ,

аоставшихся n- k наблюдений зависимостью

Y = a2 + b2 X .

Рассчитаем остаточную дисперсию (6.4) первой линейной модели se21 и остаточную дисперсию второй модели se22 . Далее рассчитаем

сводную дисперсию

s2 =

(k - 2)s2

+ (n- k

- 2)s2

 

e1

 

e2

.

(7.7)

 

n- 4

 

e

 

 

 

 

 

 

 

 

 

Сводная дисперсия

это остаточная дисперсия регрессии двумя

линейными функциями, первая из которых построена по первым k наблюдениям, а вторая по оставшимся n- k наблюдениям. Число ее степеней свободы ν= n- 4 .

29

Наилучшая модель регрессии двумя прямыми (аппроксимация ломаной) получается при наименьшем значении сводной остаточной дисперсии se2 (7.7). Для нахождения минимума будем последова- тельно менять число наблюдений в первой группе k от 3 до n- 3 , каждый раз рассчитывая сводную остаточную дисперсию se2 . Выбе- рем значение k, при котором дисперсия se2 минимальна. При таком числе наблюдений в первой группе регрессия двумя прямыми наи- лучшая. Координата точки пересечения двух прямых

x

=

a2 - a1

,

(7.8)

 

c

 

b

- b

 

 

1

2

 

 

где а1, b1, а2, b2 коэффициенты регрессии линейных моделей при выбранном k. Координата хс точечная оценка значения фактора, при котором происходит смена зависимостей.

Дополнительно убедимся, что аппроксимация ломаной лучше, чем единая линейная модель. Рассчитаем по (6.4) остаточную дис- персию единой линейной модели se2 line с числом степеней свободы νline = n- 2 и F-критерий отношения дисперсий

F = se2 line ,

se2

где в знаменателе дисперсия ломаной se2 (7.7) с ч.с.с. ν= n 4 . Если уровень значимости этого критерия α(F) низкий (например, меньше 0,05), то регрессия двумя прямыми значимо лучше единой линейной модели.

Пример 7.3. Имеется 24 наблюдения независимой переменной х и зависимой переменной у (см. рис. 7.9). Построить регрессионную модель двумя линейными функциями, оценить граничное значение фактора, сравнить регрессию двумя прямыми с единой линейной регрессионной моделью. Данные:

х: 0,55; 1,72; 3,08; 3,87; 5,29; 5,71; 7,19; 7,82; 8,63; 9,68; 11,44; 11,66; 12,96; 14,15; 15,10; 15,79; 17,31; 17,89; 19,16; 19,56; 20,80; 22,08; 23,30; 23,99,

у: 59,91; 59,75; 56,46; 57,77; 54,70; 58,85; 56,53; 58,34; 58,42; 55,40; 54,05; 56,35; 55,40; 52,95; 50,48; 51,53; 47,64; 47,68; 44,09; 40,01;

39,96; 38,40; 38,07; 32,18.

Решение. Поместим наблюдения, упорядоченные по возрастанию значений независимой переменной в ячейках С5:С28 и D5:D28 (табл. 7.7). В ячейках В5:В28 проставим последовательные номера наблюдений.

30

Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]