Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Анализ данных в материаловедении. Часть 2. Регрессионный анализ. Учебное пособие

.pdf
Скачиваний:
0
Добавлен:
12.08.2026
Размер:
1 Мб
Скачать

№ 2381

М И Н И С Т Е Р С Т В О ОБРАЗОВАНИЯ И НАУКИ РФ

ФЕДЕРАЛЬНОЕ ГОСУДАРСТВЕННОЕ АВТОНОМНОЕ ОБРАЗОВАТЕЛЬНОЕ УЧРЕЖДЕНИЕ ВЫСШЕГО ПРОФЕССИОНАЛЬНОГО ОБРАЗОВАНИЯ

«НАЦИОНАЛЬНЫЙ ИССЛЕДОВАТЕЛЬСКИЙ ТЕХНОЛОГИЧЕСКИЙ УНИВЕРСИТЕТ «МИСиС»

Кафедра металловедения и физики прочности

А.С. Мельниченко

Анализ данных в материаловедении

Часть 2. Регрессионный анализ

Учебное пособие

Допущено учебно-методическим объединением по образованию в области металлургии в качестве

учебного пособия для студентов высших учебных заведений, обучающихся по направлению Металлургия

Москва 2014

УДК 620.22 М48

Р е ц е н з е н т канд. техн. наук, доц. С.Н. Богданов

Мельниченко, А.С.

М48 Анализ данных в материаловедении. Ч. 2. Регрессионный анализ : учеб. пособие / А.С. Мельниченко. – М. : Изд. Дом МИСиС, 2014. – 87 с.

ISBN 978-5-87623-775-0

Во второй части пособия рассмотрены практические вопросы регресси- онного анализа, включая линейную и нелинейную регрессию, регрессию ор- тогональными полиномами, множественную регрессию. По всем темам при-

водятся краткие теоретические сведения и примеры решения реальных задач из металлургии и материаловедения в программе Excel. В пособие включены задания для самостоятельной работы.

Предназначено для выполнения курсовых и дипломных исследователь- ских работ бакалаврами и магистрами, обучающимися по направлениям «Ма- териаловедение» и «Металлургия». Может быть использовано аспирантами в области металлургии и материаловедения.

УДК 620.22

ISBN 978-5-87623-775-0

А.С. Мельниченко, 2014

2

 

ОГЛАВЛЕНИЕ

 

Предисловие..............................................................................................

4

6.

Регрессионная модель..........................................................................

5

 

6.1. Метод наименьших квадратов ...................................................

5

 

6.2. Анализ регрессионной модели...................................................

6

 

6.3. Регрессионный анализ в программе Excel ..............................

11

7.

Линейная регрессия............................................................................

13

 

7.1. Линейная модель .......................................................................

13

 

7.2. Общая модель линейной регрессии.........................................

20

 

7.3. Регрессия двумя функциями ....................................................

28

8.

Ортогональные базисные функции...................................................

36

 

8.1. Регрессия ортогональными базисными функциями ..............

36

 

8.2. Ортогональные полиномы........................................................

38

 

8.3. Ортогональные тригонометрические функции ......................

50

9.

Нелинейная регрессия........................................................................

59

10. Множественная регрессия ...............................................................

71

Библиографический список .................................................................

86

3

ПРЕДИСЛОВИЕ

Во второй части учебного пособия рассмотрены практические за- дачи регрессионного анализа. Цель второй части пособия, как и пер- вой [1], – дать возможность студентам, выполняющим курсовые и дипломные исследовательские работы, проводить регрессионный анализ, используя вычислительные средства Excel и не прибегая к другим программам и статистическим таблицам. Структура второй части пособия аналогична структуре первой части краткое теорети- ческое введение и подробный разбор типичных примеров, заимство- ванных из материаловедческой практики. Более полно с теорией рег- рессионного анализа можно ознакомиться в учебнике [2] или фунда- ментальном труде [3].

Поскольку вторая часть пособия является продолжением первой, нумерация глав в обеих частях сплошная, а ссылки в тексте на раз- делы и формулы из первой части даются без указания источника. Во второй части действует то же правило ссылок в формулах: если фор- мула или функция относится к диапазону ячеек, то она приводится только для верхней левой ячейки диапазона, а на остальные ячейки распространяется копированием.

4

6. РЕГРЕССИОННАЯ МОДЕЛЬ

6.1. Метод наименьших квадратов

Цель регрессионного анализа построение по эксперименталь- ным данным аналитической (формульной) зависимости переменной Y свойства от независимой переменной Х фактора. Предполага- ется, что зависимая переменная Y содержит случайную ошибку, при- чины которой многообразны, например, сам метод измерений, фик- сирующий случайный поток импульсов, влияние неучтенных в экс- перименте факторов, нестабильность работы измерительных прибо- ров и др. Фактор Х изменяется в определенных границах и не являет- ся случайным в том смысле, что ошибка его измерения много мень- ше интервала его варьирования. Зависимость между переменными Х и Y (математическая модель) ищется в виде

 

 

 

 

 

Y = F(β0 ,β1, ...,βp , X ) .

 

 

 

(6.1)

Здесь F известная функция переменной Х, содержащая

 

p +1

неоп-

ределенных независимых параметров β0 ,β1, ...,βp

. Эти параметры

оцениваются по результатам n (n > p +1)

пар наблюдений фактора Х

и зависимой переменной Y xi , yi (i =1, 2, ..., n) методом наименьших

квадратов (МНК).

 

 

 

значения b0 , b1

, ..., bp , ми-

МНК оценки параметров β0

,β1, ...,βp

нимизирующие сумму квадратов разностей наблюдаемых значений

свойства

yi и

рассчитанных по

модели

(6.1)

 

величин

Yi = F(b0 , b1, ..., bp , xi ) :

 

 

 

 

 

 

 

 

 

 

n

 

2

ì

n

 

 

 

ü

 

 

2

 

å

 

ï

 

 

 

2 ï

 

S

=

[ yi -Yi

] = min

ï

é yi - F

(β0 ,β1, ...,βp , xi )ù

 

ï

(6.2)

 

í

 

ý .

 

 

 

 

β0 ,...,βp

 

ê

 

ú

 

ï

 

 

 

 

 

ïåë

 

û

 

 

 

 

 

i=1

 

 

î

 

 

 

 

þ

 

 

 

 

 

 

ï i=1

 

 

 

ï

 

Уравнение (6.1)

называется

уравнением регрессии,

функция

F(β0 ,β1, ...,βp , X )

функцией регрессии, а оценки b0 , b1, ..., bp

коэффициентами регрессии.

 

 

Если функция

регрессии

линейна относительно параметров

β0 ,β1, ...,βp :

 

 

 

F(β0 ,β1, ...,βk , X ) 0 1 f1(X ) + ... p fp (X ) ,

(6.3)

5

то регрессия называется линейной. В противном случае нелинейной. В моделях линейной регрессии все функции f1(X ), f2 (X ), ..., fp (X ) ,

называемые базисными, полностью определены, а оцениваемые па- раметры β0 ,β1, ...,βp не являются их аргументами. Такая структура

функции регрессии позволяет рассчитать p +1 коэффициент регрес- сии b0 , b1, ..., bp путем решения системы линейных уравнений неза-

висимо от вида базисных функций. В моделях нелинейной регрессии нет единого метода расчета коэффициентов регрессии; в большинст-

ве случаев минимизация суммы S2 (6.2) по параметрам β0 ,β1, ...,βp проводится численно.

6.2. Анализ регрессионной модели

После расчета коэффициентов регрессии b0 , b1, ..., bp проводится анализ качества полученной модели, поскольку даже при наилучших МНК оценках рассчитанные по модели значения Yi = = F(b0 , b1, ..., bp , xi ) могут значительно отличаться от наблюдаемых yi , если сама функция регрессии F(β0 ,β1, ...,βp , X ) выбрана неудачно.

Используются следующие характеристики качества регрессион- ной модели:

Остаточная дисперсия

 

 

1

n

 

 

 

s2

=

å

(y

-Y )2 .

(6.4)

 

n- ( p +1)

e

 

i

i

 

 

 

 

 

 

 

 

 

i=1

 

 

 

Остаточная дисперсия дисперсия наблюдений yi

относительно мо-

дели, характеристика разброса наблюдений вокруг модели. Число, стоящее в знаменателе,

νe = n ( p +1)

(6.5)

называется числом степеней свободы (ч.с.с.) остаточной дисперсии.

Остаточная дисперсия и остаточное стандартное отклонение

 

 

 

1

n

 

 

 

s =

s2

=

å

(y

-Y )2

(6.6)

 

n- ( p +1)

e

e

 

i

i

 

 

 

 

 

 

 

 

 

 

 

i=1

 

 

 

служат для сравнения различных регрессионных моделей и для вы- числения других характеристик качества модели.

6

Множественный коэффициент детерминации

 

n

 

 

 

å(Yi -

 

 

)2

 

 

 

y

 

 

R2 =

i=1

,

(6.7)

n

 

å( yi -

 

)2

 

 

 

y

 

 

i=1

n

где среднее y = 1 å yi . Коэффициент R2 ( 0 R2 1) характеризу-

n i=1

ет долю суммы квадратов отклонений наблюдений yi от среднего y , объясняемую регрессионной моделью. Коэффициент

 

n

 

 

å(Yi -

 

 

)2

 

 

y

 

R =

i=1

(6.8)

n

 

å( yi -

 

)2

 

 

y

 

i=1

называется множественным коэффициентом корреляции. Это пар-

ный коэффициент корреляции между наблюдаемыми yi и предска- занными моделью Yi значениями: R = ryY (его также можно рассчи- тать по (5.4) именно как ryY). Если R2 и R близки к единице, то пред- сказанные величины Yi близки к наблюдаемым yi. Наблюдения yi со- держат случайные ошибки. Поэтому модель с высокими R2 и R, но малым числом степеней свободы νe, необязательно наилучшая. Кро- ме функциональной зависимости свойства от фактора, такая модель может описывать и случайные отклонения от нее.

F-критерий значимости регрессии

 

F =

sr2

.

 

 

(6.9)

 

 

 

 

s2

 

 

 

 

 

e

 

 

Здесь sr2 средний квадрат отклонений модели от среднего

 

(сред-

y

ний квадрат, обусловленный регрессией):

 

 

 

 

n

 

 

sr2 =

1

å(Yi -

 

)2 .

(6.10)

y

p

 

 

i=1

 

 

Число его степеней свободы

7

νr = p .

(6.11)

Если дисперсия в числителе значимо больше дисперсии в знаменате- ле F-критерия (6.9), то регрессионная модель описывает наблюдения значимо лучше, чем просто среднее y . По постановке задачи F-критерий (6.9) является односторонним, поэтому риск ошибочного отклонения гипотезы о равенстве дисперсий (уровень значимости критерия) α(F) вычисляется как

¥

 

α(F) = ò wF (u)du ,

(6.12)

F

где wF (u) – плотность распределения Фишера. Если риск (6.12) мал (например, меньше 0,05), то дисперсия sr2 значимо больше остаточ- ной дисперсии se2 и регрессия значима.

Значимость коэффициентов регрессии

Коэффициенты регрессии b0 , b1, ..., bp рассчитываются по резуль-

татам эксперимента, содержащим случайные ошибки, поэтому сами являются случайными величинами оценками некоторых истинных значений. Как и всякие оценки, они могут незначимо отличаться от нуля. Для проверки этого рассчитываются их стандартные ошибки. В моделях линейной регрессии (6.3) эти ошибки

sbj = cjj se ,

(6.13)

где коэффициенты cjj вычисляются в процессе решения системы ли- нейных уравнений для коэффициентов регрессии. Ниже в отдельных

случаях приводятся явные выражения для sb .

j

Далее вычисляются t-критерии коэффициентов регрессии

tj =

bj

(6.14)

s

 

 

 

bj

 

и риск ошибочного отклонения гипотезы о равенстве нулю коэффи- циента регрессии (уровень значимости t-критерия) α(tj ) (2.5) с ч.с.с. остаточной дисперсии νe . Если уровень значимости α(tj ) превосхо- дит некоторое заданное значение, то коэффициент регрессии bj не- значимо отличается от нуля, и его можно приравнять к нулю. Ис- ключение части коэффициентов регрессии упрощает модель, но из- меняет саму модель. Поэтому после исключения надо повторить всю процедуру регрессионного анализа с новой моделью.

8

Анализ остатков. Остатками называются разности между наблю- даемыми yi и рассчитанными по модели Yi значениями зависимой переменной:

ei = yi -Yi .

(6.15)

Метод наименьших квадратов предполагает, что остатки являются нормально распределенными случайными величинами. Если единст- венная причина отклонения модели от наблюдений эксперимен- тальный случайный разброс, то и последовательность остатков явля- ется случайной. Для проверки этого строится точечный график зави- симости остатков ei от значений фактора xi. Точки на графике долж-

ны только случайно отклоняться от нулевой линии и располагаться без видимых закономерностей, трендов или периодичностей. Если это не так, то регрессионная модель не полностью описывает зави- симость свойства от фактора и является неадекватной.

Для оценки близости распределения остатков к нормальному рас- пределению строится нормальный вероятностный график. Сначала определяется ранг остатка j ( j =1, 2, ..., n ) – его номер в упорядочен-

ном по возрастанию ряду остатков, затем по величине ранга j рас-

считывается квантиль нормального распределения

 

 

-1

æ

3 j -1

 

 

ö

 

 

 

 

 

 

W

 

ç

 

 

÷

 

 

 

 

 

 

 

ç

 

 

÷

 

 

 

è3n +1

,e,ser ÷

 

z( j) =

 

 

ø

,

(6.16)

 

 

 

 

 

 

ser

где W1 обратная функция нормального распределения с выбороч-

n

ным средним остатков e = åei и выборочным стандартным откло-

i=1

нением остатков

 

 

 

 

n

 

ser =

1

 

å(ei -

 

)2 .

(6.17)

 

 

e

n-

1

 

 

 

 

i=1

 

Далее строится точечный график в координатах е z. Если рас- пределение остатков близко к нормальному, точки на этом графике группируются около прямой. Если точки систематически отклоняют- ся от прямой (часто в виде буквы S), то распределение остатков от- личается от нормального.

9

Выбросы. Выбросами среди остатков считаются остатки, значи- тельно превосходящие по абсолютной величине все остальные. В

точках выбросов различие между наблюдениями и регрессионной моделью аномально велико. Причинами выбросов могут быть ошиб- ки эксперимента или регистрации и подготовки данных, влияние не- учтенных в модели факторов и, как редкое исключение, неизвестные ранее локальные особенности зависимости свойства от фактора. Если остатки распределены нормально, критерием выбросов может слу- жить максимальное относительное отклонение (т.е. стандартизован- ное значение)

ξ =

 

 

em -

 

 

 

 

 

 

 

e

 

 

 

,

(6.18)

 

 

 

 

 

ser

 

 

 

 

 

 

 

 

 

 

 

где еm максимальный или минимальный остаток. Первоначально

подозрительными на выбросы можно считать стандартизованные остатки ξ > 2 , если число данных n 5, ξ > 2,3, если 5 < n 15 и ξ > 2,5, если n > 15 . Далее следует воспользоваться критерием максимального относительного отклонения (6.18), как это описано в п. 3.2. Исключая наблюдение, признанное выбросом, следует изучить все возможные причины большого отклонения наблюде- ния от модели, а не только руководствоваться величиной крите-

рия (6.18).

Влияющие наблюдения. Влияющее наблюдение пара xi, yi, которая одна вносит непропорционально большой вклад в коэффициенты рег- рессии. Исключение такого наблюдения из анализа приводит к значи- тельному изменению коэффициентов регрессии. Наличие влияющих наблюдений недостаток модели. Надежная регрессионная модель не должна слишком сильно зависеть от отдельного наблюдения.

Влияющими наблюдениями могут оказаться пары xi, yi с крайними значениями фактора, особенно, если эти значения далеки от основ- ной совокупности, т.е. являются выбросами фактора. Для проверки модели на наличие влияющих наблюдений надо поочередно исклю-

чить из нее пары с наименьшим и наибольшим значением фактора и повторить регрессионный анализ без них. Если наблюдение не влияющее, то коэффициенты регрессии модели с исключенным на-

блюдением не должны значительно отличаться от коэффициентов полной модели, а графики обеих функций регрессии должны прохо- дить примерно одинаково.

10

Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]