Анализ данных в материаловедении. Часть 2. Регрессионный анализ. Учебное пособие
.pdf
№ 2381 |
М И Н И С Т Е Р С Т В О ОБРАЗОВАНИЯ И НАУКИ РФ |
ФЕДЕРАЛЬНОЕ ГОСУДАРСТВЕННОЕ АВТОНОМНОЕ ОБРАЗОВАТЕЛЬНОЕ УЧРЕЖДЕНИЕ ВЫСШЕГО ПРОФЕССИОНАЛЬНОГО ОБРАЗОВАНИЯ
«НАЦИОНАЛЬНЫЙ ИССЛЕДОВАТЕЛЬСКИЙ ТЕХНОЛОГИЧЕСКИЙ УНИВЕРСИТЕТ «МИСиС»
Кафедра металловедения и физики прочности
А.С. Мельниченко
Анализ данных в материаловедении
Часть 2. Регрессионный анализ
Учебное пособие
Допущено учебно-методическим объединением по образованию в области металлургии в качестве
учебного пособия для студентов высших учебных заведений, обучающихся по направлению Металлургия
Москва 2014
УДК 620.22 М48
Р е ц е н з е н т канд. техн. наук, доц. С.Н. Богданов
Мельниченко, А.С.
М48 Анализ данных в материаловедении. Ч. 2. Регрессионный анализ : учеб. пособие / А.С. Мельниченко. – М. : Изд. Дом МИСиС, 2014. – 87 с.
ISBN 978-5-87623-775-0
Во второй части пособия рассмотрены практические вопросы регресси- онного анализа, включая линейную и нелинейную регрессию, регрессию ор- тогональными полиномами, множественную регрессию. По всем темам при-
водятся краткие теоретические сведения и примеры решения реальных задач из металлургии и материаловедения в программе Excel. В пособие включены задания для самостоятельной работы.
Предназначено для выполнения курсовых и дипломных исследователь- ских работ бакалаврами и магистрами, обучающимися по направлениям «Ма- териаловедение» и «Металлургия». Может быть использовано аспирантами в области металлургии и материаловедения.
УДК 620.22
ISBN 978-5-87623-775-0 |
♥ А.С. Мельниченко, 2014 |
2
|
ОГЛАВЛЕНИЕ |
|
Предисловие.............................................................................................. |
4 |
|
6. |
Регрессионная модель.......................................................................... |
5 |
|
6.1. Метод наименьших квадратов ................................................... |
5 |
|
6.2. Анализ регрессионной модели................................................... |
6 |
|
6.3. Регрессионный анализ в программе Excel .............................. |
11 |
7. |
Линейная регрессия............................................................................ |
13 |
|
7.1. Линейная модель ....................................................................... |
13 |
|
7.2. Общая модель линейной регрессии......................................... |
20 |
|
7.3. Регрессия двумя функциями .................................................... |
28 |
8. |
Ортогональные базисные функции................................................... |
36 |
|
8.1. Регрессия ортогональными базисными функциями .............. |
36 |
|
8.2. Ортогональные полиномы........................................................ |
38 |
|
8.3. Ортогональные тригонометрические функции ...................... |
50 |
9. |
Нелинейная регрессия........................................................................ |
59 |
10. Множественная регрессия ............................................................... |
71 |
|
Библиографический список ................................................................. |
86 |
|
3
ПРЕДИСЛОВИЕ
Во второй части учебного пособия рассмотрены практические за- дачи регрессионного анализа. Цель второй части пособия, как и пер- вой [1], – дать возможность студентам, выполняющим курсовые и дипломные исследовательские работы, проводить регрессионный анализ, используя вычислительные средства Excel и не прибегая к другим программам и статистическим таблицам. Структура второй части пособия аналогична структуре первой части – краткое теорети- ческое введение и подробный разбор типичных примеров, заимство- ванных из материаловедческой практики. Более полно с теорией рег- рессионного анализа можно ознакомиться в учебнике [2] или фунда- ментальном труде [3].
Поскольку вторая часть пособия является продолжением первой, нумерация глав в обеих частях – сплошная, а ссылки в тексте на раз- делы и формулы из первой части даются без указания источника. Во второй части действует то же правило ссылок в формулах: если фор- мула или функция относится к диапазону ячеек, то она приводится только для верхней левой ячейки диапазона, а на остальные ячейки распространяется копированием.
4
6. РЕГРЕССИОННАЯ МОДЕЛЬ
6.1. Метод наименьших квадратов
Цель регрессионного анализа – построение по эксперименталь- ным данным аналитической (формульной) зависимости переменной Y – свойства – от независимой переменной Х – фактора. Предполага- ется, что зависимая переменная Y содержит случайную ошибку, при- чины которой многообразны, например, сам метод измерений, фик- сирующий случайный поток импульсов, влияние неучтенных в экс- перименте факторов, нестабильность работы измерительных прибо- ров и др. Фактор Х изменяется в определенных границах и не являет- ся случайным в том смысле, что ошибка его измерения много мень- ше интервала его варьирования. Зависимость между переменными Х и Y (математическая модель) ищется в виде
|
|
|
|
|
Y = F(β0 ,β1, ...,βp , X ) . |
|
|
|
(6.1) |
|||
Здесь F – известная функция переменной Х, содержащая |
|
p +1 |
неоп- |
|||||||||
ределенных независимых параметров β0 ,β1, ...,βp |
. Эти параметры |
|||||||||||
оцениваются по результатам n (n > p +1) |
пар наблюдений фактора Х |
|||||||||||
и зависимой переменной Y xi , yi (i =1, 2, ..., n) методом наименьших |
||||||||||||
квадратов (МНК). |
|
|
|
– значения b0 , b1 |
, ..., bp , ми- |
|||||||
МНК оценки параметров β0 |
,β1, ...,βp |
|||||||||||
нимизирующие сумму квадратов разностей наблюдаемых значений |
||||||||||||
свойства |
yi и |
рассчитанных по |
модели |
(6.1) |
|
величин |
||||||
Yi = F(b0 , b1, ..., bp , xi ) : |
|
|
|
|
|
|
|
|||||
|
|
|
n |
|
2 |
ì |
n |
|
|
|
ü |
|
|
2 |
|
å |
|
ï |
|
|
|
2 ï |
|
||
S |
= |
[ yi -Yi |
] = min |
ï |
é yi - F |
(β0 ,β1, ...,βp , xi )ù |
|
ï |
(6.2) |
|||
|
í |
|
ý . |
|||||||||
|
|
|
|
β0 ,...,βp |
|
ê |
|
ú |
|
ï |
|
|
|
|
|
|
ïåë |
|
û |
|
|
||||
|
|
|
i=1 |
|
|
î |
|
|
|
|
þ |
|
|
|
|
|
|
ï i=1 |
|
|
|
ï |
|
||
Уравнение (6.1) |
называется |
уравнением регрессии, |
функция |
F(β0 ,β1, ...,βp , X ) |
– функцией регрессии, а оценки b0 , b1, ..., bp – |
||
коэффициентами регрессии. |
|
|
|
Если функция |
регрессии |
линейна относительно параметров |
|
β0 ,β1, ...,βp : |
|
|
|
F(β0 ,β1, ...,βk , X ) =β0 +β1 f1(X ) + ... +βp fp (X ) , |
(6.3) |
||
5
то регрессия называется линейной. В противном случае – нелинейной. В моделях линейной регрессии все функции f1(X ), f2 (X ), ..., fp (X ) ,
называемые базисными, полностью определены, а оцениваемые па- раметры β0 ,β1, ...,βp не являются их аргументами. Такая структура
функции регрессии позволяет рассчитать p +1 коэффициент регрес- сии b0 , b1, ..., bp путем решения системы линейных уравнений неза-
висимо от вида базисных функций. В моделях нелинейной регрессии нет единого метода расчета коэффициентов регрессии; в большинст-
ве случаев минимизация суммы S2 (6.2) по параметрам β0 ,β1, ...,βp проводится численно.
6.2. Анализ регрессионной модели
После расчета коэффициентов регрессии b0 , b1, ..., bp проводится анализ качества полученной модели, поскольку даже при наилучших МНК оценках рассчитанные по модели значения Yi = = F(b0 , b1, ..., bp , xi ) могут значительно отличаться от наблюдаемых yi , если сама функция регрессии F(β0 ,β1, ...,βp , X ) выбрана неудачно.
Используются следующие характеристики качества регрессион- ной модели:
Остаточная дисперсия
|
|
1 |
n |
|
|
|
|
s2 |
= |
å |
(y |
-Y )2 . |
(6.4) |
||
|
|||||||
n- ( p +1) |
|||||||
e |
|
i |
i |
|
|||
|
|
|
|
|
|||
|
|
|
i=1 |
|
|
|
|
Остаточная дисперсия – дисперсия наблюдений yi |
относительно мо- |
||||||
дели, характеристика разброса наблюдений вокруг модели. Число, стоящее в знаменателе,
νe = n −( p +1) |
(6.5) |
называется числом степеней свободы (ч.с.с.) остаточной дисперсии.
Остаточная дисперсия и остаточное стандартное отклонение
|
|
|
1 |
n |
|
|
|
|
s = |
s2 |
= |
å |
(y |
-Y )2 |
(6.6) |
||
|
||||||||
n- ( p +1) |
||||||||
e |
e |
|
i |
i |
|
|||
|
|
|
|
|
|
|||
|
|
|
|
i=1 |
|
|
|
служат для сравнения различных регрессионных моделей и для вы- числения других характеристик качества модели.
6
Множественный коэффициент детерминации
|
n |
|
|
||||
|
å(Yi - |
|
|
)2 |
|
|
|
|
y |
|
|
||||
R2 = |
i=1 |
, |
(6.7) |
||||
n |
|||||||
|
å( yi - |
|
)2 |
|
|
||
|
y |
|
|
||||
i=1
n
где среднее y = 1 å yi . Коэффициент R2 ( 0 ≤ R2 ≤1) характеризу-
n i=1
ет долю суммы квадратов отклонений наблюдений yi от среднего y , объясняемую регрессионной моделью. Коэффициент
|
n |
|
||||
|
å(Yi - |
|
|
)2 |
|
|
|
y |
|
||||
R = |
i=1 |
(6.8) |
||||
n |
||||||
|
å( yi - |
|
)2 |
|
||
|
y |
|
||||
i=1
называется множественным коэффициентом корреляции. Это пар-
ный коэффициент корреляции между наблюдаемыми yi и предска- занными моделью Yi значениями: R = ryY (его также можно рассчи- тать по (5.4) именно как ryY). Если R2 и R близки к единице, то пред- сказанные величины Yi близки к наблюдаемым yi. Наблюдения yi со- держат случайные ошибки. Поэтому модель с высокими R2 и R, но малым числом степеней свободы νe, необязательно наилучшая. Кро- ме функциональной зависимости свойства от фактора, такая модель может описывать и случайные отклонения от нее.
F-критерий значимости регрессии
|
F = |
sr2 |
. |
|
|
(6.9) |
|||
|
|||||||||
|
|
|
s2 |
|
|
||||
|
|
|
e |
|
|
||||
Здесь sr2 – средний квадрат отклонений модели от среднего |
|
(сред- |
|||||||
y |
|||||||||
ний квадрат, обусловленный регрессией): |
|
|
|||||||
|
|
n |
|
|
|||||
sr2 = |
1 |
å(Yi - |
|
)2 . |
(6.10) |
||||
y |
|||||||||
p |
|||||||||
|
|
i=1 |
|
|
|||||
Число его степеней свободы
7
νr = p . |
(6.11) |
Если дисперсия в числителе значимо больше дисперсии в знаменате- ле F-критерия (6.9), то регрессионная модель описывает наблюдения значимо лучше, чем просто среднее y . По постановке задачи F-критерий (6.9) является односторонним, поэтому риск ошибочного отклонения гипотезы о равенстве дисперсий (уровень значимости критерия) α(F) вычисляется как
¥ |
|
α(F) = ò wF (u)du , |
(6.12) |
F
где wF (u) – плотность распределения Фишера. Если риск (6.12) мал (например, меньше 0,05), то дисперсия sr2 значимо больше остаточ- ной дисперсии se2 и регрессия значима.
Значимость коэффициентов регрессии
Коэффициенты регрессии b0 , b1, ..., bp рассчитываются по резуль-
татам эксперимента, содержащим случайные ошибки, поэтому сами являются случайными величинами – оценками некоторых истинных значений. Как и всякие оценки, они могут незначимо отличаться от нуля. Для проверки этого рассчитываются их стандартные ошибки. В моделях линейной регрессии (6.3) эти ошибки
sbj = cjj se , |
(6.13) |
где коэффициенты cjj вычисляются в процессе решения системы ли- нейных уравнений для коэффициентов регрессии. Ниже в отдельных
случаях приводятся явные выражения для sb .
j
Далее вычисляются t-критерии коэффициентов регрессии
tj = |
bj |
(6.14) |
|
s |
|||
|
|
||
|
bj |
|
и риск ошибочного отклонения гипотезы о равенстве нулю коэффи- циента регрессии (уровень значимости t-критерия) α(tj ) (2.5) с ч.с.с. остаточной дисперсии νe . Если уровень значимости α(tj ) превосхо- дит некоторое заданное значение, то коэффициент регрессии bj не- значимо отличается от нуля, и его можно приравнять к нулю. Ис- ключение части коэффициентов регрессии упрощает модель, но из- меняет саму модель. Поэтому после исключения надо повторить всю процедуру регрессионного анализа с новой моделью.
8
Анализ остатков. Остатками называются разности между наблю- даемыми yi и рассчитанными по модели Yi значениями зависимой переменной:
ei = yi -Yi . |
(6.15) |
Метод наименьших квадратов предполагает, что остатки являются нормально распределенными случайными величинами. Если единст- венная причина отклонения модели от наблюдений – эксперимен- тальный случайный разброс, то и последовательность остатков явля- ется случайной. Для проверки этого строится точечный график зави- симости остатков ei от значений фактора xi. Точки на графике долж-
ны только случайно отклоняться от нулевой линии и располагаться без видимых закономерностей, трендов или периодичностей. Если это не так, то регрессионная модель не полностью описывает зави- симость свойства от фактора и является неадекватной.
Для оценки близости распределения остатков к нормальному рас- пределению строится нормальный вероятностный график. Сначала определяется ранг остатка j ( j =1, 2, ..., n ) – его номер в упорядочен-
ном по возрастанию ряду остатков, затем по величине ранга j рас-
считывается квантиль нормального распределения
|
|
-1 |
æ |
3 j -1 |
|
|
ö |
|
|
|
|
|
|
|
|||||||
W |
|
ç |
|
|
÷ |
|
|
|||
|
|
|
|
|||||||
|
ç |
|
|
÷ |
|
|
||||
|
è3n +1 |
,e,ser ÷ |
|
|||||||
z( j) = |
|
|
ø |
, |
(6.16) |
|||||
|
|
|
|
|
|
|||||
ser
где W−1 – обратная функция нормального распределения с выбороч-
n
ным средним остатков e = åei и выборочным стандартным откло-
i=1
нением остатков
|
|
|
|
n |
|
||
ser = |
1 |
|
å(ei - |
|
)2 . |
(6.17) |
|
|
|
e |
|||||
n- |
1 |
||||||
|
|
|
|
i=1 |
|
||
Далее строится точечный график в координатах е – z. Если рас- пределение остатков близко к нормальному, точки на этом графике группируются около прямой. Если точки систематически отклоняют- ся от прямой (часто в виде буквы S), то распределение остатков от- личается от нормального.
9
Выбросы. Выбросами среди остатков считаются остатки, значи- тельно превосходящие по абсолютной величине все остальные. В
точках выбросов различие между наблюдениями и регрессионной моделью аномально велико. Причинами выбросов могут быть ошиб- ки эксперимента или регистрации и подготовки данных, влияние не- учтенных в модели факторов и, как редкое исключение, неизвестные ранее локальные особенности зависимости свойства от фактора. Если остатки распределены нормально, критерием выбросов может слу- жить максимальное относительное отклонение (т.е. стандартизован- ное значение)
ξ = |
|
|
em - |
|
|
|
|
|
|
|
e |
|
|
|
, |
(6.18) |
|||
|
|
|
|||||||
|
|
ser |
|
|
|
||||
|
|
|
|
|
|
|
|
||
где еm – максимальный или минимальный остаток. Первоначально
подозрительными на выбросы можно считать стандартизованные остатки ξ > 2 , если число данных n ≤ 5, ξ > 2,3, если 5 < n ≤ 15 и ξ > 2,5, если n > 15 . Далее следует воспользоваться критерием максимального относительного отклонения (6.18), как это описано в п. 3.2. Исключая наблюдение, признанное выбросом, следует изучить все возможные причины большого отклонения наблюде- ния от модели, а не только руководствоваться величиной крите-
рия (6.18).
Влияющие наблюдения. Влияющее наблюдение – пара xi, yi, которая одна вносит непропорционально большой вклад в коэффициенты рег- рессии. Исключение такого наблюдения из анализа приводит к значи- тельному изменению коэффициентов регрессии. Наличие влияющих наблюдений – недостаток модели. Надежная регрессионная модель не должна слишком сильно зависеть от отдельного наблюдения.
Влияющими наблюдениями могут оказаться пары xi, yi с крайними значениями фактора, особенно, если эти значения далеки от основ- ной совокупности, т.е. являются выбросами фактора. Для проверки модели на наличие влияющих наблюдений надо поочередно исклю-
чить из нее пары с наименьшим и наибольшим значением фактора и повторить регрессионный анализ без них. Если наблюдение не влияющее, то коэффициенты регрессии модели с исключенным на-
блюдением не должны значительно отличаться от коэффициентов полной модели, а графики обеих функций регрессии должны прохо- дить примерно одинаково.
10
