Моделирование процессов и систем. Учебное пособие
.pdf31
Вторая составляющая общей дисперсии – второе слагаемое в правой части выражения (47) – характеризует рассеяние значений yˆ j ,
предсказываемых по регрессионной модели. Однако рассеяние значений регрессии происходит только вследствие наклона регрессионной поверхности, который определяется величинами коэффициентов регрессии. Таким образом, сумма квадратов QR представляет ту часть рассеяния переменной y, которая в основном обусловлена влиянием объясняющих переменных x=(x1, x2, … , xm ), включенных в модель. В связи с этим QR называют объясненной суммой квадратов или суммой квадратов, обусловленной регрессией.
Коэффициент детерминации
При анализе регрессионной модели существенное значение имеет понимание того, хорошо ли полученное уравнение описывает отклик как функцию факторов.
Подбор регрессионной зависимости осуществляется на основе соображений профессионально-теоретического характера, а вычисленные оценки параметров, входящие в уравнение регрессии, наиболее хорошо согласуются с опытными данными. Критерий соответствия регрессии опытным данным заложен в требовании наименьших квадратов.
Результаты различных выборок имеют различное рассеяние. Поэтому может случиться, что построение регрессионной зависимости одного и того же экономического смысла по данным двух выборок из одной и той же генеральной совокупности приведет к различным уравнениям. Степень соответствия этих уравнений опытным данным, несмотря на одинаковый тип зависимости, может быть различна. Однако критерий метода наименьших квадратов имеет недостаток: хотя его нижняя граница равна нулю, верхняя граница не может быть указана. Поэтому для оценки степени соответствия регрессии имеющимся эмпирическим данным он не может использоваться. Желательно иметь в распоряжении показатель, отражающий, в какой мере функция регрес-
сии определяется объясняющими переменными, содержащимися в ней. В качестве такого показателя обычно используется R2 – коэффициент детерминации (мера определенности).
Рассмотрим вначале коэффициент детерминации для простой линейной регрессии, называемый также коэффициентом парной де-
терминации.
На основе соображений, изложенных в предыдущем разделе, относительно легко найти меру точности оценки регрессии. Определить
32
эту меру можно, используя разложение общей суммы квадратов Q на две составляющие – на "необъясненную" сумму квадратов QОСТ и сумму квадратов QR, обусловленную регрессией. Чем больше QR по сравнению с QОСТ, тем больше общая вариация выходной величины формируется за счет влияния объясняющей переменной x, и, следовательно, связь между двумя переменными у и х более интенсивная.
Очевидно, что в качестве показателя интенсивности связи между зависимой и объясняющей переменными или оценки степени влияния переменной x на у можно использовать отношение
R2 |
QR |
. |
(52) |
|
|||
|
Q |
|
|
Это отношение указывает, какая часть общего (полного) рассеяния значений у обусловлена изменчивостью переменной х. Чем большую долю в общей дисперсии составляет QR, тем лучше выбранная функция регрессии соответствует эмпирическим данным. Чем меньше эмпирические значения зависимой переменной отклоняются от прямой регрессии, тем лучше определена функция регрессии. Отсюда происходит и название отношения (52) – коэффициент детерминации R2 . Иногда для этого отношения используется обозначение Вух. Индекс при коэффициенте детерминации указывает на переменные, связь между которыми изучается.
Учитывая соотношение
QR = Q – QОСТ,
коэффициент детерминации можно представить в виде:
R2 1 QОСТ .
Q
Из определения коэффициента детерминации как относительной доли очевидно, что он всегда заключен в пределах от 0 до 1:
0 R2 1.
Если R2 = 1, то все эмпирические значения уj лежат на регрессионной прямой. Это означает, что y j yˆ j для всех j = 1,...,N, и, сле-
довательно, QОСТ = 0. В этом случае говорят о строгом линейном соотношении (линейной функции) между переменными у и х. Если R2 =0, вариация, обусловленная регрессией, равна нулю, а "необъясненная" дисперсия равна общей сумме квадратов. В этом случае yˆ j y . Линия
33
регрессии тогда параллельна оси абсцисс. Никакой численной линейной зависимости переменной у от х в статистическом ее понимании не может быть. Коэффициент регрессии при этом незначимо отличается от нуля.
Таким образом, чем больше R2 приближается к единице, тем лучше определена регрессия.
Коэффициент детерминации есть величина безразмерная, и поэтому он не зависит от изменения единиц измерения переменных у и х (в отличие от параметров регрессии). Коэффициент детерминации не реагирует на преобразование переменных.
Если изучаемое явление зависит не от одного, а от нескольких факторов, то зависимость между ними описывается с помощью множественной регрессии, а для установления доли дисперсии, обусловленной воздействием изменений объясняющих переменных, вычисляется
коэффициент множественной детерминации.
Выражение коэффициента множественной детерминации можно получить простым обобщением формулы (52) с учетом особенностей множественной регрессии. При этом у является зависимой переменной и вариабельность всех объясняющих переменных х1, ..., хт рассматривается одновременно в изучаемой регрессии.
Интерпретация R2 аналогична интерпретации коэффициента детерминации для простой линейной регрессии. Коэффициент детерминации указывает, как велика доля объясненной дисперсии в общей дисперсии, какая часть общей дисперсии может быть объяснена зависимостью переменной у от переменных xl, ..., хт.
Величина коэффициента множественной детерминации показывает, в какой степени исследуемая регрессия определена включенными в нее объясняющими переменными, т.е. R2 показывает, насколько предсказание по регрессионной модели лучше, чем по среднему значению отклика y . Если коэффициент детерминации слишком мал, то
нужно искать другие факторы (входные переменные), причинно обусловливающие зависимую переменную.
В статистической литературе R2 называют выборочным коэф-
фициентом множественной корреляции. Его можно рассматривать как оценку коэффициента множественной корреляции , определен-
ного следующим образом:
2 1 |
2 |
y |
|
x , x ,..., x |
|
|
|
|
|
|
|
||||||
|
|
|
1 2 |
m |
|
, |
(53) |
|
|
|
|||||||
|
|
|
2 |
|
|
|||
|
|
|
|
|
|
|
|
|
|
|
|
|
y |
|
|
|
|
|
|
|
|
34 |
где 2 y |
|
x , x ,..., x |
– условная дисперсия y при заданных |
|
|
||||
|
|
1 2 |
m |
|
x1,x2,…,xm , а 2y – дисперсия наблюдаемых значений у.
Если представить коэффициент множественной детерминации в
виде:
R |
|
1 |
|
|
2 |
QОСТ |
|
|
|
|
N |
|
Q |
||
|
|
|
, |
|
|||
|
|
N |
|
то можно Qост/N рассматривать как оценку 2 (y|x1. x2,..., xm), a Q/N
– как оценку 2y, значит, R2 — оценка 2.
Термин "коэффициент множественной корреляции" связан с тем, что R2 можно рассматривать как обыкновенный коэффициент корреляции между у и yˆ , который показывает степень линейной статистиче-
ской зависимости между наблюдаемыми значениями отклика уj и их предсказаниями по модели
Полученная оценка коэффициента множественной корреляции оказывается смещенной, поскольку число степеней свободы для
ОСТ = N — k, а число степеней свободы для Q равно N – 1. Из-за этого иногда используют скорректированный выборочный коэффи-
циент множественной детерминации, основанный на несмещенных оценках 2 (y|x1. x2,..., xm) и 2y . Он записывается так:
2 |
|
Q |
|
|
Q |
|
|
R |
1 |
ОСТ |
|
|
|
|
, |
|
|
|
|||||
|
N k |
N 1 |
|
||||
или |
N 1 |
|
|
R2 1 1 R2 |
. |
||
|
|||
|
N k |
||
|
|
||
Следует отметить, что коэффициент детерминации удовлетворительно отвечает своему назначению при достаточно большом числе наблюдений.
Ошибки в определении структуры модели
Одна из наиболее важных величин в дисперсионном анализе остатков — это s2ОСТ. Она представляет собой несмещенную оценку
дисперсии 2 случайного возмущения , если модель постулирована априори верно. При ошибочном выборе структуры модели это утверждение может оказаться ошибочным.
35
При ошибочном выборе модели возможны два случая:
постулируемая модель имеет меньше коэффициентов, чем действительная;
избранная модель содержит больше коэффициентов, чем действительная.
Начнем с рассмотрения первого случая.
Предположим, что действительная модель объекта такова:
Е(у) = F + F1 1,
вто время как для оценивания выбрана модель
Е (у) = F .
Тогда вектор оценок коэффициентов выбранной модели будет иметь вид:
b= (FTF)-1FTy,
аего математическое ожидание равно:
Е(b) = (FT F)-1 FT Е (у) = (FT F)-1 FT (F + F1 1) =
=(FT F)-1 FT F + (FT F)-1 FT F1 1 = + D 1 ,
где D = (FT F)-1 FT F1.
Видно, что вектор b оказался смещенной оценкой . И смещение равно нулю, только если верна выбранная модель, т. е. если 1 = 0.
Еще можно показать, что b — несостоятельная оценка . Неправильный выбор модели приводит также к смещению оцен-
ки дисперсии случайного возмущения. Как показано в [3], при выборе
модели Е (у) = F вместо действительной модели Е (у) = F + F1 1 математическое ожидание остаточной дисперсии оказывается равным:
2ОСТ = E (s2ОСТ) = |
|
|
|
|
|
= 2 + (1/(N – k )) |
T (F – FD )T |
(F – FD ) |
. |
(54) |
|
1 |
1 |
1 |
1 |
|
|
Отсюда следует, что s2ОСТ будет несмещенной оценкой диспер-
сии 2, только если выбранная модель верна, т. е. если 1 = 0. Во втором случае, наоборот, действительная модель
Е (у) = F ,
авместо нее используется
Е(у) = F + F1 1,
т. е. вторая часть модели излишняя.
36
Вэтом случае МНК-оценивание можно провести по формуле
= (ZTZ)-1ZTy,
где Z=[F:F1,]; T = (b:b1).
Можно показать [3], что оценивает вектор несмещенно, т. е.
Е (b) = , и Е (b1,) = 0.
Это означает, что оценки "лишних" коэффициентов b1 могут отличаться от нуля только из-за случайных возмущений. Такие коэффи-
циенты называют незначимыми. Еще можно показать, что оценка b со-
стоятельна, а
|
|
N |
2 |
|
|
|
|
|
|
y j yˆ j |
|
s2 |
|
j 1 |
|
|
|
||
ОСТ |
|
|
N p |
|
|
|
|
служит несмещенной оценкой для 2. В последней формуле
p |
|
yˆ j i fij |
и р – число элементов вектора . |
i1
Сдругой стороны, матрица дисперсий - ковариаций оценок b
равна:
V (b) = V (b*) 2 A-1 ,
где V (b*) = (FTF)-1 2 — дисперсионная матрица оценок, которая получилась бы при правильном выборе модели; А – неотрицательно определенная матрица, связанная с матрицами F и F1 и их произведениями вида FTF1. Поэтому можно записать:
V (b) V (b*).
Обозначение V (b) V (b*) равнозначно выполнению соотношений
|V(b)| |V(b*)| и trV(b) trV(b*).
Следовательно, включение в модель лишних коэффициентов
снижает эффективность оценивания, уменьшая точность. Этого можно избежать, если подходящим планированием эксперимента сделать матрицы F и F1 ортогональными, т. е. обеспечить FTF1 = 0, откуда будет обеспечено V (b) = V (b*).
37
При сравнении этих двух случаев становится ясно, что первый из них приводит к более серьезным последствиям для результатов иссле-
дования, поскольку смещение может привести к неправильному предсказанию отклика. Поэтому при проверке адекватности регрессионной зависимости основное внимание направлено на недопущение модели с меньшим числом коэффициентов, чем требуется.
Проверка адекватности регрессионной модели
Уравнение (54) дает ключ к созданию процедуры проверки адекватности модели. Оно показывает, что остаточная дисперсия s2ОСТ образуется по двум причинам:
влияние случайного возмущения ; оно представлено в (54) дисперсией 2;
влияние неадекватности модели; она отражается в элементе:
(1/(N – k )) 1T (F1 – FD )T (F1 – FD ) 1 .
Чаще всего процедуры проверки адекватности модели состоят в сравнении s2ОСТ с независимой от нее оценкой s2 дисперсии случайного возмущения 2. Если s2ОСТ соизмерима с s2, влияние неадекватности можно считать незначительным, если же s2ОСТ существенно больше, чем s2, то этим влиянием нельзя пренебречь и модель приходится счи-
тать неадекватной.
Независимую оценку s2 можно получить из параллельных опытов. Один из самых распространенных способов — выбрать в факторном пространстве одну точку (т. е. определить некоторый режим с фиксированными значениями входных факторов) и провести в ней несколько независимых опытов, результаты которых не используются при оценивании регрессионных коэффициентов, а применяются только при вычислении s2.
Пусть в фиксированной точке факторного пространства (обычно это центр факторного пространства) проведены п дополнительных опытов с результатами y1g , y2g , ..., yng . Поскольку условия проведения опытов оставались неизменными, результаты отражают только влияние случайных ошибок. Дисперсия этих опытов равна:
s2 = Q / , |
(55) |
|
n |
2 |
|
y jg yg ; |
|
где Q |
|
|
|
j 1 |
|
38
n |
|
|
|
yg 1 n y jg ; |
n 1. |
|
|
j 1 |
|
|
|
Теперь проверим гипотезу H |
: Е (s2 |
) = 2. Согласно свойст- |
|
|
0 |
|
ОСТ |
ву 8 оценок метода наименьших квадратов распределение отношения QОСТ/ 2 так же, как и отношения s2ОСТ/ 2, — распределение 2. Отношение s2/ 2 также имеет распределение 2, поскольку Q — сумма квадратов нормально распределенных случайных величин. Известно,
что отношение двух случайных величин с распределением 2 имеет распределение Фишера. Поэтому величина
F = (s2ОСТ/ 2) / (s2/ 2) = s2ОСТ/s2
имеет распределение Фишера с vОСТ и v степенями свободы. Следовательно, процедуру проверки адекватности регрессионной
модели можно сформулировать следующим образом.
1. После оценивания регрессионных коэффициентов вычисляется
QОСТ , а также s2ОСТ = QОСТ / vОСТ , где vОСТ = N — k.
2. Проводится п дополнительных опытов, и по выражению (55) получается независимая оценка дисперсии случайной ошибки s2.
3.Вычисляется дисперсионное отношение F = s2ОСТ/s2.
4.При заданных уровне значимости . и числах степеней свободы vОСТ и v из таблицы распределения Фишера берут величину
FT = F ( , vОСТ, v ).
5. Сравниваются величины F водов:
если F FT , модель считается адекватной, так как в указан-
ном случае гипотеза о равенстве 2ОСТ и 2 не отвергается, т. е. они могут считаться соизмеримыми, а следовательно, неадекватность не отразилась существенно на вычислении s2
если F > FT , модель неадекватна, поскольку 2ОСТ значительно больше, чем 2, и неадекватность сыграла существенную роль при
формировании s2ОСТ.
Применяя рассмотренную процедуру, надо иметь в виду некоторые моменты.
Уровень значимости , как известно, представляет собой вероятность ошибки первого рода, т. е. вероятность отвергнуть гипотезу об
адекватности модели, когда на самом деле она верна. Величина обычно задается в границах от 0,01 до 0,1, но чаще всего используется
39
= 0,05. Выбор условен и отражает согласие исследователя принимать модели с большей или меньшей точностью. Поэтому при выборе такой вероятности допускается известная свобода, но все-таки она не должна выходить за указанные выше границы.
Числа степеней свободы vОСТ и v зависят от числа опытов. При очень малом числе опытов выводы обычно недостаточно надежны,
поэтому экспериментатор должен стремиться к достижению хотя бы 5 степеней свободы и для числителя, и для знаменателя. Увеличение числа степеней свободы всегда желательно.
Иногда может получиться s2ОСТ < s2. Тогда дисперсионное отношение меньше единицы, что не позволяет проверить гипотезу адекватности. В этом случае можно построить обратное соотношение
F= s2 / s2 ОСТ
ипри уровне значимости и числах степеней свободы v = п - 1 и vОСТ = N – k по таблице распределения Фишера найти FT = F ( , v , vОСТ), после чего сделать один из следующих двух выводов.
Если F FT , гипотеза о равенстве 2 и 2ОСТ не отвергается, значит, модель адекватна.
Если F > FT , кажется уместным принять, что 2 > 2ОСТ. Но это невозможно, если придерживаться предположений регрессионного
анализа, так как в соответствии с (54) 2ОСТ образуется как под влиянием 2, так и из-за неадекватности. Второй член в правой части (54) всегда неотрицателен, потому что матрица ( F1 – FD )T (F1 – FD ) положительно полуопределена. Следовательно, 2 не может быть
больше 2ОСТ.
Таким образом, причиной получения неравенства F > FT может быть или грубая ошибка в вычислениях, или неадекватность условий проведения опытов по определению s2 и s2ОСТ. То же самое может получиться и при неоднородности (гетероскедастичности) дисперсий отдельных наблюдений. Появление такой ситуации требует тщательного исследования всех возможных ошибок.
При констатации неадекватности модели надо изменить ее структуру и заново собрать данные. Например, если полином первой степени оказался неадекватным, надо перейти к модели второй степени.
Повышение степени полинома сверх необходимого не приводит к повышению точности предсказания. В таком случае модель начнет следовать случайным отклонениям наблюдений от их математических
40
ожиданий. Кроме того, при включении в модель многих лишних членов затрудняется обработка данных, требуется увеличение числа на-
блюдений и уменьшается число степеней свободы при проверке адек-
ватности.
Описанная процедура требует при проверке адекватности проведения дополнительных опытов в заданной точке факторного пространства для определения s2. Если в эксперименте уже есть параллельные опыты, т. е. опыты, повторенные для рассматриваемых комбинаций независимых переменных, оценивать дисперсию ошибки можно по ним, без дополнительных наблюдений.
Доверительные интервалы для коэффициентов регрессии
Полученные по МНК оценки коэффициентов регрессии называют точечными, поскольку на числовой оси возможное значение данного коэффициента представляет одна точка. Но особенно интересен вопрос о том, насколько эти точечные оценки отличаются от соответствующих им истинных значений. Ответ можно получить, если построить доверительные интервалы для коэффициентов.
Доверительным интервалом данной случайной величины bi называют интервал с границами bi - и bi + , в которых с наперед заданной вероятностью 1 – заключено истинное значение i.
bi - bi i bi +
Рис. 6. Доверительный интервал
На рис. 6 показана ось всех возможных значений i-гo коэффициента регрессии, и для него построен доверительный интервал. Вероят-
ность 1 – называется доверительной вероятностью, а , как обычно, – уровнем значимости.
При построении доверительных интервалов надо иметь в виду, что в соответствии со свойствами 7 и 9 оценки регрессионных коэффициентов b1, b2,..., bk имеют нормальное распределение и независимы от s2ОСТ. В таком случае отношение
ti = | bi - i | / s(bi) |
(56) |
имеет распределение Стьюдента ( t-распределение ) с числом степеней свободы, соответствующим s(bi). Однако из (28) следует, что
