Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Методы обработки и анализа экспериментальных данных. Учебное пособие

.pdf
Скачиваний:
0
Добавлен:
07.09.2026
Размер:
2 Мб
Скачать
☆
и ошибки изменения у. Аналитически зависимость, соответствующая этой структурной схеме, записывается в виде
y = F(x,a) + ε,
гдеa – вектор неизвестных коэффициентов; х – вектор входных переменных
х = (х1, х2, …, хn).
Задача статистического анализа заключается в том, чтобы по экспериментальным данным х и у определить в некотором смысле оптимальные значения коэффициентов вектора а.
Этап топологической идентификации в этой модели сводится к выбору влияющих наиболее существенно на у входных переменных, то есть к формированию вектора х.
Структурная идентификация заключается в выборе аналитического выражения для оператораF с точностью до конечного числа неизвестных коэффициентов вектора а. Если операторFможет быть записан в виде функции, линейной относительно неизвестных коэффициентов, то есть в виде
y = a0+a1f1(x)+a2f2(x)+…+amfm(x)+ε,
то такая модель называется регрессионной, а для ее анализа и оценки коэффициентовaj; j =  при определенных дополнительных ограничениях применяются методы и процедуры регрессионного анализа. Значения функцииfj(x )полностью определены и могут представлять собой выражения типа: х1, х
x2
1
, х
2
,lnх
1
1,х1х2
и т.д. Важно, что в составе этих функций нет
неизвестных коэффициентов.
Еще раз отметим, что данная модель является нелинейной относительно переменных х и линейной относительно неизвестных коэффициентов а.
Для определения неизвестных коэффициентов регрессионной модели, которые принято называть коэффициентами регрессии, собирается экспериментальный материал, отражающий конкретные значения переменных х и соответствующих им значений у. Как и ранее, число наблюдений обозначим
N. Для надежной оценки коэффициентов а, необходимо чтобыN было намного
51
больше, чем количество оцениваемых коэффициентов m+1. По крайней мере,
.;1 N
n;1
.;1 N
y
x1 x2
x3=x
1
2
x4=x1 x2
y1
x
11 x21
x
31 x41 y2 x12 x22
x
32 x42
… … …
… …
yn
x1n
x2n
x
3n x4n
требуетсяN>10(m+1).
Уравнения регрессионной модели часто записывают с индексом i, соответствующим конкретному наблюдению
yi=a0+a1f1(xi)+a2f2{xi)+... + amfm{xi)+εi; i =
Два последних уравнения часто называют моделью множественного нелинейного регрессионного анализа.
Еслиfj(x) = xj, j=
,
То имеем
yi = a0 + a1x1i + a2x2i + … + anxni + εi; i =
Эта модель называется моделью линейного множественного регрессионного анализа.
В математическом плане принципиальных отличий между этой и предыдущей моделью нет, ибо предыдущая модель сводится к линейной путем простой замены переменных
zmi = fm(xi).
Массив исходных данных (выборка) перед статистическим анализом пересчитывается и дополняется с учетом выбранной нами функции fj(xi).
Пример.
y = a1x1 + a2x2 + a3x
2
+ a4x1x2.
1
Имеется выборка
Как видим, таблица исходных данных дополняется новыми переменными х3и х4.
52
Если входная переменная одна, то часто говорят о линейном
.min))
ˆ
,(()
ˆ
(
ˆ
2
1
2
1

a
i
N
i
ii
N
i
i
axFyyyQ
0
i
da
dQ
.,1 mj
.2
2
1
10
...
m
m
xaxaxaya
одномерном регрессионном анализе. Хотя разницы между линейной и нелинейной регрессией, многомерной и одномерной регрессией в принципе практически нет.
Рассмотрим два уравнения.
yi = a0 + a1x1 + εi – линейная модель,
yi = a0 + a1f1(xi) + a2f2(xi)+…+εi – нелинейная модель.
Из приведенного выше примера видно, что нелинейная одномерная регрессия ничем по своей структуре не отличается от модели множественного регрессионного анализа.
12. Оценка коэффициентов регрессии методом наименьших
квадратов
Ранее говорилось, что статистическая оценка коэффициентов регрессии определяется оптимальным образом. Как правило, оптимальность оценивается по критерию наименьших квадратов отклонения истинных от спрогнозированных значений выходной величины
Уравнения для вычисления неизвестных коэффициентов а из критерияQмогут быть получены путем взятия частных производных по всем коэффициентам ajс последующим приравниванием к нулю полученных уравнений, т.е.
;
Как правило, из этих уравнений находят коэффициенты a1, а2 и т.д., свободный член а0 вычисляется как
53
Поэтому уравнения для критерияQ относительно х берутся
1
)(
ˆ
T
XXyXa
,
ˆ
1
xxyx
KKa
y
ˆ
центрированными, то есть в исходной выборке из каждой переменной вычитается средняя.
Можно доказать, что система уравнений для оценки регрессионных коэффициентов а1,...,ат может быть записана в матричном виде
,
где у – вектор-строка наблюдений за выходной переменнойy = (y1,…,yN);X – матрица наблюдений за входными переменными размерностью N т.
Несложно показать, что эта система уравнений эквивалентна выражению
гдеКух – вектор-строка коэффициентов ковариации входной переменной у с входными переменными X и/или функциями от них;
К
– ковариационная матрица входных переменных и/или функции от
хх
них.
13. Точность регрессионных моделей
Для оценки качества регрессионного уравнения прибегают к оценке его прогнозирующей способности, т.е. оценивают, на сколько точно с использованием регрессионного уравнения по входным переменным X можно прогнозировать выходную переменную у. Естественно предполагается, что коэффициенты регрессии аj; j = 0,1,...,m уже найдены, а, следовательно, уравнение регрессии полностью определено. Пусть
=(хi, а) –
прогнозированное по уравнению регрессии значение переменной у в i-м наблюдении. Тогда точность расчета переменной yможно рассчитывать по формуле
54
.));((
1
1
)
ˆ
(
1
1
ˆ
2
1
2
1
2
axFy
N
yy
N
i
N
i
ii
N
i
iост
ост
2
ˆ
y
2
ˆ
ост
2
ˆ
ост
2
ˆ
y
2
ˆ
ост
ˆ
y
ˆ
i
y
ˆ
y
ˆ
ост
2
ˆ
R
ˆ
Сравнивая дисперсию исходной случайной величины у с остаточной дисперсией, можно сделать заключение о качестве прогнозирующих свойств уравнения регрессии. Чем меньше
относительно исходной дисперсии, тем лучше прогнозирующеесвойство регрессионной модели, т.е. тем точнее по численным значениям переменной X и уравнению регрессии можно предсказать значение переменной у. Следует отметить, что остаточная дисперсия всегда меньше исходной дисперсии переменной у, т.е.
≥
Для количественной оценки прогнозирующих свойств регрессионного уравнения часто пользуются отношением
1 ≥
≥ 0 или 1 ≥
≥ 0.
Равенство этих показателей нулю свидетельствует о том, что уравнение
регрессии абсолютно точно предсказывает значение у по заданным переменным X, т.е. для всех наблюдений i имеет место yi=
, и остаточная
.
дисперсия равна нулю. Равенство этих показателей единице свидетельствует о полном отсутствии прогнозирующих способностей полученного уравнения
регрессии, ибо равенство
=
свидетельствует о том, что неправильно
выбрана структура уравнения регрессии. Промежуточные значения приведенных выше отношений свидетельствуют о степени точности прогнозирующих свойств уравнения, причем, чем больше эти показатели превышают нуль, тем более точно можно прогнозировать выходную переменную по входным.
Другим показателем качества прогноза является множественный
коэффициент корреляции
. Он характеризует корреляцию выходной
переменной у с включенными в уравнение переменными X и их различными нелинейными комбинациями, если таковые присутствуют. Коэффициент множественный корреляции можно рассчитать по формуле
55
).
ˆˆ
()(
1
1
ˆ
1
yyyy
N
R
N
i
i
%100
ˆˆ
2
RD
R
ˆ
2
2
ˆ
1
ˆ
y
ост
R
j
а
ˆ
Квадрат множественного коэффициента корреляции, умноженный на
100%, принято называть коэффициентом множественной детерминации
.
Его величина говорит о том, на сколько процентов поведение
переменной у объясняется переменными X через уравнение регрессии. Множественный коэффициент корреляции принимает значения от 0 при полном отсутствии связей, до 1 при строгой функциональной связи. Приведенная выше формула для расчета множественного коэффициента
корреляции поясняет его физическую сущность. В практических же задачах вычисляют через остаточную дисперсию, ибо между ними существует взаимно­однозначное соответствие
.
В теории регрессионного анализа существует методика оценки
достоверности каждого коэффициента регрессии
. Если какой-то из этих
коэффициентов близок к нулю, то можно говорить о несущественном влиянии соответствующей переменной хj или ее нелинейной комбинации на переменную у. Наиболее слабо влияющие входные переменные принято в регрессионном анализе называть незначимыми переменными, и, как правило, они вообще исключаются из уравнения после предварительного анализа. Следует отметить, что если из уравнения регрессии исключены какие-то переменные перед ее практическим использованием для прогнозирования у, то необходимо вновь пересчитать коэффициенты регрессии на оставшемся наборе переменных, так как оставшиеся коэффициенты примут несколько иные значения, чем в исходном, более полном, уравнении. При практическом использовании регрессионных прогнозирующих моделей в экономических и иных исследованиях рекомендуется осуществлять оценку коэффициентов регрессии
56
и проверку прогнозирующих способностей полученного уравнения на разных выборках. На одном массиве данных оцениваются коэффициенты регрессии – эта выборка называется обучающей, а на другом массиве данных осуществляется проверка точности прогнозирования – эту выборку называют экзаменующей. Совмещать обучающую и экзаменующие выборки не рекомендуется.
Использование экзаменующей выборки позволяет проверить стабильность качества прогнозирования, воспроизводимость полученных зависимостей, ибо практически всегда множественный коэффициент корреляции на экзаменующей выборке будет меньше, чем на обучающей. Чтобы полнее использовать собранную информацию и провести более тщательный и более содержательный анализ зависимости, полезно дважды провести решение; меняя обучающую и экзаменующие выборки местами.
14. Ограничения и предпосылки использования регрессионного
анализа
Применение любого математического аппарата для описания реальных процессов и явлений всегда оказывается справедливым в рамках определенных ограничений, накладываемых на моделируемую систему, и предпосылок, лежащих в основе использования математической схемы. Не составляет исключения и регрессионный анализ, предназначенный для вскрытия и оценки причинно-следственных связей в условиях статистической неопределенности. Перечислим ограничения, допускающие эффективное использование моделей и методов регрессионного анализа при оценке причинных зависимостей:
1. Структура модели, отражающая форму регрессионного уравнения, с учетом включенных в него входных переменных и различного рода нелинейных функций последних, должна как можно точнее соответствовать анализируемой системе. Соответствие предполагается именно на уровне
57
структуры, не касаясь точности предсказания выходной переменной. Если
....
21
210
n
a n
aa
xxxау
.
~
...
~~~~
22110 nn
xaxaxaay
n,1
выбранная структура зависимости не соответствует реальной, говорят о наличии ошибок структуризации. Эти ошибки приводят к тому, что качественный анализ причинных зависимостей будет не точно отражать реальные процессы и явления, протекающие в системе. Кроме того, если структура модели выбрана плохо, то прогнозирующие возможности регрессионного уравнения будут резко ухудшаться на экзаменующих выборках, а, следовательно, и при практическом использовании полученной регрессионной модели. Особенно опасно использовать такое уравнение за пределами области значений входных переменных, в рамках которой определялись коэффициенты регрессии.
2. Уравнение регрессии должно быть линейным относительно неизвестных коэффициентов, о чем уже говорилось в предыдущих разделах. Если реальная зависимость нелинейна относительно неизвестных коэффициентов, то для их оценки невозможно применение метода наименьших квадратов. В этих условиях надо постараться сделать такое преобразование исходной зависимости, чтобы она удовлетворяла условию линейности.
Пример. В ряде случаев используется уравнение Кобба-Дугласа
Прологарифмировав обе части этого уравнения, мы получаем
lny=lna0+a1lnx1+a2lnx
+…+a
2
lnxn.
n
Это преобразование позволило нам перейти к линейному уравнению
относительно неизвестных коэффициентов a0, a1, a2, …, an. Переобозначая переменные, получим
3. Включенные в уравнение входные переменные должны измеряться без ошибок. Очевидно, что ошибки измерения входных переменных причинно не связаны с выходной переменной у, следовательно, «разбавление» ими
истинных вариаций входных переменных xj;j =
58
приводит к снижению
уровня связи входов с выходной переменной, а следовательно, занижает оценки
njr
xj
,1;
истинных значений коэффициентов регрессии.
4. Приведенная к выходу помеха должна быть некоррелирована с
включенными в уравнение переменными xj. Если это ограничение не выполняется, мы никогда не сможем получить регрессионным анализом зависимостей, хотя бы слабо приближенных к реальности. Прогнозирующая способность уравнения за пределами обучающей выборки становится столь плохой, что практическое использование уравнения теряет смысл. Вычисленные же коэффициенты регрессии часто даже не соответствуют здравой логике, объясняющей поведение реальной системы. Докажем это выводом несложной формулы из исходного регрессионного уравнения.
Пусть имеет место линейная регрессия
у = а х + Е,
где у – вектор-строка наблюдений за выходной переменной у, т.е. вектор размерностью 1N; а – вектор строка 1 n;х – (nN) – матрица наблюдений за входными переменными х; Е – (1N) – вектор-строка неконтролируемых остатков, т.е. приведенная помеха.
Умножим справа уравнение на х
и затем вновь справа на (ххТ)
Т
yxT=axxT+Ex
-1
T
yxT(ххT)-1 = а + ЕхТ(ххT)-1
или
а = ух
Т
(ххT)-1 – ЕхТ(ххT)-1.
Первое слагаемое в данном уравнении есть ничто иное, как оценка
коэффициентов по методу наименьших квадратов. Таким образом, истинные значения коэффициентов а могут быть получены методом наименьших квадратов только тогда, когда второе слагаемое в приведенном уравнении равно нулю. Оно будет таковым, если ЕхТ = 0. Выражение ЕхТ – это вектор,
пропорциональный вектору коэффициентов корреляции
59
. Отметим,
что выведенное выше уравнение для определения вектора а называется оценкой
n,1
максимального правдоподобия, но практически воспользоваться ею нельзя, так как Ei; i=
не наблюдаемо и не подлежит измерению.
Два последних ограничения весьма принципиальны, и именно их
невыполнение, как правило, имеет место в собранном статистическом материале. Собирая и анализируя статистический материал, в первую очередь надо пытаться проверить их выполнимость.
5. Закон распределения приведенной помехи Ei –является гауссовским
с нулевым математическим ожиданием. Это ограничение нужно в том случае, если для проверки статистических гипотез о качестве регрессионных зависимостей применяются классические схемы математической статистики, основанные на использовании критериев Фишера и Стьюдента.
60
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]