Моделирование процессов и систем. Учебное пособие
.pdf
41
s bi 
cii s ,
где cii — это i-й диагональный элемент матрицы С = (FT F)–1. Отсюда
ti bi i / s
cii ,
что и дает доверительный интервал для i-гo коэффициента
bi tT s
cii i bi tT s
cii . (57)
Величина tT берется из таблицы распределения Стьюдента при числе степеней свободы , соответствующем знаменателю оценки s2, и
уровне значимости , т. е. tT = t ( , ). Если s2 определялась из n дополнительных наблюдений в одинаковых условиях по формуле (55), то
= n – 1.
Интервалы (57) можно строить для любого регрессионного коэффициента отдельно, поэтому их называют индивидуальными доверительными интервалами. Длина такого доверительного интервала
существенно зависит от выбора уровня значимости . Из любой таблицы распределения Стьюдента видно, что с уменьшением растет табличное значение tT, в силу чего растет и длина доверительного интервала tT s
cii .
Поэтому нет смысла выбирать чрезмерно малые значения , это приведет к таким большим доверительным интервалам, что они станут практически бесполезными.
Использование индивидуальных доверительных интервалов крайне ограниченно, так как они не учитывают коррелированности оценок регрессионных коэффициентов. Во многих случаях действительные ковариации между оценками не равны нулю, а согласно
(29) есть
cov(bi, bj) = сij 2.
Из-за статистической зависимости между оценками bi и bj до-
верительный интервал для bi зависит от значения bj и наоборот. Значит, использование индивидуальных доверительных интервалов уме-
стно, когда cij = 0, например при ортогональной матрице F. Тогда FTF и С = = (FTF)–1 — диагональные матрицы, и индивидуальные доверительные интервалы будут достаточно хорошо описывать возможное положение истинного значения оценки.
42
Проверка значимости регрессионных коэффициентов
Современный регрессионный анализ позволяет проверять различные предположения относительно регрессионных коэффициентов. Это делается посредством проверки статистических гипотез.
Рассмотрим гипотезы о значимости коэффициентов регрессии. С их помощью можно проверить, не отличается ли оценка данного коэффициента регрессии bi от нуля только за счет случайных возмущений.
Сначала рассмотрим проверку гипотезы о том, что истинное зна-
чение коэффициента равно наперед заданному числу ai, т. е. H0: bi = = аi. Как известно из теории статистических решений, для проверки такой гипотезы формируется статистика, в которую входит неизвестный параметр. Затем находят распределение этой статистики и доверительный интервал для неизвестного параметра i при условии, что нулевая гипотеза верна. Если оценка bi попадает в такой доверитель-
ный интервал, нулевая гипотеза принимается, в противном случае — отвергается.
Для проверки сформулированной выше гипотезы можно использовать статистику ti, определенную в (56). При верной нулевой гипотезе она принимает вид:
ti = | bi – ai | / s(bi).
После вычисления этой величины в таблице распределения
Стьюдента находится критическое значение tTi = t( , ). Если ti < tTi,
нулевая гипотеза принимается, в противном случае – отвергается.
Эту проверку можно использовать и для выявления значимости регрессионных коэффициентов, для чего полагается аi = 0, а статисти-
ка ti принимает вид: |
|
ti bi |
s bi bi s cii . |
После получения tT делается один из следующих выводов:
если ti > tT , коэффициент bi значим;
если ti < tT , коэффициент bi незначим.
Пользуясь этой процедурой, надо иметь в виду, что проверка значимости по индивидуальным доверительным интервалам может оказаться не слишком точной из-за коррелированности оценок регрессионных коэффициентов. Точность их достаточно хороша для таких коэффициентов, оценки которых не коррелированны с другими, т. е. для которых равны нулю элементы cij матрицы С = (FT F)– 1 .
43
Уровень значимости для проверки можно рассматривать как вероятность ошибки первого рода, т. е. ошибки, ведущей к отбрасыва-
нию нулевой гипотезы Н0 : i = 0, когда на самом деле она верна. Сле-
довательно, эта ошибка приводит к сохранению в модели регрессоров, чьи коэффициенты незначимы.
Ошибкой второго рода называется ошибка, приводящая к при-
нятию нулевой гипотезы, когда она неверна. При этом из модели вы-
брасываются члены, которые надо было бы оставить. Очевидно, что ошибка второго рода для экспериментатора более неприятна, посколь-
ку приводит к смещению оценок и неправильному предсказанию отклика, а ошибка первого рода дает лишь некоторое снижение эффективности.
Обычно уменьшение уровня значимости ведет к росту вероятности ошибки второго рода. Поэтому не стоит выбирать слишком ма-
ленькие значения , ибо возможны неприятности. То же самое было отмечено и при построении доверительных интервалов.
Описанная проверка значимости пригодна для упрощения модели отбрасыванием незначимых коэффициентов. Однако из-за их корре-
лированности такое упрощение часто оказывается совершенно ненадежно и приводит к отбрасыванию чрезмерно большого числа коэффициентов. Как следствие, оценки предсказанных значений отклика получаются смещенными. Лучше оставить в модели незначимые коэффициенты, чем отбросить значимые.
Если оценки коэффициентов коррелированны, то после отбрасывания незначимых коэффициентов рекомендуется обработать дан-
ные заново для новой модели и после этого опять проверить ее адекватность.
Доверительный интервал для предсказанного значения отклика
По свойству 7 в классическом регрессионном анализе предсказанное значение отклика yˆ x имеет нормальное распределение.
Поэтому отношение |
s yˆ x , |
|
t yˆ x x |
(58) |
как и (56), имеет распределение Стьюдента. Оценку среднего квадратичного отклонения s yˆ x можно получить подстановкой в (40) вме-
сто истинного значения дисперсии случайного возмущения 2 его оценки s2:
44
s2 yˆ |
1 |
f |
|
s2 . |
|
x f T FT F |
x |
(59) |
|||
|
x |
|
|
|
После подстановки этого результата в (58) получается искомый
доверительный интервал. С доверительной вероятностью 1 – истинное значение отклика находится в границах:
yˆ x tT s
fxT FT F 1fx x yˆ x tT s
fxT FT F 1fx , (60)
где tT = t( , ) – табличное значение распределения Стьюдента при уровне значимости и числе степеней свободы . Если s2 определено из n независимых опытов, проведенных в одинаковых условиях, то = = n – 1. Так как векторы fx различны в разных точках факторного пространства, длина доверительных интервалов тоже будет различаться. Это означает, что точность предсказания отклика различна в разных точках х.
Организация и планирование эксперимента
При определении оценок параметров модели исходят из того, что результаты наблюдений получены в некотором заданном множестве точек. На практике, однако, часто оказывается возможным свободно выбирать условия проведения опытов в пределах некоторых границ. Выбор числа и условий проведения экспериментов, обеспечивающих получение наилучшего в определенном смысле результата исследования, и составляет цель планирования эксперимента. Разработан ряд критериев оптимальности планов эксперимента. Оптимальный выбор плана эксперимента существенным образом зависит от конкретных особенностей исследуемого объекта, таких, как вид его модели, стоимость отдельных опытов, области варьирования независимых переменных и т. п.
Одной из важнейших характеристик плана, влияющей, с одной стороны, на стоимость и длительность исследования, а с другой - на точность результатов, является число экспериментов. Заметим, что план с минимально возможным числом экспериментов N=k (насыщенный план) не позволяет проверить адекватность модели. Поэтому обычно выбирают N > k , где k – число оцениваемых параметров модели.
Важное значение для оценки качества плана эксперимента имеет вид информационной матрицы плана M = FTF.
Матрица М должна быть невырожденной, т. е. |М| 0. Только в этом случае система линейных уравнений, к которой приводит крите-
45
рий наименьших квадратов, имеет единственное решение. Кроме этого, элементы матрицы C = M-1 участвуют в определении величины дисперсий и ковариаций (32) оценок неизвестных коэффициентов регрессионной модели, а также величины дисперсии предсказанного значения функции отклика (40). Элементы дисперсионно-ковариационной
матрицы C полностью определяются видом регрессионной модели и координатами точек факторного пространства, в которых проводятся измерения функции отклика. Отсюда с очевидностью следует, что качество решения задачи построения регрессионной модели зависит как от метода оценивания неизвестных коэффициентов регрессии, так и от используемого плана эксперимента.
Решение задач планирования эксперимента обычно выполняется в нормированном факторном пространстве, ограниченном гиперкубом с координатами -1 ≤ xi ≤ +1, i = 1,2,...,n. Такой подход позволяет унифицировать экспериментальные планы, получаемые для исследования объектов, имеющих различную физическую природу, но представляемых регрессионными моделями одинакового вида. Кроме этого, использование нормированного факторного пространства облегчает анализ построенной регрессионной модели и ранжирование факторов по степени их влияния на функцию отклика.
Во многих практических задачах идентификации на первых этапах исследования часто нужно получить в первом приближении лишь линейную аппроксимацию изучаемого уравнения связи. В этом случае регрессионная модель содержит линейные эффекты и их взаимодействия (произведения факторов). В этом случае [4] задача планирования эксперимента проще всего решается при использовании полного факторного эксперимента (ПФЭ) или дробного факторного эксперимента (ДФЭ). В этих планах каждый фактор хi принимает значения только на двух уровнях +1 и -1.
Полным факторным планом типа 2n называется множество всех точек в n-мерном пространстве, координаты которых являются +1 (+) или –1 (–). Число точек в этом плане N=2n.
Число опытов полных факторных планов быстро растет с увеличением размерности факторного пространства, так что при больших п эти планы оказываются практически неприемлемыми. При линейном росте числа независимых факторов число вариантов варьирования для ПФЭ растет по показательному закону, в результате чего на проверку гипотезы об адекватности остается излишне много степеней свободы. В то же время при исследовании технических объектов, технологических процессов и экономических систем в небольшой окрестности некоторой базовой точки факторного пространства влияние взаимодейст-
46
вий факторов второго и более высоких порядков отсутствует или пренебрежимо мало. Поэтому неэффективно использовать ПФЭ для оценивания коэффициентов лишь при линейных членах и некоторых парных произведениях. В этом случае из множества точек факторных планов 2п может быть отобрана некоторая часть, представляющая дробный факторный план и содержащая подходящее число опытов.
Для построения дробного факторного плана типа 2n-р из множества п отбирают п-р основных факторов, для которых строят полный факторный план с матрицей Хп-р. Этот план дополняют затем р столбцами, соответствующими оставшимся факторам. Каждый из этих р столбцов получается как результат поэлементного перемножения не менее двух и не более п-р определенных столбцов, соответствующих основным факторам.
Для определения способа образования каждого из р столбцов дробного факторного плана используется понятие генератора плана. Генератор представляет собой произведение основных факторов, определяющее значение элементов каждого из дополнительных р столбцов матрицы плана. Очевидно, что в случае построения дробного факторного плана типа 2n-p может быть использовано р генераторов.
Проиллюстрируем процедуру построения ДФЭ на примере дробного факторного плана типа 23-1.
При решении этой задачи для основных факторов х1 и х2 строится полный факторный план 22. Затем полученный план должен быть дополнен столбцом значений третьего фактора x3. Элементы этого столбца принимаются равными произведениям соответствующих элементов первого и второго столбцов. В данном случае это единственная возможность определения столбца для фактора х3.
x1 |
x2 |
x3 |
–1 |
–1 |
+1 |
–1 |
+1 |
–1 |
+1 |
–1 |
–1 |
+1 |
+1 |
+1 |
Генератором плана, определяющего в этом примере значения дополнительной переменной x3, является выражение x3 = x1x2. Преимуществом этого плана является меньшее число опытов (23-1 = 4) по сравнению с числом опытов полного факторного плана (23 = 8) для трех факторов. Полученный дробный план называется полурепликой факторного плана 23.
47
В случае n = 4 можно построить четыре различных дробных факторных плана типа 24-1. При этом для основных факторов x1, x2 и x3 строится полный факторный план 23 , содержащий 8 наблюдений. Для построения дробного факторного плана 24-1 элементы столбца, соответствующего дополнительному фактору x4 , могут быть получены с помощью одного из генераторов, образованных поэлементными произ-
ведениями столбцов плана 23 : x1x2, x1x3, x2x3, x1x2x3. Выбор для реализации конкретного генератора осуществляется исходя из оценки сте-
пени влияния на функцию отклика взаимодействий факторов, используемых в качестве генерирующих соотношений.
При большом количестве факторов, участвующих в построении регрессионной модели, могут быть построены дробные факторные планы высокой степени дробности. Так, при n = 5 для построения дробного плана типа 25-2 имеется три основных фактора x1, x2 и x3 и два дополнительных фактора x4 и x5. Каждый из дополнительных факторов может быть определен с помощью любого из четырех возможных генераторов x1x2, x1x3, x2x3, x1x2x3 . Очевидно, что использование различных сочетаний этих генераторов для определения обоих дополнительных факторов дает возможность построения шести различных вариантов дробного факторного плана типа 25-2. Элементы дополнительных столбцов этого плана определяются в соответствии со следующими возможными комбинациями генерирующих соотношений.
x4 |
x1x2 |
x1x2 |
x1x2 |
x1x3 |
x1x3 |
x2x3 |
x5 |
x1x3 |
x2x3 |
x1x2x3 |
x2x3 |
x1x2x3 |
x1x2x3 |
Еще шесть дробных факторных планов могут быть получены заменой столбцов дополнительных факторов x4 и x5 .
Для пяти факторов дробный факторный план типа 25-2 (четвертьреплика) содержит 8 опытов по сравнению с 32 опытами полного факторного плана 25 .
Библиографический список
1.Айвазян С.А., Мхитарян В.С. Теория вероятностей и прикладная статистика. – М.: ЮНИТИ, 2001. – 656 с.
2.Айвазян С.А. Основы эконометрики.– М.:ЮНИТИ, 2001.– 432 с.
3.Магнус Я.Р., Катышев П.К., Пересецкий А.А. Эконометрика. –
М.: Дело, 2000. – 247 с.
48
4. Боровиков В.П., Боровиков И.П. STATISTICA – статистический анализ и обработка данных в среде WINDOWS. – М.: ФИЛИНЪ ,
1998. – 582 с.
Оглавление
Введение ………………………………………..…………..........3 Понятие регрессии ……………………………………………....4
Регрессионные модели …………………………………….........6 Основные предпосылки регрессионного анализа ……........…11 Простая линейная регрессия ……………………………..........14 Множественная регрессия ………………………………..........18
Свойства МНК-оценок …………………………………….......20
Статистический анализ регрессионной модели ………….......26 Дисперсионный анализ результатов оценивания ………........28 Коэффициент детерминации …………………………….....…31
Ошибки в определении структуры модели …………….....….34
Проверка адекватности регрессионной модели …………...…37
Доверительные интервалы для коэффициентов регрессии …………………………......….40
Проверка значимости регрессионных коэффициентов ….......42 Доверительный интервал для предсказанного значения отклика ………………………………………......…...43
Организация и планирование эксперимента.............................44 Библиографический список ……………………………......…..47
С о с у л и н Юрий Андреевич
Моделирование процессов и систем
Редактор М.Е.Цветкова Корректор С.В.Макушина
Подписано в печать 10.04.20. Формат бумаги 60х84 1/16. Бумага писчая. Печать трафаретная. Усл. печ. л. 3,0.
Тираж 50 экз. Заказ Рязанский государственный радиотехнический университет.
390005, Рязань, ул. Гагарина, 59/ 1. Редакционно-издательский центр РГРТУ.
