Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:
Специальные разделы высшей математики. Практикум по математической статистике. Учебно-методическое пособие.pdf
Скачиваний:
0
Добавлен:
07.09.2026
Размер:
2 Мб
Скачать
☆
6.1. Коротко о главном 181
Критической областью данного критерия при уровне значимости рав­ным α является интервал(0; f
(
k − 1; n − k)), где f
1−α
(
v,w)— квантиль рас-
α
пределения Фишера с(v,w)степенями свободы уровня α.
Таким образом, если:
а) F < f
(
k − 1; n − k)— гипотеза H0принимается (множественный ко-
1−α
эффициент корреляции не значим);
б) F ≥ f
(
k − 1; n − k)— гипотеза H0отклоняется (множественный ко-
1−α
эффициент корреляции статистически значим).
6.1.2 Регрессионный анализ
Регрессионный анализ (regression analysis) — раздел математической статистики, посвященный разработке и применению методов исследова­ния регрессионной зависимости случайной величины Y от переменных Xi, i = 1,k, по данным статистических наблюдений. Зависимая переменная в регрессионном анализе называется объясняемой, а переменные факторы — регрессорами или объясняющими переменными.
Термин «регрессия» (to regress — двигаться в обратном направлении) впервые использовал в 1885 году английский исследователь — статистик, географ, антрополог и психолог сэр Фрэнсис Гальтон.
При проведении регрессионного анализа обычно предполагают, что слу­чайная величина Y имеет нормальный закон распределения с условным математическим ожиданием Y*= M(Y|X1, . . . X
)
= f(X1, . . . X
k
)
.
k
Взаимосвязь между средним значением результативной переменной и средними значениями регрессоров выражается в виде уравнения регрессии.
Регрессионный анализ очень тесно связан с корреляционным анализом. В корреляционном анализе исследуется направление и теснота связи меж­ду случайными переменными. В регрессионном анализе исследуется форма зависимости между переменными. Таким образом, фактически оба мето­да изучают одну и ту же взаимосвязь, но с разных сторон, и дополняют друг друга. На практике корреляционный анализ выполняется перед ре­грессионным. После доказательства наличия взаимосвязи методом корре­ляционного анализа можно выразить форму этой связи с помощью регрес-
182 Глава 6. КОРРЕЛЯЦИОННЫЙ И РЕГРЕССИОННЫЙ АНАЛИЗ
сионного анализа. Как и корреляционный, регрессионный анализ отража­ет только количественные зависимости между переменными. Причинно­следственные зависимости регрессионный анализ не отражает. Гипотезы о причинно-следственной связи переменных должны формулироваться и обосновываться исходя из теоретического анализа содержания изучаемого явления.
В зависимости от количества объясняющих переменных различают:
X однофакторный регрессионный анализ (одна независимая переменная
X );
X многофакторный регрессионный анализ (больше, чем одна независи-
мая переменная X1, . . . Xk).
В зависимости от вида функции f(X1, . . . X
)
регрессионный анализ бы-
k
вает:
X линейным;
X нелинейным.
Целями регрессионного анализа являются.
1. Определение формы зависимости между зависимой переменной и ре­грессорами.
2. Предсказание значения зависимой переменной с помощью независи­мых.
3. Определение вклада отдельных независимых переменных в вариацию зависимой переменной.
Основные задачи регрессионного анализа следующие:
X определение вида и формы зависимости;
X оценка параметров уравнения модели;
X проверка значимости уравнения регрессии;
6.1. Коротко о главном 183
X проверка значимости отдельных параметров модели;
X построение доверительных интервалов для параметров модели;
X исследование характеристик точности модели;
X построение точечных и интервальных прогнозов зависимой перемен-
ной.
Этапы построения регрессионной модели.
1. Постановка задачи. На этом этапе формируются предварительные ги­потезы о зависимости исследуемых явлений.
2. Спецификация независимых переменных X1, . . . Xk, т.е. определение тех существенных факторов, которые воздействуют на результиру­ющую переменную Y.
3. Сбор статистических данных.
4. Определение вида функции f(X1, . . . X
)
связи между Y и X1, . . . Xk.
k
5. Оценка параметров модели на основе статистических данных. Одним из основных методов для оценки параметров (коэффициентов) регрес­сионной модели является метод наименьших квадратов (МНК), суть которого заключается в том, что минимизируется сумма квадратов отклонений (SSR) реально наблюдаемых значений yiот их оценок y
*
i
т.е. решается оптимизационная задача
,
SSR =
n
X
i=1
2
e
i
=
n
X
i=1
(
yi− y
2
*
)
→
min
i
.
6. Анализ корректности и правдоподобия полученных результатов. Кор­ректировка модели.
7. Анализ и интерпретация полученных результатов.
184 Глава 6. КОРРЕЛЯЦИОННЫЙ И РЕГРЕССИОННЫЙ АНАЛИЗ
Парная линейная регрессия Рассмотрим однофакторную регресси-
онную модель
Y = β0+ β1X + ε, (6.11)
где β0, β1— параметры (неслучайные, но, вообще говоря, неизвестные) ре­грессионной модели, ε — случайная ошибка.
По выборке одновременных наблюдений{(x1, y
);(
1
x2, y
)
; . . . ;(xn, y
2
необходимо оценить уравнение
Y*= β
*
0
*
+ β
X. (6.12)
1
Оценка параметров. Согласно методу наименьших квадратов оценки
β
*
0
и β
*
неизвестных пармеметров β0и β1находятся из условия
1
SSR =
n
X
i=1
2
e
i
=
n
X
i=1
(
yi− y
n
X
2
*
)
=
i
i=1
(
yi− β
*
0
− β
2
*
)
x
→
i
1
min
*
β
,β
0
.
*
1
Необходимым условием минимума функции является равенство нулю
первых частных производных:
n
∂SSR
∂β
∂SSR
*
∂β
0
= −2
*
0
= −2
X
i=1
n
X
i=1
(
yi− β
(
x
i
yi− β
*
0
− β
*
− β
0
*
)
x
= 0,
i
1
*
)
x
= 0.
i
1
)}
n
Эти равенства называются системой нормальных уравнений, решая ко-
торую получим формулы для оценок коэффициентов модели (6.12):
P
n
β
1
*
n
=
1
1
n
P
i=1
n i=1
β
xiyi− m
2
x
−(m
i
*
= m
0
*
Y
*
X
*
x
− β
*
m
)
*
1
2
cov(X,Y)
Y
=
*
(
σ
x
*
m
. (6.14)
X
, (6.13)
2
)
Оценка дисперсии случайной составляющей ε определяется формулой
n
X
=
1
n − 2
i=1
2
e
i
2
S
ε
1
=
n − 2
n
X
i=1
(
yi− y
2
*
)
. (6.15)
i
6.1. Коротко о главном 185
Тогда стандартные ошибки коэффициентов регрессии можно вычис-
лить следующим образом
*
S
= S
β
0
ε
n
P
P
n i=1
n
2
x
i=1
i
(
xi− m
2
*
)
x
1
*
S
= S
β
1
P
ε
n i=1
(
xi− m
= S
2
*
)
x
= S
ε
ε
n
n
P
P
n i=1
n i=1
x
P
x
2 i
2 i
n
−
n i=1
−
(
x
P
(
P
2 i
n i=1
n i=1
, (6.16)
2
)
x
i
. (6.17)
2
)
x
i
Проверка значимости коэффициентов. Коэффициент регрессион-
ной модели βj, j = 0; 1 считается значимым, если он статистически отличен от нуля. В терминах проверки статистических гипотез определение значи­мости коэффициента проводится следующим образом.
1. Выдвигается основная гипотеза
H0: βj= 0 (коэффициент βjнезначим)
против альтернативы
H1: βj= 0 (коэффициент βjзначим).
2. Вычисляется значение статистики
*
β
t =
j
, (6.18)
*
S
β
j
которая, при справедливости гипотезы H0, имеет распределение Стьюдента с n − 2 степенями свободы.
3. По заданному уровню значимости α с помощью таблицы t -распреде-
ления вычисляется критическое значение t
крит
= t
1−α/2
(
n − 2).
4. Правило принятия решения, если
|t|
< t
1−α/2
(
n − 2)— гипотеза H0принимается (коэффициент статисти-
чески не значим);
|t|
≥ t
1−α/2
(
n − 2)— гипотеза H0отклоняется (коэффициент статисти-
чески значим).
Адекватность модели. Средняя относительная ошибка аппроксима-
ции вычисляется по формуле:
A =
1
n
n
X
i=1
 
yi− y
 
y
*
i
 
i
· 100%=
1
n
n
X
i=1
e
i
· 100%. (6.19)
y
i
Если A 6 7%, то считают, что модель имеет хорошее качество.
186 Глава 6. КОРРЕЛЯЦИОННЫЙ И РЕГРЕССИОННЫЙ АНАЛИЗ
Коэффициентом детерминации R2регрессионной модели называют ве-
личину
R2=
P
P
n i=1
n i=1
*
y
− m
i
yi− m
*
y
*
y
2
2
= 1 −
P
P
n i=1
n i=1
(
yi− y
yi− m
2
*
)
i
. (6.20)
2
*
y
Коэффициент детерминации характеризует долю дисперсии зависимой переменной Y, объясняемую регрессией, в общей дисперсии. Соответствен­но, величина 1 − R2характеризует долю дисперсии Y, вызванную влиянием остальных не учтенных в модели факторов.
Коэффициент детерминации лежит в интервале 0 ≤ R2≤ 1. Чем ближе
R2к 1, тем выше качество модели.
Для оценки значимости уравнения регрессии в целом выполняют сле­дующие шаги.
1. Выдвигается основная гипотеза
H0: R2= 0, модель в целом незначима, против альтернативы
H1: R2= 0, модель в целом значима.
2. Вычисляется значение статистики
F =
2
R
1 − R
(
n − 2
n i=1
P
y
n i=1
*
− m
i
P
)
=
2
*
y
(
yi− y
2
(
*
i
n − 2
2
)
)
, (6.21)
которая при справедливости гипотезы H0имеет распределение Фишера с
(
1,n − 2)степенями свободы.
3. По заданному уровню значимости α, используя таблицы F-распределения,
находим критическое значение F
крит
= F
1−α
(
1,n − 2).
4. Правило принятие решения, если
а) F < F
, то гипотеза H0принимается, и модель в целом при заданном
крит
уровне α признается незначимой;
б) F ≥ F
, то гипотеза H0отклоняется, и модель в целом при заданном
крит
уровне α признается значимой.
Отметим, что для парной линейной регрессии t-критерии для коэф­фициента корреляции rxy, коэффициента регрессии β1и F-критерий для модели в целом совпадают.
6.1. Коротко о главном 187
Множественная линейная регрессия На практике часто использу­ется множественная линейная модель вида
Y = β0+ β1X1+ β2X2+ . . . + βkXk+ ε, (6.22)
где βi, i = 0,k — параметры (вообще говоря неизвестные) регрессионной модели, ε — случайная ошибка, имеющая нормальное распределение.
Для проведения регрессионного анализа из(k + 1)–мерной генеральной совокупности Y, X1, . . . Xkизвлекается выборка одновременных наблюдений объемом n, при этом i-е наблюдение (объект) характеризуется значениями
yi,xi1,xi2, . . . ,xik, i = 1,n
переменных Y,X1, . . . Xk, где xij— значение j–й переменной для i–го наблю­дения yi, — значение результативного признака для i–го наблюдения.
Тогда уравнение модели (6.22) можно записать в координатной форме
yi= β0+ β1xi1+ β2xi2+ . . . + βkxik+ εi, (6.23)
или матричном виде
Y = βX + ε, (6.24)
где Y — случайный вектор–столбец размерности n × 1 наблюдаемых значе-
T
ний результативного признака Y =(y1,y2, . . . ,y
)
, X — матрица размерно-
n
сти n ×(k + 1)наблюдаемых значений регрессоров.
X =
⎛
1 x
⎜ ⎜
. . . . . . . . . . . .
⎜
11
. . . x
⎜ ⎜
1 x
⎜ ⎜
. . . . . . . . . . . .
⎝
i1
. . . x
1k
ik
⎞
⎟ ⎟ ⎟ ⎟ ⎟ ⎟ ⎟ ⎠
,
1 x
β — вектор–столбец β =(β0,β1, . . . ,β
n1
)
k
x
nk
T
размерности(k + 1)× 1 неизвест- ных, подлежащих оценке параметров модели; ε — вектор–столбец размер­ности n × 1 случайных ошибок модели.
Оценивание параметров модели. Оценки β
0
,β
*
, . . . ,β
1
*
неизвестных
k
*
коэффициентов β0,β1, . . . ,βkмодели (6.22) являются решением оптимиза­ционной задачи МНК
188 Глава 6. КОРРЕЛЯЦИОННЫЙ И РЕГРЕССИОННЫЙ АНАЛИЗ
n
SSR =
X
j=1
(
yj−y
2
)
→
j
β
min
*
,β
0
*
,...,β
1
.
*
k
Ее решение — это вектор столбец, определяемый формулой
β*=XTX
−1
XTY. (6.25)
Оценка дисперсии σ
(
2
S
ε
Y − β*X
=
)T(
Y − β*X
n − k − 1
2
случайного члена ε определяется формулой
ε
n
)
=
1
n − k − 1
X
i=1
(
yi− y
2
*
)
=
i
n
1
X
=
n − k − 1
i=1
2
e
. (6.26)
i
Точность коэффициентов модели. Оценка ковариационной матрицы
вектора β*коэффициентов регрессии определяется выражением
cov
*
*
(
)
β
= S
2 ε
XTX
−1
.
Учитывая, что на главной диагонали ковариационной матрицы нахо­дятся дисперсии оценок коэффициентов регрессии, можно выписать стан­дартные ошибки оценок коэффициентов
где
XTX
*
S
= S
β
j
−1
(
ε
XTX
— диагональный элемент матрицыXTX
jj
−1
)
, (6.27)
jj
−1
.
Стандартная ошибка (оценка среднего квадратичного отклонения) для прогноза условного среднего зависимой переменной, если регрессоры равны
X = X0, определяется формулой
T
S
= S
*
Y
0
ε
X
0
(
XTX
−1
)
X0.
Стандартную ошибку для индивидуального прогноза зависимой пере­менной, если регрессоры равны X = X0, можно вычислить по формуле
*
S
= S
Y
0
ε
1 + X
T 0
(
XTX
−1
)
X0.
6.1. Коротко о главном 189
Оценку качества построенной модели дает коэффициент детермина­ции R2, а также средняя ошибка аппроксимации, которые, как и в парной модели, определяются формулами (6.20) и (6.21).
Однако значение R2при добавлении в модель нового регрессора воз­растает, независимо от того влияет ли новый регрессор на независимую переменную или нет. И в связи с этим используют скорректированный (adjusted) коэффициент детерминации:
n − 1
S
= 1 −1 − R
adj
2
n − k − 1
. (6.28)
Линейная модель с двумя регрессорами Рассмотрим модель
Y = β0+ β1X1+ β2X2+ ε.
В данном случае матрицы XTX и XTY имеют вид
XTX =
⎛
⎜ ⎜ ⎝
P
P
n
P
x
i1
P
x
i1
P
x
i2
2
x
i1
xi1x
P
P
xi1x
P
i2
⎞
x
i2
⎟ ⎟
i2
⎠
2
x
i2
Следовательно, оцененная модель примет вид
где оценки β
*
0
, β
*
1
и β
Y*= β
*
коэффициентов регрессии, согласно соотношению
2
*
0
+ β
*
X1+ β
1
(6.26), можно вычислить по формулам
β
β
*
(
cov
*
=
1
cov
*
=
2
X1,Y)S
*
(
X2,Y)S
*
β
= m
0
2
− cov
x
2
2
2
S
S
1
S
1
*
y
−[cov
x
2
2
− cov
x
1
2
−[cov
x
2
− β
x
2
S
x
*
(
X2,Y)cov
*
(
X1,X
*
(
X1,Y)cov(X1,X
*
(
X1,X
*
*
m
x
1
− β
1
, XTY =
*
X2,
2
*
2
)]
2
2
)]
2
*
*
m
. (6.31)
2
x
2
⎛
⎜ ⎜ ⎝
(
X1,X
y
⎞
i
⎟ ⎟
.
i1
⎠
i2
P
P
P
2
yix
yix
)
, (6.29)
)
2
, (6.30)
Стандартные ошибки коэффициентов β ниями
S
β
=
i
nS
2 x
i
2
S
ε
1 − r
*
и β
1
2 x1,x
*
определяются соотноше-
2
. (6.32)
2
190 Глава 6. КОРРЕЛЯЦИОННЫЙ И РЕГРЕССИОННЫЙ АНАЛИЗ
Оценка значимости коэффициента регрессии βjосуществляется с ис­пользованием критерия Стьюдента.
При этом выдвигается основная гипотеза
H0: βj= 0;
против двусторонней альтернативы
H1: βj= 0.
Для выбора одной из этих гипотез вычисляют статистику критерия:
*
β
t =
j
,
*
S
β
j
которая, при справедливости гипотезы H0, имеет распределение Стьюдента с n − k − 1 степенями свободы.
Таким образом, при уровне значимости равном α, если:
а)|t|< t
1−α/2
(
n − k − 1)— гипотеза H0принимается (коэффициент не
значим);
б)|t|≥ t
1−α/2
(
n − k − 1)— гипотеза H0отклоняется (коэффициент ста-
тистически значим).
Здесь t
p
(m)
— квантиль распределения Стьюдента с m степенями сво-
боды уровня p.
Значимость уравнения регрессии в целом, т.е. гипотезы
H0: β1= 0, . . . ,βk= 0;
против альтернативы
H1: хотя бы для одного ii = 1,kβi= 0,
проверяется по F–критерию Фишера.
Если справедлива основная гипотеза, то статистика критерия
2
F =
(
R
n − k − 1
(
1 − R
)
2
)
k
имеет распределение Фишера с(k,n − k − 1)степенями свободы.
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]