Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Специальные разделы высшей математики. Практикум по математической статистике. Учебно-методическое пособие.pdf
X
- •ВВЕДЕНИЕ
- •СЛУЧАЙНЫЕ ВЕЛИЧИНЫ
- •Коротко о главном
- •Определение и виды случайных величин
- •Числовые характеристики случайных величин
- •Распределения связанные с нормальным
- •Предельные теоремы
- •Вопросы для самоконтроля
- •Примеры типовых задач с решением
- •Задачи
- •Коротко о главном
- •Аналитическое представление выборки
- •Графическое представление выборки
- •Вопросы для самоконтроля
- •Примеры типовых задач с решением
- •Задачи
- •СТАТИСТИЧЕСКИЕ ОЦЕНКИ
- •Коротко о главном
- •Точечные оценки параметров
- •Выборочные числовые характеристики
- •Методы нахождения оценок
- •Доверительные интервалы
- •Вопросы для самоконтроля
- •Примеры типовых задач с решением
- •Задачи
- •Коротко о главном
- •Критерии согласия
- •Вопросы для самоконтроля
- •Примеры типовых задач с решением
- •Задачи
- •ДИСПЕРСИОННЫЙ АНАЛИЗ
- •Коротко о главном
- •Однофакторный дисперсионный анализ
- •Двухфакторный дисперсионный анализ
- •Вопросы для самоконтроля
- •Примеры типовых задач с решением
- •Задачи
- •Коротко о главном
- •Корреляционный анализ
- •Регрессионный анализ
- •Вопросы для самоконтроля
- •Примеры типовых задач с решением
- •Задачи
- •Тема 1. Случайные величины
- •Тема 4. Проверка статистических гипотез
- •Тема 5. Дисперсионный анализ
- •Тема 1. Случайные величины
- •Тема 2. Основы выборочного метода
- •Тема 3. Статистические оценки
- •Стандартное нормальное распределение
- •Распределение Стьюдента
- •Распределение Фишера
- •2–распределение
- •Критерий согласия Колмогорова
- •Критерий Кохрена
- •ЛИТЕРАТУРА

6.1. Коротко о главном 181
Критической областью данного критерия при уровне значимости равным α является интервал(0; f
(
k − 1; n − k)), где f
1−α
(
v,w)— квантиль рас-
α
пределения Фишера с(v,w)степенями свободы уровня α.
Таким образом, если:
а) F < f
(
k − 1; n − k)— гипотеза H0принимается (множественный ко-
1−α
эффициент корреляции не значим);
б) F ≥ f
(
k − 1; n − k)— гипотеза H0отклоняется (множественный ко-
1−α
эффициент корреляции статистически значим).
6.1.2 Регрессионный анализ
Регрессионный анализ (regression analysis) — раздел математической
статистики, посвященный разработке и применению методов исследования регрессионной зависимости случайной величины Y от переменных Xi,
i = 1,k, по данным статистических наблюдений. Зависимая переменная в
регрессионном анализе называется объясняемой, а переменные факторы —
регрессорами или объясняющими переменными.
Термин «регрессия» (to regress — двигаться в обратном направлении)
впервые использовал в 1885 году английский исследователь — статистик,
географ, антрополог и психолог сэр Фрэнсис Гальтон.
При проведении регрессионного анализа обычно предполагают, что случайная величина Y имеет нормальный закон распределения с условным
математическим ожиданием Y*= M(Y|X1, . . . X
)
= f(X1, . . . X
k
)
.
k
Взаимосвязь между средним значением результативной переменной и
средними значениями регрессоров выражается в виде уравнения регрессии.
Регрессионный анализ очень тесно связан с корреляционным анализом.
В корреляционном анализе исследуется направление и теснота связи между случайными переменными. В регрессионном анализе исследуется форма
зависимости между переменными. Таким образом, фактически оба метода изучают одну и ту же взаимосвязь, но с разных сторон, и дополняют
друг друга. На практике корреляционный анализ выполняется перед регрессионным. После доказательства наличия взаимосвязи методом корреляционного анализа можно выразить форму этой связи с помощью регрес-

182 Глава 6. КОРРЕЛЯЦИОННЫЙ И РЕГРЕССИОННЫЙ АНАЛИЗ
сионного анализа. Как и корреляционный, регрессионный анализ отражает только количественные зависимости между переменными. Причинноследственные зависимости регрессионный анализ не отражает. Гипотезы
о причинно-следственной связи переменных должны формулироваться и
обосновываться исходя из теоретического анализа содержания изучаемого
явления.
В зависимости от количества объясняющих переменных различают:
X однофакторный регрессионный анализ (одна независимая переменная
X );
X многофакторный регрессионный анализ (больше, чем одна независи-
мая переменная X1, . . . Xk).
В зависимости от вида функции f(X1, . . . X
)
регрессионный анализ бы-
k
вает:
X линейным;
X нелинейным.
Целями регрессионного анализа являются.
1. Определение формы зависимости между зависимой переменной и регрессорами.
2. Предсказание значения зависимой переменной с помощью независимых.
3. Определение вклада отдельных независимых переменных в вариацию
зависимой переменной.
Основные задачи регрессионного анализа следующие:
X определение вида и формы зависимости;
X оценка параметров уравнения модели;
X проверка значимости уравнения регрессии;

6.1. Коротко о главном 183
X проверка значимости отдельных параметров модели;
X построение доверительных интервалов для параметров модели;
X исследование характеристик точности модели;
X построение точечных и интервальных прогнозов зависимой перемен-
ной.
Этапы построения регрессионной модели.
1. Постановка задачи. На этом этапе формируются предварительные гипотезы о зависимости исследуемых явлений.
2. Спецификация независимых переменных X1, . . . Xk, т.е. определение
тех существенных факторов, которые воздействуют на результирующую переменную Y.
3. Сбор статистических данных.
4. Определение вида функции f(X1, . . . X
)
связи между Y и X1, . . . Xk.
k
5. Оценка параметров модели на основе статистических данных. Одним
из основных методов для оценки параметров (коэффициентов) регрессионной модели является метод наименьших квадратов (МНК), суть
которого заключается в том, что минимизируется сумма квадратов
отклонений (SSR) реально наблюдаемых значений yiот их оценок y
*
i
т.е. решается оптимизационная задача
,
SSR =
n
X
i=1
2
e
i
=
n
X
i=1
(
yi− y
2
*
)
→
min
i
.
6. Анализ корректности и правдоподобия полученных результатов. Корректировка модели.
7. Анализ и интерпретация полученных результатов.

184 Глава 6. КОРРЕЛЯЦИОННЫЙ И РЕГРЕССИОННЫЙ АНАЛИЗ
Парная линейная регрессия Рассмотрим однофакторную регресси-
онную модель
Y = β0+ β1X + ε, (6.11)
где β0, β1— параметры (неслучайные, но, вообще говоря, неизвестные) регрессионной модели, ε — случайная ошибка.
По выборке одновременных наблюдений{(x1, y
);(
1
x2, y
)
; . . . ;(xn, y
2
необходимо оценить уравнение
Y*= β
*
0
*
+ β
X. (6.12)
1
Оценка параметров. Согласно методу наименьших квадратов оценки
β
*
0
и β
*
неизвестных пармеметров β0и β1находятся из условия
1
SSR =
n
X
i=1
2
e
i
=
n
X
i=1
(
yi− y
n
X
2
*
)
=
i
i=1
(
yi− β
*
0
− β
2
*
)
x
→
i
1
min
*
β
,β
0
.
*
1
Необходимым условием минимума функции является равенство нулю
первых частных производных:
n
∂SSR
∂β
∂SSR
*
∂β
0
= −2
*
0
= −2
X
i=1
n
X
i=1
(
yi− β
(
x
i
yi− β
*
0
− β
*
− β
0
*
)
x
= 0,
i
1
*
)
x
= 0.
i
1
)}
n
Эти равенства называются системой нормальных уравнений, решая ко-
торую получим формулы для оценок коэффициентов модели (6.12):
P
n
β
1
*
n
=
1
1
n
P
i=1
n
i=1
β
xiyi− m
2
x
−(m
i
*
= m
0
*
Y
*
X
*
x
− β
*
m
)
*
1
2
cov(X,Y)
Y
=
*
(
σ
x
*
m
. (6.14)
X
, (6.13)
2
)
Оценка дисперсии случайной составляющей ε определяется формулой
n
X
=
1
n − 2
i=1
2
e
i
2
S
ε
1
=
n − 2
n
X
i=1
(
yi− y
2
*
)
. (6.15)
i

6.1. Коротко о главном 185
Тогда стандартные ошибки коэффициентов регрессии можно вычис-
лить следующим образом
*
S
= S
β
0
ε
n
P
P
n
i=1
n
2
x
i=1
i
(
xi− m
2
*
)
x
1
*
S
= S
β
1
P
ε
n
i=1
(
xi− m
= S
2
*
)
x
= S
ε
ε
n
n
P
P
n
i=1
n
i=1
x
P
x
2
i
2
i
n
−
n
i=1
−
(
x
P
(
P
2
i
n
i=1
n
i=1
, (6.16)
2
)
x
i
. (6.17)
2
)
x
i
Проверка значимости коэффициентов. Коэффициент регрессион-
ной модели βj, j = 0; 1 считается значимым, если он статистически отличен
от нуля. В терминах проверки статистических гипотез определение значимости коэффициента проводится следующим образом.
1. Выдвигается основная гипотеза
H0: βj= 0 (коэффициент βjнезначим)
против альтернативы
H1: βj= 0 (коэффициент βjзначим).
2. Вычисляется значение статистики
*
β
t =
j
, (6.18)
*
S
β
j
которая, при справедливости гипотезы H0, имеет распределение Стьюдента
с n − 2 степенями свободы.
3. По заданному уровню значимости α с помощью таблицы t -распреде-
ления вычисляется критическое значение t
крит
= t
1−α/2
(
n − 2).
4. Правило принятия решения, если
|t|
< t
1−α/2
(
n − 2)— гипотеза H0принимается (коэффициент статисти-
чески не значим);
|t|
≥ t
1−α/2
(
n − 2)— гипотеза H0отклоняется (коэффициент статисти-
чески значим).
Адекватность модели. Средняя относительная ошибка аппроксима-
ции вычисляется по формуле:
A =
1
n
n
X
i=1
yi− y
y
*
i
i
· 100%=
1
n
n
X
i=1
e
i
· 100%. (6.19)
y
i
Если A 6 7%, то считают, что модель имеет хорошее качество.

186 Глава 6. КОРРЕЛЯЦИОННЫЙ И РЕГРЕССИОННЫЙ АНАЛИЗ
Коэффициентом детерминации R2регрессионной модели называют ве-
личину
R2=
P
P
n
i=1
n
i=1
*
y
− m
i
yi− m
*
y
*
y
2
2
= 1 −
P
P
n
i=1
n
i=1
(
yi− y
yi− m
2
*
)
i
. (6.20)
2
*
y
Коэффициент детерминации характеризует долю дисперсии зависимой
переменной Y, объясняемую регрессией, в общей дисперсии. Соответственно, величина 1 − R2характеризует долю дисперсии Y, вызванную влиянием
остальных не учтенных в модели факторов.
Коэффициент детерминации лежит в интервале 0 ≤ R2≤ 1. Чем ближе
R2к 1, тем выше качество модели.
Для оценки значимости уравнения регрессии в целом выполняют следующие шаги.
1. Выдвигается основная гипотеза
H0: R2= 0, модель в целом незначима,
против альтернативы
H1: R2= 0, модель в целом значима.
2. Вычисляется значение статистики
F =
2
R
1 − R
(
n − 2
n
i=1
P
y
n
i=1
*
− m
i
P
)
=
2
*
y
(
yi− y
2
(
*
i
n − 2
2
)
)
, (6.21)
которая при справедливости гипотезы H0имеет распределение Фишера с
(
1,n − 2)степенями свободы.
3. По заданному уровню значимости α, используя таблицы F-распределения,
находим критическое значение F
крит
= F
1−α
(
1,n − 2).
4. Правило принятие решения, если
а) F < F
, то гипотеза H0принимается, и модель в целом при заданном
крит
уровне α признается незначимой;
б) F ≥ F
, то гипотеза H0отклоняется, и модель в целом при заданном
крит
уровне α признается значимой.
Отметим, что для парной линейной регрессии t-критерии для коэффициента корреляции rxy, коэффициента регрессии β1и F-критерий для
модели в целом совпадают.

6.1. Коротко о главном 187
Множественная линейная регрессия На практике часто используется множественная линейная модель вида
Y = β0+ β1X1+ β2X2+ . . . + βkXk+ ε, (6.22)
где βi, i = 0,k — параметры (вообще говоря неизвестные) регрессионной
модели, ε — случайная ошибка, имеющая нормальное распределение.
Для проведения регрессионного анализа из(k + 1)–мерной генеральной
совокупности Y, X1, . . . Xkизвлекается выборка одновременных наблюдений
объемом n, при этом i-е наблюдение (объект) характеризуется значениями
yi,xi1,xi2, . . . ,xik, i = 1,n
переменных Y,X1, . . . Xk, где xij— значение j–й переменной для i–го наблюдения yi, — значение результативного признака для i–го наблюдения.
Тогда уравнение модели (6.22) можно записать в координатной форме
yi= β0+ β1xi1+ β2xi2+ . . . + βkxik+ εi, (6.23)
или матричном виде
Y = βX + ε, (6.24)
где Y — случайный вектор–столбец размерности n × 1 наблюдаемых значе-
T
ний результативного признака Y =(y1,y2, . . . ,y
)
, X — матрица размерно-
n
сти n ×(k + 1)наблюдаемых значений регрессоров.
X =
⎛
1 x
⎜
⎜
. . . . . . . . . . . .
⎜
11
. . . x
⎜
⎜
1 x
⎜
⎜
. . . . . . . . . . . .
⎝
i1
. . . x
1k
ik
⎞
⎟
⎟
⎟
⎟
⎟
⎟
⎟
⎠
,
1 x
β — вектор–столбец β =(β0,β1, . . . ,β
n1
)
k
x
nk
T
размерности(k + 1)× 1 неизвест-
ных, подлежащих оценке параметров модели; ε — вектор–столбец размерности n × 1 случайных ошибок модели.
Оценивание параметров модели. Оценки β
0
,β
*
, . . . ,β
1
*
неизвестных
k
*
коэффициентов β0,β1, . . . ,βkмодели (6.22) являются решением оптимизационной задачи МНК

188 Глава 6. КОРРЕЛЯЦИОННЫЙ И РЕГРЕССИОННЫЙ АНАЛИЗ
n
SSR =
X
j=1
(
yj−y
2
)
→
j
β
min
*
,β
0
*
,...,β
1
.
*
k
Ее решение — это вектор столбец, определяемый формулой
β*=XTX
−1
XTY. (6.25)
Оценка дисперсии σ
(
2
S
ε
Y − β*X
=
)T(
Y − β*X
n − k − 1
2
случайного члена ε определяется формулой
ε
n
)
=
1
n − k − 1
X
i=1
(
yi− y
2
*
)
=
i
n
1
X
=
n − k − 1
i=1
2
e
. (6.26)
i
Точность коэффициентов модели. Оценка ковариационной матрицы
вектора β*коэффициентов регрессии определяется выражением
cov
*
*
(
)
β
= S
2
ε
XTX
−1
.
Учитывая, что на главной диагонали ковариационной матрицы находятся дисперсии оценок коэффициентов регрессии, можно выписать стандартные ошибки оценок коэффициентов
где
XTX
*
S
= S
β
j
−1
(
ε
XTX
— диагональный элемент матрицыXTX
jj
−1
)
, (6.27)
jj
−1
.
Стандартная ошибка (оценка среднего квадратичного отклонения) для
прогноза условного среднего зависимой переменной, если регрессоры равны
X = X0, определяется формулой
T
S
= S
*
Y
0
ε
X
0
(
XTX
−1
)
X0.
Стандартную ошибку для индивидуального прогноза зависимой переменной, если регрессоры равны X = X0, можно вычислить по формуле
*
S
= S
Y
0
ε
1 + X
T
0
(
XTX
−1
)
X0.

6.1. Коротко о главном 189
Оценку качества построенной модели дает коэффициент детерминации R2, а также средняя ошибка аппроксимации, которые, как и в парной
модели, определяются формулами (6.20) и (6.21).
Однако значение R2при добавлении в модель нового регрессора возрастает, независимо от того влияет ли новый регрессор на независимую
переменную или нет. И в связи с этим используют скорректированный
(adjusted) коэффициент детерминации:
n − 1
S
= 1 −1 − R
adj
2
n − k − 1
. (6.28)
Линейная модель с двумя регрессорами Рассмотрим модель
Y = β0+ β1X1+ β2X2+ ε.
В данном случае матрицы XTX и XTY имеют вид
XTX =
⎛
⎜
⎜
⎝
P
P
n
P
x
i1
P
x
i1
P
x
i2
2
x
i1
xi1x
P
P
xi1x
P
i2
⎞
x
i2
⎟
⎟
i2
⎠
2
x
i2
Следовательно, оцененная модель примет вид
где оценки β
*
0
, β
*
1
и β
Y*= β
*
коэффициентов регрессии, согласно соотношению
2
*
0
+ β
*
X1+ β
1
(6.26), можно вычислить по формулам
β
β
*
(
cov
*
=
1
cov
*
=
2
X1,Y)S
*
(
X2,Y)S
*
β
= m
0
2
− cov
x
2
2
2
S
S
1
S
1
*
y
−[cov
x
2
2
− cov
x
1
2
−[cov
x
2
− β
x
2
S
x
*
(
X2,Y)cov
*
(
X1,X
*
(
X1,Y)cov(X1,X
*
(
X1,X
*
*
m
x
1
− β
1
, XTY =
*
X2,
2
*
2
)]
2
2
)]
2
*
*
m
. (6.31)
2
x
2
⎛
⎜
⎜
⎝
(
X1,X
y
⎞
i
⎟
⎟
.
i1
⎠
i2
P
P
P
2
yix
yix
)
, (6.29)
)
2
, (6.30)
Стандартные ошибки коэффициентов β
ниями
S
β
=
i
nS
2
x
i
2
S
ε
1 − r
*
и β
1
2
x1,x
*
определяются соотноше-
2
. (6.32)
2

190 Глава 6. КОРРЕЛЯЦИОННЫЙ И РЕГРЕССИОННЫЙ АНАЛИЗ
Оценка значимости коэффициента регрессии βjосуществляется с использованием критерия Стьюдента.
При этом выдвигается основная гипотеза
H0: βj= 0;
против двусторонней альтернативы
H1: βj= 0.
Для выбора одной из этих гипотез вычисляют статистику критерия:
*
β
t =
j
,
*
S
β
j
которая, при справедливости гипотезы H0, имеет распределение Стьюдента
с n − k − 1 степенями свободы.
Таким образом, при уровне значимости равном α, если:
а)|t|< t
1−α/2
(
n − k − 1)— гипотеза H0принимается (коэффициент не
значим);
б)|t|≥ t
1−α/2
(
n − k − 1)— гипотеза H0отклоняется (коэффициент ста-
тистически значим).
Здесь t
p
(m)
— квантиль распределения Стьюдента с m степенями сво-
боды уровня p.
Значимость уравнения регрессии в целом, т.е. гипотезы
H0: β1= 0, . . . ,βk= 0;
против альтернативы
H1: хотя бы для одного ii = 1,kβi= 0,
проверяется по F–критерию Фишера.
Если справедлива основная гипотеза, то статистика критерия
2
F =
(
R
n − k − 1
(
1 − R
)
2
)
k
имеет распределение Фишера с(k,n − k − 1)степенями свободы.
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
