Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Прикладная математическая статистика. Учебное пособие
.pdf
81
Y
P
X
Y
Y
Q
S P Q
= −
τ
2(2 5)
9 ( 1)
+
−
0,5
τ >
( )
m n n
−
m
n
W
S
2
R
n
j
R R
∑
2 2
j
R R
∑
( 1)
= χ −
W W
α
>
j
m n m T
∑
j j j
T t t
= −
j
t
• значения X ранжируются в порядке возрастания или убывания;
• значения Y располагаются в порядке, соответствующем значениям X;
• для каждого ранга
превышающих его по величине. Суммируя эти числа, определяем величину
(число последовательностей) — меру соответствия последовательностей рангов
;
• для каждого ранга
величины. Суммируя величины, получаем величину
определяется число следующих за ним значений рангов,
определяется число следующих за ним рангов, меньших его
(число инверсий);
и
• определяется разность по всем членам ряда
Связь между признаками можно признать статистически значимой, если значение
.
n
коэффициента корреляции
между признаками значимой, если
3.
Коэффициент конкордации.
ранжированными признаками применяют
корреляции — коэффициент конкордации,
где
—- количество факторов;
— число наблюдений;
— отклонение суммы квадратов рангов от среднего квадрата суммы рангов
τ > τ =
α α
=
W
S R
= −
W
u
(на практике часто полагают связь
n n
).
Для определения тесноты связи между несколькими
множественный коэффициент ранговой
который вычисляется по формуле:
12
S
W
2 3
2
, (7.14)
, (7.15)
10
где
Критическое значение коэффициента конкордации равно
значимой.
Если среди последовательностей рангов есть совпадения, то коэффициент конкордации
следует вычислять по формуле
где
рангам присваиваются средние ранги.
На основе приведенных выше формул (7.10)—(7.12) произведем вычисление
непараметрических коэффициентов корреляции и проверим их значимости. Для
непараметрических методов необходимы дополнительные преобразования, которые покажем
на примерах (вынесено на практику).
=
j
=
1
, то с вероятностью α корреляция между изучаемыми признаками признается
3
,
,
– количество совпавших рангов в j-й последовательности. Совпавшим
10
=
.
1
j
=
W
=
2 2
− −
( 1)
12
W n
1
α α
S
W
, (7.16)
m
j
=
1
( 1)
m n
−
2
. Если

82
Вопросы для самопроверки
1. Для чего используется корреляционный анализ?
2. Как вычисляются параметрические коэффициенты корреляции?
3. Как определяется значимость коэффициента корреляции?
4. Что такое множественный коэффициент корреляции?
5. Как определяется значимость множественного коэффициента корреляции?
6. Вычисление непараметрических коэффициентов корреляции. Коэффициент ранговой
корреляции Спирмана.
7. Коэффициент ранговой корреляции Кендалла.
8. Коэффициент конкордации.

83
x
y
( ) ( , )
F y F x y
=
y
x
y
x
( ; ); ( ; ); ( ; ); ( ; )
f x f x f x f x
µ = β µ = β µ = β µ = β
( ,..., )
k
β = β β
y
x
( ; )
f x
µ = β
y
x
( ; )
f x
µ = β
y
( ; )
y f x
= β + ε
2
( ; )
= − β
( ; )
f x
β
j
β
i
y
( ; )
f x
β
2
( ; )
= − β
k
( ; )
f x
β
1
k m
= +
( ; )
y f x
= β + ε
( ; )
f x
β
( ; )
f x
β
2
≥
( ; )
f x
β
y
x
( ; )
y f x
= β + ε
y
x
Тема 8. Регрессионный анализ
Рассмотренные ранее методы дисперсионного и корреляционного анализа позволяют
выявить наличие связи между случайными величинами и оценить силу этой связи.
Следующей ступенью является выявление конкретного функционального вида связи
между случайными величинами.
При наличии корреляционной связи между
и
имеет место соотношение
т.е. функция распределения случайной величины
случайной величины
параметрами. Изменение функции распределения случайной величины
задать зависимостями
1 2 2 3 3 4 4
y y y y
называемыми соответственно –
Здесь
дисперсия и моменты высших порядков распределения
Наибольший практический интерес представляет определение зависимости
описывающей истинную зависимость между
1
y
оценки их статистических свойств составляют содержание регрессионного анализа.
По выборочным данным можно найти только оценку истинной регрессии, содержащую
ошибку, связанную со случайностью выборки.
В основе регрессионного анализа лежит принцип наименьших квадратов, в соответствии с
которым в качестве уравнения регрессии
выбирается функция, доставляющая минимум сумме квадратов разностей
n
s y f x
функции
( )
∑
1
=
i
1
называется регрессией
i i
определяется заранее, а методом наименьших квадратов определяются ее
.
Любая функция распределения полностью определяется своими
регрессионной, скедастической, клитической и синагической
– параметры модели. На практике обычно предполагается, что
не зависят от значения
и
.
Зависимость средних значений
по x, а методы нахождения таких зависимостей и
,
.
Здесь ε – случайная погрешность уравнения. Как правило, вид
зависит от значения
от
можно
,
1
y
.
.
,
коэффициенты
вокруг регрессии
где
если
(
регрессии.
(процесса), а также из общего графического анализа зависимости между
нелинейной зависимости
преобразования переменных
приведены в табл. 1 (для случая двух параметров).
–
число коэффициентов, входящих в аналитическое выражение регрессии (например,
В зависимости от вида уравнения регрессии
– многочлен первой степени) и нелинейную (
Вид функции
Чаще всего ограничиваются рассмотрением линейной регрессионной модели, а при
, минимизирующие s. Количественной мерой рассеяния значений
является дисперсия
n
и
1
( )
∑
n k
−
.
Наиболее распространенные из этих преобразований
=
i
i i
1
используют различные линеаризующие
D y f x
– многочлен степени m, то
выбирается исходя из особенностей исследуемого явления
).
,
различают линейную
– многочлен степени
и
)
.

84
* * * *
y a b x
( ; )
y f x
= β
*
y
*
x
*
a
*
b
b
x
= +
y
1
x
a
b
a
b x
+
1
y
x
b
a
1
a
ax
b x
+
1
y
1
x
b
a
1
a
x
a bx
+
x
y
x
a
b
x
y ab
lg
y
x
lg
a
lg
b
b
y ax
lg
y
lg
x
lg
a
b
bx
y ae
ln
y
x
ln
a b
/
b x
y ae
ln
y
1
x
ln
a
b
n
y a bx
y
n
x
a
b
i
y
2
y
σ
i
y
(
)
; ( ) ( ) ( )
= β + ε = β + β + β + + β + ε
…
Таблица 8.1. Линеаризующие функциональные преобразования
(
= +
)
Исходная
зависимость
y a
y
=
y
=
y
=
=
=
=
=
= +
Преобразование
переменных
Преобразование
коэффициентов
Схема регрессионного анализа включает в себя последовательное решение следующих
задач: нахождение выборочной оценки истинной регрессии (т.е. нахождение коэффициентов
регрессии); оценки статистической значимости выборочной регрессии в сравнении с
безусловным разбросом значений
доверительных областей, с заданной вероятностью включающих в себя истинную регрессию.
Среди дополнительных задач, позволяющих получить полную статистическую
картину изучаемой регрессии, отметим: анализ так называемых регрессионных остатков
(разница между выборочной регрессией и выборочными значениями функции); анализ
наличия грубых отклонений от регрессии (выбросов); построение толерантных границ
для регрессии.
Разработанный в настоящее время аппарат регрессионного анализа предполагает, что
значения
должно быть предварительно проверено с помощью критериев нормальности (см. раздел 3.3)
и критериев сравнения дисперсий (см. раздел 4.3).
взаимно независимы и нормально распределены. Выполнение этих условий
, характеризующимся дисперсией
; определение
8.1. Построение модели регрессии
Рассмотрим линейную по коэффициентам модель регрессии:
y f x f x f x f x
0 1 1 2 2
k k
, (8.1)

85
( ), 1,...,
f x j k
=
( ), 1,
x f x j k
(
)
= β + ε = β + β + β + + β + ε
…
, 0,
j k
( , , , , )
k
Y X X X
…
Y X
= β + ε
(
)
T
Y y y y
T
…
(
)
T
ε = ε ε
…
(
)
2
0,
ε ∈Ν σ
X
j
X
+
×
0
x
1 2
, ,...,
k
x x x
1 1
2 2
k
k
n n
k
x x
x x
x x
⋯
*
β
T
…
* * *
0 1
, , ,
k
β β β
…
Q
i
y
( )
i
f x
Q y f x Y X Y X
= − = ε =ε ε = − β − β
*
β
(
)
X X X Y
2
S
i
y
2
y
S
i
y
y
2
S
где ε - случайная величина с математическим ожиданием равным нулю и дисперсией
j
Полагая,
регрессии:
Пусть для оценки неизвестных параметров
взята выборка объемом n из значений величин
где
β = β β β
матрицы X содержит единицы (значения фиктивной переменной
значения переменных
=
1 2
, , ,
( )
0 1
, ,
1
- матрица исходных данных переменных
n
– некоторые заданные функции.
= =
j j
y f x x x x
, ...,
– вектор ошибок, где
;
- вектор значений переменной y;
n
- вектор параметров модели;
k
перейдем к модели множественной линейной
0 1 1 2 2
β =
j
1 2
,
i
:
и независимы;
размерами )1(
k k
. (8.2)
уравнения регрессии (8.2)
. Тогда
kn
. Первый столбец
), остальные столбцы
2
σ
;
X
1
1
=
⋯
1
⋯
1
.
⋯
1
1
Для нахождения оценки
наименьших квадратов, согласно которому в качестве оценок
которые минимизируют сумму квадратов
n n
( )
∑ ∑
i i i
= =
i i
1 1
Оценка
метода наименьших квадратов имеет вид:
вектора параметров
2
( )
1
* T T
β =
−
отклонений значений
2
T
. (8.4)
β = β β β
( ) ( )
, , ,
( )
0 1
T
8.2. Оценка адекватности регрессии
Количественной мерой адекватности является отношение дисперсии
используем метод
k
берутся такие,
от
. (8.3)
:
,
определяемой рассеянием значений
естественного рассеяния значений
можно сформулировать так: ошибки, обусловленные заменой истинной зависимости на
выборочную регрессию, находятся на уровне естественного разброса, наблюдаемых
случайных величин.
Оценим сначала величину дисперсии модели
вокруг своего среднего
вокруг линии регрессии, к дисперсии
.
Другими словами это
:

86
T
S y y e e e
ɵ
i k k
y x x
= β + β + β
…
i
y
2
S y y
( 1, 1)
> = − − = −
1 2
( , )
F v v
1
v
2
v
α
1 2
( , )
F v v
2
( )
y y
( 1, 1)
> = − − = −
0 1 2
, ,
β β β
2
2
( )
( )
y y
y y
2
R
Y
ɵ
i i
e y y
= −
ɵ
y
y
i
e
i
e
i
e
( ) 0
M e
=
1 1 1
− − − − − −
n k n k n k
где
2 2 2
* * *
0 1
i
= − = =
Оценка дисперсии разброса случайных чисел
n
1
2
= −
y i
n
−
Если
Фишера с
вероятностью
2
S
<
α
2
S
y
Примечание.
Если
F F v n k v n
( )
∑
1
1
=
i
2
S
F v n k v n
α
2
S
y
и
степенями свободы, то ошибка в определении регрессии с доверительной
признается статистически значимой, а модель неадекватной. Если
, то модель можно признать адекватной.
В пакете Excel используется статистика
1 2
α
отбрасывается гипотеза о том, что коэффициенты модели
n n
( )
∑ ∑
1 1 1
= =
i i
1 1
ɵ
i
i
.
вокруг своего среднего значения равна
.
1 2
, где
α
F
– квантиль распределения
=
n k
− −
, то модель признается адекватной (т.е.
,
n
1
k
1
( )
∑
=
1
i
∑
1
ɵ
y y
−
i
n
=
1
i
i
равны нулю) (см.
−
Дрейпер Н., Смит Г. Прикладной регрессионный анализ. Том 1. – М.: Финансы и
статистика, 1986. –366с. [3], на стр.53).
2
.
ɵ
i
Качество модели также можно оценить с использованием оценки коэффициента
n
ɵ
−
i
1
−
i
1
. Чем ближе значения
объясняет модель регрессии.
к 1, тем большую долю
2
R
детерминации:
=
дисперсии величины
∑
=
i
n
∑
=
i
8.2.1 Анализ регрессионных остатков
Определенную информацию об адекватности уравнения регрессии дает исследование
остатков вида
истинную зависимость между
распределенными случайными величинами с нулевым средним и в значениях
отсутствовать тренд. Нормальность распределения остатков
. Если выборочная регрессия
i
и x, остатки
удовлетворительно описывает
должны быть независимыми нормально
должен
может быть установлена
одним из критериев согласия (см. раздел 3.3).
Гипотезу о равенстве
можно проверить любым параметрическим или
непараметрическим критерием сравнения среднего с заданным значением (в нашем случае с
нулем, см. раздел 4.4).

87
( 1,..., )
e i n
=
2
( )
> α
4 ( )
> − α
( ) ( )
α > > α
4 ( ) 4 ( )
− α > > − α
( ) 4 ( )
α < < − α
( )
α
( )
α
ɵ
( | )
y M Y X x
= =
(1, , , )
T
X x x
…
(
)
t
α
1
n k
− −
(1, , , )
T
X x x
…
(
)
( )
y f x
= + ε
(
)
0 0
X X
2 2
S
ε =
j
β
jj
jj
1
( )
X X
−
2
σ
2 2 2
( 1) /
χ = − − σ
i
ε
1
n k
− −
jj
: 0
β =
1
n k
− −
Независимость в последовательности значений
с помощью сериального коэффициента корреляции Дарбина-Ватсона. Статистика
сериального коэффициента корреляции Дарбина-Ватсона имеет вид
n
e e
( )
∑
i i
2
=
i
D
=
n
∑
=
i
Если
наличии соответственно отрицательной или положительной корреляции остатков.
Если
принять решение по гипотезе о наличии или отсутствии корреляции остатков. Если
D D D
значения
приведены в табл. 11 (см. статистические таблицы).
8.2.2 Доверительный интервал для уравнения регрессии
точке
D D
D D D
2 1
2 2
D
Доверительный интервал для условного среднего
=
0 1
1
1
или
и
D
0 0
D D
или
, то гипотеза корреляции остатков отклоняется. Критические
для различных α и числа k коэффициентов в регрессии
2
определяется по формуле:
k
, то с достоверностью α принимается гипотеза о
1
D D D
1 2
i
−
1
−
.
2
e
i
1
, то критерий не позволяет
может быть проверена
в многомерной
* 1
T T T
X t S X X X X
β ±
( )
0 1 / 2 0 0
точке
T T T
X t S X X X X
β ± +
( )
0 1 / 2 0 0
будет определяться двумя источниками: погрешностью
связанной с погрешностями параметров модели, и погрешностью собственно модели
−α
степенью свободы. Соответственно доверительный интервал для значений y в
=
0 1
* 1
.
0 0
−α
( )
будет иметь вид:
k
1 ( )
−
−
, где
– квантиль распределение Стьюдента с
, так как погрешность модели
2 1
2
∆ =
f
T T
( )( )
X XS
−
8.3. Оценка дисперсии коэффициентов регрессии и доверительных
интервалов
где
Оценка дисперсии коэффициента
1
T
( )
X X
Доверительные интервал для
−
соответствующий диагональный элемент матрицы
находится по формуле:
находится с использованием статистики
2 2 1
s S X X
=
j
T
T
( )
.
−
,
,
n k S
квадрат с (
Для проверки значимости коэффициентов уравнения регрессии используем
статистику
распределение Стьюдента с (
=
t
j
, которая при нормальном распределении
) степенью свободы.
*
β
j
2 1
T
( )
S X X
−
имеет распределение хи-
, которая при истинности гипотезы
) степенью свободы. Если для заданного уровня
H
0
j
, имеет

88
| |jt
( 1)
= − −
α
| |
j
t
(
)
j
P x t
α
jj
t
α
1
n k
− −
Y
1,3
σ =
( , )
X Y
значимости α значение
больше критического
t t n k
крит
1 / 2
−α
, то нулевая
гипотеза отвергается и коэффициент признается значимым. В противном случае
коэффициент признается незначимым, и соответствующее слагаемое исключается из модели.
В пакете Excel рассчитывается также уровень значимости
вероятность
>
. Степень значимости параметров распределения качественно
определяется по уровню значимости: не значимые (
0,050), статистически значимые (0,050 >
высоко значимые (0,001 >
Для уровня значимости
* 2 1
t S X X
β ±
j
α
T
( )
−
).
α
, где
доверительный интервал рассчитывается по формуле
– квантиль распределение Стьюдента с
≥ 0,010), сильно значимые (0,010 >
α
≥ 0,100), слабо значимые (0,100 >
α
статистики
α
, т.е.
≥
α
≥ 0,001),
степенью
свободы.
8.4 Пример построения уравнения регрессии
Имеется выборка значений совместно наблюдаемых величин X и Y:
X 0,5 1 1,5 2 2,5 3 3,5 4 4,5 5
Y 2,96 0,61 4,63 2,44 2,23 4,89 4,98 3,89 6,74 8,07
X 5,5 6 6,5 7 7,5 8 8,5 9 9,5 10
Y 8,34 9,56 9,30 12,35 11,46 11,09 7,91 8,16 6,54 7,88
Требуется подобрать подходящую модель регрессии, характеризующую зависимость
от X, если известно, что ошибка
Нанесем точки
на координатную плоскость – построим корреляционное поле,
2
.
соответствующее нашей выборке (рис. 8.1)
Исходная выборка
14
12
10
8
Y
6
4
2
Y
0
0 2 4 6 8 10 12
X
Рис. 8.1. Исходные данные

89
2
y x x
= β + β + β
2
x x x x
= =
0 1 1 2 2
y x x
= β + β + β
(
)
X X X Y
X
1
x
2
x
X
* * * * 2
y x x
Видим, что существует зависимость, между значениями Y и X, причем зависимость явно
нелинейная. Попробуем аппроксимировать эту зависимость для начала полиномами
различных порядков. Возьмем в качестве уравнения регрессии квадратное уравнение:
0 1 2
Чтобы воспользоваться МНК для оценки коэффициентов, проведем линеаризацию
модели, положив
,
1 2
, получим
Тогда оценку вектора параметров, согласно МНК, найдем как
1
−
Здесь
значения
* T T
β =
- матрица, первый столбец которой содержит единицы, а второй и последующий
и
.
Для облегчения подбора модели можно воспользоваться встроенными функциями
пакета EXCEL (для выбранной модели все равно потом потребуется провести все
вычисления вручную, чтобы построить доверительные интервалы). В пакете анализа
необходимо выбрать функцию “регрессия”, задать столбец значений Y и матрицу,
соответствующую
(единичный столбец в этом случае задавать не надо). Если выбрать
вывод остатков, то помимо регрессионной статистики, будут выведены и предсказанные
значения Y, т.е.
= β + β + β
0 1 2
Для нашей модели, регрессионная статистика, полученная пакетом Fxcel будет иметь
следующий вид:
Таблица 8.1.
ВЫВОД ИТОГОВ
Регрессионная статистика
Множественный R 0,852379622
R-квадрат 0,72655102
Нормированный Rквадрат 0,694380552
Стандартная ошибка 1,820336831
Наблюдения 20
Таблица 8.2.
Дисперсионный
анализ
Регрессия 2 149,6702188 74,83510939 22,58750495 1,63336E-05
Остаток 17 56,32303623 3,313119778
df SS MS F Значимость F

90
2
R
2
2
( )
( )
y y
y y
1
1
n k
−
− −
2
S S
2 2
( )
S y y
2 2
регрессия R
SS y y k S
= − = ⋅
( ) ( 1)
= − = ⋅ − −
Итого 19 205,993255 10,841750 0,305589
Таблица 3.
Стандартная
Коэффициенты
Y-пересечение -0,963028418
Переменная X1 2,604940094
Переменная X2 -0,167559332
ошибка
t-статистика P-Значение
1,354297293 -0,711090853
0,594036759
4,385149663
0,054953956 -3,049085893
0,486670901
0,000403854
0,007253372
(продолжение таблицы 8.3)
Нижние 95% Верхние 95%
-3,82010793 1,894090386
1,351577249 3,858001699
-0,283477711 -0,051610008
Здесь в первой таблице:
Множественный R – корень квадратный из коэффициента детерминации
n
ɵ
∑
2
=
R-квадрат – коэффициент детерминации
R
i
=
n
∑
i
=
Нормированный R-квадрат – это скорректированная величина коэффициента
2
детерминации, вычисляемая по формуле
Стандартная ошибка – значение
оценка дисперсии предсказания
Наблюдения – объем выборки n.
2
σ ;
R R
1 (1 )
= − −
=
, где
−
i
1
−
i
1
;
n
2
1
= −
n k
− −
;
n
∑
1
i i
i
1
=
Во второй таблице:
;
ɵ
-
df – степени свободы v;
•
• SS – сумма квадратов разностей:
1)
между модельными значениями и средним
2) остатки
n
ɵ
( )
∑
i
1
=
i
n
SS y y S n k
остаток i i
∑
=
i
1
;
ɵ
2 2
;
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
