- •Оглавление:
- •Введение.
- •Общая характеристика статистической информации.
- •1.Исходные данные.
- •2. Корреляционный анализ.
- •Процедуры выбора регрессоров и функциональной формы модели
- •Уравнение с учетом всех указанных факторов.
- •4. Проверка гипотез о линейном ограничении на параметры регрессии
- •Исключение переменных.
- •3. Включение переменных
- •5. Метод главных компонент.
- •6.Проверка линейности регрессии.
- •7.Регрессионная однородность выборки.
- •Проверка спецификации ошибок.
- •1. Нормальность.
- •2. Гомоскедастичность.
- •3.Автокорреляция.
- •Коррекция мнк-оценок и процедуры домнк.
- •1.Мнк с учетом стандартной ошибки в форме Уайта и Нью-веста.
- •2.Метод взвешенных наименьших квадратов.
- •Процедура Кохрана-Оркатта
- •Фиктивные переменные.
- •Интерпретация модели.
- •Приложение.
2. Корреляционный анализ.
Теперь проанализируем взаимосвязь
признаков, оценив матрицу парных
коэффициентов
.
Таблица 1-корреляционная матрица
Анализ матрицы парных коэффициентов
корреляции показывает, что стоимость
полиса автострахования КАСКО (у) наиболее
тесно связана со стоимостью машины
(х3), поскольку r (y,x3)=0,53. Это
хорошо просматривается при построении
корреляционного облака. Невооруженным
глазом можно заметить его овально-продолговатую
форму, которая имеет положительный
наклон.
Рисунок 5 Корреляционное облако.
В то же время достаточно тесная связь между факторами. Так, коэффициент корреляции между и возрастом автомобиля (х1) и пробегом x(2) равен: r12 = 0,57; а между возрастом водителя и его стажем : r 56 = 0,85. Учитывая тесную взаимосвязь показателей в регрессионную модель стоимости полиса КАСКО может войти лишь один показатель из пары, чтобы избежать проблемы мультиколлинеарности.
Процедуры выбора регрессоров и функциональной формы модели
Уравнение с учетом всех указанных факторов.
Рассмотрим модель в виде:
В основе модели лежат следующие гипотезы:
Все переменные (x1,x2,x3,x4,x5,x6) – детерминированные величины, векторы которых независимы между собой.
не
зависят от t.
при
t≠s –
статистическая независимость
(некоррелированность) ошибок для разных
наблюдений.Ошибки
имеют совместное нормальное распределение:
В этом случае модель называется нормальной линейной регрессией.
Результаты проведенных вычислений можно оформить в следующую таблицу для наглядности:
Таблица 2-коэффициенты регрессии (6 факторов).
Нижняя строка таблица содержит показатели адекватности модели.
Проверим, является ли построенная модель
значимой. Для этого выдвинем гипотезу
полученная модель незначима. Для проверки
данной гипотезы используем F-критерий:
=8,89
.
Можем сделать вывод о том, что уравнение регрессии значимо на уровне значимости 0,05 (т.к. Fнабл 8,89 > Fкрит 2,427) и переходим к анализу значимости отдельных коэффициентов регрессии.
Для уровня значимости 0,05 и числа степеней
свободы 43 критическое значение
t-статистики 2,016 не превосходит расчетное
значение этой статистики
только
для двух факторов x(3) и x(6). Поэтому
коэффициенты при остальных факторах
незначимы на уровне значимости 0,05.
Данный вывод так же подтверждается
построением интервальной оценки для
коэффициентов регрессии. Воспользуемся
стандартной формулой для расчёта
доверительного интервала:
,
где
рассчитывается по распределению
Стьюдента на заданном уровне значимости
(в нашем случае, 0,05).
bmin< bi <bmax
-9981,9 < b0 <17647,47
18,29 < b1 < 5,2435725
-0,769 < b2 < 4,078
0,0009 < b3 <0,002
-538,43< b4 < 358,03
-26,76 < b 5 < 19,41
-57,22 < b 6 < -3,024
Только два интервала не включают 0 в свои границы. Значимы коэффициенты при х3 и х6.
Составим прогноз для наблюдения x0, чьи значения на 10% превышают средние значения этих показателей. Составим два прогноза: первый – без учёта случайной ошибки (прогноз среднего), второй – с учётом случайной ошибки (прогноз для случайного наблюдения).
Итак, значимость уравнения в целом сопровождается незначимостью большинства коэффициентов регрессии. Поэтому полученное уравнение регрессии неприемлемо.
Для получения уравнения регрессии со значимыми коэффициентами используем пошаговые алгоритмы отбора факторов.
