Добавил:
Upload Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:
Итоговый отчет.Беднарская с-32.doc
Скачиваний:
1
Добавлен:
01.05.2025
Размер:
2 Мб
Скачать
☆

2. Корреляционный анализ.

Теперь проанализируем взаимосвязь признаков, оценив матрицу парных коэффициентов .

Таблица 1-корреляционная матрица

Анализ матрицы парных коэффициентов корреляции показывает, что стоимость полиса автострахования КАСКО (у) наиболее тесно связана со стоимостью машины (х3), поскольку r (y,x3)=0,53. Это хорошо просматривается при построении корреляционного облака. Невооруженным глазом можно заметить его овально-продолговатую форму, которая имеет положительный наклон.

Рисунок 5 Корреляционное облако.

В то же время достаточно тесная связь между факторами. Так, коэффициент корреляции между и возрастом автомобиля (х1) и пробегом x(2) равен: r12 = 0,57; а между возрастом водителя и его стажем : r 56 = 0,85. Учитывая тесную взаимосвязь показателей в регрессионную модель стоимости полиса КАСКО может войти лишь один показатель из пары, чтобы избежать проблемы мультиколлинеарности.

Процедуры выбора регрессоров и функциональной формы модели

  1. Уравнение с учетом всех указанных факторов.

Рассмотрим модель в виде:

В основе модели лежат следующие гипотезы:

  • Все переменные (x1,x2,x3,x4,x5,x6) – детерминированные величины, векторы которых независимы между собой.

  • не зависят от t.

  • при t≠s – статистическая независимость (некоррелированность) ошибок для разных наблюдений.

  • Ошибки имеют совместное нормальное распределение:

В этом случае модель называется нормальной линейной регрессией.

Результаты проведенных вычислений можно оформить в следующую таблицу для наглядности:

Таблица 2-коэффициенты регрессии (6 факторов).

Нижняя строка таблица содержит показатели адекватности модели.

Проверим, является ли построенная модель значимой. Для этого выдвинем гипотезу полученная модель незначима. Для проверки данной гипотезы используем F-критерий:

=8,89 .

Можем сделать вывод о том, что уравнение регрессии значимо на уровне значимости 0,05 (т.к. Fнабл 8,89 > Fкрит 2,427) и переходим к анализу значимости отдельных коэффициентов регрессии.

Для уровня значимости 0,05 и числа степеней свободы 43 критическое значение t-статистики 2,016 не превосходит расчетное значение этой статистики только для двух факторов x(3) и x(6). Поэтому коэффициенты при остальных факторах незначимы на уровне значимости 0,05. Данный вывод так же подтверждается построением интервальной оценки для коэффициентов регрессии. Воспользуемся стандартной формулой для расчёта доверительного интервала: , где рассчитывается по распределению Стьюдента на заданном уровне значимости (в нашем случае, 0,05).

bmin< bi <bmax

-9981,9 < b0 <17647,47

18,29 < b1 < 5,2435725

-0,769 < b2 < 4,078

0,0009 < b3 <0,002

-538,43< b4 < 358,03

-26,76 < b 5 < 19,41

-57,22 < b 6 < -3,024

Только два интервала не включают 0 в свои границы. Значимы коэффициенты при х3 и х6.

Составим прогноз для наблюдения x0, чьи значения на 10% превышают средние значения этих показателей. Составим два прогноза: первый – без учёта случайной ошибки (прогноз среднего), второй – с учётом случайной ошибки (прогноз для случайного наблюдения).

Итак, значимость уравнения в целом сопровождается незначимостью большинства коэффициентов регрессии. Поэтому полученное уравнение регрессии неприемлемо.

Для получения уравнения регрессии со значимыми коэффициентами используем пошаговые алгоритмы отбора факторов.