- •Лекция 1 Тема: Предмет эконометрики. Методология эконометрического исследования
- •1. История эконометрики
- •2. Понятие эконометрического исследования
- •3. Общий вид эконометрической модели; этапы построения модели
- •Лекция 2 Тема: Парная корреляция
- •1. Задачи и предпосылки корреляционного анализа
- •2. Функциональная, корреляционная, статистическая связи. Виды и формы корреляционной связи
- •3. Коэффициент парной корреляции: определение, оценка по выборке
- •2. Использование закона распределения для выражения числовых характеристик случайной величины
- •3. Выборочный метод. Точечные и интервальные оценки
- •1. Случайная величина. Закон распределения случайной величины
- •1. Статистическая гипотеза. Ошибки в принятии решения по гипотезе
- •2. Алгоритм проверки статистической гипотезы
- •4. Доверительный интервал для коэффициента корреляции в генеральной совокупности
- •1. Модель парной линейной регрессии. Причины существования случайного члена уравнения регрессии
- •2. Метод наименьших квадратов. Преимущества и недостатки метода
- •3. Оценка параметров модели парной линейной регрессии по методу наименьших квадратов
- •Лекция 6 Тема: Анализ показателей точности модели парной линейной регрессии
- •1. Показатель общего качества модели регрессии – коэффициент детерминации
- •2. Оценка дисперсии параметров модели регрессии
- •Лекция 7 Тема: Проверка предпосылок к построению модели регрессии
- •2. Гомоскедастичность отклонений
- •3. Попарная независимость отклонений (отсутствие автокорреляции)
- •2. Формулы точечного и интервального прогноза по модели парной линейной регрессии
- •3. Графический метод проверки гипотезы о нормальном законе распределения
- •Лекция 9 Тема: Модели нелинейной регрессии
- •1. Примеры нелинейных эконометрических моделей
- •3. Выбор между линейной и нелинейной моделью
- •Лекция 10 Тема: Множественный корреляционный анализ
- •1. Множественная корреляция. Коэффициент детерминации
- •2. Мультиколлинеарность
- •3. Отбор факторов для построения модели регрессии. Частная корреляция
- •1. Общий вид модели множественной линейной регрессии. Экономический смысл коэффициентов
- •2. Система уравнений МНК для множественной линейной регрессии
- •3. Анализ общего качества модели и значимости коэффициентов
- •2. Лаговые переменные
- •3. Прогноз по уравнению множественной линейной регрессии
- •1. Временной ряд и его элементы
- •2. Цели анализа временных рядов. Этапы построения модели
- •3. Декомпозиция временного ряда
- •1. Глазомерный метод
- •2. Механические методы выравнивания
- •1. Понятие и задачи аналитического выравнивания временного ряда
- •2. Выбор модели по методу характеристик прироста
- •3. Методы оценивания параметров модели временного ряда
- •1. Понятие сезонной компоненты. Индексы сезонности
- •2. Алгоритмы построения тренд-сезонной модели
- •3. Моделирование сезонных колебаний
- •Лекция 17 Тема: Прогнозирование временных рядов
- •1. Точечный прогноз. Свойства остаточной компоненты
- •2. Интервальный прогноз
- •3. Верификация прогноза
- •Лекция 18 Тема: Модели стационарных временных рядов
- •1. Модели авторегрессии
- •2. Модель авторегрессии – скользящего среднего
- •3. Модель авторегрессии – проинтегрированного скользящего среднего
- •Лекция 19 Тема: Системы одновременных уравнений
- •1. Виды одновременных уравнений
- •2. Методы оценки систем одновременных уравнений
- •3. Проблема идентифицируемости системы одновременных уравнений
Лекция 4 Тема: Проверка статистических гипотез.
Статистические выводы о коэффициенте корреляции
Даны понятия статистической гипотезы, ошибок в принятии решения по гипотезе, приведен общий алгоритм проверки статистических гипотез. Рассмотрены статистические выводы о коэффициенте корреляции: проверка гипотезы о равенстве нулю по критерию Стьюдента и построение доверительного интервала.
Основные вопросы:
1.Статистическая гипотеза. Ошибки в принятии решения по гипотезе.
2.Проверка гипотезы о равенстве нулю коэффициента корреляции в генеральной совокупности.
3.Доверительный интервал для коэффициента корреляции в генеральной совокупности.
Основные понятия:
Статистическая гипотеза – предположение о свойствах генеральной совокупности. Ошибка первого рода – отвергли основную гипотезу, при том, что на самом деле она
верна.
Ошибка второго рода – приняли основную гипотезу, при том, что на самом деле она неверна.
Уровень значимости критерия – предельная вероятность совершить ошибку первого рода.
Мощность критерия – вероятность не совершить ошибку второго рода. Статистический критерий K – это случайная величина, подчиняющаяся некоторому
известному закону распределения. Значение K, как правило, определяет меру расхождения данных выборки с высказанной гипотезой Н0.
Введение
На практике часто приходится на основе выборочных наблюдений проверять различные предположения относительно генеральной совокупности. Процедура сопоставления выдвинутых гипотез с выборкой и принятие решения относительно приемлемости этих гипотез называется проверкой гипотез.
В практике статистических исследований можно встретить различную трактовку численного значения коэффициента парной корреляции r(X ,Y ). Например, в лекции № 2
приведена шкала Чеддока. Имеются и другие трактовки, например, при значении от 0 до 0,3 (по абсолютной величине) говорят об отсутствии линейной связи; от 0,3 до 0,5 – связь слабая; от 0,5 до 0,7 – связь средняя; от 0,7 до 1 – связь тесная. В любом случае полученные результаты расчетов непосредственно относятся лишь к изучаемой выборке. Обобщение результатов на генеральную совокупность связано с темой статистических выводов.
Статистическая значимость результата представляет собой оцененную меру уверенности в его «истинности» (в смысле репрезентативности выборки). То есть, убедившись в статистической значимости, результат, полученный по выборке, можно распространить на генеральную совокупность.
1. Статистическая гипотеза. Ошибки в принятии решения по гипотезе
Статистической проверкой гипотез называется сопоставление гипотезы, выдвинутой относительно генеральной совокупности, с имеющимися выборочными данными. Сопоставление осуществляется с помощью того или иного статистического критерия и сопровождается количественной оценкой степени достоверности сделанного вывода. Основную (нулевую) гипотезу обозначают Н0, а альтернативную (конкурирующую) – Н1.
21
Так как проверка статистических гипотез осуществляется на основании выборочных данных, т. е. ограниченного ряда наблюдений, решение относительно нулевой гипотезы Н0
имеет вероятностный характер. Гипотезу можно принять в случае, если рассматриваемые выборочные данные этой гипотезе не противоречат. Это не значит, что высказанное предположение является единственно подходящим (могут быть и другие гипотезы, которым, возможно, имеющиеся данные тоже не противоречат). Решение принимает исследователь.
Результаты решения относительно нулевой гипотезы даны в таблице 4.1. Таблица 4.1 – Ошибки в принятии решения по гипотезе и их вероятности
Нулевая гипотеза |
Результаты решения относительно нулевой гипотезы Н0 |
||
Н0 |
|
|
|
Отклонена |
Принята |
||
|
|||
|
|
|
|
Верна |
Ошибка 1-го рода, |
Правильное решение, |
|
её вероятность Р(Н1|Н0) = α |
его вероятность Р(Н0|Н0) = 1- α |
||
|
|||
|
|
|
|
Неверна |
Правильное решение, |
Ошибка 2-го рода, |
|
его вероятность Р(Н1|Н1) = 1– β |
её вероятность Р(Н0|Н1) = β |
||
|
|||
|
|
|
|
Здесь символом "|" обозначена условная вероятность. Например, Р(Н1|Н0) – вероятность события "Принята гипотеза Н1 при том, что в действительности верна Н0".
Вероятность ошибки первого рода α называют уровень значимости критерия. Вероятность 1−β называют мощностью критерия.
Статистический критерий K – это случайная величина (СВ), подчиняющаяся некоторому известному закону распределения. Значение K, как правило, определяет меру расхождения данных выборки с высказанной гипотезой Н0.
Вероятности α и β уменьшаются при увеличении объема выборки. При фиксиро-
ванном объеме выборки вероятность α задает тот, кто проверяет гипотезу (обычно α =0,05, 0,1 или 0,01), вероятность β зависит от выбранного критерия. Для проверки одной гипотезы
может применяться несколько критериев различной мощности. Более мощные критерии обычно требуют большего объема выборки и (или) знания закона распределения той генеральной совокупности, из которой извлечена выборка.
Как у любой СВ, у критерия K есть значения, более вероятные и менее вероятные. При проверке статистической гипотезы к маловероятным относят α % значений СВ К, которым соответствуют наименьшие значения функции плотности вероятности СВ К. В зависимости от того, как сформулированы основная и альтернативная гипотезы, это либо самые большие значения СВ К, либо самые маленькие (при односторонних гипотезах), либо поровну (по вероятности) большие и маленькие.
2.Алгоритм проверки статистической гипотезы
1.Формулируют основную и конкурирующую гипотезы. Выбирают критерий,
спомощью которого будет выполняться проверка.
2.Задают уровень значимости α .
3.Множество всех возможных значений критерия K разбивается на два непере-
секающихся подмножества: область принятия гипотезы Н0 и критическую область. Для
этого при двусторонней гипотезе с помощью обратной функции распределения находят два числа: FK−1(α /2) и FK−1(1−α /2). Область между ними – область принятия гипотезы Н0. Справа и слева – двусторонняя критическая область. При односторонней гипотезе находят
одно число: FK−1(α) или FK−1(1−α). Как правило, область принятия гипотезы Н0 – та
область значений СВ К, в которой находится мода распределения СВ К. 4. По имеющейся выборке вычисляют k – значение критерия К.
22
5. При попадании значения k в область принятия гипотезы гипотезу Н0 можно |
|||
принять с вероятностью правильного решения, не меньшей чем 1–α . При попадании k |
|||
в критическую область нулевую гипотезу отвергают с вероятностью ошибки, не превы- |
|||
шающей α . |
|
|
|
Выводы |
|
|
|
Нулевую гипотезу отвергают, если по выборочным данным критерий К принял |
|||
значение, маловероятное для того закона распределения, которому должна подчиняться СВ |
|||
K. Точнее говоря, отвергая гипотезу Н0, отвергают гипотезу о том, что случайная величина K |
|||
подчиняется модельному закону распределения. |
|
||
Принять или отклонить |
гипотезу |
– решает исследователь. Решение может изме- |
|
ниться, если: а) увеличить объем выборки; б) задать другой уровень значимости; применить |
|||
другой критерий. |
|
|
|
3. Проверка гипотезы о равенстве нулю коэффициента корреляции в генеральной |
|||
|
совокупности |
|
|
Учитывая, что полученное по выборке значение |
r(X ,Y ) может отличаться от нуля |
||
просто по причине случайности выборки, в то время как в генеральной совокупности |
|||
исследуемые показатели не связаны, в корреляционном анализе для ответа на вопрос об |
|||
отсутствии корреляционной связи проверяют статистическую гипотезу. |
|||
При значениях r(X ,Y ) |
(далее обозначим r), далеких от -1 или +1, проверка гипотезы |
||
об отсутствии линейной связи двух показателей выполняется по критерию Стьюдента. |
|||
Обозначим ρ – коэффициент корреляции в генеральной совокупности. Формулировка |
|||
гипотез: основная (нулевая) гипотеза H0: ρ = 0, то есть, лине йной связи на самом деле нет; |
|||
альтернативная гипотеза H1: ρ ≠ 0, т. е. два показателя связаны (гипотеза двусторонняя, то |
|||
есть H1: ρ < > 0). |
|
|
|
Критерий Стьюдента: «Если справедлива нулевая гипотеза, то случайная величина |
|||
|
t = r |
n −2 |
(4.1) |
|
|
1−r 2 |
|
подчиняется распределению Стьюдента с числом степеней свободы n–2». |
|||
Из n вычитается 2, т. к. в формулу для расчета r входят два выборочных средних. |
|||
Область принятиягипотезы Н1 |
|
Область принятиягипотезы Н1 |
|
t1кр |
|
0 |
t2кр |
Область принятиягипотезы H0
Рисунок 4.1 – Плотность распределения Стьюдента и критические точки
Поскольку гипотеза двусторонняя, область принятия гипотезы H0 ограничена двумя критическими точками (у распределения Стьюдента они симметричны относительно нуля).
(рис. 4.1). Можно встретить обозначение критической точки: tкр , tтабл , tα , tα;n−2 .
При попадании рассчитанного по формуле (4.1) значения t в область принятия гипотезы нулевую гипотезу Н0 можно принять с вероятностью правильного решения. не меньшей, чем 1–α ; при попадании t в критическую область нулевую гипотезу отвергают с вероятностью ошибки, не превышающей α .
23
Критические значения t-критерия Стьюдента для различных уровней значимости и числа степеней свободы можно найти в «Excel» с помощью функции СТЬЮДРАСПОБР или по таблице.
Критерий Стьюдента можно использовать и для проверки гипотезы о статистической незначимости найденного по выборке значения r . Принятие гипотезы Н0 означает, что при заданном предельном уровне ошибки результат, полученный по выборке, не может быть распространен на генеральную совокупность.
Пример 1. По выборке объема n = 20 получено значение коэффициента корреляции r = 0,5. Вывод 1: обнаружена прямая связь средней силы двух рассматриваемых показателей.
Выдвигаем гипотезу Н0: ρ = 0. Альтернативная гипотеза H1 : ρ ≠ 0.
Критическое значение t-критерия Стьюдента на уровне значимости α = 0,05 при числе степеней свободы n-2 находим по таблице или с помощью функции «Excel» СТЬЮДРАСПОБР
tкрит = t0,05;20−2 =2,10.
Область принятия гипотезы H0 – интервал (-2,10; 2,10). Расчетное (наблюдаемое) значение критерия:
tнабл = |
r |
|
n − 2 |
|
= |
0,5 |
|
20− |
2 |
|
≈ 2,45 . |
||
|
|
|
|
|
|
|
|
|
|
||||
1− r 2 |
1−0,52 |
||||||||||||
|
|
|
|
|
|||||||||
Вывод 2. Поскольку tнабл не входит в область принятия гипотезы H0 , гипотезу H0
отклоняем с вероятностью ошибки, не превышающей 0,05. Связь является статистически значимой, полученный результат можно обобщить.
Пример 2. По выборке объема n = 15 получено значение коэффициента корреляции r = 0,5. Вывод 1: обнаружена прямая связь средней силы двух рассматриваемых показателей.
Выдвигаем гипотезу Н0: ρ = 0. Альтернативная гипотеза H1 : ρ ≠ 0.
Критическое значение t-критерия Стьюдента на уровне значимости α= 0,05 при числе степеней свободы 15-2:
tкрит = t0,05;15−2 = 2,16.
Область принятия гипотезы H0 – интервал (-2,16; 2,16). Расчетное (наблюдаемое) значение критерия:
|
r |
|
|
|
|
= |
0,5 |
|
|
|
|
|
|
tнабл = |
|
n − 2 |
|
|
15 − 2 |
|
≈ 2,08. |
||||||
|
|
|
|
|
|
|
|
|
|
|
|||
1− r 2 |
|
|
−0,52 |
||||||||||
|
1 |
|
|
||||||||||
Вывод 2. Поскольку tнабл входит в область принятия гипотезы H0 , гипотезу H0
принимаем с вероятностью правильного решения, превышающей 0,95. Связь статистически незначима, и обобщать результат нельзя.
Выводы
Принимая нулевую гипотезу о равенстве нулю коэффициента корреляции, можно сделать вывод либо об отсутствии линейной связи двух показателей, либо о том, что объем выборки недостаточен, чтобы утверждать наличие связи.
4. Доверительный интервал для коэффициента корреляции в генеральной совокупности
Интервальная оценка неизвестного параметра генеральной совокупности – интервал, в котором с заранее заданной доверительной вероятностью p , близкой к 1, находится истин-
24
ное значение параметра. Уровень значимости α =1 − p – вероятность того, что истинное
значение параметра находится за границами найденного доверительного интервала.
С доверительной вероятностью p значение ρ – коэффициент парной корреляции для генеральной совокупности – находится в интервале
|
|
|
u |
|
|
|
|
|
|
u |
|
|
|
|
|||||||||
th z(r) − |
|
α /2 |
< ρ |
< th z(r) + |
|
|
|
α /2 |
. |
|
|
(4.2) |
|||||||||||
|
|
|
|
|
|
|
|
|
|
|
|
||||||||||||
|
|
|
|
n −3 |
|
|
|
|
|
n −3 |
|
|
|
|
|||||||||
Здесь z – преобразование Фишера (в Excel функция ФИШЕР). |
|
|
|||||||||||||||||||||
uα / 2 – процентная |
точка |
уровня |
α /2 стандартного |
нормального |
распределения |
||||||||||||||||||
(в Excel – функция НОРМСТОБР с аргументом 1–α /2); |
|
|
|
|
|
|
|
|
|
|
|
|
|||||||||||
α =1 − p ; |
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
th – гиперболический тангенс (в Excel функция TANH или ФИШЕРОБР); |
|||||||||||||||||||||||
Для данных из примера 1 (значения n = 20, |
|
r = 0,5) |
|
зададим |
доверительную |
||||||||||||||||||
вероятность 0,95 и получим: |
|
|
|
|
|
|
|
z(0,5) ≈ 0,55; |
|
|
|
|
|
|
|
|
|
|
|
|
|||
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|||
|
|
1,96 |
|
|
|
u0,05/2 |
≈1,96 ; |
|
|
1,96 |
|
|
|
|
|
||||||||
|
|
|
|
|
|
|
|
|
|
|
|
|
|||||||||||
th 0,55 − |
|
|
|
|
|
|
≈ 0,43 |
; |
th 0,55 |
+ |
|
|
|
|
|
|
|
|
≈ 0,56 |
|
|||
|
|
|
|
|
|
|
|
|
|
|
|
|
|
||||||||||
|
|
20−3 |
|
|
|
|
|
|
|
|
20−3 |
|
|
|
|||||||||
Вывод. С доверительной вероятностью 0,95 истинное значение коэффициента корреляции находится в диапазоне (0,43; 0,56).
Выводы
При малом объеме выборки доверительный интервал может получиться широким. Границы интервала не симметричны относительно значения r .
Заключение
Результаты расчетов, выполненных по данным выборки, относятся только к этой выборке. Для их обобщения на генеральную совокупность, из которой извлечена выборка, надо обосновать статистическую значимость результата. Вывод делается на основе проверки статистических гипотез (сопоставления предположения с данными выборочного наблюдения). Вывод обязательно содержит определенную долю ошибки, поскольку выборка случайна. Для проверки используются статистические критерии. Исследователь выбирает критерий и задает уровень значимости критерия α – предельно допустимую вероятность ошибки первого рода (вероятность отклонить верную гипотезу). Обычно задают α = 0,05.
Основной метод проверки гипотезы о равенстве нулю коэффициента корреляции в генеральной совокупности (об отсутствии линейной связи) – критерий Стьюдента. Статистическая значимость коэффициента корреляции тем больше, чем дальше от нуля
значение r(X ,Y ) и чем больше объем выборки n .
Вопросы для закрепления материала:
1.Что такое статистическая гипотеза?
2.Какого рода ошибки возможны в принятии решения по гипотезе? Можно ли избежать этих ошибок?
3.В каком случае нулевую гипотезу можно принять? Что можно предпринять, если принимать ее не хочется?
4.Сформулируйте критерий Стьюдента для проверки гипотезы о коэффициенте корреляции.
5.От каких показателей зависит ширина доверительного интервала для коэффициента корреляции?
25
