Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Специальные разделы высшей математики. Теория вероятностей и математическая статистика для инженера-исследователя. Учебное пособие

.pdf
Скачиваний:
0
Добавлен:
07.09.2026
Размер:
1 Мб
Скачать
☆
5.3. Двухфакторный дисперсионный анализ 121
Контрольные вопросы
1. Какую задачу решает дисперсионный анализ?
2. Как понимать термины «однофакторный анализ» и «многофакторный
анализ»?
4. Что такое уровни фактора?
5. Каковы предположения дисперсионного анализа?
6. Какой вид имеет основное тождество однофакторного дисперсионного
анализа?
7. Что называется межгрупповой суммой квадратов отклонений?
8. Что называется внутригрупповой суммой квадратов отклонений?
9. Какой вид имеют нулевая и альтернативная гипотезы задачи двухфак-
торного дисперсионного анализа?
10. Какое распределение используется при проверке гипотезы однофактор-
ного дисперсионного анализа?
11. Какова процедура решения задачи однофакторного дисперсионного ана-
лиза.
12. Какие критерии используются для проверки однородности дисперсий?
13. В чем существенная разница между однофакторным и многофакторным
дисперсионным анализом?
14. Какой вид имеет основное тождество двухфакторного дисперсионного
анализа?
Глава 6
КОРРЕЛЯЦИОННЫЙ И
РЕГРЕССИОННЫЙ
АНАЛИЗ
6.1 Основные понятия корреляционного анализа
При анализе эмпирических данных на практике часто требуется установить и оценить зависимость одной случайной величины от одной или нескольких других величин.
Формы проявления взаимосвязей весьма разнообразны. В качестве самых общих их видов выделяют следующие связи:
— функциональную (полную);
— статистическую (неполную).
Зависимость является функциональной в том случае, когда каждой от­дельной величине соответствует строго определенная другая величина. Вообще же строго функциональные зависимости между двумя величинами встречаются крайне редко, так как обе величины подвержены действию случайных факто­ров и среди них могут быть общие для обеих величин. В этом случае возникает статистическая зависимость.
Корреляция (лат. correlatio — соотношение, взаимосвязь) — это статисти- ческая взаимосвязь двух или более случайных величин. Термин корреляция ввёл французский палеонтолог Жорж Кювье в XVIII веке. А, благодаря ан­глийскому биологу и статистику Френсису Гальтону, слово корреляция в конце XIX века нашло свое место и в математической статистике. Корреляционная связь проявляется в среднем, для массовых наблюдений, когда при изменении одной величины изменяется среднее значение другой.
122
6.1. Основные понятия корреляционного анализа 123
Определение 6.1. Корреляционный анализ — статистический метод, поз- воляющий обнаружить зависимость и оценить ее силу между двумя или нескольким случайными величинами.
Цели корреляционного анализа.
1. Определить взаимосвязь между случайными величинами.
2. Прогнозирование, т. е. по поведению одной величины, предсказать пове-
дение другой, коррелирующей с первой.
3. Проведение классификации и идентификации объектов. Корреляцион­ный анализ помогает подобрать набор независимых признаков для классифи­кации.
Ограничения на статистические данные для корректного проведения кор-
реляционного анализа.
1. Данные наблюдений должны быть выбранными из генеральной совокуп­ности, распределенной по многомерному нормальному закону.
2. Его применение оправдано при наличии достаточно большого объема на­блюдений для анализа. На практике считается, что число наблюдений должно не менее чем в 5 раз превышать число переменных.
3. Исходная совокупность значений должна быть качественно однородной.
Итак, основной задачей корреляционного анализа является оценка корре­ляционной матрицы генеральной совокупности по выборке и определение на ее основе оценок частных и множественных коэффициентов корреляции и детер­минации.
Основой для корреляционного анализа является матрица размерности 𝑛×𝑘
𝑋 =
⎛
𝑥11. . . 𝑥1𝑗. . . 𝑥
⎜ ⎜
. . . . . . . . . . . . . . . . . .
⎜ ⎜ ⎜
𝑥𝑖1. . . 𝑥𝑖𝑗. . . 𝑥
⎜ ⎜
. . . . . . . . . . . . . . . . . .
⎝
𝑥𝑛1. . . 𝑥𝑛𝑗. . . 𝑥
1𝑘
𝑖𝑘
𝑛𝑘
⎞
⎟ ⎟ ⎟ ⎟ ⎟ ⎟ ⎟ ⎠
,
которая представляет собой 𝑛 наблюдений для 𝑘-мерного вектора (𝑋1, . . . ,𝑋𝑘).
124 Глава 6. КОРРЕЛЯЦИОННЫЙ И РЕГРЕССИОННЫЙ АНАЛИЗ
а)
б)
в)
𝑦
𝑥
𝑦
𝑥
𝑦
𝑥
Рис. 6.1 – Корреляционное поле:
а) отрицательная корреляция, б) положительная корреляция,
г) отсутствие корреляционной связи
6.2 Показатели корреляции
При анализе двух случайных величин 𝑋 и 𝑌 данные одновременных наблю­дений над ними (𝑥𝑖,𝑦𝑖) удобно представлять графически. Изображая наблюде­ния в виде точек в декартовой системе координат, получим корреляционное поле. По характеру расположения точек поля можно составить предваритель­ное представление о форме зависимости случайных величин (например, о том, что одна из них в среднем возрастает или убывает с возрастанием другой). На рисунке 6.1 приведены примеры корреляционных полей при разных видах корреляционной зависимости.
6.2.1 Парный коэффициент корреляции
Парный коэффициент корреляции характеризуют тесноту и направ­ление связи между двумя переменными соответственно на фоне действия всех остальных показателей, входящих в модель.
Наибольшее распространение в корреляционном анализе, предполагающем нормальный закон распределения наблюдений, получил коэффициент ли- нейной корреляции Карла Пирсона — 𝜌 математика, статистика, биолога и философа; основателя математической ста-
. Он назван в честь английского
𝑥,𝑦
тистики как науки. Этот коэффициент еще называют мерой линейной зависимо­сти двух случайных величин. Парный коэффициент корреляции опредяляется формулой (1.37).
На практике, как правило, точное распределение исследуемых случайных
6.2. Показатели корреляции 125
Таблица 6.1 – Шкала Чеддока
|𝜌𝑥𝑦| Качественная характеристика
Меньше 0,1 Очень слабая
0.1–0,3 Слабая
0.3–0,5 Умеренная
0.5–0,7 Заметная
0.7–0,9 Высокая
Больше 0,9 Очень высокая
величин неизвестно и, как следствие, теоретический коэффициент корреляции вычислить невозможно.
Несмещенной оценкой теоретического ковариационного момента служит выборочная ковариация
𝑛
𝑐𝑜𝑣 (𝑋,𝑌 ) =
1
𝑛 −1
𝑗=1
(𝑥𝑗− 𝑚
*
)𝑦𝑗− 𝑚
𝑥
*
.
𝑦
А в качестве точечной оценки коэффициента корреляции 𝜌𝑥𝑦, используют выборочный коэффициент корреляции 𝑟𝑥𝑦, определяемый формулой
*
𝑦
𝑦𝑗− 𝑚
. (6.1)
2
*
𝑦
𝑟𝑥𝑦=
𝑐𝑜𝑣 (𝑋,𝑌 )
𝑆𝑥𝑆
𝑦
=
𝑛
(𝑥𝑗− 𝑚
𝑗=1
𝑛
(𝑥𝑗− 𝑚
𝑗=1
2
*
)
𝑥
*
)𝑦𝑗− 𝑚
𝑥
𝑛 𝑗=1
Зачастую количественной характеристике меры связи между величинами ставят в соответствие качественную оценку. Одним из примеров такого соот­ветствия является шкала Чеддока (см. таблицу 6.1).
В случае, если корреляционный анализ включает в себя изучение связей не двух, а нескольких 𝑘 > 2 случайных величин, то вычисляются корреляции для каждой пары из этого множества переменных. Результат представляется в виде матрицы, называемой корреляционной
𝑅 =
⎛
⎜ ⎜ ⎜ ⎜ ⎝
1
𝑟
...
12
𝑟
𝑟
21
.
𝑘1
1
...
.
...
𝑟
...
𝑘2
⎞
𝑟
1𝑘
⎟ ⎟
𝑟
2𝑘
⎟
, (6.2)
⎟
.
⎠
1
126 Глава 6. КОРРЕЛЯЦИОННЫЙ И РЕГРЕССИОННЫЙ АНАЛИЗ
где
𝑟𝑖𝑗= 𝑟
𝑋𝑖𝑋
=
𝑗
𝑛 𝑙=1
𝑛
(𝑥𝑙𝑖− 𝑚
𝑙=1
(𝑥𝑙𝑖− 𝑚
*
2
)
𝑖
*
)(𝑥𝑙𝑗− 𝑚
𝑖
𝑛 𝑙=1
*
)
𝑗
(𝑥𝑙𝑗− 𝑚
, 𝑖,𝑗 = 1,𝑘
*
2
)
𝑗
оценки парных коэффициентов корреляции случайного вектора, а 𝑥𝑗𝑖— значе­ние 𝑗-го наблюдения 𝑖-й случайной величины.
Матрица 𝑅 является симметричной и положительно определенной.
6.2.2 Частный коэффициент корреляции
Частный коэффициент корреляциихарактеризует тесноту линейной зависимости между двумя переменными при исключении влияния всех осталь­ных факторов, входящих в модель.
Он также изменяется в пределах от − 1 до + 1, причем, чем ближе част­ный коэффициент корреляции к ±1, тем сильнее «чистая» зависимость между переменными.
Пусть имеется 𝑘-мерное невырожденное нормальное распределение, зафик­сируем 𝑘−2 случайных величины, например 𝑋3,𝑋4, . . . ,𝑋𝑘, тогда коэффициент частной корреляции оставшихся двух 𝑋1и 𝑋2определяется формулой
𝐶
𝐶
11
12
√
, (6.3)
𝐶
22
𝑟
𝑋1,𝑋2/𝑋3,𝑋4,...,𝑋
𝑘
= −
√
где 𝐶𝑖𝑗— алгебраическое дополнение элемента 𝑟𝑖𝑗корреляционной матрицы 𝑅.
Частные коэффициенты могут быть разных порядков. Порядок коэффи­циента определяется числом факторов, влияние которых исключается. Так, частный коэффициент корреляции 𝑟 ка; 𝑟
𝑥1,𝑥2/𝑥3,𝑥
— это коэффициент второго порядка и т. д.
4
𝑥1,𝑥2/𝑥
— это коэффициент первого поряд-
3
Для случая 𝑘 = 3 частный коэффициент корреляции (первого порядка) величин 𝑋1и 𝑋2при исключении влияния переменной 𝑋3можно вычислить, используя коэффициенты парной корреляции, по формуле
𝑟
𝑥1,𝑥2/𝑥
3
= −
√
𝐶
𝐶
11
12
√
𝐶
=
22
𝑟12− 𝑟13𝑟
1 −𝑟
2 13
23
1 −𝑟
. (6.4)
2 23
Для выявления «чистой» зависимости между статистическими показателя­ми и влияния на нее исключаемых факторов необходимо сравнить частные и
6.3. Проверка гипотез в корреляционном анализе 127
соответствующие парные коэффициенты корреляции.Что, в свою очередь, мо­жет привести к одному из следующих выводов.
1. 𝑟
𝑋1,𝑋
> 𝑟
𝑋1,𝑋2/𝑋3,𝑋4,...,𝑋
2
— факторы 𝑋3,𝑋4, . . . ,𝑋𝑘искажают взаимосвязь
𝑘
между 𝑋1и 𝑋2в сторону ее увеличения.
2. 𝑟
𝑋1,𝑋
< 𝑟
𝑋1,𝑋2/𝑋3,𝑋4,...,𝑋
2
— факторы 𝑋3,𝑋4, . . . ,𝑋𝑘искажают взаимосвязь
𝑘
между 𝑋1и 𝑋2в сторону ее уменьшения.
3. 𝑟
𝑋1,𝑋
2
≈ 𝑟
𝑋1,𝑋2/𝑋3,𝑋4,...,𝑋
— факторы 𝑋3,𝑋4, . . . ,𝑋𝑘практически не иска-
𝑘
жают взаимосвязь между 𝑋1и 𝑋2.
6.2.3 Множественный коэффициент корреляции
Множественный коэффициент корреляции характеризует тесноту связи между одной переменной (результативной) и остальными, входящими в модель. Он изменяется в пределах от 0 до 1. Квадрат множественного ко­эффициента корреляции называется множественным коэффициентом де- терминации, который характеризует долю дисперсии одной результативной переменной, обусловленной влиянием остальных переменных, входящих в мо­дель.
Множественный коэффициент корреляции результирующего признака 𝑋 определяется по формуле:
|𝑅|
𝑅1= 𝑅
1/2,3,...,𝑘
=1 −
, (6.5)
𝐶
11
где |𝑅| — определитель корреляционной матрицы 𝑅.
6.3 Проверка гипотез
в корреляционном анализе
Значимость парных и частных коэффициентов корреляции проверяется по
1
𝑡-критерию Стьюдента.
Рассмотрим процедуру проверки значимости коэффициента корреляции. Нулевая гипотеза при этом состоит в том, что коэффициент корреляции ра­вен нулю (не значим), альтернативная — не равен нулю (значим):
128 Глава 6. КОРРЕЛЯЦИОННЫЙ И РЕГРЕССИОННЫЙ АНАЛИЗ
𝐻0: 𝜌 = 0 ,
𝐻1: 𝜌 = 0.
Статистика критерия находится по формуле:
√
𝑟
√
𝑡 =
1 −𝑟
𝑛 −𝑖 − 2, (6.6)
2
где 𝑟 — соответственно оценка частного или парного коэффициента корреля­ции; 𝑖 — порядок коэффициента корреляции, т. е. число фиксируемых факторов, 𝑖 = 0 для парного коэффициента корреляции.
Если гипотеза 𝐻0справедлива, то статистика критерия асимптотически имеет распределение Стьюдента с 𝑛 − 𝑖 − 2 степенями свободы.
Двусторонней критической областью при уровне значимости 𝛼 в данном случае является
−∞; −𝑡
1−𝛼/2
(𝑛 −𝑖 − 2)
𝑡
1−𝛼/2
(𝑛 −𝑖 − 2) ; ∞,
где 𝑡𝛽(𝑚) — квантиль распределения Стьюдента с 𝑚 степенями свободы уровня 𝛽.
Таким образом, если:
а) |𝑡| < 𝑡
1−𝛼/2
— гипотеза 𝐻0принимается (коэффициент корреляции не зна-
чим);
б) |𝑡| ≥ 𝑡
1−𝛼/2
(𝑛 −𝑖 − 2) — гипотеза 𝐻0отклоняется (коэффициент корре-
ляции статистически значим).
При построении доверительного интервала для парного и частного коэффи­циентов корреляции, ввиду сложности их законов распределения, пользуются 𝑧-преобразованием, предложенным английским статистиком Р. Фишером
1 + 𝑟
𝑧 = 0,5 ln
. (6.7)
1 −𝑟
Функция распределения случайной величины 𝑧 сходится к функции рас­пределения нормального закона со средним 0,5 ln
1+𝜌 1−𝜌
и дисперсией 𝑛 −𝑖 −3, здесь 𝑖, по-прежнему, порядок коэффициента корреляции. Следовательно, дву­сторонний доверительный интервал для z с доверительным уровнем 1−𝛼 будет иметь вид:
𝑧 − 𝑧
1−𝛼/2
√
𝑛 −𝑖 − 3; 𝑧 + 𝑧
1−𝛼/2
√
𝑛 −𝑖 − 3= (𝑧1; 𝑧2) , (6.8)
6.3. Проверка гипотез в корреляционном анализе 129
где 𝑧𝛽— квантиль стандартного нормального распределения уровня 𝛽.
Для построения доверительного интервала для коэффициента корреляции
сделаем обратное преобразование. Получим, что с вероятностью 1−𝛼 интервал
2𝑧
1
𝑒
− 1
2𝑧
1
𝑒
+ 1
2𝑧
2
𝑒
;
2𝑧
2
𝑒
− 1
(6.9)
+ 1
накрывает значение неизвестного теоретического коэффициента корреляции.
Для проверки значимости множественного коэффициента корреляции, а равно и его квадрата — коэффициента детерминации, используется F -критерий. Напомним, что множественный коэффициент корреляции 𝑅1является зна­чимым, если имеет место линейная статистическая зависимость между 𝑋1и остальными факторами 𝑋2, . . . ,𝑋𝑘.
Итак, для выяснения значимости множественного коэффициента корреля­ции, если результирующий признак является первым, выдвигают две гипотезы:
𝐻0: 𝑅1= 0,
𝐻1: 𝑅1> 0.
Как мы видим, в этом случае альтернативная гипотеза односторонняя.
Статистика критерия находится по формуле:
1
2
𝑅
𝐹 =
𝑘−1
1
𝑛−𝑘
1
(1 −𝑅
, (6.10)
2
)
1
где 𝑘 — размерность факторного пространства, 𝑛 — количество наблюдений.
Если справедлива основная гипотеза, то статистика критерия 𝐹 слабо схо­дится к распределению Фишера с (𝑘 −1; 𝑛 − 𝑘) степенями свободы.
Критической областью данного критерия при уровне значимости равным 𝛼 является интервал (0;𝑓
(𝑘 − 1; 𝑛 − 𝑘)), где 𝑓𝛼(𝑣,𝑤) — квантиль распределе-
1−𝛼
ния Фишера с (𝑣,𝑤) степенями свободы уровня 𝛼.
Таким образом, если:
а) 𝐹 < 𝑓
(𝑘 − 1; 𝑛 − 𝑘) — гипотеза 𝐻0принимается (множественный ко-
1−𝛼
эффициент корреляции не значим);
б) 𝐹 ≥ 𝑓
(𝑘 − 1; 𝑛 − 𝑘) — гипотеза 𝐻0отклоняется (множественный ко-
1−𝛼
эффициент корреляции статистически значим).
Пример 6.1. Были проведены опыты по исследованию зависимости дефор­мации трубопровода 𝑌 (мм) в зависимости от жесткости 𝑋 (кгc/см2) основания
130 Глава 6. КОРРЕЛЯЦИОННЫЙ И РЕГРЕССИОННЫЙ АНАЛИЗ
траншеи. В ходе эксперимента были получены следующие данные, представлен­ные в таблице 6.2.
Таблица 6.2 – Зависимость деформации трубопровода от жесткости основания
𝑥 5,5 7,5 9,8 10,9 13,2 13,5 14,1 14,4 16,1 18,1 𝑦 1,12 0,84 0,74 0,75 0,64 0,68 0,63 0,6 0,67 0,52
Оценим выборочный коэффициент корреляции, проверим его значимость при 𝛼 = 0,05 и построим доверительный интервал уровня 1 − 𝛼.
Построим по эмпирическим данным корреляционное поле (диаграмму рас­сеяния) (риснок 6.2).
1.4
1.2
1
0.8
Деформация, мм
0.6
6 8 10 12 14 16 18
Жесткость основания кгс/см
2
Рис. 6.2 – Диаграмма рассеяния
На основании визуального анализа этой диаграммы мы можем выдвинуть гипотезу о линейной зависимости между исследуемыми факторами.
Вычислим коэффициент корреляции. Для этого составим вспомогательную таблицу с результатами промежуточных вычислений (см. таблицу 6.3).
Согласно этой таблице выборочные средние равны
𝑛
𝑛
1
1
𝑛
𝑛
𝑖=1
2
𝑥
𝑖
𝑥𝑖𝑦𝑖= 0,3237.
𝑗=1
= 165,083,
*
𝑚
= 12,31𝑚
𝑥
𝑛
1
𝑛
𝑖=1
*
𝑦
2
𝑦
= 0,54283,
𝑖
= 0,72,
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]