Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:
Специальные разделы высшей математики. Практикум по математической статистике. Учебно-методическое пособие.pdf
Скачиваний:
0
Добавлен:
07.09.2026
Размер:
2 Мб
Скачать
☆
5.4. Задачи 171
Задача 5.12. При анализе значимости влияния факторов A и B на ре- зультирующий признак X на каждой комбинации уровней факторов было сделано одинаковое количество опытов. Результаты первичной статистиче­ской обработки полученных данных представлены в следующей ANOVA­таблице.
Вариация SS df MS F F критическое
Фактор A 24 2 C H K Фактор B A 3 D E L Остаточная 86 B E Общая 485 11
Предположив, что все требования двухфакторного дисперсионного ана­лиза выполнены и взаимодействия между факторами нет, закончите про­ведение дисперсионного анализа, положив α = 0,01. Для этого
a) запишите все пары нулевых и альтернативных гипотез двухфактор­ного дисперсионного анализа;
б) допишите в ANOVA-таблицу недостающие значения: A, B, C, D, E, H, K, L;
г) сделайте вывод о значимости влияния факторов и их взаимодействий на результирующий признак.
Задача 5.13. В таблице приводятся эмпирические данные о сменной выработке (X) рабочего в зависимости от типа станка (фактор A) и стажа его работы (фактор B), на каждой комбинации уровней факторов сделано по одному измерению X.
B1 B2 B3
A1 189 186 198 A2 188 190 203 A3 179 193 201
При α = 0,01 методом дисперсионного анализа проверить гипотезу о том, что факторы A и B не влияют на сменную выработку рабочего. Пред­положить, что все требования двухфакторного дисперсионного анализа вы­полнены и взаимодействия между факторами нет.
172 Глава 5. ДИСПЕРСИОННЫЙ АНАЛИЗ
Задача 5.14. При экспериментальном исследовании влияния на резуль­тирующий признак качества изделия двух факторов, получены следующие результаты.
Фактор B
B1 B2
Фактор A
A1 55 48 46 47 53 51 A2 51 47 46 53 54 50
В предположении, что все требования двухфакторного дисперсионного анализа выполнены, при α = 0,01 методом дисперсионного анализа прове­рить гипотезу о том, что факторы A, B и их взаимодействия не влияют на результирующий признак.
6
КОРРЕЛЯЦИОННЫЙ И
РЕГРЕССИОННЫЙ АНАЛИЗ
— Ты когда-нибудь слышал термин «регрессия к сред-
нему значению»?
— Нет.
— Это технический способ сказать «всё возвращается
на круги своя».
— То есть всегда становится лучше?
— Скорее. . . не может всегда быть плохо.
— И не важно, сколько плохого произошло?
— Или. . . хорошего.
— Всегда должно быть равновесие. . .
— . . . Регрессия к среднему значению.
— Т/с «Оборотень (Teen Wolf)»

6.1 Коротко о главном

6.1.1 Корреляционный анализ
При анализе эмпирических данных на практике часто требуется устано­вить и оценить зависимость случайной величины от одной или нескольких других величин.
Формы проявления взаимосвязей весьма разнообразны. В качестве са­мых общих их видов выделяют следующие связи:
— функциональную (полную);
174 Глава 6. КОРРЕЛЯЦИОННЫЙ И РЕГРЕССИОННЫЙ АНАЛИЗ
— статистическую (неполную).
Зависимость является функциональной в том случае, когда каждой отдельной величине соответствует строго определенная другая величина. Вообще же строго функциональные зависимости между двумя величинами встречаются крайне редко, так как обе величины подвержены действию случайных факторов и среди них могут быть общие для обеих величин. В этом случае возникает статистическая зависимость.
Корреляция (лат. correlatio — соотношение, взаимосвязь) — это стати- стическая взаимосвязь двух или более случайных величин. Термин корре­ляция ввёл французский палеонтолог Жорж Кювье в XVIII веке. А, благо­даря английскому биологу и статистику Френсису Гальтону, слово корре­ляция в конце XIX века нашло свое место и в математической статистике. Корреляционная связь проявляется в среднем для массовых наблюдений, когда при изменении одной величины изменяется среднее значение другой.
Определение 6.1. Корреляционный анализ — статистический ме-
тод, позволяющий обнаружить зависимость и оценить ее силу
между двумя или нескольким случайными величинами.
Цели корреляционного анализа.
1. Определить взаимосвязь между случайными величинами.
2. Прогнозирование, т. е. по поведению одной величины предсказать
поведение другой, коррелирующей с первой.
3. Проведение классификации и идентификации объектов. Корре­ляционный анализ помогает подобрать набор независимых признаков для классификации.
Ограничения на статистические данные для корректного прове-
дения корреляционного анализа.
1. Данные наблюдений должны быть выбранными из генеральной со­вокупности, распределенной по многомерному нормальному закону.
2. Его применение оправдано при наличии достаточно большого объема наблюдений для анализа. На практике считается, что число наблюдений должно не менее чем в 5 раз превышать число переменных.
3. Исходная совокупность значений должна быть качественно однород­ной.
6.1. Коротко о главном 175
а)
б)
в)
y
x
y
x
y
x
Рис. 6.1 – Корреляционное поле:
а) отрицательная корреляция, б) положительная корреляция,
г) отсутствие корреляционной связи
Основой для корреляционного анализа является матрица размерности
n × k
X =
⎛
x11. . . x1j. . . x
⎜ ⎜
. . . . . . . . . . . . . . . . . .
⎜ ⎜ ⎜
xi1. . . xij. . . x
⎜ ⎜
. . . . . . . . . . . . . . . . . .
⎝
1k
ik
⎞
⎟ ⎟ ⎟ ⎟ ⎟ ⎟ ⎟ ⎠
,
xn1. . . xnj. . . x
nk
которая представляет собой n наблюдений для k-мерного вектора(X1, . . . ,X
Показатели корреляции При анализе двух случайных величин X и Y
данные одновременных наблюдений над ними(xi,y
)
удобно представлять
i
графически. Изображая наблюдения в виде точек в декартовой системе координат, получим корреляционное поле. По характеру расположения точек поля можно составить предварительное представление о форме за­висимости случайных величин (например, о том, что одна из них в среднем возрастает или убывает с возрастанием другой). На рисунке 6.1 приведены примеры корреляционных полей при разных видах корреляционной зави­симости.
Парный коэффициент корреляции характеризует тесноту и направ-
)
.
k
ление связи между двумя переменными соответственно на фоне действия всех остальных показателей, входящих в модель.
Наибольшее распространение в корреляционном анализе, предполага-
ющем нормальный закон распределения наблюдений, получил коэффици-
176 Глава 6. КОРРЕЛЯЦИОННЫЙ И РЕГРЕССИОННЫЙ АНАЛИЗ
ент линейной корреляции Карла Пирсона — ρ
, который определяется
x,y
формулой (1.37).
На практике, как правило, точное распределение исследуемых случай­ных величин неизвестно и, как следствие, теоретический коэффициент кор­реляции вычислить невозможно.
Несмещенной оценкой теоретического ковариационного момента слу­жит выборочная ковариация
n
cov
*
(
X,Y)=
1
n − 1
X
j=1
(
xj− m
*
)
x
yj− m
*
.
y
А в качестве точечной оценки коэффициента корреляции ρxyиспользу­ют выборочный коэффициент корреляции rxy, определяемый формулой
P
n
rxy=
1 n
P
n
1 n
i=1
2
x
i
−(m
xiyi− m
i=1
2
*
)
x
*
*
m
x
y
P
n
1
n
=
i=1
y
P
2
−m
i
P
n i=1
n i=1
(
xi− m
2
*
y
(
xi− m
=
*
)
yi− m
x
P
2
*
)
x
n i=1
*
y
yi− m
2
*
y
. (6.1)
Зачастую количественной характеристике меры связи между величина­ми ставят в соответствие качественную оценку. Одним из примеров такого соответствия является шкала Чеддока (см. таблицу 6.1).
Таблица 6.1 – Шкала Чеддока
|
|
r
xy
Качественная характеристика
0,0–0,1 Очень слабая
0.1–0,3 Слабая
0.3–0,5 Умеренная
0.5–0,7 Заметная
0.7–0,9 Высокая 0,9–1,0 Очень высокая
6.1. Коротко о главном 177
В случае, если корреляционный анализ включает в себя изучение связей не двух, а нескольких k > 2 случайных величин, то вычисляются корре­ляции для каждой пары из этого множества переменных. Результат пред­ставляется в виде матрицы, называемой корреляционной
где
rij= r
XiX
⎛
1
r
...
12
⎜ ⎜
r
⎜
R =
⎜ ⎝
r
P
n
(xli− m
=
j
P
l=1
n
(xli− m
l=1
21
.
k1
1
.
r
k2
*
2
)
i
...
...
...
*
)(xlj− m
i
P
⎞
r
1k
⎟ ⎟
r
2k
⎟ ⎟
.
⎠
1
n
(xlj− m
l=1
, (6.2)
*
)
j
, i,j = 1,k
*
2
)
j
оценки парных коэффициентов корреляции случайного вектора, а xji— зна­чение j-го наблюдения i-й случайной величины.
Матрица R является симметричной и положительно определенной.
Частный коэффициент корреляции характеризует тесноту линей­ной зависимости между двумя переменными при исключении влияния всех остальных факторов, входящих в модель.
Он также изменяется в пределах от −1до +1, причем, чем ближе частный коэффициент корреляции к ±1, тем сильнее «чистая» зависимость между переменными.
Пусть имеется k-мерное невырожденное нормальное распределение, за­фиксируем k −2 случайных величины, например X3, X4, . . . , Xk, тогда коэф­фициент частной корреляции оставшихся двух X1и X2определяется фор­мулой
C
C
11
12
√
, (6.3)
C
22
r
X1,X2|X3,X4,...,X
k
= −
√
где Cij— алгебраическое дополнение элемента rijкорреляционной матрицы R.
Частные коэффициенты могут быть разных порядков. Порядок коэф­фициента определяется числом факторов, влияние которых исключается. Так, частный коэффициент корреляции r порядка; r
x1,x2|x3,x
— это коэффициент второго порядка и т. д.
4
x1,x2|x
— это коэффициент первого
3
178 Глава 6. КОРРЕЛЯЦИОННЫЙ И РЕГРЕССИОННЫЙ АНАЛИЗ
Для случая k = 3 частный коэффициент корреляции (первого порядка) величин X1и X2при исключении влияния переменной X3можно вычислить, используя коэффициенты парной корреляции, по формуле
r
x1,x2|x
= −
3
C
C
11
12
C
=
22
r12− r13r
1 − r
2 13
23
1 − r
. (6.4)
2 23
Для выявления «чистой» зависимости между статистическими пока­зателями и влияния на нее исключаемых факторов необходимо сравнить частные и соответствующие парные коэффициенты корреляции.Что, в свою очередь, может привести к одному из следующих выводов.
1.|r
X1,X
 
|
>
r
2
X1,X2|X3,X4,...,X
 
— факторы X3, X4, . . . ,Xkискажают взаимо-
k
связь между X1и X2в сторону ее увеличения.
2.|r
X1,X
 
|
<
r
2
X1,X2|X3,X4,...,X
 
— факторы X3, X4, . . . ,Xkискажают взаимо-
k
связь между X1и X2в сторону ее уменьшения.
3. r
X1,X
2
≈ r
X1,X2|X3,X4,...,X
— факторы X3, X4, . . . , Xkпрактически не иска-
k
жают взаимосвязь между X1и X2.
Множественный коэффициент корреляции характеризует тесноту связи между одной переменной (результативной) и остальными, входящи­ми в модель. Он изменяется в пределах от 0 до 1. Квадрат множественного коэффициента корреляции называется множественным коэффициентом детерминации, который характеризует долю дисперсии одной результа­тивной переменной, обусловленной влиянием остальных переменных, вхо­дящих в модель.
Множественный коэффициент корреляции результирующего признака
X1определяется по формуле:
|R|
R1= R
1/2,3,...,k
=1 −
, (6.5)
C
11
где|R|— определитель корреляционной матрицы R.
Проверка гипотез в корреляционном анализе Значимость парных и частных коэффициентов корреляции проверяется по t-критерию Стьюден­та.
6.1. Коротко о главном 179
Рассмотрим процедуру проверки значимости коэффициента корреля­ции. Нулевая гипотеза при этом состоит в том, что коэффициент корреля­ции равен нулю (не значим), альтернативная — не равен нулю (значим):
H0: ρ = 0 ,
H1: ρ = 0.
Статистика критерия находится по формуле:
√
r
√
t =
1 − r
n − i − 2, (6.6)
2
где r — соответственно оценка частного или парного коэффициента корре­ляции; i — порядок коэффициента корреляции, т. е. число фиксируемых факторов, i = 0 для парного коэффициента корреляции.
Если гипотеза H0справедлива, то статистика критерия асимптотически имеет распределение Стьюдента с n − i − 2 степенями свободы.
Двусторонней критической областью при уровне значимости α в данном случае является
)
t
1−α/2
(
n − i − 2); ∞,
где t
β
−∞; −t
(m)
— квантиль распределения Стьюдента с m степенями свободы
1−α/2
(
n − i − 2
уровня β.
Таким образом, если:
а)|t|< t
1−α/2
— гипотеза H0принимается (коэффициент корреляции не
значим);
б)|t|≥ t
1−α/2
(
n − i − 2)— гипотеза H0отклоняется (коэффициент кор-
реляции статистически значим).
При построении доверительного интервала для парного и частного ко­эффициентов корреляции, ввиду сложности их законов распределения, пользуются z-преобразованием, предложенным английским статистиком Р. Фишером
1 + r
z = 0,5
ln
. (6.7)
1 − r
Функция распределения случайной величины z сходится к функции распределения нормального закона со средним 0,5
ln
1+ρ 1−ρ
и дисперсией
180 Глава 6. КОРРЕЛЯЦИОННЫЙ И РЕГРЕССИОННЫЙ АНАЛИЗ
n − i − 3, здесь i, по-прежнему, порядок коэффициента корреляции. Сле­довательно, двусторонний доверительный интервал для z с доверительным уровнем 1 − α будет иметь вид:
z − z
1−α/2
√
n − i − 3; z + z
1−α/2
√
n − i − 3=(z1; z
)
, (6.8)
2
где zβ— квантиль стандартного нормального распределения уровня β.
При построении доверительного интервала для коэффициента корреля­ции сделаем обратное преобразование. Получим, что с вероятностью 1 − α интервал
2z
1
e
− 1
2z
1
e
+ 1
2z
2
e
;
2z
2
e
− 1
(6.9)
+ 1
накрывает значение неизвестного теоретического коэффициента корреля­ции.
Для проверки значимости множественного коэффициента корреля­ции, а равно и его квадрата — коэффициента детерминации, используется F -критерий. Напомним, что множественный коэффициент корреляции R является значимым, если имеет место линейная статистическая зависи­мость между X1и остальными факторами X2, . . . ,Xk.
Итак, для выяснения значимости множественного коэффициента кор­реляции, если результирующий признак является первым, выдвигают две гипотезы:
H0: R1= 0,
H1: R1> 0.
Как мы видим, в этом случае альтернативная гипотеза односторонняя. Статистика критерия находится по формуле:
1
2
R
1
F =
1
n−k
k−1
(1 − R
, (6.10)
2
)
1
где k — размерность факторного пространства, n — количество наблюде-
1
ний.
Если справедлива основная гипотеза, то статистика критерия F слабо сходится к распределению Фишера с(k − 1; n − k)степенями свободы.
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]