Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Специальные разделы высшей математики. Практикум по математической статистике. Учебно-методическое пособие.pdf
X
- •ВВЕДЕНИЕ
- •СЛУЧАЙНЫЕ ВЕЛИЧИНЫ
- •Коротко о главном
- •Определение и виды случайных величин
- •Числовые характеристики случайных величин
- •Распределения связанные с нормальным
- •Предельные теоремы
- •Вопросы для самоконтроля
- •Примеры типовых задач с решением
- •Задачи
- •Коротко о главном
- •Аналитическое представление выборки
- •Графическое представление выборки
- •Вопросы для самоконтроля
- •Примеры типовых задач с решением
- •Задачи
- •СТАТИСТИЧЕСКИЕ ОЦЕНКИ
- •Коротко о главном
- •Точечные оценки параметров
- •Выборочные числовые характеристики
- •Методы нахождения оценок
- •Доверительные интервалы
- •Вопросы для самоконтроля
- •Примеры типовых задач с решением
- •Задачи
- •Коротко о главном
- •Критерии согласия
- •Вопросы для самоконтроля
- •Примеры типовых задач с решением
- •Задачи
- •ДИСПЕРСИОННЫЙ АНАЛИЗ
- •Коротко о главном
- •Однофакторный дисперсионный анализ
- •Двухфакторный дисперсионный анализ
- •Вопросы для самоконтроля
- •Примеры типовых задач с решением
- •Задачи
- •Коротко о главном
- •Корреляционный анализ
- •Регрессионный анализ
- •Вопросы для самоконтроля
- •Примеры типовых задач с решением
- •Задачи
- •Тема 1. Случайные величины
- •Тема 4. Проверка статистических гипотез
- •Тема 5. Дисперсионный анализ
- •Тема 1. Случайные величины
- •Тема 2. Основы выборочного метода
- •Тема 3. Статистические оценки
- •Стандартное нормальное распределение
- •Распределение Стьюдента
- •Распределение Фишера
- •2–распределение
- •Критерий согласия Колмогорова
- •Критерий Кохрена
- •ЛИТЕРАТУРА

5.4. Задачи 171
Задача 5.12. При анализе значимости влияния факторов A и B на ре-
зультирующий признак X на каждой комбинации уровней факторов было
сделано одинаковое количество опытов. Результаты первичной статистической обработки полученных данных представлены в следующей ANOVAтаблице.
Вариация SS df MS F F критическое
Фактор A 24 2 C H K
Фактор B A 3 D E L
Остаточная 86 B E
Общая 485 11
Предположив, что все требования двухфакторного дисперсионного анализа выполнены и взаимодействия между факторами нет, закончите проведение дисперсионного анализа, положив α = 0,01. Для этого
a) запишите все пары нулевых и альтернативных гипотез двухфакторного дисперсионного анализа;
б) допишите в ANOVA-таблицу недостающие значения: A, B, C, D, E,
H, K, L;
г) сделайте вывод о значимости влияния факторов и их взаимодействий
на результирующий признак.
Задача 5.13. В таблице приводятся эмпирические данные о сменной
выработке (X) рабочего в зависимости от типа станка (фактор A) и стажа
его работы (фактор B), на каждой комбинации уровней факторов сделано
по одному измерению X.
B1 B2 B3
A1 189 186 198
A2 188 190 203
A3 179 193 201
При α = 0,01 методом дисперсионного анализа проверить гипотезу о
том, что факторы A и B не влияют на сменную выработку рабочего. Предположить, что все требования двухфакторного дисперсионного анализа выполнены и взаимодействия между факторами нет.

172 Глава 5. ДИСПЕРСИОННЫЙ АНАЛИЗ
Задача 5.14. При экспериментальном исследовании влияния на результирующий признак качества изделия двух факторов, получены следующие
результаты.
Фактор B
B1 B2
Фактор A
A1 55 48 46 47 53 51
A2 51 47 46 53 54 50
В предположении, что все требования двухфакторного дисперсионного
анализа выполнены, при α = 0,01 методом дисперсионного анализа проверить гипотезу о том, что факторы A, B и их взаимодействия не влияют на
результирующий признак.

6
КОРРЕЛЯЦИОННЫЙ И
РЕГРЕССИОННЫЙ АНАЛИЗ
— Ты когда-нибудь слышал термин «регрессия к сред-
нему значению»?
— Нет.
— Это технический способ сказать «всё возвращается
на круги своя».
— То есть всегда становится лучше?
— Скорее. . . не может всегда быть плохо.
— И не важно, сколько плохого произошло?
— Или. . . хорошего.
— Всегда должно быть равновесие. . .
— . . . Регрессия к среднему значению.
— Т/с «Оборотень (Teen Wolf)»
6.1 Коротко о главном
6.1.1 Корреляционный анализ
При анализе эмпирических данных на практике часто требуется установить и оценить зависимость случайной величины от одной или нескольких
других величин.
Формы проявления взаимосвязей весьма разнообразны. В качестве самых общих их видов выделяют следующие связи:
— функциональную (полную);

174 Глава 6. КОРРЕЛЯЦИОННЫЙ И РЕГРЕССИОННЫЙ АНАЛИЗ
— статистическую (неполную).
Зависимость является функциональной в том случае, когда каждой
отдельной величине соответствует строго определенная другая величина.
Вообще же строго функциональные зависимости между двумя величинами
встречаются крайне редко, так как обе величины подвержены действию
случайных факторов и среди них могут быть общие для обеих величин. В
этом случае возникает статистическая зависимость.
Корреляция (лат. correlatio — соотношение, взаимосвязь) — это стати-
стическая взаимосвязь двух или более случайных величин. Термин корреляция ввёл французский палеонтолог Жорж Кювье в XVIII веке. А, благодаря английскому биологу и статистику Френсису Гальтону, слово корреляция в конце XIX века нашло свое место и в математической статистике.
Корреляционная связь проявляется в среднем для массовых наблюдений,
когда при изменении одной величины изменяется среднее значение другой.
Определение 6.1. Корреляционный анализ — статистический ме-
тод, позволяющий обнаружить зависимость и оценить ее силу
между двумя или нескольким случайными величинами.
Цели корреляционного анализа.
1. Определить взаимосвязь между случайными величинами.
2. Прогнозирование, т. е. по поведению одной величины предсказать
поведение другой, коррелирующей с первой.
3. Проведение классификации и идентификации объектов. Корреляционный анализ помогает подобрать набор независимых признаков для
классификации.
Ограничения на статистические данные для корректного прове-
дения корреляционного анализа.
1. Данные наблюдений должны быть выбранными из генеральной совокупности, распределенной по многомерному нормальному закону.
2. Его применение оправдано при наличии достаточно большого объема
наблюдений для анализа. На практике считается, что число наблюдений
должно не менее чем в 5 раз превышать число переменных.
3. Исходная совокупность значений должна быть качественно однородной.

6.1. Коротко о главном 175
а)
б)
в)
y
x
y
x
y
x
Рис. 6.1 – Корреляционное поле:
а) отрицательная корреляция, б) положительная корреляция,
г) отсутствие корреляционной связи
Основой для корреляционного анализа является матрица размерности
n × k
X =
⎛
x11. . . x1j. . . x
⎜
⎜
. . . . . . . . . . . . . . . . . .
⎜
⎜
⎜
xi1. . . xij. . . x
⎜
⎜
. . . . . . . . . . . . . . . . . .
⎝
1k
ik
⎞
⎟
⎟
⎟
⎟
⎟
⎟
⎟
⎠
,
xn1. . . xnj. . . x
nk
которая представляет собой n наблюдений для k-мерного вектора(X1, . . . ,X
Показатели корреляции При анализе двух случайных величин X и Y
данные одновременных наблюдений над ними(xi,y
)
удобно представлять
i
графически. Изображая наблюдения в виде точек в декартовой системе
координат, получим корреляционное поле. По характеру расположения
точек поля можно составить предварительное представление о форме зависимости случайных величин (например, о том, что одна из них в среднем
возрастает или убывает с возрастанием другой). На рисунке 6.1 приведены
примеры корреляционных полей при разных видах корреляционной зависимости.
Парный коэффициент корреляции характеризует тесноту и направ-
)
.
k
ление связи между двумя переменными соответственно на фоне действия
всех остальных показателей, входящих в модель.
Наибольшее распространение в корреляционном анализе, предполага-
ющем нормальный закон распределения наблюдений, получил коэффици-

176 Глава 6. КОРРЕЛЯЦИОННЫЙ И РЕГРЕССИОННЫЙ АНАЛИЗ
ент линейной корреляции Карла Пирсона — ρ
, который определяется
x,y
формулой (1.37).
На практике, как правило, точное распределение исследуемых случайных величин неизвестно и, как следствие, теоретический коэффициент корреляции вычислить невозможно.
Несмещенной оценкой теоретического ковариационного момента служит выборочная ковариация
n
cov
*
(
X,Y)=
1
n − 1
X
j=1
(
xj− m
*
)
x
yj− m
*
.
y
А в качестве точечной оценки коэффициента корреляции ρxyиспользуют выборочный коэффициент корреляции rxy, определяемый формулой
P
n
rxy=
1
n
P
n
1
n
i=1
2
x
i
−(m
xiyi− m
i=1
2
*
)
x
*
*
m
x
y
P
n
1
n
=
i=1
y
P
2
−m
i
P
n
i=1
n
i=1
(
xi− m
2
*
y
(
xi− m
=
*
)
yi− m
x
P
2
*
)
x
n
i=1
*
y
yi− m
2
*
y
. (6.1)
Зачастую количественной характеристике меры связи между величинами ставят в соответствие качественную оценку. Одним из примеров такого
соответствия является шкала Чеддока (см. таблицу 6.1).
Таблица 6.1 – Шкала Чеддока
|
|
r
xy
Качественная характеристика
0,0–0,1 Очень слабая
0.1–0,3 Слабая
0.3–0,5 Умеренная
0.5–0,7 Заметная
0.7–0,9 Высокая
0,9–1,0 Очень высокая

6.1. Коротко о главном 177
В случае, если корреляционный анализ включает в себя изучение связей
не двух, а нескольких k > 2 случайных величин, то вычисляются корреляции для каждой пары из этого множества переменных. Результат представляется в виде матрицы, называемой корреляционной
где
rij= r
XiX
⎛
1
r
...
12
⎜
⎜
r
⎜
R =
⎜
⎝
r
P
n
(xli− m
=
j
P
l=1
n
(xli− m
l=1
21
.
k1
1
.
r
k2
*
2
)
i
...
...
...
*
)(xlj− m
i
P
⎞
r
1k
⎟
⎟
r
2k
⎟
⎟
.
⎠
1
n
(xlj− m
l=1
, (6.2)
*
)
j
, i,j = 1,k
*
2
)
j
оценки парных коэффициентов корреляции случайного вектора, а xji— значение j-го наблюдения i-й случайной величины.
Матрица R является симметричной и положительно определенной.
Частный коэффициент корреляции характеризует тесноту линейной зависимости между двумя переменными при исключении влияния всех
остальных факторов, входящих в модель.
Он также изменяется в пределах от −1до +1, причем, чем ближе
частный коэффициент корреляции к ±1, тем сильнее «чистая» зависимость
между переменными.
Пусть имеется k-мерное невырожденное нормальное распределение, зафиксируем k −2 случайных величины, например X3, X4, . . . , Xk, тогда коэффициент частной корреляции оставшихся двух X1и X2определяется формулой
C
C
11
12
√
, (6.3)
C
22
r
X1,X2|X3,X4,...,X
k
= −
√
где Cij— алгебраическое дополнение элемента rijкорреляционной матрицы
R.
Частные коэффициенты могут быть разных порядков. Порядок коэффициента определяется числом факторов, влияние которых исключается.
Так, частный коэффициент корреляции r
порядка; r
x1,x2|x3,x
— это коэффициент второго порядка и т. д.
4
x1,x2|x
— это коэффициент первого
3

178 Глава 6. КОРРЕЛЯЦИОННЫЙ И РЕГРЕССИОННЫЙ АНАЛИЗ
Для случая k = 3 частный коэффициент корреляции (первого порядка)
величин X1и X2при исключении влияния переменной X3можно вычислить,
используя коэффициенты парной корреляции, по формуле
r
x1,x2|x
= −
3
C
C
11
12
C
=
22
r12− r13r
1 − r
2
13
23
1 − r
. (6.4)
2
23
Для выявления «чистой» зависимости между статистическими показателями и влияния на нее исключаемых факторов необходимо сравнить
частные и соответствующие парные коэффициенты корреляции.Что, в свою
очередь, может привести к одному из следующих выводов.
1.|r
X1,X
|
>
r
2
X1,X2|X3,X4,...,X
— факторы X3, X4, . . . ,Xkискажают взаимо-
k
связь между X1и X2в сторону ее увеличения.
2.|r
X1,X
|
<
r
2
X1,X2|X3,X4,...,X
— факторы X3, X4, . . . ,Xkискажают взаимо-
k
связь между X1и X2в сторону ее уменьшения.
3. r
X1,X
2
≈ r
X1,X2|X3,X4,...,X
— факторы X3, X4, . . . , Xkпрактически не иска-
k
жают взаимосвязь между X1и X2.
Множественный коэффициент корреляции характеризует тесноту
связи между одной переменной (результативной) и остальными, входящими в модель. Он изменяется в пределах от 0 до 1. Квадрат множественного
коэффициента корреляции называется множественным коэффициентом
детерминации, который характеризует долю дисперсии одной результативной переменной, обусловленной влиянием остальных переменных, входящих в модель.
Множественный коэффициент корреляции результирующего признака
X1определяется по формуле:
|R|
R1= R
1/2,3,...,k
=1 −
, (6.5)
C
11
где|R|— определитель корреляционной матрицы R.
Проверка гипотез в корреляционном анализе Значимость парных и
частных коэффициентов корреляции проверяется по t-критерию Стьюдента.

6.1. Коротко о главном 179
Рассмотрим процедуру проверки значимости коэффициента корреляции. Нулевая гипотеза при этом состоит в том, что коэффициент корреляции равен нулю (не значим), альтернативная — не равен нулю (значим):
H0: ρ = 0 ,
H1: ρ = 0.
Статистика критерия находится по формуле:
√
r
√
t =
1 − r
n − i − 2, (6.6)
2
где r — соответственно оценка частного или парного коэффициента корреляции; i — порядок коэффициента корреляции, т. е. число фиксируемых
факторов, i = 0 для парного коэффициента корреляции.
Если гипотеза H0справедлива, то статистика критерия асимптотически
имеет распределение Стьюдента с n − i − 2 степенями свободы.
Двусторонней критической областью при уровне значимости α в данном
случае является
)
t
1−α/2
(
n − i − 2); ∞,
где t
β
−∞; −t
(m)
— квантиль распределения Стьюдента с m степенями свободы
1−α/2
(
n − i − 2
уровня β.
Таким образом, если:
а)|t|< t
1−α/2
— гипотеза H0принимается (коэффициент корреляции не
значим);
б)|t|≥ t
1−α/2
(
n − i − 2)— гипотеза H0отклоняется (коэффициент кор-
реляции статистически значим).
При построении доверительного интервала для парного и частного коэффициентов корреляции, ввиду сложности их законов распределения,
пользуются z-преобразованием, предложенным английским статистиком
Р. Фишером
1 + r
z = 0,5
ln
. (6.7)
1 − r
Функция распределения случайной величины z сходится к функции
распределения нормального закона со средним 0,5
ln
1+ρ
1−ρ
и дисперсией

180 Глава 6. КОРРЕЛЯЦИОННЫЙ И РЕГРЕССИОННЫЙ АНАЛИЗ
n − i − 3, здесь i, по-прежнему, порядок коэффициента корреляции. Следовательно, двусторонний доверительный интервал для z с доверительным
уровнем 1 − α будет иметь вид:
z − z
1−α/2
√
n − i − 3; z + z
1−α/2
√
n − i − 3=(z1; z
)
, (6.8)
2
где zβ— квантиль стандартного нормального распределения уровня β.
При построении доверительного интервала для коэффициента корреляции сделаем обратное преобразование. Получим, что с вероятностью 1 − α
интервал
2z
1
e
− 1
2z
1
e
+ 1
2z
2
e
;
2z
2
e
− 1
(6.9)
+ 1
накрывает значение неизвестного теоретического коэффициента корреляции.
Для проверки значимости множественного коэффициента корреляции, а равно и его квадрата — коэффициента детерминации, используется
F -критерий. Напомним, что множественный коэффициент корреляции R
является значимым, если имеет место линейная статистическая зависимость между X1и остальными факторами X2, . . . ,Xk.
Итак, для выяснения значимости множественного коэффициента корреляции, если результирующий признак является первым, выдвигают две
гипотезы:
H0: R1= 0,
H1: R1> 0.
Как мы видим, в этом случае альтернативная гипотеза односторонняя.
Статистика критерия находится по формуле:
1
2
R
1
F =
1
n−k
k−1
(1 − R
, (6.10)
2
)
1
где k — размерность факторного пространства, n — количество наблюде-
1
ний.
Если справедлива основная гипотеза, то статистика критерия F слабо
сходится к распределению Фишера с(k − 1; n − k)степенями свободы.
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
