Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Прикладная математическая статистика. Учебное пособие
.pdf
71
ji
x
ji
x
ji
x
0
H
ji
r
0
H
Уровни фактора
A
1
A
2
A
i
A
k
A
11
r
12
r
1
i 1
k
21
r
22
r
2
i
r
2
k
r
j
1
j
r
2
j
r
ji
r
jk
r
n
1
1
n
r
2
2
n
r
i
n i
r
k
n k
r
0
H
ji
x
ji
r
{
}
ji
x
i ji
R r
∑
ji
R r
∑
i
R
{
}
ji
r
1
2
+
получают числа
при упорядочении всей их совокупности. Ранговые критерии
применяются и тогда, когда измерения сделаны в порядковой шкале, например,
представлены текстовыми баллами или экспертными суммами. Здесь значения
вообще
являются условностью, а содержательный смысл имеют лишь отношения «больше —
меньше» между ними (например, оценки 2, 3, 4, 5). Будем рассматривать наиболее простой
случай, когда среди чисел
нет совпадающих. В этом случае преобразование таблицы 6.1 в
таблицу 6.4 будет однозначным.
Для проверки гипотезы
функцию от рангов
, которая легла бы в основу критерия проверки гипотезы. Основные
требования к этой статистике следующие: ее значение при гипотезе
необходимо сконструировать некоторую статистику, т.е.
должно заметно
отличаться от ее значений при альтернативах. Рассмотрим два метода.
Таблица 6.4. Форма представления преобразованных
данных
Ранги
результатов
наблюдений
1
2
…. …. …. …. ….
…. …. ….. ….. …..
Однофакторный непараметрический анализ на основе критерия Краскела-Уоллеса
(произвольные альтернативы)
Этот метод используется, когда невозможно сказать что-либо определенное об
альтернативах
рангами
, упорядочивая всю совокупность
, так как он свободен от распределения. Заменим наблюдения
в порядке возрастания. Затем для каждой
их
обработки i (уровня фактора, столбца таблицы) надо вычислить суммарный и средний
ранги:
n
i
=
и
i
1
j
=
n
i
1
=
n
i
. (6.11)
1
j
=
Если между столбцами нет систематических различий, то средние ранги
значительно отличаться от среднего, рассчитанного по всей совокупности
последнего
R
, не должны
. Значение
N
=
. Здесь N— общее число наблюдений.

72
i
N n
∑
2
( )
R R
2 2
1 1
0
H
2
12 1
( 1)
+
H
2
χ
1
v k
= −
( )qH v
0
H
ji
x
ji
r
H
′
1 /( )
T N N
j j j
T r t
= −
j
t
{
}
ji
x
, ,....,
m
x x x
, ,...,
n
y y y
=
k
.
1
i
=
Вычислим величины
N N
R R
i k
+ +
− −
,...,
−
i
.
для каждого уровня фактора
2 2
Эти значения при
характеристику, разумно учесть различия в числе наблюдений для разных обработок
(уровней факторов) и взять в качестве меры отступления от чистой случайности величину
H n R
Эта величина называется статистикой Краскела-Уоллеса
в совокупности должны быть небольшими. Составляя общую
n
= −
( 1) 2
N N
∑
+
i
1
=
i
N
i
+
. (6.12)
12
Множитель
присутствует в качестве нормировочного для обеспечения сходимости
N N
распределения статистики
то фактор считается значимым и гипотеза
Если среди
использовать средние ранги (например, если 2 значения (5 и 5) занимают ранги 11, 12, то
средний ранг (11,5) надо присвоить им обоим). Если совпадений много, рекомендуется
использовать модифицированную форму статистики
есть совпадающие значения, то при ранжировании и переходе к
H
и
′
=
с числом степеней свободы
m
− −
∑
=
j
. Если
отвергается при уровне значимости q.
:
H
, (6.13)
3
j
1
> χ
2
надо
,
где m — число групп совпадающих наблюдений;
наблюдений в группе j).
Однофакторный непараметрический анализ на основе критерия Джонкхиера
(альтернативы с упорядочением)
Нередко исследователю заранее известно, что имеющиеся группы результатов упорядочены
по возрастанию влияния фактора. Пусть первый столбец таблицы
наименьшему уровню, а последний — наибольшему. В таких случаях критерий Джонкхиера
более чувствителен (более мощный) в сравнении с упорядоченным влиянием фактора.
Рассмотрим сначала случай, когда сравниваются только 2 способа обработки (2 уровня
фактора). Фактически речь идет тогда об однородности двух выборок. Для проверки этой
гипотезы рассмотрим статистику Манна-Уитни.
Пусть имеем 2 выборки:
1 2
и
1 2
3
(
. Положим
— число совпадающих
соответствует

73
0, ;
( , ) , ;
1, .
i j
i j i j
i j
если x y
x y если x y
если x y
( , )
i j
U x y
1
u v k
≤ < ≤
( , ) ( , )
i j
U u v x y
(1, 2), (1,3),..., (1, ), (2,3),..., (2, ),...,
( 1, )
U U U k U U k U k k
−
( , )
I U u v
∑
1
u v k
≤ < ≤
0
H
1
H
( , )
I N MI DI
∼
j
MI N n
∑
(2 3) (2 3)
j
n
N
0
H
1
H
I MI
DI
−
Φ = α
1
q
− − α
0
H
>
1
ϕ = =
Статистика Манна-Уитни:
Обратившись теперь к общему случаю, когда сравниваются k способов обработки (k
уровней), поступим следующим способом. Для каждой пары уровней u и v, где
, составим по выборкам с номерами u и v статистики Манна-Уитни:
Получим
Определим статистику Джонкхиера I как
2
m n
= ϕ
∑∑
1 1
i i
= =
= ϕ
<
m n
∑∑
1 1
i i
= =
(6.14)
. (6.15)
. (6.16)
.
=
для
. Свидетельством
против
полученные в эксперименте. Для больших объемов выборок в отношении статистики I
действует нормальное распределение
дисперсией
где
статистики
точками нормального распределения
функции Лапласа). Тогда
– количество наблюдений в каждом уровне;
— общий объем наблюдений;
Свидетельством против
(в пользу альтернативы
1
DI N N n n
= + − +
72
(в пользу альтернативы
*
I
=
, полученные в эксперименте, в сравнении с α-процентными
— уровень значимости принятия гипотезы
) служат большие значения статистики I,
1
= −
4
2 2
k
2
i
=
1
k
∑
1
=
j
*
( )I
(табличные значения нормированной
, с математическим ожиданием и
,
j j
, (6.17)
) служат большие значения
.
6.3. Двухфакторный анализ
Иногда в однофакторной модели влияние интересующего нас фактора не проявляется,
хотя такое влияние должно быть. Причиной этого может быть большой внутригрупповой
разброс, на фоне которого действие фактора остаётся незаметным. Очень часто этот разброс
вызван не только случайными причинами, но и действиями еще одного фактора. Если мы в
состоянии указать такой фактор, то можно попытаться включить его в модель, чтобы
уменьшить статистическую неоднородность наблюдений. Конечно, не всегда удается
поправить дело введением мешающего фактора и переходом к двухфакторной схеме. Иногда

74
n
{
}
ji
x
n k
×
Уровни основного фактора
A
Блоки фактора
B
1
A
2
A
i
A
k
A
1
B
11
x
12
x
1
i
x
1
k
x
2
B
21
x
22
x
2
i
x
2
k
x
j
B
1
j
x
2
j
x
ji
x
jk
x
n
B
1
n
x
2
n
x
ni
x
nk
x
ji
x
ji i j ji
x a b e
= + +
i
a
j
b
ji
x
, 0, 0
= η + α + β α = β =
ji
x
i
α
j
β
η
приходится рассматривать трехфакторные и более сложные модели. Замысел во всех этих
случаях остается прежним.
Назовём фактор A (рис. 1) главным, B — мешающим. Пусть фактор A принимает k
значений, а мешающий —
значений. Фактор B разбивает все группы наблюдений
(столбцы таблицы
) на блоки.
Рис. 6.1. Двухфакторная модель
Каждый блок соответствует определенному уровню фактора B. В частном случае таблица
содержит
наблюдений (по одному в клетке). Отличие этой таблицы от однофакторной
в том, что наблюдения в любом столбце не являются однородными, если влияние
мешающего фактора значимо (табл. 6.3).
Таблица 6.3
Форма представления экспериментальных данных двухфакторной модели
…. …. …. …. ….
…. …. ….. ….. …..
Для описания двухфакторного эксперимента обычно применяют аддитивную модель. Она
предполагает, что значения отклика
факторов A и B и независимых случайных факторов:
являются суммой вкладов соответствующих уровней
. В этой модели
величины вкладов A и B не могут быть восстановлены однозначно. Действительно, при
одновременном увеличении всех
ту же константу значения
не изменяются.
на одну и ту же константу и при уменьшении всех
на
Для однозначности вкладов удобно перейти к представлению в виде:
x при
ji i j i j
Параметр η интерпретируется как среднее всех
в результате действия факторов A и B.
∑ ∑
i j
(т.е. x), а
.
и
— отклонения от

75
ji
e
2
σ
k
α = α = = α
0
H
2
A
σ
2
сл
σ
n n n n
= = = =
2
1 ji
Q x
∑∑
2
2
2
1 4 2 3
Q Q Q Q
(k 1)(n 1)
+ − −
2 4
Q Q
k 1
−=−
3 4
Q Q
k 1
−=−
1, ( 1)( 1)
> = − = − −
0
H
1, ( 1)( 1)
> = − = − −
0
H
ji
e
ji
x
ji
r
{
}
ji
x
ji
x
1,2,...,
i k
=
B
ji
x
ji
r
ji
r
6.3.1 Двухфакторный параметрический дисперсионный анализ
Если есть основания предполагать, что случайные величины
распределение с нулевым средним и одинаковой при всех i и j дисперсией
имеют нормальное
, можно
использовать метод, аналогичный однофакторному дисперсионному анализу. Предположим,
что влияние фактора A отсутствует. Сформулируем гипотезу
Проверим гипотезу
дисперсии:
и
, также основываясь на сравнении двух независимых оценок
.
: ...
H
0 1 2
Дисперсионный анализ для двухфакторных таблиц проводится в следующей
последовательности. Вычисляются суммы (полагаем
=
k n
i 1 j 1
= =
Q x
;
2 ji
=
k n
1
∑ ∑
n
i 1 j 1
= =
n k
1
Q x
;
=
∑ ∑
3 ji
k
j 1 i 1
= =
1 2
;
...
Q x
=
4 ji
nk
1
k
k n
∑∑
i 1 j 1
= =
)
.
Далее находятся оценки дисперсий
2
s
=
сл
− −
2
;
s
A
2
;
s
B
.
Если выполняется неравенство
2
s
A
F v k v n k
( )
1 2
2
s
сл
q
, то
отвергается и влияние фактора A
считается существенным.
Аналогично значимым признается влияние фактора B, если
2
s
B
F v n v n k
( )
1 2
2
s
сл
q
.
.
6.3.2. Двухфакторный непараметрический анализ
Двухфакторный непараметрический анализ используется при проверке гипотезы
о распределении случайной величины
известно только то, что она непрерывна и
,
если
независима. Рассмотрим решение задачи с использованием критерия Фридмана, который не
предъявляет требований к упорядочению уровней факторов.
Двухфакторный непараметрический анализ по критерию Фридмана (произвольные
альтернативы)
Критерий основан на идее перехода от значений
однофакторного анализа ранжирование происходит не по всей таблице
к их рангам
. В отличие от
, а по блокам,
т.е. рассматривается каждая отдельная строка таблицы. При фиксированном j осуществляется
ранжирование величин
фактора
величин
,
значение которого для каждой строки постоянно. Обозначим полученные ранги
через
при
. Ясно, что
. Тем самым устраняется влияние мешающего
. изменяются от 1 до k, а каждая строка представляет

76
1,2,...,
k
ji
x
k
α = α = = α
!
k
ji
r r
∑
0
H
1
2
+
2
S r r
0
H
( 1)
≥ χ = −
,
n k
( , , )
S q n k
{
}
ji
x
k
α = α = = α
k
α < α < < α
i ji
R r
∑
i k
L i R R R R k R
= ⋅ = ⋅ + ⋅ + ⋅ + + ⋅
0
H
1
H
( , )
L L k n
>
( , )
L k n
( , )
L k n
10
n
>
( )
( )
L M L
D L
−
2 3 2
( 1) ( )
4 144( 1)
nk k n k k
−
L u
α
>
u
α
перестановку чисел
гипотезе
1
=
i
n
j
n
: ...
H
0 1 2
— среднее значение ранга по столбцу. При
1
=
(при совпадении
все
перестановок равновероятны. Введем величину
надо использовать средние ранги). При
значение для каждого столбца не
k
должно сильно отличаться от
Статистика
Гипотеза
S v k
может быть найдена по специальным статистическим таблицам.
Двухфакторный непараметрический анализ по критерию Пейджа (альтернативы с
упорядочением)
2
q
Фридмана
отвергается в пользу альтернативы о наличии эффектов в обработке, если
. Для небольших значений
имеет следующий вид
=
r
12
= −
k k
( 1)
— среднего ранга всех элементов таблицы.
k
n
+
( )
∑
1
=
i
i
. (6.19)
величина критерия Фридмана
Если уровни факторов в таблице
: ...
H
0 1 2
Пейджа.
Введем величину
Вычисляется статистика
k
∑
1
i
=
отклоняется в пользу
специальным статистическим таблицам.
Критические значения
приложении). Для
*
L
=
против альтернативы
n
=
1 2 3 ...
1 2 3
, где
M L D L
.
1
j
=
, если
α
справедлива аппроксимация статистики Пейджа
( ) , ( )
приведены в табл. 9 (см. статистические таблицы в
= =
упорядочены, то для проверки гипотезы
: ...
H
1 1 2
. (6.20)
набл
α
, где значение
+ −
k
используется статистика
α
.
найдено по
При
распределения.
*
нулевая гипотеза отклоняется (
Вопросы для самопроверки
1. Дисперсионный анализ зависимостей. Основные понятия.
2. Однофакторный параметрический дисперсионный анализ.
– квантиль стандартного нормального

77
3. Однофакторный непараметрический анализ на основе критерия Краскела-Уоллеса
(произвольные альтернативы).
4. Однофакторный непараметрический анализ на основе критерия Джонкхиера
(альтернативы с упорядочением)
5. Двухфакторный дисперсионный анализ.
дисперсионный анализ.
6. Двухфакторный непараметрический анализ по критерию Фридмана (произвольные
альтернативы).
7. Двухфакторный непараметрический анализ по критерию Пейджа (альтернативы с
упорядочением).
Двухфакторный параметрический

78
x x y y xy x y
s s s s
2 2
x x y y
15
n
<
2( 3)
( )( )
0
r
=
1
r
=
x
y
s
r b
s
b
i i
y a bx
= +
x
s
x
y
s
y
2
= = −
Тема 7. Корреляционный анализ
Корреляционный анализ имеет своей задачей количественное определение тесноты связи
между изучаемыми явлениями. Корреляционная связь — эта связь, при которой
определенному значению факторного признака соответствует среднее значение
результирующего признака. Изучение тесноты и направления связи является важной задачей
математической статистики. Оценка тесноты связи между признаками предполагает
определение меры соответствия вариации результирующего признака от одного (при
изучении парных зависимостей) или нескольких (множественных) факторных признаков.
7.1. Вычисление параметрических коэффициентов корреляции
Выборочный коэффициент корреляции
впервые введен Пирсоном, поэтому его часто
Пирсона.
формулы расчета данного коэффициента. Приведем некоторые из них:
В теории разработаны и на практике применяются различные модификации
( )( )
= =
r
Используя преобразование, получают
n n
x x y y x x y y
− − − −
( )( ) ( )( )
∑ ∑
i i i i
1 1
= =
i i
r
= =
n s s
⋅
x y
При
необходимо скорректировать коэффициент корреляции
*
r r
= +
между двумя случайными величинами x и y был
называют коэффициентом корреляции
− − −
.
x y x y
n n
( ) ( )
∑ ∑
= =
1 1
i i
1
r
−
1
−
n
− −
i i
2
. (7.2)
. (7.1)
При большом объеме выборки выборочный коэффициент корреляции будет приближаться
к корреляционному моменту генеральной совокупности ρ, который определяется как
M x m y m
ρ =
Если
является функциональной. Коэффициент корреляции тесно связан с коэффициентом регрессии:
, то величины x и y независимы, а при
=
где
— коэффициент регрессии в уравнении вида
— среднеквадратичное отклонение
— среднеквадратичное отклонение
на основе критерия Стьюдента. При проверке этой гипотезы вычисляется t-статистика:
2
r n
t n
рас
( 2)
1
−
− −
x y
σ σ
x y
, (7.4)
;
.
Значимость коэффициента корреляции проверяется
−
2
r
r
2
r
1
−
. (7.3)
зависимость между x и y
;
. (7.5)

79
( 2)
= −
y
100
n
>
t n
Y
1
x
2
x
1 2 1 2 1 2
yx yx yx yx x x
r r r r r
ab
r
, ,...,
m
x x x
1
ρ
ρ
... ... ... ... ...
... 1
1
ρ
11
ρ
R
20
k
−
<
1
1
− −
R
Расчетное значение сравнивается с табличным значением
t v n
q
. Если расчетное
значение больше табличного, это свидетельствует о значимости коэффициента корреляции,
а, следовательно, и о статистической существенности зависимости между x и
При большом числе наблюдений (
) используется следующая формула t-
.
статистики:
r
=
рас
1
r
−
Множественный коэффициент корреляции
результирующим признаком
и несколькими факторными признаками, а также между
парой факторных признаков.
В случае оценки связи между результирующим признаком Y и двумя факторными
признаками
и
множественный коэффициент корреляции можно определить по
формуле:
2 2
+ −
где
R
— парные коэффициенты корреляции между признаками.
/ ,
y x x
1 2
=
1
. (7.6)
2
рассчитывается при наличии линейной связи между
2
2
r
−
x x
1 2
, (7.7)
В общем случае коэффициент множественной корреляции между результирующим
признаком Y и m факторными признаками
R
/ , ,...,
y x x x
1 2
= −
m
1
1 1
, (7.8)
определяется по формуле
где ρ – определитель матрицы парной корреляции
1 ...
ρ ρ ρ
ρ =
ρ ρ ρ
ρ ρ ρ
– алгебраическое дополнение элемента
ρ ρ ρ
yx yx yx
1 2
x y x x x x
1 1 2 1
x y x x x x
2 2 1 2
x y x x x x
m m m
1 ...
1 ...
2 3
m
m
; (7.9)
m
.
Множественный коэффициент корреляции изменяется в пределах от 0 до 1. Приближение
к единице свидетельствует о сильной зависимости между признаками. При небольшом
n k
числе наблюдений (
) величина множественного коэффициента корреляции, как
правило, завышается. В этом случае множественный коэффициент корреляции
корректируется:
R R
/ , ,...,
y x x x
где
— скорректированное значение;
1 2
= − −
1 (1 )
m
2
n
n k
−
, (7.10)

80
n
k
R
20
k
−
≥
3
( 2, 3)
> = = −
2
( 1)
i
d
−
∑
2
i
d
n
/
2
x y
−
− ρ
( 2)
> = −
( 1) ( 1)
P Q S
−
− −
S
— число наблюдений;
— число факторных признаков.
n k
Корректировка
Проверка значимости множественного коэффициента корреляции осуществляется по
критерию Фишера:
Множественный коэффициент корреляции считается значимым, если
F F v v n
рас q
На основе приведенных выше формул (1)-(9) произведем вычисление коэффициентов
корреляции и проверим их значимость (вынести на практику).
1 2
не производится при условии, если
1
2
R
/ ,
y x x
F
рас
2
=
1
1
( )
.
1 2
2
R
−
y x x
. (7.11)
/ ,
1 2
.
7.2 Вычисление непараметрических коэффициентов корреляции
Если признаки подчиняются различным (отличным от нормального) законам
распределения, то можно рассчитать непараметрические коэффициенты корреляции. Эти
коэффициенты могут быть использованы для определения тесноты связи как между
количественными, так и между качественными признаками при условии, если их значения
упорядочить или проранжировать по степени убывания или возрастания признака.
Среди непараметрических методов оценки тесноты связи наибольшее распространение
получили следующие:
1.
Коэффициент ранговой корреляции Спирмана:
n
6
1
i
n n
=
2
, (7.12)
ρ = −
где
Коэффициент Спирмана принимает значения от -1 до 1. Значимость коэффициента
проверяется на основе t-критерия Стьюдента. Расчетное значение t-критерия
определяется по формуле:
– квадрат разности рангов;
— число наблюдений (число пар рангов).
x y
1
/
Значение коэффициента корреляции считается статистически существенным, если
t t v n
рас
где n — число наблюдений;
Расчет коэффициента Кендалла производится в такой последовательности:
α
2. Коэффициент ранговой корреляции Кендалла
— разность между числом последовательностей и числом инверсий по второму признаку.
= ρ
t
рас x y
.
/
1
2
.
2( ) 2
n
τ = =
, (7.13)
n n n n
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
