Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Методы и модели решения задачи классификации данных. Основные этапы. Учебное пособие
.pdf
позволяет оценить корректность применения вероятностного подхода
H
F
для решения конкретной задачи классификации.
Проверка на соответствие выборочных данных модели нормального
закона распределения проводится с помощью ряда специальных критериев согласия (для проверки принадлежности только нормальному закону) или с помощью непараметрических критериев (универсальных,
применимых для разных законов распределения). К специальным критериям относятся
, например, критерий проверки на симметричность,
критерий проверки на эксцесс, Шапиро – Уилка, Эппса – Палли; к непараметрическим критериям: Колмогорова – Смирнова, Андерсона – Дарлинга, Крамера – фон Мизеса и т. д. [8, 12, 13].
Критерий согласия проверяет основную гипотезу
о соответ-
0
ствии выборочных данных модели нормального закона распределения
при заданном уровне значимости (вероятность ошибки первого рода –
вероятность отвергнуть основную гипотезу при условии, что она верна).
В случае простой гипотезы известны параметры нормального закона
распределения (
– математическое ожидание, – СКО), в случае слож-
ной гипотезы – параметры закона неизвестны и оцениваются по выборке (
ˆ
– среднее,
ˆ
– оценка СКО):
ˆ
: ( ) ( , , )
HFxFx, (7)
0
ˆˆ
где нормальный закон распределения задается функцией
ˆ
(
)
x
x
ˆ
ˆ
xedx
(, , ) .
1
ˆ
2
∫
2
ˆ
2
(8)
Поскольку неизвестно, из какого распределения извлечены выбо-
рочные данные, проверка выполняется в условиях сложной гипотезы.
Критерии согласия различаются между собой принятой мерой разницы выборочного и теоретического (нормального) законов распределения, которая положена в основу критерия и называется критической
статистикой.
Рассмотрим более подробно некоторые базовые критерии согласия.
Критерий согласия Шапиро –
Уилка [5, 6, 12, 13]. Он основан на оп-
тимальной линейной комбинации порядковых статистик (рангов) наблюдений для получения оценки параметров нормального распределения.
21

Эта комбинация рассчитывается таким образом, чтобы минимизировать
y
F
среднеквадратичное отклонение между теоретическими и наблюдаемыми значениями упорядоченных в порядке возрастания выборочных
данных (порядковых статистик).
Полученные оценки параметров используются для вычисления критической статистики критерия Шапиро – Уилка, которая представляет
собой отношение оптимальной линейной несмещенной оценки дисперсии к ее обычной оценке методом максимального
правдоподобия:
2
, (9)
2
где
k
⎛⎞
⎜⎟
∑
⎜⎟
i
1
⎝⎠
W
a
– коэффициенты, зависящие от размера выборки (их значения
i
()
ay y
ni ni i
11
n
yy
∑
i
i
1
могут быть найдены в статистических таблицах для W-теста, где предварительно рассчитаны соответствующие значения для различных раз-
меров выборки [5, 6, 12]);
значения выборки x;
y
– упорядоченные в порядке возрастания
i
– среднее значение выборки; n – объем вы-
борки; k = n / 2, если n – четное и k = (n – 1) / 2, если n – нечетное.
Предельные значения критической статистики W(a) (процентные
точки распределения) приведены в таблицах для W-теста [5, 6, 12]. Критерий левосторонний: если расчетное значение критической статистики W превышает табличное значение
(),WWa
то гипотеза о нор-
мальном распределении выборочных данных не отвергается при заданном уровне значимости.
Критерий согласия Андерсона – Дарлинга [12, 13]. Суть критерия за-
ключается в измерении расхождения между эмпирической и теоретической функцией распределения данных.
Критическая статистика критерия рассчитывается по формуле
n
2
An i Fy Fy
1
(2 1) ln ( ) ln 1 ( )
∑
n
i
1
ˆˆ
⎡⎤
⎣⎦
ini
(1)
, (10)
где ˆ()
y – эмпирическая функция распределения, вычисленная для
i
i-го упорядоченного значения.
22

Квантили распределения критической статистики
A
H
A
A
H
в [12]. В случае справедливости гипотезы
тической статистики
2
не превышает верхний квантиль распределе-
ния критической статистики критерия:
расчетное значение кри-
0
22
A
t
.
2
приведены
t
Критерий согласия Крамера – фон Мизеса [12, 13]. Суть критерия заключается в суммировании квадратов разностей между эмпирической
и теоретической функцией распределения данных. Чем меньше сумма
квадратов разностей, тем ближе эмпирическая функция распределения
к теоретической функции распределения и тем больше вероятность того,
что данные соответствуют предполагаемому распределению. Критическая статистика критерия Крамера – фон
Мизеса вычисляется по формуле
n
⎛⎞
12121
2
WFyFy
12 2 2
nn n
⎛⎞⎛ ⎞
ˆˆ
⎜⎟
∑
i
() ( )
⎜⎟⎜ ⎟
ii
⎜⎟
⎝⎠⎝ ⎠
1
⎝⎠
Квантили распределения критической статистики
в [12]. В случае справедливости гипотезы
2
тической статистики
W
не превышает верхний квантиль распределе-
ния критической статистики критерия:
22
ii
1
W
расчетное значение кри-
0
22
WW
.
t
. (11)
2
приведены
t
Как показывают исследования [13], мощность критериев, специально построенных для проверки отклонения от нормального закона
распределения (например, Шапиро – Уилка), на объемах выборок n ≤ 50
выше мощности непараметрических критериев согласия типа Крамера –
фон Мизеса и типа Андерсона – Дарлинга при проверке сложных гипотез. Мощность критерия Андерсона – Дарлинга сравнительно выше
мощности критерия Крамера –
1.4.3. АНАЛИЗ ВЗАИМОСВЯЗЕЙ ПРИЗНАКОВ
фон Мизеса.
Этап анализа взаимосвязей признаков сводится к определению предикторов, которые имеют статистически значимое влияние на прогнозируемый результат (целевую переменную «Класс»). Анализ значимости взаимосвязей признаков позволяет:
идентифицировать наиболее важные признаки, которые суще-
ственно влияют на целевую переменную;
23

удалить неинформативные признаки, что позволяет сократить
размерность данных, улучшить обобщающую способность модели
и уменьшить риск переобучения;
осуществить оптимизацию времени и ресурсов: исключение не-
значимых признаков из модели может значительно сократить вычислительные затраты при обучении и применении модели, что особенно
важно в случае обработки больших данных;
решить проблему мультиколлинеарности: мультиколлинеарность
возникает, когда признаки тесно связаны друг с другом; идентификация
и удаление избыточных или сильно коррелированных признаков помогают избежать проблемы мультиколлинеарности и улучшают стабильность и точность модели;
повысить интерпретируемость модели за счет выделения призна-
ков, которые оказывают наибольшее влияние на классификацию.
Таким образом, анализ значимости исходных признаков играет важную роль в процессе решения задачи классификации, позволяя выбрать
наиболее информативные предикторы, оптимизировать вычислительные ресурсы, решить проблему мультиколлинеарности и улучшить интерпретируемость модели.
Выбор методов для исследования взаимосвязей
признаков, входящих в состав исходной БД, зависит от типа шкалы измерений признака.
На количественной шкале применяются методы корреляционного анализа данных; на порядковой шкале – методы рангового корреляционного анализа данных; на классификационной шкале – методы анализа
таблиц сопряженности; в случае разнотипных признаков проводится
дисперсионный анализ данных. Возможен переход от количественной
шкалы измерения значений признака к порядковой или классификационной шкале; от порядковой шкалы – к классификационной шкале.
Таким образом, реализуется понижение шкалы измерения, но обратный
переход невозможен. Чем выше шкала измерения, тем больше информации в ней заложено, понижение шкалы всегда связно с потерей информации о признаке.
В следующих разделах кратко
рассмотрены базовые методы иссле-
дования взаимосвязей для каждого типа шкал.
24

1.4.3.1. КОРРЕЛЯЦИОННЫЙ АНАЛИЗ ВЗАИМОСВЯЗЕЙ
x
x
КОЛИЧЕСТВЕННЫХ ПРИЗНАКОВ
Корреляционный анализ данных представляет собой раздел математической статистики, который разрабатывает методы исследования статистических взаимосвязей между значениями признаков, измеренных
на изучаемых объектах. Также под корреляционным анализом данных
понимают сам процесс исследования статистических взаимосвязей
между значениями признаков исходной БД на основе совокупности специальных методов и критериев.
К основным задачам корреляционного
анализа данных относят сле-
дующие [7, 8]:
установить факт наличия (отсутствия) взаимосвязи между иссле-
дуемыми признаками;
измерить степень тесноты связи;
оценить статистическую значимость связи.
Для визуальной оценки взаимосвязи количественных признаков
строятся диаграммы рассеяния, анализ которых позволяет сделать предварительный вывод о наличии, направлении и типе (линейная, нелинейная) связи между исследуемыми признаками.
Парные линейные взаимосвязи между количественными признаками X и Y оцениваются на основе коэффициента корреляции Пирсона,
который рассчитывается по
r
XY
формуле
n
xxyy
∑
ii
1
i
nn
∑∑
ii
11
22
xyy
ii
, (12)
y
и
где
i
– i-е значение признаков X и Y соответственно; x и y –
i
средние значения признаков.
Коэффициент корреляции Пирсона используется только в случае
нормального распределения исходных признаков, и его рекомендуется
30.n
применять при объеме выборочных данных
Свойства коэффициента корреляции Пирсона:
измеряет только линейную взаимосвязь;
25

11
H
X
H
X
R
диапазон изменения:
r
XY
; при
нальная линейная взаимосвязь между признаками; при
r
XY
1
– прямая функцио-
r
XY
1
– об-
ратная функциональная линейная взаимосвязь между признаками;
при
YX
симметричность:
– отсутствие взаимосвязи между признаками;
rr
XY YX
, т. е. коэффициент Пирсона не позво-
0
r
ляет определить результирующий и факторный признак (X зависит
от Y или Y зависит от X).
Проверка основной гипотезы
о статистической незначимости
0
коэффициента корреляции Пирсона реализуется на основе критической
статистики:
rn
t
расч
YX
1
2
, (13)
2
r
Y
которая в условиях справедливости гипотезы
подчиняется распре-
0
делению Стьюдента с (n – 2) степенями свободы. Если выполняется неравенство
tt
где
– квантиль распределения Стьюдента уровня
t
⎛⎞
1
⎜⎟
⎝⎠
2
расч
⎛⎞
1
⎜⎟
⎝⎠
, (14)
2
, то гипо-
1
2
теза о статистической незначимости взаимосвязи между признаками не
отвергается при уровне значимости
.
Частный коэффициент корреляции – измеритель степени тесноты
статистической связи между признаками X и Y при условии, что значения остальных признаков зафиксированы на некотором постоянном
уровне, т. е. связь «очищена» от влияния других признаков.
Формула для вычисления частного коэффициента корреляции:
R
, ,
RRR
где
XY XX YY
элементов
rrr
– алгебраические дополнения соответственно для
, ,
XY XX YY
r
XY
, (15)
()
в определителе корреляционной матрицы.
XY
R
XYY
26

Пусть построена корреляционная матрица для признаков X, Y и Z:
X
1
⎛⎞
⎜⎟
Rr r
⎜⎟
⎜⎟
⎝⎠
rr
YXZ
1
YX YZ
rr
ZX ZY
. (16)
1
Частный коэффициент корреляции между признаками X и Y при
исключении влияния Z будет рассчитываться по формуле
rrr
r
XY Z
()
YX YZ ZX
22
11
rr
YZ ZX
. (17)
Для расчета частных коэффициентов корреляции между двумя признаками при исключении влияния более чем одного признака можно
также воспользоваться рекуррентными соотношениями, которые приведены в [7, 8].
Частный коэффициент корреляции используется в случае нормального распределения исходных признаков и обладает следующими свойствами:
измеряет очищенную линейную связь;
диапазон изменения:
симметричность:
11;
r
rr
() ()
XY YX
()
XY
;
распределен так же, как и коэффициент корреляции Пирсона,
между теми же признаками, но объем выборки при проверке гипотезы
о статистической незначимости коэффициента необходимо уменьшить
на k, где k – количество «мешающих» признаков.
1.4.3.2. КОРРЕЛЯЦИОННЫЙ АНАЛИЗ ВЗАИМОСВЯЗЕЙ
ПОРЯДКОВЫХ ПРИЗНАКОВ
В случае если значения признаков измерены в порядковой шкале
или распределение исходных количественных данных не подчиняется
нормальному закону, выполняется расчет непараметрических ранговых
коэффициентов корреляции. Для оценки парных взаимосвязей используются ранговые коэффициенты корреляции Спирмена и Кендалла.
Перед расчетом коэффициентов выполняется ранжирование значений
27

r
x
x
x
исходных признаков X и Y в порядке возрастания и переход к
X
и
r
Y
по следующим правилам:
наименьшему значению признака присваивается ранг 1;
ранг равен месту значения признака в вариационном ряду (упоря-
доченном в порядке возрастания значений); если в выборке присутствуют одинаковые значения признаков, им присваивают один и тот же
ранг, равный среднему значению занимаемых ими мест;
наибольшее значение признака имеет ранг не выше количества
наблюдений в выборке.
Формула для расчета коэффициента ранговой корреляции Спирмена
имеет следующий вид:
n
2
6
d
∑
i
i
где
1
r
С
d
– разность рангов для каждой i-й пары
i
1
2
(1)
nn
, (18)
r
X
r
Y
и
– из n наблю-
дений.
r
Если в вариационных рядах
X
r
Y
и
встречаются члены ряда с оди-
наковыми ранговыми числами, то в формулу (18) необходимо внести
поправки
T
и yT на одинаковые ранги:
l
Ttt
*
r
С
,
ykk
1
(1)( )
nn T T
где l – число групп в вариационном ряду с одинаковыми рангами;
3
∑
k
1
n
6
∑
i
2
, (19)
2
d
i
1
1
2
, (20)
y
t
–
k
число членов в каждой из k-групп.
28

Проверка основной гипотезы
H
H
X
X
о статистической незначимости
0
коэффициента ранговой корреляции Спирмена выполняется с помощью
расчета критической статистики:
2
n
tr
расч С
, (21)
2
1
r
С
которая в условиях справедливости гипотезы
подчиняется распре-
0
делению Стьюдента с (n – 2) степенями свободы. Если выполняется неравенство
tt
расч
, (22)
⎛⎞
1
⎜⎟
2
⎝⎠
то гипотеза о статистически незначимой взаимосвязи между признаками не отвергается при уровне значимости .
Коэффициент ранговой корреляции Кендалла определяется по формуле
rr
4( , )
1
r
где
rr
(, )
XY
– минимальное число обменов соседних элементов ран-
К
жированной последовательности ,
к упорядочению
.rY
Если исследуемые ранжировки
Y
, (23)
(1)
nn
r
необходимое для приведения ее
r
X
r
Y
и
имеют одинаковые ранги,
то в расчетах используется скорректированный коэффициент ранговой
корреляции Кендалла:
2( )
UU
r
*
r
К
К
⎛⎞⎛⎞
2
11
⎜⎟⎜⎟
⎜⎟⎜⎟
(1) (1)
nn nn
⎝⎠⎝⎠
xy
(1)
nn
2
U
x
U
, (24)
y
29

где поправочные величины определяются соотношением
H
H
l
Utt
1
,
xy k k
2
k
∑
1
()
1.
(25)
Проверка основной гипотезы
о статистической незначимости
0
коэффициента ранговой корреляции Кендалла выполняется на основе
расчета критической статистики:
Гипотеза
zn
zD
расч
,
Dnn
не отвергается при заданном уровне значимости ,
0
2(2 5)
9( 1)
. (26)
если выполняется неравенство
zz
где
– квантиль стандартного нормального распределения уровня
z
⎛⎞
a
1
⎜⎟
2
⎝⎠
расч
⎛⎞
1
⎜⎟
⎝⎠
, (27)
a
2
1 – а / 2.
Свойства ранговых коэффициентов корреляции Спирмена и Кендалла:
допускается любой тип распределения исходных признаков;
диапазон изменения: [–1; 1];
симметричность;
1, 5rr
СК
единицы; всегда справедливо соотношение
, при значениях коэффициентов, достаточно далеких от
rr , за исключением
СК
случая полной функциональной взаимосвязи признаков и равенства
обоих коэффициентов единице.
Разработаны также множественные коэффициенты корреляции для
оценки взаимосвязи между совокупностью признаков (более двух).
В настоящем учебном пособии эти коэффициенты не приводятся, описание и основные расчетные формулы можно найти в [7, 8, 12, 16].
30
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
