Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Методы и модели решения задачи классификации данных. Основные этапы. Учебное пособие

.pdf
Скачиваний:
0
Добавлен:
07.09.2026
Размер:
1 Мб
Скачать
☆
позволяет оценить корректность применения вероятностного подхода
H
F
для решения конкретной задачи классификации.
Проверка на соответствие выборочных данных модели нормального закона распределения проводится с помощью ряда специальных крите­риев согласия (для проверки принадлежности только нормальному за­кону) или с помощью непараметрических критериев (универсальных, применимых для разных законов распределения). К специальным кри­териям относятся
, например, критерий проверки на симметричность, критерий проверки на эксцесс, Шапиро – Уилка, Эппса – Палли; к непа­раметрическим критериям: Колмогорова – Смирнова, Андерсона – Дар­линга, Крамера – фон Мизеса и т. д. [8, 12, 13].
Критерий согласия проверяет основную гипотезу
о соответ-
0
ствии выборочных данных модели нормального закона распределения при заданном уровне значимости (вероятность ошибки первого рода – вероятность отвергнуть основную гипотезу при условии, что она верна). В случае простой гипотезы известны параметры нормального закона распределения (
– математическое ожидание,  – СКО), в случае слож-
ной гипотезы – параметры закона неизвестны и оцениваются по вы­борке (
ˆ
– среднее,
ˆ
– оценка СКО):
ˆ
: ( ) ( , , )
HFxFx, (7)
0
ˆˆ
где нормальный закон распределения задается функцией
ˆ
(
)
x

x
ˆ
ˆ
xedx

(, , ) .
1
ˆ

2

∫
2
ˆ
2
(8)
Поскольку неизвестно, из какого распределения извлечены выбо-
рочные данные, проверка выполняется в условиях сложной гипотезы.
Критерии согласия различаются между собой принятой мерой раз­ницы выборочного и теоретического (нормального) законов распреде­ления, которая положена в основу критерия и называется критической статистикой.
Рассмотрим более подробно некоторые базовые критерии согласия.
Критерий согласия Шапиро –
 Уилка [5, 6, 12, 13]. Он основан на оп-
тимальной линейной комбинации порядковых статистик (рангов) наблю­дений для получения оценки параметров нормального распределения.
21
Эта комбинация рассчитывается таким образом, чтобы минимизировать
y
F
среднеквадратичное отклонение между теоретическими и наблюдае­мыми значениями упорядоченных в порядке возрастания выборочных данных (порядковых статистик).
Полученные оценки параметров используются для вычисления кри­тической статистики критерия Шапиро – Уилка, которая представляет собой отношение оптимальной линейной несмещенной оценки диспер­сии к ее обычной оценке методом максимального
правдоподобия:
2
, (9)
2
где
k
⎛⎞ ⎜⎟
∑
⎜⎟
i
1
⎝⎠
W
a
– коэффициенты, зависящие от размера выборки (их значения
i
()
ay y
ni ni i
 
11
n
yy

∑
i
i
1
могут быть найдены в статистических таблицах для W-теста, где пред­варительно рассчитаны соответствующие значения для различных раз-
меров выборки [5, 6, 12]); значения выборки x;
y
– упорядоченные в порядке возрастания
i
– среднее значение выборки; n – объем вы-
борки; k = n / 2, если n – четное и k = (n – 1) / 2, если n – нечетное.
Предельные значения критической статистики W(a) (процентные точки распределения) приведены в таблицах для W-теста [5, 6, 12]. Кри­терий левосторонний: если расчетное значение критической стати­стики W превышает табличное значение
(),WWa
то гипотеза о нор-
мальном распределении выборочных данных не отвергается при задан­ном уровне значимости.
Критерий согласия Андерсона – Дарлинга [12, 13]. Суть критерия за- ключается в измерении расхождения между эмпирической и теоретиче­ской функцией распределения данных.
Критическая статистика критерия рассчитывается по формуле
n
2
An i Fy Fy
 
1
(2 1) ln ( ) ln 1 ( )
∑
n
i
1
ˆˆ
⎡⎤

⎣⎦
ini

(1)
, (10)
где ˆ()
y – эмпирическая функция распределения, вычисленная для
i
i-го упорядоченного значения.
22
Квантили распределения критической статистики
A
H
A
A
H
в [12]. В случае справедливости гипотезы тической статистики
2
не превышает верхний квантиль распределе-
ния критической статистики критерия:
расчетное значение кри-
0
22
A
t
.
2
приведены
t
Критерий согласия Крамера – фон Мизеса [12, 13]. Суть критерия за­ключается в суммировании квадратов разностей между эмпирической и теоретической функцией распределения данных. Чем меньше сумма квадратов разностей, тем ближе эмпирическая функция распределения к теоретической функции распределения и тем больше вероятность того, что данные соответствуют предполагаемому распределению. Критиче­ская статистика критерия Крамера – фон
Мизеса вычисляется по формуле
n
⎛⎞
12121
2
WFyFy

12 2 2
nn n
⎛⎞⎛ ⎞
ˆˆ
⎜⎟
∑
i
() ( )
⎜⎟⎜ ⎟
ii
⎜⎟
⎝⎠⎝ ⎠
1
⎝⎠
Квантили распределения критической статистики в [12]. В случае справедливости гипотезы
2
тической статистики
W
не превышает верхний квантиль распределе-
ния критической статистики критерия:
22
ii

1
W
расчетное значение кри-
0
22
WW
.
t
. (11)
2
приведены
t
Как показывают исследования [13], мощность критериев, специ­ально построенных для проверки отклонения от нормального закона распределения (например, Шапиро – Уилка), на объемах выборок n ≤ 50 выше мощности непараметрических критериев согласия типа Крамера – фон Мизеса и типа Андерсона – Дарлинга при проверке сложных гипо­тез. Мощность критерия Андерсона – Дарлинга сравнительно выше мощности критерия Крамера –
1.4.3. АНАЛИЗ ВЗАИМОСВЯЗЕЙ ПРИЗНАКОВ
 фон Мизеса.
Этап анализа взаимосвязей признаков сводится к определению пре­дикторов, которые имеют статистически значимое влияние на прогно­зируемый результат (целевую переменную «Класс»). Анализ значи­мости взаимосвязей признаков позволяет:
идентифицировать наиболее важные признаки, которые суще-
ственно влияют на целевую переменную;
23
удалить неинформативные признаки, что позволяет сократить
размерность данных, улучшить обобщающую способность модели и уменьшить риск переобучения;
осуществить оптимизацию времени и ресурсов: исключение не-
значимых признаков из модели может значительно сократить вычисли­тельные затраты при обучении и применении модели, что особенно важно в случае обработки больших данных;
решить проблему мультиколлинеарности: мультиколлинеарность
возникает, когда признаки тесно связаны друг с другом; идентификация и удаление избыточных или сильно коррелированных признаков помо­гают избежать проблемы мультиколлинеарности и улучшают стабиль­ность и точность модели;
повысить интерпретируемость модели за счет выделения призна-
ков, которые оказывают наибольшее влияние на классификацию.
Таким образом, анализ значимости исходных признаков играет важ­ную роль в процессе решения задачи классификации, позволяя выбрать наиболее информативные предикторы, оптимизировать вычислитель­ные ресурсы, решить проблему мультиколлинеарности и улучшить ин­терпретируемость модели.
Выбор методов для исследования взаимосвязей
признаков, входя­щих в состав исходной БД, зависит от типа шкалы измерений признака. На количественной шкале применяются методы корреляционного ана­лиза данных; на порядковой шкале – методы рангового корреляцион­ного анализа данных; на классификационной шкале – методы анализа таблиц сопряженности; в случае разнотипных признаков проводится дисперсионный анализ данных. Возможен переход от количественной шкалы измерения значений признака к порядковой или классификаци­онной шкале; от порядковой шкалы – к классификационной шкале. Таким образом, реализуется понижение шкалы измерения, но обратный переход невозможен. Чем выше шкала измерения, тем больше инфор­мации в ней заложено, понижение шкалы всегда связно с потерей ин­формации о признаке.
В следующих разделах кратко
рассмотрены базовые методы иссле-
дования взаимосвязей для каждого типа шкал.
24
1.4.3.1. КОРРЕЛЯЦИОННЫЙ АНАЛИЗ ВЗАИМОСВЯЗЕЙ
x
x
КОЛИЧЕСТВЕННЫХ ПРИЗНАКОВ
Корреляционный анализ данных представляет собой раздел матема­тической статистики, который разрабатывает методы исследования ста­тистических взаимосвязей между значениями признаков, измеренных на изучаемых объектах. Также под корреляционным анализом данных понимают сам процесс исследования статистических взаимосвязей между значениями признаков исходной БД на основе совокупности спе­циальных методов и критериев.
К основным задачам корреляционного
анализа данных относят сле-
дующие [7, 8]:
установить факт наличия (отсутствия) взаимосвязи между иссле-
дуемыми признаками;
измерить степень тесноты связи;
оценить статистическую значимость связи.
Для визуальной оценки взаимосвязи количественных признаков строятся диаграммы рассеяния, анализ которых позволяет сделать пред­варительный вывод о наличии, направлении и типе (линейная, нелиней­ная) связи между исследуемыми признаками.
Парные линейные взаимосвязи между количественными призна­ками X и Y оцениваются на основе коэффициента корреляции Пирсона, который рассчитывается по
r
XY
формуле
n
xxyy


∑
ii
1
i
nn

∑∑
ii
11

22
xyy

ii
, (12)
y
и
где
i
– i-е значение признаков X и Y соответственно; x и y –
i
средние значения признаков.
Коэффициент корреляции Пирсона используется только в случае нормального распределения исходных признаков, и его рекомендуется
30.n
применять при объеме выборочных данных
Свойства коэффициента корреляции Пирсона:
измеряет только линейную взаимосвязь;
25
11
H
X
H
X
R
диапазон изменения:
r
XY
; при
нальная линейная взаимосвязь между признаками; при
r
XY
1
– прямая функцио-
r 
XY
1
– об-
ратная функциональная линейная взаимосвязь между признаками; при
YX
симметричность:
– отсутствие взаимосвязи между признаками;
rr
XY YX
, т. е. коэффициент Пирсона не позво-
0
r
ляет определить результирующий и факторный признак (X зависит от Y или Y зависит от X).
Проверка основной гипотезы
о статистической незначимости
0
коэффициента корреляции Пирсона реализуется на основе критической статистики:
rn
t
расч
YX
1
2
, (13)
2
r
Y
которая в условиях справедливости гипотезы
подчиняется распре-
0
делению Стьюдента с (n – 2) степенями свободы. Если выполняется не­равенство
tt
где
– квантиль распределения Стьюдента уровня
t
⎛⎞
1
⎜⎟ ⎝⎠
2
расч
⎛⎞
1
⎜⎟ ⎝⎠
, (14)
2
, то гипо-
1
2
теза о статистической незначимости взаимосвязи между признаками не отвергается при уровне значимости
.
Частный коэффициент корреляции – измеритель степени тесноты статистической связи между признаками X и Y при условии, что значе­ния остальных признаков зафиксированы на некотором постоянном уровне, т. е. связь «очищена» от влияния других признаков.
Формула для вычисления частного коэффициента корреляции:
R
, ,
RRR
где
XY XX YY
элементов
rrr
– алгебраические дополнения соответственно для
, ,
XY XX YY
r
XY
 , (15)
()
в определителе корреляционной матрицы.
XY
R
XYY
26
Пусть построена корреляционная матрица для признаков X, Y и Z:
X
1
⎛⎞ ⎜⎟
Rr r
⎜⎟ ⎜⎟ ⎝⎠
rr
YXZ
1
YX YZ
rr
ZX ZY
. (16)
1
Частный коэффициент корреляции между признаками X и Y при исключении влияния Z будет рассчитываться по формуле
rrr
r
XY Z
()
YX YZ ZX
22
11
rr

 
YZ ZX
. (17)
Для расчета частных коэффициентов корреляции между двумя при­знаками при исключении влияния более чем одного признака можно также воспользоваться рекуррентными соотношениями, которые приве­дены в [7, 8].
Частный коэффициент корреляции используется в случае нормаль­ного распределения исходных признаков и обладает следующими свой­ствами:
измеряет очищенную линейную связь;
диапазон изменения:
симметричность:
11;
r

rr
() ()
XY YX

()
XY
;
распределен так же, как и коэффициент корреляции Пирсона,
между теми же признаками, но объем выборки при проверке гипотезы о статистической незначимости коэффициента необходимо уменьшить на k, где k – количество «мешающих» признаков.
1.4.3.2. КОРРЕЛЯЦИОННЫЙ АНАЛИЗ ВЗАИМОСВЯЗЕЙ ПОРЯДКОВЫХ ПРИЗНАКОВ
В случае если значения признаков измерены в порядковой шкале или распределение исходных количественных данных не подчиняется нормальному закону, выполняется расчет непараметрических ранговых коэффициентов корреляции. Для оценки парных взаимосвязей исполь­зуются ранговые коэффициенты корреляции Спирмена и Кендалла. Перед расчетом коэффициентов выполняется ранжирование значений
27
r
x
x
x
исходных признаков X и Y в порядке возрастания и переход к
X
и
r
Y
по следующим правилам:
наименьшему значению признака присваивается ранг 1;
ранг равен месту значения признака в вариационном ряду (упоря-
доченном в порядке возрастания значений); если в выборке присут­ствуют одинаковые значения признаков, им присваивают один и тот же ранг, равный среднему значению занимаемых ими мест;
наибольшее значение признака имеет ранг не выше количества
наблюдений в выборке.
Формула для расчета коэффициента ранговой корреляции Спирмена имеет следующий вид:
n
2
6
d
∑
i
i
где
1
r

С
d
– разность рангов для каждой i-й пары
i
1
2
(1)
nn
, (18)
r
X
r
Y
и
– из n наблю-
дений.
r
Если в вариационных рядах
X
r
Y
и
встречаются члены ряда с оди-
наковыми ранговыми числами, то в формулу (18) необходимо внести поправки
T
и yT на одинаковые ранги:
l
Ttt
*

r
С

,
ykk
1
(1)( )
nn T T
где l – число групп в вариационном ряду с одинаковыми рангами;
3
∑

k
1
n
6
∑
i
2

, (19)
2
d
i
1
1
2
, (20)
y
t
–
k
число членов в каждой из k-групп.
28
Проверка основной гипотезы
H
H
X
X
о статистической незначимости
0
коэффициента ранговой корреляции Спирмена выполняется с помощью расчета критической статистики:
2
n
tr
расч С
, (21)
2
1
r
С
которая в условиях справедливости гипотезы
подчиняется распре-
0
делению Стьюдента с (n – 2) степенями свободы. Если выполняется не­равенство
tt
расч
, (22)
⎛⎞
1
⎜⎟
2
⎝⎠
то гипотеза о статистически незначимой взаимосвязи между призна­ками не отвергается при уровне значимости .
Коэффициент ранговой корреляции Кендалла определяется по фор­муле
rr
4( , )
1
r
где
rr
(, )
XY
– минимальное число обменов соседних элементов ран-

К
жированной последовательности , к упорядочению
.rY
Если исследуемые ранжировки
Y
, (23)
(1)
nn
r
необходимое для приведения ее
r
X
r
Y
и
имеют одинаковые ранги,
то в расчетах используется скорректированный коэффициент ранговой корреляции Кендалла:
2( )
UU
r
*
r
К
К
⎛⎞⎛⎞
2
11

⎜⎟⎜⎟ ⎜⎟⎜⎟
(1) (1)
nn nn
⎝⎠⎝⎠
xy
(1)
nn
2
U
x
U
, (24)
y

29
где поправочные величины определяются соотношением
H
H
l
Utt
1

,
xy k k
2
k
∑
1
()
1.
(25)
Проверка основной гипотезы
о статистической незначимости
0
коэффициента ранговой корреляции Кендалла выполняется на основе расчета критической статистики:
Гипотеза
zn
zD
расч
,

Dnn
не отвергается при заданном уровне значимости ,
0
2(2 5)
9( 1)
. (26)
если выполняется неравенство
zz
где
– квантиль стандартного нормального распределения уровня
z
⎛⎞
a
1
⎜⎟
2
⎝⎠
расч
⎛⎞
1
⎜⎟ ⎝⎠
, (27)
a
2
1 – а / 2.
Свойства ранговых коэффициентов корреляции Спирмена и Кен­далла:
допускается любой тип распределения исходных признаков;
диапазон изменения: [–1; 1];
симметричность;
1, 5rr
СК
единицы; всегда справедливо соотношение
, при значениях коэффициентов, достаточно далеких от
rr , за исключением
СК
случая полной функциональной взаимосвязи признаков и равенства обоих коэффициентов единице.
Разработаны также множественные коэффициенты корреляции для оценки взаимосвязи между совокупностью признаков (более двух). В настоящем учебном пособии эти коэффициенты не приводятся, опи­сание и основные расчетные формулы можно найти в [7, 8, 12, 16].
30
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]