Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Цифровые методы диагностики и прогнозирования процессов. Учебное пособие
.pdf
3.2. Статистические методы распознавания
X
p
μ
μ
X
X
3.2.1. Байесовский метод, основанный
на аппроксимации с помощью нормальных
распределений
Ранее было показано, что максимальную точность распознавания
,,
классов
KK
1
обеспечивает байесовское решающее правило, от-
L
носящее распознаваемый объект, описываемый вектором перемен-
,,
ных (признаков)
(|)
роятность
KPx
b
i
X
1
, к классу
n
максимальна.
K , для которого условная ве-
b
i
Байесовские методы обучения основаны на аппроксимации условных
вероятностей классов в точках признакового пространства с использованием формулы Байеса. Формула Байеса позволяет рассчитать условные
вероятности классов в точке признакового пространства:
где
(|)
K
Px
i
()
p x
– плотность распределения вероятности для класса
i
()
KP
– вероятность класса
i
ii
L
() ( )
xP
ii
j
1
K
безотносительно к признаковым
i
,
K
K
;
i
() ( )
pK
xP
описаниям (априорная вероятность).
()
KP
При этом в качестве оценки априорных вероятностей
жет быть взята доля объектов класса
торая далее будет обозначаться
(), , ()
ppxx
1
восстанавливаются исходя из предположения об их
L
K
в обучающей выборке, ко-
i
. Плотности вероятностей
i
i
мо-
принадлежности фиксированному типу распределения. Чаще всего
используется многомерное нормальное распределение. Плотность
данного распределения в общем виде представляется выражением
где
μ
Σ
() exp[()()]
p
xx
– математическое ожидание вектора признаков
– матрица ковариаций признаков
||Σ – детерминант матрицы
11
/2 1/2
n
(2 ) | |
2
Σ
.
,,
1
1
t
x
X
,
,,
X
1
;
n
;
n
31

Для построения распознающего алгоритма достаточно оценить
x
p
p
g
μ
,,
векторы атематических ожиданий
,,
ΣΣ
1
для классов
L
,,
KK
1
μμ
1
соответственно. Оценка
L
и матрицы ковариаций
L
μ
вычис-
i
ляется как среднее значение векторов признаков по объектам обучающей выборки из класса
K
:
i
1
ˆ
μ x
ij
m
i
sS K
jt i
,
m
где
– число объектов класса
i
Оценка элемента матрицы ковариаций для класса
K
в обучающей выборке.
i
K
вычисляется
i
по формуле
где
ˆ
kk jk k jk k
m
i
sS K
i
– k-я компонента вектора
k
()( ),,{1,,}
jt i
xkkn
i
μ
.
Матрицу ковариации, состоящую из элементов
ˆ
. Очевидно, что согласно формуле Байеса максимум
i
,
i
, обозначим
kk
(|)
KPx
до-
i
1
iii
стигается для тех же самых классов, для которых максимально про-
() ( )
изведение
пользовать натуральный логарифм
KxP
ii
. На практике для классификации удобнее ис-
ln[ ( ) ( )]
KxP
ii
, который согласно
вышеизложенному может быть оценен выражением
() ( )
iii
01
g
iiiiiii
1
2
11
ˆˆ
( ) ln(| |) ln( ) ln(2 )
μΣ μ Σ – не зависящее от
22 2
tt
ˆ
t
ˆˆ
g xxΣ xwx , где
iii
1
ˆ
ˆ
w
Σ
,
n
x слагаемое.
Таким образом, объект с признаковым описанием х будет отнесен
построенной выше аппроксимацией байесовского классификатора к
классу, для которого оценка является максимальной. Следует отметить, что построенный классификатор в общем случае является квадратичным по признакам. Однако классификатор превращается в линейный, если оценки ковариационных матриц разных классов оказываются
равными.
32

Задача
X
K
Пусть априорные вероятности классов
1
и
K
равны 0,3 и 0,7
2
соответственно. Предположим, что значения некоторого признака
для обоих классов распределены нормально. Для класса
. Для класса
1
K
2
области значений признака
катор относит классифицируемые объекты к классу
2
,
2
X
, при которых байесовский классифи-
. Выделить на числовой оси
1, 5
K
K
1
1
.
1
Решение. Как было показано, байесовский классификатор относит
объект, для которого
x
, к классу
*
K
. При выполнении неравен-
1
ства
22
() ()
xx
PK e PK e
ln ( ) ln ( )
11
12
22
*1 *2
22
12
12
,
откуда следует, что
()
ln 0
11 * 1 * 2
()
PK
212
()( )
xxPK
2
22
22
. (3.1)
Введем дополнительные обозначения:
12
2
12
,
12 21
12
,
22
12 21
12
.
X
2
,
Нетрудно показать, что неравенство (3.1) эквивалентно неравен-
ству
()
PK
()ln[ ]( )
22
x
*
Введем обозначение
ство (3.2) эквивалентно неравенству
неравенству
()x
2
*
при
21
()
PK
2
1
()
PK
1
ln[ ] ( )
21
21
()
PK
1
()x
*
.
. (3.2)
2
при
. Неравен-
, или
12
33
2
2

Неравенство
j
неравенство
0
()x
полнению неравенств
Неравенство
неравенство
нию неравенств
()x
()x
*
**
2
*
()x
*
*
2
выполняется всегда при
2
**
2
эквивалентно одновременному вы-
,.xx
не выполняется при
эквивалентно одновременному выполне-
,.xx
0
. При
0
3.2.2. Линейный дискриминант Фишера (ЛДФ)
Рассмотрим вариант метода ЛДФ для распознавания двух классов
K
K
и
1
пространстве такого направления
ции на него объектов обучающей выборки из классов
. В основе метода лежит поиск в многомерном признаковом
2
w
, чтобы средние значения проек-
K
K
и
1
симально различались. Проекцией произвольного вектора
t
(, )
w
направление
чий проекций классов на
ˆ
w
X
где
()
wi
является отношение
w
[() ()]
()
w
t
()
wx
w
||
1
m
i
sS K
jt i
используется функционал
ˆˆ
Xw X w
ww
12
ˆˆ
dd
() ()
12
– среднее значение проекции векторов,
описывающих объекты из класса
t
()
wx
ˆ
dX
() [ ()]
wi wi
1
ww
m
i
sS K
jt i
j
w
||
wx
. В качестве меры разли-
w
||
ww
K
ˆ
2
;
i
2
– выборочная дисперсия
,
проекций векторов, описывающих объекты из класса
,{1,2}
Ki
i
.
. При
0
мак-
2
x на
()
Смысл функционала
w понятен из его структуры. Он является
квадратом отличия между средними значениями проекций классов
на направление
w
, нормированным на сумму внутриклассовых вы-
борочных дисперсий.
Можно показать, что
34
()
w достигает максимума при

1
s
s
s
tt
ˆ
w μμ
ˆˆˆ
где
12 1 2
.
()
12 1 2
,
Таким образом записана оценка направления, оптимального для
K
распознавания
Распознавание нового объекта
производится по величине проекции
стого порогового правила: при
K
су
и
относится к классу
1
*
Граничный параметр
K
и
1
.
2
по признаковому описанию
*
t
(, )
wx
x
()
*
()x
K
в противном случае.
2
*
объект
*
с помощью про-
||
w
относится к клас-
*
x
подбирается по обучающей выборке таким образом, чтобы проекции объектов разных классов на оптимальное направление
w
оказались бы максимально разделенными. Простой, но эффективной стратегией является выбор в качестве порогового параметра
на направление
средней проекции объектов обучающей выборки
w
.
Метод ЛДФ легко обобщается на случай с несколькими классами.
,,
K
KK
и
1
1
K
сво-
L
:
2
При этом исходная задача распознавания классов
дится к последовательности задач с двумя классами
KK
Класс
, класс
11
\KK
21
;
………………………………….....
KK
Класс
1 L
Для каждой из
, класс
L задач находится оптимальное направление и по-
KK
роговое правило. В результате получается набор из
,,
ww
1
. При распознавании нового объекта по признаковому опи-
L
санию вычисляются проекции на
() ( )
() ,, ()
1* *
wx w x
xx
ww
|| | |
\
2
.
L
L направлений
,,
ww
1
tt
1* *
1
L
L
L
.
L
*
Распознаваемый объект относится к классу, соответствующему
максимальной величине проекции. Распознавание может производиться также по величинам
[( ) ], ,[ ( ) ]
1* 1 *
bb xx
LL
.
35

3.2.3. Логистическая регрессия
K
x
Целью логистической регрессии является аппроксимация плотности условных вероятностей классов в точках признакового пространства. При этом аппроксимация производится с использованием логистической функции
z
()
gz
e
zz
ee
1
.
11
График логистической функции приведен на рис. 3.4
Рис. 3.4. График логистической функции
В методе логистической регрессии связь условной вероятности
класса с прогностическими признаками осуществляются через переменную, которая задается как линейная комбинация признаков:
zX X
Таким образом, условная вероятность
странства
(,, )
**1 *
Px
(|)
K
Оценки регрессионных параметров
011 nn
.
в точке векторного про-
xx
задается в виде
n
xx
1
xx xx
01*1 1* 01*1 1*
ee
nn
e
11
01*1 1*
,,,
01
n
n
.
могут быть вы-
числены по обучающей выборке с помощью различных вариантов
метода максимального правдоподобия.
36

3.2.4. Метод k-ближайших соседей
s
Простым, но достаточно эффективным подходом к решению за-
дач распознавания является метод
(|)
условных вероятностей
V
точки x , содержащей k признаковых описаний объектов обучаю-
k
KPx
i
щей выборки. В качестве оценки за класс
k
i
k
борки из
ции расстояния
XX
, где
k
– число признаковых описаний объектов обучающей вы-
i
K
, где
внутри
i
X
– область допустимых значений признаковых описа-
V
. Окрестность
k
(', ")
xx , заданной на декартовом произведении
k-ближайших соседей. Оценка
ведется по ближайшей окрестности
K
выступает отношение
i
V
задается с помощью функ-
k
ний. В качестве функции расстояния может быть использована стандартная эвклидова метрика
n
(',") (' ")
xx
i
1
xx
2
ii
.
Для задач с бинарными признаками в качестве функции расстояния может быть использована метрика Хэмминга, равная числу совпадающих позиций в двух сравниваемых признаковых описаниях.
Окрестность
V
находится поиском в обучающей выборке
k
S
век-
t
торных описаний, ближайших в смысле выбранной функции расстояний, к описанию распознаваемого объекта
. Единственным пара-
*
метром, который может быть использован для настройки (обучения)
алгоритмов в методе
k-ближайших соседей является собственно само
число ближайших соседей.
Для оптимизации параметра
k обычно используется метод, осно-
ванный на скользящем контроле. Оценка точности распознавания
производится по обучающей выборке при различных
k и выбирается
значение данного параметра, при котором полученная точность максимальна.
Разнообразные статистические методы распознавания рассмотрены в курсе лекций [3]. Следует отметить также книги [4, 5].
37

4. МОДЕЛИ РАСПОЗНАВАНИЯ, ОСНОВАННЫЕ
f
X
xx
f
s
L
f
s
f
НА РАЗЛИЧНЫХ СПОСОБАХ ОБУЧЕНИЯ
Статистические методы распознавания обеспечивают достаточно
высокую точность в прикладных исследованиях. Однако в различных
областях науки и практической деятельности возникали задачи диагностики и прогнозирования, которые могли быть сведены к задачам
распознавания. При этом исследователям удавалось собрать обучающую выборку весьма ограниченного объема. а число показателей,
которые потенциально могли быть использованы, оказывалось
достаточно большим. Для решения таких задач стали предлагаться новые подходы, не содержащие предположений о лежащих в основе
изучаемого процесса вероятностных распределений. Оказалось, что
такие подходы часто имеют более высокую эффективность, чем статистические методы.
4.1. Метод линейной машины
Метод линейной машины предназначен для решения задачи рас-
познавания с классами
,,
KK
1
В процессе обучения классам
линейные функции
оценками за классы
ний переменных
,,
1
,,
KK
1
(, , )
x
1
() ,
fwwx wx
x
1011
() .
wwx wx
x
Lnn
Для того чтобы распознать объект
вектором
Объект
венств:
x
, вычисляются значения функций
будет отнесен классу
() (), {1, , }\{}
fj LLxx
lj
.
L
,,
KK
1
от переменных
f
L
, т.е. для произвольного вектора значе-
L
n
11 1
LL L
011
ставятся в соответствие
L
, являющиеся
X
n
nn
1
,,
, описание которого задается
в точке x.
,,
f
1
, если выполняется набор нера-
K
l
.
Таким образом, алгоритм распознавания задается матрицей вещественных параметров
38

11 1
s
f
ww w
01
W.
LL L
ww w
01
n
n
Обучение ведется по выборке
где
{, , }
yy
1
являются значениями дискретной прогнозируемой
m
{(,),, (,)}
Ssy s y xx
111
tmmm
переменной, указывающей на номер класса, которому принадлежит
соответствующий объект. Обучение состоит в поиске таких значений
параметров из матрицы
тов
оказывается правильно распознанным. Обозначим через ()ri
S
t
номер класса, которому принадлежит объект
борки. Максимальная точность на
W , при которых максимальное число объек-
из обучающей вы-
i
соответствует выполнению
S
t
максимального числа блоков неравенств:
() (), {1, ,}\{(1)}
ffjLrxx
(1) 1 1
rj
() (), {1,,}\{()}
()
rm m j m
fj Lrmxx
;
.
,
Рис. 4.1. Области, соответствующие отнесению распознаваемых
объектов классам
,,KK
13
методом линейной машины
39

Каждый из блоков соответствует одному из объектов выборки St
X
X
f
f
f
f
f
f
f
f
включает 1L неравенство. Таким образом, суммарное число нера-
венств составляет
(1)Lm
Поиск оптимальной матрицы коэффициентов
.
W производится с по-
мощью релаксационного алгоритма, подробно описанного в книге [6].
На рис. 4.1 приведен графический пример алгоритма распознавания, построенного с помощью метода линейной машины. Имеется
и
задача распознавания с классами 1, 2, 3 по признакам
1
.
2
Предполагается, что с использованием этого метода для каждого
класса найдены линейные функции оценок:
Очевидно, что классу K
полняются неравенства
Неравенство
620xx
12
(, ) (, )
xx f xx
112 312
(, ) 4,0 2
xx x x
112 1 2
(, ) 2,0 3
xx x x
212 1 2
(, )1,0 2
xx x x
312 1 2
(, ) (, )
xx f xx
112 212
соответствует область, для которой вы-
1
(, ) (, )
xx f xx
112 212
, задающему границу I (см. рис. 4.1). Неравенство
эквивалентно неравенству
ющему границу II. Область, соответствующая классу K
квадратами. Область, не относящаяся классу K
равенства
(, ) (, )
xx f xx
212 312
, относится к классу K2 и к классу K3
для класса 1;
для класса 2; (4.1)
для класса 3.
и
(, ) (, )
xx f xx
112 312
эквивалентно неравенству
30xx
12
, помечена
1
при выполнении не-
1
, зада-
при невыполнении этого неравенства.
Метод линейной машины подробно описан в книге [6].
4.2. Нейросетевые методы
4.2.1. Модель искусственного нейрона
В основе нейросетевых методов лежит попытка компьютерного
моделирования процессов обучения, используемых в живых организмах. Когнитивные способности живых существ связаны с функционированием сетей связанных между собой биологических нейронов – клеток нервной системы. Для моделирования биологических
нейросетей используются сети, узлами которых являются искусственные нейроны (т.е. математические модели нейронов). Можно
выделить три типа искусственных нейронов: нейроны-рецепторы,
внутренние нейроны и реагирующие нейроны. Каждый внутренний
.
40
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
