Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Цифровые методы диагностики и прогнозирования процессов. Учебное пособие
.pdf
ˆ
j
s
s
j
s
p
Γ
() C
ldss
1
s
m
L
sK
*(,)
k
l
. (4.3)
*
Предположим, что система
опорные множества. В этом случае число опорных множеств в
удовлетворяющих условию
B( , ) 1ss
включает в себя всевозможные
A
(, )
ds s
*
, равно
*
ω
21
A
. Следова-
тельно, оценка по формуле (4.1) может быть записана в виде
ˆ
Γ
() [2 1]
l
1
s
*
m
L
sK
(, )
ds s
*
l
.
Обучение алгоритмов вычисления оценок. Для обучения алго-
ритмов АВО в общем случае может быть использован тот же самый
подход, который используется для обучения в методе «Линейная
машина». Предположим, что решается задача обучения алгоритмов
для распознавания объектов, принадлежащих классам
При правильного распознавания объекта
должна выполнять-
K
L
,,
KK
1
L
ся система неравенств
() (),
ΓΓ
lj l j
где
s
{1, , } \lLl
.
В наиболее общем из приведенных выше вариантов модели АВО
обучение может быть сведено к поиску максимальной совместной
подсистемы системы неравенств
KS
11
mm
ll
SK t SK t
nn
()(,) ()(,)
11
LL
ωω
tt j tt j
ss p ss
lt
. (4.4)
Поиск максимальной совместной подсистемы системы (4.2) может производиться с использованием эвристического релаксационного метода, аналогичного тому, что был использован при обучении
алгоритма линейная машина [6].
,
.
4.5. Методы, основанные на голосовании по системам
логических закономерностей
Одним из эффективных подходов к решению задач прогнозирования и распознавания является использование коллективных решений
по системам закономерностей. Под закономерностью понимается
61

распознающий или прогностический алгоритм, определенный на не-
которой подобласти признакового пространства или связанный с некоторым подмножеством признаков.
В качестве примера закономерностей могут быть приведены
представительные наборы, являющиеся по сути подмножествами
признаковых описаний, характерных для одного из распознаваемых
классов. Аналогом представительных наборов задач с вещественнозначной информацией являются логические закономерности клас
сов [16]. Под логической закономерностью класса
понимается
K
l
область признакового пространства, имеющая форму гиперпараллелепипеда и содержащая только объекты из
Логическая закономерность класса
rl , математически описывается с помощью наборов предикатов вида
()
() ()
где
1, ,in
.
[()] " "
Prl a x b
iiii
rl rl
, которую мы будем обозначать
K
l
.
K
l
, (4.5)
Пример логической закономерности представлен на рис. 4.6.
Напомним, что предикатом называется утверждение, принимающее
значения «ИСТИНА» или «ЛОЖЬ» в зависимости от значений входящих в них переменных. Полностью логическая закономерность
задается конъюнкцией предикатов вида (4.5):
[ ( )] [ ( )] & & [ ( )]
rl Prl P rl
P
1
. (4.6)
n
-
Рис. 4.6. График логической закономерности, содержащей объекты класса
и не содержащей объектов, обозначенных по классам
62
K
(■) и
2
K
3
(▲)
(●)
K
1

Очевидно, что множество векторов
x
x
x
R
s
R
R
s
(, , )
1
, для которых выра-
x
n
жение (4.6) представляет собой гиперпараллелепипед в многомерном
пространстве признаков и является истиным. Не все признаки являются на самом деле существенными для закономерности ()
() ()
rl rl
[,]
несущественного признака
отрезок
i
ком, из которого принимает значения признак
На этапе обучения для каждого класса
гических закономерностей
ким образом, чтобы равенство [()]
. Границы
l
rl
P ИСТИНА выполнялось бы на
ab
ii
K
rl rl
(,)
ab
ii
совпадает с отрез-
.
i
строится множество ло-
l
() ()
подбираются та-
rl . Для
максимально большом числе объектов обучающей выборки из класса
и равенство [()]rl
K
l
обучающей выборки из класса
P ЛОЖЬ выполнялось бы на всех объектах
. Наряду с полными логическими
K
l
закономерностями, удовлетворяющими последним условиям, используются также частичные логические закономерности, для которых допускается попадание в них небольшой доли объектов чужих
классов. Методы построения логических закономерностей подробно
излагаются в работах [6] и [16].
*
Предположим, что требуется распознать новый объект
каждого класса
[()]rl P «ИСТИНА». В качестве оценки за класс
рых
ется доля таких закономерностей в
ищется число закономерностей в
K
l
. Классификация
l
K
. Для
, для кото-
l
использу-
l
*
произво-
дится с помощью стандартного решающего правила, т.е. объект относится в тот класс, оценка за который максимальна.
4.6. Метод мультимодельных статистически
взвешенных синдромов
Метод мультимодельных статистически взвешенных синдромов
является методом распознавания, основанном на принятии коллективных решений по системам синдромов. Под «синдромом» понимается
такая область признакового пространства, в которой содержание объектов одного из классов отличается от содержания объектов этого
класса в обучающей выборке или, по крайней мере, в одной из соседних областях
. Синдромы ищутся для каждого из распознаваемых
классов с помощью построения оптимальных разбиений интервалов
допустимых значений единичных признаков или совместных двумер-
63

ных областей допустимых значений пар признаков. Пример синдромов, характеризующих разделение двух классов, приведен на рис. 4.7
Рис. 4.7. Пример синдромов, характеризующих разделение двух
классов: внутри синдромов I (верхний слева) и II ( верхний справа)
преобладают объекты класса
преобладают объекты класса
(●); внутри синдрома IV
K
1
(+)
K
2
Поиск синдромов производится с использованием четырех семейств разбиений, имеющих различный уровень сложности. Примеры разбиений для каждого из семейств приведены на рис. 4.8. Семейство I включает всевозможные разбиения интервалов допустимых значений отдельных признаков на два интервала с помощью одной граничной точки. Семейство II включает всевозможные разбиения интервалов допустимых значений
отдельных признаков на три
интервала с помощью двух граничных точек. Семейство III включает
всевозможные разбиения совместных двумерных областей допустимых значений пар признаков на четыре подобласти с помощью двух
граничных точек ( по одной точке для каждого из двух признаков).
Семейство IV включает всевозможные разбиения совместных двумерных областей допустимых значений пар признаков
на две подобласти с помощью прямой граничной линии, произвольно ориентированной относительно координатных осей.
64

F
F
F
Рис. 4.8. Примеры разбиений для каждого из четырех семейств,
используемых в методе СВС
В ходе поиска выбирается разбиение с максимальным значением
функционала качества. В различных вариантах метода используется
два функционала качества, зависящих от обучающей выборки
распознаваемого класса
– интегральный
– локальный
it l
(, ,)
SKR
loc
Обозначим через
l
Пусть
S
надлежат элементу
надлежат
является долей объектов класса
0
l
;
– доля объектов
i
t
q
i
q
. Интегральный функционал задается формулой
SKR m
(, ,) ( )
it l i i
и разбиения R:
K
l
(, ,)
SKR
tl
,,
qq
1
;
m
i
;
.
элементы некоторого разбиения R.
r
в обучающей выборке
K
l
среди объектов, описания которых при-
K
l
– число объектов, описания которых при-
i
i
r
1
2
ll
0
.
1
ll
(1 )
00
S
t
Локальный функционал задается формулой
2
ll
(, ,) max
FSKR
loc
tl
ir
1, ,
()
ii
ll
00
0
(1 )
m
,
65

Метод СВС, впервые предложенный в работе [17], был основан на
R
R
R
F
R
s
s
использовании одномерных семейств разбиений. Позже была предложена модификация СВС метода – мультимодельные статистически
взвешенные синдромы (МСВС) [18]. В методе МСВС наряду с одномерными семействами I и II используются также семейства III и IV.
Синдромы, задаваемые некоторым оптимальным разбиением
*
включаются в финальный набор, используемый в дальнейшем для распознавания новых объектов, если
*
удовлетворяет специальному кри-
терию. В методе СВС для поиска синдромов используется интегральный функционал
FS K R
it l
. Для формирования финального набора
(, ,)
используется простой критерий: все элементы оптимального разбиения
*
включаются в набор, если величина интегрального функционала
(, , )
SKR
it l
*
превышает задаваемый пользователем порог . Опыт
решения прикладных задач показывает, что эффективность распознавания достигается при значениях
, меняющихся от 2 до 10.
Несколько более сложный критерий используется в методе МСВС.
Для поиска синдромов используется локальный функционал
(, ,)
FSKR
loc
tl
. Синдромы оптимального разбиения
*
включаются в
финальный набор в случае выполнения неравенства
(, ,)
FSKkR
loc
tl
, где величина параметра k зависит от сложности
используемой модели. Экперименты на прикладных задачах показали,
что высокая эффективность достигается при
разбиений из семейства I и
k = 0,5 для разбиений из семейства II–IV.
Предположим, что на этапе обучения для класса
множество синдромов
екта
*
принадлежит синдромам
*
за класс
K
вычисляется по формуле
l
l
– доля объектов класса
где
i
l
w
– вес синдрома при классификации объектов класса
i
Q
. Пусть описание
l
,,
qq
1
r
ll
w
*
(, )
sK
l
ii
i
1
r
w
i
1
в синдроме
K
l
l
i
k = 1 для простейших
найдено
K
l
*
x распознаваемого объ-
из множества
r
,
;
q
i
Q
. Оценка
L
K
l
, ко-
торый вычисляется по формуле
66
,

m
l
w
i
m
здесь
m
синдром
1
i
1
ll
i
(1 )
00
– число объектов обучающей выборки, попавших в
i
.
q
i
,
Данная формула была получена в работе [19] через максимизацию
специального функционала, сходного с функционалом правдоподобия.
4.7. Метод опорных векторов
4.7.1. Линейная разделимость
Принцип максимизации зазора.
Метод опорных векторов является универсальным методом распознавания, позволяющим наряду с
линейными реализовывать также нелинейные решающие правила.
Исходный вариант метода был предложен для задач с двумя распознаваемыми классами
и
K
1
. В случаях, когда объекты разных
K
2
классов в обучающей выборке линейно разделимы, обычно существует целая совокупность линейных поверхностей, осуществляющих такое разделение. На рис. 4.9 представлены двумерные данные,
где объекты двух классов могут быть разделены с помощью прямых
A, B, C, D. Однако наша интуиция, подсказывает, что наилучшей
обобщающей способностью должна обладать разделяющая прямая
F,
одинаково удаленная от групп объектов из разных классов.
Рис. 4.9. Иллюстрация различных вариантов разделения классов
K
(●) и
1
(■) с помощью линейных границ
K
2
67

Интуитивные представления об оптимальной разделимости опре-
деляют проведение разделяющей гиперплоскости посередине между
двумя параллельными гиперплоскостями, каждая из которых отделяет объекты одного из классов. При этом две плоскости строятся таким образом, чтобы «зазор» между ними был бы максимальным
(рис. 4.10).
Рис. 4.10. Иллюстрация разделения классов
с помощью линейных границ с использованием концепции
максимального «зазора»
Напомним, что пара параллельных гиперплоскостей
многомерном пространстве
(
(
является направляющим вектором для гиперплоскостей.
где
w
Пусть
zw
, где – некоторое вещественное число. Нетрудно
таким образом подобрать
(
68
n
R описывается с помощью уравнений:
t
b
wx
P
1
P
2
)
)
wx
,
1
t
b
, (4.7)
2
и b, чтобы уравнения
P
1
)
,
1tbzx
K
1
(●) и
(■)
K
2
и
P
1
в
P
2

(
s
s
s
s
P
2
)
(4.8)
1tbzx
описывали те же самые гиперплоскости, что и уравнения (4.7). Пусть
и
точки
x
1
принадлежат плоскостям
x
2
стояние (величина зазора)
проекции разности
()
xx
12
определению равна
tt
()
zx x
12
|| ||
zz
2
. Следовательно, задача поиска двух максимально
между гиперплоскостями
на направление
tt
()
zx x
12
||
z
и
P
соответственно. Рас-
P
1
2
P
z
. Данная проекция по
и
равно
P
1
2
. Однако согласно (4.8):
удаленных друг от друга параллельных гиперплоскостей, каждая из
которых отделяет объекты одного из классов, может быть сведена к
2
max
оптимизационной задаче
с ограничениями
||z
1
При этом оптимизация производится по компонентам направля-
ющего вектора
Введем обозначение:
тывая, что функция
t
j
t
b
zx
j
(, , )
zz
z
1
2
||z
1
bzx
при
при
SK
SK
2jt
, (4.9)
1jt
.
, 1, ,jm
и параметру сдвига b.
n
1
при
j
SK
и
1jt
SK
монотонно возрастает с уменьшением
. Учи-
2jt
n
1
i
2
z
i
переходим от задачи (4.9) к следующей задаче:
n
1
()1
jj
2
z
i
2
1
i
t
b
zx , 1, ,jm
, (4.10)
min
,
которая относится к хорошо изученному классу задач квадратичного
программирования.
Решение задачи квадратичного программирования. Важным
инструментом исследования экстремальных значений оптимизируемых функций при ограничениях является функция Лагранжа (или
лагранжиан), которая для задачи (4.10) записывается в виде
,
69

nm
2
(,, )
где
1
bz b
Lz λ zx
(,, ) [ ( ) 1]
являются неотрицательными вещественными, которые
m
1
2
ijjj
11
ij
называются множителями Лагранжа.
t
,
Из известной теоремы Каруша–Куна–Такера (ККТ) следует, что для
n
точки
(,)bz
**
, в которой функция
1
2
достигает своего минимума
z
i
2
1
i
при ограничениях задачи (4.10), и некоторого вектора значений неотрицательных множителей Лагранжа
λ
1
, соблюдаются усло-
m
** *
(,, )
вия стационарности лагранжиана (,, )bLz λ по переменным (, )bz .
ра-
Также из теоремы ККТ следует необходимость выполнения
венств, которые носят название условий дополняющей нежесткости
**
[( )1]0
zx , 1, ,jm .
jj j
Условия стационарности заключаются в выполнении
(,, )
b
Lz λ
z
i
***
b
z λ
(,,)
t
b
m
**
zx
ijjji
j
1
1, ,in
,
0
n
.
m
равенств
(4.11)
В векторной форме система (4.11) принимает вид
m
**
zx
jjj
1
j
0
.
Из условия стационарности также следует выполнение равенства
(,, )
b
Lz λ
b
***
(,,)
b
z λ
m
1
j
*
jj
0
. (4.12)
Условия стационарности (4.11) (4.12) для лагранжиана (,, )bLz λ
являются необходимыми условиями экстремума при ограничениях
задачи (4.10).
Поиск оптимальных значений множителей Лагранжа. Предпо-
ложим, что
(,,)b
z λ
является некоторой точкой, в которой соблюдаются условия стационарности и соблюдаются ограничения задачи (4.10).
Воспользовавшись уравнениями (4.11) – (4.12) можно показать, что
лагранжиан в точке
(,,)b
z λ
может быть записан в виде
70
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
