Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Цифровые методы диагностики и прогнозирования процессов. Учебное пособие

.pdf
Скачиваний:
0
Добавлен:
08.09.2026
Размер:
2 Мб
Скачать
☆
ˆ
j
s
s
j
s
p
Γ
() C
ldss
1
s

m
L
sK
*(,)
k
l
. (4.3)
*
Предположим, что система
опорные множества. В этом случае число опорных множеств в удовлетворяющих условию
B( , ) 1ss
включает в себя всевозможные
A
(, )
ds s
*
, равно
*
ω
21
A
. Следова-
тельно, оценка по формуле (4.1) может быть записана в виде
ˆ
Γ
() [2 1]
l
1
s
*
m
L
sK
(, )
ds s
*

l
.
Обучение алгоритмов вычисления оценок. Для обучения алго-
ритмов АВО в общем случае может быть использован тот же самый подход, который используется для обучения в методе «Линейная машина». Предположим, что решается задача обучения алгоритмов для распознавания объектов, принадлежащих классам
При правильного распознавания объекта
должна выполнять-
K
L
,,
KK
1
L
ся система неравенств

() (),
ΓΓ
lj l j
где
s
{1, , } \lLl
.
В наиболее общем из приведенных выше вариантов модели АВО обучение может быть сведено к поиску максимальной совместной подсистемы системы неравенств
KS
11
 
mm
ll
SK t SK t
  

nn
()(,) ()(,)
  

11
LL
ωω
tt j tt j

ss p ss
lt
. (4.4)
Поиск максимальной совместной подсистемы системы (4.2) мо­жет производиться с использованием эвристического релаксацион­ного метода, аналогичного тому, что был использован при обучении алгоритма линейная машина [6].
,
.
4.5. Методы, основанные на голосовании по системам логических закономерностей
Одним из эффективных подходов к решению задач прогнозирова­ния и распознавания является использование коллективных решений по системам закономерностей. Под закономерностью понимается
61
распознающий или прогностический алгоритм, определенный на не-
которой подобласти признакового пространства или связанный с не­которым подмножеством признаков.
В качестве примера закономерностей могут быть приведены представительные наборы, являющиеся по сути подмножествами признаковых описаний, характерных для одного из распознаваемых классов. Аналогом представительных наборов задач с вещественно­значной информацией являются логические закономерности клас сов [16]. Под логической закономерностью класса
понимается
K
l
область признакового пространства, имеющая форму гиперпаралле­лепипеда и содержащая только объекты из
Логическая закономерность класса
rl , математически описывается с помощью наборов предикатов вида
()
() ()
где
1, ,in
.
[()] " "
Prl a x b
iiii
rl rl
, которую мы будем обозначать
K
l
.
K
l
, (4.5)
Пример логической закономерности представлен на рис. 4.6. Напомним, что предикатом называется утверждение, принимающее значения «ИСТИНА» или «ЛОЖЬ» в зависимости от значений вхо­дящих в них переменных. Полностью логическая закономерность задается конъюнкцией предикатов вида (4.5):
[ ( )] [ ( )] & & [ ( )]
rl Prl P rl
P
1
. (4.6)
n
-
Рис. 4.6. График логической закономерности, содержащей объекты класса
и не содержащей объектов, обозначенных по классам
62
K
(■) и
2
K
3
(▲)
(●)
K
1
Очевидно, что множество векторов
x
x
x
R
s
R
R
s
(, , )
1
, для которых выра-
x
n
жение (4.6) представляет собой гиперпараллелепипед в многомерном пространстве признаков и является истиным. Не все признаки явля­ются на самом деле существенными для закономерности ()
() ()
rl rl
[,]
несущественного признака
отрезок
i
ком, из которого принимает значения признак
На этапе обучения для каждого класса
гических закономерностей ким образом, чтобы равенство [()]
. Границы
l
rl
P ИСТИНА выполнялось бы на
ab
ii

K
rl rl
(,)
ab
ii
совпадает с отрез-
.
i
строится множество ло-
l
() ()
подбираются та-
rl . Для
максимально большом числе объектов обучающей выборки из класса
и равенство [()]rl
K
l
обучающей выборки из класса
P ЛОЖЬ выполнялось бы на всех объектах
. Наряду с полными логическими
K
l
закономерностями, удовлетворяющими последним условиям, ис­пользуются также частичные логические закономерности, для кото­рых допускается попадание в них небольшой доли объектов чужих классов. Методы построения логических закономерностей подробно излагаются в работах [6] и [16].
*
Предположим, что требуется распознать новый объект
каждого класса
[()]rl P «ИСТИНА». В качестве оценки за класс
рых ется доля таких закономерностей в
ищется число закономерностей в
K
l
. Классификация
l
K
. Для
, для кото-
l
использу-
l
*
произво-
дится с помощью стандартного решающего правила, т.е. объект от­носится в тот класс, оценка за который максимальна.
4.6. Метод мультимодельных статистически взвешенных синдромов
Метод мультимодельных статистически взвешенных синдромов является методом распознавания, основанном на принятии коллектив­ных решений по системам синдромов. Под «синдромом» понимается такая область признакового пространства, в которой содержание объ­ектов одного из классов отличается от содержания объектов этого класса в обучающей выборке или, по крайней мере, в одной из сосед­них областях
. Синдромы ищутся для каждого из распознаваемых классов с помощью построения оптимальных разбиений интервалов допустимых значений единичных признаков или совместных двумер-
63
ных областей допустимых значений пар признаков. Пример синдро­мов, характеризующих разделение двух классов, приведен на рис. 4.7
Рис. 4.7. Пример синдромов, характеризующих разделение двух
классов: внутри синдромов I (верхний слева) и II ( верхний справа)
преобладают объекты класса
преобладают объекты класса
(●); внутри синдрома IV
K
1
(+)
K
2
Поиск синдромов производится с использованием четырех се­мейств разбиений, имеющих различный уровень сложности. Приме­ры разбиений для каждого из семейств приведены на рис. 4.8. Се­мейство I включает всевозможные разбиения интервалов допусти­мых значений отдельных признаков на два интервала с помощью од­ной граничной точки. Семейство II включает всевозможные разбие­ния интервалов допустимых значений
отдельных признаков на три интервала с помощью двух граничных точек. Семейство III включает всевозможные разбиения совместных двумерных областей допусти­мых значений пар признаков на четыре подобласти с помощью двух граничных точек ( по одной точке для каждого из двух признаков). Семейство IV включает всевозможные разбиения совместных дву­мерных областей допустимых значений пар признаков
на две подоб­ласти с помощью прямой граничной линии, произвольно ориентиро­ванной относительно координатных осей.
64
F
F
F
Рис. 4.8. Примеры разбиений для каждого из четырех семейств,
используемых в методе СВС
В ходе поиска выбирается разбиение с максимальным значением
функционала качества. В различных вариантах метода используется
два функционала качества, зависящих от обучающей выборки распознаваемого класса
– интегральный – локальный
it l
(, ,)
SKR
loc
Обозначим через
l
Пусть
S
надлежат элементу надлежат
является долей объектов класса
0
l
;
– доля объектов
i
t
q
i
q
. Интегральный функционал задается формулой
SKR m
(, ,) ( )
it l i i
и разбиения R:
K
l
(, ,)
SKR
tl
,,
qq
1
;
m
i
;
.
элементы некоторого разбиения R.
r
в обучающей выборке
K
l
среди объектов, описания которых при-
K
l
– число объектов, описания которых при-
i
i
r
1
2
ll
0
.
1

ll

(1 )
00
S
t
Локальный функционал задается формулой
2
ll
(, ,) max
FSKR
loc
tl
ir
1, ,
()

ii
ll

00
0
(1 )
m
,
65
Метод СВС, впервые предложенный в работе [17], был основан на
R
R
R
F
R
s
s
использовании одномерных семейств разбиений. Позже была предло­жена модификация СВС метода – мультимодельные статистически взвешенные синдромы (МСВС) [18]. В методе МСВС наряду с одно­мерными семействами I и II используются также семейства III и IV.
Синдромы, задаваемые некоторым оптимальным разбиением
*
включаются в финальный набор, используемый в дальнейшем для рас­познавания новых объектов, если
*
удовлетворяет специальному кри-
терию. В методе СВС для поиска синдромов используется интеграль­ный функционал
FS K R
it l
. Для формирования финального набора
(, ,)
используется простой критерий: все элементы оптимального разбиения
*
включаются в набор, если величина интегрального функционала
(, , )
SKR
it l
*
превышает задаваемый пользователем порог . Опыт
решения прикладных задач показывает, что эффективность распознава­ния достигается при значениях
, меняющихся от 2 до 10.
Несколько более сложный критерий используется в методе МСВС.
Для поиска синдромов используется локальный функционал
(, ,)
FSKR
loc
tl
. Синдромы оптимального разбиения
*
включаются в
финальный набор в случае выполнения неравенства
(, ,)
FSKkR
loc
tl
, где величина параметра k зависит от сложности
используемой модели. Экперименты на прикладных задачах показали, что высокая эффективность достигается при разбиений из семейства I и
k = 0,5 для разбиений из семейства II–IV.
Предположим, что на этапе обучения для класса
множество синдромов екта
*
принадлежит синдромам
*
за класс
K
вычисляется по формуле
l
l
– доля объектов класса
где
i
l
w
– вес синдрома при классификации объектов класса
i
Q
. Пусть описание
l
,,
qq
1
r
ll
w
*
(, )
sK

l
ii
i
1
r
w
i
1
в синдроме
K
l
l i
k = 1 для простейших
найдено
K
l
*
x распознаваемого объ-
из множества
r
,
;
q
i
Q
. Оценка
L
K
l
, ко-
торый вычисляется по формуле
66
,
m
l
w
i
m
здесь
m
синдром
1
i
1
ll
i
(1 )
00
– число объектов обучающей выборки, попавших в
i
.
q
i
,

Данная формула была получена в работе [19] через максимизацию
специального функционала, сходного с функционалом правдоподобия.
4.7. Метод опорных векторов
4.7.1. Линейная разделимость
Принцип максимизации зазора.
Метод опорных векторов явля­ется универсальным методом распознавания, позволяющим наряду с линейными реализовывать также нелинейные решающие правила. Исходный вариант метода был предложен для задач с двумя распо­знаваемыми классами
и
K
1
. В случаях, когда объекты разных
K
2
классов в обучающей выборке линейно разделимы, обычно суще­ствует целая совокупность линейных поверхностей, осуществляю­щих такое разделение. На рис. 4.9 представлены двумерные данные, где объекты двух классов могут быть разделены с помощью прямых
A, B, C, D. Однако наша интуиция, подсказывает, что наилучшей
обобщающей способностью должна обладать разделяющая прямая
F,
одинаково удаленная от групп объектов из разных классов.
Рис. 4.9. Иллюстрация различных вариантов разделения классов
K
(●) и
1
(■) с помощью линейных границ
K
2
67
Интуитивные представления об оптимальной разделимости опре-
деляют проведение разделяющей гиперплоскости посередине между двумя параллельными гиперплоскостями, каждая из которых отделя­ет объекты одного из классов. При этом две плоскости строятся та­ким образом, чтобы «зазор» между ними был бы максимальным (рис. 4.10).
Рис. 4.10. Иллюстрация разделения классов
с помощью линейных границ с использованием концепции
максимального «зазора»
Напомним, что пара параллельных гиперплоскостей
многомерном пространстве
(
(
является направляющим вектором для гиперплоскостей.
где
w
Пусть
zw
, где  – некоторое вещественное число. Нетрудно
таким образом подобрать
(
68
n
R описывается с помощью уравнений:
t
b
wx
P
1
P
2
)
)
wx
,
1
t
b
, (4.7)
2
и b, чтобы уравнения
P
1
)
,
1tbzx
K
1
(●) и
(■)
K
2
и
P
1
в
P
2
(
s
s
s
s
P
2
)
(4.8)
1tbzx
описывали те же самые гиперплоскости, что и уравнения (4.7). Пусть
и
точки
x
1
принадлежат плоскостям
x
2
стояние (величина зазора) проекции разности
()
xx
12
определению равна
tt
()
zx x
12
|| ||
zz
2
. Следовательно, задача поиска двух максимально
между гиперплоскостями
на направление
tt
()
zx x
12
||
z
и
P
соответственно. Рас-
P
1
2
P
z
. Данная проекция по
и
равно
P
1
2
. Однако согласно (4.8):
удаленных друг от друга параллельных гиперплоскостей, каждая из которых отделяет объекты одного из классов, может быть сведена к
2
max
оптимизационной задаче
с ограничениями
||z
1
При этом оптимизация производится по компонентам направля-
ющего вектора
Введем обозначение:
тывая, что функция
t
j
t
b
zx
j
(, , )
zz
z
1
2
||z
1
bzx
при
при
SK
SK
2jt
, (4.9)
1jt
.
, 1, ,jm
и параметру сдвига b.
n
1
при
j
SK
и
1jt
SK
монотонно возрастает с уменьшением
. Учи-
2jt
n
1
i
2
z
i
переходим от задачи (4.9) к следующей задаче:
n
1
()1
jj
2
z
i
2
1
i
t
b
zx , 1, ,jm
, (4.10)
min
,
которая относится к хорошо изученному классу задач квадратичного программирования.
Решение задачи квадратичного программирования. Важным
инструментом исследования экстремальных значений оптимизируе­мых функций при ограничениях является функция Лагранжа (или лагранжиан), которая для задачи (4.10) записывается в виде
,
69
nm
2
(,, )

где
1
bz b
Lz λ zx
(,, ) [ ( ) 1]
являются неотрицательными вещественными, которые
m
1 2
 

ijjj
11
ij

называются множителями Лагранжа.
t
,
Из известной теоремы Каруша–Куна–Такера (ККТ) следует, что для
n
точки
(,)bz
**
, в которой функция
1
2
достигает своего минимума
z
i
2
1
i
при ограничениях задачи (4.10), и некоторого вектора значений неотри­цательных множителей Лагранжа
λ
1
, соблюдаются усло-
m
** *
(,, )
вия стационарности лагранжиана (,, )bLz λ по переменным (, )bz .
ра-
Также из теоремы ККТ следует необходимость выполнения
венств, которые носят название условий дополняющей нежесткости
**
[( )1]0
zx , 1, ,jm .
jj j
Условия стационарности заключаются в выполнении
(,, )
b
Lz λ
z
i
***
b
z λ
(,,)
t
b
m
**
 
zx
ijjji
j
1
1, ,in
,
0
n
.
m
равенств
(4.11)
В векторной форме система (4.11) принимает вид
m
**
zx

jjj
1
j
0
.
Из условия стационарности также следует выполнение равенства
(,, )
b
Lz λ
b
***
(,,)
b
z λ
m
 
1
j
*
jj
0
. (4.12)
Условия стационарности (4.11) (4.12) для лагранжиана (,, )bLz λ
являются необходимыми условиями экстремума при ограничениях задачи (4.10).
Поиск оптимальных значений множителей Лагранжа. Предпо-
ложим, что

(,,)b
z λ
является некоторой точкой, в которой соблюдают­ся условия стационарности и соблюдаются ограничения задачи (4.10). Воспользовавшись уравнениями (4.11) – (4.12) можно показать, что
лагранжиан в точке
(,,)b
z λ
может быть записан в виде
70
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]