Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Цифровые методы диагностики и прогнозирования процессов. Учебное пособие
.pdf
щих остановит процесс построения дерева до того, как будет достиг-
нута полная однородность концевых вершин.
Рассмотрим несколько таких критериев.
1. Критерий остановки по минимальному допустимому числу
объектов в выборках, соответствующих концевым вершинам.
2. Критерий остановки по минимально допустимой величине ин-
декса
(,)
ствует выборка
сте с оптимальным предикатом, задающим разбиение
шина
считается внутренней, если индекс
роговое значение
. Предположим, что некоторой вершине соответ-
S
*
t
, для которой найдены оптимальный признак вме-
S
{, }
SS
(, )
превысил по-
S
*
t
, и считается концевой в противном случае.
lr
. Вер-
3. Критерий остановки по точности на контрольной выборке.
Исходная выборка данных случайным образом разбивается на обучающую выборку
и контрольную выборку
S
t
. Выборка
S
c
S
t
используется для построения бинарного решающего дерева. Предположим, что некоторой вершине
соответствует выборка
S
, для
которой найдены оптимальный признак вместе с оптимальным пре-
lr
дикатом, задающим разбиение
На контрольной выборке
{, }
SS
производится сравнение эффектив-
S
c
ности распознающей способности деревьев
.
и
T
.
T
Деревья
до построения вершины
цевой. В дереве
считаются вершины, соответствующие подвыборкам
Распознающая способность деревьев
контрольной выборке
T
превосходит распознающую способность
построения исходят из того, что вершина
противном случае производится исследование
и
T
включают все вершины и ребра, построенные
T
. В дереве
вершина считается внутренней, а концевыми
T
S
. В случае если распознающая способность
c
вершина считается кон-
T
l
и
S
S
T
и
T
сравнивается на
T
все дальнейшие
r
.
является концевой. В
l
r
S
S
и
.
4. Статистический критерий. Заранее фиксируется пороговый
уровень значимости (р < 0,05, p < 0,01 или p < 0,001). Предположим,
что требуется оценить, является ли концевой вершина, для которой
найдены оптимальный признак вместе с оптимальным предикатом,
51

lr
s
s
s
{, }
задающим разбиение
SS
. Исследуется статистическая досто-
верность различий между содержанием объектов распознаваемых
l
классов в подвыборках
S
r
S
и
. Для этих целей могут быть исполь-
зованы известные статистические критерии: Хи-квадрат и другие
l
критерии. По выборкам
S
r
S
и
рассчитывается статистика крите-
рия и устанавливается соответствующее p-значение. В случае если
полученное p-значение оказывается меньше заранее фиксированного
уровня значимости, вершина
случае вершина
считается концевой.
считается внутренней. В противном
Использование критериев ранней остановки не всегда позволяет
адекватно оценить необходимую глубину дерева. Слишком ранняя
остановка ветвления может привести к потере информативных предикатов, которые могут быть на самом деле найдены только при достаточно большой глубине ветвления.
В связи с этим нередко целесообразным оказывается построение
полного дерева, которое
затем уменьшается до оптимального с точки
зрения достижения максимальной обучающей способности размера
путем объединения некоторых концевых вершин. Такой процесс в
литературе принято называть pruning («подрезка»).
При подрезке дерева может быть использован критерий целесообразности объединения двух вершин, основанный на сравнении на
контрольной выборке точности распознавания до и после проведения
«подрезки».
один способ оптимизации обобщающей способности деревьев
Еще
основан на учете при «подрезке» дерева до некоторой внутренней
вершины
одновременно увеличения точности разделения классов
на обучающей выборке и увеличения сложности, которые возникают
благодаря ветвлению из
ветвлением из вершины
поддереве
ub
полного решающего дерева с корневой вершиной .
T
. При этом прирост сложности, связанный с
, может быть оценен через число листьев в
Следует отметить, что рост сложности является штрафующим фактором, компенсирующим прирост точности разделения на обучающей
выборке с помощью включения поддерева
ub
в решающее дерево.
T
Разработан целый ряд эвристических критериев, которые позволяют
ub
оценить целесообразность включения
. Данные критерии учиты-
T
вают одновременно сложность и разделяющую способность.
Методы решающих деревьев рассмотрены в работах [8, 9].
52

4.3.2. Решающие леса
В результате многочисленных экспериментов было установлено,
что точность значительно возрастает, если вместо отдельных решающих деревьев использовать коллективы (ансамбли) решающих деревьев, которые принято называть решающими лесами [10, 7]. Коллективное решение вычисляется по результатам распознавания отдельными членами ансамбля. В методах решающих лесов в качестве
членов ансамблей принято использовать решающие деревья, которые
строятся по искусственно сгенерированным обучающим выборокам,
статистически сходным с исходной обучающей выборкой. Получили
распространение процедуры построения решающих лесов «бэггинг» и
«бустинг» основанные на различных способах генерации «искусственных» выборок из исходной обучающей выборки.
В методе «бэггинг» (bagging) [11] каждая искусственная случайная выборка является выборкой с возвращениями из исходной обу-
чающей выборки
{, , }
Ss s
1
tm
, также содержащей m объектов.
Подобный способ генерации выборок называют «бутрэп» (bootstrap).
Название bagging является сокращенным и происходит от полного
названия «бутстрэп агрегирование» (bootstrap aggregating). Отметим,
что искусственная выборка состоит только из объектов исходной
обучающей выборки
. Однако некоторые объекты
S
t
могут встре-
S
t
чаться в искусственной выборке по нескольку раз, а некоторые могут
вообще отсутствовать.
Для построения коллективного решения может быть использовано простейшее решающее правило голосования по большинству:
объект относится к тому классу, в который его отнесло большинство
деревьев, формирующих лес.
Основной идеей метода «бустинг» (boosting) является пошаговое
наращивание ансамбля деревьев.
При этом на каждом шаге к ан-
самблю присоединяется алгоритм, который был обучен по выборке,
искусственно сгенерированной из исходной обучающей выборки
S
t
В отличие от метода «бэггинг», простая выборка с возвращениями,
предполагающая равновероятность всех объектов
, используется
S
t
для обучения только на первом шаге. На каждом последующем шаге
k объекты в искусственные выборки выбираются с учетом вероят-
ностей, приписанных объектам исходной выборки
. Последнее
S
t
распределение вероятностей вычисляется с учетом результатов клас-
.
53

сификации с помощью ансамбля, использованного на предыдущем
X
X
j
s
s
s
s
s
шаге. При этом объектам, которые на предыдущем шаге были классифицированы неверно, приписываются более высокие веса.
Существуют различные варианты реализации схемы «бустинг»,
зависящие от способа вычисления вероятностей, приписываемых
объектам
, а также способов вычисления коллективного решения.
S
t
Одной из наиболее известных вариантов метода «бустинг» является
метод Adaptive Boosting (AdaBoost).
4.4. Комбинаторно-логические методы, основанные
на принципе частичной прецедентности
Многие прикладные задачи распознавания могут быть успешно
решены с помощью методов, основанных на принципе частичной
прецедентности. Данный принцип подразумевает поиск по обучающей выборке фрагментов описаний, позволяющих с разной степенью
точности разделить распознаваемые классы
,,
KK
1
. Распознавае-
L
мый объект оценивается по совокупности найденных фрагментов.
Одной из первых реализаций принципа частичной прецедентности
является тестовый алгоритм, предложенный в 1966 г. в работе [12]
для решении задачи геологического прогнозирования. Данный алгоритм основан на понятии тупикового теста. Исходный вариант тестового алгоритма предназначен для распознавания объектов, описываемых с помощью бинарных
,,
1
чающая выборка
. Иными словами,
X
n
содержит объекты из классов
S
t
Xa a
этом общее число объектов равно
Выборке
j таблицы
ставится в соответствие таблица
S
t
находятся значения признаков
T
nmL
или категориальных признаков
ii
{, , }
iki
1()
m
.
,
1, ,in
T
nmL
,,
1
. Пусть обу-
,,
KK
1
[13, 6]. В строке
X
n
. При
L
на объекте
.
Определение 1. Тестом таблицы
ность столбцов
{, , }
ii
1
, что для произвольной пары строк
r
называется такая совокуп-
T
nmL
и
,
соответствующих объектам из разных классов, существует такой
*
столбец
со строками
54
из множества
i
и
различны.
{, , }
ii
1
, что значения на пересечении
r
*
i

Иными словами, набор признаков считается тестом, если описа-
s
x
x
x
j
x
j
x
x
x
s
s
s
s
ния любых двух объектов из разных классов отличаются хотя бы по
одному из признаков, входящих в тест.
Определение 2. Тест
никакое его отличное от
{, , }
Ti i
1
T
подмножество (собственное подмноже-
называется тупиковым, если
r
ство) тестом не является.
На этапе обучения ищется множество всевозможных тупиковых
тестов
распознать объект
для таблицы
()
TS
t
с векторным описанием
*
в векторном описании фрагмент
T
из множества
ством фрагментов строк
щих классу
. Фрагмент
()
TS
t
(,, )
TT
:
K
{( , , ) | }
l
xsK
ijijl
1
выполняются равенства
. Предположим, что нам требуется
T
nmL
(,, )
(,, )
ii
1
(,, )
ii
1
TT
x
iji
1
r
TT
ji i ji i
11
r
,,
xxx
**
, соответствующий тесту
x
r
сравнивается с множе-
x
r
таблицы
(,, )
rr
x
ii
1
, фиксируем полное
x
*1 *
T
nmL
r
n
, соответствую-
. В случаях, когда
. Выделим
совпадение. Обозначим число полных совпадений распознаваемого
объекта
с объектами
*
Оценка объекта
где
– число объектов обучающей выборки из класса
m
l
K
за класс
*
() ( )
**
lL
из
l
через
S
t
вычисляется по формуле:
K
l
1
m
l
()
S
TT
t
(, )
GTs
L
Gs
T,
*
,
.
.
K
l
Классификация объекта может производиться по вектору оценок
[(),, ()]
1* *
с помощью стандартного решающего правила, т.е.
s
l
объект относится к тому классу, оценка за который максимальна.
Задача о поиске всевозможных тупиковых тестов сводится к известной задаче комбинаторного анализа о поиске всевозможных тупиковых покрытий элементов.
Нахождение всех тупиковых тестов является сложной комбинаторной задачей. Однако эффективные алгоритмы поиска разработаны для некоторых типов таблиц. При решении практических задач
эффективен подход, основанный на вычислении только части тупиковых тестов [6].
55

Другим известным классом алгоритмов распознавания, основан-
x
s
x
sK
j
j
x
s
x
sv
x
sv
s
s
ным на принципе частичной прецедентности, являются алгоритмы
типа КОРА [13]. В отличие от тестового алгоритма, где в качестве
информативных элементов используются несжимаемые наборы признаков – тупиковые тесты, в алгоритмах типа КОРА в качестве информативных элементов используются несжимаемые фрагменты
описаний эталонных объектов обучающей выборки.
Определение 3. Пусть
екта
ром для класса
. Набор
K
vl
(,, )
vj vj
, если для произвольной строки таблицы
K
l
ответствующей объекту
{, , }
1
j
r
, что
x
vj uj
(,, )
1
vvn
x
1
r
ui
.
называется представительным набо-
, существует такое
– признаковое описание объ-
x
из множества
, со-
T
nmL
Определение 4. Представительный набор называется тупиковым,
если никакое его собственное подмножество представительным
набором не является.
На этапе обучения для каждого из классов
находится множество всевозможных тупиковых представитель-
T
nmL
V
ных наборов. Обозначим через
ставительных наборов для класса
ется распознать объект
(,, )
vx x
ui ui
1
если
(,, )
**
ivi i vi
11
Оценка
– представительный набор. Функция
r
xxx
за класс
*
rr
, и
вычисляется по формуле
K
l
() (,)
**
l
– множество всевозможных пред-
l
. Предположим, что нам требу-
K
l
с описанием
*
равна 0 в противном случае.
(,)
*
1
V
||
i
uV
i
su
.
,,
KK
1
(,, )
l
*1 *
(,)
по таблице
. Пусть
x
n
равна 1,
*
Первоначальные варианты тестового алгоритма и алгоритма типа
КОРА были разработаны для бинарных или категориальных переменных. Они не могут быть напрямую использованы в задачах с признаками, принимающими значения из интервалов вещественной оси.
Для того чтобы обеспечить возможность работы с подобной информацией, могут быть использованы два подхода
.
Первый подход основан на разбиении области возможных значений каждого вещественнозначного признака на k связных подмножеств (интервалов, полуинтервалов, отрезков). Значению признака,
56

принадлежащего элементу j разбиения, присваивается само значе-
X
s
s
s
s
ние j . Разбиение оптимизируется с целью достижения максимального разделения классов. Выбирается такое число элементов разбиения
k , при котором достигается максимальная точность распознавания.
Второй подход основан на модификации понятий теста и предста-
вительного набора с использованием пороговых параметров
которые задаются для признаков
Определение 5. Тестом таблицы
ность столбцов
{, , }
ii
1
, что для произвольной пары строк
r
,,
1
.
X
n
называется такая совокуп-
T
nmL
,,
1
и
n
соответствующих объектам из разных классов, существует такой
столбец
цы значений, стоящих на пересечении
вышает
*
из множества
i
.
*
i
{, , }
ii
1
r
, что абсолютная величина разни-
*
со строками
i
и
пре-
Аналогичным образом вводится модифицированное определение
представительного набора.
Главным требованием при выборе -порогов является достижение максимальной отделимости объектов разных классов при сохранении сходства внутри классов.
Поиск тупиковых тестов и тупиковых представительных наборов
при модифицированных определениях аналогичен их поиску в первоначальных вариантах методов.
Тестовый алгоритм и алгоритм с представительными наборами
являются частью более общей конструкции, основанной на принципе
частичной прецедентности
и носящей название алгоритмов вычисле-
ния оценок (АВО) [14, 15].
Существует много вариантов моделей данного типа. Причем конкретный вид модели определяется выбранными способами задания
различных ее элементов. Рассмотрим основные составляющие этой
модели.
Задание системы опорных множеств. Под опорными множествами модели АВО понимаются наборы признаков, по которым
осуществляется сравнение распознаваемых и эталонных
объектов.
Примером системы опорных множеств является множество тупиковых тестов. Система опорных множеств
может задаваться через систему подмножеств множества
некоторого алгоритма A
A
1, , n
или через систему характеристических бинарных векторов.
,
,
57

Каждому подмножеству {1, , }n может быть сопоставлен бинар-
x
x
s
s
ный вектор размерности
{, , }
ii
1
сопоставляется вектор
k
торого равны 0, кроме компонентов
n
. Пусть
{, , } {1, ,}
ii n
1
k
{,, }
ω
1
,,
ii
1
, все компоненты ко-
n
, равных 1. Теоретиче-
k
, тогда
ские исследования свойств тупиковых тестов для случайных бинарных таблиц показали, что характеристические векторы для почти
всех тупиковых тестов имеют асимптотически (при неограниченном
возрастании размерности таблицы обучения) одну и ту же длину.
Данный результат является обоснованием выбора в качестве системы опорных векторов всевозможных наборов, включающих фиксированное
число признаков k или
{:| | }Ak ωω
. Оптимальное значение k находится в процессе
обучения или задается экспертом. Другой часто используемой системе опорных множеств
соответствует множество всех подмножеств
{1, , }n , за исключе-
нием пустого множества.
Задание функции близости. Близость между объектами по опор-
ноным множествам задается аналогично тому, как задается близость
между объектами по тупиковым тестам или представительным наборам. Пусть набор номеров
скому вектору
екта
B
называется ω – частью объекта
x
(,)
s
ω
ω . Фрагмент
понимается функция от соответствующих ω -частей срав-
{, , }
ii
1
(,, )
соответствует характеристиче-
k
описания
x
ii
1
k
Под функцией близости
.
(,, )
1
объ-
x
n
ниваемых объектов, принимающая значения 1 (объекты близки) или
0 (объекты удалены).
Функции близости обычно задаются с помощью пороговых параметров
(, , )
1
, характеризующих близость объектов по отдель-
n
ным признакам.
Примеры функций близости:
1.
(,)1ss
B
ω
, всегда выполняется неравенство
1
i
(,) 0ss
B
ω
менно
i
1
, если при произвольном {1 , , }in
||
, если существует такое
и
||
xx
iii
.
xx
iii
{1, , }in
, при котором
.
, что одновре-
58

2. Пусть – скалярный пороговый параметр. Функция
s
s
s
s
s
s
L
s
s
s
n
B
ω
(,)1ss
, если выполняется неравенство
противном случае
B
ω
(,) 0ss
.
||
xx
i
1
ii i
. В
Важным элементом АВО является оценка близости распознавае-
мого объекта
к эталону
*
близости, которая будет обозначаться
по заданной -части. Данная оценка
(, , )Gss
ω
, формируется на
*
основе введенных ранее функций близости и, возможно, дополнительных параметров. Приведем еще примеры функций близости различного уровня сложности:
A)
(,,)B(,)Gss ss
ω
**
ω
B)
(,,) B(,)Gss p ss
ω
**
ω
где
– параметр, характеризующий информативность опорного
p
ω
множества с характеристическим вектором
С)
(,,) ( )B(,)
Gss p ss
ω
где
– параметр, характеризующий информативность эталона
параметры
,,
pp
1
**
признаков.
;
ω
,
ω ;
n
ω
ii
1
i
характеризуют информативность отдельных
n
,
;
Оценка объекта
ческом векторе
сти
к эталонным объектам из класса
*
где
– число объектов обучающей выборки из класса
m
Общая оценка
(, )
ω
l
по опорным множествам из системы
*
за класс
*
ω может вычисляться как среднее значение близо-
(, ) (, , )
ωω
**
l
за класс
*
ˆ
Γω
() (,)
ll
при фиксированном характеристи-
K
l
:
K
l
1
m
**
Gss
L
sK
l
вычисляется как сумма оценок
K
l
s
ω
A
,
:
A
. (4.1)
.
K
l
59

Наряду с формулой (4.1) используется формула
s
L
s
s
s
s
s
s
D
Использование взвешивающих параметров
регулировать доли правильно распознанных объектов
ˆ
Γω
lll
ws
() (,)
**
ω
A
. (4.2)
,,
ww
1
KK
позволяет
L
,,
1
.
Прямое вычисление оценок за классы по формулам (4.1) и (4.2) в
случаях, когда в качестве систем опорных множеств используются
наборы с фиксированным числом признаков или всевозможные
наборы признаков, оказывается практически невозможным при высокой размерности признакового пространства из-за необходимости
вычисления огромного числа значений функций близости.
Однако при равенстве весов всех признаков
существуют эффективные формулы для вычисления оценок по формуле (4.1). Предположим, что оценки близости распознаваемого объекта
по заданной ω -части вычисляются по формуле A.
к эталону
*
Тогда оценка по формуле (4.1) принимает вид
ˆ
Рассмотрим сумму
Γ
() B(, )
l
**
sK
ω
lA
B( , )
ω
*
ω
A
ло признаков, по которым объект
(, )ds s
Ds s i x x
. Иными словами,
*
(, ){:| | }
**
iii
. Очевидно, функция близости
ss
ω
. Предположим, что общее чис-
s
*
.
близок объекту
(, ) | (, )|ds s Ds s
**
, где
B( , )ss
, равно
*
ω
равна 1 тогда, когда опорное множество, задаваемое характеристическим вектором
ω , полностью входит в множество
остальных случаях
B( , ) 0ss
*
ω
(, )
.
ss
*
. Во всех
Предположим, что система опорных множеств удовлетворяет
условию
{:| | }Ak ωω
удовлетворяющих условию
дует, что
B( , ) C
ss
ω
A
ω
*(,)
. Очевидно, что число опорных множеств,
B( , ) 1ss
*
ω
k
. Следовательно, оценка по формуле
ds s
*
, равно
C
k
. Откуда сле-
ds s
(, )
*
(4.1) может быть записана в виде
60
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
