Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Цифровые методы диагностики и прогнозирования процессов. Учебное пособие

.pdf
Скачиваний:
0
Добавлен:
08.09.2026
Размер:
2 Мб
Скачать
☆
щих остановит процесс построения дерева до того, как будет достиг-




нута полная однородность концевых вершин.
Рассмотрим несколько таких критериев.
1. Критерий остановки по минимальному допустимому числу
объектов в выборках, соответствующих концевым вершинам.
2. Критерий остановки по минимально допустимой величине ин-
декса
(,)
ствует выборка сте с оптимальным предикатом, задающим разбиение шина
считается внутренней, если индекс
роговое значение
. Предположим, что некоторой вершинесоответ-
S
*
t
, для которой найдены оптимальный признак вме-
S

{, }
SS
(, )
превысил по-
S
*
t
, и считается концевой в противном случае.
lr
. Вер-
3. Критерий остановки по точности на контрольной выборке.
Исходная выборка данных случайным образом разбивается на обу­чающую выборку
и контрольную выборку
S
t
. Выборка
S
c
S
t
ис­пользуется для построения бинарного решающего дерева. Предпо­ложим, что некоторой вершине
соответствует выборка
S
, для
которой найдены оптимальный признак вместе с оптимальным пре-
lr

дикатом, задающим разбиение
На контрольной выборке
{, }
SS
производится сравнение эффектив-
S
c
ности распознающей способности деревьев
.
и
T
.
T
Деревья
до построения вершины цевой. В дереве считаются вершины, соответствующие подвыборкам
Распознающая способность деревьев
контрольной выборке

T
превосходит распознающую способность
построения исходят из того, что вершина противном случае производится исследование
и
T
включают все вершины и ребра, построенные
T
. В дереве
вершинасчитается внутренней, а концевыми
T
S
. В случае если распознающая способность
c
вершинасчитается кон-
T
l
и
S
S
T
и
T
сравнивается на
T
все дальнейшие
r
.
является концевой. В
l
r
S
S
и
.
4. Статистический критерий. Заранее фиксируется пороговый уровень значимости (р < 0,05, p < 0,01 или p < 0,001). Предположим, что требуется оценить, является ли концевой вершина, для которой найдены оптимальный признак вместе с оптимальным предикатом,
51
lr
s
s
s

{, }
задающим разбиение
SS
. Исследуется статистическая досто-
верность различий между содержанием объектов распознаваемых
l
классов в подвыборках
S
r
S
и
. Для этих целей могут быть исполь-
зованы известные статистические критерии: Хи-квадрат и другие
l
критерии. По выборкам
S
r
S
и
рассчитывается статистика крите-
рия и устанавливается соответствующее p-значение. В случае если полученное p-значение оказывается меньше заранее фиксированного уровня значимости, вершина случае вершина
считается концевой.
считается внутренней. В противном
Использование критериев ранней остановки не всегда позволяет адекватно оценить необходимую глубину дерева. Слишком ранняя остановка ветвления может привести к потере информативных пре­дикатов, которые могут быть на самом деле найдены только при до­статочно большой глубине ветвления.
В связи с этим нередко целесообразным оказывается построение полного дерева, которое
затем уменьшается до оптимального с точки зрения достижения максимальной обучающей способности размера путем объединения некоторых концевых вершин. Такой процесс в литературе принято называть pruning («подрезка»).
При подрезке дерева может быть использован критерий целесооб­разности объединения двух вершин, основанный на сравнении на контрольной выборке точности распознавания до и после проведения «подрезки».
один способ оптимизации обобщающей способности деревьев
Еще основан на учете при «подрезке» дерева до некоторой внутренней вершины
одновременно увеличения точности разделения классов
на обучающей выборке и увеличения сложности, которые возникают благодаря ветвлению из ветвлением из вершины
поддереве
ub
полного решающего дерева с корневой вершиной .
T
. При этом прирост сложности, связанный с
, может быть оценен через число листьев в
Следует отметить, что рост сложности является штрафующим факто­ром, компенсирующим прирост точности разделения на обучающей
выборке с помощью включения поддерева
ub
в решающее дерево.
T
Разработан целый ряд эвристических критериев, которые позволяют
ub
оценить целесообразность включения
. Данные критерии учиты-
T
вают одновременно сложность и разделяющую способность.
Методы решающих деревьев рассмотрены в работах [8, 9].
52
4.3.2. Решающие леса
В результате многочисленных экспериментов было установлено, что точность значительно возрастает, если вместо отдельных реша­ющих деревьев использовать коллективы (ансамбли) решающих де­ревьев, которые принято называть решающими лесами [10, 7]. Кол­лективное решение вычисляется по результатам распознавания от­дельными членами ансамбля. В методах решающих лесов в качестве членов ансамблей принято использовать решающие деревья, которые строятся по искусственно сгенерированным обучающим выборокам, статистически сходным с исходной обучающей выборкой. Получили распространение процедуры построения решающих лесов «бэггинг» и «бустинг» основанные на различных способах генерации «искус­ственных» выборок из исходной обучающей выборки.
В методе «бэггинг» (bagging) [11] каждая искусственная случай­ная выборка является выборкой с возвращениями из исходной обу-
чающей выборки
{, , }
Ss s
1
tm
, также содержащей m объектов.
Подобный способ генерации выборок называют «бутрэп» (bootstrap). Название bagging является сокращенным и происходит от полного названия «бутстрэп агрегирование» (bootstrap aggregating). Отметим, что искусственная выборка состоит только из объектов исходной
обучающей выборки
. Однако некоторые объекты
S
t
могут встре-
S
t
чаться в искусственной выборке по нескольку раз, а некоторые могут вообще отсутствовать.
Для построения коллективного решения может быть использова­но простейшее решающее правило голосования по большинству: объект относится к тому классу, в который его отнесло большинство деревьев, формирующих лес.
Основной идеей метода «бустинг» (boosting) является пошаговое наращивание ансамбля деревьев.
При этом на каждом шаге к ан-
самблю присоединяется алгоритм, который был обучен по выборке, искусственно сгенерированной из исходной обучающей выборки
S
t
В отличие от метода «бэггинг», простая выборка с возвращениями,
предполагающая равновероятность всех объектов
, используется
S
t
для обучения только на первом шаге. На каждом последующем шаге
k объекты в искусственные выборки выбираются с учетом вероят-
ностей, приписанных объектам исходной выборки
. Последнее
S
t
распределение вероятностей вычисляется с учетом результатов клас-
.
53
сификации с помощью ансамбля, использованного на предыдущем
X
X
j
s
s
s
s
s
шаге. При этом объектам, которые на предыдущем шаге были клас­сифицированы неверно, приписываются более высокие веса.
Существуют различные варианты реализации схемы «бустинг»,
зависящие от способа вычисления вероятностей, приписываемых
объектам
, а также способов вычисления коллективного решения.
S
t
Одной из наиболее известных вариантов метода «бустинг» является метод Adaptive Boosting (AdaBoost).
4.4. Комбинаторно-логические методы, основанные на принципе частичной прецедентности
Многие прикладные задачи распознавания могут быть успешно решены с помощью методов, основанных на принципе частичной прецедентности. Данный принцип подразумевает поиск по обучаю­щей выборке фрагментов описаний, позволяющих с разной степенью точности разделить распознаваемые классы
,,
KK
1
. Распознавае-
L
мый объект оценивается по совокупности найденных фрагментов. Одной из первых реализаций принципа частичной прецедентности является тестовый алгоритм, предложенный в 1966 г. в работе [12] для решении задачи геологического прогнозирования. Данный алго­ритм основан на понятии тупикового теста. Исходный вариант те­стового алгоритма предназначен для распознавания объектов, опи­сываемых с помощью бинарных
,,
1
чающая выборка
. Иными словами,
X
n
содержит объекты из классов
S
t
Xa a
этом общее число объектов равно
Выборке
j таблицы
ставится в соответствие таблица
S
t
находятся значения признаков
T
nmL
или категориальных признаков
ii
{, , }
iki
1()
m
.
,
1, ,in
T
nmL
,,
1
. Пусть обу-
,,
KK
1
[13, 6]. В строке
X
n
. При
L
на объекте
.
Определение 1. Тестом таблицы
ность столбцов
{, , }
ii
1
, что для произвольной пары строк
r
называется такая совокуп-
T
nmL
и

,
соответствующих объектам из разных классов, существует такой
*
столбец со строками
54
из множества
i
и
различны.
{, , }
ii
1
, что значения на пересечении
r
*
i
Иными словами, набор признаков считается тестом, если описа-
s
x
x
x
j
x
j
x
x
x
s
s
s
s
ния любых двух объектов из разных классов отличаются хотя бы по одному из признаков, входящих в тест.
Определение 2. Тест
никакое его отличное от
{, , }
Ti i
1
T
подмножество (собственное подмноже-
называется тупиковым, если
r
ство) тестом не является.
На этапе обучения ищется множество всевозможных тупиковых
тестов распознать объект
для таблицы
()
TS
t
с векторным описанием
*
в векторном описании фрагмент
T
из множества
ством фрагментов строк
щих классу
. Фрагмент
()
TS
t
(,, )
TT
:
K
{( , , ) | }
l
xsK
ijijl
1
выполняются равенства
. Предположим, что нам требуется
T
nmL
(,, )
(,, )
ii
1
(,, )
ii
1
TT
x
iji
1
r
TT
ji i ji i
11
r
,,
xxx
**
, соответствующий тесту
x
r
сравнивается с множе-
x
r
таблицы
(,, )
rr
x
ii
1
, фиксируем полное
x
*1 *
T
nmL
r
n
, соответствую-
. В случаях, когда
. Выделим
совпадение. Обозначим число полных совпадений распознаваемого объекта
с объектами
*
Оценка объекта
где
– число объектов обучающей выборки из класса
m
l
K
за класс
*

() ( )
**
lL
из
l
через
S
t
вычисляется по формуле:
K
l
1
m
l
()
S
TT
t
(, )
GTs
L
Gs
T,
*
,
.
.
K
l
Классификация объекта может производиться по вектору оценок
[(),, ()]
1* *
с помощью стандартного решающего правила, т.е.
s
l
объект относится к тому классу, оценка за который максимальна.
Задача о поиске всевозможных тупиковых тестов сводится к из­вестной задаче комбинаторного анализа о поиске всевозможных ту­пиковых покрытий элементов.
Нахождение всех тупиковых тестов является сложной комбина­торной задачей. Однако эффективные алгоритмы поиска разработа­ны для некоторых типов таблиц. При решении практических задач эффективен подход, основанный на вычислении только части тупи­ковых тестов [6].
55
Другим известным классом алгоритмов распознавания, основан-
x
s
x
sK
j
j
x
s
x
sv
x
sv
s
s
ным на принципе частичной прецедентности, являются алгоритмы типа КОРА [13]. В отличие от тестового алгоритма, где в качестве информативных элементов используются несжимаемые наборы при­знаков – тупиковые тесты, в алгоритмах типа КОРА в качестве ин­формативных элементов используются несжимаемые фрагменты описаний эталонных объектов обучающей выборки.
Определение 3. Пусть
екта ром для класса
. Набор
K
vl
(,, )
vj vj
, если для произвольной строки таблицы
K
l
ответствующей объекту
{, , }
1
j
r
, что
x
vj uj
(,, )
1
vvn
x
1
r
ui
.
называется представительным набо-
, существует такое
– признаковое описание объ-
x
из множества
, со-
T
nmL
Определение 4. Представительный набор называется тупиковым,
если никакое его собственное подмножество представительным набором не является.
На этапе обучения для каждого из классов
находится множество всевозможных тупиковых представитель-
T
nmL
V
ных наборов. Обозначим через ставительных наборов для класса ется распознать объект
(,, )
vx x
ui ui
1
если
(,, )
**
ivi i vi
11
Оценка
– представительный набор. Функция
r
xxx
за класс
*
rr
, и
вычисляется по формуле
K
l

() (,)
**
l
– множество всевозможных пред-
l
. Предположим, что нам требу-
K
l
с описанием
*
равна 0 в противном случае.
(,)
*
1
V
||
i
uV
i
su
.
,,
KK
1
(,, )
l
*1 *
(,)
по таблице
. Пусть
x
n
равна 1,
*
Первоначальные варианты тестового алгоритма и алгоритма типа КОРА были разработаны для бинарных или категориальных пере­менных. Они не могут быть напрямую использованы в задачах с при­знаками, принимающими значения из интервалов вещественной оси. Для того чтобы обеспечить возможность работы с подобной инфор­мацией, могут быть использованы два подхода
.
Первый подход основан на разбиении области возможных значе­ний каждого вещественнозначного признака на k связных подмно­жеств (интервалов, полуинтервалов, отрезков). Значению признака,
56
принадлежащего элементу j разбиения, присваивается само значе-
X
s
s
s
s
ние j . Разбиение оптимизируется с целью достижения максимально­го разделения классов. Выбирается такое число элементов разбиения
k , при котором достигается максимальная точность распознавания.
Второй подход основан на модификации понятий теста и предста-
вительного набора с использованием пороговых параметров которые задаются для признаков
Определение 5. Тестом таблицы
ность столбцов
{, , }
ii
1
, что для произвольной пары строк
r
,,
1
.
X
n
называется такая совокуп-
T
nmL
,,
1
и
n
соответствующих объектам из разных классов, существует такой столбец
цы значений, стоящих на пересечении вышает
*
из множества
i
.
*
i
{, , }
ii
1
r
, что абсолютная величина разни-
*
со строками
i
и
пре-
Аналогичным образом вводится модифицированное определение
представительного набора.
Главным требованием при выборе -порогов является достиже­ние максимальной отделимости объектов разных классов при сохра­нении сходства внутри классов.
Поиск тупиковых тестов и тупиковых представительных наборов при модифицированных определениях аналогичен их поиску в пер­воначальных вариантах методов.
Тестовый алгоритм и алгоритм с представительными наборами являются частью более общей конструкции, основанной на принципе частичной прецедентности
и носящей название алгоритмов вычисле-
ния оценок (АВО) [14, 15].
Существует много вариантов моделей данного типа. Причем кон­кретный вид модели определяется выбранными способами задания различных ее элементов. Рассмотрим основные составляющие этой модели.
Задание системы опорных множеств. Под опорными множе­ствами модели АВО понимаются наборы признаков, по которым осуществляется сравнение распознаваемых и эталонных
объектов. Примером системы опорных множеств является множество тупико­вых тестов. Система опорных множеств
может задаваться через систему подмножеств множества
некоторого алгоритма A
A
1, , n
или через систему характеристических бинарных векторов.
,
,
57
Каждому подмножеству {1, , }n может быть сопоставлен бинар-
x
x
s
s
ный вектор размерности
{, , }
ii
1
сопоставляется вектор
k
торого равны 0, кроме компонентов
n
. Пусть
{, , } {1, ,}
ii n
1
k
{,, }
ω
1
,,
ii
1
, все компоненты ко-
n
, равных 1. Теоретиче-
k
, тогда
ские исследования свойств тупиковых тестов для случайных бинар­ных таблиц показали, что характеристические векторы для почти всех тупиковых тестов имеют асимптотически (при неограниченном возрастании размерности таблицы обучения) одну и ту же длину.
Данный результат является обоснованием выбора в качестве си­стемы опорных векторов всевозможных наборов, включающих фик­сированное
число признаков k или
{:| | }Ak ωω
. Оптимальное значение k находится в процессе
обучения или задается экспертом. Другой часто используемой си­стеме опорных множеств
соответствует множество всех подмножеств
{1, , }n , за исключе-
нием пустого множества.
Задание функции близости. Близость между объектами по опор-
ноным множествам задается аналогично тому, как задается близость между объектами по тупиковым тестам или представительным набо­рам. Пусть набор номеров
скому вектору екта
B
называется ω – частью объекта
x
(,)
s
ω
ω . Фрагмент
понимается функция от соответствующих ω -частей срав-
{, , }
ii
1
(,, )
соответствует характеристиче-
k
описания
x
ii

1
k
Под функцией близости
.
(,, )
1

объ-
x
n
ниваемых объектов, принимающая значения 1 (объекты близки) или 0 (объекты удалены).
Функции близости обычно задаются с помощью пороговых пара­метров
(, , )

1
, характеризующих близость объектов по отдель-
n
ным признакам.
Примеры функций близости:
1.
(,)1ss
B

ω
, всегда выполняется неравенство
1

i
(,) 0ss
B

ω
менно

i
1
, если при произвольном {1 , , }in
||
, если существует такое
и
||
xx
iii

.


xx


iii
{1, , }in
, при котором
.
, что одновре-
58
2. Пусть – скалярный пороговый параметр. Функция
s
s
s
s
s
s
L
s
s
s
n
B
ω
(,)1ss

, если выполняется неравенство
противном случае
B
ω
(,) 0ss

.
||
xx
i
1

ii i

. В
Важным элементом АВО является оценка близости распознавае-
мого объекта
к эталону
*
близости, которая будет обозначаться
по заданной -части. Данная оценка
(, , )Gss
ω
, формируется на
*
основе введенных ранее функций близости и, возможно, дополни­тельных параметров. Приведем еще примеры функций близости раз­личного уровня сложности:
A)
(,,)B(,)Gss ss
ω
**

ω
B)
(,,) B(,)Gss p ss
ω
**

ω
где
– параметр, характеризующий информативность опорного
p
ω
множества с характеристическим вектором
С)
(,,) ( )B(,)
Gss p ss
ω
где
– параметр, характеризующий информативность эталона
параметры

,,
pp
1
**

признаков.
;
ω
,
ω ;
n
ω
ii
1
i
характеризуют информативность отдельных
n
,
;
Оценка объекта
ческом векторе сти
к эталонным объектам из класса
*
где
– число объектов обучающей выборки из класса
m
Общая оценка
(, )
ω
l
по опорным множествам из системы
*
за класс
*
ω может вычисляться как среднее значение близо-
(, ) (, , )

ωω
**
l
за класс
*
ˆ
Γω
() (,)
ll
при фиксированном характеристи-
K
l
:
K
l
1
m

**
Gss
L
sK
l
вычисляется как сумма оценок
K
l
s
ω

A
,
:
A
. (4.1)
.
K
l
59
Наряду с формулой (4.1) используется формула
s
L
s
s
s
s
s
s
D
Использование взвешивающих параметров регулировать доли правильно распознанных объектов
ˆ
Γω
lll
ws

() (,)
**
ω

A
. (4.2)
,,
ww
1
KK
позволяет
L
,,
1
.
Прямое вычисление оценок за классы по формулам (4.1) и (4.2) в случаях, когда в качестве систем опорных множеств используются наборы с фиксированным числом признаков или всевозможные наборы признаков, оказывается практически невозможным при вы­сокой размерности признакового пространства из-за необходимости вычисления огромного числа значений функций близости.
Однако при равенстве весов всех признаков
существуют эффек­тивные формулы для вычисления оценок по формуле (4.1). Предпо­ложим, что оценки близости распознаваемого объекта
по заданной ω -части вычисляются по формуле A.
к эталону
*
Тогда оценка по формуле (4.1) принимает вид
ˆ
Рассмотрим сумму
Γ
() B(, )
l

**
sK
ω

lA
B( , )
ω

*
ω
A
ло признаков, по которым объект
(, )ds s
Ds s i x x
. Иными словами,
*
(, ){:| | }

**

iii
. Очевидно, функция близости
ss
ω
. Предположим, что общее чис-
s
*
.
близок объекту
(, ) | (, )|ds s Ds s
**

, где
B( , )ss
, равно
*
ω
равна 1 тогда, когда опорное множество, задаваемое характеристиче­ским вектором
ω , полностью входит в множество
остальных случаях
B( , ) 0ss
*
ω
(, )
.
ss
*
. Во всех
Предположим, что система опорных множеств удовлетворяет
условию
{:| | }Ak ωω
удовлетворяющих условию
дует, что
B( , ) C
ss
ω
A
ω

*(,)
. Очевидно, что число опорных множеств,
B( , ) 1ss
*
ω
k
. Следовательно, оценка по формуле
ds s
*
, равно
C
k
. Откуда сле-
ds s
(, )
*
(4.1) может быть записана в виде
60
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]