Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Цифровые методы диагностики и прогнозирования процессов. Учебное пособие
.pdf
или реагирующий нейрон имеет множество входных связей, по кото-
рым поступают сигналы от рецепторов или других внутренних
нейронов. Пример модели внутреннего или реагирующего нейрона
r
представлен на рис. 4.2 Видно, что нейрон имеет
по которым на него поступают входные сигналы
пившие сигналы суммируются с весами
()z
на вырабатывается сигнал
, где
,,
ww
1
zw wu
0
сдвига. Может быть использована также форма записи
где фиктивный «сигнал»
тождественно равен 1.
u
0
внешних связей,
. Посту-
,,
uu
1
r
. На выходе нейро-
r
r
;
– параметр
w
0
ii
i
1
zwu
r
ii
i
0
,
Рис. 4.2. Модель внутреннего или реагирующего нейрона
Функцию ()z обычно называют активационной функцией. Могут
использоваться различные виды активационных функций, включая
а) пороговую функцию, задаваемую с помощью пороговой вели-
b :
чины
1 при
zb
б) сигмоидная функция
a
где
– вещественная константа;
()
z
z
()
1 при
1
zb
1
az
e
,
в) гиперболический тангенс;
41

г) тождественное преобразование ()zz
.
Первой нейросетевой моделью стал перцептрон Розенблатта,
предложенный в 1957 г. В данной модели используется единственный реагирующий нейрон. Модель, реализующая линейную разделяющую функцию в пространстве входных сигналов, может быть
использована для решении задач распознавания с двумя классами,
помеченными метками 1 или –1. В качестве активационной функции
используется пороговая функция
1 при 0,
z
()
z
1 при 0.
z
Особенностью модели Розенблатта является очень простая, но
вместе с тем эффективная процедура обучения, вычисляющая значения весовых коэффициентов
,,
ww
0
. Настройка параметров произ-
n
водится по обучающим выборкам, совершенно аналогичных тем, которые используются для обучения статистических алгоритмов.
На первом этапе производится преобразование векторов сигналов
(признаковых описаний) для объектов обучающей выборки. В набор
исходных признаков добавляется тождественно равная 1 нулевая компонента. Затем векторы описаний из класса
Векторы описаний из класса
не изменяются.
K
1
Нулевое приближение вектора весовых коэффициентов
умножаются на –1.
K
2
00
,,
ww
0
n
выбирается случайным образом. Преобразованные описания объек-
тов обучающей выборки
цептрона. В случае если описание
последовательно подаются на вход пер-
S
t
()k
x , поданное на шаге
, класси-
k
фицируется неправильно, то происходит коррекция по правилу
(1) () ()kkk
wwx
. В случае правильной классификации
(1) ()kk
ww
Отметим, что правильной классификации всегда соответствует
() ()
выполнение равенства
kk
(,)0
ции соответствует выполнение равенства
, а неправильной классифика-
wx
() ()
kk
(,)0
wx
. Процедура
повторяется до тех пор, пока не будет выполнено одно из следующих
условий:
и
– достигается полное разделение объектов из классов
K
1
;
K
2
– повторение заранее заданного числа итераций не приводит к
улучшению разделения;
– оказывается исчерпанным заранее заданный лимит итераций.
.
42

Для описанной процедуры справедлива следующая теорема.
Теорема. В случае если описания объектов обучающей выборки
линейно разделимы в пространстве признаковых описаний, то процедура обучения перцептрона построит линейную гиперплоскость,
разделяющую объекты двух классов за конечное число шагов.
Отсутствие линейной разделимости двух классов приводит к бесконечному зацикливанию процедуры обучения перцептрона.
Существенно
более высокой аппроксимирующей способностью
обладают нейросетевые методы распознавания, задаваемые комбинациями связанных между собой нейронов. Таким методом является
многослойный перцептрон.
4.2.2. Многослойный перцептрон
В методе многослойного перцептрона сеть формируется из не-
скольких слоев нейронов.
В их число входит слой входных рецепторов, подающих сигналы
на нейроны из внутренних слоев. Слои внутренних нейронов осуществляют преобразование сигналов. Слой реагирующих нейронов
производит окончательную классификацию объектов на основании
сигналов, поступающих от нейронов, принадлежащих внутренним
слоям. Обычно соблюдаются следующие
правила формирования
структуры сети:
– Допускаются связи только между нейронами, находящимися в
соседних слоях.
– Связи между нейронами внутри одного слоя отсутствуют.
– Активационные функции для всех внутренних нейронов иден-
тичны и задаются сигмоидными функциями.
Для решения задач распознавания с
пользуется конфигурация с
L
реагирующими нейронами. Схема
классами
,,
KK
1
L
ис-
L
многослойного перцептрона с двумя внутренними слоями представлена на рис. 4.3.
43

Рис. 4.3. Схема многослойного перцептрона
g
X
с двумя внутренними слоями
Отметим, что сигналы
,,
1
, вычисляемые на выходе реаги-
g
L
рующих нейронов, интерпретируются как оценки за классы
,,
KK
1
. Весовые коэффициенты w сопоставлены каждой из свя-
L
зей между нейронами из различных слоев.
Рассмотрим процедуру распознавания объектов с использованием
многослойного перцептрона. Предположим, что конфигурация
нейронной сети включает наряду со слоем рецепторов и слоем реа-
H
гирующих нейронов также
внутренних слоев искусственных
нейронов. Заданы также количества нейронов в каждом слое. Пусть
n
– число входных нейронов-рецепторов, ()rh – число нейронов во
внутреннем слое h .
На первом этапе вектор рецепторы формируют по информации,
поступающей из внешней среды, вектор входных переменных (сиг-
налов)
00
uu
1
. Отметим, что входные сигналы
,,
n
терпретироваться как признаки
,,
1
в общей постановке задачи
X
n
00
uu
1
,,
могут ин-
n
распознавания.
Предположим, что для нейрона с номером
i из первого внутрен-
него слоя связь с рецепторами осуществляется с помощью весовых
44

00
g
g
коэффициентов
го слоя вычисляет взвешенную сумму
Сигнал на выходе нейрона
ется по формуле
ii
,,
ww
1
10
u
i
. Сумматор нейрона i первого внутренне-
n
i
.
()
n
000
ii
0
t
wu
tt
.
i первого внутреннего слоя вычисля-
Аналогичным образом вычисляются сигналы на выходе нейронов
второго внутреннего слоя. Сигналы
,,
1
рассчитываются с по-
g
L
мощью той же самой процедуры, которая используется при вычислении сигналов на выходе нейронов из внутренних слоев, т.е. при вычислении
на первом шаге соответствующий сумматор вычисляет
i
взвешенную сумму
()
rH
iH iH
где
,,
ww
1()
– весовые коэффициенты, характеризующие связь
rh
реагирующего нейрона
H
,,
;
– сигналы на выходе внутреннего слоя H.
rH
слоя
HH
uu
1()
iH iH H
wu
0
t
с нейронами последнего внутреннего
i
tt
,
Сигнал на выходе реагирующего нейрона
g
i
iH
()
i вычисляется по формуле
.
Очевидно, что вектор выходных сигналов является функцией вектора входных сигналов (вектора признаков) и матрицы весовых коэффициентов связей между нейронами.
Аппроксимирующие способности многослойных перцептронов.
Один реагирующий нейрон позволяет аппроксимировать области,
являющиеся полупространствами, ограниченными гиперплоскостями. Нейронная сеть с одним внутренним слоем позволяет аппроксимировать произвольную выпуклую область в многомерном признаковом пространстве (открытую или закрытую).
Было доказано также, что многослойный перцептрон с двумя
внутренними слоями позволяет аппроксимировать произвольные области многомерного признакового пространства. Аппроксимирующая способность способность многослойного перцептрона с различным числом внутренних слоев проиллюстрирована на рис. 4.4.
45

Рис. 4.4. Схема аппроксимирующей способности нейронных сетей
с различным числом внутренних слоев
Области, соответствующие классам
и
1
, разделяются с по-
2
мощью простого нейрона, а также с помощью многослойных перцептронов с одним и двумя внутренними слоями. Конфигурация (см.
рис. 4.4, а) иллюстрирует разделяющую способность отдельного искусственного нейрон, функционирующего в соответствии с моделью
Розенблатта.
Конфигурация (см. рис. 4.4, б) – с одним внутренним слоем
нейронов. Она позволяет выделять в многомерном
пространстве признаков выпуклые области произвольного типа. Конфигурация (см.
рис. 4.4, в) – разделяющая способность многослойного перцептрона с
двумя внутренним слоями. Она позволяет выделять в многомерном
пространстве признаков области, которые могут быть получены из
набора выпуклых областей с помощью операций объединеия и пересечения. Очевидно, что многослойный перцептрон обладает очень
высокой аппроксимирующей способностью
.
Обучение многослойных перцептронов. Для обучения многослой-
ных перцептронов обычно используется метод обратного распространения ошибки. Данный метод сходен с обучением перцептрона Розенблатта тем, что коррекция изначально произвольных значений весо-
46

вых коэффициентов
процессе обучения объекта. Коррекция производится с использовани-
производится для каждого предъявленного в
ем метода градиентного спуска, т.е. коррекция производится в направлении в пространстве коэффициентов
, где максимально снижается
целевой функционал. В качестве целевого функционала используется
функционал эмпирического риска с квадратичными потерями. Принимается эффективный метод расчета градиента, основанный на использовании аналитических формул. Подробнее с методами обучения
нейронных сетей можно ознакомиться в работах [4, 7].
4.3. Решающие деревья и леса
4.3.1. Решающие деревья
Структура решающих деревьев
. Решающие деревья воспроизво-
дят логические схемы, позволяющие получить окончательное решение о классификации объекта с помощью ответов на иерархически
организованную систему вопросов. Причем вопрос, задаваемый на
последующем иерархическом уровне, зависит от ответа, полученного
на предыдущем уровне. Подобные логические модели давно используются в ботанике, зоологии, минералогии, медицине и других областях. Пример структуры решающего дерева, позволяющего грубо
оценить стоимость квадратного метра жилья в предполагаемом городе, приведен на рис. 4.5.
Схеме принятия решений (см. рис. 4.5) соответствует связный ориентированный ациклический граф – ориентированное дерево. Дерево
включает в себя корневую вершину, инцидентную только выходящим
ребрами, внутренние вершины, инцидентные одному входящему ребру
и нескольким выходящим
, и листья – концевые вершины.
Каждой из вершин дерева, за исключением листьев, соответствует
некоторый вопрос, подразумевающий несколько вариантов ответов,
соответствующих выходящим ребрам. В зависимости от выбранного
варианта ответа осуществляется переход к вершине следующего
уровня. Концевым вершинам поставлены в соответствие метки, указывающие на отнесение распознаваемого объекта к одному из клас-
Решающее дерево называется бинарным, если каждая внутрен-
сов.
няя или корневая вершина инцидентна только двум выходящим ребрам. Бинарные деревья удобно использовать в моделях машинного
обучения.
47

Рис. 4.5. Структура решающего дерева, оценивающего стоимость
T
X
j
j
j
j
j
M
j
M
квадратного метра жилых помещений. Для простоты выделяются два
уровня стоимости – высокий и низкий
Распознавание с помощью решающих деревьев. Предположим,
что бинарное дерево
описываемых набором признаков
T
рева
ставится в соответствие предикат, касающийся значения од-
ного из признаков. Непрерывному признаку
используется для распознавания объектов,
,,
1
. Каждой вершине де-
X
n
соответствует пре-
X
дикат вида
""
X
бор одного из двух, выходящих из вершины
зависимости от значения предиката. Категориальному признаку
принимающему значения из множества
в соответствие предикат вида
том дихотомического разбиения
одного из двух выходящих из вершины
j
, где
– некоторый пороговый параметр. Вы-
ребер производится в
X
jj
{,, }
Ma a
1()
1
""
XM
jj
{, }
MM
, где
12
jj
множества
1
является элемен-
j
rj
, ставится
. Выбор
ребер производится в за-
висимости от значения предиката. Процесс распознавания заканчивается при достижении концевой вершины (листа). Объект относится
классу согласно метке, поставленной в соответствие данному листу.
48
,

Обучение решающих деревьев. Рассмотрим задачу распознавания
X
L
P
g
с классами
,,
KK
1
водится по обучающей выборке
. Обучение алгоритма решающее дерево произ-
L
и включает в себя поиск опти-
S
t
мальных пороговых параметров или оптимальных дихотомических
разбиений для признаков
,,
1
. При этом поиск производится
X
n
исходя из требования снижения среднего индекса неоднородности в
выборках, порождаемых искомым дихотомическим разбиением обу-
чающей выборки
извольной выборки
. Индекс неоднородности вычисляется для про-
S
t
, содержащей объекты из классов
S
,,
KK
1
.
При этом используется несколько видов индексов, включая:
– энтропийный индекс неоднородности;
– индекс Джини;
– индекс ошибочной классификации.
1) Энтропийный индекс неоднородности вычисляется по формуле
L
() ln( )
SPP
eii
i
1
,
– доля объектов класса в выборке
где
i
При этом принимается, что
принимает при равенстве долей классов. Наименьшее значе-
()eS
ние
достигается при принадлежности всех объектов одному
()eS
0ln(0) 0 . Наибольшее значение
.
S
классу.
2) Индекс Джини вычисляется по формуле
L
() 1
SP
2
.
i
1
i
3) Индекс ошибочной классификации вычисляется по формуле
() 1 max( )
SP
mi
{1, , }
iL
.
Нетрудно понять, что индексы 2 и 3 также достигают минимального значения при принадлежности всех объектов обучающей выборке одному классу. Предположим, что в методе обучения исполь-
зуется индекс неоднородности
.
()S
Для оценки эффективности
*
49

X
разбиения обучающей выборки
l
S
ки
ности в
r
S
и
t
используется уменьшение среднего индекса неоднород-
t
l
r
S
S
и
t
по отношению к
t
S
на непересекающиеся подвыбор-
t
S
. Данное уменьшение вычисляет-
t
ся по формуле
где
(,) () ( ) ( ),
SSPSPS
ttltrt
** * *
l
P
P
и
являются долями
l
r
S
и
t
lr
r
S
в полной обучающей выборке
t
S
t
На первом этапе обучения бинарного решающего дерева находится оптимальный предикат, соответствующий корневой вершине. С
этой целью оптимальные разбиения строятся для каждого из признаков из набора
,,
1
значением индекса
. Выбирается признак
X
n
(,)
S
*
тимальным предикатом для
. Подвыбороки
t
, оцениваются с помощью критерия
X
i
max
S
t
с максимальным
X
i
max
l
r
и
, задаваемые оп-
S
t
остановки. В качестве критерия остановки может быть использован
простейший критерий достижения полной однородности по одному
*
из классов. В случае если какая-нибудь из выборок
удовлетворяет
S
t
критерию остановки, то соответствующая вершина дерева объявляется концевой и для нее вычисляется метка класса. В случае если вы-
*
борка
не удовлетворяет критерию остановки, то формируется но-
S
t
вая внутренняя вершина, для которой процесс построения дерева
продолжается. Однако вместо обучающей выборки
соответствующая вновь образованной внутренней вершине
борка
, которая равна
S
*
. Для данной выборки производятся те же
S
t
используется
S
t
вы-
построения, которые на начальном этапе проводились для обучаю-
щей выборки
. Обучение может проводиться до тех пор, пока все
S
t
вновь построенные вершины не окажутся однородными по классам.
Такое дерево может быть построено, когда обучающая выборка не
содержит объектов с одним и тем же значениям каждого из признаков, принадлежащих разным классам. Однако абсолютная точность
на обучающей выборке не всегда приводит к
высокой обобщающей
способности в результате эффекта переобучения.
Одним из способов достижения более высокой обобщающей способности является использования критериев остановки, позволяю-
.
50
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
