Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Цифровые методы диагностики и прогнозирования процессов. Учебное пособие

.pdf
Скачиваний:
0
Добавлен:
08.09.2026
Размер:
2 Мб
Скачать
☆
или реагирующий нейрон имеет множество входных связей, по кото-
рым поступают сигналы от рецепторов или других внутренних нейронов. Пример модели внутреннего или реагирующего нейрона
r
представлен на рис. 4.2 Видно, что нейрон имеет по которым на него поступают входные сигналы
пившие сигналы суммируются с весами
()z
на вырабатывается сигнал
, где
,,
ww
1
zw wu

0
сдвига. Может быть использована также форма записи
где фиктивный «сигнал»
тождественно равен 1.
u
0
внешних связей,
. Посту-
,,
uu
1
r
. На выходе нейро-
r
r
;
– параметр
w
0
ii
i
1
zwu
r
ii
i
0
,
Рис. 4.2. Модель внутреннего или реагирующего нейрона
Функцию ()z обычно называют активационной функцией. Могут
использоваться различные виды активационных функций, включая
а) пороговую функцию, задаваемую с помощью пороговой вели-
b :
чины
1 при
zb
б) сигмоидная функция
a
где
– вещественная константа;

()
z
z

()
1 при
1
zb
1
az
e
,
в) гиперболический тангенс;
41
г) тождественное преобразование ()zz
 .
Первой нейросетевой моделью стал перцептрон Розенблатта, предложенный в 1957 г. В данной модели используется единствен­ный реагирующий нейрон. Модель, реализующая линейную разде­ляющую функцию в пространстве входных сигналов, может быть использована для решении задач распознавания с двумя классами, помеченными метками 1 или –1. В качестве активационной функции используется пороговая функция
1 при 0,
z

()
z
1 при 0.
z
Особенностью модели Розенблатта является очень простая, но вместе с тем эффективная процедура обучения, вычисляющая значе­ния весовых коэффициентов
,,
ww
0
. Настройка параметров произ-
n
водится по обучающим выборкам, совершенно аналогичных тем, ко­торые используются для обучения статистических алгоритмов.
На первом этапе производится преобразование векторов сигналов (признаковых описаний) для объектов обучающей выборки. В набор исходных признаков добавляется тождественно равная 1 нулевая ком­понента. Затем векторы описаний из класса
Векторы описаний из класса
не изменяются.
K
1
Нулевое приближение вектора весовых коэффициентов
умножаются на –1.
K
2
00
,,
ww
0
n
выбирается случайным образом. Преобразованные описания объек-
тов обучающей выборки цептрона. В случае если описание
последовательно подаются на вход пер-
S
t
()k
x , поданное на шаге
, класси-
k
фицируется неправильно, то происходит коррекция по правилу
(1) () ()kkk
wwx
. В случае правильной классификации
(1) ()kk
ww
Отметим, что правильной классификации всегда соответствует
() ()
выполнение равенства
kk
(,)0
ции соответствует выполнение равенства
, а неправильной классифика-
wx
() ()
kk
(,)0
wx
. Процедура
повторяется до тех пор, пока не будет выполнено одно из следующих условий:
и
– достигается полное разделение объектов из классов
K
1
;
K
2
– повторение заранее заданного числа итераций не приводит к улучшению разделения;
– оказывается исчерпанным заранее заданный лимит итераций.
.
42
Для описанной процедуры справедлива следующая теорема.
Теорема. В случае если описания объектов обучающей выборки линейно разделимы в пространстве признаковых описаний, то про­цедура обучения перцептрона построит линейную гиперплоскость, разделяющую объекты двух классов за конечное число шагов.
Отсутствие линейной разделимости двух классов приводит к бес­конечному зацикливанию процедуры обучения перцептрона.
Существенно
более высокой аппроксимирующей способностью обладают нейросетевые методы распознавания, задаваемые комби­нациями связанных между собой нейронов. Таким методом является многослойный перцептрон.
4.2.2. Многослойный перцептрон
В методе многослойного перцептрона сеть формируется из не-
скольких слоев нейронов.
В их число входит слой входных рецепторов, подающих сигналы на нейроны из внутренних слоев. Слои внутренних нейронов осу­ществляют преобразование сигналов. Слой реагирующих нейронов производит окончательную классификацию объектов на основании сигналов, поступающих от нейронов, принадлежащих внутренним слоям. Обычно соблюдаются следующие
правила формирования
структуры сети:
– Допускаются связи только между нейронами, находящимися в соседних слоях.
– Связи между нейронами внутри одного слоя отсутствуют.
– Активационные функции для всех внутренних нейронов иден-
тичны и задаются сигмоидными функциями.
Для решения задач распознавания с пользуется конфигурация с
L
реагирующими нейронами. Схема
классами
,,
KK
1
L
ис-
L
многослойного перцептрона с двумя внутренними слоями представ­лена на рис. 4.3.
43
Рис. 4.3. Схема многослойного перцептрона
g
X
с двумя внутренними слоями
Отметим, что сигналы
,,
1
, вычисляемые на выходе реаги-
g
L
рующих нейронов, интерпретируются как оценки за классы
,,
KK
1
. Весовые коэффициенты w сопоставлены каждой из свя-
L
зей между нейронами из различных слоев.
Рассмотрим процедуру распознавания объектов с использованием многослойного перцептрона. Предположим, что конфигурация нейронной сети включает наряду со слоем рецепторов и слоем реа-
H
гирующих нейронов также
внутренних слоев искусственных
нейронов. Заданы также количества нейронов в каждом слое. Пусть
n
– число входных нейронов-рецепторов, ()rh – число нейронов во
внутреннем слое h .
На первом этапе вектор рецепторы формируют по информации, поступающей из внешней среды, вектор входных переменных (сиг-
налов)
00
uu
1
. Отметим, что входные сигналы
,,
n
терпретироваться как признаки
,,
1
в общей постановке задачи
X
n
00
uu
1
,,
могут ин-
n
распознавания.
Предположим, что для нейрона с номером
i из первого внутрен-
него слоя связь с рецепторами осуществляется с помощью весовых
44
00
g
g
коэффициентов
го слоя вычисляет взвешенную сумму
Сигнал на выходе нейрона
ется по формуле
ii
,,
ww
1
10
u
i
. Сумматор нейрона i первого внутренне-
n
i
.
()
n
000
ii

0
t
wu
tt
.
i первого внутреннего слоя вычисля-
Аналогичным образом вычисляются сигналы на выходе нейронов
второго внутреннего слоя. Сигналы
,,
1
рассчитываются с по-
g
L
мощью той же самой процедуры, которая используется при вычисле­нии сигналов на выходе нейронов из внутренних слоев, т.е. при вы­числении
на первом шаге соответствующий сумматор вычисляет
i
взвешенную сумму
()
rH
iH iH
где
,,
ww
1()
– весовые коэффициенты, характеризующие связь
rh
реагирующего нейрона
H
,,
;
– сигналы на выходе внутреннего слоя H.
rH
слоя
HH
uu
1()
iH iH H

wu
0
t
с нейронами последнего внутреннего
i
tt
,
Сигнал на выходе реагирующего нейрона
g
i
iH
()
i вычисляется по формуле
.
Очевидно, что вектор выходных сигналов является функцией век­тора входных сигналов (вектора признаков) и матрицы весовых ко­эффициентов связей между нейронами.
Аппроксимирующие способности многослойных перцептронов.
Один реагирующий нейрон позволяет аппроксимировать области, являющиеся полупространствами, ограниченными гиперплоскостя­ми. Нейронная сеть с одним внутренним слоем позволяет аппрокси­мировать произвольную выпуклую область в многомерном призна­ковом пространстве (открытую или закрытую).
Было доказано также, что многослойный перцептрон с двумя внутренними слоями позволяет аппроксимировать произвольные об­ласти многомерного признакового пространства. Аппроксимирую­щая способность способность многослойного перцептрона с различ­ным числом внутренних слоев проиллюстрирована на рис. 4.4.
45
Рис. 4.4. Схема аппроксимирующей способности нейронных сетей
с различным числом внутренних слоев
Области, соответствующие классам
и
1
, разделяются с по-
2
мощью простого нейрона, а также с помощью многослойных пер­цептронов с одним и двумя внутренними слоями. Конфигурация (см. рис. 4.4, а) иллюстрирует разделяющую способность отдельного ис­кусственного нейрон, функционирующего в соответствии с моделью Розенблатта.
Конфигурация (см. рис. 4.4, б) – с одним внутренним слоем
нейронов. Она позволяет выделять в многомерном
пространстве при­знаков выпуклые области произвольного типа. Конфигурация (см. рис. 4.4, в) – разделяющая способность многослойного перцептрона с двумя внутренним слоями. Она позволяет выделять в многомерном пространстве признаков области, которые могут быть получены из набора выпуклых областей с помощью операций объединеия и пере­сечения. Очевидно, что многослойный перцептрон обладает очень высокой аппроксимирующей способностью
.
Обучение многослойных перцептронов. Для обучения многослой-
ных перцептронов обычно используется метод обратного распростра­нения ошибки. Данный метод сходен с обучением перцептрона Розен­блатта тем, что коррекция изначально произвольных значений весо-
46
вых коэффициентов
процессе обучения объекта. Коррекция производится с использовани-
производится для каждого предъявленного в
ем метода градиентного спуска, т.е. коррекция производится в направ­лении в пространстве коэффициентов
, где максимально снижается целевой функционал. В качестве целевого функционала используется функционал эмпирического риска с квадратичными потерями. При­нимается эффективный метод расчета градиента, основанный на ис­пользовании аналитических формул. Подробнее с методами обучения нейронных сетей можно ознакомиться в работах [4, 7].
4.3. Решающие деревья и леса
4.3.1. Решающие деревья
Структура решающих деревьев
. Решающие деревья воспроизво-
дят логические схемы, позволяющие получить окончательное реше­ние о классификации объекта с помощью ответов на иерархически организованную систему вопросов. Причем вопрос, задаваемый на последующем иерархическом уровне, зависит от ответа, полученного на предыдущем уровне. Подобные логические модели давно исполь­зуются в ботанике, зоологии, минералогии, медицине и других обла­стях. Пример структуры решающего дерева, позволяющего грубо оценить стоимость квадратного метра жилья в предполагаемом горо­де, приведен на рис. 4.5.
Схеме принятия решений (см. рис. 4.5) соответствует связный ори­ентированный ациклический граф – ориентированное дерево. Дерево включает в себя корневую вершину, инцидентную только выходящим ребрами, внутренние вершины, инцидентные одному входящему ребру и нескольким выходящим
, и листья – концевые вершины.
Каждой из вершин дерева, за исключением листьев, соответствует некоторый вопрос, подразумевающий несколько вариантов ответов, соответствующих выходящим ребрам. В зависимости от выбранного варианта ответа осуществляется переход к вершине следующего уровня. Концевым вершинам поставлены в соответствие метки, ука­зывающие на отнесение распознаваемого объекта к одному из клас-
Решающее дерево называется бинарным, если каждая внутрен-
сов. няя или корневая вершина инцидентна только двум выходящим реб­рам. Бинарные деревья удобно использовать в моделях машинного обучения.
47
Рис. 4.5. Структура решающего дерева, оценивающего стоимость
T
X
j
j
j
j
j
M
j
M
квадратного метра жилых помещений. Для простоты выделяются два
уровня стоимости – высокий и низкий
Распознавание с помощью решающих деревьев. Предположим,
что бинарное дерево описываемых набором признаков
T
рева
ставится в соответствие предикат, касающийся значения од-
ного из признаков. Непрерывному признаку
используется для распознавания объектов,
,,
1
. Каждой вершинеде-
X
n
соответствует пре-
X
дикат вида
""
X
бор одного из двух, выходящих из вершины зависимости от значения предиката. Категориальному признаку
принимающему значения из множества
в соответствие предикат вида
том дихотомического разбиения одного из двух выходящих из вершины
j
, где
– некоторый пороговый параметр. Вы-
ребер производится в
X

jj
{,, }
Ma a
1()
1
""
XM
jj
{, }
MM
, где
12

jj
множества
1
является элемен-
j
rj
, ставится
. Выбор
ребер производится в за-
висимости от значения предиката. Процесс распознавания заканчи­вается при достижении концевой вершины (листа). Объект относится классу согласно метке, поставленной в соответствие данному листу.
48
,
Обучение решающих деревьев. Рассмотрим задачу распознавания
X
L
P
g
с классами
,,
KK
1
водится по обучающей выборке
. Обучение алгоритма решающее дерево произ-
L
и включает в себя поиск опти-
S
t
мальных пороговых параметров или оптимальных дихотомических разбиений для признаков
,,
1
. При этом поиск производится
X
n
исходя из требования снижения среднего индекса неоднородности в выборках, порождаемых искомым дихотомическим разбиением обу-
чающей выборки извольной выборки
. Индекс неоднородности вычисляется для про-
S
t
, содержащей объекты из классов
S
,,
KK
1
.
При этом используется несколько видов индексов, включая:
– энтропийный индекс неоднородности;
– индекс Джини;
– индекс ошибочной классификации.
1) Энтропийный индекс неоднородности вычисляется по формуле
L
() ln( )
SPP

eii
i
1
,
– доля объектов класса в выборке
где
i
При этом принимается, что
принимает при равенстве долей классов. Наименьшее значе-
()eS
ние
достигается при принадлежности всех объектов одному
()eS
0ln(0) 0 . Наибольшее значение
.
S
классу.
2) Индекс Джини вычисляется по формуле
L
() 1
SP

2
.
i
1
i
3) Индекс ошибочной классификации вычисляется по формуле
() 1 max( )
SP

mi
{1, , }
iL
.
Нетрудно понять, что индексы 2 и 3 также достигают минималь­ного значения при принадлежности всех объектов обучающей вы­борке одному классу. Предположим, что в методе обучения исполь-
зуется индекс неоднородности
.
()S
Для оценки эффективности
*
49
X
разбиения обучающей выборки
l
S
ки ности в
r
S
и
t
используется уменьшение среднего индекса неоднород-
t
l
r
S
S
и
t
по отношению к
t
S
на непересекающиеся подвыбор-
t
S
. Данное уменьшение вычисляет-
t
ся по формуле
где
  
(,) () ( ) ( ),
SSPSPS     
ttltrt
** * *
l
P
P
и
являются долями
l
r
S
и
t
lr
r
S
в полной обучающей выборке
t
S
t
На первом этапе обучения бинарного решающего дерева находит­ся оптимальный предикат, соответствующий корневой вершине. С этой целью оптимальные разбиения строятся для каждого из призна­ков из набора
,,
1
значением индекса
. Выбирается признак
X
n
(,)
S
*
тимальным предикатом для
. Подвыбороки
t
, оцениваются с помощью критерия
X
i
max
S
t
с максимальным
X
i
max
l
r
и
, задаваемые оп-
S
t
остановки. В качестве критерия остановки может быть использован простейший критерий достижения полной однородности по одному
*
из классов. В случае если какая-нибудь из выборок
удовлетворяет
S
t
критерию остановки, то соответствующая вершина дерева объявля­ется концевой и для нее вычисляется метка класса. В случае если вы-
*
борка
не удовлетворяет критерию остановки, то формируется но-
S
t
вая внутренняя вершина, для которой процесс построения дерева
продолжается. Однако вместо обучающей выборки соответствующая вновь образованной внутренней вершине борка
, которая равна
S
*
. Для данной выборки производятся те же
S
t
используется
S
t
вы-
построения, которые на начальном этапе проводились для обучаю-
щей выборки
. Обучение может проводиться до тех пор, пока все
S
t
вновь построенные вершины не окажутся однородными по классам. Такое дерево может быть построено, когда обучающая выборка не содержит объектов с одним и тем же значениям каждого из призна­ков, принадлежащих разным классам. Однако абсолютная точность на обучающей выборке не всегда приводит к
высокой обобщающей
способности в результате эффекта переобучения.
Одним из способов достижения более высокой обобщающей спо­собности является использования критериев остановки, позволяю-
.
50
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]