Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Основы мехатроники. Учебник для СПО
.pdf
21
слойного перцептрона. В многослойных же сетях оптимальные
выходные значения нейронов всех слоев, кроме последнего, как
правило, не известны и двух- или трехслойный (или более) перцептрон уже невозможно обучить, руководствуясь только величинами ошибок на выходах ИНС. Один из вариантов решения
этой проблемы — разработка наборов выходных сигналов, соответствующих входным, для каждого слоя ИНС, что, конечно,
является очень трудоемкой операцией и не всегда осуществимо.
Второй вариант — динамическая подстройка весовых коэффициентов синапсов, в ходе которой выбираются, как правило,
наиболее слабые связи и изменяются на малую величину в ту или
иную сторону, и сохраняются только те изменения, которые повлекли уменьшение ошибки на выходе всей сети. Третий, более
приемлемый вариант — распространение сигналов ошибки от
выходов ИНС к ее входам, в направлении, обратном прямому
распространению сигналов в обычном режиме работы. Этот алгоритм обучения ИНС получил название «процедура обратного
распространения».
Согласно методу наименьших квадратов, минимизируемой
целевой функцией ошибки НС является величина:
−=
pj
pj
N
pj
dywE
,
2
,
)(
,
)(
2
1
)(
, (1.1)
где
)(
,
N
pj
y
— реальное выходное состояние нейрона j выходного
слоя N нейронной сети при подаче на ее входы p-го образа;
djp — идеальное (желаемое) выходное состояние этого нейрона.
Суммирование ведется по всем нейронам выходного слоя и
по всем обрабатываемым сетью образам, а минимизация — методом градиентного спуска, что означает подстройку весовых
коэффициентов следующим образом:
ij
n
ij
w
E
w
−=
)(
, (1.2)
где wij — весовой коэффициент синаптической связи, соединяющей i-й нейрон слоя n – 1 с j-м нейроном слоя n, — коэффициент скорости обучения, 0 < < 1.

22
ij
j
j
j
jij
w
s
ds
dy
y
E
w
E
=
— (1.3)
здесь под yj, как и раньше, подразумевается выход нейрона j, а
под sj — взвешенная сумма его входных сигналов, то есть аргумент активационной функции. Так как множитель dyj/dsj является
производной этой функции по ее аргументу, из этого следует, что
производная активационной функции должна быть определена на
всей оси абсцисс. В связи с этим функция единичного скачка и
прочие активационные функции с неоднородностями не подходят для рассматриваемых ИНС. В них применяются такие гладкие функции, как гиперболический тангенс или классический
сигмоид с экспонентой. В случае гиперболического тангенса
2
1 s
ds
dy
−=
. (1.4)
Третий множитель sj/wij, очевидно, равен выходу нейрона
предыдущего слоя y
i
(n - 1)
.
Первый множитель в (1.3) легко раскладывается следующим
образом:
)1( +
==
n
jk
k
k
k
k
k
j
k
k
k
kj
w
ds
dy
y
E
y
s
ds
dy
y
E
y
E
. (1.5)
Здесь суммирование по k выполняется среди нейронов слоя n + 1.
Новая переменная
j
j
j
n
j
ds
dy
y
E
=
)(
(1.6)
позволяет получить рекурсивную формулу для расчетов величин
j
(n)
слоя n из величин
k
(n + 1)
более старшего слоя n + 1:
j
j
k
n
jk
n
k
n
j
ds
dy
w
=
++ )1()1()(
(1.7)
Для выходного слоя:
l
l
l
N
l
N
l
ds
dy
dy −= )(
)()(
. (1.8)
Можно записать (1.2) в раскрытом виде:

23
)1()()( −
−=
n
i
n
j
n
ij
yw
(1.9)
Иногда для придания процессу коррекции весов некоторой
инерционности, сглаживающей резкие скачки при перемещении
по поверхности целевой функции, (1.9) дополняется значением
изменения веса на предыдущей итерации:
))1()1(()(
)1()()()( −
−+−−=
n
i
n
j
n
ij
n
ij
ytwtw
, (1.10)
где — коэффициент инерционности, t — номер текущей
итерации.
Таким образом, полный алгоритм обучения ИНС с помощью
процедуры обратного распространения строится следующим
образом.
1. Подать на входы сети один из возможных образов и в
режиме обычного функционирования ИНС, когда сигналы распространяются от входов к выходам, рассчитать значения последних. Напомним, что
=
−
=
M
i
n
ij
n
i
n
j
wys
0
)()1()(
, (1.11)
где M — число нейронов в слое n – 1 с учетом нейрона с постоянным выходным состоянием +1, задающего смещение;
y
i
(n - 1)
=x
ij
(n)
— i-й вход нейрона j слоя n.
y
j
(n)
= f(s
j
(n)
), (1.12)
где f() — сигмоид.
y
q
(0)
= Iq, (1.13)
где I
q
— q-я компонента вектора входного образа.
2. Рассчитать (N) для выходного слоя по формуле (1.8).
Рассчитать по формуле (1.9) или (1.10) изменения весов
w(N) слоя N.
3. Рассчитать по формулам (1.7) и (1.9) (или (1.7) и (1.10)) соответственно (n) и w(n) для всех остальных слоев, n = N – 1, ... 1.
4. Скорректировать все веса в ИНС:
)()1()(
)()()(
twtwtw
n
ij
n
ij
n
ij
+−=
. (1.14)
5. Если ошибка сети существенна, перейти на шаг 1. В противном случае — конец.
Сети на шаге 1 попеременно в случайном порядке предъяв-
ляются все тренировочные образы, чтобы сеть, образно говоря,
не забывала одни по мере запоминания других.

24
На рис. 1.2 показана диаграмма сигналов в сети при обуче-
нии по алгоритму обратного распространения.
Из выражения (1.9) следует, что, когда выходное значение
y
i
(n – 1)
стремится к нулю, эффективность обучения заметно сни-
жается. При двоичных входных векторах в среднем половина
весовых коэффициентов не будет корректироваться, поэтому
область возможных значений выходов нейронов [0, 1] желательно сдвинуть в пределы [–0,5, +0,5], что достигается простыми
модификациями логистических функций. Например, сигмоид с
экспонентой преобразуется к виду
x
e
xf
−
+
+−=
1
1
5,0)(
. (1.15)
Рис. 1.2. Диаграмма сигналов в сети при обучении по алгоритму
обратного распространения
Теперь коснемся вопроса емкости НС, то есть числа образов,
предъявляемых на ее входы, которые она способна научиться
распознавать. Для сетей с числом слоев больше двух он остается
открытым. Для ИНС с двумя слоями, то есть выходным и одним
скрытым слоем, детерминистская емкость сети Cd оценивается
так:
Nw/Ny < Cd < Nw/Ny log(Nw/Ny), (1.16)
где N
w
— число подстраиваемых весов, Ny — число нейронов в
выходном слое.

25
Следует отметить, что данное выражение получено с учетом
некоторых ограничений. Во-первых, число входов Nx и нейронов
в скрытом слое N
h
должно удовлетворять неравенству Nx + Nh >
Ny. Во-вторых, Nw/Ny > 1 000. Однако вышеприведенная оценка
выполнялась для сетей с активационными функциями нейронов в
виде порога, а емкость сетей с гладкими активационными
функциями, например (1.15), обычно больше. Кроме того, фигурирующее в названии емкости прилагательное «детерминистский» означает, что полученная оценка емкости подходит абсолютно для всех возможных входных образов, которые могут быть
представлены входами N
x
. В действительности распределение
входных образов, как правило, обладает некоторой регулярностью, что позволяет ИНС проводить обобщение и таким образом
увеличивать реальную емкость. Так как распределение образов, в
общем случае, заранее не известно, мы можем говорить о такой
емкости только предположительно, но обычно она раза в два
превышает емкость детерминистскую.
Необходимо рассмотреть вопрос о емкости ИНС, о требуемой мощности выходного слоя сети, выполняющего окончательную классификацию образов. Дело в том, что для разделения
множества входных образов, например, по двум классам достаточно всего одного выхода. При этом каждый логический уровень — «1» и «0» — будет обозначать отдельный класс. На двух
выходах можно закодировать уже четыре класса и так далее.
Однако результаты работы сети, организованной таким образом
(можно сказать, под завязку), не очень надежны. Для повышения
достоверности классификации желательно ввести избыточность
путем выделения каждому классу одного нейрона в выходном
слое или, что еще лучше, нескольких, каждый из которых обучается определять принадлежность образа к классу со своей
степенью достоверности, например высокой, средней и низкой.
Такие ИНС позволяют проводить классификацию входных образов, объединенных в нечеткие (размытые или пересекающиеся)
множества. Это свойство приближает подобные сети к условиям
реальной жизни.
Рассматриваемая ИНС имеет несколько «узких мест».
Во-первых, в процессе обучения может возникнуть ситуация,
когда большие положительные или отрицательные значения ве-

26
совых коэффициентов сместят рабочую точку на сигмоидах
многих нейронов в область насыщения. Малые величины производной от логистической функции приведут в соответствии с
(1.7) и (1.8) к остановке обучения, что парализует ИНС.
Во-вторых, применение метода градиентного спуска не гарантирует, что будет найден глобальный, а не локальный минимум
целевой функции. Эта проблема связана с еще одной, а именно с
выбором величины скорости обучения. Доказательство сходимости обучения в процессе обратного распространения основано
на производных, то есть приращении весов, и, следовательно,
скорость обучения должна быть бесконечно малой, однако в этом
случае оно будет происходить неприемлемо медленно. С другой
стороны, слишком большие коррекции весов могут привести к
постоянной неустойчивости процесса обучения. Поэтому в качестве обычно выбирается число меньше 1, но не очень маленькое, например 0,1. Оно может постепенно уменьшаться.
Кроме того, для исключения случайных попаданий в локальные
минимумы иногда, после того как значения весовых коэффициентов стабилизируются, кратковременно сильно увеличивают,
чтобы начать градиентный спуск из новой точки. Если повторение этой процедуры несколько раз приведет алгоритм в одно и то
же состояние ИНС, можно более или менее уверенно сказать, что
найден глобальный максимум, а не какой-то другой.
Существует множество спорных вопросов при проектировании сетей: сколько слоев необходимо для данной задачи,
сколько следует выбрать элементов в каждом слое, как сеть станет реагировать на данные, не включенные в обучающую выборку (какова способность ИНС к обобщению), и какой размер
обучающей выборки необходим для достижения хорошей способности сети к обобщению.
Пример регулятора на основе нечетких нейронных сетей
приведен в разделе 1.9.
1.5. Нечеткая логика
Методы нечеткой логики позволяют строить логико-лингвистические модели, отражающие общую смысловую

27
постановку задачи, используя качественные представления, соответствующие «человеческим» способам рассуждений и принятия решений.
Рассмотрим основные понятия теории нечетких множеств.
Пусть А — некоторое подмножество универсального множества
Е, а х — элемент множества Е. В обычной (четкой) теории множеств функция принадлежности элемента х подмножеству А
может принимать два значения:
)(x
A
= 1, если х А и
)(x
A
= 0, если х А. В теории нечетких множеств функция
принадлежности элемента х подмножеству А может принимать
любые значения на отрезке [0, 1] то есть
)(x
A
[0, 1], при этом
подмножество А называют нечетким.
Рассмотрим пример.
Пусть Е = R1 — множество действительных чисел, тогда
нечеткие множества — «низкий» (L), «средний» (M), «высокий»
(H) — могут быть определены функциями принадлежности,
приведенными на рис. 1.3.
Замечание. В виду сложившихся традиций в рассматриваемой теории вместо термина «нечеткое подмножество» используют «нечеткое множество».
Рис. 1.3. Функции принадлежности нечетких множеств:
«низкий» (L), «средний» (M), «высокий» (H)
Для определения вида функций принадлежности разработаны различные экспертные методы. В ряде случаев используют
типовые формы функций принадлежности, тогда методом экспертных оценок определяется тип функций принадлежности и их
параметры.
Приведем некоторые типовые виды функций принадлежности.

28
Кусочно-линейные функции принадлежности могут описываться уравнениями:
−
−−−
=
,,0
,,/1
)(
axпри
axприax
x
L
(1.17а)
−
=
,0,0
,0),(1
)(
xпри
xприx
x
Z
M
(1.17б)
−
=
.0,0
,0),(1
)(
xпри
xприx
x
Z
H
(1.17в)
На рис. 1.4 приведен вид графиков кусочно-линейных
функций принадлежности: а) — (1.4б), б) — (1.4а), в) — (1.4в)
соответственно, при
0=a
и
1=
.
Рис. 1.4. Кусочно-линейные функции принадлежности
Показательные (Пуассона) функции принадлежности описываются уравнениями:
,)(
/
ax
L
ex
−−
=
(1.18а)
−
=
,0,0
,0),(1
)(
xпри
xприx
x
Z
M
(1.18б)
−
=
.0,0
,0),(1
)(
xпри
xприx
x
Z
H
(1.18в)

29
На рис. 1.5 приведен вид графиков показательных функций
принадлежности: а) — (1.5б), б) — (1.5а), в) — (1.5в) соответственно, при
0=a
и
1=
.
Рис. 1.5. Показательные функции принадлежности
Гауссовы функции принадлежности описываются уравнениями:
( )
,)(
/
2
ax
M
ex
−−
=
(1.19а)
−
=
,0,0
,0),(1
)(
xпри
xприx
x
Z
L
(1.19б)
−
=
.0,0
,0),(1
)(
xпри
xприx
x
Z
H
(1.19в)
На рис. 1.6 приведен вид графиков Гауссовых функций
принадлежности: а) — (1.6б), б) — (1.6а) и в) — (1.6в) соответственно, при
0=a
и
1=
.
Рис. 1.6. Гауссовы функции принадлежности

30
По аналогии с обычной теорией множеств в теории нечетких
множеств вводятся логические операции над множествами.
Пусть А и В — нечеткие множества на универсальном
множестве Е.
1. Равенство: А = В. А и В равны, если
Ex
)(x
A
=
)(x
B
.
2. Дополнение (отрицание):
ВА =
.
Обычно принимают, что операция, осуществляемая над
функцией принадлежности при нахождении дополнения
)(x
A
=
)(xn
, должна обладать свойствами:
1) n[0] = 1 и n[1] = 0;
2) n[•] — невозрастающая функция.
Чаще всего функция дополнения определяется следующим
образом:
Ex
)(1)( xx
BA
−=
,
очевидно, в этом случае
BA =
и
AB =
.
3. Пересечение:
BA
— наибольшее нечеткое подмно-
жество, содержащее одновременно А и В.
Обычно функции принадлежности операции пересечения
определяются в классе Т-норм, удовлетворяющих следующим
свойствам:
1)
0)0,0( =T
;
AA
T
=)1,(
;
AA
T
=),1(
—
ограниченность;
2)
),(),(
DCBA
TT
, если
CA
и
DB
—
монотонность;
3)
),(),(
ABBA
TT
=
— коммутативность;
4)
)),,(()),(,(
CBACBA
TTTT
=
— ассоциативность.
Простейшие примеры операции пересечения:
);,min(
BAВА
=
(1.20)
;
BAВА
=
(1.21)
).1,0max( −+=
BAВА
(1.22)
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
