Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Основы мехатроники. Учебник для СПО

.pdf
Скачиваний:
3
Добавлен:
07.09.2026
Размер:
2 Мб
Скачать
☆
21
слойного перцептрона. В многослойных же сетях оптимальные выходные значения нейронов всех слоев, кроме последнего, как правило, не известны и двух- или трехслойный (или более) пер­цептрон уже невозможно обучить, руководствуясь только вели­чинами ошибок на выходах ИНС. Один из вариантов решения этой проблемы — разработка наборов выходных сигналов, со­ответствующих входным, для каждого слоя ИНС, что, конечно, является очень трудоемкой операцией и не всегда осуществимо. Второй вариант — динамическая подстройка весовых коэффи­циентов синапсов, в ходе которой выбираются, как правило, наиболее слабые связи и изменяются на малую величину в ту или иную сторону, и сохраняются только те изменения, которые по­влекли уменьшение ошибки на выходе всей сети. Третий, более приемлемый вариант — распространение сигналов ошибки от выходов ИНС к ее входам, в направлении, обратном прямому распространению сигналов в обычном режиме работы. Этот ал­горитм обучения ИНС получил название «процедура обратного распространения».
Согласно методу наименьших квадратов, минимизируемой целевой функцией ошибки НС является величина:
−=
pj
pj
N
pj
dywE
,
2
,
)(
,
)(
2
1
)(
, (1.1)
где
)(
,
N
pj
y
— реальное выходное состояние нейрона j выходного
слоя N нейронной сети при подаче на ее входы p-го образа; djp — идеальное (желаемое) выходное состояние этого нейрона.
Суммирование ведется по всем нейронам выходного слоя и по всем обрабатываемым сетью образам, а минимизация — ме­тодом градиентного спуска, что означает подстройку весовых коэффициентов следующим образом:
ij
n
ij
w
E
w
−=
)(
, (1.2)
где wij — весовой коэффициент синаптической связи, соединя­ющей i-й нейрон слоя n – 1 с j-м нейроном слоя n, — коэффи­циент скорости обучения, 0 < < 1.
22
ij
j
j
j
jij
w
s
ds
dy
y
E
w
E
=
— (1.3)
здесь под yj, как и раньше, подразумевается выход нейрона j, а под sj — взвешенная сумма его входных сигналов, то есть аргу­мент активационной функции. Так как множитель dyj/dsj является производной этой функции по ее аргументу, из этого следует, что производная активационной функции должна быть определена на всей оси абсцисс. В связи с этим функция единичного скачка и прочие активационные функции с неоднородностями не подхо­дят для рассматриваемых ИНС. В них применяются такие глад­кие функции, как гиперболический тангенс или классический сигмоид с экспонентой. В случае гиперболического тангенса
2
1 s
ds
dy
−=
. (1.4)
Третий множитель sj/wij, очевидно, равен выходу нейрона предыдущего слоя y
i
(n - 1)
.
Первый множитель в (1.3) легко раскладывается следующим образом:
)1( +
==
n
jk
k
k
k
k
k
j
k
k
k
kj
w
ds
dy
y
E
y
s
ds
dy
y
E
y
E
. (1.5)
Здесь суммирование по k выполняется среди нейронов слоя n + 1.
Новая переменная
j
j
j
n
j
ds
dy
y
E
=
)(
(1.6)
позволяет получить рекурсивную формулу для расчетов величин
j
(n)
слоя n из величин
k
(n + 1)
более старшего слоя n + 1:
j
j
k
n
jk
n
k
n
j
ds
dy
w
 
 
=
++ )1()1()(
(1.7)
Для выходного слоя:
l
l
l
N
l
N
l
ds
dy
dy −= )(
)()(
. (1.8)
Можно записать (1.2) в раскрытом виде:
23
)1()()( −
−=
n
i
n
j
n
ij
yw
(1.9)
Иногда для придания процессу коррекции весов некоторой инерционности, сглаживающей резкие скачки при перемещении по поверхности целевой функции, (1.9) дополняется значением изменения веса на предыдущей итерации:
))1()1(()(
)1()()()( −
−+−−=
n
i
n
j
n
ij
n
ij
ytwtw
, (1.10)
где — коэффициент инерционности, t — номер текущей итерации.
Таким образом, полный алгоритм обучения ИНС с помощью процедуры обратного распространения строится следующим образом.
1. Подать на входы сети один из возможных образов и в режиме обычного функционирования ИНС, когда сигналы рас­пространяются от входов к выходам, рассчитать значения по­следних. Напомним, что
=
−
=
M
i
n
ij
n
i
n
j
wys
0
)()1()(
, (1.11)
где M — число нейронов в слое n – 1 с учетом нейрона с посто­янным выходным состоянием +1, задающего смещение;
y
i
(n - 1)
=x
ij
(n)
— i-й вход нейрона j слоя n.
y
j
(n)
= f(s
j
(n)
), (1.12)
где f() — сигмоид.
y
q
(0)
= Iq, (1.13)
где I
q
— q-я компонента вектора входного образа.
2. Рассчитать (N) для выходного слоя по формуле (1.8).
Рассчитать по формуле (1.9) или (1.10) изменения весов
w(N) слоя N.
3. Рассчитать по формулам (1.7) и (1.9) (или (1.7) и (1.10)) со­ответственно (n) и w(n) для всех остальных слоев, n = N – 1, ... 1.
4. Скорректировать все веса в ИНС:
)()1()(
)()()(
twtwtw
n
ij
n
ij
n
ij
+−=
. (1.14)
5. Если ошибка сети существенна, перейти на шаг 1. В про­тивном случае — конец.
Сети на шаге 1 попеременно в случайном порядке предъяв-
ляются все тренировочные образы, чтобы сеть, образно говоря, не забывала одни по мере запоминания других.
24
На рис. 1.2 показана диаграмма сигналов в сети при обуче-
нии по алгоритму обратного распространения.
Из выражения (1.9) следует, что, когда выходное значение
y
i
(n – 1)
стремится к нулю, эффективность обучения заметно сни-
жается. При двоичных входных векторах в среднем половина весовых коэффициентов не будет корректироваться, поэтому область возможных значений выходов нейронов [0, 1] жела­тельно сдвинуть в пределы [–0,5, +0,5], что достигается простыми модификациями логистических функций. Например, сигмоид с экспонентой преобразуется к виду
x
e
xf
−
+
+−=
1
1
5,0)(
. (1.15)
Рис. 1.2. Диаграмма сигналов в сети при обучении по алгоритму
обратного распространения
Теперь коснемся вопроса емкости НС, то есть числа образов, предъявляемых на ее входы, которые она способна научиться распознавать. Для сетей с числом слоев больше двух он остается открытым. Для ИНС с двумя слоями, то есть выходным и одним скрытым слоем, детерминистская емкость сети Cd оценивается так:
Nw/Ny < Cd < Nw/Ny log(Nw/Ny), (1.16)
где N
w
— число подстраиваемых весов, Ny — число нейронов в
выходном слое.
25
Следует отметить, что данное выражение получено с учетом некоторых ограничений. Во-первых, число входов Nx и нейронов в скрытом слое N
h
должно удовлетворять неравенству Nx + Nh >
Ny. Во-вторых, Nw/Ny > 1 000. Однако вышеприведенная оценка
выполнялась для сетей с активационными функциями нейронов в виде порога, а емкость сетей с гладкими активационными функциями, например (1.15), обычно больше. Кроме того, фи­гурирующее в названии емкости прилагательное «детерминист­ский» означает, что полученная оценка емкости подходит абсо­лютно для всех возможных входных образов, которые могут быть представлены входами N
x
. В действительности распределение входных образов, как правило, обладает некоторой регулярно­стью, что позволяет ИНС проводить обобщение и таким образом увеличивать реальную емкость. Так как распределение образов, в общем случае, заранее не известно, мы можем говорить о такой емкости только предположительно, но обычно она раза в два превышает емкость детерминистскую.
Необходимо рассмотреть вопрос о емкости ИНС, о требуе­мой мощности выходного слоя сети, выполняющего оконча­тельную классификацию образов. Дело в том, что для разделения множества входных образов, например, по двум классам доста­точно всего одного выхода. При этом каждый логический уро­вень — «1» и «0» — будет обозначать отдельный класс. На двух выходах можно закодировать уже четыре класса и так далее. Однако результаты работы сети, организованной таким образом (можно сказать, под завязку), не очень надежны. Для повышения достоверности классификации желательно ввести избыточность путем выделения каждому классу одного нейрона в выходном слое или, что еще лучше, нескольких, каждый из которых обу­чается определять принадлежность образа к классу со своей степенью достоверности, например высокой, средней и низкой. Такие ИНС позволяют проводить классификацию входных об­разов, объединенных в нечеткие (размытые или пересекающиеся) множества. Это свойство приближает подобные сети к условиям реальной жизни.
Рассматриваемая ИНС имеет несколько «узких мест». Во-первых, в процессе обучения может возникнуть ситуация, когда большие положительные или отрицательные значения ве-
26
совых коэффициентов сместят рабочую точку на сигмоидах многих нейронов в область насыщения. Малые величины про­изводной от логистической функции приведут в соответствии с (1.7) и (1.8) к остановке обучения, что парализует ИНС. Во-вторых, применение метода градиентного спуска не гаран­тирует, что будет найден глобальный, а не локальный минимум целевой функции. Эта проблема связана с еще одной, а именно с выбором величины скорости обучения. Доказательство сходи­мости обучения в процессе обратного распространения основано на производных, то есть приращении весов, и, следовательно, скорость обучения должна быть бесконечно малой, однако в этом случае оно будет происходить неприемлемо медленно. С другой стороны, слишком большие коррекции весов могут привести к постоянной неустойчивости процесса обучения. Поэтому в ка­честве обычно выбирается число меньше 1, но не очень ма­ленькое, например 0,1. Оно может постепенно уменьшаться. Кроме того, для исключения случайных попаданий в локальные минимумы иногда, после того как значения весовых коэффици­ентов стабилизируются, кратковременно сильно увеличивают, чтобы начать градиентный спуск из новой точки. Если повторе­ние этой процедуры несколько раз приведет алгоритм в одно и то же состояние ИНС, можно более или менее уверенно сказать, что найден глобальный максимум, а не какой-то другой.
Существует множество спорных вопросов при проектиро­вании сетей: сколько слоев необходимо для данной задачи, сколько следует выбрать элементов в каждом слое, как сеть ста­нет реагировать на данные, не включенные в обучающую вы­борку (какова способность ИНС к обобщению), и какой размер обучающей выборки необходим для достижения хорошей спо­собности сети к обобщению.
Пример регулятора на основе нечетких нейронных сетей приведен в разделе 1.9.
1.5. Нечеткая логика
Методы нечеткой логики позволяют строить логи­ко-лингвистические модели, отражающие общую смысловую
27
постановку задачи, используя качественные представления, со­ответствующие «человеческим» способам рассуждений и при­нятия решений.
Рассмотрим основные понятия теории нечетких множеств. Пусть А — некоторое подмножество универсального множества Е, а х — элемент множества Е. В обычной (четкой) теории мно­жеств функция принадлежности элемента х подмножеству А
может принимать два значения:
)(x
A
= 1, если х А и
)(x
A
= 0, если х А. В теории нечетких множеств функция
принадлежности элемента х подмножеству А может принимать любые значения на отрезке [0, 1] то есть
)(x
A
[0, 1], при этом
подмножество А называют нечетким.
Рассмотрим пример.
Пусть Е = R1 — множество действительных чисел, тогда нечеткие множества — «низкий» (L), «средний» (M), «высокий» (H) — могут быть определены функциями принадлежности, приведенными на рис. 1.3.
Замечание. В виду сложившихся традиций в рассматривае­мой теории вместо термина «нечеткое подмножество» исполь­зуют «нечеткое множество».
Рис. 1.3. Функции принадлежности нечетких множеств:
«низкий» (L), «средний» (M), «высокий» (H)
Для определения вида функций принадлежности разрабо­таны различные экспертные методы. В ряде случаев используют типовые формы функций принадлежности, тогда методом экс­пертных оценок определяется тип функций принадлежности и их параметры.
Приведем некоторые типовые виды функций принадлежности.
28
Кусочно-линейные функции принадлежности могут описы­ваться уравнениями:
−
−−−
=
,,0
,,/1
)(
axпри
axприax
x
L
(1.17а)
−
=
,0,0
,0),(1
)(
xпри
xприx
x
Z
M
(1.17б)
−
=
.0,0
,0),(1
)(
xпри
xприx
x
Z
H
(1.17в)
На рис. 1.4 приведен вид графиков кусочно-линейных функций принадлежности: а) — (1.4б), б) — (1.4а), в) — (1.4в) соответственно, при
0=a
и
1=
.
Рис. 1.4. Кусочно-линейные функции принадлежности
Показательные (Пуассона) функции принадлежности опи­сываются уравнениями:
,)(
/
ax
L
ex
−−
=
(1.18а)
−
=
,0,0
,0),(1
)(
xпри
xприx
x
Z
M
(1.18б)
−
=
.0,0
,0),(1
)(
xпри
xприx
x
Z
H
(1.18в)
29
На рис. 1.5 приведен вид графиков показательных функций принадлежности: а) — (1.5б), б) — (1.5а), в) — (1.5в) соответ­ственно, при
0=a
и
1=
.
Рис. 1.5. Показательные функции принадлежности
Гауссовы функции принадлежности описываются уравне­ниями:
( )
,)(
/
2
ax
M
ex
−−
=
(1.19а)
−
=
,0,0
,0),(1
)(
xпри
xприx
x
Z
L
(1.19б)
−
=
.0,0
,0),(1
)(
xпри
xприx
x
Z
H
(1.19в)
На рис. 1.6 приведен вид графиков Гауссовых функций принадлежности: а) — (1.6б), б) — (1.6а) и в) — (1.6в) соответ­ственно, при
0=a
и
1=
.
Рис. 1.6. Гауссовы функции принадлежности
30
По аналогии с обычной теорией множеств в теории нечетких множеств вводятся логические операции над множествами.
Пусть А и В — нечеткие множества на универсальном множестве Е.
1. Равенство: А = В. А и В равны, если 
Ex
)(x
A
=
)(x
B
.
2. Дополнение (отрицание):
ВА =
.
Обычно принимают, что операция, осуществляемая над функцией принадлежности при нахождении дополнения
)(x
A
=
)(xn
, должна обладать свойствами:
1) n[0] = 1 и n[1] = 0;
2) n[•] — невозрастающая функция.
Чаще всего функция дополнения определяется следующим образом:
Ex
)(1)( xx
BA
−=
,
очевидно, в этом случае
BA =
и
AB =
.
3. Пересечение:
BA
— наибольшее нечеткое подмно-
жество, содержащее одновременно А и В.
Обычно функции принадлежности операции пересечения определяются в классе Т-норм, удовлетворяющих следующим свойствам:
1)
0)0,0( =T
;
AA
T
=)1,(
;
AA
T
=),1(
—
ограниченность;
2)
),(),(
DCBA
TT
, если
CA
и
DB
—
монотонность;
3)
),(),(
ABBA
TT
=
— коммутативность;
4)
)),,(()),(,(
CBACBA
TTTT
=
— ассоциативность.
Простейшие примеры операции пересечения:
);,min(
BAВА
=
(1.20)
;
BAВА
=
(1.21)
).1,0max( −+=
BAВА
(1.22)