Лекция7
.pdf
Теория и алгоритмы распознавания образов
Применение нейросетей в распознавании образов
Принцип действия элементов нейросети напоминает работу сенсоранейрона – нервной клетки мозга
Основные компоненты нейросети
•Множество простых процессоров (сенсоров)
•Структура связей
•Правило распространения сигналов
•Правило комбинирования входных сигналов
•Правило вычисления сигнала активности
•Правило обучения, корректирующее связи
Теория и алгоритмы распознавания образов
Применение нейросетей в распознавании образов
Структура связей нейросети
Основной тип модели – многополюсная сеть, упорядоченная по слоям, то есть ориентированный граф
Вход |
. |
. |
. |
. |
. |
Выход |
|
|
|||||
(источники) . |
. |
. . . . . |
. |
(стоки) |
||
|
. |
. |
. |
. |
. |
|
Скрытые слои
Структура связей задается матрицей весов W
В распознавании изображений матрица W обычно многомерная (тензор)
Сети глубокого обучения обычно имеют сложную иерархическую архитектуру
Теория и алгоритмы распознавания образов
Применение нейросетей в распознавании образов
Правило распространения сигналов в сети
определяет, каким образом происходит обновление состояния элементов сети
Элементы могут обновляться в определенном порядке или произвольно
Комбинирование сигналов на входе
Наиболее распространенный способ – взвешенная сумма
n
y j xi wij , i 1
yj – полная величина сигнала на входе j-го сенсора
xi – сигнал, исходящий от i-го сенсора предыдущего слоя wij – вес связи между i-м и j-м сенсорами
n – число задействованных связей
Используется также квадратичная мера
n
y j (wij xij )2 . i 1
Теория и алгоритмы распознавания образов
Применение нейросетей в распознавании образов
Правило вычисления сигнала активности (функции активации)
Линейные функции
|
|
|
n |
Сигнал на входе со сдвигом w0 |
y j |
w0 |
xi wij . |
|
|
|
i1 |
Сеть с такой функцией активности может быть сведена к однослойной
0, x 0
ReLU Re LU (x)
x, x 0
Чаще всего используется в сверточных сетях
Нелинейные функции
Сигмоидальная |
Гиперболический тангенс |
|||||
f ( y) |
1 |
. |
tanh(x) |
ex e x |
||
|
|
ex e x |
|
|||
1 e y |
||||||
В простейших конструкциях может использоваться «ступенька» (функция Хэвисайда) или строгая дизъюнкция
Теория и алгоритмы распознавания образов
Применение нейросетей в распознавании образов
Правило обучения, корректирующее связи
Целью обучения является минимизация ошибок распознавания
Метод наименьших квадратов
|
|
1 |
n |
|
E p |
|
(t j j )2 , |
||
2 |
||||
|
|
j 1 |
tj – требуемый выход j-го элемента, j – наблюдаемый выход
Ep - полная ошибка по всем предъявленным образам
При f ( y j ) y j w0 xi wij минимум Ep можно найти
i
методом градиентного спуска
Приращение весов должно происходить в направлении, противоположном направлению градиента ошибки
|
|
Может оказаться, что у функции E |
|
|
есть локальные минимумы, |
|
|
поэтому величину градиента ΔW в |
W |
|
процессе поиска глобального |
|
|
минимума необходимо |
|
E |
регулировать |
|
|
Теория и алгоритмы распознавания образов
Применение нейросетей в распознавании образов
Зависимость ошибки E от весов при произвольной функции активации
E |
|
E |
|
j |
|
y j |
||
|
|
|
|
|
|
|
|
|
w |
|
j |
|
y |
j |
|
w |
|
|
|
|
||||||
ij |
|
|
|
|
|
ij |
||
В соответствии с правилом градиента запишем корректирующее приращение j
|
|
|
E |
|
E j |
||
j |
|
|
|
|
|||
y j |
j |
|
y j |
||||
|
|
|
|
||||
|
|
|
|
|
|||
Так как yj – линейная функция, то |
y j |
xi |
Отсюда |
E |
j |
xi |
|
|
|
||||||
|
wij |
||||||
w |
|||||||
|
|
|
|
|
|||
|
ij |
|
|
|
|
|
Приращение веса wij тогда запишется так:
Правило Видроу-Хоффа |
- некоторая малая величина |
|
– норма обучения |
||
|
В последнее время норму обучения стали называть скоростью обучения
Осталось посмотреть, что собой представляет величина j
Теория и алгоритмы распознавания образов
Применение нейросетей в распознавании образов
Посмотрим, как выглядит приращение веса при сигмоидальной функции активности
|
|
|
|
|
|
|
|
|
|
|
|
|
1 |
n |
|
||
Если среднеквадратичная ошибка в p-м слое |
Ep |
(t j |
j )2 , |
||||||||||||||
2 |
|||||||||||||||||
|
|
тогда |
|
|
|
E |
|
(t j |
j ) |
|
|
j 1 |
|
||||
|
|
|
|
|
|
|
|
|
|
|
|
||||||
|
|
|
|
|
j |
|
|
|
|
|
|
||||||
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
||
Здесь tj - |
требуемое значение функции активации j-го элемента из слоя p |
||||||||||||||||
Так как |
j f (y j ) |
, то |
j |
|
f '(y j ) |
|
|
Отсюда |
|
E |
|
(t j |
j ) f '( y j )xi |
||||
|
|
|
|
|
|
||||||||||||
y j |
|
|
|
w |
|
||||||||||||
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|||
|
|
|
|
|
|
|
|
|
|
|
|
ij |
|
|
|
|
|
|
Если |
f ( y) |
|
|
1 |
|
, то |
f '( y j ) f ( y j )[1 f ( y j )] |
|||||||||
|
|
|
|
|
|
||||||||||||
|
1 |
e y |
|
||||||||||||||
|
|
|
|
|
|
|
|
|
|
|
|
|
|||||
E |
|
|
x |
|
|
wij |
j |
i |
|||
|
|
||||
|
|
|
|
E |
(t |
j |
|
j |
) f ( y |
j |
)[1 f ( y |
j |
)]x |
( |
j |
t |
j |
) f ( y |
j |
)[1 f ( y |
j |
)]x |
wij |
|
|
|
|
i |
|
|
|
|
i |
||||||||
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
j |
|
|
|
|
|
|
|
|
|
|
|
|
|
Окончательное выражение для приращения весов при сигмоидальной функции активации
wij ( j t j ) f ( y j )[1 f ( y j )]xi
Теория и алгоритмы распознавания образов
Применение нейросетей в распознавании образов
Алгоритм обратного распространения ошибок
Вычисление решения |
Вычисление ошибки |
|
|
|
p-1 |
p |
|
|
|
|
|
|
i |
|
|
|
|
|
Вход |
. |
. |
j. |
|
. |
. |
Выход |
. |
. |
. |
. . . |
. |
. |
|
|
|
. |
. |
. |
. |
. |
|
|
|
|
|
Ошибка как функция весов
Рассмотрим произвольный j-й элемент слоя p
xi – сигнал, исходящий от i-го элемента p-1-го слоя (его функция активации) wij - вес связи между i-м элементом p-1-го слоя и j-м элементом p-го слоя
w0 - «порог возбуждения» или смещение – соответствует единичной функции активации yj - сигнал на входе j-го элемента p-го слоя
y j w0 xi wij
i
Сигмоидальная функция активации j-го элемента j=f(yj)
Теория и алгоритмы распознавания образов
Применение нейросетей в распознавании образов
Схема алгоритма обратного распространения ошибок
Шаг 0. Задаем малые начальные веса в интервале (-0.3,+0.3), кроме нормы обучения(обычно <1), используется еще один параметр: инерционный член
Шаг 1. Прямой проход (от входа к выходу) |
|
|
|
||||
Для каждого j-го элемента слоев p=1,…P рассчитываем значения на входе y j |
w0 xi wij |
||||||
|
|
|
|
|
|
|
i |
и функции активности j |
|
|
1 |
|
|
|
|
|
|
|
|
|
|
||
|
exp( yi ) |
|
|
|
|||
|
1 |
|
|
|
|||
Шаг 2. Значения j=yj на выходе сравниваем с ожидаемыми значениями. |
|
||||||
Если значения совпадают, то предъявляем следующий образ |
|
|
|||||
Если нет, то переходим к шагу 3 |
|
|
|
||||
Шаг 3. Вычисляем ошибку для элементов последнего скрытого слоя P-1: |
|
||||||
j j (1 j ) k wkj |
Здесь k – индексы P-1-го слоя |
|
|
||||
k |
|
|
|
|
|
|
|
Повторяем эту операцию для всех слоев от P-2 до 1 |
|
|
|||||
Шаг 4. Прямой проход по сети |
|
|
|
||||
Для всех слоев обновляем веса по правилу |
wij (n 1) j j |
wij |
(n) |
||||
Здесь n обозначает номер итерации обучения
Теория и алгоритмы распознавания образов
Применение нейросетей в распознавании образов
Сети с радиальными базисными функциями
Простейший вариант - 3 слоя: вход - скрытый слой - выход
|
|
|
|
|
|
|
|
|
n |
|
|
|
|
rj |
|
|
|
|
|
(xi wij ) |
2 |
|
|||
|
|
|
|
|
||||||||
Комбинированный вход для j-го элемента |
|
x |
wj |
|
|
|
|
|
||||
|
|
|
|
|
|
|
|
|
i 1 |
|
|
|
|
n – число элементов во входном слое |
|
||||||||||
|
(r) e r 2 , |
|
|
|||||||||
Распространенные функции активности скрытого слоя: |
(r) |
c2 r 2 |
||||||||||
|
|
|
|
|
|
|
|
|
|
(с – константа) |
||
Пример: самоорганизующиеся карты Кохонена (кластеризация образов)
Фактически каждое подмножество весов wi соответствует координатам центра i-го кластера
Предварительно выбирается радиус R, в пределах которого веса должны обновляться
Вход: вектор-образ x |
|
Шаг 1. Для каждого кластера (элемента на выходе) вычисляем величину d j (wij |
xi )2 |
i |
|
Шаг 2. Выбор элемента-победителя. Победителем считается тот элемент (кластер) |
|
выходного слоя, к которому поданный на вход образ оказался ближе всего |
|
Шаг 3. Коррекция весов. Для элемента-победителя вес корректируется так, чтобы он |
|
оказался еще ближе к образу: wij (n 1) wij (n) (n)[xi wij (n)] |
|
Шаг 4. Обновление всех элементов, попавших в окрестность элемента-победителя радиуса
R в порядке возрастания расстояния до элемента-победителя
