Добавил:
okley
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:ML - Коротков (2 сем, мага) / Lecture_6
.pdf
Градиентный спуск должен с чего-то начинаться. На графике
показана случайно выбранная начальная точка.
Мы исследуем место, в котором находимся, и видим, в каком
направлении идет спуск.
Наклон кривой также обозначен на графике, и в данном случае
ему соответствует отрицательный градиент.
Мы хотим следовать в направлении вниз, поэтому движемся
вдоль оси x вправо. Таким образом, мы немного увеличиваем x.
Это первый шаг. Видно, что мы улучшили нашу позицию и
продвинулись ближе к фактическому минимуму.

Представим, что мы начали спуск с какого-то другого
yxy = (x -1)2 + 1
Положительный наклон
места, как показано на следующем графике

На этот раз наклон положителен, поэтому мы движемся влево,
т.е. немного уменьшаем x. И вновь вы видите, что мы улучшили
наше положение, приблизившись к фактическому минимуму.
Мы можем продолжать действовать в том же духе до тех
пор, пока изменения не станут настолько малыми, что мы
будем считать, что достигли минимума.

Необходимым усовершенствованием этого метода должно
быть изменение величины шагов во избежание перескока
через минимум, что приведет к бесконечным прыжкам вокруг
него.
Если мы будем уменьшать величину шага пропорционально
величине градиента, то по мере приближения к минимуму
будем совершать все более мелкие шаги. При этом мы
предполагаем, что чем ближе к минимуму, тем меньше наклон.
Для большинства гладких (непрерывно дифференцируемых)
функций такое предположение вполне приемлемо. Оно не
будет справедливым лишь по отношению к экзотическим
зигзагообразным функциям со взлетами и провалами в
точках, которые математики называют точками разрыва
Идея уменьшения величины шага по мере уменьшения
величины градиента, иллюстрируется графиком,
представленным на следующем слайде.

Положительный градиент означает, что мы должны
уменьшить x. Отрицательный градиент требует увеличения x.

Вся мощь этого метода по-настоящему проявляется в случае
функций, зависящих от многих параметров. Например,
вместо зависимости y от x мы можем иметь зависимость от a,
b, c, d, e и f. Вспомните, что функция выходного сигнала, а
вместе с ней и функция ошибки зависят от множества
весовых коэффициентов, которые часто исчисляются
сотнями.
Следующий график вновь иллюстрирует метод градиентного
спуска, но на этот раз применительно к более сложной
функции, зависящей от двух параметров. График такой
функции можно представить в трех измерениях, где высота
представляет значение функции.

Может ли метод градиентного спуска привести в другую
«долину», которая расположена справа? В действительности
этот вопрос можно обобщить: не приводит ли иногда метод
градиентного спуска в ложную «долину», которая не является
самой глубокой.

Выходной сигнал нейронной сети представляет собой сложную,
трудно поддающуюся описанию функцию со многими
параметрами, весовыми коэффициентами связей, которые
влияют на выходной сигнал.
Можем ли мы использовать метод градиентного спуска для
определения подходящих значений весов?
Функция выходного сигнала сама по себе не является функцией
ошибки. Но мы знаем, что можем легко превратить ее в
таковую, поскольку ошибка — это разность между целевыми
тренировочными значениями и фактическими выходными
значениями - tk - ok.
Взгляните на приведенную ниже таблицу с тренировочными
данными и фактическими значениями для трех выходных узлов
вместе с кандидатами на роль функции ошибок.

•
Первым кандидатом на роль функции ошибки является
простая разность значений. Это кажется вполне
разумным. Но если вы решите использовать сумму
ошибок по всем узлам в качестве общего показателя
того, насколько хорошо обучена сеть, то эта сумма
равна нулю!
•
В качестве второго кандидата возьмём абсолютную
величину разности. Но этот метод не получил
популярности, потому, что при этом наклон не является
непрерывной функцией вблизи минимума, что
затрудняет использование метода градиентного спуска.

Третий вариант заключается в том, чтобы использовать в
качестве меры ошибки квадрат разности
(целевое - фактическое)
Существует несколько причин, по которым третий вариант
предпочтительнее второго, включая следующие:
•
•
он упрощает вычисления, с помощью которых определяется
величина наклона для метода градиентного спуска;
функция ошибки является непрерывно гладкой, что
обеспечивает нормальную работу метода градиентного
2
спуска ввиду отсутствия провалов и скачков значений
функции;
•
А возможны ли другие варианты? Да, вы вправе
сконструировать любую сложную функцию, которую считаете
нужной.
по мере приближения к минимуму градиент уменьшается,
что означает снижение риска перескока через минимум,
если используется уменьшение величины шагов.
Соседние файлы в папке ML - Коротков (2 сем, мага)
