- •Нейрокомпьютинг
- •Как мозг обрабатывает информацию Из чего построен мозг
- •Структура и функции мозга
- •Восприятие
- •Мышление
- •Мозг, компьютеры и нейрокомпьютеры Право-лево-полушарный симбиоз
- •Встречная эволюция мозга и компьютеров
- •Эволюция компьютеров: от вычислений - к распознаванию образов Первые компьютеры: супер-калькуляторы
- •От символов - к образам
- •От вычислений - к обработке символов
- •Символы и образы, алгоритмы и обучение Трудности современной схемотехники
- •Специфика образной информации
- •Нейрокомпьютеры
- •Вездесущие умные нейрочипы
- •Операционные системы будущего
- •Современные нейрокомпьютеры Элементная база нейрокомпьютеров
- •Сравнение стоимости обычных и нейро-вычислений
- •Преимущества нейро-эмуляторов
- •Готовые нейро-пакеты
- •Инструменты разработки нейроприложений
- •Готовые решения на основе нейросетей
- •Нейросетевой консалтинг
- •Рынок нейропродукции
- •Какие задачи решают нейросети
- •Где применяются нейросети
- •Парадигмы нейрокомпьютинга Что такое парадигмы
- •Коннекционизм
- •Локальность и параллелизм вычислений
- •Программирование: обучение, основанное на данных
- •Универсальность обучающих алгоритмов
- •Классификация базовых нейроархитектур Типы обучения нейросети
- •Архитектура связей
- •Классификация по типу связей и типу обучения (Encoding-Decoding)
- •Нейрон - классификатор
- •Выбор функции активации
- •Двухслойные персептроны
- •Персептрон Розенблатта
- •Байесовский подход
- •Принцип максимального правдоподобия (maximum likelihood)
- •Принцип минимальной длины описания (minimum description length)
- •Градиентное обучение
- •Метод обратного распространения ошибки
- •Эффективность алгоритма back-propagation
- •Использование алгоритма back-propagation
- •Вычислительная сложность обучения
- •Ошибка аппроксимации
- •Переобучение
- •Ошибка, связанная со сложностью модели
- •Оптимизация размера сети
- •Валидация обучения
- •Ранняя остановка обучения
- •Прореживание связей
- •Конструктивные алгоритмы
- •Постановка задачи
- •Правило обучения Хебба
- •Правило обучения Ойа
- •Постановка задачи
- •Необходимость взаимодействия нейронов
- •Самообучающийся слой
- •Сравнение с традиционным статистическим анализом
- •Нелинейный анализ главных компонент Целевая функция
- •Автоассоциативные сети
- •Предикторы
- •Латеральные связи
- •Победитель забирает все
- •Алгоритм обучения соревновательного слоя нейронов
- •Кластеризация и квантование
- •Оценка вычислительной сложности обучения
- •Победитель забирает не все
- •Алгоритм Кохонена
- •Аппроксиматоры с локальным базисом
- •Гибридное обучение
- •Симметричность связей
- •Асинхронная динамика
- •Метрика пространства состоянний
- •Энергия состояния
- •Ассоциативная память
- •Обучение сети. Правило Хебба
- •Выделение сигнала из шума
- •Минимальный базис
- •Пример: поиск промоторов в днк
- •Активная кластеризация
- •Анализ голосований
- •Генетические алгоритмы
- •Метод муравьиных колоний
- •Максимизация энтропии как цель предобработки
- •Типы нечисловых переменных
- •Кодирование ординальных переменных
- •Кодирование категориальных переменных
- •Отличие между входными и выходными переменными
- •Индивидуальная нормировка данных
- •Совместная нормировка: выбеливание входов
- •Понижение размерности входов методом главных компонент
- •Восстановление пропущенных компонент данных
- •Понижение размерности входов с помощью нейросетей
- •Квантование входов
- •Линейная значимость входов
- •Нелинейная значимость входов. Box-counting алгоритмы
- •Последовательное добавление наиболее значимых входов
- •Формирование признакого пространства методом ортогонализации
- •Формирование оптимального пространства признаков
- •Кому нужно предсказывать рынок?
- •Можно ли предсказывать рынок?
- •Технический анализ и нейронные сети
- •Метод погружения. Теорема Такенса
- •Эмпирические свидетельства предсказуемости финансовых рядов
- •Формирование входного пространства признаков
- •Выбор функционала ошибки
- •Обучение нейросетей
- •Способы погружения временного ряда
- •Понижение размерности входов: признаки
- •Метод искусственных примеров (hints)
- •Связь предсказуемости с нормой прибыли
- •Выбор функционала ошибки
- •Обучение нейронной сети
- •Прореживание нейронной сети
- •Извлечение правил
- •Исправление данных
- •Рейтинг корпоративных облигаций
- •Оценка акций
- •Исторические корни
- •Нейросетевое предсказание банкротств
- •Обсуждение
- •Постановка задачи
- •Данные о российских банках
- •Сечения
- •Линейное сжатие информации - метод главных компонент
- •Нелинейное сжатие информации - карты Кохонена
- •Расположение на карте банков с отозванной лицензией
- •Раскраски карты Кохонена
- •Карта размеров банков
- •Балансовые показатели
- •Обсуждение
- •Являются ли нейронные сети языком описания?
- •В чем различие нейронных сетей и статистики?
- •Что лучше, статистические методы или нейронные сети?
- •Почему статистики ревнуют специалистов по нейронным сетям, а не наоборот?
- •Перекрестное опыление.
- •Практические выводы
- •Сети интервальных нейронов
- •Элементы нечеткой логики
- •Нечеткие нейроны
- •Извлечение правил if-then
- •Адаптация функций принадлежности
- •Стохастические нейроны
- •Приближение среднего поля
- •Фазовые переходы
- •Сеть Хопфилда с Хеббовскими связями
Персептрон Розенблатта
Исторически, первые персептроны, предложенные Фрэнком Розенблаттом в 1958 г., имели два слоя нейронов. Однако, собственно обучающимся был лишь один, последний слой. Первый (скрытый) слой состоял из нейронов с фиксированными случайными весами. Эти, по терминологии Розенблатта - ассоциирующие, нейроны получали сигналы от случайно выбранных точек рецепторного поля. Именно в этом признаковом пространстве персептрон осуществлял линейную дискриминацию подаваемых на вход образов.
Результаты своих исследований Розенблатт изложил в книге "Принципы нейродинамики: Персептроны и теория механизмов мозга". Уже из самого названия чувствуется какое большое значение придавалось этому относительно простому обучающемуся устройству. Однако, многочисленные эксперименты показали неровный характер обучаемости персептронов. Некоторые задачи решались относительно легко, тогда как другие - вообще не поддавались обучению. В отсутствие теории объяснить эти эксперименты и определить перспективы практического использования персептронов было невозможно.
Подобного рода теория появилась к 1969г. с выходом в свет книги Марвина Минского и Сеймура Пейперта "Персептроны". Минский и Пейперт показали, что если элементы скрытого слоя фиксированы, их количество либо их сложность экспоненциально возрастает с ростом размерности задачи (числа рецепторов). Тем самым, теряется их основное преимущество - способность решать задачи произвольной сложности при помощи простых элементов.
Реальный же выход состоял в том, чтобы использовать адаптивные элементы на скрытом слое, т.е. подбирать веса и первого и второго слоев. Однако в то время этого делать не умели. Каким же образом находить синаптические веса сети, дающие оптимальную классификацию входных векторов?
Основы индуктивного метода
Прежде чем ответить на этот вопрос, следует задать критерий оптимальности. Поскольку нейросети осуществляют статистическую обработку данных, нам следует обратиться к основам математической статистики - индуктивному методу.
Байесовский подход
Основная проблема статистики - обобщение эмпирических данных. В формализованном виде задача состоит в выборе наилучшей модели (гипотезы, объясняющей наблюдаемые данные) из некоторого доступного множества. Для решения этой задачи надо уметь оценивать степень достоверности той или иной гипотезы. Математическая формулировка этого подхода содержится в знаменитой теореме Байеса.
Обозначим
весь набор имеющихся данных
,
а гипотезы, объясняющие эти данные (в
нашем случае - нейросети), как
.
Предполагается, что каждая такая гипотеза
объясняет данные с большей или меньшей
степенью вероятности
.
Теорема Байеса дает решение обратной
задачи - определить степень достоверности
гипотез
,
исходя из их успехов в объяснении данных.
Согласно этой теореме, достоверность
гипотезы пропорциональна ее успеху, а
также ее априорной
вероятности,
,
известной из других соображений, не
относящихся к данной серии наблюдений:
.
В этом современном виде теорема Байеса была на самом деле сформулирована Лапласом. Томасу Байесу принадлежит сама постановка задачи. Он сформулировал ее как обратную известной задаче Бернулли. Если Бернулли искал вероятность различных исходов бросания "кривой" монеты, то Байес, наоборот, стремился определить степень этой "кривизны" по эмпирически наблюдаемым исходам бросания монеты. В его решении отсутствовала априорная вероятность.
Наилучшая модель определяется максимизацией или ее логарифма, что дает один и тот же результат в силу монотонности логарифмической функции. Логарифмы удобны тем, что произведение вероятностей независимых событий они переводят в сумму их логарифмов:
. (1)
(Знаменатель не зависит от модели и не влияет на выбор лучшей.)
Выписанная выше формула является базовой для понимания основ обучения нейросетей, т.к. она задает критерий оптимальности обучения, к которому надо стремиться. Мы еще неоднократно вернемся к ней на протяжении этой главы. Обсудим, прежде всего значение обоих членов в правой части полученного выражения.
