Обучение с учителем. Классификация
Задача классификации – распределение некоторого множества объектов по заданному множеству групп (классов). При этом есть некоторое подмножество объектов, для которых распределение по классам известно, классовая принадлежность остальных – неизвестна.
Классификация:
–Значения y дискретны (принимают несколько заранее определённых значений, классов)
–Альтернативная постановка: предсказать вероятности определённых классов
–Пример: предсказание состояния хроматина, сайта связывания TF, растворимости химического вещества, пола, спам/не спам, вероятность ухода сотрудника/клиента
Классификация: Популярные методы
●Логистическая регрессия
●Машина опорных векторов (Support vector machine, SVM)
●Наивный Байес
●Деревья решений
●Нейросети
●Ансамбли (Random Forests, Gradient Boosted Trees)
●k-NN
11
Обучение с учителем. Регрессия
Задача регрессии
Задача регрессии – приближение неизвестной целевой зависимости на некотором множестве данных. То есть решить задачу регрессии – значит найти алгоритм, обладающий способностью к обобщению эмпирических фактов (способностью к выводу общих знаний из частных
наблюдений, прецедентов).
Регрессия: Примеры
●Прогнозирование уровня экспрессии гена;
●Предсказание цены дома по его характеристикам;
●Предсказание спроса на товар на ближайший месяц;
●Предсказание уровня воды в водохранилище;
●Предсказание температуры воздуха.
Регрессия: Методы
●Линейная регрессия (в том числе множественная);
●Регрессионные деревья;
●Регрессия через SVM;
●Нейросети;
●и т.п.
12
Обучение с учителем. Ранжирование
Задача ранжирования
Задача регрессии — это класс задач машинного обучения с учителем, заключающихся в автоматическом подборе ранжирующей модели по обучающей выборке, состоящей из множества списков и заданных частичных порядков на элементах внутри каждого списка.
Методы ранжирования
Всего выделяют три подхода к решению задачи ранжирования:
•поточечный (англ. pointwise),
•попарный (англ. pairwise),
•списочный (англ. listwise).
Выбор метода зависит от качества ранжирования данных. Теоретически, списочный подход считается наилучшим, однако, на практике, например в Яндексе, лучше всего работает попарный подход.
13
Обучение с учителем. Способы обучения и оценки его качества
В приведенных ниже формулах используются следующие обозначения: XY ={(x1, y1)…(xn, yn)} – |
|
обучающая выборка, n – количество прецедентов, Уi – фактическое значение (ожидаемый ответ) в |
|
i-м прецеденте (Уi ϵ XY), |
y – выданный системой ответ для Xi (Xi ϵ XY). |
|
1 |
1. Средняя ошибка представляет собой усреднение ошибок для каждого образца и вычисляется
по формуле: n
(yi − yi )
CO = i=1
n
2. Средняя абсолютная ошибка представляет собой усреднение абсолютных ошибок на каждом шаге и вычисляется по формуле:
|
n |
i |
i |
|
|
||
|
|
y |
− y |
CAO = |
i=1 |
|
|
|
n |
|
|
|
|
|
14
Обучение с учителем. Способы обучения и оценки его качества
3. Среднеквадратическая ошибка вычисляется как сумма средних квадратов ошибок. Формула:
|
( |
i |
i ) |
|
|
n |
|
|
2 |
|
|
y − y |
|
|
CKO = |
i=1 |
|
|
|
|
n |
|
|
|
|
|
|
|
|
4. Корень из среднеквадратической ошибки вычисляется по формуле:
|
n |
|
2 |
|
|
|
|
|
i |
i |
|
|
|
y |
− y |
KCKO = |
i=1 |
|
|
|
n |
||
|
|
||
5. Средняя относительная ошибка вычисляется как среднее относительных ошибок:
|
n |
y |
− y |
|
|||
|
|
|
i |
|
i |
|
|
|
|
|
y |
|
|
||
|
|
|
|
|
|
||
CO = |
i=1 |
|
|
i |
|
|
100% |
|
|
n |
|
|
|
||
|
|
|
|
|
|
|
|
15
Обучение с учителем. Способы обучения и оценки его качества
6. Средняя абсолютная относительная ошибка вычисляется как среднее относительных ошибок по модулю:
|
yi |
− yi |
|
|
|
|
n |
|
|
|
|
|
i=1 |
y |
|
|
|
MAPE = |
i |
|
100% |
||
|
n |
|
|
||
|
|
|
|
|
|
7. Симметричная средняя абсолютная относительная ошибка вычисляется как:
|
n |
yi − yi |
|
|
|
|
|
|
|
|
(yi + yi ) |
/ 2 |
|
|
SMAPE = |
i=1 |
100% |
||
|
n |
|
||
|
|
|
|
16
Обучение без учителя. Кластеризация
Задача кластеризации – разделение некоторого множества объектов на непересекающиеся группы (кластеры) таким образом, чтобы каждая группа состояла из схожих объектов, а объекты разных кластеров существенно отличались.
Цели кластеризации:
•Упростить дальнейшую обработку данных, разбить множество объектов на группы схожих объектов чтобы работать с каждой группой в отдельности (задачи классификации, регрессии, прогнозирования).
•Сократить объем хранимых данных, оставив по одному представителю от каждого кластера (задачи сжатия данных).
•Выделить нетипичные объекты, которые не подходят ни к одному из кластеров (задачи одноклассовой классификации).
•Построить иерархию множества объектов (задачи таксономии).
Кластеризация: Методы
●K-means (K-means++, K-means||)
●Иерархическая кластеризация
●Кластеризация на основе распределений (EM-алгоритм)
●Кластеризация на основе плотности (DBSCAN)
●Графовая кластеризация (определение клик)
●...
17
Обучение без учителя. Уменьшение размерности
Задача кластеризации
Уменьшение размерности используется для уменьшения размеров набора данных и ускорения последующего алгоритма машинного обучения. Он удаляет шум и избыточные функции, и это улучшает общую производительность алгоритма.
Существует несколько методов уменьшения размерности, в том числе:
1.Анализ основных компонентов (PCA);
2.Линейный дискриминантный анализ (LDA);
3.t-SNE (t-распределенное стохастическое встраивание соседей);
4.Автоэнкодеры;
Применение уменьшения размерности в машинном обучении:
1.Визуализация;
2.Выбор функций;
3.Обнаружение аномалий;
4.Кластеризация;
18
Обучение без учителя. Оценка качества
1. Adjusted RandIndex (ARI).
Рассчитывается мера следующим образом: пусть n – число объектов в выборке, a – число пар объектов, имеющих одинаковые метки и находящихся в одном кластере, b – число пар объектов, имеющих различные метки и находящиеся в различных кластерах.
RandIndex (RI)
RI = |
2 |
(a + b) |
|
|
|
||||||
n |
( |
|
|
) |
|
|
|
||||
|
|
|
|
|
|
|
|||||
|
|
|
n −1 |
|
|
|
|||||
Adjusted RandIndex (ARI) |
|
|
|
||||||||
ARI = |
|
RI − E |
|
RI |
|
|
, |
||||
|
|
|
|
|
|
||||||
max |
(RI )− E RI |
||||||||||
|
|
||||||||||
где E – математическое ожидание. |
|
|
|
|
|
|
|
|
19 |
||
Обучение без учителя. Оценка качества |
|
|
|
2. Adjusted MutualInformation (AMI). |
|
|
|
MI (X ,Y ) = y Y x X |
|
p(xy) |
|
p (x, y )log |
|
, |
|
|
|
p (x) p ( y ) |
|
|
|
|
|
где p(x, y) – совместная функция распределения вероятностей для X и Y; p(x) и p(y) – функции распределения предельной вероятности для X и Y соответственно.
3. Гомогенность, полнота, V-мера.
Гомогенность определяет, насколько каждый кластер состоит из объектов одного класса, и рассчитывается по формуле:
h =1− H (C( | K) ) , H C
где K – результат кластеризации, С – истинное разбиение, H – функция энтропии. |
20 |
