Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

2сем / лек / Л3 -О задачах машинного обучения (2)

.pdf
Скачиваний:
1
Добавлен:
04.04.2026
Размер:
573 Кб
Скачать

Обучение с учителем. Классификация

Задача классификации – распределение некоторого множества объектов по заданному множеству групп (классов). При этом есть некоторое подмножество объектов, для которых распределение по классам известно, классовая принадлежность остальных – неизвестна.

Классификация:

Значения y дискретны (принимают несколько заранее определённых значений, классов)

Альтернативная постановка: предсказать вероятности определённых классов

Пример: предсказание состояния хроматина, сайта связывания TF, растворимости химического вещества, пола, спам/не спам, вероятность ухода сотрудника/клиента

Классификация: Популярные методы

Логистическая регрессия

Машина опорных векторов (Support vector machine, SVM)

Наивный Байес

Деревья решений

Нейросети

Ансамбли (Random Forests, Gradient Boosted Trees)

k-NN

11

Обучение с учителем. Регрессия

Задача регрессии

Задача регрессии – приближение неизвестной целевой зависимости на некотором множестве данных. То есть решить задачу регрессии – значит найти алгоритм, обладающий способностью к обобщению эмпирических фактов (способностью к выводу общих знаний из частных

наблюдений, прецедентов).

Регрессия: Примеры

Прогнозирование уровня экспрессии гена;

Предсказание цены дома по его характеристикам;

Предсказание спроса на товар на ближайший месяц;

Предсказание уровня воды в водохранилище;

Предсказание температуры воздуха.

Регрессия: Методы

Линейная регрессия (в том числе множественная);

Регрессионные деревья;

Регрессия через SVM;

Нейросети;

и т.п.

12

Обучение с учителем. Ранжирование

Задача ранжирования

Задача регрессии — это класс задач машинного обучения с учителем, заключающихся в автоматическом подборе ранжирующей модели по обучающей выборке, состоящей из множества списков и заданных частичных порядков на элементах внутри каждого списка.

Методы ранжирования

Всего выделяют три подхода к решению задачи ранжирования:

поточечный (англ. pointwise),

попарный (англ. pairwise),

списочный (англ. listwise).

Выбор метода зависит от качества ранжирования данных. Теоретически, списочный подход считается наилучшим, однако, на практике, например в Яндексе, лучше всего работает попарный подход.

13

Обучение с учителем. Способы обучения и оценки его качества

В приведенных ниже формулах используются следующие обозначения: XY ={(x1, y1)…(xn, yn)} –

обучающая выборка, n – количество прецедентов, Уi – фактическое значение (ожидаемый ответ) в

i-м прецеденте (Уi ϵ XY),

y – выданный системой ответ для Xi (Xi ϵ XY).

 

1

1. Средняя ошибка представляет собой усреднение ошибок для каждого образца и вычисляется

по формуле: n

(yi yi )

CO = i=1

n

2. Средняя абсолютная ошибка представляет собой усреднение абсолютных ошибок на каждом шаге и вычисляется по формуле:

 

n

i

i

 

 

 

 

y

y

CAO =

i=1

 

 

 

n

 

 

 

 

14

Обучение с учителем. Способы обучения и оценки его качества

3. Среднеквадратическая ошибка вычисляется как сумма средних квадратов ошибок. Формула:

 

(

i

i )

 

 

n

 

 

2

 

 

y y

 

CKO =

i=1

 

 

 

 

n

 

 

 

 

 

 

4. Корень из среднеквадратической ошибки вычисляется по формуле:

 

n

 

2

 

 

 

 

i

i

 

 

y

y

KCKO =

i=1

 

 

 

n

 

 

5. Средняя относительная ошибка вычисляется как среднее относительных ошибок:

 

n

y

y

 

 

 

 

i

 

i

 

 

 

 

 

y

 

 

 

 

 

 

 

 

CO =

i=1

 

 

i

 

 

100%

 

 

n

 

 

 

 

 

 

 

 

 

 

15

Обучение с учителем. Способы обучения и оценки его качества

6. Средняя абсолютная относительная ошибка вычисляется как среднее относительных ошибок по модулю:

 

yi

yi

 

 

 

n

 

 

 

 

 

i=1

y

 

 

MAPE =

i

 

100%

 

n

 

 

 

 

 

 

 

7. Симметричная средняя абсолютная относительная ошибка вычисляется как:

 

n

yi yi

 

 

 

 

 

 

 

(yi + yi )

/ 2

 

SMAPE =

i=1

100%

 

n

 

 

 

 

 

16

Обучение без учителя. Кластеризация

Задача кластеризации – разделение некоторого множества объектов на непересекающиеся группы (кластеры) таким образом, чтобы каждая группа состояла из схожих объектов, а объекты разных кластеров существенно отличались.

Цели кластеризации:

Упростить дальнейшую обработку данных, разбить множество объектов на группы схожих объектов чтобы работать с каждой группой в отдельности (задачи классификации, регрессии, прогнозирования).

Сократить объем хранимых данных, оставив по одному представителю от каждого кластера (задачи сжатия данных).

Выделить нетипичные объекты, которые не подходят ни к одному из кластеров (задачи одноклассовой классификации).

Построить иерархию множества объектов (задачи таксономии).

Кластеризация: Методы

K-means (K-means++, K-means||)

Иерархическая кластеризация

Кластеризация на основе распределений (EM-алгоритм)

Кластеризация на основе плотности (DBSCAN)

Графовая кластеризация (определение клик)

...

17

Обучение без учителя. Уменьшение размерности

Задача кластеризации

Уменьшение размерности используется для уменьшения размеров набора данных и ускорения последующего алгоритма машинного обучения. Он удаляет шум и избыточные функции, и это улучшает общую производительность алгоритма.

Существует несколько методов уменьшения размерности, в том числе:

1.Анализ основных компонентов (PCA);

2.Линейный дискриминантный анализ (LDA);

3.t-SNE (t-распределенное стохастическое встраивание соседей);

4.Автоэнкодеры;

Применение уменьшения размерности в машинном обучении:

1.Визуализация;

2.Выбор функций;

3.Обнаружение аномалий;

4.Кластеризация;

18

Обучение без учителя. Оценка качества

1. Adjusted RandIndex (ARI).

Рассчитывается мера следующим образом: пусть n – число объектов в выборке, a – число пар объектов, имеющих одинаковые метки и находящихся в одном кластере, b – число пар объектов, имеющих различные метки и находящиеся в различных кластерах.

RandIndex (RI)

RI =

2

(a + b)

 

 

 

n

(

 

 

)

 

 

 

 

 

 

 

 

 

 

 

 

 

n 1

 

 

 

Adjusted RandIndex (ARI)

 

 

 

ARI =

 

RI E

 

RI

 

 

,

 

 

 

 

 

 

max

(RI )E RI

 

 

где E – математическое ожидание.

 

 

 

 

 

 

 

 

19

Обучение без учителя. Оценка качества

 

 

2. Adjusted MutualInformation (AMI).

 

 

 

MI (X ,Y ) = y Y x X

 

p(xy)

 

p (x, y )log

 

,

 

 

p (x) p ( y )

 

 

 

 

где p(x, y) – совместная функция распределения вероятностей для X и Y; p(x) и p(y) – функции распределения предельной вероятности для X и Y соответственно.

3. Гомогенность, полнота, V-мера.

Гомогенность определяет, насколько каждый кластер состоит из объектов одного класса, и рассчитывается по формуле:

h =1H (C( | K) ) , H C

где K – результат кластеризации, С – истинное разбиение, H – функция энтропии.

20