- •Аннотация
- •Содержание
- •Введение
- •1 Теоретические основы Data Mining
- •1.1 Понятие Data Mining и этапы процесса kdd
- •1.2 Подготовка данных: очистка, нормализация и выбор признаков
- •1.3 Обучение с учителем: классификация и регрессия
- •2.2 Логические методы: Деревья решений
- •2.3 Вероятностные методы: Наивный байесовский классификатор
- •2.4 Метрические методы: k-ближайших соседей (k-nn)
- •2.5 Метод опорных векторов (svm)
- •2 Алгоритмы классификации
- •2.1 Постановка задачи классификации
- •2.6 Метрики оценки качества классификации
- •3 Алгоритмы регрессии
- •3.1 Постановка задачи регрессии
- •3.2 Линейная регрессия
- •3.3 Логистическая регрессия
- •3.4 Метрики оценки качества регрессии
- •Заключение
- •Список используемых источников
1 Теоретические основы Data Mining
1.1 Понятие Data Mining и этапы процесса kdd
Data Mining (Интеллектуальный анализ данных) — это собирательное название, используемое для обозначения совокупности методов обнаружения в данных ранее неизвестных, нетривиальных, практически полезных и доступных для интерпретации знаний, необходимых для принятия решений в различных сферах человеческой деятельности [2].
Data Mining часто рассматривается как один из этапов более широкого процесса — KDD (Knowledge Discovery in Databases, Обнаружение знаний в базах данных). Стандартная модель процесса KDD включает в себя последовательность шагов от сырых данных до получения формализованных знаний.
На Рисунке 1 представлена схема процесса KDD, которую необходимо реализовать в рамках проектирования аналитической системы.
Рисунок 1 – схема процесса KDD
В индустрии также широко применяется методология CRISP-DM (Cross-Industry Standard Process for Data Mining), которая подчеркивает итеративный характер процесса и важность понимания бизнес-целей перед началом моделирования [3].
1.2 Подготовка данных: очистка, нормализация и выбор признаков
Качество работы алгоритмов классификации и регрессии напрямую зависит от качества входных данных. В профессиональной среде существует принцип «Garbage In, Garbage Out» (Мусор на входе — мусор на выходе). Этап предобработки данных занимает до 80% времени всего проекта по анализу данных.
Основные задачи предобработки:
Очистка данных. Включает обработку пропущенных значений (замена средним, медианой или удаление строк) и устранение шумовых выбросов.
Кодирование категориальных признаков. Большинство алгоритмов (кроме деревьев решений) работают только с числами, поэтому текстовые категории преобразуются в числовые векторы (например, методы One-Hot Encoding или Label Encoding).
Масштабирование (нормализация). Алгоритмы, использующие метрики расстояния (например, k-NN или SVM), чувствительны к разному масштабу признаков.
Наиболее часто применяются два метода масштабирования:
Минимаксная нормализация, приводящая значения к диапазону [0, 1]:
(1)
Стандартизация (Z-score), приводящая данные к распределению с нулевым средним и единичной дисперсией:
(2)
где
— среднее значение, а σ — стандартное
отклонение [4].
1.3 Обучение с учителем: классификация и регрессия
В машинном обучении и Data Mining выделяют три основных парадигмы: обучение с учителем (Supervised Learning), обучение без учителя (Unsupervised Learning) и обучение с подкреплением (Reinforcement Learning). Данный реферат посвящен методам обучения с учителем.
Суть обучения с учителем заключается в наличии обучающей выборки.
где
– вектор признаков объекта, а
– правильный ответ (целевая переменная).
Цель алгоритма — построить функцию
,
которая с минимальной ошибкой
аппроксимирует зависимость
от
.
Различие между классификацией и регрессией определяется типом целевой переменной :
Задача классификации: целевая переменная принимает дискретные значения из конечного множества классов
.
Примеры: определение спама (спам/не
спам), диагностика заболеваний,
распознавание рукописных цифр.Задача регрессии: целевая переменная принимает непрерывные значения из множества действительных чисел
.
Примеры: прогноз стоимости недвижимости,
предсказание температуры, оценка
выручки магазина [5].
На Рисунке 2 изображено различие подходов.
Рисунок 2 – Графическая интерпретация задач классификации и регрессии
