Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:
реферат / Наволоцкий_1302_DATA-MINING-классификация-регрессия_v1.docx
Скачиваний:
0
Добавлен:
27.12.2025
Размер:
255 Кб
Скачать
☆

1 Теоретические основы Data Mining

1.1 Понятие Data Mining и этапы процесса kdd

Data Mining (Интеллектуальный анализ данных) — это собирательное название, используемое для обозначения совокупности методов обнаружения в данных ранее неизвестных, нетривиальных, практически полезных и доступных для интерпретации знаний, необходимых для принятия решений в различных сферах человеческой деятельности [2].

Data Mining часто рассматривается как один из этапов более широкого процесса — KDD (Knowledge Discovery in Databases, Обнаружение знаний в базах данных). Стандартная модель процесса KDD включает в себя последовательность шагов от сырых данных до получения формализованных знаний.

На Рисунке 1 представлена схема процесса KDD, которую необходимо реализовать в рамках проектирования аналитической системы.

Рисунок 1 – схема процесса KDD

В индустрии также широко применяется методология CRISP-DM (Cross-Industry Standard Process for Data Mining), которая подчеркивает итеративный характер процесса и важность понимания бизнес-целей перед началом моделирования [3].

1.2 Подготовка данных: очистка, нормализация и выбор признаков

Качество работы алгоритмов классификации и регрессии напрямую зависит от качества входных данных. В профессиональной среде существует принцип «Garbage In, Garbage Out» (Мусор на входе — мусор на выходе). Этап предобработки данных занимает до 80% времени всего проекта по анализу данных.

Основные задачи предобработки:

  • Очистка данных. Включает обработку пропущенных значений (замена средним, медианой или удаление строк) и устранение шумовых выбросов.

  • Кодирование категориальных признаков. Большинство алгоритмов (кроме деревьев решений) работают только с числами, поэтому текстовые категории преобразуются в числовые векторы (например, методы One-Hot Encoding или Label Encoding).

  • Масштабирование (нормализация). Алгоритмы, использующие метрики расстояния (например, k-NN или SVM), чувствительны к разному масштабу признаков.

Наиболее часто применяются два метода масштабирования:

Минимаксная нормализация, приводящая значения к диапазону [0, 1]:

(1)

Стандартизация (Z-score), приводящая данные к распределению с нулевым средним и единичной дисперсией:

(2)

где — среднее значение, а σ — стандартное отклонение [4].

1.3 Обучение с учителем: классификация и регрессия

В машинном обучении и Data Mining выделяют три основных парадигмы: обучение с учителем (Supervised Learning), обучение без учителя (Unsupervised Learning) и обучение с подкреплением (Reinforcement Learning). Данный реферат посвящен методам обучения с учителем.

Суть обучения с учителем заключается в наличии обучающей выборки.

​

где – вектор признаков объекта, а – правильный ответ (целевая переменная). Цель алгоритма — построить функцию , которая с минимальной ошибкой аппроксимирует зависимость от .

Различие между классификацией и регрессией определяется типом целевой переменной :

  • Задача классификации: целевая переменная принимает дискретные значения из конечного множества классов . Примеры: определение спама (спам/не спам), диагностика заболеваний, распознавание рукописных цифр.

  • Задача регрессии: целевая переменная принимает непрерывные значения из множества действительных чисел . Примеры: прогноз стоимости недвижимости, предсказание температуры, оценка выручки магазина [5].

На Рисунке 2 изображено различие подходов.

Рисунок 2 – Графическая интерпретация задач классификации и регрессии