Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Методы и модели решения задачи классификации данных. Основные этапы. Учебное пособие
.pdf
Министерство науки и высшего образования Российской Федерации
НОВОСИБИРСКИЙ ГОСУДАРСТВЕННЫЙ ТЕХНИЧЕСКИЙ УНИВЕРСИТЕТ
__________________________________________________________________________
О. К. АЛЬСОВА, Н. А. ЗЕЛЕНЧУК
МЕТОДЫ И МОДЕЛИ
РЕШЕНИЯ ЗАДАЧИ
КЛАССИФИКАЦИИ ДАННЫХ
ОСНОВНЫЕ ЭТАПЫ
Утверждено Редакционно-издательским советом университета
в качестве учебного пособия
НОВОСИБИРСК
2024

УДК 004.655(075.8)
А579
Рецензенты:
д-р техн. наук, доцент С. П. Ильиных
канд. физ.-мат. наук Д. А. Мигов
Работа подготовлена на кафедре вычислительной техники
для студентов и магистрантов АВТФ по дисциплинам
«Методы анализа данных», «Компьютерные технологии анализа
и обработки данных», «Анализ и интерпретация данных»
Альсова О. К.
А579 Методы и модели решения задачи классификации данных.
Основные этапы: учебное пособие / О. К. Альсова, Н. А. Зеленчук. – Новосибирск: Изд-во НГТУ, 2024. – 88 с.
ISBN 978-5-7782-5280-6
В пособии рассмотрены вопросы, связанные с решением задачи
классификации данных средствами языка и среды статистических вычислений R.
Рассмотрены ключевые этапы решения задачи классификации данных, а именно: постановка задачи; подготовка данных для обработки;
анализ и устранение дисбаланса классов; первичный (разведочный)
анализ данных; классификация; анализ и интерпретация полученных
результатов.
В теоретическом разделе
сание используемых на каждом этапе методов и моделей, позволяющее
понять их суть и особенности применения. Основное внимание в пособии уделено рассмотрению технологии (методики) решения задачи
классификации с помощью среды R. Приведено описание основных
функций языка R, реализующих рассмотренные методы и модели.
Предназначено для бакалавров IV курса АВТФ,
направлениям 09.03.01 «Информатика и вычислительная техника»,
09.03.04 «Программная инженерия», и для магистрантов первого и второго года обучения – по направлениям 09.04.01 «Информатика и вычислительная техника», 09.04.04 «Программная инженерия».
учебного пособия приведено краткое опи-
обучающихся по
УДК 004.655(075.8)
ISBN 978-5-7782-5280-6 © Альсова О. К., Зеленчук Н. А., 2024
© Новосибирский государственный
технический университет, 2024

Введение .................................................................................................................. 4
1. Задача классификации данных. Методы и модели .................................... 7
1.1. Постановка задачи классификации. Основные определения и понятия ...... 7
1.2. Этапы решения задачи классификации данных ...................................... 10
1.3. Устранение дисбаланса классов на основе применения методов
семплирования ........................................................................................... 14
1.4. Первичный анализ данных ........................................................................ 18
1.4.1. Графический анализ данных ............................................................ 19
1.4.2. Исследование законов распределения данных ............................... 20
1.4.3. Анализ взаимосвязей признаков ...................................................... 23
1.4.3.1. Корреляционный анализ взаимосвязей
количественных признаков ................................................... 25
1.4.3.2. Корреляционный
порядковых признаков .......................................................... 27
1.4.3.3. Корреляционный анализ взаимосвязей
классификационных признаков ............................................ 31
1.4.3.4. Дисперсионный анализ данных............................................ 32
1.5. Наивный байесовский классификатор ..................................................... 36
1.6. Оценка точности моделей классификации .............................................. 42
1.7. Контрольные вопросы к разделу 1 ........................................................... 50
2. Решение задачи классификации в среде R ................................................. 53
2.1. Подготовка данных для анализа ............................................................... 54
2.2. Устранение дисбаланса классов ............................................................... 56
2.3. Проведение первичного анализа данных ................................................. 59
2.3.1. Оценка закона распределения данных ............................................ 59
2.3.2. Исследование
2.4. Применение наивного байесовского классификатора ............................ 74
2.5. Контрольные вопросы к разделу 2 ........................................................... 85
Библиографический список ................................................................................. 86
ОГЛАВЛЕНИЕ
анализ взаимосвязей
взаимосвязей признаков .......................................... 62

ВВЕДЕНИЕ
В настоящее время наблюдается постоянный рост объемов информации, описывающей реальные процессы и явления или особенности
функционирования конкретных объектов в разных предметных областях. Поэтому ставятся задачи, связанные с анализом и обработкой всё
больших объемов накопленной разнотипной информации с помощью
современных технологий и программных средств.
Одно из современных направлений в
зано с применением технологий Data Mining и использованием статистических методов анализа данных и машинного обучения. Под Data
Mining (эквивалент русскоязычного понятия «интеллектуальный анализ
данных») понимается процесс исследования больших объемов данных
с целью выявления закономерностей и скрытых знаний, которые впоследствии применяются к новым массивам данных [9].
Задача классификации данных – одна
в рамках направления Data Mining, и связана с разработкой классификаций и построением правил отнесения объектов к тому или иному классу.
Решение прикладной задачи классификации данных в любой предметной области (медицина, экономика, социология и т. п.) – это всегда
сложный и творческий процесс, который предполагает выполнение последовательности взаимосвязанных этапов. Каждый из этапов связан
с применением комплекса методов обработки и анализа данных, интерпретацией полученных промежуточных и итоговых результатов и принятием обоснованных решений на их основе.
В учебном пособии рассматривается комплексный алгоритм решения задачи классификации, который описывает все этапы решения,
а не только непосредственно этап классификации. Алгоритм представляет собой последовательность из итерационно взаимодействующих
этапов: постановка задачи; подготовка данных для обработки; анализ и
устранение дисбаланса классов; первичный (разведочный) анализ данных; классификация; анализ и интерпретация полученных результатов.
области обработки данных свя-
из основных задач, решаемых
4

Отметим, что в общий алгоритм включен этап устранения дисбаланса
класса, который позволяет повысить точность и обоснованность классификационных решений.
Учебное пособие разбито на две большие части, каждая из которых,
в свою очередь, включает теоретический и практический разделы.
В первой части пособия приведены ключевые этапы решения задачи
классификации данных и методы, применяемые
на каждом из этапов.
В качестве метода классификации рассмотрен наивный байесовский
классификатор. Это один из базовых, наиболее простых методов классификации, который позволяет построить интерпретируемую модель.
Вторая часть пособия посвящена рассмотрению методов и моделей,
которые применяются непосредственно на этапе классификации данных, включая этап сравнения и выбора оптимальной модели по
сово-
купности показателей точности.
В рамках теоретического раздела учебного пособия представлено
описание методов и моделей, используемых на каждом из этапов решения задачи классификации. Для каждого метода даны его краткое теоретическое описание, идея метода, математическая модель, лежащая
в основе метода, условия использования и область применения.
В практическом разделе учебного пособия
рассматривается сквоз-
ной пример решения прикладной задачи классификации сотрудников
IT-компании на основе рассмотрения их показателей эффективности
KPI (Key Performance Indicators) с помощью методов и подходов, опи-
санных в теоретическом разделе. Подробно представлены все этапы решения задачи классификации: от подготовки исходных данных, выбора
и обоснования предикторных признаков до оценки адекватности и точности построенной модели классификатора.
В качестве программной среды реализации методов и алгоритмов
выбран язык R и среда RStudio. Приведены скрипты
реализации всех
рассмотренных методов обработки и классификации данных, что позволяет их использовать для решения собственных задач.
R – интерпретируемый язык программирования и среда для статистических вычислений и графического анализа с открытым исходным
кодом [17]. R широко используется как статистическое программное
обеспечение, поддерживается большим и активным исследовательским
сообществом по всему миру и фактически
стал стандартом в области
анализа данных. В R реализованы все актуальные методы статистического анализа данных [11, 14, 15, 20, 21], а также множество специфических алгоритмов для решения узкоспециализированных задач
5

из разных предметных областей. К достоинствам R относится возможность создания графиков высокого качества, которые могут быть экспортированы в основные графические форматы и далее использоваться
в презентациях и научных публикациях.
Функции R объединяются в пакеты – загружаемые модули, которые
подключаются к любой программе и предоставляют объединенные
в них вычислительные средства. Причем пакеты для
R могут разрабатываться и на других языках программирования. В целом R, как язык программирования, довольно прост и имеет ограниченные функциональные средства, что компенсируется возможностью неограниченного его
расширения с помощью пакетов. В базовую поставку R включен основной набор пакетов, а всего по состоянию на сентябрь 2024 года доступно
более 21 000 пакетов [19]. Кроме
того, R интегрирован в профессиональные статистические пакеты, такие как Statistica, SPSS, SAS, что позволяет запускать код R в оболочке пакета.
6

1. ЗАДАЧА КЛАССИФИКАЦИИ ДАННЫХ
МЕТОДЫ И МОДЕЛИ
1.1. ПОСТАНОВКА ЗАДАЧИ КЛАССИФИКАЦИИ
ОСНОВНЫЕ ОПРЕДЕЛЕНИЯ И ПОНЯТИЯ
Понятие классификации является одним из основополагающих
в научной и практической деятельности человека. Под классификацией понимается разделение рассматриваемой совокупности объектов
или явлений на однородные (в определенном смысле) группы.
При этом термин «классификация» используется в зависимости от
контекста для обозначения как самого процесса разделения,
результата [7, 18].
В математической статистике задача классификации является базовой и предполагает распределение исследуемых объектов на классы по
выделенным наиболее существенным признакам, присущим объектам
данного типа (рода) и отличающим их от объектов других типов (родов) [10]. Выделяют два типа задач классификации, которые носят
названия соответственно: «классификация без учителя
ция с учителем» [7, 18]. В первом случае отсутствует априорная информация о разделении объектов на классы, и задача заключается в разбиении объектов на однородные (в смысле принятой метрики) группы
на основании рассмотрения совокупности значений признаков, описывающих исследуемые объекты. Задачу «классификации без учителя»
еще называют в литературе задачей
сономии. Во втором случае присутствует обучающая выборка, в которой каждый из объектов отнесен к одному из априорно выделенных
классов, и необходимо построить правило отнесения объекта к классу.
В настоящем учебном пособии рассматривается задача классификации
во второй постановке.
кластеризации или численной так-
» и «классифика-
так и его
7

Математическая постановка задачи классификации
x
K
x
X
X
K
Пусть имеется X – множество описаний объектов, Y – множество но-
меров (наименований, меток) классов. Существует неизвестная целевая
зависимость – отображение
*
: ,yX Y
только на объектах конечной обучающей выборки:
где
y
личество объектов;
– значение j-го признака (атрибута), измеренного на i-м объекте;
ij
– номер (метка) класса, к которому принадлежит i-й объект; n – ко-
i
p – количество признаков.
значения которой известны
,
ij i
np
,1
ij
n
{, }
Xxy
Необходимо построить алгоритм (правило), позволяющий классифицировать произвольный объект
.xX
Под объектом понимается элемент множества X. Под признаком или
атрибутом понимается независимая (предикторная) переменная, описывающая свойство объекта. Классом называется зависимая переменная,
{, , , }
которая принимает любое значение из множества
YCC C
12
K – количество классов.
В частном случае выделяют только два класса, и соответственно решается задача бинарной классификации с двумя непересекающимися
классами.
В области машинного обучения классификация относится к типу задач обучения по прецедентам (
supervised learning, обучение с учите-
лем). В обучении с учителем набор данных организован как коллекция
,
np
размеченных образцов
(, )
xy
ij i
. Каждый из n элементов коллек-
,1
ij
ции называется вектором признаков, обозначим его для простоты
(, , , ).
xx x Каждое измерение вектора признака описывает не-
12
которую характеристику образца (объекта):
нейшем X = x – компактная запись для
Под меткой
{ , , , }.
YCC C
12
p
XX В даль-
12
(, , , ).
xX x X x
112 2
y
подразумевается элемент конечного множества классов
i
., , ,
p
pp
Основная цель алгоритма обучения с учителем заключается в создании модели на основе предоставленного набора данных. Эта модель
принимает векторы признаков в качестве входных данных и предоставляет информацию, позволяющую определить соответствующую метку
(класс) для данного вектора признаков.
,
,
8

Задача классификации в машинном обучении состоит в автоматическом определении метки для неразмеченного образца. Для решения
этой задачи применяется алгоритм обучения классификатора, в котором
используется набор размеченных данных для создания модели.
При построении классификатора исходная выборка разбивается на
две части – обучающую и тестовую. Модель классификатора строится
на обучающей выборке, а точность
классификации проверяется на объ-
ектах тестовой выборки.
Все признаки, описывающие объект, подразделяются на количественные (числовые) и качественные (категориальные). При этом качественные признаки разделяются, в свою очередь, на порядковые и классификационные. Значения признаков измеряются в соответствующих
шкалах, на каждой из которых допустимы определенные математические операции.
Количественные признаки –
признаки, которые регистрируются
с помощью чисел, имеющих содержательный смысл. Количественные
признаки измеряются в количественной шкале, на которой допустимы
все арифметические операции и операции сравнения. К количественным признакам относятся, например, возраст, доход, стаж работы, рост,
вес и т. п.
Порядковые (ранговые, ординальные) признаки – признаки, которые
измеряются в порядковой шкале,
на которой допустимы только операции сравнения. К ранговым признакам относятся, например, уровень
сертификации (1 – низкий; 2 – средний, 3 – высокий), воинские звания,
сорта продуктов и т. п.
Классификационные (номинальные) признаки – признаки, принимающие значения из некоторого ограниченного набора неисчисляемых категорий. Измеряются в категориальной шкале, для которой недопустимы арифметические операции, а
из операций сравнения допустимы
только «равно» и «не равно» (например, пол, цвет и т. п.).
Разработано множество статистических методов разных классов,
позволяющих решать задачу классификации. Выбор методов зависит
от ряда факторов, среди которых можно выделить следующие: свойства
исходных данных; типы признаков; наличие и структура взаимосвязей
между признаками; требования к результатам классификации
; возможность обрабатывать данные большого объема и заданные временные
ограничения на реализацию процедуры классификации. Однако окончательный выбор метода классификации выполняется после проведения
экспериментальных исследований (апостериори) и построения модели
9

классификатора. Выбор опирается на оценку точности классификации,
сравнительный анализ точности разных классификаторов, анализ и интерпретацию полученных результатов.
1.2. ЭТАПЫ РЕШЕНИЯ ЗАДАЧИ
КЛАССИФИКАЦИИ ДАННЫХ
Процесс решения задачи классификации можно представить в виде
укрупненного алгоритма, состоящего из последовательности взаимосвязанных этапов. Этапы алгоритма итерационно взаимодействуют
друг с другом, на каждом шаге возможен возврат на предыдущие этапы
для их уточнения и корректировки с учетом анализа промежуточных результатов. В рамках каждого этапа применяется комплекс методов статистического
анализа данных и машинного обучения с целью построения наиболее точных моделей классификации и достижения конечных
прикладных целей исследования.
Укрупненно алгоритм решения задачи классификации состоит из
следующих этапов (рис. 1).
Этап 1. Постановка задачи. Выполняется постановка задачи классификации на предметно-содержательном уровне, описываются предмет и объекты статистического исследования, научные
и практические
выводы, которые должны быть получены в результате решения задачи,
формулируются требования к представлению результатов.
Далее выполняется формализация задачи классификации. Формулируются цели исследования в терминах основных типов прикладных задач, решаемых в теории статистических методов классификации.
Определяются исходные данные, включая словесное, содержательное описание признаков, измеренных на исследуемых
объектах, типов
признаков, их возможных значений и диапазонов изменения. Задается
объем выборки, который описывает количество исследуемых объектов.
Если исходные данные не собраны перед проведением исследования,
то составляется и реализуется план сбора информации, определяется
форма представления информации. В этом случае сбор данных выделяется в отдельный информационный этап.
На базе содержательной постановки
задачи, анализа природы исходных статистических данных осуществляется предварительный (априорный) выбор базовых математических моделей для решения задачи классификации, которые целесообразно использовать. Определяются программные средства реализации методов и алгоритмов решения задачи
10
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
