Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Методы и модели решения задачи классификации данных. Основные этапы. Учебное пособие

.pdf
Скачиваний:
0
Добавлен:
07.09.2026
Размер:
1 Мб
Скачать
Министерство науки и высшего образования Российской Федерации
НОВОСИБИРСКИЙ ГОСУДАРСТВЕННЫЙ ТЕХНИЧЕСКИЙ УНИВЕРСИТЕТ
__________________________________________________________________________
О. К. АЛЬСОВА, Н. А. ЗЕЛЕНЧУК
МЕТОДЫ И МОДЕЛИ
РЕШЕНИЯ ЗАДАЧИ
КЛАССИФИКАЦИИ ДАННЫХ
Утверждено Редакционно-издательским советом университета
в качестве учебного пособия
НОВОСИБИРСК
2024
УДК 004.655(075.8)
А579
Рецензенты:
д-р техн. наук, доцент С. П. Ильиных
канд. физ.-мат. наук Д. А. Мигов
Работа подготовлена на кафедре вычислительной техники
для студентов и магистрантов АВТФ по дисциплинам
«Методы анализа данных», «Компьютерные технологии анализа
и обработки данных», «Анализ и интерпретация данных»
Альсова О. К.
А579 Методы и модели решения задачи классификации данных.
Основные этапы: учебное пособие / О. К. Альсова, Н. А. Зелен­чук. – Новосибирск: Изд-во НГТУ, 2024. – 88 с.
ISBN 978-5-7782-5280-6
В пособии рассмотрены вопросы, связанные с решением задачи классификации данных средствами языка и среды статистических вы­числений R.
Рассмотрены ключевые этапы решения задачи классификации дан­ных, а именно: постановка задачи; подготовка данных для обработки; анализ и устранение дисбаланса классов; первичный (разведочный) анализ данных; классификация; анализ и интерпретация полученных результатов.
В теоретическом разделе сание используемых на каждом этапе методов и моделей, позволяющее понять их суть и особенности применения. Основное внимание в посо­бии уделено рассмотрению технологии (методики) решения задачи классификации с помощью среды R. Приведено описание основных функций языка R, реализующих рассмотренные методы и модели.
Предназначено для бакалавров IV курса АВТФ, направлениям 09.03.01 «Информатика и вычислительная техника»,
09.03.04 «Программная инженерия», и для магистрантов первого и вто­рого года обучения – по направлениям 09.04.01 «Информатика и вы­числительная техника», 09.04.04 «Программная инженерия».
учебного пособия приведено краткое опи-
обучающихся по
УДК 004.655(075.8)
ISBN 978-5-7782-5280-6 © Альсова О. К., Зеленчук Н. А., 2024
© Новосибирский государственный технический университет, 2024
Введение .................................................................................................................. 4
1. Задача классификации данных. Методы и модели .................................... 7
1.1. Постановка задачи классификации. Основные определения и понятия ...... 7
1.2. Этапы решения задачи классификации данных ...................................... 10
1.3. Устранение дисбаланса классов на основе применения методов
семплирования ........................................................................................... 14
1.4. Первичный анализ данных ........................................................................ 18
1.4.1. Графический анализ данных ............................................................ 19
1.4.2. Исследование законов распределения данных ............................... 20
1.4.3. Анализ взаимосвязей признаков ...................................................... 23
1.4.3.1. Корреляционный анализ взаимосвязей
количественных признаков ................................................... 25
1.4.3.2. Корреляционный
порядковых признаков .......................................................... 27
1.4.3.3. Корреляционный анализ взаимосвязей
классификационных признаков ............................................ 31
1.4.3.4. Дисперсионный анализ данных............................................ 32
1.5. Наивный байесовский классификатор ..................................................... 36
1.6. Оценка точности моделей классификации .............................................. 42
1.7. Контрольные вопросы к разделу 1 ........................................................... 50
2. Решение задачи классификации в среде R ................................................. 53
2.1. Подготовка данных для анализа ............................................................... 54
2.2. Устранение дисбаланса классов ............................................................... 56
2.3. Проведение первичного анализа данных ................................................. 59
2.3.1. Оценка закона распределения данных ............................................ 59
2.3.2. Исследование
2.4. Применение наивного байесовского классификатора ............................ 74
2.5. Контрольные вопросы к разделу 2 ........................................................... 85
Библиографический список ................................................................................. 86
ОГЛАВЛЕНИЕ
анализ взаимосвязей
взаимосвязей признаков .......................................... 62
ВВЕДЕНИЕ
В настоящее время наблюдается постоянный рост объемов инфор­мации, описывающей реальные процессы и явления или особенности функционирования конкретных объектов в разных предметных обла­стях. Поэтому ставятся задачи, связанные с анализом и обработкой всё больших объемов накопленной разнотипной информации с помощью современных технологий и программных средств.
Одно из современных направлений в зано с применением технологий Data Mining и использованием стати­стических методов анализа данных и машинного обучения. Под Data Mining (эквивалент русскоязычного понятия «интеллектуальный анализ данных») понимается процесс исследования больших объемов данных с целью выявления закономерностей и скрытых знаний, которые впо­следствии применяются к новым массивам данных [9].
Задача классификации данных – одна в рамках направления Data Mining, и связана с разработкой классифика­ций и построением правил отнесения объектов к тому или иному классу.
Решение прикладной задачи классификации данных в любой пред­метной области (медицина, экономика, социология и т. п.) – это всегда сложный и творческий процесс, который предполагает выполнение по­следовательности взаимосвязанных этапов. Каждый из этапов связан с применением комплекса методов обработки и анализа данных, интер­претацией полученных промежуточных и итоговых результатов и при­нятием обоснованных решений на их основе.
В учебном пособии рассматривается комплексный алгоритм реше­ния задачи классификации, который описывает все этапы решения, а не только непосредственно этап классификации. Алгоритм представ­ляет собой последовательность из итерационно взаимодействующих этапов: постановка задачи; подготовка данных для обработки; анализ и устранение дисбаланса классов; первичный (разведочный) анализ дан­ных; классификация; анализ и интерпретация полученных результатов.
области обработки данных свя-
из основных задач, решаемых
4
Отметим, что в общий алгоритм включен этап устранения дисбаланса класса, который позволяет повысить точность и обоснованность клас­сификационных решений.
Учебное пособие разбито на две большие части, каждая из которых, в свою очередь, включает теоретический и практический разделы.
В первой части пособия приведены ключевые этапы решения задачи классификации данных и методы, применяемые
на каждом из этапов. В качестве метода классификации рассмотрен наивный байесовский классификатор. Это один из базовых, наиболее простых методов клас­сификации, который позволяет построить интерпретируемую модель.
Вторая часть пособия посвящена рассмотрению методов и моделей, которые применяются непосредственно на этапе классификации дан­ных, включая этап сравнения и выбора оптимальной модели по
сово-
купности показателей точности.
В рамках теоретического раздела учебного пособия представлено описание методов и моделей, используемых на каждом из этапов реше­ния задачи классификации. Для каждого метода даны его краткое тео­ретическое описание, идея метода, математическая модель, лежащая в основе метода, условия использования и область применения.
В практическом разделе учебного пособия
рассматривается сквоз-
ной пример решения прикладной задачи классификации сотрудников
IT-компании на основе рассмотрения их показателей эффективности KPI (Key Performance Indicators) с помощью методов и подходов, опи-
санных в теоретическом разделе. Подробно представлены все этапы ре­шения задачи классификации: от подготовки исходных данных, выбора и обоснования предикторных признаков до оценки адекватности и точ­ности построенной модели классификатора.
В качестве программной среды реализации методов и алгоритмов выбран язык R и среда RStudio. Приведены скрипты
реализации всех рассмотренных методов обработки и классификации данных, что позво­ляет их использовать для решения собственных задач.
R – интерпретируемый язык программирования и среда для стати­стических вычислений и графического анализа с открытым исходным кодом [17]. R широко используется как статистическое программное обеспечение, поддерживается большим и активным исследовательским сообществом по всему миру и фактически
стал стандартом в области анализа данных. В R реализованы все актуальные методы статисти­ческого анализа данных [11, 14, 15, 20, 21], а также множество спе­цифических алгоритмов для решения узкоспециализированных задач
5
из разных предметных областей. К достоинствам R относится возмож­ность создания графиков высокого качества, которые могут быть экс­портированы в основные графические форматы и далее использоваться в презентациях и научных публикациях.
Функции R объединяются в пакеты – загружаемые модули, которые подключаются к любой программе и предоставляют объединенные в них вычислительные средства. Причем пакеты для
R могут разрабаты­ваться и на других языках программирования. В целом R, как язык про­граммирования, довольно прост и имеет ограниченные функциональ­ные средства, что компенсируется возможностью неограниченного его расширения с помощью пакетов. В базовую поставку R включен основ­ной набор пакетов, а всего по состоянию на сентябрь 2024 года доступно более 21 000 пакетов [19]. Кроме
того, R интегрирован в профессиональ­ные статистические пакеты, такие как Statistica, SPSS, SAS, что позво­ляет запускать код R в оболочке пакета.
6
1. ЗАДАЧА КЛАССИФИКАЦИИ ДАННЫХ МЕТОДЫ И МОДЕЛИ
1.1. ПОСТАНОВКА ЗАДАЧИ КЛАССИФИКАЦИИ ОСНОВНЫЕ ОПРЕДЕЛЕНИЯ И ПОНЯТИЯ
Понятие классификации является одним из основополагающих в научной и практической деятельности человека. Под классифика­цией понимается разделение рассматриваемой совокупности объектов или явлений на однородные (в определенном смысле) группы. При этом термин «классификация» используется в зависимости от контекста для обозначения как самого процесса разделения, результата [7, 18].
В математической статистике задача классификации является базо­вой и предполагает распределение исследуемых объектов на классы по выделенным наиболее существенным признакам, присущим объектам данного типа (рода) и отличающим их от объектов других типов (ро­дов) [10]. Выделяют два типа задач классификации, которые носят названия соответственно: «классификация без учителя ция с учителем» [7, 18]. В первом случае отсутствует априорная инфор­мация о разделении объектов на классы, и задача заключается в разбие­нии объектов на однородные (в смысле принятой метрики) группы на основании рассмотрения совокупности значений признаков, описы­вающих исследуемые объекты. Задачу «классификации без учителя» еще называют в литературе задачей сономии. Во втором случае присутствует обучающая выборка, в кото­рой каждый из объектов отнесен к одному из априорно выделенных классов, и необходимо построить правило отнесения объекта к классу. В настоящем учебном пособии рассматривается задача классификации во второй постановке.
кластеризации или численной так-
» и «классифика-
так и его
7
Математическая постановка задачи классификации
x
K
x
X
X
K
Пусть имеется X – множество описаний объектов, Y – множество но- меров (наименований, меток) классов. Существует неизвестная целевая
зависимость – отображение
*
: ,yX Y
только на объектах конечной обучающей выборки: где
y
личество объектов;
значение j-го признака (атрибута), измеренного на i-м объекте;
ij
номер (метка) класса, к которому принадлежит i-й объект; nко-
i
p – количество признаков.
значения которой известны
,
ij i
np
,1
ij
n
{, }
Xxy
Необходимо построить алгоритм (правило), позволяющий класси­фицировать произвольный объект
.xX
Под объектом понимается элемент множества X. Под признаком или атрибутом понимается независимая (предикторная) переменная, описы­вающая свойство объекта. Классом называется зависимая переменная,
{, , , }
которая принимает любое значение из множества
YCC C
12
K – количество классов.
В частном случае выделяют только два класса, и соответственно ре­шается задача бинарной классификации с двумя непересекающимися классами.
В области машинного обучения классификация относится к типу за­дач обучения по прецедентам (
supervised learning, обучение с учите-
лем). В обучении с учителем набор данных организован как коллекция
,
np
размеченных образцов
(, )
xy
ij i
. Каждый из n элементов коллек-
,1
ij
ции называется вектором признаков, обозначим его для простоты
(, , , ).
xx x Каждое измерение вектора признака описывает не-
12
которую характеристику образца (объекта): нейшем X = x – компактная запись для Под меткой
{ , , , }.
YCC C
12
p
XX В даль-
12
(, , , ).
xX x X x
112 2
y
подразумевается элемент конечного множества классов
i
., , ,
p
pp
Основная цель алгоритма обучения с учителем заключается в созда­нии модели на основе предоставленного набора данных. Эта модель принимает векторы признаков в качестве входных данных и предостав­ляет информацию, позволяющую определить соответствующую метку
(класс) для данного вектора признаков.
,
,
8
Задача классификации в машинном обучении состоит в автоматиче­ском определении метки для неразмеченного образца. Для решения этой задачи применяется алгоритм обучения классификатора, в котором используется набор размеченных данных для создания модели.
При построении классификатора исходная выборка разбивается на две части – обучающую и тестовую. Модель классификатора строится на обучающей выборке, а точность
классификации проверяется на объ-
ектах тестовой выборки.
Все признаки, описывающие объект, подразделяются на количе­ственные (числовые) и качественные (категориальные). При этом каче­ственные признаки разделяются, в свою очередь, на порядковые и клас­сификационные. Значения признаков измеряются в соответствующих шкалах, на каждой из которых допустимы определенные математиче­ские операции.
Количественные признаки –
признаки, которые регистрируются с помощью чисел, имеющих содержательный смысл. Количественные признаки измеряются в количественной шкале, на которой допустимы все арифметические операции и операции сравнения. К количествен­ным признакам относятся, например, возраст, доход, стаж работы, рост, вес и т. п.
Порядковые (ранговые, ординальные) признаки – признаки, которые
измеряются в порядковой шкале,
на которой допустимы только опера­ции сравнения. К ранговым признакам относятся, например, уровень сертификации (1 – низкий; 2 – средний, 3 – высокий), воинские звания, сорта продуктов и т. п.
Классификационные (номинальные) признаки – признаки, принима­ющие значения из некоторого ограниченного набора неисчисляемых ка­тегорий. Измеряются в категориальной шкале, для которой недопу­стимы арифметические операции, а
из операций сравнения допустимы
только «равно» и «не равно» (например, пол, цвет и т. п.).
Разработано множество статистических методов разных классов, позволяющих решать задачу классификации. Выбор методов зависит от ряда факторов, среди которых можно выделить следующие: свойства исходных данных; типы признаков; наличие и структура взаимосвязей между признаками; требования к результатам классификации
; возмож­ность обрабатывать данные большого объема и заданные временные ограничения на реализацию процедуры классификации. Однако оконча­тельный выбор метода классификации выполняется после проведения экспериментальных исследований (апостериори) и построения модели
9
классификатора. Выбор опирается на оценку точности классификации, сравнительный анализ точности разных классификаторов, анализ и ин­терпретацию полученных результатов.
1.2. ЭТАПЫ РЕШЕНИЯ ЗАДАЧИ КЛАССИФИКАЦИИ ДАННЫХ
Процесс решения задачи классификации можно представить в виде укрупненного алгоритма, состоящего из последовательности взаимо­связанных этапов. Этапы алгоритма итерационно взаимодействуют друг с другом, на каждом шаге возможен возврат на предыдущие этапы для их уточнения и корректировки с учетом анализа промежуточных ре­зультатов. В рамках каждого этапа применяется комплекс методов ста­тистического
анализа данных и машинного обучения с целью построе­ния наиболее точных моделей классификации и достижения конечных прикладных целей исследования.
Укрупненно алгоритм решения задачи классификации состоит из
следующих этапов (рис. 1).
Этап 1. Постановка задачи. Выполняется постановка задачи клас­сификации на предметно-содержательном уровне, описываются пред­мет и объекты статистического исследования, научные
и практические выводы, которые должны быть получены в результате решения задачи, формулируются требования к представлению результатов.
Далее выполняется формализация задачи классификации. Формули­руются цели исследования в терминах основных типов прикладных за­дач, решаемых в теории статистических методов классификации.
Определяются исходные данные, включая словесное, содержатель­ное описание признаков, измеренных на исследуемых
объектах, типов признаков, их возможных значений и диапазонов изменения. Задается объем выборки, который описывает количество исследуемых объектов. Если исходные данные не собраны перед проведением исследования, то составляется и реализуется план сбора информации, определяется форма представления информации. В этом случае сбор данных выделя­ется в отдельный информационный этап.
На базе содержательной постановки
задачи, анализа природы исход­ных статистических данных осуществляется предварительный (априор­ный) выбор базовых математических моделей для решения задачи клас­сификации, которые целесообразно использовать. Определяются про­граммные средства реализации методов и алгоритмов решения задачи
10
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]