- •Загрузка данных:
- •Загрузите данные вашего варианта. Учтите, что метки классов могут быть текстом.
- •Визуализируйте данные при помощи диаграммы рассеяния с выделением различных классов.
- •Оцените сбалансированность классов.
- •Проведите предобработку данных при необходимости.
- •Разделите выборку на обучающую и тестовую. На обучающей проводите обучение модели, на тестовой расчет значений метрик.
- •Постройте изображение с границами принятия решения отметив на них точки классов разным цветом. Сделайте выводы о качестве классификации на основе полученного изображения.
- •Рассчитайте значения Precision, Recall, f1 для полученных результатов.
- •Постройте изображение с границами принятия решения отметив на них точки классов разным цветом. Сделайте выводы о качестве классификации на основе полученного изображения.
- •Рассчитайте значения Precision, Recall, f1 для полученных результатов.
- •Логистическая регрессия:
- •Метод опорных векторов:
- •Постройте изображение с границами принятия решения отметив на них точки классов разным цветом. Сделайте выводы о качестве классификации на основе полученного изображения.
- •Рассчитайте значения Precision, Recall, f1 для полученных результатов.
- •Решающие деревья:
- •Проведите классификацию используя решающие деревья, подобрав параметры, при которых получается лучшее обобщение (максимальная глубина/максимальное количество листьев/метрика загрязнения и т.Д.).
- •Постройте изображение с границами принятия решения отметив на них точки классов разным цветом. Сделайте выводы о качестве классификации на основе полученного изображения.
- •Рассчитайте значения Precision, Recall, f1 для полученных результатов.
- •Визуализируйте полученное дерево решений. Сделайте выводы о правилах в узлах дерева. Сопоставьте их с полученными границами принятия решений.
- •Выбор классификатора:
- •Постройте таблицу с метриками Precision, Recall, для полученных результатов каждым классификатором.
- •Сделайте выводы о том, какие классификаторы лучше всего подходят для вашего набора данных и почему.
Выбор классификатора:
Постройте таблицу с метриками Precision, Recall, для полученных результатов каждым классификатором.
Используя предыдущие пункты, составим таблицу с метриками. Результат представлен в Таблице 6.1.1.
Таблица 6.1.1 – Метрики каждого классификатора
Классификатор |
Precision (класс 0) |
Precision (класс 1) |
Recall (класс 0) |
Recall (класс 1) |
Accuracy |
KNN |
0.9667 |
0.9672 |
0.9667 |
0.9672 |
0.9669 |
Логистическая регрессия |
0.9016 |
0.9167 |
0.9167 |
0.9016 |
0.9091 |
Метод опорных векторов |
0.9516 |
0.9831 |
0.9833 |
0.9508 |
0.9669 |
Решающее дерево |
0.9828 |
0.9524 |
0.9500 |
0.9836 |
0.9669 |
Сделайте выводы о том, какие классификаторы лучше всего подходят для вашего набора данных и почему.
Классификаторы демонстрируют близкие результаты по Accuracy для KNN, SVM и дерева (96.69%), в отличии от логистической регрессии (90.91%). KNN показывает идеальную сбалансированность метрик для обоих классов с Precision и Recall около 96.7%. SVM выделяется максимальным Recall для класса 0 (98.33%) и Precision для класса 1 (98.31%), что делает его оптимальным для задач, где важно максимально полно выявлять объекты класса 0 или минимизировать ошибочные отнесения к классу 1. Решающее дерево демонстрирует обратную картину – наивысший Precision для класса 0 (98.28%) и Recall для класса 1 (98.36%), подходя для случаев, где важна точность идентификации класса 0 и полнота охвата класса 1. Логистическая регрессия существенно уступает другим методам по точности (90.91%), что объясняется линейным характером модели.
Выбор оптимального алгоритма зависит от прикладной задачи: KNN обеспечивает баланс, SVM – лучшее выявление объектов класса 0, дерево – точность предсказаний класса 0, а логистическая регрессия может рассматриваться как базовый вариант. Все модели, кроме логистической регрессии, достигают высокой точности, но с разными акцентами в работе с классами. Это и будут классификаторы, лучше всего подходящие для набора данных.
Вывод.
В ходе лабораторной работы был проведен анализ различных методов классификации на наборе данных. Были исследованы четыре основных классификатора: метод k-ближайших соседей, логистическая регрессия, метод опорных векторов и решающие деревья. Для каждого метода проводился подбор оптимальных параметров, анализ границ принятия решений и расчет ключевых метрик качества.
KNN показал стабильно высокие результаты с точностью 96.69%, демонстрируя сбалансированность между классами. Логистическая регрессия из-за линейности, уступила другим методам с точностью в 90.91%. Метод опорных векторов с rbf-ядром проявил себя как наиболее эффективный для обнаружения объектов класса 0, достигнув Recall 98.33%. Решающие деревья, в свою очередь, показали наилучшую точность предсказаний для класса 0 (Precision 98.28%).
Сравнительный анализ метрик позволил понять, что выбор оптимального алгоритма зависит от прикладной задачи. SVM лучше для случаев, когда важно минимизировать пропуск объектов класса 0, тогда как решающие деревья предпочтительнее, когда требуется сочетание высокой точности и понятности модели. KNN остается хорошим универсальным вариантом для стандартных задач классификации. Результаты работы наглядно продемонстрировали, что выбор метода должен определяться требованиями к качеству классификации и особенностями решаемой задачи.
