Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Методы бизнес-аналитики. Учебное пособие.pdf
X
- •ВВЕДЕНИЕ
- •1.5.3. Фреймовая модель представления знаний
- •1.5.4. Продукционная модель представления знаний
- •1. Основы систем интеллектуального анализа данных
- •1.1. История искусственного интеллекта
- •1.2. Экспертные системы
- •1.3. Системы бизнес-аналитики
- •1.4. Данные и знания
- •1.5. Модели представления знаний
- •1.5.1. Логическая модель представления знаний
- •1.5.2. Семантическая модель представления знаний
- •1.5.5. Нейронная сеть как модель представления знаний
- •2.1. Технология интеллектуального анализа данных
- •2.1.1. Виды данных
- •2.1.2. Data Mining
- •2.1.3. Статистические методы многомерного анализа данных
- •2.1.4. Машинное обучение
- •2.1.5. Общие методы поиска решений в продукционных системах
- •2.1.6. Классификация и кластеризация
- •2.2. Методы кластерного анализа (обучение без учителя)
- •2.3. Методы классификации (обучение с учителем)
- •4. Практикум
- •4.1.1. Импорт данных
- •4.2. Кластерный анализ
- •Практическое занятие 1. Сегментация данных
- •4.3. Самоорганизующиеся карты признаков
- •Практическое задание 2. Построение и анализ самоорганизующихся карт признаков
- •4.4. Классификация с помощью дерева решений
- •4.4.1. Алгоритм построения дерева решений
- •Задание для самостоятельной работы
- •4.4.3. Построение дерева решений в автоматическом режиме
- •4.5. Нейросетевые модели
- •4.5.1. Классифицирующая нейросеть
- •4.5.2. Нейросетевая модель прогнозирования
- •4.6. Поиск ассоциативных правил
- •Практическое задание 6. Поиск ассоциативных правил
- •ЗАКЛЮЧЕНИЕ
- •ВОПРОСЫ К Экзамену
- •БИБЛИОГРАФИЧЕСКИЙ СПИСОК

11
если условие то действие (событие)
или иначе
если антецедент то консеквент.
Система знаний формируется в виде продукционных правил и стратегии
их выбора. Правила имеют простую и ясную нотацию, что особенно важно для
осуществления эффективной семантической коммуникации между экспертом в
предметной области и разработчиком интеллектуальной системы. Рассмотрим
особенности их применения.
Концептуальная модель предметной области и система знаний могут
быть представлены в виде древовидной логической схемы (поля знаний).
Процесс логического вывода может вестись от некоторого начального
состояния к целевому (прямой вывод или вывод, управляемый данными) или,
наоборот, от некоторой гипотезы к ее подтверждению (обратный вывод или
вывод, управляемый целями). При большом числе правил знания трудно
обозримы и логический вывод выполняется очень долго. Часто для
определения стратегии выбора, применяемой на каждом шаге продукции,
используют различные эвристики.
Текущее состояние решаемой задачи называют статическими знаниями, а
набор продукций – динамическими. В большинстве фреймовых систем
функции, описывающие структурную модель предметной области, являются
базовыми, а динамические знания и процесс логического вывода
рассматриваются как надстройка. Классические продукционные системы
используют для описания состояний триады “объект–атрибуты–значение”. Все
множество знаний обычно структурируется на основе и-или графа (рис. 1.2).
Событиями на нижнем уровне графа могут быть указание исходных
компонентов, сочетание значений признаков объекта. Консеквент правила
указывает категорию объекта. В реальных условиях, когда число объектов
исчисляется десятками, а количество их признаков – сотнями, представление
поля знаний вручную чрезвычайно затруднено: консеквенты большинства
правил указывают на абстрактные категории, а увеличенное число условий в
антецеденте трудно сформировать умозрительно. Автоматическое построение
логической структуры в виде дерева решений возможно на основе применения
алгоритмов обучения распознаванию образов.

12
Правило 3
или
и
и
Правило
1
Правило 2
События
События
Условие 2
Условие 1
Условие 3
Рис. 1.2. Фрагмент структуры и-или графа
Продукционно-фреймовая модель знаний, имеющая широкое практическое применение, позволяет определять наборы правил непосредственно во
фреймах. Декомпозиция области знаний на множество представляемых
фреймами концептов остается постоянной в процессе логического вывода.
Семантика процесса вывода инициирует вычисление неизвестных заранее
значений слотов, например, характеристик объектов. Динамические знания
образуются присоединенными процедурами и процедурами-демонами. Первые
служат для определения значений слотов (процедуры-запросы), а демоны
срабатывают при присваивании или изменении значения слота. Данная модель
обеспечивает естественное распределение динамических знаний между узламиконцептами.
1.5.5. Нейронная сеть как модель представления знаний
Нейронные сети содержат знания не в символьном (явном) представлении, а в состояниях множества нейроподобных элементов и связей между ними.
Подобным способом представляют знания также нечеткие когнитивные графы
(fuzzy cognitive maps). В процессе обучения знания обычно формируются в
форма весов связей между нейронами. Нейронные сети ориентированы на
параллельную обработку информации и соответствующую аппаратную
поддержку для работы в реальном времени. Их особенностью является замена
этапа формализации знаний обучением на примерах. Трудности вербализации
результатов работы нейронной сети затрудняют построение подсистемы
объяснений интеллектуальной обучающей системы.
В условиях значительного разнообразия объектов и их атрибутов, когда
переход к формальному описанию, допускающему семантическую интерпретацию, затруднен, оправданным выглядит выбор продукционно-фреймовой
модели, основанной на классическом логическом выводе и явном
представлении знаний. Фреймовая иерархия обеспечивает естественный способ
кластеризации знаний, а ее расширение обеспечивает сочетание декларативных
знаний и процедурных компонентов.

13
2. МЕТОДЫ ПОИСКА РЕШЕНИЙ И ФОРМИРОВАНИЯ БИЗНЕС-
ПРАВИЛ
2.1. Технология интеллектуального анализа данных
2.1.1. Виды данных
Описания объектов, хранящихся в БД, содержат признаки различного
типа. По виду шкалы принимаемых значений признаки подразделяются:
− на количественные, числовые, которые могут измеряться двумя типами
шкал. Наиболее мощная шкала – шкала отношений, в которой есть точка
отсчета и возможны отношения между значениями шкалы, например, цена на
картофель в супермаркете выше в 1,2 раза, чем цена на рынке. Интервальная
шкала – шкала, разности между значениями которой могут быть вычислены,
однако их отношения не имеют смысла, например, температура воды. Нельзя
сказать, что температура 15° в 1,5 раза выше значения 10°;
− порядковые, ординальные. Порядковая шкала дает возможность
ранжировать значения переменных, например, предпочтения экспертов, место
(рейтинг) товара среди аналогичных моделей изделия. Для этой шкалы
применимы только операции: равно (=), не равно (≠), больше (>), меньше (<);
− номинальные, классификационные. Наименее мощная номинальная
шкала содержит только категории; данные в ней не могут упорядочиваться, с
ними не могут быть произведены никакие арифметические действия.
Номинальная шкала состоит из названий, категорий, имен для классификации
объектов. Например, цвет, фасон изделия, профессии, город проживания,
семейное положение.
Ряд методов анализа данных могут обрабатывать лишь признаки,
имеющие числовой тип (т. е. непрерывный характер), а их значения должны
быть распределены в определенном диапазоне. Для нейросетевых моделей
часто применяют линейную нормализацию исходных значений в пределах [0, 1]
или в пределах [–1, 1]. Иногда выполняют нелинейную нормализацию с
использованием сигмоидной логистической функции или гиперболического
тангенса. Нормализация позволяет привести все используемые числовые
значения переменных к одинаковой области их изменения, благодаря чему
появляется возможность свести их вместе в одной нейросетевой модели.
Порядковая и номинальная шкалы являются дискретными, зачастую
используется строковый тип данных. В этом случае для нормализации
выполняется преобразование уникальных значений в их индексы или
осуществляется преобразование дискретных значений в битовую маску, т. е.
каждому уникальному значению ставится в соответствие уникальная битовая
комбинация. Возможны два способа такого преобразования:
1) позиция бита – дискретное значение признака в этом случае
представляется в виде n битов, где n – число уникальных значений признака.
Каждый бит соответствует одному значению. В 1 устанавливается только бит,
соответствующий текущему значению признака, все остальные биты равны 0.
Этот способ кодирования используется при малом числе уникальных значений;

14
2) комбинация битов – каждому уникальному значению соответствует
своя комбинация битов в двоичном виде.
Для численного представления качественных свойств номинальные и
порядковые переменные также преобразуют к бинарному типу, со значениями
“0” или “1”. Для этого вводятся новые бинарные переменные, соответствующие
категориям или уровням значений исходных признаков. Например, для
признака, имеющего 4 дискретных уровня, потребуется создать четыре новых
переменных, которые будут принимать значения 0 или 1. Такие признаки
можно обрабатывать как количественные и вместе с ними. Вычисления можно
проводить по формулам для количественных признаков с использованием евклидовой метрики. Фиктивные признаки (dummy) позволяют интерпретировать
частный коэффициент регрессии для любой бинарной переменной так же, как
это делается в случае измерения по интервальной шкале.
2.1.2. Data Mining
Технология интеллектуального анализа данных или Data Mining
представляет целый спектр методов, предназначенных для извлечения из
данных практически полезных и доступных интерпретации знаний различного
типа [4]. Он включает две основные группы методов – индуктивные методы
машинного обучения и статистические методы. Каждый из методов
предназначен для решения определенного круга задач – кластеризации,
установления зависимостей между переменными, классификации, выявления
закономерностей между связанными событиями. При этом задается модель
заданной структуры (например, нейронная сеть, дискриминантные функции,
линейная регрессия), а ее параметры подстраиваются под данные,
описывающие наблюдаемые объекты.
С направлением Data Mining пересекаются методы обнаружения знаний в
базах данных (Knowledge di sc ove ry in data, KDD ).
2.1.3. Статистические методы многомерного анализа данных
Статистические методы многомерного анализа данных относятся к
методам прикладной статистики, которая включает не только методы
описательной статистики, предназначенные для представления случайных
величин, и методы проверки гипотез, но также методы обнаружения
закономерностей, взаимосвязей между характеристиками объекта. К ним
относятся корреляционно-регрессионный анализ, факторный анализ, метод
главных компонент, анализ временных рядов и другие методы. Подбор
параметров модели, представляющей зависимости между характеристиками
многомерного объекта, выполняется на основе выборок методом наименьшего
квадрата. Для получения надежных моделей выборка должна быть
представительной (репрезентативной).
2.1.4. Машинное обучение
Машинное обучение (Machine Learning) изучает методы и алгоритмы
построения моделей, способных обучаться по прецедентам. Такое индуктивное

15
обучение основано на извлечении знаний и закономерностей из данных. В
n,1
А
N,1
отличии от дедуктивного обучения, которое основано на получении
(эксплицировании) неявных знаний специалистов для дальнейшей их
формализации в базе знаний экспертной системы.
Исходными для машинного обучения являются описания объектов-
прецедентов
словаря X
ω
, i=
i
, которые характеризуют свойства {X jj=
A
, значениями признаков (xi1, …, x
i j
, …, x
) априорного
iN
A
} объектов-
прецедентов, и сведения о принадлежности объектов-прецедентов к одному из
классов
Ω
m, Ω m ⊂ Ω, Ω = Ω
∪ Ω
1
∪…∪ Ω
2
M. Множество классов Ω отражает
различные группы объектов. Для указания класса объекта используется
соответствующая классификационная переменная Y.
2.1.5. Общие методы поиска решений в продукционных системах
Продукционные системы искусственного интеллекта оперируют двумя
основными категориями: фактами (например, первичными знаниями о
значении показателя объекта) и правилами. Комбинируя их, требуется получить
новые знания (например, принадлежность объекта к заданному классу). При
достаточном описании предметной области используются деревья решений,
выводы на фреймах и в семантических сетях, дедуктивные методы поиска
решений. При поиске решений в условиях неопределенности используются
методы, основанные на вероятностной байесовской логике, нечеткой логике и
приближенных рассуждениях.
2.1.6. Классификация и кластеризация
Задачей классификации называют предсказание номинальной выходной
переменной, значениями которой являются категории, на основе выборки
непрерывных и (или) номинальных входных переменных.
Если выходная переменная может принимать только два значения (да или
нет, 0 или 1), то имеет место задача бинарной классификации. Например,
нужно предсказать, кто из клиентов фирмы является потенциальным
покупателем определенного товара (услуги), а кто – нет.
В общем случае зависимая переменная может принимать значения из
некоторого множества предопределенных классов. Например, когда
необходимо предсказать, какую марку автомобиля захочет купить клиент.
Таким образом, цель построения модели классификации заключается в
том, чтобы, используя входные признаки (прогнозирующие атрибуты),
получить значение зависимой классификационной переменной.
Алгоритм, определяющий, какому из предопределенных классов
принадлежит объект по вектору признаков, называется классификатором.
Для построения модели классификации используется обучающее
множество (training set). Оно содержит входные и выходные значения
признаков объектов. Выходные значения предназначены для обучения модели.
Каждый объект представляет собой запись базы данных.

16
Тестовое (test set) множество также содержит входные и выходные
значения признаков. Выходные значения используются для проверки
работоспособности модели.
Разделение на обучающее и тестовое множества осуществляется путем
деления выборки в определенной пропорции, например обучающее множество
– две трети данных и тестовое – одна треть данных. Этот способ следует
использовать для выборок с большим количеством объектов. Если же выборка
имеет малые объемы, рекомендуется применять специальные методы, при
использовании которых обучающая и тестовая выборки могут частично
пересекаться [3].
Оценка точности классификации проводится при помощи кросс-проверки
(Cross-validation) на данных из тестового множества, которое также называют
кросс-проверочным множеством. Точность классификации тестового
множества сравнивается с точностью классификации обучающего множества.
Если классификация тестового множества дает приблизительно такие же
результаты по точности, как и классификация обучающего множества,
считается, что данная модель прошла кросс-проверку.
Примеры задач классификации
В банковском деле классификация применяется для решения задач
скоринга, определения кредитного рейтинга клиентов с целью минимизировать
риски при выдаче кредитов, выявления мошенничества с кредитными картами.
В розничной торговле классификация может использоваться для
выделения покупателей с определенными предпочтениями, что позволит более
полно удовлетворять спрос и гибко реагировать на его изменения,
прогнозировать состояние рынков.
В военной технике с помощью классификации можно распознавать цель
по параметрам отраженного сигнала.
В биомедицине с помощью классификации можно диагностировать
заболевания на основе наблюдаемых симптомов (температура, давление, состав
крови и т. д.), оценивать ожидаемые результаты лечения.
В системах безопасности классификация используется для распознавания людей на основе биометрических показателей: отпечатков пальцев, формы
лица, распределения цвета на радужной оболочке глаза и т. д. – в целях
организации их доступа в закрытые зоны.
Задача кластеризации отличается от задачи классификации тем, что
классы объектов заранее не предопределены.
Кластеризация предназначена для разбиения совокупности объектов на
однородные группы (кластеры или классы). Если данные выборки представить
как точки в признаковом пространстве, то задача кластеризации сводится к
определению “сгущений точек”.
Можно назвать два критерия выделения кластера:
− внутренняя однородность объектов;
− внешняя изолированность от других кластеров.
Специалисты в различных областях для группировки объектов по
похожести их свойств оперируют рядом терминов – таксономия, сегментация,

17
группировка, автоматическая классификация, самоорганизация. В Data Mining
принято употреблять термин “кластеризация”.
Кластеризация может использоваться для решения различных задач.
Изучение данных. Разбиение множества объектов на схожие группы
помогает выявить структуру данных, увеличить наглядность их представления,
выдвинуть новые гипотезы, понять, насколько информативны свойства
объектов.
Сжатие данных. В случае, когда данные имеют большой объем (сотни
тысяч и миллионы строк), кластеризация позволяет сократить объем хранимых
данных, оставив по одному наиболее типичному представителю от каждого
кластера.
Прогнозирование. Кластеры используются не только для краткого
описания имеющихся объектов, но и для распознавания новых. Каждый новый
объект относится к тому кластеру, присоединение к которому наилучшим
образом удовлетворяет критерию качества кластеризации. Значит, можно
прогнозировать поведение объекта, предположив, что оно будет схожим с
поведением других объектов кластера.
Подготовка данных для последующего анализа. Данные о кластерах, их
индивидуальные описания могут использоваться для других задач Data Mining:
классификации, регрессии, ассоциации, последовательных шаблонов.
Обнаружение аномалий. Кластеризация применяется для выделения
нетипичных объектов, которые не присоединяются ни к одному из кластеров.
Эту задачу также называют обнаружением аномалий (outlier detection). Интерес
здесь представляют кластеры (группы), в которые попадает крайне мало,
скажем 1–3, объектов.
Примеры использования метода кластеризации
Для выявления практической значимости результатов кластеризации
необходимо провести содержательную интерпретацию каждого кластера. Такая
интерпретация предполагает присвоение каждому кластеру емкого названия,
отражающего его суть, например «Разведенные женщины с детьми»,
«Дачники», «Работающие студенты» и т. д. Для интерпретации аналитик
детально исследует каждый кластер: его статистические характеристики,
распределение свойств объекта в кластере, оценивает мощность кластера –
число объектов, попавших в него.
Розничная торговля. Подготовка данных для последующего анализа. Для
сети розничных магазинов выявление совместно покупаемых продуктов
приводит к громоздким вычислениям с большим числом ассоциативных
правил. При помощи кластеризации покупатели могут быть разделены на
несколько групп, а ассоциативные правила выявляются в каждой группе
отдельно. Это позволяет упростить поиск ассоциативных правил отдельно для
каждой группы покупателей.
Банкинг. Изучение данных, подготовка данных для последующего
анализа. Отдел продаж коммерческого банка, работающего на рынке
розничного кредитования, задался целью изучить профили потенциальных
клиентов, подающих заявки на потребительский кредит. Очень малочисленным

18
оказался кластер под названием «Молодежь» – работающие студенты и
молодые люди в возрасте до 23 лет. Оказалось, что у банка не было точек
продаж кредитов в тех районах города, где сосредоточены университеты и
институты. Данный факт был учтен службой продаж и службой развития
бизнеса банка
Банкинг. Прогнозирование. Исследование клиентов банка, взявших
автокредит, при помощи инструментов кластеризации выделило кластер, в
который попали мужчины в возрасте от 23 до 28 лет, проживающие в
Московской области менее года. Их объединяло то, что практически все они
имели длительные просрочки по кредиту. Скорее всего, это молодые люди,
переоценившие свои возможности, либо мошенники. Данная информация была
учтена банком при разработке скоринговых карт.
Телекоммуникации. Изучение данных. Анализ базы данных клиентов
крупной сети сотовой связи позволил выделить несколько кластеров. Самым
малочисленным кластером оказались пожилые женщины, совершающие звонки
в весеннелетнее время. С большой долей вероятности – это пенсионеркидачницы, значительную часть теплого времени года проживающие за
городом. Для увеличения численности этого кластера был разработан
соответствующий тарифный план, который наилучшим образом устраивал бы
абонентов этой группы.
Страхование. Обнаружение аномалий. Кластеризация клиентов
страховой компании, застрахованных от несчастных случаев, выявила
небольшой по объему кластер, в котором фигурировали одни и те же фамилии
врачей; суммы страховых выплат тоже варьировались незначительно. Проверка
показала, что в 90 % таких случаев имел место сговор с врачом.
Государственные службы. Изучение данных. В ходе исследования базы
данных миграционной службы, в которой содержалась информация о людях,
переехавших из села в город (возраст, образование, семейное положение и т.д.),
с помощью алгоритма кластеризации было выделено несколько групп,
характеристики которых позволили дать им содержательную интерпретацию.
Например, выделился кластер, куда вошли женщины в возрасте более 60 лет,
дети которых живут в городе. С большой вероятностью – это бабушки, которые
едут в город нянчить своих внуков. Выделились также кластеры
«Демобилизованные солдаты», «Невесты» и др.
2.2. Методы кластерного анализа (обучение без учителя)
На сегодняшний день предложено несколько десятков методов
кластеризации. Их можно разделить на две группы: иерархические и
неиерархические. Используя различные методы для одних и тех же данных,
можно получить различные решения. Это считается нормальным явлением.
Иерархическая кластеризация (hierarchical clustering) характеризуется
построением иерархической, или древовидной, структуры. Такие методы могут
быть агломеративными (объединительными) и дивизимными (разделяющими).
Группа агломеративных методов (Agglomerative Nesting, AGNES)
характеризуется последовательным объединением исходных объектов и

19
соответствующим уменьшением числа кластеров. В начале работы алгоритма
все объекты являются отдельными кластерами. На первом шаге наиболее
похожие объекты объединяются в кластер. На последующих шагах
объединение продолжается до тех пор, пока все объекты не будут составлять
один кластер.
Дивизимные (делимые) методы (DIvisive ANAlysis, DIANA) являются
противоположностью агломеративным методам – в начале работы алгоритма
все объекты принадлежат одному кластеру.
Иерархические методы кластеризации различаются правилами, которые
используются для решения о схожести объектов при их объединении в группу
(агломеративные методы) либо разделении на группы (дивизимные методы).
Иерархические методы используются при небольших выборках. Их
преимуществом является наглядность – алгоритмы приводят к построению
дендрограмм (от греч. dendron – дерево), которые и являются результатом
иерархического кластерного анализа.
Дендрограмма содержит n уровней, каждый из которых соответствует
одному из шагов процесса последовательного укрупнения кластеров.
В дендограмме объекты могут располагаться вертикально или
горизонтально. Пример вертикальной дендрограммы приведен на рис. 2.1.
Рис. 2.1. Пример дендограммы
Числа 11, 10, 3 и т. д. соответствуют номерам объектов или наблюдений
исходной выборки. Первоначально каждое наблюдение представляет один
кластер (вертикальная линия). На первом шаге происходит объединение
наблюдений 11 и 10; 3, 4 и 5; 8 и 9; 2 и 6. На втором шаге продолжается
объединение в кластеры наблюдений 11, 10, 3, 4, 5 и 7, 8, 9. Данный процесс
продолжается до тех пор, пока все наблюдения не объединятся в один кластер.
Методы иерархического кластерного анализа различаются мерами
сходства / различия. В качестве таких мер используются так называемые
метрики. Наиболее часто используется метрика «Евклидово расстояние».
Множество точек, равноудаленных от некоторого центра, при использовании
евклидовой метрики будет образовывать сферу, поэтому кластеры, полученные
с использованием евклидова расстояния, также будут иметь форму, близкую к
сферической.
Для вычисления расстояний между объектами могут использоваться
также метрики «расстояние Манхэттена» (кластеры, построенные на основе
расстояния Манхэттена, стремятся к кубической форме):

20
∑
=
−=
N
1
j
kjij
ki
x
x)
,(
d
ω
ω
,
∑ ∑
= ∈
→−
k
1
m x
2
m
j
mj
min)x(
Ω
µ
m
Ω
m
µ
m
Ω
где N – размерность признакового пространства, «Чебышевское расстояние»,
«расстояние по Камберру» и др. Для номинальных признаков в качестве меры
расстояния может использоваться функция отличия (diferent function).
Методы иерархического кластерного анализа также используют
различные методы определения расстояний между кластерами: метод
ближайшего соседа, метод наиболее удаленных соседей и др.
При большом количестве наблюдений иерархические методы кластерного
анализа не пригодны. В таких случаях используют неиерархические методы,
которые представляют собой итеративные методы дробления исходной
выборки. В процессе деления новые кластеры формируются до тех пор, пока не
будет выполнено правило остановки.
Наиболее распространен среди неиерархических методов алгоритм k-
средних (k-means), также называемый быстрым кластерным анализом.
Алгоритм k-means выполняет разделительную кластеризацию (partitioning
clustering), для которой заранее задается число кластеров k (k < n).
Случайным образом выбираются начальные центры («семена»)
кластеров. Для каждой записи исходной выборки определяется ближайший к
ней центр кластера. Производится вычисление центроидов как среднего
вектора для каждого значения признака. Центроид становится центром
кластера. Действие алгоритма таково, что он стремится минимизировать
среднеквадратичное отклонение на точках каждого кластера от центроида:
,
где k – число кластеров,
центроида класстера
.
– полученные кластеры,
– координаты
На каждой итерации перевычисляется центры для каждого кластера.
Алгоритм завершается, когда на какой-то итерации не происходит изменения
кластеров.
Недостатком алгоритма k-means является отсутствие ясного критерия для
выбора оптимального числа кластеров.
Одним из самых популярных алгоритмов кластеризации с
автоматическим выбором числа кластеров является g-means. В его основе
лежит предположение о том, что кластеризуемые данные подчиняются
некоторому закону распределения, например, гауссовскому, откуда и название
алгоритма.
Выбор критерия качества кластеризации
Одно и то же множество объектов можно разбить на k кластеров поразному. Не существует одного универсального алгоритма кластеризации.
Результат кластеризации определяется критерием (целевой функцией).
Например, семейство алгоритмов k-means основано на вычислении расстояний
точек до центров кластера. Они показывают хорошие результаты, когда данные
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
