Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Модификации метода логического анализа данных для задач классификации. Монография.pdf
X
- •ОГЛАВЛЕНИЕ
- •ПРЕДИСЛОВИЕ
- •ВВЕДЕНИЕ
- •1. АНАЛИЗ ЛОГИЧЕСКИХ АЛГОРИТМОВ КЛАССИФИКАЦИИ
- •1.2. АЛГОРИТМЫ ПОИСКА ЗАКОНОМЕРНОСТЕЙ В ФОРМЕ КОНЪЮНКЦИЙ
- •1.3. АНАЛИЗ ОСНОВНЫХ ЛОГИЧЕСКИХ АЛГОРИТМОВ КЛАССИФИКАЦИИ И СПОСОБОВ ИХ ПОСТРОЕНИЯ
- •1.3.1. Решающие списки
- •1.3.2. Решающие деревья
- •1.3.4. Алгоритмы вычисления оценок
- •1.3.3. Алгоритмы простого и взвешенного голосования правил
- •2.1. ПРИЛОЖЕНИЯ В ОБЛАСТИ БИЗНЕСА, ЭКОНОМИКИ И ФИНАНСОВ
- •2.2. ПРИЛОЖЕНИЯ В ОБЛАСТИ МЕДИЦИНЫ И ЗДРАВООХРАНЕНИЯ
- •2.3. ПРИЛОЖЕНИЯ В ОБЛАСТИ ТЕХНИКИ
- •2.4. ПРИЛОЖЕНИЯ В ОБЛАСТИ ФИЗИКИ, ХИМИИ, БИОЛОГИИ
- •2.5. ПРИЛОЖЕНИЯ В ОБЛАСТИ ОБРАБОТКИ И РАСПОЗНАВАНИЯ ИЗОБРАЖЕНИЙ
- •3. МЕТОД ЛОГИЧЕСКОГО АНАЛИЗА ДАННЫХ И ЕГО МОДИФИКАЦИИ
- •3.1. ОПИСАНИЕ ПОДХОДА
- •3.2. БИНАРИЗАЦИЯ ПРИЗНАКОВ
- •3.3. ПОСТРОЕНИЕ ОПОРНОГО МНОЖЕСТВА
- •3.4. ФОРМИРОВАНИЕ ЗАКОНОМЕРНОСТЕЙ
- •3.5. ПОСТРОЕНИЕ КЛАССИФИКАТОРА
- •4.1. СОСТОЯНИЕ ПРОБЛЕМЫ
- •4.2. СВОЙСТВА ПСЕВДОБУЛЕВЫХ ФУНКЦИЙ
- •5. АНАЛИЗ ИСХОДНОЙ ВЫБОРКИ ДАННЫХ
- •5.1. НЕДОСТАТКИ В ИСХОДНОЙ ВЫБОРКЕ ДАННЫХ
- •5.3. ВЫБОР ПУЛА ПРИЗНАКОВ
- •5.4. АЛГОРИТМИЧЕСКАЯ ПРОЦЕДУРА ПОЛУЧЕНИЯ УСЕЧЕННОГО НАБОРА ПРИЗНАКОВ
- •ЗАКЛЮЧЕНИЕ
- •СПИСОК ЛИТЕРАТУРЫ
- •ПРИЛОЖЕНИЕ 1
- •ПРИЛОЖЕНИЕ 2

Это есть мера информационного выигрыша – количество информа-
ции об исходном делении выборки на классы k и не k, которое содержится
в закономерности φ.
Закономерность φ является закономерностью по энтропийному кри-
XIGain
терию информативности, если
большом G
.
0
, > G0 при заданном достаточно
k
Особенностью энтропийного критерия является завышение информативности малых закономерностей; статистический критерий в данном случае
работает лучше. На практике, как правило, используют энтропийный критерий информативности, так как он проще с точки зрения его вычисления.
1.2. АЛГОРИТМЫ ПОИСКА ЗАКОНОМЕРНОСТЕЙ В ФОРМЕ КОНЪЮНКЦИЙ
Информативные закономерности служат исходными данными для
построения логических алгоритмов классификации. Множество предикатов, в котором следует искать информативные закономерности, называют
пространством поиска.
Пространство поиска описывается закономерностями в виде различных эталонных форм.
Параметрическое семейство шаров:
, (1.3)
, rxxx
00
где ρ(x, x0) – метрика в пространстве наблюдений X.
Параметрами являются центр шара x
, его радиус r0, и, вообще гово-
0
ря, сама функция расстояния ρ. В качестве центров берут либо обучающие
наблюдения, либо центры кластеров, найденные, скажем, EM-алгоритмом.
Наиболее информативны шары, внутрь которых попадают наблюдения преимущественно одного класса. Радиусы шаров можно подбирать аналогично
выделению зон: формируется множество (ℓ − 1) пороговых значений, по-
разному разделяющих выборку, и
из них выбирается такое значение радиу-
са, при котором достигается максимум информативности предиката (1.3).
Функция расстояния ρ часто задаётся как линейная комбинация элементарных метрик по некоторому набору признаков },...,1{ n
:
wj
,
xfxfxx,
jjw
где набор ω и коэффициенты αj предполагается оптимизировать по выборке.
– 11 –

Преимущество шарообразных закономерностей в том, что они особен-
x
но хорошо интерпретируются, если число признаков в наборе ω невелико.
Действительно, если наблюдение x покрывается такой закономерностью, то
мы можем говорить о том, что наблюдение x относится к классу c потому,
что оно близко к эталонному наблюдению x
купности признаков ω. Такого рода объяснения хорошо воспринимаются
экспертами в тех предметных областях, где распространён прецедентный
стиль мышления: в медицине, геологии, социологии, юриспруденции и др.
На закономерностях данного типа основаны алгоритмы вычисления
оценок, подробно рассматриваемые в п. 1.3.4 данной работы.
Параметрическое семейство полуплоскостей:
, лежащему в классе c, по сово-
0
xx , (1.4)
где
и смещение ω
ω и ω
преимущественно одного класса.
случаях, когда среди компонент вектора ω мало ненулевых, т. е. когда разделяющие гиперплоскости проводятся в подпространствах небольшой
размерности. Поиск информативных наборов признаков },...,1{ n , ана-
логичных конъюнкциям и шарам, сводится
вариантов. Линейные комбинации большого числа признаков, как правило,
трудно интерпретировать.
,x – скалярное произведение в пространстве наблюдений X.
Параметрами являются направляющий вектор гиперплоскости ω
. Максимизация информативности сводится к подбору таких
0
, при которых по одну сторону гиперплоскости лежат наблюдения
0
Закономерности вида (1.4) поддаются интерпретации только в тех
Параметрическое семейство областей, описываемых ядром:
φ ,
,
Kxx K
0
к комбинаторному перебору
00
,
где K: X × X → R – функция ядра (kernel function), x
метры предиката.
Легко видеть, что шары и полуплоскости являются частными примерами ядер. Функция K может свободно выбираться, исходя из любых
априорных соображений. Если таковых в конкретной прикладной задаче
не имеется, единственное, что остаётся, – организовать банк ядер, содержащий некоторое конечное множество метрик, скалярных произведений
и других «потенциально
информативных закономерностей должна включать в себя цикл перебора
по банку ядер.
полезных» функций. Тогда процедура поиска
– 12 –
0
X и K
R – пара-
0

Ядра, зависящие только от небольшого числа признаков, проще под-
x
даются содержательной интерпретации, но для их поиска приходится
организовывать эффективный перебор подмножеств признаков.
Параметрическое семейство гиперпараллелепипедов:
β
Если все исходные признаки являются бинарными, то пространство
поиска образуется самими признаками и всевозможными булевыми функциями, которые из этих признаков можно построить. Такие булевые функции будут иметь форму гиперпараллелепипедов, для построения которых
достаточно построить лишь дизъюнктивные нормальные формы (ДНФ),
поскольку любую булеву функцию можно записать в виде ДНФ
го, в качестве закономерностей можно брать только конъюнкции признаков и их отрицаний, а дизъюнкцию реализовать как корректирующую операцию, например как голосование по большинству или старшинству.
Логические закономерности часто ищут в виде конъюнкций небольшого числа элементарных высказываний. Именно в такой форме люди
привыкли выражать свой житейский
На практике чаще встречаются случаи, когда наблюдения описываются разнотипными признаками: номинальными, порядковыми, количественными. Тогда пространством поиска становятся всевозможные бинарные функции от исходных признаков. Процесс построения таких функций
называют бинаризацией исходной информации. Способы бинаризации подробно рассмотрены в п. 3.2 данной работы.
После бинаризации признаков в качестве
брать только конъюнкции этих признаков или их отрицаний. Пусть B – конечное множество предикатов (термов), которые называются элементарными. Рассмотрим множество конъюнкций с ограниченным числом термов
из B:
Количество термов k в конъюнкции называется её рангом (степенью). Конъюнкции небольшой степени обладают полезным преимуществом, так как они имеют вид привычных для человека логических высказываний и легко поддаются интерпретации.
Процедура поиска наиболее информативных конъюнкций в общем
случае требует полного перебора. Число допустимых конъюнкций может
оказаться настолько большим
неосуществимым. На практике используют различные эвристики для со-
,,,|
dfxd
и профессиональный опыт.
, что полный перебор станет практически
11
.
. Более то-
закономерностей можно
.
kkK
KkBxBxBxBxBxBK
– 13 –

кращённого целенаправленного поиска конъюнкций, близких к оптимальным. Идея всех этих методов заключается в том, чтобы не перебирать
огромное количество заведомо неинформативных термов.
Далее приведем обзор наиболее известных алгоритмов синтеза
конъюнкций [17].
Наиболее простой из них – градиентный алгоритм синтеза конъюнкций. Суть алгоритма заключается в том, что каждой конъюнкции φ ставится в соответствие её окрестность – множество конъюнкций V(φ), получаемых из φ путём элементарных модификаций: добавлением, удалением или
модификацией одного из термов конъюнкции.
Начиная с заданной конъюнкции φ
следовательность конъюнкций φ
щая конъюнкция φ
выбирается из окрестности предыдущей Vt = V(φ
t
, φ1, …, φt, …, в которой каждая следую-
0
(например, пустой) строится по-
0
t−1
)
по критерию максимума информативности (1.2).
Конъюнкции с высокой информативностью могут допускать много
ошибок, хотя они считаются наиболее перспективными с точки зрения
дальнейших модификаций. Поэтому на каждом шаге t выделяется наилуч-
*
шая конъюнкция, удовлетворяющая дополнительному условию E
и в общем случае не совпадающая с наиболее перспективной φ
.
t
k(φt
) < ε
Итерационный процесс сходится за конечное число шагов к некоторой локально неулучшаемой конъюнкции, так как множество конъюнкций,
различно классифицирующих выборку, конечно.
Ясно, что ни о каком градиенте в прямом смысле слова речь не идёт.
Данный алгоритм, по аналогии с градиентным спуском, выбирает на каждой итерации наилучшую из ближайших точек
пространства поиска.
Критерий информативности и функция окрестности являются параметрами алгоритма. При формировании окрестности можно применять
различные эвристики [17]:
1) ограничивать максимальный ранг конъюнкций;
2) разрешать только добавления термов;
3) чередовать серии добавлений термов с сериями удалений;
4) разрешать модификацию нескольких термов одновременно.
Изменяя параметры градиентного алгоритма синтеза конъюнкций,
можно получать различные процедуры поиска
или улучшения информативных конъюнкций. Ниже приведены несколько вариантов этого
алгоритма.
«Жадный» алгоритм синтеза конъюнкции использует только операцию добавления термов. Начальным приближением является конъюнкция, не содержащая термов. Недостаток «жадной» стратегии в том,
что она может уводить в сторону от глобального максимума информативности, поскольку терм, найденный на i
-м шаге, перестаёт быть опти-
– 14 –

мальным после добавления последующих термов. Тем не менее на некоторых практических задачах данная эвристика способна находить хорошие закономерности.
Случайный локальный поиск [180, 219] начинает с пустой конъюнкции, но применяет весь набор возможных модификаций. Это преимущество по сравнению с «жадным» алгоритмом, так как появляется возможность удалять и заменять неоптимальные
термы. Недостатком является
наличие, как правило, очень большой мощности окрестности |V(φ)|, что затруднит перебор всех допустимых модификаций. Для устранения недостатка в случайном локальном поиске строится не вся окрестность, а только некоторое её случайное подмножество. Максимальная допустимая
мощность этого подмножества задаётся как дополнительный параметр
алгоритма.
С целью
улучшения конъюнкции, построенной «жадным» наращиванием или случайным локальным поиском, к ней применяют процедуры
стабилизации и редукции.
Основной идеей процедуры стабилизации является попытка улучшения конъюнкции путем удаления или замены по одному терму. В отличие от
случайного локального поиска перебираются все возможные удаления и замены. Модификации производятся все время, пока
идет возрастание информативности конъюнкции. В результате стабилизации найденные конъюнкции
часто сходятся к одним и тем же локальным максимумам информативности,
что положительно сказывается на интерпретируемости правил. Также процедура стабилизации рекомендуется для настройки порогов в термах.
Целью процедуры редукции является повышение обобщающей спо-
собности правила. Ее отличие от стабилизации заключается
в том, что
термы только удаляются, а информативность вычисляется по независимой
k
контрольной выборке X
, составленной из наблюдений, не участвовавших
в построении конъюнкции. Контрольную выборку формируют до начала
обучения, выделяя случайным образом из массива исходных данных примерно 25 % наблюдений. При этом наблюдения разных классов распределяются в той же пропорции, что и во всей выборке. Смысл редукции в том,
чтобы проверить, не является ли найденная
конъюнкция избыточно сложной, и либо упростить её, либо вовсе признать неудачной и удалить
из классификатора. Упрощение повышает общность закономерности, поскольку множество покрываемых ей наблюдений расширяется. Недостаток
редукции заключается в том, что она оставляет значительную долю данных для контроля, уменьшив представительность обучающей выборки.
Однако при приемлемом выборе соотношения ℓ
следующей редукцией по X
ℓ
по X
U Xk без редукции.
k
может давать лучшие результаты, чем поиск
/k поиск правил по Xℓ c по-
– 15 –

Дальнейшим усовершенствованием случайного локального поиска
на основе идей дарвиновской эволюции является генетический алгоритм
синтеза конъюнкций. Основное отличие генетического алгоритма от случайного локального поиска в том, что на каждом шаге отбирается не одна,
наилучшая конъюнкция, а целое множество лучших конъюнкций, называемое популяцией. Из них порождается большое количество конъюнкцийпотомков
с помощью двух генетических операций – скрещивания и мутации. Скрещивание – образование новой конъюнкции путём обмена термами между двумя членами популяции. В роли мутаций выступают операции
добавления, замещения и удаления термов.
Следует отметить, что генетические алгоритмы отличаются большим
разнообразием всевозможных эвристик, заимствованных непосредственно
из живой природы. Например, в генетический алгоритм легко
встроить
процедуру селекции или искусственного отбора, породив потомков только
от наилучших конъюнкций или задав распределение вероятностей на популяции так, чтобы вероятность стать родителем увеличилась с ростом
информативности. Эти и другие эвристики описаны в литературе по генетическим алгоритмам [19, 31, 95, 148].
Для поиска конъюнктивных закономерностей можно также приспо-
собить методы отбора признаков,
описанные в [34]: метод последовательного сокращения признаков (алгоритм Del [200]), метод последовательного
добавления признаков (алгоритм Add [13]), алгоритм Add–Del [33], метод
случайного поиска с адаптацией (алгоритм СПА [56]). Для этого достаточно заменить в них функционал качества: вместо минимизации средней
ошибки искать максимум информативности.
1.3. АНАЛИЗ ОСНОВНЫХ ЛОГИЧЕСКИХ АЛГОРИТМОВ КЛАССИФИКАЦИИ И СПОСОБОВ ИХ ПОСТРОЕНИЯ
1.3.1. Решающие списки
Решающий список [193] – логический алгоритм классификации a: X → Y,
который задается набором закономерностей φ
классам k
, …, kT соответственно, и вычисляется согласно алгоритму 1 [17]:
1
(x),...,φT(x), приписанных к
1
Алгоритм 1. Классификация наблюдения решающим списком
t = 1.
1.
Если φ
2.
(x) = 1, то вернуть kt;
t
иначе t = t + 1.
Если t ≤ T, то на 2;
3.
иначе вернуть k
.
0
– 16 –

Согласно алгоритму 1 при классификации наблюдения x закономер-
ности проверяются последовательно для всех t = 1,…,T, пока для некоторого t не выполнится условие φ
t
(x) = 1. Ответ k0 означает отказ алгоритма от
k
классификации наблюдения x. Часто такие наблюдения приписывают
классу, имеющему минимальную цену ошибки.
Для формирования решающего списка используется алгоритм 2 [17].
Алгоритм 2. «Жадный» алгоритм построения решающего списка:
1.
2.
3.
4.
ошибок:
U = X
Для всех t = 1, …, T
k = k
Найти наиболее информативное правило при ограничении на долю
ℓ
.
.
max
– выбрать класс, для которого будет строиться правило.
t
maxarg
t
Ik(φ, U), где
,: EUE
k
max
.
Если I
5.
Исключить из выборки наблюдения, выделенные правилом φ
6.
(φt, U) < I
k
, то выход.
min
:
t
xUxU
t
.
0:
7. Если |U| ≤ ℓ0, то выход из алгоритма, в котором Xℓ – обучающая
выборка, Ф – семейство предикатов, из которого выбираются закономер-
T
ности,
нимальная допустимая информативность правил в списке,
мальная допустимая доля ошибок на обучающей выборке,
– максимальное допустимое число правил в списке, I
max
ℓ
E
max
– максималь-
0
ное допустимое число отказов.
На каждой итерации алгоритм 2 строит ровно одно правило φ
крывающее максимальное число наблюдений некоторого класса
нимальное число наблюдений других классов. Для этого производится поиск наиболее информативного правила на шаге 4 алгоритма, допускающего относительно мало ошибок на обучающей выборке. После построения
правила φ
реходит к поиску следующего правила φ
В итоге выборка оказывается покрытой множествами вида {
покрытые им наблюдения удаляются из выборки и алгоритм пе-
t
по оставшимся наблюдениям.
t+1
x: φ
По этой причине решающий список называют также покрывающим набором закономерностей, или машиной покрывающих множеств [212].
В алгоритме 2 одновременно работают три критерия останова:
построение заданного числа правил T
покрытие всей выборки, за исключением не более ℓ
невозможность найти правило с информативностью выше I
max
;
наблюдений;
0
остатку выборки.
Для нахождения баланса между точностью классификации обучающей выборки и длиной списка в алгоритме используется параметр
– ми-
min
– макси-
, по-
t
k
и ми-
t
(x) = 1}.
t
по
min
E
max
.
– 17 –

Уменьшение E
приводит к снижению числа ошибок на обучении, но
max
усложняет отбор правил, способствует уменьшению числа наблюдений,
покрываемых отдельными правилами, и увеличению длины списка. Правила, покрывающие слишком мало наблюдений, статистически не надёжны, в них может быть много ошибок на независимых контрольных данных.
Таким образом, увеличение длины списка при одновременном малом
по-
крытии правил может приводить к эффекту переобучения. Следовательно,
E
значение
должно быть примерно равно доле ошибок, которую мы
max
ожидаем получить как на обучающей выборке, так и контрольной.
E
На практике параметр
подбирается экспериментально.
max
Важным моментом алгоритма 2 является выбор класса на шаге 3.
Для реализации этого предлагается два альтернативных варианта.
Первый вариант состоит в поочередном построении набора правил
для каждого класса. Классы берутся в порядке убывания важности или цены ошибки. Преимущество данного варианта в том, что правила оказываются независимыми – в пределах
своего класса их можно переставлять
местами. Это улучшает их интерпретируемость.
Второй вариант заключается в совмещении шагов 3 и 4 алгоритма
и выборе пары (φ
, kt), для которой информативность Ikt(φt, U) максималь-
t
на. Тогда правила различных классов могут следовать неупорядоченно.
Доказано, что списки такого типа реализуют более широкое множество
функций [193]. При этом улучшается разделяющая способность списка, но
ухудшается его интерпретируемость. На практике первый вариант часто
оказывается более удобным.
Особенностью решающих списков является решение проблемы пропущенных данных. Если для вычисления правила
то считается, что φ
(x) = 0, и обработку наблюдения x берут на себя следу-
t
φt не хватает данных,
ющие правила в списке. Это относится и к стадии обучения, и к стадии
классификации.
К преимуществам решающих списков можно отнести:
интерпретируемость правил;
возможность обработки данных с пропусками.
Недостатки решающих списков следующие:
список может не построиться, если множество предикатов выбрано
неудачно. При этом возможен высокий процент отказов от классификации;
список плохо интерпретируется, если он длинный и правила раз-
личных классов следуют неупорядоченно;
каждое наблюдение классифицируется только одним правилом,
что не позволяет правилам компенсировать ошибки друг друга. Данный
недостаток устраняется путём голосования правил.
– 18 –

1.3.2. Решающие деревья
Решающее дерево – это логический алгоритм классификации, отличающийся от решающего списка тем, что при синтезе все конъюнкции
строятся одновременно.
Деревом
ленной вершиной
называется конечный связный ациклический граф с выде-
v
V, называемой корневой вершиной (корнем) дерева
0
[28]. Вершина, не имеющая выходящих рёбер, называется терминальной,
или листом. Остальные вершины называются внутренними. Дерево называется бинарным, если из любой его внутренней вершины выходят два ребра. Выходящие рёбра связывают каждую внутреннюю вершину с левой
L
дочерней вершиной
и с правой дочерней вершиной Rv.
v
Бинарное решающее дерево – это алгоритм классификации, задающийся бинарным деревом, в котором каждой внутренней вершине
приписан предикат βv: X → {0, 1}, каждой терминальной вершине v
k
приписано имя класса
. При классификации наблюдения xX он прохо-
v
vV
V
дит по дереву путь от корня до некоторого листа в соответствии с алгоритмом 3 [17]:
Алгоритм 3. Классификация наблюдения решающим деревом
v := v
1.
Пока вершина v внутренняя:
2.
если β
иначе
Вернуть k
3.
.
0
(x) = 1, то v := Rv (переход вправо);
v
v := L
(переход влево).
v
.
v
Основными элементами алгоритмов синтеза решающих деревьев являются также: выбор критерия ветвления для поиска атрибута во внутреннюю вершину решающего дерева, выбор критерия остановки для прекращения ветвления с целью получения терминальных вершин, определение
имени класса, приписываемого листу.
Признак обладает свойством полной отделимости, если логическое
правило, построенное на базе этого
ство наблюдений на два подмножества: подмножество
жит наблюдения только одного класса; подмножество
наблюдения только одного класса, и классы наблюдений из
Признак обладает свойством частичной отделимости, если подмножество
или подмножество
B содержит наблюдения только одного класса [28].
признака, разделяет исходное множе-
A, которое содер-
B, которое содержит
A и B различны.
A
Большая часть эвристических алгоритмов синтеза решающих деревьев предпочитают признаки со свойством полной или частичной отделимости. Считается, что такие признаки формируют решающее правило, которое допускает минимальное число ошибок на наблюдениях экзаменующей выборки [132, 136].
– 19 –

В зависимости от выбора алгоритма разбиения по данным наблюде-
ниям обучающей выборки может быть построено несколько решающих
деревьев, позволяющих верно классифицировать эти наблюдения. В этом
случае необходимо выбрать решающее дерево, которое лучше остальных
позволит правильно классифицировать наблюдения, не участвовавшие
в обучении. Как правило, таким деревом считают наиболее простое решающее дерево
, точное на всех обучающих наблюдениях.
На практике применяют различные эвристики, нацеленные на построение как можно более простого дерева, обладающего как можно лучшим качеством классификации. Придумано огромное количество различных алгоритмов синтеза бинарных решающих деревьев по обучающей
выборке.
Сначала следует рассмотреть простой «жадный» алгоритм ID3, основанный на принципе «разделяй
и властвуй» [208].
Идея алгоритма заключается в последовательном разбиении выборки
на две части до тех пор, пока в каждой части не окажутся наблюдения
только одного класса. Проще всего записать этот алгоритм в виде рекурсивной процедуры LearnID3, которая строит дерево по заданной подвыборке
U [17]:
Алгоритм 4. Алгоритм синтеза бинарного ID3:
Процедура LearnID3 (U).
1.
Если все наблюдения из U лежат в одном классе k, то:
2.
создать новый лист
k
= k;
v
вернуть (
v).
v;
Найти предикат с максимальной информативностью:
3.
4.
Разбить выборку на две части U = U
= {xU : β(x) = 0};
U
0
= {xU : β(x) = 1}.
U
1
Если U
5.
= Ø или U1 = Ø, то:
0
U1 по предикату β:
0
создать новый лист v;
= класс, в котором находится большинство наблюдений
k
v
из U.
Иначе:
6.
создать новую внутреннюю вершину v;
:= β;
β
v
:= LearnID3 (U0), т. е. построим левое поддерево;
L
v
:= LearnID3 (U1), т. е. построим правое поддерево.
R
v
Вернуть (v).
7.
– 20 –
β arg max β,IU
.
β
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
