- •Методы построения деревьев решений в задачах классификации в Data Mining Содержание
- •Введение
- •1 Data Mining
- •2 Теоретические аспекты методов построения деревьев решений
- •2.1. Понятие информативности
- •2.2. Решающие деревья
- •2.3. Редукция решающих деревьев
- •3. Описание алгоритмов построения деревьев решений
- •3.1. Алгоритм id3
- •3.2. Алгоритм cart
- •3.3. Алгоритм с4.5
- •Заключение
2 Теоретические аспекты методов построения деревьев решений
Статистические алгоритмы классификации основаны на априорных предположениях о виде плотностей распределения классов (байесовское решающее правило, линейный дискриминант Фишера, ЕМ-алгоритм). Метрические алгоритмы основаны на формализации понятия сходства между объектами и гипотезе компактности (методы ближайших соседей, потенциальных функций, радиальных базисных функций). Существует ещё один, качественно иной, принцип, на основе которого удаётся строить алгоритмы классификации. Это принцип индуктивного вывода логических закономерностей или индукции правил (rule induction, rule learning).
Неформально логическая закономерность — это предикат φ: X —> {0, 1), на области истинности которого целевая зависимость хорошо аппроксимируется константой. Можно сказать и так: это правило вида «если (φ(х) то с», где с — фиксированный ответ из Y. Если (φ(х) = 1, то говорят, что φ покрывает х. Более строгое определение логической закономерности будет дано ниже.
Особую ценность представляют закономерности, которые покрывают достаточно широкое подмножество объектов, и при этом описываются простой логической формулой. Процесс поиска таких закономерностей по выборке называют извлечением знаний из данных (knowledge discovery). На практике закономерности часто ищут в виде конъюнкций небольшого числа элементарных высказываний. Именно в такой форме люди привыкли выражать свой житейский и профессиональный опыт.
Каждая отдельная закономерность несёт лишь часть информации о целевой зависимости. Поэтому логические алгоритмы конструируются из множества закономерностей, дополняющих друг друга.
Напомним основные обозначения. Рассматривается задача классификации (X, У, у*,.Хl), где X — пространство объектов; Y = {О, ...,М — 1} — множество возможных ответов, М — число классов; у* : X —> Y — неизвестная целевая зависимость; Xl = {xi,yi}l i=1~~ обучающая выборка, уi = y*(xi). Требуется построить алгоритм классификации а : X —> У, аппроксимирующий целевую зависимость у*.
2.1. Понятие информативности
Эвристическое
определение информативности
Интуитивно предикат (φ тем более
информативен, чем больше он покрывает
объектов некоторого фиксированного
«своего» класса с
Y
по сравнению с объектами всех остальных
«чужих» классов. Введём следующие
обозначения:
Gc — число объектов класса с в выборке Xе-]
gс(φ) — из них число объектов, для которых выполняется условие (φ(х) = 1);
Вс — число объектов всех остальных классов Y \ {с} в выборке Xl
bс(φ) — из них число объектов, для которых выполняется условие φ(х) = 1.
Для краткости индекс с и аргумент (φ) будем иногда опускать. Предполагается, что G> = 1, В>= 1 и G + В = l.
Чем больше число покрываемых объектов (g + b) и чем меньше среди них ошибочных b, тем более информативен предикат φ. И, наоборот, наименее интересны предикаты, которые либо покрывают слишком мало объектов, либо выделяют «свои» и «чужие» объекты примерно в той же пропорции, в которой они представлены во всей выборке, b : g ~ В : G.
Введём обозначение Ес для доли ошибочно покрываемых «чужих» объектов, и Dc для доли всех покрываемых объектов:
Опр.
Предикат φ(х) будем называть логической
закономерностью для класса с
Y,
если Ес(φ,Xl)
и Dc(φ,Xl)
при заданных достаточно малом ε и
достаточно большом δ
из отрезка [0,1].
Если bс(φ) = 0, то закономерность φ называется чистой или непротиворечивой. Если bс(φ)> 0, то закономерность φ называется частичной.
В некоторых случаях имеет смысл ограничиваться поиском только чистых закономерностей. В частности, когда длина выборки мала или заранее известно, что данные практически не содержат шума. Такие прикладные задачи нередко встречаются на практике, например, классификация месторождений редких полезных ископаемых по данным геологоразведки.
Но чаще данные оказываются неполными и неточными. Таковы многие медицинские и экономические задачи (в частности, задача о выдаче кредитов). Для них незначительная доля ошибок ε на обучающей выборке вполне допустима. Кроме того, существуют способы построения корректных алгоритмов на основе частичных закономерностей, например, взвешенное голосование. В этих случаях сравнивать и отбирать предикаты приходится по двум критериям (g, b) одновременно. Что лучше: уменьшение b на 1 или увеличение g на 10? Для целенаправленного поиска лучших закономерностей удобнее иметь скалярный критерий информативности.
Статистическое определение информативности Адекватную скалярную характеристику информативности даёт техника проверки статистических гипотез.
Пусть X — вероятностное пространство, у*(х) и φ(х) — случайные величины. Допустим, справедлива гипотеза о независимости событий {х: у*(х) = с} и {х: (φ (х) = 1}. Тогда вероятность реализации пары (g,b) подчиняется гипергеометрическому распределению:
,
где
Если вероятность мала, и тем не менее пара (g, b) реализовалась, то гипотеза о независимости, скорее всего, не верна. Тогда, возможно, между у* и φ имеется закономерная связь, и это тем возможнее, чем меньше значение вероятности.
Опр. Информативность предиката φ(х) относительно класса с Y по выборке Xl есть
Предикат
φ (х) будем называть статистической
закономерностью для класса с, если
>I0
при заданном достаточно большом I0.
Порог информативности I0 выбирается так, чтобы ему соответствовало достаточно малое значение вероятности, называемое уровнем значимости. Например, при уровне значимости 0.05 закономерностями являются предикаты с информативностью выше I0 = —ln 0.05 ~ 3.
Энтропийное определение информативности Ещё один способ определения информативности вытекает из теории информации.
Напомним, что если имеются два исхода w0, w1 с вероятностями р0 и p1 = 1 — р0 ,то количество информации, связанное с исходом wi по определению равно — log2pi. Энтропия определяется как мат.ожидание количества информации:
H(p0, p1)=- p0*log2 p0- p1*log2 p1.
Если
дана случайная независимая выборка,
содержащая п0
исходов w0
и п1
исходов
w1,
то вероятности можно оценить по выборке:
и вычислить выборочную энтропию
H(n0,n1)
= H(p0,p1).
Этих определений достаточно, чтобы
оценить информационный выигрыш,
(information
gain)
— количество информации об исходном
делении выборки на два класса «с» и
«не с», которое содержится в предикате
φ.
Исходная энтропия выборки Xl равна H(G, В). Энтропия выборки после того, как стало известно, что предикат φ выделил g объектов из G и b объектов из В, есть
.
В итоге уменьшение энтропии (информационный выигрыш) составляет IGainc(φ, X1) = H(G, B) - H φ(G, B, g, b}.
Согласно энтропийному критерию информативности предикат φ является закономерностью, если IGainc(φ, Xl )> G0 при некотором достаточно большом G0.
Теорема Энтропийный критерий IGainc асимптотически эквивалентен статистическому IС:
IGainc(φ,
X1)
при
t
.
