Добавил:
Upload Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:
Data mining.docx
Скачиваний:
2
Добавлен:
01.07.2025
Размер:
133 Кб
Скачать
☆

2 Теоретические аспекты методов построения деревьев решений

Статистические алгоритмы классификации основаны на априорных предполо­жениях о виде плотностей распределения классов (байесовское решающее правило, линейный дискриминант Фишера, ЕМ-алгоритм). Метрические алгоритмы основа­ны на формализации понятия сходства между объектами и гипотезе компактности (методы ближайших соседей, потенциальных функций, радиальных базисных функ­ций). Существует ещё один, качественно иной, принцип, на основе которого удаётся строить алгоритмы классификации. Это принцип индуктивного вывода логических закономерностей или индукции правил (rule induction, rule learning).

Неформально логическая закономерность — это предикат φ: X —> {0, 1), на области истинности которого целевая зависимость хорошо аппроксимируется констан­той. Можно сказать и так: это правило вида «если (φ(х) то с», где с — фиксированный ответ из Y. Если (φ(х) = 1, то говорят, что φ покрывает х. Более строгое определение логической закономерности будет дано ниже.

Особую ценность представляют закономерности, которые покрывают достаточ­но широкое подмножество объектов, и при этом описываются простой логической формулой. Процесс поиска таких закономерностей по выборке называют извлечени­ем знаний из данных (knowledge discovery). На практике закономерности часто ищут в виде конъюнкций небольшого числа элементарных высказываний. Именно в такой форме люди привыкли выражать свой житейский и профессиональный опыт.

Каждая отдельная закономерность несёт лишь часть информации о целевой зависимости. Поэтому логические алгоритмы конструируются из множества законо­мерностей, дополняющих друг друга.

Напомним основные обозначения. Рассматривается задача классификации (X, У, у*,.Хl), где X — пространство объектов; Y = {О, ...,М — 1} — множество возможных ответов, М — число классов; у* : X —> Y — неизвестная целевая зави­симость; Xl = {xi,yi}l i=1~~ обучающая выборка, уi = y*(xi). Требуется построить алгоритм классификации а : X —> У, аппроксимирующий целевую зависимость у*.

2.1. Понятие информативности

Эвристическое определение информативности Интуитивно предикат (φ тем более информативен, чем больше он покрывает объектов некоторого фиксированного «своего» класса с Y по сравнению с объектами всех остальных «чужих» классов. Введём следующие обозначения:

Gc — число объектов класса с в выборке Xе-]

gс(φ) — из них число объектов, для которых выполняется условие (φ(х) = 1);

Вс — число объектов всех остальных классов Y \ {с} в выборке Xl

bс(φ) — из них число объектов, для которых выполняется условие φ(х) = 1.

Для краткости индекс с и аргумент (φ) будем иногда опускать. Предполагается, что G> = 1, В>= 1 и G + В = l.

Чем больше число покрываемых объектов (g + b) и чем меньше среди них ошибочных b, тем более информативен предикат φ. И, наоборот, наименее интересны предикаты, которые либо покрывают слишком мало объектов, либо выделяют «свои» и «чужие» объекты примерно в той же пропорции, в которой они представ­лены во всей выборке, b : g ~ В : G.

Введём обозначение Ес для доли ошибочно покрываемых «чужих» объектов, и Dc для доли всех покрываемых объектов:

Опр. Предикат φ(х) будем называть логической закономерностью для класса с Y, если Ес(φ,Xl) и Dc(φ,Xl) при заданных достаточно малом ε и доста­точно большом δ из отрезка [0,1].

Если bс(φ) = 0, то закономерность φ называется чистой или непротиворечивой. Если bс(φ)> 0, то закономерность φ называется частичной.

В некоторых случаях имеет смысл ограничиваться поиском только чистых за­кономерностей. В частности, когда длина выборки мала или заранее известно, что данные практически не содержат шума. Такие прикладные задачи нередко встреча­ются на практике, например, классификация месторождений редких полезных иско­паемых по данным геологоразведки.

Но чаще данные оказываются неполными и неточными. Таковы многие меди­цинские и экономические задачи (в частности, задача о выдаче кредитов). Для них незначительная доля ошибок ε на обучающей выборке вполне допустима. Кроме того, существуют способы построения корректных алгоритмов на основе частичных зако­номерностей, например, взвешенное голосование. В этих случаях сравнивать и от­бирать предикаты приходится по двум критериям (g, b) одновременно. Что лучше: уменьшение b на 1 или увеличение g на 10? Для целенаправленного поиска лучших закономерностей удобнее иметь скалярный критерий информативности.

Статистическое определение информативности Адекватную скалярную ха­рактеристику информативности даёт техника проверки статистических гипотез.

Пусть X — вероятностное пространство, у*(х) и φ(х) — случайные вели­чины. Допустим, справедлива гипотеза о независимости событий {х: у*(х) = с} и {х: (φ (х) = 1}. Тогда вероятность реализации пары (g,b) подчиняется гипергео­метрическому распределению:

, где

Если вероятность мала, и тем не менее пара (g, b) реализовалась, то гипо­теза о независимости, скорее всего, не верна. Тогда, возможно, между у* и φ имеется закономерная связь, и это тем возможнее, чем меньше значение вероятности.

Опр. Информативность предиката φ(х) относительно класса с Y по выбор­ке Xl есть

Предикат φ (х) будем называть статистической закономерностью для клас­са с, если >I0 при заданном достаточно большом I0.

Порог информативности I0 выбирается так, чтобы ему соответствовало до­статочно малое значение вероятности, называемое уровнем значимости. Например, при уровне значимости 0.05 закономерностями являются предикаты с информатив­ностью выше I0 = —ln 0.05 ~ 3.

Энтропийное определение информативности Ещё один способ определения информативности вытекает из теории информации.

Напомним, что если имеются два исхода w0, w1 с вероятностями р0 и p1 = 1 — р0 ,то количество информации, связанное с исходом wi по определению равно — log2pi. Энтропия определяется как мат.ожидание количества информации:

H(p0, p1)=- p0*log2 p0- p1*log2 p1.

Если дана случайная независимая выборка, содержащая п0 исходов w0 и п1 исхо­дов w1, то вероятности можно оценить по выборке: и вычислить выборочную энтропию H(n0,n1) = H(p0,p1). Этих определений достаточно, чтобы оценить информационный выигрыш, (in­formation gain) — количество информации об исходном делении выборки на два клас­са «с» и «не с», которое содержится в предикате φ.

Исходная энтропия выборки Xl равна H(G, В). Энтропия выборки после того, как стало известно, что предикат φ выделил g объектов из G и b объектов из В, есть

.

В итоге уменьшение энтропии (информационный выигрыш) составляет IGainc(φ, X1) = H(G, B) - H φ(G, B, g, b}.

Согласно энтропийному критерию информативности предикат φ является за­кономерностью, если IGainc(φ, Xl )> G0 при некотором достаточно большом G0.

Теорема Энтропийный критерий IGainc асимптотически эквивалентен стати­стическому IС:

IGainc(φ, X1) при t .

Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]