Соловьев 2012 / СИИ 2012 / Посибия СИИ / СИИ пособие / СИИ_3
.docЕсли в качестве метрики пространства признаков используется метрика Хаусдорфа, то для кластеризации образов можно применить метод цепной развертки.
На первом этапе цепной развертки в качестве исходного берется любой образ из предъявленной совокупности, ему приписывается номер 1 и расстояние 0. Затем просматриваются все оставшиеся образы. Выбирается образ, расстояние от которого до исходного элемента минимально. Ему присваивается номер 2 и расстояние, равное расстоянию до исходного образа. Затем среди оставшихся ищется образ, расстояние от которого до уже отмеченного множества из двух элементов минимально, и т.д. – всегда на очередном шаге выбирается образ, расстояние от которого до уже пронумерованных образов, как расстояние до множества, минимально, ему приписывается очередной номер и это расстояние. Процедура повторяется, пока все образы не будут пронумерованы. В результате все множество образов будет выстроено в некотором порядке, и каждому образу приписано некоторое число – расстояние до предшествующего множества.
На следующем этапе производится разделение полученного множества на несколько кластеров так, чтобы выполнялись следующие условия:
-
расстояние между любыми образами, входящими в разные кластеры, должно быть больше некоторого заданного расстояния d0;
-
для любой пары образов из одного кластера (t1, t2) можно найти цепочку образов (o1=t1, o2, …, on=t2) из того же кластера, что для любого i (i<n) расстояние между соседними образами d(oi,oi+1) ≤ d0.
Для выполнения этих условий достаточно просмотреть все приписанные образам расстояния и пометить те образы, у которых d > d0. Пусть будут помечены образы с номерами N1, N2,..., Nk. Тогда к первому кластеру следует отнести все образы с номерами меньше N1, ко второму – все образы с номерами от N1 до N2 и т.д. В результате будет сформировано k кластеров.
После процедуры цепной развертки можно легко проводить анализ полученной совокупности кластеров, например, при каких значениях порога d0 возникают разные варианты кластеризации, как эти варианты соотносятся между собой и многое другое.
Необходимо отметить,
что данная процедура требует
операций вычисления расстояния между
образами, если всего имеется N образов,
что требует значительных временных
затрат. Как правило, более быстрый
результат можно получить кластеризацией
с фиксированным порогом, которая является
модификацией описанного выше метода.
В начале кластеризации с фиксированным порогом берется любой образ и ему присваивается принадлежность к первому кластеру. К данному кластеру присоединяются все образы, принадлежность которых к какому-либо кластеру еще не установлена, и расстояние от которых до исходного образа меньше порога d0. Затем для каждого из присоединенных образов данная процедура повторяется. После того как к первому кластеру больше нельзя отнести ни одного образа, среди оставшихся в качестве исходного образа для второго кластера берется произвольный образ. Процедура повторяется до тех пор, пока не будут исчерпаны все образы. В худшем случае и здесь при наличии N образов потребуется 0,5N(N–1) процедур вычисления расстояния, но в наилучшем случае будет выполнено всего N процедур.
3.4. Построение классификаторов
Следующий важный этап в процессе разработки системы распознавания – разработка априорного словаря признаков. Располагая полным перечнем признаков и априорным алфавитом классов, полученных в результате решения первой и второй задач, необходимо провести анализ возможностей измерения признаков или расчета их по данным измерений, а также оценить их информативность для обеспечения требуемой эффективности распознавания. Косвенно информативность отдельного признака для каждой пары классов можно оценить по критерию Фишера. Информативность признака можно считать низкой, если критерий Фишера имеет недостаточные значения для всех пар классов.
Однако, хороший или плохой набор признаков распознавания, получился в результате можно понять, только выполнив испытания системы распознавания в целом и оценив эффективность распознавания. Но системы распознавания на данном этапе разработки еще не существует. Выходом из создавшегося положения является создание на данном этапе математической модели системы, которая и используется для реализации последовательных приближений к желаемому результату.
После формирования набора признаков необходимо выполнить описание классов из априорного алфавита на языке априорного словаря признаков. Априорное описание классов – наиболее трудоемкая из задач в процессе создания системы распознавания, требующая глубокого изучения свойств объектов распознавания. В результате каждому классу необходимо поставить в соответствие числовые параметры детерминированных и вероятностных признаков, значения логических признаков и предложения, составленные из структурных признаков-примитивов. Значения этих параметров можно получить в результате: обработки данных, полученных в ходе специально поставленных экспериментов; математического моделирования; извлечения необходимой информации из литературных источников.
Если признаки распознаваемых образов детерминированные, то описанием класса может быть точка в многомерном пространстве признаков из априорного словаря, сумма расстояний которой от точек, представляющих образы данного класса, минимальна.
Если распределение образов, представляемых числовыми значениями их признаков, по областям соответствующего пространства вероятностное, то для описания классов необходимо определить характеристики этих распределений. К таким характеристикам относятся:
-
функция ПРВ pi(x1, x2,...., xn), где x1.....xn - вероятностные признаки, i - номер класса;
-
априорная вероятность Pi того, что образ, случайно выбранный из общей совокупности, окажется принадлежащим к i-му классу.
Статистические характеристики можно определить по экспериментальным статистическим данным, путем теоретического вывода или моделированием.
Если признаки распознавания – структурные, то описанием каждого класса должен быть набор предложений, т.е. цепочек из непроизводных элементов с правилами соединения. В таком случае каждое из предложений класса является характеристикой структурных особенностей образов этого класса.
Важнейшим этапом разработки системы распознавания является выбор алгоритма классификации, обеспечивающего отнесение распознаваемого образа к соответствующему классу.
Один из подходов к решению данной задачи заключается в разбиении пространства значений признаков распознавания на области D1, D2,..., Dn, соответствующие классам, причем разбиение должно быть выполнено таким образом, чтобы обеспечить минимум ошибки распознавания. В таком случае результатом классификации является отнесение образа, имеющего вектор признаков X=(x1, x2,...., xn) (точка в n-мерном пространстве), к g-му классу, если указанная точка лежит в соответствующей классу области признаков Dg.
Разбиение пространства признаков можно представлять как построение разделяющих функций Sg(X) между множествами признаков Dg, принадлежащих разным классам. Эти функции должны обладать следующим свойством: если образ, имеющий вектор признаков X фактически относится к g-му классу, то Sg(X) > Sj(X) для всех j≠g. Отсюда легко определить выражение разделяющей границы между областями Dg и Dk, соответствующих g-му и k-му классам: Sg(X) – Sk(X) = 0. Очевидно, что форма границы зависит от вида разделяющих функций и в линейном случае представляет собой гиперплоскость в многомерном пространстве признаков.
В простейшем случае разделения двух классов по одному признаку разделяющая их граница в одномерном пространстве признаков превращается на признаковой оси в точку, положение которой для вероятностного признака согласно байесовской стратегии, позволяющей обеспечить минимизацию среднего риска или стоимости потерь, находится следующим образом.
Пусть требуется произвести разделение образов на два класса W1 и W2 по одному вероятностному признаку х. Тогда вектор признаков каждого образа состоит из одного элемента, а описания классов представляют собой функции условной плотности распределения вероятности значений признака p1(x), p2(x) для классов W1 и W2 соответственно.
Пусть кроме p1(x)
и p2(x)
известны априорные вероятности появления
образов разных классов Р1,
Р2
и матрица стоимости потерь
,
где с11,
с22
– потери при правильных решениях, с12
и с21
– потери при ошибочной классификации,
когда образ, относящийся к первому
классу, ошибочно распознан как образ,
относящийся ко второму классу, и,
соответственно, наоборот. Первый случай
называется ошибкой первого рода, а
второй – ошибкой второго рода.
Условная вероятность
ошибки первого рода определяется как
.
Соответственно
условная вероятность ошибки второго
рода
,
где х0
– пороговое значение признака, т.е.
образ распознается как относящийся к
первому классу, если для него х
< x0,
и образ распознается как относящийся
ко второму классу в противном случае.
Графическое представление условных
вероятностей и порогового значения
признака приведено на рис.12.
Байесовский
классификатор минимизирует потери при
распознавании R, которые можно оценить
как
.
Чтобы найти минимум
функции R
от х,
необходимо подставить в нее выражения
для Q1
и Q2,
взять производную по х
и приравнять ее к нулю, положив х=х0
.
Рисунок 12 – Функции условной плотности распределения вероятности значений признака для двух классов
Откуда
,
где 0
– пороговое значение коэффициента
правдоподобия
,
обеспечивающее минимальные потери при
классификации.
Конкретные значения
априорных вероятностей Р1,
Р2
и элементов матрицы стоимости потерь
определяют отношение условных плотностей
распределения при пороговом значении
признака. Так, для Р1=Р2,
с11=с22,
и с12=с21
0=1,
т.е. пороговое значение x0
соответствует абсциссе точки пересечения
функций p1(x)
и p2(x),
как показано на рис.12. При нормальном
законе распределения для p1(x),
p2(x)
с равными среднеквадратичными отклонениями
σ
и математическими ожиданиями m1,
m2
соответственно
.
Другой подход к
проблеме классификации образов
основывается на сравнении значений той
или иной меры близости или сходства
распознаваемого образа с каждым классом.
Если значение выбранной меры близости
L(X,W)
данного образа X
с каким-либо g-ым
классом, описываемым множеством свойств
Wg,
достигает экстремума относительно ее
значений по другим K
классам для данного образа, т.е.
,
то принимается решение о принадлежности
этого образа g-му
классу.
В простейшем случае одномерного пространства статистических признаков при наличии всего двух классов хорошие результаты дает применение в качестве меры близости расстояния Фишера. Данная мера позволяет классифицировать распознаваемый образ даже при совпадении математических ожиданий классов, отличающихся только дисперсией. Графическая иллюстрация такого случая, приведенная на рис.13 показывает, что согласно расстоянию Фишера распознаваемый образ следует отнести к классу, имеющему большую дисперсию.
Рис.13 – Классификация образа по расстоянию Фишера
В принципе разработкой алгоритма классификации заканчивается создание системы распознавания, однако, на практике процесс разработки является итерационным приближением к максимально возможной эффективности распознавания. В этом ряду последовательных приближений главную роль играют признаки распознавания, т.к. от эффективности их набора зависит, эффективность системы в целом. В процессе совершенствования системы указанный набор пополняется, а неинформативные признаки исключаются. В некоторых случаях может возникнуть необходимость изменения алгоритма классификации, что в свою очередь приведет к существенному изменению словаря признаков, а возможно и алфавита классов.
В сложных задачах распознавания образов требуется учитывать большое количество различных признаков, причем определение значения каждого из них может быть достаточно трудоемкой задачей, а полное сравнение неизвестного вектора признаков со многими векторами признаков эталонов может потребовать много времени. Например, в системе медицинской диагностики количество возможных диагнозов исчисляется тысячами, а в качестве признаков используются результаты различных лабораторных анализов, число которых может достигать нескольких десятков, причем многие из них требуют проведения сложных, длительных и дорогостоящих, а иногда и болезненных процедур. Для таких систем становится актуальной задача выбора последовательности определения признаков.
Использование дерева решений позволяет совместить процесс определения значений признаков с классификацией распознаваемого образа за счет выбора на каждом шаге наиболее информативною признака. С каждым узлом дерева решений связана функция выбора, которая определяет – какой дочерний узел следует обрабатывать далее. Каждый листовой узел связан с конкретным классом. Если процедура обхода дерева достигает листа, то неизвестный образ считается принадлежащим тому классу, который связан с данным листом.
В качестве примера построения дерева решений рассмотрим распознавание рукописных цифр на основе следующих структурных признаков:
-
число замкнутых областей (озера);
-
число незамкнутых областей (заливы);
-
расположение залива (в верхней или нижней части изображения цифры);
-
направление открытой части залива (четыре стороны).
Например, цифра «8» характеризуется двумя озерами, а цифра «5» - заливом вверху, открытым вправо и заливом внизу, открытым влево. В таблице 5 приведены указанные признаки для всех десяти цифр. Конечно, признаки не учитывают всех особенностей рукописных цифр, например, «четверка» может иметь вместо залива озеро, но для демонстрации работы дерева решений приведенных признаков достаточно. На рис.14 приведено дерево решений, позволяющие однозначно классифицировать цифры. На каждом шаге определяется признак и в зависимости от его значения выбирается соответствующая ветвь, что позволяет изменять порядок определения значений признаков в зависимости от распознаваемой цифры.
Таблица 5
|
Цифра |
Число озер |
Число заливов |
Расположение заливов |
Направление |
|
0 |
1 |
- |
- |
- |
|
1 |
- |
1 |
верх |
вниз |
|
2 |
- |
2 |
верх, низ |
влево, вправо |
|
3 |
- |
2 |
верх, низ |
влево, влево, |
|
4 |
- |
1 |
верх |
вверх |
|
5 |
- |
2 |
верх, низ |
вправо, влево |
|
6 |
1 |
1 |
верх |
вправо |
|
7 |
- |
- |
- |
- |
|
8 |
2 |
- |
- |
- |
|
9 |
1 |
1 |
низ |
влево |
Рис.14 – Дерево решений для распознавания по структурным признакам
В системах распознавания, предназначенных для решения практических задач, используются сотни признаков, десятки классов и тысячи эталонных образов, причем для любого набора эталонных образов и признаков может быть построено более одного дерева решений. В таких случаях выбор признаков, дающих наилучшее, согласно некоторому критерию, дерево решений, становится актуальной задачей. В качестве критерия можно использовать стоимость определения значений признаков или минимальное число уровней дерева решений. Существуют методы автоматического построения дерева решений по значениям признаков эталонных образов, например, на основе энтропии.
Энтропия множества
событий x={x1,
x2,
… xn},
где xi
– отдельное событие, равна
,
где pi
- вероятность события xi.
Энтропию можно интерпретировать как
«среднюю неопределенность источника
информации» Теория информации позволяет
измерить информативность события через
энтропию. В частности, информативность
I(W/x)
переменной класса W
с возможными значениями {w1,
w2,
… wK}
по отношению к переменной признака x
с возможными значениями {x1,
x2,
… xN}
определяется как
,
где p(W=wi) - вероятность появления класса W, имеющего значение wi, p(x=xj) - вероятность появления признака x, имеющего значение xj, p(W=wi/x=xj) - совместная вероятность класса W=wi и переменной x=xj. Эти априорные вероятности можно оценить по частоте соответствующих событий в эталонных образах.
Рассмотрим простейший пример определения наиболее информативного признака из трех бинарных признаков {x, y, z} для четырех образов, относящимся к двум классам W {I, II}, приведенный в таблице 6.
Класс I наблюдается в двух из четырех образов, следовательно, p(W=I) = 2/4 = 0.5. Признак x=1 наблюдается у трех эталонов, следовательно, p(x=1) = 3/4 = 0.75. Признак x=1 наблюдается у двух эталонов, относящихся, к классу W=I, следовательно, p(W=I/x=1) = 2/4 = 0.5. Информативность признака x:
![]()
![]()
Таблица 6
|
Эталон |
x |
y |
z |
W |
|
1 |
1 |
1 |
1 |
I |
|
2 |
1 |
1 |
0 |
I |
|
3 |
0 |
0 |
1 |
II |
|
4 |
1 |
0 |
0 |
II |
Аналогично определяется информативность признака y (I(W/y) = 1.0 ) и z (I(W/z) = 0), т.е. наиболее информативен признак y, которого вполне достаточно для классификации имеющихся образов.
На каждом шаге создания дерева решений в качестве анализируемого признака используется наиболее информативный признак и разделение множества эталонных образов на подмножества производится по данному признаку в данном узле дерева. Формирование дерева заканчивается, когда множество эталонных образов полностью разделяется, т.е. число листьев дерева становится равным числу классов.
