Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Лекция3 (1) [другая]

.pdf
Скачиваний:
0
Добавлен:
22.07.2026
Размер:
2 Мб
Скачать

Теория и алгоритмы распознавания образов

Обучение статистических классификаторов при автоматизированном дешифрировании данных ДЗ

Как получить качественную выборку образов

Используйте RGB-композиции различных каналов для визуального анализа спектральной однородности тематических классов

R=4 G=3 B=2

R=5 G=3 B=2

R=7 G=3 B=2

Искусственные объекты,

Древесная растительность,

Искусственные объекты,

почва-растительность

почвы

почвы

Теория и алгоритмы распознавания образов

Обучение статистических классификаторов при автоматизированном дешифрировании данных ДЗ

Как получить качественную выборку образов

Для анализа однородности пространственных объектов полезно использовать

регулирование динамического диапазона яркостей

Светлые искусственные объекты и сухие почвы при визуализации по умолчанию часто представляются однородными по яркости, хотя на самом деле это неверно

Теория и алгоритмы распознавания образов

Обучение статистических классификаторов при автоматизированном дешифрировании данных ДЗ

Как получить качественную выборку образов

Гистограммы по тестовому участку хвойного леса в ближнем ИК диапазоне (канал 5 изображения с аппаратуры OLI)

Инструмент наращивания

 

 

областей в пакете ERDAS Imagine

 

 

позволяет получить связное

 

 

множество точек, лежащее внутри

Гистограмма по всей области не

Гистограмма по области,

гиперсферы заданного радиуса в

полученной путем наращивания,

соответствует нормальному

ПП

хорошо аппроксимируется

распределению

 

нормальным распределением

 

 

Радиус r (максимальное допустимое евклидово расстояние до центральной точки) зависит от однородности объекта по спектральной яркости и радиометрического разрешения съемочной аппаратуры

Теория и алгоритмы распознавания образов

Обучение статистических классификаторов при автоматизированном дешифрировании данных ДЗ

Как получить качественную выборку образов

Создание тестовых участков лиственного леса. R=5,G=3,B=2 Динамический диапазон RGB компонент установлен на интервал яркостей леса

Для получения репрезентативной выборки можно объединить сигнатуры по нескольким идентичным участкам

Перед объединением сигнатур необходимо проверить идентичность их гистограмм в канале с наибольшим динамическим диапазоном

Гистограммы в канале 5 для выбранных тестовых участков практически полностью совпадают, следовательно, их можно объединить

Теория и алгоритмы распознавания образов

Обучение статистических классификаторов при автоматизированном дешифрировании данных ДЗ

Анализ статистической разделимости обучающих выборок

Меры статистической разделимости

Меры статистической разделимости - это функциональные меры расстояний между классами, известным образом связанные с ожидаемой ошибкой классификации

При разных средних в одномерном случае может использоваться нормализованное расстояние, связанное с ошибкой линейной завиимостью:

R | m1 m2 |

1 2

При значении R=1 полная ошибкка классификации составляет около 33%

В многомерном случае при C1=C2 может использоваться расстояние Махаланобиса, также связанное с ошибкой линейной зависимостью: R12=(m1-m2)TC-1(m1-m2).

Теория и алгоритмы распознавания образов

Обучение статистических классификаторов при автоматизированном дешифрировании данных ДЗ

Анализ статистической разделимости обучающих выборок

Меры статистической разделимости

Если средние значения по классам близки или совпадают, нормализованное расстояние не может служить

мерой статистической

разделимости, хотя байесовский классификатор позволяет разделить такие классы

Из-за ограниченных возможностей использования нормализованного расстояния на практике применяются другие меры, но они часто теоретически сравниваются именно с нормализованным расстоянием

Теория и алгоритмы распознавания образов

Обучение статистических классификаторов при автоматизированном дешифрировании данных ДЗ

Анализ статистической разделимости обучающих выборок

Меры статистической разделимости: парная дивергенция

 

 

 

Среднее количество различающей

p(x/ 1 )

 

 

информации для класса 1

 

относительно класса 2:

p(x/ 2 )

 

p(x/ 1 ) p(x/ 2 )

 

p(x/ 1 )

 

 

 

 

 

 

 

 

 

p(x/ 1 )ln

 

dx

 

 

 

 

 

 

 

 

X

 

p(x/ 2 )

 

 

 

Среднее количество различающей

 

 

 

 

 

 

информации для класса 2

 

 

 

относительно класса 1:

 

 

 

p(x/ 2 )ln

 

p(x/ 2 )

dx

 

 

 

 

 

 

 

X

p(x/ 1 )

Полная дивергенция для пары классов :

D12 p(x/ 1 )ln

p(x/ 1 )

dx p(x/ 2 )ln

p(x/ 2 )

dx

(p(x/ 1 ) p(x/ 2 ))ln

p(x/ 1 )

dx

p(x/ 2 )

p(x/ 1 )

 

X

X

X

 

p(x/ 2 )

Теория и алгоритмы распознавания образов

Обучение статистических классификаторов при автоматизированном дешифрировании данных ДЗ

Анализ статистической разделимости обучающих выборок

Меры статистической разделимости

Основной недостаток парной дивергенции – быстрый рост с увеличением расстояния между классами (нелинейная взаимосвязь с ошибкой)

Предпочтительны такие меры статистической разделимости, которые при

фактическом отсутствии перекрытия между классами принимают фиксированное значение («насыщаются»)

Трансформированная дивергенция:

TD12 1 exp( D12 ) 8

Если классы не перекрываются, TD=1. В пакетах ERDAS Imagine и ENVI значение TD умножается на 2000, то есть при полной разделимости TD=2000

Расстояние Джеффриса-Матуситы (J-M расстояние):

JM12 { [

 

 

 

1

 

 

 

p(x/ 1 )

p(x/ 2 )]2 dx}2 .

X

 

 

 

 

Если классы не перекрываются, JM2=1,414. В пакете ERDAS Imagine значение JM умножается на 1000, то есть при полной разделимости JM=1414

Теория и алгоритмы распознавания образов

Оценка качества классификации и постклассификационная обработка

Качество классификации зависит от следующих факторов:

1.Репрезентативности эталонов классов

2.Взаимного положения сигнатур классов и особенностей их статистического распределения

3.Удачного выбора метода классификации

Выбор метода классификации опирается, прежде всего, на классификацию самих эталонов (так называемую «классификацию на контрольных выборках»)

Матрица ошибок

 

Диагональные элементы – доля правильно

 

классифицированных точек

 

 

 

 

Сумма остальных элементов по k-й строке

 

 

 

 

(зеленый прямоугольник) – ошибка первого рода

 

 

 

 

для класса k

 

 

 

 

 

 

 

 

Сумма остальных элементов по k-му столбцу

 

 

 

 

 

 

 

 

(синий прямоугольник) – ошибка второго рода

 

 

 

 

 

 

 

для класса k

 

 

 

 

 

Наилучшим методом классификации является тот, который обеспечивает наиболее высокую точность по всем выделяемым классам

Теория и алгоритмы распознавания образов

Оценка качества классификации и постклассификационная обработка

Пример: Дмитров с окрестностями – OLI (Lansat-8)

Все представленные классы разделяются по мере Джеффриса-Матуситы Первый недостаток эталонов: слишком маленький размер для 7 каналов

Второй недостаток: не проверены на выполнение гипотезы о нормальном распределении

Соседние файлы в предмете Теория и алгоритмы распознавания образов