Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Цифровые методы диагностики и прогнозирования процессов. Учебное пособие
.pdf
Вектор оценок значений регрессионных коэффициентов
y
X
X
X
ˆˆ ˆ
(,, )
β
0
является решением системы уравнений (2.3), которая в
n
матричной форме может быть записана в виде
tt t t
22 0
Xy XXβ
Решение (2.4) существует, если
t
XX существует обратная матрица и решение (2.4) относительно
вектора может быть записано в виде:
Из теории матриц следует, что
по строкам менее
, что происходит, если m-мерный вектор зна-
1n
чений одной из переменных
ся линейной комбинаций
переменных из
из переменных
{,, }
1
in
m
X
n
{,, }
XX
1
-мерных векторов значений на
. При сильной коррелированности одной
det( ) 0
{,, }
XX
in
на выборке
ной комбинацией других переменных, значение
ся близким к 0. При этом вычисленный вектор оценок
. (2.4)
t
det( ) 0
XX
tt tt
ˆ
()
β XX X
t
XX
1
. В этом случае для
1
.
если ранг матрицы X
S
на выборке
S
с какой-либо линей-
t
t
det( )
XX
являет-
t
S
других
t
оказывает-
t
ˆ
β
может
сильно изменяться при относительно небольших чисто случайных
изменениях вектора
y
1
. Таким образом, оценивание с
m
(, , )
yy
использованием МНК при наличии мультиколлинеарности оказывается неустойчивым. Отметим также, что
XX
при
1nm
t
det ( ) 0
поэтому МНК не может использоваться для оценивания регрессионных коэффициентов, когда число переменных превышает число объектов в обучающей выборке. На практике высокая устойчивость достигается, когда число объектов в выборках по крайней мере в 3–
5 раз превышает число переменных.
,
2.4. Методы регуляризации по Тихонову
Одним из возможных способов борьбы с
неустойчивостью явля-
ется использование методов, основанных на включении в исходный
(, , , )
оптимизируемый функционал
QS
0
tn
дополнительной
штрафной компоненты. Введение такой компоненты позволяет по-
лучить решение, на котором функционал
(, , , )
QS
0
tn
достаточно
близок к своему глобальному минимуму. Однако данное решение
21

оказывается значительно более устойчивым, благодаря чему позво-
X
s
X
X
s
j
j
s
X
sss
s
s
X
ляет достигать существенно более высокой обобщающей способности. Подход к получению более эффективных решений с помощью
включения штрафного слагаемого в оптимизируемый функционал
принято называть регуляризацией по Тихонову.
,,
X
На первом этапе переходим от исходных переменных
ˆ
XX
s
,,
стандартизированным
m
1
ˆ
ijii
менной
YY y
Пусть
для j-го объекта.
ка
i
xX
()
m
1
j
Y
к стандартизированной прогнозируемой переменной
m
1
m
1
j
s
x
j
1
ˆ
.
j
,
1
xx
2
, а также от исходной прогнозируемой пере-
ss
iji
Допустим, что
X
sj jn
X
при
, где
n
nn
(1)
ss
xx
11 1
xx
1
xx
1
mmn
дартизированных переменных,
стандартизированной переменной
Одним из первых методов регрессии, использующих принцип ре-
гуляризации, является метод гребневой регрессии (ridge regression), в
Y
s
iiji
, где
1i
– матрица плана для стан-
(,, )
yyy
1
.
ii
ˆ
i
s
– значение призна-
x
(1)
i
– вектор значений
m
1
1
ˆ
Xx
,,
m
к
n
m
1
j
котором в оптимизируемый функционал дополнительно включается
сумма квадратов регрессионных коэффициентов при переменных
s
,,
X
1
. В результате функционал имеет вид
n
mn n
QS y x
(, , , ) [ ]
ridge 0
tn jiji i
1
m
ss
10 0
ji i
22
,
– положительный вещественный параметр.
где
22

ˆ
s
X
y
s
s
Пусть
тов, полученным в результате минимизации
β
является вектором оценок регрессионных коэффициен-
r
(, , , )
QS
ridge 0
tn
. От-
метим, что увеличение регрессионных коэффициентов приводит к
увеличению
(, , , )
QS
ridge 0
tn
. Таким образом, использование греб-
невой регрессии приводит к снижению длины вектора регрессион-
s
,,
ных коэффициентов при переменных
X
nn
.
Рассмотрим конкретный вид вектора регрессионных коэффициен-
тов
QS
ˆ
β . Необходимым условием минимума функционала
r
(, , , )
ridge 0
tn
является выполнение системы из
уравнений:
1n
(, , , )
QS
tn
(, , , )
QS
tn
0
0
0
n
mmn
sss
yx x x
2[ ] 0,
110
jj ijij
110
jji
...........................................................
mmn
2[ ] 0.
sss
yx x x
j jn i ji jn n
110
jji
(2.5)
Поэтому вектор оценок регрессионных коэффициентов в методе
гребневая регрессия является решением системы (2.5).
В матричной форме система (2.5) может быть записана в виде
tt t t
(]0
Xy XX β
ss s s
ˆ
I
или в виде
tttt
I
– единичная матрица.
где
ˆ
Отметим, что произведение
[]
XX I
ss s s
t
XX
1
β X
,
представляет собой симмет-
s
рическую неотрицательно определенную матрицу. Матрица
t
XX I
ss
ственному значению
значение
собственное значение матрицы
min
также является симметрической матрицей. Каждому соб-
t
матрицы
k
i
матрицы
t
ss
. Откуда следует, что всегда
XX
соответствует собственное
s
XX I
. Таким образом, минимальное
t
XX I
ss
удовлетворяет неравенству
t
det ( ) 0
ss
IXX
, а обратная
23

1
всегда существует. Большая величина
приводит к относительно небольшим изменениям
t
ss
[( ) ]stIXX
I XX
матрица
det ( ) 0
оценок регрессионных коэффициентов при небольших изменениях в
обучающих выборках.
Наряду с гребневой регрессией в последние годы получил распро-
странение метод Лассо, основанный на минимизации функционала
mn n
QS y x
(, , , ) [ ] | |
Lasso 0
tn jiji i
1
m
ss
10 0
ji i
2
.
Интересной особенностью метода Лассо является равенство нулю
большинства из оптимальных значений регрессионных коэффициен-
(, , )
тов
1
. Однако на самом деле это означает исключение из
n
модели соответствующей ему переменной. Поэтому метод Лассо не
только строит оптимальную регрессионную модель, но и производит
отбор переменных. Метод может быть использован для отбора переменных в условиях, когда размерность данных превышает размер
выборки. Отметим, что общее число отобранных переменных не может превышать размера обучающей выборки m. Эксперименты показали, что эффективность отбора переменных методом Лассо снижается при высокой взаимной корреляции некоторых из них.
Данными недостатками не обладает другой метод построения регрессионной модели, основанный на регуляризации по Тихонову,
который называется эластичная сеть. Этот метод основан на минимизации функционала
mn n
(, , , ) [ ] [| |(1 ) ]
QS y x
0
rt n j iji i i
11
m
ss
10 0
ji i
22
,
2
где
[0,1] .
Метод эластичная сеть включает в себя методы гребневая регрессия и Лассо как частные случаи.
Методы регрессионного анализа подробно рассматриваются в
большом числе публикаций. Например можно привести учебное пособие [2]. Методы регрессионного анализа, основанные на регуляризации по Тихонову рассматриваются в курсе лекций [3] и книге [4].
24

3. МЕТОДЫ РАСПОЗНАВАНИЯ
R
A
s
s
s
s
s
ps
p
p
p
p
p
p
p
p
s
3.1. Методы оценки эффективности алгоритмов
распознавания
Каждый алгоритм распознавания классов
KK
1
, независимо
L
,,
от задачи или используемой модели, может быть представлен как
последовательное выполнение распознающего оператора
ющего правила
:
C
познаваемого объекта
,,
KK
сы
1
несение объекта
соответственно. Решающее правило C производит от-
L
по вектору оценок
. Оператор оценок вычисляет для рас-
RC
вещественные оценки
[(), , ()]
1
(), , ()
1
s
L
и реша-
s
за клас-
L
к одному из
классов. Распространенным решающим правилом является простая
процедура, относящая объект в тот класс, оценка за который макси-
K
K
и
мальна. В случае распознавания двух классов
мый объект
K
классу
в противном случае.
2
будет отнесен к классу
s
K
1
, если
Приведенное выше правило называется правилом
точность распознавания правила
(0)C может оказаться слишком
1
распознавае-
2
() () 0ss
12
(0)C . Однако
и
низкой для того, чтобы обеспечить требуемую величину потерь, связанных с неправильной классификацией объектов, на самом деле
K
принадлежащих классу
. Для достижения необходимой величины
1
потерь может быть использовано пороговое решающее правило
()C : распознаваемый объект
() ()ss
12
и классу
Обозначим через
объекта
11
cc
s, на самом деле принадлежащего
(,) (0,)
sp s , но
K
(,)
ci
22
cc
будет отнесен к классу
в противном случае.
2
вероятность правильной классификации
K
, {1, 2 }i
i
(,) (0,)
sp s
. Уменьшая , увеличиваем
K
. При
, если
1
0
(,)
s
и уменьшаем
1
c
(,)
s
и увеличиваем
1
c
(,)
s
может быть приближенно восстановлена по обучающей вы-
2
c
S
борке
, включающей описания объектов
t
(,)
2
c
s
. Напротив, увеличивая , уменьшаем
(,)
s
. Зависимость между
2
c
{, , }
s
1
.
m
1
c
(,)
s
и
25

Пусть
s
s
s
s
p
p
{, , }
s
1
m
11 1
() ( )
21 2
.
m
– матрица оценок за классы объектов
s
m
() ( )
ss
По данной матрице оценок легко получить множество величин:
где
1, ,im
{( ) ( ) ( )| 1, , },
iii
.
Предположим, что величины
,,
ний
1
правила
. Данным величинам можно сопоставить решающие
r
(),,()
CC
1
ssim
12
()
принимают r различных значе-
i
. Для каждого из правил
r
()
C
вычислим
i
две величины:
1) долю
щих условию
2) долю
щих условию
K
среди объектов обучающей выборки, удовлетворяю-
1
()is
K
среди объектов обучающей выборки, удовлетворяю-
2
()
, которую обозначим
s
, которую обозначим
*
i
()
1
ci
()
2
ci
;
.
В результате получим r пар чисел
{[ ( ), ( )], ,[ ( ), ( )]}
11 2 1 1 2
cc crcr
.
Каждая пара чисел может рассматриваться как точка на плоскости
в декартовой системе координат. Таким образом, набору пороговых
элементов
1
соответствует набор точек на плоскости.
r
,,
Соединив соседние по номеру точки отрезками прямых, получим
ломаную линию, соединяющую точки (1,0) и (0,1), которая изображена
на рис. 3.1. Данная линия графически отображает аппроксимацию по
обучающей выборке взаимозависимости между
всевозможных значениях
. Взаимозависимость между
s
1
c
и
(,)
2
c
1c
s
и
при
2c
(,)
наиболее полно оценивает эффективность распознающего оператора R.
Отметим, что
Однако сохранение высокого значения
соответствует существованию решающего правила, при котором
2c
постепенно убывает по мере роста
1c
.
2c
при высоких значениях
1c
точность распознавания обоих классов высока. Наиболее эффективному распознающему оператору, обеспечивающему полное распознавание классов, соответствует совпадение линии I с прямой, связывающей точки (0,1) и (1,1). Отсутствию распознающей способности соот-
26

ветствует совпадение с прямой II, связывающей точки (0,1) и (1,0). В
целом эффективность распознающего оператора может характеризоваться формой линии I. Чем ближе линия I к прямой, связывающей
точки (0,1) и (1,1), тем лучше распознающий оператор и соответствующий ему метод распознавания. Наоборот, приближенность линии I к
прямой, связывающей точки (0,1) и (1,1), соответствует низкой эффективности соответствующего метода распознавания.
Рис. 3.1. Пример ломаной линии (I), соединяющей точки на
двумерной плоскости в декартовой системе координат, которые
являются соседними в ряду точек (1,1)
На рис. 3.2 сравниваются линии, характеризующие эффективность распознающих операторов, принадлежащих к трем методам
распознавания, при решении задач диагностики двух видов аутизма
по психометрическим показателям. Изучалась эффективность:
– линейного дискриминанта Фишера (ЛДФ) с соответствующей
линией обозначенной
– метода опорных векторов (МОВ) c линией, обозначенной
;
;
– метода статистически взвешенные синдромов (СВС) c линией,
обозначенной
.
27

Рис. 3.2. Сравнение трех методов
Методы распознавания используются при решении многих задач
идентификации объектов, представляющих важность для пользователя. Эффективность идентификации для таких задач можно описывать в терминах:
– «чувствительность» – доля правильно распознанных объектов
целевого класса;
– «ложная тревога» – доля объектов ошибочно отнесенных в целевой класс.
Пример кривой, связывающей параметры «чувствительность» и
«ложная тревога»
представлен на рис. 3.3.
28

L
Рис. 3.3. Вид ROC-кривой в координатах «чувствительность» (ось Y)
и «ложная тревога» (ось X)
Анализ, основанный на построении и анализе линий, связывающих параметры «чувствительность» и «ложная тревога», принято
называть анализом Receiver Operating Characteristic (ROC-анализом).
Отметим, что по мере увеличения числа пороговых точек, что
обычно происходит при возрастании объема выборки, ломаная линия
I постепенно приближается к некоторой кривой. Поэтому линии, связывающие параметры «чувствительность» и «ложная тревога» принято называть ROC-кривыми. В качестве меры близости к прямой,
связывающей точки (0,0) и (1,1), соответствующей абсолютно точному распознаванию, используется площадь под ROC-кривой.
Задача
Банк использует два метода распознавания для повышения прибыли при кредитовании. Используемая технология основана на распознавании заемщиков, для которых риск отказа от выплат по кредиту является высоким. Предполагается, что доход банка с одного добросовестного заемщика составляет
10 000 условных единиц
d
(у.е.). Потери банка при отказе от выплат по кредиту составляет
45 000 у.е. Доля заемщиков, отказывающихся от выплат по кре-
диту, составляет
p
0,05. В таблице приведены значения чувстви-
rej
тельности и ложной тревоги при некотором наборе пороговых значений для методов распознавания A и B.
29

Метод A Метод B
p
Чувствительность Ложная тревога Чувствительность Ложная тревога
0,03 0,001 0,03 0,001
0,08 0,002 0,16 0,002
0,13 0,01 0,28 0,02
0,19 0,03 0,44 0,06
0,27 0,07 0,57 0,08
0,34 0,09 0,61 0,09
0,47 0,11 0,67 0,11
0,61 0,14 0,69 0,14
0,74 0,17 0,72 0,17
0,91 0,21 0,78 0,2
0,97 0,24 0,83 0,23
1 0,28 0,88 0,27
0,92 0,32
0,98 0,35
1 0,37
Вопросы. Позволяют ли приведенные в таблице данные сделать
вывод о потенциальной возможности увеличения дохода банка при
использовании метода A или метода B? Какой из двух методов позволяет получить более высокий доход?
Решение. Средний доход банка на одну поданную заявку на кре-
D
дит в
случае, когда методы распознавания не используются, мо-
жет быть найден по формуле
(1 ) 10 000 0,95 45 000 0,05 7250Dd p p L
rej rej
.
При использовании метода распознавания с чувствительностью
и уровнем ложной тревоги Fa величина потерь, произошедших
Sen
непосредственно из-за отказов от выплат по кредиту, которая без
применения методов распознавания была равна
равной
(1 Se n)pL
rej
. Величина дохода, полученная от добросо-
L
, становится
rej
вестных заемщиков, которая без применения методов распознавания
была равна
оказывается равной
(1 )dp
, в случае применения метода распознавания
rej
(1 ) (1 Fa )dp
rej
. Таким образом, величина
дохода в случае использования метода распознавания рассчитывается по формуле
30
(1 ) (1 Fa ) (1 S en )Dd p p L
rej rej
.
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
