Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Цифровые методы диагностики и прогнозирования процессов. Учебное пособие
.pdf
мощью ММП аналогичен поиску оптимального значения параметра
M
X
X
j
j
и приводит к одинаковому результату.
1
,,
В общем случае нам требуется найти параметры
,,,
местного распределения переменных
YX X
1
1
. Данная задача
n
сов-
r
может быть решена с помощью максимизации функционала правдоподобия
(,, , ) (, ,, , )
LS py
tr jjr
, (1.5)
11
m
j
x
1
который является произведением плотностей вероятностей в точках,
соответствующих объектам обучающей выборки
{(,),, (,)}
Ssy s y xx
111
tmmm
. Метод ММП является одним из
важнейших инструментов настройки алгоритмов распознавания или
регрессионных моделей в математической статистике. Однако использованием ММП требует знания вида вероятностного распределения. На практике чаще используется метод минимизации эмпирического риска, который требует знания только общего вида алгоритма прогнозирования.
1.4.2. Метод минимизации эмпирического риска
(ММЭР)
Основным способом поиска закономерностей является выбор из
{: }
заданного семейства
AX Y
зом аппроксимирующего связь переменных из набора
Y
переменной
на обучающей выборке, где
значений векторов переменных
Y
значений переменной
. Отметим, что чаще всего алгоритм A зада-
алгоритма, наилучшим обра-
,,
1
X
– область возможных
,,
1
X
Y
,
– область возможных
n
X
с
n
ется с помощью прогнозирующей функции.
[,()]
Пусть
тате использования в качестве прогноза величины
yA x
– величина «потерь», произошедших в резуль-
j
()
A x . Одним из
способов обучения является минимизация на обучающей выборке
функционала эмпирического риска
m
(,) [ ,()]
QS A y A
tjj
1
x
m
1
j
.
11

[,()]
j
M
yA
Примеры конкретного вида функции потерь
x
j
. В за-
дачах регрессии чаще всего используется квадрат ошибки прогноза
2
[,()][ ()]
yA y Axx
jj j j
[,()]|[ ()]|
ошибки
yA y Axx
jj j j
. Также может быть использован модуль
.
В случае задачи распознавания функция потерь может быть равной 0 при правильной классификации и 1 при ошибочной. При этом
функционал эмпирического риска равен числу ошибочных классификаций.
Точность алгоритма прогнозирования на всевозможных новых
неиспользованных для обучения объектах, которые возникают в результате процесса, соответствующего рассматриваемой задаче прогнозирования, принято называть обобщающей
способностью. Иными
словами обобщающую способность алгоритма прогнозирования
можно определить как точность на всей генеральной совокупности.
Мерой обобщающей способности служит математическое ожидание
потерь по генеральной совокупности
{ [ , ( )]}EYA
x
При решении
.
задач прогнозирования основной целью является достижение
наилучшей обобщающей способности, при которой математическое
ожидание потерь
{ [ , ( )]}EYA
x
минимально.
1.5. Эффект переобучения
Расширение модели {: }
AX Y
, увеличение ее сложности
всегда приводит к повышению точности аппроксимации на обучающей выборке. Однако повышение точности на обучающей выборке,
связанное с увеличением сложности модели, часто не ведет к увеличению обобщающей способности. Более того, обобщающая способность может даже снижаться. Различие между точностью на обучающей выборке и обобщающей способностью
при этом возрастает.
Данный эффект называется эффектом переобучения.
12

а б
Рис. 1.3. Эффект переобучения для регрессии
На рис. 1.3, а показано, что использование кусочно-линейной мо-
дели (красная линия)позволяет значительно лучше аппроксимировать зависимость на обучающей выборке
S
, чем простая линейная
t
регрессия (темно-синяя прямая). Однако оказывается (рис. 1.3, б),
что точность аппроксимации новой контрольной выборки
S
взятой
c
из той же самой генеральной совокупности, для простой линейной
регрессии значительно лучше, чем для кусочно-линейной.
а б
Рис. 1.4. Эффект переобучения для распознавания
На рис. 1.4, а показано, что использование кусочно-линейной гра-
ницы (красная линия) позволяет значительно лучше разделить объекты класса K
и класса K2 обучающей выборке
1
S
, чем простая ли-
t
13

нейная граница (темно-синяя прямая). Однако (рис. 1.4, б) точность
j
j
X
A
на новой контрольной выборке
S
, взятой из той же самой генераль-
c
ной совокупности, для простой линейной границы значительно лучше, чем для кусочно-линейной.
1.6. Методы оценивания обобщающей способности
Обобщающая способность алгоритма прогнозирования на генеральной совокупности
объектов из
, которую обычно называют контрольной выборкой.
, может оцениваться по случайной выборке
При этом контрольная выборка не должна содержать объектов из
обучающей выборки. В противном случае величина потерь может
оказаться завышенной.
Контрольная выборка имеет вид
y
где
– значение переменной Y для j-го объекта;
x
– значение вектора переменных
m
– число объектов в
c
Обобщающая способность алгоритма прогнозирования
{( , ), ,( , )}
Sy y xx
cmm
11
S
.
c
cc
,,
1
,
X
для j-го объекта;
n
может
оцениваться с помощью функционала риска
m
c
m
При
c
QS A y A
(,) [,()]
cjj
согласно закону больших чисел
( , ) { [ , ( )]}
QS A E Y A
c
1
x.
m
j
1
x
.
Обычно при решении задачи прогнозирования по прецедентам в
распоряжении исследователей сразу оказывается весь массив суще-
ствующих эмпирических данных
S
, по которому необходимо по-
in
строить алгоритм прогнозирования и оценить его точность. Для
оценки точности прогнозирования могут быть использованы следующие стратегии.
14

j
s
j
s
j
1. Выборка
для обучения алгоритма прогнозирования и выборку
S
случайным образом расщепляется на выборку
in
S
для оценки
c
точности.
2. Процедура кросс-проверки. Выборка
S
S
и
расщепляется на выборки
S
для обучения и
зуется для обучения
для контроля. На втором шаге, наоборот, исполь-
2
S
, а для контроля
2
1
. На первом шаге
2
S
случайным образом
in
S
используется
1
S
.
1
3. Процедура скользящего контроля выполняется по полной вы-
борке
выборка
S
за
in
SSs
ttj
ка, состоящая из единственного объекта
mS
j
\
||
шагов, на j-м шаге формируется обучающая
in
, где
– j-й объект в
S
, и контрольная выбор-
in
. Величина потерь в мето-
де скользящего контроля оценивается с помощью функционала
m
QSA yA S
(,) [,(,)]
sc in j j t
В работе [1] было показано, что функционал
несмещенной оценкой математического ожидания потерь.
1
x
m
j
1
.
(,)
QSA
sc in
является
S
t
1.7. Существующие методы и модели для решения
задач прогнозирования и распознавания
Для подавляющего числа приложений вид распределений или
значения конкретных их параметров неизвестны. Не известен обычно
также вид регрессионной зависимости (или разделяющей поверхности) в задачах распознавания. В связи с этим возникло большое чис-
разнообразных подходов, в которых поиск оптимальных алгорит-
ло
мов прогнозирования производится внутри достаточно обширных
семейств (моделей). Обычно такие семейства задаются с помощью
набора параметров. Для поиска оптимальных значений параметров
используются варианты ММП или ММЭР, позволяющие добиваться
более высокой устойчивости обучения. Использование данных подходов позволяет добиваться определенных успехов при решении
конкретных
задач. Для решения задач распознавания часто приме-
няются:
– cтатистические методы, включая байесовские методы;
15

– методы, основанные на линейной разделимости;
– методы, основанные на ядерных оценках;
– нейросетевые методы;
– комбинаторно-логические методы и алгоритмы вычисления
оценок;
– алгебраические методы;
– решающие деревья и леса;
– методы, основанные на принятии коллективных решений по си-
стемам закономерностей;
– методы, основанные на опорных векторах.
Для решения задач регрессии используются:
– многомерная
линейная регрессия;
– ядерные оценки;
– нейросетевые методы;
– метод опорных векторов.
16

2. ЛИНЕЙНАЯ РЕГРЕССИЯ
X
X
j
y
j
x
X
j
2.1. Методы настройки моделей
Распространенным средством решения задач прогнозирования ве-
личины
Y
по переменным
,,
1
X
является использование метода
n
множественной линейной регрессии. В данном методе связь переменной
модели
где
Y
с переменными
YXX
,, ,
01
– случайная величина, являющаяся ошибкой прогнозирования.
– вещественные регрессионные коэффициенты;
n
,,
X
1
011 nn
задается с помощью линейной
n
,
Регрессионные коэффициенты находятся по обучающей выборке
{(,),, (,)}
где
– значение прогнозируемой переменной Y;
(1,,).
(,,)
Ssy s y xx
111
tmmm
xx – вектор значений переменных
1
jnj
n
Предположим, что ошибка
ожиданием
что разность
0 и стандартным отклонением
YX X
011 nn
с нулевым ожиданием
,
,,
1
распределена нормально с нулевым
. Откуда следует,
также распределена нормально
0 и стандартным отклонением
X
n
. Из этого
следует, что функционал правдоподобия (1.5) может быть записан в
виде
n
()
yx
0
m
LS e
(, , , , )
tn
. (2.1)
01
j
1
2
1
jiij
2
2
1
i
2
Прологарифмируем функцию правдоподобия
17

n
2
()
yx
LS e
ln ( , ) ln
11
t
m
sK
1
j
2
1
jiij
0
i
2
1
2
n
2
()
yx
0
jiij
sK
1
j
1
ln( ) ln
2
e
2
()
yx
ln( ) ln(2 )
mm
11
1
2
sK
j
jiij
1
1
i
2
n
0
i
2
2
2
1
.
Традиционным способом поиска регрессионных коэффициентов
является метод наименьших квадратов (МНК), который заключается
в минимизации функционала эмпирического риска с квадратичными
потерями
mn
QS y x
(, , , ) [ ]
00
tn j jii
1
m
11
ji
2
,
ˆˆ ˆ
,, ,
т.е. оценки
01
удовлетворяют условию
регрессионных коэффициентов
n
ˆˆ
(,,)argmin[(,,,)]
00
ntn
QS
,, ,
01
.
n
Очевидно, МНК является вариантом метода минимизации эмпи-
рического риска с квадратичной функцией потерь.
2.2. Одномерная регрессия
Рассмотрим простейший вариант линейной регрессии, описыва-
Y
ющей связь между переменной
YX
0
{( , ), , ( , )}
Syx yx
11
tmm
18
. Функционал эмпирического риска на выборке
QS y x
(, , ) [ ]
принимает вид
01 0 1
tjj
1
m
и единственной переменной X:
j
m
1
2
.

Необходимым условием минимума функционала
j
x
y
D
ляется выполнение системы из двух уравнений
(, ,)
QS
t
01
яв-
(, , )
QS
QS
(, , )
Оценки
параметров
01
t
0
01
t
1
ˆˆ
(,)
01
(,)
01
являются решением системы (2.2) относительно
.
mm
2
mm
jj
mmm
2
mm
jjj
20,
yx
jj
11
xy x x
jj j j
111
2
1
0
2
20.
0
1
Таким образом, оценки могут быть записаны в виде
mmm
jjj
111
ˆ
1
mm
jj
mm
где
11
yyxx
mm
Выражение для
,
jj
11
jj
ˆ
1
1
yxy
jjj
m
1
22
xx
11
()
jj
m
ˆ
,
01
.
может быть переписано в виде
cov( , | )
ˆ
1
DX
YX S
()
t
,
(2.2)
2
x
,
где
сov( , | ) ( )( )
переменных
(|) ( )
XS x x
YX S y y x x
tjj
tj
1
m
m
Y
и X;
m
1
j
1
j
2
– выборочная дисперсия переменной X.
– выборочная ковариация
m
1
2.3. Многомерная регрессия
,,
При вычислении оценки вектора параметров
0
в случае
n
многомерной линейной регрессии удобно использовать матрицу
плана
X
размером (1)mn
, которая строится по обучающей вы-
19

j
x
X
X
j
x
j
{( , ), ,( , )}
борке
Sy y xx
tmm
ний переменных
Матрица плана имеет вид
Пусть
Y
чений
с переменными
11
,,
1
(, , )
yyy
1
m
, где
X
.
n
1
X
1
1
(,, )
xx
11 1
xx
1
jjn
xx
1
mmn
xx
1
jjm
– вектор значе-
n
– вектор значений переменной Y. Связь зна-
,,
X
1
на объектах обучающей выборки
n
может быть описана с помощью матричного уравнения
t
y βX ε
(, , )
ε
где
Функционал
1
– вектор ошибок прогнозирования для объектов
m
(, , , )
QS
QS y x
(, , , ) [ ]
tn jiji
0
tn
0
может быть записан в виде
1
m
,
mn
10
ji
2
,
S
.
t
где
x
является выполнение системы из
20
– элементы матрицы плана X, определяемые равенствами
i
1
,
xx
1
j
1(1)
Необходимым условием минимума функционала
(, , , )
QS
(, , , )
QS
при
ji
tn
0
0
.
1i
2[ ] 0,
.................................................
tn
0
n
2[ ] 0.
уравнений
1n
mmn
yx x x
jj ijij
11
jji
110
mmn
yx x x
jjn ijijn
jji
110
(, , , )
QS
0
tn
(2.3)
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
