Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Цифровые методы диагностики и прогнозирования процессов. Учебное пособие

.pdf
Скачиваний:
0
Добавлен:
08.09.2026
Размер:
2 Мб
Скачать
☆
мощью ММП аналогичен поиску оптимального значения параметра
M
X
X
j
j
и приводит к одинаковому результату.
1
,,
В общем случае нам требуется найти параметры
,,,
местного распределения переменных
YX X
1
1
. Данная задача
n
сов-
r
может быть решена с помощью максимизации функционала правдо­подобия
(,, , ) (, ,, , )
LS py
tr jjr
  
, (1.5)
11
m
j
x
1
который является произведением плотностей вероятностей в точках, соответствующих объектам обучающей выборки
{(,),, (,)}
Ssy s y xx
111
tmmm
. Метод ММП является одним из
важнейших инструментов настройки алгоритмов распознавания или регрессионных моделей в математической статистике. Однако ис­пользованием ММП требует знания вида вероятностного распреде­ления. На практике чаще используется метод минимизации эмпири­ческого риска, который требует знания только общего вида алгорит­ма прогнозирования.
1.4.2. Метод минимизации эмпирического риска (ММЭР)
Основным способом поиска закономерностей является выбор из

{: }
заданного семейства
AX Y
зом аппроксимирующего связь переменных из набора
Y
переменной
на обучающей выборке, где
значений векторов переменных
Y
значений переменной
. Отметим, что чаще всего алгоритм A зада-
алгоритма, наилучшим обра-
,,
1
X
– область возможных
,,
1
X
Y
,
– область возможных
n
X
с
n
ется с помощью прогнозирующей функции.
[,()]
Пусть
тате использования в качестве прогноза величины
yA x
– величина «потерь», произошедших в резуль-
j
()
A x . Одним из
способов обучения является минимизация на обучающей выборке функционала эмпирического риска
m
(,) [ ,()]
QS A y A
tjj
1
x
m
1
j
.
11
[,()]
j
M
yA
Примеры конкретного вида функции потерь
x
j
. В за-
дачах регрессии чаще всего используется квадрат ошибки прогноза
2
[,()][ ()]
yA y Axx
jj j j
[,()]|[ ()]|
ошибки
yA y Axx
jj j j
. Также может быть использован модуль
.
В случае задачи распознавания функция потерь может быть рав­ной 0 при правильной классификации и 1 при ошибочной. При этом функционал эмпирического риска равен числу ошибочных класси­фикаций.
Точность алгоритма прогнозирования на всевозможных новых неиспользованных для обучения объектах, которые возникают в ре­зультате процесса, соответствующего рассматриваемой задаче про­гнозирования, принято называть обобщающей
способностью. Иными словами обобщающую способность алгоритма прогнозирования можно определить как точность на всей генеральной совокупности. Мерой обобщающей способности служит математическое ожидание
потерь по генеральной совокупности
{ [ , ( )]}EYA
x
При решении
.
задач прогнозирования основной целью является достижение наилучшей обобщающей способности, при которой математическое
ожидание потерь
{ [ , ( )]}EYA
x
минимально.
1.5. Эффект переобучения
Расширение модели {: }

AX Y
, увеличение ее сложности
всегда приводит к повышению точности аппроксимации на обучаю­щей выборке. Однако повышение точности на обучающей выборке, связанное с увеличением сложности модели, часто не ведет к увели­чению обобщающей способности. Более того, обобщающая способ­ность может даже снижаться. Различие между точностью на обуча­ющей выборке и обобщающей способностью
при этом возрастает.
Данный эффект называется эффектом переобучения.
12
а б
Рис. 1.3. Эффект переобучения для регрессии
На рис. 1.3, а показано, что использование кусочно-линейной мо-
дели (красная линия)позволяет значительно лучше аппроксимиро­вать зависимость на обучающей выборке
S
, чем простая линейная
t
регрессия (темно-синяя прямая). Однако оказывается (рис. 1.3, б), что точность аппроксимации новой контрольной выборки
S
взятой
c
из той же самой генеральной совокупности, для простой линейной регрессии значительно лучше, чем для кусочно-линейной.
а б
Рис. 1.4. Эффект переобучения для распознавания
На рис. 1.4, а показано, что использование кусочно-линейной гра-
ницы (красная линия) позволяет значительно лучше разделить объ­екты класса K
и класса K2 обучающей выборке
1
S
, чем простая ли-
t
13
нейная граница (темно-синяя прямая). Однако (рис. 1.4, б) точность
j
j
X
A
на новой контрольной выборке
S
, взятой из той же самой генераль-
c
ной совокупности, для простой линейной границы значительно луч­ше, чем для кусочно-линейной.
1.6. Методы оценивания обобщающей способности
Обобщающая способность алгоритма прогнозирования на гене­ральной совокупности объектов из
, которую обычно называют контрольной выборкой.
, может оцениваться по случайной выборке
При этом контрольная выборка не должна содержать объектов из обучающей выборки. В противном случае величина потерь может оказаться завышенной.
Контрольная выборка имеет вид
y
где
– значение переменной Y для j-го объекта;
x
– значение вектора переменных
m
– число объектов в
c
Обобщающая способность алгоритма прогнозирования
{( , ), ,( , )}
Sy y xx
cmm
11
S
.
c
cc
,,
1
,
X
для j-го объекта;
n
может
оцениваться с помощью функционала риска
m
c
m 
При
c
QS A y A
(,) [,()]
cjj
согласно закону больших чисел
( , ) { [ , ( )]}
QS A E Y A
c
1
x.
m
j
1
x
.
Обычно при решении задачи прогнозирования по прецедентам в распоряжении исследователей сразу оказывается весь массив суще-
ствующих эмпирических данных
S
, по которому необходимо по-
in
строить алгоритм прогнозирования и оценить его точность. Для оценки точности прогнозирования могут быть использованы следу­ющие стратегии.
14
j
s
j
s
j
1. Выборка
для обучения алгоритма прогнозирования и выборку
S
случайным образом расщепляется на выборку
in
S
для оценки
c
точности.
2. Процедура кросс-проверки. Выборка
S
S
и
расщепляется на выборки
S
для обучения и зуется для обучения
для контроля. На втором шаге, наоборот, исполь-
2
S
, а для контроля
2
1
. На первом шаге
2
S
случайным образом
in
S
используется
1
S
.
1
3. Процедура скользящего контроля выполняется по полной вы-
борке выборка
S
за
in

SSs
ttj
ка, состоящая из единственного объекта
mS
j
\
||
шагов, на j-м шаге формируется обучающая
in
, где
– j-й объект в
S
, и контрольная выбор-
in
. Величина потерь в мето-
де скользящего контроля оценивается с помощью функционала
m

QSA yA S
(,) [,(,)]
sc in j j t
В работе [1] было показано, что функционал
несмещенной оценкой математического ожидания потерь.
1
x
m
j
1
.
(,)
QSA
sc in
является
S
t
1.7. Существующие методы и модели для решения задач прогнозирования и распознавания
Для подавляющего числа приложений вид распределений или значения конкретных их параметров неизвестны. Не известен обычно также вид регрессионной зависимости (или разделяющей поверхно­сти) в задачах распознавания. В связи с этим возникло большое чис-
разнообразных подходов, в которых поиск оптимальных алгорит-
ло мов прогнозирования производится внутри достаточно обширных семейств (моделей). Обычно такие семейства задаются с помощью набора параметров. Для поиска оптимальных значений параметров используются варианты ММП или ММЭР, позволяющие добиваться более высокой устойчивости обучения. Использование данных под­ходов позволяет добиваться определенных успехов при решении конкретных
задач. Для решения задач распознавания часто приме-
няются:
– cтатистические методы, включая байесовские методы;
15
– методы, основанные на линейной разделимости; – методы, основанные на ядерных оценках; – нейросетевые методы; – комбинаторно-логические методы и алгоритмы вычисления
оценок;
– алгебраические методы; – решающие деревья и леса; – методы, основанные на принятии коллективных решений по си-
стемам закономерностей;
– методы, основанные на опорных векторах. Для решения задач регрессии используются: – многомерная
линейная регрессия; – ядерные оценки; – нейросетевые методы; – метод опорных векторов.
16
2. ЛИНЕЙНАЯ РЕГРЕССИЯ
X
X
j
y
j
x
X
j
2.1. Методы настройки моделей
Распространенным средством решения задач прогнозирования ве-
личины
Y
по переменным
,,
1
X
является использование метода
n
множественной линейной регрессии. В данном методе связь пере­менной
модели
где
Y
с переменными
YXX
   
,, ,
 
01
– случайная величина, являющаяся ошибкой прогнозирования.
– вещественные регрессионные коэффициенты;
n
,,
X
1
011 nn
задается с помощью линейной
n
,
Регрессионные коэффициенты находятся по обучающей выборке
{(,),, (,)}
где
– значение прогнозируемой переменной Y;
(1,,).
(,,)
Ssy s y xx
111
tmmm
xx – вектор значений переменных
1
jnj
n
Предположим, что ошибка
ожиданием что разность
0 и стандартным отклонением
YX X  
011 nn
с нулевым ожиданием
,
,,
1
распределена нормально с нулевым
. Откуда следует,
также распределена нормально
0 и стандартным отклонением
X
n
. Из этого
следует, что функционал правдоподобия (1.5) может быть записан в виде
n
()
yx

0
m
LS e
(, , , , )
tn
. (2.1)
  
01
j
1

2
1
jiij
2
2
1
i
2
Прологарифмируем функцию правдоподобия
17
n






2
()
yx

LS e
ln ( , ) ln
11


t
m
sK
1
j
2

1

jiij
0
i
2
1
2
 
n
2
()
yx

0
jiij

sK
1
j
1
ln( ) ln

2
e
2

()
yx

ln( ) ln(2 )
mm
    
11
1
2
sK
j
jiij
1
1
i
2
 
n
0
i
2
2
2
1
.
Традиционным способом поиска регрессионных коэффициентов
является метод наименьших квадратов (МНК), который заключается в минимизации функционала эмпирического риска с квадратичными потерями
mn
QS y x
(, , , ) [ ]
00
tn j jii
1
 

m

11
ji
2
,
ˆˆ ˆ
,, ,
т.е. оценки
 
01
удовлетворяют условию
регрессионных коэффициентов
n
ˆˆ
(,,)argmin[(,,,)]


00
ntn
QS
,, ,

01
.
n
Очевидно, МНК является вариантом метода минимизации эмпи-
рического риска с квадратичной функцией потерь.
2.2. Одномерная регрессия
Рассмотрим простейший вариант линейной регрессии, описыва-
Y
ющей связь между переменной
YX  
0
{( , ), , ( , )}
Syx yx
11
tmm
18
. Функционал эмпирического риска на выборке
QS y x
(, , ) [ ]
принимает вид
  
01 0 1
tjj
1
m
и единственной переменной X:
j
m
1
2
.
Необходимым условием минимума функционала

j
x
y
D
ляется выполнение системы из двух уравнений
(, ,)
QS
t
01
яв-

(, , )
QS
QS

(, , )
Оценки
параметров
01
t
0
01
t

1
ˆˆ
(,)

01
(,)
01
   
  
являются решением системы (2.2) относительно
.
mm
2

mm
jj

mmm
2

mm
jjj

20,
yx
jj
11
xy x x
jj j j
111
2
1
0
2
20.
0
1
Таким образом, оценки могут быть записаны в виде
mmm
jjj
111

ˆ

1
mm

jj

mm
где
11
yyxx

mm
Выражение для
,

jj
11

jj
ˆ
1
1
yxy

jjj
m
1
22
xx
11
()
jj
m
ˆ
,
01
.
может быть переписано в виде
cov( , | )
ˆ

1
DX
YX S
()
t
,
(2.2)
2
x 
,
где
сov( , | ) ( )( )
переменных
(|) ( )
XS x x
YX S y y x x
tjj

tj
1
m
m
Y
и X;
m
1
j

1
j
2
– выборочная дисперсия переменной X.
– выборочная ковариация
m
1
2.3. Многомерная регрессия
,,
При вычислении оценки вектора параметров
0
в случае
n
многомерной линейной регрессии удобно использовать матрицу плана
X
размером (1)mn
, которая строится по обучающей вы-
19
j
x
X
X
j
x
j


{( , ), ,( , )}
борке
Sy y xx
tmm
ний переменных
Матрица плана имеет вид
Пусть
Y
чений
с переменными
11
,,
1
(, , )
yyy
1
m
, где
X
.
n

1


 
X
1
 

 
1

(,, )

xx
11 1

xx
1
jjn

xx
1
mmn
xx
1
jjm
– вектор значе-
n
– вектор значений переменной Y. Связь зна-
,,
X
1
на объектах обучающей выборки
n
может быть описана с помощью матричного уравнения
t
y βX ε
(, , )
 ε
где
Функционал
1
– вектор ошибок прогнозирования для объектов
m
(, , , )
QS
QS y x
(, , , ) [ ]
tn jiji
0
tn
 
0
может быть записан в виде
1
m
,
mn


10
ji
2
,
S
.
t
где
x
является выполнение системы из
20
– элементы матрицы плана X, определяемые равенствами
i
1
,
xx
1
j
1(1)
Необходимым условием минимума функционала
(, , , )
QS



(, , , )
QS
при
ji
tn
0
0
.
1i

2[ ] 0,
.................................................
tn

0
n

2[ ] 0.
уравнений
1n
mmn

yx x x

jj ijij
11
jji
110

mmn

yx x x

jjn ijijn
jji
110

(, , , )
QS
0
tn
(2.3)
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]