Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Системы искусственного интеллекта и машинное обучение. Учебное пособие
.pdf
Дисперсия является второй степенью среднеквадратического откло-
x
x
x
F
x
F
нения (СКО) случайной величины:
2
D
(13)
,
где
– СКО случайной величины x.
Математическое ожидание и дисперсия дают исчерпывающее описание нормально распределенной случайной величины. Кроме того, эти
параметры имеют широкое распространение в задачах анализа выборок
данных, корреляционном анализе, статистической радиотехнике и других статистических приложениях, что будет показано в следующих разделах этого учебного пособия.
1.3. СИСТЕМЫ СЛУЧАЙНЫХ ВЕЛИЧИН
Если на результат измерения влияет набор случайных величин, то
применяются совместные законы распределения.
Пусть имеется набор случайных величин
{ , ..., }
xx
1
. Их сов-
n
местная функция распределения вероятностей
( , ..., ) ( , ..., ).
xxPXxXx
111
nnn
(14)
Их совместная ПРВ
( , ..., ) ( , ..., ).
xPxXxdx xXxdx
11111
nnnnn
(15)
При этом вид связи между ПРВ и функцией распределения вероятностей сохраняется.
( , ..., ) ... ( , ..., ) ... .
xx xxdxdx
111
nnn
∫∫
(16)
Приведем пример численных характеристик в системе двух случайных величин, получив выражения, подобные (8).
11

Начальные моменты в системе двух случайных величин:
x
x
R
kk k
mx xxxdxdx
11 11212
kk k
mx xxxdxdx
22 21212
∫∫
∫∫
(, ) ;
(17)
(, ) .
Центральные моменты в системе двух случайных величин:
k
111 11 1212
k
222 22 1212
kk
xxxxxdxdx
∫∫
(, ) ;
(18)
kk
xxxxxdxdx
∫∫
(, ) .
Помимо начальных и центральных моментов для систем случайных
величин важное значение имеют смешанные моменты.
Начальный смешанный момент называется ковариационным и определяется по следующему выражению:
12 12 12 1 2 1 2
∫∫
(, ) .Kxx xxxxdxdx
(19)
Центральный смешанный момент называется корреляционным
и определяется по следующему выражению:
xxxx xxx x xxdxdx
12 1122 1122 1212
∫∫
(, ) .
(20)
Корреляционный момент, нормированный к СКО случайных величин, называется коэффициентом корреляции и широко применяется
в задачах статистического анализа.
R
12
12
.
(21)
12
r
12

Коэффициент корреляции и корреляционный момент обладают сле-
x
x
дующими свойствами:
область значений коэффициента корреляции:
коэффициенты автокорреляции равны единице:
;
1
r
nn
11r
12
11 22
;
...rr
значения парных коэффициентов корреляции в общем случае
симметричны:
rr
12 21
;
автокорреляционные моменты равны дисперсиям соответствую-
щих случайных величин:
11 1
2
;R
R
22 2
2
; …;
R
nn n
2
;
равенство нулю ковариационных моментов двух случайных ве-
личин является необходимым условием их статистической независимости.
Случайные величины
если
( , ..., ) ( ) ( ).
xxx
11
nn
{ , ..., }
xx
1
статистически независимы,
n
Статистически независимые случайные величины являются некоррелированными. Обратное утверждение в общем случае неверно.
Согласно центральной предельной теореме (ЦПТ) закон распределения суммы множества независимых случайных величин с конечными
дисперсиями стремится к нормальному с ростом числа слагаемых.
Понятие коэффициента корреляции широко применяют для выявления зависимостей между случайными величинами.
1.4. КОРРЕЛЯЦИОННЫЙ АНАЛИЗ
Корреляционный анализ в статистических методах обработки данных и машинном обучении – это совокупность основанных на математической теории корреляции методов обнаружения статистической
связи между случайными величинами или их признаками.
Выделяют функциональную и статистическую зависимость.
Функциональная зависимость: каждому значению независимой величины y соответствует строго определенное значение зависящей от нее
переменной x
, т. е. ()yfx . Такая зависимость может быть записана
строго аналитически.
13

Статистическая (вероятностная) зависимость: изменению независи-
N
X
N
x
x
мой переменной соответствует изменение статистических характеристик зависимой переменной.
Следует разделять статистическую зависимость и корреляционную
связь.
Статистическая, или корреляционная, связь: согласованное изменение двух и более признаков, отражающее тот факт, что изменчивость
одного признака соответствует изменчивости других. Причинно-следственные связи при этом не рассматриваются, но
они учитываются при
интерпретации статистической зависимости. Следовательно, статистическая зависимость в общем случае является более сильным термином,
чем корреляционная связь.
В большинстве задач статистического анализа, как правило, ограничиваются рассмотрением парной корреляции. При большем количестве
случайных величин существенно возрастают математическая сложность
вычислений и трудности в интерпретации полученных результатов.
Пусть имеются
рами данных:
две переменные X и Y, представленные двумя набо-
[ , ..., ]
xx
1
и
Yy y
[ , ..., ]
1
.
Форма корреляционного поля позволяет предварительно указать
на наличие взаимосвязи между двумя выборками в виде знака и качественного значения коэффициента корреляции. На рис. 1–3 приведены
примеры корреляционных полей для пяти разных значений коэффициента корреляции.
Корреляционный анализ заключается в расчете коэффициента взаимной корреляции двух случайных величин по их выборкам значений
и определении свойств корреляционной связи на его основе.
Выражение для расчета значения коэффициента корреляции определяется по (21) как
где
R
r
xy
и
– СКО по выборкам величин X и Y соответственно.
y
xy
xy xy
yxy
,
(22)
14

Рис. 1. Корреляционное поле для
Рис 2. Корреляционное поле для
1
r
xy
и
1
r
соответственно
xy
0.75
r
xy
и
r
xy
0.75
соответственно
Рис. 3. Корреляционное поле для
15
r
xy
0

На основе полученного значения коэффициента корреляции дела-
x
ется вывод о характере зависимости двух величин:
положительная корреляционная связь: 0
отрицательная корреляционная связь: 0
случайные величины не коррелированы: 0
r ;
xy
r ;
xy
r ;
xy
насколько сильная связь: по значению
;
r
y
между величинами присутствует линейная функциональная зави-
симость:
r
.
1
xy
На практике оценить можно только коэффициент корреляции по
ограниченной выборке (или выборочный коэффициент корреляции).
Поэтому необходимо задать критерий для установления достаточной
существенности значения выборочного коэффициента корреляции и
принятия версии о том, что имеет место статистическая связь, а не случайные артефакты измерения.
Для этого выдвигаются две статистические гипотезы:
нет;
– связь есть.
H
1
– связи
H
0
Проверяют гипотезы одним из классических способов, например, по
критерию Стьюдента.
Рассчитывается экспериментальное значение критерия Стьюдента
для оценки коэффициента корреляции:
r
xy
tN
2
1
r
xy
Количество степеней свободы в (23) равно
(23)
2.
, так как рассмат-
2N
риваются две случайные величины: x и y.
Рассчитанное значение (23) сравнивается с теоретическим:
⎛⎞
где
– вероятность ложной тревоги.
tt N
1, 2,
кр
⎜⎟
2
⎝⎠
16
(24)

Если условие (24) выполняется, то гипотеза
отвергается, а оце-
H
0
ненный коэффициент корреляции считается значимым. Если не выполняется, то гипотеза не отвергается, но это и не означает, что она принимается.
На практике часто измеряемые случайные величины могут быть
коррелированы между собой без наличия явной причинно-следственной
связи. Причины коррелированности могут быть скрыты в одном или
нескольких факторах, общих для этих двух величин. Это явление называется ложной корреляцией. Устранить влияние одного такого фактора из
оценки статистической связи двух случайных величин довольно просто.
С увеличением количества учитываемых факторов сложность их устранения существенно возрастает.
Влияние одного фактора на результат оценки коэффициента взаим-
ной корреляции двух случайных
величин устраняется путем расчета
частного коэффициента корреляции.
Пусть для пары анализируемых случайных величин наблюдается влияние общего для них фактора. Этот фактор можно рассматривать как третью случайную величину, наблюдаемую вместе с первыми двумя. Тогда
частный коэффициент корреляции, определяющий статистическую связь
между исходной парой случайных величин, рассчитывается как
rrr
r
12 3
12 13 23
22
11
rr
13 23
,
(25)
где
,
и
r
r
12
13
– коэффициенты взаимной корреляции, определенные
r
23
по выборкам значений случайных величин с соответствующими порядковыми номерами.
Множественный коэффициент корреляции, определяющий статистическую связь одной случайной величины со всеми остальными, может быть рассчитан по выражению
22
rr rrr
r
123
12 13 12 13 23
2
2
1
r
23
(26)
.
Проверка частных и множественных коэффициентов корреляции на
значимость может выполняться по критериям Стьюдента или Фишера.
17

1.5. ЗАДАЧА РЕГРЕССИИ И МНК
Одним из видов задач, решаемых при классическом машинном обучении, является задача регрессии. Решение этой задачи подразумевает
предсказание с ограниченной точностью значений случайной величины
по значениям статистически связанной с ней другой случайной величины или набора случайных величин.
Цель машинного обучения: синтезировать модель устройства, обеспечивающего требуемую реакцию на заданные входные
воздействия,
с последующей ее реализацией в заданной архитектуре интеллектуальной системы.
Случайным входным воздействиям соответствуют случайные отклики. Таким образом, для задачи регрессии случайных величин x и y
необходимо синтезировать аналитическое соотношение, позволяющее
по ранее неизвестным значениям x получить новые значения y. Обучение модели заключается в установлении такого аналитического
соот-
ношения, а сама модель тогда называется регрессионной.
Для обучения модели необходима сформированная обучающая выборка, представляющая собой набор значений величин x, для которой
известны достоверные значения величины y. Достоверность при этом
не означает детерминированность. Для обеспечения адекватного моделирования или адекватного обучения обучающая выборка должна быть
избавлена от «грязных данных
» и от артефактов измерений. Значения
в ней должны быть приведены к единым измерительным шкалам и размерностям. Например, при задаче классификации изображений классифицируемый объект и эталон для сравнения должны занимать на изображении одинаковую площадь, быть одинаковым образом ориентированы в пространстве изображения и приведены к единой цветовой и
яр-
костной шкале.
Кроме того, обучающая выборка должна удовлетворять необходимым статистическим требованиям. Она должна быть выборкой из генеральной совокупности значений случайных величин и быть репрезентативной. Генеральной совокупностью называется множество всех объектов, наблюдений или наблюдаемых состояний среды, по которым проводятся измерения. Репрезентативная выборка отражает все необходимые
свойства генеральной совокупности, учитываемые при проведении
измерений и дальнейшем анализе.
18

При построении регрессионной модели связь между величинами y
f
x
и x выражется следующим образом:
() (, ) ,yx fa x
(27)
где y – это зависимая переменная, отклик или результат; x – независимые переменные, регрессоры или неслучайные факторы;
– случайный фактор, случайная ошибка или ошибка исходных данных; а – параметры модели.
Ограничимся рассмотрением случая линейной регрессии, при ко-
тором
( , ) ... ,
ax a ax ax (28)
011
pp
где p – количество факторов (или переменных) в модели.
Обучение модели сводится к определению коэффициентов
…,
,a
0
Нелинейная регрессия отличается наличием нелинейной связи
между значениями y и хотя бы одного из факторов x (например, показательная или экспоненциальная зависимость), а регрессионная модель
для нее строится путем более сложных вычислений и с применением
более громоздких математических соотношений. Поэтому пример линейной регрессии больше подходит для пояснения принципов построения и обучения модели.
Парная регрессия является простейшим случаем линейной регрессии. Рассматривается связь только между двумя величинами:
() .yx a ax
011
(29)
.na
Далее будем обозначать
как x.
1
Задача обучения: построить линейную зависимость – уравнение или
линию регрессии, наиболее точно отражающую характер имеющихся
данных.
и
Задача сводится к определению коэффициентов
() .yx a ax
01
Коэффициент
относят к первому фактору для удобства. При этом
a
0
a
0
в функции
a
1
между факторами и парами воздействие–отклик может не быть
19

причинно-следственных связей. Параметр
N
x
N
M
F
– значение функции при от-
a
0
сутствии всех факторов, которое отражает собственные свойства модели.
Одним из самых распространенных способов решения такой задачи
является метод наименьших квадратов (МНК). Метод заключается
в расчете функционала ошибок и определении таких параметров модели, чтобы значение этого функционала было минимальным или стремилось к нулю.
Пусть
[ , ..., ]
xx
1
и
[ , ..., ]
yy y
1
– элементы обучающей вы-
борки. Тогда функционал ошибок для МНК определяется как
N
Fyaax
∑
i
()0.
iii
1
01
2
(30)
Из выражения (30) можно вывести следующие требования для корректного применения МНК.
Математическое ожидание ошибок должно стремиться к нулю:
Это гарантирует адекватность метода:
() 0.M
() .
yaax
01
i
Дисперсия всех остатков на области определения y должна быть
постоянной:
22
() ()MD
.
Выполнение этих условий называется гомоскедастичностью. Нарушение условия называется гетероскедастичностью.
Ошибки в разных наблюдениях должны быть статистически неза-
висимыми: ( ) 0.
M Это называется дельта-коррелированностью.
ij
Все эти условия можно усилить и свести к нормальному распре-
делению ошибок с параметрами 0 и
:
. Регрессионная мо-
N
2
0,
2
дель в таком случае называется нормальной регрессионной моделью.
При невыполнении хотя бы одного из перечисленных выше условий
адекватность моделирования с применением МНК не гарантируется.
Найдем решение для выражения
N
()min().
yaax F
∑
iii
i
1
01
20
2
aa
01
(31)
,
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
