Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Системы искусственного интеллекта и машинное обучение. Учебное пособие

.pdf
Скачиваний:
4
Добавлен:
07.09.2026
Размер:
1 Мб
Скачать
☆
Дисперсия является второй степенью среднеквадратического откло-
x
x
x
F
x
F
нения (СКО) случайной величины:
2
D 
(13)
,
где
– СКО случайной величины x.
Математическое ожидание и дисперсия дают исчерпывающее опи­сание нормально распределенной случайной величины. Кроме того, эти параметры имеют широкое распространение в задачах анализа выборок данных, корреляционном анализе, статистической радиотехнике и дру­гих статистических приложениях, что будет показано в следующих раз­делах этого учебного пособия.
1.3. СИСТЕМЫ СЛУЧАЙНЫХ ВЕЛИЧИН
Если на результат измерения влияет набор случайных величин, то применяются совместные законы распределения.
Пусть имеется набор случайных величин
{ , ..., }
xx
1
. Их сов-
n
местная функция распределения вероятностей
( , ..., ) ( , ..., ).
xxPXxXx
111
nnn
(14)
Их совместная ПРВ
( , ..., ) ( , ..., ).
xPxXxdx xXxdx
11111
nnnnn
(15)
При этом вид связи между ПРВ и функцией распределения вероят­ностей сохраняется.

( , ..., ) ... ( , ..., ) ... .
xx xxdxdx
111

nnn
∫∫
 
(16)
Приведем пример численных характеристик в системе двух случай­ных величин, получив выражения, подобные (8).
11
Начальные моменты в системе двух случайных величин:
x
x
R
kk k
mx xxxdxdx
 
11 11212
kk k
mx xxxdxdx
 
22 21212

∫∫
 

∫∫
 
(, ) ;
(17)
(, ) .
Центральные моменты в системе двух случайных величин:

k
  
 
111 11 1212
k

 
222 22 1212
kk
xxxxxdxdx
∫∫
 
(, ) ;
(18)

kk
xxxxxdxdx
∫∫
 
(, ) .
Помимо начальных и центральных моментов для систем случайных величин важное значение имеют смешанные моменты.
Начальный смешанный момент называется ковариационным и опре­деляется по следующему выражению:


12 12 12 1 2 1 2
∫∫
 
(, ) .Kxx xxxxdxdx
(19)
Центральный смешанный момент называется корреляционным и определяется по следующему выражению:

xxxx xxx x xxdxdx
   
 
12 1122 1122 1212
∫∫
 
(, ) .
(20)
Корреляционный момент, нормированный к СКО случайных вели­чин, называется коэффициентом корреляции и широко применяется в задачах статистического анализа.
R
12

12
.
(21)
12
r
12
Коэффициент корреляции и корреляционный момент обладают сле-
x
x
дующими свойствами:
область значений коэффициента корреляции:
коэффициенты автокорреляции равны единице:
;
1
r
nn
11r
12
11 22
;
...rr
значения парных коэффициентов корреляции в общем случае
симметричны:
rr
12 21
;
автокорреляционные моменты равны дисперсиям соответствую-
щих случайных величин:
11 1
2
;R 
R 
22 2
2
; …;
R 
nn n
2
;
равенство нулю ковариационных моментов двух случайных ве-
личин является необходимым условием их статистической независи­мости.
Случайные величины если
( , ..., ) ( ) ( ).
xxx
11
nn
{ , ..., }
xx
1
статистически независимы,
n
Статистически независимые случайные величины являются некор­релированными. Обратное утверждение в общем случае неверно.
Согласно центральной предельной теореме (ЦПТ) закон распреде­ления суммы множества независимых случайных величин с конечными дисперсиями стремится к нормальному с ростом числа слагаемых.
Понятие коэффициента корреляции широко применяют для выявле­ния зависимостей между случайными величинами.
1.4. КОРРЕЛЯЦИОННЫЙ АНАЛИЗ
Корреляционный анализ в статистических методах обработки дан­ных и машинном обучении – это совокупность основанных на матема­тической теории корреляции методов обнаружения статистической связи между случайными величинами или их признаками.
Выделяют функциональную и статистическую зависимость.
Функциональная зависимость: каждому значению независимой ве­личины y соответствует строго определенное значение зависящей от нее переменной x
, т. е. ()yfx . Такая зависимость может быть записана
строго аналитически.
13
Статистическая (вероятностная) зависимость: изменению независи-
N
X
N
x
x
мой переменной соответствует изменение статистических характери­стик зависимой переменной.
Следует разделять статистическую зависимость и корреляционную связь.
Статистическая, или корреляционная, связь: согласованное измене­ние двух и более признаков, отражающее тот факт, что изменчивость одного признака соответствует изменчивости других. Причинно-след­ственные связи при этом не рассматриваются, но
они учитываются при интерпретации статистической зависимости. Следовательно, статисти­ческая зависимость в общем случае является более сильным термином, чем корреляционная связь.
В большинстве задач статистического анализа, как правило, ограни­чиваются рассмотрением парной корреляции. При большем количестве случайных величин существенно возрастают математическая сложность вычислений и трудности в интерпретации полученных результатов.
Пусть имеются рами данных:
две переменные X и Y, представленные двумя набо-
[ , ..., ]
xx
1
и
Yy y
[ , ..., ]
1
.
Форма корреляционного поля позволяет предварительно указать на наличие взаимосвязи между двумя выборками в виде знака и каче­ственного значения коэффициента корреляции. На рис. 1–3 приведены примеры корреляционных полей для пяти разных значений коэффици­ента корреляции.
Корреляционный анализ заключается в расчете коэффициента вза­имной корреляции двух случайных величин по их выборкам значений и определении свойств корреляционной связи на его основе.
Выражение для расчета значения коэффициента корреляции опреде­ляется по (21) как
где
R
r
xy
и
 – СКО по выборкам величин X и Y соответственно.
y
xy

 
xy xy
yxy

,
(22)
14
Рис. 1. Корреляционное поле для
Рис 2. Корреляционное поле для
1
r 
xy
и
1
r
соответственно
xy
0.75
r 
xy
и
r
xy
0.75
соответственно
Рис. 3. Корреляционное поле для
15
r
xy
0
На основе полученного значения коэффициента корреляции дела-
x
ется вывод о характере зависимости двух величин:
положительная корреляционная связь: 0
отрицательная корреляционная связь: 0
случайные величины не коррелированы: 0
r ;
xy
r ;
xy
r ;
xy
насколько сильная связь: по значению
;
r
y
между величинами присутствует линейная функциональная зави-
симость:
r
.
1
xy
На практике оценить можно только коэффициент корреляции по ограниченной выборке (или выборочный коэффициент корреляции). Поэтому необходимо задать критерий для установления достаточной существенности значения выборочного коэффициента корреляции и принятия версии о том, что имеет место статистическая связь, а не слу­чайные артефакты измерения.
Для этого выдвигаются две статистические гипотезы: нет;
– связь есть.
H
1
– связи
H
0
Проверяют гипотезы одним из классических способов, например, по критерию Стьюдента.
Рассчитывается экспериментальное значение критерия Стьюдента для оценки коэффициента корреляции:
r
xy
tN

2
1
r
xy
Количество степеней свободы в (23) равно
(23)
2.
, так как рассмат-
2N
риваются две случайные величины: x и y.
Рассчитанное значение (23) сравнивается с теоретическим:
⎛⎞
где
 – вероятность ложной тревоги.
tt N
1, 2,
 
кр
⎜⎟
2
⎝⎠
16
(24)
Если условие (24) выполняется, то гипотеза
отвергается, а оце-
H
0
ненный коэффициент корреляции считается значимым. Если не выпол­няется, то гипотеза не отвергается, но это и не означает, что она прини­мается.
На практике часто измеряемые случайные величины могут быть коррелированы между собой без наличия явной причинно-следственной связи. Причины коррелированности могут быть скрыты в одном или
не­скольких факторах, общих для этих двух величин. Это явление называ­ется ложной корреляцией. Устранить влияние одного такого фактора из оценки статистической связи двух случайных величин довольно просто. С увеличением количества учитываемых факторов сложность их устра­нения существенно возрастает.
Влияние одного фактора на результат оценки коэффициента взаим-
ной корреляции двух случайных
величин устраняется путем расчета
частного коэффициента корреляции.
Пусть для пары анализируемых случайных величин наблюдается вли­яние общего для них фактора. Этот фактор можно рассматривать как тре­тью случайную величину, наблюдаемую вместе с первыми двумя. Тогда частный коэффициент корреляции, определяющий статистическую связь между исходной парой случайных величин, рассчитывается как
rrr
r
12 3
12 13 23
22

11
rr

13 23
,
(25)
где
,
и
r
r
12
13
– коэффициенты взаимной корреляции, определенные
r
23
по выборкам значений случайных величин с соответствующими поряд­ковыми номерами.
Множественный коэффициент корреляции, определяющий стати­стическую связь одной случайной величины со всеми остальными, мо­жет быть рассчитан по выражению
22
rr rrr

r
123
12 13 12 13 23
2
2
1
r
23
(26)
.
Проверка частных и множественных коэффициентов корреляции на значимость может выполняться по критериям Стьюдента или Фишера.
17
1.5. ЗАДАЧА РЕГРЕССИИ И МНК
Одним из видов задач, решаемых при классическом машинном обу­чении, является задача регрессии. Решение этой задачи подразумевает предсказание с ограниченной точностью значений случайной величины по значениям статистически связанной с ней другой случайной вели­чины или набора случайных величин.
Цель машинного обучения: синтезировать модель устройства, обес­печивающего требуемую реакцию на заданные входные
воздействия, с последующей ее реализацией в заданной архитектуре интеллектуаль­ной системы.
Случайным входным воздействиям соответствуют случайные от­клики. Таким образом, для задачи регрессии случайных величин x и y необходимо синтезировать аналитическое соотношение, позволяющее по ранее неизвестным значениям x получить новые значения y. Обу­чение модели заключается в установлении такого аналитического
соот-
ношения, а сама модель тогда называется регрессионной.
Для обучения модели необходима сформированная обучающая вы­борка, представляющая собой набор значений величин x, для которой известны достоверные значения величины y. Достоверность при этом не означает детерминированность. Для обеспечения адекватного моде­лирования или адекватного обучения обучающая выборка должна быть избавлена от «грязных данных
» и от артефактов измерений. Значения в ней должны быть приведены к единым измерительным шкалам и раз­мерностям. Например, при задаче классификации изображений класси­фицируемый объект и эталон для сравнения должны занимать на изоб­ражении одинаковую площадь, быть одинаковым образом ориентиро­ваны в пространстве изображения и приведены к единой цветовой и
яр-
костной шкале.
Кроме того, обучающая выборка должна удовлетворять необходи­мым статистическим требованиям. Она должна быть выборкой из гене­ральной совокупности значений случайных величин и быть репрезента­тивной. Генеральной совокупностью называется множество всех объек­тов, наблюдений или наблюдаемых состояний среды, по которым про­водятся измерения. Репрезентативная выборка отражает все необходи­мые
свойства генеральной совокупности, учитываемые при проведении
измерений и дальнейшем анализе.
18
При построении регрессионной модели связь между величинами y
f
x
и x выражется следующим образом:
() (, ) ,yx fa x
 (27)
где y – это зависимая переменная, отклик или результат; x – независи­мые переменные, регрессоры или неслучайные факторы;
– случай­ный фактор, случайная ошибка или ошибка исходных данных; а – пара­метры модели.
Ограничимся рассмотрением случая линейной регрессии, при ко-
тором
( , ) ... ,
ax a ax ax  (28)
011
pp
где p – количество факторов (или переменных) в модели.
Обучение модели сводится к определению коэффициентов
…,
,a
0
Нелинейная регрессия отличается наличием нелинейной связи между значениями y и хотя бы одного из факторов x (например, пока­зательная или экспоненциальная зависимость), а регрессионная модель для нее строится путем более сложных вычислений и с применением более громоздких математических соотношений. Поэтому пример ли­нейной регрессии больше подходит для пояснения принципов построе­ния и обучения модели.
Парная регрессия является простейшим случаем линейной регрес­сии. Рассматривается связь только между двумя величинами:
() .yx a ax 
011
(29)
.na
Далее будем обозначать
как x.
1
Задача обучения: построить линейную зависимость – уравнение или линию регрессии, наиболее точно отражающую характер имеющихся данных.
и
Задача сводится к определению коэффициентов
() .yx a ax 
01
Коэффициент
относят к первому фактору для удобства. При этом
a
0
a
0
в функции
a
1
между факторами и парами воздействие–отклик может не быть
19
причинно-следственных связей. Параметр
N
x
N
M
F
– значение функции при от-
a
0
сутствии всех факторов, которое отражает собственные свойства модели.
Одним из самых распространенных способов решения такой задачи является метод наименьших квадратов (МНК). Метод заключается в расчете функционала ошибок и определении таких параметров мо­дели, чтобы значение этого функционала было минимальным или стре­милось к нулю.
Пусть
[ , ..., ]
xx
1
и
[ , ..., ]
yy y
1
– элементы обучающей вы-
борки. Тогда функционал ошибок для МНК определяется как
N
Fyaax

∑
i
()0.

iii
1
01
2
(30)
Из выражения (30) можно вывести следующие требования для кор­ректного применения МНК.
Математическое ожидание ошибок должно стремиться к нулю:
 Это гарантирует адекватность метода:
() 0.M
() .
yaax
01
i
Дисперсия всех остатков на области определения y должна быть
постоянной:
22
() ()MD
 
.
Выполнение этих условий называется гомоскедастичностью. Нару­шение условия называется гетероскедастичностью.
Ошибки в разных наблюдениях должны быть статистически неза-
висимыми: ( ) 0.
M   Это называется дельта-коррелированностью.
ij
Все эти условия можно усилить и свести к нормальному распре-
делению ошибок с параметрами 0 и
 :

. Регрессионная мо-
N
2
0,
2
дель в таком случае называется нормальной регрессионной моделью.
При невыполнении хотя бы одного из перечисленных выше условий адекватность моделирования с применением МНК не гарантируется.
Найдем решение для выражения
N
()min().
yaax F


∑
iii
i
1
01
20
2
aa
01
(31)
,
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]