Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:
Методы и средства обработки сигналов. Учебное пособие.pdf
Скачиваний:
1
Добавлен:
07.09.2026
Размер:
2 Мб
Скачать
☆
81
Зависимости, строго описываемые явными формулами или алго-
( )
11
,,XY
( ) ( )
nn
XY XY
1
n
XX
1
n
YY
xXX= −
yYY
11 22
( , ), ( , ),..., ( , ).
nn
xy xy xy
0x >
ритмами, дающие возможность предсказания, называют детерминиро­ванными.
Наличие большого числа наблюдательных данных позволяет по­строить зависимость одного параметра от другого не строго, без учета других факторов. Зависимости, полученные таким образом, называют­ся статистическими.
Аппроксимация эмпирических закономерностей методом наименьших квадратов строго обоснована лишь в случае, когда только наблюдательные данные содержат погрешности. В статистических за­кономерностях «шумят» не только функции, но и аргументы. Поэтому для анализа таких закономерностей требуется особый подход.

8.2. Корреляция и коэффициент корреляции

Ситуацию, когда одно явление похоже на другое (или, наоборот, наблюдения обратно зависимы) или одно явление оказывает заметное влияние на другое, называют корреляцией. Таким образом, если две кривые коррелируют между собой, то на глаз можно отметить совпа­дение по времени отдельных локальных максимумов или минимумов. Мы, таким образом, получим качественное представление о корреля­ции. Количественную характеристику дает коэффициент корреляции, который может принимать любые значения от –1 до +1. Если между величинами Х и Y существует точная детерминированная линейная зависимость, то коэффициент корреляции равен 1 или –1, а при отсут­ствии корреляции (Х и Y независимы) – нулю.
По промежуточному значению коэффициента корреляции можно судить о степени связи величин между собой. Пусть
, ,..., ,
22
множества точек:
Возьмем эту точку в качестве начала координат новой системы
,
= −
около начала координат
– n пар точек. Определим среднее положение этого
∑
k
,
k
1
=
=
n
=
n
∑
k
=
.
k
1
. Мы получим точки на плоскости, рассеянные
Если при
82
наблюдается, как правило,
0y >
0x <
0y <
[ ]
1
.
n
kk
k
xy x y
=
=
∑
[ ]
[ ][ ]
xy
r
xx yy
=
kk
xXX
n
kk
kk
yYY
[ ]
2
1
,
n
k
k
xx x
=
=
∑
[ ]
2
1
.
n
k
k
yy y
=
=
∑
r
k
X
k
Y
r
2
1
.
r
rn−
ε=
k
X
k
Y
Y aX b= +
( ) ( )
kk
Y Y aX X−= −
.
kk
y ax=
[ ]
2
1
,
n
k
k
xy a x
=
=
∑
[ ]
2
1
,
n
k
k
xx x
=
=
∑
[ ]
22
1
.
n
k
k
yy a x
=
=
∑
( )
2
2
22
1 0
sign
1 0
k
k
ax
a
a
ra
a
a
ax
+>
= = = =
−<
∑
∑
r
11r− ≤ ≤+
, а при
–
, то говорят, что
корреляция положительная. В противном случае – отрицательная.
Возьмем сумму произведений
При положительной
корреляции почти все члены этой суммы положительны, практически никакой компенсации не происходит. Однако величина этой суммы зависит как от числа членов, так и от масштабов, в которых измеряют­ся величины x и y, а не только от корреляции. Чтобы исключить влия­ние числа членов суммы и масштабов, в качестве эмпирического ко­эффициента корреляции берут
,
где
= −
xy x y
=
,
[ ]
∑
k
=
Если n невелико, то случае, когда
и
не коррелируют. Просто случайным образом
точки расположили на плоскости так, что
,
= −
1
,
может быть отличным от нуля даже и в том
оказалось отличным от
нуля. Поэтому помимо вычисления эмпирического коэффициента кор­реляции необходимо определить и его среднеквадратическую погреш-
ность
Рассмотрим частный случай. Пусть Х и Y связаны между собой строгой линейной зависимостью Y = aХ+b.
Тогда все наблюдения (
,
) подчиняются этой зависимости
,
Очевидно, что
, т.е.
Следовательно,
В реальных ситуациях
лежит между этими двумя пределами
.
.
83

8.3. Уравнения регрессии

12
: , , ...,
n
XXX X
12
: , , ...,
n
YYY Y
k
y∆
Аппроксимация данных с учетом их статистических параметров относится к задачам регрессии. Они обычно возникают при обработке экспериментальных данных, полученных в результате измерений про­цессов или физических явлений, статистических по своей природе (как, например, измерения в радиометрии и ядерной геофизике), или на высоком уровне помех (шумов). Задачей регрессионного анализа является подбор математических формул, наилучшим образом описы­вающих экспериментальные данные.
Математическая постановка задачи регрессии заключается в сле­дующем. Зависимость величины (числового значения) определенного свойства случайного процесса или физического явления Y от другого переменного свойства или параметра Х, которое в общем случае также может относиться к случайной величине, зарегистрирована на множе-
стве точек этом в каждой точке зарегистрированные значения Y действительные значения Y
множеством значений
) со случайной погрешностью
k(Хk
и Xk отображают
k
пределенной, как правило, по нормальному закону. По совокупности значений Yk требуется подобрать функцию f(Xk, a0, a1, …, an), для кото­рой зависимость Y(X) отображалась бы с минимальной погрешностью.
Функцию f(X
, a0, a1, …, an) называют регрессией величины y на вели-
k
чину х. Регрессионный анализ предусматривает задание вида функции
, a0, a1, …, an) и определение численных значений ее параметров
f(X
k
, a1, …, an, обеспечивающих наименьшую погрешность приближения к
a
0
множеству значений Y
. Как правило, при регрессионном анализе по-
k
грешность приближения вычисляется методом наименьших квадратов (МНК).
Виды регрессии обычно называются по типу аппроксимирующих функций: полиномиальная, экспоненциальная, логарифмическая и т.п.
, при
, рас-
Если разброс точек около предполагаемой кривой зависимости од­ной величины от другой невелик, то эту зависимость можно опреде­лить с помощью МНК, подбирая подходящие параметры этой функ­ции. Если разброс точек велик, то, как правило, достаточно трудно подобрать какую-либо иную функцию, кроме линейной. Такая эмпи­рическая кривая будет прямой регрессии.

8.3.1. Линейная регрессия

84
Пусть мы имеем некоторое количество пар точек
12
: , ,...,
n
XXX X
12
: , ,...,
n
YYY Y
k
X
k
Y
kk k
Y AX C y= + +∆
k
y∆
k
X
k
Y
1
n
XX
1
n
YY
1
1
0
n
k
k
yy
n
=
∆= ∆ =
∑
Y AX C= +
( ) ( )
,
k kk
Y Y AX X y k− = − +∆ =
yYY
xXX= −
k kk
y Ax y= +∆
( )
2
2
1
min
n
kk
k
L y Ax
=
= −=
∑
[ ] [ ]
xy
Axx=
[ ]
( )( )
11
nn
kk k k
kk
xy x y X X Y Y
= =
= = −−
∑∑
[ ]
( )
2
2
11
nn
kk
kk
xx x X X
= =
= = −
∑∑
( )
[ ] [ ]
( )
xy
YY X X
xx
−= −
( )
[ ]
[ ]
( )
yy
YY r X X
xx
−= −
. Подберем прямую, проходящую между этими точками,
и, в некотором смысле, наилучшим способом аппроксимирующую за­висимость Y от X: Y = AX+C.
Точки ( прямой. Поэтому точки (
,
), вообще говоря, не лежат на аппроксимирующей
,
) до этой прямой.
, где
– расстояние по ординате
Введем в рассмотрение арифметические средние:
,
∑
k
,
k
1
=
=
=
n
Потребуем, чтобы выполнялось условие
Получим:
,
n
∑
k
=
.
k
1
.
1,2,…, n.
Снова будем пользоваться обозначениями центрированных пере­менных нимают вид
= −
,
. Теперь наши исходные уравнения при-
.
Для определения А применим метод наименьших квадратов:
,
,
где, как и раньше,
,
Величина А является коэффициентом регрессии, а уравнение ре­грессии принимает вид
или
.
.
85
X
k
Y
[ ] [ ]
xx A xy=
k
Y
k
X
( ) ( )
22 0
1
1
2
n
k
k
n
=
ε= υ
−
∑
( )
,XY
[ ]
kk
nx
Рис. 8.3.1. Линейная регрессия
Для построения функции линейной регрессии применяют полином первой степени, т.е. функцию вида y = f(t, a
Отклонения точек (
,
) от прямой регрессии создают некоторую
k
, a1) = a0, + a1t (рис. 8.3.1).
0
неопределенность (ошибку) в вычислении коэффициента регрессии А. Для вычисления ошибки А воспользуемся правилами МНК. Нормаль­ным уравнением для МНК-оценки коэффициента регрессии будет
, а остаточные разности суть отклонения
от коэффици-
ента регрессии в точках
Вычислим среднеквадратическую ошибку «единицы веса»
Нужно заметить, что хотя нормальное уравнение содержит одну неизвестную величину, в знаменателе приведенной формулы нужно брать n – 2, так как число степеней свободы прямой регрессии две: па­раллельный перенос и поворот. Степень свободы параллельного пере­носа мы использовали, выбрав за начало отсчета точку плоскости с
координатами
Весом неизвестного А является коэффициент уравнения, и
:
y Ax Y Y A X Xυ= − = − − −
kk k k k
.
.
.
нормального
xx
2
−
∑
.
2
k
ε=
A
y Ax
( )
∑
2
−
( )
86
Полученную формулу можно упростить, если ввести в рассмотре-
( )
( )
[ ] [ ] [ ]
2
2 22 2
22
k k k kk k
y Ax y Ax y A x yy A xy A xx−= − +=− +
∑∑
[ ] [ ]
xy
Axx=
[ ]
[ ]
[ ]
[ ] [ ]
[ ] [ ]
[ ]
[ ] [ ]
[ ]
( )
22 2
22
2
2
1 1
k
xy xy xy
yy xx yy yy r
xx yy xx
xx
 
υ= − + = − = −
 
∑
[ ]
[ ][ ]
xy
r
xx yy
=
[ ] [ ]
2
(1 )
( 2)
A
yy
r
xx n
−
ε=
−
[ ] [ ]
y
yy
kxx=
2
1
2
Ay
r
k
n
−
ε=
−
k
X
k
X
( ) ( )
X X BY Y−= −
k kk
x By x= +∆
[ ]
2
1
2
Bx
r
k
n
−
ε=
−
[ ] [ ]
y
yy
kxx=
k
Y
ние эмпирический коэффициент корреляции. Раскрывая скобки и сум­мируя, получим:
.
Подставим сюда
где
Следовательно,
Переменные X и Y в данной задаче равноправны. В отличие от классических задач, в которых используется метод наименьших квад-
ратов, прямой регрессии с наблюдательными данными в том числе вызвано и погрешностями в определении зависимости этих двух переменных друг от друга можно также решать,
как определение линейной зависимости X от Y:
Тогда, повторяя приведенные выше выкладки, получим:
не являются точными значениями аргумента. Несовпадение
.
.
:
,
. Обозначим
. Поэтому задачу аппроксимации
. Теперь
.
,
X X YY
−= −
( )
Зависимость Y от X при условии минимизации отклонений прямой регрессии, как уже говорилось, называется регрессией y на x.
Наоборот, зависимость X от Y называется регрессией x на y. Эти две прямые, вообще говоря, не совпадают.
xy
( )
yy
[ ]
,
,
.
от
87

8.3.2. Полиномиальная регрессия

Одномерная полиномиальная регрессия с произвольной степенью n полинома и с произвольными координатами отсчетов реализуется вы­числением по формуле
f(x) = а
+ а1x1 + а2x2 + … + аnxn.
0
На рис. 8.3.2 приведен пример полиномиальной регрессии с ис­пользованием полиномов 2, 3 и 8-й степени. Степень полинома обычно устанавливают не более 4-6 с последовательным повышением степени, контролируя среднеквадратическое отклонение функции аппроксима­ции от фактических данных. Нетрудно заметить, что по мере повыше­ния степени полинома функция аппроксимации приближается к фак­тическим данным, а при степени полинома, равной количеству отсчетов данных минус 1, вообще превращается в функцию интерпо­ляции данных, что не соответствует задачам регрессии.
Рис. 8.3.2. Одномерная полиномиальная регрессия
Зональная регрессия. При больших интервалах с большим количе- ством отсчетов и сложной динамике изменения данных рекомендуется применять последовательную локальную регрессию отрезками поли­номов малых степеней.
На рис. 8.3.3 приведен пример вычисления регрессии модельной кривой (отрезка синусоиды) в сумме с шумами. Параметр span опреде­ляет размер локальной области и подбирается с учетом характера дан­ных и необходимой степени их сглаживания (чем больше span, тем больше степень сглаживания данных).
88
Рис. 8.3.3. Зональная регрессия полиномом второй степени

8.3.3. Нелинейная регрессия

Линейное суммирование произвольных функций. В программных пакетах для инженерных вычислений, таких как MatLab, MathСad и прочих имеется возможность выполнения регрессии с приближением к функции общего вида весовой суммы функций f
f(x, K
) = K1·f1(x) + + K2f2(x) + … KN fN(x).
n
При этом сами функции f
(x) могут быть любого, в том числе нели-
n
нейного типа. С одной стороны, это резко повышает возможности ана­литического отображения функций регрессии. Но с другой стороны, это требует от пользователя определенных навыков аппроксимации экспериментальных данных комбинациями достаточно простых функ­ций.
Регрессия общего типа. Второй вид нелинейной регрессии реали­зуется путем подбора параметров к заданной функции аппроксимации с использованием функции, обеспечивающей минимальную средне­квадратическую погрешность приближения функции регрессии к входным данным (векторы Х и Y координат и отсчетов). Пример при- веден на рис. 8.3.4, где G(x) – набор из трех экспонент.
(x):
n
Рис. 8.3.4. Регрессия общего типа
89
Типовые функции регрессии. Для простых типовых формул ап-
1( )fx
2( ).fx
проксимации предусмотрен ряд функций регрессии, в которых пара­метры функций подбираются программой самостоятельно.
На рис. 8.3.5 приведен пример реализации синусоидальной регрессии модельного массива данных по базовой синусоиде
нии с зональной регрессией полиномом второй степени
в сопоставле-
Как можно видеть из сопоставления методов по среднеквадратиче­ским приближениям к базовой кривой и к исходным данным, извест­ность функции математического ожидания для статистических данных с ее использованием в качестве базовой для функции регрессии дает возможность с более высокой точностью определять параметры ре­грессии в целом по всей совокупности данных, хотя при этом кривая регрессии не отражает локальных особенностей фактических отсчетов данной реализации. Это имеет место и для всех других методов с зада­нием функций регрессии.
Рис. 8.3.5. Синусоидальная регрессия

8.4. Сглаживание данных

Сглаживание данных как искаженных помехами, так и статистиче­ских по своей природе, также можно считать частным случаем регрес­сии без определения символьной формы ее функции, а потому может выполняться более простыми методами. Обычно для сглаживания применяется линейное сглаживание методом наименьших квадратов по k ближайших отсчетов с адаптивным выбором значения k вание данных на основе распределения Гаусса; сглаживание данных по методу скользящей медианы и др.
Сопоставление методов сглаживания приведено на рисунке. Как вид­но из этого рисунка, качество сглаживания двух первых методов пример­но одинаково. Медианный способ уступает по своим возможностям двум другим, особенно на концах интервала задания данных.
; сглажи-
90
1( )fx
2( )fx
Сопоставление методов сглаживания

8.5. Предсказание зависимостей

По вектору равномерно распределенных данных Y иногда требует­ся составить вектор K точек предсказания (экстраполяции) поведения произвольного сигнала за пределами его задания (по возрастанию ко­ординат х). Предсказание тем точнее, чем более гладкую форму имеет заданный сигнал. Пример предсказания для гладкой аналитически за­данной функции
ных данных полинома определяет глубину использования входных данных и может
быть достаточно небольшой для гладких и монотонных сигналов. Ошибка прогнозирования увеличивается по мере удаления от реаль­ных данных.
и статистически зашумленных эксперименталь-
приведен на рисунке. Степень аппроксимирующего
Предсказание зависимостей
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]