Применение временных рядов для анализа больших данных. Учебное пособие по курсу «Математические методы анализа больших данных»
.pdfМИНИСТЕРСТВО НАУКИ И ВЫСШЕГО ОБРАЗОВАНИЯ РОССИЙСКОЙ ФЕДЕРАЦИИ
Федеральное государственное автономное образовательное учреждение высшего образования «ЮЖНЫЙ ФЕДЕРАЛЬНЫЙ УНИВЕРСИТЕТ»
Инженерно-технологическая академия
А. Н. ЦЕЛЫХ В. С. ВАСИЛЬЕВ Э. М. КОТОВ
ПРИМЕНЕНИЕ ВРЕМЕННЫХ РЯДОВ ДЛЯ АНАЛИЗА БОЛЬШИХ ДАННЫХ
Учебное пособие по курсу
МАТЕМАТИЧЕСКИЕ МЕТОДЫ АНАЛИЗА БОЛЬШИХ ДАННЫХ
Ростов-на-Дону – Таганрог Издательство Южного федерального университета
2021
1
УДК 519.62(075.8)+004.056.5(075.8)
ББК 22.193я73+32.97я73
Ц349
Печатается по решению кафедры информационно-аналитических систем безопасности Института компьютерных технологий и информационной безопасности Южного федерального университета
(протокол № 7 от 27 апреля 2021 г.)
Рецензенты:
доктор технических наук, профессор, заведующий кафедрой информатики Таганрогского института им. А. П. Чехова (филиал) РГЭУ (РИНХ)
Я. Е. Ромм
доктор технических наук, профессор, профессор кафедры информационно-аналитических систем безопасности Южного федерального университета А. В. Боженюк
Целых, А. Н.
Ц349 Применение временных рядов для анализа больших данных : учебное пособие по курсу «Математические методы анализа больших данных» / А. Н. Целых, В. С. Васильев, Э. М. Котов ; Южный федеральный университет. − Ростов-на-Дону ; Таганрог : Издательство Южного федерального университета, 2021. − 83 с.
ISBN 978-5-9275-3983-3
Пособие посвящено рассмотрению теоретических подходов к разработке «быстрых» алгоритмов, пригодных для обработки массивов больших данных, и соответствующих структур данных. Практический аспект включает корреляционный анализ, спектральный анализ, выделение трендов и циклических составляющих, оценивание параметров моделей ARIMA, GARCH и прогнозирование на их основе значений временных рядов.
Пособие предназначено для студентов высших учебных заведений, обучающихся по направлениям 09.04.03 "Прикладная информатика" (направленность программы: "Машинное обучение и технологии больших данных") по курсу "Математические методы анализа больших данных" и 10.03.01 "Информационная безопасность" (направленность программы: "Информационно-аналитические системы безопасности") по курсу "Методы интеллектуального анализа данных".
УДК 519.62(075.8)+004.056.5(075.8) ББК 22.193я73+32.97я73
ISBN 978-5-9275-3983-3
978-5-9275-
2912-4 |
© Южный федеральный университет, 2021 |
|
© Целых А. Н., Васильев В. С., Котов Э. М., 2021 |
||
|
||
|
© Оформление. Макет. Издательство |
|
|
Южного федерального университета, 2021 |
2
СОДЕРЖАНИЕ
ВВЕДЕНИЕ …………………………………………………………… |
5 |
ГЛАВА 1. ЧИСЛЕННЫЕ МЕТОДЫ РЕШЕНИЯ СИСТЕМ |
|
ЛИНЕЙНЫХ АЛГЕБРАИЧЕСКИХ УРАВЛЕНИЙ ………………. |
6 |
1.1. Прямые, стационарные и нестационарные итерационные |
|
методы ………………………………………………………………. |
6 |
1.2. Стационарные итерационные методы решения СЛАУ ……... |
7 |
1.3. Метод Зейделя ………………………………………………….. |
8 |
1.4. Метод релаксации ……………………………………………… |
9 |
1.5. Предиктор-корректор схемы и схемы с весами ……………… |
11 |
1.6. Соответствие между задачей минимизации квадратичного |
|
функционала и задачей решения СЛАУ с симметричной матрицей |
13 |
1.7. Метод простых итераций ……………………………………… |
14 |
1.8. Аналогия методов решения СЛАУ и методов решения ОДУ ... |
16 |
1.9. Макроитерации ………………………………………………… |
17 |
1.10. Полиномы Чебышёва ………………………………………… |
19 |
1.11. Чебышёвский итерационный метод …………………………. |
21 |
1.12. Нестационарные итерационные методы решения СЛАУ ….. |
23 |
1.13. Метод скорейшего спуска ……………………………………. |
24 |
1.14. Метод минимальных невязок ………………………………... |
25 |
1.15. Метод сопряжённых направлений …………………………... |
27 |
Глава 2. ЧАСТИЧНАЯ ПРОБЛЕМА СОБСТВЕННЫХ |
|
ЗНАЧЕНИЙ …………………………………………………………… |
35 |
2.1. Решение частичных проблем собственных значений ……….. |
35 |
2.2. Процесс ортогонализации Грама-Шмидт …………………….. |
37 |
Глава 3. ПРОЦЕДУРЫ IMSL АНАЛИЗА |
|
ВРЕМЕННЫХ РЯДОВ ………………………………………………. |
41 |
3.1. Процедуры IMSL автокорреляционного и кросс-корреляци- |
|
онного анализа ………………………………………………………. |
41 |
3.1.1. Процедура ACF ………………………………………………….. |
41 |
3
Содержание
3.1.2. Процедура PACF ………………………………………………… 42
3.1.3.Процедура CCF ………………………………………………….. 43
3.1.4.Процедура MCCF ……………………………………………….. 45
3.2.Процедуры IMSL спектрального и кросс-спектрального ана-
лиза …………………………………………………………………… 46
3.2.1.Процедура DIRIC ………………………………………………... 46
3.2.2.Процедура FEJER ……………………………………………….. 47
3.2.3.Спектральные окна ……………………………………………... 48
3.2.4. Процедура PFFT ………………………………………………… |
49 |
3.2.5. Процедура SSWD ………………………………………………… |
51 |
3.2.6. Процедура SSWP ………………………………………………… |
53 |
3.2.7. Процедура SWED ………………………………………………... |
53 |
3.2.8. Процедура SWEP ………………………………………………… |
55 |
3.2.9.Процедура CPFFT ………………………………………………. 56
3.2.10.Процедура CSSWD …………………………………………….. 58
3.2.11.Процедура CSSWP ……………………………………………... 62
3.2.12.Процедура CSWED …………………………………………….. 64
3.2.13.Процедура CSWEP …………………………………………….. 67
Глава 4. ПРОЦЕДУРЫ ОЦЕНКИ МОДЕЛЕЙ |
|
ВРЕМЕННЫХ РЯДОВ ………………………………………………. |
70 |
4.1. Процедура ARMME …………………………………………… |
70 |
4.2. Процедура MAMME …………………………………………... |
71 |
4.3. Процедура nspe ………………………………………………… |
72 |
4.4. Процедура KALMN ……………………………………………. |
75 |
КОНТРОЛЬНЫЕ ЗАДАНИЯ ……………………………………….. |
79 |
ЗАКЛЮЧЕНИЕ ……………………………………………………….. |
80 |
СПИСОК ЛИТЕРАТУРЫ …………………………………………… |
81 |
4
Введение
ВВЕДЕНИЕ
Учебное пособие содержит материалы к выполнению расчётных заданий для дисциплин «Математические основы анализа больших данных» и «Математические методы интеллектуального анализа данных».
Изложены процедуры корреляционного, кросс-корреляционного, спектрального, кросс-спектрального анализа. Для решения систем линейных алгебраических уравнений большой размерности пригодны только итерационные методы. Приведены псевдокоды алгоритмов стационарных и нестационарных итерационных методов, а также условия и оценки их скорости сходимости. Для оценки параметров ряда итерационных методов требуется знание границ спектра матрицы системы линейных уравнений. Приведены псевдокоды алгоритмов решения частичной проблемы собственных значений для получения границ спектра.
Методы решения систем линейных алгебраических уравнений градиентного типа находят также широкое применение в алгоритмах машинного обучения. А последовательность решений частичной проблемы собственных значений составляет основу спектральных методов кластеризации больших массивов данных.
5
1. Численные методы решения систем линейных алгебраических уравнений
ЧИСЛЕННЫЕ МЕТОДЫ РЕШЕНИЯ СИСТЕМ ЛИНЕЙНЫХ АЛГЕБРАИЧЕСКИХ УРАВНЕНИЙ
1.1. Прямые, стационарные и нестационарные итерационные методы
Задача состоит в нахождении решения x системы Ax = b линейных алгебраических уравнений (СЛАУ). Методы решения разделяют на два направления – прямые и итерационные. В прямых методах для нахождения решения задачи заданной размерности число арифметических действий заранее предопределено. Это является достоинством прямых методов. В итерационных методах итерации продолжаются, пока не будет достигнута требуемая точность решения. Это достоинство итерационных методов – противовес недостатку прямых, в которых на получаемую точность повлиять нельзя.
Примером прямых методов является метод Гаусса. В прямых методах число арифметических действий, требуемое для решения СЛАУ с N неизвестными составляет O(N3).
Примером итерационных методов, для которых одна итерация требует O(N2) действий, можно назвать метод Якоби. Но характерное число самих итераций может составлять M, которое в большей степени определяется спектральными свойствами матрицы СЛАУ, чем размерностью задачи N. В случае слабой зависимости M от N (именно такова действительность) существует пороговое значение Nθ, до которого преимущества за прямыми методами (и по вычислительной эффективности, и по обеспечиваемой точности), а свыше – за итерационными. Практически считается, что для типичных случаев до N ≤ 100 итерационные методы не конкурируют с прямыми, а свыше N ≥ 200 – прямые не конкурируют с итерационными. Интервал 100 < N < 200 является переходным, и в нём определяющим являются характеристики матрицы СЛАУ [34], [35].
Рассматриваемая задача будет моделироваться на расчётной сетке 83×20, т.е. число неизвестных кратно 1,5·103. Поэтому анализируются только итерационные методы.
6
1.2.Стационарные итерационные методы решения СЛАУ
Ванализе методов используются два вектора-индикатора – вектор погрешности и вектор невязки. Пусть x(S) – приближение к точному решению x на шаге s. Разность η(S) = x(S) – x между приближённым x(S) и точ-
ным x-решением – это погрешность. Невязка ξ(S) на приближении x(S) – это вектор компенсации, добавляемый к левой части СЛАУ для точного выполнения уравнений Ax(S) + ξ(S) = b при подстановке x(S).
Чтобы указать вектор погрешности η(S), необходимо располагать точным решением x, которое только отыскивается. Для указания вектора невязки ξ(S) достаточно располагать только самим приближением x(S) к решению.
Вычтем из векторного уравнения Ax(S) + ξ(S) = b векторное уравнение Ax = b самой СЛАУ, т.е.
A(x |
(s) |
− x)+ ξ |
(s) |
|
|
(s) |
+ ξ |
(s) |
= 0. |
|
|
|
|
= b − b = Aη |
|
||||||
Таким образом, получаем соотношение между векторами погреш- |
||||||||||
ности η(S) и невязки ξ(S): |
|
|
|
|
|
|
|
|
|
|
|
|
|
ξ |
(s) |
(s) |
, |
|
|
|
|
|
|
|
|
|
= −Aη |
|
|
|
||
показывающее, что отыскание погрешности по сравнению с невязкой равноценно самому решению СЛАУ (решив СЛАУ, мы располагали бы и точным решением).
Итерационные методы, как правило, имеют некоторый итерационный параметр (и даже не один) τS. Если от итерации к итерации параметр не изменяется, то такие методы называют стационарными, в противном случае – нестационарными.
1.2. Стационарные итерационные методы решения СЛАУ
Рассматриваются следующие стационарные итерационные методы решения СЛАУ:
−метод Зейделя;
−метод релаксации;
−метод простых итераций;
−чебышёвский итерационный метод.
7
1. Численные методы решения систем линейных алгебраических уравнений
Чебышёвский итерационный метод имеет черты и стационарных, и нестационарных. С одной стороны, итерационный параметр от итерации к итерации изменяется, но метод принципиально состоит из целого числа макроитераций, которые повторяются одна за другой в неизменном виде.
1.3. Метод Зейделя
Простейшим рассматриваемым итерационным методом решения СЛАУ Ax = b является метод Зейделя:
(AL + D)x(s +1) + AU x(s ) = b
или
(A |
|
+ D)x |
(s+1) |
= b − A |
x |
(s) |
, |
L |
|
|
|||||
|
|
|
U |
|
|
|
|
где A = AL + D + AU, AL – |
нижняя треугольная, D – диагональная, AU – |
||||||
верхняя треугольная матрицы: |
|
|
|
|
|
||
|
|
|
0 |
|
|
|
|
|
a |
0 |
|
|
|
|
|
||
|
|
21 |
|
|
|
A |
L |
= a |
a |
0 |
|
|
|
31 |
32 |
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
an2 |
an3 |
|
|
an1 |
|||
0
AU =
|
|
|
|
|
|
|
|
|
|
|
|
|
|
, |
D |
|
|
|
|
|
|
|
|
0 |
|
|
|
|
|
|
a12 a13
0a23
0
a |
|
|
|
|
|
|
11 |
|
|
|
|
|
a |
|
|
||
|
|
|
|
|
|
|
22 |
|
|
||
= |
|
a |
33 |
|
, |
|
|
|
|
|
|
|
|
|
|
||
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
ann |
|
a1n a2n
a3n .
0
Покомпонентно вычислительная схема выглядит следующим обра-
зом:
8
1.4. Метод релаксации
( +1) = ( |
|
− |
( ) |
− |
( ) − − |
( ))⁄ |
, |
|
|||||||
1 |
|
1 |
12 |
2 |
|
|
13 |
3 |
1 |
|
11 |
|
|
||
( +1) = (− |
|
( +1) + |
− |
( ) − − |
2 |
( ))⁄ |
22 |
, |
|||||||
2 |
|
21 1 |
|
|
2 |
|
23 3 |
|
|
|
|
||||
( +1) = (− |
|
( +1) |
− |
32 |
( +1) + |
− − |
|
( ))⁄ , |
|||||||
3 |
31 |
|
1 |
|
2 |
3 |
|
3 |
|
33 |
|||||
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
( +1) = (− |
1 |
( +1) − |
|
( +1) − |
( +1) − + )⁄ . |
||||||||||
{ |
|
1 |
|
2 |
|
2 |
3 |
3 |
|
|
|
|
|
||
Обобщением метода Зейделя является метод релаксации. Соответственно, метод Зейделя является частным случаем метода релаксации. Поэтому анализ методов проведём для случая метода релаксации, из чего анализ метода Зейделя будет следовать как частный случай.
1.4. Метод релаксации
Запишем итерационную
Зейделя в виде (вычитая |
(A |
L |
+ |
|
|
|
схему
D)x |
(s ) |
|
(A |
L |
+ D)x(s +1) = b − A |
U |
x(s) |
|
|
|
из обеих частей уравнения):
метода
(AL + D)(x |
(s+1) |
− x |
(s) |
)= b − AU x |
(s) |
− (AL |
+ D)x |
(s) |
= b − Ax |
(s) |
. |
|
|
|
|
|
Идея метода релаксации состоит в ускорении сходимости за счёт «усиления» (α > 0; метод нижней релаксации; стремление к более монотонной сходимости) или «ослабления» (α < 0; метод верхней релаксации; стремление к более быстрой сходимости) диагональных коэффициентов матрицы итерационной схемы
|
|
|
(AL + D)(x |
(s+1) |
− x |
(s) |
)+ D(x |
(s+1) |
− x |
(s) |
)= b − Ax |
(s) |
. |
|
|
|
|
|||||||||||||||||||||||||
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|||||||||||||||||||||||
|
|
|
Подставляя |
x |
(s ) |
|
|
|
|
(s ) |
|
+ x |
в схему |
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|||||||||||||
|
|
|
|
|
= η |
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|||||||||||||||||||
|
|
|
|
|
(AL + D)(x |
(s+1) |
− x |
(s) |
)+ D(x |
(s+1) |
− x |
(s) |
)= b − Ax |
(s) |
, |
|
|
|
|
|
|
|||||||||||||||||||||
( |
|
|
( |
) |
|
|
( |
|
|
|
|
|
|
|
|
|
|
) |
|
|
|
|||||||||||||||||||||
|
L |
|
)( |
|
(s+1) |
|
|
(s) |
) |
|
|
L |
|
( |
) |
)( |
(s+1) |
|
|
(s) |
) |
( |
(s) |
|
|
|
(s) |
|
||||||||||||||
|
A |
|
+ 1+ |
|
D |
|
x |
|
− x |
|
|
|
|
= |
|
A |
|
|
+ 1+ D |
|
|
η |
|
− η |
|
|
|
|
= b − A η |
|
+ x |
|
= −Aη |
|
, |
|||||||
получим уравнение для погрешности
(AL + (1+ )D)(η(s+1) − η(s) )= −Aη(s) = − 12 A(η(s) + η(s+1) )− 12 A (η(s) − η(s+1) ),
9
1. Численные методы решения систем линейных алгебраических уравнений
откуда
|
|
|
|
|
(A |
|
|
|
(s +1) |
(s ) |
) |
− |
1 |
|
(s +1) |
|
(s ) |
)= |
|
|
|
||
|
|
|
|
|
L |
+ (1 + )D)(η |
− η |
2 |
A(η |
|
− η |
|
|
|
|||||||||
= (A |
|
+ (1 + )D − 1 (A |
|
+ D + A ))(η |
(s+1) |
(s ) |
|
|
|
(s) |
+ η |
(s+1) |
|||||||||||
L |
L |
|
|
|
− η |
)= − 1 A(η |
|
|
|||||||||||||||
|
|
|
|
|
|
|
2 |
|
U |
|
|
|
|
|
|
2 |
|
|
|
||||
и |
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
||
( |
1 |
AL + ( |
1 |
+ )D − |
1 |
AU )(η(s+1) − η(s) )= − |
1 |
A (η(s) + η(s+1) ). |
|||||||||||||||
2 |
2 |
2 |
2 |
||||||||||||||||||||
|
Для скалярного произведения последнего уравнения на |
(s +1) |
− |
||||||||||||||||||||
|
η |
|
|||||||||||||||||||||
получим
((12 AL + (12 + )D − 12 AU )(η(s+1) − η(s) ), η(s+1) − η(s) )= − 12 (A (η(s) + η(s+1) ),η(s+1) − η
Если матрица A симметрична (A |
|
) |
= A |
|
, , то |
|
|
T |
|
|
|
|
L |
|
|
U |
|
)
η(s )
(s) ).
( |
1 |
(A |
|
− A |
|
|
||
|
2 |
|
|
|
L |
|
U |
|
|
|
|
|
Тогда |
|
|
||
= − |
1 |
|
|
(s ) |
, |
|||
2 |
(Aη |
|
||||||
|
|
|
|
|
|
|
|
|
)(η |
(s +1) |
|
|
|
( |
η |
(s+1) |
) |
|
|
|
|
|
|
(s ) |
|
(s +1) |
|
|
(s ) |
|
|
|
и |
( |
|
(s) |
( |
|
− η |
), η |
− η |
)= 0 |
|
Aη |
,η |
||||||||||||
|
|
|
|
|
|
|
|
|
||||||||||
1 |
|
|
|
|
|
(s+1) |
|
(s) |
|
(s+1) |
|
|
(s) |
)= |
||||
2 |
+ )(D(η |
|
|
− η |
|
), η |
|
− η |
||||||||||
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
− |
1 |
|
|
(s+1) |
|
|
(s+1) |
)+ |
1 |
|
|
(s ) |
|
(s ) |
||||
2 |
(Aη |
|
, η |
|
2 |
(Aη |
, η |
|||||||||||
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
||
s+1) |
)= (Aη |
(s+1) |
,η |
(s) |
). |
|
|
|
)+ |
|
(Aη |
, η |
) |
|
1 |
(s+1) |
(s ) |
|
|
2 |
|
|
|
и ( 2 |
+ )(D(η |
|
1 |
|
|
Если матрица A |
||
и при |
1 |
+ 0 |
|
||
2 |
|
|
|
|
|
(s+1) |
− η |
(s) |
) |
, η |
(s+1) |
− η |
(s) |
) |
= − 2 (Aη |
(s+1) |
, η |
(s+1) |
)+ |
2 (Aη |
(s) |
, η |
(s) |
). |
||||||
|
|
|
|
|
|
|
|
|
|
|
|
|
1 |
|
|
|
|
|
|
1 |
|
|
|
|
– положительно определённая, то |
|
|
|
|
|
|
|
|
||||||||||||||||
|
(D(η |
(s+1) |
− |
η |
(s) |
), η |
(s+1) |
− η |
(s) |
) 0, |
|
|
|
|
|
|
|
|||||||
|
|
|
|
|
|
|
|
|
|
|
|
|
||||||||||||
получаем
(s+1) |
(s+1) |
) (Aη |
(s) |
, η |
(s) |
), |
(Aη |
, η |
|
|
что означает снижение погрешности (повышение точности) в норме, порождаемой матрицей A. В качестве итерационного параметра метода ре-
лаксации чаще указывают = (1+ )−1 . При − 12 для ω получаем
10
