Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:
Технологии обработки информации. Учебное пособие.pdf
Скачиваний:
0
Добавлен:
15.08.2026
Размер:
910 Кб
Скачать

 

Путём подбора различных полиномов, а также исходя из графиче-

ского представления, которое во многих случаях позволяет приближённо

выявить тип тенденции временного ряда

 

 

 

 

 

yi = a + b *t + c *t2 .

 

 

Основой для методики оценки параметров тренда служит МНК, ко-

торый даёт оценки параметров, отвечающие принципу максимального

правдоподобия: сумма квадратов отклонений фактических уровней от

тренда должна быть минимальной для данного типа уравнения.

 

Уравнение тренда примет вид:

 

 

 

2 .

 

yi = - 343,605852 + 1797,810035× t - 20,5728498× t

 

В одной координатной плоскости изображены исходный ряд и ряд,

полученный аналитическим выравниванием по параболе второго поряд-

ка (рис. 2.2.)

 

 

70000

 

 

60000

 

 

50000

 

Продажа

40000

Продажи

 

30000

Тренд

 

 

 

 

20000

 

 

10000

 

 

0

 

 

апр.82 авг.82 дек.82 апр.83 авг.83 дек.83 апр.84 авг.84 дек.84 апр.85 авг.85 дек.85 апр.86 авг.86 дек.86 апр.87

авг.87 дек.87

 

Месяц

 

Рис. 2.2. Выделение трендовой составляющей из исходного ряда

Достоверность модели

Следующим шагом после получения регрессионной модели является анализ достоверности этой модели. Иными словами, требуется установить, является ли гипотеза, положенная в основу регрессионной модели, достаточно правильной, чтобы с её помощью делать предсказания, и, какая степень точности придаётся оценкам, содержащимся в регрессионной модели.

Анализ точности и достоверности моделей можно производить путём рассмотрения следующих характеристик:

42

 

разброс данных вокруг их среднего значения SSt =

G

( y j Y )2 ,

 

å

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

j= 1

 

 

 

 

 

 

 

 

 

 

 

 

 

 

SSr

=

G

(Yj

YAj )2 ,

 

– разброс данных вокруг линии регрессии

å

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

j = 1

 

 

разброс линии регрессии вокруг среднего значения

 

 

 

SSB =

G

(YAj

Y )2 .

 

 

 

 

 

 

 

 

 

 

 

 

å

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

j = 1

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

Для этого вычисляется дисперсионное отношение (критерий

Фишера):

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

F =

SS

B

÷

SS

r ,

 

 

 

 

 

 

 

 

 

 

 

 

 

 

γ

δ

 

 

 

 

 

 

 

 

 

 

 

 

где γ

= n = 2; δ

= G n – 1 = 69.

 

 

 

 

 

 

 

 

 

 

 

Полученное значение F-критерия, равное 63,61455849, сравним с

критическим.

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

1,2

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

1

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

0,8

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

1-F 0,6

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

0,4

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

0,2

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

0

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

0

4

8

2

6

2

4

8

2

,6

4

 

4

8

2

6

 

 

 

 

,

0,

,

1,

 

2,

2,

,

 

,

4,

,

5,

 

 

 

 

0

 

1

 

3

3

 

4

5

 

 

 

 

 

 

 

 

 

 

 

 

U

 

 

 

 

 

 

 

 

 

 

Рис. 2.3. Фишеровское распределение величин

 

 

 

 

 

 

с доверительным уровнем, равным 96 %

 

 

Из рис. 2.3 видно, что критическое значение фишеровского распределения величин с доверительным уровнем, равным 96 %, и γ = 2, δ = 69, равно 3,4.

Расчётное значение больше критического, значит гипотеза о том, что полученное уравнение регрессии правильно отображает процесс, принимается.

Для определения степени взаимосвязи объекта и его полученной модели вычисляется коэффициент множественной корреляции:

43

KR =

1SSr .

 

 

SSt

 

Для принятия модели по степени взаимосвязи необходимо иметь:

KR2 ³

0,25 .

(2.1)

В нашем случае KR=0,8052144, и условие (2.1) выполняется

(0,64837023 >0,25).

 

Учёт сезонной составляющей

 

Если из исходного процесса вычесть трендовую составляющую, то

получим сезонную составляющую (рис. 2.4).

 

 

Сезонная составляющая за 6 лет

 

35000

 

 

30000

 

 

25000

 

 

20000

 

 

15000

 

 

10000

 

Сезонная

Продажи

 

5000

 

составляющая

0

 

за 6 лет

-5000

апр.82 авг.82 екд.82 апр.83 авг.83 дек.83 апр.84 авг.84 екд.84 апр.85 авг.85 дек.85 апр.86 авг.86 дек.86 апр.87

авг.87 дек.87

-10000

-15000

 

 

-20000

 

 

 

Месяц

 

 

Рис. 2.4. Сезонная составляющая за 6 лет

Сезонные составляющие каждого года необходимо центрировать, т.е. найти отклонение от среднего значения ряда.

В результате усреднения всех сезонных составляющих шести лет получаем среднюю сезонную составляющую (рис. 2.5).

8000,0000000

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

6000,0000000

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

4000,0000000

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

2000,0000000

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

Продаж а 0,0000000

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

Средняя

 

в

 

в

 

 

т

 

р

 

й

юн

юл

г

 

нт

кт

 

б

к

сезонная

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

в

 

 

волна

н

е

 

р

п

а

а

 

я

де

-2000,0000000я

 

ф

 

а

 

а

 

м

 

и

и

 

с

 

 

но

 

 

 

 

 

 

м

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

-4000,0000000

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

-6000,0000000

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

-8000,0000000

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

Месяц

 

 

 

 

 

 

 

 

Рис. 2.5. Средняя сезонная волна за 6 лет

 

44

2.3. Прогнозирование

Прогнозирование – это способ научного предвидения, в котором используется как накопленный в прошлом опыт, так и текущие допущения насчет будущего с целью его определения. Результатом является прогноз, т.е. научно обоснованное суждение о возможных состояниях объекта в будущем, об альтернативных путях и сроках его существования.

При прогнозировании будем учитывать как тренд, так и сезонную составляющую, т.е.:

y = c0 + c1 *t + c2 *t2 + c3 *S(t) ,

где S(t) – средняя сезонная составляющая. Поскольку нам известны значения средней сезонной волны, то мы можем для прогнозирования не-

ограниченно распространить её вправо и влево. Коэффициенты ci , i =

0…3 определяются как коэффициенты множественной линейной регрессии.

2.4. Реализация обработки данных с помощью Deductor

Для выполнения этой процедуры необходимо следующее:

1. Импортировать структурированный текстовый файл с разделителями, содержащий исходные данные (рис. 2.6) (подробно изложено в п. 1.4).

Рис. 2.6. Импортирование данных из текстового файла

45

2. Выбрать метод обработки – декомпозиция временного ряда на сезонную и трендовую составляющие (рис. 2.7).

Рис. 2.7. Декомпозиция временного ряда на сезонную и трендовую составляющие

Следующим этапом исследования временного ряда является оценка параметров на скользящем постоянном интервале.

46

Библиографический список

1.Барсегян А.А., Куприянов М.С., Степаненко В.В., Холод И.И. Технологии анализа данных: Data Mining, Visual Mining, Text Mining, OLAP. – СПб.: БХВ-Петербург, 2008.

2.Паклин Н.Б., Орешков В.И. Бизнес-аналитика: от данных к знаниям. – СПб: Питер, 2013. – 704 с.

3.Информационно-аналитические системы: учеб. пособие / Г.А. Калачев, О.Н. Стасюк. – Омск: Изд-во СибАДИ, 2010. – 101 с.

4.Чубукова И.А. Data Mining: учеб. пособие. – М: Интернет-уни- верситет информационных технологий: БИНОМ: Лаборатория знаний, 2006.

5.Владимир Рафалович. Data Mining или Интеллектуальный анализ данных для занятых. Практический курс. Издательство: SmartBook, 2014.

6.Тьюки, Дж. Анализ результатов наблюдений. Разведочный анализ. – М.: «Мир»,1981г. – 688 c.

7.Нейронные сети для адаптивной обработки данных: учеб. пособие / М.П. Булаев, А.Н. Кабанов, И.С. Маркова. Рязан. гос. радиотехн. ун-т. – Рязань, 2012. – 24 с.

8.Математическая статистика и прогнозирование: учеб. пособие / М.П. Булаев, Н.В. Дорошина, А.Н. Кабанов. Рязан. гос. радиотехн. ун-т. – Рязань, 2014. – 64 c.

9.Петрунин Ю.Ю. Информационные технологии анализа данных. Data analysis: учеб. пособие. – М.: КДУ, 2008. – 292 c.

10.Отбор однородных групп экспертов на основе метода парного сравнения / А.Н. Кабанов, А.М. Гаушко, Д.Н. Фоломкин. Труды международной научной конференции «Математические методы в технике и технологиях» ММТТ-28. – Рязань, РГРТУ, 2016. БД РИНЦ.

11.Маркин А.В. Разработка отчетов в информационных системах: учеб. пособие. – М: Диалог-МИФИ, 2012. – 312 c.

47

ОГЛАВЛЕНИЕ

 

ВВЕДЕНИЕ ..................................................................................................

3

ГЛАВА 1. Очистка данных. Многомерная кластеризация.

 

Основные теоретические положения ......................................

5

1.1. Задача о кластеризации множества элементов ..................................

6

1.2. Построение кратчайшего остовного дерева. ......................................

6

1.3. Многомерная кластеризация на основе алгоритма k-средних

 

(k-means) ................................................................................................

10

1.4. Кластеризация множества элементов в Deductor ..............................

12

1.5. Редактирование аномалий в группах.

 

Основные теоретические положения ..................................................

13

1.6. Исключение аномальных результатов измерений в Deductor ..........

22

1.7. Определение главных компонент

 

дискретного конечного множества элементов ...................................

23

1.8. Очистка данных. Оперативное оценивание параметров

 

модели регрессии при наличии аномальных данных.

 

Основные теоретические положения ..................................................

35

ГЛАВА 2. Трансформация данных.

 

Преобразование к скользящему окну.

 

Основные теоретические положения .......................................

38

2.1. Описание временного ряда ...................................................................

38

2.2. Декомпозиция временных рядов .........................................................

40

2.3. Прогнозирование ..................................................................................

45

2.4. Реализация обработки данных с помощью Deductor ........................

45

Библиографический список.........................................................................

47

48

Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]