Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Приложение методов фрактального анализа, теории графов и анализа сложных сетей к исследованию временных рядов.pdf
X
- •Оглавление
- •Введение
- •1.2.4. Метод усредненного вейвлет-коэффициента
- •1.1. Корреляционный анализ
- •1.1.1. Типы автокорреляции
- •1.1.2. Автомодельные процессы
- •1.2. Методы анализа долговременных автокорреляций
- •1.2.1. R/S-анализ
- •1.2.2. Флуктуационный анализ
- •1.2.3. Анализ детрендированных флуктуаций
- •1.2.5. Метод преобразования Фурье
- •1.2.6. Мультифрактальный анализ детрендированных флуктуаций
- •1.3.1. Временной ряд интенсивности новостного потока
- •1.3.2. Анализ самоподобия интенсивности новостей
- •1.4. Измерение долговременных корреляций во временных рядах настроений новостного потока
- •1.4.1. Временные ряды настроений новостей
- •1.4.2. Анализ самоподобия настроений новостей
- •1.4.3. Исследование мультифрактальности
- •2. Методы анализа данных новостной аналитики
- •2.1. Построение графа совместных упоминаний компаний в финансовых новостях
- •2.2. Анализ сети со-упоминания компаний
- •2.2.1. Сетевой анализ, методология анализа социальных сетей
- •2.2.2. Временной ряд интенсивности новостного потока
- •2.2.3. Анализ ключевых компаний
- •2.2.4. Анализ ключевых компаний по секторам экономики
- •2.2.5. Анализ ключевых компаний по биржам
- •2.2.6. Анализ распределения степеней вершин
- •2.2.7. Анализ распределения степеней вершин для подграфов
- •2.2.8. Кластерный анализ
- •2.2.9. Распределение коэффициентов кластеризации для подграфов
- •2.2.10. QAP корреляционный и регрессионный анализ
- •2.2.11. Основные выводы по анализу сети со-упоминания компаний
- •2.3.1. Распределение степеней вершин и коэффициентов кластеризации
- •2.3.2. Эволюция размера максимальных клик
- •3.1. Кластерный подход на основе графов для обнаружения событий
- •3.1.1. Обнаружение событий с помощью временных и атрибутивных ограничений
- •3.1.2. Описание данных
- •3.1.3. Результаты обнаружения событий
- •Заключение
- •Список литературы

Глава 3. Методы обнаружения экономических и финансовых событий
матрица смежности. Вершины V графа будут представлять новости, E =
= V ×V – множество ребер. Ребро соединяет две новости, если они от-
носятся к одной компании и имеют одинаковую тему. Если W (ni,nj) , 0,
то между двумя вершинами viи vjесть ребро и вес w
i j
= 1.
С таким графическим представлением W обнаружение событий можно свести к задаче разбиения графа, т. е. к разделению графа G на
подграфы. Необходимо разделить вершины графа на непересекающиеся
кластеры таким образом, чтобы каждый кластер содержал новости, которые, вероятно, соответствуют одному и тому же экономическому или
финансовому событию. Ограничения в (3.1) подразумевают, что события должны быть локализованы во времени и относиться к одной и той
же компании (или группе компаний, или к одному и тому же сектору
экономики, стране).
Algorithm 1: Обнаружение событий с помощью локальных и
атрибутивных ограничений
Input: N: набор новостей с временной, атрибутивной и
текстовой информацией; T : временной порог; A:
атрибутивная информация
begin
· Вычисляем попарные сходства S(ni,nj) между всеми
новостями в N, используя (3.1);
· Вычисляем матрицу смежности W , используя (3.2);
· Применяем алгоритм разбиения графа к W и сохраняем
значимые кластеры {ci}
m
после шагов постобработки;
i=1
end
Output: {ci}
m
: кластеры, которые соответствуют
i=1
локализованным во времени событиям и имеют один и
тот же атрибут
3.1.2. Описание данных
Рассматриваемые данные охватывают период с 1 по 31 января 2015 года (т. е. 22 торговых дня). Были учтены все новости, вышедшие за этот
период. Первоначально были выполнены отбор и очистка данных.
Описательную статистику потока новостей можно найти в табл. 3.1.
Общее количество новостей, выпущенных в январе, составило 134 199.
81

Приложение методов фрактального анализа, теории графов
Среднее количество новостей, публикуемых в день, составило 4329, что
также видно из табл. 3.1.
Были дни с очень низкой интенсивностью потока новостей (например, только 30 экономических и финансовые новости были опубликованы 1 января 2015 года), в то время как в некоторые дни количество опубликованных новостей значительно выше (например, 29 января 2015 года
было выпущено 10 238 новостей).
Описательная статистика новостного потока
в январе 2015 года
Характеристики выборки Значения
Продолжительность периода 31
Общее количество новостей 134 199
Среднее 4329
Минимум 30
Максимум 10 238
Стандартное отклонение 3122.8
Медиана 5360
Таблица 3.1
В среднем количество новостей в праздники намного меньше, чем
в будни, что показывает рис. 3.1.
4
·10
1
0.8
0.6
0.4
Количество ново стей в день
0.2
0
1 5 10 15 20 25 30
Время, дни
Рис. 3.1. Дневная динамика новостного потока в январе 2015 года
82

Глава 3. Методы обнаружения экономических и финансовых событий
Поэтому из исследования исключаются все новости в праздники.
Новостной поток сильно зашумлен, а временные ряды данных новостного потока демонстрируют самоподобие и фрактальность [101, 102,
193]. Исследуя проблему обработки зашумленной информации в данных
твиттер, в статье [186] в качестве статистической модели используется
однородный процесс Пуассона.
3.1.3. Результаты обнаружения событий
Хотелось бы сгруппировать похожие новости в один кластер таким образом, чтобы они соответствовали реальному событию в мире.
Далее был реализован алгоритм обнаружения событий и получены эмпирические результаты для разных значений временного порога θ =
= 0.5,1, 3,6, 12 часов для обнаружения кластеров событий. Результаты
представлены в табл. 3.2, 3.3. Распределение количества каскадов в зависимости от размера каскада для разных значений θ показано в табл. 3.2.
Размеры компонентов связности и временные длительности соответствующих новостных каскадов для разных значений θ представлены
в табл. 3.3.
Как видно из табл. 3.2, распределение размеров компонентов связности достаточно стабильно независимо от параметра θ. В то же время
табл. 3.3 показывает, что большинство компонентов связности соответствуют каскадам небольшого размера (от 2 до 10 новостей). Эти малогабаритные каскады не могут отражать происходящее. Очевидно, что
увеличение параметра θ должно приводить к появлению более крупных
компонентов связности и соответствующие каскады могут длиться весь
рассматриваемый период. По нашему мнению, взятие значения θ более
12 часов может привести к объединению всего новостного потока для
достаточно крупной компании в один каскад. На наш взгляд, если событие произошло, его обсуждение в ленте новостей будет происходить
достаточно интенсивно. В то же время непрерывность рабочего дня мирового финансового рынка не позволит забыть о событии и новости
будут публиковаться на финансовых рынках Азии, Европы, Америки и
т. д. Поэтому, как мы считаем, для обнаружения событий вполне достаточно взять θ в интервале от 3 до 6 часов. На рисунке 3.2 приведено
распределение числа компонентов связи (с 11 и более элементами) для
временного порога θ = 3 часа.
Анализ результатов кластеризации для алгоритма 1 показывает, что
кластеры, обнаруженные алгоритмом, соответствуют значимым эконо-
83

Приложение методов фрактального анализа, теории графов
Количество каскадов N и средняя продолжительность каскадов T с заданным разме-
Размеры
каскадов
11–20 770 26 м 847 49м 985 2 ч 13 м 1071 3 ч 59 м 1132 7 ч 50 м
21–30 84 36 м 107 1 ч 24 м 151 3 ч 53 м 159 7 ч 6 м 209 17 ч 1 м
31–40 29 1 ч 0 м 33 1 ч 28 м 41 4 ч 12 м 49 9 ч 13 м 62 17 ч 53 м
41–50 9 1ч 2 м 14 2 ч 15 м 18 6 ч 25 м 23 12 ч 1 м 24 1 д 3 ч 23 м
51–60 8 1ч 1 м 10 1 ч 56 м 13 5 ч 15 м 16 11 ч 31 м 24 21 ч 6 м
61–70 1 2 ч 43 м 1 2 ч 43 м 6 11 ч 40 м 7 22 ч 28 м 7 1 д 16 ч 59 м
71–80 2 58 м 2 58 м 2 58 м 9 15 ч 1 м 10 1 д 6 ч 56 м
81–90 0 – 0 – 0 – 0 – 1 2 д 20 ч 45 м
91–100 0 – 0 – 0 – 0 – 1 4 д 6 ч 51 м
101–110 0 – 0 – 0 – 0 – 1 1 д 8 ч 32 м
ром (количество новостей в каскаде) для разных значений θ
θ = 0.5 θ = 1 θ = 3 θ = 6 θ = 12
N T N T N T N T N T
Таблица 3.2
Характеристики размеров компонентов связности и длительности соответствующих
Характеристики каскадов Временной порог θ
Общее количество компонентов
связи (с 2 и более элементами)
Средняя продолжительность компонентов связи (с 2 и более элементами)
Средний размер компонентов связи (с 2 и более элементами)
Медиана компонентов связи (с 2 и
более элементами)
Общее количество каскадов (от 11
и более)
Средняя продолжительность каскадов (11 и более элементов)
Средний размер каскадов (от 11 и
более)
Медиана каскадов (с 11 и более
элементами)
Максимальный каскад 74 74 74 76 101
Максимальная продолжительность 3 ч 18 м 7 ч 52 м 21 ч 31 м 1 д 16 ч 59 м 4 д 10 ч 40 м
новостных каскадов для разных значений θ
0.5 часа 1 час 3 часа 6 часов 12 часов
21 038 21 276 21 382 21 610 21 657
8 м 15 м 39 м 1ч 19 м 2ч 36 м
3.98 4.10 4.31 4.43 4.57
3 3 3 3 3
903 1014 1216 1334 1471
29 м 56 м 2 ч 37 м 4 ч 57 м 10 ч 32 м
16.16 16.49 17.05 17.54 18.29
13 14 14 14 15
Таблица 3.3
84

Глава 3. Методы обнаружения экономических и финансовых событий
мическим и финансовым событиям реального мира, представляющим
интерес.
Ниже описывается несколько случаев новостных каскадов, обнару-
женных алгоритмом 1.
1. “Yahoo Inc.” решила передать свои 15% акций компании “Alibaba
Group”. На момент закрытия торгов 26 января стоимость акций оценивалась в 40 млрд долл., следует из сообщения на сайте компании. Каскад
начался 28.01.2015 в 02:36:07 и длился до 28.01.2015 в 18:04:04. Продолжительность 15 часов 27 минут 57 секунд. Количество новостей в
каскаде – 22. Первую новость напечатал “Forbes”.
2. “Facebook” сообщает результаты за четвертый квартал года и
полный 2014 год. Сообщество его пользователей постоянно росло. Выручка за четвертый квартал 2014 года составила 3,85 млрд долл., увеличившись на 49% по сравнению с 2,59 млрд долл. в четвертом квартале 2013 года. Каскад начался 21.01.2015 в 21:01:12 и продлился до
22.01.2015 15:17:24. Продолжительность 18 часов 16 минут 12 секунд.
Количество новостей в каскаде – 48. Новость распечатал “Facebook”.
3. “Netflix” закончил 2014 год с 57,4 млн подписчиков по всему миру, что превзошло ожидания роста за рубежом. Поставщик видео по запросу № 1 по подписке сообщил о квартальном доходе в
1,48 млрд долл., что на 26% больше, чем годом ранее. Акции “Netflix”
выросли более чем на 13% после закрытия торгов до 395,15 долл. за
акцию. Каскад начался 20.01.2015 в 21:01:11 и длился до 21.01.2015
15:21:30. Продолжительность 18 часов 20 минут 29 секунд. Количество
новостей в каскаде – 52. Первую новость напечатала “Variety”.
4. Утром 28 января 2015 года в 05:19:31 служба новостей BBC
сообщила о рекордных доходах “Apple”. “Apple” сообщила о квартальной прибыли в 18 млрд долл. Это исторический рекорд для публичной
компании. После этого цена акций “Apple” выросла на 5%. Это заявление вызвало новостной каскад продолжительностью 12 часов 14 минут
38 секунд. Каскад содержал 25 новостей.
5. “Tesco PLC” – британская компания и одна из старейших транснациональных торговых сетей. “Tesco PLC” владеет крупной торговой
сетью в Великобритании. Эта компания контролирует около 30% розничной торговли продуктами питания. Утром 8 января 2015 года в 7:00:28
в одном из крупнейших американских изданий “The Wall Street Journal”
была опубликована новость о снижении цен и закрытии убыточных магазинов. “Tesco PLC” планировала закрыть около 43 убыточных магазинов и продать ряд активов. После этого акции “Tesco” выросли сразу на
85

Приложение методов фрактального анализа, теории графов
14,97% и достигли 2,09 фунта стерлингов. Эта информация вызвала новостной каскад продолжительностью 21 час 31 минуту. Каскад содержал
66 новостей.
600
400
200
Количество каскадов на интервал
0
10 15 20 25 30 35 40 45 50 55 60 65 70
Количество ново стей в одном каскаде (интервалы)
Рис. 3.2. Гистограмма количества компонентов связи (с 11 и более элементами),
порог θ = 3 ч
Проведенный анализ показал, что важное экономическое или финансовое событие должно приводить к каскаду новостей. По этой причине нахождение таких каскадов в потоке новостей может использоваться для обнаружения событий. Каждый такой каскад образует кластер
на графе новостных сообщений. Следовательно, определение каскадов
(и связанных с ними событий) может быть сведено к задаче поиска соответствующих кластеров в графе. Предлагаемый алгоритм кластеризации
использует меру сходства между новостями, которая учитывает как временные, так и текстовые особенности новостной статьи. Эмпирические
результ аты по реальным данным новостной аналитики демонстрируют
эффективность предложенного подхода к обнаружению событий.
3.2. Метод обнаружения событий на основе совместного
упоминания компаний
В этом параграфе отмечается, что могут представлять интерес анализ колебаний новостного потока и разложение временного ряда на составляющие. Информационные агентства выполняют функцию агрегирования разрозненной информации из разных источников. Например,
86

Глава 3. Методы обнаружения экономических и финансовых событий
такая информация, как отчеты, балансы, аналитические обзоры и т. д.,
публикуется на регулярной основе. Крупные компании вовремя совершают множество повторяющихся операций, целенаправленно раскрывают данные о своей деятельности, что отражается в новостях. Проведенный нами анализ позволяет сделать вывод, что некоторая часть новостного потока достаточно стабильна, поскольку воспроизводится от
периода к периоду. В связи с этим предлагается подход к обнаружению
новых событий в финансово-экономической сфере. В последние годы
одна из тем исследований в социальных сетях и анализе новостей была
связана с задачей обнаружения событий [174,181,184,186,187,189]. Следует отметить, что значительная часть новостей посвящена событиям,
которых не ожидались. В этом случае каждый участник финансовой инфосферы по-своему оценивает актуальность и значимость вновь полученной информации, затем новости отфильтровываются и ранжируются
по их важности. Публикацию новости можно интерпретировать как реакцию определенного агента на возникновение определенного эпизода,
факта или события, которые, по его мнению, заслуживают отражения в
финансовых отчетах. Более важные новости должны привлекать больше внимания и вести к увеличению интенсивности новостного потока.
Изменение интенсивности со-упоминаний можно интерпретировать как
сигнал или маркер неожиданных явлений, которые могут затронуть относительно узкий или широкий круг экономических субъектов. Некоторые новости носят отраслевой или региональный характер. Чем знаменательнее событие, тем шире диапазон компаний, которые упоминаются в появляющихся новостях. Таким образом, одновременное колебание
новостного потока для широкого круга компаний можно использовать
как оценку значимости события, вызвавшего новостной шок. Некоторые из наших результатов относительно характеристик новостного потока опубликованы в [104]. В данном исследовании сосредоточимся на
упоминаниях в источниках информации о 500 крупнейших компаниях
по данным за 2005–2010 годы.
Обозначим c
(t) количество совместных упоминаний компаний i
i j
и j за период t. Элементы такой матрицы можно рассматривать как
матрицу смежности неориентированного графа, вершины которой соответствуют компаниям, а ребра – связям между вершинами. Число совместных упоминаний определяет вес ребра в графе. Количество ребер,
исходящих из вершины, и сумма весов этих ребер по состоянию на декабрь 2010 года приведены в т абл. 3.4.
87

Приложение методов фрактального анализа, теории графов
Компании с наибольшим количеством упоминаний в декабре 2010 года
Компании Число со-упомянутых
компаний
US/JPM 151 US/BAC 1913
CH/UBSN 146 US/JPM 1759
US/GS 138 US/MS 1505
US/BAC 131 US/MHP 1492
US/MS 128 US/C 1406
US/MHP 120 CH/UBSN 1389
US/C 117 US/GS 1345
GB/BARC 114 HK/0388 1277
CH/CSGN 111 US/CME 1184
DE/DBK 105 GB/RIO 1161
Компании Число со-упоминаний
Таблица 3.4
Выбирая шаг по времени ∆t, можно получить последовательность
матриц смежности C(t) = c
(t), y = 1, 2,. .. , T и соответствующих графов
i j
для ряда периодов, которые также можно интерпретировать как многомерный временной ряд. Обратите внимание, что веса ребер в графах смежности, соответствующие двум последовательным периодам,
довольно стабильны во времени. Значения коэффициента ранговой корреляции Спирмена между элементами матриц смежности за два по следовательных месяца показаны на рис. 3.3. Коэффициент корреляции колеблется от 0.35 до 0.48. Но если ограничить анализ сотней крупнейших
компаний, корреляции проявляются значительно сильнее.
Предположим, что можно разложить C(t) на отдельные элементы
C(t) = CP(t) + CE(t) + U (t), где Cp(t) – воспроизводимая от периода к
периоду (стабильная) часть графа совместного упоминания; CE(t) – составляющая, отражающая влияние событий периода t; U(t) – случайная
составляющая. Говорят, что какое-то ребро входит в устойчивую часть
графа CP(t), если, во-первых, вероятность его реализации в период t
превышает заданный уровень δ, (0 < δ < 1): P(c
(t) > 0) > δ, и во-вто-
i j
рых, наблюдаемый вес ребра находится в пределах доверительного интервала для среднего за T периодов уровня:
P(|c
(t) − c
i j
| < δ) = γ,
i j
где δ – ширина доверительного интервала, соответствующего выбранному уровню надежности γ. В приведенных ниже результатах расчетов
были использованы значения γ = 0.8; γ = 0.9. В стабильной части графа
88

Глава 3. Методы обнаружения экономических и финансовых событий
Рис. 3.3. Значения коэффициента корреляции между матрицами со-упоминаний за два последовательных месяца с января 2005 по декабрь 2010 года
представлено значительно меньше ребер, но этим ребрам соответствуют
большие веса. При уровне отсечения γ = 0.8 стабильная часть графа отражает примерно две трети общего количества новостей. Выделенную
таким образом стабильную часть графа, а именно число ребер, исходящих из указанной вершины, которые присутствовали в каждом из графов в 100% или 50% периодов (месяцев), иллюстрирует табл. 3.5. Таким
образом, 15 компаний упоминались в новостях совместно с US/MER в
каждом из календарных месяцев, в половине периодов 118 компаний
упоминались в новостях вместе с US/C и т. д.
Некоторые ребра графа присутствуют только в определенные периоды. Чем чаще упоминается одно и то же количество компаний в
течение ограниченного периода времени, тем выше значимость события или процесса, отраженных в новостях, которые происходят в течение ограниченного периода времени. Проблема обнаружения значимых
событий (News Event Detection) широко обсуждается в литературе по
данной теме [2, 13, 20, 23, 24, 35, 38]. Обычно вновь полученное текстовое сообщение анализируется на предмет сходства с уже классифицируемыми новостями. Далее его относят к событию, произошедшему
ранее, либо оно рассматривается как отражение нового события. При
этом рассчитывается время между сообщением и событием. Чем больше
времени прошло с момента наступления некоторого события, тем менее
вероятно, что вновь поступившее новостное сообщение будет иметь к
нему отношение.
89

Приложение методов фрактального анализа, теории графов
Число компаний, упоминавшихся совместно с указанной, во всех периодах
и в половине периодов
Во всех периодах Число компаний В половине периодов Число компаний
US/MER 15 US/C 118
US/JPM 14 US/JPM 109
DE/DBK 13 US/GS 99
CH/UBSN 12 CH/UBSN 88
US/C 11 US/MS 78
US/GS 10 CH/CSGN 69
US/MS 10 GB/HSBA 68
CH/CSGN 9 US/BAC 68
GB/BARC 9 DE/DBK 66
US/BAC 9 US/MER 66
AU/RIO 8 US/GM 59
GB/HSBA 8 US/MSFT 58
GB/RIO 8 US/MHP 53
AU/BHP 7 AU/RIO 44
US/MHP 7 GB/BARC 40
AU/CBA 5 AU/MBL 39
FR/13110 5 FR/13110 38
Таблица 3.5
Для анализа и кластеризации сообщений используются разные варианты методов кластерного анализа. Задача состоит в том, чтобы определить ключевые слова и общий набор терминов, характеризующих новости, интенсивность обсуждения и продолжительность события. Однако в отличие от анализа СМИ и сообщений в социальных сетях здесь
ориентируемся не на описание терминов, характеризующих событие, а
на круг компаний, на которых оно влияет. Чтобы выделить составляющие графа CE(t), которые можно интерпретировать как реакцию новости на некоторые события E(t), мы использовали следующее правило.
Ребро графа принадлежало подмножеству CE(t), если вес ребра превышал значение q-го квантиля для эмпирического распределения c
всех периодов c
i j
(t) > c
q
. Выбранные таким образом подграфы хорошо
i j
(t) для
i j
поддаются содержательной интерпретации. В периоды затишья событийная часть содержит небольшое количество вершин и ребер. Наиболее
значимая часть события соответствует финансовому кризису 2008 года.
В этот период аномальное количество упоминаний было зафиксирова-
90
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
