Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Приложение методов фрактального анализа, теории графов и анализа сложных сетей к исследованию временных рядов.pdf
X
- •Оглавление
- •Введение
- •1.2.4. Метод усредненного вейвлет-коэффициента
- •1.1. Корреляционный анализ
- •1.1.1. Типы автокорреляции
- •1.1.2. Автомодельные процессы
- •1.2. Методы анализа долговременных автокорреляций
- •1.2.1. R/S-анализ
- •1.2.2. Флуктуационный анализ
- •1.2.3. Анализ детрендированных флуктуаций
- •1.2.5. Метод преобразования Фурье
- •1.2.6. Мультифрактальный анализ детрендированных флуктуаций
- •1.3.1. Временной ряд интенсивности новостного потока
- •1.3.2. Анализ самоподобия интенсивности новостей
- •1.4. Измерение долговременных корреляций во временных рядах настроений новостного потока
- •1.4.1. Временные ряды настроений новостей
- •1.4.2. Анализ самоподобия настроений новостей
- •1.4.3. Исследование мультифрактальности
- •2. Методы анализа данных новостной аналитики
- •2.1. Построение графа совместных упоминаний компаний в финансовых новостях
- •2.2. Анализ сети со-упоминания компаний
- •2.2.1. Сетевой анализ, методология анализа социальных сетей
- •2.2.2. Временной ряд интенсивности новостного потока
- •2.2.3. Анализ ключевых компаний
- •2.2.4. Анализ ключевых компаний по секторам экономики
- •2.2.5. Анализ ключевых компаний по биржам
- •2.2.6. Анализ распределения степеней вершин
- •2.2.7. Анализ распределения степеней вершин для подграфов
- •2.2.8. Кластерный анализ
- •2.2.9. Распределение коэффициентов кластеризации для подграфов
- •2.2.10. QAP корреляционный и регрессионный анализ
- •2.2.11. Основные выводы по анализу сети со-упоминания компаний
- •2.3.1. Распределение степеней вершин и коэффициентов кластеризации
- •2.3.2. Эволюция размера максимальных клик
- •3.1. Кластерный подход на основе графов для обнаружения событий
- •3.1.1. Обнаружение событий с помощью временных и атрибутивных ограничений
- •3.1.2. Описание данных
- •3.1.3. Результаты обнаружения событий
- •Заключение
- •Список литературы

Глава 2 Методы анализа данных новостной аналитики
В данной главе предлагается один из подходов к анализу новостных
данных, основанный на представлении взаимосвязей между компаниями
в форме графа совместных упоминаний. Информационный фон, несомненно, оказывает существенное влияние на динамику рыночных цен
активов, принятие решений в сфере финансов и управлении рисками.
Поставщики финансовой информации уже длительное время включают
в состав продуктов, предлагаемых участникам денежного и фондового рынка, доступ к сервисам новостной аналитики. Наряду с данными биржевых котировок, аналитическими обзорами и т. д. подписчикам
предлагается доступ к информационным ресурсам, содержащим сведения о времени выхода новостей и полученных на о снове анализа их
текста индикаторов, таких как тип новостного сообщения, его источник, время публикации, индикаторы новизны, настроения, релевантности и т. д. Кроме того, указывается, какие компании упомянуты в тексте
либо могут быть соотнесены с новостью. Крупнейшие поставщики обрабатывают новостную информацию практически обо всех крупнейших
компаниях по всему миру из широкого перечня информационных источников, таких как информационные агентства, социальные сети, блоги и
т. д. Они также рассматривают так называемые предварительные новости, т. е. отчеты компаний, правительственных учреждений и бизнесресурсов, судебные документы, объявления, промышленную и макроэкономическую статистику.
Подписчики таких сервисов получают поток данных новостной аналитики в режиме реального времени и могут разрабатывать количественные модели или торговые стратегии, которые используют как финансовые, так и новостные аналитические данные. Обзор методов и инструментов новостной аналитики можно найти в книгах [10, 109]. В последние годы инструменты аналитики новостей были разработаны и использованы в анализе социальных сетей [110–113].
В главе описываются разные методы импорта и агрегирования новостных, информационных, финансовых и других данных. Эти методы
41

Приложение методов фрактального анализа, теории графов
используются нами далее для формирования матриц сходства объектов
(графов сетевых структур) по разным источникам данных:
1) в нашем исследовании матрицы сходства строились на основании
одновременного со-упоминания компаний в новостях;
2) построение матрицы сходства по финансовым данным может осуществляться разными способами:
– преобразованием матрицы ковариаций доходностей активов;
– преобразованием матрицы ковариаций объемов торгов;
– выявлением резких скачков доходности или волатильности (шоков)
и построением матриц сходства как числа шоков, наблюдаемых для
разных компаний в течение рассматриваемого периода времени.
Число скачков является базисом для построения матриц сходства;
3) построение матрицы сходства на основании отраслевой, географической и т. д. принадлежности компаний.
Применялись следующие подходы и методы к исследованию полу-
ченных графов:
1) анализ сетевых структур, заданных одним графом. Основными методами являлись выделение клик, поиск центральных вершин, исследование законов распределения степеней вершин и локальных
характеристик вершин графа;
2) динамические модели сетевых структур. Для поиска нетипичных
фрагментов исследуемых графов использовались методы классификации и кластеризации;
3) корреляции графов, линейные регрессии на графах. Применялись
методы корреляционного и регрессионного анализа матриц смежности вершин с использованием QAP – процедуры контроля качества.
2.1. Построение графа совместных упоминаний компаний в финансовых новостях
Информационные агентства, биржи, компании, журналы генерируют огромное количество экономических и финансовых новостей. Новостные сервисы уже длительное время обеспечивают доступ в режиме
реального времени к сведениям о выходе новостей и полученных на
основе анализа их текста индикаторов, таких как тип новостного сообщения, его источник, время публикации, индикаторы новизны, настроения, релевантности и т. д. Указывается также, какие компании могут
быть соотнесены с новостью.
42

Глава 2. Методы анализа данных новостной аналитики
Новости, как правило, затрагивают лишь одну конкретную компанию. Но более чем в 10% случаев поставщик сервиса полагает верным
соотнести новостное сообщение с некоторым перечнем компаний. Тогда
говорят, что имело ме сто со-упоминание этих компаний в новостном потоке. Подсчитывая число таких со-упоминаний для всевозможных пар
компаний в заданный период времени, можно построить матрицу соупоминаний. Кажется разумным полагать, что такая матрица отражает
мнения финансовой инфосферы о степени взаимозависимости бизнеспроцессов пары или группы компаний. Более частое появление в новостях некоторых со-упоминаний дает возможность выяснить, как мировая
финансовая информационная система воспроизводит восприятие взаимного влияния или взаимозависимости деятельности участников рынка.
Кроме того, анализ матрицы со-упоминаний позволяет охарактеризовать
восприятие бизнес-связей компании с другими участниками и место
компании в системе взаимосвязей.
Использованная нами процедура построения графа совместных упоминаний включает следующие этапы [114]:
1) сбор полных текстов всех экономических и финансовых новостей,
опубликованных в течение некоторого периода времени;
2) определение списка компаний, которые упоминаются в данной новости, для каждого новостного сообщения;
3) подсчет ссылок для каждой пары со-упомянутых компаний для всех
наборов доступных новостей;
4) построение симметричной взвешенной матрицы со-упоминания компаний;
5) статистический анализ матрицы совместного упоминания, визуализацию и интерпретацию результатов.
Шаги 1 и 2 требуют обработки большого количества новостных
ресурсов. Действия на шагах 1 и 2 выполняются провайдерами новостной аналитики. В исследовании будут использованы уже подготовленные данные новостной аналитики.
Сеть со-упоминания компаний формируется следующим образом:
компания имеет связь с теми конкретная компаниями, которые были
упомянуты в новостях вместе с ней. Основываясь на доступных данных новостной аналитики, была построена матрица смежности, которая представляет собой взаимосвязь компаний в соответствии со следующим подходом.
Предположим, есть восемь новостей N 1–N8. Пусть в N 1 упомина-
ются три компании – c1, c2 и c3; в N2 – две компании, c3 и c4: в 3-й
43

Приложение методов фрактального анализа, теории графов
c2
c1 c3
c5
c4
c6
c7
1
1
1
3
2 2
3
1
новости – компании c4, c5, c6; в N4 – две компании, c6 и c7; в N5 –
две компании, c1 и c2; N 6 имеет две совместно упомянутые компании –
c4, c6; N7 упоминает три компании – c4, c5 и c6; N8 – упоминает две
компании c1 и c2 (табл. 2.1).
В итоге получаем следующую весовую симметричную матрицу
(табл. 2.2).
Новости / компании
Таблица 2.1
c1 c2 c3 c4 c5 c6 c7
N1 + + +
N2 + +
N3 + + +
N4 + +
N5 + +
N6 + +
N7 + + +
Весовая матрица
c1 c2 c3 c4 c5 c6 c7
c1 0 3 1 0 0 0 0
c2 3 0 1 0 0 0 0
c3 1 1 0 1 0 0 0
c4 0 0 1 0 2 3 0
c5 0 0 0 2 0 2 0
c6 0 0 0 3 2 0 1
c7 0 0 0 0 0 1 0
Таблица 2.2
N8 + +
Сеть со-упоминания компаний, построенная на основе матрицы смежности, представлена на рис. 2.1. Связываем компании c1–c2 с весом 3,
c1–c3 с весом 1 и т. д. Здесь узлы представляют компании и устанав-
ливается связь между двумя узлами, если есть новость, в которой упоминаются обе компании. Таким образом, каждая компания приобретает
определенную ценность в зависимости от количества новостей, в которых она упоминается. Более того, можно рассматривать количество со-
Рис. 2.1. Сеть со-упоминания компаний: узлами являются ком-
пании, а вес ребра соответствует числу совместных новостей
44

Глава 2. Методы анализа данных новостной аналитики
упоминаний как силу связей между компаниями. Таким образом, сеть
со-упоминания компаний будет представлена в виде неориентированного взвешенного графа.
2.2. Анализ сети со-упоминания компаний
На основе подхода из предыдущего параграфа будет построена матрица, содержащая количество совместных новостей между парами компаний, акции которых торгуются на основных финансовых рынках. Для
нахождения ключевых компаний в сети были использованы различные
типы метрик анализа социальных сетей (SNA). Для проверки гипотезы о воспроизводстве в сетевом графе со-упоминаний компаний их
отраслевой и биржевой принадлежности будем опираться на Quadratic
Assignment Procedure (QAP), которая была предложена и разработана
в [115–118]. С тех пор QAP широко используется в анализе социальных сетей (см., например, [119–124], среди многих других). QAP – это
своеобразный тип теста перестановок, который сохраняет неизменной
структуру двоичных данных при перестановках.
В исследовании были использованы два способа построения подсетей:
1) секторальный – подсети представляют различные сектора экономики, такие как продукты, ресурсы, сектор услуг и ИТ-сектор;
2) географический – каждая подсеть состоит из компаний одной и той
же фондовой биржи.
Были сформулированы следующие гипотезы:
1) степени вершин сети со-упоминания компаний распределены по
степенному закону;
2) распределение коэффициентов кластеризации для сети со-упоминания подчиняется степенному закону;
3) имеет место степенное распределение степеней узлов и коэффициентов кластеризации подсетей со-упоминания компаний;
4) сеть совместного упоминания компаний воспроизводит отраслевую
структуру экономики;
5) структура сети совместных упоминаний компаний отражает кластеризацию компаний на основе их принадлежности к фондовой бирже.
45

Приложение методов фрактального анализа, теории графов
2.2.1. Сетевой анализ, методология анализа социальных сетей
Анализ социальных сетей рассматривает социальные отношения с
точки зрения теории графов. SNA представляет объекты в сети в виде узлов и связей, которые описывают отношения между объектами,
такие как дружба, соавторство, организации и сексуальные отношения
[11,13, 125–127]. Основная цель SNA состоит в измерении отношений и
потоков между объектами (отдельными лицами, группами, организациями, URL-адресами и другими связанными объектами) [14,128,129]. SNA
обеспечивает как визуальный, так и математический анализ отношений
между людьми и объектами [130, 131]. В целом анализ социальных сетей может помочь оценить эффективность отдельных людей, групп или
всей социальной сети.
Одной из задач данного исследования является выявление ключевых компаний сети. Предполагается, что компании с обширными связями или со-упоминаниями со многими другими компаниями считаются в экономике более важными, чем компании с относительно меньшим количеством связей. Для поиска ключевых компаний в сети были использованы следующие общеизвестные метрики SNA: частота (F,
frequency), центра льность по степени (DC, degree centrality), центральность по близости (CC, closeness centrality), центральность по посредничеству (BC, betweenness centrality), центральность собственного вектора
(EC, eigenvector centrality).
Частота
Частота определяется как общее количество новостей, в которых
упоминается компания.
Центральность по степени
Степень узла – это число его прямых связей [132]. Степень узла
равна количеству ребер, примыкающих к нему [125, 133].
Центральность по степени является простейшей мерой центральности, так как она определяет только количество связей компании с их
непосредственными соседями в сети [134].
Таким образом, ключевые узлы обычно имеют высокую степень.
Степень является показателем влияния компании. Нормализованная степень определяется как число связей актора, деленное на максимально
возможное количество связей [135, 136].
46

Глава 2. Методы анализа данных новостной аналитики
Нормализованная степень diузла i определяется как
d(i)
di=
n − 1
.
Центральность по близости
Чтобы определить, насколько близко узел находится ко всем остальным узлам в сети (как напрямую, так и косвенно), можно использовать
меру близости [125]. Близость – это средняя длина (количество шагов)
кратчайших путей, соединяющих узел со всеми другими узлами в сети. Близость измеряется как обратная величина этого среднего [132].
Метрика близости может использоваться только в сети, в которой каждые два узла имеют хотя бы один путь к другому, т. е. в связанной
сети [137–139]. Центральность Cc(i) узла i определяется следующим образом:
Cc(i) =
1
avg(L(i, j))
, (2.1)
где L(i, j) – длина кратчайшего пути между двумя узлами i и j. Центральность по близости каждого узла лежит между 0 и 1. В рамках SNA
центральность по близости измеряет скорость распро странения информации от данного узла к другому достижимому узлу в сети.
Центральность по посредничеству
Центральность по посредничеству отображает степень, в которой
узел лежит вдоль путей, соединяющих другие пары узлов [140]. Узел
в данном месте находится в состоянии контроля или влияния на информационные потоки в сети. Это доля путей, содержащих узел, который соединяет пару узлов в сети. Таким образом, центральность по
посредничеству измеряет потенциальный авторитет объекта внутри с ети [125, 133]. По определению, центральность по посредничеству – это
отношение количества кратчайших путей (между всеми парами узлов),
проходящих через данный узел, к общему количеству кратчайших путей. Центральность по посредничеству Cb(i) узла i равна
Cb(i) =
2
(n − 1)(n − 2)
∑
j,i,k
σjk(i)
, (2.2)
σ
jk
где сумма берется по всем узлам j и k, отличным от i, σjk– это число
кратчайших путей от j до k, а σjk(i) обозначает количество кратчайших путей от j до k, которые содержат узел i [127, 141]. Коэффициент
47

Приложение методов фрактального анализа, теории графов
2
(n−1)(n−2)
представляет собой количество пар узлов, исключая i, и нормализует значение центральности между ними, так что для каждого узла
i значение Cb(i) лежит между 0 и 1 [142–144].
Центральность собственного вектора
Центральность собственного вектора показывает, насколько центральный (или периферийный) объект основан на его загрузке на самый
большой собственный вектор социоматрицы сети [145]. Центральность
собственного вектора используется для измерения влияния узла в сети.
Центральность собственного вектора расширяет понятие центральности
по степени [146]. В то время как степень узла есть общее количество
узлов, которые смежны с этим узлом, центральность собственного вектора учитывает как общее количество соседних узлов, так и важность
каждого из них. Таким образом, центральность собственного вектора является полезной мерой для сетей, в которых известны веса (определяющие частоту связи) между объектами, а не наличие или отсутствие связи
между узлами. Это приводит к тому, что узел, связанный с узлами, которые имеют высокие показатели влиятельности, будет также иметь более
высокую степень влиятельности, чем в случае наличия связей с менее
важными узлами. Следовательно, связи в центральности собственного
вектора не равны. Чтобы найти центральность собственного вектора,
необходимо принять во внимание не только связи, но и значения центральности собственного вектора связанных узлов. Центральность собственного вектора можно найти, оценивая насколько хорошо узел связан
с частями сети с наибольшей связностью [147]. Если узел имеет высокий показатель собственного вектора, у него должно быть много прямых
связей с другими узлами, которые также имеют много прямых связей с
другими узлами. Таким образом, искомый узел будет связан со многими узлами сети. Центральность собственного вектора была предложена
в 1987 году Филиппом Боначичем в [148]. Центральность собственного вектора определяется как простая доминанта собственного вектора
матрицы смежности.
Как указывалось в [149], индивиды с высокой центральностью собственного вектора не обязательно выполняют роль индивидов с высокой
центральностью по близости и по посредничеству.
2.2.2. Временной ряд интенсивности новостного потока
Рассматриваемые данные охватывают период с 1 по 28 февраля
2015 года (т. е. 20 торговых дней). За данный период было выпущено
48

Глава 2. Методы анализа данных новостной аналитики
около 230 тысяч новостей с упоминанием более 18 000 компаний. Был
составлен список компаний, у которых есть хотя бы одна общая новость
с другой компанией, чтобы включить те компании, которые могут быть
связаны со всеми возможными аспектами данного исследования. В феврале 2015 года таких компаний было 7030. Описательную статистику
рассматриваемого временного ряда можно найти в табл. 2.3.
Описательная статистика данных новостной аналитики
с 1 по 28 февраля 2015 года
Характеристики выборки Значения
Число дней 28
Число новостей 234736
Среднее значение 8383.43
Минимум 262
Максимум 15069
Стандартное отклонение 5415.21
Медиана 10653
Асимметрия −0.60
Эксцесс 1.75
Таблица 2.3
После поиска по индексируемому названию каждой компании были
подсчитаны частоты совместного упоминания между всеми парами компаний. Для подсчета совместного упоминания каждой пары компаний
была сформирована ненаправленная симметричная матрица с оцененными весами, а пакет R использовался для расчета основных статистик
и визуализации сети компаний.
2.2.3. Анализ ключевых компаний
Данный параграф посвящен нахождению ключевых компаний в сети со-упоминания. Для этого была создана сеть со-упоминания компаний, основанная на доступных данных новостной аналитики. Далее приведен анализ различных метрик, определенных в параграфе 2.2.1.
Затем располагаем компании в порядке убывания и выбираем 10
лучших компаний по каждой мере и объединяем их. Топ 20 компаний,
которые перечислены сначала по убыванию частоты, а затем по степени центральности, центральности по посредничеству и центральности
собственного вектора, приведен в табл. 2.4.
49

Приложение методов фрактального анализа, теории графов
Меры центральности для топ-20 компаний с наиболее высокой частотой
Компании Частота Степень
узла
“Apple” 3590 759 1.08 1.48825 4.18 0.20
“Apache” 2335 327 0.47 1.48774 0.65 0.97
“Continental Resources” 2291 292 0.42 1.48776 0.23 1.00
“General Motors” 2062 393 0.56 1.48818 2.31 0.09
“Exxon Mobil” 2061 523 0.74 1.48823 3.02 0.19
“Halliburton” 1973 450 0.64 1.48803 0.61 0.17
“Anadarko Petroleum” 1914 339 0.48 1.48790 1.05 0.72
“Chesapeake Energy” 1840 336 0.48 1.48807 0.84 0.66
“Basic Energy Services” 1828 406 0.58 1.48813 0.60 0.14
“Devon Energy” 1714 244 0.35 1.48777 0.13 0.83
“Transocean Ltd” 1710 469 0.67 1.48818 1.62 0.14
“ACT” 1678 416 0.59 1.48801 0.91 0.11
“Bank of America” 1651 389 0.55 1.48834 3.13 0.09
“EP Energy” 1547 203 0.29 1.48795 0.60 0.82
“JPMorgan Chase” 1541 362 0.52 1.48820 2.56 0.08
“Concho Resources” 1540 163 0.23 1.48745 0.08 0.77
“Pioneer Natural Resources” 1535 83 0.12 1.48697 0.00 0.94
“Antero Resources” 1502 280 0.40 1.48752 0.10 0.47
“RSP Permian” 1496 80 0.11 1.48703 0.00 0.91
“American Express” 1493 383 0.54 1.48816 1.32 0.09
Примечание. DC – центральность по степени, СС – центральность по близости,
BC – центральность по посредничеству, EC – центральность собственного вектора.
DC ×
× 10
CC ×
−1
× 10
−7
Таблица 2.4
BC ×
−2
× 10
EC
Компании с высокой частотой можно считать ключевыми, поскольку у них больше новостей, в которых они упоминаются с другими компаниями. Необходимо также учитывать компании с высокой центральностью по степени, так как они имеют больше связей с другими компаниями с точки зрения совместного упоминания. При этом нельзя утверждать, что компания с высокой центральностью по степени является ключевой компанией сети, потому что она может иметь связи с большим
количеством компаний, многие из которых имеют очень небольшое количество новостей, совместно упоминающих другие компании. Важны
также компании с высокой центральностью по близости, поскольку они
близки к среднему числу компаний. Компании, которые имеют высокую
степень центральности по посредничеству, занимают важное место в сети, поскольку являются связующим звеном, соединяющим другие пары
50
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
