Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:
Приложение методов фрактального анализа, теории графов и анализа сложных сетей к исследованию временных рядов.pdf
Скачиваний:
0
Добавлен:
08.09.2026
Размер:
2 Мб
Скачать
☆

Глава 2 Методы анализа данных новостной аналитики

В данной главе предлагается один из подходов к анализу новостных данных, основанный на представлении взаимосвязей между компаниями в форме графа совместных упоминаний. Информационный фон, несо­мненно, оказывает существенное влияние на динамику рыночных цен активов, принятие решений в сфере финансов и управлении рисками. Поставщики финансовой информации уже длительное время включают в состав продуктов, предлагаемых участникам денежного и фондово­го рынка, доступ к сервисам новостной аналитики. Наряду с данны­ми биржевых котировок, аналитическими обзорами и т. д. подписчикам предлагается доступ к информационным ресурсам, содержащим сведе­ния о времени выхода новостей и полученных на о снове анализа их текста индикаторов, таких как тип новостного сообщения, его источ­ник, время публикации, индикаторы новизны, настроения, релевантно­сти и т. д. Кроме того, указывается, какие компании упомянуты в тексте либо могут быть соотнесены с новостью. Крупнейшие поставщики об­рабатывают новостную информацию практически обо всех крупнейших компаниях по всему миру из широкого перечня информационных источ­ников, таких как информационные агентства, социальные сети, блоги и т. д. Они также рассматривают так называемые предварительные ново­сти, т. е. отчеты компаний, правительственных учреждений и бизнес­ресурсов, судебные документы, объявления, промышленную и макро­экономическую статистику.
Подписчики таких сервисов получают поток данных новостной ана­литики в режиме реального времени и могут разрабатывать количе­ственные модели или торговые стратегии, которые используют как фи­нансовые, так и новостные аналитические данные. Обзор методов и ин­струментов новостной аналитики можно найти в книгах [10, 109]. В по­следние годы инструменты аналитики новостей были разработаны и ис­пользованы в анализе социальных сетей [110–113].
В главе описываются разные методы импорта и агрегирования но­востных, информационных, финансовых и других данных. Эти методы
41
Приложение методов фрактального анализа, теории графов
используются нами далее для формирования матриц сходства объектов (графов сетевых структур) по разным источникам данных:
1) в нашем исследовании матрицы сходства строились на основании одновременного со-упоминания компаний в новостях;
2) построение матрицы сходства по финансовым данным может осу­ществляться разными способами:
– преобразованием матрицы ковариаций доходностей активов; – преобразованием матрицы ковариаций объемов торгов; – выявлением резких скачков доходности или волатильности (шоков)
и построением матриц сходства как числа шоков, наблюдаемых для разных компаний в течение рассматриваемого периода времени. Число скачков является базисом для построения матриц сходства;
3) построение матрицы сходства на основании отраслевой, географи­ческой и т. д. принадлежности компаний. Применялись следующие подходы и методы к исследованию полу-
ченных графов:
1) анализ сетевых структур, заданных одним графом. Основными ме­тодами являлись выделение клик, поиск центральных вершин, ис­следование законов распределения степеней вершин и локальных характеристик вершин графа;
2) динамические модели сетевых структур. Для поиска нетипичных фрагментов исследуемых графов использовались методы классифи­кации и кластеризации;
3) корреляции графов, линейные регрессии на графах. Применялись методы корреляционного и регрессионного анализа матриц смеж­ности вершин с использованием QAP – процедуры контроля каче­ства.

2.1. Построение графа совместных упоминаний компаний в финансовых новостях

Информационные агентства, биржи, компании, журналы генериру­ют огромное количество экономических и финансовых новостей. Но­востные сервисы уже длительное время обеспечивают доступ в режиме реального времени к сведениям о выходе новостей и полученных на основе анализа их текста индикаторов, таких как тип новостного сооб­щения, его источник, время публикации, индикаторы новизны, настрое­ния, релевантности и т. д. Указывается также, какие компании могут быть соотнесены с новостью.
42
Глава 2. Методы анализа данных новостной аналитики
Новости, как правило, затрагивают лишь одну конкретную компа­нию. Но более чем в 10% случаев поставщик сервиса полагает верным соотнести новостное сообщение с некоторым перечнем компаний. Тогда говорят, что имело ме сто со-упоминание этих компаний в новостном по­токе. Подсчитывая число таких со-упоминаний для всевозможных пар компаний в заданный период времени, можно построить матрицу со­упоминаний. Кажется разумным полагать, что такая матрица отражает мнения финансовой инфосферы о степени взаимозависимости бизнес­процессов пары или группы компаний. Более частое появление в ново­стях некоторых со-упоминаний дает возможность выяснить, как мировая финансовая информационная система воспроизводит восприятие взаим­ного влияния или взаимозависимости деятельности участников рынка. Кроме того, анализ матрицы со-упоминаний позволяет охарактеризовать восприятие бизнес-связей компании с другими участниками и место компании в системе взаимосвязей.
Использованная нами процедура построения графа совместных упо­минаний включает следующие этапы [114]:
1) сбор полных текстов всех экономических и финансовых новостей, опубликованных в течение некоторого периода времени;
2) определение списка компаний, которые упоминаются в данной но­вости, для каждого новостного сообщения;
3) подсчет ссылок для каждой пары со-упомянутых компаний для всех наборов доступных новостей;
4) построение симметричной взвешенной матрицы со-упоминания ком­паний;
5) статистический анализ матрицы совместного упоминания, визуали­зацию и интерпретацию результатов. Шаги 1 и 2 требуют обработки большого количества новостных
ресурсов. Действия на шагах 1 и 2 выполняются провайдерами новост­ной аналитики. В исследовании будут использованы уже подготовлен­ные данные новостной аналитики.
Сеть со-упоминания компаний формируется следующим образом:
компания имеет связь с теми конкретная компаниями, которые были упомянуты в новостях вместе с ней. Основываясь на доступных дан­ных новостной аналитики, была построена матрица смежности, кото­рая представляет собой взаимосвязь компаний в соответствии со следу­ющим подходом.
Предположим, есть восемь новостей N 1–N8. Пусть в N 1 упомина-
ются три компании – c1, c2 и c3; в N2 – две компании, c3 и c4: в 3-й
43
Приложение методов фрактального анализа, теории графов
c2
c1 c3
c5
c4
c6
c7
1
1
1
3
2 2
3
1
новости – компании c4, c5, c6; в N4 – две компании, c6 и c7; в N5 – две компании, c1 и c2; N 6 имеет две совместно упомянутые компании – c4, c6; N7 упоминает три компании – c4, c5 и c6; N8 – упоминает две компании c1 и c2 (табл. 2.1).
В итоге получаем следующую весовую симметричную матрицу
(табл. 2.2).
Новости / компании
Таблица 2.1
c1 c2 c3 c4 c5 c6 c7
N1 + + + N2 + + N3 + + + N4 + + N5 + + N6 + + N7 + + +
Весовая матрица
c1 c2 c3 c4 c5 c6 c7
c1 0 3 1 0 0 0 0 c2 3 0 1 0 0 0 0 c3 1 1 0 1 0 0 0 c4 0 0 1 0 2 3 0 c5 0 0 0 2 0 2 0 c6 0 0 0 3 2 0 1 c7 0 0 0 0 0 1 0
Таблица 2.2
N8 + +
Сеть со-упоминания компаний, построенная на основе матрицы смеж­ности, представлена на рис. 2.1. Связываем компании c1–c2 с весом 3, c1–c3 с весом 1 и т. д. Здесь узлы представляют компании и устанав- ливается связь между двумя узлами, если есть новость, в которой упо­минаются обе компании. Таким образом, каждая компания приобретает определенную ценность в зависимости от количества новостей, в кото­рых она упоминается. Более того, можно рассматривать количество со-
Рис. 2.1. Сеть со-упоминания компаний: узлами являются ком-
пании, а вес ребра соответствует числу совместных новостей
44
Глава 2. Методы анализа данных новостной аналитики
упоминаний как силу связей между компаниями. Таким образом, сеть со-упоминания компаний будет представлена в виде неориентированно­го взвешенного графа.

2.2. Анализ сети со-упоминания компаний

На основе подхода из предыдущего параграфа будет построена мат­рица, содержащая количество совместных новостей между парами ком­паний, акции которых торгуются на основных финансовых рынках. Для нахождения ключевых компаний в сети были использованы различные типы метрик анализа социальных сетей (SNA). Для проверки гипо­тезы о воспроизводстве в сетевом графе со-упоминаний компаний их отраслевой и биржевой принадлежности будем опираться на Quadratic Assignment Procedure (QAP), которая была предложена и разработана в [115–118]. С тех пор QAP широко используется в анализе социаль­ных сетей (см., например, [119–124], среди многих других). QAP – это своеобразный тип теста перестановок, который сохраняет неизменной структуру двоичных данных при перестановках.
В исследовании были использованы два способа построения под­сетей:
1) секторальный – подсети представляют различные сектора экономи­ки, такие как продукты, ресурсы, сектор услуг и ИТ-сектор;
2) географический – каждая подсеть состоит из компаний одной и той же фондовой биржи.
Были сформулированы следующие гипотезы:
1) степени вершин сети со-упоминания компаний распределены по степенному закону;
2) распределение коэффициентов кластеризации для сети со-упомина­ния подчиняется степенному закону;
3) имеет место степенное распределение степеней узлов и коэффици­ентов кластеризации подсетей со-упоминания компаний;
4) сеть совместного упоминания компаний воспроизводит отраслевую структуру экономики;
5) структура сети совместных упоминаний компаний отражает класте­ризацию компаний на основе их принадлежности к фондовой бир­же.
45
Приложение методов фрактального анализа, теории графов

2.2.1. Сетевой анализ, методология анализа социальных сетей

Анализ социальных сетей рассматривает социальные отношения с точки зрения теории графов. SNA представляет объекты в сети в ви­де узлов и связей, которые описывают отношения между объектами, такие как дружба, соавторство, организации и сексуальные отношения [11,13, 125–127]. Основная цель SNA состоит в измерении отношений и потоков между объектами (отдельными лицами, группами, организация­ми, URL-адресами и другими связанными объектами) [14,128,129]. SNA обеспечивает как визуальный, так и математический анализ отношений между людьми и объектами [130, 131]. В целом анализ социальных се­тей может помочь оценить эффективность отдельных людей, групп или всей социальной сети.
Одной из задач данного исследования является выявление ключе­вых компаний сети. Предполагается, что компании с обширными свя­зями или со-упоминаниями со многими другими компаниями считают­ся в экономике более важными, чем компании с относительно мень­шим количеством связей. Для поиска ключевых компаний в сети бы­ли использованы следующие общеизвестные метрики SNA: частота (F, frequency), центра льность по степени (DC, degree centrality), централь­ность по близости (CC, closeness centrality), центральность по посредни­честву (BC, betweenness centrality), центральность собственного вектора (EC, eigenvector centrality).
Частота
Частота определяется как общее количество новостей, в которых упоминается компания.
Центральность по степени
Степень узла – это число его прямых связей [132]. Степень узла равна количеству ребер, примыкающих к нему [125, 133].
Центральность по степени является простейшей мерой централь­ности, так как она определяет только количество связей компании с их непосредственными соседями в сети [134].
Таким образом, ключевые узлы обычно имеют высокую степень. Степень является показателем влияния компании. Нормализованная сте­пень определяется как число связей актора, деленное на максимально возможное количество связей [135, 136].
46
Глава 2. Методы анализа данных новостной аналитики
Нормализованная степень diузла i определяется как
d(i)
di=
n − 1
.
Центральность по близости
Чтобы определить, насколько близко узел находится ко всем осталь­ным узлам в сети (как напрямую, так и косвенно), можно использовать меру близости [125]. Близость – это средняя длина (количество шагов) кратчайших путей, соединяющих узел со всеми другими узлами в се­ти. Близость измеряется как обратная величина этого среднего [132]. Метрика близости может использоваться только в сети, в которой каж­дые два узла имеют хотя бы один путь к другому, т. е. в связанной сети [137–139]. Центральность Cc(i) узла i определяется следующим об­разом:
Cc(i) =
1
avg(L(i, j))
, (2.1)
где L(i, j) – длина кратчайшего пути между двумя узлами i и j. Цент­ральность по близости каждого узла лежит между 0 и 1. В рамках SNA центральность по близости измеряет скорость распро странения инфор­мации от данного узла к другому достижимому узлу в сети.
Центральность по посредничеству
Центральность по посредничеству отображает степень, в которой узел лежит вдоль путей, соединяющих другие пары узлов [140]. Узел в данном месте находится в состоянии контроля или влияния на ин­формационные потоки в сети. Это доля путей, содержащих узел, ко­торый соединяет пару узлов в сети. Таким образом, центральность по посредничеству измеряет потенциальный авторитет объекта внутри с е­ти [125, 133]. По определению, центральность по посредничеству – это отношение количества кратчайших путей (между всеми парами узлов), проходящих через данный узел, к общему количеству кратчайших пу­тей. Центральность по посредничеству Cb(i) узла i равна
Cb(i) =
2
(n − 1)(n − 2)
∑
j,i,k
σjk(i)
, (2.2)
σ
jk
где сумма берется по всем узлам j и k, отличным от i, σjk– это число кратчайших путей от j до k, а σjk(i) обозначает количество кратчай­ших путей от j до k, которые содержат узел i [127, 141]. Коэффициент
47
Приложение методов фрактального анализа, теории графов
2
(n−1)(n−2)
представляет собой количество пар узлов, исключая i, и нор­мализует значение центральности между ними, так что для каждого узла i значение Cb(i) лежит между 0 и 1 [142–144].
Центральность собственного вектора
Центральность собственного вектора показывает, насколько цент­ральный (или периферийный) объект основан на его загрузке на самый большой собственный вектор социоматрицы сети [145]. Центральность собственного вектора используется для измерения влияния узла в сети. Центральность собственного вектора расширяет понятие центральности по степени [146]. В то время как степень узла есть общее количество узлов, которые смежны с этим узлом, центральность собственного век­тора учитывает как общее количество соседних узлов, так и важность каждого из них. Таким образом, центральность собственного вектора яв­ляется полезной мерой для сетей, в которых известны веса (определяю­щие частоту связи) между объектами, а не наличие или отсутствие связи между узлами. Это приводит к тому, что узел, связанный с узлами, кото­рые имеют высокие показатели влиятельности, будет также иметь более высокую степень влиятельности, чем в случае наличия связей с менее важными узлами. Следовательно, связи в центральности собственного вектора не равны. Чтобы найти центральность собственного вектора, необходимо принять во внимание не только связи, но и значения цен­тральности собственного вектора связанных узлов. Центральность соб­ственного вектора можно найти, оценивая насколько хорошо узел связан с частями сети с наибольшей связностью [147]. Если узел имеет высо­кий показатель собственного вектора, у него должно быть много прямых связей с другими узлами, которые также имеют много прямых связей с другими узлами. Таким образом, искомый узел будет связан со многи­ми узлами сети. Центральность собственного вектора была предложена в 1987 году Филиппом Боначичем в [148]. Центральность собственно­го вектора определяется как простая доминанта собственного вектора матрицы смежности.
Как указывалось в [149], индивиды с высокой центральностью соб­ственного вектора не обязательно выполняют роль индивидов с высокой центральностью по близости и по посредничеству.

2.2.2. Временной ряд интенсивности новостного потока

Рассматриваемые данные охватывают период с 1 по 28 февраля 2015 года (т. е. 20 торговых дней). За данный период было выпущено
48
Глава 2. Методы анализа данных новостной аналитики
около 230 тысяч новостей с упоминанием более 18 000 компаний. Был составлен список компаний, у которых есть хотя бы одна общая новость с другой компанией, чтобы включить те компании, которые могут быть связаны со всеми возможными аспектами данного исследования. В фев­рале 2015 года таких компаний было 7030. Описательную статистику рассматриваемого временного ряда можно найти в табл. 2.3.
Описательная статистика данных новостной аналитики
с 1 по 28 февраля 2015 года
Характеристики выборки Значения Число дней 28 Число новостей 234736 Среднее значение 8383.43 Минимум 262 Максимум 15069 Стандартное отклонение 5415.21 Медиана 10653 Асимметрия −0.60 Эксцесс 1.75
Таблица 2.3
После поиска по индексируемому названию каждой компании были подсчитаны частоты совместного упоминания между всеми парами ком­паний. Для подсчета совместного упоминания каждой пары компаний была сформирована ненаправленная симметричная матрица с оценен­ными весами, а пакет R использовался для расчета основных статистик и визуализации сети компаний.

2.2.3. Анализ ключевых компаний

Данный параграф посвящен нахождению ключевых компаний в се­ти со-упоминания. Для этого была создана сеть со-упоминания компа­ний, основанная на доступных данных новостной аналитики. Далее при­веден анализ различных метрик, определенных в параграфе 2.2.1.
Затем располагаем компании в порядке убывания и выбираем 10 лучших компаний по каждой мере и объединяем их. Топ 20 компаний, которые перечислены сначала по убыванию частоты, а затем по степе­ни центральности, центральности по посредничеству и центральности собственного вектора, приведен в табл. 2.4.
49
Приложение методов фрактального анализа, теории графов
Меры центральности для топ-20 компаний с наиболее высокой частотой
Компании Частота Степень
узла “Apple” 3590 759 1.08 1.48825 4.18 0.20 “Apache” 2335 327 0.47 1.48774 0.65 0.97 “Continental Resources” 2291 292 0.42 1.48776 0.23 1.00 “General Motors” 2062 393 0.56 1.48818 2.31 0.09 “Exxon Mobil” 2061 523 0.74 1.48823 3.02 0.19 “Halliburton” 1973 450 0.64 1.48803 0.61 0.17 “Anadarko Petroleum” 1914 339 0.48 1.48790 1.05 0.72 “Chesapeake Energy” 1840 336 0.48 1.48807 0.84 0.66 “Basic Energy Services” 1828 406 0.58 1.48813 0.60 0.14 “Devon Energy” 1714 244 0.35 1.48777 0.13 0.83 “Transocean Ltd” 1710 469 0.67 1.48818 1.62 0.14 “ACT” 1678 416 0.59 1.48801 0.91 0.11 “Bank of America” 1651 389 0.55 1.48834 3.13 0.09 “EP Energy” 1547 203 0.29 1.48795 0.60 0.82 “JPMorgan Chase” 1541 362 0.52 1.48820 2.56 0.08 “Concho Resources” 1540 163 0.23 1.48745 0.08 0.77 “Pioneer Natural Resources” 1535 83 0.12 1.48697 0.00 0.94 “Antero Resources” 1502 280 0.40 1.48752 0.10 0.47 “RSP Permian” 1496 80 0.11 1.48703 0.00 0.91 “American Express” 1493 383 0.54 1.48816 1.32 0.09
Примечание. DC – центральность по степени, СС – центральность по близости,
BC – центральность по посредничеству, EC – центральность собственного вектора.
DC ×
× 10
CC ×
−1
× 10
−7
Таблица 2.4
BC ×
−2
× 10
EC
Компании с высокой частотой можно считать ключевыми, посколь­ку у них больше новостей, в которых они упоминаются с другими ком­паниями. Необходимо также учитывать компании с высокой централь­ностью по степени, так как они имеют больше связей с другими компа­ниями с точки зрения совместного упоминания. При этом нельзя утверж­дать, что компания с высокой центральностью по степени является клю­чевой компанией сети, потому что она может иметь связи с большим количеством компаний, многие из которых имеют очень небольшое ко­личество новостей, совместно упоминающих другие компании. Важны также компании с высокой центральностью по близости, поскольку они близки к среднему числу компаний. Компании, которые имеют высокую степень центральности по посредничеству, занимают важное место в се­ти, поскольку являются связующим звеном, соединяющим другие пары
50
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]