Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Приложение методов фрактального анализа, теории графов и анализа сложных сетей к исследованию временных рядов.pdf
X
- •Оглавление
- •Введение
- •1.2.4. Метод усредненного вейвлет-коэффициента
- •1.1. Корреляционный анализ
- •1.1.1. Типы автокорреляции
- •1.1.2. Автомодельные процессы
- •1.2. Методы анализа долговременных автокорреляций
- •1.2.1. R/S-анализ
- •1.2.2. Флуктуационный анализ
- •1.2.3. Анализ детрендированных флуктуаций
- •1.2.5. Метод преобразования Фурье
- •1.2.6. Мультифрактальный анализ детрендированных флуктуаций
- •1.3.1. Временной ряд интенсивности новостного потока
- •1.3.2. Анализ самоподобия интенсивности новостей
- •1.4. Измерение долговременных корреляций во временных рядах настроений новостного потока
- •1.4.1. Временные ряды настроений новостей
- •1.4.2. Анализ самоподобия настроений новостей
- •1.4.3. Исследование мультифрактальности
- •2. Методы анализа данных новостной аналитики
- •2.1. Построение графа совместных упоминаний компаний в финансовых новостях
- •2.2. Анализ сети со-упоминания компаний
- •2.2.1. Сетевой анализ, методология анализа социальных сетей
- •2.2.2. Временной ряд интенсивности новостного потока
- •2.2.3. Анализ ключевых компаний
- •2.2.4. Анализ ключевых компаний по секторам экономики
- •2.2.5. Анализ ключевых компаний по биржам
- •2.2.6. Анализ распределения степеней вершин
- •2.2.7. Анализ распределения степеней вершин для подграфов
- •2.2.8. Кластерный анализ
- •2.2.9. Распределение коэффициентов кластеризации для подграфов
- •2.2.10. QAP корреляционный и регрессионный анализ
- •2.2.11. Основные выводы по анализу сети со-упоминания компаний
- •2.3.1. Распределение степеней вершин и коэффициентов кластеризации
- •2.3.2. Эволюция размера максимальных клик
- •3.1. Кластерный подход на основе графов для обнаружения событий
- •3.1.1. Обнаружение событий с помощью временных и атрибутивных ограничений
- •3.1.2. Описание данных
- •3.1.3. Результаты обнаружения событий
- •Заключение
- •Список литературы

Глава 2. Методы анализа данных новостной аналитики
компаний. Компании с высокой центральностью собственного вектора
играют ключевую роль в сети, так как имеют связи с компаниями, занимающими центральные позиции по собственному вектору.
Центральность по близости и по посредничеству полезна в сети
информационных потоков, но сеть совместных упоминаний компаний
является с етью отношений со-упоминаний новостей. Поведение финансовых рынков в значительной степени зависит от потока новостей, а
цепная реакция плохих или хороших новостей для компании может повлиять на другие компании, что может привести к волатильности на
финансовых рынках. Такой эффект зависит от компании: если она тесно связана с другими компаниями, обладающими высокими показателями центральности, существует высокая вероятность того, что новости о
компании окажут влияние на рынок. Поэтому центральность собственного вектора больше подходит для определения ключевой компании в
сети.
Как видно из табл. 2.4, компания “Apple” с высокой частотой и
высокой степенью является ключевой компанией со значительным запасом, поскольку у нее наибольшее количество совместных новостей и
наибольшее количество связей с другими компаниями. Отметим, что с
точки зрения центральности все рассматриваемые компании идентичны.
Индикатор центральности по посредничеству предполагает, что “Apple”
также является одним из сетевых звеньев. Отметим, что Bank of America
попадает в этот список с высокой центральностью по посредничеству,
хотя эта компания не входит в первую десятку по частоте или степени.
Центральность собственного вектора указывает на то, что Continental
Resources имеет связи с крупнейшими и наиболее важными компаниями, в то время как этот показатель для компании “Apple” достаточно
низкий (0.2). Следует также отметить, что акции компании “Apple” торгуются на бирже Nasdaq, а остальные 19 компаний из таблицы относятся к Нью-Йоркской фондовой бирже.
2.2.4. Анализ ключевых компаний по секторам экономики
Рассматриваемые в исследовании компании относились к одной из
десяти отраслей экономики (дискреционные потребительские товары,
основные потребительские товары, энергетика, финансы, здравоохранение, промышленность, информационные технологии, сырье, телекоммуникационные услуги и коммунальные услуги). Далее число отрас-
51

Приложение методов фрактального анализа, теории графов
Товары длительного пользования
Товары повседневного спроса
Промышленность
Энергетика
Материалы
Финансы
Здравоохранение
Телекоммуникации
Коммунальные услуги
Информационные технологии
Рис. 2.2. Схема секторальной принадлежности отраслей
−→ Продукты (2007 компаний)
)
−→ Ресурсы (1398 компаний)
−→ Сервис (2375 компаний)
o
−→ IT-сектор (548 компаний)
лей было сокращено до четырех секторов экономики, как показано на
рис. 2.2:
В дополнение к матрице совместного упоминания была создана
матрица, описывающая, к какому из четырех секторов экономики принадлежат компании.
Топ-5 компаний с самой высокой частотой со-упоминания по каждому из 4 секторов экономики приводятся в табл. 2.5. В ней также указаны число связей компании и разные стандартизованные показатели
центральности. Компания “General Motors” с высокой частотой и с высокой степенью является ключевой компанией в секторе «Продукты» с
большим отрывом, так как имеет наибольшее число совместных новостей и связей с другими компаниями. Данная компания также лидирует по всем показателям центральности. Отметим, что с точки зрения
центральности по близости (closeness centrality) все рассматриваемые
компании идентичны. Это характерно для всех исследуемых секторов
экономики. Большинство крупнейших компаний из данного сектора экономики являются автоконцернами или авиакомпаниями.
Крупнейшие компании в секторе «Ресурсы» также представлены
в табл. 2.5. Лидирующие компании данного сектора нефтегазовые, что
вполне естественно. При этом как по частоте со-упоминания, так и по
числу связей с другими компаниями данного сектора лидируют американские компании “Apache Corporation” и “Continental Resources”, которые взаимодействуют с наиболее крупными компаниями сектора (см.
центральность собственного вектора). Компания “Continental Resources”
52

Глава 2. Методы анализа данных новостной аналитики
Меры центральности для топ-5 компаний с высокой частотой для четырех секторов
Компании Частота Степень
“General Motors Co” 1051 143 0.71 2.0745 0.72 1.000
“Ford Motor Co” 691 90 0.45 2.0731 0.26 0.877
“Volkswagen AG” 668 101 0.50 2.0734 0.23 0.572
“Boeing Co” 663 103 0.51 2.0735 0.34 0.084
“Bayerische Motoren” 652 108 0.54 2.0724 0.17 0.576
“Apache Corp” 1583 118 0.84 2.5374 0.04 0.966
“Continental Resources Inc” 1538 101 0.72 2.5373 0.06 1.000
“Pioneer Natural Resources” 1422 70 0.50 2.5354 0.00 0.984
“RSP Permian Inc” 1369 67 0.48 2.5353 0.00 0.937
“Devon Energy Corp” 1282 92 0.66 2.5356 0.01 0.849
“JPMorgan Chase & Co” 882 137 0.58 1.6921 0.43 1.000
“Citigroup” 837 128 0.54 1.6922 0.43 0.889
“Bank of America Corp” 757 142 0.60 1.6926 0.69 0.763
“Goldman Sachs Group Inc” 706 105 0.44 1.6915 0.13 0.868
“American Express Co” 622 126 0.53 1.6921 0.39 0.391
“Apple Inc” 805 127 2.32 6.1457 2.59 1.000
“Alphabet Inc” 472 67 1.22 6.1364 0.79 0.927
“Twitter Inc” 371 54 0.99 6.1293 0.27 0.640
“Samsung Electronics Co Ltd” 336 56 1.02 6.1364 0.79 0.618
“Facebook Inc” 307 47 0.86 6.1323 0.32 0.640
Примечание. DC – центральность по степени, СС – центральность по близости,
BC – центральность по посредничеству, EC – центральность собственного вектора.
экономики
узла
Продукты
Ресурсы
Сервисы
IT-сектор
DC ×
× 10
CC ×
−1
× 10
−7
Таблица 2.5
BC ×
−2
× 10
EC
лидирует по показателю центральности по посредничеству, т. е. она чаще других является связующим звеном компаний данного сектора.
В секторе «Сервис» можно выделить несколько лидеров, являющихся крупнейшими финансовыми холдингами: “JPMorgan Chase”, “Citigroup”, “Bank of America”. Эти компании также являются лидерами по
всем рассматриваемым мерам центральности. Компания “Apple” является лидером сектора «Информационные технологии» по всем исследу-
53

Приложение методов фрактального анализа, теории графов
Меры центральности для топ-5 компаний с высокой частотой
Компании Частота Степень
“Barclays PLC” 484 42 1.72 3.2481 3.37 0.374
“Aviva PLC” 429 47 1.93 3.2517 5.20 0.308
“BHP Billiton PLC” 363 81 3.33 3.2576 4.29 1.000
“BP PLC” 313 53 2.18 3.2511 3.43 0.536
“Associated British Food” 303 68 2.79 3.2534 3.00 0.733
“Continental Resources Inc” 1594 178 2.08 0.2767 0.50 0.720
“Apache Corp” 1588 184 2.15 0.2774 1.02 0.733
“Anadarko Petroleum Corp” 1386 217 2.53 0.2780 1.96 0.831
“Basic Energy Services Inc” 1336 252 2.94 0.2778 1.05 1.000
“Halliburton Co” 1281 247 2.88 0.2778 1.52 0.924
“Bombardier Inc” 515 154 5.26 2.0368 6.32 0.994
“Calfrac Well Services Ltd” 489 105 3.59 2.0299 0.59 0.710
“Alara Resources Ltd” 464 120 4.10 2.0320 1.08 0.883
“Newalta Corp” 428 147 5.03 2.0345 1.86 1.000
“Strad Energy Services Ltd” 414 101 3.45 2.0305 0.68 0.633
Примечание. DC – центральность по степени, СС – центральность по близости,
BC – центральность по посредничеству, EC – центральность собственного вектора.
для трех фондовых бирж
узла
Лондонская биржа
Нью-Йоркская биржа
Токийская биржа
DC ×
× 10
CC ×
−1
× 10
−7
Таблица 2.6
BC ×
−2
× 10
EC
емым показателям с большим отрывом. Ранее было показано, что она
является ведущей (ключевой) среди всех рассматриваемых компаний.
2.2.5. Анализ ключевых компаний по биржам
Далее рассмотрим сеть со-упоминания компаний, относящихся к
разным территориальным зонам. Отдельно изучим компании, торгующиеся на европейских, американских и азиатских биржах, на биржах
LSE, NYSE и TSE.
Как видно из табл. 2.6, ключевыми компаниями Лондонской биржи с точки зрения числа связей являются банки “Barclays” и “Aviva”.
При этом горнодобывающая компания BHP “Billiton” имеет наибольшее
число совместных новостей и взаимодействует с наиболее крупными
54

Глава 2. Методы анализа данных новостной аналитики
компаниями данной биржи. Далее в таблице приводятся ключевые компании Нью-Йоркской фондовой биржи, и все они относятся к нефте- и
газодобывающей отрасли, в то время как ключевые компании Токийской
фондовой биржи относятся к машиностроительной и промышленной отраслям.
2.2.6. Анализ распределения степеней вершин
Такой локальной топологической меры, как степень данного узла,
недостаточно для характеристики всей сети. Обычно можно интегрировать локальную меру в глобальное описание сети, вычисляя распределение степеней P(k), которое представляет вероятность того, что случайно выбранный узел будет иметь степень k. Чтобы найти распределение
степеней, нужно посчитать количество узлов n(k), каждый из которых
имеет ребра k = 1,2, 3, .. ., а затем разделить n(k) на общее количество
узлов сети n.
В последние два десятилетия были проведены обширные исследования в области анализа распределения степеней сложных сетей, возникших в социологии, физике и биологии. Было показано, что многие
сети имеют сходное распределение степеней [16–18, 150–152]. Оказалось, что большинство реальных сетей имеют безмасштабное распределение степеней [150]. Другими словами, их распределение степеней
вершин является степенным.
Распределение степеней вершин называется степенным распределением, если
P(k) ∼ Ak−γ,
где A – постоянная, такая что сумма P(k) равна 1.
Степенной показатель γ обычно одинаков для подобных сетей. Например, в [150, 153–155] было показано, что 2 < γ < 3 для метаболических сетей и большинства ген-регуляторных сетей. Степенной закон
распределения степеней для подавляющего большинства реальных сетей выявляет фрактальную структуру базовых систем. Это означает, что
существует большое различие степеней узлов и в сети нет среднего узла, который бы характеризовал остальные узлы. Справедливости ради
следует отметить, что некоторые сети демонстрируют экспоненциальное распределение степеней. К таким сетям относятся сеть подстанций
и линий электропередачи, которая образует североамериканскую электрическую сеть [156], и сеть маршрутов воздушных перевозок по всему
миру [157].
55

Приложение методов фрактального анализа, теории графов
В статье [15] изучается структура международных интернет-гиперссылок и показывается, что некоторые страны являются более центральными, чем другие, в сети гиперссылок, и эт а структура соответствует глобальной структуре с основными и периферийными измерениями,
предложенными теорией мировых систем.
Распределение степеней для построенной нами сети со-упоминания
компаний подчиняется степенному закону с γ = 1.41:
P(k) ∼ 8.34k
−1.41,R2
= 0.87.
Полученная модель является статистически значимой и превосходит экспоненциальную модель. Однако показатель степени γ = 1.41 не попадает в интервал (2; 3). Зависимость количества компаний n(k) от степени
узла k показана на рис. 2.3.
4
Распределение степеней вершин
n(k) ∼ 8.34k
3
2
lg(p(k))
1
0
0 0.5 1 1.5 2 2.5
Рис. 2.3. Распределение степеней компаний сети со-упоминания
lg(k)
−1.41
, R2= 0.87
2.2.7. Анализ распределения степеней вершин для подграфов
В этом параграфе будет проведен анализ распределения степеней
вершин на примере подграфов по четырем секторам экономики и для
трех фондовых бирж, описанных в параграфах 2.2.4, 2.2.5.
56

Глава 2. Методы анализа данных новостной аналитики
Для всех рассматриваемых бирж и секторов экономики распреде-
ление степеней вершин следует степенному закону (табл. 2.7, 2.8).
Распределение степеней вершин по четы-
рем секторам экономики
Подграфы γ R
Продукты 1.06 0.82
Ресурсы 0.91 0.79
Услуги 1.14 0.84
IT-сектор 0.64 0.65
Распределение степеней вершин по трем
биржам
Подграфы γ R
Лондонская биржа 1.10 0.81
Нью-Йоркская биржа 1.18 0.84
Токийская биржа 0.68 0.44
Таблица 2.7
2
Таблица 2.8
2
Зависимость количества компаний n(k) от степени узла k для Нью-
Йоркской биржи показана на рис. 2.4.
Полученные модели статистически значимы и превосходят экспоненциальную модель. Однако показатель степени для всех фондовых
бирж не попадает в интервал (2;3). Таким образом, убывание степеней вершин медленнее, чем для типичных социальных сетей [154,155].
Стоит также отметить, что чем меньше компаний в подграфе, тем медленнее происходит убывание степеней вершин и меньше коэффициент
детерминации.
2.2.8. Кластерный анализ
Коэффициент локальной кластеризации для узла i определяется как
E
Ci=
i
ki(ki− 1)
,
где Ei– количество ребер, соединяющих непосредственных соседей узла
i, а ki– степень узла i. Среднее значение коэффициентов кластеризации
всех узлов в сети называется средним коэффициентом кластеризации.
57

Приложение методов фрактального анализа, теории графов
2.5
2
1.5
lg(n(k))
1
0.5
0
0 0.5 1 1.5 2 2.5
Рис. 2.4. Распределение степеней вершин сети со-упоминания
компаний Нью-Йорка
Распределение степеней вершин
n(k) ∼ 2.76k
lg(k)
−1.18
, R2= 0.84
Значение среднего коэффициента кластеризации количественно определяет степень связности в сети. В статье [158] рассматриваются сети
межбелкового взаимодействия и метаболические сети, которые должны
демонстрировать большие средние коэффициенты кластеризации. Аналогичный результат был установлен для сетей сотрудничества в научных кругах и индустрии развлечений в статьях [159, 160]. Обозначим
через C(k) средний коэффициент кластеризации узлов со степенью k.
Было обнаружено, что для большинства реальных сетей C(k) следует
C(k) ∼ Bk−β,
где показатель β обычно лежит между 1 и 2 [161–163].
График зависимости коэффициентов кластеризации, т. е. C(k) как
функции степени узла k, показан на рис. 2.5.
Для сети со-упоминания компаний распределение коэффициентов
кластеризации следует степенному закону:
C(k) ∼ 1.02k
−0.32
, R2= 0.69.
Полученная модель статистически значима. При этом показатель
степени β = 0.32 существенно меньше 1.
58

Глава 2. Методы анализа данных новостной аналитики
−0.4
Распределение коэффициентов кластеризации
−0.6
−0.8
−1
lg(C(k))
−1.2
−1.4
−1.6
3.5 4 5 5.5 6
Рис. 2.5. Распределение степеней коэффициентов кластериза-
C(k) ∼ 1.02k
ции сети со-упоминания компаний
−0.32
, R2= 0.69
lg(k)
2.2.9. Распределение коэффициентов кластеризации для подграфов
В этом параграфе будет проведен кластерный анализ на примере
подграфов по четырем секторам экономики и для трех фондовых бирж,
указанных в параграфах 2.2.4, 2.2.5. Для этих сетей распределение коэффициентов кластеризации соответствует степенному закону.
Полученные модели статистически значимы на любом уровне значимости. При этом показатель степени β получился меньше 1 для всех
рассматриваемых подграфов (табл. 2.9, 2.10).
Локальный коэффициент кластеризации
для четырех с екторов экономики
Подграфы β R
Продукты 0.70 0.58
Ресурсы 0.44 0.46
Услуги 0.70 0.61
IT-сектор 0.61 0.54
Таблица 2.9
2
59

Приложение методов фрактального анализа, теории графов
Локальный коэффициент кластеризации
для трех бирж
Подграфы β R
Лондонская биржа 0.68 0.55
Нью-Йоркская биржа 0.68 0.74
Токийская биржа 0.78 0.74
Таблица 2.10
2
Необходимо также отметить, что степенная зависимость между локальным коэффициентом кластеризации и степенью узла проявляется
для достаточно больших значений степеней k. Это хорошо видно на
примере подграфа Нью-Йоркской биржи (рис. 2.6). Для относительно
−0.4
−0.6
−0.8
lg(C(k))
−1
−1.2
−1.4
0 0.5 1 1.5 2 2.5
Рис. 2.6. Распределение коэффициентов кластеризации сети со-
Распределение коэффициентов кластеризации
C(k) ∼ 0.26k
C(k) ∼ −0.82k
упоминания Нью-Йоркских компаний
−0.68
0.058
, R2= 0.74
, R2= 0.015
lg(k)
небольших k зависимость отсутствует. Данный факт характерен для всех
рассматриваемых подграфов.
2.2.10. QAP корреляционный и регрессионный анализ
С использованием матрицы совместного упоминания компаний и
матрицы принадлежности к секторам (а также матрицу принадлежности
60
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
