Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Приложение методов фрактального анализа, теории графов и анализа сложных сетей к исследованию временных рядов.pdf
X
- •Оглавление
- •Введение
- •1.2.4. Метод усредненного вейвлет-коэффициента
- •1.1. Корреляционный анализ
- •1.1.1. Типы автокорреляции
- •1.1.2. Автомодельные процессы
- •1.2. Методы анализа долговременных автокорреляций
- •1.2.1. R/S-анализ
- •1.2.2. Флуктуационный анализ
- •1.2.3. Анализ детрендированных флуктуаций
- •1.2.5. Метод преобразования Фурье
- •1.2.6. Мультифрактальный анализ детрендированных флуктуаций
- •1.3.1. Временной ряд интенсивности новостного потока
- •1.3.2. Анализ самоподобия интенсивности новостей
- •1.4. Измерение долговременных корреляций во временных рядах настроений новостного потока
- •1.4.1. Временные ряды настроений новостей
- •1.4.2. Анализ самоподобия настроений новостей
- •1.4.3. Исследование мультифрактальности
- •2. Методы анализа данных новостной аналитики
- •2.1. Построение графа совместных упоминаний компаний в финансовых новостях
- •2.2. Анализ сети со-упоминания компаний
- •2.2.1. Сетевой анализ, методология анализа социальных сетей
- •2.2.2. Временной ряд интенсивности новостного потока
- •2.2.3. Анализ ключевых компаний
- •2.2.4. Анализ ключевых компаний по секторам экономики
- •2.2.5. Анализ ключевых компаний по биржам
- •2.2.6. Анализ распределения степеней вершин
- •2.2.7. Анализ распределения степеней вершин для подграфов
- •2.2.8. Кластерный анализ
- •2.2.9. Распределение коэффициентов кластеризации для подграфов
- •2.2.10. QAP корреляционный и регрессионный анализ
- •2.2.11. Основные выводы по анализу сети со-упоминания компаний
- •2.3.1. Распределение степеней вершин и коэффициентов кластеризации
- •2.3.2. Эволюция размера максимальных клик
- •3.1. Кластерный подход на основе графов для обнаружения событий
- •3.1.1. Обнаружение событий с помощью временных и атрибутивных ограничений
- •3.1.2. Описание данных
- •3.1.3. Результаты обнаружения событий
- •Заключение
- •Список литературы

Глава 2. Методы анализа данных новостной аналитики
1,600
1,400
1,200
1,000
Число ребер
800
01.2005 01.2006 01.2007 01.2008 01.2009 01.2010
Время, год
Рис. 2.14. Динамика количества ребер с января 2005 по декабрь 2010 года
2.3.2. Эволюция размера максимальных клик
В данном параграфе проводится анализ эволюции размера макси-
мальной клики на графах за рассматриваемый период.
Граф G = (V,E) называется связным, если для любых двух вершин
из множества V существует путь от одной к другой. Если граф не связен, его можно подразделить на несколько связных подграфов (связных
компонент G).
Обозначим через G(S) подграф, индуцированный S, для данного
подмножества S ⊆ V . Напомним, что подмножество C ⊆V называется
кликой, если G(C) – полный граф. Задача о клике – это задача нахождения самой большой клики в графе.
Подмножество I ⊆ V называется независимым множеством, если
подграф G(I) не имеет ребер. Задача о независимом множестве состоит в том, чтобы найти наибольшее независимое множество в графе.
Ее легко можно выразить как задачу нахождения максимальной клики в
дополнительном графеeG(V,eE). Очевидно, что максимальная клика вeG
является максимальным независимым множеством в G, поэтому задачи
о клике и о независимом множестве легко сводятся друг к другу.
Независимые множества могут рассматриваться как наборы объектов, которые отличаются от любого другого объекта в наборе, и эти знания могут быть важны в некоторых приложениях. Нахождение максимальной клики дало бы нам максимально возможный размер множеств
«связанных» элементов, в то время как обнаружение наибольшего независимого множества могло бы дать нам максимально возможный размер
групп «разных» объектов в сети.
Хорошо известно, что задачи о клике и о независимом множестве
являются NP-трудными [164]. Более того, в работах [165,166] говорится,
71

Приложение методов фрактального анализа, теории графов
2
1
Число вершин
0
2
1
Число вершин
0
2
1
0
0
0.5
0
0.5
1
1.5
а
1
1.5
в
0
0.5
2
1
0
0
0.5
1
1.5
б
1
1.5
г
2
1
Число вершин
0
0
0.5
Рис. 2.15. Распределение степеней графа со-упоминания за отдельные периоды (в логарифмической шкале): а – июнь 2005, б – июнь 2006, в – июнь 2007, г – июнь 2008, д –
1
1.5
д
июнь 2009, е – июнь 2010
2
1
0
2
0
0.5
1
1.5
е
72

Глава 2. Методы анализа данных новостной аналитики
что данные задачи трудно аппроксимировать, и это делает данные задачи особенно требовательными в больших графах. Однако разреженная
структура графа совместного упоминания позволяет нам найти точное
решение задачи о клике.
Задача о клике возникает в практическом приложении во многих
областях. Некоторые из этих практических задач могут быть прямо сформулированы как задачи о клике и во многих случаях сведены к задаче,
которая требует поиска максимальной клики. Реальные приложения задачи о клике появляются в обработке сигналов, теории классификации,
теории кодирования, компьютерном зрении, экономике, финансах, поиске информации, теории передачи сигналов, выравнивании последовательностей ДНК и белков, анализе социальных сетей и многих других конкретных областях. Некоторые из этих приложений можно найти
в [167–176].
Из определения клики следует, что это набор полностью связанных
между собой вершин, и поэтому каждая компания, которая относится к
клике, прочно связана со всеми остальными компаниями в этой клике.
Таким образом, компания связана с данной группой тогда и только тогда, когда она упоминается совместно со всеми другими компаниями в
этой группе. Компании в одной клике, как правило, имеют общие характеристики экономической и финансовой деятельности, и тот факт, что
они упоминаются в совместных новостях, является следствием их финансово-экономических связей в реальном мире. Эти экономические и
финансовые отношения между компаниями могут возникать по разным
причинам, например:
– если существует сильная корреляция между доходностью активов
компаний;
– если в обеих компаниях есть общие члены совета директоров;
– если одна из компаний вкладывает средства в другую;
– если одна из компаний потребляет услуги или товары другой ком-
пании;
– если одна из компаний поставляет товары или услуги другой ком-
пании.
Поскольку максимальная клика представляет собой максимально
возможную группу похожих объектов, ее можно рассматривать как важную характеристику графа совместного упоминания.
В этом исследовании для нахождения точной максимальной клики был использован один из вариантов алгоритма Брона – Кербоша,
предложенный в [177]. Алгоритм Брона – Кербоша рекурсивно решает
73

Приложение методов фрактального анализа, теории графов
подзадачи, детализированные тремя наборами вершин, к которым относятся:
– вершины, которые должны быть включены в данную клику;
– вершины, которые следует исключить из клики;
– некоторые оставшиеся вершины, статус которых остается неизвест-
ным.
Доказано, что этот алгоритм является эффективным для достаточно
разреженных сетей. Обратите внимание, что сети со-упоминаний очень
разрежены. Точное описание алгоритма представлено в статье [178].
С другой стороны, проблема обнаружения максимальных независимых множеств для таких разреженных сетей совместного упоминания
является более сложной с вычислительной точки зрения задачей ввиду
высокой плотности дополнительного графа для сети совместного упоминания компаний. По этой причине для решения данной проблемы
была использована полувнешняя жадная процедура рандомизированного адаптивного поиска, предложенная в [179]. Известно, что алгоритм
работает достаточно быстро, но не обязательно может давать точные
решения.
Динамика размера максимальной клики для сети совместного упоминания показана на рис. 2.16. Видно, что размер максимальной клики
достиг максимального значения в разгар финансового кризиса (сентябрь
2008 года). Следует отметить, что в каждый период алгоритм находит
несколько разных клик с общим максимальным размером.
10
9
8
7
6
5
01.2005 01.2006 01.2007 01.2008 01.2009 01.2010 01.2011
Рис. 2.16. Месячная динамика размера максимальных клик
74

Глава 2. Методы анализа данных новостной аналитики
В табл. 2.17 представлены клики с наибольшим значением степени
центральности среди всех клик, имеющих одинаковый максимальный
размер, для 12 (из 72) разных периодов времени.
Максимальные центральные клики за разные периоды времени
Период, год Компании, входящие в максимальную центральную клику
Сентябрь
2005
Сентябрь
2006
Март 2007 “Modern Home Products”, “C-Corporation”, “JPMorgan Chase”, “Urban Select
Октябрь
2007
Июнь 2008 “US/MOT”, “Delta Air Lines”, “eBay Inc.”, “United Technologies
Март 2008 “Federal National Mortgage Association”, “Boeing Co”, “US/MOT”, “Wells
Июль 2008 “Modern Home Products”, “C-Corporation”, “JPMorgan Chase”, “Moran
Сентябрь
2008
Февраль
2009
Октябрь
2009
Май 2010 “C-Corporation”, “JPMorgan Chase”, “Urban Select Capital Corporation”,
Ноябрь
2010
“C-Corporation”, “JPMorgan Chase”, “Urban Select Capital Corporation”,
“Goldman Sachs Group”, “Deutsche Bank Aktiengesellschaft”, “Mouser
Electronics”, “Der Deutsche Richterbund”
“C-Corporation”, “Urban Select Capital Corporation”, “Goldman Sachs
Group”, “Morgan Stanley Bank”, “Deutsche Bank Aktiengesellschaft”,
“Telstra Corporation Limited”
Capital Corporation”, “Credit Suisse Group AG”, “Bank of America
Corporation”, “Deutsche Bank Aktiengesellschaft”
“Bank of America Corporation”, “NOKIA”, “Alphabet Inc.”, “Eli Lilly and
Company”, “C-CorporationOF”, “Gilead Sciences, Inc.”, “The Hershey
Company”
Corporation”, “C-CorporationOP”, “General Dynamics Corporation”,
“Southwest Airlines Co.”, “C-CorporationOF”
Fargo Advantage Funds”, “Eli Lilly and Company”, “MBIA Inc.”, “Amgen
Inc.”, “Northrop Grumman Corp.”
Environmental Recovery”, “Bank of America Corporation”, “Federal National
Mortgage Association, US/FRE”
“Modern Home Products”, “C-Corporation”, “JPMorgan Chase”, “Urban Select
Capital Corporation”, “Credit Suisse Group AG ”, “Moran Environmental
Recovery”, “Morgan Stanley Bank”, “Lehman Brothers”, “American
International Group”, “Weibo Corporation”
“Modern Home Products”, “Urban Select Capital Corporation”, “Credit Suisse
Group AG ”, “Morgan Stanley Bank”, “Lehman Brothers”, “ND Software Co
Ltd”, “Wells Fargo & Company”
“Modern Home Products”, “C-Corporation”, “JPMorgan Chase”, “Urban Select
Capital Corporation”, “Credit Suisse Group AG ”, “Bank of America
Corporation”, “ND Software Co Ltd”, “Wells Fargo & Company”
“Credit Suisse Group AG ”, “Morgan Stanley Bank”, “Bank of America
Corporation”, “Deutsche Bank Aktiengesellschaft”, “Barclays Group”
“Modern Home Products”, “JPMorgan Chase”, “Urban Select Capital
Corporation”, “Credit Suisse Group AG ”, “Goldman Sachs Group”, “Morgan
Stanley Bank”, “Bank of America Corporation”
Таблица 2.17
75

Приложение методов фрактального анализа, теории графов
Оказалось, что некоторые компании появлялись в максимальных
кликах в разное время. Максимальные клики включают значительное
количество компаний из финансового сектора, таких как “JPMorgan Chase
& Co.” (JPM), “UBS Group AG” (UBSN), “Credit Suisse Group AG”
(CSGN), “Goldman Sachs Group, Inc.” (GS), “Deutsche Bank Aktiengesellschaft” (DBK), “Morgan Stanley” (MS), “Citigroup Inc.” (C). Можно
сделать вывод, что крупные финансовые и банковские компании регулярно представлены в группах наиболее часто упоминаемых компаний
в течение рассматриваемых периодов времени.
2.3.3. Основные выводы по анализу динамики сети со-упоминания
компаний
В параграфе 2.3 были исследованы изменения структурных свойств
графа со-упоминания компаний во времени. В результате было сделано
несколько интересных выводов. Было показано, что степенная структура графа совместного упоминания достаточно устойчива. Более того, в
отличие от реальных социальных графов сети со-упоминания компаний
свойственно экспоненциальное распределение степеней с нетипичными
коэффициентами степенной экспоненты. Таким образом, можно отметить, что концепция «самоорганизующейся» сети может использоваться
для потока новостей, а рынок новостей можно рассматривать как «самоорганизованную» систему. Другим важным фактом является то, что
максимальная клика увеличивается в условиях кризиса и это поддерживает широко обсуждаемое представление о глобальной экономике. Оказалось, что в большинстве случаев компании, которые оказывались в
максимальной клике ранее, также появлялись в более поздние периоды.
Все максимальные клики включают множество компаний банковского
сектора. Следует отметить, что результаты довольно стабильны при использовании разных окон агрегации.

Глава 3
Методы обнаружения экономических
и финансовых событий
В по следние годы одной из самых обширных тем исследований в
области анализа социальных сетей было обнаружение событий. В большинстве подходов для обнаружения событий используются фиксированное временное и прост ранственное разрешение. В этой главе предлагается процедура обнаружения экономических и финансовых событий с
использованием данных новостной аналитики на основе использования
алгоритма для вычисления графа подобия данных в выбранных масштабах и одновременного обнаружения экономических и финансовых
событий с помощью единого процесса кластеризации на основе графа. Экспериментальные результаты на реальных данных, собранных от
поставщиков аналитики новостей, демонстрируют эффективность процедуры обнаружения событий на основе данных аналитики новостей в
реальном времени.
В этой главе также предлагается новый метод обнаружения событий на основе сети совместного упоминания компаний. Идея метода заключается в том, что более важные новости должны привлекать больше
внимания и приводить к увеличению интенсивности новостного потока.
Изменение интенсивности со-упоминаний можно интерпретировать как
сигнал или маркер неожиданных явлений, которые могут затронуть относительно узкий или широкий круг экономических субъектов. Анализ,
проведенный в исследовании, предполагает, что разложение матриц совместного упоминания может использоваться для разделения новостных
сигналов. Новости, соответствующие стабильной части графика, появляются чаще; соответственно они несут меньше информации. Метод
выявления неожиданных новостей заслуживает особого внимания при
принятии финансовых и инвестиционных решений. Предлагаемый подход к выбору событийной части может быть использован при разработке алгоритмов обнаружения новых событий в финансово-экономической
сфере.
77

Приложение методов фрактального анализа, теории графов
3.1. Кластерный подход на основе графов для обнаружения событий
Информационные агентства, организации, социальные с ети, предприятия и т. д. генерируют огромное количество информации и новостей в режиме реального времени. Изучение характеристик и особенностей новостного потока стало одной из последних тем в социальной
информатике. Лента новостей общедоступна и отражает процессы, происходящие в мире. Поэтому изучение структурных свойств новостного потока и разработка методов и алгоритмов обработки таких данных
представляют большой интерес.
Таким образом, огромный объем данных новостной аналитики позволяет изучать некоторые исследовательские проблемы. В этом параграфе рассматривается еще одна такая проблема – обнаружение событий.
Обратите внимание, что аналитические данные новостей дают преимущества для обнаружения событий. Используя характер новостных аналитических служб в реальном времени, как трейдеры, так и правительства могут повысить свою осведомленность о событиях в реальном мире намного быстрее, чем с помощью автономного анализа, основанного
на традиционных источниках СМИ.
Наш исследовательский интерес близок к проблеме обнаружения
событий в Твиттере. Следует отметить, что обнаружение событий в
Твиттере долгое время было темой исследования [180] и основная проблема заключалась в обнаружении тех событий, которые пользователи
Твиттера обсуждают больше всего. Большинством исследований предполагалось, что увеличение использования некоторых связанных слов
будет показывать, когда происходит событие. Поэтому событие обычно
характеризуется рядом ключевых слов, отображающих резкий всплеск
количества их появлений [180, 181]. С тех пор проблема обнаружения
событий в Твиттере вызвала серьезный энтузиазм со стороны исследователей интеллектуального анализа данных [182–186]. Принято считать,
что события на платформах социальных сетей можно условно определить как события реального мира, происходящие в конкретный период
времени и в рамках некоторого географического местоположения, которые были упомянуты онлайн-пользователями [187–191].
В этом параграфе используется подход, основанный на идеях статьи
[180]. Для обнаружения событий аналогичного масштаба используются
данные новостной аналитики, локализованные во времени и относящиеся к конкретной компании. Таким образом, используется характеристика
78

Глава 3. Методы обнаружения экономических и финансовых событий
новостей, которая отражает их локализацию во времени и схожесть атрибутов.
События определяются как явления реального мира, которые отражаются в новостях, сконцентрированных во времени и связанных с конкретной компанией, группой компаний или сектором экономики. Полагается, что важное оффлайн-мероприятие привлечет интерес новостных
и информационных агентств, а также других поставщиков новостей и
участников обмена новостями. Чем важнее событие, тем интенсивнее
будет соответствующий новостной поток. Предполагается, что важное
событие должно вызвать каскад новостей. Каскад новостей определяется как последовательность новостей, публикуемых разными поставщиками в один и тот же период времени, относятся к одной компании и
имеют одну тему. Как правило, такой каскад имеет начальное новостное сообщение (триггер), которое запускает этот каскад. Если какието новости оказались важными, другие поставщики новостей и информационные агентства перепечатывают их в близком к первоначальному
виде. Кроме того, они могут публиковать новости, связанные с развитием событий, вызванных этой новостью. Если опубликованная новость
кажется неважной, она может быть перепечатана очень немногими поставщиками новостей или вообще остается без внимания. Новость, которая не вызвала интереса и каскада новостей, на наш взгляд, вряд ли
связана с важным событием. Следовательно, обнаружение таких каскадов в потоке новостей позволяет нам тем или иным образом обнаруживать события. Каждый такой каскад является компонентом связи в графе
новостных сообщений. Таким образом, идентификация каскадов и соответствующих им событий сводится к задаче поиска связанных подграфов (кластеров) графа новостей. Можно предположить, что чем больше
новостей в каскаде, тем значительнее соответствующее событие. Конечно, разные события могут иметь разные временные масштабы, т. е. они
могут охватывать разные интервалы времени.
В этом параграфе рассматривается поток данных новостной аналитики с временной и текстовой информацией. Целью данного параграфа
является использование подхода к идентификации событий с применением потоковых данных поставщиков новостной аналитики. Обнаружение событий рассматривается как задача кластеризации на основе графа,
где вершины графа представляют новости, а ребра отражают их сходство.
79

Приложение методов фрактального анализа, теории графов
3.1.1. Обнаружение событий с помощью временных и атрибутивных ограничений
Экономические и финансовые события, представленные в потоке
новостей, могут иметь разную локализацию во времени и разную принадлежность к конкретной компании (группе компаний, отрасли, ст ране).
Когда события локализованы в двух измерениях (временном и атрибутивном), обнаружение событий может быть адекватно реализовано путем на ложения временных и атрибутивных ограничений на данные. Будет подробно рассмотрен подход к обнаружению экономических и финансовых событий, локализованных как по времени, так и по атрибутам.
Это можно свести к задаче кластеризации, когда собираются вместе новости, описывающие одно и то же событие реального мира. Мы определяем меру сходства между разными новостями niи njследующим
образом:
(
S(ni,nj) =
1, если t(ni,nj) ≤ Ttи A(ni) = A(nj),
0, иначе
(3.1)
где t(ni,nj) – временная разница в минутах между niи nj, а A(n) –
значение атрибута A (название компании и тема новости) для элемента
новостей n.
Порог Ttобеспечивает строгие временные ограничения событий, а
A реализует общие атрибуты. При таких ограничениях две новости niи
njбудут относится к одному и тому же экономическому и финансовому
событию.
Компоненты связности графа находятся с помощью метода поиска в глубину. Главный недостаток этого алгоритма кластеризации на
больших графах – высокие требования к объему оперативной памяти.
Однако проблема значительно уменьшилась из-за исключительной разреженности данного графа.
В статьях [186,192] использовались разные подходы к поиску меры
сходства для твиттов.
Пусть S(ni,nj) будет попарным сходством между новостями, определенными в (3.1). Зададим матрицу W следующим образом:
(
W (ni,nj) =
S(ni,nj), если i , j,
0, если i = j.
(3.2)
Матрица W – симметричная разреженная матрица. Можно построить разреженную неориентированную G = (V,E,W ), для которой W –
80
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
