Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:
Приложение методов фрактального анализа, теории графов и анализа сложных сетей к исследованию временных рядов.pdf
Скачиваний:
0
Добавлен:
08.09.2026
Размер:
2 Мб
Скачать
☆
Глава 2. Методы анализа данных новостной аналитики
1,600
1,400
1,200
1,000
Число ребер
800
01.2005 01.2006 01.2007 01.2008 01.2009 01.2010 Время, год
Рис. 2.14. Динамика количества ребер с января 2005 по декабрь 2010 года

2.3.2. Эволюция размера максимальных клик

В данном параграфе проводится анализ эволюции размера макси-
мальной клики на графах за рассматриваемый период.
Граф G = (V,E) называется связным, если для любых двух вершин из множества V существует путь от одной к другой. Если граф не свя­зен, его можно подразделить на несколько связных подграфов (связных компонент G).
Обозначим через G(S) подграф, индуцированный S, для данного подмножества S ⊆ V . Напомним, что подмножество C ⊆V называется кликой, если G(C) – полный граф. Задача о клике – это задача нахожде­ния самой большой клики в графе.
Подмножество I ⊆ V называется независимым множеством, если подграф G(I) не имеет ребер. Задача о независимом множестве состо­ит в том, чтобы найти наибольшее независимое множество в графе. Ее легко можно выразить как задачу нахождения максимальной клики в дополнительном графеeG(V,eE). Очевидно, что максимальная клика вeG является максимальным независимым множеством в G, поэтому задачи о клике и о независимом множестве легко сводятся друг к другу.
Независимые множества могут рассматриваться как наборы объек­тов, которые отличаются от любого другого объекта в наборе, и эти зна­ния могут быть важны в некоторых приложениях. Нахождение макси­мальной клики дало бы нам максимально возможный размер множеств «связанных» элементов, в то время как обнаружение наибольшего неза­висимого множества могло бы дать нам максимально возможный размер групп «разных» объектов в сети.
Хорошо известно, что задачи о клике и о независимом множестве являются NP-трудными [164]. Более того, в работах [165,166] говорится,
71
Приложение методов фрактального анализа, теории графов
2
1
Число вершин
0
2
1
Число вершин
0
2
1
0
0
0.5
0
0.5
1
1.5
а
1
1.5
в
0
0.5
2
1
0
0
0.5
1
1.5
б
1
1.5
г
2
1
Число вершин
0
0
0.5
Рис. 2.15. Распределение степеней графа со-упоминания за отдельные периоды (в лога­рифмической шкале): а – июнь 2005, б – июнь 2006, в – июнь 2007, г – июнь 2008, д –
1
1.5
д
июнь 2009, е – июнь 2010
2
1
0
2
0
0.5
1
1.5
е
72
Глава 2. Методы анализа данных новостной аналитики
что данные задачи трудно аппроксимировать, и это делает данные зада­чи особенно требовательными в больших графах. Однако разреженная структура графа совместного упоминания позволяет нам найти точное решение задачи о клике.
Задача о клике возникает в практическом приложении во многих областях. Некоторые из этих практических задач могут быть прямо сфор­мулированы как задачи о клике и во многих случаях сведены к задаче, которая требует поиска максимальной клики. Реальные приложения за­дачи о клике появляются в обработке сигналов, теории классификации, теории кодирования, компьютерном зрении, экономике, финансах, по­иске информации, теории передачи сигналов, выравнивании последо­вательностей ДНК и белков, анализе социальных сетей и многих дру­гих конкретных областях. Некоторые из этих приложений можно найти в [167–176].
Из определения клики следует, что это набор полностью связанных между собой вершин, и поэтому каждая компания, которая относится к клике, прочно связана со всеми остальными компаниями в этой клике. Таким образом, компания связана с данной группой тогда и только то­гда, когда она упоминается совместно со всеми другими компаниями в этой группе. Компании в одной клике, как правило, имеют общие харак­теристики экономической и финансовой деятельности, и тот факт, что они упоминаются в совместных новостях, является следствием их фи­нансово-экономических связей в реальном мире. Эти экономические и финансовые отношения между компаниями могут возникать по разным причинам, например:
– если существует сильная корреляция между доходностью активов
компаний;
– если в обеих компаниях есть общие члены совета директоров; – если одна из компаний вкладывает средства в другую; – если одна из компаний потребляет услуги или товары другой ком-
пании;
– если одна из компаний поставляет товары или услуги другой ком-
пании.
Поскольку максимальная клика представляет собой максимально возможную группу похожих объектов, ее можно рассматривать как важ­ную характеристику графа совместного упоминания.
В этом исследовании для нахождения точной максимальной кли­ки был использован один из вариантов алгоритма Брона – Кербоша, предложенный в [177]. Алгоритм Брона – Кербоша рекурсивно решает
73
Приложение методов фрактального анализа, теории графов
подзадачи, детализированные тремя наборами вершин, к которым отно­сятся:
– вершины, которые должны быть включены в данную клику; – вершины, которые следует исключить из клики; – некоторые оставшиеся вершины, статус которых остается неизвест-
ным.
Доказано, что этот алгоритм является эффективным для достаточно разреженных сетей. Обратите внимание, что сети со-упоминаний очень разрежены. Точное описание алгоритма представлено в статье [178].
С другой стороны, проблема обнаружения максимальных независи­мых множеств для таких разреженных сетей совместного упоминания является более сложной с вычислительной точки зрения задачей ввиду высокой плотности дополнительного графа для сети совместного упо­минания компаний. По этой причине для решения данной проблемы была использована полувнешняя жадная процедура рандомизированно­го адаптивного поиска, предложенная в [179]. Известно, что алгоритм работает достаточно быстро, но не обязательно может давать точные решения.
Динамика размера максимальной клики для сети совместного упо­минания показана на рис. 2.16. Видно, что размер максимальной клики достиг максимального значения в разгар финансового кризиса (сентябрь 2008 года). Следует отметить, что в каждый период алгоритм находит несколько разных клик с общим максимальным размером.
10
9
8
7
6
5
01.2005 01.2006 01.2007 01.2008 01.2009 01.2010 01.2011 Рис. 2.16. Месячная динамика размера максимальных клик
74
Глава 2. Методы анализа данных новостной аналитики
В табл. 2.17 представлены клики с наибольшим значением степени центральности среди всех клик, имеющих одинаковый максимальный размер, для 12 (из 72) разных периодов времени.
Максимальные центральные клики за разные периоды времени
Период, год Компании, входящие в максимальную центральную клику
Сентябрь 2005
Сентябрь 2006
Март 2007 “Modern Home Products”, “C-Corporation”, “JPMorgan Chase”, “Urban Select
Октябрь 2007
Июнь 2008 “US/MOT”, “Delta Air Lines”, “eBay Inc.”, “United Technologies
Март 2008 “Federal National Mortgage Association”, “Boeing Co”, “US/MOT”, “Wells
Июль 2008 “Modern Home Products”, “C-Corporation”, “JPMorgan Chase”, “Moran
Сентябрь 2008
Февраль 2009
Октябрь 2009
Май 2010 “C-Corporation”, “JPMorgan Chase”, “Urban Select Capital Corporation”,
Ноябрь 2010
“C-Corporation”, “JPMorgan Chase”, “Urban Select Capital Corporation”, “Goldman Sachs Group”, “Deutsche Bank Aktiengesellschaft”, “Mouser Electronics”, “Der Deutsche Richterbund”
“C-Corporation”, “Urban Select Capital Corporation”, “Goldman Sachs Group”, “Morgan Stanley Bank”, “Deutsche Bank Aktiengesellschaft”, “Telstra Corporation Limited”
Capital Corporation”, “Credit Suisse Group AG”, “Bank of America Corporation”, “Deutsche Bank Aktiengesellschaft”
“Bank of America Corporation”, “NOKIA”, “Alphabet Inc.”, “Eli Lilly and Company”, “C-CorporationOF”, “Gilead Sciences, Inc.”, “The Hershey Company”
Corporation”, “C-CorporationOP”, “General Dynamics Corporation”, “Southwest Airlines Co.”, “C-CorporationOF”
Fargo Advantage Funds”, “Eli Lilly and Company”, “MBIA Inc.”, “Amgen Inc.”, “Northrop Grumman Corp.”
Environmental Recovery”, “Bank of America Corporation”, “Federal National Mortgage Association, US/FRE”
“Modern Home Products”, “C-Corporation”, “JPMorgan Chase”, “Urban Select Capital Corporation”, “Credit Suisse Group AG ”, “Moran Environmental Recovery”, “Morgan Stanley Bank”, “Lehman Brothers”, “American International Group”, “Weibo Corporation”
“Modern Home Products”, “Urban Select Capital Corporation”, “Credit Suisse Group AG ”, “Morgan Stanley Bank”, “Lehman Brothers”, “ND Software Co Ltd”, “Wells Fargo & Company”
“Modern Home Products”, “C-Corporation”, “JPMorgan Chase”, “Urban Select Capital Corporation”, “Credit Suisse Group AG ”, “Bank of America Corporation”, “ND Software Co Ltd”, “Wells Fargo & Company”
“Credit Suisse Group AG ”, “Morgan Stanley Bank”, “Bank of America Corporation”, “Deutsche Bank Aktiengesellschaft”, “Barclays Group”
“Modern Home Products”, “JPMorgan Chase”, “Urban Select Capital Corporation”, “Credit Suisse Group AG ”, “Goldman Sachs Group”, “Morgan Stanley Bank”, “Bank of America Corporation”
Таблица 2.17
75
Приложение методов фрактального анализа, теории графов
Оказалось, что некоторые компании появлялись в максимальных кликах в разное время. Максимальные клики включают значительное количество компаний из финансового сектора, таких как “JPMorgan Chase & Co.” (JPM), “UBS Group AG” (UBSN), “Credit Suisse Group AG” (CSGN), “Goldman Sachs Group, Inc.” (GS), “Deutsche Bank Aktienge­sellschaft” (DBK), “Morgan Stanley” (MS), “Citigroup Inc.” (C). Можно сделать вывод, что крупные финансовые и банковские компании регу­лярно представлены в группах наиболее часто упоминаемых компаний в течение рассматриваемых периодов времени.
2.3.3. Основные выводы по анализу динамики сети со-упоминания
компаний
В параграфе 2.3 были исследованы изменения структурных свойств графа со-упоминания компаний во времени. В результате было сделано несколько интересных выводов. Было показано, что степенная структу­ра графа совместного упоминания достаточно устойчива. Более того, в отличие от реальных социальных графов сети со-упоминания компаний свойственно экспоненциальное распределение степеней с нетипичными коэффициентами степенной экспоненты. Таким образом, можно отме­тить, что концепция «самоорганизующейся» сети может использоваться для потока новостей, а рынок новостей можно рассматривать как «са­моорганизованную» систему. Другим важным фактом является то, что максимальная клика увеличивается в условиях кризиса и это поддержи­вает широко обсуждаемое представление о глобальной экономике. Ока­залось, что в большинстве случаев компании, которые оказывались в максимальной клике ранее, также появлялись в более поздние периоды. Все максимальные клики включают множество компаний банковского сектора. Следует отметить, что результаты довольно стабильны при ис­пользовании разных окон агрегации.
Глава 3 Методы обнаружения экономических и финансовых событий
В по следние годы одной из самых обширных тем исследований в области анализа социальных сетей было обнаружение событий. В боль­шинстве подходов для обнаружения событий используются фиксирован­ное временное и прост ранственное разрешение. В этой главе предлага­ется процедура обнаружения экономических и финансовых событий с использованием данных новостной аналитики на основе использования алгоритма для вычисления графа подобия данных в выбранных мас­штабах и одновременного обнаружения экономических и финансовых событий с помощью единого процесса кластеризации на основе гра­фа. Экспериментальные результаты на реальных данных, собранных от поставщиков аналитики новостей, демонстрируют эффективность про­цедуры обнаружения событий на основе данных аналитики новостей в реальном времени.
В этой главе также предлагается новый метод обнаружения собы­тий на основе сети совместного упоминания компаний. Идея метода за­ключается в том, что более важные новости должны привлекать больше внимания и приводить к увеличению интенсивности новостного потока. Изменение интенсивности со-упоминаний можно интерпретировать как сигнал или маркер неожиданных явлений, которые могут затронуть от­носительно узкий или широкий круг экономических субъектов. Анализ, проведенный в исследовании, предполагает, что разложение матриц сов­местного упоминания может использоваться для разделения новостных сигналов. Новости, соответствующие стабильной части графика, появ­ляются чаще; соответственно они несут меньше информации. Метод выявления неожиданных новостей заслуживает особого внимания при принятии финансовых и инвестиционных решений. Предлагаемый под­ход к выбору событийной части может быть использован при разработ­ке алгоритмов обнаружения новых событий в финансово-экономической сфере.
77
Приложение методов фрактального анализа, теории графов

3.1. Кластерный подход на основе графов для обнаружения событий

Информационные агентства, организации, социальные с ети, пред­приятия и т. д. генерируют огромное количество информации и ново­стей в режиме реального времени. Изучение характеристик и особен­ностей новостного потока стало одной из последних тем в социальной информатике. Лента новостей общедоступна и отражает процессы, про­исходящие в мире. Поэтому изучение структурных свойств новостно­го потока и разработка методов и алгоритмов обработки таких данных представляют большой интерес.
Таким образом, огромный объем данных новостной аналитики поз­воляет изучать некоторые исследовательские проблемы. В этом парагра­фе рассматривается еще одна такая проблема – обнаружение событий. Обратите внимание, что аналитические данные новостей дают преиму­щества для обнаружения событий. Используя характер новостных ана­литических служб в реальном времени, как трейдеры, так и правитель­ства могут повысить свою осведомленность о событиях в реальном ми­ре намного быстрее, чем с помощью автономного анализа, основанного на традиционных источниках СМИ.
Наш исследовательский интерес близок к проблеме обнаружения событий в Твиттере. Следует отметить, что обнаружение событий в Твиттере долгое время было темой исследования [180] и основная проб­лема заключалась в обнаружении тех событий, которые пользователи Твиттера обсуждают больше всего. Большинством исследований пред­полагалось, что увеличение использования некоторых связанных слов будет показывать, когда происходит событие. Поэтому событие обычно характеризуется рядом ключевых слов, отображающих резкий всплеск количества их появлений [180, 181]. С тех пор проблема обнаружения событий в Твиттере вызвала серьезный энтузиазм со стороны исследо­вателей интеллектуального анализа данных [182–186]. Принято считать, что события на платформах социальных сетей можно условно опреде­лить как события реального мира, происходящие в конкретный период времени и в рамках некоторого географического местоположения, кото­рые были упомянуты онлайн-пользователями [187–191].
В этом параграфе используется подход, основанный на идеях статьи [180]. Для обнаружения событий аналогичного масштаба используются данные новостной аналитики, локализованные во времени и относящие­ся к конкретной компании. Таким образом, используется характеристика
78
Глава 3. Методы обнаружения экономических и финансовых событий
новостей, которая отражает их локализацию во времени и схожесть ат­рибутов.
События определяются как явления реального мира, которые отра­жаются в новостях, сконцентрированных во времени и связанных с кон­кретной компанией, группой компаний или сектором экономики. Пола­гается, что важное оффлайн-мероприятие привлечет интерес новостных и информационных агентств, а также других поставщиков новостей и участников обмена новостями. Чем важнее событие, тем интенсивнее будет соответствующий новостной поток. Предполагается, что важное событие должно вызвать каскад новостей. Каскад новостей определяет­ся как последовательность новостей, публикуемых разными поставщи­ками в один и тот же период времени, относятся к одной компании и имеют одну тему. Как правило, такой каскад имеет начальное новост­ное сообщение (триггер), которое запускает этот каскад. Если какие­то новости оказались важными, другие поставщики новостей и инфор­мационные агентства перепечатывают их в близком к первоначальному виде. Кроме того, они могут публиковать новости, связанные с развити­ем событий, вызванных этой новостью. Если опубликованная новость кажется неважной, она может быть перепечатана очень немногими по­ставщиками новостей или вообще остается без внимания. Новость, ко­торая не вызвала интереса и каскада новостей, на наш взгляд, вряд ли связана с важным событием. Следовательно, обнаружение таких каска­дов в потоке новостей позволяет нам тем или иным образом обнаружи­вать события. Каждый такой каскад является компонентом связи в графе новостных сообщений. Таким образом, идентификация каскадов и соот­ветствующих им событий сводится к задаче поиска связанных подгра­фов (кластеров) графа новостей. Можно предположить, что чем больше новостей в каскаде, тем значительнее соответствующее событие. Конеч­но, разные события могут иметь разные временные масштабы, т. е. они могут охватывать разные интервалы времени.
В этом параграфе рассматривается поток данных новостной анали­тики с временной и текстовой информацией. Целью данного параграфа является использование подхода к идентификации событий с примене­нием потоковых данных поставщиков новостной аналитики. Обнаруже­ние событий рассматривается как задача кластеризации на основе графа, где вершины графа представляют новости, а ребра отражают их сход­ство.
79
Приложение методов фрактального анализа, теории графов

3.1.1. Обнаружение событий с помощью временных и атрибутивных ограничений

Экономические и финансовые события, представленные в потоке новостей, могут иметь разную локализацию во времени и разную при­надлежность к конкретной компании (группе компаний, отрасли, ст ране). Когда события локализованы в двух измерениях (временном и атрибу­тивном), обнаружение событий может быть адекватно реализовано пу­тем на ложения временных и атрибутивных ограничений на данные. Бу­дет подробно рассмотрен подход к обнаружению экономических и фи­нансовых событий, локализованных как по времени, так и по атрибутам. Это можно свести к задаче кластеризации, когда собираются вместе но­вости, описывающие одно и то же событие реального мира. Мы опре­деляем меру сходства между разными новостями niи njследующим образом:
(
S(ni,nj) =
1, если t(ni,nj) ≤ Ttи A(ni) = A(nj), 0, иначе
(3.1)
где t(ni,nj) – временная разница в минутах между niи nj, а A(n) – значение атрибута A (название компании и тема новости) для элемента новостей n.
Порог Ttобеспечивает строгие временные ограничения событий, а
A реализует общие атрибуты. При таких ограничениях две новости niи njбудут относится к одному и тому же экономическому и финансовому
событию.
Компоненты связности графа находятся с помощью метода поис­ка в глубину. Главный недостаток этого алгоритма кластеризации на больших графах – высокие требования к объему оперативной памяти. Однако проблема значительно уменьшилась из-за исключительной раз­реженности данного графа.
В статьях [186,192] использовались разные подходы к поиску меры сходства для твиттов.
Пусть S(ni,nj) будет попарным сходством между новостями, опре­деленными в (3.1). Зададим матрицу W следующим образом:
(
W (ni,nj) =
S(ni,nj), если i , j,
0, если i = j.
(3.2)
Матрица W – симметричная разреженная матрица. Можно постро­ить разреженную неориентированную G = (V,E,W ), для которой W –
80
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]