Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:
Образ СССР в фокусе математического моделирования опыт цифровой гуманитаристики.pdf
Скачиваний:
0
Добавлен:
07.09.2026
Размер:
2 Мб
Скачать
☆
Глава 3. Анализ конвергентных СМИ и социальных сетей
распространение информации среди конкретных групп пользователей социальных сетей.
Модель SI является самой базовой из всех сегментарных моделей, используемыхдля описания распространения информации в социальных сетях. Модель SI была впервые использована Гриличес, который при­менил логистическую модель для объяснения широкого использования гибридной кукурузы в США21. Некоторые ученые рассматривали это ис­следование в качестве образца для использования логистической модели в своих работах22.
Согласно этой модели, пользователей социальных сетей (приняв­ших участие в обсуждение некоторой темы) можно классифицировать на две категории: группа, которая начинает распространение информа­ции (например, публикация статей или сообщений по некоторой темати­ке, используя уникальные хэштеги), и группа, которая ещё не получила информацию и не участвует в её распространении. Модель SI логистиче­ского роста представлена следующим дифференциальным уравнением:
dI (t)
dt
= β⟨k⟩
S (t)I (t)
N
, (1)
где β – вероятность распространения информации, т. е. вероятность то­го, что пользователь сети, получивший сообщение, заинтересуется его тематикой и транслирует его или его производную форму другим поль­зователям сети в единицу времени; ⟨k⟩ – среднее число контактов поль­зователей социальной сети; S(t) – количество восприимчивых к данной тематике пользователей, не получивших новостное сообщение и/или его производные публикации, т. е. не владеющие информацией в момент времени t (для краткости восприимчивые); I(t) – число пользователей, получивших новостное сообщение и/или его производные публикации на заданную тему, т. е. получившие информацию и продолжающие её распространение, в момент времениt (для краткости информированные); N – число пользователей сети.
21
См.: Griliches Z. Hybrid corn: An exploration in the economics of technological change //
Econometrica. 1957. Vol. 15. P. 501–522.
22
См.: Frank L. An analysis of the economic situation on modeling and forecasting the diffusion of wireless communications in Finland // Technol. Forecast. Soc. Change. 2019. № 71. P. 391–403; Gruber H., Verboven F. The diffusion of mobile telecommunications services in the European Union // Eur. Econ. Rev. 2001. Vol. 45. P. 577–622; Lee M., Cho T. The diffusion of mobile telecommunications services in Korea // Applied Economics Letters. 2007. Vol. 14. P. 477–481; Liikanen J., Stoneman P., Toivanen O. Intergenerational effects in the diffusion of new technology: The case of mobile phones // International Journal of Industrial Organization.
2004. Vol. 22, № 8. P. 1137–1154; Daley D. J., Kendall D. G. Stochastic rumors // J. Inst. Math. Appl. 1965. Vol. 142. P. 42–55.
191
Образ СССР в фокусе математического моделирования
Обозначим через s = s(t) = S(t)/N и i = i(t) = I(t)/N доли воспри­имчивых и информированных пользователей, соответственно, в момент времени t. Тогда уравнение (1) можно переписать следующим образом:
di
= β⟨k⟩si = β⟨k⟩i (1 −i), (2)
dt
где произведение β⟨k⟩ по сути представляет собой скорость передачи информации.
Решение этого дифференциального уравнения первого порядка с на­чальным условием i0= i (0) может быть найдено в явном виде:
β⟨k⟩t
i = i (t) =
i0e
1 − i0+ i0e
. (3)
β⟨k⟩t
Уравнение (3) предсказывает, что:
– вначале доля пользователей, получивших новостное сообщение,
увеличивается экспоненциально. Действительно, на раннем этапе
информированный пользователь сталкивается только с восприим-
чивыми, поэтому информация может легко распространяться;
– характеристическое время, необходимое для достижения доли 1/e
(около 36%) всех восприимчивых особей:
1
τ =
. (4)
β⟨k⟩
Следовательно,величина τ обратно пропорциональна скорости, с ко-
торой информация распространяется среди пользователей сети. Та-
ким образом, из уравнения (4) следует, что увеличение либо плот-
ности связей ⟨k⟩, либо β увеличивает скорость распространения ин-
формации и уменьшает характеристическое время;
– со временем пользователь, получивший информацию (сообщение)
на заданную тему, транслирует её дальше всё меньшему и меньшему
числу восприимчивых пользователей. Следовательно, рост i замед-
ляется при больших t. Распространение информации заканчивается,
когда все осведомлены (информированы), т. е. когда i(t → ∞) = 1
и s(t → ∞) = 0.

3.2.2. Модели распространения информации на сетях

Необходимо отметить, что модели, обсуждавшиеся выше, не учи­тывают структуру контактной сети, которая способствует распростра-
192
Глава 3. Анализ конвергентных СМИ и социальных сетей
нению информации. Основное предположение таких моделей состоит в том, что любой пользователь сети может заразить некоторой тема­тикой любого другого пользователя (гипотеза гомогенного смешения), и что все пользователи имеют сопоставимое число контактов (друзей, подписчиков). Однако в реальных социальных сетях эти предположения неверны: сообщение, размещенное пользователем соцсети, доступно его друзьям (подписчикам), следовательно, информация распространяются по сложной сети контактов. Кроме того, таким контактным сетям, как правило, свойственна безмасштабность, поэтому показателя среднего числа связей у пользователя недостаточно для характеристики их топо­логии.
Несостоятельность основных гипотез вызвала фундаментальный пересмотр основы моделирования распространения информации в соцсетях. Это изменение началось с работы Ромуальдо Пастор­Саторраса и Алессандро Веспиньяни, которые в 2001 г. расширили основные модели распространения эпидемии (которые легко переносятся (адаптируются) на случай распространения информации), учтя топологические характеристики сети23. Распространение информации, а также наилучшие условия для распространения и появления суперраспространителей в значительной степени исследованы в сетевых науках о распространении опасных вирусов, патогенов (а также дезинформации или сплетен)24. В другой работе авторы исследовали влияние структуры сообщества сети на перколяции, моделирующие распространение эпидемии по образцу классической эпидемической модели SIR25. Авторы пришли к выводу, что распространение внутри сообществ критически связано с плотностью сети26, а границы между сообществами являются наиболее важным фактором для распространения эпидемии, независимо от размера
23
См.: Pastor-Satorras R., Vespignani A. Epidemic spreading in scale-free networks // Phys.
Rev.Lett. Apr. 2001. Vol. 86. P.3200–3203. https://link.aps.org/doi/10.1103/PhysRevLett.86.3200
24
См.: Xiaoqi Zhang, Zi Ke Zhang, Wenbo Wang, Donglin Hou, Jiajing Xu, Xinyue Ye, Shengwen Li. Multiplex network reconstruction for the coupled spatial diffusion of infodemic and pandemic of COVID-19 // International Journal of Digital Earth. 2021. Vol. 14, № 4. P. 401–423. https://doi.org/10.1080/17538947.2021.1888326
25
См.: Berestycki H., Desjardins B., Weitz J. S. Epidemic modeling with heterogeneity and social diffusion //J. Math. Biol. 2023. Vol. 86,№ 60. https://doi.org/10.1007/s00285-022-01861-w
26
См.: Eryarsoy E., Delen D., Davazdahemami B., Topuz K. A novel diffusion-based model for estimating cases, and fatalities in epidemics: The case of COVID-19 // J. Bus. Res. 2021. Jan. Vol. 124. P. 163–178. https://doi.org/10.1016/j.jbusres.2020.11.054. Epub 2020 Dec 1. PMID: 33281248; PMCID: PMC7706427; Dimarco G., Perthame B., Toscani G. Kinetic models for epidemic dynamics with social heterogeneity // J. Math. Biol. 2021. Vol. 83, № 4. https://doi.org/
10.1007/s00285-021-01630-1
193
Образ СССР в фокусе математического моделирования
и формы сообщества. В частности, распространение эпидемии изучается с использованием матрицы смежности графа27.
Новая модель SIR представлена в сочетании с социальными сетями для изучения распространения слухов и позволяет в явном виде учесть расположение объектов, а также связи и взаимодействия между объекта­ми28. Эксперименты в этой модели показали, что существование сетевой среды сокращает время распространения слухов и ускоряет их распро­странение. Но в модели авторы пренебрегли связями сетевой среды, ко­торые сильно влияют на процесс распространения слухов.
В своей работе Ву и Чен улучшили модельSIR, используясвою инте­грированную методологию для моделирования распространения мнений и идей на веб-форумах29. Эта обновленная модель была подтвержде­на большим набором данных с веб-форума крупной розничной компа­нии и набором данных с общего политического дискуссионного форума. Их экспериментальные результаты также показали, что эта обновленная модель SIR хорошо работает с распространением тем на веб-форумах.
Бао и Чанг изучали механизм распространения информации с ис­пользованием способов передачи тепла вместе со связями между узлами сети для моделирования распространения информации в социальных сетях30. Выдвинутая ими модель зависит от сетевых структур, поскольку предлагаемые механизмы определяются состояниями и степенями сете­вых узлов.
Доу и Лиу представили модель распространения информации, осно­ванную на принципах процесса теплопередачи31. Таким образом, пред­полагается, что механизм диффузии модели зависит от того, сколько раз конкретный узел взаимодействует со своими соседями. Эксперимен­ты на реальном наборе данных социальных сетей продемонстрирова­ли эффективность модели. Авторы также разработали алгоритмы для поиска топ-k узлов, на которые повлияла маркетинговая информация.
27
См.: Gómez A., Oliveira G. New approaches to epidemic modeling on networks // Sci. Rep.
2023. Vol. 13, № 468. https://doi.org/10.1038/s41598-022-19827-9
28
См.: Wang J., Wang Y.-Q. Sir rumor spreading model with networkmedium in complex social
networks // Chinese Journal of Physics. Oct. 2014. № 1. P. 27–46.
29
См.: Woo J., Chen H. Epidemic model for information diffusion in web forums: Experiments
in marketing exchange and political dialog // SpringerPlus. 2016. Vol. 5. Article number 66.
30
См.: Bao H., Chasng E. AdHeat: An influence-based diffusion model for propagating hints to match ads. // Proceedings of the 19th International Conference on World Wide Web. 2010. April. P. 71–80.
31
См.: Doo M.,Liu L. Extracting top-k most influential nodes by activity analysis //Proceedings of the IEEE 15th International Conference on Information Reuse and Integration (IEEE IRI 2014).
2014. April. P. 227–236.
194
Глава 3. Анализ конвергентных СМИ и социальных сетей
Некоторые ограничения модели заключаютсяв том, что она не учитывает дружеские отношения пользователей при распространении информации.
В этом исследовании предлагаются модели типа SI и их различные модификации для изучения закономерностей процесса распространения информации на реальных данных социальных сетей. Мы заинтересованы в разработке новых моделей на графах, которые могли бы учитывать особенности их топологии.
3.2.2.1. Модель SI на графах (SI на сети)
Для построения модели SI на сети будет использована формула (2) классической модели SI, не учитывающая структуру сети. Отметим, что в случае распространения информации по сети люди с большим количеством связей с большей вероятностью вступят в контакт с ин­формированным человеком, следовательно, они с большей вероятностью будут владеть информацией. Поэтому математический формализм дол­жен рассматривать степень каждого узла как неявную переменную. Это достигается с помощью блочной аппроксимации степени, которая разли­чает узлы на основе их степени и предполагает, что узлы с одинаковой степенью статистически эквивалентны. Поэтому обозначим через
I
k
ik=
N
k
(5)
долю информированных узлов степени k среди всех Nkузлов степени k в сети. Общая доля информированных узлов равна сумме всех информи­рованных узлов степени k:
i =
pkik, (6)
∑
k
где pk– вероятность того, что случайно выбранный узел имеет степень k.
Учитывая разные степени узлов, запишем модель SI для каждой степени k отдельно:
di
k
= β(1 − i
dt
k
)kθ
.
k
(7)
Это уравнение имеет похожую структуру, что и классическая мо­дель SI (2), описанная ранее: уровень распространения информации про­порционален β и доле еще не информированных узлов степени k, которая равна (1 − ik). Тем не менее, есть несколько ключевых отличий:
195
Образ СССР в фокусе математического моделирования
– средняя степень ⟨k⟩ в (2) заменяется фактической степенью k каждо-
го узла;
– функция плотности θkпредставляет долю информированных сосе-
дей восприимчивого узла со степенью k. Таким образом, θk– это просто доля информированных узлов ik. Однако в сетевой среде доля информированных узлов в непосредственной близости от узла может зависеть от его степени k и времени t ;
– в то время как (2) описывает поведение всей системы с помощью
одного уравнения, зависящего от времени, (7) представляет собой систему из k
связанных уравнений, по одному уравнению для
max
каждой степени, присутствующей в сети.
В приведенной выше работе Ромуальдо Пастор-Саторраса и Алес­сандро Веспиньяни 2001 г. изучалось поведение ikна ранних времен­ных периодах32. В этой работе мы расширяем разработанный ими фор­мализм, рассматривая распространение информации на всех временных этапах (периодах) её проникновения в сети.
Как обсуждалось ранее, чтобы вычислить ik, мы должны сначала определить θk. Если в сети отсутствуют корреляции степеней, вероят­ность того, что ссылка ведет от узла степени k к узлу степени k′, не за­висит от k. Следовательно, вероятность того, что случайно выбранное ребро указывает на узел степени k′, есть степень избытка:
k′p
∑
′
k
k
p
k
k
′
k′p
k
=
, (8)
⟨k⟩
где pk– доля узлов степени k.
Вполне естественно, что как минимум одно звено каждого информи­рованного узла связано с другим информированным узлом, передавшим информацию. В связи с этим предполагали
33
, что количество каналов, доступных для передачи информации в будущем, равно (k′− 1). Тогда функция плотности θkможет быть определена следующим образом:
′
θk=
(k′− 1)p
′
∑
k
⟨k⟩
′
i
k
k
. (9)
Необходимо отметить, что такое предположение достаточно грубое и может иметь место только на ранней стадии распространения инфор­мации.
32
См.: Pastor-Satorras R., Vespignani A. Op. sit.
33
Ibid.
196
Глава 3. Анализ конвергентных СМИ и социальных сетей
Далее вернемся к уравнению (9). Отметим, что при отсутствии кор­реляций степеней, θ = θkне будет зависеть от k. Тогда дифференцируя (9), получаем:
dθ
dt
=
(k − 1) p
∑
k
⟨k⟩
di
k
k
. (10)
dt
Используя (7) и (10), получаем:
dθ
dt
=
(k − 1) p
∑
k
k
β(1 − ik)kθ. (11)
⟨k⟩
Очевидно, что на ранней стадии распространения информации (при ма­лых t ) доля информированных значительно меньше единицы и (1 − ik) можно пренебречь. Отмечается, что в этом случае доля информирован­ных может быть найдена в явном виде34. В нашем случае мы не можем отбросить множитель (1 −ik).
Таким образом, мы получаем следующую систему из k
связанных
max
уравнений:
θ =
(k − 1) pki
∑
k
⟨k⟩
di
k
= β (1 −ik)kθ, k = 1, . ..,k
dt
k
,
max
(12)
.
3.2.2.2. Новая модель SI на графах (SI аппроксимация)
В предлагаемой нами новой модели предполагается, что количе­ство каналов, доступных для передачи информации в будущем, наоборот, будет увеличиваться с течением времени по мере увеличения инфор­мированности пользователей сети, поскольку все больше узлов будут становиться информированными и будет больше возможности (каналов) для передачи информациив будущем. Тогда функцияплотности θkможет быть определена следующим образом:
′
θk=
′
∑
k
k′(t, β) p
⟨k⟩
′
i
k
k
, (13)
где предполагается, что количество каналов k′(t), доступных для пере­дачи информации, в будущем может быть аппроксимировано функцией,
34
См.: Pastor-Satorras R., Vespignani A. Op. sit.
197
Образ СССР в фокусе математического моделирования
зависящей от времени t и от вероятности распространения информации β: k′(t, β) = k
′
1 − β
c(β)t
, где c (β) = aβ + b – линейная функция от β.
Коэффициенты a и b были оценены эмпирически на одном из графов. a
Таким образом, мы получаем следующую систему из k
связанных
max
уравнений:
⟨k⟩
c(β)t
pki
k
,
(14)
.
max
k1 − β
∑
k
θ =
di
k
= β (1 −ik)kθ, k = 1, . .., k
dt
Алгоритм для решения данной системы уравнений может быть лег-
ко запрограммирован.
Результатырешения систем уравнений(12) и (14), а также уравнения
(2) будут представлены позже на примере реальных сетей.
3.2.2.3. Имитационная модель (агент-ориентированное моделирование, клеточный автомат)
Чтобы проверить адекватность предлагаемых ранее моделей SI на графах, рассмотрим подход, по своей сути напоминающий метод Монте-Карло. Мы будем симулировать распространение информации на сетях, используя методы агент-ориентированного моделирования. Данный подход подразумевает изучение распространения информации в сети графов с учетом поведения узлов и их влияния на соседние вершины.
Обозначим через G = (V,E) – граф социальной сети. Узлами графа (V) являются агенты (пользователи сети), которые получают информа­цию и принимают решение о её дальнейшем распространении; ребра (E) – это связи, через которые агенты обмениваются информацией.
Узлы графа могут находиться в нескольких состояниях. Эти состоя­ния, такие же, как и в моделях логистического роста, рассмотренных ранее. Например, активное состояние (I) из модели SI свидетельству­ет о том, что узел передает информацию соседним узлам. В контексте социальных сетей это означает, что пользователь публикует сообщение на своей странице, которое могут видеть его друзья или подписчики. Рас­пространение информации происходит в дискретные моменты времени. Вначале имеется набор информированных узлов графа, например, по­лучивших информацию из внешних источников. Их подписчики, делая репост сообщения, тем самым приводят к дальнейшему распростране­нию информации (т. е. активируют соседние узлы), изменяя состояние
198
Глава 3. Анализ конвергентных СМИ и социальных сетей
соседнего узла с S (восприимчивого) на I (информированный). На следу­ющем шаге рассматриваются активированные узлы с учетом предыдуще­го момента времени и происходит активация связанных с ними соседних узлов. Процесс будет продолжаться до тех пор, пока не выполнятся все возможные активации. Правила распространения информации определя­ются согласно модели независимых каскадов: на каждом шаге активиро­ванный узел v имеет только один шанс активировать неактивного соседа u с некоторой вероятностью p.

3.2.3. Тестирование моделей на реальных графах

Данный раздел будет посвящен проверке адекватности предлагае­мой нами новой модели SI на графах. Также будет рассмотрена про­гностическая сила классической модели SI (не учитывающей структуру контактной сети) и модели на графах, предложенной в работе35, в их спо­собности предсказыватьраспространение информации на графах. В каче­стве эталона будут браться симуляции агент-ориентированного модели­рования. Тестирование предлагаемых моделей будет проводиться на ре­альных социальных графах. В статье36также представлены результаты работы рассматриваемых в монографии моделей для различных типов случайных графов (Барабаши–Альберт и Эрдеша–Рейни).
Для сравнения предлагаемых в работе подходов будут рассмотре­ны следующие аппроксимирующие дифференциальные уравнения (мо­дели):
1) классическая модель SI, не учитывающая структуру сети:
di
= ⟨k⟩i (1 − i) .
dt
Для краткости назовём такую модель как «SI»;
2) модель SI на сети, предложенная в работе37:
θ =
di
(k − 1) pki
∑
k
⟨k⟩
k
= β (1 −ik)kθ, k = 1, . ..,k
dt
k
,
max
.
Для краткости назовём такую модель, как «SI on network (SI на
сети)»;
35
См.: Pastor-Satorras R., Vespignani A. Op. sit.
36
Sidorov S., Faizliev A., Tikhonova S. An Extension of the Susceptible–Infected Model and Its Application to the Analysis of Information Dissemination in Social Networks // Modelling. 2023. № 4. P. 585–599. https://doi.org/10.3390/modelling4040033
37
См.: Pastor-Satorras R., Vespignani A. Op. sit.
199
Образ СССР в фокусе математического моделирования
3) аппроксимирующая версия модели SI на графах, учитывающая из­менение числа каналов передачи информации во времени:
⟨k⟩
c(β)t
pki
k
,
.
max
k1 − β
∑
k
θ =
di
k
= β (1 −ik)kθ, k = 1, . ..,k
dt
Для краткости назовём такую модель, как «ApprSI, SI аппроксима­ция»;
4) агент-ориентированная модель. Данный подход подразумевает си­мулирование процесса распространения информации по модели SI. Для краткости назовём такую модель, как «benchmark». Будет вы­полняться по 10 симуляций. Для сравнения моделей будет использовано две метрики: l2-norm и max.
n
|
||y − x||2=
(yi− xi)2, ||y −x||∞= max
∑
i=1
1⩽i⩽n
yi− x
|
.
i
Симуляции агент-ориентированной модели усреднялись и брались в качестве эталона для расчета точности рассматриваемых моделей в дифференциальных уравнениях. В табл. 3 приводятся характери­стики рассматриваемых реальных графов для тестирования моде­лей.
Таблица 3
Характеристики реальных графов
Графы Число узлов Число ребер Плотность Средняя
Twitch Social Networks (DE)
Github-social 37 700 289 003 0.0004 15.33 2.4 Ego-Gplus 107 614 12 238 285 0.002 227.45 1.35 Large twitch 168 114 6 797 557 0.0005 80.87 2.23
9 498 153 138 0.003 32.25 2.01
степень
Показатель степенного
закона γ
Как видно из табл. 3, рассматриваемые реальные графы не похожи
друг на друга. Единственное, что их объединяет – это степенной закон распределения степеней.
В табл. 4 приводятся оценки точности моделей для реальных графов
различного размера и плотности.
Отметим, что предлагаемая нами модель «SI аппроксимация» пока-
зала хорошие результаты на реальных графах. Средняя квадратическая
200
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]