Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Образ СССР в фокусе математического моделирования опыт цифровой гуманитаристики.pdf
X
- •Оглавление
- •От редакторов
- •Введение
- •1.1. Специфика «цифровой» методологии: от атрибуции до калибровки
- •1.2. Инструментальные средства анализа информационного потока
- •1.3. Методы сентимент-анализа сообщений
- •2.1. Динамика основных кластеров советских тем в газете «Аргументы и факты»
- •2.1.1. Кластер 0 «Спорт»
- •2.1.3. Кластер 2 «Экономика»
- •2.1.2. Кластер 1 «Кинематограф»
- •2.1.4. Кластер 3 «Музыка»
- •2.1.5. Кластер 4 «Коммеморация»
- •2.1.6. Кластер 5 «Идеология»
- •2.1.7. Кластер 6 «Политика»
- •2.1.8. Кластер 7 «Образование»
- •2.1.9. Кластер 8 «Космос»
- •2.1.10. Кластер 9 «Долги и кредиты»
- •2.1.11. Кластер 10 «Продукты»
- •2.1.12. Кластер 11 «Поколение»
- •2.1.13. Кластер 12 «Война в Афганистане»
- •2.1.14. Кластер 13 «Дороги и заводы»
- •2.1.15. Кластер 14 «Разведка»
- •2.1.16. Кластер 15 «Атомный проект»
- •2.2. Динамика основных кластеров советских тем в газете «Коммерсантъ»
- •2.2.1. Кластер 1 «Спорт»
- •2.2.2. Кластер 2 «Кинематограф»
- •2.2.3. Кластер 3 «Литература»
- •2.2.4. Кластер 4 «Арт-выставки»
- •2.2.5. Кластер 5 «Вооруженные Силы»
- •2.2.6. Кластер 6 «Телепрограмма»
- •2.2.7. Кластер 7 «Музыка»
- •2.2.8. Кластер 8 «Космос»
- •2.2.9. Кластер 9 «Промышленность»
- •2.2.10. Кластер 10 «Коммеморация»
- •2.2.11. Кластер 11 «Образование»
- •2.2.12. Кластер 12 «Долги и кредиты»
- •2.2.13. Кластер 13 «Политика»
- •2.2.14. Кластер 14 «Наука»
- •2.2.15. Кластер 15 «Архитектура»
- •2.2.16. Кластер 16 «Балет»
- •2.2.17. Кластер 17 «Экономика»
- •2.2.18. Кластер 18 «Китай»
- •2.2.19. Кластер 19 «Геополитика и НАТО»
- •2.2.20. Кластер 20 «Война в Афганистане»
- •2.2.21. Кластер 21 «Разведка»
- •2.2.22. Кластер 22 «Церковь»
- •2.2.23. Кластер 23 «Германия»
- •2.2.24. Кластер 24 «Здравоохранение»
- •2.2.25. Кластер 25 «Атомный проект»
- •3.1. Намедни
- •3.1.1. Парфёнов как медиатор
- •3.1.2. НМДНИ
- •3.1.3. Классификация комментариев
- •3.2. Модели распространения информации на сетях
- •3.2.1. Модель SI, не учитывающая структуры сети
- •3.2.2. Модели распространения информации на сетях
- •3.2.2.1. Модель SI на графах (SI на сети)
- •3.2.2.2. Новая модель SI на графах (SI аппроксимация)
- •3.2.3. Тестирование моделей на реальных графах
- •3.2.4. Анализ феномена распространения медиаконтента в социальных сетях, посвященного СССР
- •3.2.4.1. Советская ностальгия как социокультурный тренд в современной России
- •3.2.4.2. Телевизионный фильм «Ирония судьбы или с легким паром!», 1975 г.
- •3.2.4.3. Мини-сериал «Чернобыль», HBO, 2019
- •3.2.4.4. Фильм «Чемпион мира», 2021 г.
- •3.2.4.5. Телесериал «Вампиры Средней зоны», 2021 г.
- •3.2.4.6. Компьютерная игра Atomic Heart от студии Mundfish, 2023 г.
- •3.2.4.7. Тестирование моделей
- •3.3. Медиаобраз СССР в измерении хештег-динамики
- •3.3.1. Методология анализа
- •3.3.2. Анализ и динамика хештега «#назадвссср»
- •Заключение
- •Список литературы
- •С в е д е н и я о б а в т о р а х

Глава 1. Инструментальные методы анализа медиапространства
3) релевантность (показывает, насколько событие, описанное
в новостномсообщении, относится к интересующему исследователя
объекту);
4) новизна (показывает, насколько новым и информативным является
данное сообщение).
Инструментальные средства анализа медиапространства нацелены
на более глубокое понимание явлений и процессов, происходящих в медиапространстве, на основе количественной оценки вышеуказанных характеристик новостных сообщений.
Очевидно, что в современном мире уровень интенсивности генера-
ции сообщений различными новостными агентствами или пользователями социальных сетей столь высок, что человек не в состоянии своими силами обработать этот информационный поток. События, потенциально
способные изменить ситуацию, могут быть потеряны или просмотрены
в огромном потоке сообщений. Именно поэтому автоматизированные
средства анализа медиапространства могут служить эффективным помощником при исследовании новостного потока в медиапространстве.
Оценка характеристик новостей в виде количественных значений
дает возможность их применения в математических моделях медиапотока. Зачастую процесс анализа новостей носит автоматический характер
и включает следующие шаги:
1) отбор новостных сообщений в режиме реального времени из различных ресурсов,
2) предварительный анализ текстовых сообщений,
3) оценка ожиданий, вызванных публикацией новости, на основе текущей ситуации,
4) создание и применение количественных моделей.
Охарактеризуем эти шаги более подробно.
Новости могут быть извлечены из потока, генерируемого различны-
ми источниками:
1) новостные ресурсы информационных агентств. Традиционные медиа до сравнительно недавнего времени распространяли свои сообщения, используя печатные ресурсы, радио, телевидение. Заметим,
что это затрудняло получение общей картины новостного потока.
Однако современные медиа и информационные агентства перенесли публикацию своих новостей и сообщений в сеть Интернет, что
повлияло на процесс отслеживания, сбора и анализа единиц новостного потока. Более того, наличие тегов и индексирования новостей
сделало возможной их автоматизированную обработку в режиме
реального времени;
21

Образ СССР в фокусе математического моделирования
2) предварительныеновости или материалы из первичных источников.
Предварительные новости представляет собой сырой, необработанный материал, который журналисты и медиа могут применять при
написании текста новостного сообщения. Такой материал часто получается на основе анализа первичных источников, например текстов принимаемых указов, законов, отчетов ЦБ или счетной палаты, судебных документов, отчетов различных правительственных
агентств, корпоративных ресурсов, компаний, анонсов, индустриальной и макроэкономической статистики;
3) социальные сети и информационные площадки (блоги, форумы, со-
циальные сети, видеохосты и т. п.). Очевидно, что качество размещенных в социальных сетях сообщений должно тщательно проверяться из-за большого количества фейковых новостей, и большее количество таких сообщений не являются достоверными. Однако они
дают исследователю возможность изучать и анализировать общее
настроение большого количества однотипных сообщений, строить
характеристики настроений социума на основе анализа лайков или
дизлайков, оценок интереса к той или иной теме сообщений и т. п.,
а также использовать результаты моделирования для анализа трендов.
Сентимент-анализ (анализ настроений, или интеллектуальный ана-
лиз мнений) определяется как задача поиска мнений авторов о конкретных объектах. Общая архитектура общей системы анализа настроений
выглядит следующим образом. Прежде чем приступить к классификации
текстов и определению их настроения, необходимо провести их предобработку. Под текстом понимается одна строка из алфавитных и неалфавитных символов. Заметим, что обрабатывать его в таком виде неудобно,
поэтому на начальном этапе необходимо выделить числовые признаки,
для чего данные приводятся к удобному виду и нормализуются. Для
заданной коллекции текстовых документов предобработка осуществляется следующим образом: осуществляется токенизация, затем все слова
приводятся к нижнему регистру, далее удаляются стоп-слова и знаки
пунктуации, происходит фильтрация слов по частоте / длине / регулярному выражению, и наконец, осуществляется процесс лемматизации (стемминг).
Новостная аналитика измеряет релевантность, характер, новизну
и весомость новости. Обработанные новости превращаются из текстовой
информации в статистические данные, на основе которых анализируются взаимоотношения различных новостей (их взаимная корреляция). По-
22

Глава 1. Инструментальные методы анализа медиапространства
тому время выхода новости при осуществлении такого анализа является
важным.
1.3. Методы сентимент-анализа сообщений
Одна из важных задач, которые подлежат решению при разработке
системы автоматизированного анализа новостного потока, состоит в получении количественной оценки сообщений. Другими словами, необходимо на основании содержания новостного сообщения (текста новости)
найти некоторую количественную оценку, которая отражает контекст
упоминания объекта в новости (положительное, нейтральное или негативное), что соответствует ожиданиям относительно объекта, которые
связаны с этой новостью или вызваны ее появлением12.
Самая простая формулировка этой проблемы состоит в оценке смысла новости на основе бинарной классификации (положительная / негативная). Более сложные формулировки могут включать использование
шкалы положительности / негативности, что дает более дифференцируемую оценку ожиданий, связанных с сообщением.
Чтобы осуществить эту классификацию, необходимо проанализировать контекст и текст новости, ее эмоциональное содержание, т. е.
интерпретацию новости читателями в терминах положительного или
негативного восприятия. Количественная оценка эмоционального наполнения сообщения может проводиться с использованием экспертов и/или
психологических словарей. Однако это не исключает конфликта интерпретаций между различными экспертами.
Для оценки ожиданий, связанных с новостью, можно использовать
следующие два достаточно простых подхода. Первый из них вычисляет
некоторый индекс, базирующийся на поведении пользователей социальных сетей13, а именно вычисляется индекс DISAG расхождения в оценке
сообщения
DISAG
B−S
B + S
,
=
1 −
где B – число лайков или положительных комментариев, а S – число
дизлайков или негативных комментариев к сообщению социальной се-
12
См.: Liu B. Sentiment Analysis…
13
См.: Lavrenko V., Schmill M., Lawrie D., Ogilvie P., Jensen D., Allan J. Language models
for financial news recommendation // Proceedings of the Ninth International Conference on
Information and Knowledge Management. McLean, Virginia, United States, 2000. P. 389–396.
23

Образ СССР в фокусе математического моделирования
ти. Тогда DISAG=0 означает, что среди пользователей нет разногласия,
в то время как DISAG=1 означает полное разногласие.
Второй подход к определению ожиданий относительно данной новости состоит в использовании методов машинного обучения и методов
обработки естественного языка, в результате чего рассчитывается индекс
ожиданий.
В частности, для классификации текстов используются многие модели машинного обучения, среди которых наивный байесовский классификатор, логистическая регрессия, композиции деревьев решений, полносвязные нейросети, свёрточные нейросети, а также рекуррентные нейросети.
Для оценки индекса ожиданий, связанныхс новостным сообщением,
применяются следующие методы14:
1) примитивный классификатор, самый простой из алгоритмов, считает количество положительных и отрицательных коннотаций слов.
Если разность между этими величинами больше (или меньше) некоторого порогового значения, то новость считается положительной
(или негативной), в иных случаях – нейтральной;
2) метод классификации сообщений на основе вычисления векторно-
го расстояния основан на том, что используется многомерное пространство, осями которого являются слова лексикона. Задается также множестве обучающих примеров (сообщений), для которых заранее известна их принадлежность к одному из классов (позитивное,
негативное или нейтральное). В процессе своей работы алгоритм
находит скалярное произведение между новым сообщением и всеми сообщениями из множества обучающих примеров и определяет
новое сообщение в тот класс, к которому это сообщение наиболее
близко в смысле векторного расстояния;
3) дискриминантный классификатор основан на предварительно установленных весовых значениях для каждого слова лексикона. Далее
классификатор считает значение настроения сообщения как сумму
весов слов лексикона, входящих в это сообщение (взвешенный подсчет). Для оценки веса для слова лексикона применяется обучающее
множество сообщений, для каждого из которых известно, к какому
из классов (нейтральное, отрицательное, положительное) оно принадлежит;
4) классификатор фраз прилагательное-наречиеоснован на томфакте,
что фразы, использующие прилагательные и наречия, акцентируют
14
См.: Liu B. Sentiment Analysis…
24

Глава 1. Инструментальные методы анализа медиапространства
ожидания и имеют больший вес. Этот метод считает слова из лексикона в новостном сообщении, но учитывает только те из них,
которые идут совместно с прилагательными или наречиями;
5) другим распространенным методом является байесовский классифи-
катор, в котором новостное сообщение приписывается тому классу,
вероятность принадлежать которому больше.
В настоящее время во многих языках программирования разработа-
ны библиотеки подпрограмм, предназначенные для выполнения задач,
связанных с анализом текстов (text mining). Невозможно рассказать обо
всех из них, поэтому упомянем лишь библиотеки tm (язык R) и spaCy
(язык Python):
1) библиотека tm для работы на языке программирования R обладает
рядом функций, предназначенных для проведения интеллектуального анализа текстов. Эта библиотека содержит методы импорта данных, обработки корпуса текстов, предварительной обработки текстовых фрагментов, управления метаданными и создания матриц
терминов и документов15;
2) spaCy – это бесплатная библиотека с открытым исходным кодом, написанным на языке Python, с множеством встроенных возможностей
для обработки естественного языка (Natural Language Processing –
NLP). Эта библиотека является одной из самых популярных инструментов, предназначенных для решения задач обработки и анализа текстовых данных. Пакет подпрограмм содержит функции обработки естественного языка, включая инструменты предварительной
обработки и очистки текстовых данных. Кроме того, он содержит
средства токенизации, удаления стоп-слов, нормализации слов, векторизации текста16. Важной частью функциональных возможностей
является использование классификаторов машинного обучения для
прогнозирования настроений.
Еще одна важная тенденция последнего времени – появление аг-
регаторов новостного потока, создание полномасштабных баз новостей
и публикаций за большой промежуток времени. Такие агрегаторы являются результатом работы коллективов крупных медиаресурсов и медиакомпаний и могут предоставлять ограниченно бесплатный доступ для
исследователей.
15
См.: Feinerer H., Hornik K., Meyer D. Text mining infrastructure in R // Journal of Statistical
Software. 2008. Vol. 25, № 5. P. 1–54.
16
См.: Neumann M., King D., Beltagy I., Ammar W. ScispaCy: Fast and Robust Models for
Biomedical Natural Language Processing // Proceedings ofthe 18th BioNLP Workshop and Shared
Task. Florence, Italy : Association for Computational Linguistics, 2019. P. 319–327.
25

Образ СССР в фокусе математического моделирования
Одним из таких амбициозных проектов является GDELT (Глобальная база данных событий, языка и тональности), созданный Джорджтаунским университетом на основе использования разработок Google
17
GDELT отслеживает и собирает в режиме реального времени все онлайнновости, автоматически переводит их на английский язык и кодирует
каждую новостную статью по теме, настроению и тональности, местоположению и объектам (организациям и лицам). Этот процесс использует алгоритмы анализа текстов (text mining), поддерживаемые Google
Cloud, при этом генерирутся более 1 триллиона различных записей данных в год.
.
17
См.: Leetar K., Schrodt P. A. Gdelt: Global data on events, location and tone, 1979–2012 //
Technical report. KOF Working Papers, 2013.

Г л а в а 2
АНАЛИЗ КЛАССИЧЕСКИХ СМИ:
ЦИФРОВЫЕ АРХИВЫ ГАЗЕТ
Сайты современной массовой периодики, как правило, включают
в себя архивы, отражающие историю перехода от печати к цифре. В наши дни цифровые версии номеров опережают выход печатных версий
либо выходят одномоментно с ними, цифровая версия может быть более
широкой, нежели печатная, включать в себя дополнительные материалы
и обрамляться блогами. Тем не менее, доминируетподход, в которомсайт
издания рассматривается как «зеркало» бумажных тиражей. Если издание существует с советских времен, то в архив вносятся оцифрованные
и распознанные выпуски доинтернетной эпохи. С точкизрения форматов
представления материалов разница в анализе доцифровых и цифровых
изданий в настоящее время не фиксируется.
2.1. Динамика основных кластеров советских тем в газете «Аргументы и факты»
Цель исследования: по результатам текстов статей в одном из круп-
нейших периодических изданий России «Аргументы и факты», далее
«АиФ»1, сочетающем бумажные тиражи с электронными, подобрать пуб-
ликации, затрагивающие советский период, автоматически отнести отобранные статьи к той или иной тематической группе, обеспечивая репре-
1
Крупнейшая еженедельная общественно-политическая газета России, основана
в 1978 г. как советский информационный бюллетень. Тираж – более 1,5 млн экземпляров.
Сайт газеты основан в 1997 г. Является одним из самых популярных российских изданий
за рубежом. В 1990 г. вошла в книгу рекордов Гиннеса за самый большой тираж в истории
человечества – 33 441 100 экземпляров с числом читателей свыше 100 млн. В 2013 г.
сайт «АиФ» вошел в топ-10 самых популярных ресурсов в категории «Новости и СМИ».
Основные рубрики: новости, общество, деньги, культура, спорт, почти в каждом номере
присутствуют статьи с политической пропагандой. Ядро аудитории: читатели 38–65 лет.
В основном это руководители, чиновники, рабочие, военные, фермеры и пенсионеры.
27

Образ СССР в фокусе математического моделирования
зентацию полученных данных в удобном для дальнейшего исследования
виде и проинтерпретировать их.
Использовались следующие виды методов: поиск и парсинг информации, предварительная обработка информации, отбор документов, извлечение информации, применение методов Texting mining, интерпретация результатов. Исходные данные – архив статей еженедельной газеты
«Аргументы и факты» https://aif.ru/gazeta/archive/edition/I, включающий
публикации с 1983 по 2022 гг. при периодичности газеты в 52 (54) выпуска в год. Предварительная обработка текста включала следующие операции: приведение регистра (все буквы приводятся к строчным), удаление
знаков препинания и цифр, приведение каждого слова к нормальной
форме (лематизия или стэмминг), удаление стоп-слов (часто встречающиеся слова – союзы, предлоги, вводные слова), сужение рамок периода –
нижняя планка была поднята до января 1992 г., верхняя определена как
июль 2022 г.
В качестве критерия отбора статей использовалось наличие в их тексте одного из слов (терминов анализа) «СССР» или «советский», а также
биграмм «советский союз», «союз советский», «советское государство»,
«советская власть», «советское время» и т. п. Они употреблялись в 17%
статей (0,06% терминов). Отобрано было более 12 000 статей, из них
в 9 000 встречался термин «СССР», почти в 7 000 – термин «советский»,
в целом это каждая 6-я статья.
Формат газеты «АиФ» менялся во времени, в 2008–2009 гг. менялось число полос в газете, что привело к увеличению числа статей и слов,
и соответственно, числа изучаемых терминов. Для отображения этого
роста была представлена относительная частота упоминаний.
Для дальнейшего анализа выбирались не статьи целиком, а их фрагменты – ближайшее окружение ±20 слов от изучаемого термина.
На следующем этапе использовался алгоритм тематического моделирования, а именно, метод машинного обучения, который позволяет
анализировать корпуса документов, обнаруживать шаблоны слов и фраз,
которые встречаются чаще всего и тем самым лучше характеризуют корпус, и автоматически группировать термины, близкие по встречаемости
в документах, и документы, в которых встречаются близкие по смыслу термины. Область тематического моделирования развивается очень
быстро, и в литературе, и в пакетах программ можно встретить более
трех десятков различных методик, которые предназначены для решения
задач такого типа (Latent Dirichlet Allocation, Latent Semantic Analysis,
Probabilistic Latent Semantic Analysis, Non-negative Matrix Factorization,
Ida2vec, BERTopic и др.). После тестирования нескольких из них наибо-
28

Глава 2. Анализ классических СМИ: цифровые архивы газет
лее перспективными были сочтены результаты, полученные с помощью
методики BERTopic, которая и применялась дальше.
BERTopic – Bidirectional Encoder Representations from Transformer
Topic, относится к типу Toping Modeling и представляет собой пакет программ, компьютерную библиотеку, которая активно использует нейросетевые технологии на этапе перевода текстовой информации в числовую.
Основные этапы методики:векторизация текста, кластеризация документов, описание тем, максимизация предельной релевантности. По предварительному, очень объемному массиву документов (более 50 млн англоязычных статей) настраивается так называемая языковая модель. Результатом работы последней является преобразование в числовой вектор,
набор чисел, который тем или иным образом характеризует изучаемый
текст (векторизация, ключевой для успешности методики этап). Этапы
кластеризации и описания более или менее одинаковы в большинстве
программ. По умолчанию библиотека BERTopic применяет для векторизации предварительно обученную нейросеть, предназначенную более
чем для 52 языков, включая русский.
После того как каждый текст был представлен в числовом виде,
он рассматривался как числовой вектор очень большой размерности.
Полученные векторы снижались с помощью специализированного
алгоритма нелинейного снижения размерности UMAP (Uniform
Manifold Approximation and Projection). В итоге возможен переход
от нескольких сотен или тысяч чисел к характеристике их через 4–
5 чисел. После этого применяется один из доступных алгоритмов
кластеризации. В библиотеке BERTopic для этой цели по умолчанию
используется алгоритм hdbscan, часто применяющийся в анализе
данных. Он позволяет выделить в интересующем пользователя
множестве объектов группы, или кластеры / темы, таким образом,
что документы, попавшие в темы, схожи друг с другом, а документы
из разных тем различаются. Число кластеров не задается пользователем,
а зависит от выбора параметров. При этом не все документы могут
быть отнесены к темам. Если они не похожи ни на один из кластеров,
они объявляются шумом и остаются нераспознанными. Результатом
является разбиение на кластеры (темы). Было выделено 95 кластеров,
для этого классифицированы 5757 статей, не отнесены к темам
6613 статей. Критерием кластеризации выступал размер темы
(число отнесенных к ней документов), минимальное количество –
10 документов, максимальное – несколько сотен.
Описание тем предполагает возвращение от чисел к терминам.
По мнению авторов, термин хорошо характеризует тему, если он в
29

Образ СССР в фокусе математического моделирования
рамках документов, к ней относящихся, встречается часто, а в других
темах – редко. Соответственно, использовалось сравнение частоты
появления термина в рамках одной темы и частоты его встречаемости
во всем корпусе. Этот подход применяется к так называемому
«мешку слов», т. е. анализируется не отдельный документ, а все
документы, относящиеся к одной теме. В результате были получены
термины, наиболее часто встречающиеся в рамках каждой темы. Темы
по умолчанию нумеруются с 0.
Для проверки работы алгоритма случайно выбирались контрольные
статьи в каждой теме и их содержание рассматривалось традиционным
способом. Чтение показало соответствие отобранных машинным методом терминов смыслу статей.
Библиотека позволяет установить, насколько темы похожи друг
на друга и на этом основании объединить число кластеров без потери
разнообразия. Таким способом 95 кластеров можно свести к 16 крупным
тематическим блокам. Для этого предложен алгоритм иерархического
объединения, который позволяет выбрать уровень, на котором число тем
окажется соответствующим интересам пользователя. Можно учитывать
расположение всех документов в тематическом пространстве.
Также учитывалось различие упоминания терминов по годам – как
часто статьи с конкретной темой появлялись в издании в разные годы,
какие термины использовались внутри темы и какиетемы превалировали.
Особое внимание уделялось выделению внутри темы специфических
терминов.
Для отображения специфики был применен подход мешка слов,
но не в разрезе тем, а в разрезе годов. Было отобрано 950 терминов,
которые наиболее часто встречаются в 95 кластерах. Их дополнительно
проредили, оставили те, которые встречались достаточно часто (не менее
50 раз). После этого устанавливались термины, которые встречались
часто в отдельные годы по критерию относительной частоты.
2.1.1. Кластер 0 «Спорт»
Специфической чертой еженедельной газеты «Аргументы и факты» является отсутствие рубрикации на тематические блоки, то есть нет,
например, разделов «Спорт» или «Культура», характерных для многих
ежедневных газет. Такое положение дел, с одной стороны, затрудняет,
так сказать, выделение информационных кластеров, но, с другой стороны, позволяет увидеть доли обозначенных с помощью математических
расчетов кластеров в общем объеме текста от номера к номеру, от года
к году и так далее. Кластер «Спорт» в этом отношении оказывается
30
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
