Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:
Образ СССР в фокусе математического моделирования опыт цифровой гуманитаристики.pdf
Скачиваний:
0
Добавлен:
07.09.2026
Размер:
2 Мб
Скачать
☆
Глава 1. Инструментальные методы анализа медиапространства
3) релевантность (показывает, насколько событие, описанное в новостномсообщении, относится к интересующему исследователя объекту);
4) новизна (показывает, насколько новым и информативным является данное сообщение). Инструментальные средства анализа медиапространства нацелены
на более глубокое понимание явлений и процессов, происходящих в ме­диапространстве, на основе количественной оценки вышеуказанных ха­рактеристик новостных сообщений.
Очевидно, что в современном мире уровень интенсивности генера-
ции сообщений различными новостными агентствами или пользователя­ми социальных сетей столь высок, что человек не в состоянии своими си­лами обработать этот информационный поток. События, потенциально способные изменить ситуацию, могут быть потеряны или просмотрены в огромном потоке сообщений. Именно поэтому автоматизированные средства анализа медиапространства могут служить эффективным по­мощником при исследовании новостного потока в медиапространстве.
Оценка характеристик новостей в виде количественных значений
дает возможность их применения в математических моделях медиапото­ка. Зачастую процесс анализа новостей носит автоматический характер и включает следующие шаги:
1) отбор новостных сообщений в режиме реального времени из различ­ных ресурсов,
2) предварительный анализ текстовых сообщений,
3) оценка ожиданий, вызванных публикацией новости, на основе теку­щей ситуации,
4) создание и применение количественных моделей. Охарактеризуем эти шаги более подробно. Новости могут быть извлечены из потока, генерируемого различны-
ми источниками:
1) новостные ресурсы информационных агентств. Традиционные ме­диа до сравнительно недавнего времени распространяли свои сооб­щения, используя печатные ресурсы, радио, телевидение. Заметим, что это затрудняло получение общей картины новостного потока. Однако современные медиа и информационные агентства перенес­ли публикацию своих новостей и сообщений в сеть Интернет, что повлияло на процесс отслеживания, сбора и анализа единиц новост­ного потока. Более того, наличие тегов и индексирования новостей сделало возможной их автоматизированную обработку в режиме реального времени;
21
Образ СССР в фокусе математического моделирования
2) предварительныеновости или материалы из первичных источников. Предварительные новости представляет собой сырой, необработан­ный материал, который журналисты и медиа могут применять при написании текста новостного сообщения. Такой материал часто по­лучается на основе анализа первичных источников, например тек­стов принимаемых указов, законов, отчетов ЦБ или счетной пала­ты, судебных документов, отчетов различных правительственных агентств, корпоративных ресурсов, компаний, анонсов, индустри­альной и макроэкономической статистики;
3) социальные сети и информационные площадки (блоги, форумы, со- циальные сети, видеохосты и т. п.). Очевидно, что качество разме­щенных в социальных сетях сообщений должно тщательно прове­ряться из-за большого количества фейковых новостей, и большее ко­личество таких сообщений не являются достоверными. Однако они дают исследователю возможность изучать и анализировать общее настроение большого количества однотипных сообщений, строить характеристики настроений социума на основе анализа лайков или дизлайков, оценок интереса к той или иной теме сообщений и т. п., а также использовать результаты моделирования для анализа трен­дов. Сентимент-анализ (анализ настроений, или интеллектуальный ана-
лиз мнений) определяется как задача поиска мнений авторов о конкрет­ных объектах. Общая архитектура общей системы анализа настроений выглядит следующим образом. Прежде чем приступить к классификации текстов и определению их настроения, необходимо провести их предоб­работку. Под текстом понимается одна строка из алфавитных и неалфа­витных символов. Заметим, что обрабатывать его в таком виде неудобно, поэтому на начальном этапе необходимо выделить числовые признаки, для чего данные приводятся к удобному виду и нормализуются. Для заданной коллекции текстовых документов предобработка осуществля­ется следующим образом: осуществляется токенизация, затем все слова приводятся к нижнему регистру, далее удаляются стоп-слова и знаки пунктуации, происходит фильтрация слов по частоте / длине / регулярно­му выражению, и наконец, осуществляется процесс лемматизации (стем­минг).
Новостная аналитика измеряет релевантность, характер, новизну
и весомость новости. Обработанные новости превращаются из текстовой информации в статистические данные, на основе которых анализируют­ся взаимоотношения различных новостей (их взаимная корреляция). По-
22
Глава 1. Инструментальные методы анализа медиапространства
тому время выхода новости при осуществлении такого анализа является важным.

1.3. Методы сентимент-анализа сообщений

Одна из важных задач, которые подлежат решению при разработке системы автоматизированного анализа новостного потока, состоит в по­лучении количественной оценки сообщений. Другими словами, необхо­димо на основании содержания новостного сообщения (текста новости) найти некоторую количественную оценку, которая отражает контекст упоминания объекта в новости (положительное, нейтральное или нега­тивное), что соответствует ожиданиям относительно объекта, которые связаны с этой новостью или вызваны ее появлением12.
Самая простая формулировка этой проблемы состоит в оценке смыс­ла новости на основе бинарной классификации (положительная / нега­тивная). Более сложные формулировки могут включать использование шкалы положительности / негативности, что дает более дифференцируе­мую оценку ожиданий, связанных с сообщением.
Чтобы осуществить эту классификацию, необходимо проанализи­ровать контекст и текст новости, ее эмоциональное содержание, т. е. интерпретацию новости читателями в терминах положительного или негативного восприятия. Количественная оценка эмоционального напол­нения сообщения может проводиться с использованием экспертов и/или психологических словарей. Однако это не исключает конфликта интер­претаций между различными экспертами.
Для оценки ожиданий, связанных с новостью, можно использовать следующие два достаточно простых подхода. Первый из них вычисляет некоторый индекс, базирующийся на поведении пользователей социаль­ных сетей13, а именно вычисляется индекс DISAG расхождения в оценке сообщения
DISAG
B−S B + S
,
=
1 −
где B – число лайков или положительных комментариев, а S – число дизлайков или негативных комментариев к сообщению социальной се-
12
См.: Liu B. Sentiment Analysis…
13
См.: Lavrenko V., Schmill M., Lawrie D., Ogilvie P., Jensen D., Allan J. Language models for financial news recommendation // Proceedings of the Ninth International Conference on Information and Knowledge Management. McLean, Virginia, United States, 2000. P. 389–396.
23
Образ СССР в фокусе математического моделирования
ти. Тогда DISAG=0 означает, что среди пользователей нет разногласия, в то время как DISAG=1 означает полное разногласие.
Второй подход к определению ожиданий относительно данной но­вости состоит в использовании методов машинного обучения и методов обработки естественного языка, в результате чего рассчитывается индекс ожиданий.
В частности, для классификации текстов используются многие мо­дели машинного обучения, среди которых наивный байесовский класси­фикатор, логистическая регрессия, композиции деревьев решений, пол­носвязные нейросети, свёрточные нейросети, а также рекуррентные ней­росети.
Для оценки индекса ожиданий, связанныхс новостным сообщением, применяются следующие методы14:
1) примитивный классификатор, самый простой из алгоритмов, счи­тает количество положительных и отрицательных коннотаций слов. Если разность между этими величинами больше (или меньше) неко­торого порогового значения, то новость считается положительной
(или негативной), в иных случаях – нейтральной;
2) метод классификации сообщений на основе вычисления векторно- го расстояния основан на том, что используется многомерное про­странство, осями которого являются слова лексикона. Задается так­же множестве обучающих примеров (сообщений), для которых зара­нее известна их принадлежность к одному из классов (позитивное, негативное или нейтральное). В процессе своей работы алгоритм находит скалярное произведение между новым сообщением и все­ми сообщениями из множества обучающих примеров и определяет новое сообщение в тот класс, к которому это сообщение наиболее близко в смысле векторного расстояния;
3) дискриминантный классификатор основан на предварительно уста­новленных весовых значениях для каждого слова лексикона. Далее классификатор считает значение настроения сообщения как сумму весов слов лексикона, входящих в это сообщение (взвешенный под­счет). Для оценки веса для слова лексикона применяется обучающее множество сообщений, для каждого из которых известно, к какому из классов (нейтральное, отрицательное, положительное) оно при­надлежит;
4) классификатор фраз прилагательное-наречиеоснован на томфакте, что фразы, использующие прилагательные и наречия, акцентируют
14
См.: Liu B. Sentiment Analysis…
24
Глава 1. Инструментальные методы анализа медиапространства
ожидания и имеют больший вес. Этот метод считает слова из лек­сикона в новостном сообщении, но учитывает только те из них, которые идут совместно с прилагательными или наречиями;
5) другим распространенным методом является байесовский классифи- катор, в котором новостное сообщение приписывается тому классу, вероятность принадлежать которому больше. В настоящее время во многих языках программирования разработа-
ны библиотеки подпрограмм, предназначенные для выполнения задач, связанных с анализом текстов (text mining). Невозможно рассказать обо всех из них, поэтому упомянем лишь библиотеки tm (язык R) и spaCy (язык Python):
1) библиотека tm для работы на языке программирования R обладает рядом функций, предназначенных для проведения интеллектуально­го анализа текстов. Эта библиотека содержит методы импорта дан­ных, обработки корпуса текстов, предварительной обработки тек­стовых фрагментов, управления метаданными и создания матриц терминов и документов15;
2) spaCy – это бесплатная библиотека с открытым исходным кодом, на­писанным на языке Python, с множеством встроенных возможностей для обработки естественного языка (Natural Language Processing – NLP). Эта библиотека является одной из самых популярных инстру­ментов, предназначенных для решения задач обработки и анали­за текстовых данных. Пакет подпрограмм содержит функции обра­ботки естественного языка, включая инструменты предварительной обработки и очистки текстовых данных. Кроме того, он содержит средства токенизации, удаления стоп-слов, нормализации слов, век­торизации текста16. Важной частью функциональных возможностей является использование классификаторов машинного обучения для прогнозирования настроений. Еще одна важная тенденция последнего времени – появление аг-
регаторов новостного потока, создание полномасштабных баз новостей и публикаций за большой промежуток времени. Такие агрегаторы явля­ются результатом работы коллективов крупных медиаресурсов и медиа­компаний и могут предоставлять ограниченно бесплатный доступ для исследователей.
15
См.: Feinerer H., Hornik K., Meyer D. Text mining infrastructure in R // Journal of Statistical
Software. 2008. Vol. 25, № 5. P. 1–54.
16
См.: Neumann M., King D., Beltagy I., Ammar W. ScispaCy: Fast and Robust Models for Biomedical Natural Language Processing // Proceedings ofthe 18th BioNLP Workshop and Shared Task. Florence, Italy : Association for Computational Linguistics, 2019. P. 319–327.
25
Образ СССР в фокусе математического моделирования
Одним из таких амбициозных проектов является GDELT (Глобаль­ная база данных событий, языка и тональности), созданный Джорджта­унским университетом на основе использования разработок Google
17
GDELT отслеживает и собирает в режиме реального времени все онлайн­новости, автоматически переводит их на английский язык и кодирует каждую новостную статью по теме, настроению и тональности, место­положению и объектам (организациям и лицам). Этот процесс исполь­зует алгоритмы анализа текстов (text mining), поддерживаемые Google Cloud, при этом генерирутся более 1 триллиона различных записей дан­ных в год.
.
17
См.: Leetar K., Schrodt P. A. Gdelt: Global data on events, location and tone, 1979–2012 //
Technical report. KOF Working Papers, 2013.
Г л а в а 2
АНАЛИЗ КЛАССИЧЕСКИХ СМИ:
ЦИФРОВЫЕ АРХИВЫ ГАЗЕТ
Сайты современной массовой периодики, как правило, включают в себя архивы, отражающие историю перехода от печати к цифре. В на­ши дни цифровые версии номеров опережают выход печатных версий либо выходят одномоментно с ними, цифровая версия может быть более широкой, нежели печатная, включать в себя дополнительные материалы и обрамляться блогами. Тем не менее, доминируетподход, в которомсайт издания рассматривается как «зеркало» бумажных тиражей. Если изда­ние существует с советских времен, то в архив вносятся оцифрованные и распознанные выпуски доинтернетной эпохи. С точкизрения форматов представления материалов разница в анализе доцифровых и цифровых изданий в настоящее время не фиксируется.

2.1. Динамика основных кластеров советских тем в газете «Аргументы и факты»

Цель исследования: по результатам текстов статей в одном из круп-
нейших периодических изданий России «Аргументы и факты», далее
«АиФ»1, сочетающем бумажные тиражи с электронными, подобрать пуб-
ликации, затрагивающие советский период, автоматически отнести ото­бранные статьи к той или иной тематической группе, обеспечивая репре-
1
Крупнейшая еженедельная общественно-политическая газета России, основана в 1978 г. как советский информационный бюллетень. Тираж – более 1,5 млн экземпляров. Сайт газеты основан в 1997 г. Является одним из самых популярных российских изданий за рубежом. В 1990 г. вошла в книгу рекордов Гиннеса за самый большой тираж в истории человечества – 33 441 100 экземпляров с числом читателей свыше 100 млн. В 2013 г. сайт «АиФ» вошел в топ-10 самых популярных ресурсов в категории «Новости и СМИ». Основные рубрики: новости, общество, деньги, культура, спорт, почти в каждом номере присутствуют статьи с политической пропагандой. Ядро аудитории: читатели 38–65 лет. В основном это руководители, чиновники, рабочие, военные, фермеры и пенсионеры.
27
Образ СССР в фокусе математического моделирования
зентацию полученных данных в удобном для дальнейшего исследования виде и проинтерпретировать их.
Использовались следующие виды методов: поиск и парсинг инфор­мации, предварительная обработка информации, отбор документов, из­влечение информации, применение методов Texting mining, интерпрета­ция результатов. Исходные данные – архив статей еженедельной газеты
«Аргументы и факты» https://aif.ru/gazeta/archive/edition/I, включающий
публикации с 1983 по 2022 гг. при периодичности газеты в 52 (54) выпус­ка в год. Предварительная обработка текста включала следующие опера­ции: приведение регистра (все буквы приводятся к строчным), удаление знаков препинания и цифр, приведение каждого слова к нормальной форме (лематизия или стэмминг), удаление стоп-слов (часто встречаю­щиеся слова – союзы, предлоги, вводные слова), сужение рамок периода – нижняя планка была поднята до января 1992 г., верхняя определена как июль 2022 г.
В качестве критерия отбора статей использовалось наличие в их тек­сте одного из слов (терминов анализа) «СССР» или «советский», а также биграмм «советский союз», «союз советский», «советское государство»,
«советская власть», «советское время» и т. п. Они употреблялись в 17%
статей (0,06% терминов). Отобрано было более 12 000 статей, из них в 9 000 встречался термин «СССР», почти в 7 000 – термин «советский», в целом это каждая 6-я статья.
Формат газеты «АиФ» менялся во времени, в 2008–2009 гг. меня­лось число полос в газете, что привело к увеличению числа статей и слов, и соответственно, числа изучаемых терминов. Для отображения этого роста была представлена относительная частота упоминаний.
Для дальнейшего анализа выбирались не статьи целиком, а их фраг­менты – ближайшее окружение ±20 слов от изучаемого термина.
На следующем этапе использовался алгоритм тематического моде­лирования, а именно, метод машинного обучения, который позволяет анализировать корпуса документов, обнаруживать шаблоны слов и фраз, которые встречаются чаще всего и тем самым лучше характеризуют кор­пус, и автоматически группировать термины, близкие по встречаемости в документах, и документы, в которых встречаются близкие по смыс­лу термины. Область тематического моделирования развивается очень быстро, и в литературе, и в пакетах программ можно встретить более трех десятков различных методик, которые предназначены для решения задач такого типа (Latent Dirichlet Allocation, Latent Semantic Analysis, Probabilistic Latent Semantic Analysis, Non-negative Matrix Factorization, Ida2vec, BERTopic и др.). После тестирования нескольких из них наибо-
28
Глава 2. Анализ классических СМИ: цифровые архивы газет
лее перспективными были сочтены результаты, полученные с помощью методики BERTopic, которая и применялась дальше.
BERTopic – Bidirectional Encoder Representations from Transformer Topic, относится к типу Toping Modeling и представляет собой пакет про­грамм, компьютерную библиотеку, которая активно использует нейросе­тевые технологии на этапе перевода текстовой информации в числовую. Основные этапы методики:векторизация текста, кластеризация докумен­тов, описание тем, максимизация предельной релевантности. По пред­варительному, очень объемному массиву документов (более 50 млн ан­глоязычных статей) настраивается так называемая языковая модель. Ре­зультатом работы последней является преобразование в числовой вектор, набор чисел, который тем или иным образом характеризует изучаемый текст (векторизация, ключевой для успешности методики этап). Этапы кластеризации и описания более или менее одинаковы в большинстве программ. По умолчанию библиотека BERTopic применяет для векто­ризации предварительно обученную нейросеть, предназначенную более чем для 52 языков, включая русский.
После того как каждый текст был представлен в числовом виде, он рассматривался как числовой вектор очень большой размерности. Полученные векторы снижались с помощью специализированного алгоритма нелинейного снижения размерности UMAP (Uniform Manifold Approximation and Projection). В итоге возможен переход от нескольких сотен или тысяч чисел к характеристике их через 4– 5 чисел. После этого применяется один из доступных алгоритмов кластеризации. В библиотеке BERTopic для этой цели по умолчанию используется алгоритм hdbscan, часто применяющийся в анализе данных. Он позволяет выделить в интересующем пользователя множестве объектов группы, или кластеры / темы, таким образом, что документы, попавшие в темы, схожи друг с другом, а документы из разных тем различаются. Число кластеров не задается пользователем, а зависит от выбора параметров. При этом не все документы могут быть отнесены к темам. Если они не похожи ни на один из кластеров, они объявляются шумом и остаются нераспознанными. Результатом является разбиение на кластеры (темы). Было выделено 95 кластеров, для этого классифицированы 5757 статей, не отнесены к темам 6613 статей. Критерием кластеризации выступал размер темы (число отнесенных к ней документов), минимальное количество – 10 документов, максимальное – несколько сотен.
Описание тем предполагает возвращение от чисел к терминам. По мнению авторов, термин хорошо характеризует тему, если он в
29
Образ СССР в фокусе математического моделирования
рамках документов, к ней относящихся, встречается часто, а в других темах – редко. Соответственно, использовалось сравнение частоты появления термина в рамках одной темы и частоты его встречаемости во всем корпусе. Этот подход применяется к так называемому
«мешку слов», т. е. анализируется не отдельный документ, а все
документы, относящиеся к одной теме. В результате были получены термины, наиболее часто встречающиеся в рамках каждой темы. Темы по умолчанию нумеруются с 0.
Для проверки работы алгоритма случайно выбирались контрольные статьи в каждой теме и их содержание рассматривалось традиционным способом. Чтение показало соответствие отобранных машинным мето­дом терминов смыслу статей.
Библиотека позволяет установить, насколько темы похожи друг на друга и на этом основании объединить число кластеров без потери разнообразия. Таким способом 95 кластеров можно свести к 16 крупным тематическим блокам. Для этого предложен алгоритм иерархического объединения, который позволяет выбрать уровень, на котором число тем окажется соответствующим интересам пользователя. Можно учитывать расположение всех документов в тематическом пространстве.
Также учитывалось различие упоминания терминов по годам – как часто статьи с конкретной темой появлялись в издании в разные годы, какие термины использовались внутри темы и какиетемы превалировали. Особое внимание уделялось выделению внутри темы специфических терминов.
Для отображения специфики был применен подход мешка слов, но не в разрезе тем, а в разрезе годов. Было отобрано 950 терминов, которые наиболее часто встречаются в 95 кластерах. Их дополнительно проредили, оставили те, которые встречались достаточно часто (не менее 50 раз). После этого устанавливались термины, которые встречались часто в отдельные годы по критерию относительной частоты.

2.1.1. Кластер 0 «Спорт»

Специфической чертой еженедельной газеты «Аргументы и фак­ты» является отсутствие рубрикации на тематические блоки, то есть нет, например, разделов «Спорт» или «Культура», характерных для многих ежедневных газет. Такое положение дел, с одной стороны, затрудняет, так сказать, выделение информационных кластеров, но, с другой сторо­ны, позволяет увидеть доли обозначенных с помощью математических расчетов кластеров в общем объеме текста от номера к номеру, от года к году и так далее. Кластер «Спорт» в этом отношении оказывается
30
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]