Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Большие данные в исследовании политических процессов. Учебное пособие

.pdf
Скачиваний:
0
Добавлен:
07.09.2026
Размер:
2 Мб
Скачать
ГлаваIII. Инструменты киберметрии как способ аккумулирования ианализа больших данных
Рис. 8. Импорт настроек изфайла
2-й этап: редактирование определения тональности до­кументов.
Программа автоматически выстраивает тональность докумен­тов, ноиногда следует внести корректировки.
«Считать эти слова и фразы негативом» – в этот компонент добавляются выражения, которые должны быть маркированы как имеющие отрицательную модальность для конкретной рубрики.
Чтобы добавить фразу всписок, надо ввести ее вполе под ним инажать кнопку «+». При
вводе можно использовать язык запро-
совIQBuzz.
«Не считать эти слова ифразы негативом» – вэтот компонент можно добавлять выражения, которые ошибочно определяются как обладающие отрицательной тональностью. Как правило, это характерно для случаев иронии иподстрочного смысла втекстах.
«Ширина контекста» позволяет задать расстояние между клю- чевыми словами поиска и словарными выражениями негатива
31
Е. В. БРОДОВСКАЯ, А. Ю. ДОМБРОВСКАЯ. БОЛЬШИЕ ДАННЫЕ В ИССЛЕДОВАНИИ ПОЛИТИЧЕСКИХ ПРОЦЕССОВ
втексте документа. Ширина контекста задается в словах, ичем меньше она будет, тем жестче будет работать алгоритм определе­ния тональности. Тоесть вероятность того, что негатив относится именно кобъекту мониторинга, будет тем выше, чем меньше рас­стояние между ними.
3-йэтап: работа сдокументами.
Документ– это текст супоминанием потеме рубрики, взятый изпоста вблоге, комментария или сообщения всоциальных сетях.
Чтобы просмотреть документы, которые аккумулировались врубрике, необходимо открыть ее ивыбрать вкладку «Документы».
Документы отображаются в виде списка, отсортированного по дате создания. В списке отображаются основные параметры документа, его тональность, атакже фрагмент текста свыделен­ными ключевыми словами рубрики.
Справа находится окно, которое позволяет группировать до­кументы потональности.
Для анализа каждого документа (при
наличии технической
возможности) используется дополнительная информация:
• «охват»– количество интернет-пользователей, которые могли
ознакомиться с документом (фактически или потенциально). Для разных источников этот показатель считается по-разному: Twitter– количество читателей автора; Youtube, Rutube, Vimeo– количество просмотров ролика; пост вблоге LiveJournal– количе­ство друзей автора, пост всообществе LiveJournal– количество участ­ников сообщества; запись
настене группы/сообщества вFacebook и«ВКонтакте»– количество участников группы, сообщения нафо­руме– количество просмотров;
• «комментариев»количество комментариев кдокументу;
• «понравилось»количество пользователей, которым пон-
равился этот документ, и они поставили на нем соответствую­щую отметку: для Facebook– число лайков, для «ВКонтакте»– число отметок «Мне нравится», для Youtube –
число нажатий
«Нравится»;
• «поделились»количество пользователей, которые распро-
странили (перепостили) этот документ через свои аккаунты всо­циальных сетях. Для Twitter– количество ретвитов, для Facebook и «ВКонтакте»– количество поделившихся, для Youtube– число нажатий кнопки «Поделиться» для ролика, пост вблоге/сообществе
LiveInternetколичество процитировавших.
32
ГлаваIII. Инструменты киберметрии как способ аккумулирования ианализа больших данных
Указанные возможности позволяют исследовать пользователь­скую аудиторию сообщений, имеющих определенные контексты, иоценивать потенциал их ценностного воздействия.
Работа савтором документа.
Информация обавторе документа выводится вотдельной кар­точке (карточке автора). Чтобы открыть ее, необходимо кликнуть покнопке
вдокументе ивыбрать воткрывшемся меню пункт
«Карточка автора».
В этом меню автора можно осуществить дополнительные опе­рации.
Карточка автора содержит всю имеющуюся вIQBuzz информа­цию овыбранном блогере. Вполе «Всего документов» отображается общее количество документов этого автора вбазе данныхIQBuzz. Кликнув поэтому числу, можно просмотреть все его документы.
4-йэтап: отчеты вIQBuzz.
При
работе скаждой рубрикой доступны несколько видов ста-
тистических отчетов подокументам:
• Документы повремени– показывает динамику создания до-
кументов завыбранный период времени.
• Распределение потемам– отображает относительное иабсо-
лютное распределение документов порубрикам итональности.
• Распределение поисточникам – распределение документов
понаиболее активным источникам (блогохостингам).
• Распределение потипам– распределение документов пораз-
ным типам источников.
• Облако ключевых
слов– список слов ифраз, которые встрети-
лись внаибольшем количестве документов рубрики.
• Активность авторов– позволяет получить топ авторов, кото-
рые пишут потеме рубрики.
• Активность блогов– топ блогов исообществ поколичеству со-
зданных документов рубрики.
• Распределение авторов по полу– относительное и абсолют-
ное распределение авторов пополу.
• Распределение авторов повозрасту– количественное соотно-
шение авторов различных
возрастных категорий.
Местоположение авторов географическое распределение
авторов погеографии (страна ирегион).
Распределение по тегам показывает распределение до-
кументов поуказанным тегам.
33
Е. В. БРОДОВСКАЯ, А. Ю. ДОМБРОВСКАЯ. БОЛЬШИЕ ДАННЫЕ В ИССЛЕДОВАНИИ ПОЛИТИЧЕСКИХ ПРОЦЕССОВ
Отчеты позволяют сравнивать данные различных рубрик иподрубрик.
Чтобы сформировать отчет, нужно открыть рубрики икликнуть поинтересующему отчету справа отокна основной информации рубрики (см.рис.9).
Рис. 9. Формирование автоматического отчета
Внутри каждого отчета можно самостоятельно выбирать дан­ные, для этого необходимо провести следующие действия.
Распределение потемам –> кликнуть «Выбрать рубрику» –>от­метить необходимые данные –> сформировать отчет.
Не все типы отчетов позволяют выбрать несколько данных од­новременно.
После настройки отчета его можно сохранить как пользова­тельский, чтобы иметь к нему быстрый доступ. Для этого
надо
кликнуть «Сохранить как пользовательский отчет».
34
Рис. 10. Экспорт статистики вMicrosoftWord
ГлаваIII. Инструменты киберметрии как способ аккумулирования ианализа больших данных
Отчеты также можно экспортировать вMicrosoftWord, кликнув кнопку «Экспортировать отчет» (см.рис.10).
Таким образом, сервис для мониторинга социальных медиа впроцессе автоматизированного аккумулирования данных учи­тывает обширный круг характеристик: язык, геолокацию до­кументов, социально-демографические признаки авторов (пол, возраст), дату опубликования, интересующие исследователя блоги иблогохостинги, типы (жанры) документов ит. д., атакже обладает
широким аналитическим функционалом: определение динамики информационных потоков, их модальности, публика­ционной активности различных блогов иблогохостингов, семан­тическое ядро выгружаемых потоков.
ГЛАВАIV
ТЕХНИКА АККУМУЛИРОВАНИЯ БОЛЬШИХ
ДАННЫХ– ЦИФРОВЫХ МАРКЕРОВ
ПОЛИТИЧЕСКИХ ПРОЦЕССОВ
СПРИМЕНЕНИЕМ ОНЛАЙН-СЕРВИСОВ
ДЛЯМОНИТОРИНГА СОЦИАЛЬНЫХ МЕДИА
(
СОСТАВЛЕНИЕ ПОИСКОВЫХ ЗАПРОСОВ
Сервисы для мониторинга социальных медиа являются про­граммами для аккумулирования больших данных, осуществля­емого наоснове поисковых запросов– цифровых маркеров ин­тересующих исследователя процессов. Вэтой связи особую роль вметодике мониторинга социальных медиа играет техника раз­работки поисковых запросов исловарей маркеров.
Для формирования поискового запроса вIQBuzz используется язык поискового запроса, который включает всебя сические запросы, ноиспециальные операторы языка.
Язык запросов IQBuzz позволяет формировать поисковые за­просы любой сложности, структуры истепени вложенности. Поиск осуществляется поключевым словам сиспользованием операто­ров языкаIQBuzz.
По умолчанию ключевые слова ищутся с учетом всех языко­вых форм русского и английского языков (поиск с учетом мор­фологии). Существует определенный набор операторов языка сервиса.
Слово1 | Слово2 | Слово3– такие знаки отделения запросов друг отдруга означают «Искать любое изслов».
Слово1 & Слово2– знак & означает «Искать оба слова вместе впределах всего сообщения».
(Слово1 & Слово2) & Слово3Стоп-слова (минус-слова). Это кодирование означает «Исключить сообщения со "Словом 3"». Используется только всочетании соператором &.
(Слово1 | Слово2 | Слово3) & Слово4 –
группировки условий всложносоставных запросах.
«Слово1Слово– искать все слова точно втакой последова­тельности– словосочетания.
нетолько лек-
скобки нужны для
)
36
ГлаваIV. Техника аккумулирования больших данных– цифровых маркеров политических
процессов сприменением онлайн-сервисов для мониторинга социальных медиа
(составление поисковых запросов)
Слово1 *{1} Слово2– искать словосочетание спропущенным словом.
@Словоискать слово именно втакой морфологической форме.
{Слово1 & Слово2,... 5}– искать все слова вместе впределах
5слов потексту.
мобил % – искать поначалу слова.
#слово Поиск хештегов. Будут найдены слова, перед которыми
обязательно стоит символ #.
При формировании поискового запроса важно учитывать лек­сические
особенности рассматриваемой темы, в данном случае нельзя, как ваналогии споисковой системой браузера, просто на­писать искомую фразу или тему. IQBuzz не обладает всеми спо­собностями поисковых систем, поэтому для качественного поиска нужны определенные уточнения иисключения.
Пример
Необходимо найти упоминание известной исторической лич-
ности– Александра Невского.
Если вполе поискового запроса ввести простое сочетание Александр
Невский, в результате выгрузки обнаружится большое количество нереле­вантных сообщений супоминанием нетолько искомого истори­ческого деятеля, но и современной медийной персоны с анало­гичным именем. Таким образом, необходимо указать исключения, найти своего рода стоп-слова или маркеры, указывающие нане­релевантные документы. Вданном случае таким маркером могут служить слова Голливуд, актер, фильм. Втаком случае
поисковый
запрос будет выглядеть следующим образом:
(Александр Невский) &– (Голливуд актер фильм). Оператор «-» исключит сообщения с указанными словами
извыдачи.
К созданию поискового запроса необходимо подходить спози­ции глубокого анализа искомой темы инебольшой долей креатива. Внекоторых сложных случаях необходимо много раз возвращаться к найденным документам, чтобы снова откорректировать пои­сковый запрос.
При работе
с определенными категориями можно выделить
некоторую специфику создания поискового запроса.
Работа с ценностными категориями несет в себе определен­ную сложность, так как ценности имеют абстрактное содержание,
37
Е. В. БРОДОВСКАЯ, А. Ю. ДОМБРОВСКАЯ. БОЛЬШИЕ ДАННЫЕ В ИССЛЕДОВАНИИ ПОЛИТИЧЕСКИХ ПРОЦЕССОВ
большое количество значений, по-разному понимаются субъек­тами сообщений.
Рассмотрим процесс создания поискового запроса напримере кейса «Анализ репрезентаций ценностных ориентаций молодых российских пользователей всети Интернет».
Первым шагом к формированию поискового запроса было определение списка ценностных категорий, которые должны подвергаться анализу. Вслучае данного кейса напервом этапе были рассмотрены ценности, которые пользователи указывают насвоих
страницах всоциальной сети «ВКонтакте» через специ­альную форму, помимо этого использовались данные глубин­ных интервью, которые проводились врамках данного проекта. Врезультате был выделен ряд укрупненных категорий, отража­ющих наиболее популярные ценности молодых пользователей Интернета:
семья идети,развлечение иотдых,саморазвитие,бизнес (карьера, деньги, успех).
Формирование поискового запроса
только лишь с использо­ванием выделенных категорий не позволит получить достаточ­ное количество релевантных сообщений. Так, поиск документов супоминанием слов семья и дети может дать нам только те до­кументы, вкоторых пользователи использовали лишь эти слова, тогда как беседа осемейных ценностях может выражаться ивдру­гих лексических формах. Поэтому вторым шагом кформирова­нию поискового
запроса было определение как можно большего количества лексических форм, раскрывающих понятие выделен­ной категории. Каждая категория будет выступать вкачестве от­дельной рубрики всервисе.
Пример
Категория «Семья и дети» наиболее обширная категория, ко­торая будет включать всебя понятия: семья, дети, ребенок, дочь, сын, домашний очаг, любовь, любимый человек, отец, мать, мама, папа, семейные ценности
.
Список этих категорий можно расширять взависимости отце­лей изадач, поставленных перед оператором.
С использованием операторов поисковый запрос будет выгля­деть следующим образом:
38
ГлаваIV. Техника аккумулирования больших данных– цифровых маркеров политических
процессов сприменением онлайн-сервисов для мониторинга социальных медиа
(составление поисковых запросов)
Семья дети ребенок дочь сын (домашний&очаг) любовь (люби­мый&человек) отец мать мама папа (семейные&ценности).
В данном случае используется оператор или (| или просто про­бел) иоператор и(&).
Однако стоит всегда проверять полученную выдачу сервиса икорректировать запрос. Например, кзапросу (домашний&очаг) могут подходить документы, которые содержат упоминания магазина стаким названием или журнала, втаком случае нужно исключить их, указав впоисковом запросе стоп-слова.
Работа с именами (акторами). С одной стороны, формирова- ние поискового запроса для поиска упоминания определенной личности является наиболее легким, с другой стороны, можно столкнуться сопределенными трудностями, например, стакими, как вописанном примере сАлександром Невским.
Поэтому при работе с акторами важно предварительно опре- делить
возможных популярных «двойников» искомой личности иисключить их извыдачи. Вторым шагом является формирова­ние списка имен актора сообщения. Рассмотрим этот шаг напри­мере личности Владимира Вольфовича Жириновского.
Если впоисковом запросе просто указать фамилию, имя иот­чество актора, то сервис найдет лишь те сообщения, в которых личность называют именно так, поимени-отчеству. Скорее всего, ввыдачу попадут сообщения изновостных лет, посты официаль­ного характера инебудут отображать мнения иоценки реальных пользователей. Поэтому необходимо учесть как можно больше возможных вариаций использования имени искомого актора. Для Владимира Вольфовича этот список будет выглядеть следующим образом:
Жириновский,
Владимир Жириновский,
Владимир Вольфович Жириновский,
Владимир Вольфович,
Жирик.
С использованием операторов
поисковый запрос будет выгля-
деть следующим образом:
Жириновский| (Владимир&Жириновский)|
(Владимир&Вольфович&Жириновский)| (Владимир&Вольфович)|Жирик
39
Е. В. БРОДОВСКАЯ, А. Ю. ДОМБРОВСКАЯ. БОЛЬШИЕ ДАННЫЕ В ИССЛЕДОВАНИИ ПОЛИТИЧЕСКИХ ПРОЦЕССОВ
При этом стоит учитывать степень медийности персоны, осо­бенно это касается использования имени иотчества без указания фамилии, в случае с В.В. Жириновским сочетание Владимир Вольфович крайне редко и неимеет отношения кего персоне.
Продолжая тему медийности, необходимо коснуться менее из­вестных персон. Рассмотрим этот аспект напримере губернатора Ставропольского края Владимирова Владимира Владимировича. Помимо менее широкого охвата пользователей Владимиров имеет еще специфическое сочетание фамилии, имени и отчества. При формировании поискового запроса с указанием лишь этих ка­тегорий сервис выгружает огромное количество нерелевантных сообщений, в которых есть и упоминания Владимира Путина, так как он часто в границах одного сообщения упоминается как «Владимир Владимирович», ипросто большого количества людей винициалах которых фигурирует
имя Владимир.
«Чистить», тоесть повышать релевантность массива сообще-
ний при помощи указания стоп-слов, вданном случае затруд­нительно, ипоэтому рациональнее будет сузить поиск засчет указания какого-либо маркера-уточнения. В данном случае маркером моглабы стать должность интересующего лица или регион, вкотором эта персона работает. Таким образом, при­мером корректного поискового запроса
служит следующая сис-
тема маркеров:
((Владимиров&Владимир) (Владимиров&Владимир&Владими рович)) & ((губернатор (ставропольский&край) Ставрополье)).
Стоит обратить внимание, что вданном случае оператор & (и)ис­пользуется для объединения двух больших частей поискового за­проса, это сделано стой целью, чтобы ввыборку попали лишьте сообщения, в которых указывается и имя Владимирова, и его должность или регион.
Отдельно необходимо коснуться особенностей формирования поискового запроса для персон, которые находятся напике по­пулярности и обсуждаются большим количеством людей веже­дневном формате. Ктаким лицам можно отнести Президента РФ Владимира Владимировича Путина. Сложность такого поискового запроса состоит втом, что мощности сервиса просто несправля­ются стаким потоком сообщений. Это связано стем, что количе­ство
сообщений, выгружаемых заопределенный период времени,
ограничено.
40
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]