Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Большие данные в исследовании политических процессов. Учебное пособие
.pdf
ГлаваIII. Инструменты киберметрии как способ аккумулирования ианализа больших данных
Рис. 8. Импорт настроек изфайла
2-й этап: редактирование определения тональности документов.
Программа автоматически выстраивает тональность документов, ноиногда следует внести корректировки.
«Считать эти слова и фразы негативом» – в этот компонент
добавляются выражения, которые должны быть маркированы как
имеющие отрицательную модальность для конкретной рубрики.
Чтобы добавить фразу всписок, надо ввести ее вполе под ним
инажать кнопку «+». При
вводе можно использовать язык запро-
совIQBuzz.
«Не считать эти слова ифразы негативом» – вэтот компонент
можно добавлять выражения, которые ошибочно определяются
как обладающие отрицательной тональностью. Как правило, это
характерно для случаев иронии иподстрочного смысла втекстах.
«Ширина контекста» позволяет задать расстояние между клю-
чевыми словами поиска и словарными выражениями негатива
31

Е. В. БРОДОВСКАЯ, А. Ю. ДОМБРОВСКАЯ. БОЛЬШИЕ ДАННЫЕ В ИССЛЕДОВАНИИ ПОЛИТИЧЕСКИХ ПРОЦЕССОВ
втексте документа. Ширина контекста задается в словах, ичем
меньше она будет, тем жестче будет работать алгоритм определения тональности. Тоесть вероятность того, что негатив относится
именно кобъекту мониторинга, будет тем выше, чем меньше расстояние между ними.
3-йэтап: работа сдокументами.
Документ– это текст супоминанием потеме рубрики, взятый
изпоста вблоге, комментария или сообщения всоциальных сетях.
Чтобы просмотреть документы, которые аккумулировались
врубрике, необходимо открыть ее ивыбрать вкладку «Документы».
Документы отображаются в виде списка, отсортированного
по дате создания. В списке отображаются основные параметры
документа, его тональность, атакже фрагмент текста свыделенными ключевыми словами рубрики.
Справа находится окно, которое позволяет группировать документы потональности.
Для анализа каждого документа (при
наличии технической
возможности) используется дополнительная информация:
• «охват»– количество интернет-пользователей, которые могли
ознакомиться с документом (фактически или потенциально).
Для разных источников этот показатель считается по-разному:
Twitter– количество читателей автора; Youtube, Rutube, Vimeo–
количество просмотров ролика; пост вблоге LiveJournal– количество друзей автора, пост всообществе LiveJournal– количество участников сообщества; запись
настене группы/сообщества вFacebook
и«ВКонтакте»– количество участников группы, сообщения нафоруме– количество просмотров;
• «комментариев»– количество комментариев кдокументу;
• «понравилось»– количество пользователей, которым пон-
равился этот документ, и они поставили на нем соответствующую отметку: для Facebook– число лайков, для «ВКонтакте»–
число отметок «Мне нравится», для Youtube –
число нажатий
«Нравится»;
• «поделились»– количество пользователей, которые распро-
странили (перепостили) этот документ через свои аккаунты всоциальных сетях. Для Twitter– количество ретвитов, для Facebook
и «ВКонтакте»– количество поделившихся, для Youtube– число
нажатий кнопки «Поделиться» для ролика, пост вблоге/сообществе
LiveInternet– количество процитировавших.
32

ГлаваIII. Инструменты киберметрии как способ аккумулирования ианализа больших данных
Указанные возможности позволяют исследовать пользовательскую аудиторию сообщений, имеющих определенные контексты,
иоценивать потенциал их ценностного воздействия.
Работа савтором документа.
Информация обавторе документа выводится вотдельной карточке (карточке автора). Чтобы открыть ее, необходимо кликнуть
покнопке
вдокументе ивыбрать воткрывшемся меню пункт
«Карточка автора».
В этом меню автора можно осуществить дополнительные операции.
Карточка автора содержит всю имеющуюся вIQBuzz информацию овыбранном блогере. Вполе «Всего документов» отображается
общее количество документов этого автора вбазе данныхIQBuzz.
Кликнув поэтому числу, можно просмотреть все его документы.
4-йэтап: отчеты вIQBuzz.
При
работе скаждой рубрикой доступны несколько видов ста-
тистических отчетов подокументам:
• Документы повремени– показывает динамику создания до-
кументов завыбранный период времени.
• Распределение потемам– отображает относительное иабсо-
лютное распределение документов порубрикам итональности.
• Распределение поисточникам – распределение документов
понаиболее активным источникам (блогохостингам).
• Распределение потипам– распределение документов пораз-
ным типам источников.
• Облако ключевых
слов– список слов ифраз, которые встрети-
лись внаибольшем количестве документов рубрики.
• Активность авторов– позволяет получить топ авторов, кото-
рые пишут потеме рубрики.
• Активность блогов– топ блогов исообществ поколичеству со-
зданных документов рубрики.
• Распределение авторов по полу– относительное и абсолют-
ное распределение авторов пополу.
• Распределение авторов повозрасту– количественное соотно-
шение авторов различных
возрастных категорий.
• Местоположение авторов – географическое распределение
авторов погеографии (страна ирегион).
• Распределение по тегам – показывает распределение до-
кументов поуказанным тегам.
33

Е. В. БРОДОВСКАЯ, А. Ю. ДОМБРОВСКАЯ. БОЛЬШИЕ ДАННЫЕ В ИССЛЕДОВАНИИ ПОЛИТИЧЕСКИХ ПРОЦЕССОВ
Отчеты позволяют сравнивать данные различных рубрик
иподрубрик.
Чтобы сформировать отчет, нужно открыть рубрики икликнуть
поинтересующему отчету справа отокна основной информации
рубрики (см.рис.9).
Рис. 9. Формирование автоматического отчета
Внутри каждого отчета можно самостоятельно выбирать данные, для этого необходимо провести следующие действия.
Распределение потемам –> кликнуть «Выбрать рубрику» –>отметить необходимые данные –> сформировать отчет.
Не все типы отчетов позволяют выбрать несколько данных одновременно.
После настройки отчета его можно сохранить как пользовательский, чтобы иметь к нему быстрый доступ. Для этого
надо
кликнуть «Сохранить как пользовательский отчет».
34
Рис. 10. Экспорт статистики вMicrosoftWord

ГлаваIII. Инструменты киберметрии как способ аккумулирования ианализа больших данных
Отчеты также можно экспортировать вMicrosoftWord, кликнув
кнопку «Экспортировать отчет» (см.рис.10).
Таким образом, сервис для мониторинга социальных медиа
впроцессе автоматизированного аккумулирования данных учитывает обширный круг характеристик: язык, геолокацию документов, социально-демографические признаки авторов (пол,
возраст), дату опубликования, интересующие исследователя
блоги иблогохостинги, типы (жанры) документов ит. д., атакже
обладает
широким аналитическим функционалом: определение
динамики информационных потоков, их модальности, публикационной активности различных блогов иблогохостингов, семантическое ядро выгружаемых потоков.

ГЛАВАIV
ТЕХНИКА АККУМУЛИРОВАНИЯ БОЛЬШИХ
ДАННЫХ– ЦИФРОВЫХ МАРКЕРОВ
ПОЛИТИЧЕСКИХ ПРОЦЕССОВ
СПРИМЕНЕНИЕМ ОНЛАЙН-СЕРВИСОВ
ДЛЯМОНИТОРИНГА СОЦИАЛЬНЫХ МЕДИА
(
СОСТАВЛЕНИЕ ПОИСКОВЫХ ЗАПРОСОВ
Сервисы для мониторинга социальных медиа являются программами для аккумулирования больших данных, осуществляемого наоснове поисковых запросов– цифровых маркеров интересующих исследователя процессов. Вэтой связи особую роль
вметодике мониторинга социальных медиа играет техника разработки поисковых запросов исловарей маркеров.
Для формирования поискового запроса вIQBuzz используется
язык поискового запроса, который включает всебя
сические запросы, ноиспециальные операторы языка.
Язык запросов IQBuzz позволяет формировать поисковые запросы любой сложности, структуры истепени вложенности. Поиск
осуществляется поключевым словам сиспользованием операторов языкаIQBuzz.
По умолчанию ключевые слова ищутся с учетом всех языковых форм русского и английского языков (поиск с учетом морфологии). Существует определенный набор операторов языка
сервиса.
Слово1 | Слово2 | Слово3– такие знаки отделения запросов
друг отдруга означают «Искать любое изслов».
Слово1 & Слово2– знак & означает «Искать оба слова вместе
впределах всего сообщения».
(Слово1 & Слово2) & Слово3Стоп-слова (минус-слова). Это
кодирование означает «Исключить сообщения со "Словом 3"».
Используется только всочетании соператором &.
(Слово1 | Слово2 | Слово3) & Слово4 –
группировки условий всложносоставных запросах.
«Слово1Слово2»– искать все слова точно втакой последовательности– словосочетания.
нетолько лек-
скобки нужны для
)
36

ГлаваIV. Техника аккумулирования больших данных– цифровых маркеров политических
процессов сприменением онлайн-сервисов для мониторинга социальных медиа
(составление поисковых запросов)
Слово1 *{1} Слово2– искать словосочетание спропущенным
словом.
@Слово– искать слово именно втакой морфологической форме.
{Слово1 & Слово2,... 5}– искать все слова вместе впределах
5слов потексту.
мобил % – искать поначалу слова.
#слово Поиск хештегов. Будут найдены слова, перед которыми
обязательно стоит символ #.
При формировании поискового запроса важно учитывать лексические
особенности рассматриваемой темы, в данном случае
нельзя, как ваналогии споисковой системой браузера, просто написать искомую фразу или тему. IQBuzz не обладает всеми способностями поисковых систем, поэтому для качественного поиска
нужны определенные уточнения иисключения.
Пример
Необходимо найти упоминание известной исторической лич-
ности– Александра Невского.
Если вполе поискового запроса ввести простое сочетание
Александр
Невский,
в результате выгрузки обнаружится большое количество нерелевантных сообщений супоминанием нетолько искомого исторического деятеля, но и современной медийной персоны с аналогичным именем. Таким образом, необходимо указать исключения,
найти своего рода стоп-слова или маркеры, указывающие нанерелевантные документы. Вданном случае таким маркером могут
служить слова Голливуд, актер, фильм. Втаком случае
поисковый
запрос будет выглядеть следующим образом:
(Александр Невский) &– (Голливуд актер фильм).
Оператор «-» исключит сообщения с указанными словами
извыдачи.
К созданию поискового запроса необходимо подходить спозиции глубокого анализа искомой темы инебольшой долей креатива.
Внекоторых сложных случаях необходимо много раз возвращаться
к найденным документам, чтобы снова откорректировать поисковый запрос.
При работе
с определенными категориями можно выделить
некоторую специфику создания поискового запроса.
Работа с ценностными категориями несет в себе определенную сложность, так как ценности имеют абстрактное содержание,
37

Е. В. БРОДОВСКАЯ, А. Ю. ДОМБРОВСКАЯ. БОЛЬШИЕ ДАННЫЕ В ИССЛЕДОВАНИИ ПОЛИТИЧЕСКИХ ПРОЦЕССОВ
большое количество значений, по-разному понимаются субъектами сообщений.
Рассмотрим процесс создания поискового запроса напримере
кейса «Анализ репрезентаций ценностных ориентаций молодых
российских пользователей всети Интернет».
Первым шагом к формированию поискового запроса было
определение списка ценностных категорий, которые должны
подвергаться анализу. Вслучае данного кейса напервом этапе
были рассмотрены ценности, которые пользователи указывают
насвоих
страницах всоциальной сети «ВКонтакте» через специальную форму, помимо этого использовались данные глубинных интервью, которые проводились врамках данного проекта.
Врезультате был выделен ряд укрупненных категорий, отражающих наиболее популярные ценности молодых пользователей
Интернета:
– семья идети,
– развлечение иотдых,
– саморазвитие,
– бизнес (карьера, деньги, успех).
Формирование поискового запроса
только лишь с использованием выделенных категорий не позволит получить достаточное количество релевантных сообщений. Так, поиск документов
супоминанием слов семья и дети может дать нам только те документы, вкоторых пользователи использовали лишь эти слова,
тогда как беседа осемейных ценностях может выражаться ивдругих лексических формах. Поэтому вторым шагом кформированию поискового
запроса было определение как можно большего
количества лексических форм, раскрывающих понятие выделенной категории. Каждая категория будет выступать вкачестве отдельной рубрики всервисе.
Пример
Категория «Семья и дети» наиболее обширная категория, которая будет включать всебя понятия: семья, дети, ребенок, дочь,
сын, домашний очаг, любовь, любимый человек, отец, мать, мама,
папа, семейные ценности
.
Список этих категорий можно расширять взависимости отцелей изадач, поставленных перед оператором.
С использованием операторов поисковый запрос будет выглядеть следующим образом:
38

ГлаваIV. Техника аккумулирования больших данных– цифровых маркеров политических
процессов сприменением онлайн-сервисов для мониторинга социальных медиа
(составление поисковых запросов)
Семья дети ребенок дочь сын (домашний&очаг) любовь (любимый&человек) отец мать мама папа (семейные&ценности).
В данном случае используется оператор или (| или просто пробел) иоператор и(&).
Однако стоит всегда проверять полученную выдачу сервиса
икорректировать запрос. Например, кзапросу (домашний&очаг)
могут подходить документы, которые содержат упоминания
магазина стаким названием или журнала, втаком случае нужно
исключить их, указав впоисковом запросе стоп-слова.
Работа с именами (акторами). С одной стороны, формирова-
ние поискового запроса для поиска упоминания определенной
личности является наиболее легким, с другой стороны, можно
столкнуться сопределенными трудностями, например, стакими,
как вописанном примере сАлександром Невским.
Поэтому при работе с акторами важно предварительно опре-
делить
возможных популярных «двойников» искомой личности
иисключить их извыдачи. Вторым шагом является формирование списка имен актора сообщения. Рассмотрим этот шаг напримере личности Владимира Вольфовича Жириновского.
Если впоисковом запросе просто указать фамилию, имя иотчество актора, то сервис найдет лишь те сообщения, в которых
личность называют именно так, поимени-отчеству. Скорее всего,
ввыдачу попадут сообщения изновостных лет, посты официального характера инебудут отображать мнения иоценки реальных
пользователей. Поэтому необходимо учесть как можно больше
возможных вариаций использования имени искомого актора. Для
Владимира Вольфовича этот список будет выглядеть следующим
образом:
– Жириновский,
– Владимир Жириновский,
– Владимир Вольфович Жириновский,
– Владимир Вольфович,
– Жирик.
С использованием операторов
поисковый запрос будет выгля-
деть следующим образом:
Жириновский| (Владимир&Жириновский)|
(Владимир&Вольфович&Жириновский)| (Владимир&Вольфович)|Жирик
39

Е. В. БРОДОВСКАЯ, А. Ю. ДОМБРОВСКАЯ. БОЛЬШИЕ ДАННЫЕ В ИССЛЕДОВАНИИ ПОЛИТИЧЕСКИХ ПРОЦЕССОВ
При этом стоит учитывать степень медийности персоны, особенно это касается использования имени иотчества без указания
фамилии, в случае с В.В. Жириновским сочетание Владимир
Вольфович крайне редко и неимеет отношения кего персоне.
Продолжая тему медийности, необходимо коснуться менее известных персон. Рассмотрим этот аспект напримере губернатора
Ставропольского края Владимирова Владимира Владимировича.
Помимо менее широкого охвата пользователей Владимиров имеет
еще специфическое сочетание фамилии, имени и отчества. При
формировании поискового запроса с указанием лишь этих категорий сервис выгружает огромное количество нерелевантных
сообщений, в которых есть и упоминания Владимира Путина,
так как он часто в границах одного сообщения упоминается как
«Владимир Владимирович», ипросто большого количества людей
винициалах которых фигурирует
имя Владимир.
«Чистить», тоесть повышать релевантность массива сообще-
ний при помощи указания стоп-слов, вданном случае затруднительно, ипоэтому рациональнее будет сузить поиск засчет
указания какого-либо маркера-уточнения. В данном случае
маркером моглабы стать должность интересующего лица или
регион, вкотором эта персона работает. Таким образом, примером корректного поискового запроса
служит следующая сис-
тема маркеров:
((Владимиров&Владимир) (Владимиров&Владимир&Владими
рович)) & ((губернатор (ставропольский&край) Ставрополье)).
Стоит обратить внимание, что вданном случае оператор & (и)используется для объединения двух больших частей поискового запроса, это сделано стой целью, чтобы ввыборку попали лишьте
сообщения, в которых указывается и имя Владимирова, и его
должность или регион.
Отдельно необходимо коснуться особенностей формирования
поискового запроса для персон, которые находятся напике популярности и обсуждаются большим количеством людей вежедневном формате. Ктаким лицам можно отнести Президента РФ
Владимира Владимировича Путина. Сложность такого поискового
запроса состоит втом, что мощности сервиса просто несправляются стаким потоком сообщений. Это связано стем, что количество
сообщений, выгружаемых заопределенный период времени,
ограничено.
40
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
