Работа с сервисом бизнес-аналитики Yandex DataLens. Учебное пособие
.pdfМИНИСТЕРСТВО НАУКИ И ВЫСШЕГО ОБРАЗОВАНИЯ РОССИЙСКОЙ ФЕДЕРАЦИИ
Федеральное государственное автономное образовательное учреждение высшего образования
«ЮЖНЫЙ ФЕДЕРАЛЬНЫЙ УНИВЕРСИТЕТ»
Экономический факультет
Е. А. Березовская, С. В. Крюков
РАБОТА С СЕРВИСОМ БИЗНЕС-АНАЛИТИКИ YANDEX DATALENS
Учебное пособие
Ростов-на-Дону – Таганрог Издательство Южного федерального университета
2022
1
УДК 334.72:303.732.4(075.8) ББК 65.29+65.053я73
Б58
Печатается по решению кафедры экономической кибернетики экономического факультета Южного федерального университета (протокол № 5 от 25 мая 2022 г.)
Рецензенты:
доктор экономических наук, доцент, зав. кафедрой информационных систем и прикладной информатики
Ростовского государственного экономического университета (РИНХ)
С. М. Щербаков;
кандидат экономических наук, доцент,
и.о. зав. кафедрой экономической кибернетики ЮФУ
Е.В. Маслюкова
Березовская, Е. А.
Б58 Работа с сервисом бизнес-аналитики Yandex DataLens : учебное пособие / Е. А. Березовская, С. В. Крюков ; Южный федеральный университет. – Ростов-на-Дону ; Таганрог : Издательство Южного федерального университета, 2022. – 92 с.
ISBN 978-5-9275-4119-5
Учебное пособие содержит изложение основ и примеров работы с современным отечественным сервисом бизнес-аналитики Yandex DataLens для решения разнообразных задач в области экономики, бизнеса и управления. Также раскрываются особенности появления и развития науки о данных (Data Science) и науки о больших данных (Big Data). Показана взаимосвязь развития бизнес-аналитики с наукой о данных. Характер изложения учебного материала способствует развитию навыков самостоятельной исследовательской работы. Приведены задания для выполнения самостоятельной работы в сервисе Yandex DataLens и проверки усвоения учебного материала.
Пособие разработано на основе нормативных документов Министерства науки и высшего образования Российской Федерации.
Адресовано студентам, магистрантам, аспирантам, работникам высшей школы и практикам, специализирующимся в области экономической и бизнесаналитики.
ISBN 978-5-9275-4119-5 |
УДК 334.72:303.732.4(075.8) |
|
ББК 65.29+65.053я73 |
|
© Южный федеральный университет, 2022 |
|
© Березовская Е. А., Крюков С. В., 2022 |
|
© Оформление. Макет. Издательство |
|
Южного федерального университета, 2022 |
2
Оглавление
Введение.............................................................................................................................. |
4 |
|
1. |
Наука о данных и большие данные |
|
|
(Data Science и Big Data) ..................................................................................... |
5 |
2. |
Зарубежные и отечественные платформы |
|
|
бизнес-аналитики ............................................................................................... |
25 |
3. |
Работа с сервисом Yandex DataLens ......................................................... |
50 |
4. |
Задания для самостоятельной работы в сервисе |
|
|
Yandex DataLens ................................................................................................... |
81 |
Глоссарий.......................................................................................................................... |
85 |
|
Литература ...................................................................................................................... |
91 |
|
3
Введение
Всовременных условиях любой бизнес не может нормально существовать и развиваться без применения методов и инструментария науки о данных (Data Science). С развитием информационных технологий и сетевых коммуникаций в рамках науки о данных стал стремительно развиваться такой раздел, как работа с «большими данными» (Big Data). Если раньше проблема заключалась в поиске нужной информации для ведения успешного бизнеса, то в настоящее время в условиях появления доступа к огромным массивам данных проблема сместилась в сторону извлечения из данных необходимой информации и знаний для принятия эффективных бизнес-решений.
Инструменты для проведения бизнес-аналитики становятся всё более доступными для обычных пользователей, не имеющих специальной подготовки в области информационных технологий. На рынке комплексных платформ и отдельных инструментов для проведения бизнес-аналитики в настоящее время присутствуют десятки продуктов отечественных и зарубежных компаний.
Вучебном пособии представлены материалы теоретического характера об особенностях развития науки о данных и больших данных (Data Science и Big Data). Также представлены результаты сравнительного анализа лучших зарубежных и отечественных платформ для проведения бизнес-аналитики. Подробно рассмотрены особенности работы с отечественным сервисом бизнес-аналитики Yandex DataLens. Приведены примеры и задания для самостоятельного освоения основных приёмов и способов работы с данным сервисом.
Вглоссарии представлены основные термины, используемые в биз- нес-анализе и смежных дисциплинах.
Учебное пособие адресовано студентам, магистрантам, аспирантам и практикам, специализирующимся в области экономики, биз- нес-информатики, экономической и бизнес-аналитики.
4
1.Наука о данных и большие данные (Data Science и Big Data)
В широком плане Data Science (наука о данных) теперь включает
всебя и использование методов для анализа огромных объёмов данных (Big Data) и извлечения содержащихся в них знаний. Условно взаимосвязь между Big Data и Data Science можно обозначить как отношения между сырой нефтью и нефтеперерабатывающим заводом.
Big Data – это общий термин для любого из наборов данных, настолько больших или сложных, что их становится трудно обрабатывать с использованием традиционных методов управления данными, таких как СУБД (системы управления реляционными базами данных). Получившая широкое распространение технология СУБД долгое время считалась универсальным решением, но возникшие потребности
вуправлении большими данными выявили её серьёзные недостатки. Для «больших данных» нет строгого определения. Изначально
идея состояла в том, что объём информации настолько вырос, что рассматриваемое количество уже фактически не помещалось в памяти компьютера, используемой для обработки, поэтому инженерам потребовалось модернизировать инструменты для анализа всех данных. Так появились новые технологии обработки, например модель MapReduce компании Google и её аналог с открытым исходным кодом – Hadoop от компании Yahoo1. Они дали возможность управлять намного бόльшим количеством данных, чем прежде. При этом важно, что их не нужно было выстраивать в аккуратные ряды или классические таблицы баз данных. На горизонте также появились другие технологии обработки данных, которые обходились без прежней жёсткой иерархии и однородности. В то же время интернет-компании, имеющие возможность собирать огромные массивы данных и острый финансовый
1Майер-Шенбергер В., Кукьер К. Большие данные. Революция, которая изменит то, как мы живём, работаем и мыслим / пер. с англ. И. Гайдюк. М.: Манн, Иванов и Фербер, 2014.
5
стимул для их анализа, стали ведущими пользователями новейших технологий обработки, вытесняя компании, у которых порой было гораздо больше опыта, но работали они автономно.
Главными характеристиками Big Data являются объём, разнообразие, скорость появления. Часто эти характеристики дополняют четвёртым критерием – достоверность. Насколько точны данные, насколько им можно доверять? Эти четыре основных характеристики отличают большие данные от данных, обрабатываемых традиционными инструментами управления данными. В результате проблемы анализа и управления Big Data могут проявляться практически во всех аспектах: сбор данных, хранение, поиск, обмен, передача и визуализация. Кроме того, большие данные требуют специализированных методов для извлечения знаний.
Современная наука о данных (Data Science) – это эволюционное расширение традиционной статистики в условиях необходимости обработки и анализа огромных объёмов данных. При этом возникла необходимость к традиционному статистическому анализу добавить возможности информационных технологий. Основные компетенции, которые отличают специалиста по анализу данных от традиционного статистика, – это способность работать с большими данными, а также владение технологией машинного обучения. Инструменты, с которыми работают эти специалисты, как правило, тоже различаются: в описаниях должностных обязанностей специалиста по анализу данных чаще упоминается необходимость использования Hadoop, R, Python, Java и других подобных продуктов.
Поскольку объём данных, используемых в самых разных сферах жизнедеятельности человека, продолжает расти, менеджеры и специалисты в самых разных областях бизнеса будут сталкиваться с проектами анализа больших данных в течение своей профессиональной карьеры.
Big Data и Data Science используются почти повсеместно как в коммерческих, так и в некоммерческих целях. Коммерческие компании практически во всех отраслях используют Big Data и Data Science для получения информации о своих клиентах, персонале, бизнес-процессах и продуктах. Многие компании используют эти технологии, чтобы предоставить клиентам более качественный сервис, а также для повышения объёмов продаж и персонализации своих предложений. Хорошим примером этого является сервис Google
6
AdSense1, который собирает данные о пользователях сети Интернет, чтобы соответствующие маркетинговые предложения могли быть сопоставлены с конкретным человеком. Данный маркетинговый сервис особенно полезен для повышения доходности небольших интернет-компаний, у которых отсутствуют средства для развития собственной системы продажи рекламы. С помощью своей интерактивной учётной записи клиент сервиса в любое время может просматривать количество запросов, кликов, рейтинг кликов, а также свои текущие доходы от использования AdSense.
Специалисты по работе с персоналом используют науку о данных для отбора кандидатов на вакантную должность, отслеживания состояния психологического климата в коллективе и изучения неформальной структуры организации.
Финансовые организации используют науку о данных для прогнозирования состояния фондовых рынков, определения риска кредитования и изучения того, как привлечь новых клиентов. В настоящее время примерно половина сделок в финансовой сфере по всему миру совершаются машинами, действующими на основе алгоритмов, разработанных специалистами по анализу данных с помощью методов Big Data и Data Science.
Правительственные организации также осознают ценность использования достижений науки о данных. Им приходится не только заниматься обработкой полученной информации, но и необходимо делиться результатами своего анализа с общественностью. Специалист по обработке данных в правительственной организации работает над различными проектами, например по выявлению мошенничества и другой преступной деятельности.
Неправительственные организации также активны в использовании методов анализа больших данных. Например, Всемирный фонд дикой природы (WWF) нанимает специалистов по обработке данных с целью повысить эффективность своих усилий по сбору средств для финансирования своих проектов.
Очень многие высшие учебные заведения используют Big Data и Data Science в своих исследованиях, а также для подъёма уровня образования своих студентов. Появление и распространение массовых от-
1Google Adsence. URL: https://www.seonews.ru/glossary/google-adsense/ (дата обращения: 22.08.2022).
7
крытых онлайн-курсов (MOOC) даёт много данных для анализа того, как этот тип обучения может дополнять традиционные занятия1.
Классификация данных
В Big Data и Data Science можно встретить множество различных типов данных, и каждый из них, как правило, требует для работы с ними различных методов и инструментов.
Основными типами данных являются2:
•структурированные данные;
•неструктурированные данные;
•данные на естественном языке;
•машинно-генерируемые данные;
•сетевые данные;
•аудиоданные, фото- и видеоизображения;
•потоковые данные.
Структурированные данные
Структурированные данные – это данные, которые зависят от модели данных и находятся в строго фиксированном месте в наборе данных. Поэтому легко хранить структурированные данные в таблицах в базах данных или файлах типа Excel (рис. 1). SQL (язык структурированных запросов) является предпочтительным способом управления данными, которые находятся в базах данных.
Рис. 1. Пример хранения данных в формате таблицы Excel
1 МООК, MOOC, или массовые открытые онлайн-курсы, и их классификация. URL: https://skillbox.ru/media/education/mook-mooc-ili-massovye-otkrytye-on- laynkursy-i-ikh-klassifikatsiya/ (дата обращения: 22.08.2022).
2 Дэви С., Арно М., Мохамед А. Основы Data Science и Big Data. СПб.: ПИТЕР, 2017.
8
Однако окружающий мир, как правило, не состоит из структурированных данных. Чаще всего данные приходят в неструктурированном виде.
Неструктурированные данные
Неструктурированные данные – это данные, которые не удаётся вписать в какую-либо модель данных. Примером неструктурированных данных является обычная электронная почта. Хотя письмо может содержать определённые структурированные элементы, такие как отправитель, тема, дата отправки и получения, текст письма, конечно, будет уникальным (если это не массовая рассылка спама). А наличие множества языков и различных диалектов внутри каждого языка ещё больше осложняет структурирование подобных данных.
Данные на естественном языке
Естественный язык – это особый тип неструктурированных данных, их особенно трудно обрабатывать, потому что помимо конкретных методов науки о данных нужно ещё знать и лингвистику. Технологии обработки естественного языка достигли определённых успехов в распознавании содержания текста. Но даже самые современные методы пока не в состоянии расшифровать значение каждого фрагмента текста. Скрытый смысл, эзопов язык, ирония и сарказм – не каждый человек может с первого раза их распознать, а тем более машина. К тому же смысл одних и тех же слов может варьироваться в зависимости от настроения человека.
Данные, сгенерированные машиной
Машинно-генерируемые данные – это информация, которая автоматически генерируется компьютером или другой машиной без вмешательства человека. В последнее время машинно-генерируемые данные стали одним из основных информационных ресурсов, и, судя по всему, их объём будет всё нарастать. Различные датчики, камеры и другие приборы, которые относят к «Интернету вещей», ежедневно генерируют огромные массивы данных.
Графы, или сетевые данные
Граф, или сетевые данные сети, – это данные, которые сосредоточены на взаимосвязи объектов. На основе графов, например, есте-
9
ственно представлять и анализировать социальные сети, иметь возможность количественно оценить некоторые показатели, допустим, личный авторитет человека в Сети или кратчайший путь между двумя людьми.
Примеры использования сетевых данных можно найти на многих социальных медиасайтах. Так, в профессиональной социальной сети LinkedIn можно увидеть на графе своих знакомых и узнать, в каких организациях они работают.
Сетевые базы данных используются для хранения данных на основе графов, в них применяется специализированный язык запросов – например, SPARQL1.
Аудиоданные, фото- и видеоизображения
Аудиоданные, фото- и видеоизображения – это типы данных, которые создают особые проблемы для специалистов по обработке данных. Для человека, как правило, нет большой сложности распознать голос своего знакомого или объекты на фотографии, но для компьютера эта задача очень сложна.
Одна из областей развития современных методов искусственного интеллекта (ИИ) как раз связана с распознаванием информации, представленной в звуковой или визуальной форме.
Потоковые данные
Хотя потоковые данные не являются, строго говоря, отдельным типом данных, они всё же имеют дополнительное свойство, которое позволяет выделить их в особую категорию. Эти данные поступают в систему, когда происходит событие, а не загружаются в хранилище данных в пакетном режиме. В этом их особая ценность – отражение событий и процессов в реальном режиме времени. Примерами могут служить данные с фондового рынка, прямые трансляции спортивных или музыкальных мероприятий.
Процесс обработки данных
В процессе обработки данных выделяют шесть основных этапов (рис. 2).
1Онтологическая модель как граф. Язык SPARQL. URL: https://trinidata.ru/tech_ sparql.htm (дата обращения: 22.08.2022).
10
