Работа с сервисом бизнес-аналитики Yandex DataLens. Учебное пособие
.pdf
ʿˀʽˉʫˁˁʽʥˀʤʥʽ˃ʶʰ ʪʤʻʻˏˈ
1. ʿʽˁ˃ʤʻʽʦʶʤ ˉʫʸʫʱ
2. ˁʥʽˀ ʪʤʻʻˏˈ
3. ʿʽʪʧʽ˃ʽʦʶʤ ʪʤʻʻˏˈ
4. ʤʻʤʸʰʯ ʪʤʻʻˏˈ
5. ʺʽʪʫʸː ʪʤʻʻˏˈ
6. ʿˀʫʯʫʻ˃ʤˉʰ˔
Рис. 2. Этапы процесса обработки данных
1. Постановка целей исследования
Если рассматривать коммерческие организации, для них главными являются бизнес-цели. Когда бизнес заказывает проект по анализу данных, он сначала готовит техническое задание. Это задание содержит следующую информацию: предмет анализа, какую выгоду от этого анализа желает получить компания, необходимые ресурсы, график реализации проекта и ожидаемые конкретные результаты.
2. Сбор данных
Вторым этапом является сбор данных. В случае со многими источниками можно просто системно собирать все доступные данные. Есть много способов управления потоками данных. Можно воспользоваться интерфейсом прикладного программирования (API) или собирать файлы с FTP-сервера, можно даже проводить анализ экранных данных и сохранять, что необходимо. Если это одноразовая задача, с ней легко справиться. Однако при частом обновлении или добавлении данных нужно решить, как работать с этим потоком. Для небольших таблиц или файлов может быть проще полностью заменять их новым, более масштабным набором данных. Для работы с более крупными массивами данных необходимо установить более сложный процесс с анализом изменений.
11
3. Подготовка данных
Сбор данных – это итеративный процесс, подверженный ошибкам. На этом этапе нужно последовательно улучшать качество данных и готовить их к использованию на следующих этапах.
Чтобы данные считались качественными, они должны отвечать ряду требований1.
Доступность. У аналитика должен быть доступ к данным. Это предполагает не только разрешение на их получение, но также наличие соответствующих инструментов, обеспечивающих возможность их использовать и анализировать. Например, в файле дампа памяти SQL содержится информация, которая может потребоваться аналитику, но не в той форме, в которой он сможет её использовать. Для работы с этими данными они должны быть представлены в работающей базе данных или в инструментах бизнес-аналитики, подключённых к этой базе данных.
Точность. Данные должны отражать истинные значения или положение дел. Например, показания неправильно настроенного термометра, ошибка в дате рождения или устаревший адрес – это всё примеры неточных данных.
Взаимосвязанность. Должна быть возможность точно связать одни данные с другими. Например, заказ клиента должен быть связан с информацией о нём самом, с товаром или товарами из заказа, с платёжной информацией и информацией об адресе доставки. Этот набор данных обеспечивает полную картину заказа клиента. Взаимосвязь обеспечивается набором идентификационных кодов или ключей, связывающих воедино информацию из разных частей базы данных.
Полнота. Под неполными данными может подразумеваться как отсутствие части информации (например, в сведениях о клиенте не указано его имя), так и полное отсутствие единицы информации (например, в результате ошибки при сохранении в базу данных потерялась вся информация о клиенте).
Непротиворечивость. Данные должны быть согласованными. Например, адрес конкретного клиента в одной базе данных должен совпадать с адресом этого же клиента в другой базе. При наличии
1Андерсон К. Аналитическая культура. От сбора данных до бизнес-результатов / пер. с англ. Ю. Константиновой; [науч. ред. Р. Салахиев]. М.: Манн, Иванов и Фербер, 2017.
12
разногласий один из источников следует считать основным или вообще не использовать сомнительные данные до устранения причины разногласий.
Однозначность. Каждое поле, содержащее индивидуальные данные, имеет определённое, недвусмысленное значение. Чётко названные поля в совокупности со словарём базы данных (подробнее об этом чуть позже) помогают обеспечить качество данных.
Релевантность. Данные зависят от характера анализа. Например, исторический экскурс по биржевым ценам Американской ассоциации землевладельцев может быть интересным, но при этом не иметь никакого отношения к анализу фьючерсных контрактов на свинину.
Надёжность. Данные должны быть одновременно полными (т. е. содержать все сведения, которые вы ожидали получить) и точными (т. е. отражать достоверную информацию).
Своевременность. Между сбором данных и их доступностью для использования в аналитической работе всегда проходит время. На практике это означает, что аналитики получают данные как раз вовремя, чтобы завершить анализ к необходимому сроку. У некоторых компаний время ожидания при работе с хранилищем данных составляет до одного месяца. В наше динамичное время при такой задержке данные становятся практически бесполезными (при сохранении издержек на их хранение и обработку), их можно использовать только в целях долгосрочного стратегического планирования и прогнозирования.
Ошибка всего в одном из этих аспектов может привести к тому, что данные окажутся частично или полностью непригодными к использованию или, хуже того, будут казаться достоверными, но приведут к неправильным выводам.
4. Анализ данных
Анализ данных направлен на более глубокое понимание собранных данных. Важно понять, как переменные взаимодействуют друг с другом, каково распределение данных во времени и в пространстве, существуют ли аномалии в данных. Выделяют шесть основных типов анализа данных. Они перечислены ниже от простого к сложному:
–описательный (descriptive);
–разведочный (exploratory);
–индуктивный (inferential);
–прогностический (predictive);
13
–каузальный (причинно-следственный) (causal);
–механистический (mechanistic)1.
5. Построение модели данных
На этом этапе может быть создана модель данных, чтобы ответить на вопрос, сформулированный как цель исследования. После выбора методов из области статистики, машинного обучения, исследования операций и т. д. строится модель данных. Построение модели – это итеративный процесс, который включает в себя выбор переменных для модели, построение самой модели и диагностику модели.
6. Презентация результатов
Получены результаты анализа данных. Эти результаты могут быть представлены в разных формах, начиная от простой презентации до составления объёмного научного отчёта. Иногда целесообразно автоматизировать процесс формирования отчёта о результатах, потому что компании может потребоваться использовать эту технологию в другом проекте или регулярно обновлять отчёты по мере поступления новых данных.
Описание поэтапного процесса обработки данных может создать впечатление, что этот процесс проходит линейно, но на самом деле часто приходится возвращаться и пересматривать определённые выводы и результаты. Например, на этапе исследования данных могут быть обнаружены аномалии, указывающие на ошибки импорта данных. В рамках процесса изучения данных можно получить дополнительную информацию, которая может привести к появлению новых вопросов. Однако, чтобы избежать серьёзных переделок, необходимо убедиться, что вы чётко и тщательно сформулировали бизнес-цель своего проекта с самого начала.
Технологии и инструменты Big Data и Data Science
В настоящее время существует множество инструментов и технологий для работы с большими данными. Экосистему больших данных можно представить в виде групп технологий, имеющих схожие цели и функциональные возможности.
1 Андерсон К. Указ. соч.
14
Распределённая файловая система
Распределённая файловая система похожа на обычную файловую систему, за исключением того, что она работает на нескольких серверах одновременно. Поскольку это всё же файловая система, в ней можно делать почти то же самое, что и в обычной файловой системе, только в больших масштабах. Такие операции, как хранение, чтение и удаление файлов, а также повышение безопасности файлов, лежат в основе любой файловой системы, включая распределённую.
Распределённые файловые системы обладают значительными преимуществами:
•Они могут хранить файлы размером больше, чем твёрдый диск компьютера.
•Файлы автоматически реплицируются на нескольких серверах для обеспечения избыточности или для выполнения параллельных операций, а для пользователя всё это незаметно.
•Система легко масштабируется: больше нет ограничений по памяти.
Впрошлом масштабирование увеличивалось за счёт перемещения всего объёма информации на сервер с бόльшим объёмом памяти. В настоящее время можно просто добавить ещё один небольшой сервер (горизонтальное масштабирование). Этот принцип делает потенциал масштабирования практически неограниченным.
Наиболее известной распределённой файловой системой на данный момент является файловая система Hadoop1. Это реализация файловой системы Google с открытым исходным кодом. Однако существует множество других распределённых файловых систем: кластерная файловая система Red Hat, файловая система Ceph, файловая система Tachyon и др.
Структура интеграции данных
После создания распределённой файловой системы вам необходимо добавить данные. Данные следует перемещать из одного источника в другой, и именно здесь работают такие платформы интеграции данных, как Apache Sqoop и Apache Flume excel2. Этот процесс
1Применение Hadoop Distributed File System. URL: https://www.bigdataschool.ru/ wiki/hdfs (дата обращения: 22.08.2022).
2Sqoop – Краткое руководство. URL: https://coderlessons.com/tutorials/bolshie- dannye-i-analitika/uznaite-sqoop/sqoop-kratkoe-rukovodstvo (дата обращения: 22.08.2022).
15
аналогичен процессу извлечения, преобразования и загрузки данных в традиционном хранилище данных.
Технологии машинного обучения
Как только данные будут собраны, пришло время извлечь полезную информацию. Здесь можно опираться на методы машинного обучения, статистики и прикладной математики. До Второй мировой войны всё приходилось рассчитывать вручную, что сильно ограничивало возможности анализа данных. После Второй мировой войны были разработаны компьютеры и специальное программное обеспечение. Компьютер стал способен выполнять практически любые вычисления, и перед исследователями и практиками открылся целый мир возможностей. После этого прорыва людям просто нужно было вывести математические формулы, записать их в алгоритм и загрузить свои данные.
При огромном объёме данных, доступных сегодня, компьютер больше не в состоянии самостоятельно справляться с рабочей нагрузкой. Для обработки этого объёма данных требуются специальные технологии и библиотеки. Самой популярной библиотекой машинного обучения для Python является Scikit-learn.
Базы данных NoSQL
Для хранения больших объёмов данных требуется программное обеспечение, которое специализируется на управлении и запросах этих данных. Традиционно при управлении данными использовались реляционные базы данных, такие как Oracle SQL, MySQL, Sybase IQ и др. Хотя они по-прежнему являются предпочтительной технологией для многих вариантов использования, для управления большими данными появились базы данных NoSQL.
Название этой группы может вводить в заблуждение, потому что «No» в данном контексте означает «не только». Недостаток функциональности в SQL не является основной причиной смены парадигмы, и во многих базах данных NoSQL даже есть версия SQL, похожая на неё. Однако традиционные базы данных имеют серьёзные недостатки, которые не позволяют им хорошо масштабироваться. Решая некоторые обычные проблемы с базами данных, базы данных NoSQL обеспечивают управление почти бесконечным ростом данных.
16
Появилось много новых баз данных, например:
•Базы данных столбцов – данные хранятся в столбцах, что позволяет алгоритмам выполнять гораздо более быстрые запросы. Новые технологии используют сотовое хранилище.
•Хранилища документов – они больше не используют таблицы, а хранят все элементы управления в файлах. Это позволяет создавать гораздо более гибкие планы управления данными.
•Потоковые данные – преобразование и агрегирование данных происходит не пакетами, а в режиме реального времени.
•Пакетные запросы SQL в Hadoop. Пакетные запросы Hadoop выполняются на языке типа SQL, который использует платформу Map-Reduce в фоновом режиме.
•Новый SQL – этот класс баз данных сочетает в себе масштабируемость баз данных NoSQL с преимуществами реляционных баз данных. Все они имеют интерфейс SQL в реляционной модели данных.
•Графические базы данных – не все данные лучше всего хранить
водной таблице. Некоторые данные более естественно хранить
вбазах данных графов. Классическим примером этого является социальная сеть.
Инструменты планирования
Инструменты планирования помогают автоматизировать повторяющиеся задачи и запускать задачи на основе таких событий, как добавление нового файла в папку. Они похожи на такие инструменты, как Cron в Linux, но разработаны специально для больших данных.
Инструмент сравнительного анализа (бенчмаркинга)
Этот класс устройств был разработан для оптимизации развёртывания больших объёмов данных за счёт предоставления стандартизированных наборов профилирования. Пакет презентаций представляет собой репрезентативный набор сервисов для обработки больших данных. Сравнительный анализ, оптимизация и управление инфраструктурой больших данных часто необходимы не для самих специалистов по обработке данных, а для профессионалов в области развёртывания ИТ-инфраструктуры. Использование оптимизированной инфраструктуры может привести к значительной разнице в затратах. Например, если вы можете получить 10 % при-
17
были на одном кластере из 100 серверов, то вы сможете сэкономить стоимость 10 серверов.
Безопасность
Инструменты безопасности больших данных обеспечивают централизованный и точный контроль доступа к данным. Безопасность больших данных сама по себе стала отдельным предметом, и исследователи данных обычно сталкиваются с этим только как потребители данных; они редко внедряют инструменты безопасность сами. Это работа скорее для эксперта по безопасности.
Визуализация данных для конечного пользователя
Часто специалистам по данным приходится передавать информацию конечному пользователю. Результаты анализа данных могут быть сообщены различными способами.
Сейчас всё чаще прибегают к использованию различных форм визуализации данных для облегчения процесса коммуникации с конечным пользователем. Более того, многие инструменты визуализации данных обладают дружественным интерфейсом и не требуют особых навыков и длительного процесса обучения.
Существует несколько альтернатив программного обеспечения для представления ваших цифр и информации в привлекательной визуальной форме.
Можно использовать проверенные специализированные программные пакеты от известных разработчиков, таких как Tableau, MicroStrategy, Qlik, SAP, IBM, SAS, Microsoft, Spotfire. Все эти компании предлагают инструменты создания информационной интерактивной панели, с помощью которой практически любой пользователь становится аналитиком данных.
Как Big Data и Data Science изменяют бизнес в разных сферах
Здравоохранение. Ожидается, что персонализированная медицина – индивидуальный уход и лечение, основанные на медицинских данных отдельных пациентов, – даст более эффективные результаты, чем традиционная медицина. Врачи уже могут использовать науку о данных, чтобы разработать план лечения, соответствующий индивидуальной природе пациента, вместо того чтобы лечить его лекарством, которое якобы работает в 60 % случаев. Наука о данных
18
рассматривается также как потенциальное решение для стимулирования разработки лекарств, что в настоящее время является долгим и дорогостоящим процессом с высокой степенью неопределённости – до 90 % разработанных лекарств так и не попадают на рынок. Наука о данных уже играет ключевую роль в процессе открытия лекарств. Например, биотехнологическая компания Amgen использует продвинутую аналитику для выявления потенциальных сбоев или опасных взаимодействий пациентов с лекарствами и отдаёт приоритет тем лекарствам, у которых более высокие показатели успеха.
Туризм и путешествия. Компании используют большой список имеющихся у них данных, включая бронирование маршрутов и гостиниц, приобретённые клиентами дополнительные услуги, для создания персонализированных предложений и стимулирования роста бизнеса. Показательный пример – небольшие туристические компании, использующие данные для разделения клиентов на сегменты (например, одинокие путешественники с ограниченным бюджетом, семейный пары со средним бюджетом), вместо того чтобы конкурировать за всех клиентов сразу. Ещё одна тенденция – динамическое ценообразование, которое всё чаще используется авиакомпаниями и отелями. На основе передовых инструментов прогнозной аналитики авиакомпании предлагают уникальные структуры тарифов для каждого маршрута и каждого дня вылета. Аналогичным образом отели корректируют свои цены, снижая тарифы в середине недели и повышая их в выходные и праздничные дни.
Отрасль высоких технологий. Взрывной рост объёма доступных данных, который переживает отрасль высоких технологий, в сочетании с переходом от аппаратных к платформенным экосистемам привёл к появлению бизнес-моделей «Продукт как услуга». Продажа подписки (пользователи подписываются на доступ к программному обеспечению или услуге) является одной из таких моделей. «Устройство как услуга» – это ещё одна модель, которая помогает пользователям снизить затраты на управление парком необходимых для бизнеса устройств. Они могут приобрести некий аппарат (мобильный телефон, ноутбук, настольный компьютер или планшет) вместе с услугами и программным обеспечением, которые поддерживаются и управляются одним поставщиком услуг по контракту на основе подписки.
Финансовые услуги. Алгоритмическая торговля на финансовых рынках уже стала синонимом больших данных. Многие финансовые
19
игроки используют обширные исторические данные вместе со сложными математическими моделями для максимизации доходности своего портфеля. Кроме того, в отрасли широко используется анализ больших данных для принятия более эффективных инвестиционных решений. Большие данные и аналитика также играют ключевую роль в ситуациях выявления мошенничества и управления рисками. Например, система мониторинга и управления рисками мошенничества компании Alibaba (Китай) улавливает сигналы мошенничества непосредственно из огромного объёма данных о поведении пользователей, анализирует их в режиме реального времени с помощью машинного обучения и довольно точно позволяет выявлять подозрительные транзакции.
Добыча природных ресурсов. Энергетические компании используют прогнозную аналитику для улучшения технического обслуживания оборудования. Теперь компании имеют возможность анализировать и прогнозировать ситуации, последствия которых могут оказаться очень дорогостоящими. Это могут быть перебои в работе оборудования или проблемы с его техническим обслуживанием. Например, нефтегазовая компания Woodside внедряет прогнозную аналитику для технического обслуживания и управления производственными процессами на своих предприятиях по производству сжиженного природного газа (СПГ). Ожидается, что это поможет компании снизить эксплуатационные расходы и сохранить темпы роста объёмов производства.
Бизнес-анализ и системы поддержки принятия решений (DSS – decision support system)
Бизнес-анализ в узком смысле – это только промежуточный этап в целом управленческом цикле. Анализ не нужен сам по себе, он должен помогать принимать эффективные управленческие решения. С появлением компьютеров и информационных технологий стал развиваться специальный класс программного обеспечения, предназначенный для поддержки принятия управленческих решений – DSS.
Аналитика имеет решающее значение для совершенствования бизнес-процессов. Аналитика – это инструменты, которые помогают компаниям определить те признаки, по которым они лучше всех в своей отрасли, и воспользоваться этими преимуществами. Как только организация определила такие признаки, она может применять обширные данные, статистический и количественный анализ для
20
