Статистическое управление процессами. «Большие данные». Учебное пособие
.pdf
|
Окончание табл. 1 |
|
|
Метод |
Краткое описание метода |
23. Имитационное |
Создание моделей поведения сложных систем, применяемых |
моделирование |
для прогнозирования возможных будущих состояний и/или |
(Simulation) |
сценарного планирования |
24. Анализ времен- |
Совокупность методов для анализа последовательностей |
ных рядов |
данных, характеризующих изменение некоторых параметров |
(Time Series Analysis) |
объекта во времени, с целью содержательного описания |
|
такого объекта |
25. Ненаправляемое |
Совокупность методов машинного обучения, нацеленных на |
обучение (обучение |
выявление скрытых взаимосвязей между объектами за счет |
без учителя) |
анализа произвольных (unlabeled) данных |
(Unsupervised Learn- |
|
ing) |
|
26. Визуализация |
Методы создания изображений, диаграмм, анимации, |
(Visualization) |
используемых для коммуникаций, улучшения понимания |
|
самих данных и результатов их анализа |
П р и м е ч а н и е. Краткие описания методов приводятся с учетом формулировок |
|
рассматриваемого отчета [55]. |
|
Таким образом, в настоящее время «большие данные» опираются на многочисленные методы, создававшиеся на протяжении многих десятилетий. По-видимому, трудно было ожидать чего-то другого. В то же время нельзя исключать, что в процессе адаптации этих методов к задачам применения «больших данных» будут созданы новые методы анализа, либо существующие методы «мутируют» настолько, что их вполне можно будет рассматривать как новые.
11. Программные продукты
Выше отмечалось, что появление «больших данных» обусловлено бурным развитием информационно-телекоммуникационных технологий, что сопровождалось в том числе количественным наращиванием объемов данных, их качественным усложнением, стремительным нарастанием разнообразия. В какой-то момент стало очевидным, что устоявшиеся технологические решения не в состоянии справиться с новым вызовом вовлечения накапливаемых массивом данных в экономическую деятельность. Пренебрежительное отношение к таким данным ведет к потерям, которых хотелось бы избежать. Для решения этой задачи нужны новые технологические подходы.
В отчете [55] приведен перечень технологий, которые сегодня фигурируют в контексте задач «больших данных». Разумеется, нет возможности обсуждать все эти технологии в рамках данной работы.
31
Однако одну из технологий – Hadoop – стоит затронуть хотя бы на самом общем уровне, так как она находит наибольше распространение и наиболее обсуждаема в сообществе специалистов.
Система Hadoop представляет собой свободно распространяемый набор утилит, библиотек и программный каркас для разработки и выполнения распределенных программ, работающих на кластерах из сотен и тысяч узлов [57; 58]1.
Отличительные особенности Hadoop следующие:
• Доступность. Hadoop работает на больших кластерах общераспространенных (commodity) компьютеров или в таких облачных сервисах, как Elastic Compute Cloud (EC2) компании Amazon2.
• Надежность. Так как пакет Hadoop ориентирован на работу на обычных, общедоступных компьютерах, его архитектура предусматривает возможность частых сбоев и позволяет успешно справляться с большинством из них.
• Масштабируемость. Hadoop предусматривает возможность очень простого расширения вычислительных мощностей посредством добавления в кластер дополнительных узлов – общедоступных компьютеров, которых в одном кластере могут быть сотни.
• Простота. Hadoop предоставляет пользователям возможность быстрого написания эффективного программного кода.
Совокупность этих свойств делает Hadoop востребованной технологией в самых различных секторах и применениях. Доступность и простота позволяют быстро и дешево создавать кластеры Hadoop даже учащимся колледжей. Надежность и масштабируемость делают Hadoop привлекательным даже в самых крупных и технологически требовательных проектах и компаниях, таких как Yahoo и Facebook, например.
Ключевые элементы Hadoop – распределенная файловая система
HDFS (Hadoop Distributed File System) и MapReduce – технология распределенных параллельных вычислений над очень большими наборами данных в компьютерных кластерах. Отметим лишь наиболее принципиальные особенности этих технологических элементов.
1 Указанные источники рекомендованы компанией IBM в качестве учебных пособий для изучения технологии Hadoop.
2 Компания Amazon – мировой лидер (но не монополист) в области предоставления облачных сервисов. Облачные вычисления и сервисы стремительно развиваются во многих странах мира, в том числе и в России. Хороший обзор состояния и перспектив развития «облаков» в нашей стране приведен в источнике [59].
32
Распределенная файловая система HDFS функционирует таким образом, что если требуется обеспечить работу вычислительной системы с очень большим блоком данных (например, несколько терабайт), то этот блок разбивается на более мелкие блоки (обычно 64 МБ), которые распределяются по многочисленным компьютерам, составляющим кластер Hadoop. Затем HDFS обеспечит параллельную работу вычислительной системы с каждым малым блоком. В результате кластер простых общедоступных компьютеров справляется с большой вычислительной задачей намного быстрее, чем одиночный сервер с самыми передовыми техническими характеристиками. К тому же затраты на создание кластера будут меньшими по сравнению с затратами на высокопроизводительные серверы.
Другая техническая особенность Hadoop заключена в самой философии работы с данными. Традиционно в работе с данными используется подход, предусматривающий неоднократную передачу данных между клиентами и сервером. Этот подход вполне оправдан, когда объемы данных сравнительно невелики. Однако в «больших данных» мы имеем дело с большими объемами данных по определению. Перемещение таких данных становится очень затратной проблемой. Поэтому философия взаимодействия данных и вычислительных программ меняется на прямо противоположную: данные остаются там, где они изначально сохранены в рамках кластера Hadoop, а пересылаются от клиента к серверу вычислительные программы MapReduce, размеры которых обычно очень малы (килобайты). Как говорится, если гора не идет к Магомету, Магомет идет к горе.
Еще одна важная особенность Hadoop касается принципов построения баз данных. В большинстве сегодняшних приложений используются реляционные базы данных, в качестве ключевого элемента которых выступает технология SQL (Structured Query Language). Ключевое слово в этом наименовании – Structured (структурированный). Оно «выдает» тот факт, что реляционные базы данных и SQL ориентированы на работу с хорошо структурированными данными, подразумевающую тщательный заблаговременный выбор полей и таблиц, в которых данные будут храниться, установление четких взаимосвязей между ними и т.п.
Но, как уже обсуждалось, задачи «больших данных» подразумевают работу не только с хорошо структурированными данными, но и с полу- и неструктурированными данными. Применение технологии реляционных баз данных и SQL в таких случаях было бы сопряже-
33
но со значительными затратами либо вообще не возможно. Нужны иные технологические подходы к работе с такими данными. Поэтому в подходе Hadoop в качестве элементарной единицы данных использует пары «ключ – значение». Другими словами, исходные данные могу поступать в Hadoop в любой форме, однако в какой-то момент они преобразуются в пары «ключ – значение». В качестве технологии формирования и обработки запросов к данным, структурированными по принципу «ключ – значение», вместо SQL используются программы MapReduce, которые предъявляют принципиально иные (существенно менее строгие) требования к структурированности данных и обеспечивают принципиально иной уровень работы с ними.
Разумеется, здесь приведены лишь наиболее примечательные особенности применяемого в задачах «больших данных» аппаратного и программного обеспечения. Более детальное изложение данного вопроса выходит за рамки настоящей работы. Всем, кто заинтересован более глубоким изучением технологии Hadoop, можно лишь порекомендовать обратиться к специальным источникам.
12. Сферы применения
Потенциальные сферы применения «больших данных» отличаются широким разнообразием секторов экономики, способов получения экономической отдачи, проблем, возникающих при первых попытках практического применения. Все эти вопросы заслуживают отдельного обсуждения. Здесь ограничимся лишь простым перечислением областей, применение в которых технологий «больших данных» активно обсуждается.
Так, в отчете [55] подробно излагаются результаты исследований перспектив «больших данных» в здравоохранении и медицине, государственных услугах, розничной торговле, различных производственных отраслях, телекоммуникационной отрасли и т.д. В работе [56] в качестве перспективных сфер применения и функций управления указаны сама информационно-технологическая отрасль, финансы и страхование, энергетика, маркетинг и рискменеджмент применительно ко многим сферам деятельности.
Вработе [57], помимо уже упомянутых отраслей, в качестве возможного бенефициара «больших данных» указано издательское дело.
Вработе [58] разнообразные аспекты применения «больших данных» в области информационно-технологических и телекоммуникационных услуг обсуждаются подробно.
34
В публикации [60] в качестве перспективных отраслей дополнительно упоминаются медиасфера и развлечения, биотехнологии, транспорт и логистика, коммунальные услуги.
Можно продолжать перечислять перспективные сферы применения, но уже приведенных ссылок вполне достаточно, чтобы осознать их разнообразие. Вряд ли стоит сомневаться, что со временем это разнообразие будет только нарастать.
Серьезную заинтересованность в развитии «больших данных» проявляет правительство Соединенных Штатов Америки. В марте 2012 г. президент США Б. Обама объявил о запуске Инициативы по исследованиям и разработкам в области «больших данных» (Big Data Research and Development Initiative) [61]. В официальном сообщении на этот счет указывается на значительную потенциальную ценность «больших данных» в разрешении актуальных государственных задач США. В качестве первого шага на проведение НИОКР в этой области выделено 200 млн долл. государственных средств.
Научно-исследовательская работа в области «больших данных» ведется в рамках десятков государственных программ, которые проходят через целый ряд министерств и ведомств США [62]:
–Министерство обороны (Department of Defense);
–Министерство внутренней безопасности (Department of Homeland Security);
–Министерство энергетики (Department of Energy);
–Министерство по делам ветеранов (Department of Veteran Administration);
–Министерство здравоохранения и социальных служб (Department of Health and Human Services);
–Национальный архив (National Archive & Records Administration);
–Национальное агентство по аэронавтике и исследованию космического пространства США – НАСА (National Aeronautics & Space Administration – NASA);
–Национальный фонд искусств и гуманитарных наук (National Endowment for the Humanities);
–Национальные институты здоровья (National Institutes of Health);
–Национальный научный фонд (National Science Foundation);
–Национальное агентство безопасности (National Security Agen-
cy);
–Геологическая служба США (United States Geological Survey).
35
Приведенный в [62] перечень государственных программ НИОКР также свидетельствует о широком разнообразии потенциальных сфер применения «больших данных» для решения актуальных государственных и общественных задач.
Финансовые услуги – одна из сфер бизнеса, где применение технологий Big Data может приносить хорошие бизнес-результаты уже в обозримом будущем. Во всяком случае, в этом уверена консалтинговая компания Deloitte [62, 63].
Одним из возможных направлений применения технологий «больших данных» специалисты этой фирмы считают анализ тональности мнений в социальных сетях (Sentiment Analysis), который представляет собой класс методов контент-анализа, предназначенных для автоматизированного выявления в текстах эмоционально окрашенной лексики и эмоциональной оценки реакции авторов по отношению к объектам, речь о которых идет в тексте.
Изучение тональности мнений – интересный аналитический подход применительно к финансовому сектору и бизнесу вообще, однако, говорят в Deloitte, не стоит преувеличивать его возможности. Это связано с целым рядом факторов. К примеру, сообщения, размещаемые в социальных сетях, могут и не отражать весь спектр мнений относительно конкретного бренда. К тому же финансовые услуги – это не та тема, которая обсуждается в сетях слишком активно. Можно привести и другие соображения.
На концептуальном уровне основной недостаток классического анализа тональности, который нужно преодолеть, – отсутствие интерактивности во взаимодействии с потребителями. Иными словами, данные, собираемые и анализируемые методами Sentiment Analysis, нужно тут же «возвращать» в процесс взаимодействия с потребителями, иначе извлечь из них какую-то практическую пользу (ценность) не удастся.
На рис. 3 показана принципиальная схема взаимодействия между поставщиком и потребителем в контексте использования технологий «больших данных». В качестве отправной точки рассматривается процесс потенциального потребления финансовых услуг, включающий четыре этапа (шага). Процесс запускается с осознания потенциальным потребителям финансовой потребности (потребности в некоторых финансовых услугах). Осознав потребность, потенциальный клиент начинает поиск вариантов ее удовлетворения. В какойто момент времени он делает свой выбор и принимает решение о
36
покупке. Процесс потребления финансовой услуги может продолжаться в течение длительного времени.
Процессы поставщика Процессы потребителя
|
|
|
|
|
|
|
|
|
|
|
|
|
|
Результаты |
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
потребителя |
|
Финансовая |
|
|
Поиск вариантов |
|
|
Выбор и принятие |
|
|
Удовлетворение |
и поставщика |
|||||
потребность |
|
|
удовлетворения |
|
|
решения о |
|
|
потребности на |
|
|
||||
потенциального |
|
|
|
|
|
|
непрерывной |
|
|
||||||
|
|
потребности |
|
|
покупке |
|
|
|
|
||||||
потребителя |
|
|
|
|
|
|
основе |
|
|
||||||
|
|
|
|
|
|
|
|
|
|
|
|
||||
|
|
|
Кастомизированная информация о продукте под конкретного потребителя |
|
|
|
Кастомизированное предложение конкретному потребителю |
|
|
|
Помощь потребителю, общение, отслеживание результатов |
|
|
|
|
Обучение, информирование и вовлечение потенциальных потребителей |
|
|
|
|
|
|
|
|
|
|
|
|
|||
|
|
|
Данные |
|
|
|
Данные |
|
|
|
Данные |
|
Данные |
||
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
Анализ данных
Рис. 3. Принципиальная схема интерактивного взаимодействия между поставщиком финансовых услуг и потребителями
Цель применения технологий Big Data и методов анализа контекста финансовых услуг состоит в том, чтобы выявлять нюансы и воздействовать на поведение потенциального потребителя на всех этапах процесса потребления. Основная задача – индивидуализировать (кастомизировать) воздействие под каждого конкретного потребителя в условиях широкого разнообразия и быстрого изменения потребностей. Традиционный подход «выстрелил и забыл», применявшийся в сфере финансовых услуг на протяжении длительного периода времени, себя исчерпал. В сегодняшних условиях значительные конкурентные преимущества можно создать в ходе непрерывного диалога между поставщиками и потребителями. Такое взаимодействие нужно выстраивать как на индивидуальной, так и на групповой основе для более точного и своевременного выявления непрерывно эволюционирующих потребностей и формулирования индивидуальных предложений. Такой подход должен привести к
37
непрерывному обновлению номенклатуры предоставляемых услуг, росту их качества, уровня удовлетворенности со стороны потребителей, что в итоге обеспечит долгосрочный прибыльный рост бизнеса.
Основные механизмы создания ценности за счет применения технологий Big Data следующие:
–во взаимоотношениях между поставщиками и потребителями переход от принципа «выталкивания» (поставщик продает то, что
унего есть) к принципу «вытягивания» (потребитель получает индивидуальное предложение по цене в объемах и сроки, которые его устраивают) – в духе концепции бережливого производства (lean production);
–выстраивание подлинно взаимовыгодных отношений между поставщиками и потребителями, предполагающее тесное сотрудничество в процессе создания ценности;
–поощрение поставщиком тесного взаимодействия между потребителями, в том числе через социальные сети;
–установление связей между поставщиком и независимыми сообществами и социальными группами;
–усиление внутренних связей между сотрудниками поставщика, расширение взаимодействия на потребителей, поставщиков и иных партнеров;
–создание новых благоприятных возможностей для улучшения процессов маркетинга, продаж, послепродажного обслуживания.
Таким образом, с точки зрения путей дальнейшего совершенствования деятельности финансовых структур не предлагаются никакие принципиально новые подходы. Однако, считают оптимисты, применение технологий Big Data в сочетании с адекватными методами анализа позволит решать актуальные бизнес-задачи на принципиально новом уровне.
Тезис о важности перехода к модели устойчивого развития (Sustainable Development) активно обсуждается во всем мире на протяжении многих десятилетий. Основная цель, достигаемая при реализации модели устойчивого развития, состоит в гармонизации различных интересов – экономики (бизнеса и иных субъектов рынка), общества и окружающей среды.
Устойчивое производство (Sustainable Manufacturing) – важная составная часть этого глобального движения. Министерство торговли США (Department of Commerce) под устойчивым производством понимает создание промышленной продукции с использованием процес-
38
сов, которые не загрязняют среду (non-polluting), сохраняют энергию и природные ресурсы, экономически целесообразны и безопасны для работников, местных жителей (communities) и потребителей [64]. Существуют и другие определения устойчивого производства.
Решить задачу перехода компаний к устойчивому производству далеко непросто. Именно поэтому специалисты многих стран разрабатывают различные методические рекомендации, которые помогали бы руководителям бизнеса продвигаться на этом непростом пути. Одним из удачных примеров рекомендаций такого рода можно считать руководство Организации по экономическому сотрудничеству и развитию (ОЭСР) по переходу к устойчивому производству [65].
Вэтом документе первостепенного внимания заслуживает тезис
отом, что всю концепцию устойчивого производства нельзя рассматривать в качестве навязчивого предложения решать проблемы окружающей среды за счет бизнеса. Мотивация движения прямо противоположна: последовательная реализация концепции устойчивого производства призвана гармонизировать интересы всех заинтересованных сторон, в том числе позволяет создавать новую ценность для самого бизнеса на систематической основе. Ключевые выгоды для бизнеса, создаваемые при переходе к устойчивому производству, следующие: прирост финансовых показателей (Financial Performance); рост уровня совершенства бизнеса (Business Excellence); укрепление отношений с различными заинтересованными сторонами (Relationships with Stakeholders).
Всоответствии с рекомендациями ОЭСР переход к устойчивому производству должен осуществляться на постепенной основе за счет реализации непрерывного цикла совершенствования деятельности. Цель этого цикла – обеспечить непрерывное улучшение результатов работы компании по 18 ключевым показателям1 (табл. 2).
Цикл совершенствования деятельности по указанным показателям устойчивости включает семь шагов2 (табл. 3).
1 Этот перечень показателей носит ориентировочный характер. В зависимости от ситуации конкретные предприятия могут применять и другие показатели. В силу принципа постепенности компании не обязаны применять все показатели сразу, а могут остановиться лишь на некоторых из них, постепенно расширяя их номенклатуру
2 Как следует из табл. 3, предлагаемый цикл представляет собой одну из бесчисленных вариаций цикла Шухарта–Деминга – концептуальной основы современного менеджмента качества.
39
Таблица 2
Аспекты деятельности и показатели устойчивости производства
Аспект деятельности |
Показатели устойчивости производства |
|
|
|
|
|
I1. Содержание невозобновляемых видов сырья и |
|
1. Материалы на |
материалов во входных материалах |
|
|
||
входе в производ- |
I2. Содержание веществ ограниченного применения во |
|
ство |
входных материалах |
|
(Inputs) |
|
|
I3. Содержание перерабатываемых материалов и материалов |
||
|
||
|
повторного использования во входных материалах |
|
|
|
|
|
O1. Объемы потребления воды |
|
|
|
|
|
O2. Объемы потребления энергии |
|
|
|
|
|
О3. Доля возобновляемых видов энергии в общем энергопо- |
|
|
треблении |
|
2. Производствен- |
|
|
O4. Объемы парниковых выбросов |
||
ные операции |
||
|
||
O5. Объемы отходов производства |
||
(Operations) |
||
|
||
|
O6. Объемы воздушных выбросов производства |
|
|
|
|
|
O7. Объемы сточных вод |
|
|
|
|
|
O8. Доля земли в естественном состоянии в суммарной |
|
|
площади территории, занимаемой предприятием |
|
|
|
|
|
P1. Содержание переработанных или повторно |
|
|
используемых материалов в готовой продукции |
|
|
|
|
|
P2. Содержание перерабатываемых или повторно |
|
|
используемых материалов в готовой продукции |
|
|
|
|
|
P3. Содержание возобновляемых материалов в готовой |
|
|
продукции |
|
|
|
|
3. Готовая продук- |
P4. Содержание невозобновляемых материалов в готовой |
|
ция |
продукции, отнесенное к длительности жизненного цикла |
|
(Products) |
продукции |
|
|
|
|
|
P5. Содержание веществ ограниченного применения в |
|
|
готовой продукции |
|
|
|
|
|
P6. Энергопотребление при использовании готовой |
|
|
продукции |
|
|
|
|
|
P7. Выбросы парниковых газов при использовании готовой |
|
|
продукции |
|
|
|
Реализация указанных шагов цикла на практике неизбежно связана со сбором, хранением, анализом, представлением и использованием больших массивов разнообразных данных.
Актуальность перехода к устойчивой модели развития в полной мере осознана правительствами передовых стран. Ряд государствен-
40
