Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Статистическое управление процессами. «Большие данные». Учебное пособие

.pdf
Скачиваний:
0
Добавлен:
11.08.2026
Размер:
610 Кб
Скачать

Попросту говоря, это означает, что любой бизнес создает, хранит и использует огромные массивы данных о своих потребителях, поставщиках, производственных операциях. IT-компании ежесекундно собирают данные обо всех «телодвижениях» своих клиентов. Мир вступил в эпоху «Интернета вещей»: разнообразные «умные» устройства собирают и обмениваются самыми различными данными без участия человека. Человечество попало «в плен» социальных сетей, миллиарды людей проводят значительную часть своего времени в режиме «он-лайн». Это сопровождается в том числе генерацией разнородной информации об их вкусах, привычках, потребностях, предпочтениях.

Примечательно, что все эти данные создаются до и вне самой постановки вопроса о «больших данных». Другими словами, со сбором потенциально ценных «больших данных» не сопряжены никакие дополнительные затраты, такие данные собираются «автоматически» посредством уже используемых программно-аппаратных средств. Однако сегодня эти данные никак не используются. С таким расточительством, считают энтузиасты «больших данных», нужно заканчивать, «выбрасываемые» сегодня данные могут и должны быть вовлечены в «хозяйственный оборот».

2. «Большие данные» могут создавать ценность.

Изучая вопрос о том, как можно использовать «большие данные», исследователи выявили несколько способов, прибегнув к которым можно извлечь значительную пользу:

1)  «большие данные» создают прозрачность функционирования бизнеса и других организаций. Нужно сделать данные оперативно доступными различным заинтересованным сторонам. Это позволит повысить эффективность и результативность многих хозяйственных операций;

2)  «большие данные» позволяют проводить различные управляемые (планируемые) эксперименты для выявления существующих нужд, оценки изменчивости (вариабельности) операций и улучшения результатов работы;

3)  «большие данные» позволяют по-новому сегментировать потребителей, причем осуществлять такое сегментирование (в том числе микросегментирование) в реальном времени, предлагая целевым сегментам точно подогнанные маркетинговые сообщения и стимулы;

4)  «большие данные» могут значительно улучшить процесс принятия решений. Утверждается, что «большие данные» предлагают принципиально новый уровень аналитики, которая позволяет суще-

21

ственно снизить риски, связанные с теми или иными решениями, а также стимулируют выдвижение таких идей, которые без «больших данных» сформулировать не удалось бы. Также заявлено, что благодаря «большим данным» можно автоматизировать принятие многих решений, которые сегодня принимаются «вручную»;

5) «большие данные» позволят улучшать существующие или создавать новые продукты и услуги или даже модели бизнеса. Другим словами, «большие данные» обладают существенным инновационным потенциалом.

Таким образом, исследователи McKinsey Global Institute констатировали, что «большие данные» предлагают богатые возможности для создания разнообразных конкурентных преимуществ. Эта констатация очень интересна, однако важно разобраться, в чем конкретно состоит новизна применения «больших данных» по сравнению с теми подходами, которые применялись ранее.

3. Использование «больших данных» становится ключевым инструментом поддержания конкурентоспособности и обеспечения роста многих видов бизнеса.

Этот пункт органически вытекает из предыдущего. Ведь приведенные выше подходы к созданию ценности представляют собой не что иное, как способы обеспечения конкурентных преимуществ. Так, говоря о прозрачности бизнеса, мы, по сути дела, говорим об информационном обеспечении руководства и других заинтересованных сторон актуальной информацией о протекающей в компании деятельности. Проведение различных экспериментов с моделями и данными также не несет с собой какой-то принципиальной новизны. Например, на протяжении десятилетий развивается такой подход к работе с моделями и данными, как планирование экспериментов, используются и другие методы. Проблема микросегментирования рынка также поставлена достаточно давно. Задача информационного обеспечения в процессе принятия решений существует столько же, сколько человек. Потребность в информационном обеспечении инновационной деятельности – тоже не новая проблема.

Другими словами, речь не идет о том, что «большие данные» декларируют какие-то принципиально новые магистральные пути обеспечения конкурентоспособности: все принципы создания конкурентных преимуществ остаются прежними. Смысл – в другом: реализовывать известные принципы на качественно ином уровне совершенства за счет привлечения к анализу принципиально новых данных, которые ранее не использовались, «выбрасывались».

22

За анонсированием положения о том, что «большие данные» позволяют создавать конкурентные преимущества, которые без них были бы недоступными, естественным образом вытекает следующий постулат: «большие данные» создают новую основу для дальнейшего роста существующего бизнеса, а также запуска новых компаний, реализующих новые бизнес-модели, которые без «больших данных» были нереализуемы.

4.«Большие данные» способны обеспечить рост производительности

ипотребительского излишка1.

В этом пункте авторы исследования переходят к конкретным численным показателям, касающимся пяти секторов экономики, находившихся в центре их внимания:

а) здравоохранение и медицина США: «большие данные» в состоянии способствовать созданию ценности на уровне ~300 млрд долл. в год и обеспечить рост производительности на уровне 0,7 % в год;

б) государственное управление в Европе: потенциальная ценность – 250 млрд евро в год, рост производительности – 0,5 % в год; в) телекоммуникации (определение глобального местонахождения абонентов мобильных устройств): создаваемая новая ценность – 100 млрд долл. в год плюс доходы от оказания новых услуг, ценность

в восприятии потребителей – 100 млрд долл. в год; г) розничная торговля США: можно обеспечить рост чистой

маржи торговых операций на 60%, а производительность – на 0,5…1,0) % в год;

д) производственный сектор: снижение затрат на разработку новой продукции и сборку конечных изделий на 50 %, а также снижение на 7% требуемых оборотных средств.

Как видим, специалисты McKinsey Global Institute декларируют очень серьезные показатели. Если все это правда, то игра, безусловно, стоит свеч.

5. «Большие данные» принесут пользу всем отраслям экономики, но некоторые сектора выгадают больше других.

Позитивное влияние «больших данных» не будет равномерным. В отчете проведены данные анализа по 20 секторам экономики. Эти сектора оценивались по пяти критериям:

1 Потребительский излишек (Consumer Surplus) – понятие в экономической теории, означающее разницу между максимумом цены, которую потребитель готов заплатить за единицу некоторого товара, и той реальной ценой, которую он заплатил фактически.

23

специально сконструированный для целей исследования индекс восприимчивости секторов экономики к выгодам «больших данных» (Overall Ease of Capture Index);

обеспеченность кадрами для работы с «большими данными»;

интенсивность использования в каждом секторе информационных технологий;

степень ориентации склада мышления в организациях на работу с «большими данными» (Data-Driven Mindset);

фактическое наличие «больших данных».

Для ознакомления с результатами анализа секторов по данным критериям целесообразно обратиться к первоисточнику. Здесь лишь отметим, что в контексте использования «больших данных» у каждого сектора экономики есть свои плюсы и минусы. Это, в свою очередь, свидетельствует о наличии больших возможностей для дальнейшего совершенствования деятельности многих организаций.

6. Организации, желающие воспользоваться благоприятными возможностями в связи с «большими данными», неизбежно столкнутся с «кадровым голодом».

В исследовании утверждается, что США и весь мир столкнутся с серьезной кадровой проблемой. Приводится следующая оценка дефицита аналитиков, работающих с «большими данными»: даже с учетом уже реализуемых и планируемых мероприятий по подготовке кадров в этой области нехватка таких специалистов к 2018 г. составит 140–190 тыс. человек в одних только США. Кроме того, Соединенным Штатам понадобится подготовить еще порядка 1,5 млн менеджеров, чья задача будет состоять в том, чтобы задавать специалистам по «большим данным» адекватные вопросы и понимать смысл получаемых ответов.

7. Для того чтобы воспользоваться потенциалом «больших данных», нужно осознавать наличие ряда принципиальных проблем и вырабатывать последовательные меры по их разрешению.

Авторы исследования предупреждают, что использование «больших данных» столкнется с рядом принципиальных проблем, к числу важнейших из которых они отнесли следующие:

а) в связи с «большими данными» новое звучание приобретает и без того актуальный вопрос о конфиденциальности, безопасности данных, интеллектуальной собственности и ответственности в этой сфере;

б) организации, вставшие на путь использования «больших данных», будут вынуждены осваивать новые технологии и методы анализа. Устранение несоответствия между тем, что есть и тем, что

24

должно быть, может оказаться затруднительным для очень многих структур;

в) помимо технологических изменений неизбежным спутником освоения «больших данных» должны стать организационные изменения: новые процессы, организационные структуры, культура, требования к квалификации и опыту руководителей и рядовых сотрудников;

г) организации должны получить доступ к данным из многих источников, которые могут находиться под контролем различных субъектов. У этих субъектов должна быть мотивация к тому, чтобы такими данными делиться. В связи с этим весьма вероятны монополистические проявления;

д) структура отраслей будет иметь значение. Конкурентные отрасли с большим энтузиазмом будут осваивать «большие данные». Монополизированные отрасли будут сопротивляться до конца.

Таким образом, подводя краткий итог рассмотрению наиболее принципиальных положений результатов рассматриваемого исследования, можно констатировать, что специалисты McKinsey Global Institute рисуют перед нами грандиозную картину. Из этого следует, что данная тематика заслуживает самого пристального внимания.

Работа [56] – следующий важный источник для освещения проблематики «больших данных». Она представляет собой базовое (начальное) учебное пособие компании IBM по «большим данным» и программной платформе Hadoop, собственную версию которой эта фирма сегодня активно продвигает.

Примечательна эта работа в том числе тем, что в ней приводятся технические признаки, характеризующие «большие данные». В этом плане использована запоминающаяся формула V3 Volume (объем данных), Variety (разнообразие данных) и Velocity (скорость генерации и работы с данными).

1. Объем данных

Первый признак «больших данных» – их объем – уже затрагивался выше. С этого в общем, и начинается вся проблема. Ввиду очевидности этого момента нет смысла задерживаться на нем подробно. Стоит лишь воспроизвести диаграмму (рис. 2).

Как следует из представленной диаграммы, в современных усло­ виях организациям становится доступным все больший объем данных. Однако обработать эти данные с использованием традиционных технологий организации не могут. Это приводит к тому, что данные «выбрасываются», хотя в случае использования они могут

25

,

IT-

Рис. 2. Расхождение во времени между объемами собираемых организациями данных и способностью их обработать [56]

обладать существенной ценностью. Уже одного этого было бы достаточно для постановки вопроса о поиске путей работы с «большими данными», но дело не ограничивается только этим.

2. Разнообразие данных

Другой важнейший признак «больших данных» – их разнообразие. Он связан с тем, что применение современных информационных технологий сопряжено с генерацией данных, представленных в самых различных форматах. Ранее, используя традиционные реляционные базы данных и технологию SQL, мы имели дело с хорошо структурированными данными. Прежде чем оказаться в базах данных в виде соответствующих записей, такие данные должны быть соответствующим образом подготовлены. Зачастую такая подготовка сопряжена с затратами времени и других ресурсов.

В сегодняшних условиях данные генерируются в полу- и неструктурированном виде (показания датчиков, взаимодействия в социальных сетях и многое другое). Доведение таких данных (к тому же в таких количествах) до «кондиции», устраивающей традиционные реляционные базы данных, было бы сопряжено с огромными затратами, что сделало бы вовлечение таких данных в оборот экономически бессмысленным.

Таким образом, признак большого разнообразия также диктует настоятельную потребность в выработке новых технических подходов к работе с данными в современных условиях.

26

3. Скорость генерации и работы с данными

Наконец, еще один признак работы с «большими данными» – скорость. Ранее, говоря о скорости, мы прежде всего имели дело с параметрами, характеризующими производительность компьютера, скорость доступа к тому или иному устройству и т.п. Разумеется, и сегодня такого рода параметры сохраняют и будут сохранять свою актуальность. Однако в случае с «большими данными» этого недостаточно. Разница состоит в том, что ранее, говоря о скорости, мы говорили об этом аспекте выполнения конкретных операций. Сегодня, говоря о скорости, мы говорим об обработке потока данных. Скорость поступления таких данных и принятия решения по ним значительно возросла.

Очень важным следует считать положение о том, что технологии «больших данных» не могут служить заменой предыдущим технологиям: «большие данные» приходят не вместо, а в дополнение к ним. Всегда будут существовать практические задачи, в решении которых традиционные технологии будут обладать значительными конкурентными преимуществами. Поэтому ключ к успеху – в обеспечении синергии между традиционными технологиями и новыми технологиями «больших данных».

В связи с этим при принятии решения о целесообразности освоения технологий «больших данных» авторы предлагают рассматривать ряд признаков прикладных задач, при наличии которых такие технологии можно считать адекватным решением:

1.Применять технологии «больших данных» целесообразно, когда обработке подлежат не только хорошо структурированные, но и полу- и неструктурированные данные.

2.Технологии «больших данных» идеальны в ситуациях, когда анализировать нужно весь (большой) массив данных, а не какие-то отдельные выборки данных.

3.Технологии «больших данных» применяются там, где отсутствует потребность в сверхбыстрой реакции на запрос клиента. Они предназначены для итеративного и поискового анализа при отсутствии жестких, строго ограниченных временных рамок по выдаче результата. Другим словами, «большие данные» не терпят суеты. Это не «передовая» современных сложных информационных систем, которые должны реагировать на запросы клиентов молниеносно в рамках надежно прогнозируемых временных интервалов, а глубокий «тыл», где можно не слишком торопиться и «поразмышлять».

27

4.Идеальная стратегия – совместное применение традиционных (для хорошо структурированных данных) и новых (для полу- и неструктурированных данных) технологий в целях обеспечения синергии.

5.«Большие данные» целесообразны, когда затраты на предварительную подготовку данных к использованию в рамках реляционных баз данных велики.

10. Методы анализа

Значительный интерес представляет вопрос о методах анализа, применяемых при работе с «большими данными». На текущий момент наиболее полный перечень таких методов приведен в отчете [55]. При этом авторы отчета специально предупреждают, что этот перечень нельзя считать исчерпывающим, новые методы продолжают появляться.

Заслуживает упоминания и другая оговорка авторов: большинство методов было создано до и вне постановки проблемы «больших данных», поэтому речь прежде всего идет об адаптации существующих аналитических методов к задачам «больших данных». С учетом этих оговорок приведем перечень методов, упоминаемых в рассматриваемом отчете (табл. 1).

 

Таблица 1

Методы анализа, применяемые в «больших данных»

 

 

Метод

Краткое описание метода

1. А/Б тестирование

Метод, предусматривающий сравнение реакций на

(A/B Testing)

контрольный (А) и тестируемый (Б) варианты некоторых

 

стимулов. Тестируемых вариантов может быть несколько. На

 

основании сравнения реакций выбирается наилучшее для

 

данной цели решение

2. Анализ с исполь-

Совокупность методов для выявления характерных

зованием ассоциа-

взаимосвязей (ассоциативных правил) между переменными

тивных правил

в больших базах данных. Такие методы представляют собой

(Association Rule

набор алгоритмов для генерации и тестирования возможных

Learning)

правил.

 

Одно из применений метода ассоциативных правил – анализ

 

рыночной корзины (Market Basket Analysis), применение

 

которого позволяет, например, установить, что покупа-

 

тель товара А с высокой вероятностью купит и товар Б. Это

 

дает возможность продавцам принимать соответствующие

 

маркетинговые решения

3. Классификация

Совокупность методов рубрикации новых данных на основе

(Classification)

рубрикации обучающих данных (Training Data Set). Эти мето-

 

ды относят к группе методов обучения с учителем (Supervised

 

Learning), так как изначально имеющиеся обучающие данные

 

направляют процесс обучения (см. далее)

28

 

Продолжение табл. 1

 

 

Метод

Краткое описание метода

4. Кластерный

Статистический метод классификации объектов,

анализ

предполагающий разбиение всей совокупности объектов на

(Cluster Analysis)

более мелкие группы (кластеры), объединяющие похожие

 

между собой объекты и в то же время сильно отличающиеся

 

от объектов других групп. Характеристики, на основе

 

которых данный объект относится к тому или иному

 

кластеру, заблаговременно неизвестны. Этот метод относят к

 

числу методов обучения без учителя (Unsupervised Learning)

 

 

5. Краудсорсинг

Метод сбора данных, предоставляемых большими группами

(Crowdsourcing)

людей («толпой») в ответ на открытый запрос на такие

 

данные. Как правило, осуществляется с использованием

 

сетевых методов социального взаимодействия

 

 

6. Интеграция

Совокупность методов интеграции и анализа данных,

данных

полученных из множественных источников, что позволяет

(Data Fusion and

делать более точные выводы по сравнению с ситуацией, когда

Data Integration)

такие данные используется раздельно

 

 

7. «Раскопки в дан-

Совокупность методов, позволяющих распознавать

ных » (Глубинный

устойчивые структуры (Patterns) на основе анализа крупных

анализ данных)

массивов данных. К числу методов, применяемых для

(Data Mining)

такого анализа данных, можно отнести, например, анализ с

 

использованием ассоциативных правил, кластерный анализ,

 

классификацию, регрессионный анализ и др.

 

 

8. Ансамблевое

Подразумевает использование множественных

обучение

прогностических моделей (Predictive Models), каждая из которых

(Ensemble Learning)

разработана с использованием статистических методов или ма-

 

шинного обучения, для получения более адекватных прогнозов

 

 

9. Генетические

Метод оптимизации, вдохновленный изучением процессов

(эволюционные)

естественной эволюции, которая, как известно, предполагает

алгоритмы

выживание наиболее приспособленных особей. В этом методе

(Genetic Algorithms)

потенциальные решения интерпретируются как «хромосомы»,

 

которые могут объединяться и мутировать. «Хромосомы»

 

приводятся в соприкосновение с условиями «окружающей

 

среды». «Выжившие» «хромосомы» рассматриваются в

 

качестве наилучшего решения. Такого рода методы наиболее

 

ценны при решении нелинейных задач

 

 

10. Распознавание

Подраздел компьютерной науки (относимый к области

образов (Машинное

искусственного интеллекта), занимающийся разработкой

обучение)

алгоритмов, позволяющих компьютерам изменять свое

(Machine Learning)

поведение на основе поступающих эмпирических данных.

 

Важнейшее направление исследований – автоматическое

 

распознавание сложных устойчивых моделей и принятие

 

адекватных решений на основе данных

 

 

29

Продолжение табл. 1

Метод

Краткое описание метода

11. Обработка

Составная часть машинного обучения, подразумевающая

естественных

совместное использование компьютерных технологий

языков

и лингвистики для создания алгоритмов, позволяющих

(Natural Language

анализировать естественные (человеческие) языки

Processing)

 

12. Искусственные

Модели вычислений, предназначенные для распознавания

нейросети

устойчивых моделей в массивах данных. Их создание

(Neural Networks)

вдохновлено структурой и работой биологических нейросетей

13. Сетевой анализ

Совокупность методов, применяемых для описания

(Network Analysis)

взаимоотношений между отдельными узлами,

 

объединенными в граф или сеть

14. Оптимизация

Совокупность численных методов, применяемых для

(Optimization)

изменения (to redesign) сложных систем и процессов с целью

 

улучшения результатов их работы, определяемых на основе

 

одного или нескольких объективных численных показателей

 

(например, затраты, скорость, надежность и др.)

15. Распознавание

Совокупность методов машинного обучения, которые

устойчивых моделей

в соответствии с конкретным алгоритмом присваивают

(Pattern Recognition)

некоторой входной величине некоторую выходную величину –

 

метку (label). Классификация относится к числу таких методов

16. Прогностическое

Совокупность методов, подразумевающих создание

моделирование

или выбор математических моделей для предсказания

(Predictive Modeling)

вероятности некоторого результата (параметра выхода)

17. Регрессионный

Совокупность статистических методов для определения

анализ

изменений зависимой величины вследствие изменений

(Regression)

одной или нескольких независимых величин

18. Анализ настрое-

Применение методов обработки естественных языков и

ний (мнений)

других аналитических методов для выявления и извлечения

(Sentiment Analysis)

из анализируемого текста субъективной информации,

 

характеризующей настроения, мнения, отношение людей к

 

проблеме

19. Статистическая

Эти методы заимствованы из электротехники и прикладной

обработка сигналов

математики. Изначально они применялись для анализа

(Signal Processing)

дискретных и непрерывных сигналов. В современном анализе

 

данных применяются для статистического вычленения из

 

данных полезного сигнала на фоне шума

20. Пространствен-

Совокупность методов анализа топологических,

ный анализ

геометрических или географических свойств объектов,

(Spatial Analysis)

содержащихся в данных

21. Статистика

Наука о сборе, структурировании и интерпретации данных,

(Statistics)

включая планирование опросов (design of surveys) и планиро-

 

вание экспериментов (design of experiments)

22. Направляемое

Совокупность методов машинного обучения, позволяющих

обучение (обучение

делать выводы о наличии некоторых функций или

с учителем)

отношений на основе обучающих данных. Пример – метод

(Supervised Learning)

классификации

30

Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]