Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Статистическое управление процессами. «Большие данные». Учебное пособие

.pdf
Скачиваний:
0
Добавлен:
11.08.2026
Размер:
610 Кб
Скачать

под стеклом висели счеты. Надпись над стендом гласила: «При необходимости разбей и пользуйся». И действительно, сами машины были еще слишком ненадежны. От абака до современности промелькнули века, давшие среди прочего, арифметическую машину Блеза Паскаля во Франции, построенную им в 1640–1645 гг. [16], машину Готфрида Вильгельма Лейбница в Германии, построенную

в1663–1673 гг. [17], машину Чарльза Бэбиджа в Англии, построенную в 1822 г. [18]. Между прочим, с Ч. Бэбиджем дружила дочь лорда Байрона леди Ада Лавлейс, которую называют «первой программисткой» [19] ([18], с. 123.) Вот что писала дочь Байрона в 1843 г.: «Желательно предостеречь против преувеличения возможностей аналитической машины (Чарльза Бэбиджа). Она не претендует на то, чтобы создавать что-то действительно новое. Она не может выполнить все то, что мы умеем ей предписать. Функции машины заключаются в том, чтобы помочь нам получить то, с чем мы уже знакомы». Готовы ли мы сегодня с ней поспорить?

Но современная история началась во время Второй мировой войны

вСША. Решающий вклад в нее внес, как принято считать, Джон фон Нейман (1903–1957) [20]. Пересказывать бурную драматическую историю создания и непрерывного совершенствования компьютеров здесь не представляется возможным. Но все-таки нельзя не упомянуть выдающиеся работы Алана Тьюринга (1912–1954), который первым показал принципиальную возможность создания компьютера и поставил вопрос: «Может ли машина мыслить?» [21] (в этой брошюре, оригинал которой вышел в 1950 г., в качестве приложения опубликована статья Джона фон Неймана «Общая и логическая теория автоматов»), Норберта Винера (1894–1964), который создал новую науку, названную «кибернетикой» (1947 г.) [22], Клода Шеннона (1916–2001), который опубликовал в 1948 г. работу «Математическая теория связи» [23], заложив основы теории информации. Прошедшие после Второй мировой войны примерно 70 лет были наполнены бурным ростом вычислительной техники, которая радикально изменила нашу жизнь. Именно компьютеры и связанные с ними системы, такие как Интернет, или мобильная связь, стали основой для очередной научно-технической революции, которую мы все теперь начинаем переживать. «Большие данные», несомненно, звено в этой цепи событий. Теперь мы лучше готовы к их обсуждению, но прежде – еще очень краткая история прикладной математической статистики и таких ее спутников, как «анализ данных», «раскопки в данных» и др.

11

4. Данные и статистика

Сколько бы данных у нас ни было, рано или поздно их приходится как-то обрабатывать, причем чем больше данных, тем острее стоит проблема их обработки. Для этой цели обычно используется прикладная математическая статистика, дополняемая по мере надобности другими инструментами и методами. При кратком описании траектории развития прикладной статистики мы будем опираться на обзор [24], а также на работу [13] и прекрасную монографию [25]. Еще очень полезны были посты Джила Пресса [26]. Можно предположить, что статистика возникла потому, что данные,

скоторыми люди сталкивались в ходе жизни, были им «не по зубам». Действительно, мы знаем, например из Библии, что в определенные моменты были важны переписи населения. Это как раз задача для «больших данных». А как же с этим было справиться в библейские времена? Видимо, приходилось как-то обобщать результаты наблюдений и счета, как-то «сворачивать» данные, чтобы избежать работы

снеобозримыми массивами данных. Неудивительно, что идея свертки данных стала одной из ведущих в той, древней, статистике. Выше мы уже касались различных аспектов статистики, теперь давайте попробуем несколько упорядочить и систематизировать наше краткое описание. Для этого нам понадобятся две модели. Правда, некоторые сторонники «больших данных» полагают, что их приход отменяет все и всякие научные теории [27]. Мы, однако, с этим совершенно не согласны. Модель «черного ящика», предложенная еще Н. Винером и А. Розенблютом [22] в ходе создания кибернетики и использованная одним из авторов (Ю.А.) в 1964–1968 гг. при формализации задач планирования эксперимента [28], прекрасно может служить моделью объекта исследования в разнообразных задачах «больших данных». Похоже, даже, что она тем полезнее, чем больше данных. Схема модели «черного ящика» приведена на рис. 1.

Входящие стрелки принято называть в кибернетике «входами черного ящика», а в статистике их обычно называют «факторами», или «независимыми переменными» задачи. Их принято обозначать

маленькими латинскими буквами х с порядковыми номерами: х1, х2, , хk. Выходящие стрелки соответственно называются «выходами черного ящика», «откликами» или «зависимыми переменными». Их обычно обозначают маленькими латинскими буквами у, тоже с порядковыми номерами, только теперь не до k, а до m. Сам прямо-

12

 

 

 

 

y1

 

 

x1

 

 

 

x2

 

 

y2

 

 

 

 

 

 

 

xi

 

 

 

yi

 

 

 

 

 

 

 

 

 

 

ym

 

xk

 

 

 

 

 

 

Рис. 1. Схема модели «черного ящика»

угольник символизирует «черный ящик». Еще несколько лет назад мы (Ю.А.) позволили себе несколько обобщить идею Винера. Напрашивается мысль о том, что можно построить целую гамму ящиков разной степени «серости»: от «белого» до «черного». В такой иерархии ящиков «белый» представлял бы некий объект, про который мы знаем абсолютно все. Понятно, что это идеальная модель, и понятно, что это – не про «большие данные». Но это удобная модель, поскольку она позволяет структурировать задачи по степени убывания априорной информации (т.е. всей совокупности наших знаний об объекте исследования, какими мы располагаем до начали исследования).

Можно себе представить, что все наши знания сводятся к некоторой математической модели, например, к уравнению прямой линии, причем такому, что оно предсказывает результаты без всяких ошибок. Это будет детерминированная модель, не имеющая ничего общего не только с «большими данными», но и вообще с реальностью. Следующий шаг на пути к неопределенности – модель та же, но предсказывает уже с некоторой ошибкой. Дальше – больше: есть несколько известных заранее альтернативных моделей, из которых нам предстоит выбор, но все-таки «правильная» модель есть среди предложенных. Можно пойти еще дальше и рассмотреть ситуацию,

вкоторой и сама модель неизвестна, но задан класс моделей, в котором надо произвести выбор. Например, знаем, что ответ надо искать

врядах Фурье, или в рядах Тейлора, или в экспоненциальных функциях. И опять-таки, правильность выбора самого класса функций не подвергается сомнению. Где же предел? А это как раз наш «черный ящик». Здесь мы не знаем об изучаемой модели практически ничего,

13

но можем нарисовать схему рис. 1 и попытаться наполнить ее конкретным содержанием. Значит, когда наука не доросла до того, чтобы предложить нам подходящую теоретическую модель, мы просто переходим к модели «черного ящика», которая встречается на практике гораздо чаще, чем принято думать.

Чем же можно наполнить наш ящик? Мы уже знаем, что источников данных, которые могли бы помочь нам разобраться в «черном ящике» совсем мало. Это наблюдение, эксперимент, размышление эксперта и озарение. Мы не будем останавливаться на бесконечном разнообразии форм и способов представления всех доступных нам данных. Скажем только, что в конечном счете их можно представить в виде матрицы – таблицы, столбцы которой можно интерпретировать как входы «черного ящика». Число таких переменных может быть сколь угодно велико. А строки этой таблицы можно связать с отдельными наблюдениями, опытами или суждениями. Это может быть и просто ход времени. Такое представление универсально в том смысле, что пригодно для описания любого конкретного объекта исследования. В ходе накопления знаний и опыта люди научились погружать конкретные объекты в структуру модели «черного ящика» [29]. Это был большой шаг на пути анализа нашего мира.

5. Модели объектов и модели данных

Однако одной модели объекта мало, нам нужна еще модель данных. Моделями данных занимается статистика. Все началось с К.Ф. Гаусса [25]. Те 200 лет, что прошли с его времени, были потрачены на упорные попытки ослабления жестких моделей данных. И кое-чего удалось достичь. Особенно отличился ХХ в. Упомянем в этой связи работы Госсета (Стьюдента) и фон Мизеса по малым выборкам. Любопытно, что сто лет тому назад малые выборки были весьма актуальны, а выборки гигантских размеров, о которых идет речь сегодня, даже не рассматривались, считалось, что их анализ лежит за пределами не только науки, но и вообще человеческих возможностей. Теперь малые выборки вышли из моды. Отметим работы Фишера, Бокса и их многочисленных последователей по планированию эксперимента. Вспомним работы Вилкоксона по непараметрической статистике, Бокса по робастным оценкам, возврат к подходу Байеса к условным вероятностям и множество других вех в развитии статистики. Сегодня представляется, что весь ход событий был направлен на систематическое стремление к освобожде-

14

нию статистики от пут различных постулатов, которые порождались различными моделями данных. Эти усилия дали свои плоды, но их оказалось недостаточно. Поэтому 1962 г. начался с публикации программной статьи Джона Тьюки [30] под знаменательным названием «Будущее анализа данных». Статистика разрывала свои оковы, делала акцент на широкой визуализации данных, на привлечении многих традиционно нестатистических инструментов и методов, заявляла о своих симпатиях к вычислительной технике и о стремлении к союзу с ней. Все это имело многочисленные важные последствия. Только в 1971 г. появился расширенный ротапринтный вариант, который только в 1977 г. вышел в виде книги, переведенной на русский язык в 1981 г. [31]. В том же 1977 г. вышла в свет и книга, написанная совместно с Ф. Мостеллером [32] (в русском переводе – в 1982 г.).

Вней анализ данных рассматривался в связи с задачами регрессии. Поскольку мы рассматриваем предысторию «больших данных»,

то имеет смысл проследить за сближением статистики и компьютера. Одним из ярких симптомов такого сближения стало имитационное моделирование (см., например, [33]), которое, в свою очередь, родилось из метода Монте-Карло и сходных приемов [34]. Один из следующих шагов связан с идеей «бутстреп-моделирования», метода «складного ножа», процедур «перепроверки» [35].

Из «анализа данных» Дж. Тьюки естественным образом родился метод, для которого еще не придумали общепринятого русского термина и который мы предпочитаем называть «раскопками в данных» или «интеллектуальным анализом данных» (Data Mining) [36]. Не случайно многие компании, занятые разработками комплексов программных продуктов, дружно взялись создавать продукты для «раскопок в данных». В этих программных продуктах есть уже почти все, что характерно для «больших данных», кроме, разве лишь, готовности работать с разнородными данными. И именно эта готовность (и техническая, и идеологическая) меняет все. Статистические процедуры, широко используемые в «раскопках», систематизированы в справочнике [37]. Конечно, историю «раскопок в данных» можно рассказывать и с «другого конца», исходя из таких концепций, как распознавание образов, искусственный интеллект, и машинное обучение. Один из авторов (Ю.А.), читая студентам курс «раскопок в данных», долго не мог понять, почему начало этих работ не отсчитывают от классической работы Джона Тьюки 1962 г. В одном из первых отечественных курсов [38] нет даже упоминания об

15

этой работе. Постепенно стало ясно, что разные научные «племена» говорят каждое на своем языке и не склонны к изучению языков соседних «племен». Нет сомнения в том, что создание «баз данных» и «экспертных систем», а также развитие вычислительных систем и языков программирования – это исключительно важные вехи в развитии человечества. Ясно и то, что без прогресса в этих областях не было бы ни «раскопок в данных», ни, тем более, «больших данных». Тем не менее, если говорить не о технической стороне, то, например, в машинном обучении нет ничего, кроме процедур многомерного статистического анализа. Это кластерный, или дискриминантный, анализ, или даже регрессия с обучающими выборками или без них. О разнобое языков отчасти свидетельствует и разнообразие синонимов для «раскопок». Вот примеры: «извлечение знаний», «добыча информации», «археология данных» и другие. Между прочим, такая языковая замкнутость и глухота не раз приводили в истории к конфузам. Так, «новое научное направление» – детище холодной войны – «распознавание образов» при ближайшем рассмотрении оказалось эквивалентным дискриминантному анализу, который предложил сэр Рональд Фишер еще в 1928 г. [39]. А, скажем, теория нечетких множеств, созданная Люфти Заде [40], оказалась аналогом концепции субъективных вероятностей [41]. Надо заметить, что это были вовсе не скучные тождественные результаты. На самом деле, новые формулировки всегда открывали новые возможности, проливали новый свет на изучаемые проблемы. Так, в проблеме распознавания, например, была поставлена, и в значительной степени решена проблема машинного зрения [42], а из нечетких множеств родились «мягкие вычисления» и подходы к принятию решений в рамках «раскопок в данных» [43]. Более того, на базе идеи «нечеткости» возникла «теория возможностей» [44], которая систематизировала и обобщила многие разрозненные подходы.

6. Что есть знание?

Есть еще одна тема, которую трудно обойти. Уже в эпиграфе к этому обзору мы пытались обратить внимание читателя на вопросы типа «Что есть знание?» или «Что есть понимание?» Работа [45] была одной из первых, где знание рассматривается как товар. Тогда можно говорить о его производстве и распространении. Похоже, что «большие данные» готовы включиться в эту работу. Но можно подойти к проблеме и с другой стороны: через пирамиду DIKW, т.е.

16

через пирамиду: Данные – Информация – Знания – Мудрость. Такой подход имеет уже долгую историю, и ее критическое рассмотрение можно найти, например, в работе [46]. Во всяком случае для нас важно дать себе отчет в том, где берутся знания и как они связаны с данными. Судить о мудрости мы не беремся. Поэтому заметим, что недавно появилось новое направление в управлении бизнесом, основанное на беспрецедентном акценте на добывании знаний и на использовании их в качестве конкурентного преимущества [47]. Обзор [48] содержит уже устаревшую, но все еще важную информацию о knowledge management («управлении знаниями»).

7. Статистическое мышление

Теперь, казалось бы, мы готовы наконец приступить собственно к «большим данным». Но это не так. Есть еще, по крайней мере, два момента, которые мы должны рассмотреть прежде. Они связаны отчасти между собой. Это роль статистического мышления и дилемма: детерминированный мир против вероятностного (стохастического) мира. Сначала о статистическом мышлении. Недавно была опубликована работа [8], которой мы воспользуемся в дальнейшем изложении. Случилось так, что примерно 20 лет назад под влиянием У. Шухарта и Е. Деминга на пересечении статистических идей и менеджмента возникло новое направление, которое получило название «статистическое мышление» [49, 50]. Оказалось, что это направление имеет прямое отношение к «большим данным», поэтому нам придется на нем остановиться. Начнем с определения [8]: «Статистическое мышление – это философия обучения и действия, основанная на следующих фундаментальных принципах:

Всякая работа идет в некоторой системе взаимосвязанных процессов.

Во всех процессах есть вариации.

Понимание и снижение этой вариации – ключи к успеху» . Вот основные моменты, связанные с «большими данными», с

точки зрения «статистического мышления»:

1)четкая постановка задачи;

2)построение модели процесса;

3)последовательный подход к решению;

4)интенсивное использование знаний об объекте исследования;

5)забота о качестве данных;

6)поиск источников вариации;

17

7)разработка стратегии анализа;

8)понимание процесса.

При этом особо выделяются шаги 3, 4, 5 и 7-й. Действительно, если данные плохи, то работу не смогут спасти ни замечательная программа их обработки, ни изощрения при постановке задачи. Более того, когда данных очень много, их качество влияет существеннее, чем в обычных задачах, а выявляется гораздо труднее. Без использования априорных знаний объекта нет надежды на хоть сколько-нибудь приемлемую интерпретацию полученных результатов. Без последовательной стратегии обработки и анализа данных не будет возможности учиться на собственных ошибках. В эйфории первых успехов многие адепты «больших данных» еще не готовы обращать внимание на такие «мелочи», но прозрение неизбежно.

8. Детерминизм или вероятностный мир?

Еще несколько замечаний. В настоящее время, насколько мы знаем, на русский язык переведена только одна книга о «больших данных» [51]. Ее авторы, как и многие другие сторонники «больших данных», например [27], полагают, что в данном случае достаточно применить просто анализ коэффициентов корреляции для успешного решения задачи. Причем содержательный анализ, хотя, может быть, он и желателен, в большинстве случаев просто не нужен и почти всегда – невозможен. Мы не знаем, почему именно такая комбинация значений переменных решает задачу, да это и не важно. Важно, что она решена. Таким образом, в который раз в истории встает вопрос о детерминизме и его антиподе – стохастическом взгляде на мир. Лев Толстой говорил [52]: «Для человеческого ума не доступна совокупность причин явлений. Но потребность в отыскании причин вложена в душу человека». Значит, всякие поиски причин – это ловля химер, это болезнь, но, к сожалению, врожденная. А такие болезни трудно поддаются лечению. Ситуация, возникшая в «больших данных», отнюдь не нова. Когда, после Второй мировой войны кибернетические модели начали проникать в практические задачи, что, между прочим, привело к широкому распространению методов планирования экспериментов, одно из основных возражений против использования таких моделей сводилось как раз к тому, что эти модели, основанные на «черном ящике», хотя и решают поставленные задачи, но трудно интерпретируемы. Мы не знаем, почему именно такие значения, имен-

18

но данных переменных, обеспечивают, скажем, оптимальное в том или ином смысле решение. Но если это решение устойчиво воспроизводится, то задача решена, всем нравится, один только Л. Толстой против. На знамени кибернетики с самого начала был написан важный лозунг: «Оптимальное управление сложной системой возможно при неполном знании ее механизма». Поэтому пришлось разделить модели на «теоретические», т.е. основанные на каких-то теоретических законах, например на уравнениях Аррениуса для химической кинетики, для которых по экспериментальным данным находятся некоторые константы. В таких случаях интерпретация полученных констант возникает сама собой. Более того, если, скажем, в вычисления вкралась ошибка, которая осталась незамеченной, интерпретация, скорее всего, тоже получится, потому что неопределенность выбора столь велика, что практически любой результат можно объяснить. Другой сорт моделей естественно называть «эмпирическими»; он не основывается на каких бы то ни было содержательных теориях, но они и не претендуют на содержательную интерпретацию. Ясно, что в случае «больших данных» придется чаще всего пользоваться эмпирическими моделями. Но полный отказ от модели пока не представляется возможным, поскольку в ныне существующей парадигме «данные без модели не имеют смысла».

Теперь, наконец, мы готовы к путешествию в страну «больших данных». Начнем его с одной вспомогательной таблицы:

Бит*

1 или 0

 

Обозначения

 

 

 

русское

 

международное

 

 

 

 

 

 

 

 

Байт

8 битов

 

 

 

 

 

 

Килобайт

1000 байтов

КБ

 

KB

 

 

 

 

 

Мегабайт

1000 КВ

МБ

 

MB

 

 

 

 

 

Гигабайт

1000 МВ

ГБ

 

GB

 

 

 

 

 

Терабайт

1000 ГБ

ТБ

 

TB

 

 

 

 

 

Петабайт

1000 ТБ

ПБ

 

PB

 

 

 

 

 

Эксабайт

1000 ПБ

ЕБ

 

EB

 

 

 

 

 

Зеттабайт

1000 ЕБ

ЗБ

 

ZB

 

 

 

 

 

_____________

* Термин предложен Дж. Тьюки.

Теперь мы знаем, что почем, вперед!

19

9.«Большие данные»

Впоследние несколько лет в США стремительно развивается новый сегмент информационно-технологической отрасли, получивший название «большие данные» (Big Data). Все большее число IT компаний,

втом числе настоящих гигантов (IBM, Microsoft, Oracle и многие другие), подключается к теме со своими продуктами и сервисами. О стремительном росте количества публикаций, конференций и прочих мероприятий можно и не упоминать. Компания IBM создала открытый онлайновый университет Big Data University [53], в котором может пройти обучение любой желающий. В США запущена обширная государственная программа научно-исследовательских работ. Включается

вэтот процесс и Россия, пусть и с традиционным для нашей страны опозданием от мировых лидеров. В марте 2012 г. проведен первый в России крупный форум Big Data 2012, организованный издательством «Открытые системы» [54]. Факты подобного рода можно приводить еще очень долго. В итоге можно констатировать: налицо все признаки нового движения, поучаствовать в котором изъявляет желание очень большое число людей и организаций во многих странах мира.

Возникает первый естественный вопрос: откуда вообще взялась сама проблематика «больших данных»? При ответе на него представители отрасли обычно начинают сыпать самыми различными численными показателями, характеризующими объемы собираемых во всем мире данных. Но приводить здесь все эти тера-пета-экза- байты нет никакого смысла, так как такие данные устареют раньше, чем читатель причитает этот текст хотя бы по диагонали. Ясно одно: данных действительно много, каждый из нас ежедневно принимает участие в их создании, используя различные устройства и сервисы для решения своих актуальных задач на работе, дома и в любых иных мыслимых ситуациях.

Наблюдение этих эмпирических фактов провоцирует постановку вопроса о принципиальной возможности извлечения экономических и прочих выгод в связи со складывающимися тенденциями. Для ответа на этот вопрос можно прибегнуть к результатам исследования авторитетного McKinsey Global Institute. В отчете по результатам этой исследовательской работы констатирован целый ряд положений, которые стоит привести [55].

1. Феномен «больших данных» свойствен любой отрасли современной экономики, любой бизнес-функции и превратился в важный фактор любой производственной деятельности.

20

Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]