Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Стратегия управления данными организациями. Учебно-методическое пособие
.pdf
Каталог метаданных представляет собой инструмент для реального понимания технической стороны деятельности организации.
Можно назвать работу каталога «инвентаризацией», потому что он
показывает текущее представление всех реализованных технических решений. К основным задачам каталога можно отнести следующие:
- сканирование физических метаданных систем хранения дан-
ных;
- сканирование физических метаданных систем интеграции,
трансформации, передачи данных;
- сканирование систем проверки качества данных;
- построение визуальных связей зависимостей метаданных –
data lineage;
- проведение анализа зависимостей (impact analysis);
- профилирование данных;
- выявление доменов данных на основе правил или искусствен-
ного интеллекта;
- автоматизированная привязка бизнес-терминологии к объек-
там физических метаданных;
- поиск среди объектов метаданных;
- сертификация объектов метаданных;
- поиск объектов, имеющих наборы данных, аналогичные дру-
гим объектам.
9.3.2 Задачи каталога метаданных
Использование каталога метаданных эффективно для следующих задач:
- проверка соответствия технической реализации поставленным
бизнес-требованиям – стандартная задача для специалистов CDOO;
- инвентаризация и техническое описание систем с привязкой к
глоссарию;
- изучение новых подключенных источников метаданных (например, при слиянии компаний или изучении системной архитектуры дочерних организаций);
- исследование функционирующих хранилищ или озер данных
для вычистки неиспользуемых объектов – таблиц, витрин, отчетов –
и удаления их самих и процессов их наполнения для сокращения
61

временных затрат и на инфраструктуру.
Пользователями каталога метаданных являются технические
специалисты. Бизнес-пользователи обычно не работают с такой системой, чтобы не вникать в особенности разработки каждой системы и межсистемной интеграции.
9.3.3 Системы-источники для каталога метаданных
Каждый каталог должен уметь работать, как минимум, с основными видами систем, установленными в большинстве организаций,
для чтения их метаданных. К таким системам обычно относят:
- основные реляционные и нереляционные СУБД;
- ERP-системы;
- CRM-системы;
- BI-средства и системы аналитики;
- системы ведения хранилищ и витрин данных;
- основные производственные системы;
- средства интеграции данных, такие как ETL/ELT;
- скрипты SQL различных вариаций;
- сервисы передачи данных.
Часто многие системы-источники не требуется обрабатывать на
уровне объектов, которыми система оперирует. Достаточно провести сканирование базы данных, которой система пользуется и где
сохраняет свои данные.
Однако есть системы, для которых система хранения данных
устроена настолько сложно, что с результатами работы каталога на
уровне СУБД не даст никаких результатов.
В этом случае каталог метаданных должен уметь отрабатывать
взаимодействие с системой на уровне ее объектов, функций, сервисов и т.д.
А что же делать в том случае, если системы написаны непосредственно для компании или встречаются только на определенной
территории или в единичном количестве? Для таких случаев в каталоге обычно предусмотрен специальный механизм создания отдельного соединения с системой, который предусматривает, что из системы есть возможность любым способом получить метаданные, затем распознать и преобразовать их в единый формат и провести сканирование средствами каталога. Такие виды подключения предпо-
62

лагают дополнительную работу по настройке, но зато снимают ограничение по составу систем для выявления состояния данных.
Результат сканирования представляет собой список объектов
хранения или обработки данных, специфичных для каждого типа
систем:
- для СУБД – таблицы, представления, их поля и форматы, про-
цедуры и SQL-запросы;
- для ERP-систем – объекты хранения, объекты и процедуры
обработки данных и т.д.;
- для BI – отчеты разных типов, агрегаты, сборки, поля и запросы;
- для систем интеграции данных – маппинги и процессы обра-
ботки данных.
Обычно сканирование метаданных устанавливается по расписанию на определенное время. Чаще всего этот процесс проводят
по ночам, когда процесс внесения изменений в системы и разработки уже завершен.
9.3.4 Состав объектов на уровне физической модели
После чтения метаданных каталог должен предоставлять возможность поиска среди найденных объектов. Аналогично бизнесглоссарию, каталог должен уметь осуществлять поиск среди десятков, а иногда и сотен тысяч объектов, чтобы показать наиболее подходящие результаты пользователю. Поэтому поисковые возможности каталога метаданных не должны ограничиваться только стандартными возможностями по наименованию, но и иметь возможности
подстановки текста, учитывать семантические особенности языка и
дополнительные особенности, увеличивающие шанс найти нужный
объект. К ним могут относиться признаки сертификации объектов
экспертом, оценки пользователей, последние использованные объекты и многое другое.
В поиске всегда участвуют только объекты хранения или визуализации данных, а интеграционные потоки можно проследить в data
lineage.
Выбрав нужный объект хранения, технический специалист сначала видит его структуру, понимая реальный состав его полей и форматов, его принадлежность системе, выявленные домены данных в
виде присвоенных бизнес-терминов (см. рис. 20).
63

Рисунок 20. Пример объекта метаданных после чтения каталогом
Детальное понимание состава полей нужно, в первую очередь,
для правильного сопоставления структуры с требованиями бизнеса,
в особенности, если объект является конечной структурой – витриной данных или отчетом.
9.3.5 Профилирование данных
Также важно понимать и состав данных по каждому полю. Современные каталоги позволяют выполнять профилирование данных
– определение базового уровня качества, маску заполнения, частоту
встречаемости значений и многое другое. Эта информация крайне
нужна для понимания возможности использовать ресурс в дальнейшей работе специалистов. Довольно часто бизнес-требования выстраиваются на основе наличия поля по своей сути, но без учета реального качества данных, заполняющих его.
Приведу небольшой пример. В одном из банков требовалось
выявлять дубликаты данных клиентов на основании основной банковской системы. Выбор полей был естественным – ФИО, дата рождения, место рождения. Однако в ходе профилирования выяснилось,
что дата рождения заполнена только на 20%, а место – на 2%. Применение правила поиска пришлось сузить только до самых новых
клиентов, для которых заполнение трех указанных полей стало обязательным. И пришлось придумывать еще много вариантов поиска
дублирующихся записей на основе других признаков.
64

Примеры результатов профилирования данных объекта метадан-
ных в каталоге метаданных приведены на рисунке 21.
Рисунок 21. Пример профиля данных
Отдельно необходимо выделить среди функций каталога возможность при подключении к нему новой системы определять, что
за данные в ней находятся и нет ли таких данных в других системах.
Это очень важная особенность современных каталогов данных, которая серьезно упрощает работу по описанию данных для сотрудников CDOO.
Обычно подобные поисковые механизмы пользуются искусственным интеллектом, чтобы более точно предсказать, какие из данных являются близкими друг к другу по сути.
9.3.6 Data Lineage и impact analysis
Как бы то ни было основным инструментом для работы специалистов в составе каталога остается data lineage. Это зависимость
между объектами метаданных, которая выявляется по запросам, сервисам, интеграционным процессам и визуализируется каталогом.
Промышленные каталоги метаданных позволяют менять размер и
глубину просматриваемой области связей, так как иногда в нее попадают тысячи объектов, что заставляет ждать пользователя. Чтобы
избежать задержки, обычно data lineage строится сначала в общем
виде, давая возможность пользователю выбрать требуемую глубину
65

и направление просмотра. Важной функцией промышленных каталогов метаданных является детализация взаимосвязей до уровня
отдельных трансформаций над данными. Чаще всего такие требования применяются при изучении потоков данных, реализованных
на ETL/ELT-средствах или SQL-запросах.
Анализ влияния (или impact analysis) – это действия по изучению влияния изменений в одних системах на другие на основе построенного data lineage. Так как каталог метаданных сканирует системы обычно ежедневно, то при обновлении какой-либо из систем
возможно образование разрывов в зависимостях, что однозначно
указывает на появление неверных данных затем в отчетах и аналитике. Это будет сигналом к действию стюарда данных по информированию бизнес-подразделений о наличии проблем с отчетностью,
а для ИТ-служб – указанием, какие нестыковки необходимо устранить.
Одновременно это же служит поводом для руководителя подразделения по управлению данными к изменению организационной
политики по предварительному извещению об изменениях в системах с его обязательным подтверждением.
9.3.7 Связи моделей данных
Вернемся к тому, почему каталог важен при управлении данными. Бизнес-пользователь со стороны глоссария должен иметь возможность перейти к физической реализации систем, чтобы увидеть
соответствие требованиям. И с другой стороны, технический специалист должен понимать, с чем он работает. Название таблицы и поля
зачастую не могут дать никакой дополнительной информации пользователю. В ряде банковских систем, особенно западной разработки,
такая ситуация встречается часто.
Для таких случаев каталог может в качестве одного из ресурсов
сканирования использовать сам бизнес-глоссарий, чтобы присвоить
затем нужный термин нужному техническому объекту метаданных.
Тогда каждый объект и сам data lineage смогут в себе содержать как
технические, так и бизнес-составляющие, усиливая понимание реальной ситуации с данными.
Важно, что каталог дает возможность перейти в каждый объект
для просмотра его структуры и качества, а также построить data
lineage из любого выбранного объекта в нужную сторону.
66

9.3.8 Выявление доменов данных
Особенным механизмом этого типа программных инструментов является выявление доменов данных и присвоение техническим
объектам соответствующих терминов. Мы уже упоминали об этом в
разделе о бизнес-глоссарии, который ожидает от каталога найденных объектов, подходящих под бизнес-описание, для построения
связи между термином и объектом физической модели.
Есть несколько вариантов выявления такого соответствия. Рассмотрим основные из них.
1. Построение соответствия на основе названия физических
объектов.
Оптимальный способ, если система спроектирована так, что по
названию таблиц и полей можно сделать вывод о сущности хранимых данных.
2. Построение соответствия на основе соответствия данных оп-
ределенному списку.
Этот метод использует обычно искусственный интеллект для
выявления домена данных. Естественно, каталог нужно заранее обучать на существующих данных для более точного результата. Такой
способ хорошо подходит для данных, содержащих информацию описательного характера – фамилии, имена, названия продуктов и т.п.
3. Выявление домена на основании правил и условий. Этот метод хорошо работает при возможности выявить маску заполнения
данных (даты, номера телефонов, адреса электронной почты и т.д.)
и наложения уточняющих условий. Хотя самое большое количество
ошибок в результатах обычно дает именно этот метод.
Например, как выявить дату рождения или дату транзакции? Мы
быстро можем выявить, где находится дата, а вот условия, определяющие именно этот тип даты, надо серьезно продумать заранее и
протестировать на используемых массивах данных.
4. Комбинированные методы. Естественно, делать ставку только на один из перечисленных выше способов выявления доменов
данных часто неразумно.
Обычно используется сочетание методов работы с данными и
названиями метаданных. Но увеличение числа правил методов приводит к существенному увеличению времени, которое затрачивает
каталог на сканирование. Для ежедневного исследования метадан-
67

ных использовать такие методы нужно осторожно, чтобы успеть завершить все расчеты к началу рабочего дня специалистов (если, конечно, сканирование выполняется ночью).
Любой метод не дает точного попадания в выбранный домен.
Поэтому многие каталоги определяют процент соответствия, а также имеют правила, которые дают возможность сделать присвоение
физическому объекту термина при превышении определенной границы в процентах. Если процент не столь высок, чтобы сделать операцию автоматически, обычно у эксперта или архитектора данных
появляется задача на ручное присвоение термина с рекомендацией
от системы.
В результате выявления доменов данных каталог подтянет бизнес-описания из глоссария, проведет связи с объектами физической
модели, может изменить логическую модель данных, а также оповестить заинтересованных лиц об этом.
Теперь у специалиста есть возможность не только посмотреть
сам объект метаданных, но и его бизнес-описания из глоссария.
Кроме того, бывает необходимо понять весь набор физических объектов, попадающих под нужный домен данных.
Вообще, самой длительной операцией при настройке каталога
метаданных является именно обучение системы и построение нужного набора правил для выявления доменов и построения связей с
бизнес-глоссарием.
9.3.9 Каталог каталогов
Иногда в организации уже есть один или несколько каталогов,
которые умеют работать с определенными наборами метаданных.
Часто крупные производители программного обеспечения выпускают возможность анализа физической модели для своих систем. Но
такие решения бывает сложно расширить на изучение других систем.
Появившийся не так давно термин «Каталог каталогов» означает возможность каталога метаданных обращаться к локальному средству, работающему для узкого круга систем, для получения информации о структурах хранения и перемещения данных. Этот подход
позволяет:
- не нагружать пользователей бизнес-подразделений нескольки-
ми системами для исследования метаданных;
68

- получить полную информацию и зависимости;
- не проводить сканирование метаданных несколько раз.
При таком подходе без дополнительной нагрузки на системыисточники метаданных каталог каталогов забирает данные из доступных «более узких» каталогов, становясь «зонтичным» решением, позволяющим сотрудникам CDOO выполнять свою работу вне
зависимости от типов применяемых в организации систем.
МЕТОДИЧЕСКИЕ РЕКОМЕНДАЦИИ ПО ПОДГОТОВКЕ
2.
К СЕМИНАРСКИМ (ПРАКТИЧЕСКИМ) ЗАНЯТИЯМ
Основной целью организации подготовки к практическим занятиям является развитие навыков целеполагания и постановки задач
стратегического управления данными организациями, навыков применения методов стратегического анализа и управления данными.
При подготовке к каждому занятию необходимо обратиться к курсу
лекций по данному вопросу и учебным пособиям.
Все более становится очевидным, что в процессе подготовки
специалиста главным является не усвоение готовых знаний, а развитие у выпускников способностей к овладению методами познания, дающими возможность самостоятельно добывать знания, творчески их использовать на основе известных или вновь созданных
способов и средств деятельности.
Меняется сама парадигма конечной образовательной цели: от
«специалиста-исполнителя» – к компетентному «профессионалуисследователю». Стать таким специалистом без хорошо сформированных умений и навыков самостоятельной учебной деятельности
невозможно.
В рамках требований ФГОС ВО к уровню подготовки выпускников они должны: быть способными к самостоятельному поиску истины, к системному действию в профессиональной ситуации, к анализу
и проектированию своей деятельности; обладать стремлением к самосовершенствованию (самосознанию, самоконтролю, саморегуляции, саморазвитию); стремиться к творческой самореализации.
ВОПРОСЫ И ЗАДАНИЯ ДЛЯ ЗАНЯТИЙ
2.1
СЕМИНАРСКОГО ТИПА
Тема 1. Общее понимание стратегического менеджмента
Вопросы для опроса:
1. Этапы становления стратегического менеджмента
69

2. Понятие и сущность стратегического менеджмента
3. Понятие стратегии
4. Достоинства и недостатки стратегического подхода к управ-
лению
5. Составляющие стратегического управления
6. Соотношение стратегического и оперативного управления
Тема 2. Базовые стратегии организации
Практическое задание № 1
Практическая ситуация №1:
Пензенская фирма «Ваши двери» существует всего 7 лет, тем не
менее за это время она завоевала доброе имя у потребителей. Основным видом деятельности предприятия является производство,
реализация и установка деревянных и металлических дверей. Конкурентами «Ваши двери» являются «Мир дверей» и «Дверной альянс». «Дверной альянс» занимает лидирующие позиции на рынке
Приволжского региона России, активизируя свою деятельность на
всех территориальных сегментах. «Мир дверей» акцентирует свое
присутствие на рынке Пенза и Пензенской области. На рынке Пензенской области емкость рынка существенно больше, чем представленная на нем продукция конкурентов. Поэтому сегодня фирма
«Ваши двери» работает в Пензе. В перспективе она предполагает
выйти на рынки Приволжского региона за пределами Пензенской
области, поскольку даже однократный выход на потребителей за
пределами области был для фирмы весьма удачным. Деятельность
«Ваши двери» за последние три года характеризуется такими цифрами. Выручка от реализации товаров и услуг в 2013 г. составила
13 млн 510 тыс. руб., в 2014 г. –10 млн 371 тыс. руб., в 2015 г.
–16 млн 266 тыс. руб. Прибыль, соответственно, по годам: 3 млн
665 тыс. руб., 1 млн 383 тыс. руб. и 830 тыс. руб. Рост объема продаж в 2015 г. был достигнут за счет снижения реализационных цен,
что сказалось на себестоимости. Ее уровень имеет тенденцию к увеличению: в 2013 г. доля себестоимости в объеме продаж составляла
72,9%, в 2014 г. – 86,7%, а в 2015 г. – 84,9%. Именно этим, прежде
всего, объясняется снижение прибыли. Такое положение не может
устроить руководство фирмы. Перед ним стоит задача изменить сложившуюся ситуацию. Для того чтобы осуществить процесс форму-
70
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
