Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Стратегия управления данными организациями. Учебно-методическое пособие

.pdf
Скачиваний:
0
Добавлен:
07.09.2026
Размер:
2 Мб
Скачать
☆
Каталог метаданных представляет собой инструмент для реаль­ного понимания технической стороны деятельности организации. Можно назвать работу каталога «инвентаризацией», потому что он показывает текущее представление всех реализованных техничес­ких решений. К основным задачам каталога можно отнести следую­щие:
- сканирование физических метаданных систем хранения дан-
ных;
- сканирование физических метаданных систем интеграции,
трансформации, передачи данных;
- сканирование систем проверки качества данных;
- построение визуальных связей зависимостей метаданных –
data lineage;
- проведение анализа зависимостей (impact analysis);
- профилирование данных;
- выявление доменов данных на основе правил или искусствен-
ного интеллекта;
- автоматизированная привязка бизнес-терминологии к объек-
там физических метаданных;
- поиск среди объектов метаданных;
- сертификация объектов метаданных;
- поиск объектов, имеющих наборы данных, аналогичные дру-
гим объектам.
9.3.2 Задачи каталога метаданных
Использование каталога метаданных эффективно для следую­щих задач:
- проверка соответствия технической реализации поставленным
бизнес-требованиям – стандартная задача для специалистов CDOO;
- инвентаризация и техническое описание систем с привязкой к
глоссарию;
- изучение новых подключенных источников метаданных (на­пример, при слиянии компаний или изучении системной архитекту­ры дочерних организаций);
- исследование функционирующих хранилищ или озер данных для вычистки неиспользуемых объектов – таблиц, витрин, отчетов – и удаления их самих и процессов их наполнения для сокращения
61
временных затрат и на инфраструктуру.
Пользователями каталога метаданных являются технические специалисты. Бизнес-пользователи обычно не работают с такой си­стемой, чтобы не вникать в особенности разработки каждой систе­мы и межсистемной интеграции.
9.3.3 Системы-источники для каталога метаданных
Каждый каталог должен уметь работать, как минимум, с основ­ными видами систем, установленными в большинстве организаций, для чтения их метаданных. К таким системам обычно относят:
- основные реляционные и нереляционные СУБД;
- ERP-системы;
- CRM-системы;
- BI-средства и системы аналитики;
- системы ведения хранилищ и витрин данных;
- основные производственные системы;
- средства интеграции данных, такие как ETL/ELT;
- скрипты SQL различных вариаций;
- сервисы передачи данных.
Часто многие системы-источники не требуется обрабатывать на уровне объектов, которыми система оперирует. Достаточно провес­ти сканирование базы данных, которой система пользуется и где сохраняет свои данные.
Однако есть системы, для которых система хранения данных устроена настолько сложно, что с результатами работы каталога на уровне СУБД не даст никаких результатов.
В этом случае каталог метаданных должен уметь отрабатывать взаимодействие с системой на уровне ее объектов, функций, серви­сов и т.д.
А что же делать в том случае, если системы написаны непос­редственно для компании или встречаются только на определенной территории или в единичном количестве? Для таких случаев в ката­логе обычно предусмотрен специальный механизм создания отдель­ного соединения с системой, который предусматривает, что из сис­темы есть возможность любым способом получить метаданные, за­тем распознать и преобразовать их в единый формат и провести ска­нирование средствами каталога. Такие виды подключения предпо-
62
лагают дополнительную работу по настройке, но зато снимают ог­раничение по составу систем для выявления состояния данных.
Результат сканирования представляет собой список объектов хранения или обработки данных, специфичных для каждого типа систем:
- для СУБД – таблицы, представления, их поля и форматы, про-
цедуры и SQL-запросы;
- для ERP-систем – объекты хранения, объекты и процедуры
обработки данных и т.д.;
- для BI – отчеты разных типов, агрегаты, сборки, поля и запросы;
- для систем интеграции данных – маппинги и процессы обра-
ботки данных.
Обычно сканирование метаданных устанавливается по распи­санию на определенное время. Чаще всего этот процесс проводят по ночам, когда процесс внесения изменений в системы и разработ­ки уже завершен.
9.3.4 Состав объектов на уровне физической модели
После чтения метаданных каталог должен предоставлять воз­можность поиска среди найденных объектов. Аналогично бизнес­глоссарию, каталог должен уметь осуществлять поиск среди десят­ков, а иногда и сотен тысяч объектов, чтобы показать наиболее под­ходящие результаты пользователю. Поэтому поисковые возможнос­ти каталога метаданных не должны ограничиваться только стандар­тными возможностями по наименованию, но и иметь возможности подстановки текста, учитывать семантические особенности языка и дополнительные особенности, увеличивающие шанс найти нужный объект. К ним могут относиться признаки сертификации объектов экспертом, оценки пользователей, последние использованные объек­ты и многое другое.
В поиске всегда участвуют только объекты хранения или визуа­лизации данных, а интеграционные потоки можно проследить в data lineage.
Выбрав нужный объект хранения, технический специалист сна­чала видит его структуру, понимая реальный состав его полей и фор­матов, его принадлежность системе, выявленные домены данных в виде присвоенных бизнес-терминов (см. рис. 20).
63
Рисунок 20. Пример объекта метаданных после чтения каталогом
Детальное понимание состава полей нужно, в первую очередь, для правильного сопоставления структуры с требованиями бизнеса, в особенности, если объект является конечной структурой – витри­ной данных или отчетом.
9.3.5 Профилирование данных
Также важно понимать и состав данных по каждому полю. Со­временные каталоги позволяют выполнять профилирование данных – определение базового уровня качества, маску заполнения, частоту встречаемости значений и многое другое. Эта информация крайне нужна для понимания возможности использовать ресурс в дальней­шей работе специалистов. Довольно часто бизнес-требования выст­раиваются на основе наличия поля по своей сути, но без учета ре­ального качества данных, заполняющих его.
Приведу небольшой пример. В одном из банков требовалось выявлять дубликаты данных клиентов на основании основной бан­ковской системы. Выбор полей был естественным – ФИО, дата рож­дения, место рождения. Однако в ходе профилирования выяснилось, что дата рождения заполнена только на 20%, а место – на 2%. При­менение правила поиска пришлось сузить только до самых новых клиентов, для которых заполнение трех указанных полей стало обя­зательным. И пришлось придумывать еще много вариантов поиска дублирующихся записей на основе других признаков.
64
Примеры результатов профилирования данных объекта метадан-
ных в каталоге метаданных приведены на рисунке 21.
Рисунок 21. Пример профиля данных
Отдельно необходимо выделить среди функций каталога воз­можность при подключении к нему новой системы определять, что за данные в ней находятся и нет ли таких данных в других системах. Это очень важная особенность современных каталогов данных, ко­торая серьезно упрощает работу по описанию данных для сотруд­ников CDOO.
Обычно подобные поисковые механизмы пользуются искусст­венным интеллектом, чтобы более точно предсказать, какие из дан­ных являются близкими друг к другу по сути.
9.3.6 Data Lineage и impact analysis
Как бы то ни было основным инструментом для работы специ­алистов в составе каталога остается data lineage. Это зависимость между объектами метаданных, которая выявляется по запросам, сер­висам, интеграционным процессам и визуализируется каталогом. Промышленные каталоги метаданных позволяют менять размер и глубину просматриваемой области связей, так как иногда в нее по­падают тысячи объектов, что заставляет ждать пользователя. Чтобы избежать задержки, обычно data lineage строится сначала в общем виде, давая возможность пользователю выбрать требуемую глубину
65
и направление просмотра. Важной функцией промышленных ката­логов метаданных является детализация взаимосвязей до уровня отдельных трансформаций над данными. Чаще всего такие требо­вания применяются при изучении потоков данных, реализованных на ETL/ELT-средствах или SQL-запросах.
Анализ влияния (или impact analysis) – это действия по изуче­нию влияния изменений в одних системах на другие на основе пост­роенного data lineage. Так как каталог метаданных сканирует систе­мы обычно ежедневно, то при обновлении какой-либо из систем возможно образование разрывов в зависимостях, что однозначно указывает на появление неверных данных затем в отчетах и анали­тике. Это будет сигналом к действию стюарда данных по информи­рованию бизнес-подразделений о наличии проблем с отчетностью, а для ИТ-служб – указанием, какие нестыковки необходимо устра­нить.
Одновременно это же служит поводом для руководителя под­разделения по управлению данными к изменению организационной политики по предварительному извещению об изменениях в систе­мах с его обязательным подтверждением.
9.3.7 Связи моделей данных
Вернемся к тому, почему каталог важен при управлении данны­ми. Бизнес-пользователь со стороны глоссария должен иметь воз­можность перейти к физической реализации систем, чтобы увидеть соответствие требованиям. И с другой стороны, технический специ­алист должен понимать, с чем он работает. Название таблицы и поля зачастую не могут дать никакой дополнительной информации пользо­вателю. В ряде банковских систем, особенно западной разработки, такая ситуация встречается часто.
Для таких случаев каталог может в качестве одного из ресурсов сканирования использовать сам бизнес-глоссарий, чтобы присвоить затем нужный термин нужному техническому объекту метаданных. Тогда каждый объект и сам data lineage смогут в себе содержать как технические, так и бизнес-составляющие, усиливая понимание ре­альной ситуации с данными.
Важно, что каталог дает возможность перейти в каждый объект для просмотра его структуры и качества, а также построить data lineage из любого выбранного объекта в нужную сторону.
66
9.3.8 Выявление доменов данных
Особенным механизмом этого типа программных инструмен­тов является выявление доменов данных и присвоение техническим объектам соответствующих терминов. Мы уже упоминали об этом в разделе о бизнес-глоссарии, который ожидает от каталога найден­ных объектов, подходящих под бизнес-описание, для построения связи между термином и объектом физической модели.
Есть несколько вариантов выявления такого соответствия. Рас­смотрим основные из них.
1. Построение соответствия на основе названия физических
объектов.
Оптимальный способ, если система спроектирована так, что по названию таблиц и полей можно сделать вывод о сущности храни­мых данных.
2. Построение соответствия на основе соответствия данных оп-
ределенному списку.
Этот метод использует обычно искусственный интеллект для выявления домена данных. Естественно, каталог нужно заранее обу­чать на существующих данных для более точного результата. Такой способ хорошо подходит для данных, содержащих информацию опи­сательного характера – фамилии, имена, названия продуктов и т.п.
3. Выявление домена на основании правил и условий. Этот ме­тод хорошо работает при возможности выявить маску заполнения данных (даты, номера телефонов, адреса электронной почты и т.д.) и наложения уточняющих условий. Хотя самое большое количество ошибок в результатах обычно дает именно этот метод.
Например, как выявить дату рождения или дату транзакции? Мы быстро можем выявить, где находится дата, а вот условия, опреде­ляющие именно этот тип даты, надо серьезно продумать заранее и протестировать на используемых массивах данных.
4. Комбинированные методы. Естественно, делать ставку толь­ко на один из перечисленных выше способов выявления доменов данных часто неразумно.
Обычно используется сочетание методов работы с данными и названиями метаданных. Но увеличение числа правил методов при­водит к существенному увеличению времени, которое затрачивает каталог на сканирование. Для ежедневного исследования метадан-
67
ных использовать такие методы нужно осторожно, чтобы успеть за­вершить все расчеты к началу рабочего дня специалистов (если, ко­нечно, сканирование выполняется ночью).
Любой метод не дает точного попадания в выбранный домен. Поэтому многие каталоги определяют процент соответствия, а так­же имеют правила, которые дают возможность сделать присвоение физическому объекту термина при превышении определенной гра­ницы в процентах. Если процент не столь высок, чтобы сделать опе­рацию автоматически, обычно у эксперта или архитектора данных появляется задача на ручное присвоение термина с рекомендацией от системы.
В результате выявления доменов данных каталог подтянет биз­нес-описания из глоссария, проведет связи с объектами физической модели, может изменить логическую модель данных, а также опо­вестить заинтересованных лиц об этом.
Теперь у специалиста есть возможность не только посмотреть сам объект метаданных, но и его бизнес-описания из глоссария. Кроме того, бывает необходимо понять весь набор физических объек­тов, попадающих под нужный домен данных.
Вообще, самой длительной операцией при настройке каталога метаданных является именно обучение системы и построение нуж­ного набора правил для выявления доменов и построения связей с бизнес-глоссарием.
9.3.9 Каталог каталогов
Иногда в организации уже есть один или несколько каталогов, которые умеют работать с определенными наборами метаданных. Часто крупные производители программного обеспечения выпуска­ют возможность анализа физической модели для своих систем. Но такие решения бывает сложно расширить на изучение других сис­тем.
Появившийся не так давно термин «Каталог каталогов» означа­ет возможность каталога метаданных обращаться к локальному сред­ству, работающему для узкого круга систем, для получения инфор­мации о структурах хранения и перемещения данных. Этот подход позволяет:
- не нагружать пользователей бизнес-подразделений нескольки-
ми системами для исследования метаданных;
68
- получить полную информацию и зависимости;
- не проводить сканирование метаданных несколько раз.
При таком подходе без дополнительной нагрузки на системы­источники метаданных каталог каталогов забирает данные из дос­тупных «более узких» каталогов, становясь «зонтичным» решени­ем, позволяющим сотрудникам CDOO выполнять свою работу вне зависимости от типов применяемых в организации систем.
МЕТОДИЧЕСКИЕ РЕКОМЕНДАЦИИ ПО ПОДГОТОВКЕ
2.
К СЕМИНАРСКИМ (ПРАКТИЧЕСКИМ) ЗАНЯТИЯМ
Основной целью организации подготовки к практическим заня­тиям является развитие навыков целеполагания и постановки задач стратегического управления данными организациями, навыков при­менения методов стратегического анализа и управления данными. При подготовке к каждому занятию необходимо обратиться к курсу лекций по данному вопросу и учебным пособиям.
Все более становится очевидным, что в процессе подготовки специалиста главным является не усвоение готовых знаний, а раз­витие у выпускников способностей к овладению методами позна­ния, дающими возможность самостоятельно добывать знания, твор­чески их использовать на основе известных или вновь созданных способов и средств деятельности.
Меняется сама парадигма конечной образовательной цели: от «специалиста-исполнителя» – к компетентному «профессионалу­исследователю». Стать таким специалистом без хорошо сформиро­ванных умений и навыков самостоятельной учебной деятельности невозможно.
В рамках требований ФГОС ВО к уровню подготовки выпускни­ков они должны: быть способными к самостоятельному поиску исти­ны, к системному действию в профессиональной ситуации, к анализу и проектированию своей деятельности; обладать стремлением к са­мосовершенствованию (самосознанию, самоконтролю, саморегуля­ции, саморазвитию); стремиться к творческой самореализации.
ВОПРОСЫ И ЗАДАНИЯ ДЛЯ ЗАНЯТИЙ
2.1
СЕМИНАРСКОГО ТИПА
Тема 1. Общее понимание стратегического менеджмента
Вопросы для опроса:
1. Этапы становления стратегического менеджмента
69
2. Понятие и сущность стратегического менеджмента
3. Понятие стратегии
4. Достоинства и недостатки стратегического подхода к управ-
лению
5. Составляющие стратегического управления
6. Соотношение стратегического и оперативного управления
Тема 2. Базовые стратегии организации
Практическое задание № 1 Практическая ситуация №1:
Пензенская фирма «Ваши двери» существует всего 7 лет, тем не менее за это время она завоевала доброе имя у потребителей. Ос­новным видом деятельности предприятия является производство, реализация и установка деревянных и металлических дверей. Кон­курентами «Ваши двери» являются «Мир дверей» и «Дверной аль­янс». «Дверной альянс» занимает лидирующие позиции на рынке Приволжского региона России, активизируя свою деятельность на всех территориальных сегментах. «Мир дверей» акцентирует свое присутствие на рынке Пенза и Пензенской области. На рынке Пен­зенской области емкость рынка существенно больше, чем представ­ленная на нем продукция конкурентов. Поэтому сегодня фирма «Ваши двери» работает в Пензе. В перспективе она предполагает выйти на рынки Приволжского региона за пределами Пензенской области, поскольку даже однократный выход на потребителей за пределами области был для фирмы весьма удачным. Деятельность «Ваши двери» за последние три года характеризуется такими циф­рами. Выручка от реализации товаров и услуг в 2013 г. составила 13 млн 510 тыс. руб., в 2014 г. –10 млн 371 тыс. руб., в 2015 г. –16 млн 266 тыс. руб. Прибыль, соответственно, по годам: 3 млн 665 тыс. руб., 1 млн 383 тыс. руб. и 830 тыс. руб. Рост объема про­даж в 2015 г. был достигнут за счет снижения реализационных цен, что сказалось на себестоимости. Ее уровень имеет тенденцию к уве­личению: в 2013 г. доля себестоимости в объеме продаж составляла 72,9%, в 2014 г. – 86,7%, а в 2015 г. – 84,9%. Именно этим, прежде всего, объясняется снижение прибыли. Такое положение не может устроить руководство фирмы. Перед ним стоит задача изменить сло­жившуюся ситуацию. Для того чтобы осуществить процесс форму-
70
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]