Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Интеллектуальные базы данных. Учебное пособие

.pdf
Скачиваний:
0
Добавлен:
12.08.2026
Размер:
1 Мб
Скачать

ФЕДЕРАЛЬНОЕ АГЕНТСТВО СВЯЗИ

Федеральное государственное образовательное бюджетное учреждение высшего профессионального образования

Московский технический университет связи и информатики

Кафедра Математической кибернетики и информационных технологий

Л.И.Воронова

ИНТЕЛЛЕКТУАЛЬНЫЕ БАЗЫ ДАННЫХ

Учебное пособие

Москва 2013

ФЕДЕРАЛЬНОЕ АГЕНТСТВО СВЯЗИ

Федеральное государственное образовательное бюджетное учреждение высшего профессионального образования

Московский технический университет связи и информатики

Кафедра Математической кибернетики и информационных технологий

Л.И.Воронова

ИНТЕЛЛЕКТУАЛЬНЫЕ БАЗЫ ДАННЫХ

Учебное пособие

для направлений:

230100 - Информатика и вычислительная техника

220301 - Автоматизация технологических процессов и производств (связь)

Москва 2013

1

УДК 004.62+ 004.048

Воронова Л.И. Интеллектуальные базы данных: Учебное пособие / МТУСИ. – М., 2013. – 35 с.

В подготовке рукописи принимали участие магистранты факультета информационных технологий МТУСИ гр. М231101 Стариков Дм. (гл.4), Поволоцкий О., Демина Н. (гл. 2,3).

В учебном пособии ―Интеллектуальные базы данных» рассмотрены вопросы применения методов интеллектуального анализа данных (Data Mining) к большим объемам данных (Data Warehouse). Проанализированы соответствующие программно-инструментальные средства, в том числе технологии известные как «NoSQL» базы данных - решения альтернативные реляционным базам данных.

Список лит. 16 назв.

Издание утверждено Методическим советом университета. Протокол № 4 от 09.04.2013г.

Рецензенты: А.Г.Таташев, д.ф.-м.н., профессор (МТУСИ) В.А.Клетин, к.т.н., профессор (РГГУ)

© Московский технический университет связи и информатики, 2013 г.

2

ВВЕДЕНИЕ

Современная экономика, характеризующаяся высокой динамичностью, требует применения адекватных методов и средств оптимального управления предприятиями. Главная проблема современного бизнеса заключается сегодня в переизбытке неструктурированных данных; они составляют 85% всех данных, которыми оперируют сегодня предприятия. Именно на их обработку будут направлены основные усилия — важно не только собрать и организовать хранение структурированных и неструктурированных данных, а еще требуется организовать эффективный поиск, установить сквозные связи и понять их значение. В силу сложности и часто неформализованности подобную задачу невозможно решить без использования средств искусственного интеллекта.

Внастоящее время существует большое количество разных классов интеллектуальных систем. К ним относятся интеллектуальные базы данных,

вт.ч. с интерфейсами, использующими естественный язык, гипертекст и мультимедиа, когнитивную графику; статические и динамические экспертные системы; самообучающиеся системы на принципах индуктивного вывода, нейронных систем, поиска прецедентов, организации информационных хранилищ; адаптивные информационные системы на основе использования CASE-технологий и/или компонентных технологий.

Вучебном пособии «Интеллектуальные базы данных» рассмотрены вопросы применения некоторых методов анализа данных и соответствующих программно-инструментальных средств, в том числе OLAP, Data Mining,

DataWarehouse, NoSQL БД.

Целью учебного пособия является ознакомление студентов, обучающихся магистратратуре по направлению 230100Информатика и вычислительная техника с проблематикой и областями использования интеллектуальных баз данных и применения интеллектуального анализа для больших данных. В результате изучения учебного пособия студенты получат базовые знания по архитектуре и классификации хранилищ данных, методам интеллектуального анализа данных и основных подходах при работе с современными нереляционными базами данных, способными к высокопроизводительной обработке данных.

3

Глава 1. ХРАНИЛИЩА ДАННЫХ

Интеллектуальные базы данных (ИБД) отличаются от обычных баз данных возможностью выборки по запросу необходимой информации, которая может явно не храниться, а выводиться из имеющейся в базе данных. Примерами таких запросов могут быть следующие:

-―Вывести список товаров, цена которых выше среднеотраслевой‖,

-―Вывести список товаров-заменителей некоторой продукции‖,

-―Вывести список потенциальных покупателей некоторого товара‖ и т.д.

Для выполнения первого типа запроса необходимо сначала проведение статистического расчета среднеотраслевой цены по всей базе данных, а уже после этого собственно отбор данных. Для выполнения второго типа запроса необходимо вывести значения характерных признаков объекта, а затем поиск по ним аналогичных объектов. Для третьего типа запроса требуется сначала определить список посредников-продавцов, выполняющих продажу данного товара, а затем провести поиск связанных с ними покупателей.

Во всех перечисленных типах запросов требуется осуществить поиск по условию, которое должно быть доопределено в ходе решения задачи. Интеллектуальная система без помощи пользователя по структуре базы данных сама строит путь доступа к файлам данных. Формулирование запроса осуществляется в диалоге с пользователем, последовательность шагов которого выполняется в максимально удобной для пользователя форме.

В отличие от ИБД информационное хранилище (Data Warehouse) представляет собой хранилище извлеченной значимой информации из оперативной базы данных, которое предназначено для оперативного анализа данных. Извлечение знаний из баз данных осуществляется регулярно, например, ежедневно.

Типичными задачами оперативного ситуационного анализа являются:

определение профиля потребителей конкретного товара;

предсказание изменений ситуации на рынке;

анализ зависимостей признаков ситуаций (корреляционный анализ) и др.

Для извлечения значимой информации из баз данных используются специальные методы (Data Mining или Knowledge Discovery), основанные или на применении многомерных статистических таблиц, или индуктивных

4

методов построения деревьев решений, или нейронных сетей. Формулирование запроса осуществляется в результате применения интеллектуального интерфейса, позволяющего в диалоге гибко определять значимые признаки анализа.

Разработкой и распространением информационных хранилищ в настоящее время занимаются такие компьютерные фирмы, как IBM

(Intelligent Miner), Silicon Graphics (MineSet), Intersolv (DataDirect, SmartData), Oracle (Express), SAS Institute (SAS/Assist) и др.

Хранилище данных (Data Warehouse) — предметно ориентированная информационная база данных, специально разработанная и предназначенная для подготовки отчѐтов и бизнес-анализа с целью поддержки принятия решений в организации. Строится на базе систем управления базами данных

исистем поддержки принятия решений. Данные, поступающие в хранилище данных, как правило, доступны только для чтения. Данные из OLTP-системы копируются в хранилище данных таким образом, чтобы построение отчѐтов

иOLAP-анализ не использовал ресурсы транзакционной системы и не нарушал еѐ стабильность. Как правило, данные загружаются в хранилище с определѐнной периодичностью, поэтому актуальность данных может несколько отставать от OLTP-системы.

При организации хранилища учитывается ряд принципов.

1.Проблемно-предметная ориентация. Данные объединяются в категории и хранятся в соответствии с областями, которые они описывают, а не с приложениями, которые они используют.

2.Интегрированность. Данные объединены так, чтобы они удовлетворяли всем требованиям предприятия в целом, а не единственной функции бизнеса.

3.Некорректируемость. Данные в хранилище данных не создаются: т.е. поступают из внешних источников, не корректируются и не удаляются.

4.Зависимость от времени. Данные в хранилище точны и корректны только в том случае, когда они привязаны к некоторому промежутку или моменту времени.

Существуют два архитектурных направления дизайна хранилищ – нормализованные хранилища данных и хранилища с измерениями.

5

Внормализованных хранилищах данные находятся в предметно ориентированных таблицах третьей нормальной формы. Нормализованные хранилища характеризуются как простые в создании и управлении, недостатки нормализованных хранилищ – большое количество таблиц как следствие нормализации, из-за чего для получения какой-либо информации нужно делать выборку из многих таблиц одновременно, что приводит к ухудшению производительности системы.

Хранилища с измерениями используют схему «звезда» или схему «снежинка». При этом в центре «звезды» находятся данные (Таблица фактов), а измерения образуют лучи звезды. Различные таблицы фактов совместно используют таблицы измерений, что значительно облегчает операции объединения данных из нескольких предметных таблиц фактов (Пример – факты продаж и поставок товара). Таблицы данных и соответствующие измерения образуют архитектуру «шина». Измерения часто создаются в третьей нормальной форме, в том числе, для протоколирования изменения в измерениях. Основными достоинствами хранилищ с измерениями является простота и понятность для разработчиков

ипользователей, также, благодаря более эффективному хранению данных и формализованным измерениям, облегчается и ускоряется доступ к данным, особенно при сложных анализах. Основными недостатками являются более сложные процедуры подготовки и загрузки данных, а также управление и изменение измерений данных.

Вхранилище происходят процессы работы с данными. При этом источниками данных могут быть как традиционные системы регистрации операций, так и отдельные документы; наборы данных.

Перечислим операции с данными:

1) извлечение – перемещение информации от источников данных в отдельную БД, приведение их к единому формату;

2) преобразование – подготовка информации к хранению в оптимальной форме для реализации запроса, необходимого для принятия решений;

3) загрузка – помещение данных в хранилище, производится атомарно, путем добавления новых фактов или корректировкой существующих;

4) анализ – OLAP, Data Mining, сводные отчѐты;

6

5) представление результатов анализа.

Вся эта информация используется в словаре метаданных. В словарь метаданных автоматически включаются словари источников данных. Здесь же форматы данных для их последующего согласования, периодичность пополнения данных, согласованность во времени. Задача словаря метаданных состоит в том, чтобы освободить разработчика от необходимости стандартизировать источники данных.

Создание хранилищ данных не должно противоречить действующим системам сбора и обработки информации. Специальные компоненты словарей должны обеспечивать своевременное извлечение из словарей и обеспечить преобразование к единому формату на основе словаря метаданных.

Логическая структура данных хранилища данных отличается от структуры данных источников данных. Для разработки эффективного процесса преобразования необходима хорошо проработанная модель корпоративных данных и модель технологии принятия решений.

Данные для пользователя удобно представлять в многомерных БД, где в качестве измерения могут выступать время, цена или географический регион.

Кроме извлечения данных из БД, принятия решений важен процесс извлечения знаний, в соответствии с информационными потребностями пользователя.

С точки зрения пользователя в процессе извлечения знаний из БД должны решаться следующие преобразования: данные → информация → знания → полученные решения.

В последние годы необходимость обращения с накопленной корпоративной информацией, как с Большими данными, осознало большое число российских компаний. Технологии обработки Больших Данных, казавшиеся экзотикой, стали находить промышленное применение, вендоры выпустили новые средства хранения, анализа и защиты Больших Данных, наконец, работа с Большими Данными стала еще активнее рассматриваться в контексте облачных сервисов, причем не только частных, но и публичных. Более того, многие аналитики полагают, что именно Большие Данные станут катализатором бурного развития облачных инфраструктур.

7

Глава 2. DATA MINING

Целью интеллектуального анализа данных (англ. Data mining, другие варианты перевода - "добыча данных", "раскопка данных") является обнаружение неявных закономерностей в наборах данных. Как научное направление, он стал активно развиваться в 90-х годах XX века, что было вызвано широким распространением технологий автоматизированной обработки информации и накоплением в компьютерных системах больших объемов данных [1, 2]. И хотя существующие технологии позволяли, например, быстро найти в базе данных нужную информацию, этого во многих случаях было уже недостаточно. Возникла потребность поиска взаимосвязей между отдельными событиями среди больших объемов данных, для чего понадобились методы математической статистики, теории баз данных, теории искусственного интеллекта и ряда других областей.

Классическим считается определение, данное одним из основателей направления Григорием Пятецким-Шапиро [2]: Data Mining - исследование и обнаружение "машиной" (алгоритмами, средствами искусственного интеллекта) в сырых данных скрытых знаний, которые ранее не были известны, нетривиальны, практически полезны, доступны для интерпретации.

Data Mining – это собирательное название, используемое для обозначения совокупности методов обнаружения в данных ранее не известных, нетривиальных, практически полезных и доступных интерпретации знаний, необходимых для принятия решений в различных сферах человеческой деятельности. Данный термин получил свое название из двух понятий: поиска ценной информации в большой базе данных (data) и добычи полезных ископаемых (mining). Оба процесса требуют просеивания огромного количества сырого материала или разумного исследования и поиска искомых ценностей.

Data Mining - мультидисциплинарная область, возникшая и развивающаяся на базе прикладной статистики, распознавания образов, искусственного интеллекта, теории баз данных и др. Суть и цель технологии Data Mining можно охарактеризовать так: это технология, которая предназначена для поиска в больших объемах данных неочевидных, объективных и полезных на практике закономерностей.

8

Неочевидные – найденные закономерности не обнаруживаются стандартными методами обработки информации или экспертным путем. Объективные - обнаруженные закономерности будут полностью соответствовать действительности, в отличие от экспертного мнения, которое всегда является субъективным. Практически полезные - выводы имеют конкретное значение, которому можно найти практическое применение.

Знания - совокупность сведений, которая образует целостное описание, соответствующее некоторому уровню осведомленности об описываемом вопросе, предмете, проблеме и т.д. Использование знаний означает действительное применение найденных знаний для достижения конкретных преимуществ (например, в конкурентной борьбе за рынок).

2.1. Классификация аналитических систем

Агентство Gartner Group, занимающееся анализом рынков информационных технологий, в 1980-х годах ввело термин " Business Intelligence " (BI), деловой интеллект или бизнес-интеллект.

Business Intelligence (BI) - программные средства, функционирующие в рамках предприятия и обеспечивающие функции доступа и анализа информации, которая находится в хранилище данных, а также обеспечивающие принятие правильных и обоснованных управленческих решений. Понятие BI объединяет в себе различные средства и технологии анализа и обработки данных масштаба предприятия. BI-системы также известны под названием Систем Поддержки Принятия Решений (СППР, DSS, Decision Support System). Эти системы превращают данные в информацию, на основе которой можно принимать решения, т.е. поддерживающую принятие решений.

Gartner Group определяет состав рынка систем Business Intelligence как набор программных продуктов следующих классов:

средства построения хранилищ данных (data warehousing, ХД); системы оперативной аналитической обработки (OLAP); информационно-аналитические системы (Enterprise Information

Systems, EIS);

средства интеллектуального анализа данных (data mining);

9

Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]