Добавил:
Upload Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:
Лекции / Лекция 17 Перспективы БД.doc
Скачиваний:
46
Добавлен:
11.06.2015
Размер:
3 Мб
Скачать

Развитие средств работы с бд

Рост объемов БД создает трудности для всех компонент информационной системы. Чем больше данных, тем больше способов их обработать, что в свою очередь приводит к дальнейшему росту объема данных. Данные надо передавать, хранить, структурировать и обрабатывать в реальном времени.

Существует множество нерешенных проблем при работе с контентом: семантическая неоднородность; разнообразие форм представления данных, неполнота и неточность данных; ограниченность доступа к конфиденциальным данным и т.д. Требуется в онлайн искать, получать, анализировать и представлять огромные объемы информации. В понятие управления данными следует включить вопросы, связанные с управление контентом в Интернет, интеллектуальным поиском, удаленным вводом данных и др. Для повышения эффективности работы с данными необходимо:

  • создание средств сбора, агрегирования и фильтрация информации, сохранения знаний и информации;

  • интеграция данных;

  • обеспечение надежного и безопасного доступа к данным с произвольного устройства;

  • классификация и кастомизация знаний и информации;

  • анализ данных, моделирование и прогнозирование обстановки;

  • совместная работа с различными формами хранения данных (точка, профиль, объектные файлы);

  • организация тиражирования данных, с распределенным размещением дубликатов;

  • применение кэширования данных как можно ближе к клиентам, миграции данных по сети;

  • мониторинг работы планировщиков запуска приложений с отслеживанием изменений в реальном времени;

  • структурирование воздействий в соответствии с принятыми политиками реагирования;

  • применение систем поддержки принятия решений;

  • создание среды, в которой владельцам данных не требуется знать, где находятся их данные, поскольку они всегда могут получить доступ к ним со своего компьютера.

Большинство предприятий имеет затруднения при интеграции "островков информации". Интеграция данных имеет несколько уровней. Так необходима интеграция данных в рамках одной предметной области (дисциплины), предприятия или нескольких предприятий. Интеграция данных на уровне одной дисциплины проводится, как правило, средствами СУБД – создание единых форматов хранения данных, позволяющих без изменения структуры добавлять новые параметры, типы данных. Например, в области океанографии в одном дисциплинарном массиве хранятся практически все основные виды наблюдений, выполняемые на океанографической станции (метео, термохалинные параметры, гидрохимия, загрязнение, батитермографные, СТД зондирования). Интеграцию информации в масштабах предприятия можно провести построением хранилищ, витрин данных, их приведением к единой универсальной модели данных, позволяющей хранить данные в единой структуре в виде триплов и атомарной единице хранения - значение одного атрибута.

Современные подходы к решению задач обработки данных связаны с интеграцией распределенных и разнородных данных, позволяющей регулярно получать информацию из различных оперативных и неоперативных систем. При этом информация обновляется в соответствии с регламентом пополнения источников таких данных. За счет интеграции увеличивается широта представленных данных, появляется возможность работы с различными формами представления данных (временные ряды, профили, сеточные данные и каталоги объектных файлов). На основе интегрированных данных создаются системы нового поколения, выполняющие отдельные функции ГИС, ИАС, АСУ, СППР, АСНИ. Например, для организации поиска данных через карту или для их простой визуализации (оцифровка данных и построение изолиний) необходима только небольшая часть функций ГИС. Аналогично, функции агрегации и анализа данных могут браться из пакетов программ типа MATLAB или Статистика.

Создание метаданных все еще остается проблемой для многих БД. Для обмена метаданными разрабатываются соответствующие структуры для различных объектов метаданных. Для обмена сведениями об Интернет-ресурсах может использоваться формат Dublin Core, для обмена новостной информацией – RSS, для информационного обмена между программными компонентами разрабатываются стандартные интерфейсы (API), позволяющие усваивать информацию, как из технологии интеграции данных, так и других компонент.

Сервисы БД теперь доступны не только с персонального компьютера, но и с мобильных Интернет – устройств (смартофоны, коммуникаторы и нетбуки). Кроме того, разрабатываются информационно-справочные киоски (использующие сенсорные экраны) в местах массового скопления людей (аэропортах, вокзалах и др.) для быстрого получения информации о состоянии объекта в том или ином пункте. Технология информационного обслуживания пользователей различных категорий использует средства агрегации данных и подготовки аналитической продукции на основе интегрированных данных.

В последнее десятилетие кроме текста стали широко применяться другие типы данных (изображения, мультимедиа - аудио- и видеоданные). Если в восьмидесятые и девяностые года прошлого столетия в БД доминировали структурированные данные, то сейчас объём неструктурированных данных превышает объем структурированных. Эти данные все чаще используются в аналитических целях.

Данные должны стать самоописывающимися, т.е. содержать как собственно подлежащую обработке информацию, так и метаданные, описывающие содержание обрабатываемых данных. К примеру, к цифровому фотоизображению или видеокадру добавляется метаинформация о времени, месте, условиях съемки и т.д.

Традиционно применяемый в информационно-поисковых системах контекстный поиск по ключевым словам перестает удовлетворять пользователей. Особенно это заметно в поисковых средствах, ориентированных на работу в Интернет. Огромные объемы хранимых в Интернет текстовых документов приводят к недопустимо высокому уровню нерелевантных документов при их поиске. Поэтому для решения этой проблемы при поиске используется не только контекст, но и семантика документов в виде тезаурусов, онтологий и т.д.

Информацию надо искать по месту, времени и другим свойствам. Для выполнения анализа текстов и поддержки поиска с использованием семантики приходится иметь дело с огромными объемами информации. Для этого не пригодны ни традиционные файловые системы, ни современные СУБД. Проблемой является также создание простых способов анализа, обобщения, поиска и обозрения электронных подборок мультимедийной информации, относящейся к некоторой персоне. При выдаче ответа на запросы пользователей система должна оценивать полноту и релевантность результатов выдачи, чтобы пользователи могли понять, что они получили. Фактически необходимо объединение возможностей СУБД и файловых систем. Современные СУБД должны поддерживать неструктурированные (текстовые), пространственные и мультимедийные данные; временные ряды; процедурные данные; триггеры; потоки данных. Крупные фирмы – разработчики СУБД включают в свои продукты дополнительные приложения, которые позволяют работать с подобной информацией. Например, СУБД Oracle имеет картриджи для работы с пространственными, текстовыми и XML данными.

Данные должны управлять системой, поэтому средства манипулирования знаниями в виде правил должны тоже стать составной частью БД. При этом однородные правила оформляются в виде критических значений атрибутов, которые определяют критерии (условия) выполнения правил. Значения критериев выдачи в команде select заполняются только в момент выполнения запроса. Здесь можно определить правила контроля данных, критерии выдачи рекомендаций, правила обработки сообщений системы и т.п. Правила запуска заданий для доставки тех или иных данных в другие приложения (системы) тоже оформляется в виде набора правил (триггеров).

Для современных БД существенно наличие обновляемых View-представлений. При изменениях таблицы может потребоваться модификация программ, поэтому необходимо стандартизовать представления. Эти представления могут стать прообразами стандартов для отражения свойств различных объектов.

Новые СУБД будут распознавать интересующую пользователя или приложение информацию за счет метаданных; усваивать большие объемы данных в реальном времени; генерировать и синтезировать за счет имеющихся в БД информации новые наборы данных.

Новые СУБД, призванные обслуживать сотни тысяч пользователей в режиме онлайн и работать с петабайтами данных, должны решать такие задачи, как обработка аналитических запросов к огромным наборам данных или выполнение транзакций, требующих высокой производительности. При этом необходимо использовать современные модели организации облачных технологий (инфраструктура как сервис - IaaS, платформа как сервис - PaaS, программное приложение как сервис - SaaS).

При создании и поддержке БД должны применяются следующие стандарты, табл.1.

Таблица 1 – Основные стандарты создания и поддержки БД

Назначение

Стандарты

Управление данными и приложениями

Мониторинг аппаратно-программных средств

Common information model (CIM),

Simple Network Management Protocol (SNMP), Windows Management Instrumentation (WMI)

Сбор и обработка данных и знаний

JSR87 – Java Agent Services

Управление загрузкой данных

Application Response Measurements (ARM)

Функциональные стандарты

ISO 19120:2001

Правила для схемы приложений

ISO 19109:2003

Интеграция данных

Набор основных семантических элементов, описывающий публикации, http://dublincore.org/documents/dcq-html/

ISO 15836: 2003 DC (Dublin Core) RFC 2413, RFC 2731

Технология интеграции распределенных и неоднородных данных, http://data.meteo.ru/ru/e2edm/index.php?section=1

E2EDM

Описание информационных ресурсов в области образования, http://ltsc.ieee.org/wg12

LOM (Learning Object Metadata): 2002 P1484.12.1

Поддержка сервисов

Регистр источников сервисов

UDDI

Регистр сервисов

WSDL

Доступ к простым объектам. Часть 1: Общая архитектура. Часть 2: Доступ через SQL

ISO 19125:2004

Простой протокол обмена данными

SOAP

Диагностика проблем за счет взаимодействия с источниками данных

JSR47 - Logging API Specification

Сервисы

ISO 19119

Координация Web-сервисов, http://www.isotc211.org/opendoc/211n2034/

TC211/OGC: 2006

Определение прикладных сервисов и спецификация протокола

ISO 23950:1998

Администрирование сервисов

Общий интерфейс

JSR168

Спецификация портлетов, выполняемых на одном узле

JSR286

Спецификация удаленных портлетов

WSRP

Программный интерфейс приложения

API

Качество данных

Принципы оценки качества

ISO 19113:2002, ГОСТ Р ИСО 19113-2003

Методы оценки качества

ISO 19114:2003

Качество программных средств

ISO 9126

Структуры данных

Эталонная модель

ISO 19101:2002

Язык концептуальной схемы

ISO 19103

Профили

ISO 19106:2004

Временная схема

ISO 19108:2002

Методология каталогизации

ISO 19110

Почтовые адреса

ISO 11180

Представление дат и времени, http://xml.coverpages.org/ISO-FDIS-8601.pdf

ISO 8601:2000

Семибитное кодирование набора символов

ISO 646

Модель описания датчиков, приборов и генерируемых ими потоков информации (http://vast.uah.edu/SensorML/)

SensorML (The Sensor Model Language)

Метаданные

Метаданные

ISO 19115:2003

Географический язык разметки GML

ISO 19136

Каталоги, директории и регистры

ISO 19126

Электронная визитная карточка – описание персоны

vCard, REC 2426

Информация о научных проектах (“Проект”, “Организация” и “Персона”)

CERIF

Метаданные – Реализация XML схемы

ISO 19139

Библиографические описания – содержание форма и структура

ISO 690:1987

Информационные технологии – Регистр метаданных. Стандарт для описания элементов данных в БД и документах

ISO 11179

Интеграция информационно – измерительных систем, обмена сообщениями между сенсорами и компьютером, http://www.opengeospatial.org/legal

TML (Transducer Markup Language), 2005

Общая метамодель для обмена метаданными при использовании технологий Хранилищ данных

CWM (Common Warehouse Metamodel)

Кодирование и передача метаданных

METS (Metadata Encoding and Transmission Standard)

Описание моделей данных, реляционных схем, схем обмена данными

MDC OIM (Metadata Coalition Open Informational Model)

Протокол сбора метаданных, http://www.openarchives.org/OAI/openarchivesprotocol.html

Protocol for Metadata Harvesting, the Open Archives Initiative (OAI)

Среда описания ресурсов с разной степенью формализации , http://www.w3.org/RDF/

RDF (Resource Description Framework)

Описание схемы классов и их свойств, с учетом их наследования, ограничений, http://www.w3.org/TR/REC-rdf-syntax/

RDFS (Resource Definition Framework Schema)

Описание предметных онтологий на основе RDFS http://ontology.com/

OWL (Web Ontology Language)

Классификаторы

Кодирование (шифрование)

ISO 19118: 2003

Коды стран

ISO 3166

Сокращения названий языков

ISO 639-2:1998

Модель определения основной структуры и содержания схемы концепций тезауруса, классификационных схем, таксономий, «фолксономий» терминов и определений, глоссариев и других типов контролируемых словарей. http://www.w3.org/2004/02/skos/mapping/spec/

SKOS Core (SKOS Mapping Vocabulary Specification): 2004

Пространственные данные

Пространственная схема

ISO 19107:2003

Привязка в пространстве по координатам, http://portal.opengeospatial.org/files/?artifact_id=6716

ISO 19111:2003

Привязка в пространстве по географическим идентификаторам

ISO 19112:2003

Услуги определения координат

ISO 19116:2004

Изображения и растровые данные

ISO 19121:2000

Схема геометрического и функционального покрытия

ISO 19123:2004

Геодезические коды и параметры

ISO 19127

Интерфейс картографического сервера

ISO 19128

Содержание цифровых геопространственных метаданных

FGDC STD 001–1998

Передача пространственных данных.

Часть 5: Профиль и расширения для растровых данных.

Часть 6: Профиль для точечных данных,

Часть 7: Профиль CADD

FGDC STD 002.5– 1999,

FGDC STD 002.6,

FGDC STD 002.7– 2000

Точность определения геопространственных координат

FGDC STD 007– 1998

Содержание цифровых ортоизображений

FGDC STD 008– 1999

Содержание сканерных данных дистанционного зондирования

FGDC STD 009– 1999

В последние годы стали много говорить о создании единого информационного пространство (ЕИП). Понимание этого термина у многих разное. Одни считают, что Интернет уже создает ЕИП, другие - ЕИП это единое окно доступа к информационным ресурсам и сервисам через веб-портал. К сожалению, это далеко не так, т.к. в этих случаях использовать полученную информацию от различных приложений можно только с экрана. А автоматически включить полученную информацию в другое приложение очень трудно - только путем предварительной договоренности о месте записи файла и его структуре. То есть основным критериями ЕИП являются:

  • кросплатформенность - разработчик БД помещает свои данные, не задумываясь, в какой ОС, СУБД он работает и где она установлена;

  • возможность автоматического обмена данными и информацией - пользователь не зная, где находятся, необходимые ему данные, получает их в том составе, виде, форме и в той нотации словарей, с которой он привык работать.

При разработке ЕИП необходимо широкое использование:

  • систем классификации и кодирования информации;

  • средств интеграции разнородных и распределенных данных;

  • облачных технологий (IaaS, PaaS, SaaS);

  • стандартизации протоколов обмена данными, структур данных;

  • программ учета и архивации данных;

  • современных коммуникационных средств (web-камер, Skype, ICQ, мобильных телефонов, коммуникаторов, др.);

  • сервис-ориентированной архитектуры, использующей открытые стандарты UDDI, WSDL, SOAP и тематических XML-схем [20];

  • геоинформационных систем.