- •Развитие компьютерной техники
- •Развитие ядра субд
- •Развитие внешнего окружения
- •Развитие средств работы с бд
- •Развитие моделей данных
- •Каталог объектов
- •Используемые классификаторы
- •Объекты Экземпляры объекта Свойства объекта Индекс
- •Формы представления
- •Технологии обслуживания нового поколения
- •Список литературы
- •Перечень вопросов для самопроверки
Развитие средств работы с бд
Рост объемов БД создает трудности для всех компонент информационной системы. Чем больше данных, тем больше способов их обработать, что в свою очередь приводит к дальнейшему росту объема данных. Данные надо передавать, хранить, структурировать и обрабатывать в реальном времени.
Существует множество нерешенных проблем при работе с контентом: семантическая неоднородность; разнообразие форм представления данных, неполнота и неточность данных; ограниченность доступа к конфиденциальным данным и т.д. Требуется в онлайн искать, получать, анализировать и представлять огромные объемы информации. В понятие управления данными следует включить вопросы, связанные с управление контентом в Интернет, интеллектуальным поиском, удаленным вводом данных и др. Для повышения эффективности работы с данными необходимо:
создание средств сбора, агрегирования и фильтрация информации, сохранения знаний и информации;
интеграция данных;
обеспечение надежного и безопасного доступа к данным с произвольного устройства;
классификация и кастомизация знаний и информации;
анализ данных, моделирование и прогнозирование обстановки;
совместная работа с различными формами хранения данных (точка, профиль, объектные файлы);
организация тиражирования данных, с распределенным размещением дубликатов;
применение кэширования данных как можно ближе к клиентам, миграции данных по сети;
мониторинг работы планировщиков запуска приложений с отслеживанием изменений в реальном времени;
структурирование воздействий в соответствии с принятыми политиками реагирования;
применение систем поддержки принятия решений;
создание среды, в которой владельцам данных не требуется знать, где находятся их данные, поскольку они всегда могут получить доступ к ним со своего компьютера.
Большинство предприятий имеет затруднения при интеграции "островков информации". Интеграция данных имеет несколько уровней. Так необходима интеграция данных в рамках одной предметной области (дисциплины), предприятия или нескольких предприятий. Интеграция данных на уровне одной дисциплины проводится, как правило, средствами СУБД – создание единых форматов хранения данных, позволяющих без изменения структуры добавлять новые параметры, типы данных. Например, в области океанографии в одном дисциплинарном массиве хранятся практически все основные виды наблюдений, выполняемые на океанографической станции (метео, термохалинные параметры, гидрохимия, загрязнение, батитермографные, СТД зондирования). Интеграцию информации в масштабах предприятия можно провести построением хранилищ, витрин данных, их приведением к единой универсальной модели данных, позволяющей хранить данные в единой структуре в виде триплов и атомарной единице хранения - значение одного атрибута.
Современные подходы к решению задач обработки данных связаны с интеграцией распределенных и разнородных данных, позволяющей регулярно получать информацию из различных оперативных и неоперативных систем. При этом информация обновляется в соответствии с регламентом пополнения источников таких данных. За счет интеграции увеличивается широта представленных данных, появляется возможность работы с различными формами представления данных (временные ряды, профили, сеточные данные и каталоги объектных файлов). На основе интегрированных данных создаются системы нового поколения, выполняющие отдельные функции ГИС, ИАС, АСУ, СППР, АСНИ. Например, для организации поиска данных через карту или для их простой визуализации (оцифровка данных и построение изолиний) необходима только небольшая часть функций ГИС. Аналогично, функции агрегации и анализа данных могут браться из пакетов программ типа MATLAB или Статистика.
Создание метаданных все еще остается проблемой для многих БД. Для обмена метаданными разрабатываются соответствующие структуры для различных объектов метаданных. Для обмена сведениями об Интернет-ресурсах может использоваться формат Dublin Core, для обмена новостной информацией – RSS, для информационного обмена между программными компонентами разрабатываются стандартные интерфейсы (API), позволяющие усваивать информацию, как из технологии интеграции данных, так и других компонент.
Сервисы БД теперь доступны не только с персонального компьютера, но и с мобильных Интернет – устройств (смартофоны, коммуникаторы и нетбуки). Кроме того, разрабатываются информационно-справочные киоски (использующие сенсорные экраны) в местах массового скопления людей (аэропортах, вокзалах и др.) для быстрого получения информации о состоянии объекта в том или ином пункте. Технология информационного обслуживания пользователей различных категорий использует средства агрегации данных и подготовки аналитической продукции на основе интегрированных данных.
В последнее десятилетие кроме текста стали широко применяться другие типы данных (изображения, мультимедиа - аудио- и видеоданные). Если в восьмидесятые и девяностые года прошлого столетия в БД доминировали структурированные данные, то сейчас объём неструктурированных данных превышает объем структурированных. Эти данные все чаще используются в аналитических целях.
Данные должны стать самоописывающимися, т.е. содержать как собственно подлежащую обработке информацию, так и метаданные, описывающие содержание обрабатываемых данных. К примеру, к цифровому фотоизображению или видеокадру добавляется метаинформация о времени, месте, условиях съемки и т.д.
Традиционно применяемый в информационно-поисковых системах контекстный поиск по ключевым словам перестает удовлетворять пользователей. Особенно это заметно в поисковых средствах, ориентированных на работу в Интернет. Огромные объемы хранимых в Интернет текстовых документов приводят к недопустимо высокому уровню нерелевантных документов при их поиске. Поэтому для решения этой проблемы при поиске используется не только контекст, но и семантика документов в виде тезаурусов, онтологий и т.д.
Информацию надо искать по месту, времени и другим свойствам. Для выполнения анализа текстов и поддержки поиска с использованием семантики приходится иметь дело с огромными объемами информации. Для этого не пригодны ни традиционные файловые системы, ни современные СУБД. Проблемой является также создание простых способов анализа, обобщения, поиска и обозрения электронных подборок мультимедийной информации, относящейся к некоторой персоне. При выдаче ответа на запросы пользователей система должна оценивать полноту и релевантность результатов выдачи, чтобы пользователи могли понять, что они получили. Фактически необходимо объединение возможностей СУБД и файловых систем. Современные СУБД должны поддерживать неструктурированные (текстовые), пространственные и мультимедийные данные; временные ряды; процедурные данные; триггеры; потоки данных. Крупные фирмы – разработчики СУБД включают в свои продукты дополнительные приложения, которые позволяют работать с подобной информацией. Например, СУБД Oracle имеет картриджи для работы с пространственными, текстовыми и XML данными.
Данные должны управлять системой, поэтому средства манипулирования знаниями в виде правил должны тоже стать составной частью БД. При этом однородные правила оформляются в виде критических значений атрибутов, которые определяют критерии (условия) выполнения правил. Значения критериев выдачи в команде select заполняются только в момент выполнения запроса. Здесь можно определить правила контроля данных, критерии выдачи рекомендаций, правила обработки сообщений системы и т.п. Правила запуска заданий для доставки тех или иных данных в другие приложения (системы) тоже оформляется в виде набора правил (триггеров).
Для современных БД существенно наличие обновляемых View-представлений. При изменениях таблицы может потребоваться модификация программ, поэтому необходимо стандартизовать представления. Эти представления могут стать прообразами стандартов для отражения свойств различных объектов.
Новые СУБД будут распознавать интересующую пользователя или приложение информацию за счет метаданных; усваивать большие объемы данных в реальном времени; генерировать и синтезировать за счет имеющихся в БД информации новые наборы данных.
Новые СУБД, призванные обслуживать сотни тысяч пользователей в режиме онлайн и работать с петабайтами данных, должны решать такие задачи, как обработка аналитических запросов к огромным наборам данных или выполнение транзакций, требующих высокой производительности. При этом необходимо использовать современные модели организации облачных технологий (инфраструктура как сервис - IaaS, платформа как сервис - PaaS, программное приложение как сервис - SaaS).
При создании и поддержке БД должны применяются следующие стандарты, табл.1.
Таблица 1 – Основные стандарты создания и поддержки БД
Назначение |
Стандарты |
Управление данными и приложениями |
|
Мониторинг аппаратно-программных средств |
Common information model (CIM), Simple Network Management Protocol (SNMP), Windows Management Instrumentation (WMI) |
Сбор и обработка данных и знаний |
JSR87 – Java Agent Services |
Управление загрузкой данных |
Application Response Measurements (ARM) |
Функциональные стандарты |
ISO 19120:2001 |
Правила для схемы приложений |
ISO 19109:2003 |
Интеграция данных |
|
Набор основных семантических элементов, описывающий публикации, http://dublincore.org/documents/dcq-html/ |
ISO 15836: 2003 DC (Dublin Core) RFC 2413, RFC 2731 |
Технология интеграции распределенных и неоднородных данных, http://data.meteo.ru/ru/e2edm/index.php?section=1 |
E2EDM |
Описание информационных ресурсов в области образования, http://ltsc.ieee.org/wg12 |
LOM (Learning Object Metadata): 2002 P1484.12.1 |
Поддержка сервисов |
|
Регистр источников сервисов |
UDDI |
Регистр сервисов |
WSDL |
Доступ к простым объектам. Часть 1: Общая архитектура. Часть 2: Доступ через SQL |
ISO 19125:2004 |
Простой протокол обмена данными |
SOAP |
Диагностика проблем за счет взаимодействия с источниками данных |
JSR47 - Logging API Specification |
Сервисы |
ISO 19119 |
Координация Web-сервисов, http://www.isotc211.org/opendoc/211n2034/ |
TC211/OGC: 2006 |
Определение прикладных сервисов и спецификация протокола |
ISO 23950:1998 |
Администрирование сервисов |
|
Общий интерфейс |
JSR168 |
Спецификация портлетов, выполняемых на одном узле |
JSR286 |
Спецификация удаленных портлетов |
WSRP |
Программный интерфейс приложения |
API |
Качество данных |
|
Принципы оценки качества |
ISO 19113:2002, ГОСТ Р ИСО 19113-2003 |
Методы оценки качества |
ISO 19114:2003 |
Качество программных средств |
ISO 9126 |
Структуры данных |
|
Эталонная модель |
ISO 19101:2002 |
Язык концептуальной схемы |
ISO 19103 |
Профили |
ISO 19106:2004 |
Временная схема |
ISO 19108:2002 |
Методология каталогизации |
ISO 19110 |
Почтовые адреса |
ISO 11180 |
Представление дат и времени, http://xml.coverpages.org/ISO-FDIS-8601.pdf |
ISO 8601:2000 |
Семибитное кодирование набора символов |
ISO 646 |
Модель описания датчиков, приборов и генерируемых ими потоков информации (http://vast.uah.edu/SensorML/) |
SensorML (The Sensor Model Language) |
Метаданные |
|
Метаданные |
ISO 19115:2003 |
Географический язык разметки GML |
ISO 19136 |
Каталоги, директории и регистры |
ISO 19126 |
Электронная визитная карточка – описание персоны |
vCard, REC 2426 |
Информация о научных проектах (“Проект”, “Организация” и “Персона”) |
CERIF |
Метаданные – Реализация XML схемы |
ISO 19139 |
Библиографические описания – содержание форма и структура |
ISO 690:1987 |
Информационные технологии – Регистр метаданных. Стандарт для описания элементов данных в БД и документах |
ISO 11179 |
Интеграция информационно – измерительных систем, обмена сообщениями между сенсорами и компьютером, http://www.opengeospatial.org/legal |
TML (Transducer Markup Language), 2005 |
Общая метамодель для обмена метаданными при использовании технологий Хранилищ данных |
CWM (Common Warehouse Metamodel) |
Кодирование и передача метаданных |
METS (Metadata Encoding and Transmission Standard) |
Описание моделей данных, реляционных схем, схем обмена данными |
MDC OIM (Metadata Coalition Open Informational Model) |
Протокол сбора метаданных, http://www.openarchives.org/OAI/openarchivesprotocol.html |
Protocol for Metadata Harvesting, the Open Archives Initiative (OAI) |
Среда описания ресурсов с разной степенью формализации , http://www.w3.org/RDF/ |
RDF (Resource Description Framework) |
Описание схемы классов и их свойств, с учетом их наследования, ограничений, http://www.w3.org/TR/REC-rdf-syntax/ |
RDFS (Resource Definition Framework Schema) |
Описание предметных онтологий на основе RDFS http://ontology.com/ |
OWL (Web Ontology Language) |
Классификаторы |
|
Кодирование (шифрование) |
ISO 19118: 2003 |
Коды стран |
ISO 3166 |
Сокращения названий языков |
ISO 639-2:1998 |
Модель определения основной структуры и содержания схемы концепций тезауруса, классификационных схем, таксономий, «фолксономий» терминов и определений, глоссариев и других типов контролируемых словарей. http://www.w3.org/2004/02/skos/mapping/spec/ |
SKOS Core (SKOS Mapping Vocabulary Specification): 2004 |
Пространственные данные |
|
Пространственная схема |
ISO 19107:2003 |
Привязка в пространстве по координатам, http://portal.opengeospatial.org/files/?artifact_id=6716 |
ISO 19111:2003 |
Привязка в пространстве по географическим идентификаторам |
ISO 19112:2003 |
Услуги определения координат |
ISO 19116:2004 |
Изображения и растровые данные |
ISO 19121:2000 |
Схема геометрического и функционального покрытия |
ISO 19123:2004 |
Геодезические коды и параметры |
ISO 19127 |
Интерфейс картографического сервера |
ISO 19128 |
Содержание цифровых геопространственных метаданных |
FGDC STD 001–1998 |
Передача пространственных данных. Часть 5: Профиль и расширения для растровых данных. Часть 6: Профиль для точечных данных, Часть 7: Профиль CADD |
FGDC STD 002.5– 1999, FGDC STD 002.6, FGDC STD 002.7– 2000 |
Точность определения геопространственных координат |
FGDC STD 007– 1998 |
Содержание цифровых ортоизображений |
FGDC STD 008– 1999 |
Содержание сканерных данных дистанционного зондирования |
FGDC STD 009– 1999 |
В последние годы стали много говорить о создании единого информационного пространство (ЕИП). Понимание этого термина у многих разное. Одни считают, что Интернет уже создает ЕИП, другие - ЕИП это единое окно доступа к информационным ресурсам и сервисам через веб-портал. К сожалению, это далеко не так, т.к. в этих случаях использовать полученную информацию от различных приложений можно только с экрана. А автоматически включить полученную информацию в другое приложение очень трудно - только путем предварительной договоренности о месте записи файла и его структуре. То есть основным критериями ЕИП являются:
кросплатформенность - разработчик БД помещает свои данные, не задумываясь, в какой ОС, СУБД он работает и где она установлена;
возможность автоматического обмена данными и информацией - пользователь не зная, где находятся, необходимые ему данные, получает их в том составе, виде, форме и в той нотации словарей, с которой он привык работать.
При разработке ЕИП необходимо широкое использование:
систем классификации и кодирования информации;
средств интеграции разнородных и распределенных данных;
облачных технологий (IaaS, PaaS, SaaS);
стандартизации протоколов обмена данными, структур данных;
программ учета и архивации данных;
современных коммуникационных средств (web-камер, Skype, ICQ, мобильных телефонов, коммуникаторов, др.);
сервис-ориентированной архитектуры, использующей открытые стандарты UDDI, WSDL, SOAP и тематических XML-схем [20];
геоинформационных систем.
