Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Методы и средства интеграции независимых баз данных в распределенных телекоммуникационных сетях. Монография

.pdf
Скачиваний:
0
Добавлен:
07.09.2026
Размер:
2 Мб
Скачать
☆
1.4.1. Формальная модель для интеграции данных
Multiplex
В работе [21] описывается формальная модель для интеграции данных Multiplex. Модель для описания мультибаз данных Multiplex является расширением реляционной модели. В модели Multiplex явно формулируются предположения согласованности модели и предположение согласованности экземпляров БД. Интересной особенностью Multiplex является использование приблизительных ответов — когда получение полного ответа на запрос невозможно, система может дать приблизительный ответ.
Модель Multiplex определяется следующим образом. Пусть дано конечное множество атрибутов T, для каждого атрибута
определен конечный домен , пусть null - специальное значение, не принадлежащее ни одному домену. Схема отношения R — последовательность атрибутов из T. Кортеж t со схемой отношения — это элемент множества
. Экземпляр отношения (или отношение) R - конечный набор кортежей R. Схема БД D — множество схем отношений . Экземпляр БД d со схемой БД
D — множество отношений , где — отношение со схемой (i=1,..,n).
Пусть D — схема БД. Тогда представление V БД со схемой D
— это выражение вида , где может представляться выражением вида
1) , где R — схема отношения в D арности l, а —
это
,
или константа,
2) , где - или , - , или константа, а —
операция сравнения (<,>,=,<> и т.д.).
41
При этом должно появиться среди точно один раз, а - по крайней мере, один раз. Для экземпляра БД d со схемой D представление V определяет отношение
, где каждое вхождение схемы
отношения R в формуле заменено соответствующим отношением r. Данное отношение v называется расширением (extension) представления V на экземпляре БД d. Запросом Q над схемой БД D называется представление, определенное на этой схеме. Расширение Q на экземпляре БД d со схемой D называется ответом на запрос Q в экземпляре БД d.
Определенные таким образом представления эквивалентны выражениям реляционной алгебры (РА), использующим только операции декартова произведения, выборки и проекции. В модели Multiplex также определяются понятия подпредставления (subview) и суперпредставления (superview). Для двух представлений V' и V БД со схемой D представление V' является подпредставлением представления V, если существует запрос W к V, использующий только операции проекции и выборки, такой что схемы W и V' совпадают, и для любого экземпляра d БД D расширения V' и W идентичны. При этом V называется суперпредставлением представления V'.
Ограничения целостности I на БД со схемой D определяются как представления в D. Экземпляр БД d со схемой D удовлетворяет ограничениям целостности I, если расширение I в БД d — пустое отношение.
БД определяется как тройка (D,C,d) — комбинация схемы БД, ограничений целостности на схеме D и конкретного экземпляра БД d, удовлетворяющего ограничениям целостности C. Пара (D,C) называется моделью БД.
Пусть даны БД (D,C,d) и D' — схема БД с отношениями, определенными как представления схемы D. Схема D' называется
42
производной от схемы D. Пусть d' - экземпляр БД со схемой D' такой, что он является расширением представлений D' на экземпляре БД d. Такой экземпляр БД d' называется производным от экземпляра БД d. Ограничения целостности C' называются производными от ограничений целостности C, если для любого экземпляра БД d со схемой D, который удовлетворяет ограничениям целостности C, производный экземпляр БД d' удовлетворяет ограничениям целостности C'.
БД (D',C',d') называется производной от БД (D,C,d), если ее схема D' является производной от схемы D, ее ограничения целостности C' являются производными от ограничений целостности C, а ее экземпляр d' является производным от экземпляра БД d'. При этом модель БД (D',C') называется производной от модели БД (D,C).
Пусть , — производные БД от БД . Представления схемы и схемы называются эквивалентными, если для любого экземпляра БД d со схемой D расширение для экземпляра БД и расширение для экземпляра БД идентичны.
Пусть две модели БД и являются производными от модели БД . Отображением между схемами
и
называется множество пар представлений , i=1,..,m, где
- представления над схемой , - представления над схемой и эквивалентно . Отображением между ограничениями
целостности называется множество пар , i=1,..,k, где каждое
,
эквивалентны .
является производными от ограничений целостности
является производными от ограничений целостности и
D
Мультибазой данных называется следующая совокупность:
1) Схема D и множество ограничений целостности C на схеме
43
2) Множество БД ( ) , ... , ( )
3) Множество отображений между схемами: ( ) , ... , ( )
4) Множество отображений между ограничениями
целостности ( ) , ... , ( )
В работе [21] формулируются два предположения, которые могут использоваться (или не использоваться) в СИД. Оба предположения основываются на предположении о существовании единственной гипотетической БД, которая адекватно представляет реальность. Предположение о согласованности модели утверждает, что все модели БД являются производными от модели реального мира (то есть все способы моделирования реальности корректны, нет ошибок моделирования, только различия в составлении моделей). Предположение о согласованности экземпляров утверждает, что все экземпляры БД являются производными от экземпляра БД реального мира (то есть, информация, хранимая в БД всегда корректная). Модель Multiplex основывается на истинности лишь первого предположения (схемы различных ИД совместимы), но ИД могут содержать противоречивые факты.
При этом запрос Q над мультибазой данных определяется как запрос над схемой D. Глобальные ограничения целостности переводятся в ограничения целостности над запросом Q, что не всегда может быть сделано (то есть не всегда возможно проверить, удовлетворяются ли они). Когда алгоритм вычисления ответа на запрос Q приводит к генерации множества решений (множества запросов над различными БД), эти решения могут вести к различным ответам (наборам кортежей). Каждый такой ответ называется возможным ответом (candidate answer). Ответ на запрос Q — множество всех возможных ответов. Когда проблема перевода Q в термины схемы ИД неразрешима, то ответ на запрос Q определяется как пустое множество.
44
Для решения проблемы согласования множества ответов,
полученных из разных ИД, в модели Multiplex используется концепция приблизительных ответов. Пусть — идеальный ответ, то есть ответ на запрос Q в идеальном экземпляре БД ,
отражающем реальный мир. Тогда назовем q — уверенным (sound) ответом, если , и полным (complete) ответом, если .
Определим подответ (subunswer) на запрос Q к БД со схемой
D как подпредставление, расширенное null-значениями до схемы D. Подответ — уверенный ответ на запрос Q. Сверхответом
(superanswer) в [21] называется представление, для которого Q является подпредставлением, усеченное проекциями до схемы D. Сверхответ является полным ответом. Объединение подответов и пересечение сверхответов дают наибольший уверенный ответ и наименьший полный ответ, соответственно. Модель Multiplex не принимает предположение о согласованности экземпляров, поэтому предусмотрена процедура согласования ответов
посредством процедуры голосования. Для двух ответов и
на запрос Q кортежи во множестве получают голоса «yes» (да), во множестве
— голоса «maybe» (возможно), остальные (которые, возможно присутствуют в других ответах) — голоса «no» (нет). Для того, чтобы согласовывать результаты голосования, используется таблица (Таб.1.1).
В случае, если предположение о согласованности экземпляров принимается, может возникнуть аномалия, когда для запроса невозможно построить полный ответ. (Если доступен хотя бы один ответ, все равно какой ответ возвращать пользователю — так как по предположению они равнозначны).
45
Таблица 1.1.
yes
no
maybe
yes
yes
maybe
maybe
no maybe
no
maybe
maybe
maybe
maybe
maybe
Таблица согласования результатов голосования
Пусть D — схема БД, - множество представлений БД, Q — запрос над D. Представление V называется максимальным уверенным приближением Q с использованием M, если V — подпредставление Q и любое другое подпредставление Q из M является подпредставлением V. Представление V из M называется минимальным полным приближением Q с использованием M, если Q — подпредставление V и для любого другого подпредставления Q из M V является подпредставлением.
Максимальное уверенное приближение Q с использованием M — объединение всех подпредставлений Q, которые выразимы с помощью представлений из M. Минимальное полное приближение Q с использованием M— пересечение всех сверхпредставлений Q, которые выразимы с помощью представлений из M.
Если на запрос Q к мультибазе данных ответа не существует, то пользователю возвращается приблизительный ответ, представляющий собой пару, состоящую из максимального уверенного и минимального полного приближений Q. При этом максимальное уверенное приближение Q всегда существует (пустое представление со структурой Q), в отличие от минимального полного приближения.
46
Рассмотрим случай, когда предположение о согласованности экземпляров не принимается. Пусть D — схема БД, - множество представлений БД, Q — запрос над D. В результате работы алгоритма обработки запросов получается набор представлений:
1. — доступные ответы,
2. — доступные подпредставления ответа,
3. — доступные суперпредставления ответа.
После соответствующих проекций и увеличений отношений (дополнений null-значениями) получается k+m+n ответов, которые
имеют право голоса. Каждый ответ подает голос «да» за кортеж, присутствующий в нем, и «нет» за другие кортежи. Каждый ответ
подает голос «да» за кортеж, присутствующий в нем и
«возможно» за другие кортежи. Каждый ответ подает голос «возможно» за кортеж, присутствующий в нем и «нет» за другие кортежи. Однако стоит отметить, что часть представлений могут быть только частично определены (иметь множество null­значений). В результате, получается приблизительный ответ: в качестве максимального уверенного приближения возвращаются кортежи, за которые поданы только голоса «да», в качестве минимального полного приближения - кортежи, за которые не подано голосов «нет». Стоит учитывать, что данные приближения могут и не являться уверенными (нижнее приближение) или полными (верхнее приближение).
Рассмотренная работа интересна тем, что она описывает способы построения ответов в условиях неполноты ИД, массовой недоступности ИД и отсутствия точных ответов на запросы.
47
1.4.2. Методы разрешения противоречий в СИД
Fusionplex
Идеи, предложенные в работе [21], получили свое дальнейшее развитие в рамках проекта Fusionplex [22]. В системе Multiplex все ИД рассматривались как равнозначные, что не всегда верно. В [22] вводится понятие характеристик ИД. Эти характеристики обозначают различные особенности ИД — стоимость получения информации, доступность, последнюю дату обновления информации и т.д.
В [22] предлагается использовать расширенные версии РА и SQL для выражения запросов пользователей. Полагается, что сами кортежи помимо основных атрибутов содержат значения различных характеристик (которые принимают значения от 0 до
1). Расширение РА сводится к введению новых операций ­разрешение (resolution) , которая позволяет пользователю
назначать веса различным характеристикам ИД (например, пользователю необходимо получать самую свежую (актуальную)
информацию и ему не важна ее стоимость) и - выборка кортежей по значению весов. Обычная операция проекции
разрешена только для атрибутов (не для характеристик). Выборка возможна только по значениям атрибутов. Декартово произведение помимо конкатенации обычных атрибутов кортежей вычисляет каждую их характеристику как минимум из соответствующих характеристик кортежей.
Основная проблема, которая рассматривается в работе [22] — согласование результатов. На предпоследней стадии выполнения запроса выполняется операция разрешения конфликтов, чтобы составить из двух кортежей с одинаковыми первичными ключами один. Все потенциальные кортежи результата после выполнения всех операций и перед выдачей результата пользователю проходят операцию разрешения конфликтов. Вводится предположение, что
48
все несогласованные записи имеют одинаковое значение первичного ключа и таким образом могут быть идентифицированы. Операция разрешения конфликтов выполняется следующим образом.
Вначале отсеиваются все кортежи с агрегированным весом характеристик, меньшим определенного порогового значения (веса характеристик задаются пользователем как параметры операции , пороговое значение — администратором системы).
Затем для каждого атрибута поликортежа (отношения, состоящего изо всех кортежей с одинаковым значением первичного ключа) составляются кортежи, полученные проекцией ключа отношения и этого атрибута. К данным кортежам применяется политика разрешения, а затем они соединяются для формирования окончательного ответа.
Политика разрешения имеет вид:
for
[keep [restrictive]
] fuse .
Здесь — атрибут глобальной схемы, к которому применяется политика, - уничтожающие функции, ­функция совмещения. Уничтожающие функции последовательно применяются к характеристике
, если она указана в качестве
аргумента функции, или к атрибуту, для которого определяется политика, чтобы отсеять какую-то часть кортежей. Примерами уничтожающих функций могут служить функции min(), max(), top_five_percent(), over_average(). После применения уничтожающих функций к оставшимся значениям обрабатываемого атрибута применяется функция совмещения. Примерами функции совмещения могут служить функции min(), max(), avg(), any(). После совмещения атрибутов выполняется совмещение характеристик. Если для совмещения атрибутов использовалось несколько кортежей (например, использовалась
49
функция avg()), то для совмещения характеристик используется функция min().
Методы, описанные в [22], позволяют пользователю выбрать предпочтительные характеристики ИД и политики согласования результата. В результате обработки запроса в отличие от методов, описанных в [21], пользователь получает один согласованный ответ, а не пару ответов (нижнее и верхнее приближения),.
1.5. Выводы по результатам анализа существующих СИД и постановка задачи на разработку усовершенствованной СИД
Как видно из проведенного анализа, современные методы обработки запросов в области интеграции данных не обеспечивают адекватной скорости получения ответов на запросы к совокупности реляционных источников данных в распределенной сети. В основном, они направлены на уменьшение объема пересылаемой информации между системой интеграции данных и источниками данных. Большинство методов не предлагают адекватных механизмов обработки ошибок при доступе к источникам данных. Отсутствуют механизмы параллельного выполнения запросов с учетом возможной недоступности части источников данных. В связи с этим актуальной является разработка методов, обеспечивающих минимизацию времени ответа на запрос к совокупности источников данных в распределенных сетях TCP/IP.
Прежде, чем сформулировать постановку задачи на разработку усовершенствованной СИД, в максимально возможной степени свободной от отмеченных выше и некоторых дополнительных недостатков, подробнее резюмируем основы организации известных СИД, присущие им недостатки и дополнительные требования, предъявляемые нами к усовершенствованной СИД.
50
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]