Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:
Лекции БД, ИС, ИТ (Беликова).doc
Скачиваний:
104
Добавлен:
27.05.2013
Размер:
528 Кб
Скачать

Основные показатели эффективности функционирования дис

Полнота информационного поиска R определяется отношением числа найденных пертинентных документов A к общему числу пертинентных документов C, имеющихся в системе или в исследуемой совокупности документов: R = A/C.

Точность информационного поиска P определяется отношением числа найденных пертинентных документов A к общему числу документов L, выданных на запрос пользователя: P = A/L.

Наличие среди отобранных на запрос пользователя нерелевантных документов называется информационным шумом системы. Коэффициент информационного шума K, соответственно, определяется отношением числа нерелевантных документов (L-A), выданных в ответе пользователю к общему числу документов L, выданных на запрос пользователя: K = (L - A)/L.

Полнотекстовые ИПС строятся на основе информационно- поисковых языков дескрипторного типа. Их информационно-технологическая структура включает следующие элементы:

  • хранилище документов;

  • глобальный словарь;

  • индекс документов;

  • интерфейс ввода документов в систему,

  • механизм индексирования;

  • интерфейс запросов пользователя;

  • механизм поиска документов (поисковую машину);

  • механизм извлечения найденных документов.

Хранилище документов может быть организовано как единая локально сосредоточенная информационная структура в виде специального файла (файлов) с текстами документов. Организация такого файла предусматривает указательную конструкцию на основе массива адресов размещения документов.

Другой вариант не предусматривает создания локально сосредоточенного хранилища документов, а ограничивается лишь массивом адресов расположения документов в соответствующей компьютерной информационной инфраструктуре (структура дисков и каталогов отдельного компьютера или локальной информационной сети, информационная инфраструктура глобальной информационной сети). Файлы учтены в полнотекстовой ИПС (т. е. проиндексированы по содержанию и зафиксированы по месторас­положению) для эффективного поиска и доступа. Такой подход более логичен с точки зрения технологий документо­оборота или распределенного характера систем (например, си­стема WWW сети Интернет), но его недостатком является необходимость постоянного отслеживания и учета переме­щений документов.

Одним из наиболее характерных элементов полнотекстовых ИПС является глобальный словарь системы. Статические словари не зависят от содержания документов, вошедших в хранилище, а определены изначально в систе­ме. Динамические словари определяются набором словоформ, имеющихся в накапливаемых в хранилище документах. Изначально такой словарь пуст, но с каждым новым документом в него помещаются новые словоформы, которых еще не было в ранее накопленных документах.

Элементы глобального словаря выступают в качестве дескрипторов ИПЯ системы. Поступающие через интерфейс ввода/вывода документы подвергаются операции индексирования по глобальному словарю. Механизм индексирования в полнотекстовых ИПС полностью автоматизируется и заключается в создании специального двоичного вектора, компоненты которого показывают наличие или отсутствие в данном документе слова с соответствующим номером (позицией) из глобального словаря. В результате на «учет» в системе ставятся все слова текста документа.

В результате индексирования поисковый образ каждого нового доку­мента представляется набором словоформ из глобального сло­варя, присутствующих в тексте документа, и поступает в виде соответствующего двоичного вектора для дополнения индекса системы. Индекс отражает весь (полный) текст учтенных или накоп­ленных документов. При удалении документа из системы соответственно уда­ляется и поисковый образ документа, т. е. соответствующий столбец индекса.

Пользователь языком запросов ИПЯ через соответствующий интерфейс запросов выражает свои информационные потребности по поиску документов, которые в общем плане, так же как и документы, индексируются и в виде двоичных векторов поисковых образов запросов поступа­ют на поисковую машину.

Механизм поиска основывается на тех или иных алгоритмах и критериях сравнения поискового образа запроса с поисковыми образами документов, образую­щими индекс системы. Результатом поиска является определе­ние номеров документов, поисковые образы которых соответ­ствуют или близки поисковому образу запроса. Далее специ­альная подсистема на основе установленных в хранилище документов указательных конструкций извлекает и доставляет соответствующие документы пользователю.

Таким образом, программное обеспечение полнотекстовых ИПС обеспечивает полный технологический цикл ввода, обработки, поиска и получения документов. В практическом плане ИПС могут поставляться как готовый информационный продукт, т. е. с уже сформированной базой документов и интерфейсом поиска и доступа к ним. В других случаях поставляется программная среда, позволяющая такую базу создать и сформировать тем самым документальную информационно-поисковую систему. Такие программные средства иногда называют полнотекстовыми СУБД.