Добавил:
Upload Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:
LEKCIJA_8.doc
Скачиваний:
38
Добавлен:
17.12.2018
Размер:
138 Кб
Скачать

2.2. Особенности поведения пользователей поисковых систем в Web

В Web изменяется и понятие “типичного пользователя”. Отметим следующие отличия.

Плохие” запросы. Никто толком не обучает пользователей ИПС для Web формулировать запросы, и, как следствие, значительно меньший процент пользователей использует расширенные возможности поиска, такие, как логические выражения.

Более того, типичные запросы очень коротки - более 60% поисковых запросов в Web состоят из 1-2 слов, что сильно отличается от 7-9 слов в классических ПС.

Разнородный контингент. Разнообразие в знаниях, потребностях и ожиданиях пользователей очень велико. Большинство же пользователей классических ПС обычно имеет много общих черт.

Поведение. Пользователь не готов долго ждать результата и не готов даже искать его в предоставленной системой выборке. Так, 58% пользователей не идут дальше первого экрана, а 67% не предпринимают попыток модифицировать свой первоначальный запрос.

3. Архитектура поисковых систем для Web

Обобщенная схема поисковой системы для Web изображена на рис.3. На рисунке параллелепипедами обозначены функциональные модули, цилиндрами - репозитории данных, а стрелками - направления потоков данных в системе.

Рис.3. Обобщенная архитектура поисковой системы для Web

3.1. Сканирование

Ключевым архитектурным отличием от классических ПС является наличие сетевых роботов. Сетевые роботы - это программы, которые, исходя из некоторого начального множества ссылок (URL), рекурсивно сканируют Web-страницы, извлекая из них новые ссылки. Как правило, извлеченные ссылки сначала передаются модулю стратегии сканирования, который определяет, какие из них стоит посещать и отдает соответствующие ссылки обратно сетевым роботам. Этот выбор напрямую зависит от направленности поисковой системы. Например, стратегия сканирования одной ПС может быть направлена на посещение как можно большего числа сайтов, “не зарываясь” при этом вглубь сайтов, в то время как другая ПС ориентирована на страницы определенного домена.

3.2. Хранение, индексирование и поиск

Собранные роботами документы складываются в хранилище. Хранилище содержит большое количество объектов данных (Web-страниц) и в этом смысле очень похоже на СУБД или файловую систему. Однако, многие возможности этих систем в этом случае совершено не нужны (например, транзакции или иерархия директорий), зато очень важны другие: масштабируемость, эффективная поддержка двух режимов доступа: случайного - для того, чтобы быстро найти конкретную страницу по ее идентификатору (например, для создания копии страницы из кэша ПС), и потокового - для того, чтобы вынуть значительную часть всей коллекции (например, для индексирования или анализа), эффективная поддержка обновлений, сборка “мусора” (устаревших страниц).

Для повышения эффективности поиска используются индексные структуры. За создание этих структур отвечает модуль индексирования. Кроме текстовых индексов, часто дополнительно строятся структурный и вспомогательный индексы. В структурном индексе описывается структура графа Web, и эта информация может быть полезна модулю стратегии сканирования. Во вспомогательном индексе хранится любая другая нужная конкретной ПС информация, которая, как правило, используется для ранжирования результатов поиска, например, размер Web-страниц, количество используемых графических изображений, PageRank метрика.

Получение и выполнение запросов пользователей - это задача модуля поисковая машина. В основном, поиск осуществляется по индексным структурам, но может - и напрямую по документам в хранилище (пунктирная связь на рис.). Информацию о том, какие ресурсы наиболее часто посещаемы пользователями, поисковая машина передает модулю стратегии сканирования.

Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]