Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Поисковые системы сети Internet. Курс лекций

.pdf
Скачиваний:
0
Добавлен:
09.08.2026
Размер:
429 Кб
Скачать

ИНФОРМАЦИОННЫЕ СИСТЕМЫ И ТЕХНОЛОГИИ В ЭКОНОМИКЕ И УПРАВЛЕНИИ

О. Н. Королева, А. В. Мажукин, Т. В. Королева

ПОИСКОВЫЕ СИСТЕМЫ СЕТИ

INTERNET

КУРС ЛЕКЦИЙ

Москва 2012

МОСКОВСКИЙ ГУМАНИТАРНЫЙ УНИВЕРСИТЕТ

ФАКУЛЬТЕТ ЭКОНОМИКИ И УПРАВЛЕНИЯ КАФЕДРА МАТЕМАТИЧЕСКОГО И КОМПЬЮТЕРНОГО МОДЕЛИРОВАНИЯ

ИНФОРМАЦИОННЫЕ СИСТЕМЫ И ТЕХНОЛОГИИ В ЭКОНОМИКЕ И УПРАВЛЕНИИ

О. Н. Королева, А. В. Мажукин, Т. В. Королева

ПОИСКОВЫЕ СИСТЕМЫ СЕТИ INTERNET КУРС ЛЕКЦИЙ

2-е издание, исправленное и дополненное

Под редакцией проф. В. И. Мажукина

Издательство Московского гуманитарного университета

2012

ББК 32.81 К68

Рецензенты: доктор физико-математических наук, профессор Ю.А. Повещенко (кафедра математического и компьютерного моделирования, МосГУ)

доктор физико-математических наук, профессор В.А. Гасилов (Институт прикладной математики им. М.В. Келдыша)

Серия основана в 2007 году

Королева О. Н.

К68 Поисковые системы сети Internet : курс лекций / О. Н. Королева, А. В. Мажукин, Т. В. Королева ; под ред. В. И. Мажукина. – М. : Изд-во Моск. гуманит. ун-та, 2012. – 34 с. – (Информационные системы и технологии в экономике и управлении).

ISBN 978-5-98079-839-0

Предлагаемое учебное пособие охватывает в основном вопросы организации поиска информации в сети Internet. В нем содержатся принципы работы поисковых систем и построения алгоритма поиска, краткий обзор различных поисковых систем.

Учебное пособие предназначено для обучения студентов основам информационных технологий и систем в экономике и управлении с целью овладения передовыми технологиями поиска информации в сети Internet и их использования в будущей профессиональной деятельности.

ББК 32.81

©Королева О. Н., Мажукин А. В., Королева Т. В., 2012

ISBN 978-5-98079-839-0

СОДЕРЖАНИЕ

Введение.......................................................................................................................................

3

1.

История развития поисковых систем....................................................................................

4

2.

Принципы работы поисковых систем...................................................................................

5

 

2.1. Агент (Agent) ...................................................................................................................

7

 

2.2. Паук (Spider) ....................................................................................................................

7

 

2.3. Кроулеры (Crawler) .........................................................................................................

7

3.

Статистический анализ текстов...........................................................................................

10

 

3.1. Первый закон Зипфа «ранг — частота»......................................................................

11

 

3.2. Второй закон Зипфа «количество — частота» ...........................................................

13

 

3.3. Весовые коэффициенты................................................................................................

15

4.

Модели индексирования и поиска документов..................................................................

16

5.

Cемантические поисковые системы....................................................................................

17

6.

Алгоритм ранжирования......................................................................................................

22

7.

Различия поисковых систем.................................................................................................

22

8.

Алгоритмы поисковых систем.............................................................................................

24

Приложение. Краткий обзор поисковых систем....................................................................

26

 

1.

Рейтинг поисковых систем..............................................................................................

26

 

2.

Поисковая система Google ..............................................................................................

26

 

3.

Поисковая система AltaVista...........................................................................................

27

 

4.

Поисковая система Lycos ................................................................................................

28

 

5.

Поисковая система Yahoo! ..............................................................................................

29

 

6.

Поисковая система Yandex..............................................................................................

30

 

7.

Поисковая система Rambler ............................................................................................

30

 

8.

Поисковая система Aport! ...............................................................................................

31

Список литературы...................................................................................................................

32

Введение

Курс лекций «Информационные системы и технологии в экономике и управлении. Поисковые системы сети Internet» разработан в рамках учебных дисциплин «Информационные технологии в управлении» и «Информационные сис-

темы в экономике» в соответствии с Федеральным государственным образовательным стандартом высшего профессионального образования по направлениям 080400.62 «Управление персоналом», 80200.62 «Менеджмент», 081100.62 «Государственное и муниципальное управление», 100700.62 «Торговое дело», 080100 «Экономика».

Курс лекций предназначен для ознакомления студентов с принципами организации поиска информации в сети Internet с целью приобретения навыков осознанного самостоятельного поиска информации, необходимой для интеллектуальной поддержки управленческих решений.

Острота и актуальность проблемы оптимального поиска в сети Интернет (в дальнейшем — Сеть) постоянно возрастает в связи с увеличением объема информации.

Проблема не исчерпывается простым поиском необходимой информации. Разнообразие современной информации помимо скорости диктует дополнительные критерии поиска. Постоянное обновление информации на сайтах еще более затрудняет поиск.

Поиск информации в Интернете обеспечивается различными протоколами. Основными используемыми в Сети протоколами являются HTTP и FTP. К сожалению, ни один из них не обеспечен достаточными встроенными функциями многокритериального поиска. Протокол HTTP хорош лишь в отношении навигации, которая рассматривается только как средство просмотра страниц. То же самое относится и к протоколу FTP, который даже более примитивен, чем HTTP.

Для структурирования информации в Сети и обеспечения пользователей удобными средствами многокритериального поиска были созданы поисковые системы (search engines), которые в настоящее время пользуются огромным спросом. Поиск необходимых ресурсов поисковые системы осуществляют по одному или нескольким ключевым словам, которые, по мнению пользователя, лучше всего отражают суть интересующего вопроса. Поисковая система за считанные секунды просматривает весь собственный каталог веб-ресурсов (индекс), состоящий из десятков и сотен гигабайт информации. В результате предлагается список ссылок на страницы, в которых встречаются указанные слова.

3

1. История развития поисковых систем

История развития поисковых систем в Интернете началась в 1995 году, когда стала понятна простая истина — людям нужна не вся служба Web в целом, а только несколько веб-страниц по определенной теме.

Сначала глобальная сеть Интернет представляла собой совокупность множества региональных сетей, причем существовало четыре службы извлечения информации из Интернета:

WAIS (Wide Area Information Servers) — поиск информации в открытых ба-

зах данных Интернета;

Archie — программа поиска файлов;

Gopher — доступ к информации через системы меню; Word Wide Web — извлечение информации браузерами.

Поисковые системы действуют в пределах службы Word Wide Web и обеспечивают поиск по ключевым словам или фразам.

Первой возможности поиска стала предоставлять служба (сайт) Yahoo!. Однако это был индексированный каталог, а не поисковая система в чистом виде. Первым реальным поисковиком принято считать службу Lycos, которая с помощью программных средств методически открывала и индексировала все ссылки на всех обнаруженных веб-страницах. Уже к марту 1995 года в индексной базе данных Lycos находилось 1,75 млн веб-страниц.

Позже многие пользователи переключились на поисковую систему Webcrawler. Сегодня этот поисковик продолжает существовать, хотя и стал частью более успешной системы Excite. Из лидеров прошлых лет можно отметить еще Galaxy и Open Text.

Поисковой службой следующего поколения стала система Google. Хотя она была создана относительно недавно — летом 1998 года, сейчас это самая популярная поисковая система. К июню 2000 года эта поисковая система имела более 1 млрд проиндексированных веб-страниц (на сегодня, по данным Google, эта цифра превышает 4 млрд страниц).

Поисковые системы совершенствуются и усложняются. Вводятся новые алгоритмы, технологии. Так, например, Google ввел специализированный поиск рисунков и поиск в огромном текстовом архиве Usenet (приобретен у Deja.com). Помимо статистических поисковых систем, к которым относятся все перечисленные, в настоящее время активно разрабатываются семантические — поисковики с обработкой запросов на естественном языке.

4

2. Принципы работы поисковых систем

Поисковая система — программно-аппаратный комплекс с вебинтерфейсом, предоставляющий возможность поиска информации в Интернете. Под поисковой системой обычно подразумевается сайт, на котором размещен интерфейс (фронт-энд) системы. Программной частью поисковой системы является поисковая машина (поисковый движок) — комплекс программ, обеспечивающий функциональность поисковой системы и обычно являющийся коммерческой тайной компании-разработчика поисковой системы.

Большинство поисковых систем ищут информацию на сайтах Всемирной паутины, но существуют также системы, способные искать файлы на FTPсерверах, товары в интернет-магазинах, а также информацию в группах новостей Usenet. Средства поиска и структурирования, называемые поисковыми механизмами, используются для поиска необходимой информации в Интернете.

В настоящее время используются такие механизмы, как агенты, пауки, кроулеры и роботы. Это специальные программы, которые занимаются поиском страниц в Сети, извлекают гипертекстовые ссылки на этих страницах и автоматически индексируют информацию, которую они находят для построения базы данных.

На заре развития у поисковых систем был один поисковый робот, работающий циклично. Сайты сканировались от «А» до «Я». Совершенствование поисковых систем привело к разделению поискового робота на несколько спе-

циализированных поисковых роботов. Каждый поисковый робот стал отве-

чать за выполнение конкретных задач. IP-адресов, с которых «ходят» поисковые роботы, может быть много, они могут меняться, и поисковые системы их не разглашают. Одна из основных задач современной поисковой системы — оперативный сбор, обработка и удобное представление информации на запросы поль-

зователей. Оперативно собрать и обработать без ошибок миллиарды веб-

страниц нельзя. Можно говорить лишь о степени соответствия результатов, выдаваемых поисковой системой, ожиданиям пользователей.

Алгоритм работы современных поисковых систем можно разделить на штатный, или автоматический, и нештатный — ручной или полуавтоматический.

В штатном режиме поисковая система собирает и ранжирует ключевые слова сайтов без участия человека. В нештатном режиме необходимо полное или частичное участие человека — модератора поисковой системы. 100% вебстраниц, имеющихся в базе данных поисковой системы, в штатном режиме не может проиндексировать ни одна современная поисковая система.

5

По области действия поисковые системы можно разделить на глобаль-

ные, которые осуществляют поиск на многих языках без учета имени домена, и локальные, которые осуществляют поиск в пределах определенного домена, например национального, на определенном языке.

Поисковые системы обычно состоят из трех компонентов:

1)средства поиска и структурирования информации:

поисковая машина (агент, паук или кроулер ),

средство анализа текста (Indexer),

оптимизатор — программа, которая выявляет степень соответствия страницы введенному запросу, определяет порядок сортировки htmlстраниц;

2)база данных, которая содержит всю собранную информацию;

3)пользовательский интерфейс для взаимодействия с базой данных. Каждый поисковый механизм имеет собственный набор правил, опреде-

ляющих, как собирать документы. Некоторые следуют за каждой ссылкой на каждой найденной странице и затем в свою очередь исследуют каждую ссылку на каждой из новых страниц и т. д. Можно придумать сколько угодно алгоритмов работы поисковой системы, методов ранжирования ключевых слов сайта и считать их наиболее точными. Сколько поисковых систем — столько и мнений. Приведем некоторые из многочисленных факторов, которые учитываются при проектировании поисковых систем для выстраивания рейтинга сайтов на основании ключевого запроса:

1)Количество ключевых слов на сайте.

2)Количество ключевых слов на странице.

3)Соотношение общего числа слов на сайте и количества ключевых слов на сайте.

4)Соотношение общего числа слов на странице и количества ключевых слов на странице.

5)Индекс цитирования.

6)Популярность тематики.

7)Возраст сайта.

8)Название URL сайта (имя домена)

9)Периодичность обновления информации на сайте.

10)Последнее обновление страниц сайта.

11)Язык сайта (русский или иностранный).

12)Размер шрифта, которым оформлены ключевые слова.

13)Жирность шрифта ключевых слов.

14)Написаны в разрядку или нет ключевые слова.

15)Написаны заглавными буквами или нет ключевые слова.

6

16)Наличие файла «робот».

17)Соответствие ключевых слов сайта тому разделу каталога поисковой машины, в котором зарегистрирован сайт.

18)Наличие «шумовых слов» («стоп-слов»).

19)Общее количество гиперссылок сайта.

20)Количество внутренних гиперссылок сайта.

21)Количество внешних гиперссылок сайта.

Рассмотрим подробнее особенности работы каждого поискового механизма.

2.1. Агент (Agent)

Агенты — самые «интеллектуальные» из поисковых средств. Их возможности не ограничиваются простым поиском. Агенты могут выполнять даже многокритериальный поиск, групповые операции (транзакции), благодаря чему возможным становится поиск сайтов специфической тематики и формирование списков сайтов, отсортированных по посещаемости.

Агенты могут обрабатывать содержание документов, находить и индексировать другие виды ресурсов, не только страницы. Они могут программироваться для извлечения информации из существующих баз данных, ее индексации и передачи базе данных поискового механизма.

2.2. Паук (Spider)

Общий поиск информации в Сети осуществляют программы, известные как пауки. Пауки сообщают о содержании найденного документа, индексируют его и извлекают итоговую информацию. Также они просматривают заголовки, некоторые ссылки и посылают проиндексированную информацию базе данных поискового механизма.

2.3. Кроулеры (Crawler)

Кроулеры, называемые также роботами, просматривают заголовки и возвращают только первую ссылку. Кроулеры могут быть запрограммированы так, чтобы переходить по различным ссылкам различной глубины вложенности, выполнять индексацию и даже проверять ссылки в документе. Из-за их природы они могут застревать в циклах, поэтому, проходя по ссылкам, им нужны значительные ресурсы Сети.

В настоящее время существует большое количество разновидностей поисковых роботов. В табл. 1 приведены некоторые из них.

7

Таблица 1. Виды поисковых роботов

Название поискового

Назначение поискового робота

 

робота

 

 

 

Национальный по-

Сбор информации с одного национального

исковый робот

домена и сайтов, принятых к индексации в ба-

(главный поиско-

зу данных поисковой системы. Пример: .ru, .su

вый робот)

 

 

Глобальные поис-

Сбор информации с национальных сайтов.

ковые роботы

Может быть один или несколько

Индексатор карти-

Отвечает за индексацию графики

нок

 

 

Индексатор аудио-

Отвечает за индексацию аудио- и видеофайлов

и видеофайлов

Определяет зеркала сайтов1

Робот-зеркальщик

Ссылочный робот

Отвечает за подсчет числа ссылок на сайте

 

 

Отвечает за оформление результатов, выда-

 

 

ваемых поисковой системой.

Робот-оформитель

Например, обращающийся к веб-странице по

 

 

ссылке «Найденные слова» и выделяющий

 

 

слова запроса в ее тексте

Проверяющий ро-

Проверяет наличие сайта в базе данных поис-

бот

ковой системы и количество проиндексиро-

ванных документов

 

 

 

 

Один или несколько роботов, определяющих,

 

 

доступен ли в данный момент сайт или доку-

Робот-стукач

мент, на который стоит ссылка в соответст-

вующем сервисе. Если сайт недоступен в те-

 

 

 

 

чение некоторого времени, он удаляется из ба-

 

 

зы данных

 

 

Ищет ссылки с сайтов на веб-страницы или

Робот-шпион

сайты, которых нет в базе данных поисковой

 

 

системы

Робот-смотритель

Предназначен для перепроверки полученных

 

 

результатов

Робот-

Предназначен для отладки алгоритма работы

поисковой системы или исследования кон-

исследователь

кретных сайтов

 

 

Быстрый робот

Проверяет дату последнего обновления сайтов

 

 

 

 

 

 

 

 

Примечание

Влокальных поисковых системах

Вглобальных поисковых системах

PageRank, индекс цити-

рования и т. д.

У Yandex — робот-

подсветчик

По-другому — «агентстукач»

Поисковая система стремится увеличивать свою базу данных автоматически Запускаются в ручном режиме

Могут быть объединены в одном роботе

Работает в автоматическом режиме

1 Зеркало сайта — сайт, являющийся полной или частичной копией основного сайта, расположенный на другом компьютере в другом месте в Интернете.

8

Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]