Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Поисковые системы сети Internet. Курс лекций

.pdf
Скачиваний:
0
Добавлен:
09.08.2026
Размер:
429 Кб
Скачать

Результаты выводятся в виде отсортированного по релевантности списка, содержащего выдержки из текста проиндексированных веб-страниц, на которых подсвечиваются ключевые понятия из вашего запроса, а также дополнительные слова, которые система нашла и учла в ходе поиска. Каждый текстовый фрагмент сопровождается линком на оригинальную веб-страницу. Поскольку интернетсервис Stocona Search использует индексные базы других поисковых машин, рядом с каждой ссылкой выводится название нашедшего ее поисковика.

В режиме «Синтаксический анализ» пользователям предлагается вписать в поле поиска любое предложение на русском или английском языке, а система проводит его полный синтаксический разбор с выделением членов предложения и определением грамматических характеристик каждого слова. Прямого отношения к интернет-поиску данная функция не имеет, однако она весьма любопытна и позволяет слегка заглянуть за кулисы Stocona, поскольку аналогичный механизм применяется поисковиком при разборе реального запроса.

Система AskNet (http://www.asknet.ru/) в определенной степени является наследницей Stocona Global Search. Дело в том, что ее авторы в свое время участвовали в создании Stocona, поэтому в базовых положениях работы данные проекты весьма схожи.

Особенность данной системы проявляется в возможности вести поиск в нескольких вертикальных базах, доступ к которым можно получить с помощью вкладок над полем запроса. Предлагается шесть таких баз, а также режим поиска во всех доступных источниках.

При поступлении запроса система самостоятельно понимает наиболее вероятный объект поиска. При поиске учитываются синонимы, обрабатываются аббревиатуры и словесная запись цифр и дат. Свободно сформулированное вопросительное предложение будет корректно разобрано системой только в том случае, если в нем содержится не более двух сказуемых или трех других однородных членов. Вопрос также должен быть грамматически верным и синтаксически согласованным. В принципе, AskNet может обработать и предложение с ошибками, однако ждать в таком случае достойного результата не стоит. Заметим, что эта система, как, в общем-то, и другие машины, включенные в настоящий обзор, не проверяет орфографию в запросе и не обладает способностью формулировать ответы на основе логической комбинации данных. Ответ будет выдан, только если соответствующая информация в какой-то форме прописана в базе проиндексированных текстов.

AskNet, как и Stocona, лучше всего понимает только определенный набор типов вопросов. Перечень поддерживаемых в настоящее время конструкций на русском и английском языках подробно разобран в «Справке» проекта. Если сис-

19

тема не сможет обработать ваш запрос с учетом семантики, поиск будет проведен в обычном режиме — только по ключевым понятиям.

Система Quintura.ru — интерактивная поисковая система, является одной из лучших на сегодняшний день реализаций визуального «облачного» интерфейса, создана российскими разработчиками. При поиске Quintura задействует индексные базы поисковика Yandex. Единственная не только в Рунете, но и в мире интерактивная поисковая машина, которая по поисковому запросу вместе с выдачей показывает и облако тегов, по которым может идти дополнительный поиск. Отображаемое облако ключевых слов, позволяет быстро уточнить поисковый запрос. В мире считается одним из наиболее перспективных поисковиков.

Англоязычные семантические поисковые системы. Kngine.com — новый поисковик с элементами семантики. Наряду со ссылками позволяет получать агрегированный ответ на поисковый запрос, сгенерированный из наиболее релевантных сведений и без учета Википедии.

Результаты поиска на Kngine начинаются с информации о том, что вы ищите, известных как «Концепции» (Concepts). Например, при поиске iPhone 3GS будут сначала отображены спецификации устройства. При поиске фильма сначала будет отображаться информация о фильме, ссылки на трейлеры, рецензии и отзывы. При поиске города будет отображаться информация о городе, о местных достопримечательностях, событиях, погоде и гостиницах города. Kngine в настоящее время содержит более 8 млн концепций.

Hakia.com — является первой семантической поисковой системой, которая в отличие от других поисковиков не просто индексирует страницы, а производит их смысловую классификацию по категориям и группам. Результаты поиска на Hakia делятся на веб-новости, блоги, Twitter, изображения и видео, соответствующие запросу. В зависимости от поиска в результаты могут добавляться отрывки из Википедии. Результаты также имеют пометки как «Достоверные» (Credible), полученные из надежных источников. Каждая ссылка сопровождается дополнительно текстом, давая представление о том, что можно найти в результатах поиска. По мнению экспертов, таким системам принадлежит будущее Веба.

DuckDuckGo.com — многофункциональная семантическая поисковая система, которая с помощью поисковой строки может осуществлять поиск через любые известные поисковики, такие как Google, YouTube, Amazon и eBay, и автоматически доставлять списки результатов поиска в этих сервисах. Функция также работает с ключевыми словами с добавлением характеристик ожидаемой информации (например: о погоде, изображения и тексты).

20

DuckDuckGo имеет функцию «Zero-click info», тогда как с Kngine, информа-

ция по теме поиска предшествует результатам поиска. Реализуется несколько вариантов поиска.

Если необходимо найти термин, имеющий более одного значения, то предоставляется возможность выбрать то, что необходимо найти, по его значению в результатах. Например, при поиске по термину Apple результат даст длинный список возможных значений, в том числе фрукты, компьютерную компанию, банк и многое другое. Несмотря на экстравагантное название, высоко оценивается специалистами информационного поиска. Отмечаются такие ее преимущества, как блокирование трастовых и спамовых сайтов, богатый функционал специальных поисков и настроек и т. д.

Evri.com — молодой, быстроразвивающийся и высокооцениваемый ведущими американскими интернет-изданиями поисковик — агрегатор новостей по любым выбранным темам. Реализован, в том числе, и для смартфонов и IPad. Имеет богатую информацией целевую страницу с самыми популярными новостями из Интернета, которые можно пролистывать за счет использования навигации в верхней части страницы.

Результаты поиска могут быть отфильтрованы в статьях и изображениях, а также могут быть импортированы в Facebook, Twitter и MySpace. Регистрация аккаунта предоставляет дополнительные преимущества при получении потоков специфической информации для конкретных результатов. Однако, не все результаты поиска можно проследить. Так, хотя поиск по слову «Barack Obama» может привести к потоку, который можно отследить, то поиск по слову «Obama» сам по себе не даст пользователям такую же функцию. На странице также отображаются дополнительные сведения по поиску, но опять же ограниченные определенными результатами. На примере Barack Obama, дополнительная информация может содержит ссылки на других мировых лидеров, выдержки из Википедии.

Потенциал у современных семантических систем действительно большой, однако в настоящее время реализованы далеко не все возможные семантические технологии. По сути, сейчас они только помогают выделить ключевые слова из свободно построенных фраз и подобрать дополнительные словоформы для составления корректного поискового запроса. Данное направление интернет-поиска постоянно развивается, и элементы семантического поиска используются современными статистическими поисковиками.

21

6. Алгоритм ранжирования

Когда кто-либо хочет найти информацию, доступную в сети Интернет, он посещает страницу поисковой системы и заполняет форму, детализирующую информацию, которая ему необходима. Здесь могут использоваться ключевые слова, даты и другие критерии. Критерии в форме поиска должны соответствовать критериям, используемым агентами при индексации информации, которую они нашли при перемещении по Сети и поместили в базу данных.

Поиск информации по запросу осуществляется в базе данных, сформированной поисковым механизмом. Порядок вывода информации, соответствующей пользовательскому запросу, определяется базой данных по определенному алгоритму ранжирования. В идеальном случае документы, наиболее релевантные пользовательскому запросу, будут помещены первыми в списке. Различные поисковые системы используют различные алгоритмы ранжирования, однако в основном учитываются следующие характеристики текста для определения релевантности:

1.Количество слов запроса в текстовом содержимом документа (т. е. в htmlкоде).

2.Теги, в которых эти слова располагаются.

3.Местоположение искомых слов в документе.

4.Удельный вес слов, относительно которых определяется релевантность, в общем количестве слов документа.

База данных выводит ранжированный подобным образом список документов с HTML и возвращает его пользователю, сделавшему запрос. Различные поисковые механизмы также выбирают различные способы показа полученного списка — некоторые показывают только ссылки; другие выводят ссылки с первыми несколькими предложениями, содержащимися в документе, или заголовок документа вместе со ссылкой.

Когда вы щелкаете на ссылке к одному из документов, который вас интересует, этот документ запрашивается у того сервера, на котором он находится.

7. Различия поисковых систем

Различия поисковых систем связаны с алгоритмами обработки данных, заложенных их создателями. Одни системы уделяют больше внимания «индексу цитирования», другие наличию всех метатегов, третьи вообще не уделяют внимания метатегам. Rambler, например, полностью игнорирует содержание метатегов (кроме мета тега robots). Если посмотреть на рейтинг любого сайта в различных поисковых системах, он везде окажется различным. Поэтому и существуют так

22

называемые входные страницы, оптимизированные под работу отдельных поисковых систем.

Как правило, поисковые системы держат в секрете свои алгоритмы ранжирования, в соответствии с которыми формируются их рейтинги. Этим преследуются две цели: защита от конкурентов и защита от направленного спама. Кроме того, поисковые системы отличаются объемом проиндексированных страниц и периодом обновления своего индекса.

В настоящее время объем индексации поисковых систем оценивается по двум параметрам: по количеству веб-страниц, которые поисковые системы посетили для создания своей базы данных, и количеству веб-страниц проиндексированных в базе данных.

AltaVista, например, утверждает, что ее база данных насчитывает 250 млн страниц, а число посещенных для индексации страниц составило 400 млн. У поисковой системы FAST этот показатель составляет 400 млн против 700 млн, Excite — 250/920 млн, Inktomi — 110 млн/1 млрд.

Второй показатель очень важен для правильной оценки «индекса цитирования», так как чем большее число веб-страниц посетил поисковый робот, тем большее количество перекрестных ссылок он проиндексировал. Чтобы лучше понять соотношение этих двух цифр, можно привести следующий пример: предположим, в комнате 250 млн экспертов, и они и только они могут ответить на поставленный вопрос. Когда приходит запрос от пользователя, то происходит голосование, кто будет первым отвечать на вопрос. Так вот, в этом голосовании принимают участие не только эксперты, которые уполномочены отвечать на вопрос, но и люди за пределами комнаты. В случае AltaVista количество людей за пределами комнаты составит 150 млн человек, а общее число проголосовавших будет равняться 400 млн.

Кроме того, поисковые системы различаются периодом обновления своего индекса, то есть временем, за которое происходит полное обновление базы данных поисковой системы. Чем короче этот период, тем более релевантны результаты поиска и меньше количество «мертвых» ссылок. Именно поэтому рейтинг в одной и той же поисковой системе может изменяться: появляются или исчезают какие-то сайты, вводятся изменения в алгоритм работы поисковых систем, меняется структура информации на сайтах. Период обновления индекса генератора у основных русскоязычных поисковых машин — неделя. Поэтому, зарегистрировав свой ресурс в поисковой машине, не следует сразу же искать ссылку на него среди результатов поиска — ссылка станет доступной только тогда, когда будет обновлена база данных поисковой системы.

23

8. Алгоритмы поисковых систем

Параметр, о котором далее пойдет речь, в зарубежных поисковиках называется link popularity, а в русскоязычных — индекс цитирования. Индекс цитирования (ИЦ) — это количество ссылок на определенный сайт с других сайтов. Существуют следующие разновидности индекса цитируемости в различных поисковых системах.

Взвешенный индекс цитирования (ВИЦ) — это количество ссылок на сайт с других сайтов с учетом важности каждой из них (зарубежный ана-

лог Page Rank).

Взвешенный индекс цитирования с учетом тематики сайта (ТИЦ) используется в Яндексе. Это тот же самый ВИЦ, но при подсчете учитывается тематика ссылающихся ресурсов, и из-за этого значения ВИЦ и ТИЦ для одного и того же сайта могут очень сильно отличаться. Тематика определяется по данным Яндекс-Каталога. Пока на выдачу результатов поиска влияет слабо.

Впоследнее время в ведущих западных поисковиках параметр ВИЦ становится все более и более важным. Google, например, использует Page Rank (ВИЦ) как основополагающий фактор в вычислении релевантности страницы. Нужно отметить, что Page Rank учитывает ссылки между страницами, а не между доменами, поэтому у страниц с одного домена может быть разный Page Rank, причем ссылки между страницами внутри домена тоже учитываются при определении Page Rank. Чем больше ссылок с других страниц, тем выше Page Rank. В настоящее время практически все поисковые системы в том или ином виде пользуются алгоритмом link popularity. На определение индекса цитируемости большое влияние оказывают следующие факторы:

содержание ссылки на сайт;

какой текст расположен около ссылки;

какого типа ссылающийся сайт.

Ссылка с очень популярного и известного сайта будет оценена намного выше, чем ссылка с нескольких малоизвестных сайтов. Ясно, что этот параметр очень трудно искусственно увеличить.

Однако не стоит думать, что везде скоро будут ВИЦ и Page Rank основными параметрами из-за того факта, что первые страницы в результатах поиска могут оказаться нерелевантными. Это накладывает ограничения на развитие новых ресурсов Сети.

Пользователей привлекают поисковики, которые могут не только производить поиск в своей базе данных сайтов, но и переадресовывать запрос другим поисковым системам. В системе Yandex, например, пользователь в случае, если он

24

не нашел ничего нужного по своему запросу, может попробовать найти то же самое с помощью таких поисковых систем, как AltaVista, Google, Fast, Yahoo!, Rambler, Апорт! При этом ему не требуется вручную переходить на сайт и заново набирать свой запрос, можно просто нажать необходимую ссылку в нижней части страницы, поискать то же самое на AltaVista — Google — Fast — Yahoo! — Rambler — Апорт! Поисковые системы Yandex и Google на сегодняшний день — одни из самых посещаемых в Интернете. Их популярность с каждым днем только увеличивается, и невозможно предугадать, насколько они будут популярны через несколько лет, если будут развиваться такими же темпами.

В последнее время, когда информация ценится очень высоко, для пользователя важна ее доступность и быстрый поиск. Следует помнить, что поисковые системы — не благотворительные организации. Основная цель работы поисковой системы — получение прибыли. Любой рейтинг можно купить. Чем сложнее это сделать, тем честнее поисковая система и рейтинг сайтов, которые она выстраивает. Учитывая это, разработчики, чтобы соответствовать современным требованиям, вынуждены все время развивать и совершенствовать поисковые системы, тем самым привлекая к себе пользователей новыми сервисами и новыми возможностями.

25

Приложение. Краткий обзор поисковых систем 1. Рейтинг поисковых систем

По данным компании Net Applications, в ноябре 2011 года использование поисковых систем распределялось следующим образом:

Google — 83,87 %;

Bing — 3,69 %;

Yahoo! — 6,20 %;

Ask — 0,57 %;

Baidu — 4,22 %;

AOL — 0,36 %.

Согласно данным LiveInternet об охвате русскоязычных поисковых запросов:

Всеязычные:

Google (37,2 %) Bing (0,8 %)

Yahoo! (0,2 %) и принадлежащие этой компании поисковые машины: Inktomi

AltaVista

Alltheweb

Англоязычные и международные: AskJeeves (механизм Teoma)

Русскоязычные — большинство «русскоязычных» поисковых систем индексируют и ищут тексты на многих языках — украинском, белорусском, английском, татарском и др. Отличаются же они от «всеязычных» систем, индексирующих все документы подряд, тем, что в основном индексируют ресурсы, расположенные в доменных зонах, где доминирует русский язык, или другими способами ограничивают своих роботов русскоязычными сайтами.

Yandex (48,1 %)

Mail.ru (5,9 %)

Rambler (1,2 %)

Nigma (0,3 %)

Некоторые из поисковых систем используют внешние алгоритмы поиска. Так, Qip.ru использует поисковый механизм Yandex, а Nigma сочетает в себе как свой алгоритм, так и сборную выдачу от других поисковиков.

2.Поисковая система Google

В1998 году два студента Стэнфордского университета — Сергей Брин и Ларри Пейдж — разработали поисковую систему Google, которая сразу же получила признание.

26

Вместе с поисковой системой был разработан механизм определения Page Rank. Этот механизм, используемый в Google, в основном основан на link popularity, то есть при вычислении релевантности страницы наибольший вес имеет количество и качество ссылок на страницы с других страниц.

Данный алгоритм используется во всех основных поисковых системах мира (в той или иной степени). Кстати, в русскоязычных поисковых системах также используется этот параметр, например в Яндексе, этот параметр называется «индекс цитирования».

Название поисковой системы Google было образовано в результате игры букв в слове «googol3». Этим компания хочет подчеркнуть свое намерение индексировать и обрабатывать большие объемы информации.

Данная поисковая система обрабатывает свыше половины всех запросов в Сети, на ее серверах хранится более 3 млрд проиндексированных страниц.

Поисковик Google использует новейшие технологии, например такие, как поиск по картинкам или поиск по книгам и новостям, которые позволяют пользователю самостоятельно определять релевантность сайта. Google первым стал индексировать не только HTML-файлы, но и документы Microsoft Office (Word, Excel, PowerPoint), PDF, RTF, PostScript-файлы. Это он делает тоже весьма ус-

пешно. Всем известно, что это самый популярный поисковик в мире. Но не всем известно, что его поддерживают более 130 тыс. серверов против, например, 5 тыс.

у Yandex.

Очень удобной функцией является «cache». Благодаря этой функции пользователь может просмотреть проиндексированную страницу, даже если эта страница удалена или сервер, на котором расположена страница, недоступен. Вы также можете использовать эту функцию для исследования ваших конкурентов, это помогает лучше понять принцип индексирования страницы поисковым пауком (роботом).

3. Поисковая система AltaVista

Одна из наиболее популярных поисковых систем — AltaVista Search появилась в декабре 1995 года. Первоначально она задумывалась как демонстрация мощи 64-разрядного сервера Alpha APX корпорации Digital Equipment, однако быстро приобрела самостоятельное значение как эффективное и мощное средство поиска. По последним данным, на сегодняшний день в индексе AltaVista зарегистрировано более 100 млн. URL. Эта поисковая система поражает своим быстродействием — в сутки она обслуживает более 20 млн запросов, при этом она отвечает на запросы незамедлительно, без задержек. Благодаря таким характеристи-

3 Число 10 в степени 100 (англ.).

27

кам система используется не только обычными пользователями, но и другими службами поиска, в частности каталогом Yahoo! Система обновления индекса — краулер — посещает WWW-сервера во всем мире, не испытывая проблем с языковым многообразием, поскольку AltaVista поддерживает поиск на 25 языках.

Организация этой системы такова, что странички, обновляемые редко, посещаются краулером реже, чем популярные и часто обновляющиеся страницы. К сожалению, автоматически из индекса никогда не удаляются «мертвые» ссылки, поэтому по некоторым запросам количество недействующих ссылок может быть довольно велико (до 12 %).

Наиболее интересная возможность AltaVista — это расширенный поиск. В отличие от многих других систем AltaVista поддерживает одноместный оператор NOT. Кроме этого, имеется еще и оператор NEAR, который реализует возможность контекстного поиска, когда термины должны располагаться рядом в тексте документа. AltaVista разрешает поиск по ключевым фразам, при этом она имеет довольно большой фразеологический словарь. Кроме всего прочего, при поиске в AltaVista можно задать имя поля, где должно встретиться слово: гипертекстовая ссылка, applet, название образа, заголовок, и ряд других полей. Сильные стороны этой системы проявляются, когда пользователю необходимо осуществить сложный поиск с указанием многих критериев отбора или поиск редких. В этом случае AltaVista предоставляет наиболее мощные и изощренные средства поиска среди всех рассматриваемых систем, среди которых такие уникальные средства, как поиск документов на конкретном языке, поиск по названию страницы, поиск среди гиперссылок (можно узнать, например, есть ли в WWWссылки на вашу страницу и если есть, то где), поиск объектов Java/ActiveX, поиск в «якорях» и т. д. Кроме того, AltaVista обеспечивает набор более стандартных, но очень ценных критериев отбора, таких как логические операции над ключевыми словами, поиск с учетом вариантов написания слов, поиск целых фраз, поиск документов только на определенных серверах (или доменах), ограничения по дате создания документа и т. д.

4. Поисковая система Lycos

Lycos — крупный портал, а также поисковая система. Портал помимо поисковой системы включает в себя много других разделов.

В 1994 году Lycos начал развиваться как самостоятельная поисковая система со своим собственным поисковым роботом, своим собственным каталогом. В 1998 году Lycos приобрел систему HotBot. Летом 2000 года Lycos объявил, что больше не будет поддерживать своего поискового робота и для выдачи результатов поиска будет использоваться база данных FAST. Потом Lycos купил поиско-

28

Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]