Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Практические аспекты разработки веб-ресурсов. Учебное пособие

.pdf
Скачиваний:
0
Добавлен:
08.09.2026
Размер:
2 Мб
Скачать
B. Много IP-адресов/один пользователь. Также весьма распространенный случай, возникает при динамическом выделении адресов провайдером. В неко­торых случаях новый адрес выделяется пользователю при каждом новом обра­щении к странице. Для случаев A или B можно выделять различных пользова­телей, основываясь на типе браузера, и отслеживать путь пользователя за один сеанс, находя для каждого документа вызвавший его, и таким образом выделять отдельные сеансы, от входа на сайт до страницы, с которой не было перехода внутри сайта.
C. Один пользователь использует различные браузеры. В таком случае, если IP-адрес не дает достоверных данных, можно воспользоваться только дву­мя методами, описанными ниже, при этом надо учесть, что файлы cookie будут далеко не всегда корректно работать.
В любом из упомянутых случаев, если для идентификации не хватает данных журнала, можно использовать файлы cookie и уникальную регистрацию пользователей. У каждого из этих методов есть недостатки: пользователь может удалить файлы, находящиеся на его компьютере, а обязательная регистрация, помимо очевидных недостатков, не обязательно получает точные данные.
Другая важная задача — идентификация сеанса доступа. Перед тем как будет выполнен какой-либо анализ использования, необходимо разделить дан­ные на логические части, представляющие разные сеансы или транзакции. Се­анс пользователя — весь набор использованных страничных ссылок, сделанных им за одно посещение сайта. Проблема определения сеансов сходна с опреде­лением отдельных пользователей.
Самым популярным методом решения этой проблемы является выделе­ние сеансов использования по временному принципу, когда два последователь­ных обращения с одного адреса считаются принадлежащими одному сеансу, если перерыв между этими обращениями не превысил заданный порог [8]. Вто­рым широко используемым способом является поддержание «per session cookies» (на стороне пользователя хранятся данные, только от первого визита на страницу до выключения браузера; анализ этих данных позволяет отличить одно посещение пользователя от другого).
Транзакции отличаются от пользовательского сеанса тем, что в них могут входить от одной до всех страниц маршрута пользователя за одну или несколь­ко сеансов, в зависимости от заданного условия. Основная задача разбиения ра­боты пользователя на транзакции состоит в выделении групп семантически близких обращений одного пользователя, поэтому для разбиения могут исполь­зоваться и операция разбиения, и слияния. Таким образом, транзакция может быть меньше или больше, чем один сеанс. Опишем три различных подхода к разбиению на транзакции [6].
111
A. Идентификация транзакций с учетом продолжительности посещений. Данный метод основывается на том, что время, проведенное пользователем на странице, зависит от важности этой страницы для пользователя. Статистиче­ские данные показывают, что количество страниц, где пользователь провел определенное время, обратно экспоненциально зависит от этого времени. Та­ким образом, если выбрать некоторую границу времени, то можно отделить страницы, которые интересны пользователю от остальных. Этот метод предла­гает формулу для вычисления такого интервала, в зависимости от распределе­ния посещений страниц с различными временными интервалами. Концом тран­закции служит первая из страниц, время посещения которой превысило вы­бранный порог, а началом — первая страница после конца предыдущей.
B. Идентификация транзакций методом максимальной ссылочной глуби­ны. В этом случае новая транзакция начинается с первой ссылки вперед (пере­ход на страницу, которую данный пользователь еще не посещал). Конец тран­закции — достижение наибольшей глубины, т.е. если пользователь вернулся на уже посещенную страницу.
C. Разбиение транзакций по временному принципу — перекликается с методом выделения сеансов, все посещения делятся на части продолжительно­стью не превышающие заданный порог. Независимое применение такого раз­биения малооправданно, этот метод можно применять после одного из семан­тически ориентированных методов, для отсечения вырожденных транзакций, с помощью слияния транзакций, меньших порогового значения.
Статистический анализ
Как правило, по данным журнала сервера подсчитываются самая попу­лярная страница, наибольшее количество посетителей за день, неделю, месяц, также могут быть выделены страницы, обращения к которым вызвали наибольшее количество ошибок. Можно применять статистический анализ к уже очищенному и разбитому на транзакции журналу. В этом случае функцио­нальная полезность резко возрастает, появляется возможность подсчитывать статистические данные для продолжительности пребывания на различных страницах или длины транзакции. Конечно, сбор статистики не дает требуемой для методов извлечения знаний глубины, но любая система принятия решений предоставляет пользователю такого рода информацию, как потенциально инте­ресную и полезную. В качестве удобного интерфейса анализа получаемых дан­ных, часто используется OLAP [7].
112
Методы поиска схем
После идентификации отдельной транзакции аналитик может применить один из методов извлечения знаний из схемы доступа: анализ пути, нахождение ассоциативных правил и последовательностей образцов, кластеризация или классификация.
Для анализа пути используются различные виды графов, так как граф представляет некоторое отношение, определенное на странице (или другом объекте). Самым распространенным является построение графа, соответствую­щее физической структуре сервера, при этом страницы являются узлами, а ссылки между ними — направленными ветвями. Также могут быть использова­ны графы, основанные на типах страниц, когда ребра представляют совпадения между страницами, или где ребрам соответствуют количества пользователей, переходящих с одной страницы на другую. Большая часть исследований, по­священных нахождению частых путей или последовательностей ссылок, прове­дена для графов отражающих физическую структуру. С помощью этой методи­ки можно определять наиболее посещаемые пути в сети.
В связи с тем, что подобные базы транзакций содержат множество ин­формации, обычно технологии поиска ориентируются только на записи, доступ к которым осуществлялся не менее определенного числа раз. Обнаружение этих правил для организаций, занятых в электронной коммерции, может помочь в разработке эффективного маркетинга. Также эта информации помогает при улучшении организации сетевого пространства.
Нахождение последовательностей образцов — обнаружение связи между различными операциями, происходящими на протяжении одного временного интервала. В серверных журналах транзакций каждое посещение клиента запи­сывается с некоторым интервалом времени. Исследование временных отноше­ний между различными данными, может иметь, например, следующие резуль­таты: 30% клиентов после посещения исследуемого сервера, в течение 10 дней прошли на нем регистрацию.
Другой важный тип связанности данных, также обнаруживаемый при по­мощи этой методики — сходные временные последовательности. Например, нам может быть интересно найти общие характеристики у клиентов, обращав­шихся к одному файлу в определенный период времени, или временной интер­вал, на протяжении которого интересующий нас файл чаще всего используется.
Обнаружение классификационных правил позволяет создать описание записей, принадлежащих к определенной группе в связи с общностью атрибу­тов. Это описание затем используется для классификации вновь добавляемых
113
записей. При изучении использования сети можно разрабатывать описание для клиентов, обращавшихся к определенным файлам, используя имеющиеся для этих клиентов демографическую информацию или схемы доступа.
Кластерный анализ позволяет сгруппировать клиентов или данные, кото­рые имеют сходные характеристики. Кластеризация информации о клиенте с данными в журналах может позволить разработать и осуществить ряд марке­тинговых стратегий.
Кластеризация транзакций
Основной областью применения для кластер-анализа в Web usage mining, является персонификация наполнения страниц. Пользователь распределяется в одну из категорий, после чего соответствующим образом изменяется выводи­мая для данного пользователя информация [8]. Еще одной традиционной для кластеризации областью применения является поддержка принятия решений.
Кластеризация может использоваться для автоматической модификации страниц. Особый интерес представляет выбор объекта кластеризации. Есть возможность не проводить разбиение по транзакциям. Отказ от традиционного подхода объясняется трудностями с выбором метрики, а также слишком боль­шим количеством транзакций, относительно общего числа страниц. На первом этапе с помощью алгоритма нахождения ассоциативных правил выделяются группы страниц, к которым часто обращаются на протяжении одной транзак­ции. На втором полученные группы проецируются на ребра графа, и к графу применяется алгоритм кластеризации. При запросе пользователя, система раз­мещает текущую транзакцию в один из заранее созданных кластеров. В зави­симости от свойств данного кластера формируется результирующий список ссылок, интересных пользователю, который выводится на просматриваемой странице.
При применении кластеризации всегда требуется решить две различные проблемы: выбор метрики и выбор алгоритма. Основной проблемой при кла­стеризации транзакций является выбор метрики. По ряду причин классические евклидовы метрики оказываются неэффективными.
Можно попробовать сравнивать сеансы пользователей следующим обра­зом. Поскольку количество страниц ограничено, представим все сессии как вектора одинаковой длины, где длина — общее количество анализируемых страниц, а значениями элементов будет Истина, если такая страница входит в сеансы — Ложь, если не входит. Используя подходящие методы кластеризации, при таком подходе можно добиться достаточно точных результатов (например, алгоритмы ROCK или CACTUS). Но при таком подходе теряется количество обращений к одной странице за время одной транзакции, также не учитывается последовательность посещения страниц.
114
Второй проблемой, сопряженной с выбором метрики, является нормали­зация транзакций. Достаточно часто приходится сравнивать между собой тран­закции из двух-трех страниц, и транзакции длинной свыше 25 переходов. На данный момент работ, посвященных этой проблеме, нет. Следует отметить, что проблема нормализации данных отпадает при применении некоторых специ­альных метрик. Очень перспективно выглядит возможность изучения приме­нимости для кластеризации транзакций метрики n-грамов, но на данный мо­мент таких работ также нет.
Анализ полученных схем
OLAP является мощным инструментом для стратегического анализа баз данных. Анализ, требуемый при извлечении знаний из сети, сходен с проводи­мым в хранилищах данных. Хорошим примером применения OLAP в данной области является система WebLogMiner. Работа данной системы напоминает многоуровневую базу данных.
На первом уровне записи журналов очищаются и помещаются в реляци­онные таблицы. На втором уровне строится куб данных на основании выбран­ных атрибутов. В качестве атрибутов могут быть выбраны: пользователь, рас­положение пользователя, тип ресурса, время, затраченное на просмотр ресурса, дата, ответ сервера и т.д. На третьем — используется механизм OLAP, для изу­чения полученных данных экспертами. Для изучения можно запрашивать раз­личные срезы куба данных. Например, можно получить статистику по всем за­просам, по запросам от одного домена или от одного типа браузера. Можно по­лучать информацию по различным пользовательским сессиям или временным отрезкам. На четвертом уровне используются методы data mining для предска­зания, классификации и нахождения интересных закономерностей. Этот этап может предоставлять информацию, которую в силу различных причин не уда­лось обнаружить на предыдущем.
Визуализация является мощным инструментом для облегчения понима­ния различного рода задач. Еще в 1996 году была разработана система WebViz для визуализации образцов сетевого доступа. Система использует парадигму Web-пути, при которой наборы записей в журнале используются для извлече­ния последовательных наборов прохождения сети. WebViz позволяет аналити­ку обработать часть сети, отфильтровав неподходящую информацию по раз­личным критериям, как-то, по именам серверов или по локальным адресам страниц. При этом сеть представлена как направленный, цикличный граф, в ко­тором узлам соответствуют страницы и ребрам — переходы пользователей по ссылкам со страницы на страницу.
115
Методы извлечения знаний при использовании Internet на данный мо­мент, становятся все более популярными. На данный момент хорошо работаю­щих систем позволяющих проводить точный анализ Сети, практически нет, а существующие плохо масштабируемы и мало эффективны. При этом в связи с резким ростом числа пользователей Сети, потребность рынка в подобных ин­формационных системах крайне велика, но реализации мешает отсутствие го­товых теоретических решений [11]. Нет окончательного решения для целого ряда задач: идентификации пользователей, сохранения конфиденциальности, выбора метрики для пространства транзакций и т.д.
Контрольные вопросы
1. Назовите основные этапы анализа в процессе извлечения данных.
2. Какие существуют средства и методы сбора информации в Internet?
3. Какие проблемы решаются на этапе подготовки данных?
4. Опишите методы извлечения знаний из схемы доступа.
5. В каких случаях целесообразно использовать кластер-анализ?
Текстовая аналитика (Text Mining)
За последнее время одной из важнейших проблем является автоматиче­ская обработка текстов, получаемых пользователями, в том числе через Internet. Лавинообразный рост объемов документов требует дифференцированного из­влечения только такой информации, которая может заинтересовать пользовате­ля. Речь идет о содержательной обработке, т.е. извлечении знаний из текстов. Трудности такой обработки определяются особенностями естественного языка (ЕЯ): наличием большого количества словоформ, синтаксических конструкций, неоднозначностей, умолчаний и др. В связи с этим, уровень формализации тек­стов в существующих системах (полнотекстовых баз данных, системах на ги­пертекстовой основе) невысок, что зачастую не устраивает пользователя.
Полнотекстовые базы данных не решают проблемы, так как при работе с текстами на ЕЯ, дают много шумов (лишних документов) и потерь. Причина этому — свободный порядок слов в русском языке, явление омонимии и поли­семии. Одно и тоже можно выразить множеством различных способов. Более того, слова запроса могут быть разбросаны по тексту документа и относиться к различным сущностям. Все одно документ будет найден. Например, нужно найти Иванова Ивана, а в документе упоминаются Иванов Петр и Петров Иван.
116
Такой документ при поиске будет считаться адекватным. Чтобы уменьшить процент шумов используют различные методы: вводят критерии близости слов, обрезают окончания словоформ, вводят индексирование нормализованных слов и др. Но и это кардинально не решает проблемы.
Другой вариант — это использование реляционных БД. Но для этого тре­буются трудоемкая работа специально обученных людей по формализации тек­стов на ЕЯ: выделение из текстового документа (происшествия) лиц, адресов, дат,... и заполнение соответствующих таблиц БД. При больших потоках доку­ментов это сделать крайне трудно. В любом случае будут потери той информа­ции, которая не учтена в рамках схем (таблиц) БД.
Описанная ситуация является типичной для многих других областей, имеющих дело с потоками информации в виде текстов на ЕЯ: через СМИ, ИН­ТЕРФАКС, из специальных источников.
Отметим, что в настоящее время в глобальной сети Internet хранится огромное количество всевозможной информации. Подавляющее большинство документов — это текстов на ЕЯ. На данный момент в качестве помощи поль­зователю, работающему в Internet, предлагается класс поисковых машин, кото­рые обеспечивают возможность контекстного поиска по ключевым словам за­проса. Поисковая машина является универсальным инструментом и дает много лишней информации, которую конечному пользователю приходится самостоя­тельно анализировать. Причиной этому является неспособность поисковой ма­шины вылавливать то, что интересует пользователя.
В тоже время большинство конкретных пользователей — это люди, кото­рые интересуются конкретными вещами. Например, следователю важны фигу­ранты, их место жительства, телефоны, криминальные события, даты и др. Специалиста по кадрам интересуют организации, где человек работал, кем он работал и когда это было. Другие люди вылавливают из СМИ информацию о странах, влиятельных лицах, катастрофах и др. Здесь важны и связи: место ра­боты с занимаемой должностью, экстремальная ситуация с ее временем и т.д. Будем называть интересующую пользователя конкретную информацию — ин­формационными объектами. Каждый пользователь (или класс пользователей) интересуется своими объектами и связями между ними. Вся остальная инфор­мация является лишней и человек старается ее просто не замечать. Отсюда ча­сто используемая людьми методика чтения «по диагонали», или «с поиском ключевых слов».
117
Перспективное направление в области информатики (обработки докумен­тов на ЕЯ) должно учитывать, прежде всего, интересы конечного пользователя. Отсюда следует необходимость построения нового класса информационных систем, использующих специальные лингвистические процессоры и техноло­гию баз знаний [11]. Лингвистические процессоры необходимы для глубинной обработки текстов с выявлением информационных объектов и связей. На осно­ве последних формируются структуры знаний, которые образуют БЗ. На уровне БЗ становится возможным более полно учитывать потребности пользователя — за счет организации различных видов поиска: поиска конкретных объектов, по­иска похожих объектов, поиска по связям и др. Такие виды поиска относятся к «семантическим», так как осуществляется не на уровне слов или словоформ, а на уровне структур знаний из БЗ. Будем называть системы подобного типа се­мантико-ориентированными.
Важным источником текста являются графические, видео- и речевые объ­екты внутри сообщений. Особенностью ТА является необходимость обрабаты­вать текст на различных языках.
Эта область технологий позволяет извлекать информацию (знания) для генерации полезных идей для общества, бизнеса и государства. Спрос на осмысление естественного языка растет в приложениях, начиная от корпора­тивного поиска и мониторинга социальных медиа до когнитивных приложений и систем поддержки принятия решений. Для удовлетворения этого спроса ак­тивно создаются новые методы и инструменты ТА в направлениях: Natural Language Processing, Text Mining, социологический анализ авторов сообщений, социальный граф связей. Развивается общая модель описания семантики текста
OWL 2 в проекте Semantic Web консорциума W3C [2].
TA используется там, где необходима быстрая обработка большого объе-
ма текста. Хотя не все приложения обрабатывают только текст, но при наличии общего пространства «больших данных», аналитическая задача, обрабатываю­щая транзакционные записи, может быть дополнена результатами обработки текста в качестве дополнительного источника.
Многие организации ведут борьбу за интеграцию разнообразных потоков знаний и их полезного использования. Чтобы использовать скрытые знания, за­ключенные в контенте, инновационные организации внедряют технологии, ко­торые виртуально объединяют их разнообразную структурированную и не­структурированную информацию, и делают ее доступной и необходимой для работников умственного труда.
118
Проблема состоит в востребованности современных методов и программ­ных компонентов текстовой аналитики, эффективно работающих с Big Data хранилищами данных. Наличие таких компонентов позволит выполнять сов­местный анализ данных различных типов для поддержки процессов принятия решений.
Ее решение позволит также создать современную распределенную ин­формационную систему, отвечающую оптимальным требованиям по произво­дительности, надежности, горизонтальной и вертикальной масштабируемости, целостности данных и стоимости.
Текстовая аналитика (TA) достигла наибольшего успеха в четырех сфе­рах: потребительский сектор, государственное и местное управление, естество­знание и клиническая медицина, а также научно-технические исследования. Прежде всего вызывает интерес анализ Internet-новостей, сообщений в соци­альных сетях и обратной связи клиентов. Поисковые приложения — поиск, ре­клама, исследования, работа с клиентами.
TA становится значительной частью рынка систем поиска и аналитики. Растёт спрос на автоматический анализ естественного языка для применения в различных приложениях, начиная с корпоративных поисковых систем, систем мониторинга социальных медиа, услуг «виртуальных помощников», например, в Internet-магазинах и Call-центрах, и заканчивая системами обучения, систе­мами комплексного анализа данных: ситуационного анализа, поддержки приня­тия решений и др.
У потребителей растёт интерес к автоматизированной идентификации те­матик, сущностей и концептов, событий и характеристик персон в сочетании с анализом цели и тональности — отношения, эмоций и оценок, а также другой субъективной информации об объектах и их атрибутах. В 2013 году также по­явился новый сегмент рынка приложений и технологий, основанных на искус­ственном интеллекте, машинном обучении и когнитивных вычислениях, кото­рые используют неструктурированные данные и информацию.
В 2014 году рынок еще значительнее фрагментируется на программные средства, сервисы обработки естественного языка (NLP), средства ТА, системы социальной аналитики, интегрированные среды анализа данных, а также техно­логии, интегрированные в другие приложения.
Ниже приведены некоторые выводы, полученные из обзора рынка, про­ведённого корпорацией Альта-Плана (Alta Plana Corp.) в 2014 году.
119
Социальные медиа остаются на сегодняшний день самым популярным источником идей для проектов текстовой аналитики. Основные категории он­лайн/социальных источников информации:
блоги и другие социальные медиа (61%); новостные статьи (42%); комментарии в блогах и к новостным статьям (38%);  Internet-форумы (36%).
Появление качественно новых материалов сказывается на увеличении производительности технического обеспечения, развитие коммуникационных средств и технологий управления информационными ресурсами привели к по­явлению более крупных и сложных информационных систем. Речь идет о мас­штабах систем не только относительно объема поддерживаемых информацион­ных ресурсов, но и числа их пользователей. Одновременно прослеживается тенденция к глобализации информационных систем, интеграция всевозможных участков систем. Многочисленные глобальные системы создаются в настоящее время как приложения web для электронной коммерции, для поддержки науч­ных сообществ различных коллективов ученых во многих областях знаний в международном и национальном масштабе, в библиотечном деле, медицине и в других сферах. И немаловажную роль в этом процессе играет внедрение интел­лектуальных Internet-технологий.
Контрольные вопросы
1. Что представляет собой технология текстовой аналитики?
2. Назовите особенности текстовой аналитики и использование есте-
ственного языка.
3. Каковы области, где применение Text Mining наиболее актуально?
4. С какими другими технологиями применятся текстовая аналитика?
120
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]