Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Практические аспекты разработки веб-ресурсов. Учебное пособие
.pdf
B. Много IP-адресов/один пользователь. Также весьма распространенный
случай, возникает при динамическом выделении адресов провайдером. В некоторых случаях новый адрес выделяется пользователю при каждом новом обращении к странице. Для случаев A или B можно выделять различных пользователей, основываясь на типе браузера, и отслеживать путь пользователя за один
сеанс, находя для каждого документа вызвавший его, и таким образом выделять
отдельные сеансы, от входа на сайт до страницы, с которой не было перехода
внутри сайта.
C. Один пользователь использует различные браузеры. В таком случае,
если IP-адрес не дает достоверных данных, можно воспользоваться только двумя методами, описанными ниже, при этом надо учесть, что файлы cookie будут
далеко не всегда корректно работать.
В любом из упомянутых случаев, если для идентификации не хватает
данных журнала, можно использовать файлы cookie и уникальную регистрацию
пользователей. У каждого из этих методов есть недостатки: пользователь может
удалить файлы, находящиеся на его компьютере, а обязательная регистрация,
помимо очевидных недостатков, не обязательно получает точные данные.
Другая важная задача — идентификация сеанса доступа. Перед тем как
будет выполнен какой-либо анализ использования, необходимо разделить данные на логические части, представляющие разные сеансы или транзакции. Сеанс пользователя — весь набор использованных страничных ссылок, сделанных
им за одно посещение сайта. Проблема определения сеансов сходна с определением отдельных пользователей.
Самым популярным методом решения этой проблемы является выделение сеансов использования по временному принципу, когда два последовательных обращения с одного адреса считаются принадлежащими одному сеансу,
если перерыв между этими обращениями не превысил заданный порог [8]. Вторым широко используемым способом является поддержание «per session
cookies» (на стороне пользователя хранятся данные, только от первого визита
на страницу до выключения браузера; анализ этих данных позволяет отличить
одно посещение пользователя от другого).
Транзакции отличаются от пользовательского сеанса тем, что в них могут
входить от одной до всех страниц маршрута пользователя за одну или несколько сеансов, в зависимости от заданного условия. Основная задача разбиения работы пользователя на транзакции состоит в выделении групп семантически
близких обращений одного пользователя, поэтому для разбиения могут использоваться и операция разбиения, и слияния. Таким образом, транзакция может
быть меньше или больше, чем один сеанс. Опишем три различных подхода к
разбиению на транзакции [6].
111

A. Идентификация транзакций с учетом продолжительности посещений.
Данный метод основывается на том, что время, проведенное пользователем на
странице, зависит от важности этой страницы для пользователя. Статистические данные показывают, что количество страниц, где пользователь провел
определенное время, обратно экспоненциально зависит от этого времени. Таким образом, если выбрать некоторую границу времени, то можно отделить
страницы, которые интересны пользователю от остальных. Этот метод предлагает формулу для вычисления такого интервала, в зависимости от распределения посещений страниц с различными временными интервалами. Концом транзакции служит первая из страниц, время посещения которой превысило выбранный порог, а началом — первая страница после конца предыдущей.
B. Идентификация транзакций методом максимальной ссылочной глубины. В этом случае новая транзакция начинается с первой ссылки вперед (переход на страницу, которую данный пользователь еще не посещал). Конец транзакции — достижение наибольшей глубины, т.е. если пользователь вернулся на
уже посещенную страницу.
C. Разбиение транзакций по временному принципу — перекликается с
методом выделения сеансов, все посещения делятся на части продолжительностью не превышающие заданный порог. Независимое применение такого разбиения малооправданно, этот метод можно применять после одного из семантически ориентированных методов, для отсечения вырожденных транзакций, с
помощью слияния транзакций, меньших порогового значения.
Статистический анализ
Как правило, по данным журнала сервера подсчитываются самая популярная страница, наибольшее количество посетителей за день, неделю, месяц,
также могут быть выделены страницы, обращения к которым вызвали
наибольшее количество ошибок. Можно применять статистический анализ к
уже очищенному и разбитому на транзакции журналу. В этом случае функциональная полезность резко возрастает, появляется возможность подсчитывать
статистические данные для продолжительности пребывания на различных
страницах или длины транзакции. Конечно, сбор статистики не дает требуемой
для методов извлечения знаний глубины, но любая система принятия решений
предоставляет пользователю такого рода информацию, как потенциально интересную и полезную. В качестве удобного интерфейса анализа получаемых данных, часто используется OLAP [7].
112

Методы поиска схем
После идентификации отдельной транзакции аналитик может применить
один из методов извлечения знаний из схемы доступа: анализ пути, нахождение
ассоциативных правил и последовательностей образцов, кластеризация или
классификация.
Для анализа пути используются различные виды графов, так как граф
представляет некоторое отношение, определенное на странице (или другом
объекте). Самым распространенным является построение графа, соответствующее физической структуре сервера, при этом страницы являются узлами, а
ссылки между ними — направленными ветвями. Также могут быть использованы графы, основанные на типах страниц, когда ребра представляют совпадения
между страницами, или где ребрам соответствуют количества пользователей,
переходящих с одной страницы на другую. Большая часть исследований, посвященных нахождению частых путей или последовательностей ссылок, проведена для графов отражающих физическую структуру. С помощью этой методики можно определять наиболее посещаемые пути в сети.
В связи с тем, что подобные базы транзакций содержат множество информации, обычно технологии поиска ориентируются только на записи, доступ
к которым осуществлялся не менее определенного числа раз. Обнаружение
этих правил для организаций, занятых в электронной коммерции, может помочь
в разработке эффективного маркетинга. Также эта информации помогает при
улучшении организации сетевого пространства.
Нахождение последовательностей образцов — обнаружение связи между
различными операциями, происходящими на протяжении одного временного
интервала. В серверных журналах транзакций каждое посещение клиента записывается с некоторым интервалом времени. Исследование временных отношений между различными данными, может иметь, например, следующие результаты: 30% клиентов после посещения исследуемого сервера, в течение 10 дней
прошли на нем регистрацию.
Другой важный тип связанности данных, также обнаруживаемый при помощи этой методики — сходные временные последовательности. Например,
нам может быть интересно найти общие характеристики у клиентов, обращавшихся к одному файлу в определенный период времени, или временной интервал, на протяжении которого интересующий нас файл чаще всего используется.
Обнаружение классификационных правил позволяет создать описание
записей, принадлежащих к определенной группе в связи с общностью атрибутов. Это описание затем используется для классификации вновь добавляемых
113

записей. При изучении использования сети можно разрабатывать описание для
клиентов, обращавшихся к определенным файлам, используя имеющиеся для
этих клиентов демографическую информацию или схемы доступа.
Кластерный анализ позволяет сгруппировать клиентов или данные, которые имеют сходные характеристики. Кластеризация информации о клиенте с
данными в журналах может позволить разработать и осуществить ряд маркетинговых стратегий.
Кластеризация транзакций
Основной областью применения для кластер-анализа в Web usage mining,
является персонификация наполнения страниц. Пользователь распределяется в
одну из категорий, после чего соответствующим образом изменяется выводимая для данного пользователя информация [8]. Еще одной традиционной для
кластеризации областью применения является поддержка принятия решений.
Кластеризация может использоваться для автоматической модификации
страниц. Особый интерес представляет выбор объекта кластеризации. Есть
возможность не проводить разбиение по транзакциям. Отказ от традиционного
подхода объясняется трудностями с выбором метрики, а также слишком большим количеством транзакций, относительно общего числа страниц. На первом
этапе с помощью алгоритма нахождения ассоциативных правил выделяются
группы страниц, к которым часто обращаются на протяжении одной транзакции. На втором полученные группы проецируются на ребра графа, и к графу
применяется алгоритм кластеризации. При запросе пользователя, система размещает текущую транзакцию в один из заранее созданных кластеров. В зависимости от свойств данного кластера формируется результирующий список
ссылок, интересных пользователю, который выводится на просматриваемой
странице.
При применении кластеризации всегда требуется решить две различные
проблемы: выбор метрики и выбор алгоритма. Основной проблемой при кластеризации транзакций является выбор метрики. По ряду причин классические
евклидовы метрики оказываются неэффективными.
Можно попробовать сравнивать сеансы пользователей следующим образом. Поскольку количество страниц ограничено, представим все сессии как
вектора одинаковой длины, где длина — общее количество анализируемых
страниц, а значениями элементов будет Истина, если такая страница входит в
сеансы — Ложь, если не входит. Используя подходящие методы кластеризации,
при таком подходе можно добиться достаточно точных результатов (например,
алгоритмы ROCK или CACTUS). Но при таком подходе теряется количество
обращений к одной странице за время одной транзакции, также не учитывается
последовательность посещения страниц.
114

Второй проблемой, сопряженной с выбором метрики, является нормализация транзакций. Достаточно часто приходится сравнивать между собой транзакции из двух-трех страниц, и транзакции длинной свыше 25 переходов. На
данный момент работ, посвященных этой проблеме, нет. Следует отметить, что
проблема нормализации данных отпадает при применении некоторых специальных метрик. Очень перспективно выглядит возможность изучения применимости для кластеризации транзакций метрики n-грамов, но на данный момент таких работ также нет.
Анализ полученных схем
OLAP является мощным инструментом для стратегического анализа баз
данных. Анализ, требуемый при извлечении знаний из сети, сходен с проводимым в хранилищах данных. Хорошим примером применения OLAP в данной
области является система WebLogMiner. Работа данной системы напоминает
многоуровневую базу данных.
На первом уровне записи журналов очищаются и помещаются в реляционные таблицы. На втором уровне строится куб данных на основании выбранных атрибутов. В качестве атрибутов могут быть выбраны: пользователь, расположение пользователя, тип ресурса, время, затраченное на просмотр ресурса,
дата, ответ сервера и т.д. На третьем — используется механизм OLAP, для изучения полученных данных экспертами. Для изучения можно запрашивать различные срезы куба данных. Например, можно получить статистику по всем запросам, по запросам от одного домена или от одного типа браузера. Можно получать информацию по различным пользовательским сессиям или временным
отрезкам. На четвертом уровне используются методы data mining для предсказания, классификации и нахождения интересных закономерностей. Этот этап
может предоставлять информацию, которую в силу различных причин не удалось обнаружить на предыдущем.
Визуализация является мощным инструментом для облегчения понимания различного рода задач. Еще в 1996 году была разработана система WebViz
для визуализации образцов сетевого доступа. Система использует парадигму
Web-пути, при которой наборы записей в журнале используются для извлечения последовательных наборов прохождения сети. WebViz позволяет аналитику обработать часть сети, отфильтровав неподходящую информацию по различным критериям, как-то, по именам серверов или по локальным адресам
страниц. При этом сеть представлена как направленный, цикличный граф, в котором узлам соответствуют страницы и ребрам — переходы пользователей по
ссылкам со страницы на страницу.
115

Методы извлечения знаний при использовании Internet на данный момент, становятся все более популярными. На данный момент хорошо работающих систем позволяющих проводить точный анализ Сети, практически нет, а
существующие плохо масштабируемы и мало эффективны. При этом в связи с
резким ростом числа пользователей Сети, потребность рынка в подобных информационных системах крайне велика, но реализации мешает отсутствие готовых теоретических решений [11]. Нет окончательного решения для целого
ряда задач: идентификации пользователей, сохранения конфиденциальности,
выбора метрики для пространства транзакций и т.д.
Контрольные вопросы
1. Назовите основные этапы анализа в процессе извлечения данных.
2. Какие существуют средства и методы сбора информации в Internet?
3. Какие проблемы решаются на этапе подготовки данных?
4. Опишите методы извлечения знаний из схемы доступа.
5. В каких случаях целесообразно использовать кластер-анализ?
Текстовая аналитика (Text Mining)
За последнее время одной из важнейших проблем является автоматическая обработка текстов, получаемых пользователями, в том числе через Internet.
Лавинообразный рост объемов документов требует дифференцированного извлечения только такой информации, которая может заинтересовать пользователя. Речь идет о содержательной обработке, т.е. извлечении знаний из текстов.
Трудности такой обработки определяются особенностями естественного языка
(ЕЯ): наличием большого количества словоформ, синтаксических конструкций,
неоднозначностей, умолчаний и др. В связи с этим, уровень формализации текстов в существующих системах (полнотекстовых баз данных, системах на гипертекстовой основе) невысок, что зачастую не устраивает пользователя.
Полнотекстовые базы данных не решают проблемы, так как при работе с
текстами на ЕЯ, дают много шумов (лишних документов) и потерь. Причина
этому — свободный порядок слов в русском языке, явление омонимии и полисемии. Одно и тоже можно выразить множеством различных способов. Более
того, слова запроса могут быть разбросаны по тексту документа и относиться к
различным сущностям. Все одно документ будет найден. Например, нужно
найти Иванова Ивана, а в документе упоминаются Иванов Петр и Петров Иван.
116

Такой документ при поиске будет считаться адекватным. Чтобы уменьшить
процент шумов используют различные методы: вводят критерии близости слов,
обрезают окончания словоформ, вводят индексирование нормализованных слов
и др. Но и это кардинально не решает проблемы.
Другой вариант — это использование реляционных БД. Но для этого требуются трудоемкая работа специально обученных людей по формализации текстов на ЕЯ: выделение из текстового документа (происшествия) лиц, адресов,
дат,... и заполнение соответствующих таблиц БД. При больших потоках документов это сделать крайне трудно. В любом случае будут потери той информации, которая не учтена в рамках схем (таблиц) БД.
Описанная ситуация является типичной для многих других областей,
имеющих дело с потоками информации в виде текстов на ЕЯ: через СМИ, ИНТЕРФАКС, из специальных источников.
Отметим, что в настоящее время в глобальной сети Internet хранится
огромное количество всевозможной информации. Подавляющее большинство
документов — это текстов на ЕЯ. На данный момент в качестве помощи пользователю, работающему в Internet, предлагается класс поисковых машин, которые обеспечивают возможность контекстного поиска по ключевым словам запроса. Поисковая машина является универсальным инструментом и дает много
лишней информации, которую конечному пользователю приходится самостоятельно анализировать. Причиной этому является неспособность поисковой машины вылавливать то, что интересует пользователя.
В тоже время большинство конкретных пользователей — это люди, которые интересуются конкретными вещами. Например, следователю важны фигуранты, их место жительства, телефоны, криминальные события, даты и др.
Специалиста по кадрам интересуют организации, где человек работал, кем он
работал и когда это было. Другие люди вылавливают из СМИ информацию о
странах, влиятельных лицах, катастрофах и др. Здесь важны и связи: место работы с занимаемой должностью, экстремальная ситуация с ее временем и т.д.
Будем называть интересующую пользователя конкретную информацию — информационными объектами. Каждый пользователь (или класс пользователей)
интересуется своими объектами и связями между ними. Вся остальная информация является лишней и человек старается ее просто не замечать. Отсюда часто используемая людьми методика чтения «по диагонали», или «с поиском
ключевых слов».
117

Перспективное направление в области информатики (обработки документов на ЕЯ) должно учитывать, прежде всего, интересы конечного пользователя.
Отсюда следует необходимость построения нового класса информационных
систем, использующих специальные лингвистические процессоры и технологию баз знаний [11]. Лингвистические процессоры необходимы для глубинной
обработки текстов с выявлением информационных объектов и связей. На основе последних формируются структуры знаний, которые образуют БЗ. На уровне
БЗ становится возможным более полно учитывать потребности пользователя —
за счет организации различных видов поиска: поиска конкретных объектов, поиска похожих объектов, поиска по связям и др. Такие виды поиска относятся к
«семантическим», так как осуществляется не на уровне слов или словоформ, а
на уровне структур знаний из БЗ. Будем называть системы подобного типа семантико-ориентированными.
Важным источником текста являются графические, видео- и речевые объекты внутри сообщений. Особенностью ТА является необходимость обрабатывать текст на различных языках.
Эта область технологий позволяет извлекать информацию (знания) для
генерации полезных идей для общества, бизнеса и государства. Спрос на
осмысление естественного языка растет в приложениях, начиная от корпоративного поиска и мониторинга социальных медиа до когнитивных приложений
и систем поддержки принятия решений. Для удовлетворения этого спроса активно создаются новые методы и инструменты ТА в направлениях: Natural
Language Processing, Text Mining, социологический анализ авторов сообщений,
социальный граф связей. Развивается общая модель описания семантики текста
OWL 2 в проекте Semantic Web консорциума W3C [2].
TA используется там, где необходима быстрая обработка большого объе-
ма текста. Хотя не все приложения обрабатывают только текст, но при наличии
общего пространства «больших данных», аналитическая задача, обрабатывающая транзакционные записи, может быть дополнена результатами обработки
текста в качестве дополнительного источника.
Многие организации ведут борьбу за интеграцию разнообразных потоков
знаний и их полезного использования. Чтобы использовать скрытые знания, заключенные в контенте, инновационные организации внедряют технологии, которые виртуально объединяют их разнообразную структурированную и неструктурированную информацию, и делают ее доступной и необходимой для
работников умственного труда.
118

Проблема состоит в востребованности современных методов и программных компонентов текстовой аналитики, эффективно работающих с Big Data
хранилищами данных. Наличие таких компонентов позволит выполнять совместный анализ данных различных типов для поддержки процессов принятия
решений.
Ее решение позволит также создать современную распределенную информационную систему, отвечающую оптимальным требованиям по производительности, надежности, горизонтальной и вертикальной масштабируемости,
целостности данных и стоимости.
Текстовая аналитика (TA) достигла наибольшего успеха в четырех сферах: потребительский сектор, государственное и местное управление, естествознание и клиническая медицина, а также научно-технические исследования.
Прежде всего вызывает интерес анализ Internet-новостей, сообщений в социальных сетях и обратной связи клиентов. Поисковые приложения — поиск, реклама, исследования, работа с клиентами.
TA становится значительной частью рынка систем поиска и аналитики.
Растёт спрос на автоматический анализ естественного языка для применения в
различных приложениях, начиная с корпоративных поисковых систем, систем
мониторинга социальных медиа, услуг «виртуальных помощников», например,
в Internet-магазинах и Call-центрах, и заканчивая системами обучения, системами комплексного анализа данных: ситуационного анализа, поддержки принятия решений и др.
У потребителей растёт интерес к автоматизированной идентификации тематик, сущностей и концептов, событий и характеристик персон в сочетании с
анализом цели и тональности — отношения, эмоций и оценок, а также другой
субъективной информации об объектах и их атрибутах. В 2013 году также появился новый сегмент рынка приложений и технологий, основанных на искусственном интеллекте, машинном обучении и когнитивных вычислениях, которые используют неструктурированные данные и информацию.
В 2014 году рынок еще значительнее фрагментируется на программные
средства, сервисы обработки естественного языка (NLP), средства ТА, системы
социальной аналитики, интегрированные среды анализа данных, а также технологии, интегрированные в другие приложения.
Ниже приведены некоторые выводы, полученные из обзора рынка, проведённого корпорацией Альта-Плана (Alta Plana Corp.) в 2014 году.
119

Социальные медиа остаются на сегодняшний день самым популярным
источником идей для проектов текстовой аналитики. Основные категории онлайн/социальных источников информации:
блоги и другие социальные медиа (61%);
новостные статьи (42%);
комментарии в блогах и к новостным статьям (38%);
Internet-форумы (36%).
Появление качественно новых материалов сказывается на увеличении
производительности технического обеспечения, развитие коммуникационных
средств и технологий управления информационными ресурсами привели к появлению более крупных и сложных информационных систем. Речь идет о масштабах систем не только относительно объема поддерживаемых информационных ресурсов, но и числа их пользователей. Одновременно прослеживается
тенденция к глобализации информационных систем, интеграция всевозможных
участков систем. Многочисленные глобальные системы создаются в настоящее
время как приложения web для электронной коммерции, для поддержки научных сообществ различных коллективов ученых во многих областях знаний в
международном и национальном масштабе, в библиотечном деле, медицине и в
других сферах. И немаловажную роль в этом процессе играет внедрение интеллектуальных Internet-технологий.
Контрольные вопросы
1. Что представляет собой технология текстовой аналитики?
2. Назовите особенности текстовой аналитики и использование есте-
ственного языка.
3. Каковы области, где применение Text Mining наиболее актуально?
4. С какими другими технологиями применятся текстовая аналитика?
120
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
