- •Оглавление
- •Краткое описание предприятия
- •Описание отдела, должностные обязанности
- •Описание сути проекта, в рамках которого студент проходил производственную практику
- •Описание выполнения работ по производственной практике
- •Информационно-аналитические системы
- •Применение
- •Поиск и неструктурированные данные
- •Типовые задачи, выполняемые иас:
- •Индивидуальные особенности систем:
- •Проблемы uda
- •Сводная информация о системах
- •Детальное описание систем
- •Задачи, выполняемые иас «Астарта»:
- •Особенности системы:
- •Вместе с иас Астарта могут быть приобретены услуги:
- •Задачи, выполняемые иас «Аналитический курьер»:
- •Архитектура программного комплекса
- •Заявленные возможности системы
- •Задачи, выполняемые иас «Семантический архив»:
- •Заключение по производственной практике.
Архитектура программного комплекса
Система «Аналитический Курьер» реализована на платформе Microsoft .NET, имеет многослойную архитектуру взаимодействующих с «тонким клиентом» сервисов и предоставляет пользователям веб-интерфейс. Такая архитектура предполагает, что система состоит из относительно независимых звеньев: сервера данных, сервера приложений, веб-сервера и самих приложений. Система может функционировать в современных центрах обработки данных, предоставляющих услуги «облачных вычислений»;
Лингвистический анализ текста
лексический анализ — разбиение текста на предложения и лексемы
морфологический анализ — часть речи, род, число, падеж и т.д.
предсинтаксический анализ — выделение групп лексем - синтагм и др.
синтаксический анализ — построение дерева разбора предложения и определение синтаксических ролей слов в предложении: подлежащее, сказуемое, дополнение и т.д.
постсинтаксический анализ — выделение типизированных сущностей
орфографический корректор ошибок и вариативной лексики в тексте
Семантический анализ текста
Последующий семантический анализ текста производит типизацию сущностей (физические, юридические лица; одушевленные предметы; даты; регионы и многие другие типы), а также их нормализацию. Для идентификации ссылочно представленных сущностей (местоимения) используются различные эвристические методы:
Разрешение анафорических ссылок. Пример. Если в тексте присутствуют местоимения («он», «она» и т.д.), то производится идентификация объекта – источника ссылки.
Разрешение аббревиатур. Например, если в тексте встретилась — «НЛМК», то просмотрев текст и найдя в нем «Новолипецкий меткомбинат» система сгенерирует синоним для НЛМК.
Идентификация географических объектов. Пример. Если в тексте встретился географический объект с названием, например, «деревня Иваново», то производится поиск других географических объектов в тексте, например, «Московская область», что позволит связать найденную деревню «Иваново» именно с той в справочнике стран и регионов, которая находится в Московской области.
Поиск наиболее полного наименования персоны. Пример. Если в тексте встретилась персона «Д. Медведев», а по тексту выше есть персона «президент России Д. Медведев», то система возьмет это последнее наименование, как наиболее полное в данном тексте.
«Айкумена-Аналитика»
http://www.iqanalytics.ru/
Поисковый механизм системы является собственной разработкой компании ЗАО «Айкумен-информационные бизнес-системы» и включает в себя:
средства сбора информации из различных источников (интернет, базы данных, файловые хранилища)
инструменты поиска и мониторинга
средства аналитической обработки информации
целостные хранилища полученной информации
Задачи, выполняемые ИАС «Айкумена-Аналитика»:
Сбор информации
Автоматический мониторинг Интернет источников на наличие текстовой информации в форматах: html, txt, doc, rtf, xls, pdf и других
Добавление в систему документов из Интернета в ручном и автоматическом режиме
Интеграция с различными источниками данных
• внутренние СУБД
• внешние информационные системы
• локальные файловые системы
• системы телеэфира (сохранение и анализ распознанной речи)
Добавление в систему документов из печатных материалов
Рубрикация
Распределение информации по темам (рубрикам)
Наличие общего и персонального рубрикатора
Разграничение прав доступа к соответствующим рубрикам
Поиск информации с использованием собственного языка запросов
Сохранение и повторное использование поисковых запросов (понятия)
Автоматическое определение схожих по содержанию документов (дублей)
Анализ информации
Выделение и поиск фактической информации – отдельно чисел, денег, процентов, дат, персон, организаций и других параметров
Ретроспективный анализ развития тем – визуализация динамики развития определенной темы во времени
Анализ игроков – автоматическое выделение в текстах документов «Игроков» - организаций и персон
Поиск связей между игроками следующих типов
• персона-персона
• персона-организация
• организация-организация
Внедрение системы происходит в несколько этапов:
- Проведение диагностики информационных потребностей организации.
- Определение источников информации, описание объектов мониторинга и ключевых запросов.
- Подготовка и согласование документации, отчетов диагностики, определение стоимости.
- Настройка и адаптация системы, создание рубрикатора.
- Обучение персонала.
При необходимости на этапе предпродажной подготовки проекта выполняется разработка демонстрационного стенда Системы «Айкумена-Аналитика».
Продолжительность внедрения системы зависит от сложности решаемых задач, выбранных настроек, масштаба внедрения и может составлять от одной недели до нескольких месяцев.
Также, компания предоставляет следующие услуги:
Техническую поддержку работоспособности системы «Айкумена-Аналитика».
Информационное сопровождение (оповещение о выходе новых версий и релизов, новостей).
Разработку нового функционала в соответствии с потребностями заказчика, проектирование информационных систем.
Консультации по работе с системой.
Обучение.
InfoNgen
http://infongen.ru
Компания InfoNgen предлагает как коробочные решения по сбору и агрегации информации, так и индивидуальную разработку (InfoNgen Custom Development).
Основным предлагаемым инструментом обработки неструктурированной информации является InfoNgen Web Discovery.
Первая функциональная версия проекта InfoNgen была представлена компанией Instant Information в 2007 г. Сейчас выпущена версия 3, идет работа над версией 4.
Языки: Java, C#, MS SQL 2005
Технологии и системы: Web Services, ASP.NET, .NET, IIS 7.0
InfoNgen оснащен гибким набором инструментов для сбора информации, которые работают с любыми форматами, что позволяет осуществлять неограниченную навигацию по контенту в различных форматах и приложениях, которые обычно несовместимы друг с другом.
Система осуществляет постоянное сканирование и индексацию тематическими, корпоративными и финансовыми ярлыками всех источников информации, которые в последующем обрабатываются с помощью технологий семантического анализа. Контекстуальные рамки, используемые для организации такого контента, могут свободно изменяться и настраиваться пользователями в соответствии со своими персональными требованиями, а также могут транспортироваться при помощи детализированного XML-метатегирования (использования ярлыков) или при помощи описательного RDF.
InfoNgen автоматически проводит мониторинг порядка 30 000 сетевых источников информации и обрабатывает более 700 тыс. информационных материалов в сутки. В среднем к каждому материалу прилагается около десяти тегов (ярлыков), каждый из них – на языке обработанного материала. Материалы на иностранных языках автоматически переводятся на английский и в результатах поиска появляются уже с английскими заголовками.
InfoNgen, в качестве источника интернет-информации в области бизнеса, при помощи технологий RDF или XML отмечает информацию на основе биржевых символов компаний, секторов промышленности и экономики, даты и времени, а также по темам, ключевым предприятиям и компаниям, по их взаимосвязи, показателям релевантности, тематике новостей, заголовков и краткого содержания.
Сообщения доставляются в режиме реального времени либо как XML-поток информации, либо как FTP-решение.
Индивидуальные пользовательские решения для сбора деловой информации на базе платформы InfoNgen:
бизнес-анализ и написание спецификации проекта
построение архитектуры и дизайна проекта
разработка решения и его последующее внедрение
текущая техническая поддержка проекта и предоставление серверных мощностей для его функционирования
Существующие модульные платформы и технологии InfoNgen могут быть интегрированы в индивидуальные пользовательские решения.
Сроки реализации проекта варьируются от трех месяцев до года и более в зависимости от сложности поставленных задач.
EPAM Systems/Clarabridge Document Analytics
http://clarabridge.ru
Компания EPAM Systems оказывает полный спектр консалтинговых и технологических услуг, связанных с построением систем анализа неструктурированной информации и их использованием для решений бизнес-задач заказчика. Сопровождение процесса выбора и настройки решения включают в себя следующие услуги:
идентификация источников, в которых сконцентрирована информация
сбор предварительных данных для анализа
выбор оптимальных аналитических методов
настройка системы отчетности для различных задач по желанию пользователя (анализ трендов, аномальные отклонения, рейтинги, выявление скрытых зависимостей, т.п.)
интеграция с внутренними данными (переписка, CRM, данные о продажах и т.п.).
С технологической точки зрения ЕРАМ Systems гарантирует:
решение всех технических вопросов
организацию сбора данных из различных источников (web, e-mails, документы, базы данных, графические материалы и т.д.)
обеспечение возможностей для анализа любых неструктурированных текстов
максимально эффективное использование средств визуализации и анализа (Data mining, Business intelligenсе, olap).
После предварительной настройки системы заказчику предоставляется возможность провести "тест-драйв" решения. После тестового использования могут быть реализованы различные формы сотрудничества.
В рамках партнёрской программы, совместно с компанией Clarabridge, EPAM Systems осуществляет разработку и внедрение систем, основанных на платформе Clarabridge.
Платформа обеспечивает автоматизацию процессов сбора и обработки данных различных источников информации, в том числе выделение фактографической информации из неструктурированных или слабоструктурированных документов и их загрузку в хранилище данных.
ЕРАМ.Конкурентый анализ:
полностью автоматизировать сбор данных из всех доступных источников информации и осуществлять автоматическое обновление баз данных
благодаря мощной аналитической составляющей применять к собранным данным традиционные методы анализа — это дает возможность выявлять основных конкурентов, их слабые и сильные стороны, аффилированность, отслеживать тенденции появления новых продуктов на рынках, а также оценивать и прогнозировать эффективность деятельности конкурентов и самой компании в настоящем и будущем
используя разнообразные средства визуализации получать результаты анализа в наглядной форме
проводить аудит информации до уровня первоначального документа (поста в блоге, обзора, статьи и т.д.)
разграничить права пользователей, что обеспечит необходимый уровень конфиденциальности.
ЕРАМ.Анализ источников:
в автоматическом режиме осуществлять мониторинг любых неструктурированных (содержащих обычный текст) источников, как открытых, так и внутренних
получать информацию в удобном для принятия решений виде (отчеты, рейтинги)
применять различные типы анализа (выявление аномалий, анализ тенденций и т.д.)
при необходимости обращаться к исходным документам.
«АРИОН»
http://www.sytech.ru
ИАС «АРИОН», разработанная российской компанией САЙТЭК (SyTech), предназначена для анализа и агрегации данных из неструктурированных источников. Система предоставляет пользователям возможности по сбору, обработке и анализу разнородных данных в условиях современной информационной среды.
Задачи, выполняемые ИАС «АРИОН»:
сбор данных из различных источников
режимы обработки полнотекстовой информации
анализ документов на естественном языке и выделение из текстов
фактографической информации
режим многокритериального поиска
анализ фактографической информации
построение аналитических и статистических отчетов
визуализация данных с помощью графических средств и интерфейсы пользователей
интеграция со смежными информационными системами
Сбор данных из различных источников
Для сбора данных из разнородных источников в ИАС «АРИОН» используется специализированный модуль позволяющий выполнять загрузку данных из следующих типов источников:
Неструктурированные источники
Частично структурированные источники:
формализованные документы
электронная почта
электронные архивы и системы документооборота
Базы данных, таблицы и файлы xml с неатомарными полями:
структурированные источники
базы данных
xml
таблицы Excel
Система позволяет задать критерии отбора информации из источников и способы ее первичной фильтрации, а также организовать периодическое обновление и загрузку новой информации в соответствии с определенным регламентом. Для этого используется специальная утилита – менеджер загрузки.
Обработка полнотекстовой информации
извлечение и загрузка документов из массива
автоматическая рубрикация документов
Подготовка информационных материалов на основе массива документов:
составление дайджестов и рефератов документов
аннотирование текстов документов
подготовка аналитических подборок
полнотекстовый поиск с учетом морфологии
атрибутивный поиск документов
разметка текстов документов
Выделение фактографической информации из текстов документов выполняется в специализированном модуле ИАС «АРИОН» - Лингвистическом процессоре.
Результатом обработки текста документа в лингвистическом процессоре является набор связанной фактографической информации – информационных объектов и связей между ними.
Поиск в фактографическом хранилище
Для работы с поисковыми запросами и их результатами в ИАС «АРИОН» предусмотрены различные режимы и критерии поиска:
поиск по атрибутам объектов
поиск цепочек связей
многокритериальный поиск (в запросе описывается искомая ситуация в виде набора типов объектов и связей между ними)
поиск связей между фактами
Для удобства и эффективной работы пользователей предусмотрены следующие сервисные функции:
формирование и выполнение типовых запросов
оперативное и долговременное сохранение результатов поиска персонально для каждого пользователя
сортировка и фильтрация информационного списка
слияние двух и более информационных объектов
добавление объектов в результат запроса
теоретико-множественные операции над результатами нескольких запросов
Анализ фактографической информации
Идентификационные возможности:
слияние совпадающих объектов
поиск похожих объектов, фактов и ситуаций
определение незначимых объектов, фактов ситуаций
определение весов объектов, фактов ситуаций
Поисково-аналитические функции:
поиск скрытых закономерностей
атрибутивный поиск объектов, фактов ситуаций
поиск цепочек связей между объектами, фактами, ситуациями
Аналитические функции:
контекстный анализ
временной анализ
ситуативный анализ
Функции мониторинга и прогнозирования:
построение моделей ситуаций
мониторинг фактов и ситуаций
прогнозирование развития ситуаций
автоматический сбор и построение досье
Построение аналитических и статистических отчетов
Информация из ИАС «АРИОН» может быть выведена в виде отчетов в табличном и графическом виде. Предусмотрены режимы агрегирования и подсчета статистики. Результаты статистической обработки представляются в системе в виде таблиц, графиков и гистограмм.
Средства визуализация данных и интерфейсы пользователей
Для представления данных пользователю предусмотрено 2 основных режима: табличный и графический. В табличном режиме пользователю предлагается список объектов с указанием их характеристик. Графический режим является более наглядным, в нем информация представляется в виде графа, в котором вершины представляют объекты, а ребра – связи.
Любой режим представления позволяет пользователю редактировать характеристики объектов и связей, а также удалять и создавать их.
Ввод данных может осуществляться как в ручном, так и в пакетном режиме с помощью менеджера загрузки.
Интеграция со смежными информационными системами
ИАС «АРИОН» базируется на открытых стандартах и имеет возможность взаимодействовать со смежными системами на разных уровнях. Вся информация в системе «АРИОН» имеет представление в формате xml и может быть выгружена в файл, в базу данных, или передана в нужную веб-службу (web-service).
Семантический архив
http://www.anbr.ru/
Компания ООО «Аналитические бизнес решения» специализируется на автоматизации деятельности аналитических служб (служб безопасности, маркетинга, PR-служб, информационно-аналитических отделов и пр.) организаций различных сфер деятельности.
Разработка компании, ИАС «Семантический архив», представляет собой инструмент для создания интегрированного хранилища информации с возможностью хранения досье на объекты мониторинга, происходящие события, а также текстовые документы.
Текущая версия системы 4.0 выпущена в 2011 г. Система была полностью переведена на новую платформу, переработан интерфейс и юзабилити. Система написана на C# с использованием .NET Framework. В качестве СУБД используется MS SQL Server 2005/2008. Для интеграции со сторонними продуктами и подключения дополнительных компонентов, созданных сторонними разработчиками, имеет SDK (с подробной документацией и примерами). Подходит к завершению разработка web-версии системы.
В новой версии упор делается на разработку новых интернет роботов, отчетных форм, работе с графиками и геокартами, автоматизации выделения событий и фактов и рядом других новых функций.
