Добавил:
Upload Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:
MAG_SShI_15_1_Kushvid_poyasnyuvalna_zapiska.doc
Скачиваний:
2
Добавлен:
01.07.2025
Размер:
2 Мб
Скачать

Календарний план

Номер

Назва етапів дипломної роботи

Термін

виконання етапів

роботи

Примітка

1

Отримання завдання на дипломну роботу

27.10.2016

Виконано

2

Аналіз предметної області

27.10.2016-3.11.2016

Виконано

3

Постановка завдання та узгодження з керівником

3.11. 2016-4.11.2016

Виконано

4

Розробка моделі взаємодії даних

5.11.2016-10.11.2016

Виконано

5

Написання програмного коду

10.11.2016-12.11.2016

Виконано

6

Розробка моделі інтерфейсу

13.11.2016-25.11.2016

Виконано

7

Реалізація візуального інтерфейсу

26.11.2016-27.12.2016

Виконано

8

Надання пояснювальної записки на перевірку керівнику

03.01.2017

Виконано

9

Захист перед ДЕК

19.01.2017

Студент

(підпис)

Керівник роботи

доц. Чала Л.Е.

(підпис)

(посада, прізвище, ініціали)

РЕФЕРАТ

Записка пояснювальна: 85 с., 22 рисунки, 1 таблиць, 49 джерел.

Об'єктом дослідження є методи кластеризації електронних текстів в розподіленої файлової системи.

Метою роботи є розробка методів ефективного пошуку текстової інформації в розподіленої файлової системи з високою продуктивністю і якістю при малих ресурсних витратах додатки і створення модифікованого методу кластерної індексації текстової інформації з використанням нейромережі багатошарового персептрона.

Методами дослідження є моделі нейронних мереж, призначені для задач ієрархічної кластеризації та аналізу динамічної інформації з метою швидкого реагування на зовнішній вплив.

DATA MINING, TEXT MINING, TEXT CLUSTERING, NEURAL NETWORKS, SEARCH ENGINE, INDEXING, SOINN

РЕФЕРАТ

Пояснительная записка: 85 с., 22 рисунка, 1 таблиц, 49 источников.

Объектом исследования являются методы кластеризации электронных текстов в распределенной файловой системе.

Целью работы является разработка метода эффективного поиска текстовой информации в распределенной файловой системе с высокой производительностью и качеством при малых ресурсных затратах приложения и создание модифицированного метода кластерной индексации текстовой информации с использованием нейросети многослойного персептрона.

Методами исследования являются модели нейронных сетей, предназначенные для задач иерархической кластеризации и анализа динамичной информации с целью быстрого реагирования на внешнее воздействие.

DATA MINING, TEXT MINING, TEXT CLUSTERING, NEURAL NETWORKS, SEARCH ENGINE, INDEXING, SOINN

ABSTRACT

Master thesis: 85 pages, 22 figures, 1 tables, 49 references.

The object of the study are clustering methods of electronic texts in a distributed file system.

The aim is to develop methods for effective search of textual information in a distributed file system with high performance and quality at low cost resource applications and the creation of a modified method of clustered indexing textual information using a neural network of multilayer perceptron.

The methods of research are models of neural networks are designed for tasks hierarchical clustering and dynamic analysis of information in order to quickly respond to external stimuli.

DATA MINING, TEXT MINING, TEXT CLUSTERING, NEURAL NETWORKS, SEARCH ENGINE, INDEXING, SOINN

СОДЕРЖАНИЕ

ВВЕДЕНИЕ 7

1 АНАЛИЗ ПРЕДМЕТНОЙ ОБЛАСТИ И ПОСТАНОВКА ЗАДАЧИ 9

1.2 Понятие классификации 10

1.3 Понятие кластеризации 12

1.4 Понятие индексации 15

1.5 Дескрипторы и стоп-слова 19

1.6 Стемминг 21

1.7 Постановка задачи 22

2 Методы ИЗВЛЕЧЕНИЯ, анализа И ХРАНЕНИЯ ДАННЫХ 24

2.1 Методы классификации 24

2.1.1 Анализ формальных концептов (FCA) 26

2.1.2 Полиномиальная модель метода Naive Bayes 30

2.1.3 Модель Бернулли метода Naive Bayes 32

2.1.4 Байесовская классификация текстов 33

2.2 Методы кластеризации 36

2.2.1 Алгоритм k-средних 40

2.2.2 Алгоритм FOREL 43

2.2.3 Нейронная сеть Кохонена 45

2.2.4 SOINN 47

2.3 Использование нейронных сетей в задачах классификации и кластеризации 51

2.4 Выбор дескрипторов 54

2.5 Предварительная обработка данных 56

2.6 Анализ входных документов 57

2.7 Хранение результатов обработки данных 59

3 ПРОЕКТИРОВАНИЕ АРХИТЕКТУРЫ 60

3.1 Анализ языка программирование программирования Ruby и C++ 60

3.2 Общая схема 61

3.3 Модуль 1: Парсер 64

3.4 Модуль 2: Обработчик 65

3.5 Модуль 3: Поисковый движок 66

4 ПРАКТИЧЕСКАЯ РЕАЛИЗАЦИЯ И АНАЛИЗ ЭФФЕКТИВНОСТИ 68

4.1 Практическая реализация 68

4.2 Анализ эффективности 73

ВЫВОДЫ 75

ПЕРЕЧЕНЬ ССЫЛОК 77

ПРИЛОЖЕНИЕ А 82

ВВЕДЕНИЕ

Самым распространенным видом информации в современном цифровом обществе есть текстовая информация. В 21-м веке стали проявляться особенно остро негативные стороны наличия большого разнообразия этого вида информации и ее доступности, а именно – информационная перегрузка.

В то же время возросла и скорость доступа к этой информации. Человек уже не справляется с качественной классификацией текстовых массивов информации вручную, и возникает необходимость в автоматизации этого процесса и усовершенствования систем поиска по большим выборкам текстовых данных.

Отличительной особенностью методов кластеризации является способность автоматически выделять группы в потоке входных данных. В контексте обработки текстов на естественном языке это свойство является особенно привлекательным, когда возникает необходимость оперативно выделить группы в большом массиве текстовых документов. Эта задача, например, актуальна для информационно-поисковых систем, когда пользователю необходимо дать поверхностное представление обо всем списке найденных документов, не принуждая его просматривать большую часть этих документов. В такой постановке задачи дополнительно возникает необходимость синтеза аннотаций кластеров, кратко отражающих тематику их документов; необходимость выделения динамической структуры кластеров по причине изменчивой природы данных.

Наиболее подходящим аннотированием для кластеров с целью дальнейшего использования в поисковых целях является присвоение кластерам уникального индекса который присваивается каждому документу из этого кластера. Данный способ позволяет однозначно и кратко определять схожет общей тематики документов с возможностью быстрого определения отношениея новых документов в структуре и модифицировать структуру при изменчивости данных.

Для больших объемов текстовой информации наиболее эффективным критерием кластеризации является лингвистические дескрипторы. Лингвистический дескриптор – лексическая единица (слово, словосочетание) информационно-поискового языка, выражающая основное смысловое содержание какого-либо текста [1].

Распределенное хранение информации и возможность изменения местонахождения файла в файловой структуре с необходимостью сохранения общей структуры файлов требует поиска альтеранитавного способа хранения структруры который поспособствовал бы сохранению иерархии при полной свободе перемещения.

Лучшим решением в данном случает является размещение дополнительной информации в системный раздел метаинформации файла, что позволяет удобное и компактное хранение предобработанных данных этого файла с маркировкой по дате вытяжки. В комбинации со стандартными свойствами, такими как: дата создания и дата изменения, этот метод позволяет получить минимально необходимую распределенную систему котроля версии предобработнаного вектора дексрипторов для каждого текстового документа в составляемой библиотеке.

Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]