Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Автоматизированные системы финансовых расследований. Курс лекций
.pdf
Типовые прикладные программные инструменты и технологии
50 различных результатов, при этом, возможно, противоречивых.
В противоположность этому, контент-анализ является математически точной исследовательской технологией.
Для более полной характеристики технологии контент-ана-
лиза можно отметить следующее:
1. Все данные статистики вербального материала используются для формулирования выводов о невербальных аспектах,
например о тех или иных характеристиках адресата и адресанта.
Поэтому исходный текстовой материал является промежуточным объектом аналитического исследования.
2. Само по себе выяснение частоты употребления какого-то
слова не является собственно контент-анализом. Контент-анализ — это всегда сопоставление характеристик двух материалов.
Например, сопоставление двух газет как двух текстовых материалов. Возможно сопоставление текстового и нетекстового материала, например статистических данных о каком-либо социальном феномене и текстовой информации о субъектах,
имеющих прямое или косвенное отношение к нему. Возможно
сопоставление текстовых данных о каком-либо феномене и правовых норм, которые могут опосредовать отдельные его составляющие; частоты употребления определенного слова в статьях
конкретного журналиста и стандартной частоты употребления
этого слова в современном языке — и т.д.
В качестве основных составляющих контент-анализа можно
выделить следующие:
а) формулировка задачи, определение программы исследо-
вания;
б) определение выборки (то есть текстов, которые достаточны
для анализа всего массива публикаций и обеспечивают репрезентативность выборки);
в) определение единого семантического толкования ключевых понятий исследования;
г) составление кода, перечня характеристик текста, отвечающих задаче исследования (единиц анализа);
д) составление рабочего документа, кодированной карточки
и инструкции кодировщику (человеку, который будет работать с
текстом, фиксировать частоту употребления единиц текста);
е) составление сметы исследования;
ж) компьютерная обработка данных;
з) предъявление результатов исследования.
Зачастую реализация технологий контент-анализа прессы
в целях информационно-аналитического обеспечения финансо-
121

Лекция 7
вых расследований может требовать чрезмерно больших затрат
времени и средств, поэтому в целях обеспечения своевременности и оперативности получения необходимой информации могут использоваться и другие технологии, в частности технологии
экспресс-анализа, который обычно базируется на количественном подсчете содержательных элементов текста (факт, конфликт,
аргумент, тема, обобщение) и учете качественных характеристик
текстового материала (соответствие цели, информативность, актуальность, доказательность, конструктивность).
Контент-анализ предпочтительно используется в таких областях, как изучение социальных оценок тех или иных событий,
анализ целенаправленности пропаганды в СМИ, методов работы
журналистов; изучение арсенала средств массовой коммуникации,
используемых хозяйствующими субъектами, представляющими
оперативный интерес для органов финансовых расследований;
психоаналитические и криминалистические исследования. Указанный диапазон задач может охватывать до 60% объема всей
информационно-аналитической работы, проводимой по какомулибо конкретному объекту, попавшему в поле зрения органов
финансовых расследований.
* * *
В заключение можно отметить, что относительно самостоятельный блок типовых прикладных программных инструментов
в АСФР образуют вспомогательные системы автоматизированного делопроизводства и документооборота (САДД) и информационного обеспечения кадровых задач (СИОК).
САДД — это программная система, которая предназначена
для автоматизации делопроизводственной деятельности и документационного обеспечения повседневной управленческой деятельности соответствующих подразделений ведомственной принадлежности.
СИОК предназначена для автоматизации процесса информационного обеспечения деятельности сотрудников кадровых и
организационно-мобилизационных подразделений ведомственной принадлежности.
Такие средства обычно не являются специфическими и базируются на общеизвестных принципах и технико-технологических платформах. Как правило, они изучаются в рамках общих
дисциплин в области информатизации хозяйственной деятельности предприятий и организаций.
122

Лекция 8
БАЗЫ ДАННЫХ И СИСТЕМЫ
УПРАВЛЕНИЯ БАЗАМИ ДАННЫХ
В АВТОМАТИЗИРОВАННЫХ СИСТЕМАХ
ФИНАНСОВЫХ РАССЛЕДОВАНИЙ
8.1. Понятие базы данных: основные определения
В настоящее время в теоретическом плане единое определение категории «база данных» отсутствует. В литературе предлагается множество определений, отражающих скорее субъективное
мнение тех или иных авторов или ту или иную сторону этой системообразующей категории. Так, например, в международных
стандартах приводятся следующие определения:
– база данных — совокупность данных, хранимых в соответствии со схемой данных, манипулирование которыми выполняют в соответствии с правилами средств моделирования данных
– база данных — совокупность данных, организованных в
соответствии с концептуальной структурой, описывающей характеристики этих данных и взаимоотношения между ними,
причем такая совокупность данных, которая поддерживает одну
или несколько областей применения
2
.
В научной литературе приводятся и такие определения:
– база данных — организованная в соответствии с опреде-
ленными правилами и поддерживаемая в памяти компьютера
совокупность данных, характеризующая актуальное состояние
некоторой предметной области и используемая для удовлетворения информационных потребностей пользователей
3
;
– база данных — некоторый набор перманентных (постоянно
хранимых) данных, используемых прикладными программными
системами какого-либо предприятия
4
.
1
;
1
ГОСТ Р ИСО/МЭК ТО 10032—2007: Эталонная модель управления данными
(идентичен ISO/IEC TR 10032:2003 Information technology — Reference model of
data management).
2
ISO/IEC 2382-1:1993. Information technology — Vocabulary — Part 1: Fun-
damental terms.
3
Когаловский М.Р. Энциклопедия технологий баз данных. М., 2002.
4
Дейт К.Дж. Введение в системы баз данных. М., 2005.
123

Лекция 8
В такой ситуации не последнюю роль играет общепринятая
практика. В соответствии с ней, например, не называют базами
данных файловые архивы, интернет-порталы или электронные
таблицы — несмотря на то, что они в некоторой степени обладают признаками базы данных.
В российском законодательстве дано следующее определение рассматриваемой категории: «…базой данных является представленная в объективной форме совокупность самостоятельных
материалов (статей, расчетов, нормативных актов, судебных
решений и иных подобных материалов), систематизированных
таким образом, чтобы эти материалы могли быть найдены и обработаны с помощью электронной вычислительной машины
(ЭВМ)» (гл. 70 «Авторское право», ст. 1260 «Переводы, иные
производные произведения. Составные произведения» ГК РФ)
1
.
При этом, согласно данному кодексу (гл. 69 «Общие положения», ст. 1225 «Охраняемые результаты интеллектуальной деятельности и средства индивидуализации», п. 1), базы данных
являются интеллектуальной собственностью и относятся к результатам интеллектуальной деятельности и приравненным к
ним средствам индивидуализаци юридических лиц, товаров,
работ, услуг и предприятий, которым предоставляется правовая
охрана.
Существует огромное количество разновидностей баз данных, различающихся по целому ряду критериев. Например, в
«Энциклопедии технологий баз данных»
2
даются определения
свыше 50 видов баз данных.
При классификации по модели данных различают следующие виды БД:
• иерархическая;
• объектная и объектно-ориентированная;
• объектно-реляционная;
• реляционная;
• сетевая;
• функциональная.
1
Гражданский кодекс Российской Федерации (часть четвертая) от 18.12.2006
№ 230-ФЗ // Парламентская газета. 2006. 21 дек.
2
Когаловский М.Р. Указ. соч.
124

Базы данных и системы управления базами данных в АСФР
8.2. Модели данных, реализуемые в АСФР: общая
характеристика, основные понятия и определения
Иерархическая модель данных — представление базы данных
в виде древовидной (иерархической) структуры, состоящей из
объектов (данных) различных уровней.
Между объектами существуют связи, каждый объект может
включать в себя несколько объектов более низкого уровня. Такие
объекты находятся в отношении предка (объект более близкий
к корню) к потомку (объект более низкого уровня); при этом
возможна ситуация, когда объект-предок не имеет потомков или
имеет их несколько, тогда как у объекта-потомка всегда только
один предок. Объекты, имеющие общего предка, называются
близнецами (в программировании применительно к древовидной структуре данных устоялось название «братья»).
Первые системы управления базами данных использовали
иерархическую модель данных. Например: если иерархическая
база данных содержит информацию о покупателях и их заказах,
то существует объект «покупатель» (родитель) и объект «заказ»
(дочерний). Объект «покупатель» будет иметь указатели от каждого заказчика к физическому расположению заказов покупателя в объект «заказ». В этой модели запрос, направленный вниз по
иерархии, прост (например: какие заказы принадлежат этому
покупателю); однако запрос, направленный вверх по иерархии,
более сложен (например: какой покупатель поместил этот заказ).
Трудно также представить неиерархические данные при использовании этой модели.
Иерархической базой данных является файловая система,
состоящая из корневого каталога, в котором имеется иерархия
подкаталогов и файлов.
Основными информационными единицами в иерархиче-
ской модели данных являются сегмент и поле. Поле данных
определяется как наименьшая неделимая единица данных, доступная пользователю. Для сегмента определяются тип сегмента
и экземпляр сегмента. Экземпляр сегмента образуется из конкретных значений полей данных. Тип сегмента — это поименованная совокупность входящих в него типов полей данных.
Как и сетевая, иерархическая модель данных базируется на
графовой форме построения данных, и на концептуальном уровне она является просто частным случаем сетевой модели данных.
В иерархической модели данных вершине графа соответствует
125

Лекция 8
тип сегмента или просто сегмент, а дугам — типы связей «предок—потомок». В иерархических структуpax сегмент-потомок
должен иметь в точности одного предка.
Иерархическая модель представляет собой связный неориентированный граф древовидной структуры, объединяющий
сегменты. Иерархическая БД состоит из упорядоченного набора
деревьев.
Объектно-ориентированная база данных (ООБД) — база данных, в которой данные моделируются в виде объектов, их атрибутов, методов и классов. Объектно-ориентированные базы данных рекомендованы в первую очередь для тех случаев, когда
требуется высокопроизводительная обработка данных, имеющих
сложную структуру. В манифесте ООБД предлагаются обязательные характеристики, которым должна отвечать любая ООБД. Их
выбор основан на 2 критериях: система должна быть объектно-ориентированной и представлять собой базу данных.
Обязательные характеристики ООБД:
1. Поддержка сложных объектов. В системе должна быть
предусмотрена возможность создания составных объектов за счет
применения конструкторов составных объектов. Необходимо,
чтобы конструкторы объектов были ортогональны, то есть чтобы
любой конструктор можно было применять к любому объекту.
2. Поддержка индивидуальности объектов. Все объекты
должны иметь уникальный идентификатор, который не зависит
от значений их атрибутов.
3. Поддержка инкапсуляции. Корректная инкапсуляция достигается за счет того, что программисты обладают правом доступа только к спецификации интерфейса методов, а данные и
реализация методов скрыты внутри объектов.
4. Поддержка типов и классов. Требуется, чтобы в ООБД
поддерживалась хотя бы одна концепция различия между типами и классами. (Термин «тип» в большей степени соответствует
понятию абстрактного типа данных. В языках программирования переменная объявляется с указанием ее типа. Компилятор
может использовать эту информацию для проверки выполняемых с переменной операций на совместимость с ее типом, что
позволяет гарантировать корректность программного обеспечения. С другой стороны, класс является неким шаблоном для создания объектов и предоставляет методы, которые могут применяться к этим объектам. Таким образом, понятие «класс»
126

Базы данных и системы управления базами данных в АСФР
в большей степени относится ко времени исполнения, чем ко
времени компиляции.)
5. Поддержка наследования типов и классов от их предков.
Подтип и подкласс должны наследовать атрибуты и методы от
своих супертипа и суперкласса соответственно.
6. Перегрузка в сочетании с полным связыванием. Методы
должны применяться к объектам разных типов. Реализация метода должна зависеть от типа объектов, к которым данный метод
применяется. Для обеспечения этой функциональности связывание имен методов в системе не должно выполняться до времени
выполнения программы.
7. Вычислительная полнота. Язык манипулирования данными должен быть языком программирования общего назначения.
8. Набор типов данных должен быть расширяемым. Пользователь должен иметь средства создания новых типов данных на
основе набора предопределенных системных типов. Более того,
между способами использования системных и пользовательских
типов данных не должно быть никаких различий.
Необязательные характеристики:
• множественное наследование;
• проверка типов;
• распределение;
• проектные транзакции.
Открытые характеристики:
• парадигмы программирования (процедурное, декларативное);
• система представления;
• система типов;
• однородность;
• реализация — язык программирования — интерфейс.
Реляционная модель данных (РМД) — логическая модель дан-
ных, прикладная теория построения баз данных, которая является приложением к задачам обработки данных таких разделов математики, как теория множеств и логика первого порядка.
Для работы с реляционными БД применяют реляционные
СУБД. Реляционная база данных — база данных, основанная на
реляционной модели данных.
Реляционная модель данных включает следующие компоненты:
• структурный аспект (составляющая) — данные в базе дан-
ных представляют собой набор отношений;
127

Лекция 8
• аспект (составляющая) целостности — отношения (таблицы) отвечают определенным условиям целостности. РМД поддерживает декларативные ограничения целостности уровня домена (типа данных), уровня отношения и уровня базы данных;
• аспект (составляющая) обработки (манипулирования) —
РМД поддерживает операторы манипулирования отношениями
(реляционная алгебра, реляционное исчисление).
Кроме того, в состав реляционной модели данных включают
теорию нормализации.
Термин «реляционный» означает, что теория основана на
математическом понятии «отношение» (relation). В качестве неформального синонима к термину «отношение» часто используется
слово «таблица». Необходимо помнить, что «таблица» есть понятие нестрогое и неформальное и зачастую им обозначается не
«отношение» как абстрактное понятие, а визуальное представление отношения на бумаге или экране. Некорректное и нестрогое
использование термина «таблица» вместо термина «отношение»
нередко приводит к недопониманию. Наиболее распространенная ошибка состоит в рассуждениях о том, что РМД имеет дело
с «плоскими», или «двумерными», таблицами, тогда как таковыми могут быть только визуальные представления таблиц. Отношения же являются абстракциями, они не могут быть ни «плоскими», ни «неплоскими».
Для лучшего понимания РМД следует отметить три важных
обстоятельства:
• модель является логической, то есть отношения являются
логическими (абстрактными), а не физическими (хранимыми)
структурами;
• для реляционных баз данных верен информационный
принцип: все информационное наполнение базы данных представлено одним и только одним способом, а именно — явным
заданием значений атрибутов в кортежах отношений; в частности, нет никаких указателей (адресов), связывающих одно значение с другим;
• наличие реляционной алгебры позволяет реализовать декларативное программирование и декларативное описание ограничений целостности, в дополнение к навигационному (процедурному) программированию и процедурной проверке условий.
Наиболее известными альтернативами реляционной модели
являются иерархическая модель и сетевая модель. Некоторые
системы, использующие эти старые архитектуры, применяются
128

Базы данных и системы управления базами данных в АСФР
до сих пор. Кроме того, можно упомянуть об объектно-ориентированной модели, на которой строятся так называемые объектно-ориентированные СУБД, хотя однозначного и общепринятого
определения такой модели нет.
Сетевая модель данных — логическая модель данных, являющаяся расширением иерархического подхода, строгая математическая теория, описывающая структурный аспект, аспект целостности и аспект обработки данных в сетевых базах данных.
Прежде чем перейти к описанию сетевой базы данных, чтобы иметь представление о том, с чем нам предстоит иметь дело,
следует разобраться со словом «сети», которое присутствует в названии: «сетевая модель». Сети — это естественный способ представления отношений между объектами базы данных и связей
между этими объектами. Под словом «объекты» следует понимать таблицы баз данных или сущности. В общем, как вам удобно, так и называйте, вас везде поймут правильно.
Сетевые базы данных опираются на математику графов.
Если говорить конкретнее, сетевую модель данных можно представить в виде ориентированного графа. Направленный граф состоит из узлов и ребер. Узлы направленного графа — это не что
иное, как объекты сетевой базы данных, а ребра такого графа
отображают связи между объектами сетевой модели данных,
причем ребра показывают не только саму связь, но и тип связи
(связь «один к одному» или связь «один ко многим»; см. рис.).
Сетевые базы данных имеют достаточно простую структуру,
во всяком случае, сетевая модель имеет более простую структуру,
нежели реляционная модель. Структура сетевых баз данных состоит из четырех компонентов, то есть в сетевой модели используют четыре типа структур данных, два из которых являются
главными и два, если можно так сказать, неглавными. Главные
129

Лекция 8
типы структур сетевых данных — это запись и набор. Вспомогательные типы структур сетевой модели данных, которые используются для построения главных структур, — это элемент данных
и агрегат данных.
Стоит отметить, что иерархическая модель баз данных является частным и упрощенным случаем сетевых баз данных. Разница между иерархической моделью данных и сетевой состоит в
том, что в иерархических структурах запись-потомок должна
иметь в точности одного предка, а в сетевой структуре у потомка
может иметься любое число предков.
Сетевая БД состоит из набора экземпляров определенного
типа записи и набора экземпляров определенного типа связей
между этими записями. Тип связи определяется для двух типов
записи: предка и потомка. Экземпляр типа связи состоит из одного экземпляра типа записи предка и упорядоченного набора
экземпляров типа записи потомка. Для данного типа связи L
с типом записи предка P и типом записи потомка C должны выполняться следующие два условия:
• каждый экземпляр типа записи P является предком только
в одном экземпляре типа связи L;
• каждый экземпляр типа записи C является потомком не
более чем в одном экземпляре типа связи L.
Функциональная модель данных — концепция, лежащая в основе многих вопросов, связанных с реляционными базами данных, включая, в частности, их проектирование. Математически
представляет бинарное отношение между множествами атрибутов данного отношения и является, по сути, связью типа «один
ко многим». Использование функциональной модели данных
обусловлено тем, что она позволяет формально и строго решить
многие проблемы.
8.3. Системы управления базами данных АСФР: общая
характеристика, основные понятия и определения
Система управления базами данных (СУБД) — совокупность
программных и лингвистических средств общего или специального назначения, обеспечивающих управление созданием и использованием баз данных
1
ГОСТ Р ИСО/МЭК ТО 10032—2007: Эталонная модель управления данными.
1
.
130
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
