Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Современные информационные технологии. Учебное пособие

.pdf
Скачиваний:
0
Добавлен:
07.09.2026
Размер:
2 Мб
Скачать
☆
2.6. Контрольные вопросы
1. Что такое организационная структура и состав предприятия?
2. Какие могут быть уровни управления предприятием?
3. Какие цели имеют составные части предприятия?
4. Как вы представляете функциональную структуру и состав предприятия?
5. Что такое процесс функционирования предприятия?
6. На сколько и какие циклы делится процесс управления предприятием?
7. Чем похожи и чем отличаются друг от друга предприятия?
8. Какие и кем обрабатываются данные при выполнении операции прогно-
зирования?
9. Кто и какие данные обрабатывает при выполнении операции принятия
решения?
10. Кем и какие данные обрабатываются при планировании?
11. Кто и какие данные обрабатывает при оперативном управлении?
12. Что представляют собой информационный, материальный и энергети-
ческий потоки в технологическом процессе?
13. Дайте определение информационным технологиям и процессам.
14. Приведите классификацию информационных технологий.
15. Какие информационные технологии можно отнести к функционально-
ориентированным технологиям?
16. Состав проблемно-ориентированных информационных технологий?
17. Расскажите о предметно-ориентированных информационных техноло-
гиях и их составе.
18. Какое применение на практике нашли проблемно-ориентированные
технологии?
19. Приведите примеры использования предметно-ориентированных ин-
формационных технологий.
51
3. ЗАДАЧИ АНАЛИЗА ДАННЫХ
В основе ряда методов построения моделей лежит набор данных, который описывает исследуемые объекты или процессы и отражает их свойства и зако­номерности. Такой набор данных называется выборкой.
При формировании обучающей выборки неизбежно возникает вопрос о числе примеров в ней. Чаще говорят не о количестве примеров, а о репрезен- тативности выборки в целом. Под репрезентативностью понимается, насколь­ко хорошо обучающая выборка отражает закономерности, которые модель должна выявлять после обучения. Примеры обучающей выборки должны со­держать как можно больше возможных комбинаций «вход – выход», а сама вы­борка – удовлетворять определенным критериям качества данных, то есть в ней не должно быть дублирующих, противоречивых и недостоверных примеров.
При обработке данных следует стремиться к получению новых знаний, которые, например, описывают связи между признаками исследуемого объекта, позволяют предсказывать значения одних признаков на основе других и пр. Знания являются отражением одной из сторон объективной действительности, выраженной в виде понятий, представлений, зависимостей, алгоритмов и т. п.
Можно выделить пять типов задач анализа данных, связанных с получе­нием нового знания.
Классификация – это отнесение объектов к одному из заранее известных классов. На выходе алгоритма классификации получают переменные дискрет­ного типа, называемые классом. Множество классов, к которым может быть от­несен объект, известно заранее. Решение задачи классификации сводится к оп­ределению типа объекта по его входным характеристикам. Например, при отне­сении нового товара к той или иной товарной группе, отнесении клиента к ка­кой-либо категории (при кредитовании – отнесение клиента по каким-то при­знакам к одной из групп риска), при исследовании работы сложной техниче­ской системы – отнесение ее к одному из устойчивых состояний, при поиске музейного образца – определение его принадлежности к определенному типу изделий.
Регрессия – это установление зависимости непрерывной выходной пере­менной от входных переменных. К задаче регрессии сводится, в частности, прогнозирование временного ряда на основе исторических данных. Например, в задаче прогнозирования зависимая величина – объемы продаж, а факторами, влияющими на нее, могут быть предыдущие объемы продаж, изменение курса валют, активность конкурентов и т. д. Или, например, при кредитовании физи­ческих лиц вероятность возврата кредита зависит от личных характеристик че­ловека, сферы его деятельности, наличия имущества.
Кластеризация – это группировка объектов (наблюдений, событий) на основе данных, описывающих свойства объектов. Объекты внутри кластера должны быть похожими друг на друга и отличаться от других, которые вошли в другие кластеры. Для объяснения образовавшихся кластеров необходима их дополнительная интерпретация.
52
При достаточно большом количестве клиентов становится трудно подхо­дить к каждому индивидуально, поэтому их удобно объединять в группы с од­нородными признаками. После кластеризации можно узнать, какие группы наиболее активны, какие приносят наибольшую прибыль, выделить характер­ные для них признаки.
Ассоциация – выявление закономерностей между связанными событиями. Примером такой закономерности служит правило, указывающее, что из собы­тия X следует событие Y. Такие правила называются ассоциативными. Ассо­циации помогают выявлять совместно приобретаемые товары. Это может быть полезно для более удобного размещения товара на прилавках, стимулирования продаж.
Последовательные шаблоны – установление закономерностей между свя­занными во времени событиями. Примером такой закономерности служит пра­вило, указывающее, что из события X спустя время t последует событие Y.
Последовательные шаблоны могут использоваться при планировании продаж или предоставления услуг. Они похожи на ассоциации, но в анализе до­бавляется временной показатель, то есть важна последовательность совершения операций. Например, если заемщик взял потребительский кредит, то с вероят­ностью 60 % через полгода он оформит кредитную карту. Ассоциации и после­довательные шаблоны иногда объединяют в одну задачу, называемую анализом связей (link analysis).
53
),...,(
1 p
XXX
),...,(
1 q
YYY
Исследуемый
объект
X1
X2
Xp
Y1
Y2
Yq
1
2
q
),...,(
1 q
εfY ),...,(
1 p
XX
),...,(
1 p
XXfY
4. АНАЛИЗ ДАННЫХ ПРИ ПРЕДСКАЗАНИИ КОЛИЧЕСТВЕННОЙ
ПЕРЕМЕННОЙ
4.1. Общая схема объекта исследования
Функционирование реальных объектов или систем процессов обычно описывается набором переменных (признаков). Обозначим контролируемые
входные переменные или признаки через
(рис. 4.1). В различ-
ных моделях исследования их называют независимыми переменными, факто­рами или предикторами (т. е. предсказателями). Факторами могут выступать,
например, характеристики материалов, параметры технологических процессов, экономические показатели. Результат функционирования характеризуют вы- ходные переменные
, например, физические и химические свой-
ства производимого продукта или технико-экономические показатели процесса. Их называют зависимыми переменными или откликами. Часто отклик является целевой функцией оптимизации, которую требуется максимизировать или ми­нимизировать.
Рис. 4.1. Общая схема объекта исследования
Случайные компоненты
отражают влияние неучтенных на
“входе” факторов, например, изменение характеристик оборудования вслед­ствие износа, присутствие случайных примесей, а также случайные ошибки в измерении Y. Это неконтролируемые возмущения, которые не могут быть из­мерены. На практике возмущения чаще всего воздействуют на исследуемую за­висимость аддитивно:
.
Конечной целью статистического исследования зависимостей является построение математической модели объекта
,
54
),(
ii
YX
n,1
),...,(
1 p
XXf
q1
Y,,...Y
p1
X,...,X
)X,X(fY
21
которое осуществляется по результатам n измерений входных и выходных пе­ременных
, i =
таким образом, чтобы q-мерная функция отклика
позволяла наилучшим образом восстанавливать значения выход­ных переменных менных
. Таким образом, по отдельным, частным наблюдениям, ре-
по заданным измеренным значениям входных пере-
шая статистическую задачу многомерной аппроксимации, необходимо описать общую закономерность. Так, при p = 2, q = 1 моделью объекта будет функция двух переменных
, которая в пространстве (Y, X1, X2) аппрокси-
мирует результаты измерений какой-то поверхностью.
По размерности отклика различают скалярные (одномерные) и векторные (многомерные, многоканальные) модели. В пособии рассматриваются в основ­ном модели первого вида.
4.2. Типы признаков (переменных)
Исследуемые переменные (признаки) по виду шкалы принимаемых значе­ний подразделяются на количественные, порядковые и классификационные.
Количественные признаки измеряются либо в непрерывной шкале, напри-
мер, температура, длина, либо в интервальной или дискретной шкале – когда о их величине судят по попаданию наблюдения в определенный диапазон (интер­вал) значений, например, измерение времени при усадке материала с точностью до недели.
Порядковые (ординальные) признаки не поддаются количественной оцен­ке. Реальным содержание их измерений является тот порядок, в котором вы­страиваются объекты по степени выраженности измеряемого признака. Напри­мер, уровни музыкальных и математических способностей учащихся; двига­тельные и умственные способности детей. На сколько или во сколько раз при­знак более выражен не имеет значения, действительны лишь операции типа ">, <". Так, эксперт, учитель или экзаменатор выставляет тестовый балл, напри­мер, по времени, затраченному на выполнение задания. Нельзя утверждать, что ребенок, получивший четверку, имеет двигательные способности на единицу лучше, чем ребенок, получивший тройку. Для умений, знаний, способностей нет единицы измерения. Можно утверждать лишь, что первый ребенок более ловок, чем второй.
Содержанием измерений классификационных (номинальных) признаков являются лишь соотношения типа x = c или x  c; x (a, b) или x  (a, b). Вза­имный порядок здесь уже не имеет значения. Каждый признак делит группу ис­следуемых объектов на подгруппы. Например, при обработке социологических анкет признак пола разделяет людей на мужчин и женщин; профессия имеет уже большее число наименований. Для классификации цветов и оттенков в текстильной промышленности, в полиграфии используются альбомы с цвето­выми образцами (в России – каталог стандартизованных цветов "Радуга", в США – Pantone). Цвет указывается по соответствующему номеру.
55
Для обеспечения численного представления качественных свойств номи­нальные и порядковые переменные преобразуют к бинарному типу. Для этого вводятся новые бинарные переменные, соответствующие категориям или уров­ням значений исходных признаков. Например, для признака “цвет”, имеющего 4 дискретных уровня (“белый”, “серый”, “красный”, “пестрядинный”), потребу­ется создать четыре новых переменных (“белый цвет”, “серый цвет” и др.), ко­торые будут принимать значения 0 или 1. В ряде работ показано, что такие при­знаки можно обрабатывать как количественные и вместе с ними. Вычисления можно проводить по формулам для количественных признаков с использовани­ем евклидовой метрики, пользуясь стандартными статистическими пакетами.
Такие фиктивные признаки (dummy), со значениями “0” или “1”, позво­ляют в дальнейшем интерпретировать частные коэффициенты регрессии для любой бинарной переменной (дихотомии) так же, как это делается в случае из­мерения по количественной шкале.
При подготовке к анализу фиктивных переменных указывается на одну меньше, чем имеется категорий в исходной переменной – обычно не включает­ся в рассмотрение дихотомия для той категории, в которой имеется наименьшее количество наблюдений. Это связано с тем, что, например, при трех категориях значения третьей фиктивной переменной будут точной линейной функцией двух других, нарушится условие об отсутствии мультиколлинеарных связей, и однозначный подсчет коэффициентов регрессии станет невозможным.
4.3. Модели зависимостей между количественными переменными
Модель взаимосвязи определяется природой анализируемых переменных Y и X.
Функциональные зависимости y = f(x) имеют место при исследовании свя- зей между неслучайными переменными. Значения y зависят только от соответ-
ствующих значений x1, x2, ... , xp и полностью ими определяются. В этом случае нет необходимости использовать статистические методы анализа данных.
Стохастические зависимости возникают в следующих случаях:
1) значения входных и выходных переменных флюктуируют случайным
(но взаимосвязанным) образом около установленных номиналов;
2) переменные Y и X измеряются с некоторой случайной ошибкой;
3) влиянием помимо факторов X1, ..., Xp еще и ряда неконтролируемых
(неучтенных) факторов.
4.4. Этапы статистического анализа
Основные этапы при проведении статистического анализа представлены на рис. 4.2. Коротко рассмотрим их.
56
Содержательный анализ
Составление плана сбора исходных
данных
Получение исходных данных
Первичная статистическая обработка
Дисперсионный
анализ
Корреляционный
анализ
Регрессионный
анализ
Интерпретация результатов
Построение и анализ статистических зависимостей
)(fy X
)X ,...,(X
p1
X
Рис. 4.2. Этапы статистического анализа
1. Содержательный анализ исследуемого объекта или системы. На этом
этапе определяется набор входных и выходных параметров (X1, ... , Xp ; Y1, ... , Yq ).
2. Cоставление плана сбора исходных данных – значений входных пере-
менных (X1, ... , Xp ), числа наблюдений n. Этот этап выполняется при активном планировании эксперимента.
3. Получение исходных данных (статистического материала) и ввод их в
компьютер. На этом этапе формируются массивы чисел (x1i,..., xpi; y1i,..., yqi),
i=1,...,n, где n – объем выборки.
4. Первичная статистическая обработка данных. На данном этапе фор-
мируется статистическое описание рассматриваемых параметров.
5. Построение и анализ статистических зависимостей
5.1. Дисперсионный анализ используется для оценивания влияния на от-
клик Y неколичественных факторов (X1,..., Xp ) с целью выбрать среди них наиболее важные (существенные).
5.2. Корреляционный анализ предназначен для оценивания значимости
влияния факторов (X1,..., Xp) на отклик Y (будем рассматривать случай q = 1).
5.3. Регрессионный анализ предназначен для определения аналитической
зависимости отклика
от количественных факторов X из входного
набора (X1,..., Xp ),
6. Анализ временных рядов используется, если фактором является «вре-
мя». Он основан на моделях авторегрессионных зависимостей.
В целом этапы п. 5 могут выполняться в итерационной последовательности.
7. Интерпретация результатов в терминах поставленной задачи.
(случай q = 1).
57
4.5. Практическое задание: подготовка данных
Подобрать исходные данные для многомерного анализа. Дать описание предметной области, объекта (процесса) исследования, перечислить названия входных и выходной переменной и привести их обозначения. Массив “объек­ты–свойства” подготовить в MS Excel. Он должен описывать в каждой строке значения признаков объектов обучающей выборки. Заголовками столбцов яв­ляются обозначения входных признаков X1, X2, … и выходной переменной Y.
Номинальные и порядковые переменные преобразовать к бинарному ти­пу. Исключить избыточные фиктивные переменные.
58
 
 
2
2
2
)x(
exp
2
1
)x(f
),(N~X
2
f(x)
1
1
2
2
0x
)3,3(
5. ПЕРВИЧНАЯ СТАТИСТИЧЕСКАЯ ОБРАБОТКА
5.1. Наглядные методы представления выборок
Нормальное распределение (закон Гаусса) – наиболее часто встречаю­щийся на практике вид распределения:
Подчинение случайной величины X нормальному закону кратко обозна-
.
чается как
.
Графики функции f(x) имеют колоколообразную форму (рис. 5.1), причем x =  – ось симметрии,  – расстояние от этой оси до точки перегиба. Если
мало, то кривая высокая и заостренная; если  велико, то она широкая и плос­кая. Математическое ожидание  является параметром положения графика
вдоль оси Х, а стандартное отклонение – параметром разброса х относительно
μ.
Рис. 5.1. Кривые нормального распределения, σ2 > σ1
Широкое распространение нормального закона объясняется тем, что на практике очень часто возникают условия, при которых нормальное распределе­ние становится справедливым. Так ему подчиняются отклонения размеров из­готавливаемых изделий от номинального, показатели прочности сырья, его не­равномерность, измерения длины, плотности, объема, массы и другие величи­ны, на которые воздействует большое количество независимых случайных фак­торов, среди которых нет сильно выделяющихся. Реже подчиняются законам нормального распределения данные в экономике - цены, ставки заработной платы, товарооборот.
График плотности нормального распределения имеет хвосты бесконечной длины, чего не бывает в случае реальных данных. В интервале
площадь, ограниченная графиком f(x), составляет 99.73 %. Отсюда следует так
59
),(N
2
)3,3(
3
 
 
2
x
exp
2
1
)x(f
2
x
dx)x(f
называемое правило трех сигм: нормальная случайная величина вероятностью 0.9973 попадает в интервал отклонение x от  практически не превосходит
.
, иными словами,
с
Распределение с параметрами  = 0,  = 1, или Х ~ N(0,1), называется стандартным нормальным распределением, т. е. центрированным и нормиро-
ванным. Его плотность
,
функция распределения
F(x)=Ф(x)=
.
Чаще всего для наглядного описания выборок исходных данных исполь­зуются гистограммы и полигоны.
Для построения гистограммы определяются:
1) размах варьирования R= x
max
– x
min
;
2) число интервалов группировки K (иногда используется эмпирическая
формула Стэрджеса K = 1 + 3.32lg n с округлением до ближайшего целого);
3) длина интервалов группировки l = R/K;
4) частоты ni, т.е. число элементов вариационного ряда, попавших в ин-
тервалы (x
, xi), здесь i = 1,...,K, x0 = x
i-1
, xi = x
min
+ l, xk  x
i-1
max
;
5) относительные частоты ni / n.
Гистограммой называется графическое изображение зависимости частот ni (или относительных частот ni / n) попадания элементов выборки от соответ­ствующего интервала группировки в виде ступенчатой функции.
Изображение гистограммы для замеров обхвата груди школьников при
К =13 показано на рис. 5.2.
60
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]