Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Современные информационные технологии. Учебное пособие
.pdf
2.6. Контрольные вопросы
1. Что такое организационная структура и состав предприятия?
2. Какие могут быть уровни управления предприятием?
3. Какие цели имеют составные части предприятия?
4. Как вы представляете функциональную структуру и состав предприятия?
5. Что такое процесс функционирования предприятия?
6. На сколько и какие циклы делится процесс управления предприятием?
7. Чем похожи и чем отличаются друг от друга предприятия?
8. Какие и кем обрабатываются данные при выполнении операции прогно-
зирования?
9. Кто и какие данные обрабатывает при выполнении операции принятия
решения?
10. Кем и какие данные обрабатываются при планировании?
11. Кто и какие данные обрабатывает при оперативном управлении?
12. Что представляют собой информационный, материальный и энергети-
ческий потоки в технологическом процессе?
13. Дайте определение информационным технологиям и процессам.
14. Приведите классификацию информационных технологий.
15. Какие информационные технологии можно отнести к функционально-
ориентированным технологиям?
16. Состав проблемно-ориентированных информационных технологий?
17. Расскажите о предметно-ориентированных информационных техноло-
гиях и их составе.
18. Какое применение на практике нашли проблемно-ориентированные
технологии?
19. Приведите примеры использования предметно-ориентированных ин-
формационных технологий.
51

3. ЗАДАЧИ АНАЛИЗА ДАННЫХ
В основе ряда методов построения моделей лежит набор данных, который
описывает исследуемые объекты или процессы и отражает их свойства и закономерности. Такой набор данных называется выборкой.
При формировании обучающей выборки неизбежно возникает вопрос о
числе примеров в ней. Чаще говорят не о количестве примеров, а о репрезен-
тативности выборки в целом. Под репрезентативностью понимается, насколько хорошо обучающая выборка отражает закономерности, которые модель
должна выявлять после обучения. Примеры обучающей выборки должны содержать как можно больше возможных комбинаций «вход – выход», а сама выборка – удовлетворять определенным критериям качества данных, то есть в ней
не должно быть дублирующих, противоречивых и недостоверных примеров.
При обработке данных следует стремиться к получению новых знаний,
которые, например, описывают связи между признаками исследуемого объекта,
позволяют предсказывать значения одних признаков на основе других и пр.
Знания являются отражением одной из сторон объективной действительности,
выраженной в виде понятий, представлений, зависимостей, алгоритмов и т. п.
Можно выделить пять типов задач анализа данных, связанных с получением нового знания.
Классификация – это отнесение объектов к одному из заранее известных
классов. На выходе алгоритма классификации получают переменные дискретного типа, называемые классом. Множество классов, к которым может быть отнесен объект, известно заранее. Решение задачи классификации сводится к определению типа объекта по его входным характеристикам. Например, при отнесении нового товара к той или иной товарной группе, отнесении клиента к какой-либо категории (при кредитовании – отнесение клиента по каким-то признакам к одной из групп риска), при исследовании работы сложной технической системы – отнесение ее к одному из устойчивых состояний, при поиске
музейного образца – определение его принадлежности к определенному типу
изделий.
Регрессия – это установление зависимости непрерывной выходной переменной от входных переменных. К задаче регрессии сводится, в частности,
прогнозирование временного ряда на основе исторических данных. Например,
в задаче прогнозирования зависимая величина – объемы продаж, а факторами,
влияющими на нее, могут быть предыдущие объемы продаж, изменение курса
валют, активность конкурентов и т. д. Или, например, при кредитовании физических лиц вероятность возврата кредита зависит от личных характеристик человека, сферы его деятельности, наличия имущества.
Кластеризация – это группировка объектов (наблюдений, событий) на
основе данных, описывающих свойства объектов. Объекты внутри кластера
должны быть похожими друг на друга и отличаться от других, которые вошли в
другие кластеры. Для объяснения образовавшихся кластеров необходима их
дополнительная интерпретация.
52

При достаточно большом количестве клиентов становится трудно подходить к каждому индивидуально, поэтому их удобно объединять в группы с однородными признаками. После кластеризации можно узнать, какие группы
наиболее активны, какие приносят наибольшую прибыль, выделить характерные для них признаки.
Ассоциация – выявление закономерностей между связанными событиями.
Примером такой закономерности служит правило, указывающее, что из события X следует событие Y. Такие правила называются ассоциативными. Ассоциации помогают выявлять совместно приобретаемые товары. Это может быть
полезно для более удобного размещения товара на прилавках, стимулирования
продаж.
Последовательные шаблоны – установление закономерностей между связанными во времени событиями. Примером такой закономерности служит правило, указывающее, что из события X спустя время t последует событие Y.
Последовательные шаблоны могут использоваться при планировании
продаж или предоставления услуг. Они похожи на ассоциации, но в анализе добавляется временной показатель, то есть важна последовательность совершения
операций. Например, если заемщик взял потребительский кредит, то с вероятностью 60 % через полгода он оформит кредитную карту. Ассоциации и последовательные шаблоны иногда объединяют в одну задачу, называемую анализом
связей (link analysis).
53

),...,(
1 p
XXX
),...,(
1 q
YYY
Исследуемый
объект
X1
X2
Xp
Y1
Y2
Yq
1
2
q
),...,(
1 q
εfY ),...,(
1 p
XX
),...,(
1 p
XXfY
4. АНАЛИЗ ДАННЫХ ПРИ ПРЕДСКАЗАНИИ КОЛИЧЕСТВЕННОЙ
ПЕРЕМЕННОЙ
4.1. Общая схема объекта исследования
Функционирование реальных объектов или систем процессов обычно
описывается набором переменных (признаков). Обозначим контролируемые
входные переменные или признаки через
(рис. 4.1). В различ-
ных моделях исследования их называют независимыми переменными, факторами или предикторами (т. е. предсказателями). Факторами могут выступать,
например, характеристики материалов, параметры технологических процессов,
экономические показатели. Результат функционирования характеризуют вы-
ходные переменные
, например, физические и химические свой-
ства производимого продукта или технико-экономические показатели процесса.
Их называют зависимыми переменными или откликами. Часто отклик является
целевой функцией оптимизации, которую требуется максимизировать или минимизировать.
Рис. 4.1. Общая схема объекта исследования
Случайные компоненты
отражают влияние неучтенных на
“входе” факторов, например, изменение характеристик оборудования вследствие износа, присутствие случайных примесей, а также случайные ошибки в
измерении Y. Это неконтролируемые возмущения, которые не могут быть измерены. На практике возмущения чаще всего воздействуют на исследуемую зависимость аддитивно:
.
Конечной целью статистического исследования зависимостей является
построение математической модели объекта
,
54

),(
ii
YX
n,1
),...,(
1 p
XXf
q1
Y,,...Y
p1
X,...,X
)X,X(fY
21
которое осуществляется по результатам n измерений входных и выходных переменных
, i =
таким образом, чтобы q-мерная функция отклика
позволяла наилучшим образом восстанавливать значения выходных переменных
менных
. Таким образом, по отдельным, частным наблюдениям, ре-
по заданным измеренным значениям входных пере-
шая статистическую задачу многомерной аппроксимации, необходимо описать
общую закономерность. Так, при p = 2, q = 1 моделью объекта будет функция
двух переменных
, которая в пространстве (Y, X1, X2) аппрокси-
мирует результаты измерений какой-то поверхностью.
По размерности отклика различают скалярные (одномерные) и векторные
(многомерные, многоканальные) модели. В пособии рассматриваются в основном модели первого вида.
4.2. Типы признаков (переменных)
Исследуемые переменные (признаки) по виду шкалы принимаемых значений подразделяются на количественные, порядковые и классификационные.
Количественные признаки измеряются либо в непрерывной шкале, напри-
мер, температура, длина, либо в интервальной или дискретной шкале – когда о
их величине судят по попаданию наблюдения в определенный диапазон (интервал) значений, например, измерение времени при усадке материала с точностью
до недели.
Порядковые (ординальные) признаки не поддаются количественной оценке. Реальным содержание их измерений является тот порядок, в котором выстраиваются объекты по степени выраженности измеряемого признака. Например, уровни музыкальных и математических способностей учащихся; двигательные и умственные способности детей. На сколько или во сколько раз признак более выражен не имеет значения, действительны лишь операции типа ">,
<". Так, эксперт, учитель или экзаменатор выставляет тестовый балл, например, по времени, затраченному на выполнение задания. Нельзя утверждать, что
ребенок, получивший четверку, имеет двигательные способности на единицу
лучше, чем ребенок, получивший тройку. Для умений, знаний, способностей
нет единицы измерения. Можно утверждать лишь, что первый ребенок более
ловок, чем второй.
Содержанием измерений классификационных (номинальных) признаков
являются лишь соотношения типа x = c или x c; x (a, b) или x (a, b). Взаимный порядок здесь уже не имеет значения. Каждый признак делит группу исследуемых объектов на подгруппы. Например, при обработке социологических
анкет признак пола разделяет людей на мужчин и женщин; профессия имеет
уже большее число наименований. Для классификации цветов и оттенков в
текстильной промышленности, в полиграфии используются альбомы с цветовыми образцами (в России – каталог стандартизованных цветов "Радуга", в
США – Pantone). Цвет указывается по соответствующему номеру.
55

Для обеспечения численного представления качественных свойств номинальные и порядковые переменные преобразуют к бинарному типу. Для этого
вводятся новые бинарные переменные, соответствующие категориям или уровням значений исходных признаков. Например, для признака “цвет”, имеющего
4 дискретных уровня (“белый”, “серый”, “красный”, “пестрядинный”), потребуется создать четыре новых переменных (“белый цвет”, “серый цвет” и др.), которые будут принимать значения 0 или 1. В ряде работ показано, что такие признаки можно обрабатывать как количественные и вместе с ними. Вычисления
можно проводить по формулам для количественных признаков с использованием евклидовой метрики, пользуясь стандартными статистическими пакетами.
Такие фиктивные признаки (dummy), со значениями “0” или “1”, позволяют в дальнейшем интерпретировать частные коэффициенты регрессии для
любой бинарной переменной (дихотомии) так же, как это делается в случае измерения по количественной шкале.
При подготовке к анализу фиктивных переменных указывается на одну
меньше, чем имеется категорий в исходной переменной – обычно не включается в рассмотрение дихотомия для той категории, в которой имеется наименьшее
количество наблюдений. Это связано с тем, что, например, при трех категориях
значения третьей фиктивной переменной будут точной линейной функцией
двух других, нарушится условие об отсутствии мультиколлинеарных связей, и
однозначный подсчет коэффициентов регрессии станет невозможным.
4.3. Модели зависимостей между количественными переменными
Модель взаимосвязи определяется природой анализируемых переменных
Y и X.
Функциональные зависимости y = f(x) имеют место при исследовании свя-
зей между неслучайными переменными. Значения y зависят только от соответ-
ствующих значений x1, x2, ... , xp и полностью ими определяются. В этом случае
нет необходимости использовать статистические методы анализа данных.
Стохастические зависимости возникают в следующих случаях:
1) значения входных и выходных переменных флюктуируют случайным
(но взаимосвязанным) образом около установленных номиналов;
2) переменные Y и X измеряются с некоторой случайной ошибкой;
3) влиянием помимо факторов X1, ..., Xp еще и ряда неконтролируемых
(неучтенных) факторов.
4.4. Этапы статистического анализа
Основные этапы при проведении статистического анализа представлены
на рис. 4.2. Коротко рассмотрим их.
56

Содержательный анализ
Составление плана сбора исходных
данных
Получение исходных данных
Первичная статистическая обработка
Дисперсионный
анализ
Корреляционный
анализ
Регрессионный
анализ
Интерпретация результатов
Построение и анализ статистических зависимостей
)(fy X
)X ,...,(X
p1
X
Рис. 4.2. Этапы статистического анализа
1. Содержательный анализ исследуемого объекта или системы. На этом
этапе определяется набор входных и выходных параметров (X1, ... , Xp ; Y1, ... , Yq ).
2. Cоставление плана сбора исходных данных – значений входных пере-
менных (X1, ... , Xp ), числа наблюдений n. Этот этап выполняется при активном
планировании эксперимента.
3. Получение исходных данных (статистического материала) и ввод их в
компьютер. На этом этапе формируются массивы чисел (x1i,..., xpi; y1i,..., yqi),
i=1,...,n, где n – объем выборки.
4. Первичная статистическая обработка данных. На данном этапе фор-
мируется статистическое описание рассматриваемых параметров.
5. Построение и анализ статистических зависимостей
5.1. Дисперсионный анализ используется для оценивания влияния на от-
клик Y неколичественных факторов (X1,..., Xp ) с целью выбрать среди них
наиболее важные (существенные).
5.2. Корреляционный анализ предназначен для оценивания значимости
влияния факторов (X1,..., Xp) на отклик Y (будем рассматривать случай q = 1).
5.3. Регрессионный анализ предназначен для определения аналитической
зависимости отклика
от количественных факторов X из входного
набора (X1,..., Xp ),
6. Анализ временных рядов используется, если фактором является «вре-
мя». Он основан на моделях авторегрессионных зависимостей.
В целом этапы п. 5 могут выполняться в итерационной последовательности.
7. Интерпретация результатов в терминах поставленной задачи.
(случай q = 1).
57

4.5. Практическое задание: подготовка данных
Подобрать исходные данные для многомерного анализа. Дать описание
предметной области, объекта (процесса) исследования, перечислить названия
входных и выходной переменной и привести их обозначения. Массив “объекты–свойства” подготовить в MS Excel. Он должен описывать в каждой строке
значения признаков объектов обучающей выборки. Заголовками столбцов являются обозначения входных признаков X1, X2, … и выходной переменной Y.
Номинальные и порядковые переменные преобразовать к бинарному типу. Исключить избыточные фиктивные переменные.
58

2
2
2
)x(
exp
2
1
)x(f
),(N~X
2
f(x)
1
1
2
2
0 x
)3,3(
5. ПЕРВИЧНАЯ СТАТИСТИЧЕСКАЯ ОБРАБОТКА
5.1. Наглядные методы представления выборок
Нормальное распределение (закон Гаусса) – наиболее часто встречающийся на практике вид распределения:
Подчинение случайной величины X нормальному закону кратко обозна-
.
чается как
.
Графики функции f(x) имеют колоколообразную форму (рис. 5.1), причем
x = – ось симметрии, – расстояние от этой оси до точки перегиба. Если
мало, то кривая высокая и заостренная; если велико, то она широкая и плоская. Математическое ожидание является параметром положения графика
вдоль оси Х, а стандартное отклонение – параметром разброса х относительно
μ.
Рис. 5.1. Кривые нормального распределения, σ2 > σ1
Широкое распространение нормального закона объясняется тем, что на
практике очень часто возникают условия, при которых нормальное распределение становится справедливым. Так ему подчиняются отклонения размеров изготавливаемых изделий от номинального, показатели прочности сырья, его неравномерность, измерения длины, плотности, объема, массы и другие величины, на которые воздействует большое количество независимых случайных факторов, среди которых нет сильно выделяющихся. Реже подчиняются законам
нормального распределения данные в экономике - цены, ставки заработной
платы, товарооборот.
График плотности нормального распределения имеет хвосты бесконечной
длины, чего не бывает в случае реальных данных. В интервале
площадь, ограниченная графиком f(x), составляет 99.73 %. Отсюда следует так
59

),(N
2
)3,3(
3
2
x
exp
2
1
)x(f
2
x
dx)x(f
называемое правило трех сигм: нормальная случайная величина
вероятностью 0.9973 попадает в интервал
отклонение x от практически не превосходит
.
, иными словами,
с
Распределение с параметрами = 0, = 1, или Х ~ N(0,1), называется
стандартным нормальным распределением, т. е. центрированным и нормиро-
ванным. Его плотность
,
функция распределения
F(x)=Ф(x)=
.
Чаще всего для наглядного описания выборок исходных данных используются гистограммы и полигоны.
Для построения гистограммы определяются:
1) размах варьирования R= x
max
– x
min
;
2) число интервалов группировки K (иногда используется эмпирическая
формула Стэрджеса K = 1 + 3.32lg n с округлением до ближайшего целого);
3) длина интервалов группировки l = R/K;
4) частоты ni, т.е. число элементов вариационного ряда, попавших в ин-
тервалы (x
, xi), здесь i = 1,...,K, x0 = x
i-1
, xi = x
min
+ l, xk x
i-1
max
;
5) относительные частоты ni / n.
Гистограммой называется графическое изображение зависимости частот
ni (или относительных частот ni / n) попадания элементов выборки от соответствующего интервала группировки в виде ступенчатой функции.
Изображение гистограммы для замеров обхвата груди школьников при
К =13 показано на рис. 5.2.
60
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
