Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Основы научных исследований при разработке энерго- и ресурсосберегающих процессов в химической технологии, нефтехимии и биотехнологии. Учебное пособие
.pdf
при изменении некоторого признака х изменяется среднее значение признака y. Но поскольку среднее значение принадлежит доверительному интервалу, то y может принимать множество значений внутри этого интервала с различными вероятностями.
На рис. 15 приведены графические зависимости, которые иллюстрируют присутствие между переменными корреляционной
связи различных видов (а, б, в) и отсутствие любой связи (г). Качество корреляционной зависимости обратно пропорционально
плотности точек: чем ближе точки на графике лежат друг к другу,
тем меньше дисперсия и тем сильнее корреляционная связь.
у
а б
у
в г
Рис. 15. Корреляционные зависимости [11, с. 58]
у
х
у
х х
х
Ввиду того, что корреляционная связь является подвидом статистической связи, для ее изучения необходим достаточно большой объем данных. Число необходимых наблюдений или опытов,
достаточное для анализа корреляционной связи, зависит от цели
исследований, точности и надежности параметров связи, от количества факторов, корреляция с которыми изучается. Обычно число наблюдений не менее чем в 5–6, а лучше не менее чем в 10 раз
больше числа факторов. Большинство исследований в химии однофакторные, поэтому число испытаний выбирают не менее 5.
121

К о р р е л я ц и я – это признак, учитывающий взаимосвязь
ряда числовых последовательностей. Установить значимость связи между переменными – значит установить корреляцию. При этом
корреляция не может объяснить, почему две переменные связаны
между собой. То есть корреляционная связь показывает тесноту
связи между переменными, но не описывает ее количественно.
Корреляцию изучают с применением корреляционно-регрессионного анализа. Корреляционно-регрессионный анализ учитывает межфакторные связи и дает более полное измерение роли каждого фактора: непосредственное его влияние на результативный признак; его косвенное влияние на другие факторы; влияние всех
факторов на результативный признак.
Существование корреляции между двумя переменными х и y
устанавливают на этапе к о р р е л я ц и о н н о г о а н а л и з а,
который проводят с учетом следующих допущений [12, с. 53]:
переменные Х и Y являются случайными величинами, рас-
пределенными по нормальному закону;
некоторому значению Х можно поставить в соответствие одно
или несколько значений Y;
по данному нормальному распределению случайных величин
Х и Y можно определить выборочное среднее и среднеквадратическое отклонение величин Х и Y.
Р е г р е с с и о н н ы й а н а л и з показывает, что по результатам анализа является фактором, что функцией отклика и каким
уравнением эта связь описывается. Регрессионный анализ используют для прогнозирования одной переменной на основании значений другой. Причем, если между переменными не существует
корреляции, то регрессионный анализ проводить бессмысленно.
Основными допущениями регрессионного анализа являются
следующие [12, с. 46]:
1) переменная Y является случайной величиной, распределен-
ной по нормальному закону;
2) при фиксированном значении Х дисперсия Y постоянна;
3) ошибка в определении переменной Х пренебрежимо мала
по сравнению с ошибкой в определении переменной Y.
122

Корреляционно-регрессионный анализ проводится по следую-
( )( )
,
x x y y
2
( )
x x
2
( )
y y
щему плану:
1. Сбор первичной информации, проверка ее на однородность
и нормальность распределения. Оценку однородности проводят
по коэффициенту вариации V, формула расчета которого приведена
в п. 5.2.3, а нормальность распределения можно проверить по правилу трех сигм.
2. Исключение из массива данных промахов. Для этого можно
использовать различные статистические критерии или правило
трех сигм.
3. Установление наличия и направления корреляционной зависимости между переменными. Для этого используются методы:
параллельного сопоставления рядов результативного и факторного
признака, графического изображения фактических данных с помощью поля корреляции, построения корреляционной таблицы.
На данном этапе можно лишь предварительно оценить наличие
корреляции между переменными.
4. Измерение степени тесноты связи, оценка ее существенности. Для определения степени тесноты парной линейной зависимости пользуются коэффициентом корреляции, который находится
по формуле:
n
i i
1
i
r
( 1)
n s s
x y
где
ния в пределах от –1 до +1. Чем ближе он по абсолютной величине к 1, тем теснее связь. Знак при коэффициенте указывает направление связи: знак «+» соответствует прямой зависимости, знак
«–» – обратной. Если коэффициент корреляции равен нулю, то связи между признаками нет; если он равен единице, то между признаками существует функциональная связь.
n
i
1
i
s
x
1
n
и
s
n
i
1
i
y
n
.
1
Линейный коэффициент корреляции может принимать значе-
123

При этом следует помнить, что коэффициент корреляции по-
...,
казывает наличие взаимосвязи между переменными, но не описывает ее количественную составляющую, т. е. как именно фактор
влияет на функцию отклика. Также коэффициент корреляции является достаточно грубой оценкой тесноты связи. Приведенная формула его определения показывает линейную зависимость между
переменными. В случае, если коэффициент rxy будет иметь низкое
значение, то нельзя сделать однозначный вывод об отсутствии корреляции, возможно, связь просто имеет нелинейный характер и следует рассматривать другую модель.
5. Построение модели связи. Тип модели выбирается на основе сочетания теоретического анализа и исследования эмпирических зависимостей. Чаще всего встречаются следующие типы функций: линейная, гиперболическая, параболическая, показательная.
Зависимость одной случайной величины от значений, которые
принимает другая случайная величина, в статистике называется
р е г р е с с и е й. Если этой зависимости придан аналитический
вид, то такую форму представления называют у р а в н е н и е м
р е г р е с с и и.
Уравнение регрессии еще называют уравнением полинома,
которое в общем виде выглядит следующим образом:
k k
b x b x x b xy b
0
i i ij i j ii i
1 1
i i j i
2
где b0, bi, bij, bii, … – выборочные коэффициенты регрессии, которые можно получить, пользуясь результатами эксперимента. Коэффициенты регрессии показывают, как сильно факторы или их
сочетание влияют на значение функции отклика.
Дисперсионный анализ является одним из методов оценки значимости влияния фактора на величину выходной (зависимой) переменной. Он позволяет оценить вклад одного из факторов на результат испытаний и сравнить его с вкладом ошибок или случайных неучтенных явлений посредством сравнения их дисперсий.
5.3. Дисперсионный анализ
124

Дисперсионный анализ может применяться при обработке ре-
2
( ) ,
х
ij
x x
зультатов как однофакторных, так и многофакторных экспериментов. Причем во втором случае он считается весьма эффективным,
поскольку в отличие от классической постановки многофакторных экспериментов, где варьируются значения одного из факторов
при неизменности других, при дисперсионном анализе каждое наблюдение служит для одновременной оценки всех факторов и их
взаимодействий. То есть в каждом проводимом опыте или наблюдении допускается варьирование значений нескольких факторов,
а потом проводится оценка их раздельного влияния на отклик. Это
позволяет существенно снизить количество испытаний без потери
требуемой точности к результатам.
В основе дисперсионного анализа лежит положение, что общую дисперсию S
определить как сумму факторной S
ной S
(внутригрупповой) дисперсий:
ост
определения зависимой переменной Y можно
общ
(межгрупповой) и остаточ-
факт
S
общ
= S
факт,j
+ S
ост
,
где j – количество факторов.
Указанная зависимость означает, что на итоговый разброс значений отклика вокруг его математического ожидания влияют ко-
ний, а также действие случайных или неучтенных параметров.
Общая дисперсия (другое название – полная вариация) определяется как общая сумма квадратов отклонений наблюдаемых
значений от общей средней:
n
j
k
S x
где
общ
j i
n
j
k
1
n
i j
– общее среднее; xij – i-е наблюдение в j-й группе
1 1
1 1
ij
или уровне; nj – количество наблюдений в j-й группе; n – общее
количество наблюдений во всех группах (т. е. n = n1 + n2 + … + nj);
k – количество изучаемых групп или уровней.
125

Факторная дисперсия характеризует факторную сумму квад-
2
( ) ,
S n x x
2
( ) ,
;1;.1
n k
.
MSA
MSW
ратов отклонений групповых средних от общей средней. Под группой понимается уровень фактора k – т. е. значение, которое принимает фактор в исследовании. Во время проведения опыта может
проводиться nj параллельных наблюдений при каждом значении,
или уровне, фактора. Факторная, или межгрупповая дисперсия определяется по формуле:
k
факт
j j
1
j
где xj – среднее значение j-й группы; x – общее среднее.
Остаточная или внутригрупповая дисперсия равна сумме квадратов разностей между элементами каждой группы и выборочным
средним этой группы:
n
j
k
S x x
ост
j i
1 1
ij j
где xj – среднее значение j-й группы.
Средние суммы квадратов указанных дисперсий определяются по формулам:
S
MSA
факт
k
S
MSW
ост
Затем вычисляется критерий Фишера по соотношению:
Если наблюдаемое (рассчитанное) значение критерия Фишера
больше табличного при заданном уровне значимости и степенях
свободы f1 = k – 1 и f2 = n – k, тогда с заданной вероятностью
можно утверждать, что между факторным и результативным признаком существует взаимосвязь.
MST
F
126
S
общ
n

Таким же образом проверяют адекватность выбранной модели уравнения регрессии. Если условие выполняется, то модель является адекватной. В противном случае делают вывод об отсутствии какой-либо связи либо проверяют другую модель уравнения
регрессии, которая будет описывать нелинейную взаимосвязь между переменными.
В некоторых случаях при неадекватности линейной модели
для нахождения удовлетворительного уравнения регрессии требуется провести дополнительные опыты.
5.4. Методы планирования эксперимента
При выполнении экспериментальных исследований часто встает вопрос об оптимальном количестве опытов, которые необходимо осуществить для того, чтобы получить адекватный достоверный результат при минимальном количестве затрат.
Чтобы спланировать исследование и получить достаточно
точные результаты, выраженные статистическими параметрами
и моделями, пользуются специальными методами планирования
эксперимента.
Наиболее простым методом планирования экспериментальных
исследований является полный факторный эксперимент.
П о л н ы м ф а к т о р н ы м э к с п е р и м е н т о м (ПФЭ)
называется такой эксперимент, при реализации которого определяется значение параметра оптимизации (функции отклика) при всех
возможных сочетаниях уровней варьирования факторов. Под уровнем варьирования подразумевают те численные значения, которые имеет конкретный фактор во время эксперимента.
Если имеют дело с q факторами, каждый из которых может
устанавливаться на k уровнях, то для того, чтобы осуществить полный факторный эксперимент, необходимо поставить n = kq опытов.
Наибольшее распространение получили двухуровневые эксперименты типа 2q. В ходе реализации ПФЭ реализуются все основные способы обработки данных, рассмотренные выше: описатель-
127

ная статистика вариационного ряда, корреляционно-регрессионный анализ, а также дисперсионный анализ.
Для лучшего понимания роли планирования в экспериментальных исследованиях, а также сути корреляционно-регрессионного анализа рассмотрим подробно алгоритм ПФЭ на примере
из учебника [15, с. 10–17].
Проводится процесс дистилляции некоторого сырья в аппарате периодического действия. Цель исследования – определить зависимость выхода продукта, который обычно выражается в процентах от загруженного в агрегат сырья, от двух факторов – от скорости
и конечной температуры нагрева сырья.
Все исследования проводятся в выбранных интервалах значений рассматриваемых факторов. Пределы варьирования выбираются из практических задач исследуемого процесса или на основании литературного обзора. Следует обратить внимание, что все полученные зависимости справедливы лишь в выбранных интервалах
варьирования. Для оценки влияния факторов на отклик вне этих
интервалов следует проводить дополнительные исследования. Это
обусловлено тем, что в зависимости от степени влияния и значения
факторов могут изменяться механизмы их воздействия на объект
исследования, которые будут описываться уже другими уравнениями.
Для рассматриваемого в примере процесса установлены технологически разумные пределы, в которых могут изменяться факторы:
конечная температура – от 250 до 450 °С, скорость нагрева – от 3
до 10 °С/мин.
На первом этапе ПФЭ осуществляют кодирование факторов,
что подразумевает собой перевод их натуральных значений в безразмерные. Этот этап необходим в первую очередь для удобства последующих вычислений и для построения матрицы эксперимента.
Для перевода натуральных величин заполняют таблицу кодирования переменных на двух уровнях (табл. 6) – верхнем и нижнем, которые соответствуют границам интервала варьирования.
В качестве нулевого уровня факторов принимают центр интервала,
в котором предполагается вести эксперимент.
128

0
,
i
X x
Кодирование факторов
Т а б л и ц а 6
Интервал варьирова ния
и уровень факторов
Нулевой уровень xi = 0
Интервал варьирования
Нижний уровень xi = –1
Верхний уровень xi = +1
Кодовое обозначение
Конечная
темпера тура,
°С
350
i
50
300
400
x
1
Скорость
нагрева ,
°С/мин
6
2
4
8
x
2
Связь между кодовым и натуральным значением фактора:
i
x
i
δ
i
где Xi – натуральное значение фактора; xi0 – значение i-го фактора
на нулевом уровне; i – интервал варьирования i-го фактора.
После завершения процедуры кодирования факторов составляется план-матрица эксперимента, которая для рассматриваемого примера приведена в табл. 7.
Т а б л и ц а 7
План-матрица полного факторного эксперимента 2
2
Опыт x
1
2
3
4
–1
+1
–1
+1
x
1
2
–1
–1
+1
+1
Следующим этапом является рандомизация опытов. Р а н д о м и з а ц и я – это процедура определения случайного порядка
проведения опытов на основе план-матрицы эксперимента. Она
129

необходима для обоснованного использования аппарата матема-
1 2
u u
y y
тической статистики. Рандомизированный план эксперимента также позволяет исключить влияние на функцию отклика любых регулярных изменений, обусловленных окружающей средой, ошибками оператора, дефектами аппаратуры.
Если проводятся невоспроизводимые эксперименты, т. е. анализируемый образец не возвращается в свое первоначальное состояние и такой образец поступил на испытания в единственном
количестве, то рандомизацию не проводят, а реализуют последовательный план эксперимента. Пример подобных исследований:
проверка зависимости деформации от напряжения в отдельном
образце, находящемся под действием растягивающей нагрузки.
В рассматриваемом примере путем рандомизации получили
следующую последовательность проведения опытов: 2, 3, 1, 2, 4, 1,
3, 4. В данном случае предполагается проведение двух параллельных испытаний для каждого опыта.
Далее проводят реализацию плана эксперимента. Результаты
представлены в табл. 8.
Т а б л и ц а 8
Условия и результаты опытов
Опыт x
1
2
3
4
1
–1
+1
–1
+1
–1
–1
+1
+1
x
2
x1x
+1
–1
–1
+1
2
y
u
1
27,0
15,9
22,1
13,4
y
28,0
17,1
22,9
13,6
y
u
2
u
2
27,5
16,5
22,5
13,5
Приведенный в табл. 8 план эксперимента представляет собой расширенную матрицу, так как введен столбец x1x2, позволяющий оценить коэффициент регрессии при взаимодействии факторов. Кодированные значения в этом столбце получены путем
перемножения кодированных значений отдельных факторов.
После того, как были проведены испытания, осуществляют
самопроверку и оценивают воспроизводимость результатов опытов.
130
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
