Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Основы научных исследований при разработке энерго- и ресурсосберегающих процессов в химической технологии, нефтехимии и биотехнологии. Учебное пособие

.pdf
Скачиваний:
0
Добавлен:
07.09.2026
Размер:
1 Мб
Скачать
☆
при изменении некоторого признака х изменяется среднее значе­ние признака y. Но поскольку среднее значение принадлежит до­верительному интервалу, то y может принимать множество значе­ний внутри этого интервала с различными вероятностями.
На рис. 15 приведены графические зависимости, которые ил­люстрируют присутствие между переменными корреляционной связи различных видов (а, б, в) и отсутствие любой связи (г). Ка­чество корреляционной зависимости обратно пропорционально плотности точек: чем ближе точки на графике лежат друг к другу, тем меньше дисперсия и тем сильнее корреляционная связь.
у
а б
у
в г
Рис. 15. Корреляционные зависимости [11, с. 58]
у
х
у
х х
х
Ввиду того, что корреляционная связь является подвидом ста­тистической связи, для ее изучения необходим достаточно боль­шой объем данных. Число необходимых наблюдений или опытов, достаточное для анализа корреляционной связи, зависит от цели исследований, точности и надежности параметров связи, от коли­чества факторов, корреляция с которыми изучается. Обычно чис­ло наблюдений не менее чем в 5–6, а лучше не менее чем в 10 раз больше числа факторов. Большинство исследований в химии одно­факторные, поэтому число испытаний выбирают не менее 5.
121
К о р р е л я ц и я – это признак, учитывающий взаимосвязь ряда числовых последовательностей. Установить значимость свя­зи между переменными – значит установить корреляцию. При этом корреляция не может объяснить, почему две переменные связаны между собой. То есть корреляционная связь показывает тесноту связи между переменными, но не описывает ее количественно.
Корреляцию изучают с применением корреляционно-регрес­сионного анализа. Корреляционно-регрессионный анализ учитыва­ет межфакторные связи и дает более полное измерение роли каж­дого фактора: непосредственное его влияние на результативный при­знак; его косвенное влияние на другие факторы; влияние всех факторов на результативный признак.
Существование корреляции между двумя переменными х и y устанавливают на этапе к о р р е л я ц и о н н о г о а н а л и з а, который проводят с учетом следующих допущений [12, с. 53]:
переменные Х и Y являются случайными величинами, рас-
пределенными по нормальному закону;
некоторому значению Х можно поставить в соответствие одно
или несколько значений Y;
по данному нормальному распределению случайных величин
Х и Y можно определить выборочное среднее и среднеквадрати­ческое отклонение величин Х и Y.
Р е г р е с с и о н н ы й а н а л и з показывает, что по резуль­татам анализа является фактором, что функцией отклика и каким уравнением эта связь описывается. Регрессионный анализ исполь­зуют для прогнозирования одной переменной на основании зна­чений другой. Причем, если между переменными не существует корреляции, то регрессионный анализ проводить бессмысленно.
Основными допущениями регрессионного анализа являются следующие [12, с. 46]:
1) переменная Y является случайной величиной, распределен-
ной по нормальному закону;
2) при фиксированном значении Х дисперсия Y постоянна;
3) ошибка в определении переменной Х пренебрежимо мала
по сравнению с ошибкой в определении переменной Y.
122
Корреляционно-регрессионный анализ проводится по следую-
( )( )
,
x x y y
2
( )
x x
2
( )
y y
щему плану:
1. Сбор первичной информации, проверка ее на однородность и нормальность распределения. Оценку однородности проводят по коэффициенту вариации V, формула расчета которого приведена в п. 5.2.3, а нормальность распределения можно проверить по пра­вилу трех сигм.
2. Исключение из массива данных промахов. Для этого можно использовать различные статистические критерии или правило трех сигм.
3. Установление наличия и направления корреляционной за­висимости между переменными. Для этого используются методы: параллельного сопоставления рядов результативного и факторного признака, графического изображения фактических данных с по­мощью поля корреляции, построения корреляционной таблицы. На данном этапе можно лишь предварительно оценить наличие корреляции между переменными.
4. Измерение степени тесноты связи, оценка ее существеннос­ти. Для определения степени тесноты парной линейной зависи­мости пользуются коэффициентом корреляции, который находится по формуле:
n
i i
1
i
r
( 1)
n s s
x y
где
ния в пределах от –1 до +1. Чем ближе он по абсолютной величи­не к 1, тем теснее связь. Знак при коэффициенте указывает на­правление связи: знак «+» соответствует прямой зависимости, знак «–» – обратной. Если коэффициент корреляции равен нулю, то свя­зи между признаками нет; если он равен единице, то между при­знаками существует функциональная связь.
n
i
1
i
s
x
1
n
и
s
n
i
1
i
y
n
.
1
Линейный коэффициент корреляции может принимать значе-
123
При этом следует помнить, что коэффициент корреляции по-
...,
казывает наличие взаимосвязи между переменными, но не описы­вает ее количественную составляющую, т. е. как именно фактор влияет на функцию отклика. Также коэффициент корреляции явля­ется достаточно грубой оценкой тесноты связи. Приведенная фор­мула его определения показывает линейную зависимость между переменными. В случае, если коэффициент rxy будет иметь низкое значение, то нельзя сделать однозначный вывод об отсутствии кор­реляции, возможно, связь просто имеет нелинейный характер и сле­дует рассматривать другую модель.
5. Построение модели связи. Тип модели выбирается на осно­ве сочетания теоретического анализа и исследования эмпиричес­ких зависимостей. Чаще всего встречаются следующие типы функ­ций: линейная, гиперболическая, параболическая, показательная.
Зависимость одной случайной величины от значений, которые принимает другая случайная величина, в статистике называется р е г р е с с и е й. Если этой зависимости придан аналитический вид, то такую форму представления называют у р а в н е н и е м р е г р е с с и и.
Уравнение регрессии еще называют уравнением полинома, которое в общем виде выглядит следующим образом:
k k
b x b x x b xy b
0
i i ij i j ii i
1 1
i i j i
2
где b0, bi, bij, bii, … – выборочные коэффициенты регрессии, кото­рые можно получить, пользуясь результатами эксперимента. Ко­эффициенты регрессии показывают, как сильно факторы или их сочетание влияют на значение функции отклика.
Дисперсионный анализ является одним из методов оценки зна­чимости влияния фактора на величину выходной (зависимой) пере­менной. Он позволяет оценить вклад одного из факторов на ре­зультат испытаний и сравнить его с вкладом ошибок или случай­ных неучтенных явлений посредством сравнения их дисперсий.
5.3. Дисперсионный анализ
124
Дисперсионный анализ может применяться при обработке ре-
2
( ) ,
х
ij
x x

зультатов как однофакторных, так и многофакторных эксперимен­тов. Причем во втором случае он считается весьма эффективным, поскольку в отличие от классической постановки многофактор­ных экспериментов, где варьируются значения одного из факторов при неизменности других, при дисперсионном анализе каждое на­блюдение служит для одновременной оценки всех факторов и их взаимодействий. То есть в каждом проводимом опыте или наблю­дении допускается варьирование значений нескольких факторов, а потом проводится оценка их раздельного влияния на отклик. Это позволяет существенно снизить количество испытаний без потери требуемой точности к результатам.
В основе дисперсионного анализа лежит положение, что об­щую дисперсию S определить как сумму факторной S ной S
(внутригрупповой) дисперсий:
ост
определения зависимой переменной Y можно
общ
(межгрупповой) и остаточ-
факт
S
общ
= S
факт,j
+ S
ост
,
где j – количество факторов.
Указанная зависимость означает, что на итоговый разброс зна­чений отклика вокруг его математического ожидания влияют ко-
ний, а также действие случайных или неучтенных параметров.
Общая дисперсия (другое название – полная вариация) оп­ределяется как общая сумма квадратов отклонений наблюдаемых значений от общей средней:
n
j
k
S x

где
общ
j i
n
j
k
1
n
i j
 
– общее среднее; xij – i-е наблюдение в j-й группе
1 1
1 1
 
ij
или уровне; nj – количество наблюдений в j-й группе; n – общее количество наблюдений во всех группах (т. е. n = n1 + n2 + … + nj); k – количество изучаемых групп или уровней.
125
Факторная дисперсия характеризует факторную сумму квад-
2
( ) ,
S n x x
2
( ) ,
;1;.1
n k

.
MSA
MSW
ратов отклонений групповых средних от общей средней. Под груп­пой понимается уровень фактора k – т. е. значение, которое прини­мает фактор в исследовании. Во время проведения опыта может проводиться nj параллельных наблюдений при каждом значении, или уровне, фактора. Факторная, или межгрупповая дисперсия оп­ределяется по формуле:
k
факт
j j
1
j
где xj – среднее значение j-й группы; x – общее среднее.
Остаточная или внутригрупповая дисперсия равна сумме квад­ратов разностей между элементами каждой группы и выборочным средним этой группы:
n
j
k
S x x

ост
j i
1 1
 
ij j
где xj – среднее значение j-й группы.
Средние суммы квадратов указанных дисперсий определяют­ся по формулам:
S
MSA
факт
k
S
MSW
ост
Затем вычисляется критерий Фишера по соотношению:
Если наблюдаемое (рассчитанное) значение критерия Фишера больше табличного при заданном уровне значимости и степенях свободы f1 = k – 1 и f2 = n – k, тогда с заданной вероятностью можно утверждать, что между факторным и результативным при­знаком существует взаимосвязь.
MST
F
126
S
общ
n
Таким же образом проверяют адекватность выбранной моде­ли уравнения регрессии. Если условие выполняется, то модель яв­ляется адекватной. В противном случае делают вывод об отсут­ствии какой-либо связи либо проверяют другую модель уравнения регрессии, которая будет описывать нелинейную взаимосвязь меж­ду переменными.
В некоторых случаях при неадекватности линейной модели для нахождения удовлетворительного уравнения регрессии требу­ется провести дополнительные опыты.
5.4. Методы планирования эксперимента
При выполнении экспериментальных исследований часто вста­ет вопрос об оптимальном количестве опытов, которые необходи­мо осуществить для того, чтобы получить адекватный достовер­ный результат при минимальном количестве затрат.
Чтобы спланировать исследование и получить достаточно точные результаты, выраженные статистическими параметрами и моделями, пользуются специальными методами планирования эксперимента.
Наиболее простым методом планирования экспериментальных исследований является полный факторный эксперимент.
П о л н ы м ф а к т о р н ы м э к с п е р и м е н т о м (ПФЭ) называется такой эксперимент, при реализации которого определя­ется значение параметра оптимизации (функции отклика) при всех возможных сочетаниях уровней варьирования факторов. Под уров­нем варьирования подразумевают те численные значения, кото­рые имеет конкретный фактор во время эксперимента.
Если имеют дело с q факторами, каждый из которых может устанавливаться на k уровнях, то для того, чтобы осуществить пол­ный факторный эксперимент, необходимо поставить n = kq опытов.
Наибольшее распространение получили двухуровневые экспе­рименты типа 2q. В ходе реализации ПФЭ реализуются все основ­ные способы обработки данных, рассмотренные выше: описатель-
127
ная статистика вариационного ряда, корреляционно-регрессион­ный анализ, а также дисперсионный анализ.
Для лучшего понимания роли планирования в эксперимен­тальных исследованиях, а также сути корреляционно-регрессион­ного анализа рассмотрим подробно алгоритм ПФЭ на примере из учебника [15, с. 10–17].
Проводится процесс дистилляции некоторого сырья в аппара­те периодического действия. Цель исследования – определить зави­симость выхода продукта, который обычно выражается в процен­тах от загруженного в агрегат сырья, от двух факторов – от скорости и конечной температуры нагрева сырья.
Все исследования проводятся в выбранных интервалах значе­ний рассматриваемых факторов. Пределы варьирования выбира­ются из практических задач исследуемого процесса или на основа­нии литературного обзора. Следует обратить внимание, что все по­лученные зависимости справедливы лишь в выбранных интервалах варьирования. Для оценки влияния факторов на отклик вне этих интервалов следует проводить дополнительные исследования. Это обусловлено тем, что в зависимости от степени влияния и значения факторов могут изменяться механизмы их воздействия на объект исследования, которые будут описываться уже другими уравнениями.
Для рассматриваемого в примере процесса установлены техно­логически разумные пределы, в которых могут изменяться факторы: конечная температура – от 250 до 450 °С, скорость нагрева – от 3 до 10 °С/мин.
На первом этапе ПФЭ осуществляют кодирование факторов, что подразумевает собой перевод их натуральных значений в без­размерные. Этот этап необходим в первую очередь для удобства по­следующих вычислений и для построения матрицы эксперимента.
Для перевода натуральных величин заполняют таблицу коди­рования переменных на двух уровнях (табл. 6) – верхнем и ниж­нем, которые соответствуют границам интервала варьирования. В качестве нулевого уровня факторов принимают центр интервала, в котором предполагается вести эксперимент.
128
0
,
i
X x
Кодирование факторов
Т а б л и ц а 6
Интервал варьирова ния
и уровень факторов
Нулевой уровень xi = 0
Интервал варьирования
Нижний уровень xi = –1
Верхний уровень xi = +1
Кодовое обозначение
Конечная
темпера тура,
°С
350
i
50
300
400
x
1
Скорость
нагрева ,
°С/мин
6
2
4
8
x
2
Связь между кодовым и натуральным значением фактора:
i
x
i
δ
i
где Xi – натуральное значение фактора; xi0 – значение i-го фактора на нулевом уровне; i – интервал варьирования i-го фактора.
После завершения процедуры кодирования факторов состав­ляется план-матрица эксперимента, которая для рассматриваемо­го примера приведена в табл. 7.
Т а б л и ц а 7
План-матрица полного факторного эксперимента 2
2
Опыт x
1
2
3
4
–1
+1
–1
+1
x
1
2
–1
–1
+1
+1
Следующим этапом является рандомизация опытов. Р а н ­д о м и з а ц и я – это процедура определения случайного порядка проведения опытов на основе план-матрицы эксперимента. Она
129
необходима для обоснованного использования аппарата матема-
1 2
u u
y y
тической статистики. Рандомизированный план эксперимента так­же позволяет исключить влияние на функцию отклика любых ре­гулярных изменений, обусловленных окружающей средой, ошиб­ками оператора, дефектами аппаратуры.
Если проводятся невоспроизводимые эксперименты, т. е. ана­лизируемый образец не возвращается в свое первоначальное сос­тояние и такой образец поступил на испытания в единственном количестве, то рандомизацию не проводят, а реализуют последо­вательный план эксперимента. Пример подобных исследований: проверка зависимости деформации от напряжения в отдельном образце, находящемся под действием растягивающей нагрузки.
В рассматриваемом примере путем рандомизации получили следующую последовательность проведения опытов: 2, 3, 1, 2, 4, 1, 3, 4. В данном случае предполагается проведение двух параллель­ных испытаний для каждого опыта.
Далее проводят реализацию плана эксперимента. Результаты представлены в табл. 8.
Т а б л и ц а 8
Условия и результаты опытов
Опыт x
1
2
3
4
1
–1
+1
–1
+1
–1
–1
+1
+1
x
2
x1x
+1
–1
–1
+1
2
y
u
1
27,0
15,9
22,1
13,4
y
28,0
17,1
22,9
13,6
y
u
2
u
2
27,5
16,5
22,5
13,5
Приведенный в табл. 8 план эксперимента представляет со­бой расширенную матрицу, так как введен столбец x1x2, позволяю­щий оценить коэффициент регрессии при взаимодействии фак­торов. Кодированные значения в этом столбце получены путем перемножения кодированных значений отдельных факторов.
После того, как были проведены испытания, осуществляют самопроверку и оценивают воспроизводимость результатов опытов.
130
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]