Теория эксперимента. Учебное пособие
.pdfтого, что экспериментальное значение F будет больше чем 4,40, равна 0,05
или 5%. Наше Fэксп=15,9. Оно значительно превышает табличное значение.
Так проверяется гипотеза об однородности дисперсий. Наша гипотеза состояла в том, что обе группы экспериментальных данных получены из одной и той же совокупности и дают одинаковое рассеяние. Установили, что одна дисперсия значимо отличается от другой (для выбранного уровня значимости).
Если сравниваемое количество дисперсий больше двух и одна дисперсия значительно превышает остальные, можно воспользоваться критерием Кохрена. Этот критерий пригоден для случаев, когда во всех точках имеется одинаковое число повторных опытов. При этом подсчитывается дисперсия в каждой горизонтальной строке матрицы по формуле 2.1, а затем из всех дисперсий находится наибольшая smax2 , которая делится на сумму всех дисперсий. Критерий Кохрена — это отношение максимальной дисперсии к сумме всех дисперсий:
N
G smax2 / si2 . 1
С этим критерием связаны числа степеней свободы f1=n—1 и f2=N.
Гипотеза об однородности дисперсий подтверждается, если экспериментальное значение критерия Кохрена не превышает табличного значения. Тогда можно усреднять дисперсии и пользоваться формулой 2.1.
Пример 3. В начале главы, показывая, как нужно оформлять журнал, мы привели матрицу 2^3 с двумя повторными опытами. Мы сказали: вот с такой таблицей 4.4 можно приступать к обработке экспериментальных данных.
Воспользуемся этой таблицей для расчета дисперсии воспроизводимости.
Перепишем ее с целью удобства расчета (таблице 2.6).
101
Таблица 2.6 – Расчет дисперсии воспроизводимости
Номер |
Матрица |
y |
y |
|
y |
|
y |
|
|
плани- |
|
|
( y)2 |
si2 |
|||||
опыта |
рования |
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
1 |
(1) |
80,23 |
81,93 |
81,08 |
-0,85 |
0,722 |
1,144 |
||
2 |
a |
86,50 |
84,80 |
85,65 |
0,85 |
0,722 |
1,144 |
||
3 |
b |
82,45 |
82,10 |
82,27 |
0,18 |
0,031 |
0,062 |
||
4 |
ab |
89,50 |
91,30 |
90,40 |
-0,90 |
0,810 |
1,620 |
||
5 |
c |
85,10 |
84,80 |
84,95 |
0,15 |
0,023 |
0,046 |
||
6 |
ac |
90,30 |
89,60 |
89,95 |
0,35 |
0,123 |
0,246 |
||
7 |
bc |
85,60 |
84,90 |
85,25 |
0,35 |
0,123 |
0,246 |
||
8 |
abc |
88,02 |
88,48 |
88,25 |
-0,23 |
0,053 |
0,106 |
||
Сумма |
|
|
|
|
|
|
|
2,607 |
|
Дисперсия в каждом опыте равна:
|
1 |
|
2 |
|
|
|
s2 |
|
(yq |
y |
)2 2( y)2 . |
||
2 1 |
||||||
|
1 |
|
|
|||
Максимальная дисперсия оказалась в опыте № 4. Экспериментальный критерий Кохрена равен 6=1,620/5,214=0,31. Табличный критерий Кохрена равен: G=0,68. Экспериментальный критерий Кохрена не превышает значения табличного. Гипотеза об однородности дисперсий подтверждается».
Дисперсия воспроизводимости равна s{2y} 2*2,607/8 0,652.
Более экономный вариант проверки однородности основан на выделении из всех дисперсий наибольшей и наименьшей. Затем по F-критерию производится проверка, значимо ли они различаются между собой. Если наибольшая и наименьшая дисперсии не отличаются значимо, то дисперсии, имеющие промежуточные значения, также не могут значимо отличаться друг от друга. Тогда всю группу дисперсий можно считать принадлежащей к единой совокупности. В таких случаях нет необходимости в применении критерия Бартлета.
Если дисперсии все-таки оказались неоднородными, то оказывается полезным изменение масштаба для параметра оптимизации. При этом вводится некоторая математическая функция от параметра оптимизации,
102
например квадратный корень или логарифм. Использование таких методов выходит за рамки элементарного анализа, и в случае необходимости экспериментатору целесообразно обращаться за советом к специалисту по планированию эксперимента.
2.6 Рандомизация
Чтобы исключить влияние систематических ошибок, вызванных внешними условиями (переменой температуры, сырья, лаборанта и т. д.), рекомендуется случайная последовательность при постановке опытов, запланированных матрицей. Опыты необходимо рандомизировать во времени. Термин «рандомизация» происходит от английского слова random — случайный. Почему рандомизация опытов важна, покажем на следующем примере.
Пример 4. В таблице 2.7 приведена матрица 23 , полученная из матрицы
22 обычным способом: два раза повторен план 22 , причем в первых четырех опытах x3 имеет верхнее значение, а в последних четырех опытах — нижнее значение. Допустим, что экспериментатор может поставить в первый день четыре опыта и во второй день также четыре опыта. Можно ли опыты ставить подряд и в первый день реализовать опыты № 1, 2, 3 и 4, а во второй — 5, 6, 7 и 8? Ставя опыты подряд, матрица разбивается на две части или на два блока: в первый блок входят опыты № 1» 2, 3 и 4, во второй — № 5, 6, 7 и 8. Если внешние условия первого дня каким-то образом отличались от внешних условий второго дня, то это способствовало возникновению некоторой систематической ошибки. Обозначим эту ошибку .
Тогда четыре значения параметра оптимизации сдвинуты на величину по сравнению с истинными значениями. Пусть это будут параметры, входящие в первый блок: y1 ;y2 ;y3 ;y4 .
103
Таблица 2.7 –Матрица 23 , нерандомизированная во времени
Номер |
x1 |
x2 |
x3 |
y |
Номер |
x1 |
x2 |
x3 |
y |
опыта |
|
|
|
|
опыта |
|
|
|
|
1 |
+ |
+ |
+ |
y1 |
5 |
+ |
+ |
- |
y5 |
2 |
- |
- |
+ |
y2 |
6 |
- |
- |
- |
y6 |
3 |
+ |
- |
+ |
y3 |
7 |
+ |
- |
- |
y7 |
4 |
- |
+ |
+ |
y4 |
8 |
- |
+ |
- |
y8 |
Однако матрица построена так, что в первом блоке значения х3
находятся на верхнем уровне, а во втором — на нижнем уровне. Тогда при подсчете b3 получится следующая картина:
1
b3 8[(y1 ) (y2 ) (y3 ) (y4 ) y5 y6 y7 y8 ] 3 /2,
Где 3 - истинное значение коэффициента при х3. Таким образом, возможное различие во внешних условиях смешалось с величиной линейного коэффициента b3 и исказило это значение. В такой последовательности опыты ставить нельзя. Опыты нужно рандомизировать во времени, т. е. придать последовательности опытов случайный характер.
Пример рандомизации условий эксперимента. В полном факторном эксперименте 23 предполагается каждое значение параметра оптимизации определять по двум параллельным опытам. Нужно случайно расположить всего 16 опытов.
Присвоим параллельным опытам номера с 9 по 16, и тогда опыт № 9 будет повторным по отношению к первому опыту, десятый — ко второму и т. д. Следующий этап рандомизации — использование таблицы случайных чисел. Обычно таблица случайных чисел приводится в руководствах по математической статистике. В случайном месте таблицы выписываются числа с 1 по 16 с отбрасыванием чисел больше 16 и уже выписанных. В нашем случае, начиная с четвертого столбца, можно получить такую последовательность: 2; 15; 9; 5; 12; 14; 8; 7; 16; 1; 3; 13; 4; 6; 11; 10. Это значит,
104
что первым реализуется опыт № 2, вторым — опыт № 7 и т. д. Выбранную
случайным образом последовательность опытов не рекомендуется нарушать.
3 ОБРАБОТКА РЕЗУЛЬТАТОВ ЭКСПЕРИМЕНТА МЕТОДОМ РЕГРЕССИОННОГО АНАЛИЗА
3.1 Зависимость между случайными величинами
При изучении процессов функционирования сложных систем приходится иметь дело с целым рядом одновременно действующих случайных величин. Для уяснения механизма явлений, причинно-следственных связей между элементами системы и т.д., по полученным наблюдениям мы пытаемся установить взаимоотношения этих величин.
В математическом анализе зависимость, например, между двумя величинами выражается понятием функции y=f(x), где каждому значению одной переменной соответствует только одно значение другой. Такая зависимость носит название функциональной.
Гораздо сложнее обстоит дело с понятием зависимости случайных величин. Как правило, между случайными величинами (случайными факторами), определяющими процесс функционирования сложных систем, обычно существует такая связь, при которой с изменением одной величины меняется распределение другой. Такая связь называется стохастической, или
вероятностной. При этом величину изменения случайного фактора Y, соответствующую изменению величины Х, можно разбить на два компонента. Первый связан с зависимостью Y от X, а второй с влиянием "собственных" случайных составляющих величин Y и X. Если первый компонент отсутствует, то случайные величины Y и X являются независимыми. Если отсутствует второй компонент, то Y и X зависят функционально. При наличии обоих компонент соотношение между ними определяет силу или тесноту связи между случайными величинами Y и X.
Существуют различные показатели, которые характеризуют те или иные
105
стороны стохастической связи. Так, линейную зависимость между случайными величинами X и Y определяет коэффициент корреляции.
M[(X a )(Y a )]
r |
|
x |
y |
, |
(3.1) |
x |
y |
|
|||
|
|
|
|
где |
a , |
a |
– математические ожидания случайных величин X и Y. |
|
x |
|
y |
|
, |
|
– средние квадратические отклонения случайных |
|
x |
|
y |
величин X и Y.
Линейная вероятностная зависимость случайных величин заключается в том, что при возрастании одной случайной величины другая имеет тенденцию возрастать (или убывать) по линейному закону. Если случайные величины X и Y связаны строгой линейной функциональной зависимостью, например,
y=b0+b1x1,
то коэффициент корреляции будет равен r 1; причем знак соответствует знаку коэффициента b1 .Если величины X и Y связаны произвольной стохастической зависимостью, то коэффициент корреляции будет изменяться в пределах
1 r 1.
Следует подчеркнуть, что для независимых случайных величин коэффициент корреляции равен нулю. Однако коэффициент корреляции как показатель зависимости между случайными величинами обладает серьезными недостатками. Во-первых, из равенства r = 0 не следует независимость случайных величин X и Y (за исключением случайных величин, подчиненных нормальному закону распределения, для которых r = 0 означает одновременно
и отсутствие всякой зависимости). Вовторых, крайние значения r 1 также
106
не очень полезны, так как соответствуют не всякой функциональной зависимости, а только строго линейной.
Полное описание зависимости Y от X , и притом выраженное в точных функциональных соотношениях, можно получить, зная условную функцию распределения F Y
X x .
Следует отметить, что при этом одна из наблюдаемых переменных величин считается неслучайной. Фиксируя одновременно значения двух случайных величин X и Y, мы при сопоставлении их значений можем отнести все ошибки лишь к величине Y. Таким образом, ошибка наблюдения y будет складываться из собственной случайной ошибки величины Y и из ошибки сопоставления, возникающей из-за того, что с величиной Y сопоставляется не совсем то значение X, которое имело место на самом деле.
Однако отыскание условной функции распределения, как правило,
оказывается весьма сложной задачей. Наиболее просто исследовать зависимость между Х и Y при нормальном распределении Y, так как оно полностью определяется математическим ожиданием и дисперсией. В этом случае для описания зависимости Y от X не нужно строить условную функцию распределения, а достаточно лишь указать, как при изменении параметра X
изменяются математическое ожидание и дисперсия величины Y.
Таким образом, мы приходим к необходимости отыскания только двух функций:
M[Y / X x] ay / x (x);
(3.2)
D[Y / X x] y2/ x *(x).
Зависимость условной дисперсии D [Y/X=x] от параметра Х носит название сходастической зависимости. Она характеризует изменение точности методики наблюдений при изменении параметра и используется достаточно редко.
Зависимость условного математического ожидания M[Y/x=x] от X носит название регрессии, она дает истинную зависимость величин Х и У, лишенную
107
всех случайных наслоений. Поэтому идеальной целью всяких исследований зависимых величин является отыскание уравнения регрессии, а дисперсия используется лишь для оценки точности полученного результата.
3.2 Обработка результатов пассивного эксперимента методом регрессионного анализа
3.2.1 Основные понятия классического регрессионного анализа
В пассивном эксперименте исходная информация о функционировании сложной системы может быть получена путем непрерывной или дискретной фиксации уровней исследуемых входных факторов и выходных параметров системы в условиях ее нормального функционирования. В данном случае, как уровни, так и сочетания уровней всех входных факторов в каждый момент времени будут являться случайными величинами. Случайными величинами будут являться и выходные параметры системы. При проведении пассивного эксперимента исследователь каждому сочетанию уровней всех входных факторов должен поставить в соответствие текущий уровень выходных параметров системы. Полученная таким образом информация может быть представлена в виде следующей таблицы.
Таблица 3.1 – Результаты пассивного эксперимента
Опыты |
|
Входные параметры |
|
Выходные параметры |
||||||
x1 |
… |
xi |
… |
xk |
y1 |
… |
ys |
… |
y2 |
|
|
|
|
|
|
|
|
|
|
|
|
1 |
x11 |
… |
x1i |
… |
x1k |
y11 |
… |
y1s |
… |
y1r |
2 |
x21 |
… |
x2i |
… |
x2k |
y21 |
… |
y2s |
… |
y2r |
… |
… |
… |
… |
… |
… |
… |
… |
… |
… |
… |
j |
xj1 |
… |
xji |
… |
xjk |
yj1 |
… |
yjs |
… |
yjr |
… |
… |
… |
… |
… |
… |
… |
… |
… |
… |
… |
N |
xN1 |
… |
xNi |
… |
xNk |
yN1 |
… |
yNs |
… |
yNr |
Выходные параметры системы ys стохастические связаны с входными
факторами xi. В общем виде, эту связь можно представить выражением:
108
ys (xi) , |
(3.3) |
где i=1,k;
–аддитивная помеха, то есть величина, учитывающая случайные ошибки измерений, случайные шумы, влияние неучтенных факторов.
Данную аналитическую зависимость принято называть математической моделью системы, полученной по результатам пассивного эксперимента. Так как математическая модель вида (3.3) находится для каждого выходного параметра системы y1, y2, ..., ys, ..., yr в отдельности, то в дальнейшем будем рассматривать способ ее нахождения лишь в общем виде для одного выходного параметра y.
Выше было отмечено, что истинную зависимость величин X и Y
характеризует зависимость условного математического ожидания M[Y/X=x] от параметра. Следовательно, математическую модель (3.3) целесообразно искать в виде уравнения регрессии. Если принять условие, что математическое ожидание аддитивной помехи:
M[ ]=0,
то условное математическое ожидание выходного параметра y будет совпадать со значением функции (xi):
M[Y/Xi=xi]=y= (xi); |
(3.4) |
где (xi) – |
функция регрессии. |
Условное математическое ожидание M[Y/Xi=xi], как правило, зависит не только от входных факторов xi, но и от некоторых параметров i, тогда:
M[Y/Xi=xi]=y= (xi, i). (3.5)
109
В зависимости от того, как данные параметры i входят в функцию регрессии, модели (3.5) делятся на линейные и нелинейные (по параметрам).
Мы будем рассматривать только линейные регрессионные модели.
Точное уравнение регрессии можно получить, только зная M[Y/Xi=xi] для всех допустимых значений переменной xi.
Практически, при проведении экспериментальных исследований такая ситуация невозможна, так как даже отдельные значения M[Y/Xi=xi] не могут быть найдены точно. В связи с этим мы можем искать лишь уравнения приближенной регрессии, оценивая величину и вероятность этой приближенности. Уравнение приближенной регрессии будем записывать в виде:
|
y |
|
M[Y/Xi=xi]=ay/x |
y |
f(xi,bi), |
(3.6) |
||
где |
– |
оценка условного математического ожидания; |
||||||
|
|
f(xi,bi) |
– |
функция приближенной регрессии; |
||||
|
|
bi |
– |
оценки параметров регрессии. |
|
|||
Вид уравнения приближенной регрессии существенно зависит от выбранного метода приближения. В качестве такого метода в "классическом"
регрессионном анализе используется метод наименьших квадратов. Следует отметить, что принцип применения метода наименьших квадратов пригоден для сравнения любого числа функций. Однако при этом удобнее всего сравнивать функции, накладывающие на выборку одинаковое число связей,
так как при этом можно сравнивать просто суммы квадратов отклонений.
Рассмотрим теоретические основы его применения при обработке результатов пассивного эксперимента.
Так как уровни входных факторов, полученных при испытаниях
110
