Введение в планирование экспериментов. Учебное пособие
.pdf
|
|
|
|
Таблица 1.3 |
|
План и результаты первой серии экспериментов |
|
||
|
|
|
|
|
Номер опыта |
Сливки |
Шоколад |
Наполнитель |
Оценка |
1 |
3 |
3 |
1 |
21 |
2 |
7 |
3 |
1 |
55 |
3 |
3 |
7 |
1 |
34 |
4 |
7 |
7 |
1 |
67 |
5 |
3 |
3 |
5 |
38 |
6 |
7 |
3 |
5 |
68 |
7 |
3 |
7 |
5 |
52 |
8 |
7 |
7 |
5 |
78 |
9 |
5 |
5 |
3 |
53 |
Рассмотрим полученные результаты. Хорошо видно, что наши исход- ные представления оказались далекими от действительности. Лучший результат, с точки зрения предпочтений потребителя, получился в опыте номер 8. Здесь все оказалось выше среднего. Надо больше сливок, боль- ше шоколада и больше наполнителя, чем мы думали.
Ну что ж, поумнев благодаря полученным результатам, мы можем теперь спланировать следующую серию опытов. Логично построить их относительно нового центра, поскольку мы знаем вариант напитка, ко- торый гораздо больше нравится потребителям, чем наш предыдущий нулевой опыт. Это, естественно, результат опыта номер 8, где сливки находятся на уровне 7, шоколад – на уровне 7, а наполнитель – на уров- не 5. Будем теперь «плясать от новой печки». Интервал для верхнего и нижнего уровней придется уменьшить, сделав его равным не двум, а одной градации вверх и вниз. Тогда получится табл. 1.4.
|
|
|
|
|
Таблица 1.4 |
|
Факторы и их уровни для эксперимента |
|
|||
|
с жидким шоколадом (вторая серия опытов) |
|
|||
|
|
|
|
|
|
Уровень |
|
|
Факторы |
|
|
|
Сливки |
Шоколад |
|
Наполнитель |
|
|
|
|
|||
Верхний |
|
8 |
8 |
|
6 |
Нулевой |
|
7 |
7 |
|
5 |
Нижний |
|
6 |
6 |
|
4 |
План эксперимента полностью сохранит свою структуру. Только изменятся уровни факторов, а значит, и условия опытов. План и ре- зультаты второй серии опытов представлены в табл. 1.5.
11
|
|
|
|
|
Таблица 1.5 |
|
План и результаты второй серии экспериментов |
|
|||
|
|
|
|
|
|
Номер опыта |
Сливки |
Шоколад |
Наполнитель |
|
Оценка |
1 |
6 |
6 |
4 |
|
71 |
2 |
8 |
6 |
4 |
|
91 |
3 |
6 |
8 |
4 |
|
74 |
4 |
8 |
8 |
4 |
|
83 |
5 |
6 |
6 |
6 |
|
76 |
6 |
8 |
6 |
6 |
|
85 |
7 |
6 |
8 |
6 |
|
70 |
8 |
8 |
8 |
6 |
|
79 |
9 |
7 |
7 |
5 |
|
76 |
На этот раз рекордсменом оказался опыт номер 2. И результаты всех опытов в целом заметно улучшились. Если в первой серии раз- брос оценок был от 21 до 78, т.е. диапазон составлял 57 единиц, то во второй серии он оказался от 70 до 91, т.е., диапазон составил 21 еди- ницу. Получается, что рецепт требует много сливок, умеренное ко- личество шоколада и не густую консистенцию. А уровень оценок говорит, что результат близок к максимально возможному значению: 91 из 100. Можно было бы на этом закончить. Но для очистки совес- ти стоит провести еще одну серию опытов. Логика остается прежней. Мы находим наилучший результат предыдущей серии, рассматрива- ем его как новый центр эксперимента и строим вокруг него совер- шенно аналогичный план, который показан в табл. 1.6.
|
|
|
|
|
Таблица 1.6 |
|
План и результаты третьей серии экспериментов |
|
|||
|
|
|
|
|
|
Номер опыта |
Сливки |
Шоколад |
Наполнитель |
|
Оценка |
1 |
7 |
5 |
3 |
|
77 |
2 |
9 |
5 |
3 |
|
84 |
3 |
7 |
7 |
3 |
|
73 |
4 |
9 |
7 |
3 |
|
85 |
5 |
7 |
5 |
5 |
|
75 |
6 |
9 |
5 |
5 |
|
84 |
7 |
7 |
7 |
5 |
|
81 |
8 |
9 |
7 |
5 |
|
89 |
9 |
8 |
6 |
4 |
|
93 |
Получилось, что нулевая точка этой серии опытов дала наилуч- ший результат. Она же была наилучшей и во второй серии. Похоже, что мы близки к глобальному максимуму. Дальнейшие эксперимен-
12
ты в существующих условиях вряд ли способны дать существенно лучший результат. Интересно, что некоторые члены нашей команды полагали до начала опытов, что наилучший результат соответствует комбинации: сливки = 5, шоколад = 9, а наполнитель = 3. Как мы те- перь знаем, они ошибались. Наш ответ: сливки = 8, шоколад = 6, а наполнитель = 4. И приятного аппетита! Может быть, вы не любите сладкого? Не огорчайтесь. Ничего не стоит переделать этот пример под, скажем, выбор состава для засолки огурцов. Совсем просто применить методы планирования эксперимента в большинстве лабо- раторных исследований. Но об этом – в следующий раз.
Если у вас, дорогие читатели, возник интерес к этой теме, то мы вернемся к нашему примеру и посмотрим, что можно улучшить, и как можно изменять исходную постановку задачи. Мы можем рас- смотреть и иные постановки задач из тех, что были перечислены в начале главы. Кроме того, мы опишем этот пример в более фор- мальной манере с учетом математического аппарата теории планиро- вания эксперимента. А пока обдумайте, пожалуйста, то, что вы здесь прочитали. Между прочим, если бы вы захотели перебрать все 10 градаций для каждого из трех факторов, то вам потребовалось бы проделать 310 различных опытов!
А если вам потребуется дополнительная информация, то вы мо- жете обратиться для начала, например, к работам, приведенным в библиографическом списке.
13
2. УЧИМСЯ СЧИТАТЬ
Итак, теперь, когда вы подкрепились шоколадным напитком, при- готовленным по моему рецепту, и находитесь в благодушном на- строении, самое время вернуть вас к суровой действительности и на- чать постепенно приобщать к тому математическому аппарату, кото- рый дает планированию эксперимента его огромную силу. Вы убеди- тесь, что он совсем не страшен.
Начнем с того самого примера, что мы уже разобрали подробно в предыдущей главе. Покажем, как он будет выглядеть, если его не- сколько формализовать. Таблицу 1.1 мы оставим без изменений,
авот с табл. 1.2 проделаем следующее. Если бы мы всегда экспери- ментировали только с шоколадными напитками, можно было бы ни- чего не менять. Но, поскольку нас окружают самые разнообразные задачи, лучше вместо конкретных наименований факторов ввести абстрактные символы. В планировании эксперимента принято обо- значать факторы заглавными латинскими буквами Х с нижними сим- волами – порядковыми номерами. Таким образом, обозначим сливки через Х1, шоколад – Х2 и наполнитель – Х3.
Точно так же вместо конкретных выбранных нами уровней этих факторов, представленных в табл. 1.2, имеет смысл ввести универ- сальные обозначения: 0, +1 и –1. Такие обозначения принято назы- вать «кодированными». Сама процедура кодирования крайне проста. Возьмем, например, сливки. В шкале, приведенной в табл. 1.1, они принимают в нашей первой серии экспериментов значения 7 и 3,
асередина между ними равна 5. Построим ось координат для этого фактора:
_____________________________3______5______7__________ Х1
–1 |
0 |
+1 |
х1 |
Над осью мы поместили естественные, физические значения этого фактора, а под осью – кодированные. Иногда кодированные факторы в отличие от натуральных обозначают маленькими символами, а не большими. Думаю, что никакие дополнительные соображения и формулы не нужны. Аналогично дело обстоит и со всеми осталь- ными факторами, сколько бы их не было. К кодированным перемен- ным не стоит относиться свысока. Вы узнаете, что их использование создает огромные преимущества.
В результате старая табл. 1.2 превратится в новую табл. 2.1.
14
|
|
|
|
Таблица 2.1 |
Факторы и их уровни для первой серии опытов |
|
|||
|
|
|
|
|
Уровни |
|
Факторы |
|
|
х1 |
х2 |
|
х3 |
|
|
|
|||
Верхний уровень |
+1 |
+1 |
|
+1 |
Нулевой уровень |
0 |
0 |
|
0 |
Нижний уровень |
–1 |
–1 |
|
–1 |
Ясно, что в таком виде эта таблица не нужна, поскольку она одина- кова для всех серий экспериментов такого рода, как мы сейчас рассмат- риваем. И мы привели ее только для порядка. То, что действительно надо знать и что будет меняться всякий раз, – это схема кодирования всех факторов. Между прочим, схема кодирования преобразует шкалы всех факторов так, чтобы расстояния от нулевой точки до любого уров- ня (верхнего или нижнего) было одинаковым для всех факторов. Благо- даря этому для двух факторов координаты точек, в которых мы будем проводить опыты, соответствуют вершинам квадрата, а для трех факто- ров – куба (рис. 2.1). При большем числе факторов наше пространст- венное воображение перестает нам помогать, но на помощь приходит алгебра – ей все равно сколько факторов.
Рис. 2.1. Факторы в пространстве
Давайте посмотрим, как теперь преобразуется старая табл. 1.3? Она превратится в новую табл. 2.2.
15
|
|
|
|
|
Таблица 2.2. |
|
План и результаты первой серии экспериментов |
|
|||
|
|
|
|
|
|
Номер опыта |
|
х1 |
х2 |
х3 |
Y |
1 |
|
– |
– |
– |
21 |
2 |
|
+ |
– |
– |
55 |
3 |
|
– |
+ |
– |
34 |
4 |
|
+ |
+ |
– |
67 |
5 |
|
– |
– |
+ |
38 |
6 |
|
+ |
– |
+ |
68 |
7 |
|
– |
+ |
+ |
52 |
8 |
|
+ |
+ |
+ |
78 |
9 |
|
0 |
0 |
0 |
53 |
Вы заметили, конечно, что лодыри пишут только знаки, а едини- цы подразумевают. Еще мы ввели латинскую букву Y для обозначе- ния результатов опытов. Их принято называть «откликами».
Теперь мы можем проанализировать результаты этой серии опы- тов более тщательно, чем сделали это раньше. Дело в том, что теперь можно выяснить, как влияют на отклик все факторы в отдельности. Кроме того, возможно, есть и совместные эффекты факторов. Давай- те попробуем это узнать.
Для начала оставим в стороне девятый опыт. Он потом нам еще пригодится. Представим теперь на минутку, что никакие факторы на самом деле не влияют на результат. Тогда все различия в резуль- татах восьми опытов будут проявляться только случайным образом. Значит, их различия обусловлены только естественной вариабельно- стью системы. В этих предположениях давайте сложим восемь ре- зультатов и разделим сумму на восемь. Получится среднее арифме- тическое. В нашем случае сумма равна 413, а среднее равно 51,625. Если исходные данные измеряются с точностью до единиц, то в ста- тистических оценках, получаемых на их основании, стоит сохранять два-три «лишних» знака. В конце концов, когда мы захотим вернуть- ся снова к исходным данным и сравнить их с расчетными, мы смо- жем снова округлить до той точности, которую обеспечивает экспе- римент. Тогда-то и пригодятся «лишние» знаки, они позволят нам не потерять точность.
Теперь хорошо бы измерить эту самую «естественную» вариацию. Можно, конечно, посчитать выборочную дисперсию – меру разброса случайной величины с симметричным законом распределения, на- пример с нормальным. Здесь мы предполагаем, что читатель знаком с основами статистики. Если это не так, то вам придется воспользо-
16
ваться каким-нибудь элементарным учебником статистики. Все рав- но рано или поздно это надо сделать. Но представление о «прилич- ном» законе распределения выглядит в данном случае рискованно: в игру могут вмешаться пока неизвестные эффекты различных фак- торов. Как известно, сочетание относительно больших неслучайных эффектов со случайным фоном, делает предположение о нормально- сти распределения сомнительным. Можно, конечно, сделать вид, что мы ничего про это не знаем, и формально посчитать дисперсию, квадратичную ошибку или иные подходящие оценки. Иногда так и делают. Давайте посмотрим, как именно.
|
|
|
|
|
|
|
|
|
|
Таблица 2.3 |
||
|
План и результаты первой серии экспериментов. |
|
|
|
||||||||
|
|
Вычисление квадратичной ошибки среднего |
|
|
|
|||||||
|
|
|
|
|
|
|
|
|
|
|
|
|
Номер |
|
|
|
|
|
|
|
|
|
|
|
|
х1 |
|
х2 |
х3 |
Y |
Y– Y |
|
(Y– Y )2 |
|||||
опыта |
|
|
||||||||||
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
||||
1 |
– |
|
– |
– |
21 |
–30,625 |
|
937,89 |
||||
2 |
+ |
|
– |
– |
55 |
+ 3,375 |
|
11,39 |
||||
3 |
– |
|
+ |
– |
34 |
–17,625 |
|
310,64 |
||||
4 |
+ |
|
+ |
– |
67 |
+15,375 |
|
236,39 |
||||
5 |
– |
|
– |
+ |
38 |
–13,625 |
|
185,64 |
||||
6 |
+ |
|
– |
+ |
68 |
+16,375 |
|
104,39 |
||||
7 |
– |
|
+ |
+ |
52 |
+ 0,375 |
|
0,13 |
||||
8 |
+ |
|
+ |
+ |
78 |
+26,375 |
|
695,64 |
||||
Сумма |
|
|
|
|
413 |
0 |
|
|
|
2482,11 |
||
Среднее |
|
|
|
|
51,625 |
|
|
|
|
|
|
|
Посмотрим, что у нас получилось (табл. 2.3). Первое, что бросает- ся в глаза, это то, что сумма отклонений от среднего равна нулю. Так бывает всегда, поэтому условие равенства нулю можно рассматри- вать как метод проверки правильности вычислений. Среднее значе- ние получается делением суммы значений на их число. В данном случае число значений равно восьми. В последнем столбце мы ок- руглили результат до двух знаков после запятой. Найденную сумму квадратов отклонений теперь тоже хочется разделить на восемь, что- бы получить некоторую обобщенную меру разброса результатов от- носительно среднего. Но дело в том, что мы уже нашли по этим же данным среднее значение. Поэтому делить надо не на восемь, а на семь, чтобы учесть операцию усреднения. Число, на которое де- лится сумма квадратов, называется числом степеней свободы. Про- делав деление, мы получим для оценки разброса число 354,59. Если бы требования нормального распределения выполнялись, то
17
эта оценка была бы выборочной дисперсией (s2). Поскольку этого нет, лучше назовем ее выборочной вариацией (δ2). Положительное значение корня квадратного из полученной величины будет служить аналогом выборочной квадратичной ошибки (s). У нас она получает- ся близкой к 19. Таким образом, δ2 = 354,59, а δ ≈ 19.
В рамках стандартных представлений о нормальности можно по- строить двух- или трехсигмовые доверительные интервалы для сред- него. Тогда соответственно получим:
Y ±2δ = 51,6 ± 2 х · 19 = 51,6 ± 38 = {13,6 – 89,6};
Y ±3δ = 51,6 ± 3 х · 19 = 51,6 ± 57 = {–5,4 – 108,6}.
Вспомним, что вся шкала охватывает значения от 0 до 100. Выхо- дит, что неопределенность, связанная со средним, практически охва- тывает весь диапазон возможных значений. Это хорошо или плохо? С точки зрения использования среднего для предсказания результа- тов опытов это явно плохо. В нашем случае среднее для этого не го- дится. А вот с точки зрения разнообразия, которое охватывается не- определенностью среднего, это явно хорошо, поскольку вселяет на- дежду на то, что есть факторы, существенно влияющие на вкус на- питка. А раз они есть, мы их непременно найдем.
Можно избежать всех этих сомнительных предположений и нуд- ных расчетов, если вместо оценки вариации воспользоваться оценкой выборочного размаха. Благо эта характеристика очень просто счита- ется. Это разность между самым большим и самым маленьким ре- зультатами в выборке. У нас самое большое число 78, а самое ма- ленькое – 21. Выборочный размах, который принято обозначать ла- тинской заглавной буквой R, таким образом, равен R=78 – 21 = 57. Грубо говоря, в рамках нашего предположения мы получили Y = 51,625 ± 28,5. Здесь 28,5 – это половина выборочного размаха. Значит, в среднем вкус напитка «так себе», но с очень большой ва- риацией. Прямо скажем, не густо.
На то, что мы получили, можно посмотреть и с другой стороны. Если бы все результаты были совершенно одинаковыми, то размах был бы равен нулю. Тогда мы могли бы считать, что на отклик ничто не оказывает влияния. Все проведенные опыты были бы параллель- ными. В них содержалась бы информация об одном значении откли- ка, повторенном восемь раз. Такой результат был бы не информати- вен относительно влияния всех возможных факторов. Если же ва- риация велика и, следовательно, выборочный размах велик, то в этой
18
вариации могут скрываться, как мы уже знаем, эффекты различных факторов. В этом смысле, чем больше размах, тем больше информа- ции о потенциальных эффектах он скрывает. Сэр Рональд Фишер, создатель концепции планирования экспериментов [6], назвал это «информационным количеством», а потомки стали называть полу- чившуюся вариацию «информационным количеством Фишера». Ес-
ли эффект какого-нибудь фактора оказывается |
существенным |
|
(что это значит мы еще уточним), его |
можно как |
бы «вычесть» |
из общего информационного количества. |
Оно тогда уменьшится, и |
|
внем останется меньше возможностей для обнаружения других эф- фектов. Так постепенно можно выделить все важные эффекты. А то, что останется – будет «шумом». Шум характеризует естественную вариацию отклика при «одинаковых» условиях проведения повтор- ных или параллельных опытов. О нем мы поговорим отдельно.
Но, может быть, стоит проверить, не влияют ли какие-нибудь из факторов, которые мы изучали в эксперименте? Начнем с первого. Наш план очень прост. Надо сложить все четыре отклика, которые получились при факторе х1, стоящем на уровне +1, т.е. при значе- нии 7. Затем надо сложить четыре опыта на уровне –1. Теперь оста- лось алгебраически сложить эти две суммы (с учетом знаков). И, на- конец, результат всех этих манипуляций надо поделить на число опытов, т.е. на восемь. То, что получится, называется эффектом фак- тора х1. Что же получится в нашем случае?
Результаты опытов с четными номерами (х1 с плюсом) в сумме дают 268, а нечетные дают соответственно –145. Их сумма равна 123. Если ее разделить на восемь, то получится +15,375 – это и есть эф- фект фактора «сливки». Что же это означает практически? Все очень просто. Отталкиваясь от нулевого уровня факторов, надо двигаться
всторону увеличения значений фактора «сливки». Маловато сливок было в напитке, надо бы прибавить. Посмотрим теперь, что можно сказать о других факторах, например об х2.
Теперь знаки столбца, соответствующего уровню шоколада, надо приписать столбцу отклика и сложить отклики с учетом знаков. По- лученный результат надо разделить на число опытов, т.е. на восемь. Эффекты часто обозначают латинскими буквами b с соответствую- щими нижними индексами. Таким образом, b2 = +6,125; аналогично b3 = +7,375. Выходит, что условия первой серии опытов были выбра- ны не слишком удачно. Но это не беда. Это просто свидетельствует о том, насколько хорошо исследователи знали предмет до начала экс- периментов. Опыт – дело наживное.
19
А теперь – «рояль в кустах». Дело в том, что использованный на- ми план первой серии экспериментов предполагает, что факторы свя- заны с откликом некоторым уравнением. Каким именно – мы не зна- ем, но надеемся, что, если различия между верхним и нижним уров- нями не слишком велики, то нас устроит уравнение плоскости в про- странстве соответствующей размерности. Для одного фактора это будет прямая линия, для двух факторов – обычная плоскость, а в нашем случае это будет плоскость в четырехмерном пространст- ве. Пожалуйста, не пугайтесь. Мы легко изучим все важные свойства этой поверхности и воспользуемся ими для дальнейшего совершен- ствования результатов.
Пока мы вычисляли эффекты факторов, нечаянно получилось ис- комое уравнение. Вот оно:
Y = b0 + b1x1 + b2x2 + b3x3
или
Y = 51,625 + 15,375x1 + 6,125x2 + 7,375x3.
Вообще, уравнения нужны для того, чтобы предсказывать резуль- таты опытов, которые не были проведены. Но сначала интересно вы- яснить, как они справляются с предсказанием тех результатов, кото- рые у нас уже есть. Нет ничего проще. Надо подставить в полученное уравнение кодированные условия каждого опыта и вычислить значе- ния отклика, предсказываемые найденным уравнением. Расширим табл. 2.2 и получим табл. 2.4.
Таблица 2.4
План и результаты первой серии экспериментов и предсказанные отклики
Номер опыта |
х1 |
х2 |
х3 |
Y |
Ŷ |
1 |
– |
– |
– |
21 |
22,750 |
2 |
+ |
– |
– |
55 |
53,500 |
3 |
– |
+ |
– |
34 |
35,000 |
4 |
+ |
+ |
– |
67 |
65,750 |
5 |
– |
– |
+ |
38 |
37,500 |
6 |
+ |
– |
+ |
68 |
68,250 |
7 |
– |
+ |
+ |
52 |
50,750 |
8 |
+ |
+ |
+ |
78 |
80,500 |
9 |
0 |
0 |
0 |
53 |
51,625 |
Знак «крышечка» над значениями отклика используется для пред- сказанных значений в отличие от экспериментальных данных, кото- рые ни в каких крышечках не нуждаются.
20
