Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Методология и практика планирования эксперимента в России. Монография

.pdf
Скачиваний:
0
Добавлен:
07.09.2026
Размер:
1 Мб
Скачать
☆
2. ВТОРОЙ ЭТАП РАЗВИТИЯ ИССЛЕДОВАНИЙ ПО ПЛАНИРОВАНИЮ ЭКСПЕРИМЕНТА
В РОССИИ (1981–1991)
2.1. Методологические исследования
На этом этапе обобщены основные результаты в развитии матема-
тической теории эксперимента:
1. Планирование эксперимента становится возможным только по­сле того, как задана модель изучаемого объекта (явления). Модель – формализация постановки задачи, должна предшествовать самому эксперименту. Математическая модель – это вопрос, задаваемый ис­следователем природе. Как и всякий вопрос, модель имеет утвер­ждающую прошающую составляющую, которая может быть уместной или не­уместной (но не истинной или ложной). На первом этапе утвержда­ющей частью служит аналитический вид модели, в нем заложено априорное знание об изучаемом предмете исследования. Вопроша­ющая часть модели – это требование дать числовую оценку рам. После получения оценок вопрошающей частью модели стано­вится требование адекватности модели экспериментальным данным. Завершающей вопрошающей частью оказывается требование ее ин­терпретации. При заданной утвердительной части и некоторых фик­сированных экспериментальных возможностях ответ получается тем определеннее, чем слабее требования, задаваемые вопрошающей ча­стью модели [13, 68].
2. Аксиомы математической теории эксперимента не внутренне непротиворечивой структуры. Это мозаика исходных вы­сказываний, которые могут быть и взаимоисключающими. Поэтому в практическом плане основной задачей математической теории экс­перимента становится разработка средств и приемов компромиссных решений, создание архитектуры плана, в той или иной степени отве­чающей нескольким критериям оптимальности. Формализованные представления о критериях оптимальности не го безусловного решения. Они обостряют интуицию эксперимента­тора при выборе архитектуры плана.
часть (она может быть правильной или ошибочной) и во-
парамет-
образуют
навязывают некоторо-
31
3. Значительная часть критериев оптимальности связывает распо-
ложение точек в пространстве независимых переменных с очевид­ными требованиями к дисперсионным характеристикам модели, сле­дующим из геометрии эллипсоидов рассеяния. Здесь одно требова­ние обладает высокой степенью общности: архитектура планов экс­перимента должна включать все независимые переменные одновре­менно. Этот результат противоречит парадигматически закреплен­ному требованию (изменение факторов по одному), господствующе­му в науке более двух столетий.
4. Математическая теория эксперимента раскрыла механизм по­рождения систематических ошибок в оценке параметров модели. Это собственно систематические ошибки, порождаемые неадекватностью выбранной модели, ошибки в оценках параметров из-за неортого­нальности плана эксперимента. В практическом плане мало что уда­лось сделать. Ортогональное планирование возможно только для простых полиномиальных моделей. Но уже для полинома второго порядка ортогональное расположение точек заметно снижает эффек­тивность, оцениваемую по дисперсионным критериям. И еще: экспе­риментатор с позиций математической теории эксперимента понима­ет всю сложность ситуации и это позволяет ему ориентироваться и при выборе плана эксперимента
, и при выборе модели. Здесь важна
осторожная интерпретация всего исследования в целом.
5. Теория открыла ранее неизвестные приемы постановки отсеи­вающих экспериментов с числом опытов, меньшим чем число пере­менных, среди которых надо провести отсеивание и выделить доми­нирующую группу.
6. Возможность быть хорошим экспериментом определяется прежде всего выбором модели. Но
при этом возникла новая пробле­ма: что есть хорошая модель? Но эта проблема не может быть рас­смотрена в рамках математического формализма. Свойства модели в каждом конкретном случае определяются рядом частных обстоятель­ств: уровнем априорных сведений; постановкой самой задачи и пр. Важно чтобы серьезность модели – вложенная в нее амбициозность, соответствовала априорным
знаниям о моделируемом предмете.
7. Более отчетливо проявились трудности применения математи-
ческого формализма в экспериментальных исследованиях. Одна трудность связана с усложнением модели. В простых моделях, направленных на оценивание роли отдельных факторов, формализо-
32
ванные процедуры обычно позволяют получать надежные однознач­ные результаты. Для моделей, нелинейных по параметрам, оценки параметров часто оказываются сильно коррелированными. Эта труд­ность дополняется чувствительностью модели к репараметризации. Изменение ее структуры меняет значения всех параметров. Модели разных исследователей, даже при небольшом различии в исходных предметных предпосылках, могут заметно различаться, но одинаково хорошо представлять экспериментальные данные.
Вторая трудность связана с процедурой дискриминации моделей. Здесь формализм основан на предположении: среди конкурирующих моделей имеется модель, которую (условно) можно назвать истин­ной. Лучшая модель в узком диапазоне варьирования переменными может оказаться неадекватной при далекой экстраполяции, связан­ной, например, с переносом модели в производственные условия. Вероятно,
стоит отказаться от основного принципа математической статистики: представлять результаты не одной лучшей моделью, а множеством равноправных моделей. Это обострит интуицию иссле­дователя и заставит его быть более осторожным на стадии выполне­ния крупных проектных работ.
Из рассмотренных обобщений следует вывод: понимание того, что
есть хороший эксперимент, важнее, чем умение обращаться к
какому-
то частному решению, следующему из этой теории [13, 69, 70].
Проникновение математики в эксперимент привело к возникнове­нию триады «объект исследования – планирование эксперимента – ЭВМ». Появление персональных ЭВМ, банков данных и экспертных систем способствовало повышению роли ЭВМ в этой триаде [71]. Например, по планированию и анализу эксперимента была разрабо­тана гибридная методо-ориентированная система
ПЛАНЭКС, в кото­рую помимо самой экспертной системы входили: банк теорем; гене­ратор планов; толковый словарь и тезаурус; библиографическая ин­формация; блок игровых имитаций; статистический пакет приклад­ных программ для обработки данных. Логические правила типа «ес­ли–то» помогали принятию решений на неформализованных этапах – при постановке задачи, выборе модели и пр
. Блок игровых имитаций позволял до проведения опытов «проиграть» на ЭВМ различные ва­рианты принятия решений [72].
Подсистемами компьютерной системы PLAN служат: каталог
планов эксперимента для оценивания полиномиальных моделей 2-го
33
и 3-го порядков (частично 1-го и 4-го) на кубе, шаре и симплексе, а также для оценивания смешанных моделей (часть факторов смесе­вые, другие – несмесевые) – всего около 500 планов; таблицы стати­стических и нестатистических характеристик планов; список литера­туры по планам; справочник по математической теории эксперимен­та. Пакет решает такие задачи: поиск оптимального
плана для поли­номиальной регрессии; выбор подмножества планов по заданным признакам; обеспечение интерактивного режима работы с каталогом планов; оценка модели по выбранному плану и выполнение регрес­сионного анализа [73].
На втором этапе методологических исследований увидела свет книга «Таблицы планов эксперимента для факторных и полиноми­альных моделей» [74]. На основе таблиц и инструкций
стало воз­можным построение планов, отвечающих различным требованиям и следующим ограничениям:
1) моделями главных эффектов для многоуровневых факторов и моделями с двухфакторными взаимодействиями для двухуровневых факторов;
2) максимальным числом опытов – 64;
3) максимальным числом факторов – 40;
4) максимальным числом уровней – 8.
В каталоге представлены способы оценки эффективности синте­зированных планов для разных критериев оптимальности. Теорети­ческой
основой каталога планов для факторных моделей служила монография В. З. Бродского [75]. В ней приведены также факторные планы главных эффектов для двух факторов, один из которых основ­ной, а другой – блоковый. Рассмотрены три типа неполноблочных планов с равными размерами блоков: сбалансированные непол­ноблочные планы; частично сбалансированные неполноблочные планы с двумя ассоциативными
классами; циклические планы. К ним примыкают неполноблочные планы с неравными размерами блоков – сбалансированные неравноблочные планы.
Значительное место в каталоге занимают планы для полиноми­альных моделей 2-го и 3-го порядков. (Полиномиальные модели пер­вого порядка рассмотрены ранее как частный случай факторных пла­нов.) Для них область планирования – многомерные куб и шар. Для 2-го порядка представлены более 250 планов до семи факторов, для третьего порядка – более 140 планов до четырех факторов. В свод-
34
ных характеристиках планов имеется информация: о статистических свойствах эллипсоида рассеяния оценок параметров соответствую­щих планов; средней и максимальной дисперсий оценки модели по заданной области; особенностях структуры ковариационной матрицы оценок. Отмечены особенности, принимаемые во внимание при вы­боре плана: симметричность, композиционность, ортогональность и пр. Сводные характеристики позволяют выбирать компромиссные планы с учетом
основных и второстепенных характеристик. Состав­лены списки планов удовлетворяющие заданным ограничениям по всем основным характеристикам. Кроме собственно планов, в ката­лог включены таблицы ковариационно-корреляционных матриц и матриц линейных комбинаций результатов наблюдений для получе­ния оценок параметров с помощью небольших калькуляторов.
В отдельный раздел выделены планы для полиномиальных моде-
лей,
когда область планирования – многомерный симплекс. Эти пла­ны используются при моделировании многокомпонентных смесей. В раздел входят полные и неполные полиномы степени 4 для 9 незави­симых переменных. Всего представлены 62 плана, почти каждый из них обладает свойствами оптимальности по некоторым критериям. Таблицы ковариационно-корреляционных матриц и коэффициенты для обработки даны в формульном виде.
Все
разделы каталога иллюстрированы примерами и общими ре­комендациями по выбору планов. Это позволяет каждый новый план, выбранный или построенный по какому-либо критерию, сопоставить с другими планами, выявить его преимущества по выбранному кри­терию, оценить другие особенности и практическую значимость [70].
На втором этапе исследований большое внимание уделялось про-
граммному обеспечению
задач планирования эксперимента, возмож­ностям и перспективам применения персональных ЭВМ. Продолжа­лись работы по созданию и изучению оптимальных и квази­оптимальных планов (А. П. Вощинин, В. И. Денисов и др.), комбина­торным планам и анализу компонент дисперсий (Е. В. Маркова, Л. Н. Ежова, А. С. Новиков), диаграммам состав–свойство (Ф. С
. Но­вик, Ю. С. Слотин, Т. А. Чемлева и др.), динамическому планирова­нию эксперимента (Г. К. Круг, В. Л. Саванов), нелинейным моделям (В. Г. Горский, О. В. Кабанова и др.). Развивались новые направле­ния: планирование эксперимента при наличии систематических по­грешностей; планирование в функциональных пространствах, прове-
35
дение эксперимента при создании автоматизированных систем управления проектируемых и действующих производств и пр. Мате­матическая теория эксперимента сблизилась с современными пробле­мами математической статистики, теории вероятностей, анализа дан­ных (статистика объектов нечисловой природы, теория психологиче­ских измерений, методы многомерного шкалирования и т.д.) [25, 64].
Значительный круг теоретических и методологических задач был
рассмотрен
в справочном руководстве [76]. С позиций многокрите­риального подхода изложены экстремальный эксперимент и связан­ные с ним методы планирования регрессионного и факторного экс­перимента, методы стохастического программирования, эксперимент по проверке статистической гипотезы (дискриминирующий экспери­мент), отсеивающий эксперимент, имитационный эксперимент, в ко­тором ряд результатов по его планированию получен при использо­вании
метода Монте-Карло и при исследовании сложных систем (ти­па моделей ядерного реактора). Для этих типов эксперимента име­лись математические модели и методы. Развитие методов их анализа позволило формулировать и изучать задачи планирования экспери­мента в более сложных случаях.
В этот период продолжали выходить переводы зарубежных книг.
Вот некоторые примеры: Ф
. Мостеллер, Дж. Тьюки «Анализ данных и регрессия». Вып. 1. [77]; Мостеллер Ф., Тьюки Дж. «Анализ дан­ных и регрессия». – Вып. 2. [78]; М. Холлендер, Д. Вулф «Непара­метрические методы статистики» [79]; Б. Эфрон «Нетрадиционные методы многомерного статистического анализа» [80]; справочник по прикладной статистике. Т. 1 [81].
В этот период удалось опубликовать старую работу А. А. Люби-
щева «Дисперсионный
анализ в биологии» [82]. Отметим еще сбор­ник «Математические методы планирования эксперимента» под ре­дакцией В. В. Пененко [83].
Любопытно, что начали появляться переводы книг в конкретных областях приложения, например в психологии: Р. Готтсданкер «Ос­новы психологического эксперимента» [84].
Пожалуй, наиболее важным методологическими прорывом этого времени стало осознание единства статистических моделей в рамках общего
представления регрессионного анализа. Это стало особенно ясно после выхода в свет второго русского издания монографии Н. Дрейпер, Г. Смит «Прикладной регрессионный анализ» [85]. (первое
36
русское издание было в 1973 г.). В предисловии переводчиков было кратко изложено это новое понимание ситуации, которым мы ниже частично воспользуемся.
При желании можно «погрузить» в расширенно понимаемую ре­грессионную модель все планирование эксперимента и даже всю ста­тистику. Известно, что регрессионный анализ состоит из вычисли­тельной процедуры, предложенный К.-Ф. Гауссом
и А. Лежандром на рубеже XVIII и XIX вв., и статистической модели данных. Плюс, конечно, модель объекта. Для моделей объектов удобно использо­вать набор «ящиков» – от черного, когда перед началом исследова­ния мы ничего не знаем об объекте (его предложил Н. Винер, когда разрабатывал кибернетику), до белого, когда об объекте известно все,
что мы хотели бы знать, и никакие эксперименты больше не нужны. Для черных ящиков естественно подбирать полином, причем самый простой из всех, что согласуется с имеющимися данными. Ну а при приближении к белому ящику все зависит от тех теорий, кото­рые удалось создать в соответствующей области исследований. По­скольку теоретики редко
думают об эксперименте, они обычно вы­думывают что-нибудь замысловатое, вроде системы интегро­дифференциальных уравнений, что в итоге оборачивается для экспери­ментаторов большими проблемами. Из вычислительных процедур ре­грессии в настоящее время, несомненно, лидирует метод наименьших квадратов (МНК), который как раз и придумали Гаусс и Лежандр. Сре­ди конкурентов стоит
упомянуть метод средних, когда минимизируется не сумма квадратов отклонений, а сумма их модулей, и метод минимак­са, когда коэффициенты отыскиваются из условия минимума самого большого отклонения. Главный камень преткновения – это статистиче­ская модель данных. Собственно, классическая модель регрессии осно­вана на том, что все переменные – и факторы, и отклики – заданы и
со­мнений не вызывают, что факторы детерминированы, т.е. известны с абсолютной точностью, без всяких ошибок, что пока неизвестные па­раметры модели объекта тоже детерминированы, что отклики – неза­висимые случайные переменные с нормальным законом распределе­ния и с одинаковыми дисперсиями (равноточные), что, наконец, все переменные измеряются в непрерывных шкалах.
По
отношению к постулатам возможны три позиции: знать, ве­рить, проверять. Если известно, что постулаты статистической моде­ли верны, то «нам сам черт не страшен». Примерно 150 лет люди
37
«знали», что отклик подчиняется нормальному закону, и это снимало
массу проблем, которые не заставили себя ждать, как только это зна­ние рухнуло. Знания, однако, легко заменяет вера. Можно верить до тех пор, пока результаты не войдут в вопиющее противоречие с ве­рой и иссякнут все мыслимые оправдания этих противоречий. Самые дотошные люди, естественно, предпочитают все проверять, не счита­ясь с затратами и потерей времени. К счастью, иногда проверки бы­вают косвенными, но во всех случаях они оказываются затратными.
Выбор факторов и откликов – одно из ключевых условий успеха любого исследования. Для пассивного эксперимента это нисколько не менее важно, чем для активного. Но
здесь нас ждут несколько трудно преодолимых препятствий. Начнем с их числа. Из общих со­ображений ясно, что с любым объектом исследования можно связать бесконечное множество факторов. Это, правда, слабо утешает. Если же перевести вопрос в практическую плоскость, то число выбранных для исследования факторов, видимо, можно связать с некоторым представлением о
сложности изучаемого объекта и о характере са­мой решаемой задачи. Видимо, сложность решаемых задач может служить некоторой косвенной характеристикой того, что принято называть научно-техническим прогрессом. Тогда можно предполо­жить, что на том уровне, на котором находилась человеческая циви­лизация в ушедшем веке, уровень сложности изучаемых систем с эмпирической точки зрения
можно оценивать числами факторов по­рядка 500–1000. Правда, в новом веке ситуация изменилась. Теперь благодаря высоким технологиям стало возможно говорить об иссле­дованиях с десятками и даже сотнями тысяч факторов. При этом и сам характер эксперимента меняется: из чисто эмпирического физи­ческого эксперимента он превращается в гибрид физического и ма­шинного
имитационного эксперимента или вовсе в чисто имитаци­онный эксперимент. Ростки этого мы уже видели в прошлом веке, но только с появлением концепции Big Data (смотри, например, обзор Ю. П. Адлер, Е. А. Черных «Хорошо бы, хорошо бы, нам кита пой­мать большого», или кому и зачем нужны Большие Данные (Big Data)» [86].) процесс был поставлен
на промышленные рельсы. Вер­немся пока к физическому эксперименту. Здесь работать с сотнями факторов мы пока не умеем, но ничто не мешает нам организовать экспертную процедуру априорного ранжирования факторов. Это дает надежду на сокращение списка факторов примерно на порядок, т.е.
38
до 50. А теперь уже можно попробовать провести эксперимент, даже активный, с помощью процедуры метода случайного баланса или иной отсеивающей процедуры. Цель этого этапа – свести число оставшихся факторов до 15–5 штук, где господствует факторный эксперимент, а затем и изучение поверхности отклика.
Все это длинное рассуждение предполагает, что сами факторы в
физическом смысле мы
задавать умеем, что на самом деле весьма сомнительно. Люди всегда стремятся найти фундаментальные фак­торы, которые позволяют интерпретировать полученные результаты в содержательных терминах. Тогда получается, что экспериментатор изменяет или фиксирует те переменные, какие ему доступны, а на их основании хочет построить сами фундаментальные факторы. При этом можно предполагать, что фундаментальные
факторы будут не­которыми функциями от измеряемых факторов. Это ведет к поиску преобразований факторного пространства и к регрессии на новых факторах. Этот подход получил название факторного анализа. Он включает в себя десятки различных методов. Их особенность – неод­нозначность получаемых моделей, что естественно, поскольку могут быть разные представления о фундаментальных факторах. Постав щиками переменных могут служить самые разные модели, например, теория подобия и анализ размерностей, модели роста и развития сложных систем, и т.п. Добавим еще, что играет роль и метрика фак­торного пространства, и измерительных шкалы для факторов.
С откликами тоже не все обстоит просто. Случай, когда исследо-
вателя интересует только
один отклик, встречается крайне редко. Обычно откликов несколько, а иногда – много. Тогда приходится либо строить регрессионную модель отдельно для каждого отклика, что часто накладно и затрудняет решение оптимизационных задач, либо искать подходящую свертку множества откликов. Задачи мно­гокритериальной, или многооткликовой, оптимизации составляют большое научное направление. Среди эмпирических методов свертки часто используются
функция желательности Харрингтона и функция
потерь по Тагути [87].
И для факторов, и для откликов в запасе есть еще преобразования,
как формальные, так и содержательные.
Другая проблема связана с непрерывностью или дискретностью значений факторов. Непрерывность шкал всех факторов – требова­ние регрессионной модели. А что, если все факторы дискретные?
-
39
Тогда возникает частный случай этой модели, известный как диспер­сионный анализ – детище Р. Фишера. Именно в рамках этой модели
исторически возникла современная концепция планирования экспе­римента. Если же некоторые факторы задаются в непрерывных шка­лах, а остальные – в дискретных, то возникает модель ковариацион­ного анализа, не нашедшая пока широкого применения.
Отклик
тоже может принимать дискретные значения. Тогда воз­никает модель дискриминантного анализа и бесконечные варианты теории распознавания образов и теории классификации.
Регрессионная модель по умолчанию предполагает, что все нуж­ные и возможные данные уже собраны и речь идет только об их об­работке и интерпретации. Но в жизни процесс сбора данных,
актив­ных или пассивных, никогда не прекращается. Поэтому приходится рассматривать последовательные итеративные процедуры в духе ал­горитма А. Вальда. Этот подход был обобщен в моделях стохастиче­ской аппроксимации, где предусматриваются возможности добавле­ния в матрицу плана или в матрицу пассивных наблюдений новых строк и удаления старых. Модели такого рода иногда называют
те-
кущим регрессионным анализом.
Но и уже собранными данными можно распорядиться по-разному. Классическая модель предполагает, что все имеющиеся данные надо использовать с максимальной возможной эффективностью. Каждая степень свободы, добытая нелегким трудом экспериментатора, должна аккуратно использоваться статистиком при обработке дан­ных. И эта догма была поставлена под сомнение теми, кто
разработал метод складного ножа, метод перепроверки, а затем и бутстреп. В сущности это методы планирования эксперимента по управлению имеющейся выборкой экспериментальных данных. Они допускают исключение из выборки по одному опыту, построение регрессионной модели по оставшимся факторам с проверкой адекватности модели по исключенной точке.
Такой последовательный перебор дает важную дополнительную
информацию о
структуре выборки и отчасти о свойствах объекта ис­следования. В классической модели для проверки адекватности ис­пользуются остаточные степени свободы, причем нужна еще незави­симая информация об ошибке воспроизводимости, которую трудно добыть вне активного эксперимента. Здесь же используются резуль­таты свободных опытов, которые не участвовали в оценивании моде-
40
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]