Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Методология и практика планирования эксперимента в России. Монография
.pdf
2. ВТОРОЙ ЭТАП РАЗВИТИЯ ИССЛЕДОВАНИЙ
ПО ПЛАНИРОВАНИЮ ЭКСПЕРИМЕНТА
В РОССИИ (1981–1991)
2.1. Методологические исследования
На этом этапе обобщены основные результаты в развитии матема-
тической теории эксперимента:
1. Планирование эксперимента становится возможным только после того, как задана модель изучаемого объекта (явления). Модель –
формализация постановки задачи, должна предшествовать самому
эксперименту. Математическая модель – это вопрос, задаваемый исследователем природе. Как и всякий вопрос, модель имеет утверждающую
прошающую составляющую, которая может быть уместной или неуместной (но не истинной или ложной). На первом этапе утверждающей частью служит аналитический вид модели, в нем заложено
априорное знание об изучаемом предмете исследования. Вопрошающая часть модели – это требование дать числовую оценку
рам. После получения оценок вопрошающей частью модели становится требование адекватности модели экспериментальным данным.
Завершающей вопрошающей частью оказывается требование ее интерпретации. При заданной утвердительной части и некоторых фиксированных экспериментальных возможностях ответ получается тем
определеннее, чем слабее требования, задаваемые вопрошающей частью модели [13, 68].
2. Аксиомы математической теории эксперимента не
внутренне непротиворечивой структуры. Это мозаика исходных высказываний, которые могут быть и взаимоисключающими. Поэтому в
практическом плане основной задачей математической теории эксперимента становится разработка средств и приемов компромиссных
решений, создание архитектуры плана, в той или иной степени отвечающей нескольким критериям оптимальности. Формализованные
представления о критериях оптимальности не
го безусловного решения. Они обостряют интуицию экспериментатора при выборе архитектуры плана.
часть (она может быть правильной или ошибочной) и во-
парамет-
образуют
навязывают некоторо-
31

3. Значительная часть критериев оптимальности связывает распо-
ложение точек в пространстве независимых переменных с очевидными требованиями к дисперсионным характеристикам модели, следующим из геометрии эллипсоидов рассеяния. Здесь одно требование обладает высокой степенью общности: архитектура планов эксперимента должна включать все независимые переменные одновременно. Этот результат противоречит парадигматически закрепленному требованию (изменение факторов по одному), господствующему в науке более двух столетий.
4. Математическая теория эксперимента раскрыла механизм порождения систематических ошибок в оценке параметров модели. Это
собственно систематические ошибки, порождаемые неадекватностью
выбранной модели, ошибки в оценках параметров из-за неортогональности плана эксперимента. В практическом плане мало что удалось сделать. Ортогональное планирование возможно только для
простых полиномиальных моделей. Но уже для полинома второго
порядка ортогональное расположение точек заметно снижает эффективность, оцениваемую по дисперсионным критериям. И еще: экспериментатор с позиций математической теории эксперимента понимает всю сложность ситуации и это позволяет ему ориентироваться и
при выборе плана эксперимента
, и при выборе модели. Здесь важна
осторожная интерпретация всего исследования в целом.
5. Теория открыла ранее неизвестные приемы постановки отсеивающих экспериментов с числом опытов, меньшим чем число переменных, среди которых надо провести отсеивание и выделить доминирующую группу.
6. Возможность быть хорошим экспериментом определяется
прежде всего выбором модели. Но
при этом возникла новая проблема: что есть хорошая модель? Но эта проблема не может быть рассмотрена в рамках математического формализма. Свойства модели в
каждом конкретном случае определяются рядом частных обстоятельств: уровнем априорных сведений; постановкой самой задачи и пр.
Важно чтобы серьезность модели – вложенная в нее амбициозность,
соответствовала априорным
знаниям о моделируемом предмете.
7. Более отчетливо проявились трудности применения математи-
ческого формализма в экспериментальных исследованиях. Одна
трудность связана с усложнением модели. В простых моделях,
направленных на оценивание роли отдельных факторов, формализо-
32

ванные процедуры обычно позволяют получать надежные однозначные результаты. Для моделей, нелинейных по параметрам, оценки
параметров часто оказываются сильно коррелированными. Эта трудность дополняется чувствительностью модели к репараметризации.
Изменение ее структуры меняет значения всех параметров. Модели
разных исследователей, даже при небольшом различии в исходных
предметных предпосылках, могут заметно различаться, но одинаково
хорошо представлять экспериментальные данные.
Вторая трудность связана с процедурой дискриминации моделей.
Здесь формализм основан на предположении: среди конкурирующих
моделей имеется модель, которую (условно) можно назвать истинной. Лучшая модель в узком диапазоне варьирования переменными
может оказаться неадекватной при далекой экстраполяции, связанной, например, с переносом модели в производственные условия.
Вероятно,
стоит отказаться от основного принципа математической
статистики: представлять результаты не одной лучшей моделью, а
множеством равноправных моделей. Это обострит интуицию исследователя и заставит его быть более осторожным на стадии выполнения крупных проектных работ.
Из рассмотренных обобщений следует вывод: понимание того, что
есть хороший эксперимент, важнее, чем умение обращаться к
какому-
то частному решению, следующему из этой теории [13, 69, 70].
Проникновение математики в эксперимент привело к возникновению триады «объект исследования – планирование эксперимента –
ЭВМ». Появление персональных ЭВМ, банков данных и экспертных
систем способствовало повышению роли ЭВМ в этой триаде [71].
Например, по планированию и анализу эксперимента была разработана гибридная методо-ориентированная система
ПЛАНЭКС, в которую помимо самой экспертной системы входили: банк теорем; генератор планов; толковый словарь и тезаурус; библиографическая информация; блок игровых имитаций; статистический пакет прикладных программ для обработки данных. Логические правила типа «если–то» помогали принятию решений на неформализованных этапах –
при постановке задачи, выборе модели и пр
. Блок игровых имитаций
позволял до проведения опытов «проиграть» на ЭВМ различные варианты принятия решений [72].
Подсистемами компьютерной системы PLAN служат: каталог
планов эксперимента для оценивания полиномиальных моделей 2-го
33

и 3-го порядков (частично 1-го и 4-го) на кубе, шаре и симплексе, а
также для оценивания смешанных моделей (часть факторов смесевые, другие – несмесевые) – всего около 500 планов; таблицы статистических и нестатистических характеристик планов; список литературы по планам; справочник по математической теории эксперимента. Пакет решает такие задачи: поиск оптимального
плана для полиномиальной регрессии; выбор подмножества планов по заданным
признакам; обеспечение интерактивного режима работы с каталогом
планов; оценка модели по выбранному плану и выполнение регрессионного анализа [73].
На втором этапе методологических исследований увидела свет
книга «Таблицы планов эксперимента для факторных и полиномиальных моделей» [74]. На основе таблиц и инструкций
стало возможным построение планов, отвечающих различным требованиям и
следующим ограничениям:
1) моделями главных эффектов для многоуровневых факторов и
моделями с двухфакторными взаимодействиями для двухуровневых
факторов;
2) максимальным числом опытов – 64;
3) максимальным числом факторов – 40;
4) максимальным числом уровней – 8.
В каталоге представлены способы оценки эффективности синтезированных планов для разных критериев оптимальности. Теоретической
основой каталога планов для факторных моделей служила
монография В. З. Бродского [75]. В ней приведены также факторные
планы главных эффектов для двух факторов, один из которых основной, а другой – блоковый. Рассмотрены три типа неполноблочных
планов с равными размерами блоков: сбалансированные неполноблочные планы; частично сбалансированные неполноблочные
планы с двумя ассоциативными
классами; циклические планы. К ним
примыкают неполноблочные планы с неравными размерами блоков –
сбалансированные неравноблочные планы.
Значительное место в каталоге занимают планы для полиномиальных моделей 2-го и 3-го порядков. (Полиномиальные модели первого порядка рассмотрены ранее как частный случай факторных планов.) Для них область планирования – многомерные куб и шар. Для
2-го порядка представлены более 250 планов до семи факторов, для
третьего порядка – более 140 планов до четырех факторов. В свод-
34

ных характеристиках планов имеется информация: о статистических
свойствах эллипсоида рассеяния оценок параметров соответствующих планов; средней и максимальной дисперсий оценки модели по
заданной области; особенностях структуры ковариационной матрицы
оценок. Отмечены особенности, принимаемые во внимание при выборе плана: симметричность, композиционность, ортогональность и
пр. Сводные характеристики позволяют выбирать компромиссные
планы с учетом
основных и второстепенных характеристик. Составлены списки планов удовлетворяющие заданным ограничениям по
всем основным характеристикам. Кроме собственно планов, в каталог включены таблицы ковариационно-корреляционных матриц и
матриц линейных комбинаций результатов наблюдений для получения оценок параметров с помощью небольших калькуляторов.
В отдельный раздел выделены планы для полиномиальных моде-
лей,
когда область планирования – многомерный симплекс. Эти планы используются при моделировании многокомпонентных смесей. В
раздел входят полные и неполные полиномы степени 4 для 9 независимых переменных. Всего представлены 62 плана, почти каждый из
них обладает свойствами оптимальности по некоторым критериям.
Таблицы ковариационно-корреляционных матриц и коэффициенты
для обработки даны в формульном виде.
Все
разделы каталога иллюстрированы примерами и общими рекомендациями по выбору планов. Это позволяет каждый новый план,
выбранный или построенный по какому-либо критерию, сопоставить
с другими планами, выявить его преимущества по выбранному критерию, оценить другие особенности и практическую значимость [70].
На втором этапе исследований большое внимание уделялось про-
граммному обеспечению
задач планирования эксперимента, возможностям и перспективам применения персональных ЭВМ. Продолжались работы по созданию и изучению оптимальных и квазиоптимальных планов (А. П. Вощинин, В. И. Денисов и др.), комбинаторным планам и анализу компонент дисперсий (Е. В. Маркова,
Л. Н. Ежова, А. С. Новиков), диаграммам состав–свойство (Ф. С
. Новик, Ю. С. Слотин, Т. А. Чемлева и др.), динамическому планированию эксперимента (Г. К. Круг, В. Л. Саванов), нелинейным моделям
(В. Г. Горский, О. В. Кабанова и др.). Развивались новые направления: планирование эксперимента при наличии систематических погрешностей; планирование в функциональных пространствах, прове-
35

дение эксперимента при создании автоматизированных систем
управления проектируемых и действующих производств и пр. Математическая теория эксперимента сблизилась с современными проблемами математической статистики, теории вероятностей, анализа данных (статистика объектов нечисловой природы, теория психологических измерений, методы многомерного шкалирования и т.д.) [25, 64].
Значительный круг теоретических и методологических задач был
рассмотрен
в справочном руководстве [76]. С позиций многокритериального подхода изложены экстремальный эксперимент и связанные с ним методы планирования регрессионного и факторного эксперимента, методы стохастического программирования, эксперимент
по проверке статистической гипотезы (дискриминирующий эксперимент), отсеивающий эксперимент, имитационный эксперимент, в котором ряд результатов по его планированию получен при использовании
метода Монте-Карло и при исследовании сложных систем (типа моделей ядерного реактора). Для этих типов эксперимента имелись математические модели и методы. Развитие методов их анализа
позволило формулировать и изучать задачи планирования эксперимента в более сложных случаях.
В этот период продолжали выходить переводы зарубежных книг.
Вот некоторые примеры: Ф
. Мостеллер, Дж. Тьюки «Анализ данных
и регрессия». Вып. 1. [77]; Мостеллер Ф., Тьюки Дж. «Анализ данных и регрессия». – Вып. 2. [78]; М. Холлендер, Д. Вулф «Непараметрические методы статистики» [79]; Б. Эфрон «Нетрадиционные
методы многомерного статистического анализа» [80]; справочник по
прикладной статистике. Т. 1 [81].
В этот период удалось опубликовать старую работу А. А. Люби-
щева «Дисперсионный
анализ в биологии» [82]. Отметим еще сборник «Математические методы планирования эксперимента» под редакцией В. В. Пененко [83].
Любопытно, что начали появляться переводы книг в конкретных
областях приложения, например в психологии: Р. Готтсданкер «Основы психологического эксперимента» [84].
Пожалуй, наиболее важным методологическими прорывом этого
времени стало осознание единства статистических моделей в рамках
общего
представления регрессионного анализа. Это стало особенно
ясно после выхода в свет второго русского издания монографии Н.
Дрейпер, Г. Смит «Прикладной регрессионный анализ» [85]. (первое
36

русское издание было в 1973 г.). В предисловии переводчиков было
кратко изложено это новое понимание ситуации, которым мы ниже
частично воспользуемся.
При желании можно «погрузить» в расширенно понимаемую регрессионную модель все планирование эксперимента и даже всю статистику. Известно, что регрессионный анализ состоит из вычислительной процедуры, предложенный К.-Ф. Гауссом
и А. Лежандром
на рубеже XVIII и XIX вв., и статистической модели данных. Плюс,
конечно, модель объекта. Для моделей объектов удобно использовать набор «ящиков» – от черного, когда перед началом исследования мы ничего не знаем об объекте (его предложил Н. Винер, когда
разрабатывал кибернетику), до белого, когда об объекте известно
все,
что мы хотели бы знать, и никакие эксперименты больше не
нужны. Для черных ящиков естественно подбирать полином, причем
самый простой из всех, что согласуется с имеющимися данными. Ну
а при приближении к белому ящику все зависит от тех теорий, которые удалось создать в соответствующей области исследований. Поскольку теоретики редко
думают об эксперименте, они обычно выдумывают что-нибудь замысловатое, вроде системы интегродифференциальных уравнений, что в итоге оборачивается для экспериментаторов большими проблемами. Из вычислительных процедур регрессии в настоящее время, несомненно, лидирует метод наименьших
квадратов (МНК), который как раз и придумали Гаусс и Лежандр. Среди конкурентов стоит
упомянуть метод средних, когда минимизируется
не сумма квадратов отклонений, а сумма их модулей, и метод минимакса, когда коэффициенты отыскиваются из условия минимума самого
большого отклонения. Главный камень преткновения – это статистическая модель данных. Собственно, классическая модель регрессии основана на том, что все переменные – и факторы, и отклики – заданы и
сомнений не вызывают, что факторы детерминированы, т.е. известны с
абсолютной точностью, без всяких ошибок, что пока неизвестные параметры модели объекта тоже детерминированы, что отклики – независимые случайные переменные с нормальным законом распределения и с одинаковыми дисперсиями (равноточные), что, наконец, все
переменные измеряются в непрерывных шкалах.
По
отношению к постулатам возможны три позиции: знать, верить, проверять. Если известно, что постулаты статистической модели верны, то «нам сам черт не страшен». Примерно 150 лет люди
37

«знали», что отклик подчиняется нормальному закону, и это снимало
массу проблем, которые не заставили себя ждать, как только это знание рухнуло. Знания, однако, легко заменяет вера. Можно верить до
тех пор, пока результаты не войдут в вопиющее противоречие с верой и иссякнут все мыслимые оправдания этих противоречий. Самые
дотошные люди, естественно, предпочитают все проверять, не считаясь с затратами и потерей времени. К счастью, иногда проверки бывают косвенными, но во всех случаях они оказываются затратными.
Выбор факторов и откликов – одно из ключевых условий успеха
любого исследования. Для пассивного эксперимента это нисколько
не менее важно, чем для активного. Но
здесь нас ждут несколько
трудно преодолимых препятствий. Начнем с их числа. Из общих соображений ясно, что с любым объектом исследования можно связать
бесконечное множество факторов. Это, правда, слабо утешает. Если
же перевести вопрос в практическую плоскость, то число выбранных
для исследования факторов, видимо, можно связать с некоторым
представлением о
сложности изучаемого объекта и о характере самой решаемой задачи. Видимо, сложность решаемых задач может
служить некоторой косвенной характеристикой того, что принято
называть научно-техническим прогрессом. Тогда можно предположить, что на том уровне, на котором находилась человеческая цивилизация в ушедшем веке, уровень сложности изучаемых систем с
эмпирической точки зрения
можно оценивать числами факторов порядка 500–1000. Правда, в новом веке ситуация изменилась. Теперь
благодаря высоким технологиям стало возможно говорить об исследованиях с десятками и даже сотнями тысяч факторов. При этом и
сам характер эксперимента меняется: из чисто эмпирического физического эксперимента он превращается в гибрид физического и машинного
имитационного эксперимента или вовсе в чисто имитационный эксперимент. Ростки этого мы уже видели в прошлом веке, но
только с появлением концепции Big Data (смотри, например, обзор
Ю. П. Адлер, Е. А. Черных «Хорошо бы, хорошо бы, нам кита поймать большого», или кому и зачем нужны Большие Данные (Big
Data)» [86].) процесс был поставлен
на промышленные рельсы. Вернемся пока к физическому эксперименту. Здесь работать с сотнями
факторов мы пока не умеем, но ничто не мешает нам организовать
экспертную процедуру априорного ранжирования факторов. Это дает
надежду на сокращение списка факторов примерно на порядок, т.е.
38

до 50. А теперь уже можно попробовать провести эксперимент, даже
активный, с помощью процедуры метода случайного баланса или
иной отсеивающей процедуры. Цель этого этапа – свести число
оставшихся факторов до 15–5 штук, где господствует факторный
эксперимент, а затем и изучение поверхности отклика.
Все это длинное рассуждение предполагает, что сами факторы в
физическом смысле мы
задавать умеем, что на самом деле весьма
сомнительно. Люди всегда стремятся найти фундаментальные факторы, которые позволяют интерпретировать полученные результаты
в содержательных терминах. Тогда получается, что экспериментатор
изменяет или фиксирует те переменные, какие ему доступны, а на их
основании хочет построить сами фундаментальные факторы. При
этом можно предполагать, что фундаментальные
факторы будут некоторыми функциями от измеряемых факторов. Это ведет к поиску
преобразований факторного пространства и к регрессии на новых
факторах. Этот подход получил название факторного анализа. Он
включает в себя десятки различных методов. Их особенность – неоднозначность получаемых моделей, что естественно, поскольку могут
быть разные представления о фундаментальных факторах. Постав
щиками переменных могут служить самые разные модели, например,
теория подобия и анализ размерностей, модели роста и развития
сложных систем, и т.п. Добавим еще, что играет роль и метрика факторного пространства, и измерительных шкалы для факторов.
С откликами тоже не все обстоит просто. Случай, когда исследо-
вателя интересует только
один отклик, встречается крайне редко.
Обычно откликов несколько, а иногда – много. Тогда приходится
либо строить регрессионную модель отдельно для каждого отклика,
что часто накладно и затрудняет решение оптимизационных задач,
либо искать подходящую свертку множества откликов. Задачи многокритериальной, или многооткликовой, оптимизации составляют
большое научное направление. Среди эмпирических методов свертки
часто используются
функция желательности Харрингтона и функция
потерь по Тагути [87].
И для факторов, и для откликов в запасе есть еще преобразования,
как формальные, так и содержательные.
Другая проблема связана с непрерывностью или дискретностью
значений факторов. Непрерывность шкал всех факторов – требование регрессионной модели. А что, если все факторы дискретные?
-
39

Тогда возникает частный случай этой модели, известный как дисперсионный анализ – детище Р. Фишера. Именно в рамках этой модели
исторически возникла современная концепция планирования эксперимента. Если же некоторые факторы задаются в непрерывных шкалах, а остальные – в дискретных, то возникает модель ковариационного анализа, не нашедшая пока широкого применения.
Отклик
тоже может принимать дискретные значения. Тогда возникает модель дискриминантного анализа и бесконечные варианты
теории распознавания образов и теории классификации.
Регрессионная модель по умолчанию предполагает, что все нужные и возможные данные уже собраны и речь идет только об их обработке и интерпретации. Но в жизни процесс сбора данных,
активных или пассивных, никогда не прекращается. Поэтому приходится
рассматривать последовательные итеративные процедуры в духе алгоритма А. Вальда. Этот подход был обобщен в моделях стохастической аппроксимации, где предусматриваются возможности добавления в матрицу плана или в матрицу пассивных наблюдений новых
строк и удаления старых. Модели такого рода иногда называют
те-
кущим регрессионным анализом.
Но и уже собранными данными можно распорядиться по-разному.
Классическая модель предполагает, что все имеющиеся данные надо
использовать с максимальной возможной эффективностью. Каждая
степень свободы, добытая нелегким трудом экспериментатора,
должна аккуратно использоваться статистиком при обработке данных. И эта догма была поставлена под сомнение теми, кто
разработал
метод складного ножа, метод перепроверки, а затем и бутстреп. В
сущности это методы планирования эксперимента по управлению
имеющейся выборкой экспериментальных данных. Они допускают
исключение из выборки по одному опыту, построение регрессионной
модели по оставшимся факторам с проверкой адекватности модели
по исключенной точке.
Такой последовательный перебор дает важную дополнительную
информацию о
структуре выборки и отчасти о свойствах объекта исследования. В классической модели для проверки адекватности используются остаточные степени свободы, причем нужна еще независимая информация об ошибке воспроизводимости, которую трудно
добыть вне активного эксперимента. Здесь же используются результаты свободных опытов, которые не участвовали в оценивании моде-
40
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
