Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Методология и практика планирования эксперимента в России. Монография
.pdf
ли объекта. Процедура бутстреп, предложенная Б. Эфроном в 1978 г.,
идет еще дальше, предлагая тиражировать выборки, похожие на исходную, и получать совокупные эмпирические функции распределения исследуемых параметров. Конечно, за упражнения с выборками
приходится платить машинным временем и проблемами со степенями свободы.
Если в дисперсионном анализе представление о детерминирован-
ных
уровнях факторов представляется разумным, то для непрерывных факторов это кажется абсурдным. Поэтому неудивительно, что
систематически предпринимались попытки замены этого постулата
на представление о факторах, как о случайных величинах. С идейной
точки зрения особых трудностей это не представляет. Для этого достаточно постулировать, что факторы вместе с откликом образуют
многомерную
случайную величину с многомерным нормальным
распределением. В двухмерном случае это ведет к коэффициенту
корреляции К. Пирсона, который играет огромную роль в статистике
и в планировании эксперимента. Есть и подходящее обобщение критерия Стьюдента – критерий Хотелинга. Но в многомерном случае
практических результатов пока, насколько мы знаем, получить не
удалось.
Пришлось отступить на
заранее подготовленные позиции. Компромиссную модель конфлюэнтного анализа предложил в 30-е годы
прошлого века Р. Фриш. В этой модели предполагается, что при
нормально распределенном отклике факторы тоже могут иметь одномерные усеченные нормальные распределения. И нет никаких
многомерных требований. Тогда удается построить процедуру обработки данных, сводящуюся к многократному решению
регрессион-
ной задачи.
Неудивительно, что на модель данных оказывает влияние модель
объекта. Так, если изучаемый объект изменяется во времени, это
приходится учитывать в модели данных. Одна из особенностей таких
данных – корреляция близких значений отклика во времени даже при
изменяющихся значениях факторов. Многие системы обладают
инерцией, обусловленной теми или иными причинами. В
таких случаях часто используются модели авторегрессии, которые усредняют
результаты некоторого числа соседних значений, меняя коррелированность на сокращение числа степеней свободы, зато уже некоррелированных данных. Возможны и другие варианты, например замена
41

постулатов об откликах – случайных величинах на постулат о случайных последовательностях (для дискретных данных) или случайных процессах (для непрерывных). Ну а если еще и факторы при
этом меняются во времени или в пространстве, то возникает модель
случайных полей.
По умолчанию параметры модели объекта считаются детермини-
рованными. Но если есть априорная
информация об их законах распределения, то возникают модели байесовского типа, когда для оценок параметров используются их условные математические ожидания, вычисляемые по обобщенной формуле Байеса. В сущности, это
эквивалентно тому, что мы отталкиваемся от некоторой априорно
заданной функции распределения, например нормальной, и, продолжая накапливать данные, систематически проверяем
гипотезу о том,
можно ли ее отвергнуть. Рано или поздно данных для этого оказывается достаточно, поэтому мы отвергаем априорную гипотезу и выдвигаем новую, которую снова, говоря словами К. Поппера, подвергаем
процедуре фальсификации, накапливая экспериментальные данные.
Потеряв уверенность в том, что отклик распределен нормально,
мы оказались в плену у априорной
информации о законе распределения отклика. Когда этот закон известен заранее, каким бы он ни был,
можно воспользоваться методом максимума правдоподобия, разработанным Р. Фишером. Классический регрессионной анализ оказывается частным случаем этого метода. На практике он встречается
редко, поскольку мы редко располагаем такой информацией.
Другое дело – попробовать обойтись без
знаний о законе распределения либо потому, что мы его не знаем, либо потому, что не хотим знать. Эта область называется непараметрической статистикой
и, соответственно, в ней есть непараметрический вариант регрессионного анализа. Если закон распределения известен, то непараметрический вариант всегда хуже, но когда в законе распределения появляется
«червь сомнения», ситуация радикально меняется. Чем этот
«червь» больше, тем скорее непараметрический вариант окажется
лучше. И мы наблюдаем быстрый рост интереса к непараметрическим методам, особенно в таких областях приложений, как, например, медицина.
На практике любой закон распределения обычно бывает засорен
чужеродными элементами, которые даже в малых количествах спо
собны существенно ухудшать результаты. А в больших массивах
-
42

данных засорение практически неизбежно. Долгое время разрабатывались методы выявления подозрительных наблюдений, при исключении которых ситуация резко улучшалась. Но тут, к сожалению,
получался замкнутый круг: чтобы выработать критерий отбрасывания «диких» наблюдений, надо было знать все тот же закон распределения. В 1950 г. Дж. Бокс обнаружил, что существуют такие мето
ды обработки данных, которым засорения совершенно не мешают.
Поэтому вылавливать и отбрасывать ничего не нужно. Автор назвал
такие методы робастными, или устойчивыми. Конечно, регрессионной анализ немедленно взял их на вооружение. Робастные методы
можно рассматривать как компромисс между параметрическими и
непараметрическими методами.
Наше краткое описание было бы неполным, если бы
мы не упомянули требования модели по отношению к элементам матрицы
дисперсий-ковариаций. Действительно, классическая модель предполагает, что дисперсии оценок откликов во всех опытах одинаковы.
Причем эти дисперсии одновременно рассматриваются как дисперсии
воспроизводимости, или дисперсии ошибок опыта. Это очень сильное
утверждение. Оно редко реализуется на практике. Гетероскедаксичность, т.е
. неоднородность или неодинаковость дисперсий – это, скорее, правило, чем исключение. А нарушение однородности дисперсий разрушает всю схему анализа данных, поскольку для неравноточных данных не работает стандартная схема. Хотя технические
проблемы взвешенного метода наименьших квадратов не слишком
обременительны, тем не менее они могут, например, нарушить ортогональность плана.
Разработаны
многочисленные методы преобразования данных,
которые позволяют справиться с неоднородностью дисперсий, но с
ними связана одна важная неприятность: они вынуждают работать с
новыми данными, физический смысл которых часто трудно интерпретировать. А возврат к старым переменным в конце приводит к
смещению оценок.
До сих пор мы молчаливо предполагали, что имеем дело с
моделью объекта исследования, которая линейна по параметрам. Но на
практике это случается достаточно редко. Обычно модель как раз
бывает существенно нелинейной, и это значительно усложняет дело.
Регрессия для нелинейных по параметрам моделей – отдельная обширная область исследования.
-
43

Одно из важных практических преимуществ планирования эксперимента заключается в том, что экспериментатор может при желании
выбрать условия проведения опытов так, чтобы оценки коэффициентов модели объекта получались независимыми. Но в пассивном эксперименте исследователь не властен над природой, и структура матрицы системы нормальных уравнений может оказаться очень близкой
к вырожденной. В таком случае само решение оказывается неустойчивым. В классической модели принято получать несмещенные
оценки, но тогда система уравнений не решается. Зато если допустить получение несколько смещенных оценок, то их можно найти
сравнительно просто. Такой подход получил название риджрегрессии, или гребневой регрессии.
С ростом мощности и
доступности вычислительных машин они все
шире и интенсивнее используются в рамках регрессионного анализа.
Особенно это заметно в задачах имитационного моделирования.
В заключение этого раздела приведем мнение В. В. Налимова и
Т. И. Голиковой о месте планирования эксперимента в системе научного знания:
«Иногда мы встречаемся с утверждением о том, что
планирование эксперимента или хотя бы некоторые его разделы – частный
случай хорошо разработанных разделов математики… С этим высказыванием нельзя согласиться. Оно звучит так же странно, как,
скажем, звучало бы утверждение о том, что квантовая механика
есть частный случай того или иного раздела математики. Несмотря
на насыщенность математикой, квантовая механика имеет
свое
идейное содержание, связанное с существом физической проблемы.
Точно так же планирование эксперимента имеет свое собственное
идейное содержание, связанное с особенностями физического представления об эксперименте; планирование экстремальных экспериментов – это не просто поиск экстремума, а нечто гораздо большее –
это поиск хорошего эксперимента для решения экстремальной задачи» [13, c. 8–9].
2.2. Прикладные исследования
В развитии отечественных прикладных исследований выявились
такие тенденции:
1. Создание программ для ЭВМ с целью обработки эксперимен-
тальных данных. Типовые программы включают обычно первичную
44

обработку данных: вычисления средних, дисперсий, изучение вида
распределения случайных величин, проверку статистических гипотез. Не обойдены вниманием популярные методы анализа данных:
регрессионный, дисперсионный, корреляционный, конфлюэнтный,
дискриминантный анализы, метод главных компонент, кластеранализ. Приобрели большую важность вопросы упрощения математического использования ЭВМ, разработки систем пакетов прикладных программ с простым доступом и
гибкой структурой.
Примером может служить пакет прикладных программ СТАТПЛАН –
планирование эксперимента на гиперкубе и гиперсимплексе. В пакет
включены: априорное ранжирование факторов; построение моделей
первого и второго порядков, синтез планов эксперимента по критериям D-, A-, E-оптимальности; обработка результатов эксперимента;
крутое восхождение по поверхности отклика [88].
2. Синтез планов и исследование их
свойств. Выбор планов воз-
можен либо с помощью каталога планов, либо с помощью программ,
генерирующих на ЭВМ план с заданными свойствами. Не удалось
создать типовые пакеты прикладных программ для этой цели. Особое значение приобрели численные методы построения планов для
нелинейных по параметрам моделей. Здесь процедура планирования
совмещается с процедурой
уточнения нелинейных оценок. Построение планов обычно возможно лишь алгоритмически. Алгоритм – это
численная процедура, на каждом этапе которой решается многоэкстремальная задача.
3. Имитационный эксперимент. При имитации поведения систе-
мы на ЭВМ планирование эксперимента используется для сокращения перебора вариантов, выделения значимых факторов, поиска оптимальных условий и пр. При
решении подобных задач выделяются
математическая модель системы или алгоритм, описывающий ее поведение. Далее на ЭВМ проводится «эксперимент», что позволяет
экономить время и вырабатывать рациональные решения.
4. Диалоговые системы «ЭВМ – экспериментатор». В этих си-
стемах компьютер берет на себя функции консультанта. В полной
мере идея не была реализована, но были созданы
программы, позволяющие вести ЭВМ диалог с экспериментатором. По принципу
управления диалоговые системы разделяются на управляемые человеком, управляемые компьютером и смешанные системы. В первом
случае исследователь задает системе вопросы, а система отвечает. Во
45

втором случае ЭВМ анализирует ответы пользователя на заданные
ему вопросы и вырабатывает рекомендации. Пример системы смешанного типа – диалоговая система DIPLEX, разработанная в Московском энергетическом институте. Она предназначена для задач
оптимизации, описания поверхности отклика, последовательного
планирования эксперимента. В ней содержится и программа синтеза
оптимальных планов. До проведения эксперимента система используется
для выбора плана и метода анализа. В ходе эксперимента она
рассчитывает оптимальные условия очередного опыта и текущих
значений параметров объекта. На последней стадии система применяется для обработки данных. Критерии оптимальности подсказываются экспериментатору исходя из задачи, которую ему надо решить. Для дробных планов на дисплей выводится таблица смешивания оценок коэффициентов. Экспериментатор может менять ход решения задачи в зависимости от результатов, полученных на том или
ином этапе [71].
Создана диалоговая система ПАСЭК, позволяющая выбрать оптимальный план сравнительного или отсеивающего эксперимента и
провести обработку экспериментальных данных. Она применима для
решения широкого круга задач планирования эксперимента: отсеивающего эксперимента с
качественными факторами; оптимизации
качественного состава смесей; задач оптимизации с качественными и
количественными факторами, для классификации в целях разделения
объектов с запланированной обработкой. Система включает четыре
подсистемы: 1) ЗАДАЧА – выбор цели исследования, постановка
задачи, формализация объекта в виде системы «вход-выход» с указанием факторов, их уровней и отклика; 2) МОДЕЛЬ – представление
экспериментальных
данных в виде модели дисперсионного анализа с
взаимодействием или без взаимодействия факторов; 3) ПЛАН – выбор плана сравнительного эксперимента из множества альтернативных планов; 4) АНАЛИЗ – обработка результатов сравнительного
эксперимента с помощью параметрического дисперсионного анализа
или непараметрического анализа на основе критерия Фишера. Для
множественных сравнений использован метод Шеффе [72].
5. Последовательное применение нескольких методов
планирова-
ния эксперимента для изучения одного объекта. Одна из схем реше-
ния экстремальных задач включает: 1) методы ранговой корреляции
для экспертного оценивания силы влияния факторов; 2) отсеиваю-
46

щий эксперимент; 3) поиск области оптимума; 4) построение модели
в области оптимума; 5) интерпретация модели.
6. Изучение методических проблем, возникающих при применении
методов планирования эксперимента. Методические проблемы воз-
никают и из-за особенностей применяемых методов планирования
эксперимента и при учете специфики объектов исследований. Это,
например, принятие неформализованных решений в методе крутого
восхождения, интерпретация полиномиальных
моделей, устранение
неадекватности моделей при описании почти стационарной области и
пр.
7. Трудности в прикладных исследованиях. Широкое применение
методов планирования эксперимента выявило трудности в использовании новой концепции и стимулировало появление исследований,
помогающих преодолеть эти трудности. Одна из них – проблема неадекватности математической модели. Неадекватность может быть
обусловлена несовершенством методики
эксперимента, неудачным
выбором модели, нарушением исходных предпосылок статистического анализа и пр. Проблема неадекватности часто вызвана стремлением экспериментатора получить модель в широкой области варьирования факторов. Нарушение предпосылок статистического анализа связано с видом закона распределения, однородностью дисперсий
и т.д. Здесь актуальна задача выявления причин неадекватности. Из
методов диагностики
использованы анализ остатков, проверка гипотез (например, однородности дисперсий), логический анализ ситуации. Если новый эксперимент невозможен, то один из основных путей устранения неадекватности – преобразование переменных. Преобразование отклика часто позволяет устранить нарушение нормальности его распределения. Преобразования факторов разделяются на
содержательные и формальные. Содержательные преобразования
учитывают физическую сущность
явления. Это, например, преобразования на основе теории подобия и анализа размерностей. Встречаются
преобразования каждого фактора, всех факторов и групп факторов. В
формальных преобразованиях преобладал интуитивный подход.
Еще одна трудность, которая отмечалась и ранее, – планирование
эксперимента для нелинейных по параметрам моделей. Оценки параметров таких моделей обычно коррелированы. Информационная
матрица для
линеаризованной модели близка к вырожденной. Лине-
аризация нелинейной по параметрам модели важна для МНК-
47

оценивания параметров по результатам наблюдений и достигается
разложением модели в степенной ряд в окрестности некоторой точки. Вырожденность матрицы (X
T
X) приводит к сложному характеру
поверхности для сумм квадратов отклонений, что затрудняет сам поиск оценок параметров. Вместо простых доверительных границ для
оценок параметров приходится использовать всю связанную с ними
ковариационную матрицу, что слишком громоздко.
Сложность вызывает и неоднозначность вычислительных процедур. Здесь используется нелинейное программирование для минимизации многоэкстремальной функции
нескольких переменных. Неоднозначность обусловлена и наличием нескольких экстремумов (это
делает ответ зависимым от выбора начального приближения), и плохой сходимостью (зависимость от точности, времени счета, и т.д.).
Неудачный выбор метрики в факторном пространстве также приводит к неприятным последствиям. В уравнении регрессии одни коэффициенты могут оказаться на
порядок больше других. Это определяет нечувствительность отклика к изменению «малых» членов модели. Обычно метрику не удается подобрать так, чтобы вклад факторов
стал равномерным. Коррелированность параметров затрудняет интерпретацию, хотя прогнозирующие свойства модели в целом могут
быть хорошими [70, 71].
Прикладные исследования на втором этапе отмечены заметным
использованием критериев оптимальности планирования. Наиболее
широко они применялись при выборе планов второго порядка для
описания почти стационарной области. Если ранее в прикладных задачах преобладали центральные ротатабельные планы, то затем их
сменили компромиссные планы, близкие к D-оптимальным по величине определителя информационной матрицы и не уступающие значительно планам, оптимальным по другим критериям. Критерии
оптимальности использовались и при выборе планов первого порядка в
экстремальном эксперименте, планов для описания диаграмм состав–
свойство, в задачах последовательного планирования эксперимента
для оценки констант, нелинейных по параметрам моделей.
Появились новые направления прикладных исследований: теплои электроэнергетика, лесная и пищевая промышленность, приборостроение, испытания и эксплуатация сельскохозяйственных машин,
технология древесины
и пр. При оптимизации технологических про-
цессов в разных отраслях промышленности применение методов
48

планирования экстремального эксперимента позволяло заметно повышать выход продукта [89].
Один из примеров успешного применения методов планирования
эксперимента – оптимизация процессов получения синтетических
лекарственных веществ. Здесь наибольшее распространение получили полные и дробные факторные планы типа 2
k
, планы второго порядка, несимметричные равномерные и неравномерные факторные
планы, поиск экстремума с помощью симплекс-процедуры. Возросло
число задач с большим количеством факторов – до 20 и более. При
оптимизации действующих процессов выход продуктов в среднем
возрастал на 15 % [70].
Еще одна особенность отечественных прикладных исследований
второго этапа – «взаимодействие» методов планирования эксперимента с
широким кругом математико-статистических дисциплин. Это
проявилось, например, в деятельности лаборатории математической
теории эксперимента после перехода отдела В. В. Налимова на кафедру гидробиологии биологического факультета МГУ. Планирование эксперимента применялось там в рамках компьютерной биометрики, математизации биологического знания. Использовались многомерный статистический анализ, общестатистические методы, дифференциальные уравнения и
пр. Отмечалось, что быстрое развитие
биотехнологии и биоинженерии должно сделать планирование эксперимента постоянным средством в повседневной работе биолога
инженерной направленности.
Биометрия включает и другие статистические методы исследования. Это кластер-анализ, метод главных компонент, дискриминантный анализ, факторный анализ, регрессионный анализ, непараметрические методы, робастные оценки и пр. Но
все эти методы тогда еще
не нашли должного применения [90].
2.3. Подготовка кадров
На начало 1980-х годов лекционные курсы по планированию и автоматизации эксперимента читались в 55 вузах страны, в том числе в
МЭИ, МХТИ им. Д. И. Менделеева, МИТХТ им. М. В. Ломоносова,
химическом факультете МГУ и пр. В ряде вузов были организованы
факультеты переподготовки специалистов по планированию и автоматизации эксперимента [71]. Иногда
нием учебных пособий. Так, для студентов факультета прикладной
лекции сопровождались изда-
49

математики Московского института электронного машиностроения
было издано учебное пособие [91], охарактеризованное автором как
элементарное введение в теорию планирования эксперимента и
включающее основные разделы, требующиеся для начального изучения предмета. В пособии рассмотрены анализ линейных моделей
наблюдений полного и неполного рангов; проверка гипотезы об
адекватности моделей; анализ многомерных функций отклика; пассивный, дробный
и полный факторный эксперименты; линейные
планы; статистическое оценивание градиента, поиск экстремума
функции отклика и изучение области оптимума.
Была создана методо-ориентированная система ЭКСПЛАН для
компьютерного обучения методам планирования и анализа экстремального эксперимента. В систему входят постановка задачи оптимизации; планирование эксперимента (модель, план эксперимента,
повторные опыты, рандомизация); оценка параметров
модели; проверка статистических гипотез; многофакторная оптимизация. Система проста в обращении, снабжена множеством конкретных примеров, комментариями и различными средствами помощи. Она применима для индивидуального обучения и для организации компьютерных классов [92].
Способ обучения с помощью задачи-аналога реализован на примере диалоговой системы ПАСЭК (планирование и анализ сравни
тельного эксперимента). Пользуясь «банком решенных типовых задач» пользователь может найти аналог своей задачи и просмотреть
все этапы планирования и анализа эксперимента. Возможна и переформулировка конкретной задачи [72].
Большое внимание подготовке кадров уделялось в лаборатории
математической теории эксперимента биологического факультета
МГУ. С сентября 1983 г. на биофаке МГУ для преподавателей был
введен новый курс «Применение современной вычислительной техники в планировании и автоматизации биологических исследований». Цель курса – повысить квалификацию слушателей по вычислительной технике, автоматизации исследований, планированию
эксперимента и машинной обработке экспериментальных данных.
Курс имел два варианта. Первый вариант – для слушателей биологического отделения факультета повышения квалификации, преподавался в течение
14 недель, его общий объем – 96 часов. Второй вари-
ант – для всех преподавателей биофака МГУ (4 недели в рамках ме-
-
50
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
