Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Методология и практика планирования эксперимента в России. Монография
.pdf
Но вернемся к началу XX в. В 1901 г. Пирсон вместе с Гальтоном
и морским зоологом Р. Уэлдоном
1
, пионером прикладной биометрии,
учредили первый в Европе, да и в мире, журнал Biometrika, от начала
которого вполне можно отсчитывать время современного периода
развития статистики, которое приходит к концу. Душой предприятия
был Пирсон. Он полагал, что журнал будет способствовать экспериментальной проверке гипотезы Дарвина о происхождении видов с
помощью построения кривых распределения (
названных позднее
кривыми Пирсона) и проверки гипотезы о том, что они не противоречат результатам наблюдений в соответствии с критерием «хиквадрат» (названным позднее критерием Пирсона). Для этого предлагалось по экспериментальным данным вычислять первые четыре
момента кривых распределения, а именно: среднее, дисперсию,
асимметрию и эксцесс. Биометрия – детище Пирсона, – была не
единственной областью его интересов. Он написал, например, самую
полную из известных, трехтомную биографию Гальтона. Но главным
делом его жизни стала «Грамматика науки» [12] (есть русский перевод 1911 г., издательство «Шиповник»). Для нас важна его мысль о
том, что статистика – это прежде всего то, что задает грамматическую структуру всего, что претендует
наука. Книга опиралась на философскую концепцию позитивистского толка
2
, что вызвало резкую критику в работе В. И. Ленина «Мате-
на название «наука». Любая
риализм и эмпириокритицизм». Неприятие работ Пирсона в СССР
усугубилось еще и тем, что он активно развивал другое детище Гальтона – евгенику, взятую на вооружение фашистами как инструмент,
доказывающий расовое превосходство одних народов над другими.
Люди умеют все что угодно использовать
как во благо, так и во зло.
Сама наука здесь ни при чем. Она применяется, например, при селекции растений и животных.
Если Дарвин и его последователи обнаружили, так сказать, «вари-
абельность в неслучайном», то австрийский монах Грегор Мендель
3
напротив, показал, что «совокупность случайностей может вести к
неслучайному результату» [13]. Так возникла генетика – важная об-
,
_____________
1
У. Ф. Р. Уэлдон (Weldon) (1860–1906) – британский биолог, дарвинист, один из
основателей биометрики.
2
Позитивизм – направление в философии науки, определяющее единственным
источником истинного знания эмпирические исследования.
3
Г. Мендель (1822–1884) – основоположник генетики.
111

ласть приложения и развития статистических методов. История биометрии и генетики в нашей стране – обширная трагическая тема, которая здесь не будет рассматриваться.
На современный период развития статистики, грубо говоря, приходится целый век. Двадцатый век. Историю статистики в XX в.
удобнее всего проследить по прекрасной книге Дэйвида Солсберга
«Леди, дегустирующая
чай: как статистика революционизировала
науку в двадцатом веке» [14]. Конечно строить всякие границы и рубежи – дело сомнительное. Тем более, что логика календаря обычно
не согласуется с логикой жизни. Но, видимо, нам – людям – удобнее
структурировать события и описывать их по кластерам. Впрочем,
такой подход позволяет проследить процесс рождения новой парадигмы в
рамках старой.
Но сначала давайте кратко опишем старую парадигму. В наследство от Гальтона нам достались корреляция, регрессия и основы вариационной статистики. Пирсон добавил к этому теорию распределений и инструменты проверки гипотез. С этим мир вступил в XX в.
А начало века ознаменовалось прорывными работами Уильяма Гос-
1
сета
(псевдоним – «Стьюдент»). Он не только осознал проблемы
малых выборок и ввел распределение и критерий, получившие имя
Стьюдента, но и предвосхитил идеи планирования эксперимента и
контрольных карт.
Распределение Стьюдента было первым звонком, оно подрывало
представление об универсальности нормального распределения, введенного К.-Ф. Гауссом
2
в начале предыдущего века. Говорят, что
Гаусс по просьбе астрономов нашел математическую форму кривой,
которая хорошо описывала поведение отклонений результатов траекторных наблюдений. А пользователи решили, что Гаусс нашел некоторый универсальный закон, которому подчиняется поведение отклонений, или ошибок наблюдений. Так его и стали воспринимать
практики. Это ощущение усиливалось
еще и так называемой центральной предельной теоремой теории вероятностей, которая формулирует условия, при которых среднее как угодно распределенных
данных с ростом числа наблюдений стремится именно к нормальному гауссовому распределению.
_____________
1
У. Госсет (1876–1937) – английский статистик, изучавший статистику малых выборок.
2
К. Гаусс (1777–1855) – немецкий математик, механик, физик, астроном и геоде-
зист. Считается одним из величайших математиков всех времен.
112

Конечно, было известно, что есть дискретные распределения, с
которыми работали еще математики семейства Бернулли, например,
биномиальное распределение или распределение Пуассона. Они не
вызывали особого беспокойства, видимо, потому, что имели «другую
природу», а с практической точки зрения почти не отличались от
нормального. Но к непрерывным и ненормальным распределениям
пришлось привыкать. Жизнь вызвала
потребность в логарифмически
нормальном распределении, востребованном, например, в минералогии и обогащении полезных ископаемых, в семействе распределений
Вейбулла
1
, используемых, например, в многочисленных задачах
надежности.
Более того, оказалось, что при практическом использовании некоторой модели закона распределения возникает неопределенность,
связанная как с обычно малым объемом выборки, так и с известным
произволом при выборе самой модели. Интересно, что одной из
главных проблем прикладной статистики в XX в. была малость эмпирических
прикладной статистики, у которой главная проблема – огромность
выборки [15]. В связи с малостью выборок Рихард фон Мизес
младший брат Людвига фон Мизеса
выборок, а теперь начала бурно развиваться та ветвь
2
3
, занимаясь частотной интерпре-
тацией теории вероятности, выяснил, что число 30 наблюдений для
объема выборки может рассматриваться уже как «большое». Значения критических точек для многих статистических критериев до 30
меняются относительно быстро, а после – все медленнее и медленнее. Это стало на практике удобным ориентиром, оставив Стьюденту
совсем маленькие выборки.
Что же
касается произвола при выборе модели, то дело было не
только в том, что лишь в нескольких простых ситуациях выбор вида
модели был очевиден. Так, было известно, что распад радиоактивного изотопа хорошо описывается моделью распределения Пуассона, а
подбрасывание правильной монеты – биноминальным распределени-
_____________
1
В. Вейбулл (1887–1979) шведский инженер, офицер морской охраны, затем
профессор, автор знаменитого семейства распределений.
2
Рихард фон Мизес (1893–1953) – математик австрийского происхождения. В
1933 г. эмигрировал в Турцию, а затем в США. Его работы посвящены аэродинамике, прикладной механике, аэронавтике, статистике и теории вероятностей.
3
Людвиг фон Мизес (1881–1973) – экономист, философ, историк, внес заметный
вклад в развитие австрийской школы экономики. С 1945 г. работал в Нью-Йорском
университете.
113
,

ем. Или диаметры частиц горной породы, измельчаемые в шаровой
мельнице, распределяются в соответствии с логарифмически нор-
мальным распределением. В большинстве случаев наших априорных
знаний оказывается совершенно недостаточно для идентификации
распределения. Поэтому принцип «максимума правдоподобия»,
предложенный Р. Фишером
1
, не получил очень широкого распро-
странения, он как раз в ситуации известного, но не нормального за-
кона работал лучше всего.
Практика постоянно показывала, что с распределениями связаны
и другие неприятности. Например, «выбросы», или «дикие наблюдения», неизменно подстерегают исследователя. Всегда возможны человеческие ошибки, описки, и т.п. Кроме того,
распределения бывают «загрязненными» и даже просто смешанными, когда, например,
мы сваливаем в один ящик одинаковые детали, произведенные на
разных станках. Поэтому неудивительно, что в 1945 г. Франк Уилкоксон
2
предложил новый подход, получивший название непарамет-
рического [16]. Он сразу начал стремительно развиваться и теперь
вполне конкурентоспособен при сравнении с классическим подходом. Собственно, дилемма очень проста. Если вы не допускаете мысли о том, что распределение не может быть иным, чем то, на котором
вы настаиваете, то, конечно, надо пользоваться
параметрическим подходом. Но если у вас есть сомнения относительно закона распределения, то, чем больше сомнения, тем естественнее воспользоваться непараметрическим подходом. Есть такие области (например, медицина),
где непараметрический подход представляется наиболее естественным.
Еще в XVIII в. Томас Байес
3
в Англии в свободное от своих пас-
торских обязанностей в англиканской церкви и от разведения кроликов время занимался условными вероятностями и вывел формулу,
получившую впоследствии его имя, – формулу условных вероятностей Байеса. Она широко использовалась в стандартных вероятностных расчетах, но только в XX в. Джон Мейнард Кейнс
4
заметил в
_____________
1
Р. Фишер (1890–1962) – британский статистик и генетик, заложил основы со-
временной математической статистики и планирования экспериментов.
2
Ф. Уилкоксон (1892–1965) – американский статистик и химик, автор двух ста-
тистических критериев.
3
Т. Байес (1702–1761) – британский математик и пресвитер.
4
Д. Кейнс (1883–1946) – американский экономист, основавший отдельное
направление в экономической теории.
114

«Трактате о вероятности» (1921), что «все вероятности условные».
Так наша оценка вероятности некоторого события до начала его исследования (априори, или до) не будет совпадать с нашей же оценкой
вероятности этого события после исследования или эксперимента
(апостериори, или после). Значит, любые знания, входящие в систему, влияют на оценки вероятностей интересующих
нас событий. Конечно, это относится и к априорным гипотезам о виде закона распределения. Можно выдвинуть «произвольную» гипотезу о виде закона
распределения и, накапливая данные, собираемые для других целей,
например для построения регрессионной модели, систематически
проверять выдвинутую гипотезу о «нормальности» распределения до
тех пор, пока не накопится достаточно данных,
чтобы уверенно отбросить ее на заданном уровне значимости. Тогда нам придется выдвинуть новую гипотезу, учитывающую информацию о том, что,
например, «нормальный» закон противоречит накопленным данным.
Так действует механизм, открытый в этом же веке несколько позже
Карлом Поппером
ции» гипотез, и удачно обобщенный Джорджем Боксом
1
как механизм «верификации» и «фальсифика-
2
в афоризме:
«Все модели ошибочны, но некоторые из них полезны».
Здесь представляется уместным напомнить, что статистика была
всегда открыта к «флирту» со смежными направлениями. Наиболее
яркие примеры – это теория игр, теория полезности и теория принятия решений. Игровые модели органичны статистическим представлениям и не случайно возникли в работах Эмиля
в 20-е годы XX в., в несколько более поздних работах Джона фон
Неймана
4
, но до появления ставшей классической работы фон Ней-
Бореля3 во Франции
_____________
1
К. Поппер (1902–1994) – австрийский и британский философ и социолог, один
из самых влиятельных философов ХХ столетия. Автор философской концепции
критического рационализма. Переписывался с В. В. Налимовым.
2
Д. Бокс (1919–2013) – британский статистик, работавший в области планирова-
ния эксперимента, контроля качества, анализа временных рядов. С 1970 г. работал в
Висконсинском университете (США), где основал департамент статистики.
3
Э. Борель (1871–1956) – французский математик и политический деятель, один
из основоположников теории меры и ее приложений в теории вероятностей.
4
Дж. Нейман (1903–1957) – венгеро-американский математик, сделавший важ-
ные вклады в квантовую физику, функциональный анализ, теорию множеств, информатику и экономику. С 1930 г. работал в Принстонском университете (США) и
научно-исследовательском институте перспективных исследований Принстона.
115

мана и Оскара Моргенштерна1 «Теория игр и экономическое поведение» не были в центре внимания. Всякий «флирт» был полезен не
только сам по себе, но и потому, что ставил перед статистикой новые
задачи. Понадобилось разработать концепцию «субъективной вероятности». Она способствовала не только выяснению связей «полезности» и «субъективной вероятности», но оказала большое влияние
на
теорию принятия решений, особенно коллективных экспертных решений, столь популярных во второй половине XX в., да и теперь [17].
Но вернемся к вечной проблеме кривых распределения. Итак, у
нас есть классическая модель «нормального распределения», модель
метода максимума правдоподобия для наперед заданного распределения, непараметрическая модель, байесовская модель, можно
вспомнить еще семейство кривых
Пирсона (позже появились и другие аналогичные семейства, например семейство распределений
Джонсона). В 1950 г. Джордж Бокс ввел в обиход термин «робастность», который открыл новую главу в истории распределений и
оценивания их параметров. Многие модели, используемые в статистике, предполагают выполнение некоторых постулатов относительно свойств распределений. А что если
эти постулаты не выполняются? Можно ли построить такие оценки, которые сохраняют смысл
даже при нарушении некоторых важных постулатов? Именно такие
оценки Дж. Бокс и предложил называть робастными. Выяснилось,
что такие оценки, как правило, можно построить, хотя аналитические
методы приходится заменять компьютерными. Один из самых ранних примеров – «гофер» – оценки среднего
Тьюки
2
. Их свойства станут ясны, если вспомнить, что словом «го-
, предложенные Джоном
фер» в Библии называется порода дерева, из которого построен Ноев
ковчег. Ему не страшны никакие бури и даже всемирный потоп.
В середине прошлого века по всему чувствовалось, что со статистикой все труднее справиться «голыми руками». Тут, как раз, появились
достаточно мощные компьютеры, которым было суждено
изменить лицо статистики. В 1967 г. прошла одна из первых больших международных конференций по компьютерной статистике [18].
Этому предшествовали интенсивные поиски программных средств и
_____________
1
О. Моргенштерн (1902–1977) – американский экономист австрийского проис-
хождения. Один из авторов теории игр.
2
Дж. Тьюки (1915–2000) – американский математик, статистик, автор алгоритма
быстрого преобразования Фурье. Лауреат Национальной научной премии США.
116

создание компаний, которые постепенно разработали и постоянно
совершенствуют большие программные системы. К таким компаниям, например, относятся: SAS, SPSS, Statistika, Statgraphics, Minitab и
др. Появление легкодоступных пакетов создало опасную ловушку
для пользователей. Возникла иллюзия, что теперь можно не изучать
такой неприятный предмет, как статистика, достаточно, как выразился Джерри Хан
1
, «иметь хороший компьютер и цветной принтер».
Тем не менее компьютер сумел преодолеть и предотвратить многие трудности во многих статистических задачах, прежде всего, конечно, многомерных, среди них – задач регрессионного анализа. Созданный еще Ф. Гальтоном, он начал быстро развиваться, но с ростом числа независимых переменных быстро достиг пределов
возможностей «невооруженного» человека. Делались попытки прорваться за счет использования техники ортогональных полиномов
Чебышева, но цена оказалась непомерной: большие трудности с интерпретацией полученных моделей. Только после того как М. Эфроимсон предложил алгоритм шагового метода, дело постепенно
пошло на лад [19]. Н. Дрейпер и Г. Смит в своей книге «Прикладной
регрессионный анализ» последовательно в трех изданиях подробно
рассказывают о развитии вычислительных процедур регрессии (все
три издания переведены на русский язык).
Практические потребности привели к тому, что регрессионная
модель оказалась наиболее глубоко проработанной. Более того, при
желании можно всю статистику рассмотреть сквозь призму этой модели. Тем более что практически любую
статистическую модель
можно представить как многомерную, причем как с точки зрения
множества независимых переменных, откликов или характеристик
качества исследуемого продукта или услуги, так и с точки зрения
множества зависимых переменных или факторов. Все подобные
обобщения немедленно приводят к компьютерам и соответствующим
программным продуктам. Каждый метод имеет свою специфику, но
алгоритмы оказываются
очень похожими. Даже такие внешне далекие методы, как дисперсионный анализ, предложенный еще
Р. Фишером, и факторный анализ, возникший в связи с задачами
психологии, технически различаются не слишком сильно.
_____________
1
Хан Г. – (1930) современный американский статистик, руководитель статисти-
ческого департамента компании GM.
117

Возможность быстро и дешево проводить вычисления большого
объема породила целую гамму новых методов, называемых для краткости методами «бутстреп». За этим обобщающим названием скрываются такие методы, как метод «складного ножа», метод «перепроверки» и собственно «бутстреп». В окончательном виде они были
сформулированы Брэдли Эфроном
1
в начале 1960-х годов [20]. Дру-
гим близким направлением стало машинное имитационное моделирование [21]. Имитационное моделирование, начавшись с метода
Монте Карло, теперь превратилось в огромную область исследования, имеющую большое значение во многих областях науки и промышленности. Без него были бы невозможны, например, полеты в
космос.
Хотя мы и отклонились
от обсуждения проблем, связанных с распределениями, мы еще не исчерпали всех возможностей их исследования. В резерве остались еще преобразования. Мы знаем, что иногда нормальному распределению следуют не сами интересующие
нас величины, а, скажем, их логарифмы. А можно ли найти такое
преобразование этих величин, которое превратит их распределение
в
наперед заданное? Мы думаем, что практически всегда ответ на
этот вопрос положителен. Трудность заключается лишь в том, что
преобразования меняют метрику пространства и требуют интерпретации результатов уже в новой метрике. Иначе, если мы попытаемся вернуться в исходную метрику, оценки окажутся смещенными. А
придумать интерпретацию в новой метрике – значит
содержательную теорию, как это сделал, например, Сванте Аррени-
2
ус
в 1903 г. в теории химической кинетики, за что был удостоен
создать новую
Нобелевской премии по химии. В XX в. усилиями Джорджа Бокса
и его коллег была построена систематическая теория преобразований, причем подвергать преобразованиям можно как отклик, так и
факторы.
Стоит отметить, что на статистику, кроме вышеназванных влияли
и влияют еще многие науки.
Часто эти влияния бывают взаимными и
плодотворными. Один из важнейших примеров – кибернетика, пред-
_____________
1
Б. Эфрон (1938) – американский статистик, профессор Стэндфордского универси-
тета. Сделал заметный вклад в различные направления математической статистики.
2
С. Аррениус (1859–1927) – шведский физикохимик, автор теории электролити-
ческой диссоциации, лауреат Нобелевской премии по химии.
118

ложенная Норбертом Винером1 практически сразу после окончания
Второй мировой войны. Тезис кибернетики о том, что «оптимальное
управление сложными системами возможно при неполном знании их
механизмов», оказался для статистики как нельзя более кстати.
Большую роль сыграла и модель «черного ящика». С началом холодной войны в СССР и в США возникли целые системы наук,
имеющих хорошие перспективы военного приложения, активно участвовавшие в гонке вооружений и, как обычно бывает, получившие благодаря конкуренции и мощной поддержке государств быстрое и эффективное развитие. К таким наукам относятся: исследование операций, теория надежности систем, собственно теория систем, системотехника, теория очередей, теория массового обслуживания, теория
распознавания
образов и др. Все эти науки существенным образом
использовали статистику, но каждая из них выработала собственный
язык, свою систему понятий и обозначений. Из-за этого не сразу стало понятно, что многие модели распознавания образов, например, математически эквивалентны моделям дискриминантного анализа, предложенного Р. Фишером еще в 1927 г. Ситуация
прояснилась, когда
спала «горячка» холодной войны. Вообще, подобная мимикрия теорий
– это не редкость, а, скорее, типичная стратегия. «Своя» терминология
– лучшая защита от «профанов» и входной барьер для неофитов.
Здесь есть над чем подумать.
Переписи и обследования принадлежат, видимо, к самым древним
задачам, решение которых трудно себе представить без использования
статистических методов. Ушедший век, тем не менее, внес в их
организацию и проведение много нового. Тщательному анализу подверглась идея выборочной оценки. Возникли два ключевых понятия:
репрезентативность (представительность) выборки и рандомизация
при отборе элементов выборки. Идея рандомизации принадлежит
Р. Фишеру. Она была высказана им в связи с планированием эксперимента
и принадлежит к числу важнейших из многочисленных его
идей [22]. Хотя статистика – неотъемлемая часть планирования эксперимента, случилось так, что она как-то дистанцировалась, «чувствуя», что в планировании эксперимента есть что-то чужеродное, не
статистическое. Видимо, именно с этим связано то, что планирование до сих пор не заняло того места
_____________
1
Н. Винер (1894–1964) – американский математик и философ, основоположник
кибернетики и теории искусственного интеллекта.
в арсенале статистики, которого,
119

несомненно, заслуживает и которого ждут многочисленные задачи
практически во всех областях человеческой деятельности. Что ж,
ждем этого от наступившего века.
Естественная экспансия статистики привела к тому, что в ее сферу
стали попадать объекты, традиционно не рассматриваемые в рамках
этой науки. Это направление стало называться «статистикой объектов нечисловой природы» [23]. Другим расширением
стала статистика случайных процессов, временных рядов и, вообще, объектов,
имеющих пространственно-временную структуру. Прежде всего, это
оказалось востребованным теорией коммуникаций.
Статистика многими своими достижениями обязана математике
вообще и теории вероятностей в частности. Иногда их вообще трудно разделить и различить. Интересно, что вектор развития математики в сторону «
утраты определенности» [24]. совпадает с вектором
развития статистики в сторону учета неопределенности, ее оценки.
Оглядываясь назад, можно заметить, что к началу XX в. прикладная статистика не выглядит как стройное здание изящной архитектуры. Скорее, это пестрый конгломерат самых разных конструкций без
видимого общего плана. А есть ли вообще такой план? Можно ли
выделить ключевые черты существующей парадигмы, чтобы получить «эталон сравнения» или «точку отсчета»? Давайте попробуем.
Тогда нам будет легче обсуждать особенности новой, приходящей
парадигмы.
Можно представить себе, например, следующую систему. Основа
статистики – теория вероятностей. Статистика – математическая
дисциплина с богатыми и разнообразными приложениями. Будучи
частью математики, статистика может и должна добиваться
рого «приемлемого» уровня математической строгости в духе представлений Анри Лебега
2
баки
. Для достижения желаемого уровня строгости всякий раз, когда
1
[25] или знаменитого проекта Николя Бур-
некото-
в этом возникает потребность, надо построить подходящую математическую модель, т.е. сформулировать систему постулатов или аксиом этой модели. Отметим, что речь идет о моделях данных, а у нас
есть еще и модели объектов исследования, структуры которых суще-
_____________
1
А. Лебег ((1875–1941) – французский математик, профессор Парижского универси-
тета, автор теории интегрирования, широко применяемой в теории вероятностей.
2
Н. Бурбаки – коллективный псевдоним группы французских математиков
(позднее в нее вошли иностранные члены), образованной в 1935 г.
120
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
