Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Системный анализ и моделирование при разработке экспертных систем. Учебное пособие

.pdf
Скачиваний:
0
Добавлен:
07.09.2026
Размер:
1 Мб
Скачать
☆
5.4.2. КРИТЕРИИ СРАВНЕНИЯ АЛЬТЕРНАТИВ ПРИ
−
=
()(
≤α≤α−+α
=
НЕОПРЕДЕЛЕННОСТИ ИСХОДОВ
Об основных идеях и подходах к решению задач теории игр же­лательно иметь представление всем, кому придется проводить иссле­дования систем.
Центральным моментом является введение критерия для оценки выбираемого варианта. В силу неопределенности исхода нужно дать оценку сразу целой строке платежной матрицы; имея такие оценки для всех строк и сравнивая их
, мы и можем делать выбор.
Самым распространенным является критерий выбора «наимень­шего из зол», называемый строк матрицы платежей находится наименьший выигрыш
максиминным критерием. В каждой из
qmin , ко-
ij
j
торый характеризует гарантированный выигрыш в самом худшем слу­чае и считается оценкой альтернативы x
. Теперь остается найти аль-
i
тернативу х*, обеспечивающую наибольшее значение этой оценки:
*
= . Эта альтернатива и называется оптимальной по
qx minmaxarg
ij
j
i
максиминному критерию. Поскольку часто платежную матрицу опре­деляют не через выигрыш, а через проигрыш, тот же принцип приво-
минимаксному критерию.
дит к
Минимаксный критерий является крайне осторожным, очень пес­симистическим, поэтому были предложены другие критерии. Таков, например,
критерий минимаксного сожаления, предложенный
Сэвиджем. При этом по платежной матрице Q вычисляется «матрица сожалений» S, элементы которой определяются как
минимаксный критерий применяется к матрице
ijij
*
i
и
qqs min
ij
i
.maxminarg:
sxS =
ij
j
Дальнейшее ослабление пессимистичности оценки альтернатив
критерий пессимизма–оптимизма (критерий Гурвица), кото-
дает рый сводится к взвешенной комбинации наилучшего и наихудшего исходов. А именно: за оценку альтернативы x принимается величина
i
j
ij
)
j
в критерии Гурвица
i
qqxg .
ij
10,max1min
Показатель а называется показателем пессимизма–оптимизма (при а = 1 имеем снова максиминный критерий); оптимальная альтер­натива есть
*
= .
i
()
xgx maxarg
i
101
5.4.3. ОБЩЕЕ ПРЕДСТАВЛЕНИЕ О ТЕОРИИ ИГР
(
=
(
)
Некоторые особенности игровых ситуаций хорошо видны на про­стейшем примере. Пусть имеется игра с континуальными множества­ми X и Y, строгим соперничеством сторон и нулевой суммой. Это де­лает достаточным рассмотрение лишь одной функции платежей q(x, у), которую один игрок старается максимизировать по х, а другой – ми­нимизировать по
В тех случаях, когда
**
, yx , в которой достигается это равенство, одновременно удовле-
у.
Xx
∈
()
∈∈
YyYy
Xx
∈
)
yxqyxq
,maxmin,minmax
, точка
творяет амбиции обоих игроков. Эта точка равновесия интересов сто­рон называется седловой. Отход от этой точки невыгоден обеим сто­ронам, так что ее выбор решает игру.
Однако существуют игры без седловой точки. В такой ситуации становится выгодным скрывать от противника свой выбор и
даже свой способ выбора. Это достигается введением смешанной стратегии. В отличие от чистой стратегии, при которой альтернатива выбирается однозначно по детерминированному правилу, смешанная стратегия состоит в том, что задаются лишь вероятности выбора альтернатив, а сам выбор осуществляется случайным механизмом, подчиняющимся заданному распределению. В результате получаемый выигрыш стано­вится случайной величиной и
сравнение стратегий можно вести через
средние значения выигрыша. Оказывается (теорема фон Неймана), что
любые матричные игры со строгим соперничеством имеют решение в смешанных стратегиях. Кроме того, матричную игру можно свести к
задаче линейного программирования, что дает не только практические методы численного решения игр, но и позволяет перенести ряд теоре­тических
результатов из теории программирования в теорию игр.
5.5. О ВЫБОРЕ В УСЛОВИЯХ
СТАТИСТИЧЕСКОЙ НЕОПРЕДЕЛЕННОСТИ
Существует класс задач выбора, особенностью которых является наличие неопределенности даже после того, как проведена серия на­блюдений, измерений. Дело в том, что данные, полученные в результа­те эксперимента, связаны с интересующим нас аспектом явления не непосредственно, не однозначно, а в совокупности с другими, некон­тролируемыми факторами.
5.5.1. СТАТИСТИЧЕСКИЕ РЕШЕНИЯ КАК ВЫБОР
Пусть, например, требуется знать высокоточное значение веса не­которого предмета. Неоднократное его взвешивание на аналитических
102
весах даст хотя и близкие, но разные значения, так как на показания
(
)
(
)
весов оказывают влияние не только вес самого взвешиваемого предме­та, но и трение, неидеальность геометрической формы опорной приз­мы, течение струй воздуха, тепловой режим и т.д. Аналогично, при ра­диолокационном зондировании Луны в результате каждого измерения получают отличающиеся чему имеется множество причин. В таких задачах возникает нетриви­альная проблема выбора, какое именно из значений интересующей нас величины принять за истинное – с учетом имеющихся данных.
Аналогичная ситуация – выбор в условиях статистической неоп­ределенности – имеет место не только при оценке некоторой величи­ны, но стояние характеризуется такими-то данными анализов? На какой глу­бине находится нефть или вода, если в результате геофизической раз­ведки получена некоторая совокупность чисел?), а также при необхо­димости подобрать математическую модель явления (на какую кривую лучше всего ложатся эти экспериментальные димости обнаружить какую бы то ни было закономерность (влияет ли солнечная активность на здоровье людей? С какими наблюдаемыми характеристиками жизни человека связана возможность заболевания шизофренией? Есть ли закономерность в том, как в течение 30 лет по­ражала молния опоры данной линии электропередачи?).
новании косвенных или прямых, но обязательно «зашумленных» дан­ных. Основным, центральным, самым важным предположением для формализации решения таких задач является предположение о стати­стичности экспериментальных данных. Оно состоит в том, что связь между истинной, но неизвестной искомой альтернативой θ (будем обо­значать этой буквой любую закономерность коле наблюдений, считая, что она принадлежит множеству Θ возмож­ных закономерностей, на котором и надо сделать выбор) и наблюдае­мыми данными
вероятностей (например, функцией распределения если плотностью вероятностей что, во-первых, выборка наблюдений принадлежит статистическому
ансамблю всевозможных выборок, на котором задано распределение вероятностей, и, во-вторых, это распределение различно для разных θ, что и обеспечивает наличие информации о θ в выборке
[43, гл. 3]. Вопрос состоит в том, как извлечь эту информацию, т.е. как сделать выбор на множестве Θ или как принять статистическое решение.
и при классификации объектов (чем болен пациент, если его со-
Во всех таких задачах есть
x – непрерывные величины, а функция F дифференцируема, –
i
цифры для расстояния до нашего спутника,
данные?) и при необхо-
общее – необходимость выбора на ос-
, отыскиваемую в прото-
xxx ...,,,
адекватно описывается распределением
N
21
1
θNxxf ...,,
1
. Другими словами, считается,
1
θNxxF ...,,
или,
xx ...,,
N
103
Естественно, напрашивается идея – свести задачу к уже решенной
(
)
Θ∈θ
∈
(
−
=
μ=μ
δ
ранее. Такую возможность предоставляет теория «игр против приро­ды» (см. 1.4): выбор
можно в совокупности охарактеризовать функцией потерь торую и рассматривать как платежную функцию игры. Использование
такого представления в самом деле позволяет перенести ряд результа­тов теории игр в теорию статистических решений. Однако одни стати­стические задачи не принадлежат к числу решенных задач теории игр, для других задач существуют более прямые и короткие способы реше­ния, третьи ки экспериментальных данных, что игровая терминология лишь «за­темняет» суть дела; наконец, теория синтеза и анализа процедур для решения статистических задач – математическая статистика – начала развиваться задолго до возникновения теории игр, достигла значи­тельных результатов и продолжает успешно развиваться самостоя­тельно. По этим причинам теоретико-игровой храняя свое методологическое, междисциплинарное значение, не ока­зал существенного влияния на прикладную статистику.
5.5.2. ОБЩАЯ СХЕМА ПРИНЯТИЯ СТАТИСТИЧЕСКИХ РЕШЕНИЙ
Вернемся к рассмотрению черт, общих для задач выбора в усло­виях статистической неопределенности. Обстоятельства принятия ста­тистических решений иллюстрирует схема, приведенная на рис. 5.4. На этой схеме точкой необходимо определить; Θ – множество всех предполагаемых возмож­ностей относительно θ. Точкой
наблюдений) Тот факт, что на реализовавшееся значение выборки оказывает влия-
ние не только искомая закономерность θ, но и совокупность случай­ных факторов, изображен на схеме как результат совместного отобра­жения θ и некоторого случайного воздействия помощью некоторого оператора
лать выбор относительно θ, принять решение, какую из множества альтернатив Θ мы примем за истинную. Чтобы не путать принимаемое решение и «истинное» состояние θ, обозначим пространство, на кото­ром производится выбор, через Г. Очевидно, что в Г входят все эле­менты множества Θ, но могут войти и отказа от выбора, требования увеличить число наблюдений или про­вести рандомизацию и т.п.). Процедура выбора изображена как дейст­вие некоторого оператора оператор, называемый
104
имеют настолько сильно выраженную специфику обработ-
θˆ на Θ и действительное состояние θ природы
подход к статистике, со-
изображено то, что нам неизвестно, но
Xx
изображена выборка (протокол
)
Xxxx
;...,,
N
1
решающей функцией, ставит в соответствие ре-
множество всех возможных выборок.
n в пространство X с
()
nx ,: θ
. Зная х, мы должны сде-
дополнительные решения (типа
над выборкой х: каждой выборке х этот
θθ,ˆl , ко-
шение
γ
γ
δ
μ
μ(θ
,
x
,
()
ix,δ=
. Здесь аргумент i введен, во-первых, для того чтобы
подчеркнуть, что одну и ту же выборку можно обрабатывать по­разному, получая решения различного качества, и, во-вторых, чтобы сделать акцент на том, что качество решения зависит не только от то­го, какой протокол обрабатывается, но и от того, какие априорные предположения вошли в
структуру алгоритма.
Итак, и проблема синтеза статистических процедур (построения решающих функций), и проблема анализа их качества (оценивания степени близости между
и θ) тесно связаны с ролью априорной
информации.
Определим конкретнее, что именно в статистике понимается под априорной информацией. В нее включают любые сведения, имеющие­ся до того, как мы приступили к синтезу новой процедуры
, в том числе и любую информацию о природе наблюдений (но не саму вы­борку
х, считающуюся информацией апостериорной). Конкретнее ап-
риорные сведения характеризуют:
пространство ситуаций Θ;
1)
природу случайных факторов n;
2)
3)
оператор
4)
пространство наблюдений X; требования потребителя к качеству решений (нумерация та же,
5)
, определяющий характер взаимодействия θ и n;
что и на рис. 5.4).
θ
Пространство
ситуаций
Θ
n) δ(
⊗
ni
Источник
стохастичности
х
Пространство
наблюдений
Χ
1
2
3
4
i)
Априорная
информация
γ
Пространство
решений
Г
5
П О Т
Р Е Б И Т Е Л Ь
Рис. 5.4. Общая схема принятия статистических решений
5.5.3. ПОНЯТИЕ ОБ ОСНОВНЫХ НАПРАВЛЕНИЯХ
Априорная информация может быть более или менее полной и
точной; в зависимости от этого по-разному ставятся и решаются стати-
МАТЕМАТИЧЕСКОЙ СТАТИСТИКИ
105
стические задачи выбора. Можно даже утверждать, что разным уров-
(
)
(
γ
γ
()(
()(
(
)
(
)
ням априорной информации соответствуют различные специфические ветви математической статистики.
Самое полное описание случайного объекта состоит в задании распределения вероятностей на множестве возможных состояний это­го объекта, поэтому наиболее подробное и полное задание априорной информации состоит в том, что считаются известными: распределение
()
потребителя решений к расхождению между использовать вместо истинного θ, и действительным состоянием θ.
Такой уровень априорной информации соответствует байесову на­правлению статистики (Т. Байес – известный английский статистик). Среднее значение потерь
работки наблюдений за меру качества этого алгоритма. Оптимальная в этом смысле проце-
дура нием задачи:
вызывала необходимость задавать априорное распределение стулат Лапласа–Байеса, предлагающий при неизвестности его равномерным в Θ, приводит к противоречиям в случае деформаций пространства Θ. Не помогает и предположение о том, что неизвестное
Р(θ) принадлежит некоторому классу распределений, – с тем чтобы
взять в этом классе «наихудшее» распределение и для него найти байе­сову процедуру. Такая минимаксная процедура гарантирует, что «хуже не будет», если только
можно считать историческим недоразумением. В конце концов было признано, что могут существовать и другие уровни априорной инфор­мации, для которых требуется создание своих методов синтеза проце­дур. Следующим уровнем стал отказ от необходимости знать на этом уровне в синтезе алгоритмов участвует только информация о
семействе функций
Θ∈θθ ,P ; условное распределение выборочных значений
Θ∈θ∈θ ,, XxxF ; функция потерь
l, связанное с конкретным алгоритмом
х, называемое байесовым риском R, принимается
*
γ (также называемая байесовой) и считается наилучшим реше-
*
()
Наибольшее количество споров относительно байесовых задач
Спор между сторонниками байесова подхода и его противниками
()
γ
x
()
Р(θ) действительно входит в заданный класс.
θxF . Оказалось, что если подставить в функцию
) ()()
∫∫
Θ
X
)
θγ,l , выражающая отношение
, т.е. тем, что он должен
,minargminarg
=θγ=γ=γ
xlMxRx
Θ
X
()
γγ
xx
()
()
dPxdFxl
θθθγ=
)
.,minarg
Р(θ). По-
Р(θ) считать
об-
Р(θ);
плотности
106
θxf выборочные значения
xx ...,,
, и рассматривать ее
N
1
зависимость от θ, то такая зависимость
()(
)
(
(
)
(
)
()(
)
обладает замечательными свойствами, из-за которых ее и назвали
функцией правдоподобия. Например, если θ – неизвестный числовой
параметр распределения, то
очень хорошей оценкой рассматриваемого параметра (этот метод оце­нивания называется случае, когда по выборке
одной из конкурирующих гипотез из распределения с плотностью
процедурой является вычисление
шение превышает заданный порог, и гипотезы В рамках этого уровня возможны и другие методы принятия статисти­ческих решений; обычно их использование вызвано соображениями простоты реализации, но по качеству получаемых с их помощью ре­шений они не превосходят процедур, основанных на функции правдо­подобия.
Априорное знание функции кает вопрос, как осуществить выбор, если
таваться в рамках параметрических моделей, то можно снова рассмот­реть класс распределений и воспользоваться минимаксной методикой. Подобные алгоритмы также используются в статистике и дают хоро­шие результаты в рамках принятых предположений. Как и в аналогич­ном расширении класса байесовых задач, о свойствах процедур мини­максного правдоподобия можно ренность, что реальные распределения действительно находятся в за­данном классе.
Можно сразу и полностью отказаться от необходимости знать распределение му-то, пусть неизвестному, но существующему распределению: пред­положение о статистичности наблюдений остается в стиле. Такая по­зиция соответствует новому уровню априорной информации и новому направлению в статистической теории и практике –
ской статистике
Имеется несколько подходов к синтезу непараметрических про­цедур. Кроме эвристического, изобретательского подхода (часто дос­таточно удачного, но всегда оставляющего место для сомнений) раз­виваются и теоретически обоснованные подходы. Например, теория инвариантности [9, 16] предлагает методы, использующие свойства симметрии некоторых задач. Большой универсальностью обладает ме-
методом максимального правдоподобия). В том
...,,/...,, HxxfHxxf
F(x), конечно, не от того, что выборка подчинена како-
.
ˆ
xx ...,,
следует принять решение в пользу
N
1
H
и H1, т.е. решить – это выборка
0
Hxf или
отношения правдоподобия
и выбор гипотезы H1, если это отно-
0111
NN
F( θx ) не всегда достижимо, и возни-
говорить только, если имеется уве-
θ=θ
θ
0
F(
1мп
H
, если ниже его.
0
) неизвестно. Если ос-
θx
11
)
является
xxL ...,,maxarg
N
Hxf , лучшей
1
непараметриче-
θ=θ
xxfxxL ...,,...,,
NN
107
тод интерпретации статистик как функционалов от оценок распреде­лений. Этот метод основан на двух следующих идеях. Во-первых, вся­кая (или почти всякая) статистическая задача может быть сведена к выбору значения некоторого функционала пределения
F(x) (главной трудностью этого метода является построе-
J(F) от неизвестного рас-
ние функционала, содержащего всю априорную информацию, имею­щуюся в постановке задачи [10]. Например, в задачах сравнения двух распределений необходимо построить удачную меру их различия
J(F, G)). Во-вторых, оценку интересующего нас функционала (т.е. вы-
бор альтернативы) предполагается получать, подставляя в него вместо неизвестных распределений их непараметрические (т.е. не исполь­зующие знание их функционального вида) оценки этих распределений. Хотя при этом можно использовать разные оценки одного и того же распределения, что позволяет иметь несколько процедур
решения од­ной задачи, сами процедуры часто возможно сравнивать теоретически и решать, в каких условиях одна лучше другой.
Все же полный отказ от знания распределений выглядит как че­ресчур сильная реакция на слишком жесткие требования параметриче­ской статистики. Существует множество практических ситуаций, в ко­торых мы не знаем распределения точно, но
знаем его приблизительно. В таких случаях применение непараметрических процедур равносиль­но отказу от этой хотя и неточной, но правильной и поэтому полезной информации. В последние годы развивается новая ветвь математиче­ской статистики, соответствующая такому уровню априорной инфор­мации, –
робастная статистика [42]. Ее основная идея состоит в том,
чтобы несколько поступиться оптимальностью на точно задаваемом опорном распределении, но зато обеспечить некоторый гарантирован­ный уровень качества решения на всех других распределениях, лежа­щих в окрестности опорного решения. Математическая сторона этого вопроса связана с теорией непрерывности и дифференцируемости функционалов от распределений и требует соответствующих
знаний, но в ряде случаев получаемые алгоритмы легко воспринимаются и на уровне здравого смысла. Например, для получения робастных оценок среднего рекомендуется вычислять среднее арифметическое, отбросив из выборки самое большое и самое малое наблюдения. Именно так и поступают при определении средней урожайности за несколько лет; аналогично начисляют баллы в фигурном катании. Конечно
, это про­стейший случай, когда требуется обеспечить устойчивость к случай­ным и не относящимся к делу отклонениям, таким как субъективное оценивание или нетипичные погодные условия. Теория робастных процедур дает рекомендации и в более сложных условиях [42]. Еще один вариант, при котором распределения изначально считаются зада­ваемыми интервалами, а не точными значениями,
только начал разви-
ваться.
108
5.5.4. ПРАВИЛА «СТАТИСТИЧЕСКОЙ БЕЗОПАСНОСТИ»
В предыдущих параграфах установлено, что любой вариант зада­чи выбора сопряжен со сложностями, парадоксами, «ловушками» и опасностями, когда теоретические методы применяются на практике. Не является исключением и выбор в условиях статистической неопре­деленности. Неудачное или неправильное применение статистических методов к решению реальных проблем дало повод к появлению до­вольно зловещей шутки ложь и статистика».
Причины неправильного применения статистических методов немногочисленны, и их знание совершенно необходимо. Перечень ус­ловий, связанных с отрицательными последствиями использования статистических решений, можно рассматривать как своего рода «инст­рукцию по технике статистической безопасности».
Статистический вывод по своей природе случаен, он может
1.
иметь высокую надежность и точность, но почти никогда не может быть абсолютно достоверным
ся, каждая процедура сопровождается характеристикой ее качества: оценка параметра имеет фиксированную точность (задаваемую, на­пример, дисперсией); принятие одной из гипотез связано с вероятно­стями ошибок, сообщаемыми пользователю заранее. Когда необходи­мо ужесточить требования к качеству, это обычно можно сделать уве­личивая объем выборки. ошибочным, но мы можем варьировать характеристики этих ошибок (в пределах наличных ресурсов).
Качество решения на выходе статистической процедуры за-
2.
висит от того, что подается на ее вход
Известны случаи, когда проспавший лаборант утром сам сочинял «протокол» ночных наблюдений и измерений; когда в таблицы и про-
токолы вносились «поправки», угодные лицу, не заинтересованному в истине, и т.д. Ясно, что статистическая обработка таких «данных» вы­даст некий результат, но стоит ли обвинять статистику в его качестве?
Следующий, более сложный случай – добросовестное заблуж-
3.
дение относительно статистичности серии наблюдений, когда этого на самом деле нет
статистической обработке подвергались данные, вообще не имеющие статистической природы. Иногда этот факт трудно проверить, особен­но при небольших объемах выборки. Этому моменту следует уделять специальное внимание при организации экспериментов, а при малей­шем сомнении не полагаться на «паспортные» характеристики качест­ва процедуры, относиться к результатам вочным данным, как к поводу для дальнейших исследований.
: «Есть три вида лжи – просто ложь, наглая
. В статистике этот факт и не скрывает-
Итак, статистический вывод может быть
.
. Тутубалин [39] приводит много примеров, когда
обработки как к ориентиро-
109
4. Утрата ожидаемого качества статистических решений может
следствием использования процедуры, не соответствующей дей-
быть
ствительному уровню априорной информации
(например, применение дисперсионного анализа к негауссовым данным). Если «действитель­ный» уровень априорной информации не очень ясен, то полезно обра­ботать данные несколькими способами. Расхождение выводов должно стать сигналом к поиску причин расхождения. Следует остерегаться принимать решение «голосованием процедур», так как опасность нетранзитивности (см. 5.3) – свойство голосования вообще, а не только голосования
людей.
Нарушение априорных предположений может происходить до­вольно неожиданным образом. Поучителен пример из реальной жизни: непараметрическая процедура классификации была «обучена» эффек­тивно распознавать нефтяные слои от водяных по геофизическим дан­ным одного месторождения. Внедренная на другом, соседнем место­рождении нефти программа стала давать слишком большие вероятно­сти ошибок распознавания: непараметричность процедуры
не означа­ет, что на выборках из другого распределения она сохранит те же свойства.
5. Причиной необоснованных претензий к статистике может
служить
тистического вывода
неверная содержательная интерпретация правильного ста-
. Например, одно из английских статистических исследований прошлого века установило, что здоровье людей, нося­щих котелки, значимо лучше здоровья мужчин в кепках; в другом слу­чае оказалось, что главным фактором, влияющим на различие в уро­жайности клевера в соседних деревнях, было... число старых дев. Та­ким (и подобным) правильным выводам можно
придать совершенно разный смысл. (Кстати, оказалось, что английские старые девы держат по нескольку кошек, а мыши любят разорять гнезда шмелей – основ­ных опылителей клевера.) Действительные причины обнаруженной статистической связи могут оставаться неясными. Например, новоси­бирские статистики установили очень сильную статистическую связь между урожайностью зерна в данном году и яйценоскостью кур. Ин
-
терпретация зависимостей лежит вне статистики, и за неправильную интерпретацию нельзя осуждать саму статистику.
Несмотря на все предосторожности, как и в любой практической деятельности, в статистической практике возможны нарушения правил безопасности и неизбежны связанные с этим потери. Видимо, именно поэтому юристы одной крупной фирмы, поставляющей очень разви­тую программную систему для
статистического анализа на ЭВМ, включили в договор о поставке этой системы пункт о том, что «фирма не несет ответственности за возможный ущерб от использования дан­ной системы».
110
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]