Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Системный анализ. Учебное пособие для бакалавров и специалистов

.pdf
Скачиваний:
1
Добавлен:
07.09.2026
Размер:
2 Мб
Скачать
☆
mnmm
n
n
ij
aaa
aaa
aaa
aA
21
22221
12111
nm
1
К
2
К
1
С
2
С
22
1
С
2
С
1
К
1
-1
2
К
-1
1
1
К
2
К
1
К
2
К
.
Матрицу A назовем платежной матрицей или матрицей игры.
Конечной игрой размерности (
) называется игра,
определенная матрицей A, имеющей m строк и n столбцов.
Если конечная игра записана в виде такой матрицы, то говорят, что она приведена к нормальной форме.
Рассмотрим примеры парных игр.
Пример 1. Рассматривается игра, которую назовем «Поиск». В ней участвуют две стороны: К и С. К хочет найти С; С, наоборот, хочет спрятаться от К. У С есть два места, где он может прятаться, – убежища I и II, он может выбрать любое. Игрок К по правилам игры тоже может искать С, где ему вздумается. Если он нашел С, то С проиграл одно очко; если не нашел, т.е. пошел не в то убежище, где спрятался С, то, наоборот, К проиграл одно очко. Требуется записать игру в нормальной форме.
Решение. У К две стратегии: искать в убежище II. У С тоже две стратегии:
убежище I,
– прятаться в убежище II. Игра конечная –
– искать в убежище I,
– прятаться в
–
построим матрицу игры:
,
Представим себе, что мы – игрок К и что нам предлагается выбрать себе стратегию. Что ж, попробуем! Выберем, например,
, т.е. будем
искать всегда в убежище I. Но тогда разумный противник через несколько партий догадается о нашей стратегии и будет прятаться там, где мы его не ищем, т. е. в убежище II. Плохо! Выберем стратегию
. Ничуть не лучше: противник снова догадается и будет прятаться в
убежище I. Что же нам делать? Попробуем применять стратегии
и
попеременно, через одну партию игры. Но ведь противник и об
этом может догадаться и будет прятаться каждый раз не там, где мы его ищем. Как ни кинь – все клин! Что же, значит, наше положение безвыходно? При любом выборе стратегии нам придется проигрывать? Выходит, что так.
91
21
 
ij
j
i
aminmax
 
ij
i
j
amaxmin
33
1
С
2
С
3
С
1
К
2
-3
4
2
К
-3 4 -5
3
К
4
-5
6
Давайте теперь встанем на точку зрения противника. С удивлением мы обнаружим, что его положение – ничуть не лучше нашего! Какую бы стратегию он ни выбрал – все ему невыгодно.
Позже мы с вами решим эту игру, т.е. найдем пару оптимальных стратегий К и С. Впрочем, о них можно по секрету сообщить заранее: каждому игроку надо будет чередовать свои стратегии, но не регулярно (через одну), а случайным образом (например, подбросить монету и, если она упадет гербом, искать в убежище I, а если цифрой – в убежище II). Аналогично должен будет действовать и С. При этом в среднем на одну партию будет приходиться нулевой выигрыш («цена» этой игры будет равна нулю): К не будет ни выигрывать, ни проигрывать. Не очень приятно, но все-таки много лучше, чем всегда быть в проигрыше!
Здесь мы впервые столкнулись с одним из важных понятий теории игр – с понятием смешанной стратегии, т.е. чередования нескольких «чистых» стратегий по случайному закону в определенных пропорциях, или, как говорят, с определенными частотами. В данном примере каждая из стратегий применяется с частотой
.
Максимином или нижней ценой игры назовем число
,
а соответствующую ему стратегию (строку) – максиминной.
Минимаксом или верхней ценой игры назовем число
,
а соответствующую ему стратегию (столбец) – минимаксной.
Пример 2. Игра «Три пальца». Два игрока К и С одновременно, не
сговариваясь, показывают друг другу один, два или три пальца. Если всего показанных пальцев (первым и вторым вместе) будет четное число, то выигрывает К: он получает столько очков, сколько всего было пальцев, если нечетное – выигрывает С, на тех же условиях. Требуется записать игру в нормальной форме.
Решение. Перенумеруем стратегии по числу показанных пальцев. Игра
, построим матрицу игры:
92
1
К
2
С
Стратегии
1
С
2
С
3
С
Минимумы
строк
1
К
2
-3 4 -3*
2
К
-3 4 -5
-5
3
К
4
-5 6 -5
Максимумы
столбцов
4*
4* 6
2
К
3
С
3
К
1
К
1
К
1
К
Поразмыслим немного над стратегиями каждой стороны. Станем сначала на сторону К. Предположим, что мы выбрали стратегию
Что будет делать противник? Он разумен и хочет отдать поменьше. Ясно, что он выберет стратегию
; наш выигрыш при этом будет
равен -3, т.е. мы потеряем 3 очка. Плоховато! Запишем число -3 против первой строки в добавочном столбце:
Попробуем другую стратегию –
ответит
. Тогда мы потеряем 5 очков. Еще хуже! Третья стратегия –
. На нее разумный противник
– дает точно тот же результат: выигрыш (-5).
Что же делать? Пожалуй, лучше других будет все-таки стратегия
– при ней мы, по крайней мере, не проиграем больше 3 очков! Ведь
против этой стратегии стоит максимальное число дополнительного столбца – мы его отметили звездочкой.
Выбрав стратегию
, мы гарантируем себе, что, как бы ни вел
себя противник, мы никак не проиграем больше 3 очков [т.е. не выиграем меньше (-3) очков]. Величина (-3) есть максимальный гарантированный выигрыш, который мы («красные») можем себе обеспечить, применяя только одну-единственную стратегию. Такой стратегией должна быть
.
Как мы получили (-3)? Нашли минимум каждой строки и из этих минимумов взяли максимальный. Эта величина называется максимином или нижней ценой игры. Будем обозначать ее .
Подумаем теперь за противника. Он тоже хочет отдать поменьше, а получить побольше. Но какую бы он стратегию ни выбрал, мы («красные») поведем себя таким образом, чтобы получить с него побольше. Значит, противник («синие») должен в каждом столбце выписать не минимальное, а максимальное число.
Из этих максимумов он должен найти минимальный, так называемый минимакс или верхнюю цену игры, которую мы обозначим . Эта величина в нашем случае равна 4 и отмечена
.
93
1
С
2
С
1
К
1
С
2
С
1
К
1
С
1
К
2
С
2
К
3
С
звездочкой. Чтобы не проиграть больше 4, «синие» должны придерживаться любой из своих двух стратегий
,
.
Значит, если каждому участнику предлагается выбрать одну­единственную стратегию, то эти стратегии должны быть:
«красных» и
или
для «синих».
для
Как мы выбрали эти стратегии? Руководствуясь принципом осторожности, который говорит: в игре веди себя так, чтобы получить наибольшую выгоду при наихудших для тебя действиях противника. Этот принцип называется принципом минимакса и является в теории игр основным.
Применяя этот принцип, мы пока что рекомендовали игроку К показывать один палец, игроку С – показывать один или два пальца.
Но нашли ли мы решение игры, т.е. такую пару стратегий, которая является равновесным положением? Легко убедиться, что нет. Найденные нами стратегии обладают досадным свойством: они неустойчивы. Действительно, пусть оба игрока держатся рекомендованных чистых стратегий:
и, скажем,
. Пока оба
держатся этих стратегий, выигрыш будет равен 2, т.е. на каждую партию игры С проигрывает К два очка. К, может быть, и доволен, но С досадно. Он не хочет проигрывать. Допустим, он откуда-то узнал, что мы придерживаемся стратегии
Разумеется, немедленно перейдет к стратегии
. Что он будет делать?
и будет получать по
3 очка, т.е. сведет наш выигрыш к (-3). А если мы теперь узнаем о поведении С? Перейдем на стратегию
на
и т.д.
. В ответ на это С перейдет
Мы убедились, что пара стратегий, вытекающих из принципа минимакса, неустойчива: стоит одному игроку узнать, что делает другой, как равновесие нарушается... Всегда ли это будет так? Оказывается, не всегда.
Теорема 1.1. Нижняя цена игры всегда не превосходит верхнюю цену игры.
Игрой с седловой точкой называется игра, для которой
Ценой игры называется величина , если
.
.
В случае игры с седловой точкой игрокам выгодно придерживаться максиминной и минимаксной стратегий и невыгодно отклоняться от них. В таких случаях про игру говорят, что в ней имеет место
равновесие в чистых стратегиях.
Класс игр, имеющих седловую точку, имеет большое значение в теории игр. В частности, доказано, что если по правилам игры каждый
94
 
 
63
42
A
33;2max
36;3min
3
321a
1;0*U
0;1*Z
3
 
 
63
24
A
из игроков знает результат всех предыдущих ходов – как своих, так и противника (так называемая игра с полной информацией), то игра
имеет седловую точку и, значит, имеет решение в чистых стратегиях.
Возможна игра и с несколькими седловыми точками. Тогда игра имеет несколько оптимальных решений, но с одинаковой ценой игры.
Чаще встречаются матричные игры без седловой точки, когда
, и тогда для нахождения решения используются смешанные
стратегии.
Смешанной стратегией игрока называется вектор, каждая из
компонент которого показывает относительную частоту использования игроком соответствующей чистой стратегии.
Теорема 1.2 (основная теорема теории матричных игр). Всякая матричная игра с нулевой суммой имеет решение в смешанных стратегиях.
Теорема 1.3. Если один из игроков применяет оптимальную смешанную стратегию, то его выигрыш равен цене игры зависимости от того, с какими частотами будет применять второй игрок свои стратегии (в том числе и чистые стратегии).
3.5.3. Примеры решения задач при парной игре с нулевой суммой
Пример 1. Найти решение игры, заданной матрицей A:
.
вне
Решение. Прежде всего, проверим наличие седловой точки в данной матрице. Для этого найдем нижнюю и верхнюю цену игры.
Минимальные элементы по строкам равны 2 и 3, тогда нижняя цена игры
и 6, тогда верхняя цена игры
и мы имеем седловую точку
решение в чистых стратегиях.
Оптимальные чистые стратегии для первого и второго игроков равны соответственно
Пример 2. Найти решение игры, заданной матрицей A:
Решение. Прежде всего, проверим наличие седловой точки в
данной матрице. Для этого найдем нижнюю и верхнюю цену игры.
. Максимальные элементы по столбцам равны 3
. Отсюда видно, что
, т.е. задача имеет
,
95
, а цена игры
.
.
33;2max
46;4min
21
;uuU
 
.62
,34
* 2
*
1
* 2
*
1
uu
uu
1
* 2
*
1
uu
52;53;
*2*
1
*
uuU
518
 
.51862
,51834
* 2
*
1
* 2
*
1
zz
zz
51;54;
*2*
1
*
zzZ
Ou
0;1
1;0
Минимальные элементы по строкам равны 2 и 3, тогда нижняя цена игры
и 6, тогда верхняя цена игры
. Максимальные элементы по столбцам равны 4
. Отсюда видно, что
и мы имеем игру, которая имеет решение в смешанных
стратегиях, а цена игры
.
Предположим, что для первого игрока смешанная стратегия задается вектором
. Первый игрок, если придерживается
своей оптимальной стратегии, независимо от стратегии второго игрока получает цену игры
, т.е.:
Кроме этого, относительные частоты связаны условием:
.
Решаем полученную систему трех линейных уравнений с тремя неизвестными. Получим оптимальную стратегию первого игрока и цену игры:
,
.
Составим уравнения для нахождения оптимальной стратегии второго игрока, если при любой чистой стратегии первого второй проигрывает цену игры:
Решаем полученную систему двух линейных уравнений с двумя неизвестными. Получим оптимальную стратегию второго игрока:
.
Рассмотрим геометрическую интерпретацию этой задачи в смешанных стратегиях. Для этого на плоскости введем систему координат и на горизонтальной оси
отложим вероятность
применения первым игроком его двух стратегий, сумма этих вероятностей равна 1, поэтому весь график расположится на отрезке единичной длины. В точке 0 стратегия
, а в 1 – стратегия
По оси ординат в точке 0 отложим выигрыши первого игрока по первой его стратегии при обеих стратегиях второго, а в точке 1 – при второй стратегии первого игрока. Соединим эти платежи по столбцам, тогда пересечение прямых дадут решение первой системы уравнений, а ордината этой точки – цену игры  (рис. 3.3).
96
.
6
4 M 3
2 u2= 1-u1 u
1
0 2/5 1
Рис. 3.3. Геометрическая интерпретация задачи
Аналогично можно построить график для нахождения оптимальной стратегии второго игрока.
Мы рассмотрели только самый простой вариант парной матричной игры с нулевой суммой, но она достаточно наглядно показывает, что иногда можно количественно оценить и выбрать оптимальный вариант поведения в конфликтной ситуации.
3.6. Игры с ненулевой суммой. Конкуренция и сотрудничество
Классическая дилемма заключенного (ДЗ) – некооперативная игра, в которой игроки стремятся получить выгоду, сотрудничая друг с другом или предавая.
Двое преступников – А и Б попались примерно в одно и то же время на сходных преступлениях. Есть основания полагать, что они действовали по сговору, и полиция, изолировав их друг от друга, предлагает им одну и ту же сделку: если один свидетельствует против другого, а тот хранит молчание, то первый освобождается за помощь следствию, а второй получает максимальный срок лишения свободы (10 лет). Однако иных доказательств их вины у следствия нет. Если оба молчат, их деяние квалифицируется как неоказание помощи следствию и они приговариваются к 6 месяцам. Если оба свидетельствуют против друг друга, они получают минимальный срок (по 2 года). Каждый заключенный выбирает, молчать или свидетельствовать против другого. Однако ни один из них не знает точно, что сделает другой.
Дилемма появляется, если предположить, что оба заботятся только о минимизации собственного срока заключения.
Игру можно представить в следующем виде (табл. 3.1).
97
Стратегии
Заключенный Б
хранит молчание
Заключенный Б
дает показания
Заключенный А
хранит молчание
Оба получают
полгода тюрьмы
А получает 10 лет,
Б освобождается
Заключенный А
дает показания
А освобождается, Б получает 10 лет
тюрьмы
Оба получают
2 года тюрьмы
cdCD
cDC 2
Таблица 3.1. Дилемма заключенного в нормальной форме
Представим рассуждения одного из заключенных. Если партнер молчит, то лучше его предать и выйти на свободу (иначе – полгода тюрьмы). Если партнер свидетельствует, то лучше тоже свидетельствовать против него, чтобы получить 2 года (иначе – 10 лет). Стратегия «свидетельствовать» строго доминирует над стратегией «молчать». Аналогично другой заключенный приходит к тому же выводу.
С точки зрения группы (этих двух заключенных), лучше всего сотрудничать друг с другом, хранить молчание и получить по полгода, так как это уменьшит суммарный срок заключения. Любое другое решение будет менее выгодным.
Обобщенная форма игры часто используется в экспериментальной экономике. Можно раскрыть «скелет» игры далее, абстрагировавшись от подтекста заключенных. Следующие правила дают типичную реализацию игры (табл. 3.2).
1. В игре – два игрока и банкир. Каждый игрок держит 2 карты: на
одной написано «сотрудничать», на другой – «предать» (это стандарт­ная терминология игры). Каждый игрок кладет одну карту перед бан­киром лицом вниз (то есть никто не знает чужого решения, хотя зна­ние чужого решения не влияет на анализ доминирования). Банкир от­крывает карты и выдает выигрыш.
2. Если оба выбрали «сотрудничать», оба получают C. Если один
выбрал «предать», другой – «сотрудничать», первый получает D, вто­рой – с. Если оба выбрали «предать», оба получают d.
3. Значения переменных C, D, c, d могут быть любого знака (в
примере выше все меньше либо равны 0). Обязательно должно соблю­даться неравенство
, чтобы игра представляла собой ДЗ.
4. Если игра повторяется, то есть играется больше 1 раза подряд,
общий выигрыш от сотрудничества должен быть больше суммарного выигрыша в ситуации, когда один предает, а другой – нет, то есть
.
98
Стратегии
Сотрудничать
Предать
Сотрудничать
C, C
c, D
Предать
D, c
d, d
Таблица 3.2 . Каноническая матрица выигрышей ДЗ
Расширение сценария ДЗ – повторяющаяся дилемма заключенного (ПДЗ). В ней участники делают выбор снова раз за разом и помнят предыдущие результаты.
«Жадные» стратегии давали плохие результаты в долгосрочном периоде, тогда как более «альтруистические» стратегии работали лучше с точки зрения собственного интереса. Аксельрод использовал это, чтобы показать возможный механизм эволюции альтруистического поведения из механизмов, которые изначально чисто эгоистические, через естественный отбор.
Лучшей детерминистской стратегией оказалась «Око за око» (Tit for Tat), которую разработал и выставил на чемпионат Анатолий Рапопорт. Стратегия проста: сотрудничать на первой итерации игры, после этого игрок делает то же самое, что делал оппонент на предыдущем шаге.
Чуть лучше работает стратегия «Око за око с прощением». Когда оппонент предает, на следующем шаге игрок иногда в любом случае сотрудничает с небольшой вероятностью (1-5 %). Это позволяет случайным образом выйти из цикла взаимного предательства.
Условия, необходимые, чтобы стратегия получила высокий результат
1. Добрая. Важнейшее условие – стратегия должна быть «доброй»,
то есть не предавать, пока этого не сделает оппонент. Почти все стратегии-лидеры были добрыми. Поэтому чисто эгоистичная стратегия по чисто эгоистическим причинам не будет первой «бить» соперника.
2. Мстительная. Успешная стратегия не должна быть слепым
оптимистом. Она должна всегда мстить. Пример немстительной стратегии – всегда сотрудничать. Это очень плохой выбор, поскольку «подлые» стратегии воспользуются этим.
3. Прощающая. Другое важное качество успешных стратегий –
уметь прощать. Отомстив, они должны вернуться к сотрудничеству, если оппонент не продолжает предавать. Это предотвращает бесконечное мщение друг другу и максимизирует выигрыш.
4. Не завистливая. Последнее необходимое качество – не быть
завистливым, то есть не пытаться набрать больше очков, чем оппонент
99
mi ,...,2,1
n
nj ,...,2,1
ij
q
ij
qQ
j
П
i
Р
1
П
2
П
…
n
П
ij
j
qmin
1
Р
11
q
12
q
…
nq1
min),(1ПРQ
2
Р
21
q
22
q
…
nq2
min),(2ПРQ
… … … … …
…
m
Р
1m
q
2m
q
…
mn
q
min),( ПРQ
m
ij
rR
(что в принципе невозможно для «доброй» стратегии, то есть добрая стратегия никогда не может набрать больше очков, чем оппонент).
3.7. Критерии принятия решений в условиях неопределенности
Неопределенность среды в процессе принятия решений может быть игровой (целенаправленное противодействие среды) и природной (обусловленной воздействием случайных факторов окружающей среды).
В теории игр создание модели должно начинаться с построения
матрицы игры, т.е. платежной матрицы или матрицы выигрышей. Отличительная особенность игры с природой состоит в
том, что в ней сознательно действует только один из участников (игрок 1). Игрок 2 (природа) не действует, а выступает как партнер по игре, не имеющий конкретной цели и случайным образом выбирающий очередные «ходы».
Допустим, рассматривается вопрос о проведении финансовой операции в условиях неопределенности. При этом у игрока 1 (лица, принимающего решения – ЛПР) есть m возможных решений (ситуаций)
«природа» может принимать одно из
, а реальная ситуация неопределенна, то есть
возможных состояний
. Пусть известно, что если ЛПР примет i-e решение
(выберет i-ю альтернативу), а ситуация примет j-й вариант состояния (j-й исход), то будет получен доход
. Матрица
называется
матрицей последствий (возможных решений, выигрышей) или матрицей эффективности.
Матрицу игры с природой можно задавать и в виде матрицы рисков или матрицы упущенных возможностей. Величина риска –
это размер платы за отсутствие информации о состоянии среды. Матрица
называется матрицей рисков и строится на основе
матрицы выигрышей.
100
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]