Теория игр в принятии оптимальных решений. Учебное пособие
.pdfных игр, если интересы отдельных участников совпадают, они могут образовывать временные или постоянные коалиции. Если множество игроков образуют две коалиции (такая ситуация часто встречается в случае военных действий), то множественная игра по существу сводится к парной.
По возможности заключения соглашений между игроками игры подразделяются на кооперативные и некооперативные.
Игра называется кооперативной, или коалиционной, если игроки могут объединяться в группы, беря на себя некоторые обязательства перед другими игроками и координируя свои действия. Этим она отличается от некооперативных игр, в которых каждый обязан играть за себя. Развлекательные игры редко являются кооперативными, однако такие механизмы взаимодействия нередки в повседневной жизни. Часто предполагают, что кооперативные игры отличаются именно возможностью общения игроков друг с другом. В общем случае это неверно. Существуют игры, где коммуникация (общение игроков) разрешена, но игроки преследуют личные цели и не стремятся к образованию коалиций, и наоборот. Приведенные выше примеры относятся к некооперативным играм. Примером кооперативной игры может служить сговор нескольких фирм на рынке по поводу установления ими цены на свою продукцию.
Гибридные игры включают в себя элементы кооперативных и некооперативных игр. Например, игроки могут образовывать группы, но игра будет вестись в некооперативном стиле. Это значит, что каждый игрок будет преследовать интересы своей группы, вместе с тем стараясь достичь личной выгоды.
По способу формирования выигрыша можно выделить игры с нулевой
суммой и с ненулевой суммой.
Игры с нулевой суммой — особая разновидность игр с постоянной суммой, то есть таких игр, где игроки не могут увеличить или уменьшить имеющиеся ресурсы, так называемый фонд игры. В игре с нулевой суммой в каждой ситуации сумма выигрышей одних игроков равна сумме проигрышей остальных игроков. Примером игры с нулевой суммой является игра «камень, ножницы, бумага». Игрой с нулевой суммой является покер, спекуляции на валютной бирже, обычное воровство и множество других ситуаций.
Многие изучаемые математиками игры, в том числе уже упоминавшаяся «Дилемма заключённого», иного рода: в играх с ненулевой суммой выигрыш какого-то игрока (игроков) не обязательно означает проигрыш другого (других), и наоборот. Суммарный выигрыш в такой игре в каждой ситуации может быть меньше или больше нуля. В случае необходимости некоторые из таких игр могут быть приведены к игре с нулевой суммой, это делается введением фиктивного игрока, который «присваивает себе» излишек или восполняет недостаток средств.
Игрой с отличной от нуля положительной суммой является взаимовыгодная торговля. Примером игры с отрицательной суммой могут служить военные действия.
По сочетанию выигрышей игроков в каждой ситуации можно выделить
симметричные и несимметричные игры.
11
Игра будет симметричной тогда, когда игроки имеют одинаковый набор стратегий и выигрыши по соответствующим стратегиям у игроков равны. Иными словами, матрицы выигрышей для обоих игроков в симметричной игре будут одинаковыми. Многие изучаемые игры для двух игроков являются симметричными. В частности, таковой является «Дилемма заключённого», приведенная в примере выше. Однако ту же «Дилемму заключенного» можно представить и в виде несимметричной игры, предположив, к примеру, что в случае, когда оба заключенных отрицают свою вину, один из них получит пять лет заключения, а второй (рецидивист) - восемь.
По порядку осуществления ходов выделяют параллельные (статические) и последовательные (динамические) игры.
В параллельных играх игроки выбирают свою стратегию одновременно, или, по крайней мере, они не осведомлены о выборе других участников игры до тех пор, пока все не сделают свой ход. В последовательных, или динамических, играх участники могут делать ходы в заранее установленном либо случайном порядке, но при этом они получают некоторую информацию о предшествующих действиях других игроков. Эта информация может быть даже не совсем полной, например, игрок может узнать, что его противник из десяти своих стратегий точно не выбрал пятую и седьмую. Приведенные выше примеры игр относятся к параллельным или статическим играм. Классическим примером последовательной (динамической) игры являются шахматы.
По наличию у игроков информации о стратегиях и ходах противника вы-
деляют игры с полной информацией и игры с неполной информацией.
Игры с полной информацией составляют важное подмножество последовательных игр. В такой игре участники знают все ходы, сделанные до текущего момента, равно как и возможные стратегии противников, что позволяет им в некоторой степени предсказать последующее развитие игры. Полная информация недоступна в параллельных играх, так как в них неизвестны текущие ходы противников. Большинство изучаемых в математике игр — с неполной информацией, в том числе и «Дилемма заключённого». В то же время есть интересные примеры игр с полной информацией: шахматы, шашки, нарды и другие.
Игры с неполным информированием являются наиболее привлекательными для изучения, если грамотно соблюдён баланс между открытой и закрытой информацией. Действительно, если открыть всю информацию в игре, то процесс принятия решений сводится к умению держать в голове как можно больше информации и проводить на ее основе строгие математические расчеты. Такой игрой являются шахматы. Напротив, если закрыть всю информацию в игре, то игроки в конечном итоге будут делать ходы случайным образом и выработка оптимальной стратегии становится невозможной.
По числу шагов выделяют игры с конечным число шагов и игры с бесконечным числом шагов.
Игры в реальном мире, в том числе описывающие взаимодействие экономических субъектов, как правило, длятся конечное число ходов. Все приведенные нами примеры являются играми с конечным числом шагов. Математика не так ограничена, и в частности, в теории множеств рассматриваются игры, спо-
12
собные продолжаться бесконечно долго. Причём победитель и его выигрыш не могут быть определены до окончания всех ходов.
В играх с бесконечным числом шагов вопрос обычно состоит в том, чтобы найти не оптимальное решение, а хотя бы выигрышную стратегию, позволяющую поддерживать положительный результат на длительной дистанции. Примером конфликта, который может быть описан с помощью игры с бесконечным числом шагов, служит затяжной военный или политический конфликт, который может длиться десятилетиями без достижения окончательного результата.
2. Антагонистические игры (игры двух лиц с нулевой суммой)
Рассмотрим простейшую математическую модель конфликтной ситуации, когда имеется два игрока с полностью противоположными интересами и в каждой ситуации выигрыш одного из них равен проигрышу другого. Такая игра называется антагонистической игрой или игрой двух лиц с нулевой суммой. В реальной жизни подобных конфликтов существует множество. Например, взаимодействие налогоплательщика с налоговой инспекцией, при котором сумма уплаченного налога является одновременно выигрышем для одной стороны (государства в лице налоговой инспекции) и потерями для другой (налогоплательщика).
Антагонистические игры являются наиболее хорошо изученным классом игр, для их решения разработаны различные методы, позволяющие определить оптимальную стратегию каждого из противников.
Результаты игры двух лиц с нулевой суммой при конечном числе стратегий удобнее всего записывать в виде матрицы, в которой каждая строка соответствует одной из стратегий первого игрока (игрока А), а каждый столбец соответствует одной из стратегий второго игрока (игрока В). На пересечении строк и столбцов записываются выигрыши игрока А в различных ситуациях. Но особенность игры с нулевой суммой заключается в том, что, записывая в матрицу по строкам выигрыши для игрока А, мы автоматически отражаем по столбцам и результаты игры для игрока В, т.е. его проигрыши в каждой ситуации. Иными словами, результаты антагонистической игры для обоих игроков исчерпывающим образом могут быть отражены в одной платежной матрице. Поэтому такие игры часто называют матричными играми.
2.1.Решение игры с нулевой суммой в чистыхстратегиях
Пусть в игре участвуют два игрока, каждый из которых может записать любую цифру от 1 до 3. Если записанная цифра окажется больше цифры соперника, то выигрыш игрока будет положительным, и его величина будет равняться разнице между записанными цифрами.
Таким образом, каждый из игроков имеет три стратегии: SА = SВ = {«записать 1»; «записать 2»; «записать 3»}. Выигрыши игрока А, которые он может получить при реализации каждой из своих стратегий во взаи-
13
модействии со стратегиями игрока В, обозначим как aij и представим в таблице
2.1.
|
|
|
|
|
|
|
Таблица 2.1. |
|
|
Платежная матрица антагонистической игры (условный пример) |
|||||||
|
Стратегии игроков |
|
= 1 |
|
= 2 |
|
= 3 |
|
|
|
|
|
|
||||
|
|
|
|
|
|
|
|
|
|
= 1 |
|
1 |
|
0 |
|
-1 |
|
|
= 2 |
|
0 |
|
-1 |
|
-2 |
|
|
|
2 |
|
1 |
|
0 |
|
|
|
= 3 |
|
|
|
|
|
|
|
Таким образом, игру можно представить в виде матрицы, в которой строки
– стратегии игрока А, столбцы – стратегии игрока В, а на пересечении строк и столбцов расположены выигрыши игрока А:
0 |
−1 |
−2 |
1 |
0 |
−1 |
2 |
1 |
0 |
В общем виде платёжная матрица игры двух лиц с нулевой суммой, в которой игрок А имеет m стратегий, а игрок В имеет n стратегий, может быть записана как:
a |
a |
...a |
|
11 |
12 |
1n |
|
a21a22...a2n |
|
||
|
|
|
|
.... |
|
|
|
|
|
|
|
am1am2...amn
Строго говоря, данная матрица отражает выигрыши игрока А. Но поскольку мы имеем дело с игрой с нулевой суммой, то результаты игры для игрока В также автоматически отражены в матрице при рассмотрении ее по столбцам и представляют собой проигрыши игрока В.
Задача каждого из игроков – найти наилучшую стратегию, обеспечивающую ему наибольший гарантированный выигрыш.
Найдем наилучшую стратегию первого игрока. Минимальный размер выигрыша в каждой строке обозначим αi:
i |
minaij |
|
j |
Выигрыш в размере αi является минимальным гарантированным выигрышем игрока А при выборе им стратегии с номером i, поскольку какую бы стратегию не выбрал противник (игрок В), игрок А не получит выигрыш меньше, чем αi. Зная минимальные гарантированные выигрыши для каждой стратегии, первый игрок выберет ту из них, для которой это значение будет максимальным:
max i maxminaij
ii j
14
Подобная стратегия определения выигрыша называется максиминной, а величина α – гарантированный выигрыш, который может обеспечить себе пер-
вый игрок – нижней ценой игры.
Аналогичным образом будет вести себя и игрок В, с той лишь разницей, что он будет стремиться к минимизации проигрыша. Для этого определим максимальное значение его проигрыша по каждой возможной стратегии (максимальный гарантированный проигрыш):
j |
maxaij |
|
i |
Оптимальной стратегией для игрока В будет та из них, которая позволяет ему гарантированно получить минимальный из возможных проигрышей:
min j |
minmaxaij |
j |
j i |
Подобная стратегия называется |
минимаксной и позволяет определить |
β – верхнюю цену игры. Если игрок В будет придерживаться минимаксной стратегии, то он гарантированно проиграет не больше β.
Для любой матричной игры справедливо неравенство:
α ≤ β
Если верхняя и нижняя цены игры совпадают, то общее значение верхней и нижней цены игры α = β = v называется чистой ценой игры, или ценой игры.
В этом случае говорят, что игра имеет решение в чистых стратегиях. Мак-
симинная стратегия игрока А ( ) и минимаксная стратегия игрока В ( ), соответствующие цене игры, являются оптимальными стратегиями игроков, а профиль стратегий ( ; )— решением игры. В этом случае игрок А получает максимальный гарантированный (не зависящий от поведения игрока В) выигрыш v, а игрок В добивается минимального гарантированного (вне зависимости от поведения игрока А) проигрыша v. Говорят, что в этом случае решение игры обладает устойчивостью, т.е. если один из игроков придерживается своей оптимальной стратегии, то для другого не может быть выгодным отклоняться от своей оптимальной стратегии.
Пара чистых стратегий и дает оптимальное решение игры тогда и только тогда, когда соответствующий ей элемент aij является одновременно наибольшим в своем столбце и наименьшим в своей строке. Такая ситуация (пара стратегий), если она существует, называется седловой точкой (по аналогии с поверхностью седла, которая искривляется вверх в одном направлении и вниз — в другом).
Обозначим ( , ) — профиль чистых стратегий, при котором достигается решение игры в задаче с седловой точкой. Введем функцию выигрыша первого игрока для каждого профиля стратегий:
uA ( , ) = aij.
Тогда из условия оптимальности в седловой точке выполняется двойное неравенство:
15
uA ( , ) ≤ uA ( , ) ≤ uA ( , ),
которое справедливо для всех i = 1, ..., m; j = 1, ..., n. Действительно, выбор стратегии первым игроком при оптимальной стратегии второго игрока максимизирует его минимальный возможный выигрыш: uA ( , ) ≤ uA ( , ), а выбор стратегии вторым игроком при оптимальной стратегии первого ми-
нимизирует его максимальный проигрыш: uA ( , |
) ≤ uA ( , ). |
Иными словами, профиль стратегий ( , |
) является оптимальным в |
том смысле, что при многократном повторении игры, если оба игрока действуют рационально, отказ любым из игроков от стратегии, входящей в данный профиль, уменьшает его шансы на выигрыш (увеличивает шансы на проигрыш).
Найдем верхнюю и нижнюю цену игры в приведенном нами примере. Для этого добавим в исходную матрицу игры столбец и строку, в которых будем записывать минимальные гарантированные выигрыши игрока А и максимальные гарантированные проигрыши игрока В соответственно (таблица 2.2).
Таблица 2.2.
Поиск верхней и нижней цены игры, седловой точки в антагонистической игре (условный пример)
Стратегии |
= 1 |
= 2 |
|
|
|
-2 |
|
αi |
|
|
|
|
|
|
|
|
|
|
|
||
= 1 |
0 |
-1 |
|
|
|
-1 |
|
-2 |
|
|
= 2 |
|
|
|
|
|
|
|
|||
2 |
1 |
|
|
|
0 |
|
0 |
|
||
β=j |
1 |
0 |
|
|
|
= |
|
-1 |
|
|
2 |
1 |
|
|
|
0 |
|
|
|
||
В этом случае нижняя цена игры |
|
|
|
|
|
|
|
|
||
|
|
max i |
0, |
|
|
|
|
|
|
|
|
|
i |
|
|
|
|
|
|
|
|
а верхняя цена игры |
|
|
|
|
|
|
|
|
|
|
|
|
min j |
0 |
|
|
|
|
|
|
|
|
|
j |
. |
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
||
Таким образом, цена игры v = α = β = 0. Игра имеет решение в чистых |
||||||||||
стратегиях, оптимальной стратегией игрока А является стратегия |
, опти- |
|||||||||
мальной стратегией игрока В является стратегия |
( |
) |
, а профиль( |
стратегий) |
||||||
( , ) представляет собой седловую точку игры. |
|
|
|
|
||||||
2.2.Решение игры в смешанныхстратегиях
Если игра имеет седловую точку, то говорят, что она решается в чистых стратегиях. Иными словами, оптимальной для каждого игрока является только одна стратегия, от которой ему невыгодно отклоняться, если другой игрок при-
16
держивается своей оптимальной стратегии. Но решение в чистых стратегиях имеют далеко не все игры. Примером игры, которая не имеет решения в чистых стратегиях, является приведенная выше игра «камень-ножницы-бумага» (таб-
лица 2.3).
|
|
|
Таблица 2.3. |
|
Платежная матрица игры «камень-ножницы-бумага» |
||||
|
|
|
|
|
Стратегии В |
= камень |
= ножницы |
= бумага |
|
Стратегии А |
|
|
|
|
= камень |
0 |
1 |
-1 |
|
= ножницы |
-1 |
0 |
1 |
|
= бумага |
1 |
-1 |
0 |
|
Найдем нижнюю и верхнюю цену этой игры, применяя максиминную и минимаксную стратегии соответственно (таблица 2.4).
Таблица 2.4.
Поиск верхней и нижней цены игры в игре «камень-ножницы-бумага»
Стратегии В |
= камень |
= ножницы |
= бумага |
αi |
Стратегии А |
|
|
|
|
= камень |
0 |
1 |
-1 |
-1 |
= ножницы |
-1 |
0 |
1 |
-1 |
= бумага |
1 |
-1 |
0 |
-1 |
βj |
1 |
1 |
1 |
|
Тогда нижняя цена игры
max i 1,
i
а верхняя цена игры
min j |
1. |
j |
|
Таким образом, α ≠ β, игра не имеет седловой точки, а цена игры
-1 ≤ v ≤ 1
В данной игре применение чистых стратегий не даст оптимального реше-
ния.
Если игра не решается в чистых стратегиях, то поиск оптимального решения заключается в формировании сложной стратегии, состоящей в случайном применении двух и более стратегий с определенной вероятностью. Такая стратегия называется смешанной. На практике формирование смешанной стратегии предполагает, что игра повторяется многократно в заданных условиях и у игрока имеется возможность при повторении игры менять выбранную стратегию. Именно так и происходит в игре «камень-ножницы-бумага», если игроки играют более одного раза. Например, если игра состоится три раза, и во всех трех
17
розыгрышах игрок А будет применять разные стратегии, на языке теории игр это будет означать, что он сформировал смешанную стратегию, в которую все три его стратегии входят с вероятностью 1/3.
Смешанной стратегией σA игрока А называется применение чистых страте-
гий ( , ,…, |
m ) с вероятностями (p1, p2, ..., pi, ..., pm) причем сумма вероятно- |
|||||
стей равна 1: pi |
1 Или, иными словами, смешанная стратегия игрока – |
|||||
|
i 1 |
|
|
|
|
|
это вероятностное распределение на множестве его чистых стратегий. |
||||||
Смешанные стратегии игрока А обычно записываются |
в виде строки |
|||||
σA = (p1, p2, ..., pi, ..., pm). |
стратегии |
игрока |
В |
обозначаются |
||
Аналогично |
смешанные |
|||||
σB = (q1, q2, ..., qi, ..., qn),
n
где сумма вероятностей применения стратегий равна 1: qj 1.
i 1
Таким образом, задав два набора σA = (p1, p2, ..., pi, ..., pm) и σB = (q1, q2, ..., qi, ..., qn), мы оказываемся в ситуации смешанных стратегий. При
этом каждый профиль в чистых стратегиях |
, |
является случайным собы- |
|
тием и ввиду независимости наборов σA и σВ |
(реализуется) |
с вероятностью piqj. |
|
Математическое ожидание выигрыша игрока А при каждом профиле, выраженном в смешанных стратегиях, равно
uA ( , ) = ∑ ∑
Чистую стратегию можно считать частным случаем смешанной стратегии и задавать строкой (0, 0, …, 1, …, 0), в которой 1 соответствует вероятности, с которой применяется чистая стратегия.
В случае применения смешанных стратегий оптимальное решение игры (равновесие в игре) - это пара смешанных стратегий ( ; ), обладающих следующим свойством: если один из игроков придерживается своей оптимальной стратегии, то другому невыгодно отступать от своей, то есть:
uA ( , ) ≤ uA ( , ) ≤ uA( , ).
Выигрыш, соответствующий оптимальному решению, называется ценой игры v. Цена игры удовлетворяет неравенству:
α ≤ v ≤ β
где α и β — нижняя и верхняя цены игры.
Поиск решения игры в смешанных стратегиях основывается на нескольких основных теоремах, в частности на теореме Неймана и теореме об активных стратегиях.
Теорема Неймана гласит, что каждая конечная игра имеет, по крайней мере, одно оптимальное решение среди чистых или смешанных стратегий.
Активной называется стратегия, которая входит в оптимальную смешанную стратегию с отличной от нуля вероятностью.
18
Теорема об активных стратегиях утверждает, что если один из игроков придерживается своей оптимальной смешанной стратегии, то выигрыш остается неизменным и равным цене игры v, если второй игрок не выходит за пределы своих активных стратегий.
Поиск смешанной стратегии тем сложнее, чем выше размерность матрицы. Поэтому первым этапом решения такой игры является поиск и вычеркивание заведомо неэффективных стратегий с помощью принципа доминирования, который будет рассмотрен ниже. Наиболее простым случаем является поиск решения в игре размера 2×2, когда каждый игрок имеет всего две стратегии.
Рассмотрим игру размера 2×2, которая является простейшим случаем конечной игры. Если такая игра имеет седловую точку, то оптимальное решение
— это пара чистых стратегий, соответствующих этой точке.
Игра, в которой отсутствует седловая точка, в соответствии с теоремой Неймана имеет решение в смешанных стратегиях. Оптимальными будут стра-
тегии |
|
и |
|
|
|
. |
Если=в(игре; |
2×2) |
отсутствует седловая точка, то любая чистая стратегия |
||||
|
= ( |
; |
) |
|||
обоих игроков является активной, то есть, входит в оптимальную смешанную стратегию с ненулевой вероятностью. Поэтому для решения такой игры можно воспользоваться теоремой об активных стратегиях. Если игрок А придерживается своей оптимальной стратегии σ*A, то его средний выигрыш (математическое ожидание выигрыша) будет равен цене игры v, какой бы чистой или смешанной стратегией ни пользовался игрок В.
Пусть игра задана платежной матрицей
a11a12
P a21a22
Средний выигрыш игрока А, если он использует оптимальную смешанную стратегию = ( ; ), а игрок В — чистую стратегию (это соответствует 1-му столбцу платежной матрицы Р), равен цене игры v:
a11 p*1+ a21 p*2= v.
Тот же средний выигрыш получает игрок А, если 2-й игрок применяет стратегию , т.е.
a12 p*1+ a22 p*2= v.
Учитывая, что p*1+ p*2= 1, получаем систему уравнений для определения оптимальной стратегии игрока A и цены игры v:
a11 p1* a21 p2* v
a12 p1* a22 p2* v
p1* p2* 1
Решая эту систему, получим оптимальную стратегию:
p1* |
a |
22 |
a21 |
|
a11 a |
22 |
a12 a21 |
||
|
19
p* |
|
a11 |
a12 |
|
|
|
1 a |
a |
22 |
a |
a |
21 |
|
11 |
|
12 |
|
|||
и цену игры
v |
a22a11 |
a12a21 |
|
a11 a22 |
a12 a21 |
||
|
Аналогично можно найти оптимальную стратегию игрока В.
Пример 2.1.
Нужно найти оптимальную смешанную стратегию игроков в игре, представленной матрицей:
|
( |
) |
|
( |
3 ) |
( |
1 ) |
|
|
|
2 |
|
3 |
||
|
( |
) |
|
Решение |
|
|
|
|
|
|
|
||||
В этой игре нижняя цена игры α = 2, верхняя цена игры β = 3. Так как α ≠ β, седловая точка в игре отсутствует, игра не имеет решения в чистых стратегиях. Поскольку оба игрока имеют по две стратегии, и седловой точки в игре нет, то оба игрока используют свои стратегии с ненулевой вероятностью, то есть, все стратегии игроков являются активными. Значит, мы можем воспользоваться для поиска решения теоремой об активных стратегиях, которая утверждает, что если один из игроков придерживается своей оптимальной смешанной стратегии, то его средний выигрыш остается неизменным и равным цене игры v, если второй игрок не выходит за пределы своих активных стратегий.
Запишем средний выигрыш (математическое ожидание выигрыша) игрока А, соответствующий стратегиям и :
3p1 2p2 v
1p1 3p2 v p1 p2 1
Решая систему уравнений, получим: p1 = 1/3, p2 = 2/3, v = 7/3.
Иными словами, для достижения оптимального результата игрок А использует сме-
шанную стратегию, в которую стратегия |
|
входит с вероятностью 1/3, стратегия |
|
– с ве- |
|
роятностью 2/3. Выигрыш игрока А при |
этом составит 7/3 и будет находиться в промежутке |
||||
А |
|
|
А |
|
|
между нижней и верхней ценой игры. |
|
|
|
|
|
Запишем средний проигрыш (математическое ожидание проигрыша) игрока В, соот- |
|||||
ветствующий стратегиям и : |
+1 |
= |
|
|
|
3 |
|
|
|||
2 |
+3 |
= |
|
|
|
+= 1
Решая систему уравнений, получим: q1 = 2/3, q2 = 1/3, v = 7/3.
Иными словами, для достижения оптимального результата игрок B использует сме-
шанную стратегию, в которую стратегия входит с вероятностью 2/3, стратегия – с вероятностью 1/3. Проигрыш игрока B при этом составит 7/3 и будет находиться в промежутке между нижней и верхней ценой игры.
20
