Теория игр в принятии оптимальных решений. Учебное пособие
.pdf
2.3.Графическое решение игры
Игры, в которых хотя бы один игрок имеет только две стратегии, могут быть решены графическим методом.
Рассмотрим игру (2 х 3), в которой нет седловой точки. Обозначим через aij выигрыши первого игрока, p1 – вероятность применения первым игроком первой стратегии, p2 = 1 - p1 – вероятность применения первым игроком второй стратегии.
По оси абсцисс (см. рисунок 2.1) отложим единичный отрезок ( А, А). Все промежуточные точки отрезка отражают смешанные стратегии σA первого игрока, причем расстояние от промежуточной точки до правого конца отрезка — это вероятность p1 применения стратегии А, а расстояние до левого конца — вероятность p2 применения стратегии А.
На перпендикулярных осях, проведенных через точки А и А, будем в дальнейшем откладывать выигрыши первого игрока при применении им первой и второй стратегии соответственно. К примеру, если второй игрок примет стратегию , то она дает первому игроку выигрыши a11 и a21, которые мы откладываем на осях, соответствующих стратегиям А и А. Обозначим эти точки буквой B1. Аналогично можно отложить выигрыши первого игрока при применении вторым игроком стратегий и .
Если первый игрок применяет смешанную стратегию σА, то его ожидаемый выигрыш при применении вторым игроком первой стратегии составит:
a11p1 + a21p2.
Ожидаемый выигрыш первого игрока при применении вторым игроком второй и третьей стратегии соответственно составит:
|
|
|
a12p1 + a22p2 и a13p1 + a13p2. |
||
В3(a13) |
|
Е |
|
В1(a21) |
|
|
|
||||
|
|
|
|
|
|
В2(a12) |
|
D |
|
В2(a22) |
|
В1(a11)K |
|
M N |
|
L |
|
|
C |
|
В3(a23) |
||
|
А |
|
p2 σА p1 |
|
А |
Рисунок 2.1. Графическое решение игры 2 х 3.
В построенной нами системе координат линии ожидаемых выигрышей первого игрока при применении вторым игроком различных стратегий могут быть представлены отрезками (В1, В1), (В2, В2). (В3, В3). Для каждой смешанной стратегии σА ожидаемый выигрыш игрока А при различных стратегиях игрока В представляет собой ординату точки с абсциссой σА: при применении игроком В стратегии это будет точка С, при применении стратегий и точки D и Е соответственно.
21
Поскольку первый игрок стремится максимизировать свои минимальные гарантированные выигрыши, то точка оптимума находится как точка пересечения линий, в которой достигается максимум его минимального гарантированного выигрыша. Иными словами, ординаты точек, лежащих на ломаной KMNL, показывают минимальный гарантированный выигрыш игрока А при использовании им любой смешанной стратегии. Оптимальную стратегию определяет точка N, в которой минимальный гарантированный выигрыш достигает максимума; ее ордината равна цене игры v.
Для того, чтобы количественно определить значения p1, p2 и v (координаты точки N), необходимо установить, какие стратегии игрока В являются активными. Это можно сделать с помощью графической иллюстрации игры. Точка N, являющаяся графическим решением игры, лежит на пересечении двух линий, каждая из которых отражает средний выигрыш игрока А, соответствующий одной из стратегий игрока В. Эти стратегии и будут для игрока В активными. На рисунке 2.1 точка N лежит на пересечении линий среднего выигрыша игрока А, соответствующих стратегиям и , следовательно, стратегии и
будут активными для игрока В. Определив активные стратегии игрока В, можно воспользоваться теоремой об активных стратегиях аналогично тому, как это было сделано при решении игры 2 х 2.
С помощью графической иллюстрации можно определять оптимальную стратегию как игрока А, так и игрока В, но во втором случае строится не нижняя, а верхняя граница выигрыша и на ней определяется не максимум, а минимум.
Если в игре имеется седловая точка (то есть, игра решается в чистых стратегиях), то графически это будет точка, лежащая на одной из вертикальных осей, соответствующих чистым стратегиям первого игрока.
Пример 2.2.
Дополним условие примера 2.1 и найдем решение игры, заданной матрицей:
( |
) |
( |
2 ) |
( |
3 ) |
( |
1 ) |
|
4 |
|
2 |
|
3 |
||
( |
) |
|
|
|
|
|
|
В этой игре нижняя цена игры α = 2, верхняя цена игры β = 3. Так как α ≠ β, седловая точка в игре отсутствует, игра не имеет решения в чистых стратегиях. Сложность заключается в том, что у одного из игроков имеется три стратегии, то есть, нам заранее не известно, какие стратегии игрока В являются активными. Но поскольку один из игроков (игрок А) имеет только две стратегии, мы можем воспользоваться для определения активных стратегий и поиска решения графическим методом. Графическая иллюстрация игры представлена на рисунке 2.2. Откладывая выигрыши игрока А по вертикальным осям, для наглядности в скобках будем указывать, какой стратегии игрока В они соответствуют.
На рисунке 2.2 видно, что точка N, являющаяся решением игры и обеспечивающая игроку А максимальный из минимальных гарантированных выигрышей, лежит на пересечении линий среднего выигрыша, соответствующих стратегиям и игрока В.
22
|
|
|
|
|
4(В1) |
|
3 (В2) |
|
|
|
3(В3) |
||
2 (В1) |
|
N |
|
2(В2) |
||
1 (В3) |
|
|
|
|
||
|
|
|
|
|
|
|
|
А |
p2 |
σА |
p1 |
А |
|
Рисунок 2.2. Графическое решение игры 2 х 3. |
||||||
Запишем средний выигрыш игрока А, соответствующий стратегиям и и воспользуемся теоремой об активных стратегиях так же, как в примере 2.1.
3p1 2p2 v
1p1 3p2 v p1 p2 1
Решая систему уравнений, получим: p1 = 1/3, p2 = 2/3, v = 7/3.
Иными словами, для достижения оптимального результата игрок А использует смешанную стратегию, в которую стратегия А входит с вероятностью 1/3, стратегия А – с вероятностью 2/3. Выигрыш игрока А (проигрыш игрока В) при этом составит 7/3, т.е. будет действительно находиться в промежутке между нижней и верхней ценой игры.
2.4.Приведение игры к задаче линейного программирования
Игра m × n в общем случае не имеет наглядной геометрической интерпретации. Ее решение достаточно трудоемко при больших m и n, однако принципиальных трудностей не имеет, поскольку любая конечная игра двух лиц с нулевой суммой может быть представлена в виде задачи линейного программирования и решена с помощью симплекс-метода.
Пусть игра m × n задана платежной матрицей:
Р = (aij ), i = 1, 2, ..., m; j = 1, 2, ..., n.
Пусть все элементы aij ≥ 0, тогда v > 0. Отметим, что если некоторые из aij < 0, добиться выполнения условия aij ≥ 0 можно, прибавив ко всем элементам платежной матрицы некоторое положительное число. Оптимальные страте-
гии при этом не изменятся. |
|
|
|
|
|
|
||
( |
, |
Игрок А). обладает стратегиями ( , ,…, ), |
игрок |
В |
— стратегиями |
|||
|
,…, |
|
|
1 |
2 |
|
m |
|
|
|
Необходимо определить оптимальные стратегии |
|
= (p* , |
p* |
, ... , p* ) и |
||
|
= (q*1, q*2, ... , q*n), где p*i, q*j — вероятности применения соответствующих |
|||||||
чистых стратегий , . |
|
|
|
|
|
|
||
|
|
p*1 + p*2 +...+ p*m =1, q*1 + q*2 +...+ q*n = 1. |
|
|
|
|
|
Она |
|
|
Оптимальная стратегия удовлетворяет следующему требованию. |
||||||
обеспечивает игроку А средний выигрыш, не меньший, чем цена игры v, при любой стратегии игрока В и выигрыш, равный цене игры v, при оптимальной стратегии игрока B.
23
Если игрок А применяет смешанную стратегию = (p*1, p*2, ... , p*m)
против любой чистой стратегии игрока , то он получает средний выигрыш (математическое ожидание выигрыша):
|
|
aj = a1jp1 + a2jp2 +...+ amjpm, j = 1, 2, ..., n |
|
|
Иными словами, элементы j-го столбца платежной матрицы почленно ум- |
||
ножаются |
на соответствующие |
вероятности применения стратегий |
|
( |
, ,…, |
|
|
|
) и результаты суммируются. |
||
|
Для оптимальной стратегии |
все средние выигрыши не меньше цены иг- |
|
ры v, поэтому получаем систему соотношений:
a11 p1 a21 p2 ... am1 pm v a12 p1 a22 p2 ... am2 pm v
...
a1n p1 a2n p2 ... amn pm v p1 p2 ... pm 1
Каждое из неравенств и последнее равенство можно разделить на число v > 0. Введем новые переменные: x1 = p1/v, x2 = p2/v , ..., pm/v. Тогда соотношения примут вид:
a11x1 a21x2 |
... am1xm 1 |
||||||||
a12 x1 |
a |
22 x2 |
... am2 xm 1 |
||||||
... |
|
|
|
|
|
|
|
|
|
a1n x1 |
a |
2n x2 |
... amn xm 1 |
||||||
x |
x |
|
... x |
m |
|
1 |
|
||
|
v |
||||||||
1 |
|
2 |
|
|
|
|
|||
Цель игрока А — максимизировать свой гарантированный выигрыш, т.е. цену игры v. Максимизация цены игры v эквивалентна минимизации величины 1/v, поэтому задача может быть сформулирована следующим образом: определить значения переменных xi ≥ 0, i = 1, 2, ..., m, так, чтобы они удовлетворяли линейным ограничениям, накладываемым на средний выигрыш игрока А и при этом линейная функция Z = x1 + x2 + ...+ xm = 1/v обращалась в минимум. Это задача линейного программирования. Решив её и перейдя обратно от вектора переменных (x1, x2, …, xm) к вероятностям, получим оптимальную стратегию
= (p*1, p*2, ... , p*m) и цену игры v. |
= (q* , q* , ... , q* ) следует |
||
Для определения оптимальной стратегии |
|||
учесть, что игрок В стремится минимизировать |
гарантированный1 2 |
проигрышn |
. |
Переменные q1, q2, ..., qn удовлетворяют соотношениям:
24
a11q1 a12q2 ... a1nqn a21q1 a22q2 ... a2nqn
...
am1q1 am2q2 ... amnq q1 q2 ... qm 1
v
v
n v
которые следуют из того, что средний проигрыш игрока В не превосходит цены игры, какую бы чистую стратегию не применял, игрок А.
Если обозначить yj = qj/v, j = 1, 2, ..., n, то получим соотношения:
a11 y1 a12 y2 ... a1n yn 1 a21 y1 a22 y2 ... a2n yn 1
...
am1 y1 am2 y2 ... amn yn 1
1 y1 y2 ... ym v
Игра свелась к следующей задаче: определить значения переменных yj ≥ 0, j = 1, 2, ..., n, которые удовлетворяют системе неравенств и максимизируют линейную функцию Z' = y1 + y2 + ...+ yn = 1/v.
Решение задачи линейного программирования определяет оптимальную стратегию = (q*1, q*2, ... , q*n). При этом цена игры v = 1/maxZ' = 1/minZ.
Указанные задачи линейного являются взаимно-двойственными. Очевидно, при определении оптимальных стратегий в конкретных задачах следует выбрать ту из взаимно-двойственных задач, решение которой менее трудоемко, а решение другой задачи найти с помощью теорем двойственности. Приведем пример экономической задачи, которая описывается игровой моделью и может быть решена методами линейного программирования.
Пример 2.3.
Предприятие может выпускать три вида продукции (A1, A2 и A3), получая при этом прибыль, зависящую от цены и объема продаж, то есть – конъюнктуры рынка. Конъюнктура рынка определяется поведением конкурентов и может быть в одном из четырех состояний (B1, B2, B3, B4). Ситуация может быть описана как антагонистическая игра с платежной матрицей, элементы которой (aij) характеризуют прибыль предприятия при выпуске i-той продукции с j-тым состоянием конъюнктуры. Определить оптимальные пропорции выпускаемой продукции, гарантирующие среднюю величину прибыли при любом состоянии конъюнктуры.
Решение.
Задача сводится к игровой модели, заданной платежной матрицей.
|
= B1 |
= B2 |
= B3 |
= B4 |
= A1 |
3 |
4 |
6 |
8 |
= A2 |
9 |
10 |
4 |
2 |
= A3 |
7 |
8 |
5 |
4 |
Прежде чем решать задачу, можно попытаться упростить игру, проведя анализ платежной матрицы и отбросив стратегии, заведомо невыгодные или дублирующие. Так, вторая стратегия (второй столбец матрицы) является явно невыгодной для игрока В по сравнению с
25
первой (элементы второго столбца больше элементов первого столбца), так как цель игрока В — уменьшить выигрыш игрока А. Поэтому второй столбец можно отбросить. Получим матрицу размера 3×3:
|
|
|
368 |
|
|
||
|
|
P |
|
|
|
|
|
|
|
942 |
|
|
|||
|
|
|
|
754 |
|
|
|
|
|
|
|
|
|
||
|
|
|
|
|
|
|
αi |
|
3 |
|
|
6 |
|
8 |
3 |
|
9 |
|
|
4 |
|
2 |
2 |
|
7 |
|
|
5 |
|
4 |
4 |
βj |
9 |
|
|
6 |
|
8 |
|
Определим нижнюю и верхнюю цены игры: α = 4, β = 6.
Так как α ≠ β, то седловая точка отсутствует и оптимальное решение следует искать в смешанных стратегиях игроков: = ( , , ) и = ( ,0, , ).
Обозначив xi = pi/v, i = 1, 2, 3 и yj = qj/v , j = 1, 2, 3, 4, составим две взаимно-
двойственные задачи линейного программирования.
Задача игрока А: |
+9 |
+7 |
≥ 1 |
3 |
|||
6 |
+4 |
+5 |
≥ 1 |
8 |
+2 |
+4 |
≥ 1 |
Задача игрока В: |
+ + |
→ |
≤ 1 |
3 |
+6 |
+8 |
|
9 |
+4 |
+2 |
≤ 1 |
7 |
+5 |
+4 |
≤ 1 |
++ →
Обе задачи можно решить симплексным методом. В результате решения получим, что оптимальной стратегией предприятия будет стратегия = (0,4; 0; 0,6). Иными словами, предприятию выгодно распределить выпуск продукции следующим образом: выпускать 40% продукции A1 и 60% продукции A3, а продукцию A2 не выпускать. При этом прибыль предприятия (цена игры) составит 5,4.
** *
Итак, при решении произвольной конечной игры размера m × n рекомендуется придерживаться следующей схемы:
1.Определить верхнюю и нижнюю цены игры и проверить, имеет ли игра седловую точку. Если седловая точка есть, то соответствующие ей стратегии игроков будут оптимальными, а цена игры совпадает с верхней (нижней) ценой.
2.Если седловая точка отсутствует, то решение следует искать в смешанных стратегиях. Для этого необходимо сначала уменьшить размерность матрицы, применяя принцип доминирования, то есть, исключая заведомо невыгодные стратегии.
26
Говорят, что стратегия |
нестрого доминирует стратегию |
, если при лю- |
бом поведении остальных игроков использование стратегии |
приводит к |
|
не худшему исходу, нежели использование .
Иными словами, если для игрока А все элементы k-ой строки платежной матрицы не меньше соответствующих элементов l-ой строки:
|
|
ого столбца платежной матрицы не больше |
|||
а для игрока В все элементы k-≥ |
, |
= 1… , |
|||
соответствующих элементов l-ого столбца: |
|||||
Стратегия |
дублирует |
стратегию |
, |
если все элементы k-ой строки |
|
≤ |
, |
= |
1… . |
||
(столбца) платежной матрицы совпадают с соответствующими элементами l-ой строки (столбца).
|
= |
, |
= 1… , |
Таким образом, стратегии, |
которые доминируются другими, являются для |
||
= |
, |
= 1… . |
|
игрока заведомо невыгодными и могут быть исключены без ущерба для решения игры. Также имеет смысл исключить дублирующие стратегии.
3.Если после исключения доминируемых и дублирующих стратегий игру удалось свести к размеру 2×2, 2×n, n×2, ее возможно решить графически. Для игр размера m × n рекомендуется симплексный метод.
На практике реализация оптимального решения в смешанных стратегиях может происходить несколькими путями. Первый состоит в физическом смешении чистых стратегий в пропорциях, заданных вероятностями pi, как в приведенном выше примере с предприятием.
Другой путь возможен при многократном повторении игры и состоит в том, что в каждой партии чистые стратегии применяются в виде случайной последовательности, причем каждая из них с частотой, равной ее вероятности в оптимальном решении.
3. Неопределенность в игровых моделях. Игры с природой
В рассмотренных ранее играх предполагалось, что в них принимают участие два игрока, интересы которых не совпадают, но при этом определены и выражены в некоторых сознательно формируемых стратегиях. Поэтому решение задачи сводилось к нахождению оптимальных стратегий, позволяющих максимизировать выигрыши (минимизировать проигрыши) для обоих участников. Однако в ряде ситуаций, которые могут быть описаны в терминах игры, выигрыши игрока(-ов) зависят не от сознательных действий других игроков, а от объективной действительности. Такие игры называются играми с природой, их особенностью является высокая степень неопределенности. В играх с природой один из игроков (человек) старается действовать рационально, в то время как действия второго игрока («природы») случайны.
Игры с природой изучаются в рамках так называемой теории статистических решений, которая служит для выработки рекомендаций по рациональному
27
образу действий в условиях неопределенности, вызванной не зависящими ни от нас, ни от конфликтующей стороны причинами. Этими причинами могут быть неосведомленность сознательно действующего игрока об условиях ведения операции, а также случайный характер этих условий. В играх с природой одна из сторон конфликта, действующая рационально и целенаправленно, имеет дело с объективными обстоятельствами, которые принято называть «природой». Этими обстоятельствами («природой») могут быть погодные условия, рыночная конъюнктура (например, состояние спроса, колебания валютных курсов и др.), стихийные бедствия и другие форс-мажорные причины. Все эти обстоятельства носят случайный характер.
Поведение «природы» рационально действующему игроку полностью неизвестно, но предполагается, что она ему сознательно не противодействует. В общем виде постановка задачи из области игр с природой выглядит следующим образом:
у сознательно действующего игрока имеется m возможных стратегий: s1, s2,..., sm;
объективные обстоятельства, в которых он действует (состояние «природы») точно не известны, однако о них можно сделать n предположений: О1, O2,..., Оn; эти предположения условно можно рассматривать как стратегии «природы»;
результат, т.е. так называемый выигрыш аij, при каждом профиле стратегий задан матрицей выигрышей, представленной в таблице 3.1.
|
|
|
|
|
Таблица 3.1. |
|
Платёжная матрица игры с природой, общий вид |
|
|||
|
|
|
|
|
|
si |
|
|
Oj |
|
|
O1 |
O2 |
|
… |
On |
|
s1 |
a11 |
a12 |
|
… |
a1n |
s2 |
a21 |
a22 |
|
… |
a2n |
… |
… |
… |
|
… |
… |
sm |
am1 |
am2 |
|
… |
amn |
Несмотря на то, что по форме записи игры с природой схожи с антагонистическими играми с нулевой суммой, между этими типами игр есть существенные различия. И основное из них заключается в том, что второй игрок («природа») действует неосознанно, то есть не имеет цели играть против рационально действующего игрока. Поэтому матрица выигрышей для данного типа игр отражает только выигрыши сознательно действующего игрока, которые не могут интерпретироваться как проигрыши «природы». Следовательно,
для игр с природой не определяются верхняя и нижняя цена игры, седловая
точка, а также отсутствует понятие оптимальной стратегии для второго игрока.
С первого взгляда может показаться, что поставленная задача проще, чем обычная антагонистическая игра, так как она не содержит противодействия. Действительно, игроку, принимающему решения в игре с природой легче в том
28
отношении, что он, скорее всего, получит в этой игре больший выигрыш, чем в игре против сознательно действующего противника. Однако ему труднее принять обоснованное решение, которое даст хороший выигрыш. Дело в том, что в игровой конфликтной ситуации предположение о диаметральной противоположности интересов противников в некотором смысле снимает неопределенность. Если же такого предположения сделать нельзя, неопределенность сказывается в гораздо более сильной степени.
Наиболее простым случаем выбора решения в условиях неопределенности является случай, когда какая-то из стратегий игрока А превосходит другие («доминирует» над ними). Но даже в случае отсутствия одной доминирующей стратегии решение следует начинать с исключения доминируемых и дублирующих стратегий для рационально действующего игрока. При этом следует понимать, что для второго игрока («природы») понятия доминирующих и доминируемых стратегий не существует, так как этот игрок не стремится навредить своему «противнику», его действия случайны.
Выбор наилучшего решения в условиях неопределенной обстановки существенно зависит от того, какова степень этой неопределенности. В зависимости от этого в играх с природой обычно различают две возможных ситуации.
1. Выбор решения, когда известны вероятности возможных состояний «природы».
Это самая простая ситуация. В данном случае оптимальным для игрока А будет решение, при котором математическое ожидание его выигрыша максимально. По правилам теории вероятностей, оно находится как сумма произведений вероятностей различных состояний «природы» на соответствующие значения выигрышей.
Если игрок выбирает стратегию si, то математическое ожидание выигрыша составит: p1ai1 + p2ai2 +… + pnain, где p1,…,pn – вероятности реализации различных состояний «природы». Тогда оптимальной будет стратегия, при которой достигается:
max(p1ai1 ... pnain )
i
Если вероятности возможных состояний «природы» точно не известны, но имеются некоторые предположения относительно их значений, то оптимальная стратегия может быть определена схожим образом.
Например, если нам известно, что любое из состояний «природы» не более вероятно, чем другие, то вероятности различных вариантов обстановки можно считать равными (принцип недостаточного основания Лапласа) и производить выбор решения так же, как это показано выше для случая известных вероятностей. В этом случае математическое ожидание выигрыша составляет: (ai1 + ai2 +… + ain)/n. То есть, оптимальной будет стратегия, для которой максимально среднее арифметическое возможных выигрышей.
Вероятности различных вариантов состояния «природы» также могут устанавливаться путем опроса компетентных лиц (экспертов) либо путем предварительных экспериментов (метеонаблюдения, маркетинговые исследования и
29
пр.). Тогда их искомое значение определится как среднее из нескольких показаний.
Заметим, что в случае, когда известны вероятности состояний «природы»,
при решении игры с природой всегда можно обойтись одними чистыми стратегиями, не применяя смешанных. Действительно, если мы будем применять какую-то смешанную стратегию, то наш средний выигрыш, осредненный и по условиям (состояниям «природы») и по нашим стратегиям, будет определяться как взвешенное среднее выигрышей, соответствующих нашим чистым стратегиям. Очевидно, что любое среднее не может превосходить максимальной из осредняемых величин. Поэтому применение смешанной стратегии с любыми вероятностями не может быть выгоднее для игрока, чем применение чистой стратегии, обеспечивающей максимум математического ожидания его выигрыша.
2. Выбор решения, когда вероятности возможных состояний «природы» не известны.
В этом случае существует несколько подходов к оценке результата действий и выбору оптимальной стратегии, основанных на применении различных критериев.
Критерий Вальда.
Данный критерий рекомендует придерживаться максиминного принципа, то есть выбирать стратегию, для которой выигрыш совпадает с нижней ценой игры:
maxminaij
ij
Этот критерий является пессимистическим. То есть предполагается, что «природа» будет действовать наихудшим для человека образом. Выбор стратегии по данному критерию гарантирует, что выигрыш в любых условиях окажется не меньше, чем наибольший возможный в худших условиях. Это линия поведения по принципу «рассчитывай на худшее».
Применение критерия Вальда по сути сводит игру с природой к антагонистической игре с сознательно противодействующим противником. Поэтому в тех случаях, когда возможно физическое смешение стратегий, иногда бывает целесообразно использовать обычные методы решения антагонистической игры в смешанных стратегиях, так как применение смешанной стратегии при пессимистичном подходе может дать лучший результат, чем применение чистой стратегии.
Критерий максимума.
maxmaxaij
ij
Этот критерий является оптимистическим. То есть предполагается, что «природа» благоприятна для лица, принимающего решение.
Критерий Гурвица.
Рекомендуется стратегия, определяемая по формуле:
max( minaij |
(1 )maxaij ) |
|
i |
j |
j |
|
|
30 |
