Основы теории игр. Учебное пособие
.pdf
и перепишем неравенства (9.1) в виде |
|
|
|
|
||||
m |
|
|
|
|
|
|
|
|
1, |
j 1,n, |
|
|
|
|
|||
cij xi |
|
|
|
|
||||
i 1 |
|
|
|
|
|
|
|
(9.2) |
m |
1, |
|
|
|
|
|
|
|
xi |
xi 0, |
i |
|
|
|
|||
1,m. |
|
|||||||
|
v |
|
|
|
|
|
|
|
i 1 |
|
|
|
|
|
|
|
|
Задача игрока A – максимизировать свой выигрыш, то есть |
||||||||
|
|
|
|
|
|
|
|
m |
v max. Введем в рассмотрение функцию |
F(X ) xi , где |
|||||||
i 1
X (x1,...,xm ). В силу (9.2)
v F(1X ).
Следовательно, функцию F(X ) надо минимизировать. Таким обра-
зом, приходим к следующей далее задаче линейного программирования. Найти минимум функции
|
m |
|
|
|
|
|
F(X ) xi min |
(9.3) |
|||||
при следующих ограничениях: |
i 1 |
|
|
|
|
|
|
|
|
|
|
|
|
m |
|
|
|
|
|
|
|
j 1,n, |
|
||||
cij xi 1, |
(9.4) |
|||||
i 1 |
|
|
|
|
|
|
x 0, |
i |
|
|
|
||
1,m. |
|
|||||
i |
|
|
|
|
|
|
Рассмотрим теперь игру игрока B. Его смешанная стратегия обеспечит ему средний проигрыш, не больший чем v , при любой
чистой стратегии игрока A, то есть |
|
|
|
|
|
|
n |
|
|
|
|
|
|
|
i 1,m, |
|||||
cij q j v, |
||||||
j 1 |
|
|
|
(9.5) |
||
n |
|
|
|
|||
q j 1, |
q j 0, |
j |
|
|
||
1,n. |
||||||
|
|
|
|
|
|
|
j 1 |
|
|
|
|
|
|
41 |
|
|
|
|
|
|
Вводя новые переменные |
q j |
|
|
|
|
|
|
|
|
||
y j |
, j 1,n, |
||||
v |
|||||
|
|
|
|
||
преобразуем систему (9.5) к виду
n |
|
|
|
|
|
|
|
|
1, |
i 1,m, |
|
|
|
||||
cij y j |
|
|
|
|||||
j 1 |
|
|
|
|
|
(9.6) |
||
n |
1 |
|
|
|
|
|||
y j |
, |
y j 0, |
j |
|
|
|||
1,n. |
||||||||
|
|
|
|
|
|
|
|
|
j 1 |
|
|
|
|
|
|
|
|
n
Рассмотрим функцию G(Y ) y j , где Y (y1,..., yn ). В силу (9.6)
j1
vG(1Y ) .
Так как для |
игрока B его проигрыш v надо минимизировать, |
то функцию |
G(Y ) надо, напротив, максимизировать. Приходим |
к задаче линейного программирования: найти максимум функции
|
n |
|
|
|
|
|
G(Y ) y j max |
(9.7) |
|||||
при следующих ограничениях: |
j 1 |
|
|
|
|
|
|
|
|
|
|
|
|
n |
|
|
|
|
|
|
|
i 1,m, |
|
||||
cij y j 1, |
(9.8) |
|||||
j 1 |
|
|
|
|
|
|
|
|
|
|
|
|
|
j 1,n. |
|
|||||
y j 0, |
|
|||||
Из курса линейного программирования известно (см. также [8]), что задачи (9.3)–(9.4) и (9.7)–(9.8) представляют собой пару двой-
ственных задач и имеют оптимальные решения X 0 (x10, x20, , xm0 )
и Y 0 (y10, y20, , yn0).
42
Таким образом, приходим к результату, представленному в теореме 9.1.
Теорема 9.1. Решение матричной игры с положительной матрицей выигрышей C (cij ), i 1,m, j 1,n , равносильно решению
двойственных задач линейного программирования (9.3)–(9.4), (9.7)– (9.8). При этом цена игры v удовлетворяет равенству
|
|
|
v |
1 |
|
|
|
1 |
|
, |
|
|
|
|
||
|
|
|
F(X 0) |
G(Y 0) |
|
|
|
|
||||||||
|
|
|
|
|
|
|
|
|
|
|
||||||
а оптимальные вероятности |
|
P0 (p0, |
p0 |
, , p0 ) |
и Q0 |
|||||||||||
|
|
|
|
|
|
|
|
|
|
1 |
|
2 |
m |
|
||
(q0 |
, q0 |
, , q0) определяются формулами |
|
|
|
|
|
|||||||||
1 |
2 |
n |
|
|
|
|
|
|
|
|
|
0j |
|
|
|
|
|
|
p0 |
|
|
x0 |
|
q0 |
|
y |
|
|
|
|
|||
|
|
|
|
i |
, |
|
|
|
|
|
. |
|
|
|||
|
|
i |
|
F(X 0) |
|
|
j |
|
G(Y 0) |
|
|
|||||
Алгоритм решения матричной игры с помощью решения двойственных задач линейного программирования следующий:
1.Ко всем элементам платежной матрицы C прибавим одно
ито же положительное число γ так, чтобы все ее элементы стали положительными.
2.Составим пару двойственных задач линейного программи-
рования (9.3)–(9.4) и (9.7)–(9.8) и найдем их решения xi0, y0j . В ка-
честве контроля правильности решения задач можно использовать равенство
F(X 0) G(Y 0).
3. Построим оптимальные смешанные стратегии игроков:
p0 |
|
x0 |
, q0 |
|
|
y0j |
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|||||
|
i |
|
|
|
, i |
1,m, |
j 1,n . |
(9.9) |
|||||||||
F(X 0) |
|
|
|||||||||||||||
i |
|
j |
|
|
G(Y 0) |
|
|
|
|
|
|
|
|
||||
4. Вычислим цену игры: |
|
|
|
|
|
|
|
|
|
|
|
|
|
||||
|
|
v |
|
1 |
|
|
|
1 |
|
|
. |
|
|
|
(9.10) |
||
|
|
F(X 0) |
|
|
|
|
|
|
|
||||||||
|
|
|
43 |
G(Y 0) |
|
|
|
|
|||||||||
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
Пример 9.1. Решить матричную игру из примера 7.1 методами линейного программирования с матрицей выигрышей
|
1 |
3 |
4 |
|
D |
|
|
|
. |
|
2 |
1 |
0 |
|
|
|
Решение. В примере 7.1 было получено: 1, 2. Прибавим число 1 ко всем элементам матрицы D и рассмотрим матрицу
|
2 |
4 |
5 |
C |
|
|
. |
|
3 |
2 |
|
|
1 |
Будем искать решение в смешанных стратегиях. Составим прямую и двойственную задачу линейного программирования. Прямая задача имеет вид
F (X ) |
x x |
2 |
min, |
(9.11) |
|||||||||
|
|
|
|
|
1 |
|
|
|
|
|
|
||
|
2x1 3x2 |
|
1, |
|
|
||||||||
|
4x |
|
2x |
|
|
1, |
|
|
|||||
|
|
|
1 |
|
|
2 |
|
|
|
|
(9.12) |
||
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
5x1 x2 |
1, |
|
|
|
||||||||
|
x |
0, x |
|
|
0. |
|
|
||||||
|
|
1 |
|
|
|
|
2 |
|
|
|
|
|
|
Двойственная задача имеет вид |
|
|
|
|
|
|
|
|
|
|
|
||
G (Y ) y y |
2 |
y |
3 |
max, |
(9.13) |
||||||||
|
|
|
|
1 |
|
|
|
|
|
||||
2y |
|
4y |
2 |
5y |
|
1, |
|
||||||
|
1 |
|
|
|
|
|
|
3 |
|
|
|||
3y1 2y2 |
y3 1, |
(9.14) |
|||||||||||
y |
|
0, y |
2 |
|
0, y |
0. |
|
||||||
|
1 |
|
|
|
|
|
|
|
|
3 |
|
||
Для решения задачи можно использовать симплекс-метод. Компьютерная реализация симплекс-метода имеется во многих программах и прикладных пакетах, например Excel, Mathcad, Maple, Mathematica и др.
44
|
|
Решение |
задачи |
(9.11)–(9.12) |
дает следующий результат: |
||||||||||||||||
x10 |
|
2 |
, x20 |
|
|
3 |
|
, причем F X |
0 |
|
5 |
|
. По формулам (9.9) получаем: |
||||||||
13 |
13 |
13 |
|||||||||||||||||||
|
|
|
|
|
|
|
|
|
|
|
|
|
|||||||||
|
|
|
|
|
|
|
|
p0 |
x0 |
|
2 |
, p0 |
|
x0 |
|
3 |
|
||||
|
|
|
|
|
|
|
|
1 |
|
|
|
2 |
|
|
. |
||||||
|
|
|
|
|
|
|
|
2 |
|
2 |
|
||||||||||
|
|
|
|
|
|
|
|
1 |
|
5 |
|
2 |
|
|
5 |
|
|||||
|
|
|
|
|
|
|
|
|
xi0 |
|
|
|
|
|
|
xi0 |
|
|
|||
|
|
|
|
|
|
|
|
|
i 1 |
|
|
|
|
|
|
|
i 1 |
|
|
|
|
Таким образом, оптимальная смешанная стратегия игрока A будет иметь вид
|
|
|
S |
|
|
A1 |
A2 |
|
|
|
|
|
|
|
|
|
|
|
A |
|
2 |
3 |
. |
|
|
|
|
|
|
||
|
|
|
|
|
|
|
5 |
|
|
|
|
|
|
|
|
|
|
|
|
|
|
5 |
|
|
|
4 |
|
|
|
||
|
|
При решении задачи (9.13)–(9.14) получаем y0 |
|
, |
y0 |
0, |
|||||||||
|
13 |
||||||||||||||
|
|
1 |
, при этом G Y 0 |
|
5 |
|
|
|
1 |
|
|
2 |
|
||
y30 |
|
. Тогда по формулам (9.9) вычисляем: |
|||||||||||||
13 |
|
|
|||||||||||||
|
13 |
|
|
|
|
|
|
|
|
|
|
||||
q0 |
|
y0 |
|
4 |
|
|
q0 |
|
y0 |
|
|
q0 |
|
y0 |
|
1 |
|
|||
|
1 |
|
|
, |
|
2 |
|
0, |
|
|
3 |
|
|
. |
||||||
3 |
|
|
3 |
|
3 |
|
||||||||||||||
1 |
|
|
5 |
|
|
2 |
|
|
|
|
|
|
3 |
|
|
5 |
|
|||
|
|
y0j |
|
|
|
|
|
|
y0j |
|
|
|
|
y0j |
|
|
||||
|
|
j 1 |
|
|
|
|
|
|
|
j 1 |
|
|
|
|
j 1 |
|
|
|
||
Значит, оптимальная смешанная стратегия игрока B |
|
|
|
|||||||||||||||||
|
|
|
|
S |
|
|
B1 |
B2 |
B3 |
|
, |
|
|
|
|
|
||||
|
|
|
|
B |
|
4 |
|
|
1 |
|
|
|
|
|
|
|||||
|
|
|
|
|
|
|
|
5 |
0 |
|
|
|
|
|
|
|
|
|||
|
|
|
|
|
|
|
|
|
5 |
|
|
|
|
|
|
|||||
ацена игры, как следует из формулы (9.10):
vF (1X 0) G (1Y 0) 135 1 153.
Взаключение отметим совпадение результатов при решении матричной игры из примера 7.1 разными способами.
45
Проверь себя. 1. Решить матричную игру с матрицей выигрышей
|
|
|
|
|
|
|
D |
|
1 |
3 |
|
4 |
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
. |
|
|
|
|
|
|
|
|
|
|
|
|
0 |
|
1 |
|
2 |
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|||
Ответ: P |
0 |
3 |
|
7 |
|
0 |
|
|
3 |
|
2 |
|
1 |
. |
||
|
|
|
, |
|
|
, Q |
|
|
0, |
|
, |
, |
v |
5 |
||
|
|
10 |
|
5 |
||||||||||||
|
|
10 |
|
|
|
|
|
|
5 |
|
|
|||||
2. Решить задачу с платежной матрицей из примера б) в разделе «Проверь себя» § 7, используя методы линейного программирования. Сравнить полученный результат.
46
§ 10. Биматричные игры
Не всегда интересы двух игроков противоположны, как это имеет место в антагонистических играх. Часто встречаются ситуации, в которых интересы участников взаимодействия не являются противоположными. Проиллюстрируем это на классическом примере, называемом «Дилемма заключенного» (см., например, [9]).
Дилемма заключенного 1. Двое подозреваемых (A и B) в совершении преступления арестованы, помещены в одиночные камеры и не имеют возможности передавать друг другу какие-либо сообщения. Их допрашивают поодиночке. Если оба признаются в совершении преступления, то им грозит (с учетом их признания) тюремное заключение сроком по 6 лет каждому. Если оба не признаются, то они получат по 1 году тюремного заключения. Если же один из них сознается, а другой – нет, то первый, за содействие следствию, будет вовсе освобожден от наказания, тогда как второй будет приговорен к максимально возможному за данное преступление наказанию – 10-летнему тюремному заключению.
Описанная ситуация может быть представлена следующей игрой с матрицами выигрышей для заключенных A и B соответственно:
1 |
10 |
|
1 |
0 |
|||
|
|
|
|
и |
|
|
. |
|
0 |
6 |
|
|
10 |
6 |
|
|
|
|
|
||||
Здесь первые строки матриц выигрышей соответствуют стратегии заключенного A «молчать», а вторые строки – стратегии «сознаться». При этом первые столбцы матриц выигрышей соответствуют стратегии заключенного B «молчать», а вторые столбцы – стратегии «сознаться».
Очевидно, что стратегия «молчать» является строго доминируемой для каждого игрока (так как ни один из них не знает, что предпримет другой), поэтому каждый игрок выберет стратегию «сознаться». В результате оба заключенных получат по 6 лет тюремного заключения. При этом мы сразу же сталкиваемся с очевидной проблемой: получающийся результат игры очень плохой – он дает максимальный суммарный срок заключения. Этот факт послужил толчком к многочисленным исследованиям данной игры,
47
поскольку, например, естественным желанием было бы получить в качестве результата игры (или ее модификаций) выбор стратегий «молчать», дающий каждому заключенному лишь по одному году заключения.
Такая же проблема возникает и в следующей экономикополитической задаче (в силу схожести специфики с предыдущей задачей мы сохраняем прежнее название).
Дилемма заключенного 2. Рассмотрим нефтедобывающие страны A и B. Эти страны могут кооперироваться, договариваясь об объемах ежедневной добычи нефти, ограничиваясь, например, добычей 2 млн баррелей нефти в день для каждой страны. Но страны могут действовать и некооперативно, добывая, например, по 4 млн баррелей в день. Таким образом, считаем, что у игроков A и B по две стратегии: A1, B1 – договориться об ограничениях по добыче нефти; A2, B2 – добывать нефть без всяких ограничений. Такая ситуация может быть представлена игрой со следующими матрицами выигрышей для стран A и B соответственно:
|
46 |
26 |
|
|
42 |
44 |
|
|
|
|
|
и |
|
|
. |
|
52 |
32 |
|
|
22 |
24 |
|
|
|
|
|
Вматрицах указаны прибыли (млн долларов в день) стран
взависимости от их объемов добычи нефти. Очевидно, что у каждой страны есть стимул отклониться от договора, чтобы за счет увеличения объемов производства получить дополнительную прибыль. Мы видим, что и здесь у каждого из игроков есть доминирующая стратегия – «не кооперироваться». В итоге страны получают прибыль 32 и 24 (млн долларов в день), что гораздо меньше, чем
вситуации кооперативного поведения.
Таким образом, мы сталкиваемся с ситуацией, аналогичной предыдущей: оба игрока выбирают свои доминирующие стратегии, увеличивая тем самым свои выигрыши, но исход для каждого из них хуже, чем в ситуации, когда оба следуют доминируемым стратегиям.
Рассмотрим конфликт, в котором участвуют игроки A и В. Пусть игрок A имеет стратегии A1, A2, …, Am, а игрок B – стратегии B1, B2, …, Bn. При этом выбранной игроками стратегии {Ai , Bj } со-
48
ответствуют выигрыши aij и bij игроков A и B соответственно. Вообще говоря, aij bij . Таким образом, в такой игре существуют две различные матрицы выигрышей:
A (aij ) и B (bij ), i |
|
, |
j |
|
, |
1,m |
1,n |
для игроков A и B соответственно. В этом случае игру называют биматричной. Очевидно, что антагонистические игры являются частным случаем биматричных игр в случае, когда bij aij для
всех i 1,m, j 1,n . Иногда биматричную игру представляют од-
ной матрицей |
|
|
(a |
,b |
|
) |
(a |
|
,b ) |
|
|
(a |
,b |
|
) |
|
|
|
|
|
|
|||||||||||||
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|||||||||||||||||
|
|
|
|
|
|
|
|
11 |
11 |
|
|
|
12 |
|
12 |
|
|
|
|
|
1n |
|
1n |
|
|
|
|
|
|
|
|
|||
|
|
|
|
|
|
(a21,b21) |
(a22,b22) |
|
|
(a2n ,b2n ) |
|
|
|
|
|
|
||||||||||||||||||
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|||||
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|||||||||
|
|
|
|
|
(a |
|
,b |
|
|
) |
(a |
|
|
,b |
) |
|
|
(a |
|
,b |
|
|
|
|
|
|
|
|
||||||
|
|
|
|
|
|
m1 |
|
|
m2 |
|
|
mn |
|
|
) |
|
|
|
|
|
|
|||||||||||||
|
|
|
|
|
|
|
|
m1 |
|
|
m2 |
|
|
|
|
|
|
mn |
|
|
|
|
|
|
|
|||||||||
с элементами |
|
|
(aij ,bij ). |
Случай, |
|
когда |
aij |
bij |
const, |
i |
|
, |
||||||||||||||||||||||
|
|
|
1,m |
|||||||||||||||||||||||||||||||
j |
|
, соответствует матричной игре. |
|
|
|
|
|
|
|
|
|
|
|
|
|
|||||||||||||||||||
1,n |
|
|
|
|
|
|
|
|
|
|
|
|
|
|||||||||||||||||||||
|
Рассмотрим смешанные стратегии игроков при многократном |
|||||||||||||||||||||||||||||||||
повторении игры |
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|||||||
|
|
S |
|
|
A |
|
|
A |
|
A |
|
и S |
|
B B |
|
|
|
B |
|
|
|
|
||||||||||||
|
|
|
|
1 |
|
p |
2 |
p |
m |
|
|
1 |
|
|
2 |
|
|
q |
n |
. |
||||||||||||||
|
|
|
A |
p |
|
|
2 |
|
|
|
|
|
B |
q q |
2 |
|
|
n |
|
|
|
|
||||||||||||
|
|
|
|
|
1 |
|
|
|
|
|
|
m |
|
|
|
|
|
1 |
|
|
|
|
|
|
|
|
|
|
||||||
|
Средние выигрыши игроков определяются математическими |
|||||||||||||||||||||||||||||||||
ожиданиями |
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
||||
|
|
|
|
H A (P,Q) aij piq j |
и HB (P,Q) bij piq j . |
|
|
|
|
|||||||||||||||||||||||||
|
|
|
|
|
|
|
|
|
|
i, j |
|
|
|
|
|
|
|
|
|
|
|
i, j |
|
|
|
|
|
|
|
|
|
|||
|
Определение. |
Будем |
говорить, |
что |
пара |
(P0,Q0) векторов |
||||||||||||||||||||||||||||
P0 (p0, |
p0, , |
p |
0 ) и Q0 |
(q0 |
, q0 |
, , q0) определяет равновесную |
||||||||||||||||||||||||||||
1 |
|
2 |
|
|
|
m |
|
|
|
|
|
|
1 |
|
2 |
|
|
|
n |
|
|
|
|
|
|
|
|
|
|
|
|
|
||
ситуацию |
(точку |
равновесия), |
|
если |
при |
|
любых |
|
векторах |
|||||||||||||||||||||||||
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
49 |
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
P (p1, p2,..., pm ) и |
Q (q1,q2,...,qn ), элементы которых |
удовле- |
m |
n |
|
творяют условиям pi 1 и q j 1, выполняются неравенства |
||
i 1 |
j 1 |
|
H A (P,Q0) H A (P0,Q0) и HB (P0,Q) HB (P0,Q0). |
(10.1) |
|
Неравенства (10.1) означают, что отклонение игроков от равновесной ситуации (P0,Q0) может только уменьшить их выигры-
ши. Возникает вопрос: всегда ли существует равновесная ситуация? Положительный ответ на этот вопрос дает следующая теорема.
Теорема 10.1 (Дж. Нэш). Любая биматричная игра имеет хотя бы одну точку равновесия в чистых или смешанных стратегиях.
Замечание. Равновесие по Нэшу в биматричных играх – это обобщение понятия седловой точки (оптимального решения) в играх с нулевой суммой.
Рассмотрим примеры нахождения точки равновесия. Сначала изучим самую простую биматричную игру 2 2 с матрицами выигрышей
a |
a |
|
b |
b |
|
||
A 11 |
12 |
|
и B 11 |
12 |
. |
||
a |
21 |
a |
22 |
|
b |
b |
|
|
|
|
21 |
22 |
|
||
Пусть смешанные стратегии игроков имеют вид
S |
|
|
A |
A |
|
|
B |
B |
|
A |
|
1 |
2 |
и S |
B |
1 |
2 |
. |
|
|
|
p |
|
|
|
|
|
||
|
|
|
1 p |
|
q |
1 q |
|||
Тогда средние выигрыши HA и HB игроков A и B будут зависеть только от двух переменных: p и q. При использовании стратегий SA и SB средние выигрыши игроков
H A (p,q) a11pq a12 p(1 q) a21(1 p)q a22(1 p)(1 q),
(10.2)
HB (p,q) b11pq b12 p(1 q) b21(1 p)q b22(1 p)(1 q).
50
