Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Элементы теории игр. Учебное пособие
.pdf
21
221111
papa
в полученной точке, т. е. ординату соответствую-
щей точки отрезка В1В
1
.
Если p2 = 0, то
112111
01 aaa
, т. е. результату игры в
чистых стратегиях (А
1
, В1), и соответствующая точка отрезка В
1В1
лежит на оси I. Если p2 = 1, то
212111
10 aaa
, т. е. результату
игры в чистых стратегиях (А
2
, В1), и соответствующая точка отрезка
В1В
1
лежит на оси II. Если игрок А использует собственно смешан-
ные стратегии (0 < p2 < 1), а игрок В продолжает пользоваться только своей чистой стратегией В1, то средний результат такой игры
будет равен какому-то промежуточному значению и соответствующая ему точка будет находиться внутри отрезка В1В1. При этом
чем чаще использует игрок А в своей смешанной стратегии стратегию А
1
, т. е. чем больше p1 и соответственно меньше p
2
, тем ближе
средний результат
к величине
11
a
, а соответствующая точка от-
резка В1В
1
к оси I.
Аналогичные рассуждения проведем и в отношении отрезка
В2В2, соединяющего точки, соответствующие величинам a
12
и a22.
Уравнение этого отрезка можно записать в виде
222112
papa
,
где p2 играет роль параметра, меняющегося от 0 до 1 (0
2p
1),
а
21
1 pp
. Ордината точки данного отрезка при определенном
значении p2 равна результату игры, когда игрок А смешивает свои
чистые стратегии А
1
и А2 в пропорции p1:p2, а игрок В все время
придерживается своей чистой стратегии В2. Эту величину также
можно найти, отложив по оси абсцисс от оси I в сторону оси II отрезок, равный p2 (ось I при этом играет роль оси ординат), и замерив ординату соответствующей точки отрезка В2В
2
, т. е. ординату
графика функции
222112
papa
в точке p2.
Итак, если величина p1 зафиксирована (а значит, зафиксирована и величина p2, так как
121 pp
), то ордината точки, соответ-
ствующей этим p, на отрезке В1В1 равна средней величине выигрыша игрока А в игре со стратегиями
),(1BS
A
, а ордината аналогич-
ной точки на отрезке В2В
2
– соответственно средней величине вы-
игрыша игрока А в игре со стратегиями
),(2BS
A
, где
21
21
pp
AA
S
A
–
смешанная стратегия игрока А, а В1 и В2 – чистые стратегии игрока В. На графике наглядно видно, какой вариант дает худший результат для игрока А (меньший выигрыш).

22
Ломаную
},min{
222112221111
papapapa
будем назы-
вать нижней границей игры, а ломаную
},max{
222112221111
papapapa
– верхней ее границей.
Исходя из принципа гарантированного результата, игрок А
должен стремиться найти наилучший вариант действий при
наихудших для него действиях противника, т. е. он должен искать
максимум на нижней границе игры. Игрок В, наоборот, стремится
уменьшить свой проигрыш (т. е. выигрыш игрока А) при наихудших для него действиях игрока А. Знач
ит, он должен будет искать
точку минимума на верхней границе игры.
Очевидно, что точка максимума нижней границы игры есть
точка пересечения отрезков В
1В1
и В2В2. Ордината этой точки рав-
на цене игры
0
, а ее абсцисса делит отрезок между осями I и II на
отрезки величиной
0
2
p и
0
1
p – оптимальные частоты смешивания
чистых стратегий игрока А (рис. 2.1).
Рис. 2.1
На рис. 2.1 выделенная линия – нижняя граница игры; максимум на нижней границе – цена игры (
0
);
– результат игры, если
игроки придерживаются стратегий
),(1BS
A
, где
21
21
pp
AA
S
A
.
Поскольку точка максимума нижней границы игры лежит на
пересечении отрезков прямых, соответствующих чистым стратегиям игрока В, то становится очевидным, что если игрок А использует
А
1
А
2
ν
0
В
2
В
2
В
1
В
1
II
I
0
2
p
0
1
p
12
a
11
a
21
a
22
a
2
p
1
p

23
ет оптимальную смешанную стратегию
0
2
0
1
21
0
pp
AA
S
A
, то какую
бы чистую стратегию ни применял игрок В, результат игры остается неизменным и равным цене игры (
0
). Более того, результат не
изменится, если игрок В начнет смешивать свои стратегии произвольным образом:
00
21
0
2
0
1
0
1)( qqqq
.
Для того чтобы точно найти координаты точки максимума
нижней границы игры, нужно найти точку пересечения прямых, соответствующих чистым стратегиям игрока В, т. е. совместно решить уравнения прямой В1В
1
221111
papa
и прямой В
2В2
222112
papa
при условии
121 pp
. Таким образом, приходим к
системе уравнений
,1
,
,
21
222112
221111
pp
papa
papa
которая полностью соответствует системе, полученной в предыдущем параграфе.
Итак, нами найдена оптимальная стратегия игрока А:
0
2
0
1
21
0
pp
AA
S
A
и цена игры
0
. Чтобы полностью решить игру,
осталось найти оптимальную стратегию игрока В. Для этого можно
построить графическую схему, аналогичную построенной выше для
игрока А, но уже с позиции игрока В. Оси I и II будут теперь отражать чистые стратегии игрока В, а отрезки прямых А1А
1
и А
2А2
представлять чистые стратегии игрока А в то время, когда игрок В
использует свои стратегии в смешанном виде. Затем нужно будет
найти точку минимума верхней границы игры. Напомним, что для
игры с нулевой суммой берется платежная матрица игрока А, в которой отражены «выигрыши» игрока А, т. е. «проигрыши» игрока
В: если «выигрыш» игрока А отрицательный, то фактически игрок
А проигрывает, а игрок В выигрывает абсолютную величину этого
«выигрыша». Координаты найденной точки позволят найти оптимальные пропорции
0
1
q
и
0
2
q
смешивания чистых стратегий игрока
В. Таким образом, оптимальная стратегия игрока В будет найдена:

24
0
2
0
1
21
0
qq
BB
S
B
. Цена игры, разумеется, совпадет с ранее найденной
ценой
0
. Но можно проще найти
0
1
q
и
0
2
q
, решив с ранее найденной
ценой игры
0
систему
.1
,
21
0
212111
qq
qaqa
2.3. Графический метод решения игры 2n
Рассмотрим игру 2
n, т. е. игру с двумя стратегиями игрока А
и n стратегиями игрока В. Запишем платежную матрицу этой игры.
Пусть
. Седловой точки нет. Тогда обе стратегии игрока A
– его полезные (активные) стратегии.
Построим графическую схему игры 2
n аналогично тому, как
это было сделано для игры 2
2. На оси I будем откладывать ре-
зультаты игры («выигрыш» игрока А), когда игрок А выбирает
стратегию А
1
, а игрок В – каждую из своих стратегий В1, В
2
, …, В
n
.
На оси II аналогично отразим ситуацию выбора игроком А стратегии А
2
, а игроком В – каждой из своих стратегий. Соединим отрез-
ком прямой точки на осях I и II, соответствующие определенной
стратегии игрока В. Сделаем это для каждой его стратегии Вk (k = 1,
2, …, n). Ордината точки отрезка В
kВk
дает средний результат игры
в случае, когда игрок В все время придерживается своей чистой
стратегии В
k
, а игрок А смешивает свои полезные стратегии в той
пропорции p2:p
1
, в которой абсцисса этой точки делит расстояние
между осями I и II.
1
B
2
B
…
n
B
1
A
11
a
12
a
…
n
a
1
2
A
21
a
22
a
…
n
a
2

25
Рис. 2.2
Далее выделим нижнюю границу игры и найдем на ней максимум (
0
). Очевидно, что точка максимума нижней границы игры
полностью определяется пересечением двух отрезков, соответствующих двум чистым стратегиям игрока В из тех, что лежат на
нижней границе игры. Так как именно эти стратегии должен применять игрок В в своей оптимальной смешанной стратегии, чтобы
получить свой наилучший гарантированный средний результат,
равный цене игры
0
, то именно эти две стратегии будут его полез-
ными (активными) стратегиями.
Можно доказать общую теорему о количестве полезных стра-
тегий.
Теорема. Для игры mn количество полезных стратегий у каждого из игроков не превосходит наименьшего из чисел m и n.
Если обозначить количество полезных (активных) стратегий
игрока А через
A
k
, а игрока В через
B
k
, то согласно теореме
nmk
A
;min
и
nmk
B
;min
.
Рассмотрев графическое решение игры, найдем полезные
стратегии игрока В. Пусть это будут
i
B
и
j
B
. Тогда решение этой
I
А
2
А
1
В1 В
1
В
4
В
3
В3 В2 В2 В5 В
5
В
4
II
ν
0
0
2
p
0
1
p

26
игры ничем не отличается от решения игры 2
2: сначала рассмот-
рим пары стратегий
),(
0
i
BS
A
и
),(
0
j
BS
A
и решим систему
:),(
:),(
0
0
j
i
BS
BS
A
A
.1
,
,
21
2211
2211
pp
papa
papa
jj
ii
Найдем из системы
00
2
0
1
,, pp
. Затем рассмотрим пару стратегий
),(
0
1 B
SA
, где
0.........0
.........
00
1
0
ji
nji
B
qq
BBBB
S
и решим систему
.1
,
11
ji
jjii
qq
qaqa
.
Найдем решение этой системы –
00
,jiqq
. Тем самым найдем опти-
мальную стратегию игрока В.
ГЛАВА 3
МЕТОДЫ РЕШЕНИЯ ИГР mn
3.1. Доминирующие стратегии
Игры mn решаются путём сведения к задачам линейного
программирования.
Рассмотрим платежную матрицу задачи.
Пусть
, т. е.
. Нет седловой точки, следовательно, игра
имеет решение только в смешанных стратегиях.
Пусть игрок A смешивает все свои стратегии:
m
m
A
ppp
AAA
S
...
...
21
21
.
1
B
2
B
…
n
B
1
A
11
a
12
a
…
n
a
1
2
A
21
a
22
a
…
n
a
2
… … … … …
m
A
1m
a
2m
a
…
mn
a

27
Стратегия называется дублирующей, если все платежи при
этой стратегии равны соответствующим платежам при некоторой
другой стратегии (т.е. строчка или столбец в матрице повторяются).
Стратегия называется заведомо невыгодной, если все выиг-
рыши при этой стратегии не превосходят, а хотя бы один выигрыш
строго меньше, чем соответствующие выигрыши при некоторой
другой стратегии.
Заведомо невыгодная стратегия называется доминируемой, а
стратегия более выгодная называется доминирующей.
Решение задачи проводится в три этапа.
1-й этап. Сокращение (редуцирование) платёжной матрицы,
если это возможно, за счёт вычёркивания дублирующих и заведомо
невыгодных (доминируемых) стратегий.
Пример. Игра 44
Дана первоначальная матрица игры.
Вычёркиваем стратегию
3
A
, так как она дублирует стратегию
1
A
.
Определение доминируемых и доминирующих стратегий производится путем попарного сравнения строк (столбцов) матрицы. Если
у игрока А имеются такие стратегии, то строка матрицы, соответствующая доминируемой стратегии, состоит из элементов, не превосходящих соответствующих элементов строки, отвечающей доминирующей стратегии.
Стратегия
2
A
– доминируемая. Доминирующей для нее является
стратегия
1
A
, так как применение игроком А стратегии
2
A
всегда
1
B
2
B
3
B
4
B
1
A
1 2 4
3
2
A
0 2 3
2
3
A
1 2 4
3
4
A
4 3 1
0
1
B
2
B
3
B
4
B
1
A
1 2 4
3
2
A
0 2 3
2
4
A
4 3 1
0

28
дает результат не лучше, чем при применении стратегии
1
A
. Поэто-
му стратегию
2
A
вычёркиваем.
Других доминируемых и дублирующих стратегий у игрока А в этой
игре нет.
Полученную матрицу исследуем с позиции игрока В. Проведем попарное сравнение столбцов полученной матрицы. Дублирующих стратегий в этой матрице у игрока В нет. Если у игрока В
имеются доминируемая и доминирующая стратегии, то столбец
матрицы, соответствующий доминируемой стратегии, состоит из
элементов, не меньших (т. е. равных или больших) соответствующих элементов столбца, отвечающего доминирующей стратегии.
Стратегия
3
B
в матрице – доминируемая. Доминирующей для
нее является стратегия
4
B
, потому что она обеспечивает игроку В
меньшие проигрыши, т. е. лучший для этого игрока результат. Вычёркиваем стратегию
3
B
.
В результате подобного сокращения получаем игру 2
3.
Теперь снова просматриваем стратегии игрока А, так как после вычеркивания стратегий игрока В у игрока А вновь могут появиться
дублирующие или доминируемые стратегии. Если это случилось,
вычеркиваем их и вновь просматриваем стратегии игрока В. Подобным образом поступаем до тех пор, пока у игроков будут последовательно находиться стратегии, подлежащие вычеркиванию.
В нашем случае дальнейшее сокращение матрицы невозможно, так
как в ней не осталось больше дублирующих и доминируемых стратегий у обоих игроков.
В результате подобного сокращения конечная матрица содержит только те стратегии игроков, ни одна из которых не является
доминирующей по отношению к любой другой стратегии этого игрока и не повторяется дважды. Такие стратегии называются эф-
фективными. Только эффективные стратегии имеет смысл рас-
1
B
2
B
3
B
4
B
1
A
1 2 4
3
4
A
4 3 1
0
1
B
2
B
4
B
1
A
1 2 3
4
A
4 3 0

29
сматривать в дальнейшем, так как другие стратегии не участвуют
в формировании оптимальных стратегий игроков.
2-й этап. Если платёжная матрица содержит отрицательные
числа, то добиваемся, чтобы в ней не было отрицательных чисел,
т. е. чтобы все элементы платёжной матрицы были неотрицательны. Для этого добавляем положительное число L, равное (или
большее) модулю наименьшего отрицательного элемента матрицы,
ко всем элементам матрицы. В результате такого действия решение
игры не меняется, но цена игры увеличивается на величину L и при
этом становится положительной:
L
старнов
,
0
нов
.
Пример
Дана первоначальная матрица игры.
Добавим ко всем элементам матрицы L = 4. Получаем новую матрицу
Все элементы этой матрицы неотрицательны, оптимальные стратегии игроков не изменились, но цена игры (гарантированный средний выигрыш) увеличилась на 4 единицы и стала положительной
(
0
нов
,
L
новстар
).
3-й этап. Переход к задаче линейного программирования.
1
B
2
B
3
B
4
B
1
A
–1 2 4
–3
2
A
0
–2 3 2
3
A
–1 2 –4
3
4
A
4 3 1 0
1
B
2
B
3
B
4
B
1
A
3 6 8
1
2
A
4 2 7
6
3
A
3 6 0
7
4
A
8 7 5
4

30
3.2. Сведение матричных игр к задачам линейного
программирования
Будем считать, что возможные сокращения платежной матри-
цы уже осуществлены и матрица содержит только эффективные
стратегии обоих игроков. Кроме того, будем полагать, что все элементы платежной матрицы неотрицательны.
Рассмотрим пары стратегий:
),(
j
A
BS
для
nj ,1
, где
m
m
ppp
AAA
S
A
...
...
21
21
.
Найдем для каждой из них средний результат игры. Средний выигрыш игрока A равен математическому ожиданию случайной величины (выигрыш игрока A – случайная величина).
Математическое ожидание – произведение значений слу-
чайной величины на их вероятности.
Для пары
),(1BS
A
средний результат игры равен
mm
papapa
1221111
...
.
Поскольку игрок B не придерживается своей оптимальной
смешанной стратегии, то
mm
papapa
1221111
...
, где
– цена
игры. Точно так же и для остальных пар
),(2BS
A
, …,
),(
n
A
BS
:
....
,...
2211
2222112
mmnnn
mm
papapa
papapa
По условию все элементы платежной матрицы игры неотрицательны. Значит, нижняя цена игры не может быть меньше нуля и,
следовательно, цена игры положительна:
0
)(
.
Таким образом, имеем систему линейных неравенств
....
,...
,...
2211
2222112
1221111
mmnnn
mm
mm
papapa
papapa
papapa
1
B
2
B
…
n
B
1
A
11
a
12
a
…
n
a
1
2
A
21
a
22
a
…
n
a
2
… … … … …
m
A
1m
a
2m
a
…
mn
a
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
