Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Теория игр. Учебное пособие
.pdf
2. Смешанная стратегия Плательщика состоит из стратегий В1
;
:
:;
.
yy
A
A yy
yy
+=ν
+=ν
+=
12
12
12
75
1
22 7
1
/, ;
/, ;
/ ,.
yy= = >
= = >
ν= =
1
2
270290
5 7 0 71 0
39 7 5 56
;
:
:;
.
xx
B
B xx
xx
+=ν
+=ν
+=
12
12
12
72
1
25 7
1
/, ;
/, ;
/ ,.
xx= = >
= = >
ν= =
1
2
5 7 0 71 0
270290
39 7 5 56
и В2, применяемых с вероятностями y1 и y2 , следовательно, для вероятностей применения этих стратегий получаем уравнения
Решение системы дает следующий результат:
Сделаем вывод (он полностью согласуется с графическим решением в примере 9б): смешанная стратегия Плательщика состоит из
стратегий В1 и В2, применяемых с вероятностями y1 > 0 и y2 > 0.
3. Для обеих применяемых (yj > 0) стратегий Плательщика В1 и В2
по следствиям из теорем двойственности получаем уравнения, связывающие вероятности x1 > 0 и x2 > 0, а решая полученную систему
уравнений − вторую часть решения игры
~
4. Проведем проверку смешанной стратегии Получателя
Предположим, что Плательщик достаточно много раз применяет свою стратегию В1. Тогда величина среднего платежа может быть
вычислена
7x
+ 2x2 + 8x3 = 7⋅5/7 + 2×2/7 + 8×0 = 39/7 = ν > α = 5;
1
Во всех остальных случаях Плательщик применяет стратегию В2.
Тогда вычисление величины среднего платежа дает результат
5x
x
+ x2 + x3 = 5/7 + 2/7 + 0 = 1.
1
+ 7x2 + 4x3 = 5⋅5/7 + 7×2/7 + 4×0 = 39/7 = ν > α.
1
61

5. Проведем проверку смешанной стратегии Плательщика
Сумма найденных вероятностей − один
y
+ y2 = 2/7+5/7 + 0 = 1.
1
Предположим, что Получатель достаточно много раз применяет свою стратегию А1. Тогда величина среднего платежа может быть
вычислена
7y
+ 5y2 = 7 ⋅ 2/7 + 5 ⋅ 5/7 = 39/7 = ν < β = 7.
1
Во всех остальных случаях Получатель применяет стратегию А2.
Тогда вычисление величины среднего платежа дает результат
2y
+ 7y2 = 2 ⋅ 2/7 + 7 ⋅ 5/7 = 39/7 = ν< β.
1
Если Получатель применяет стратегию А3, то величина среднего платежа составит
8y
+ 4y2 = 8 ⋅ 2/7 + 4 ⋅ 5/7 = 36/7 < v
1
(что подтверждает невыгодность этой стратегии для Получателя).
Ответ:
– оптимальная смешанная стратегия Получателя состоит в применении стратегии А1 с вероятностью x
= 0,71 и стратегии А2 с ве-
1
роятностью x2 = 0,29;
– оптимальная смешанная стратегия Плательщика состоит в применении стратегии В1 с вероятностью y1 = 0,29 и стратегии В2 с вероятностью y2 = 0,71;
– цена игры (средняя величина платежа, гарантированная каждому игроку при применении оптимальных смешанных стратегий) ν = 5,56.
3.5. Итеративный метод Брауна – Робинсон
Метод фиктивного разыгрывания Брауна-Робинсон позволяет получить приближенную смешанную стратегию игроков на основе учета частоты выбора ими чистых стратегий во вспомогательной процедуре псевдорозыгрыша. Основная идея – выбор наиболее выгодных
решений на основе информации, интегрально содержащей результаты аналогичных предыдущих выборов.
62

Многократное взаимодействие игроков рассматривается как последовательность отдельных актов, называемых партиями. В каждой
партии игроки применяют какую-нибудь одну из конечного множества возможных стратегий, выбирая ее на основе обобщения всех
данных о партиях, разыгранных до данной, и подбирая с учетом своих интересов. Поведение игроков корректируется на каждом следующем шаге.
Предлагается следующий порядок действий:
1. Первая партия разыгрывается, исходя из равной вероятности
применения противником любой из его стратегий. Каждый игрок
подбирает такую свою чистую стратегию, чтобы получить наилучший для себя результат (математическое ожидание) при равновероятном выборе стратегий противника, и этот выбор используется для
«затравки» псевдорозыгрыша.
2. По всем предыдущим партиям для обоих игроков рассчитывается частотность применения их чистых стратегий.
3. Вычисленные частотности принимаются в качестве приближенной оценки вероятности применения этих стратегий (т. е. в качестве приближенного решения игры), затем опять производится
выбор наиболее выгодных чистых стратегий противников при дан-
ном допущении.
4. Следующая партия разыгрывается в выбранных чистых стратегиях.
5. Осуществляется повтор всех действий, начиная с п. 2 (при увеличенном количестве разыгранных партий).
Сходимость приближенных решений обеспечивается теоремой,
доказательство которой основано на свойствах ограниченных функций. При большом количестве «выгодных» решений влияние редких
случайных «невыгодных» шагов на усредненные показатели убывает,
и существует некоторая окрестность оптимального решения, которая
совсем исключает возможность использования неактивной стратегии
и невыгодных шагов. Таким образом, рассчитанная по предыдущим
партиям частотность применения неактивных стратегий монотонно
убывает, приближаясь к нулю. Этот заметный факт позволяет выдвигать правдоподобные гипотезы о составе множества активных стратегий, используемых игроками, а верификацию таких гипотез удобно проводить аналитическими методами, рассмотренными выше.
Так как при достаточно большом количестве партий влияние отдельного результата на усредненные частотности применения чистых
стратегий слабеет, однотипные решения о выборе чистых стратегий
63

принимаются удлиняющимися сериями. Частотности применения
активных стратегий варьируются около оптимальных значений, демонстрируя в пределах серии то монотонное возрастание, то убывание. Поэтому рекомендуется рассматривать результаты геометрически возрастающих количеств шагов итерации 20, 40, 80, 160...
Достоинства метода Брауна – Робинсон – в его идеологической
прозрачности, легкой алгоритмизируемости и возможности программирования, в возможности достаточно быстро сделать существенные
выводы о множестве активных стратегий игроков и перейти к аналитическим методам работы.
64

4. КОМПЛЕКСНОЕ ПРИМЕНЕНИЕ ПРИЕМОВ ПРИ РЕШЕНИИ
max(min( )) max( ; )
ij
j
i
aα= = =02 2
ЗАДАЧ ТЕОРИИ МАТРИЧНЫХ ИГР С НУЛЕВОЙ СУММОЙ
Пример 12 (игра с седловой точкой). Для данной платежной матрицы:
– найти нижнюю и верхнюю цены игры;
– упростить данную платежную матрицу, исключив из нее доминируемые строки и столбцы, соответствующие заведомо невыгодным стратегиям игроков;
– выявить активные стратегии игроков графическим методом;
– найти решение игры: стратегии игроков и цену игры.
5 0
3 2
Решение
1. Введем обозначения стратегий первого игрока (Получателя)
и второго игрока (Плательщика)
В1 В2
А1 5 0
А2 3 2
2. В каждой строке выявим наименьшее значение и из этих ре-
зультатов – наибольшее
Нижняя цена игры
при использовании Получателем стратегии А2).
3. В каждом столбце выявим наибольшее значение, а из этих ре-
зультатов – наименьшее
В1 В2
А1 5 0 0
А2 3 2 2
min( )
j
a
ij
(реализуется
65

В1 В2
min(max( )) min( ; )
ij
j
i
aβ= = =52 2
А1 5 0
А2 3 2
a
max( )
i
ij
5 2
Верхняя цена игры
(реализуется
при использовании Плательщиком стратегии В2).
4. По результатам п. 2, 3 сделаем выводы: верхняя и нижняя цены
игры совпадают, значит, игра имеет решение в чистых стратегиях
(А2 и В2 для Получателя и Плательщика соответственно), цена игры
ν = α = β = 21.
5. Для выявления доминируемых строк платежной матрицы проведем их поэлементное сравнение
В1 В2
А1 и А2 5 > 3 0 < 2
Вывод: знаки неравенств – разные, ни одной из строк исклю-
чить нельзя.
6. Для выявления доминируемых столбцов проведем их поэлементное сравнение
В1 и В2
А1 5 > 0
А2 3 > 2
Вывод: знаки неравенств – одинаковые, значит, стратегия В2 доминирует стратегию В1 (стратегия В2, очевидно, более выгодна Плательщику) и стратегия В1 может быть исключена из платежной матрицы
1
Это рассуждение является достаточным для получения ответа в случае, когда
игра имеет седловую точку. Остальные пункты примера показывают, как более сложные приемы анализа игры приводят к тому же самому результату.
66
В2
А1 0
А2 2

7. Вернемся к рассмотрению стратегий получателя. Очевидно,
что для полученной в п. 6 платежной матрицы стратегия А2 доминирует стратегию А1, и последняя может быть исключена из платежной матрицы
В2
А2 2
Дальнейшие упрощения невозможны.
8. По результатам п. 5–7 сделаем вывод: путем последовательного
упрощения платежная матрица сведена к единственному элементу.
Он определяет решение игры: Получателем и Плательщиком используются стратегии А2 и В2, цена игры ν = a22 = 2. Этот вывод полностью согласуется с результатами, полученными в п. 4.
9. Проведем графическое сравнение стратегий Плательщика при
разных смешанных стратегиях Получателя. Обозначим x2 – вероятность использования Получателем стратегии А2. Выполним графическое построение
6
µ(x
)
2
5
4
3
2
1
0
0 1
B1
М(1; 2)B2
x
2
Здесь отрезок, соответствующий стратегии В1, соединяет величины платежа a11 = 5 (при x2 = 0) и a21 = 3 (при x2 = 1). Отрезок, соответствующий стратегии В2, соединяет величины платежа a12 = 0 (при
x2 = 0) и a22 = 2 (при x2 = 1).
Найдем такую точку М на нижней границе получившейся фигуры, которая наиболее удалена от оси абсцисс, и сделаем выводы:
67

– так как отрезки на графике не пересекаются, то очевидно, что
стратегия В2 более выгодна Плательщику при любом выборе смешанной стратегии Получателем (этот вывод согласуется с результатами п. 6). Она является единственной активной стратегией Плательщика;
– точка М имеет координаты x
= 1 и µ(x2) = a22 = 2 – это указы-
2
вает на использование Получателем только стратегии А2, при неактивной стратегии А1, и цене игры, совпадающей с одним из элементов платежной матрицы.
10. Проведем графическое сравнение стратегий Получателя при
разных смешанных стратегиях Плательщика. Обозначим y2 – вероятность использования Плательщиком стратегии В2. Выполним графическое построение
6
5
3
4
2
1
0
µ(y
)
2
А1
А2
0
А2
А1
М (1; 2)
y
2
1
Здесь отрезок, соответствующий стратегии А1, соединяет величины платежа a11 = 5 (при y2 = 0) и a12 = 0 (при y2 = 1). Отрезок, соответствующий стратегии А2, соединяет величины платежа a21 = 3 (при
y2 = 0) и a22 = 2 (при y2 = 1).
Найдем точку М верхней границы получившейся фигуры, которая
наиболее приближена к оси абсцисс, и сделаем выводы:
– так как отрезки, соответствующие стратегиям Получателя, пересекаются, выбор заведомо выгодной (доминирующей) стратегии
сделать нельзя;
68

– точка М находится не в точке пересечения отрезков, а связана
:
:
min
x x YY
B
x x YY
B
x x GY Y
+ ≥ν + ≥
+ ≥ν + ≥
⇒
+= =+→
12 12
12 12
12 12
53 531
1
02 021
2
1
только со стратегией Получателя А2, что указывает на использование
Получателем только этой стратегии при неактивной стратегии А1;
– верхняя граница фигуры, образованной пересекающимися отрезками, имеет точку, наиболее приближенную к оси абсцисс, при
= 1 и µ(y2) = a22 = 2 – это указывает на использование Плательщи-
y
2
ком только стратегии В2, при неактивной стратегии В1 и цене игры,
совпадающей с одним из элементов платежной матрицы.
11. Сформулируем задачу линейного программирования для Получателя (x1 и x2 – искомые вероятности использования стратегий А1
и А2, ν – искомая цена игры, Y1 = x1 / ν, Y2 = x2 / ν и G
= 1/ν– «вспо-
min
могательные» ЛП-величины)
Задачу ЛП можно решить графическим методом. Выполним по-
строения
0,6
Y
2
0,5
0,4
M(0; 1/2)
В2
0,3
0,2
0,1
0
В1
0 0,1
0,2
Найдем точку М, удовлетворяющую требованию минимизации
целевой функции, и решение ЛП-задачи
Y
= 0, Y2 = 1/2 и G
1
0,3 0,4 0,5
= Y1 + Y2 = 0 + 1/2 = 1/2.
min
Y
1
0,6 0,7
69

Решение исходной «игровой» задачи для Получателя находим,
используя связи между искомыми и вспомогательными величинами
ν = 1/G
= 2, x1 = νY1 = 0 и x2 = νX2 = 1.
min
Сделаем дополнительный вывод: линия, соответствующая стратегии В1, целиком лежит под линией доминирующей стратегии В2, –
это указывает на то, что актуальные ограничения возможных значений целевой функции связаны только со стратегией В2, которая является единственной активной стратегией Плательщика.
12. Решение задачи для Плательщика (y
и y2 – вероятности исполь-
1
зования стратегий В1 и В2) найдем, используя следствия из ЛП -теорем двойственности и данных, полученных в предыдущем пункте.
Так как x2 > 0, для единственной активной стратегии А2 записываем точное равенство 3y1 + 2y1 = ν = 2 и рассматриваем его совместно с требованием y1 + y2 = 1. Эту систему решаем, получая результат y1 = 0 и y2 = 1.
Ответ:
– нижняя цена игры равна верхней цене игры (т. е. игра имеет
«седловую точку»): ν = α = β = 2.
– исключение доминируемых рядов из платежной матрицы сводит ее к единственному элементу ν = a22 = 2.
– активные стратегии игроков – А2 для Получателя и В2 для Плательщика.
– решение игры: x1 = 0 и y1 = 0 (стратегии А1 и В1 являются неактивными); x2 = 1 и y2 = 1 (стратегии А2 и В2 используются игроками,
как для однократного взаимодействия, так и во всех случаях многократного взаимодействия); цена игры ν = 2.
Пример 13 (игра без седловой точки). Для данной платежной матрицы:
2 9
8 0
– найти нижнюю и верхнюю цены игры;
– упростить данную платежную матрицу, исключив из нее доминируемые строки и столбцы, соответствующие заведомо невыгодным стратегиям игроков;
– выявить активные стратегии игроков графическим методом;
– найти решение игры: стратегии игроков и цену игры.
70
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
