Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Теория игр. Учебное пособие

.pdf
Скачиваний:
0
Добавлен:
08.09.2026
Размер:
2 Мб
Скачать
☆
2. Смешанная стратегия Плательщика состоит из стратегий В1
;
:
:;
.
yy
A
A yy
yy
+=ν
 
+=ν
 
+=
12
12
12
75
1
22 7
1
/, ;
/, ; / ,.
yy= = >
 
= = >
 
ν= =
1
2
270290
5 7 0 71 0
39 7 5 56
;
:
:;
.
xx
B B xx
xx
+=ν
 
+=ν
 
+=
12
12
12
72
1 25 7
1
/, ;
/, ; / ,.
xx= = >
 
= = >
 
ν= =
1
2
5 7 0 71 0
270290
39 7 5 56
и В2, применяемых с вероятностями y1 и y2 , следовательно, для веро­ятностей применения этих стратегий получаем уравнения
Решение системы дает следующий результат:
Сделаем вывод (он полностью согласуется с графическим реше­нием в примере 9б): смешанная стратегия Плательщика состоит из стратегий В1 и В2, применяемых с вероятностями y1 > 0 и y2 > 0.
3. Для обеих применяемых (yj > 0) стратегий Плательщика В1 и В2 по следствиям из теорем двойственности получаем уравнения, свя­зывающие вероятности x1 > 0 и x2 > 0, а решая полученную систему уравнений − вторую часть решения игры
~
4. Проведем проверку смешанной стратегии Получателя
Предположим, что Плательщик достаточно много раз применя­ет свою стратегию В1. Тогда величина среднего платежа может быть вычислена
7x
+ 2x2 + 8x3 = 7⋅5/7 + 2×2/7 + 8×0 = 39/7 = ν > α = 5;
1
Во всех остальных случаях Плательщик применяет стратегию В2. Тогда вычисление величины среднего платежа дает результат
5x
x
+ x2 + x3 = 5/7 + 2/7 + 0 = 1.
1
+ 7x2 + 4x3 = 5⋅5/7 + 7×2/7 + 4×0 = 39/7 = ν > α.
1
61
5. Проведем проверку смешанной стратегии Плательщика
Сумма найденных вероятностей − один
y
+ y2 = 2/7+5/7 + 0 = 1.
1
Предположим, что Получатель достаточно много раз применя­ет свою стратегию А1. Тогда величина среднего платежа может быть вычислена
7y
+ 5y2 = 7 ⋅ 2/7 + 5 ⋅ 5/7 = 39/7 = ν < β = 7.
1
Во всех остальных случаях Получатель применяет стратегию А2. Тогда вычисление величины среднего платежа дает результат
2y
+ 7y2 = 2 ⋅ 2/7 + 7 ⋅ 5/7 = 39/7 = ν< β.
1
Если Получатель применяет стратегию А3, то величина средне­го платежа составит
8y
+ 4y2 = 8 ⋅ 2/7 + 4 ⋅ 5/7 = 36/7 < v
1
(что подтверждает невыгодность этой стратегии для Получателя).
Ответ:
– оптимальная смешанная стратегия Получателя состоит в при­менении стратегии А1 с вероятностью x
= 0,71 и стратегии А2 с ве-
1
роятностью x2 = 0,29;
– оптимальная смешанная стратегия Плательщика состоит в при­менении стратегии В1 с вероятностью y1 = 0,29 и стратегии В2 с ве­роятностью y2 = 0,71;
– цена игры (средняя величина платежа, гарантированная ка­ждому игроку при применении оптимальных смешанных страте­гий) ν = 5,56.
3.5. Итеративный метод Брауна – Робинсон
Метод фиктивного разыгрывания Брауна-Робинсон позволяет по­лучить приближенную смешанную стратегию игроков на основе уче­та частоты выбора ими чистых стратегий во вспомогательной проце­дуре псевдорозыгрыша. Основная идея – выбор наиболее выгодных решений на основе информации, интегрально содержащей резуль­таты аналогичных предыдущих выборов.
62
Многократное взаимодействие игроков рассматривается как по­следовательность отдельных актов, называемых партиями. В каждой партии игроки применяют какую-нибудь одну из конечного мно­жества возможных стратегий, выбирая ее на основе обобщения всех данных о партиях, разыгранных до данной, и подбирая с учетом сво­их интересов. Поведение игроков корректируется на каждом следу­ющем шаге.
Предлагается следующий порядок действий:
1. Первая партия разыгрывается, исходя из равной вероятности применения противником любой из его стратегий. Каждый игрок подбирает такую свою чистую стратегию, чтобы получить наилуч­ший для себя результат (математическое ожидание) при равноверо­ятном выборе стратегий противника, и этот выбор используется для «затравки» псевдорозыгрыша.
2. По всем предыдущим партиям для обоих игроков рассчитыва­ется частотность применения их чистых стратегий.
3. Вычисленные частотности принимаются в качестве прибли­женной оценки вероятности применения этих стратегий (т. е. в ка­честве приближенного решения игры), затем опять производится выбор наиболее выгодных чистых стратегий противников при дан-
ном допущении.
4. Следующая партия разыгрывается в выбранных чистых стра­тегиях.
5. Осуществляется повтор всех действий, начиная с п. 2 (при уве­личенном количестве разыгранных партий).
Сходимость приближенных решений обеспечивается теоремой, доказательство которой основано на свойствах ограниченных фун­кций. При большом количестве «выгодных» решений влияние редких случайных «невыгодных» шагов на усредненные показатели убывает, и существует некоторая окрестность оптимального решения, которая совсем исключает возможность использования неактивной стратегии и невыгодных шагов. Таким образом, рассчитанная по предыдущим партиям частотность применения неактивных стратегий монотонно убывает, приближаясь к нулю. Этот заметный факт позволяет выдви­гать правдоподобные гипотезы о составе множества активных стра­тегий, используемых игроками, а верификацию таких гипотез удоб­но проводить аналитическими методами, рассмотренными выше.
Так как при достаточно большом количестве партий влияние от­дельного результата на усредненные частотности применения чистых стратегий слабеет, однотипные решения о выборе чистых стратегий
63
принимаются удлиняющимися сериями. Частотности применения активных стратегий варьируются около оптимальных значений, де­монстрируя в пределах серии то монотонное возрастание, то убыва­ние. Поэтому рекомендуется рассматривать результаты геометриче­ски возрастающих количеств шагов итерации 20, 40, 80, 160...
Достоинства метода Брауна – Робинсон – в его идеологической прозрачности, легкой алгоритмизируемости и возможности програм­мирования, в возможности достаточно быстро сделать существенные выводы о множестве активных стратегий игроков и перейти к анали­тическим методам работы.
64
4. КОМПЛЕКСНОЕ ПРИМЕНЕНИЕ ПРИЕМОВ ПРИ РЕШЕНИИ
max(min( )) max( ; )
ij
j
i
aα= = =02 2
ЗАДАЧ ТЕОРИИ МАТРИЧНЫХ ИГР С НУЛЕВОЙ СУММОЙ
Пример 12 (игра с седловой точкой). Для данной платежной ма­трицы:
– найти нижнюю и верхнюю цены игры;
– упростить данную платежную матрицу, исключив из нее доми­нируемые строки и столбцы, соответствующие заведомо невыгод­ным стратегиям игроков;
– выявить активные стратегии игроков графическим методом;
– найти решение игры: стратегии игроков и цену игры.
5 0 3 2
Решение
1. Введем обозначения стратегий первого игрока (Получателя)
и второго игрока (Плательщика)
В1 В2 А1 5 0 А2 3 2
2. В каждой строке выявим наименьшее значение и из этих ре-
зультатов – наибольшее
Нижняя цена игры
при использовании Получателем стратегии А2).
3. В каждом столбце выявим наибольшее значение, а из этих ре-
зультатов – наименьшее
В1 В2
А1 5 0 0 А2 3 2 2
min( )
j
a
ij
(реализуется
65
В1 В2
min(max( )) min( ; )
ij
j
i
aβ= = =52 2
А1 5 0 А2 3 2
a
max( )
i
ij
5 2
Верхняя цена игры
(реализуется
при использовании Плательщиком стратегии В2).
4. По результатам п. 2, 3 сделаем выводы: верхняя и нижняя цены игры совпадают, значит, игра имеет решение в чистых стратегиях (А2 и В2 для Получателя и Плательщика соответственно), цена игры ν = α = β = 21.
5. Для выявления доминируемых строк платежной матрицы про­ведем их поэлементное сравнение
В1 В2
А1 и А2 5 > 3 0 < 2
Вывод: знаки неравенств – разные, ни одной из строк исклю-
чить нельзя.
6. Для выявления доминируемых столбцов проведем их поэле­ментное сравнение
В1 и В2 А1 5 > 0 А2 3 > 2
Вывод: знаки неравенств – одинаковые, значит, стратегия В2 до­минирует стратегию В1 (стратегия В2, очевидно, более выгодна Пла­тельщику) и стратегия В1 может быть исключена из платежной ма­трицы
1
Это рассуждение является достаточным для получения ответа в случае, когда игра имеет седловую точку. Остальные пункты примера показывают, как более слож­ные приемы анализа игры приводят к тому же самому результату.
66
В2 А1 0 А2 2
7. Вернемся к рассмотрению стратегий получателя. Очевидно, что для полученной в п. 6 платежной матрицы стратегия А2 домини­рует стратегию А1, и последняя может быть исключена из платеж­ной матрицы
В2
А2 2
Дальнейшие упрощения невозможны.
8. По результатам п. 5–7 сделаем вывод: путем последовательного упрощения платежная матрица сведена к единственному элементу. Он определяет решение игры: Получателем и Плательщиком исполь­зуются стратегии А2 и В2, цена игры ν = a22 = 2. Этот вывод полно­стью согласуется с результатами, полученными в п. 4.
9. Проведем графическое сравнение стратегий Плательщика при разных смешанных стратегиях Получателя. Обозначим x2 – вероят­ность использования Получателем стратегии А2. Выполним графи­ческое построение
6
µ(x
)
2
5
4
3
2
1
0
0 1
B1
М(1; 2)B2
x
2
Здесь отрезок, соответствующий стратегии В1, соединяет вели­чины платежа a11 = 5 (при x2 = 0) и a21 = 3 (при x2 = 1). Отрезок, соот­ветствующий стратегии В2, соединяет величины платежа a12 = 0 (при
x2 = 0) и a22 = 2 (при x2 = 1).
Найдем такую точку М на нижней границе получившейся фи­гуры, которая наиболее удалена от оси абсцисс, и сделаем выводы:
67
– так как отрезки на графике не пересекаются, то очевидно, что стратегия В2 более выгодна Плательщику при любом выборе сме­шанной стратегии Получателем (этот вывод согласуется с результа­тами п. 6). Она является единственной активной стратегией Пла­тельщика;
– точка М имеет координаты x
= 1 и µ(x2) = a22 = 2 – это указы-
2
вает на использование Получателем только стратегии А2, при неак­тивной стратегии А1, и цене игры, совпадающей с одним из элемен­тов платежной матрицы.
10. Проведем графическое сравнение стратегий Получателя при разных смешанных стратегиях Плательщика. Обозначим y2 – веро­ятность использования Плательщиком стратегии В2. Выполним гра­фическое построение
6
5
3
4
2
1
0
µ(y
)
2
А1
А2
0
А2
А1
М (1; 2)
y
2
1
Здесь отрезок, соответствующий стратегии А1, соединяет вели­чины платежа a11 = 5 (при y2 = 0) и a12 = 0 (при y2 = 1). Отрезок, соот­ветствующий стратегии А2, соединяет величины платежа a21 = 3 (при
y2 = 0) и a22 = 2 (при y2 = 1).
Найдем точку М верхней границы получившейся фигуры, которая наиболее приближена к оси абсцисс, и сделаем выводы:
– так как отрезки, соответствующие стратегиям Получателя, пе­ресекаются, выбор заведомо выгодной (доминирующей) стратегии сделать нельзя;
68
– точка М находится не в точке пересечения отрезков, а связана
:
:
min
x x YY
B
x x YY
B
x x GY Y
+ ≥ν + ≥
 
+ ≥ν + ≥
⇒

+= =+→
12 12
12 12
12 12
53 531
1
02 021
2
1
только со стратегией Получателя А2, что указывает на использование Получателем только этой стратегии при неактивной стратегии А1;
– верхняя граница фигуры, образованной пересекающимися от­резками, имеет точку, наиболее приближенную к оси абсцисс, при
= 1 и µ(y2) = a22 = 2 – это указывает на использование Плательщи-
y
2
ком только стратегии В2, при неактивной стратегии В1 и цене игры, совпадающей с одним из элементов платежной матрицы.
11. Сформулируем задачу линейного программирования для По­лучателя (x1 и x2 – искомые вероятности использования стратегий А1 и А2, ν – искомая цена игры, Y1 = x1 / ν, Y2 = x2 / ν и G
= 1/ν– «вспо-
min
могательные» ЛП-величины)
Задачу ЛП можно решить графическим методом. Выполним по-
строения
0,6
Y
2
0,5
0,4
M(0; 1/2)
В2
0,3
0,2
0,1
0
В1
0 0,1
0,2
Найдем точку М, удовлетворяющую требованию минимизации
целевой функции, и решение ЛП-задачи
Y
= 0, Y2 = 1/2 и G
1
0,3 0,4 0,5
= Y1 + Y2 = 0 + 1/2 = 1/2.
min
Y
1
0,6 0,7
69
Решение исходной «игровой» задачи для Получателя находим,
используя связи между искомыми и вспомогательными величинами
ν = 1/G
= 2, x1 = νY1 = 0 и x2 = νX2 = 1.
min
Сделаем дополнительный вывод: линия, соответствующая страте­гии В1, целиком лежит под линией доминирующей стратегии В2, – это указывает на то, что актуальные ограничения возможных значе­ний целевой функции связаны только со стратегией В2, которая яв­ляется единственной активной стратегией Плательщика.
12. Решение задачи для Плательщика (y
и y2 – вероятности исполь-
1
зования стратегий В1 и В2) найдем, используя следствия из ЛП -те­орем двойственности и данных, полученных в предыдущем пункте.
Так как x2 > 0, для единственной активной стратегии А2 записы­ваем точное равенство 3y1 + 2y1 = ν = 2 и рассматриваем его совмес­тно с требованием y1 + y2 = 1. Эту систему решаем, получая резуль­тат y1 = 0 и y2 = 1.
Ответ:
– нижняя цена игры равна верхней цене игры (т. е. игра имеет «седловую точку»): ν = α = β = 2.
– исключение доминируемых рядов из платежной матрицы сво­дит ее к единственному элементу ν = a22 = 2.
– активные стратегии игроков – А2 для Получателя и В2 для Пла­тельщика.
– решение игры: x1 = 0 и y1 = 0 (стратегии А1 и В1 являются неак­тивными); x2 = 1 и y2 = 1 (стратегии А2 и В2 используются игроками, как для однократного взаимодействия, так и во всех случаях много­кратного взаимодействия); цена игры ν = 2.
Пример 13 (игра без седловой точки). Для данной платежной ма­трицы:
2 9 8 0
– найти нижнюю и верхнюю цены игры;
– упростить данную платежную матрицу, исключив из нее доми­нируемые строки и столбцы, соответствующие заведомо невыгод­ным стратегиям игроков;
– выявить активные стратегии игроков графическим методом;
– найти решение игры: стратегии игроков и цену игры.
70
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]