Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Теория игр. Учебное пособие

.pdf
Скачиваний:
0
Добавлен:
08.09.2026
Размер:
2 Мб
Скачать
☆
Аналогично проведем сравнение управлений в состоянии F32.
(3; 2)
(2; 1)
(1; 2)
(1; 2)
(1; 5)
(4; 3)
(3; 2)
(1; 1)
(2; 2)
(5; 4)
(3; 2)
(2; 3)
(2; 4)
(7; 8)
сравним U
(1)
как U
> U
32
(1)
= 2 + U42 = 2 + 2 = 4 и U
32
(2)
, то (с точки зрения первого игрока) делаем вывод о
32
(2)
= 1 + U43 = 1 + 2 = 3. Так
32
предпочтительности первого управления и принимаем значения по­тенциалов
= U
(1)
= 4; V32 = V
32
U
32
Для потенциалов состояния F
(1)
U
= 2 + U42 = 2 + 2 = 4; U
33
(1)
= 2+ V42 = 2 + 4 = 6.
32
получаем:
33
(2)
= 3 + U43 = 3 + 2 = 5; U
33
(1)
33
< U
(2)
.
33
Значит, второе управление предпочтительней и
= U
(2)
= 5; V33 = V
33
U
33
В последнем состоянии F
(2)
= 2+ V43 = 2 + 3 = 5.
33
фактический выбор у первого игрока
34
отсутствует, потенциалы этого состояния получаются суммировани­ем эффектов от единственного управления и потенциалов результи­рующего состояния S43.
U
= 3 + U43 = 3 + 2 = 5; V34 = 2+ V43 = 2 + 3 = 5.
34
Упростим граф, освободив его от неоптимальных управлений и их эффектов, вершин без входящих дуг и всех выходящих из таких вершин дуг и внесем найденные значения потенциалов состояний
F
F
1
S
21
S
22
31
F
32
(4; 6)
F
33
(5; 5)
F
34
(5; 5)
S
42
(2; 4)
S
43
(2; 3)
N
5
Шаг 3. На втором этапе выбор производит второй игрок и его ин­тересы определяют выбор управления. Суммируя эффекты управле­ний второго игрока с его потенциалами состояний третьего этапа,
21
определим оптимальные выборы второго игрока в обоих состояни-
(2; 1)
(1; 2)
(1; 5)
(4; 3)
(2; 2)
(3; 2)
(2; 3)
(2; 4)
(4; 6)
(9; 8)
(2; 3)
(2; 4)
ях и еще раз упростим граф.
Для анализа состояния S
(2)
V
= 5 + V32 = 5 + 6 = 11 и V
21
(1)
V
21
(3)
> V
, то, с точки зрения второго игрока, делаем вывод о предпоч-
21
сравним V
21
(3)
= 1 + V33 = 1 + 5 = 6. Так как V
21
(1)
= 2 + V31 = 2 + 8 =10;
21
(2)
>
21
тительности второго управления и принимаем значения потенциалов
= U
21
(2)
= 1 + U32 = 1 + 4 = 5; V21 = V
21
U
Аналогично проведем сравнение управлений в состоянии S сравним V
(1)
V
> V
22
22
(1)
= 3 + V33 = 3 + 5 = 8 и V
22
(2)
, то, с точки зрения второго игрока, делаем вывод о пред-
(2)
= 2+ V34 = 2 + 5 = 7. Так как
22
21
(2)
= 11.
22
почтительности первого управления и принимаем значения потен­циалов:
= U
(1)
= 4 + U33 = 4 + 5 = 9; V22 = V
22
U
22
(1)
= 8.
22
Снова внесем в граф найденные потенциалы состояний и упро­стим его, освободив от обнаруженных неоптимальных управлений и их эффектов, вершин без входящих дуг и всех выходящих из та­ких вершин дуг
F
1
S21
(5; 11)
S
22
F
32
F
33
(5; 5)
S
42
N
5
S
43
.
Шаг 4. Осталось изучить первоначальное решение первого игро­ка. У него две альтернативы. Первая приведет к его общему выигры­шу U
(1)
= 2 + U21 = 2 + 5 = 7, а вторая – к выигрышу U
1
(2)
= 1 + U22 =
2
= 1 + 9 = 10. Очевидно, что первым игроком будет выбрана вторая из альтернатив, т. е. управление, приводящее к состоянию S22 в начале игры (несмотря на то, что непосредственный эффект этого управле­ния меньше, чем у первой альтернативы). Выигрыш второго игрока
(2)
V
= 2 + V22 = 2 + 8 = 10.
1
22
Проведем безусловную оптимизацию и сформулируем ответ. По графу видно, что, вслед за первичным выбором первым игроком вто­рого управления на S
, последует лучший для второго игрока выбор
22
управления в F33, а затем – повторный выбор первого игрока на S43 и проследний ход – выбор вторым игроком второго управления из его двух альтернатив. Выигрыши игроков окажутся равны по 10 ед.
Заметим, что при возможности игроков вести переговоры и пе­рераспределять выигрыш с заключением обязывающих актов, эф­фекты от их управлений можно сложить и задача теории игр превра­щается в традиционную задачу динамического программирования.
2.3. Равноправные биматричные игры
В задачах этого типа требуется предсказать поведение игроков, если выигрыши сторон при взаимодействии соответствуют значе­ниям в двойной матрице, а перед принятием решения стороны смо­гут проводить равноправные переговоры. Частными случаями рав­ноправных биматричных игр являются антагонистические игры с нулевой суммой выигрышей, особо рассмотренные в разделе 2.4, и противоположные им игры с постоянной разностью выигрышей. По­следние имеют очень простое решение: сочетание стратегий, макси­мизирующее выигрыш одного игрока, наиболее выгодно и для вто­рого.
Основные приемы, используемые при анализе равноправных би­матричных игр: выявление заведомо невыгодных (доминируемых) стратегий и их исключение; поиск равновесных сочетаний стратегий игроков; определение максиминных стратегий игроков. При этом вы­явление отношений доминирования между стратегиями (см. Пример 4) – прием, не дающий гарантии получения итогового ответа, но позво­ляющий получить существенную информацию об игре «отрицательно­го» характера о заведомо неприемлемых для игроков стратегиях и, та­ким образом, перейти к более эквивалентной, но более простой задаче.
В примере 5а показано нахождение равновесных сочетаний стратегий игроков, которое можно применять без предварительно­го исключения из матрицы доминируемых стратегий, количество элементарных действий при этом только уменьшается. Речь идет о поиске и интерпретации «тупиковых» ситуаций, возникающих при примитивном эгоцентричном поведении, которые не стимулируют никого из игроков в одностороннем порядке применять другую
23
стратегию. Они называются равновесиями по Нэшу. Для поиска равно- весий по Нэшу в матрице выигрышей используется следующее прави­ло: ячейка таблицы соответствует равновесию по Нэшу, если выиг­рыш первого игрока в ней – максимальный по столбцу, а выигрыш второго игрока – максимальный по строке. Равновесие по Нэшу мо­жет указывать и выгодные, и взаимно невыгодные ситуации, которых следует избегать, используя взаимные договоренности между сторо­нами. Замечательно, что не все такие ситуации соответствуют макси­мальному индивидуальному или суммарному выигрышу, возможно­му в игре, как показано в замечаниях к примеру 4.
Однако, наличие даже одного равновесного сочетания чистых стратегий в произвольной двойной матрице не гарантировано. В этом случае рекомендуется использовать максиминный подход, продемон­стрированный в примере 5б.
Пример 4. (отношения доминирования в биматричной игре). Для данной двойной матрицы установить отношения доминирования между стратегиями (для обоих игроков) и упростить матрицу исклю­чением из нее доминируемых стратегий.
В1 В2 В3 А1 (8; 2) (4; 2) (7; 3) А2 (6; 6) (2; 5) (1; 0) А3 (3; 8) (6; 4) (7; 5)
Решение
Последовательно сравним строки двойной платежной матрицы
с учетом интересов первого игрока.
В1 В2 В3 А1 и А2 8 > 6 4 > 2 7 > 1 А1 и А3 8 > 3 4 < 6 7 = 7 А2 и А3 6 > 3 2 < 6 1 < 7
Заметим, что при первом сравнении знаки неравенств одинако­вые, что говорит об отношении доминирования стратегии перво­го игрока А2 его стратегией А1: при любом выборе стратегии вто­рым игроком стратегия А1 дает первому игроку больший выигрыш, а доминируемую стратегию А2 можно исключить из рассмотрения. С учетом этого факта, последнее сравнение можно было не прово­дить. Упростим платежную матрицу.
24
В1 В2 В3 А1 (8; 2) (4; 2) (7; 3) А3 (3; 8) (6; 4) (7; 5)
Последовательно сравним столбцы получившейся двойной пла-
тежной матрицы с учетом интересов второго игрока.
В1 и В2 В1 и В3 В2 и В3
2 = 2 2 < 3 2 < 3 8 > 4 8 > 5 4 < 5
Заметим, что при первом сравнении знаки неравенств одинако­вые (равенство трактуется в пользу любого неравенства), что говорит об отношении нестрогого доминирования стратегии второго игрока В2 его стратегией В1: при любом выборе стратегии первым игроком стратегия В1 дает второму игроку больший выигрыш, а доминируе­мую стратегию В2 можно исключить из рассмотрения. С учетом это­го факта последнее сравнение (оно устанавливает доминирование В2 стратегией В3, что не противоречит выводу об исключении В2) мож­но было не проводить. Еще раз упростим платежную матрицу.
В1 В3 А1 (8; 2) (7; 3) А3 (3; 8) (7; 5)
С учетом сделанных упрощений вернемся к сравнению страте-
гий первого игрока.
В1 В3
А1 и А3 8 > 3 7 = 7
Очевидно, что стратегия А1 предпочтительней (на это указыва­ют одинаковые знаки неравенств): она предполагает выигрыш пер­вого игрока не хуже, а иногда и лучше при любом разумном реше­нии второго игрока. Платежную матрицу можно еще раз упростить
В1 В3
А1 (8; 2) (7; 3)
По оставшейся матрице решение второго игрока – стратегия В3. Таким образом, решение игры найдено, оптимальные стратегиями игроков – А1 и В3.
25
Замечания
1. Найденное решение игры соответствует единственному равно-
весию по Нэшу (см. далее) в этой матрице.
2. В платежной матрице есть сочетания стратегий с большей сум­мой выигрышей сторон, чем найденное: А2 и В1, А3 и В1, А3 и В3. Однако предметом переговоров между игроками эти способы реше­ния не будут по причине невозможности гарантировать выполнение таких договоренностей при данной постановке задачи:
– предположим, что игроки, по результатам проведенных перего­воров, приняли необоснованное обязывающими актами (иначе надо вносить изменения в платежную матрицу) решение выбрать страте­гии А2 или А3 с одной стороны и В1 – с другой. Фактически при вза­имодействии первый игрок применит стратегию А1, увеличивающую его выигрыш в ущерб второму;
– предположим, что игроки, по результатам проведенных пере­говоров приняли необоснованное обязывающими актами решение выбрать стратегии А3 и В3. Фактически при взаимодействии вто­рой игрок применит стратегию В1, увеличивающую его выигрыш в ущерб первому.
Пример 5а (равновесия по Нэшу в биматричной игре). Дана пла­тежная матрица равноправной биматричной игры. Требуется пред­сказать выбор стратегий игроками.
В1 В2 В3 А1 (1; 4) (6; 5) (5; 8) А2 (0; 2) (9; 7) (1; 5) А3 (4; 3) (3; 4) (2; 2)
Решение
Выделим в каждом столбце наибольший выигрыш первого игро­ка, а в каждой строке – наибольший выбор второго игрока и обратим внимание на сочетания стратегий игроков, где реализуются «двой­ные предпочтения», т. е. ни одному игроку не выгодно в односторон­нем порядке отклоняться от этого сочетания, так как это приведет к уменьшению возможного выигрыша.
В1 В2 В3 В1 В2 В3
(9; 7)
(5; 8)
(1; 5)
А1 (1; 4) (6; 5) (5; 8) А1 (1; 4) (6; 5) А2 (0; 2) (9; 7) (1; 5) → А2 (0; 2) А3 (4; 3) (3; 4) (2; 2) А3 (4; 3) (3; 4) (2; 2)
26
Выделенные ячейки в приведенной выше справа матрице выигры­шей – равновесия по Нэшу, остальные ячейки соответствуют неустой­чивым сочетаниям стратегий, они могут быть исключены из анализа так как, очевидно, не будут предметом переговоров между игроками.
Итак, ограничимся только рассмотрением найденных равновесий по Нэшу и сделаем достаточно очевидные выводы о поведении игро­ков. Если сторонам удается достичь соглашения, они могут совместны­ми действиями максимизировать суммарный выигрыш, который до­стигнет 16 у. е. при сочетании стратегий А2 и В2. Этому соглашению (после того, как оно достигнуто в переговорах) можно доверять, так как любая односторонняя попытка отклониться от него приведет к умень­шению выигрыша инициатора нарушения. Однако второй игрок мо­жет поставить вопрос о компенсации его потерь (в форме уменьшения индивидуального выигрыша) при выборе этого решения в размере до 1 у. е., указанное решение все равно остается выгодно первому игроку.
Замечание
В следующем примере для сравнения проведен максиминный анализ, соответствующий независимому принятию решений игро­ками (он рекомендуется и для ситуаций, когда равновесие по Нэшу в двойной платежной матрице отсутствует).
Пример 5б (максиминный подход в биматричной игре). Для пла­тежной матрицы из предыдущей задачи, считая переговоры меж­ду сторонами невозможными, найти стратегии, обеспечивающие лучшие гарантированные выигрыши сторон, и сравнить результаты с полученными в примере 5а.
В1 В2 В3 А1 (1; 4) (6; 5) (5; 8) А2 (0; 2) (9; 7) (1; 5) А3 (4; 3) (3; 4) (2; 2)
Решение
Дополним платежную матрицу столбцом, в котором отразим наи­меньший выигрыш первого игрока по каждой строке, и строкой, в кото­рой отразим наименьший выигрыш второго игрока по каждому столбцу.
В1 В2 В3 А1 (1; 4) (6; 5) (5; 6) А2 (0; 2) (9; 7) (1; 5) 0 А3 (4; 3)
(3; 4)
2
(2; 2)
4
1
2
2
27
Несклонный к риску и переговорам первый игрок выберет стра­тегию А3, где реализуется максимальный из его минимальных выиг­рышей, равный двум (или больше). Аналогично второй игрок выбе­рет стратегию В2, где ожидается гарантированный результат, равный четырем (или больше). Все использованные в расчетах значения вы­делены в таблице. С учетом этих рассуждений выигрыш первого иг­рока при сочетании стратегий А3 и В2 достигнет трех, что не проти­воречит его интересам.
Вывод
Исходя из установки игроков на сохранение независимости, мож­но предсказать использование ими сочетания стратегий А3 и В2, ко­торое приводит к суммарному выигрышу, равному семи у. е. Это значительно менее привлекательно по сравнению с потенциальным результатом переговоров (см. пример 5а), по результатам которых суммарный выигрыш может достичь шестнадцати у. е. с сохране­нием приверженности игроков к такому решению. Более того, даже при отсутствии декларации второго игрока о его намерении исполь­зовать стратегию В2, первый игрок имеет стимул применить стра­тегию А2 вместо А3, ведь при этом выигрыши обоих игроков толь­ко увеличатся.
2.4. Антагонистические матричные игры
с нулевой суммой выигрышей
Как следует из заголовка, особенностью таких задач является ну­левая сумма выигрышей игроков в каждом сочетании их чистых стра­тегий. Для компактности записи в платежной матрице указываются выигрыши только первого игрока, далее называемого Получателем, а с точки зрения второго игрока, называемого Плательщиком, те же самые значения являются выплатами. И выигрыши первого игрока, и, соответственно, выплаты второго игрока могут принимать отрица­тельное значение, что не сказывается на технике используемых при­емов и интерпретации результатов: Получатель мотивирован прини­мать решения, увеличивающие величину, определяемую сочетанием стратегий сторон, а Плательщик – уменьшать эту величину. Любые договоренности между сторонами игры могут быть нарушены сторо­нами при появлении экономических стимулов, вот почему рассма­триваются только решения, «защищенные» от попыток противопо­ложной стороны изменить результаты розыгрышей в свою пользу.
28
Задачи такого типа можно рассматривать как частный случай рав­ноправных биматричных игр (см. раздел 2.2), в котором особенно­сти используемых обозначений обуславливают особое использова­ние рассмотренных ранее приемов. Наиболее продуктивными при наименьших вычислительных действиях оказываются приемы выяв­ления наилучших гарантированных результатов (с помощью нижней и верхней цены игры, определяемых с помощью максиминного под­хода). Менее продуктивно используется поиск отношений домини- рования между стратегиями. А результат поиска равновесных соче­таний стратегий (равновесий по Нэшу) одновременно с данными об их количестве может быть предсказан по результатам сравнения вер­хней и нижней цены игры, т. е. получен с меньшим количеством вы­числений, чем предусмотрено обычной процедурой поиска таких со­четаний.
В данном разделе, кроме технических приемов выявления нижней и верхней цен игры, рассмотрены только способы интерпретации этих результатов. Особенности выявления отношений доминирова­ния между стратегиями и исключения заведомо невыгодных для иг­роков стратегий в играх с нулевой суммой выигрышей рассматрива­ются в главе 3, посвященной возможности решения задачи о поиске смешанных стратегий игроков для улучшения результатов игры, до­стигаемых в оптимальных чистых стратегиях (когда возможно). Так сделано из-за их более частого совместного применения названных приемов, поиск отношений доминирования между стратегиями об­ычно предшествует ещё более громоздким приемам, тогда как опти­мальные чистые стратегии игроков могут быть найдены относитель­но простым выявлением и сравнением нижней и верхней цен игры.
Выявление стратегий, соответствующих нижней и верхней
ценам игры
Получатель (т. е. первый игрок, выбирающий строку в платежной матрице), не склонный к риску, выделяет в каждой строке платеж­ной матрицы наименьшее значение. Из всех наименьших значений выбирается наибольшее (оно называется нижней ценой игры и обо­значается α, максимином).
Плательщик (т. е. второй игрок, выбирающий столбец), не склонный к риску, выделяет в каждом столбце платежной матри­цы наибольшее значение. Из всех наибольших значений выбирает­ся наименьшее (оно называется верхней ценой игры и обозначается β, минимаксом).
29
Так как даже наибольшее из наименьших значений не может
max(min( )) max( ; ; ; ; ) .
ij
j
i
aα= = − − − =2 4 3 13 3
превзойти наименьшего из наибольших значений (независимо от того, по строкам или по столбцам происходил отбор), то для верхней и нижней цен игры справедливо соотношение: α ≤ β.
Пример 6а (нижняя цена игры). Количество возможных стратегий Получателя – 5, Плательщика – 4. Величины платежа образуют та­блицу. Требуется найти наиболее выгодную стратегию Получателя.
В1 В2 В3 В4 А1 2 3 5 9 А2 -2 -4 -2 7 А3 7 5 0 -3 А4 -1 6 1 2 А5 6 9 6 3
Решение
1. В каждой строке найдем минимальное значение
min( )
a
В1 В2 В3 В4
А1 2 3 5 9 2 α А2 -2 -4 -2 7 -4 α А3 7 5 0 -3 -3 α А4 -1 6 1 2 -1 α
6 9 6 3 3
А5
ij
j
Расшифровка
min(2; 3; 5; 9) = 2;
1 =
min(-2; -4; -2; 7) = -4;
2 =
min(7; 5; 0; -3) = -3;
3 =
min(-1; 6; 1; 2) = -1;
4 =
min(6; 9; 6; 3) = 3.
α
5 =
2. Вычислим максимин
Найденное значение реализуется при выборе последней (пятой)
стратегии А5 Получателя (она выделена в таблице).
Ответ: наиболее выгодной для Получателя (при однократной игре) является стратегия А5, так как при любом выборе Плательщиком его стратегии величина платежа составит α = 3 или больше.
Пример 6б (верхняя цена игры). В задаче с предыдущими услови­ями требуется найти наиболее выгодную стратегию Плательщика.
В1 В2 В3 В4 А1 2 3 5 9 А2 -2 -4 -2 7 А3 7 5 0 -3 А4 -1 6 1 2 А5 6 9 6 3
30
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]