Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Теория игр. Учебное пособие
.pdf
Аналогично проведем сравнение управлений в состоянии F32.
(3; 2)
(2; 1)
(1; 2)
(1; 2)
(1; 5)
(4; 3)
(3; 2)
(1; 1)
(2; 2)
(5; 4)
(3; 2)
(2; 3)
(2; 4)
(7; 8)
сравним U
(1)
как U
> U
32
(1)
= 2 + U42 = 2 + 2 = 4 и U
32
(2)
, то (с точки зрения первого игрока) делаем вывод о
32
(2)
= 1 + U43 = 1 + 2 = 3. Так
32
предпочтительности первого управления и принимаем значения потенциалов
= U
(1)
= 4; V32 = V
32
U
32
Для потенциалов состояния F
(1)
U
= 2 + U42 = 2 + 2 = 4; U
33
(1)
= 2+ V42 = 2 + 4 = 6.
32
получаем:
33
(2)
= 3 + U43 = 3 + 2 = 5; U
33
(1)
33
< U
(2)
.
33
Значит, второе управление предпочтительней и
= U
(2)
= 5; V33 = V
33
U
33
В последнем состоянии F
(2)
= 2+ V43 = 2 + 3 = 5.
33
фактический выбор у первого игрока
34
отсутствует, потенциалы этого состояния получаются суммированием эффектов от единственного управления и потенциалов результирующего состояния S43.
U
= 3 + U43 = 3 + 2 = 5; V34 = 2+ V43 = 2 + 3 = 5.
34
Упростим граф, освободив его от неоптимальных управлений
и их эффектов, вершин без входящих дуг и всех выходящих из таких
вершин дуг и внесем найденные значения потенциалов состояний
F
F
1
S
21
S
22
31
F
32
(4; 6)
F
33
(5; 5)
F
34
(5; 5)
S
42
(2; 4)
S
43
(2; 3)
N
5
Шаг 3. На втором этапе выбор производит второй игрок и его интересы определяют выбор управления. Суммируя эффекты управлений второго игрока с его потенциалами состояний третьего этапа,
21

определим оптимальные выборы второго игрока в обоих состояни-
(2; 1)
(1; 2)
(1; 5)
(4; 3)
(2; 2)
(3; 2)
(2; 3)
(2; 4)
(4; 6)
(9; 8)
(2; 3)
(2; 4)
ях и еще раз упростим граф.
Для анализа состояния S
(2)
V
= 5 + V32 = 5 + 6 = 11 и V
21
(1)
V
21
(3)
> V
, то, с точки зрения второго игрока, делаем вывод о предпоч-
21
сравним V
21
(3)
= 1 + V33 = 1 + 5 = 6. Так как V
21
(1)
= 2 + V31 = 2 + 8 =10;
21
(2)
>
21
тительности второго управления и принимаем значения потенциалов
= U
21
(2)
= 1 + U32 = 1 + 4 = 5; V21 = V
21
U
Аналогично проведем сравнение управлений в состоянии S
сравним V
(1)
V
> V
22
22
(1)
= 3 + V33 = 3 + 5 = 8 и V
22
(2)
, то, с точки зрения второго игрока, делаем вывод о пред-
(2)
= 2+ V34 = 2 + 5 = 7. Так как
22
21
(2)
= 11.
22
почтительности первого управления и принимаем значения потенциалов:
= U
(1)
= 4 + U33 = 4 + 5 = 9; V22 = V
22
U
22
(1)
= 8.
22
Снова внесем в граф найденные потенциалы состояний и упростим его, освободив от обнаруженных неоптимальных управлений
и их эффектов, вершин без входящих дуг и всех выходящих из таких вершин дуг
F
1
S21
(5; 11)
S
22
F
32
F
33
(5; 5)
S
42
N
5
S
43
.
Шаг 4. Осталось изучить первоначальное решение первого игрока. У него две альтернативы. Первая приведет к его общему выигрышу U
(1)
= 2 + U21 = 2 + 5 = 7, а вторая – к выигрышу U
1
(2)
= 1 + U22 =
2
= 1 + 9 = 10. Очевидно, что первым игроком будет выбрана вторая из
альтернатив, т. е. управление, приводящее к состоянию S22 в начале
игры (несмотря на то, что непосредственный эффект этого управления меньше, чем у первой альтернативы). Выигрыш второго игрока
(2)
V
= 2 + V22 = 2 + 8 = 10.
1
22

Проведем безусловную оптимизацию и сформулируем ответ. По
графу видно, что, вслед за первичным выбором первым игроком второго управления на S
, последует лучший для второго игрока выбор
22
управления в F33, а затем – повторный выбор первого игрока на S43
и проследний ход – выбор вторым игроком второго управления из
его двух альтернатив. Выигрыши игроков окажутся равны по 10 ед.
Заметим, что при возможности игроков вести переговоры и перераспределять выигрыш с заключением обязывающих актов, эффекты от их управлений можно сложить и задача теории игр превращается в традиционную задачу динамического программирования.
2.3. Равноправные биматричные игры
В задачах этого типа требуется предсказать поведение игроков,
если выигрыши сторон при взаимодействии соответствуют значениям в двойной матрице, а перед принятием решения стороны смогут проводить равноправные переговоры. Частными случаями равноправных биматричных игр являются антагонистические игры
с нулевой суммой выигрышей, особо рассмотренные в разделе 2.4,
и противоположные им игры с постоянной разностью выигрышей. Последние имеют очень простое решение: сочетание стратегий, максимизирующее выигрыш одного игрока, наиболее выгодно и для второго.
Основные приемы, используемые при анализе равноправных биматричных игр: выявление заведомо невыгодных (доминируемых)
стратегий и их исключение; поиск равновесных сочетаний стратегий
игроков; определение максиминных стратегий игроков. При этом выявление отношений доминирования между стратегиями (см. Пример 4)
– прием, не дающий гарантии получения итогового ответа, но позволяющий получить существенную информацию об игре «отрицательного» характера о заведомо неприемлемых для игроков стратегиях и, таким образом, перейти к более эквивалентной, но более простой задаче.
В примере 5а показано нахождение равновесных сочетаний
стратегий игроков, которое можно применять без предварительного исключения из матрицы доминируемых стратегий, количество
элементарных действий при этом только уменьшается. Речь идет
о поиске и интерпретации «тупиковых» ситуаций, возникающих при
примитивном эгоцентричном поведении, которые не стимулируют
никого из игроков в одностороннем порядке применять другую
23

стратегию. Они называются равновесиями по Нэшу. Для поиска равно-
весий по Нэшу в матрице выигрышей используется следующее правило: ячейка таблицы соответствует равновесию по Нэшу, если выигрыш первого игрока в ней – максимальный по столбцу, а выигрыш
второго игрока – максимальный по строке. Равновесие по Нэшу может указывать и выгодные, и взаимно невыгодные ситуации, которых
следует избегать, используя взаимные договоренности между сторонами. Замечательно, что не все такие ситуации соответствуют максимальному индивидуальному или суммарному выигрышу, возможному в игре, как показано в замечаниях к примеру 4.
Однако, наличие даже одного равновесного сочетания чистых
стратегий в произвольной двойной матрице не гарантировано. В этом
случае рекомендуется использовать максиминный подход, продемонстрированный в примере 5б.
Пример 4. (отношения доминирования в биматричной игре). Для
данной двойной матрицы установить отношения доминирования
между стратегиями (для обоих игроков) и упростить матрицу исключением из нее доминируемых стратегий.
В1 В2 В3
А1 (8; 2) (4; 2) (7; 3)
А2 (6; 6) (2; 5) (1; 0)
А3 (3; 8) (6; 4) (7; 5)
Решение
Последовательно сравним строки двойной платежной матрицы
с учетом интересов первого игрока.
В1 В2 В3
А1 и А2 8 > 6 4 > 2 7 > 1
А1 и А3 8 > 3 4 < 6 7 = 7
А2 и А3 6 > 3 2 < 6 1 < 7
Заметим, что при первом сравнении знаки неравенств одинаковые, что говорит об отношении доминирования стратегии первого игрока А2 его стратегией А1: при любом выборе стратегии вторым игроком стратегия А1 дает первому игроку больший выигрыш,
а доминируемую стратегию А2 можно исключить из рассмотрения.
С учетом этого факта, последнее сравнение можно было не проводить. Упростим платежную матрицу.
24

В1 В2 В3
А1 (8; 2) (4; 2) (7; 3)
А3 (3; 8) (6; 4) (7; 5)
Последовательно сравним столбцы получившейся двойной пла-
тежной матрицы с учетом интересов второго игрока.
В1 и В2 В1 и В3 В2 и В3
2 = 2 2 < 3 2 < 3
8 > 4 8 > 5 4 < 5
Заметим, что при первом сравнении знаки неравенств одинаковые (равенство трактуется в пользу любого неравенства), что говорит
об отношении нестрогого доминирования стратегии второго игрока
В2 его стратегией В1: при любом выборе стратегии первым игроком
стратегия В1 дает второму игроку больший выигрыш, а доминируемую стратегию В2 можно исключить из рассмотрения. С учетом этого факта последнее сравнение (оно устанавливает доминирование В2
стратегией В3, что не противоречит выводу об исключении В2) можно было не проводить. Еще раз упростим платежную матрицу.
В1 В3
А1 (8; 2) (7; 3)
А3 (3; 8) (7; 5)
С учетом сделанных упрощений вернемся к сравнению страте-
гий первого игрока.
В1 В3
А1 и А3 8 > 3 7 = 7
Очевидно, что стратегия А1 предпочтительней (на это указывают одинаковые знаки неравенств): она предполагает выигрыш первого игрока не хуже, а иногда и лучше при любом разумном решении второго игрока. Платежную матрицу можно еще раз упростить
В1 В3
А1 (8; 2) (7; 3)
По оставшейся матрице решение второго игрока – стратегия В3.
Таким образом, решение игры найдено, оптимальные стратегиями
игроков – А1 и В3.
25

Замечания
1. Найденное решение игры соответствует единственному равно-
весию по Нэшу (см. далее) в этой матрице.
2. В платежной матрице есть сочетания стратегий с большей суммой выигрышей сторон, чем найденное: А2 и В1, А3 и В1, А3 и В3.
Однако предметом переговоров между игроками эти способы решения не будут по причине невозможности гарантировать выполнение
таких договоренностей при данной постановке задачи:
– предположим, что игроки, по результатам проведенных переговоров, приняли необоснованное обязывающими актами (иначе надо
вносить изменения в платежную матрицу) решение выбрать стратегии А2 или А3 с одной стороны и В1 – с другой. Фактически при взаимодействии первый игрок применит стратегию А1, увеличивающую
его выигрыш в ущерб второму;
– предположим, что игроки, по результатам проведенных переговоров приняли необоснованное обязывающими актами решение
выбрать стратегии А3 и В3. Фактически при взаимодействии второй игрок применит стратегию В1, увеличивающую его выигрыш
в ущерб первому.
Пример 5а (равновесия по Нэшу в биматричной игре). Дана платежная матрица равноправной биматричной игры. Требуется предсказать выбор стратегий игроками.
В1 В2 В3
А1 (1; 4) (6; 5) (5; 8)
А2 (0; 2) (9; 7) (1; 5)
А3 (4; 3) (3; 4) (2; 2)
Решение
Выделим в каждом столбце наибольший выигрыш первого игрока, а в каждой строке – наибольший выбор второго игрока и обратим
внимание на сочетания стратегий игроков, где реализуются «двойные предпочтения», т. е. ни одному игроку не выгодно в одностороннем порядке отклоняться от этого сочетания, так как это приведет
к уменьшению возможного выигрыша.
В1 В2 В3 В1 В2 В3
(9; 7)
(5; 8)
(1; 5)
А1 (1; 4) (6; 5) (5; 8) А1 (1; 4) (6; 5)
А2 (0; 2) (9; 7) (1; 5) → А2 (0; 2)
А3 (4; 3) (3; 4) (2; 2) А3 (4; 3) (3; 4) (2; 2)
26

Выделенные ячейки в приведенной выше справа матрице выигрышей – равновесия по Нэшу, остальные ячейки соответствуют неустойчивым сочетаниям стратегий, они могут быть исключены из анализа
так как, очевидно, не будут предметом переговоров между игроками.
Итак, ограничимся только рассмотрением найденных равновесий
по Нэшу и сделаем достаточно очевидные выводы о поведении игроков. Если сторонам удается достичь соглашения, они могут совместными действиями максимизировать суммарный выигрыш, который достигнет 16 у. е. при сочетании стратегий А2 и В2. Этому соглашению
(после того, как оно достигнуто в переговорах) можно доверять, так как
любая односторонняя попытка отклониться от него приведет к уменьшению выигрыша инициатора нарушения. Однако второй игрок может поставить вопрос о компенсации его потерь (в форме уменьшения
индивидуального выигрыша) при выборе этого решения в размере до
1 у. е., указанное решение все равно остается выгодно первому игроку.
Замечание
В следующем примере для сравнения проведен максиминный
анализ, соответствующий независимому принятию решений игроками (он рекомендуется и для ситуаций, когда равновесие по Нэшу
в двойной платежной матрице отсутствует).
Пример 5б (максиминный подход в биматричной игре). Для платежной матрицы из предыдущей задачи, считая переговоры между сторонами невозможными, найти стратегии, обеспечивающие
лучшие гарантированные выигрыши сторон, и сравнить результаты
с полученными в примере 5а.
В1 В2 В3
А1 (1; 4) (6; 5) (5; 8)
А2 (0; 2) (9; 7) (1; 5)
А3 (4; 3) (3; 4) (2; 2)
Решение
Дополним платежную матрицу столбцом, в котором отразим наименьший выигрыш первого игрока по каждой строке, и строкой, в которой отразим наименьший выигрыш второго игрока по каждому столбцу.
В1 В2 В3
А1 (1; 4) (6; 5) (5; 6)
А2 (0; 2) (9; 7) (1; 5) 0
А3 (4; 3)
(3; 4)
2
(2; 2)
4
1
2
2
27

Несклонный к риску и переговорам первый игрок выберет стратегию А3, где реализуется максимальный из его минимальных выигрышей, равный двум (или больше). Аналогично второй игрок выберет стратегию В2, где ожидается гарантированный результат, равный
четырем (или больше). Все использованные в расчетах значения выделены в таблице. С учетом этих рассуждений выигрыш первого игрока при сочетании стратегий А3 и В2 достигнет трех, что не противоречит его интересам.
Вывод
Исходя из установки игроков на сохранение независимости, можно предсказать использование ими сочетания стратегий А3 и В2, которое приводит к суммарному выигрышу, равному семи у. е. Это
значительно менее привлекательно по сравнению с потенциальным
результатом переговоров (см. пример 5а), по результатам которых
суммарный выигрыш может достичь шестнадцати у. е. с сохранением приверженности игроков к такому решению. Более того, даже
при отсутствии декларации второго игрока о его намерении использовать стратегию В2, первый игрок имеет стимул применить стратегию А2 вместо А3, ведь при этом выигрыши обоих игроков только увеличатся.
2.4. Антагонистические матричные игры
с нулевой суммой выигрышей
Как следует из заголовка, особенностью таких задач является нулевая сумма выигрышей игроков в каждом сочетании их чистых стратегий. Для компактности записи в платежной матрице указываются
выигрыши только первого игрока, далее называемого Получателем,
а с точки зрения второго игрока, называемого Плательщиком, те же
самые значения являются выплатами. И выигрыши первого игрока,
и, соответственно, выплаты второго игрока могут принимать отрицательное значение, что не сказывается на технике используемых приемов и интерпретации результатов: Получатель мотивирован принимать решения, увеличивающие величину, определяемую сочетанием
стратегий сторон, а Плательщик – уменьшать эту величину. Любые
договоренности между сторонами игры могут быть нарушены сторонами при появлении экономических стимулов, вот почему рассматриваются только решения, «защищенные» от попыток противоположной стороны изменить результаты розыгрышей в свою пользу.
28

Задачи такого типа можно рассматривать как частный случай равноправных биматричных игр (см. раздел 2.2), в котором особенности используемых обозначений обуславливают особое использование рассмотренных ранее приемов. Наиболее продуктивными при
наименьших вычислительных действиях оказываются приемы выявления наилучших гарантированных результатов (с помощью нижней
и верхней цены игры, определяемых с помощью максиминного подхода). Менее продуктивно используется поиск отношений домини-
рования между стратегиями. А результат поиска равновесных сочетаний стратегий (равновесий по Нэшу) одновременно с данными об
их количестве может быть предсказан по результатам сравнения верхней и нижней цены игры, т. е. получен с меньшим количеством вычислений, чем предусмотрено обычной процедурой поиска таких сочетаний.
В данном разделе, кроме технических приемов выявления нижней
и верхней цен игры, рассмотрены только способы интерпретации
этих результатов. Особенности выявления отношений доминирования между стратегиями и исключения заведомо невыгодных для игроков стратегий в играх с нулевой суммой выигрышей рассматриваются в главе 3, посвященной возможности решения задачи о поиске
смешанных стратегий игроков для улучшения результатов игры, достигаемых в оптимальных чистых стратегиях (когда возможно). Так
сделано из-за их более частого совместного применения названных
приемов, поиск отношений доминирования между стратегиями обычно предшествует ещё более громоздким приемам, тогда как оптимальные чистые стратегии игроков могут быть найдены относительно простым выявлением и сравнением нижней и верхней цен игры.
Выявление стратегий, соответствующих нижней и верхней
ценам игры
Получатель (т. е. первый игрок, выбирающий строку в платежной
матрице), не склонный к риску, выделяет в каждой строке платежной матрицы наименьшее значение. Из всех наименьших значений
выбирается наибольшее (оно называется нижней ценой игры и обозначается α, максимином).
Плательщик (т. е. второй игрок, выбирающий столбец), не
склонный к риску, выделяет в каждом столбце платежной матрицы наибольшее значение. Из всех наибольших значений выбирается наименьшее (оно называется верхней ценой игры и обозначается β,
минимаксом).
29

Так как даже наибольшее из наименьших значений не может
max(min( )) max( ; ; ; ; ) .
ij
j
i
aα= = − − − =2 4 3 13 3
превзойти наименьшего из наибольших значений (независимо от
того, по строкам или по столбцам происходил отбор), то для верхней
и нижней цен игры справедливо соотношение: α ≤ β.
Пример 6а (нижняя цена игры). Количество возможных стратегий
Получателя – 5, Плательщика – 4. Величины платежа образуют таблицу. Требуется найти наиболее выгодную стратегию Получателя.
В1 В2 В3 В4
А1 2 3 5 9
А2 -2 -4 -2 7
А3 7 5 0 -3
А4 -1 6 1 2
А5 6 9 6 3
Решение
1. В каждой строке найдем минимальное значение
min( )
a
В1 В2 В3 В4
А1 2 3 5 9 2 α
А2 -2 -4 -2 7 -4 α
А3 7 5 0 -3 -3 α
А4 -1 6 1 2 -1 α
6 9 6 3 3
А5
ij
j
Расшифровка
min(2; 3; 5; 9) = 2;
1 =
min(-2; -4; -2; 7) = -4;
2 =
min(7; 5; 0; -3) = -3;
3 =
min(-1; 6; 1; 2) = -1;
4 =
min(6; 9; 6; 3) = 3.
α
5 =
2. Вычислим максимин
Найденное значение реализуется при выборе последней (пятой)
стратегии А5 Получателя (она выделена в таблице).
Ответ: наиболее выгодной для Получателя (при однократной игре)
является стратегия А5, так как при любом выборе Плательщиком его
стратегии величина платежа составит α = 3 или больше.
Пример 6б (верхняя цена игры). В задаче с предыдущими условиями требуется найти наиболее выгодную стратегию Плательщика.
В1 В2 В3 В4
А1 2 3 5 9
А2 -2 -4 -2 7
А3 7 5 0 -3
А4 -1 6 1 2
А5 6 9 6 3
30
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
