Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Теория игр. Учебное пособие
.pdf
2. ПРИЕМЫ ВЫЯВЛЕНИЯ ОПТИМАЛЬНЫХ ЧИСТЫХ СТРАТЕГИЙ
ИГРОКОВ
2.1. Игры с природой
Раздел посвящен ситуации, когда один из игроков (он ассоциируется со вторым игроком теории матричных антагонистических игр
с нулевой суммой, изложенной далее, Плательщиком) принимает решения о выборе стратегии не рационально, стремясь оптимизировать
величину платежа, а каким-либо другим способом. Такое поведение
можно назвать не экономическим, а стихийным. Соответственно
для рационального выбора оптимальной стратегии первого игрока
используются специальные приемы, учитывающие такое «поведение» второго, и некоторые дополнительные факторы, влияющие на
принятие решений. В частности, возможность тяжких, катастрофических последствий при ошибке и прогностические оценки вероятностей реализации стратегий второго игрока, если такие доступны.
Суть приемов раскрыта ниже, в приводимом примере.
Возможные результаты взаимодействия сводятся в «платежную
матрицу». Она содержит величины выгоды, получаемой активным
и рациональным (первым) игроком при разных вариантах реализации взаимодополняющих и взаимоисключающих гипотез о «поведении» второго игрока (что моделируется как «выбор» столбца), и одной
из стратегий, доступных первому игроку. Наличие в матрице отрицательных значений отражает возможность убытков. Могут быть известны также вероятности реализации гипотез о «поведении природы».
Активный игрок принимает решение о выборе строки до того,
как получена информация о выборе столбца. Принятое решение не
влияет на «поведение природы», кооперация и изменение решения
«в процессе взаимодействия» невозможны.
Пример 1 (игра с природой). Для данной платежной матрицы:
– упростить данную платежную матрицу, исключив из нее доминируемые строки, соответствующие заведомо невыгодным стратегиям активного игрока;
– восстановить пропущенную вероятность одной из гипотез
о «поведении природы» и выявить оптимальную стратегию активного игрока по математическому ожиданию прибыли;
11

– выявить оптимальные стратегии активного игрока, применяя
оптимистический и пессимистический (Вальде) критерии, критерии
Гурвица (при γ = 0,3), Сэвиджа.
24 % 11 % 38 % ?
6 3 -4 6
-4 -5 2 -5
5 8 1 0
3 0 1 -5
7 -3 3 4
Решение
1. Первый игрок имеет пять стратегий, а второй, «природа», характеризуется четырьмя возможными гипотезами. Известны вероятности реализаций первых трех гипотез. Введем обозначения стратегий
активного игрока – «получателя выгоды» и «природы»
П1 П2 П3 П4
А1 6 3 -4 6
А2 -4 -5 2 -5
А3 5 8 1 0
А4 3 0 1 -5
А5 7 -3 3 4
2. Сравним строки данной платежной матрицы для выявления заведомо невыгодных игроку стратегий
П1 П2 П3 П4
А1 и А2 6 > -4 3 > -5 -4 < 2 6 > -5
А1 и А3 6 > 5 3 < 8 -4 < 1 6 > 0
А1 и А4 6 > 3 3 > 0 -4 < 1 6 > -5
А1 и А5 6 < 7 3 > -3 -4 < 3 6 > 4
А2 и А3 -4 < 5 -5 < 8 2 > 1 -5 < 0
А2 и А4 -4< 3 -5 < 0 2 > 1 -5 = -5
А2 и А5
А3 и А4
А3 и А5 5 < 7 8 > -3 1 < 3 0 < 4
12
-4 < 7 -5 < -3 2 < 3 -5<4
5 > 3 8 > 0 1 = 1 0 > -5

Вывод: в выделенных строках знаки неравенств – одинаковые,
что указывает на невыгодность стратегий активного игрока А2 и А4
относительно стратегий А5 и А3 соответственно. Дальнейшее сравнение со стратегией А4 не проводилось.
Платежную матрицу можно упростить, удалив из нее строки, соответствующие выявленным невыгодным стратегиям (они выделены в таблице).
П1 П2 П3 П4
А1
А2
А3
А4
А5
6 3 -4 6 П1 П2 П3 П4
-4 -5 2 -5
5 8 1 0
3 0 1 -5
7 -3 3 4
А1
~ А3
А5
6 3 -4 6
5 8 1 0
7 -3 3 4
3. Восстановим вероятность возможного варианта П4 «поведения» природы, исходя из того, что события П1, П2, П3 и П4 образуют полную группу
Р(П1) + Р(П2) + Р(П3) +Р(П4) = 1,
Р(П4) = 1 – Р(П1) – Р(П2) – Р(П3) =0,27
Рассчитаем математическое ожидание дискретной случайной величины – получаемой игроком выгоды, при возможном использовании каждой его стратегии
Расшифровка
M
= 6 ⋅ 0,24 + 3 ⋅ 0,11 − 4 ⋅ 0,38 + 6 ⋅ 0,27 =1,87;
1
M
= 5 ⋅ 0,24 + 8 ⋅ 0,11 + 1 ⋅ 0,38 + 0 ⋅ 0,27 =2,46;
3
M
= 7 ⋅ 0,24 − 3 ⋅ 0,11 + 3 ⋅ 0,38 + 4 ⋅ 0,27 =3,57.
5
П1 П2 П3 П4
Pj0,24 0,11 0,38 0,27
А1 6 3 -4 6 1,87
А3 5 8 1 0 2,46
А5 7 -3 3 4 3,57
M
i
13

Вывод: при многократном взаимодействии оптимальной является стратегия А5, обеспечивающая приближение величины среднего
«платежа» к значению M
= 3,57. При этом иногда (в одиннадцати
5
процентах случаев) игрок будет нести убыток.
4. Оптимистический критерий состоит в выявлении такой стратегии рационального игрока, которые позволяют получить наибольшую выгоду (при наиболее удачном стечении обстоятельств). Этой
стратегии соответствует максимальный элемент в платежной матрице. Критерий используется в ситуациях невысокой ответственности
за возможную ошибку.
Проведем сравнение максимальных значений выгоды для каждой
отдельной стратегии рационального игрока
a
max( )
П1 П2 П3 П4
P
0,24 0,11 0,38 0,27
j
А1 6 3 -4 6 6
А3 5 8 1 0 8
А5 7 -3 3 4 7
ij
j
Вывод: максимальная выгода µ = 8 может быть получена при реализации стратегии А3. (Принимая во внимание известные вероятности гипотез о «поведении природы» заметим, однако, что вероятность такого события довольно низка – 11 %).
5. Пессимистический критерий (критерий Вальде) состоит в реализации такого же подхода при выборе стратегии, как при взаимодействии с рационально действующим партнером, нацеленным на
минимизацию величины платежа. Соответственно оптимальной считается стратегия, реализующая «нижнюю цену» игры. Критерий применяется в случаях чрезвычайно высокой ответственности за промах,
для предотвращения катастрофических убытков.
Обратим внимание на минимальные значения в строках платеж-
ной матрицы
14
П1 П2 П3 П4
А1 6 3 -4 6 -4
А3 5 8 1 0 0
А5 7 -3 3 4 -3
min( )
j
a
ij

Нижняя цена игры
max(min( )) max( ; ; )
ij
j
i
aα= = − − =40 3 0
min( ) max( ) ( ),
i ij ij
j
j
aaΓ = ⋅γ+ ⋅ −γ1
(реали-
зуется при использовании стратегии А3).
Вывод: при реализации стратегии А3 все платежи – неотрицательные, что обеспечивает отсутствие убытков. Выбор других стратегий
может привести к убыткам.
6. Критерий Гурвица является промежуточным между двумя предыдущими и опирается на заранее оцененную «меру ответственности» – величину, принимающую значения от γ
тяжких последствий (катастрофических убытков) до γ
= 0 при отсутствии
min
= 1 при их
max
возможности. Для каждой стратегии игрока рассчитывается вспомогательная величина
которая является основой для принятия решения о выборе стратегии.
Произведем расчет величины Гi при значении γ = 0,3 для каждой
стратегии и сделаем вывод
a max( )
П1 П2 П3 П4
А1 6 3 -4 6 -4 6 3
А3 5 8 1 0 0 8 5,6
А5 7 -3 3 4 -3 7 4
min( )
j
ij
a
Г
ij
j
i
Расшифровка
Г
= −4 ⋅ 0,3 + 6 ⋅ 0,7 = 3;
1
Г
= 0 ⋅ 0,3 + 8 ⋅ 0,7 = 5,6;
3
Γ
= -3 ⋅ 0,7 + 7 ⋅ 0,3 = 4.
5
Вывод: при данном «уровне ответственности» оптимальной является стратегия А3. Она обеспечивает наиболее привлекательные результаты при всех вариантах развития событий, с учетом диапазона
возможных результатов. (Отметим, что для данной платежной матрицы такой вывод повторился бы при любом значении параметра
γ, так как стратегия А3 отвечает одновременно и оптимистическому,
и пессимистическому критериям).
7. Для применения критерия Сэвиджа переработаем платежную
матрицу. Предположим, что реализуется одна из гипотез о «поведе-
15

нии» природы. Тогда потери, вызванные неправильным выбором
стратегии, определяются разностью между максимальным элементом в столбце платежной матрицы и элементом выбранной стратегии
max( ) .
r aa= −
ij ij ij
i
Элементы такой матрицы («матрицы рисков») показывают величину возможного «сожаления» о том, что выбор остановился на
конкретной стратегии, при условии, что «поведение» природы было
бы известно. Оптимальной является стратегия, уменьшающая максимальный риск.
В рассматриваемом случае получаем матрицу рисков
max( )
r
П1 П2 П3 П4 П1 П2 П3 П4
А1 7 − 6 8 − 3 3 − (-4) 6 − 6 1 5 7 0 7
А3 7 − 5 8 − 8 3 − 1 6 − 0 = 2 0 2 6 6
А5 7 − 7 8 − (-3) 3 − 3 6 − 4 0 11 0 2 11
ij
j
Вывод: по данному критерию оптимальной является стратегия
А3, допускающая максимальный риск не более, чем 6 у. е. Заметим,
с учетом известных вероятностей гипотез о «поведении» природы,
что стратегия А5 содержит два нуля, т. е. дважды может быть названа
наилучшей по столбцу платежной матрицы, но в ней же – наибольший риск величиной 11 ед.
1
Ответ:
– исключение доминируемых строк позволяет упростить платежную матрицу, сохранив стратегии А1, А3, А5;
– вероятность гипотезы П4 – 27 %;
– оптимальной по математическому ожиданию прибыли является стратегия А1;
– оптимальной по оптимистическому и пессимистическому
(Вальде) критериям, а также по критериям Гурвица (при γ = 0,3)
и Сэвиджа является стратегия А3.
1
При многократном взаимодействии можно использовать матрицу рисков совместно с информацией о вероятности стратегий природы (критерий Байеса для
матрицы рисков в игре с природой). Для каждой стратегии активного игрока рассчитывается математическое ожидание величины риска, оптимальной признается
стратегия, которой соответствует наименьшее математическое ожидание этой величины.
16

2.2. Иерархические биматричные и позиционные
многошаговые игры
Объединяющим признаком для ситуаций, рассмотренных в этом
разделе, является не форма постановки задачи, а общность идеи, используемой при решении, и близость приемов. Основой для них является динамическое программирование, что обуславливает, в том
числе, терминологию. Главенствует гипотетическое выделение таких подигр, решения в которых очевидны, что позволяет упростить
условия задачи, отбрасывая формально возможные, но неактуальные
управления. В итоге выявляется цепочка решений, обусловленная не
предыдущими, а лучшими (для игрока, сохранившего возможность
выбирать) последующими решениями.
Иерархические биматричные игры
Задача взаимодействия двух игроков ставится со следующими
ограничениями: обе взаимодействующие стороны имеют несколько возможных стратегий; результаты взаимодействия взаимно обусловлены и могут быть сведены в две матрицы, по одной для каждого игрока. Удобно объединять две платежные матрицы в одну, где
элемент, находящийся на пересечении выбранной первым игроком
строки и выбранного вторым игроком столбца, указывает оба выигрыша, сначала выигрыш первого игрока, потом – второго.
В отношении возможности переговоров между игроками рассматривается иерархическая ситуация «принципал – агент», когда первый игрок совершает свой выбор до того, как это делает второй, такая
ситуация возникает, например, когда цена на некий товар определяется одной стороной, а количество товара для продажи – другой.
При этом первому игроку надо учесть интересы второго игрока, так
как итог взаимодействия зависит именно от второго игрока, делающего завершающий ход.
Для нахождения решения рассматривается ряд предварительных
гипотез о выборе первого игрока. В рамках каждой гипотезы выявляется предпочтительное для второго игрока решение, которое указывает на актуальное при этой гипотезе значение выигрыша первого игрока и дает возможность сделать итоговый выбор.
Пример 2 (иерархическая биматричная игра). Определить решение иерархической игры для данной двойной платежной матрицы.
17

В1 В2 В3
А1 (3; 1) (6; 5) (1; 4)
А2 (3; 3) (1; 1) (5; 8)
А3 (8; 1) (8; 1) (5; 7)
Решение
Дополним платежную матрицу столбцом, в котором отразим содержание ячейки, предпочтительной для второго игрока из каждой
строчки (значения, обусловившие выбор ячеек, выделены в матрице).
В1 В2 В3
А1 (3; 1) (6; 5) (1; 4) (6; 5)
А2 (3; 3) (1; 1) (5; 8) (5; 8)
А3 (8; 1) (8; 1) (5; 7) (5; 7)
По данным дополнительного столбца, наиболее привлекательна
для первого игрока стратегия А1. Таким образом, решение игры при
отсутствии возможности переговоров между сторонами или при взаимном недоверии – в сочетании стратегий А1 и В2. Заметим, что это
решение не реализует наибольшего суммарного выигрыша. Поэтому при возможности переговоров между сторонами может быть поднят вопрос о перераспределении выигрыша от использования привлекательного сочетания стратегий А2 и В3 в пользу первого игрока.
Позиционные многошаговые игры
Особенностью постановки задачи является многократное, но конечное по количеству актов взаимодействие двух игроков и необходимость совершать ходы поочередно. Таким образом, и управления,
доступные игрокам в их ходах, и результаты этих управлений (непосредственные эффекты и новые состояния рассматриваемого объекта управления) обуславливаются всеми сделанными ранее выборами. Количество возможных состояний объекта управления может
быть ограничено или не ограничено условиями задачи; в последнем случае это количество часто может оказаться достаточно велико. Для изображения состояний и связывающих их управлений используются графы.
Основная идея решения задачи состоит в том, что ранние выборы обуславливаются теми возможностями, которые они создают для
поздних выборов. Значит, последние выборы (при гипотетическом
достижении возможных состояний) оказываются достаточно пред-
18

сказуемыми и позволяют последовательно упрощать рассматривае-
(3; 2)
F
(2; 1)
(1; 2)
(1; 5)
(4; 3)
(3; 2)
(1; 1)
(3; 2)
(2; 2)
(5; 4)
(1; 5)
(3; 2)
(2; 4)
(3; 2)
(2; 3)
(2; 4)
мую ситуацию до тех пор, пока даже самый первый выбор не станет
очевидным (условная оптимизация). Потом, с учетом сделанных ранее упрощающих действий, прогнозируется актуальная последовательность ходов обоих игроков (безусловная оптимизация).
Пример 3 (позиционная многошаговая игра). Возможные состояния системы, управления и их эффекты указаны на графе. Форма вершины показывает, какой из игроков совершает выбор: прямоугольная
форма вершины соответствует выбору первого игрока, овальная –
выбору второго, а скругленным прямоугольником выделена ситуация окончания игры. Дополнительно выбирающего игрока указывает название вершины. Требуется спрогнозировать ходы игроков и результаты игры, т. е. итоговые суммарные выигрыши обоих игроков.
S
1
F31
41
(3; 1)
(1; 2)
S
21
S
22
F
32
F
33
F
34
S
42
S
43
N
5
Решение
Условная оптимизация будет состоять из четырех шагов, по количеству этапов в игре. Примем потенциалы (т. е. наилучшие суммарные выигрыши, достижимые игроками до конца игры) первого игрока U5 и второго игрока V5 в состоянии N5, равными нулю, это позволит
последовательно найти лучшие (для выбирающего игрока) по сумме эффектов и потенциалов результирующих состояний управления,
а также потенциалы на предыдущих этапах игрового взаимодействия.
Шаг 1. Так как в состояниях S41 и S42 фактический выбор у второ-
го игрока отсутствует (в графе эти состояния имеют только одну выходящую дугу), а потенциалы состояния N5 приняты равными нулю,
то потенциалы этих состояний совпадают с соответствующими эффектами:
19

U41 = 3 + U5 = 3 + 0 = 3; V41 = 1 + V5 = 1 + 0 = 1;
(3; 2)
(1; 2)
(1; 2)
(1; 5)
(4; 3)
(3; 2)
(1; 1)
(3; 2)
(2; 2)
(3; 1)
(5; 4)
(1; 5)
(3; 2)
(2; 4)
(2; 3)
(2; 4)
U
= 2 + U5 = 2 + 0 = 2; V42 = 4 + V5 = 4 + 0 = 4.
42
Что касается состояния S
, второй игрок в этом состоянии имеет
43
выбор из двух управлений с разным возможным выигрышем и одинаковым результирующим состоянием. Следовательно, выбор управления определяется непосредственными эффектами: так как с позиции
второго игрока второе (сверху вниз) управление предпочтительней, то
U
= 2 + U5 = 2 + 0 = 2; V4 = 3 + V5 = 3 + 0 = 3.
43
В граф можно внести небольшие изменения: освободить состояние S
от неактуального первого управления и указать найденные
43
потенциалы состояний четвертого этапа выбора.
S
41
(3;1)
S
42
(2; 4)
S
43
(2; 3)
N
5
F
1
(2; 1)
S
21
S
22
F
31
F
32
F
33
F
34
Шаг 2. На третьем этапе выбор управлений осуществляется с учетом интересов первого игрока по сумме эффектов управлений и потенциалов результирующих состояний. Потенциалы обоих игроков
определяются после такого выбора, а граф упрощается за счет исключения управлений, невыгодных первому игроку.
Для анализа состояния F31 сравним два (по количеству выходящих
дуг) варианта: U
у. е. Так как U
31
(1)
= 3 + U41 = 3 + 3 = 6 и U
31
(1)
< U
(2)
, то (с точки зрения первого игрока) делаем
31
(2)
= 5 + U42 = 5 + 2 = 7
31
вывод о предпочтительности второго управления и принимаем значения потенциалов
= U
(2)
= 7; V31 = V
31
U
31
20
(2)
= 4+ V42 = 4 + 4 = 8.
31
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
