Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Теория игр. Учебное пособие

.pdf
Скачиваний:
0
Добавлен:
08.09.2026
Размер:
2 Мб
Скачать
☆
2. ПРИЕМЫ ВЫЯВЛЕНИЯ ОПТИМАЛЬНЫХ ЧИСТЫХ СТРАТЕГИЙ
ИГРОКОВ
2.1. Игры с природой
Раздел посвящен ситуации, когда один из игроков (он ассоции­руется со вторым игроком теории матричных антагонистических игр с нулевой суммой, изложенной далее, Плательщиком) принимает ре­шения о выборе стратегии не рационально, стремясь оптимизировать величину платежа, а каким-либо другим способом. Такое поведение можно назвать не экономическим, а стихийным. Соответственно для рационального выбора оптимальной стратегии первого игрока используются специальные приемы, учитывающие такое «поведе­ние» второго, и некоторые дополнительные факторы, влияющие на принятие решений. В частности, возможность тяжких, катастрофи­ческих последствий при ошибке и прогностические оценки вероят­ностей реализации стратегий второго игрока, если такие доступны. Суть приемов раскрыта ниже, в приводимом примере.
Возможные результаты взаимодействия сводятся в «платежную матрицу». Она содержит величины выгоды, получаемой активным и рациональным (первым) игроком при разных вариантах реализа­ции взаимодополняющих и взаимоисключающих гипотез о «поведе­нии» второго игрока (что моделируется как «выбор» столбца), и одной из стратегий, доступных первому игроку. Наличие в матрице отрица­тельных значений отражает возможность убытков. Могут быть извест­ны также вероятности реализации гипотез о «поведении природы».
Активный игрок принимает решение о выборе строки до того, как получена информация о выборе столбца. Принятое решение не влияет на «поведение природы», кооперация и изменение решения «в процессе взаимодействия» невозможны.
Пример 1 (игра с природой). Для данной платежной матрицы:
– упростить данную платежную матрицу, исключив из нее доми­нируемые строки, соответствующие заведомо невыгодным страте­гиям активного игрока;
– восстановить пропущенную вероятность одной из гипотез о «поведении природы» и выявить оптимальную стратегию активно­го игрока по математическому ожиданию прибыли;
11
– выявить оптимальные стратегии активного игрока, применяя оптимистический и пессимистический (Вальде) критерии, критерии Гурвица (при γ = 0,3), Сэвиджа.
24 % 11 % 38 % ?
6 3 -4 6
-4 -5 2 -5 5 8 1 0 3 0 1 -5 7 -3 3 4
Решение
1. Первый игрок имеет пять стратегий, а второй, «природа», харак­теризуется четырьмя возможными гипотезами. Известны вероятно­сти реализаций первых трех гипотез. Введем обозначения стратегий активного игрока – «получателя выгоды» и «природы»
П1 П2 П3 П4
А1 6 3 -4 6 А2 -4 -5 2 -5 А3 5 8 1 0 А4 3 0 1 -5 А5 7 -3 3 4
2. Сравним строки данной платежной матрицы для выявления за­ведомо невыгодных игроку стратегий
П1 П2 П3 П4
А1 и А2 6 > -4 3 > -5 -4 < 2 6 > -5 А1 и А3 6 > 5 3 < 8 -4 < 1 6 > 0 А1 и А4 6 > 3 3 > 0 -4 < 1 6 > -5 А1 и А5 6 < 7 3 > -3 -4 < 3 6 > 4 А2 и А3 -4 < 5 -5 < 8 2 > 1 -5 < 0 А2 и А4 -4< 3 -5 < 0 2 > 1 -5 = -5 А2 и А5 А3 и А4 А3 и А5 5 < 7 8 > -3 1 < 3 0 < 4
12
-4 < 7 -5 < -3 2 < 3 -5<4 5 > 3 8 > 0 1 = 1 0 > -5
Вывод: в выделенных строках знаки неравенств – одинаковые, что указывает на невыгодность стратегий активного игрока А2 и А4 относительно стратегий А5 и А3 соответственно. Дальнейшее срав­нение со стратегией А4 не проводилось.
Платежную матрицу можно упростить, удалив из нее строки, со­ответствующие выявленным невыгодным стратегиям (они выделе­ны в таблице).
П1 П2 П3 П4
А1
А2
А3
А4
А5
6 3 -4 6 П1 П2 П3 П4
-4 -5 2 -5
5 8 1 0
3 0 1 -5
7 -3 3 4
А1
~ А3
А5
6 3 -4 6 5 8 1 0 7 -3 3 4
3. Восстановим вероятность возможного варианта П4 «поведе­ния» природы, исходя из того, что события П1, П2, П3 и П4 образу­ют полную группу
Р(П1) + Р(П2) + Р(П3) +Р(П4) = 1,
Р(П4) = 1 – Р(П1) – Р(П2) – Р(П3) =0,27
Рассчитаем математическое ожидание дискретной случайной ве­личины – получаемой игроком выгоды, при возможном использова­нии каждой его стратегии
Расшифровка
M
= 6 ⋅ 0,24 + 3 ⋅ 0,11 − 4 ⋅ 0,38 + 6 ⋅ 0,27 =1,87;
1
M
= 5 ⋅ 0,24 + 8 ⋅ 0,11 + 1 ⋅ 0,38 + 0 ⋅ 0,27 =2,46;
3
M
= 7 ⋅ 0,24 − 3 ⋅ 0,11 + 3 ⋅ 0,38 + 4 ⋅ 0,27 =3,57.
5
П1 П2 П3 П4
Pj0,24 0,11 0,38 0,27
А1 6 3 -4 6 1,87 А3 5 8 1 0 2,46 А5 7 -3 3 4 3,57
M
i
13
Вывод: при многократном взаимодействии оптимальной являет­ся стратегия А5, обеспечивающая приближение величины среднего «платежа» к значению M
= 3,57. При этом иногда (в одиннадцати
5
процентах случаев) игрок будет нести убыток.
4. Оптимистический критерий состоит в выявлении такой стра­тегии рационального игрока, которые позволяют получить наиболь­шую выгоду (при наиболее удачном стечении обстоятельств). Этой стратегии соответствует максимальный элемент в платежной матри­це. Критерий используется в ситуациях невысокой ответственности за возможную ошибку.
Проведем сравнение максимальных значений выгоды для каждой
отдельной стратегии рационального игрока
a
max( )
П1 П2 П3 П4
P
0,24 0,11 0,38 0,27
j
А1 6 3 -4 6 6 А3 5 8 1 0 8 А5 7 -3 3 4 7
ij
j
Вывод: максимальная выгода µ = 8 может быть получена при ре­ализации стратегии А3. (Принимая во внимание известные вероят­ности гипотез о «поведении природы» заметим, однако, что вероят­ность такого события довольно низка – 11 %).
5. Пессимистический критерий (критерий Вальде) состоит в ре­ализации такого же подхода при выборе стратегии, как при взаимо­действии с рационально действующим партнером, нацеленным на минимизацию величины платежа. Соответственно оптимальной счи­тается стратегия, реализующая «нижнюю цену» игры. Критерий при­меняется в случаях чрезвычайно высокой ответственности за промах, для предотвращения катастрофических убытков.
Обратим внимание на минимальные значения в строках платеж-
ной матрицы
14
П1 П2 П3 П4
А1 6 3 -4 6 -4 А3 5 8 1 0 0 А5 7 -3 3 4 -3
min( )
j
a
ij
Нижняя цена игры
max(min( )) max( ; ; )
ij
j
i
aα= = − − =40 3 0
min( ) max( ) ( ),
i ij ij
j
j
aaΓ = ⋅γ+ ⋅ −γ1
(реали-
зуется при использовании стратегии А3).
Вывод: при реализации стратегии А3 все платежи – неотрицатель­ные, что обеспечивает отсутствие убытков. Выбор других стратегий может привести к убыткам.
6. Критерий Гурвица является промежуточным между двумя пре­дыдущими и опирается на заранее оцененную «меру ответственно­сти» – величину, принимающую значения от γ тяжких последствий (катастрофических убытков) до γ
= 0 при отсутствии
min
= 1 при их
max
возможности. Для каждой стратегии игрока рассчитывается вспомо­гательная величина
которая является основой для принятия решения о выборе стратегии.
Произведем расчет величины Гi при значении γ = 0,3 для каждой
стратегии и сделаем вывод
a max( )
П1 П2 П3 П4
А1 6 3 -4 6 -4 6 3 А3 5 8 1 0 0 8 5,6 А5 7 -3 3 4 -3 7 4
min( )
j
ij
a
Г
ij
j
i
Расшифровка
Г
= −4 ⋅ 0,3 + 6 ⋅ 0,7 = 3;
1
Г
= 0 ⋅ 0,3 + 8 ⋅ 0,7 = 5,6;
3
Γ
= -3 ⋅ 0,7 + 7 ⋅ 0,3 = 4.
5
Вывод: при данном «уровне ответственности» оптимальной явля­ется стратегия А3. Она обеспечивает наиболее привлекательные ре­зультаты при всех вариантах развития событий, с учетом диапазона возможных результатов. (Отметим, что для данной платежной ма­трицы такой вывод повторился бы при любом значении параметра γ, так как стратегия А3 отвечает одновременно и оптимистическому, и пессимистическому критериям).
7. Для применения критерия Сэвиджа переработаем платежную
матрицу. Предположим, что реализуется одна из гипотез о «поведе-
15
нии» природы. Тогда потери, вызванные неправильным выбором стратегии, определяются разностью между максимальным элемен­том в столбце платежной матрицы и элементом выбранной стратегии
max( ) .
r aa= −
ij ij ij
i
Элементы такой матрицы («матрицы рисков») показывают ве­личину возможного «сожаления» о том, что выбор остановился на конкретной стратегии, при условии, что «поведение» природы было бы известно. Оптимальной является стратегия, уменьшающая мак­симальный риск.
В рассматриваемом случае получаем матрицу рисков
max( )
r
П1 П2 П3 П4 П1 П2 П3 П4
А1 7 − 6 8 − 3 3 − (-4) 6 − 6 1 5 7 0 7 А3 7 − 5 8 − 8 3 − 1 6 − 0 = 2 0 2 6 6 А5 7 − 7 8 − (-3) 3 − 3 6 − 4 0 11 0 2 11
ij
j
Вывод: по данному критерию оптимальной является стратегия А3, допускающая максимальный риск не более, чем 6 у. е. Заметим, с учетом известных вероятностей гипотез о «поведении» природы, что стратегия А5 содержит два нуля, т. е. дважды может быть названа наилучшей по столбцу платежной матрицы, но в ней же – наиболь­ший риск величиной 11 ед.
1
Ответ:
– исключение доминируемых строк позволяет упростить платеж­ную матрицу, сохранив стратегии А1, А3, А5;
– вероятность гипотезы П4 – 27 %;
– оптимальной по математическому ожиданию прибыли являет­ся стратегия А1;
– оптимальной по оптимистическому и пессимистическому (Вальде) критериям, а также по критериям Гурвица (при γ = 0,3) и Сэвиджа является стратегия А3.
1
При многократном взаимодействии можно использовать матрицу рисков сов­местно с информацией о вероятности стратегий природы (критерий Байеса для матрицы рисков в игре с природой). Для каждой стратегии активного игрока рас­считывается математическое ожидание величины риска, оптимальной признается стратегия, которой соответствует наименьшее математическое ожидание этой вели­чины.
16
2.2. Иерархические биматричные и позиционные многошаговые игры
Объединяющим признаком для ситуаций, рассмотренных в этом разделе, является не форма постановки задачи, а общность идеи, ис­пользуемой при решении, и близость приемов. Основой для них яв­ляется динамическое программирование, что обуславливает, в том числе, терминологию. Главенствует гипотетическое выделение та­ких подигр, решения в которых очевидны, что позволяет упростить условия задачи, отбрасывая формально возможные, но неактуальные управления. В итоге выявляется цепочка решений, обусловленная не предыдущими, а лучшими (для игрока, сохранившего возможность выбирать) последующими решениями.
Иерархические биматричные игры
Задача взаимодействия двух игроков ставится со следующими ограничениями: обе взаимодействующие стороны имеют несколь­ко возможных стратегий; результаты взаимодействия взаимно об­условлены и могут быть сведены в две матрицы, по одной для каж­дого игрока. Удобно объединять две платежные матрицы в одну, где элемент, находящийся на пересечении выбранной первым игроком строки и выбранного вторым игроком столбца, указывает оба выиг­рыша, сначала выигрыш первого игрока, потом – второго.
В отношении возможности переговоров между игроками рассма­тривается иерархическая ситуация «принципал – агент», когда пер­вый игрок совершает свой выбор до того, как это делает второй, такая ситуация возникает, например, когда цена на некий товар опреде­ляется одной стороной, а количество товара для продажи – другой. При этом первому игроку надо учесть интересы второго игрока, так как итог взаимодействия зависит именно от второго игрока, делаю­щего завершающий ход.
Для нахождения решения рассматривается ряд предварительных гипотез о выборе первого игрока. В рамках каждой гипотезы выяв­ляется предпочтительное для второго игрока решение, которое ука­зывает на актуальное при этой гипотезе значение выигрыша перво­го игрока и дает возможность сделать итоговый выбор.
Пример 2 (иерархическая биматричная игра). Определить реше­ние иерархической игры для данной двойной платежной матрицы.
17
В1 В2 В3 А1 (3; 1) (6; 5) (1; 4) А2 (3; 3) (1; 1) (5; 8) А3 (8; 1) (8; 1) (5; 7)
Решение
Дополним платежную матрицу столбцом, в котором отразим со­держание ячейки, предпочтительной для второго игрока из каждой строчки (значения, обусловившие выбор ячеек, выделены в матрице).
В1 В2 В3 А1 (3; 1) (6; 5) (1; 4) (6; 5) А2 (3; 3) (1; 1) (5; 8) (5; 8) А3 (8; 1) (8; 1) (5; 7) (5; 7)
По данным дополнительного столбца, наиболее привлекательна для первого игрока стратегия А1. Таким образом, решение игры при отсутствии возможности переговоров между сторонами или при вза­имном недоверии – в сочетании стратегий А1 и В2. Заметим, что это решение не реализует наибольшего суммарного выигрыша. Поэто­му при возможности переговоров между сторонами может быть под­нят вопрос о перераспределении выигрыша от использования при­влекательного сочетания стратегий А2 и В3 в пользу первого игрока.
Позиционные многошаговые игры
Особенностью постановки задачи является многократное, но ко­нечное по количеству актов взаимодействие двух игроков и необхо­димость совершать ходы поочередно. Таким образом, и управления, доступные игрокам в их ходах, и результаты этих управлений (непо­средственные эффекты и новые состояния рассматриваемого объ­екта управления) обуславливаются всеми сделанными ранее выбо­рами. Количество возможных состояний объекта управления может быть ограничено или не ограничено условиями задачи; в послед­нем случае это количество часто может оказаться достаточно вели­ко. Для изображения состояний и связывающих их управлений ис­пользуются графы.
Основная идея решения задачи состоит в том, что ранние выбо­ры обуславливаются теми возможностями, которые они создают для поздних выборов. Значит, последние выборы (при гипотетическом достижении возможных состояний) оказываются достаточно пред-
18
сказуемыми и позволяют последовательно упрощать рассматривае-
(3; 2)
F
(2; 1)
(1; 2)
(1; 5)
(4; 3)
(3; 2)
(1; 1)
(3; 2)
(2; 2)
(5; 4)
(1; 5)
(3; 2)
(2; 4)
(3; 2)
(2; 3)
(2; 4)
мую ситуацию до тех пор, пока даже самый первый выбор не станет очевидным (условная оптимизация). Потом, с учетом сделанных ра­нее упрощающих действий, прогнозируется актуальная последова­тельность ходов обоих игроков (безусловная оптимизация).
Пример 3 (позиционная многошаговая игра). Возможные состоя­ния системы, управления и их эффекты указаны на графе. Форма вер­шины показывает, какой из игроков совершает выбор: прямоугольная форма вершины соответствует выбору первого игрока, овальная – выбору второго, а скругленным прямоугольником выделена ситуа­ция окончания игры. Дополнительно выбирающего игрока указыва­ет название вершины. Требуется спрогнозировать ходы игроков и ре­зультаты игры, т. е. итоговые суммарные выигрыши обоих игроков.
S
1
F31
41
(3; 1)
(1; 2)
S
21
S
22
F
32
F
33
F
34
S
42
S
43
N
5
Решение
Условная оптимизация будет состоять из четырех шагов, по коли­честву этапов в игре. Примем потенциалы (т. е. наилучшие суммар­ные выигрыши, достижимые игроками до конца игры) первого игро­ка U5 и второго игрока V5 в состоянии N5, равными нулю, это позволит последовательно найти лучшие (для выбирающего игрока) по сум­ме эффектов и потенциалов результирующих состояний управления, а также потенциалы на предыдущих этапах игрового взаимодействия.
Шаг 1. Так как в состояниях S41 и S42 фактический выбор у второ- го игрока отсутствует (в графе эти состояния имеют только одну вы­ходящую дугу), а потенциалы состояния N5 приняты равными нулю, то потенциалы этих состояний совпадают с соответствующими эф­фектами:
19
U41 = 3 + U5 = 3 + 0 = 3; V41 = 1 + V5 = 1 + 0 = 1;
(3; 2)
(1; 2)
(1; 2)
(1; 5)
(4; 3)
(3; 2)
(1; 1)
(3; 2)
(2; 2)
(3; 1)
(5; 4)
(1; 5)
(3; 2)
(2; 4)
(2; 3)
(2; 4)
U
= 2 + U5 = 2 + 0 = 2; V42 = 4 + V5 = 4 + 0 = 4.
42
Что касается состояния S
, второй игрок в этом состоянии имеет
43
выбор из двух управлений с разным возможным выигрышем и одина­ковым результирующим состоянием. Следовательно, выбор управле­ния определяется непосредственными эффектами: так как с позиции второго игрока второе (сверху вниз) управление предпочтительней, то
U
= 2 + U5 = 2 + 0 = 2; V4 = 3 + V5 = 3 + 0 = 3.
43
В граф можно внести небольшие изменения: освободить состо­яние S
от неактуального первого управления и указать найденные
43
потенциалы состояний четвертого этапа выбора.
S
41
(3;1)
S
42
(2; 4)
S
43
(2; 3)
N
5
F
1
(2; 1)
S
21
S
22
F
31
F
32
F
33
F
34
Шаг 2. На третьем этапе выбор управлений осуществляется с уче­том интересов первого игрока по сумме эффектов управлений и по­тенциалов результирующих состояний. Потенциалы обоих игроков определяются после такого выбора, а граф упрощается за счет исклю­чения управлений, невыгодных первому игроку.
Для анализа состояния F31 сравним два (по количеству выходящих дуг) варианта: U у. е. Так как U
31
(1)
= 3 + U41 = 3 + 3 = 6 и U
31
(1)
< U
(2)
, то (с точки зрения первого игрока) делаем
31
(2)
= 5 + U42 = 5 + 2 = 7
31
вывод о предпочтительности второго управления и принимаем зна­чения потенциалов
= U
(2)
= 7; V31 = V
31
U
31
20
(2)
= 4+ V42 = 4 + 4 = 8.
31
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]