Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Специальные разделы математики. Учебное пособие
.pdf
– восстановить пропущенную
вероятность одной из гипотез о
«поведении природы» и выявить
оптимальную стратегию активного игрока по математическому
ожиданию прибыли;
– выявить оптимальные стра-
24 % 11 % 38 % ?
6 3 -4 6
-4 -5 2 -5
5 8 1 0
3 0 1 -5
7 -3 3 4
тегии активного игрока, применяя
оптимистический и пессимистический (Вальда) критерии, критерии Гурвица (при γ = 0,3), Сэвиджа.
Решение
1. Первый игрок имеет пять стратегий, а второй, «природа», характеризуется четырьмя возможными гипотезами. Известны вероятности реализаций первых трех гипотез. Введем обозначения стратегий активного игрока – «получателя выгоды» и «природы»:
П1 П2 П3 П4
А1
А2
А3
А4
А5
6 3 -4 6
-4 -5 2 -5
5 8 1 0
3 0 1 -5
7 -3 3 4
2. Сравним строки данной платежной матрицы для выявления
заведомо невыгодных игроку стратегий:
П1 П2 П3 П4
А1 и А2 6 > -4 3 > -5 -4 < 2 6 > -5
А1 и А3 6 > 5 3 < 8 -4 < 1 6 > 0
А1 и А4 6 > 3 3 > 0 -4 < 1 6 > -5
А1 и А5 6 < 7 3 > -3 -4 < 3 6 > 4
А2 и А3 -4 < 5 -5 < 8 2 > 1 -5 < 0
А2 и А4 -4< 3 -5 < 0 2 > 1 -5 = -5
А2 и А5
А3 и А4
А3 и А5 5 < 7 8 > -3 1 < 3 0 < 4
А4 и А5 — — — —
-4 < 7 -5 < -3 2 < 3 -5<4
5 > 3 8 > 0 1 = 1 0 > -5
Вывод: в выделенных строках знаки неравенств – одинаковые,
что указывает на невыгодность стратегий активного игрока А2 и А4
11

относительно стратегий А5 и А3 соответственно. Дальнейшее сравнение со стратегией А4 не проводилось.
Платежную матрицу можно упростить, удалив из нее строки, соответствующие выявленным невыгодным стратегиям (они выделены в таблице):
П1 П2 П3 П4
А1
А2
А3
А4
А5
6 3 -4 6 П1 П2 П3 П4
-4 -5 2 -5
5 8 1 0
3 0 1 -5
7 -3 3 4
А1
~ А3
А5
6 3 -4 6
5 8 1 0
7 -3 3 4
3. Восстановим вероятность возможного варианта П4 «поведения» природы, исходя из того, что события П1, П2, П3 и П4 образуют полную группу:
Р(П1) + Р(П2) + Р(П3) + Р(П4) = 1,
Р(П4) = 1 – Р(П1) – Р(П2) – Р(П3) = 0,27.
Рассчитаем математическое ожидание дискретной случайной
величины – получаемой игроком выгоды, при возможном использовании каждой его стратегии:
П1 П2 П3 П4
0,24 0,11 0,38 0,27
P
j
А1 6 3 -4 6 1,87
А3 5 8 1 0 2,46
А5 7 -3 3 4 3,57
M
i
Расшифровка:
M1 = 6 · 0,24 + 3 · 0,11 − 4 · 0,38 + 6 · 0,27 = 1,87;
= 5 · 0,24 + 8 · 0,11 + 1 · 0,38 + 0 · 0,27 = 2,46;
M
3
= 7 · 0,24 − 3 · 0,11 + 3 · 0,38 + 4 · 0,27 = 3,57.
M
5
Вывод: при многократном взаимодействии оптимальной является стратегия А5, обеспечивающая приближение величины среднего
«платежа» к значению M
= 3,57. При этом иногда (в одиннадцати
5
процентах случаев) игрок будет нести убыток.
12

4. Оптимистический критерий состоит в выявлении такой стра-
α= = − − =max(min( )) max( 4;0; 3) 0
ij
j
i
a
тегии рационального игрока, которая позволяет получить наибольшую выгоду при наиболее удачном стечении обстоятельств. Этой
стратегии соответствует максимальный элемент в платежной матрице. Критерий используется в ситуациях невысокой ответственности за возможную ошибку.
Проведем сравнение максимальных значений выгоды для каждой отдельной стратегии рационального игрока:
max( )
П1 П2 П3 П4
P
А1 6 3 -4 6 6
А3 5 8 1 0 8
А5 7 -3 3 4 7
0,24 0,11 0,38 0,27
j
a
ij
j
Вывод: максимальная выгода µ = 8 может быть получена при
реализации стратегии А3. (Принимая во внимание известные вероятности гипотез о «поведении природы» заметим, что вероятность
такого события довольно низка – 11 %).
5. Пессимистический критерий (критерий Вальда) состоит в реализации такого же подхода при выборе стратегии, как при взаимодействии с рационально действующим партнером, нацеленным
на минимизацию величины платежа. Соответственно оптимальной
считается стратегия, реализующая «нижнюю цену» игры. Критерий
применяется в случаях чрезвычайно высокой ответственности за
промах, для предотвращения катастрофических убытков.
Обратим внимание на минимальные значения в строках платеж-
ной матрицы:
П1 П2 П3 П4
А1 6 3 -4 6 -4
А3 5 8 1 0 0
А5 7 -3 3 4 -3
Нижняя цена игры
ется при использовании стратегии А3).
Вывод: при реализации стратегии А3 все платежи – неотрицательные, что обеспечивает отсутствие убытков. Выбор других стратегий может привести к убыткам.
min( )
a
j
ij
реализу-
13

6. Критерий Гурвица является промежуточным между двумя
= ⋅γ+ ⋅ −γГ min( ) max( ) (1 ),
i ij ij
j
j
aa
= −max( ) .
ij ij ij
i
r aa
предыдущими и опирается на заранее оцененную «меру ответственности» – величину, принимающую значения от γ
ствии тяжких последствий (катастрофических убытков) до γ
= 0 при отсут-
min
max
= 1
при их возможности. Для каждой стратегии игрока рассчитывается
вспомогательная величина
которая является основой для принятия решения о выборе стратегии. Произведем расчет величины Гi при значении γ = 0,3 для каждой стратегии и сделаем вывод.
min( )
П1 П2 П3 П4
А1 6 3 -4 6 -4 6 3
А3 5 8 1 0 0 8 5,6
А5 7 -3 3 4 -3 7 4
a max( )
ij
j
a
Г
ij
j
i
Расшифровка:
Г1 = −4 · 0,3 + 6 · 0,7 = 3;
Г
= 0 · 0,3 + 8 · 0,7 = 5,6;
3
Γ
= –3 · 0,3 + 7 · 0,7 = 4.
5
Вывод: при данном «уровне ответственности» оптимальной является стратегия А3. Она обеспечивает наиболее привлекательные
результаты при всех вариантах развития событий, с учетом диапазона возможных результатов. (Отметим, что для данной платежной
матрицы такой вывод повторился бы при любом значении параметра γ, так как стратегия А3 отвечает одновременно и оптимистическому, и пессимистическому критериям).
7. Для применения критерия Сэвиджа переработаем платежную
матрицу. Предположим, что реализуется одна из гипотез о «поведении» природы. Тогда потери, вызванные неправильным выбором
стратегии, определяются разностью между максимальным элементом в столбце платежной матрицы и элементом выбранной стратегии:
Элементы такой матрицы («матрицы рисков») показывают ве-
личину возможного «сожаления» о том, что выбор остановился на
14

конкретной стратегии, при условии, что «поведение» природы было
max( )
ij
j
r
бы известно. Оптимальной является стратегия, уменьшающая максимальный риск. В рассматриваемом случае получаем матрицу рисков
П1 П2 П3 П4 П1 П2 П3 П4
7 - 6 8 - 3 3 - (-4) 6 - 6 1 5 7 0 7
А1
7 - 5 8 - 8 3 - 1 6 - 0 = 2 0 2 6 6
А3
7 - 7 8 - (-3) 3 - 3 6 - 4 0 11 0 2 11
А5
Вывод: по данному критерию оптимальной является стратегия
А3, допускающая максимальный риск не более 6 ед. Заметим, с учетом известных вероятностей гипотез о «поведении» природы, что
стратегия А5 содержит два нуля, т. е. дважды может быть названа
наилучшей по столбцу платежной матрицы, но в ней же – наибольший риск, равный 11 ед.
Ответ:
– исключение доминируемых строк позволяет упростить платежную матрицу, сохранив стратегии А1, А3, А5;
– вероятность гипотезы П4 – 27 %;
– оптимальной по математическому ожиданию прибыли является стратегия А1; оптимальной по оптимистическому и пессимистическому (Вальда) критериям, а также по критериям Гурвица (при
γ = 0,3) и Сэвиджа является стратегия А3.
При многократном взаимодействии можно использовать матрицу рисков совместно с информацией о вероятности стратегий
природы (критерий Байеса для матрицы рисков в игре с природой).
Для каждой стратегии активного игрока рассчитывается математическое ожидание величины риска, оптимальной признается стратегия, которой соответствует наименьшее математическое ожидание
этой величины.
Как следует из заголовка, особенностью таких задач является нулевая сумма выигрышей игроков в каждом сочетании их чистых стратегий. Для компактности записи в платежной матрице указываются
15

выигрыши только первого игрока, далее называемого Получателем,
а с точки зрения второго игрока, называемого Плательщиком, те же
самые значения являются выплатами. И выигрыши первого игрока,
и, соответственно, выплаты второго игрока могут принимать отрицательные значения, что не сказывается на технике используемых
приемов и интерпретации результатов: Получатель мотивирован
принимать решения, увеличивающие величину, определяемую сочетанием стратегий сторон, а Плательщик – уменьшать эту величину.
Любые договоренности между сторонами игры могут быть нарушены
при появлении экономических стимулов, поэтому рассматриваются
только решения, «защищенные» от попыток противоположной стороны изменить результаты розыгрышей в свою пользу.
Отметим, что наиболее продуктивными при наименьших вычислительных действиях оказываются приемы выявления наилучших гарантированных результатов (через нижнюю и верхнюю цены
игры, определяемые с помощью максиминного подхода). Менее
продуктивен поиск отношений доминирования между стратегиями.
Результат поиска равновесных сочетаний стратегий (равновесий по
Нэшу) одновременно с данными об их количестве может быть предсказан по результатам сравнения верхней и нижней цены игры, т. е.
получен с меньшим количеством вычислений, чем предусмотрено
обычной процедурой поиска таких сочетаний.
В данном разделе кроме технических приемов выявления нижней и верхней цен игры рассмотрены способы интерпретации этих
результатов. Особенности выявления отношений доминирования
между стратегиями и исключения заведомо невыгодных для игроков стратегий в играх с нулевой суммой выигрышей рассматриваются в следующем разделе.
Рассмотрим, как выявляются стратегии, соответствующие нижней и верхней ценам игры.
Получатель (т. е. первый игрок, выбирающий строку в платежной матрице), не склонный к риску, выделяет в каждой строке платежной матрицы наименьшее значение. Из всех наименьших значений выбирается наибольшее (оно называется нижней ценой игры и
обозначается α, максимином).
Плательщик (т. е. второй игрок, выбирающий столбец), не
склонный к риску, выделяет в каждом столбце платежной матрицы
наибольшее значение. Из всех наибольших значений выбирается
наименьшее (оно называется верхней ценой игры и обозначается β,
минимаксом).
16

Так как даже наибольшее из наименьших значений не может
α= = − − − =max(min( )) max(2; 4; 3; 1;3) 3.
ij
j
i
a
превзойти наименьшего из наибольших значений (независимо от
того, по строкам или по столбцам происходил отбор), то для верхней и нижней цен игры справедливо соотношение: α ≤ β.
Пример 1.3.1 (нижняя цена
игры). Количество возможных
стратегий Получателя – 5, Плательщика – 4. Величины платежа образуют таблицу. Требуется
найти наиболее выгодную стра-
В1 В2 В3 В4
А1 2 3 5 9
А2 -2 -4 -2 7
А3 7 5 0 -3
А4 -1 6 1 2
А5 6 9 6 3
тегию Получателя.
Решение
1. В каждой строке найдем минимальное значение:
В1 В2 В3 В4
А1
А2
А3
А4
А5
2 3 5 9
-2 -4 -2 7
7 5 0 -3
-1 6 1 2
6 9 6 3
a
ij
j
2 α1 = min(2; 3; 5; 9) = 2;
-4 α2 = min(–2; –4; –2; 7) = –4;
-3 α3 = min(7; 5; 0; –3) = –3;
-1 α4 = min(–1; 6; 1; 2) = –1;
3 α
Расшифровка:
min(6; 9; 6; 3) = 3.
5 =
min( )
2. Вычислим максимин:
Найденное значение реализуется при выборе последней (пятой)
стратегии А5 Получателя (она выделена в таблице).
Ответ: наиболее выгодной для Получателя (при однократной
игре) является стратегия А5, так как при любом выборе Плательщиком его стратегии величина платежа составит α = 3 или больше.
Пример 1.3.2 (верхняя цена игры).
В задаче с предыдущими условиями
требуется найти наиболее выгодную
стратегию Плательщика.
Решение
1. В каждом столбце найдем мак-
симальное значение.
В1 В2 В3 В4
А1 2 3 5 9
А2 -2 -4 -2 7
А3 7 5 0 -3
А4 -1 6 1 2
А5 6 9 6 3
17

В1 В2 В3 В4
max( )
ij
i
a
β= = =min(max( )) min(7;9;6;9) 6.
ij
j
i
a
max( )
ij
i
a
α= = − − =max(min( )) max(5; 2; 3) 5
ij
j
i
a
β= = =min(max( )) min(7;5;9) 5
ij
j
i
a
А1 2 3
А2 –2 –4
А3 7 5
А4 –1 6
А5 6 9
7 9
–2
5
9 β
7 β
0
1
6
6
–3 b
2 β
3
9
Расшифровка:
= max(2; –2; 7; –1; 6) = 7;
1
= max(3; –4; 5; 6; 9) = 9;
2
max(5; –2; 0; 1; 6) = 6;
3 =
max(9; 7; –3; 2; 3) = 9.
4 =
2. Вычислим минимакс:
Найденное значение реализуется при выборе третьей стратегии
В3 Плательщика (она выделена в таблице).
Ответ: наиболее выгодной для Плательщика (при однократной
игре) является стратегия В3, так как при любом выборе Получателем его стратегии величина выплаты составит β = 6 или меньше.
Пример 1.3.3 (игра, имеющая решение в
чистых стратегиях). Требуется найти наиболее выгодные стратегии игроков, если дана
платежная матрица.
А1 6 5 9
А2 –2 –2 7
А3 7 0 –3
Решение
1. Определим наименьшие значения в
строках и наибольшие значения в столбцах матрицы:
В1 В2 В3
А1 6 5 9
А2 -2 -2 7 -2
А3 7 0 -3 -3
7 5 9
min( )
2. Вычислим максимин и минимакс:
(реализуется при выборе Получателем стратегии А1),
(реализуется при выборе Плательщиком стратегии В2).
18
В1 В2 В3
a
ij
j
5

3. Так как α = β, определим цену игры ν = α = β = 5.
Ответ: наиболее выгодная стратегия Получателя – А1; наиболее
выгодная стратегия Плательщика – B2.
Интерпретация результата: получатель, выбирая стратегию А1 (т.
е. строку № 1), гарантирует результат игры ν ≥ 5. С другой стороны,
Плательщик, выбирая стратегию В2 (т. е. столбец № 2), гарантирует
результат игры ν ≤ 5. Таким образом, цена игры ν = 5 совпадает с верхней и нижней ценами игры. Никакая смешанная стратегия не принесет пользы ни Получателю, ни Плательщику: любое
использование Получателем стратегий А2 и А3 (при сохранении
Плательщиком стратегии В2) не выгодно Получателю, но и любое
использование Плательщиком стратегий В1 и В3 (при сохранении
Получателем стратегии А1) не выгодно Плательщику.
Из рассмотрения примеров 1.3.1–1.3.3 видно, что Получатель
может добиться гарантированного результата игры не меньше, чем
α, а Плательщик – не больше, чем β. С другой стороны, из определения величин следует, что α ≤ β. Таким образом, при точном
равенстве между верхней и нижней ценами игры ожидается постоянный выбор игроками наиболее выгодных для них стратегий (т. е.
игра решается в чистых стратегиях или имеет седловую точку) независимо от количества актов, и цена игры ν определяется равенством
α = ν = β. Активными стратегиями игроков как в однократном, так
и в многократном взаимодействии, являются только те, в которых
реализуется цена игры. Сочетание стратегий, реализующих цену
игры, является равновесием по Нэшу. Оно обладает важным свойством: одностороннее отклонение любого игрока от такого сочетания способно лишь ухудшить его результат. Так как цена игры отражает максимум по своему столбцу, то смена стратегии Получателем
только уменьшит величину платежа, что ему не выгодно. С другой
стороны, так как цена игры отражает минимум по своей строке, то
смена стратегии Плательщиком только увеличит величину платежа,
что ему тоже не выгодно. Количество равновесий по Нэшу в платежной матрице определяется количеством сочетаний чистых стратегий, реализующих цену игры.
В остальных случаях, когда верхняя и нижняя цены игры различаются (как в примерах 1.3.1 и 1.3.2), часто появляется возможность
достижения промежуточного, более выгодного результата ν ≥ α для
Получателя и (или) ν ≤ β для Плательщика в серии многократных
игр. Для этого применяются смешанные стратегии: несколько чистых стратегий используются с разной вероятностью, причем то,
19

какая именно стратегия будет применяться в следующий раз, игроки держат в тайне. Теория матричных игр (следующий раздел) помогает определить состав множества чистых стратегий, образующих
смешанную стратегию, т. е. активные стратегии, предсказать вероятности их использования и ожидаемый средний результат по серии
игр (т. е. цену игры ν), но не отдельный результат в серии. Фактический результат приближается к теоретическому предсказанию при
увеличении количества актов игры и отсутствии утечек информации о выборе стратегий игроками.
В предыдущем разделе рассмотрены вопросы поиска оптимальных чистых стратегий игроков, с помощью которых можно добиваться наилучших гарантированных решений в случае однократного взаимодействия между сторонами взаимодействия. Однако если:
а) взаимодействия носят многократный характер при б) неизменной платежной матрице, и в) равновесного сочетания стратегий
в этих условиях нет (его признак – совпадение нижней и верхней
цены игры), решение игры существует в смешанных стратегиях.
Чистые стратегии, не менее двух, каждый игрок применяет с некоторой вероятностью, причем то, какая именно стратегия будет применяться в следующий раз, он держит в тайне. Это позволяет игроку приблизить среднюю величину платежа к значению цены игры
ν, причем для нижней цены игры α, цены игры ν и верхней цены
игры β выполняется соотношение α ≤ ν ≤ β, т. е. такая цель – стимул
для обоих игроков, и для Получателя, и для Плательщика. Данный
раздел посвящен приемам, позволяющим определить как активные
стратегии, входящие в состав смешанных стратегий игроков и применяемые ими с ненулевой вероятностью, так и числовые значения
вероятностей применения активных стратегий, а также цену игры
ν, – то есть найти полное решение игры.
Отметим, что применение универсальных приемов поиска смешанных стратегий и цены игры предполагает проведение рутинных
и громоздких вычислительных процедур, существенно зависящих от
количества стратегий, имеющихся у игроков. Поэтому если есть возможность, следует освободить задачу от тех стратегий, которые заведомо не будут использоваться игроками, так как другие стратегии являются для них более выгодными. Такие стратегии вычеркиваются из
20
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
