Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Теория принятия решений. Учебное пособие-1
.pdf
где
p
E
(|)EMV a x
– ожидаемая денежная ценность действия a при известном x.
(|) [(, )|] (,)(|)
MV a x M L a x L a p x d
,
Здесь
(|)
– апостериорное распределение состояния природы, которое бу-
x
дем считать известным, т. к. величина спроса изучалось при различных x.
Подставим функцию потерь в (14):
EMV a x k a p x d k a p x d
(|) ( )(|) ( )(|)
[(|) (|)] {M(|) (|)
kaFax p xd k x p xd
12
[1 ( | )]}
aFax
()(|)M(|) ()(|).
kkaFaxk xkakk p xd
12 2 2 12
Минимизируем по a:
a
12
0
aa
00
EMV a x
(|)
a
()(|) 0
kkFaxk
12 2
a
a
0
, откуда
(14)
k
Fa x
(|)
k
2
()
kk
12
B
апостериорного распределения спроса.
Возьмём данные варианта 28 из задачи 8.7. k
2
. Т. о. оптимальный запас
kk
()
12
a
есть квантиль порядка
B
= 1, k2 = 1.5, x = 1.4. По груп-
1
пированным данным строим эмпирическую функцию апостериорного распределения спроса.
31

k
у
6
г
р
Матр
M
в
ы
о
j
К
у
2
е
и
р
m
т
о
и
j
ч
п
а
3
р
д
с
г
м
p
е
т
а
а
ц
–
a
и
к
у
д
а
ч
и
A
т
т
2
а
г
в
с
в
м
и
м
в
ш
н
н
в
г
у
-
-
ш
-
а
-
р
2
= 0.6.
()
kk
12
вантиль
орядка
распре
еления е
ть то м
нималь
ое значе
ние арг
рядка 0.
Анта
одного
где
0
гий пер
(проигр
ры: игр
мента ф
равна 2
онистич
авен про
ичная иг
1,2,...,
ого и в
ша втор
к 1 фикс
нкции р
тоннам.
спредел
Это и ес
.3. Ант
ские иг
грышу
а задаёт
,
N
орого и
го) при
рует но
0
ы – игр
ругого.
я матри
1,2,...,n
роков,
выборе
ер стро
ния, при
ть оптим
гонисти
двух л
ей
соотве
имею
ij
гроками
и i, игро
котором
льный з
еские и
ц с нуле
a
ij
mn
,
ственно
смысл
чистых
к 2 одно
она ≥ p.
пас.
ры
ой сум
множест
ыигры
тратегий
ременно
Т. о. ква
ой, т.е.
а чисты
а перво
i и j. Пр
фиксир
тиль по
ыигры
х страте
о игрок
оцесс иг
ет номе
столбца
, после
его 1-й и
грок пол
чает от
32
-го сум
у aij.

Применяя принцип наилучшего гарантированного результата (как против
j
arg maxmin
природы) 1-й игрок выберет стратегию
ia
*
i
.
ij
j
max min
i
a
–
ij
j
(15)
– наилучший гарантированный результат 1-го игрока (меньше этого он не получит). Критерий Вальда применительно ко 2-му игроку: при любом моём j я
max
a
проиграю в худшем случае
наименьшим:
arg minmax
*
j
i
, тогда я выберу j, чтобы этот максимум был
ij
i
a
.
ij
min max
j
a
–
ij
i
(16)
– наилучший гарантированный результат 2-го игрока (больше этого он не про-
играет). Поэтому при разумных действиях игроков выигрыш 1-го лежит между
значениями (15) и (16).
Пример 3.3
Саша и Лиза условились встретиться зимой у кинотеатра. Если оба приходят
вовремя (рано), то выигрыш Саши +2, если Саша рано, а Лиза поздно, ему приходится мёрзнуть и свой выи
грыш при этом он оценивает в 0.
Если Лиза рано
он поздно, то хуже всего -2. Если оба опаздывают, то +1.
20
A
21
. Оптимальная стратегия Саши
i
arg max 1
*
но, наилучший гарантированный результат 0). У Лизы
j
0
i
*
2
arg min 2 1 2
j
(ходить ра-
(хо-
дить поздно, наилучший гарантированный результат 1 – больше она не проиграет). Итак, Саша ходит рано, Лиза поздно и проигрывает всегда 0, хотя была
готова к 1.
Если величины (15) и (16) равны,
max min min max
ii
aav
ij ij
jj
, игра называет-
ся вполне определённой и выигрыш 1-го игрока v называется ценой игры и v =
. Нахождение тройки (i*, j*, v) называется решением игры.
a
ij
**
33

Элемент матрицы
pqp
p
A
p
r
называется седловой точкой, если он обладает следую-
a
ij
**
щими свойствами: является минимальным элементом строки и в то же время –
максимальным элементом столбца.
Пример 3.4
113
324, 2
Aaседловая точка
509
22
.
Если игра имеет седловую точку, то её решение
,,
ija
**
если 1-й игрок выберет i*, то его выигрыш составит не менее
. Действительно,
ij
**
(все остальные
a
ij
**
элементы строки ещё больше). Если 1-й игрок выберет строку отличную от i*,
то он не может гарантировать себе
, т.к. 2-й игрок может выбрать j*. Поэто-
a
ij
**
му 1-й выбирает i*, аналогично 2-й – j*.
Пример 3.3 (продолжение)
Седловой точки нет. Саша, видя, что Лиза приходит всё время поздно, решил
сам приходить поздно и выигрывать по 1 (вместо 0). Теперь Лизе стало хуже, и
она неожиданно пришла рано и Саша выиграл -2. Тогда он решил прибегнуть к
вероятностной (смешанной) стратегии.
Смешанные стратегии игроков в матрично
11
векторами
urr
p и q
22
... ...
mn
q
, где pi и qj – вероятности выбора чистых страте-
q
й игре с матрицей А за
даются
гий i и j.
Обозначим
,0, 1, 1
pq p q
ij i j
ij
ur
(,)
pj ap
m
i
ij i
применении им смешанной стратегии
.
– усреднённый выигрыш первого игрока при
, в то время как второй игрок придер-
живается постоянно чистой стратегии j.
34

A
r
r
A
p
rrr
A
p
rr
p
rr
A
p
rr
p
rrr
A
rr r
r
A
rr
(, )
iq aq
n
j
– усреднённый выигрыш первого игрока при применении
ij j
им чистой стратегии i, когда второй придерживается смешанной стратегии
urr
(,)
pq a pq
mn
ij
ij i j
– усреднённый выигрыш первого игрока, при примене-
нии обоими смешанных стратегий.
И теперь опять максиминный подход, но уже к выбору смешанных стратегий
*argmaxmin(,)
r
p
rrr
*argminmax(,)
qApq
r
q
r
q
r
p
Apq
. В отличие от чистых стратегий имеет место сле-
дующая теорема.
Теорема Неймана (теорема о минимаксе)
Любая матричная игра имеет седловую точку в смешанных стратегиях: су-
urr
**
ществует пара
urr urr urr
**
( , ) max min ( , ) min max ( , )
pq Apq Apq v
,pq
, для которой
rr
rr
qq
pp
.
.
q
Тройка
(*,*,)
qv
– решение игры в смешанных стратегиях.
Доказательство
Очевидно, если матричная игра с матрицей А имела решение
смешанных стратегиях, то матричная игра с платёжной матрицей
будет иметь решение
(*,*, )
qvc
. Поэтому, всегда можно считать
(*,*,)
'
a
ij
Покажем эквивалентность игры задаче линейного программирования.
Первый игрок ищет свою оптимальную стратегию:
Обозначим
() max
vp
r
p
min ( , ) ( )
r
q
при ограничениях
pq v p
, тогда
(,) ()
pj vp
pp
i
.
1, 0
ii
*argmaxmin(,)
r
p
r
q
Apq
Первое следует из того, что отдельное всегда не больше минимального.
qv
()
0
в
ac
ij
.
.
35

Поделим всё на
r
p
p
p
rr
A
urr
p
r
() 0vp
.
m
1
r
vp
()
min
r
i
m
i
чу линейного программирования
m
*, *
xx
ii
i
1
max
v
p
i
a
ij
vp
()
1
r
. Обозначим
pp
ii
rrr
() () ()
vp vp vp
. Затем
1
,0
m
i
max
min
.
x
i
**
xv
ii
x
i
m
ax
,
i
x
i
ij i
0
1
Аналогичные преобразования для второго игрока приведут к
n
n
j
y
j
max
ay
,
ij j
j
y
j
1
– двойственной задаче линейного программирования.
0
p
i
, получим зада-
r
()
vp
. Решая ее, находим
mn
**
xy
ij
ij
, т.е.
max min
vvv
что
Из теории двойственности
11
max min
vv
доказывает теорему Неймана.
Как всякая седловая точка,
urr urr urr
****
(, ) ( , ) ( ,)
pq v A p q A p q
, для любых
(*,*)
обладает свойством устойчивости
q
, то есть никому из игроков не
,pq
выгодно в своём выборе стратегий отклоняться от неё. Более того, если один из
участников игры придерживается своей оптимальной смешанной стратегии, то
ожидаемый выигрыш остаётся неизменным и равным v , независимо от характера действий другого участника, в пределах его стратегий, входящих в его оптимальную смешанную стратегию.
Отсюда следует
, что в игре против природы нужно придерживаться
.
*
36

Пример 3.3 (продолжение)
r
r
r
51 1
xx
53
'3
AA
3/5
r
*,'30.4
pvv
2/5
14
12
xx
34 1
,
12
xx
12
min
r
x
3/17
*
2/17
1
* * 5 /17, ' 17 / 5
xx v
12
'
v
. Оптимальная смешанная стратегия Саши: с вероятно-
стью 3/5 приходить рано и с вероятностью 2/5 приходить поздно. При этом
средний за поход выигрыш будет 0.4.
Оптимальную смешанную стратегию Лизы можно найти через условия до-
полняющей не жёсткости:
5*3*1
yy
12
1*4*1
yy
12
4/17
r
*
y
1/17
r
q
1/5
*
4/5
.
3.4. Приближённое решение матричной игры
итеративным методом Брауна – Робинсона
Пример 3.5
842
284
A
Платёжная матрица
128
.
На первом шаге (фиктивном разыгрывании) k =1, игроки выбирают страте-
гии произвольно. Пусть
1
1
1i
,
. Вектора чисел использованных стратегий
1j
после k = 1 шагов
1
(1,0,0)
T
,
1
(1,0, 0)
T
. На втором и последующих шагах k
= 2,3,… игрок 1 выбирает стратегию, максимизирующую его выигрыш против
смешанной стратегии 2-го игрока, оценённой по всем предшествующим шагам
1
k
r
q
1
k
kk kk
iaq a A
:
1
k
111
arg max arg max arg max
iii
jj
ij j ij j
r
.
37

При этом
j
j
rr
r
rr
rr
11
kk
vaq
k
ij
j
–больше этого 2-й игрок не проиграет в среднем.
kkkT
arg min arg min
Аналогично, 2-й игрок выбирает
1k
v
этом
– меньше этого 1-й игрок не выиграет в среднем. Пересчёт чисел ис-
jj
i
пользованных стратегий перед следующим шагом
k
– аналогично.
8421 8
21
arg max argmax 2 8 4 0 arg max 2 1
iA
k = 2.
21
21
jA
(1,0, 0) (2,0, 0)
r
arg min arg min 1 0 0 2 8 4 3
T
jj
r
ii i
TT
128 0 1
.
842
128
11
ap A
ij j
kk T
1
,
1
2v
,
r
. При
(0,...,1,...,0)
k
i
1
,
8v
,
, для
21
(0,0,1) (1,0,1)
TT
и т. д.
После 8 шагов (итераций) оценки смешанных стратегий игроков
r
8
33
p
[max ,min ] [3.875,5]
k
2
888
kk
vv
k
T
,
r
8
q
Кстати, точное решение
14
888
.
20 20 196
45 45 45 45 45 45 45
T
3
. Цена игры заключена в отрезке
11 14 14 11
TT
.
38

3.5. Физическая смесь стратегий. Распределение капиталовложений на
основании игровых критериев
*
p
1
*
Полученное оптимальное решение
r
p
*
p
2
очевидно легко применить в
...
*
p
m
задачах тактических, характеризующихся многократным выбором способа дей-
ствий. А если решение принимается только 1 раз?
Пример 3.6
Вы собираетесь организовать транспортную фирму и решаете, какие авто-
мобили закупить?
Тип авто Вид груза
1 (лёгкий) 2 3 4 5 (тяжелый)
КамАз 200 400 600 400 700
ЗИЛ 300 400 600 500 800
Газель 400 500 600 500 800
ИЖ-2715 700 300 500 200 100
В таблице указана прибыль от перевозки разного вида грузов на разных ав-
томобилях. Если подвернётся тяжёлый груз, то хорошо бы иметь КамАз или
ЗИЛ, лёгкий – Газель или ИЖ.
Рассмотрим это как игру. Очевидно, матрицу можно упростить, откинув за-
ведомо неиспользуемые строки и столбцы.
39

Тип авто Вид груза
1 (лёгкий) 4 5 (тяжелый)
Газель 400 500 800
ИЖ-2715 700 200 100
5/6
r
* , 450
pv
Решая эту игру, получим
1/6
. Но вы не можете начинать
каждое новое утро то с ИЖ, то с Газелями (в 5 раз чаще). Вместо этого вы закупаете и ИЖ, и Газели в соотношении 5:1, то есть смешали стратегии не во
времени, а физически.
Физическая смесь стратегий – реализация сразу нескольких технологических или конструкторских решений в пропорциях, которые вытекают из исследования игровой модели.
Упражнения
Упражнение 3.1
В операции с критерием эффективности W(a,θ):
1 2 3 0
1 3 2 4
3 1 3 0
1 0 5 1
0 2 2 3
указать множество стратегий M
, найти оценки эффективности всех стратегий,
0
оптимальные стратегии по критерию Вальда, наилучший гарантированный результат в M
ца (с
= 0.5).
. Найти оптимальные стратегии по критериям макси-макса, Гурви-
0
40
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
