Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Теория принятия решений. Учебное пособие-1
.pdf
То есть всё второму.
x
Пусть R = 2. Ясно, что
33 2
uu x
**
(2) 2 2 2 0
22 1 11
ux x ux
** * **
0000 0
3
*
k
k
*
k
u
*
k
()
zx
*
k
.
2xR
0 1 2 3
0 0 0 2
– 0 0 2
– 0 0 8
То есть всё третьему.
4.2. Задача о замене оборудования
Пример 4.3
В начальный момент времени k = 0 на предприятии установлено новое оборудование. Зависимость его производительности и затрат на содержание и ремонт от времени эксплуатации приведена в таблице.
Возраст оборудования t 0 1 2 3 4 5
Годовой выпуск продукции r(t),
80 75 65 60 60 55
тыс. руб.
Ежегодные затраты c(t), тыс. руб. 20 25 30 35 45 55
Зная, что затраты связанные с приобретением и установкой такого же нового
оборудования составляют p = 40 тыс. руб., а заменяемое оборудование списывается, составить такой план замены оборудования в течение 5 лет, при котором общая прибыль за данный период максимальна.
51

Состояние системы (предприятия) на момент начала очередного года k = 0,
x
f
x
x
f
1, 2, 3, 4, когда должно приниматься решение о замене или не замене оборудо-
k
вания (управление), характеризуется одной величиной
– возраст оборудо-
вания. Конечное состояние может быть различным и чтобы рассмотреть сразу
все возможности, удобно вести анализ с конца (обратная схема). Обозначим
k
– оптимальное значение целевой функции, сложившееся из шагов после
()
x
k
состояния
k
, т.е. за последние (K - k) шагов. Аналогично предыдущему
11
kkkk
fx wxu fx kKK
kkk
fx
K
( ) opt{ ( , ) ( )}, , 1,...,1
1
()0
k
u
K
– уравнение Беллмана в обратной форме.
В нашем примере прибыль в k-м периоде
11
kkk
()(), 1(оставить)
rx cx u
(0) (0) , 0(купить новое)
rc pu
k
wx u
1
kk
(,)
k
После расчётов по (19) получим ответ
k
k
*
0 1 2 3 4 5
0 1 2 3 1 2
–
(19)
.
k
u
*
k
()
x
k
*
– ост. ост. ост. замен. ост.
215 155 105 70 50 0
т.е. максимальная прибыль 215 тыс. руб. будет получена при замене оборудования после 3-х лет работы.
52

4.3. Управление конечным состоянием (задача Майера)
x
x
x
x
x
В ряде задач траектория изменения состояния системы интереса не пред-
ставляет, а существенным является
K
– конечное состояние системы, т.к. весь
проигрыш (выигрыш) определяется только им.
Если известно начальное состояние
уравнения Беллмана (17), только теперь
11
KK KKK K
(,) ((,),)()
wxuw xuuwx
KK
0
, то можно применить прямую форму
1
kk
wx u k K
k
(,)0,1,2,..., 1
, а
– известная функция от конечного
состояния.
Пример 4.4
0
7
Самолёт заходит на посадку и находится на высоте
м. Нужно за три
шага посадить его на землю. На отдельных шагах выдаются импульсы «вниз –
1kk k
xu
вверх» так что состояние изменяется по закону
чения управлений
12 3
{ 1,0,1}, { 4,0,4}, { 9,0,9}uu u
квадратом отклонения от 0 в конце процесса, т.е.
()( 0)wx x
. Допустимые зна-
. Потери оцениваются
332
.
Ответ:
k
k
*
k
u
*
k
()
zx
k
*
0 1 2 3
7 8 8 -1
– +1 0 -9
0 0 0 1
4.4. Решение задачи коммивояжёра методом
динамического программирования
Здесь в качестве этапов рассматриваются под маршруты, начинающиеся в
исходном городе и включающие всё большее число городов. При этом отбра-
53

сываются «бесперспективные» более длинные варианты, относящиеся к одному
и тому же множеству городов и оканчивающиеся в одном и том же городе.
4.5. Стохастические модели динамического программирования
Стохастический – от греческого слова «благоразумный», т. е. модели применяются к случайным, вероятностным явлениям. Здесь после вашего управления «природа» добавляет своё случайное управление и новое состояние стано-
1
kk
вится случайным. И выигрыш на этапе может быть случайным
Wx u
(,)
k
, и
оптимизировать можно только математическое ожидание выигрыша от этого
момента (и состояния) до конца.
Дерево решений – графическое изображение последовательности решений
природы и состояний системы с указанием соответствующих вероятностей и
выигрышей.
Пример 4.5
Фирме предстоит принять решение: внедрять или нет в массовое производство новый продукт. В начальном состоянии у фирмы есть 3 возможности: от-
54

казаться от проекта вообще (D), приступить к массовому производству (L),
f
x
f
произвести пробный сбыт небольшой партии на экспериментальном рынке (T).
При отказе – дальнейший выигрыш = 0, при L с вероятностью 0,3 может
быть «успех» (прибыль 3 млн. долл.) и с вероятностью 0,7 «неудача» (убыток
0,25 млн. долл. (прибыль -0,25)). Пробный сбыт требует затрат 22500 долл. и с
вероятностями 0,5; 0,25; 0,25 приводит к состоян
ям:
и
a) продукт продегустировали < 10% потребителей;
b) продукт продегустировали > 10%, купили повторно < 50% из них;
c) продукт продегустировали > 10%, купили повторно > 50% из них.
После каждого из них можно отказаться от проекта или запустить массовое
производство, вероятности «успеха» при этом 0.06, 0.28, 0.8 соответственно.
(Эти вероятности берутся из накопленной статистики по аналогичным примерам или из субъективных оц
енок эк
спертов).
Как поступить? Что делать в начальном состоянии?
Ясно, что в таких задачах мы не станем заранее связывать себя обязатель-
ствами по нашим управлениям на все шаги вперёд, а наоборот, подождём, в каком состоянии окажемся накануне принятия решения и, исходя из этого, при-
1
мем решение, т.е. желательно узнать
kk
()
ux
. Такие условно оптимальные
1
k
управления даёт уравнение Беллмана в обратной форме. Обозначим
()
1
k
–
x
максимальное математическое ожидание прибыли от момента (k – 1) до K, в
1k
зависимости от имеющегося состояния
.
11
kkkk
fx MWxu fX kKK
kkk
fx
K
( ) max{ [ ( , ) ( )]}, , 1,...,1
1
()0
k
u
K
.
(20)
k = 2.
112
()max{ (, )}
xMWxu
12
2
u
55

1
x
x
M
f
x
x
x
M
M
f
x
x
x
x
x
x
f
O
11 S11 F11
a b c
2
u
2
w
()
x
1
k = 1.
1
u
– – –
– – – O
0 0 0 0
2
1
0 0 0 0 0,66 2,35
0011
()max{[(,) ( )]}
fx Mwxu fX
011
0
1
w
1
()
fX
1
D L T
O
0 0.725 – 0.0225
1
0 0 0,5f(a)+0,25f(b)+0,25f(c) = 0,7525
1
u
0
S11 F11
11
L D L D L
D
S21 F21 O22S22 F22 O23 S23 F
21
– 0,055 0 0,66 0 2,35
.
a b c
23
Σ 0 0.725 0,73
Т. о.
0
()
x
0
10
()ux T
*
0,73
(пробный сбыт), а мы и есть в
0
, значит это безусловно опти-
мальное управление. Ожидаемая прибыль за все этапы
долл. Из приведённых таблиц следует, если
122
auuaD
**
122
buubL
**
122
cuucL
**
k
k
*
1*ku
k
()
x
*
k
() ;
() ;
() .
0 1
0
a b c
T D L L
0,73 0 0,66 2,35
*0
00
()0,73ffx
млн.
56

Ожидаемое значение прибыли с момента 1 может быть больше, чем с мо-
x
мента 0 (2,35 > 0,73).
4.6. Управляемые марковские процессы
Пример 4.6 [10]
Киоск продаёт или Кока-Колу, или Пепси-Колу. Поставки делаются на неде-
лю. В конце недели владелец киоска может быть в состоянии успеха от продаж
, x = 1) или неудачи (S2, x = 2). Если был успех, марка напитка не менялась,
(S
1
если неудача – марка менялась на противоположную. Назовём это управлением 1. При этом было замечено, что вероятности перехода между состояниями
за неделю и соответствующие значения прибыли за неделю были:
SSp w
1 1 11 11
SSp w
1 2 12 12
SSp w
2 1 21 21
SSp w
2 2 22 22
,0,5,500;
,0,5,150;
,0,7,200;
,0,3, 400.
Продавец решил попробовать улучшить торговлю: после успеха стал разво-
рачивать рекламные плакаты с тем же напитком, а после неудачи – переходить
на другой напиток и снижать цену на 10% (управление = 2). При этом он заме-
0,6 0, 4
(2)
P
тил
0,8 0, 2
– стало лучше, например, с большей вероятностью воз-
вращаемся к успеху. Но появились дополнительные расходы, прибыль за неде-
400 200
(2)
W
лю
100 800
, т. е. выросла только при переходе от успеха к неудаче.
Пусть у нас впереди K недель. Как следует управлять на каждой неделе, что-
бы получить максимальную суммарную прибыль? Так как переход из
жет быть в случайное состояние
k
, то в (20)
X
1k
мо-
57

1()
kk k u k
max{ [ ( , ) ( )]} max{ [ ( )]}
где
MW x u f X MW f X
k k
uu
22 2
max{ ( ) } max{ ( , ) ( ) },
wx u
k k
uu
kk k
xx x
1
kk
(,)
kk k
kk k k
() () () 1 ()
u u ku k k ku
WP fxP wxu fxP
11 1 1
kk kk kk kk
xx xx xx xx
11 1
kk
– вектор из диагональных элементов произведения матриц
k
1
kk
xX
kk
() ()
uuT
()
PW
Пусть K = 4.
334
()max{(,)0}max{ }
k = 4.
k = 3.
Значит,
k = 2.
k = 1.
fx wxu
3
fx wxu P fx
23
32
()
ux
1
()
fx
fx
1
0
()
0
1
kx
. Первая координата при
325 320 325
44
uu
2
223()3
( ) max{ ( , ) ( )} max{ ; }
735,2
462,15
945,98
673,285
33
uu
2
.
1
2
21
ux
.
ux
.
()
10
()
1
3
x
1
.
2
1
u
23
xx
.
1
– «успех», вторая при «неудаче».
20 80 20
3
1
43
()
ux
.
497,5 523 523
253,5 184 253,5
1
.
.
Таким образом оптимальное управление для периодов (недель) 1, 2, 3:
– если предшествующая неделя была успешной – управление 2 (разворачивать
рекламу, оставить напиток);
– если предшествующая неделя была неудачной – управление 1 (просто сме-
нить напиток, никаких дополнительных мер).
Для последней недели k = K = 4:
– если предшествующая неделя была успешной – управление 1 (ничего не делать, оставить напиток);
– если предшествующая не
ля была неудачной – управление 1 (просто сме-
де
нить напиток, никаких дополнительных мер).
58

При этом если вы начинали после успеха, вас ждёт в среднем оптимальная
K
x
x
x
прибыль 945,98 руб. за 4 недели, если начинали после неудачи, то 673,285 руб.
Или средняя еженедельная прибыль в этих случаях 236,495 и 168,321 руб.
Ясно, что при
и таком же оптимальном управлении, начало забыва-
ется и средняя еженедельная прибыль в этих случаях сближается (можно показать, к 210,91 руб.).
Задача о наилучшем выборе
Невеста выбирает себе жениха из N претендентов, которые появляются по
одному. Ясно, что один из них наилучший, но отвергнутого уже вернуть нельзя.
Процесс выбора заканчивается, как только невеста останавливается на какомлибо очередном претенденте. Как ей поступить?
Ограничимся процедурами отбора следующего типа: первый жених либо
принимается, либо отвергается. Если он отвергается, то автоматически отвергаются и все последующие женихи, которые хуже, чем первый, и следующе
е
решение принимается лишь при появлении жениха лучшего, чем первый. И так
далее.
Обозначим k = 0, 1, 2, …– моменты появления очередных лидеров. Состоя-
ние системы в каждый из этих моментов описывается
ло уже появившихся), ставшего лидером в момент k. Т. о.
k
– номер жениха (чис-
0
1x
и т.д. В каж-
дый момент k – 1 (т. е. на этапе от k –1 до k) мы можем применить управление
k
u
(= 1 – принять соответствующего лидера за жениха, = 2 – продолжить
осмотр следующих).
Цель – максимизировать мат. ожидание вероятности того, что выбранный на
k* этапе (в момент k*– 1 ) жених является наилучшим из всех.
Если выбор останавливается на
1
kk
(, 1)
он и есть наилучший:
wx u
1k
-м по счёту женихе, то вероятность, что
1
k
.
N
59

Это вероятность, что один конкретный (наилучший вообще) из N попадёт в
x
x
x
f
x
x
x
x
x
x
x
1k
первые
человек (то, что он будет являться последним из этих – не важно,
просто мы при этом как раз остановимся).
k
(2)
u
Каковы вероятности переходов
k
(2) 1 1
ukk k k
pPxxP x x
kk
1
,
xx
[(в диапазоне 1, 2,..., 1 лидера не было)
Pxxx
kk
(- мбудетлучшийиз )] .
xx
Пусть
(| ) (следующий лидер будет - м|предыдущий был - м)
11
kk k
1
k
()
1
k
– максимальное математическое ожидание вероятности выбо-
x
ра наилучшего на шагах с k – 1 до последнего в зависимости от состояния
p
1
k
x
kk
1
?
1
kk
,
x
1
x
1k
Уравнение Беллмана
.
fx wxu fxP
1
kk
k
u
kkk ku
11 (2)
()max{(, 1), () }
K
kk
xx
1
1
k
kk
1
,
xx
,
второе выражение соответствует управлению «продолжить».
k
Если
N
, то ясно
взять! Так как
kk
()1
ux N
– «брать», и
N
k
xN
k
()1
fx N
k
Pwxu
1(,1)
1
kk
xx
1
k
()
fx
1
k
, абсолютный лидер – последний, его
11
kk
NN N
(1)
1
k
.
1
kk
x
, значит
N
Так будет, пока второе выражение не превысит первое, тогда впервые (с
конца) условно оптимальным управлением будет «продолжить», т. е.
**1
kk
NN
*1 *
kk
xx
N
1
P
kk
xx
**1
,
x
или
***1
kkk
NxxN
*1 *
kk
xx
N
xx
kk
*1 *1
1
1
1
,
N
1
lm
торого
1
. Отсюда находим
l
1
1
*1k
u
= «продолжить», при меньших
mx
max
Т. о. нужно последним пропустить лидера с номером
*
k
– номер человека-лидера, после ко-
k
1k
u
также будет «продолжить».
m
(если он, очередной
max
60
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
