Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Теория принятия решений. Учебное пособие-1

.pdf
Скачиваний:
1
Добавлен:
07.09.2026
Размер:
1 Мб
Скачать
☆
То есть всё второму.
x
Пусть R = 2. Ясно, что
33 2
uu x
**

(2) 2 2 2 0

22 1 11
ux x ux
** * **
0000 0
3
*
k
k
*
k
u
*
k
()
zx
*
k
.
2xR
0 1 2 3
0 0 0 2
– 0 0 2
– 0 0 8
То есть всё третьему.
4.2. Задача о замене оборудования
Пример 4.3
В начальный момент времени k = 0 на предприятии установлено новое обо­рудование. Зависимость его производительности и затрат на содержание и ре­монт от времени эксплуатации приведена в таблице.
Возраст оборудования t 0 1 2 3 4 5
Годовой выпуск продукции r(t),
80 75 65 60 60 55
тыс. руб. Ежегодные затраты c(t), тыс. руб. 20 25 30 35 45 55
Зная, что затраты связанные с приобретением и установкой такого же нового оборудования составляют p = 40 тыс. руб., а заменяемое оборудование списы­вается, составить такой план замены оборудования в течение 5 лет, при кото­ром общая прибыль за данный период максимальна.
51
Состояние системы (предприятия) на момент начала очередного года k = 0,
x
f
x
x
f
1, 2, 3, 4, когда должно приниматься решение о замене или не замене оборудо-
k
вания (управление), характеризуется одной величиной
– возраст оборудо-
вания. Конечное состояние может быть различным и чтобы рассмотреть сразу все возможности, удобно вести анализ с конца (обратная схема). Обозначим
k
– оптимальное значение целевой функции, сложившееся из шагов после
()
x
k
состояния
k
, т.е. за последние (K - k) шагов. Аналогично предыдущему
11
kkkk
fx wxu fx kKK
kkk
 
fx
K

( ) opt{ ( , ) ( )}, , 1,...,1
1
()0

k
u
K
– уравнение Беллмана в обратной форме.
В нашем примере прибыль в k-м периоде
11
kkk

()(), 1(оставить)
rx cx u
(0) (0) , 0(купить новое)
rc pu

 
k
wx u
1
kk
(,)
k
 
После расчётов по (19) получим ответ
k
k
*
0 1 2 3 4 5
0 1 2 3 1 2
–
(19)
.
k
u
*
k
()
x
k
*
– ост. ост. ост. замен. ост.
215 155 105 70 50 0
т.е. максимальная прибыль 215 тыс. руб. будет получена при замене оборудо­вания после 3-х лет работы.
52
4.3. Управление конечным состоянием (задача Майера)
x
x
x
x
x
В ряде задач траектория изменения состояния системы интереса не пред-
ставляет, а существенным является
K
– конечное состояние системы, т.к. весь
проигрыш (выигрыш) определяется только им.
Если известно начальное состояние уравнения Беллмана (17), только теперь
11
KK KKK K

(,) ((,),)()
wxuw xuuwx
KK

0
, то можно применить прямую форму
1
kk
wx u k K
k

(,)0,1,2,..., 1
, а
– известная функция от конечного
состояния.
Пример 4.4
0
7
Самолёт заходит на посадку и находится на высоте
м. Нужно за три
шага посадить его на землю. На отдельных шагах выдаются импульсы «вниз –
1kk k
xu
вверх» так что состояние изменяется по закону
чения управлений
12 3
{ 1,0,1}, { 4,0,4}, { 9,0,9}uu u  
квадратом отклонения от 0 в конце процесса, т.е.
()( 0)wx x
. Допустимые зна-
. Потери оцениваются
332
.
Ответ:
k
k
*
k
u
*
k
()
zx
k
*
0 1 2 3
7 8 8 -1
– +1 0 -9
0 0 0 1
4.4. Решение задачи коммивояжёра методом динамического программирования
Здесь в качестве этапов рассматриваются под маршруты, начинающиеся в
исходном городе и включающие всё большее число городов. При этом отбра-
53
сываются «бесперспективные» более длинные варианты, относящиеся к одному и тому же множеству городов и оканчивающиеся в одном и том же городе.
4.5. Стохастические модели динамического программирования
Стохастический – от греческого слова «благоразумный», т. е. модели при­меняются к случайным, вероятностным явлениям. Здесь после вашего управле­ния «природа» добавляет своё случайное управление и новое состояние стано-
1
kk
вится случайным. И выигрыш на этапе может быть случайным
Wx u
(,)
k
, и
оптимизировать можно только математическое ожидание выигрыша от этого момента (и состояния) до конца.
Дерево решений – графическое изображение последовательности решений природы и состояний системы с указанием соответствующих вероятностей и выигрышей.
Пример 4.5
Фирме предстоит принять решение: внедрять или нет в массовое производ­ство новый продукт. В начальном состоянии у фирмы есть 3 возможности: от-
54
казаться от проекта вообще (D), приступить к массовому производству (L),
f
x
f
произвести пробный сбыт небольшой партии на экспериментальном рынке (T).
При отказе – дальнейший выигрыш = 0, при L с вероятностью 0,3 может быть «успех» (прибыль 3 млн. долл.) и с вероятностью 0,7 «неудача» (убыток 0,25 млн. долл. (прибыль -0,25)). Пробный сбыт требует затрат 22500 долл. и с вероятностями 0,5; 0,25; 0,25 приводит к состоян
ям:
и
a) продукт продегустировали < 10% потребителей;
b) продукт продегустировали > 10%, купили повторно < 50% из них;
c) продукт продегустировали > 10%, купили повторно > 50% из них.
После каждого из них можно отказаться от проекта или запустить массовое производство, вероятности «успеха» при этом 0.06, 0.28, 0.8 соответственно. (Эти вероятности берутся из накопленной статистики по аналогичным приме­рам или из субъективных оц
енок эк
спертов). Как поступить? Что делать в начальном состоянии? Ясно, что в таких задачах мы не станем заранее связывать себя обязатель-
ствами по нашим управлениям на все шаги вперёд, а наоборот, подождём, в ка­ком состоянии окажемся накануне принятия решения и, исходя из этого, при-
1
мем решение, т.е. желательно узнать
kk
()
ux
. Такие условно оптимальные
1
k
управления даёт уравнение Беллмана в обратной форме. Обозначим
()
1
k
–
x
максимальное математическое ожидание прибыли от момента (k – 1) до K, в
1k
зависимости от имеющегося состояния
.
11
kkkk
fx MWxu fX kKK
kkk
 
fx
K

( ) max{ [ ( , ) ( )]}, , 1,...,1
1
()0

k
u
K
.
(20)
k = 2.
112
()max{ (, )}
xMWxu
12
2
u
55
1
x
x
M
f
x
x
x
M
M
f
x
x
x
x
x
x
f
O
11 S11 F11
a b c
2
u
2
w
()
x
1
k = 1.
1
u
– – –
– – – O
0 0 0 0
2
1
0 0 0 0 0,66 2,35
0011
()max{[(,) ( )]}
fx Mwxu fX
011
0
1
w
1
()
fX
1
D L T
O
0 0.725 – 0.0225
1
0 0 0,5f(a)+0,25f(b)+0,25f(c) = 0,7525
1
u
0
S11 F11
11
L D L D L
D
S21 F21 O22S22 F22 O23 S23 F
21
– 0,055 0 0,66 0 2,35
.
a b c
23
Σ 0 0.725 0,73
Т. о.
0
()
x
0
10
()ux T
*
0,73
(пробный сбыт), а мы и есть в
0
, значит это безусловно опти-
мальное управление. Ожидаемая прибыль за все этапы
долл. Из приведённых таблиц следует, если
122
 
auuaD
**
122
 
buubL
**
122
 
cuucL
**
k
k
*
1*ku
k
()
x
*
k
() ;
() ;
() .
0 1
0
a b c
T D L L
0,73 0 0,66 2,35
*0
00
()0,73ffx
млн.
56
Ожидаемое значение прибыли с момента 1 может быть больше, чем с мо-
x
мента 0 (2,35 > 0,73).
4.6. Управляемые марковские процессы
Пример 4.6 [10]
Киоск продаёт или Кока-Колу, или Пепси-Колу. Поставки делаются на неде-
лю. В конце недели владелец киоска может быть в состоянии успеха от продаж
, x = 1) или неудачи (S2, x = 2). Если был успех, марка напитка не менялась,
(S
1
если неудача – марка менялась на противоположную. Назовём это управлени­ем 1. При этом было замечено, что вероятности перехода между состояниями за неделю и соответствующие значения прибыли за неделю были:
SSp w
1 1 11 11
SSp w
1 2 12 12
SSp w
2 1 21 21
SSp w
2 2 22 22
,0,5,500;
 
,0,5,150;
 
,0,7,200;
 
,0,3, 400.
 
Продавец решил попробовать улучшить торговлю: после успеха стал разво-
рачивать рекламные плакаты с тем же напитком, а после неудачи – переходить на другой напиток и снижать цену на 10% (управление = 2). При этом он заме-
0,6 0, 4

(2)
P
тил

0,8 0, 2

– стало лучше, например, с большей вероятностью воз-
вращаемся к успеху. Но появились дополнительные расходы, прибыль за неде-
400 200

(2)
W
лю

100 800

, т. е. выросла только при переходе от успеха к неудаче.
Пусть у нас впереди K недель. Как следует управлять на каждой неделе, что-
бы получить максимальную суммарную прибыль? Так как переход из
жет быть в случайное состояние
k
, то в (20)
X
1k
мо-
57
1()
kk k u k
max{ [ ( , ) ( )]} max{ [ ( )]}

где
MW x u f X MW f X
k k
uu
22 2
max{ ( ) } max{ ( , ) ( ) },
wx u

k k
uu
kk k
xx x

1
kk
(,)
kk k
kk k k
() () () 1 ()
u u ku k k ku
WP fxP wxu fxP
11 1 1

kk kk kk kk
xx xx xx xx
11 1
 
kk
– вектор из диагональных элементов произведения матриц
k
1
kk
xX
kk
() ()
uuT
()
PW
Пусть K = 4.
334
()max{(,)0}max{ }
k = 4.
k = 3.
Значит,
k = 2.
k = 1.
fx wxu
3
fx wxu P fx
23
32
()
ux
1
()
fx
fx
1
0
()
0
1
kx
. Первая координата при
325 320 325

44
uu
2
223()3
 
( ) max{ ( , ) ( )} max{ ; }
735,2
 
462,15

945,98


673,285

33
uu
2

.

1

2
21
ux
.
ux
.
()
10

 
()
1
3
x
1
.
2
 
1

u
23
xx
.
1
– «успех», вторая при «неудаче».

20 80 20
3
 
1
43
()
ux
.
497,5 523 523
 
253,5 184 253,5

 
1

.
.
Таким образом оптимальное управление для периодов (недель) 1, 2, 3:
– если предшествующая неделя была успешной – управление 2 (разворачивать рекламу, оставить напиток); – если предшествующая неделя была неудачной – управление 1 (просто сме-
нить напиток, никаких дополнительных мер).
Для последней недели k = K = 4:
– если предшествующая неделя была успешной – управление 1 (ничего не де­лать, оставить напиток); – если предшествующая не
ля была неудачной – управление 1 (просто сме-
де
нить напиток, никаких дополнительных мер).
58
При этом если вы начинали после успеха, вас ждёт в среднем оптимальная
K
x
x
x
прибыль 945,98 руб. за 4 недели, если начинали после неудачи, то 673,285 руб. Или средняя еженедельная прибыль в этих случаях 236,495 и 168,321 руб.
Ясно, что при
 и таком же оптимальном управлении, начало забыва-
ется и средняя еженедельная прибыль в этих случаях сближается (можно пока­зать, к 210,91 руб.).
Задача о наилучшем выборе
Невеста выбирает себе жениха из N претендентов, которые появляются по
одному. Ясно, что один из них наилучший, но отвергнутого уже вернуть нельзя. Процесс выбора заканчивается, как только невеста останавливается на каком­либо очередном претенденте. Как ей поступить?
Ограничимся процедурами отбора следующего типа: первый жених либо
принимается, либо отвергается. Если он отвергается, то автоматически отвер­гаются и все последующие женихи, которые хуже, чем первый, и следующе
е решение принимается лишь при появлении жениха лучшего, чем первый. И так далее.
Обозначим k = 0, 1, 2, …– моменты появления очередных лидеров. Состоя-
ние системы в каждый из этих моментов описывается
ло уже появившихся), ставшего лидером в момент k. Т. о.
k
– номер жениха (чис-
0
1x
и т.д. В каж-
дый момент k – 1 (т. е. на этапе от k –1 до k) мы можем применить управление
k
u
(= 1 – принять соответствующего лидера за жениха, = 2 – продолжить
осмотр следующих).
Цель – максимизировать мат. ожидание вероятности того, что выбранный на
k* этапе (в момент k*– 1 ) жених является наилучшим из всех.
Если выбор останавливается на
1
kk
(, 1)
он и есть наилучший:
wx u

1k
-м по счёту женихе, то вероятность, что
1
k
.
N
59
Это вероятность, что один конкретный (наилучший вообще) из N попадёт в
x
x
x
f
x
x
x
x
x
x
x
1k
первые
человек (то, что он будет являться последним из этих – не важно,
просто мы при этом как раз остановимся).
k
(2)
u
Каковы вероятности переходов
k
(2) 1 1
ukk k k

pPxxP x x
kk
1
,
xx
[(в диапазоне 1, 2,..., 1 лидера не было)
Pxxx

kk
(- мбудетлучшийиз )] .
xx

Пусть
(| ) (следующий лидер будет - м|предыдущий был - м)

11
kk k

1
k
()
1
k
– максимальное математическое ожидание вероятности выбо-
x
ра наилучшего на шагах с k – 1 до последнего в зависимости от состояния
p
1
k
x
kk
1
?
1
kk
,
x
1
x
1k
Уравнение Беллмана
.
fx wxu fxP
1
kk

k
u
kkk ku
11 (2)

()max{(, 1), () }
K
kk
xx

1
1
k
kk
1
,
xx
,
второе выражение соответствует управлению «продолжить».
k
Если
N
, то ясно
взять! Так как
kk
()1
ux N
– «брать», и
N
k
xN
k
()1
fx N
k
Pwxu
1(,1)

1
kk
xx
1
k
()
fx
1
k
, абсолютный лидер – последний, его
11
kk
NN N
(1)

1
k
.
1
kk
x
, значит
N
Так будет, пока второе выражение не превысит первое, тогда впервые (с
конца) условно оптимальным управлением будет «продолжить», т. е.
**1
kk
NN
*1 *
kk
xx
N

1
P
kk
xx
**1
,
x
или
***1
kkk
NxxN
*1 *
kk
xx
N

xx
kk

*1 *1
1
1
1
,
N
1
lm

торого
1
. Отсюда находим
l
1
1
*1k
u
= «продолжить», при меньших
mx
max
Т. о. нужно последним пропустить лидера с номером
*
k
– номер человека-лидера, после ко-
k
1k
u
также будет «продолжить».
m
(если он, очередной
max
60
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]