Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Специальные методы исследования операций и математические модели. Курс лекций
.pdf
В разд. 4.5.1 мы ввели обозначение dk(s) = min{mk, [s / wk]}. Из mk = 1 сле-
)(,0
1kk
sd
46
)(
1*nn
sZ
)(,0
1nn
sd
)(
1*nn
sZ
;если,
,если,0
11nnn
nn
wsс
ws
.если,1
,если,0
1
1
nn
nn
ws
ws
:1,1 n
)(
1*kk
sZ
.)},(),({
,),(
11
*
11
*
1
11
*
1
nkkkkkkk
kkkk
wsеслиwsZс sZmax
wsеслиsZ
случае.противномв 1
),()(или если,0
1
*
11
*
11 kkkkkkkk
sZwsZсws
nk
kk
xw
1
nk
kk
xc
1
nk
k
c
1
)(,0
1kk
sg
47
46
47
дует, что dk(s) = 1, если s ≥ wk, и dk(s) = 0 в противном случае. Тогда из
Xk(s
k –1
) =
получаем Xk(s
) = {0, 1}, если s
k–1
≥ wk, иначе Xk(s
k –1
) = {0}.
k –1
Множество Sk состояний, возможных в начале шага k + 1, имеет вид
S0 = {K}, Sk = S
Фазовое уравнение: sk = s
Уравнение Беллмана для шага n:
k –1
{s
– wkxk.
k –1
– wk | s
k –1
k –1
S
k –1
, s
≥ wk} для k > 1.
k –1
= max{cnxn | xn
}. От-
сюда
=
Уравнение Беллмана для шага k
=
xn(s
n –1
) =
Отсюда
xk(s
k –1
) =
Обратная задача: составить набор проектов, обеспечивающий суммарный эффект не менее A с минимальными суммарными затратами. Это частный
случай ОЗР при mk = 1 для всех k. Интерпретируя xk так же, как в предыдущей
задаче, получим следующую модель:
H(x) =
→ min при условиях
≥ A, xk {0, 1} для всех k.
Легко показать, что необходимым и достаточным условием разрешимости обратной задачи является неравенство
≥ A.
Если задача разрешима, то решение можно найти методом ДП. Для этого
опишем шаги процедуры и состояния системы, как в разд. 4.5.2: состояние s
k –1
системы в начале шага k равно разности между величиной A и суммарным эффектом от проектов, выбранных до шага k, если эта разность положительна, в
противном случае s
= max{0, s
– ckxk}.
k –1
= 0. Отсюда s0 = A и фазовое уравнение имеет вид: sk =
k –1
В разд. 4.5.2 введено обозначение gk(s) = min{mk, ]s / ck[}. Из mk = 1 следует, что
gk(s) = 1, если s > 0, иначе gk(s) = 0.
получаем Xk(s
) = {0, 1}, если s
k –1
> 0, иначе
k –1
Xk(s
Тогда из Xk(s
) = {0}.
k –1
k –1
) =
Множество Sk состояний, возможных в начале шага k + 1, имеет вид
S0 = {A}, Sk = S
См. разд. 4.5.1.
См. разд. 4.5.2.
{max{0, s
k –1
– ck} | s
k –1
k–1
S
} для k > 1.
k–1
61

Уравнение Беллмана для шага n описывает формула (4.22):
)(
1*nn
sZ
)(
1*nn
sZ
)(
1*nn
sZ
)(
1*nn
sZ
:1,1 n
)(
1*kk
sZ
}),0{(
1
*
1 kkkk
xcsmaxZ
}),0{(
1
*
1 kkkk
xcsmaxZ
)(
1*kk
sZ
)0(
*
1k
Z
)(
1*kk
sZ
)({
1
*
1 kk
sZ
)}0(
*
1k
Z
)({
1
*
1 kk
sZ
)(
1*kk
sZ
)}.(),({
1
*
11
*
1 kkkkkk
csZwsZmin
)(
1
*
1 kk
sZ
)(
1
*
1 kk
sZ
).(
1
*
1 kkk
сsZ
T,1
n,1
1,1 T
htk(xtk) ≤ gtk(xtk) для всех t, k.
(4.25)
= inf{wnxn | xn Xn(s
Если s
Если 0 < s
= 0, то Xn(s
n –1
≤ cn, то Xn(s
n–1
) = {0}, xn(s
n –1
только при xn = 1, поэтому xn(s
Если cn < s
ние xn(s
) не определено,
n –1
, то условие s
n –1
Таким образом, уравнение Беллмана для шага n решается формульно.
Уравнение Беллмана для шага k
= inf{wkxk +
Положим Zk(xk, s
Если s
Если 0 < s
= 0, то Xk(s
k –1
≤ ck, то Xk(s
k –1
) = wkxk +
k –1
) = {0}, xk(s
k –1
k –1
Следовательно,
и
= inf{Zk(0, s
Если s
> ck, то, как в предыдущем случае, Xk(s
k –1
= inf{Zk(0, s
Следовательно, xk(s
), Zk(1, s
k –1
), Zk(1, s
k–1
) = 0, если выполнено хотя бы одно из следующих
k –1
условий:
(а) s
= 0; (б) 0 < s
k –1
), s
n –1
) = 0 и
n –1
) = {0, 1}. Условие s
n –1
) = 1 и
n –1
≤ cnxn не выполняется для xn {0, 1}, значе-
n –1
= wn.
≤ cnxn}.
n –1
= 0.
n –1
≤ cnxn выполняется
= + ∞.
| xk Xk(s
.
) = 0 и
k –1
= Zk(0, 0) =
) = {0, 1}. При xk = 1 имеем sk = max{0, s
)} = inf
k –1
k–1
)} =
≤ ck и
k –1
, wk +
) = {0, 1}
k –1
≤ wk;
= inf
)}.
k –1
– ckxk} = 0.
k –1
= 0.
, wk}.
(в) s
В остальных случаях xk(s
> ck и
k –1
k –1
) = 1.
≤ wk +
4.6. Распределение воспроизводимого ресурса в динамике
4.6.1. Распределение пополняемого инвестиционного фонда
В этом разделе будем считать, что распределяемым и воспроизводимым
ресурсом являются денежные инвестиции. Предположим, что экономическая
система может использовать n технологических способов (например, предприятий) в течение T периодов (лет). В начале планового периода система создает
инвестиционный фонд K0 д. е. В начале года t
каждое предприятие k
получает из этого фонда инвестиции в размере xtk, вследствие чего генерирует к
концу года прибыль gtk(xtk). За использование инвестиций года t
пред-
приятие k обязано в конце года внести (из прибыли) сумму htk(xtk) в инвестиционный фонд. Оставшуюся часть прибыли года t (всю прибыль при t = T ) предприятие потребляет в конце года.
Для реализуемости описанной схемы необходимо предположить, что
62

Нужно так распределить инвестиции каждого года, чтобы максимизиро-
T,1
n,1
1,1 T
.)(λ)]()([λ
1
1
1 1
n
k
TkTk
T
T
t
n
k
tktktktk
t
xgxhxg
f(x) =
n
k
TkTk
T
T
t
n
k
tktktktk
t
xgxhxg
1
1
1
1 1
1
)(λ)]()([λ
→ max при условиях
nk
tk
x
1
= K
t – 1
для t
T,1
, xtk ≥ 0 для всех t и k,
(4.26)
Kt =
nk
tktk
xh
1
)(
для t
.1,1 T
(4.27)
T,1
n,1
.,1 n
H
t 0
= 0, H
t k
= H
t,k –1
+ h tk(x
t k
) для всех k и t
,1,1 T
H
T,k
= 0 для всех k.
(4.28)
K
1,0
= K0, K
t 0
= H
t –1,n
для t
,,2 T
Ktk = K
t,k –1
– xtk для всех t и k.
(4.29)
)0,(
1,*nTTn
KZ
48
вать суммарное (за плановый период) приведённое потребление. Это один из
вариантов задачи Вентцель48.
Предположение 4.6. Весь инвестиционный фонд распределяется.
Предположение 4.6 выполняется, если один из участвующих в задаче
технологических способов (например, первый) «передает» средства из года t в
год t + 1 c некоторой доходностью rt: gt1(xt1) = ht1(xt1) = (1 + rt)xt1. При этом
предположении инвестиционный фонд года t > 1 равен сумме взносов, сделанных предприятиями (способами) в году t – 1.
Положим x = (xtk | t
ент дисконтирования, Kt для t
, k
). Пусть λ (0, 1] – годовой коэффици-
– величина инвестиционного фонда в
конце года t (после отчислений года t, но до распределения средств на год t + 1).
Сумма, потребляемая в конце года t, дисконтируется с коэффициентом λt. Поэтому суммарное приведённое потребление описывается следующим образом:
С(x) =
Исключив из С(x) множитель , запишем математическую модель задачи:
Чтобы перейти к методу ДП, условимся, что на этапе t
распределение инвестиционного фонда в году t, то есть вектор x(t) = (xtk | k
выбирается
). В
отличие от ранее рассмотренных задач, здесь управление каждого этапа является вектором, поэтому этап t разобьем на шаги (t, k), k
На шаге (t, k) опре-
деляется значение xtk. Состояние системы в начале шага (t, k) опишем двумя параметрами: величиной K
в начале этапа t) и суммой H
нераспределенных инвестиций (Kt0 – размер фонда
t,k –1
вкладов в инвестиционный фонд года t + 1,
t,k –1
обеспеченных выделением средств на шагах (t, 1), … (t, k – 1). Понятно, что
Формулы (4.28) и (4.29) указывают начальное состояние (K
1,0
, H
) = (K0,
1, 0
0) и уравнения перехода. Множество допустимых управлений шага (t, k) имеет
вид Xtk = [0, K
t,k –1
].
Уравнение Беллмана для шага (T, n) (последний шаг процесса):
= max{g
T,n(xT, n
) | x
T,n
X
T,n
}.
См.: Вентцель Е. С. Исследование операций. – М.: Сов. радио, 1972. – С. 154–162; Гимади А. Х. Матема-
тические модели и методы принятия решений / А. Х. Гимади, Н. И. Глебов. – Новоcибирск: НГУ, 2008 (разд. 1.9).
63

При естественном предположении, что gTn – неубывающая функция, имеем
)0,(
1,
*
, nTnT
KZ
1,1 n
)0,(
1,*kTTk
KZ
)0,(
1,
*
1, TkkTkT
xKZ
1,1 T
),(
1,1,
*
ntnttn
HKZ
)0),((
1,
*
1,1 tntnntt
xhHZ
,1,1 T
1,1 n
),(
1,1,
*
ktkttk
HKZ
))(,(
1,1,
*
1, tktkkttkktkt
xhHxKZ
ki
titi
xh
1
)(
ki
titi
xg
1
)(
)(
1*tt
KZ
)(
1 *TT
KZ
:1,1 T
)(
1 *tt
KZ
))()(( λ
112 11 *1 tttttt
xKhxhZ
= g
T,n(KT,n –1
).
Уравнение Беллмана для шага (T, k), k
(не последний шаг послед-
него этапа):
= max{g
T,k(xT,k
Уравнение Беллмана для шага (t, n), t
) +
| x
T,k
X
T,k
}.
(последний шаг не послед-
него этапа)
= max{g
Уравнение Беллмана для шага (t, k), t
t n(xt n
) – h tn(x
) + λ
t n
k
| xtn X
}.
t n
(не последний
шаг не последнего этапа):
= max{g
t k(xt k
) – h tk(x
t k
) +
| xtk Xtk}.
Таким образом, мы получили задачу двухпараметрического динамического программирования. Чтобы решать ее перебором (считая, что инвестиции
распределяются неделимыми порциями), нужно ограничить множества возможных значений параметров Ktk и Htk. Например, если gtk(xtk) ≤ αxtk для всех t, k
(то есть α – максимальная прибыльность инвестиций), то из (4.25), (4.28) и
(4.29) следует, что
Htk =
≤
≤ αK
для всех t, Htk ≤ αH
t ,0
для t > 1 и H1k ≤ αK0.
t –1,n
Отсюда Htk ≤ αtK0 и Ktk ≤ K
= H
t 0
t –1,n
≤ α
t –1
K0 для всех t, k.
Частный случай 1: модель с двумя технологическими способами
Если выполняется предположение 4.6 и n = 2, то разбиение этапов на шаги
оказывается излишним. Будем считать, что состояние в начале этапа t описано
параметром K
это вектор x(t) = (xt1, xt2). Но x
(величина инвестиционного фонда), а управление на этапе t –
t – 1
= K
t 2
t – 1
– x
по (4.25), поэтому управление этапа t
t 1
можно описать одной переменной xt1 и параметрическая оптимизация при вычислении функций Беллмана
ние принимает вид: Kt = h
Из x
≥ 0 следует, что x
t 2
t 1(xt 1
= max{g
Уравнение Беллмана для этапа t
= max{[g
t 1(xt 1
+
) + h
[0, K
t 1
T 1(xT 1
становится одномерной. Фазовое уравне-
– x
t 2(Kt – 1
t – 1
) + g
).
t 1
]. Уравнение Беллмана для этапа T:
T 2(KT – 1
– x
) | 0 ≤ x
T 1
T 1
≤ K
T – 1
}.
) – h
t 1(xt 1
)]+ [g
t 2(Kt – 1
| 0 ≤ xt1 ≤ K
– x
) – h
t 1
t–1
}.
t 2(Kt – 1
– x
)] +
t 1
Частный случай 2: линейная модель
В рамках предположения 4.6 допустим, что все функции gtk и htk линейны:
gtk(xtk) = atk xtk, htk(xtk) = btk xtk.
Из (4.25) следует, что atk ≤ btk для всех t, k.
Откажемся от разбиения этапов на шаги и будем считать, что состояние в
начале этапа t описано параметром K
64
(величина инвестиционного фонда), а
t – 1

управление на этапе t – это вектор x(t) = (xtk | k
n,1
Kt =
nk
tktk
xh
1
)(
=
nk
tktk
xb
1
для t
1,1 T
(4.30)
1,1 T
nk
tk
x
1
)(
1 *TT
KZ
nk
kTkT
xg
1
)(
nk
TkTk
xa
1
T
),1 n
n,1
)(
1 *TT
KZ
n,1
1,1 T
)(
*
1 ttKZ
)(
1 *tt
KZ
n
k
tktktktk
xhxg
1
)]()([{
)(λ
1
*
1
n
k
tktkt
xbZ
n
k
tktkt
n
k
tktktk
xbxba
1
1
1
λγ)({
n
k
tktkttk
xba
1
1
])1λγ([{
n,1
)(
1 *tt
KZ
n,1
n,1
1,1 T
n,1
T,1
принимает вид
и является фазовым уравнением.
)T. Тогда условие (4.27)
Обозначение. Для t
Mt = {x(t) ≥ 0n |
определим многогранники
= K
t – 1
}.
Уравнение Беллмана для этапа T:
= max{
| x(T ) MT} = max{
| x(T ) MT}.
Максимум линейной функции на многограннике достигается в его вершине,
а вершинами многогранника Mt являются векторы y(t, k) = ( yj(t, k) | j
что
= T K
yk(t, k) = K
Положим T = max{aTk | k
.
T – 1
Допустим, что t
, значение
и yj(t, k) = 0 для j k.
t –1
}. Понятно, что
определено и
t +1
= max{aTk K
T – 1
Уравнение Беллмана для этапа t:
= max
= max
| x(t) Mt} = max
+
| x(t) Mt} =
такие,
| k
=
} =
t +1 Kt
| x(t) Mt}.
.
Положим t = max{atk + (λ
– 1)btk | k
t + 1
}. Рассуждая, как при t = T,
получим
= t K
t – 1
.
Заметим, что для рекуррентного вычисления значений t (начиная с t = T)
используются только параметры задачи (atk и btk).
t
Пусть UT = {k
. Теперь можем сформулировать результаты параметрической оптими-
| aTk = T)}, Ut = {k
| atk + (λ
– 1)btk = t} для
t + 1
зации: на этапе t весь инвестиционный фонд следует произвольным образом
распределить между технологическими способами с номерами из множества Ut.
Применив это правило на этапе 1, найдем оптимальное распределение исходного фонда K0. Затем по формуле (4.30) вычислим К1 и распределим его по
тому же правилу. Продолжая процедуру, найдем оптимальное решение.
4.6.2. Использование возобновляемого природного ресурса
Предположим, что n фирм намерены использовать природный ресурс в
течение T лет. Исходный запас ресурса равен R0 (соответствующих единиц).
Если фирма k
в течение года t
использует xtk единиц ресурса, то по-
лучает условно чистый годовой доход gtk(xtk) д. е. и должна заплатить htk(xtk)
65

д. е. за использование ресурса, htk(xtk) < gtk(xtk); прибыль фирмы, следовательно,
T,1
n,1
T,1
.)]()([λ
1 1
T
t
n
k
tktktktk
t
xhxg
1 1
1
)]()([λ
T
t
n
k
tktktktk
t
xhxg
nk
tk
x
1
,,1 T
nk
tktk
xh
1
)(
1,1 T
T,1
n,1
.,1 n
,,2 T
,1,1 n
)0,(
1,*nTTn
RZ
1,1 T
),(
1,1,
*
ntnttn
KRZ
)0)),(((
`1,1,*1,1 tntnntttnntt
xhKrxRZ
равна gtk(xtk) – htk(xtk). Указанные платежи фирм поступают равномерно в течение года и направляются на восстановление запаса ресурса. Сумма Kt, вложенная в возобновление ресурса в течение года t, обеспечивает к началу года t прирост запаса rt(Kt). Нужно определить объемы использования ресурса фирмами
(xtk) так, чтобы максимизировать их суммарную приведённую прибыль.
Положим x = (xtk | t
ент дисконтирования, Kt для t
запаса ресурса в течение года t, R
, k
). Пусть λ (0, 1] – годовой коэффици-
– средства, вложенные в восстановление
– запас ресурса в начале года t. Мы предпо-
t–1
лагаем, что в последнем году планового периода затраты на возобновление ресурса осуществляются для обеспечения работы в послеплановом периоде. Прибыль года t дисконтируется с коэффициентом λt. Поэтому суммарная приведённая прибыль описывается следующим образом:
F(x) =
Исключив из F(x) множитель , запишем математическую модель задачи:
≤ R
f (x) =
для t
t – 1
Kt =
→ max при условиях
для t
, R
= R
t
+ rt(Kt),
t – 1
xtk ≥ 0 для всех t и k.
Чтобы перейти к методу ДП, условимся, что на этапе t
потребление ресурса в году t, то есть вектор x(t) = (xtk | k
на шаги (t, k), k
На шаге (t, k) определяется значение xtk. Состояние систе-
определяется
). Этап t разобьем
мы в начале шага (t, k) опишем двумя параметрами: величиной R
зованного ресурса (Rt0 – запас ресурса в начале года t) и суммой K
неисполь-
t,k –1
отчисле-
t,k –1
ний на возобновление ресурса в году t, обеспеченных использованием ресурса в
этом году фирмами 1, …, k – 1. Тогда
R
= R0, R
1,0
Эти формулы указывают начальное состояние (R
t 0
K
= R
t 0
t –1,n–1
Rtk = R
= 0, K
– x
t,k –1
t k
+ r
t–1,n
t–1(Kt–1,n–1
– xtk для всех t и k
= K
t,k –1
+ h tk(x
t k
+ h
t–1,n(xt–1, n
)) для t
) для всех k и t.
, K
1,0
) = (R0, 0) и урав-
1, 0
нения перехода. Множество допустимых управлений шага (t, k) имеет вид
Xtk = [0, R
t,k –1
].
Уравнение Беллмана для шага (T, n) (последний шаг процесса):
= max{g
T,n(xT, n
Уравнение Беллмана для шага (t, n), t
) – h
T,n(xT,n
) | x
T,n
X
T,n
}.
(последний шаг не послед-
него этапа)
= max{[g
t n(xt n
) – h tn(x
)] + λ
t n
| xtn X
}.
t n
66

Уравнение Беллмана для шага (t, k), t
,,1 T
1,1 n
),(
1,1,
*
ktkttk
KRZ
))(,(
1,1,
*
1, tktkkttkktkt
xhKxRZ
n,1
m,1
этапа):
k
(не последний шаг
= max{[g
t k(xt k
) – h tk(x
)] +
t k
| xtk Xtk}.
Таким образом, мы получили задачу двухпараметрического динамического программирования. Чтобы решать ее перебором (считая, что ресурс потребляется неделимыми порциями), нужно ограничить множества возможных значений параметров Rtk и Ktk, например, так, как это сделано в разд. 4.6.1.
Дополнительная литература к разделу 4
1. Гайлит, Е. В. Теория оптимального управления: учеб. пособие / Е. В. Гай-
лит. – Новосибирск: изд-во НГПУ, 2013.
5. Элементы теории оптимального управления
5.1. Постановка задачи оптимального управления
В теории оптимального управления объектом моделирования является
управляемая система, состояние которой зависит от параметра t. Будем интер-
претировать этот параметркак время. В каждый момент t [t0, t1] система получает управляющее воздействие, влияющее на состояния системы в последующие моменты.
5.1.1. Основные понятия
Определения и обозначения
Если вектор x(t) = (xj(t) | j
)T описывает состояние системы в момент
t, то Rn называют фазовым пространством, а координатные функции векторфункции x(t) – фазовыми координатами или фазовыми переменными.
Когда t пробегает промежуток [t0, t1], точка фазового пространства x(t)
описывает фазовую траекторию.
Замкнутое относительно операций сложения и умножения на число семейство вектор-функций из R в Rm, определенных на некотором множестве M R,
образует линейное пространство функций (функциональное пространство).
Пусть U – подмножество некоторого функционального пространства.
Функционал на U – это отображение J: U → R, ставящее в соответствие каждой
функции u U число J(u).
Задача максимизации (минимизации) функционала J(u), определенного на
подмножестве U функционального пространства, состоит в отыскании хотя бы
одной функции u* U такой, что J(u*) ≥ (≤) J(u) для всех u U.
Управление в момент t – это вектор-функция u(t) = (ui(t) | i
)T; коор-
динатные функции вектор-функции u(t) называют переменными управления.
Множество допустимых управлений – это подмножество U некоторого
функционального пространства.
67

Предположение 5.1. Управление является кусочно-непрерывной вектор-
x'(t) = f (x(t), u(t), t),
или
)(tx
j
= fj(x1(t), …, xn(t), u1(t), …, um(t), t) для всех j
n,1
и t [t0, t1].
(5.1)
49
50
функцией на промежутке [t0, t1].
Допустим, что связь между переменными управления и фазовыми переменными выражена системой дифференциальных уравнений (система диффе-
ренциальных связей)
Если выбрано допустимое управление u0(t), то (5.1) превращается в си-
стему дифференциальных уравнений относительно вектор-функции x(t). Если,
кроме того, объект управления в момент t0 находится в начальном состоянии x0,
то возникает задача Коши: найти траекторию x(t) управляемой системы, удовлетворяющую системе уравнений x'(t) = f (t, x(t), u0(t)) и начальному условию
x(t0) = x0.
Определение. Процессом называют набор ⟨x(t), u(t), t0, t1⟩, где t0 < t1 и
вектор-функции x(t), u(t) определены на промежутке [t0, t1].
Заметим, что границы промежутка [t0, t1] и состояния объекта на концах
промежутка, вообще говоря, не фиксированы. В общем случае они описаны
краевыми условиями49, которые указывают множество допустимых сочетаний
t0, x(t0), t1 и x(t1).
Для каждого t [t0, t1] множество допустимых значений функции u(t), то
есть множество управляющих воздействий, возможных в момент t, может зависеть от состояния объекта в момент t. Такие зависимости формализуются посредством ограничений вдоль траектории, которые описывают множество допустимых троек t, x(t), u(t)50.
5.1.2. Общая формулировка задачи оптимального управления
Определения и обозначения
Вектор-функция одной переменной, непрерывная на промежутке [a, b],
кусочно-дифференцируема на [a, b], если она имеет производную во всех внут-
ренних точках этого промежутка за исключением, быть может, конечного числа
точек. Допустим, что заданы: множество допустимых управлений U; система
дифференциальных связей (5.1), ограничения вдоль траектории и краевые
условия. Процесс ⟨x0(t), u0(t), t0, t1⟩ является допустимым, если:
(а) функция u0(t) принадлежит U и кусочно-непрерывна на [t0, t1];
(б) функция x0(t) кусочно-дифференцируема на [t0, t1];
(в) t0, t1, x0(t0) и x0(t1) удовлетворяют краевым условиям;
(г) для функций x0(t), u0(t) выполняются ограничения вдоль траектории;
(д) функция x0(t) на отрезке [t0, t1] является единственным решением зада-
чи Коши для системы дифференциальных связей при u(t) = u0(t) с начальным
условием x(t0) = x0(t0).
Способы описания краевых условий см. в разд. 5.1.5.
Варианты описания ограничений вдоль траектории см. в разд. 5.1.3.
68

Пусть J(x(t), u(t), t0, t1) – целевой функционал, определенный на всех допу-
,
0
t
1
t
,
0
t
1
t
,
0
t
)
1
t
0
t
1
t
gi(x(t), u(t), t) = 0 для i
,,1 k
k ≤ n;
(5.2)
hi(x(t), u(t), t) ≥ 0 для i
.,1 r
(5.3)
51
стимых процессах. Задача оптимального управления: найти числа
и век-
тор-функции u*(t), x*(t), максимизирующие функционал J(x(t), u(t), t0, t1) на
множестве допустимых процессов.
Указанные выше функции u*(t) и x*(t) – это оптимальное управление и
оптимальная траектория соответственно; ⟨x*(t), u*(t),
процесс, J * = J(x*(t), u*(t),
Подчеркнем, что значения t0 =
– оптимальное значение функционала.
и t1 =
определяются вместе с опти-
⟩ – оптимальный
мальным процессом, если они не определены краевыми условиями (см. разд.
5.1.4). Другими словами, в общем случае выбор управления предполагает также
выбор промежутка, в течение которого будут происходить управляющие воздействия.
Для допустимого процесса функция u(t) однозначно определяет фазовую
траекторию x(t), поэтому целевой функционал J(x(t), u(t), t0, t1) на множестве
допустимых процессов зависит только от u(t), то есть является функционалом,
оценивающим качество управления.
Основные проблемы, относящиеся к теории оптимального управления:
– управляемость (существование допустимого управления, удовлетворяющего краевым условиям);
– разрешимость (существование оптимального управления)51;
– необходимые условия оптимальности;
– достаточные условия оптимальности;
– единственность оптимального решения.
5.1.3. Варианты ограничений вдоль траектории
Ограничения вдоль траектории в общем случае описываются системой
уравнений и (или) нестрогих неравенств:
Частными случаями являются ограничения на управление и фазовые огра-
ничения (ограничения на фазовые переменные).
Ограничения на управление имеют вид u(t) G(t) Rm для t [t0, t1], где
множества G(t) описаны соотношениями вида (5.2), (5.3) без зависимости от x(t)
в левых частях.
Фазовые ограничения записывают в виде (5.2), (5.3) без зависимости от
u(t) в левых частях.
См. Афанасьев В. Н. Математическая теория конструирования систем управления / В. Н. Афанасьев,
В. Б. Колмановский, В. Р. Носов. – М.: Высшая школа, 2003. Гл. VIII. §1
69

5.1.4. Основные типы функционалов
.),,(
1
0
t
t
dttuxF
1
0
),,(
t
t
dttuxF
φi(t0, x(t0), t1, x(t1)) = 0 для i
.,1 s
(5.4)
52
Интегральный функционал от процесса ⟨x(t), u(t), t0, t1⟩ имеет вид
J(x(t), u(t), t0, t1) =
Задача оптимизации интегрального функционала при дифференциальных
связях и краевых условиях (без ограничений вдоль траектории) называется за-
дачей Лагранжа.
Если F(x, u, t) 1, то интегральный функционал принимает вид J(x(t), u(t),
t0, t1) = t1 – t0. Задача минимизации этого функционала при дифференциальных
связях и краевых условиях (частный случай задачи Лагранжа) называется задачей оптимального быстродействия.
Функционал задачи оптимального быстродействия является частным случаем терминального функционала от процесса ⟨x(t), u(t), t0, t1⟩:
J(x(t), u(t), t0, t1) = φ0(t0, x(t0), t1, x(t1)).
Задачу оптимизации терминального функционала при дифференциальных
связях и краевых условиях называют задачей Майера.
Функционал Больца включает и интегральное слагаемое, которое можно
интерпретировать как эффект, полученный в течение процесса, и терминальное,
указывающее «остаточный» эффект, возникающий после завершения процесса:
J(x(t), u(t), t0, t1) =
+ φ0(t0, x(t0), t1, x(t1)).
Задача оптимизации этого функционала при дифференциальных связях и
краевых условиях называется задачей Больца. Заметим, что задачу Больца
можно эквивалентным образом преобразовать как в задачу Лагранжа, так и в
задачу Майера52.
5.1.5. Варианты краевых условий
В общем случае краевые условия имеют вид
Определения
Аргументы краевых условий (5.4) – начальный и конечный моменты t0, t1
и фазовые координаты концов траектории x(t0), x(t1) – будем называть краевыми
параметрами задачи.
Краевой параметр закреплен, если условие задачи указывает его значение.
Краевой параметр свободен, если его значение не задано и краевые условия (5.4) от него не зависят.
В остальных случаях краевой параметр называют подвижным.
В задаче с фиксированным временем и начальный, и конечный моменты
закреплены.
См., например: Павлов В. Н. Математическая экономика. – Новосибирск: изд-во СО РАН, 2005. – С. 21.
70
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
