Теория оптимального управления вводный курс лекций. Учебное пособие
.pdf
г) задача для нижней границы конечной интегральной воронки |
|
k (t) = bumax Akα (t)ent − μk (t), k (T ) = kT . |
(19) |
Все эти задачи решаются в явном виде, так как можно записать общее решение дифференциального уравнения Бернулли (см. приложение 3) и, используя начальное или конечное условие, найти произвольную постоянную.
Далее оптимальная траектория k (t) составляется из участков магистрали, границ интегральных воронок и, возможно, прямой k = kmin в соответствии с правилом, сформулированным в начале этого пункта. Конкретный вид оптимальной траектории зависит от взаимного расположения упомянутых графиков.
Рассмотрим один из типичных случаев. На рис. 11 показаны: магистраль (1), границы интегральных воронок (2), (3), (4), (5) и минимально допустимый уровень фондовооруженности (6).
В данном случае оптимальная траектория определяется следующим образом.
А) На промежутке [0,t1 ], где t1 – первая точка переключения (момент пересечения кривой (3) с прямой (6)), движение происходит из начального положения k0 по нижней границе начальной интегральной воронки (3), так как для каждого фиксированного t из [0,t1 ] точки этой кривой ближе к точке магистрали (1), чем все другие допустимые точки.
Рис. 11
61
Б) На промежутке [t1,t2 ] (от первой точки переключения до второй точки переключения) движение происходит с минимально допустимым уровнем
фондовооруженности kmin до пересечения с магистралью (1).
В) На промежутке [t2 ,t3 ] магистраль (1) попадает в множество допустимых значений фондовооруженности, поэтому здесь движение происходит по магистрали до ее пересечения с нижней границей (5) конечной интеграль-
ной воронки.
Г) На промежутке [t3,T ] эта часть оптимальной траектории совпадает с
нижней границей (5) конечной интегральной воронки.
7. Построим оптимальное управление.
После построения оптимальной траектории k (t) оптимальное управле-
ние находится из уравнения динамики (1) |
|
|||||||||||||
|
|
k (t) = bu(t) Akα (t)ent − μk (t), t [0,T ] |
(20) |
|||||||||||
после подстановки в него |
|
|
(t): |
|
||||||||||
k |
|
|||||||||||||
|
|
|
|
(t) = |
|
k |
(t) + μ |
|
(t) |
, t [0,T ] . |
|
|||
|
|
|
u |
k |
(21) |
|||||||||
|
|
|
|
|
|
|
|
|
|
|||||
|
|
|
|
|
|
|
Abk α (t) ent |
|
||||||
На участках движения по границам интегральных воронок оптимальное |
||||||||||||||
управление |
u |
(t) принимает одно из граничных значений – umax |
и umin , по- |
|||||||||||
этому формула (21) используется практически только для нахождения u (t)
на промежутке движения по магистрали или по прямой k = kmin . Оптимальное управление, соответствующее рис. 11, показано на рис. 12.
62
Рис. 12 8. Найдем оптимальное значение функционала.
Максимальное значение интегрального среднедушевого дисконтированного потребления находится подстановкой под знак интеграла в (7):
1) оптимального управления u(t) = u (t), 2) максимальной производительности труда, соответствующей оптимальной фондовооруженности: x(t) = Akα (t)ent = Ak α (t)ent . После этого находится Imax . При этом ин-
теграл по всему промежутку [0,T ] разбивается на сумму интегралов по час-
тичным промежуткам [0, t1], [t1,t2 ], [t2 ,t3 ], [t3,T ], на каждом из которых
используются соответствующие формулы для u (t) и k (t).
63
7. СИНТЕЗ ОПТИМАЛЬНОГО УПРАВЛЕНИЯ. МЕТОД ГАМИЛЬТОНА – БЕЛЛМАНА
Все рассмотренные ранее задачи оптимального управления решались в классе так называемых программных управлений, т. е. управлений u(t) – функций одного переменного t , времени. Построенное программное управление решает задачу, если система не подвержена внешним воздействиям и нет необходимости корректировать построенную программу. В случае когда требуется учитывать реальное состояние системы и строить управление с учетом этого состояния, приходится решать задачу в классе позиционных
управлений u(t, x) – функций двух переменных, времени t и фазовой пере-
менной x . В таком случае говорят о синтезе управления – построении такой
функции u(t, x) , которая |
при подстановке текущего состояния |
x(t): |
|||
u(t, x) |
|
x=x(t) =u(t, x(t)) порождает текущее управляющее воздействие. |
|
||
|
|
||||
|
|
||||
Рассмотрим задачу оптимального управления |
|
||||
|
|
T |
|
|
|
|
|
I (x,u) = ∫ f |
(t,x(t),u(t))dt + F(x(T)) → min , |
(1) |
|
0 |
|
|
|
||
|
|
x(t) = ϕ (t,x(t),u(t)), |
t [0,T ], |
(2) |
|
|
|
|
x(0) = x0 , |
(3) |
|
|
|
(x(t),u(t)) V t , |
t [0,T ], |
(4) |
|
рассмотренную ранее в п. 4, как задачу синтеза оптимального управления. Воспользуемся основной теоремой о достаточных условиях оптимальности (вариант с терминальным слагаемым в минимизируемом функционале). В силу этой теоремы следует максимизировать функцию
R(t,x,u) = |
∂W + |
∂W ϕ (t,x,u) − f (t, x,u) |
(5) |
|
∂t |
∂x |
|
при каждом t как функцию (x,u) и минимизировать функцию
Φ(x) =W (T,x) +F(x) |
(6) |
64
как функцию аргумента x. Начнем с частичного решения первой задачи и будем искать управление, максимизирующее функцию R(t, x,u) по u при
фиксированных t и x : maxR(t, x,u) . Здесь множество V t x представляет со-
u V t x
бой сечение множества V t при фиксированном x : V t x ={u :(u,x) V t}. На-
помним, что в конструкцию функции R(t, x,u) входит функция W(t, x), от которой зависит результат упомянутой максимизации. Функцию W(t, x)
можно выбрать так, чтобы функция maxR(t, x,u) не зависела от x :
u V t x
maxR(t, x,u) =c(t), t [0,T] . |
(7) |
u V t x |
|
Если, кроме того, W(t, x) такова, что Φ(x) =W (T,x) +F(x) оказывается кон-
стантой:
Φ(x) =W (T,x) +F(x) =d , |
(8) |
то при каждом x функция |
|
u(t, x) =argmax R(t,x,v) |
(9) |
v V t x |
|
удовлетворяет условиям основной теоремы, и поэтому для решения задачи синтеза оптимального управления остается сформулировать соотношения
для нахождения функции W(t,x), удовлетворяющей условиям (7) и (8). Эти
соотношения представляют собой краевую задачу Гамильтона – Беллмана
∂W +max{ |
∂W ϕ t, x,u |
− f |
t,x,u }=c(t), t [0,T], |
(10) |
|
∂t u V t x |
∂x |
( ) |
|
( ) |
|
|
|
W(T,x) =d −F(x) . |
(11) |
||
Если W(t, x)– решение этой краевой задачи, то функция u(t, x) =u(t, x), определенная равенством (9), решает задачу синтеза оптимального управления.
Для приближенного построения функции W(t, x) можно воспользоваться следующей схемой. Для определенности положим c(t) =0, d =0 . Заменим в
уравнении (10) производную |
∂W(t, x) |
разностным отношением |
|
∂t |
|
W (t,x)−W(t − ,x) |
Δ=T / N , |
, задав достаточно малое значение |
65
и запишем возникающее таким образом уравнение в виде |
|
|||||||||
W(t − ,x) =W (t,x) +Δ max{∂W (t, x) ϕ t, x,u |
) |
− f |
t,x,u }, t [0,T]. (12) |
|||||||
|
u V t x |
∂x |
( |
|
|
|
( |
|
) |
|
Будем искать решение этого уравнения |
|
|
|
|
|
|
|
|
||
W(t,x), удовлетворяющее краевому |
||||||||||
условию |
|
|
|
|
|
|
|
|
|
|
|
W(T,x) =−F(x) . |
|
|
|
|
|
(13) |
|||
Для t =T имеем |
|
|
|
|
|
|
|
|
|
|
W(T − , x) =−F(x) +Δ max{ |
∂W(T,x) ϕ T,x,u |
− f T,x,u }, t [0,T]. |
||||||||
|
u VT x |
∂x |
|
( |
|
) |
|
|
( |
) |
Далее находим |
|
|
|
|
|
|
|
|
|
|
|
W(T −2 ,x) =W(T − ,x) + |
|
|
|
|
|||||
+Δ max { |
∂W (T − ,x) ϕ T − |
,x,u |
− f |
|
T − |
,x,u }, t [0,T]; |
||||
u VT− , x |
∂x |
( |
) |
|
( |
|
|
|
) |
|
Продолжая этот процесс, на последнем шаге построим сечение W (0,x) .
Отметим, что для систем с дискретным временем задача синтеза оптимального управления решается за конечное число шагов с точным построением функции W(T,x) . Действительно, вернемся к постановке задачи для дискретного времени:
T−1 |
|
I(x,u) =∑ f (t,x(t),u(t)) +F(x(T)) →min |
(14) |
t=0 |
|
x(t +1) =ϕ(t, x(t),u(t)), t =0,1,...,T −1, |
(15) |
x(0) = x0 , |
(16) |
(x(t),u(t)) V t , t =0,1,...,T −1, x(T) VT . |
(17) |
x |
|
Снова воспользуемся основной теоремой о достаточных условиях оптимальности (вариант с терминальным слагаемым в минимизируемом функционале), которая формулируется с использованием функций R(t, x,u)и
Φ(x), определенных равенствами
R(t,x,u) = W (t +1,ϕ(t,x,u)) −W (t, x) − f (t, x,u),
Φ(x) = W(T, x) + F(x).
66
Как и в случае непрерывного времени, сначала максимизируем функцию
R(t, x,u) по u при фиксированных t и x : maxR(t, x,u) . Здесь множество |
|
|
u V t x |
V t x |
представляет собой сечение множества V t при фиксированном x : |
V t x |
={u :(u,x) V t}. Напомним, что в конструкцию функции R(t, x,u) |
входит функция W(t, x), от которой зависит результат упомянутой максими-
зации. Функцию W(t, x) можно выбрать так, чтобы функция |
maxR(t, x,u) |
|
u V t x |
не зависела от x : |
|
maxR(t, x,u) =c(t), t =0,1,...,T −1. |
(18) |
u V t x |
|
Если, кроме того, W(t, x) такова, что Φ(x) =W (T,x) +F(x) оказывается кон-
стантой: |
|
Φ(x) =W (T,x) +F(x) =d , |
(19) |
то при каждом x функция |
|
u(t, x) =argmax R(t,x,v) |
(20) |
v V t x |
|
удовлетворяет условиям основной теоремы, и поэтому для решения задачи синтеза оптимального управления остается сформулировать соотношения для нахождения функции W(t, x), удовлетворяющей условиям (18) и (19). Эти соотношения представляют собой краевую задачу Гамильтона – Беллмана
max{W(t +1,ϕ(t, x,u))−W (t, x))− f (t, x,u)}=c(t), |
t =0,...,T −1, |
(21) |
|||||
u V t x |
|
|
|
|
|
|
|
|
|
|
W(T,x) =d −F(x) . |
|
(22) |
||
Уравнение (21) допускает запись в рекуррентном виде |
|
||||||
W(t,x) |
=max{W (t +1,ϕ(t,x,u))− f (t, x,u)}−c(t), |
t =0,...,T −1, |
|
||||
|
u V t x |
|
|
|
|
|
|
позволяющем |
последовательно |
найти |
все |
сечения |
функции |
||
W(t,x), t =T,T −1,...,0 |
начиная с W(T,x) , определенного равенством (22). |
||||||
Если |
W(t, x) |
– |
решение краевой задачи (21), (22), то |
функция |
|||
u(t, x) =u(t, x), определенная равенством (20), решает задачу синтеза оптимального управления.
67
Приведем в качестве примера задачи (14)–(17), задачу, возникающую при оптимизации распределения капитальных вложений между предприятиями (см. [2], с. 250).
Пусть А – заданный фонд капитальных вложений, который надо распределить с максимальной эффективностью между n предприятий, для каждого из которых задана эффективность реализации капитальных вложений
ψi (y), i =1,...,n. Предполагается, что функции ψi – неотрицательные и неубывающие. Математическая модель этой задачи имеет вид
n |
n |
|
∑ψi (yi ) → max, |
∑yi = A, yi ≥0, i =1,...,n. |
(23) |
i=1 |
i=1 |
|
Сведем задачу (23) к задаче (14)–(17). Для этого введем обозначения
T =n, t =i−1, u(t) = yi , t =1,...,T, f (t,u(t)) =−ψi (yi ).
В новых обозначениях задача (23) принимает вид задачи оптимального управления с дискретным временем:
T−1
I(x,u) =∑f (t,x(t)) →min,
t=0
x(t +1) = x(t) +u(t), t =0,1,...,T −1, x(0) =0,
x(T) = A, u(t) ≥0, t =0,...,T −1.
Избавимся от терминального условия x(T) = A, добавив терминальное слагаемое F(x) = M (x−A)2 , где M >0 произвольно большое число, в минимизируемый функционал:
T−1
J(x,u) =∑f (t, x(t)) +M (x(T)−A)2 .
t=0
Таким образом, задача (23) сведена к задаче
J(x,u) → min, x(t +1) = x(t) +u(t), t =0,...,T −1, x(0) =0, u(t) ≥0.
68
СПИСОК ЛИТЕРАТУРЫ
1.Теория оптимального управления: программа курса, варианты индивидуальных заданий, вопросы к итоговому экзамену / Перм. ун-т; сост. В. П. Максимов. – Пермь, 2001.
2.Основы теории оптимального управления / под ред. В. Ф. Кротова. М.: Высшая школа, 1990.
3.Лагоша Б.А. Оптимальное управление в экономике. М.: Финансы и статистика, 2003.
4.Алексеев В. М., Тихомиров В. М., Фомин С. В. Оптимальное управление. М.: Наука, 1979.
5.Лутманов С. В. Курс лекций по методам оптимизации. Ижевск: НИЦ Регулярная и хаотическая динамика, 2001.
6.Галеев Э. М., Тихомиров В. М. Оптимизация: теория, примеры, задачи. М.: Эдиториал УРССС, 2000.
7.Алексеев В. М., Галеев Э. М., Тихомиров В. М. Сборник задач по оптимизации. М.: Наука, 1984.
69
ЧАСТЬ 2. ЗАДАЧИ ДЛЯ САМОСТОЯТЕЛЬНОЙ РАБОТЫ
1. Некоторые задачи о быстродействии
Время перемещения материального шарика под действием силы тяжести из точки A(0,0) в точку B(x0, y0 ) по кривой y = f ( x) определяется равенст-
вом (движение вертикально вниз соответствует положительному направлению оси y )
x
T = ∫0
0
1+y′(x) 2
( ) dx (закон Галилея).
2gy x
Решить задачу минимизации T на заданных семействах траекторий,
представляющих собой ломаные ACB , параметризованные координатами
точки C(α,β ) .
Варианты
1.B(1,1); C {(α,β ):α 0,2;0,8 ;0,5α ≤ β ≤ 0,3+0,5α}.
2.B(1,2); C {(α,β ):β =1;α 0,1;0,9 }.
3.B(1,2); C {(α,β ):α 0,2;0,7 ;α ≤ β ≤ 2}.
4.B(1,1); C {(α,β ):α 0,1;0,8 ;0,2≤ β ≤ 0,4}.
5.B(2,1); C {(α,β ):β 0,1 ;1− β ≤α ≤ 2− β}.
6.B(3,2); C {(α,β ):α ≤ 1,2 ;1−α ≤ β ≤α}.
7.B(2,2); C {(α,β ): α −1 + β −1 ≤1}.
8.B(2,3); C {(α,β ):α 1,5;2 ,β 1,2 }.
9.B(1,4); C {(α,β ):α 0,1 ,α +1≤ β ≤α +2}.
10.B(4,1); C {(α,β ):β 0,1 ,β +1≤α ≤ β + 2}.
11.B(3,3); C {(α,β ):α 2,3 ,β 1,2 }.
12.B(3,3); C {(α,β ):α 0,3 ,β 0,3 ,α −2≤ β ≤α +2}.
13.B(2,2); C {(α,β ):α 1,2 ,β 1,2 }.
14.B(3,2); C {(α,β ):α 2,3 ,β 1,2 }.
70
