Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Методы оптимальных решений. Учебное пособие-1

.pdf
Скачиваний:
0
Добавлен:
07.09.2026
Размер:
2 Мб
Скачать
☆
Началом этой кривой является фиксированное начальное состояние
00
)( xtx
11
)( xtx
t
12
( ), ( ), ..., ( )
r
u t u t u t
)(tu
12
( ), ( ),..., ( )
r
u t u t u t
n
E
)(tu
r
Etu )(
10
ttt
t
10
ttt
)(tu
10
ttt
U
10
ttt
)(tu
U
, а
окончание – конечное состояние
, которое во многих задачах требуется
определить.
Выборы (решения), которые нужно осуществлять в каждый момент време­ни
из указанного интервала, характеризуются с помощью r вещественных
чисел
, называемых управляющими параметрами. Составлен-
ный из управляющих параметров r-мерный вектор-столбец
(
)",
называемый управляющим вектором, можно интерпретировать геометрически как точку в
. Управлением называется функция
={
|
}.
Требуется, чтобы каждый управляющий параметр являлся кусочно-
непрерывной функцией времени. Поэтому управление представляет собой ку-
сочно-непрерывную функцию времени. Значениями этой функции в каждый
момент времени
из указанного промежутка являются управляющие векторы.
С геометрической точки зрения управление представляет собой некоторую кривую, состоящую из точек пространства, причем эта кривая непрерывна всю­ду, за исключением, возможно, некоторого конечного числа точек разрывов
первого рода.
Предполагается, что возможные значения управляющих параметров удо­влетворяют некоторым ограничениям. Эти ограничения в общей форме состоят в том, что управляющий вектор в каждый момент времени из интервала
должен принадлежать некоторому фиксированному непустому под-
множеству
r-мерного евклидова пространства
,
.
Обычно предполагается, что множество
(область управления) является
выпуклым и компактным (т. е. замкнутым и ограниченным). Управление назы­вается допустимым, если оно представляет собой кусочно-непрерывную век­тор-функцию времени, значения которой в любой момент времени из указанно-
го интервала принадлежат . Множество управлений
– это множество всех
допустимых управлений, т. е. таких управлений, которые являются кусочно-
непрерывными функциями времени, заданными в промежутке
. При
этом их значения в любой момент времени из указанного промежутка принад-
лежат . Управление должно принадлежать указанному множеству управле-
ний, т. е.
.
21
Фазовая траектория
)(tx
)),(),(()( ttutxftx
)(t
dt
dx
j
)(tx
j
12
( ( ), ( ),..., ( )
jn
f x t x t x t
12
( ), ( ),..., ( ); ),
r
u t u t u t t
1,2,..., .jn
(...)
1
f,(...)
2
f
(...)
n
f
,)( BuAxtx
A
nn
B
rn
)(tu
)(tx
00
)( xtx
1
t
ttx ),(
T
1
tt
T
1nE
1
t
)(1tx
определяется из уравнений движения, т. е. из си-
стемы дифференциальных уравнений, в которых скорость изменения каждой фазовой координаты представлена в виде функции фазовых координат, управ-
ляющих параметров и времени
или в развернутом виде
=
,
Предполагается, что каждая из заданных n-функций
…,
является непрерывно дифференцируемой. Если дифференциальные
уравнения не зависят явно от времени, то уравнения движения называются ав- тономными. Примером такой системы являются линейные автономные урав­нения движения
где размерности
– фиксированная матрица размерности
.
, а
– фиксированная матрица
Фиксированные начальные значения фазовых координат являются гра-
ничными условиями для уравнений движения. Если заданы начальные значения и управление
, то существует единственная фазовая траектория
, удо-
влетворяющая уравнениям движения и граничным условиям. Эту траекторию
можно найти интегрированием дифференциальных уравнений при данных начальных условиях
. Фазовая траектория, найденная в результате ре-
,
шения уравнений движения при данном начальном состоянии с использовани­ем допустимого управления, называется допустимой, а любая фазовая точка на фазовой траектории, которую можно достичь за конечное время, называется
достижимой.
Конечный момент времени
где
– заданное подмножество в
Важными частными случаями задачи управления являются задача с фиксиро- ванным временем, когда конечный момент времени
параметр задачи, и задача с закрепленным концом, когда форме как вектор параметров задачи.
22
определяется условием
при
,
, называемое конечной поверхностью.
задан в явной форме как
задан в явной
Целевой функционал, максимум которого требуется найти, представляет
)(tuJJ 
1
0
( ), ( ),
t
t
I x t u t t
11
( , ).dt F x t
ttutxI ),(),(
),,( tuxI
12
( ( ), ( ),..., );
n
I x t x t x
12
( ), ( ), ..., ( ); )
r
u t u t u t t
01
t t t
11
,txF
11
,txF
     
1 1 2 1 1 1
, ,..., ; .
n
F x t x t x t t
( ), ( ),I x t u t t
11
,F x t
 
...f
0
x
 
tu
 
tx
1
0
, , ,
t
t
J I x u t dt
11
,txFJ
 
tu
max
1
0
11
, , ,
t
t
J I x u t dt F x t
tuxfx ;;
0
t
00
xtx
 
,x t t T
 
Ututt ,
1
собой отображение управлений (функций времени) на точки вещественной
прямой. Этот функционал будет рассматриваться в следующей форме:
Подынтегральная функция
=
показывает, что функционал зависит
от фазовых координат и управляющих параметров, являющихся функциями
времени, и от времени, т. е.
=
, где
.
Второе слагаемое
в выражении для функционала, которое мы зовем
функцией конечных параметров, показывает, что функционал зависит от ко-
нечного состояния и от конечного момента времени:
Предполагается, что как
, так и
являются фиксирован-
ными, непрерывно дифференцируемыми функциями. Целевой функционал за­писан как функционал, зависящий от управлений, потому что если вектор-
функция
и вектор
заданы, то управление
определяет фазовую тра-
екторию
.
Задачу с целевым функционалом обычно называют задачей Больца. Если функция конечных параметров тождественно равна нулю так, что
то такую задачу называют задачей Лагранжа. Задачу, в которой подынтеграль-
ная функция тождественно равна нулю так, что
,
называют обычно задачей Майера.
Итак, общая задача управления состоит в следующем: требуется найти
при условии, что
и
фиксированы,
при
[1].
23
2.3. Виды управлений
 
ut
0
t
 
tx
 
ttxu ,
)),(),(()( ttutxftx
В задачах управления встречаются два вида управления. Один из них – управление по разомкнутому контуру. В этом случае оптимальное управление,
являющееся решением функционала, определяется как функция времени
.
Управление по разомкнутому контуру полностью определяется в началь­ный момент
, а фазовая траектория
отыскивается в результате интегри-
рования уравнений движения при фиксированных начальных условиях.
Другой вид управления – управление по замкнутому контуру (с обратной
связью). В этом случае оптимальное управление определяется как функция те­кущих фазовых координат и времени
.
В отличие от управления по разомкнутому контуру, когда все решения принимаются заранее, при управлении по замкнутому контуру решения можно пересматривать с учетом новой информации, которую несут текущие фазовые координаты. Задача определения оптимального управления по замкнутому кон­туру называется задачей синтеза.
Примеры этих двух видов управления существуют в экономике. Автома­тические стабилизаторы, такие как страхование по безработице и прогрессив-
ный подоходный налог, представляют собой системы управления с обратной
связью. Так, например, рост безработных приводит к росту суммы выплат по­собий по безработице, что в свою очередь противодействует росту безработи­цы. Аналогично этому расширение инфляции приводит при действующей си­стеме прогрессивного налогообложения к соответствующему увеличению по­доходного налога, что противодействует росту инфляции. Управляющие пара­метры в каждом из этих случаев (пособия по безработице и налоговые отчисле-
ния) соответствуют текущему состоянию экономики.
В дальнейшем предполагается, что задача управления не содержит случай-
ных переменных и что все необходимые параметры, функции и множества пол-
ностью определены. В этом случае управление по замкнутому контуру и управ-
ление с обратной связью приводят к одинаковым результатам. В двух типах задач управления управление по замкнутому контуру имеет преимущество пе-
ред управлением по разомкнутому контуру, так как первое доставляет большое максимальное значение целевого функционала. Этими двумя типами задач яв-
ляются задачи стохастического управления.
2.4. Общая формулировка задачи оптимального управления
Определения
Допустим, что заданы: множество допустимых управлений U; система
дифференциальных связей
; ограничения вдоль траектории
(x(t), u(t), t)G; краевые условия (x(t0), t0)B и (x(T), T)E. Процесс x0(t), u0(t)
является допустимым, если существуют числа t0 и T (t0 < T) такие, что:
24
а) функция u0(t) кусочно-непрерывна и определена на [t0, T];
* 0
t
T
t
dttuxF
0
),,(
3 4
б) функция x0(t) кусочно-дифференцируема на [t0, T]; в) t0, T, x0(t0) и x0(T) удовлетворяют краевым условиям; г) для процесса x0(t), u0(t) выполняются ограничения вдоль траектории; д) функция x0(t) на отрезке [t0, T] является единственным решением задачи
Коши для системы дифференциальных связей при u(t) = u0(t) с начальным усло- вием x(t0) = x0(t0).
Задача оптимального управления формулируется следующим образом: найти вектор-функции u*(t), x*(t), которые максимизируют функционал J(x(t), u(t)) на множестве допустимых процессов.
Здесь J(x(t), u(t)) – целевой функционал, определенный на всех допустимых процессах, критерий качества управления; u*(t) – оптимальное управление;
x*(t) – оптимальная траектория; x*(t), u*(t) – оптимальный процесс; G Rn  Rm  R – замкнутая область3; B и E – многообразия4 в Rn  R. Заметим,
что вместе с оптимальным процессом x*(t), u*(t) определяются и значения t0 = и T = T*, фигурирующие в определении допустимого процесса.
Основные проблемы, относящиеся к теории оптимального управления:
– управляемость (существование допустимого управления, удовлетворя-
ющего граничным условиям);
– разрешимость (существование оптимального управления); – необходимые условия оптимальности; – достаточные условия оптимальности; – единственность оптимального решения.
2.5. Основные типы функционалов
Интегральный функционал от процесса x(t), u(t) имеет вид
J(x(t), u(t), t0, T) =
.
Если ограничения вдоль траектории отсутствуют, то задача оптимизации интегрального функционала при дифференциальных связях и краевых условиях
называется задачей Лагранжа.
Рассмотрим чаcтный случай поставленной выше задачи оптимизации. Ес­ли в интегральном функционале F(x, u, t) 1, то J(x(t), u(t), t0, T) = (T – t
), и оп-
тимальность управления u(t) означает минимальность времени перехода из по­ложения x0 в положение x
. Задача минимизации этого функционал при диффе-
ренциальных связях и краевых условиях (частный случай задачи Лагранжа)
называется задачей оптимального быстродействия.
См. разд. 4.2.4. См. разд. 4.2.5.
25
Терминальный функционал от процесса x(t), u(t) имеет вид J(x(t), u(t), T) =
T
t
dttuxF
0
),,(
dt
dx
0
dt
dx
i
= f
i
( u1, …, ur) f i(x, u) при i{0, …, n},
(2.7)
ddty
= f(x,u),
(2.8)
5
Φ(x(T), T). Задачу оптимизации терминального функционала при дифференци- альных связях и краевых условиях называют задачей Майера.
Теорема 2.1. Задача Лагранжа является частным случаем задачи Майера5.
Более общей является задача Больца: при дифференциальных связях и
краевых условиях оптимизировать функционал
J(x(t), u(t), t0, T) =
+ Φ(x(T), T).
Здесь первое (интегральное) слагаемое можно интерпретировать как эффект,
полученный в течение процесса, а второе (терминальное) – как остаточный эф­фект, возникающий после завершения процесса.
2.6. Необходимое условие оптимальности
Для формулировки и доказательства необходимого условия оптимальности будет удобно дать иную формулировку поставленной выше задачи. Добавим к фазовым координатам x1, x2, …, xn еще одну координату x
, закон изменения
которой имеет вид
= f 0(x1, x2, …, xn, u),
где f 0 – подинтегральная функция функционала (J(x(t), u(t), t0, T). Иначе говоря, будем рассматривать систему дифференциальных уравнений
правые части которых не зависят от переменной x
. Введя в рассмотрение век-
тор
y = (x0, x1, x2, …, xn) = (x0, x)X
n + 1
перепишем систему (2.7) в векторной форме:
где f(x,u) = (f 0(x,u), …, f n(x,u)) – вектор пространства X
f(x, u) не зависит от координаты x0 вектора y.
Доказательство: Павлов В. Н. Математическая экономика. – Новосибирск : Изд-во СО РАН, 2005. –
С. 21.
26
,
n + 1
. Заметим, что вектор
Пусть теперь u(t) – некоторое допустимое управление, переводящее x0 в x1,
1 00
,...,
n
xx
1 00
,...,
n
xx
0
0
( ( ), ( ) ,
t
t
f t t dt
xu
1
0
0
( ( ), ( )
t
t
f t t dt
xu
а x = x(t) – соответствующее решение уравнения (2.4) с начальным условием x(t0) = x0. Обозначим y0 точку (0, x0) пространства X
n + 1
, имеющую координаты
(0,
), где (
) = x0 Xn.
Ясно, что решение уравнения (2.8) с начальным условием x(t0) = x
, соот-
ветствующее управлению u(t), определено на отрезке [t0, t1] и имеет вид
y(t) =
x = x(t).
В частности, мы получим
y(t1) =
= J, x(t1) = x1,
т. е. решение x(t) уравнения (2.8) с начальным условием x(t0) = x0 проходит при t = t1 через точку y = (J, x1).
Иначе говоря, обозначив через П прямую линию, проходящую в простран-
стве X через точку x = (0, x1) параллельно оси x0 (эта прямая П образована все­ми точками (ξ, x1)), где число ξ произвольно. Можно сказать, что решение x(t) проходит в момент t = t1 через точку, лежащую на прямой П и имеющую коор­динату x0 = J. Обратно, если u(t) – такое допустимое управление, что соответ­ствующее ему решение x(t) уравнения с начальным условием x(t0)= x0 =(0, x0) проходит в некоторый момент t1 через точку x1П с координатой x0 = J, то управление u(t) переводит (в пространстве X) фазовую точку из положения x0 в положение x1, причем функционал (2.5) принимает значение J.
Таким образом, можем сформулировать поставленную выше оптимальную
задачу в следующем эквивалентном виде.
В фазовом пространстве X размерности n + 1 даны точка x0=(0, x0) и пря­мая П, параллельная оси x0 и проходящая через точку (0, x1). Среди всех допу­стимых управлений u = u(t), обладающих тем свойством, что соответствующее решение x(t) уравнения (2.8) с начальным условием x(t0) = x0 пересекает пря-
мую П, найти такое, для которого точка пересечения с прямой П имеет наименьшую координату x0.
Эта задача и будет решаться далее. Термины «оптимальное управление» и
«оптимальная траектория» сохраним и для задачи в этой новой формулировке.
2.7. Свойства оптимальных управлений и траекторий
Отметим некоторые простые свойства оптимальных управлений и траек-
торий, непосредственно вытекающие из формулировки основной задачи.
1. Из автономности системы (2.6) вытекает, что при сдвиге вдоль оси t
свойства управлений не меняются. Иначе говоря, если управление u(t), t0 ≤ t ≤t1
27
переводит фазовую точку из положения x0 в положение x1 и придает функцио­налу (2.5) значение J, то при любом действительном h управление u(t + h), t0 – h≤ t ≤t1 – h также переводит фазовую точку из положения x0 в положение x1 и придает функционалу (2.5) то же значение J. Это позволяет перемещать начальную точку t0 отрезка t0 ≤ t ≤ t1, на котором задано управление u(t), в лю­бую точку оси времени.
2. Если x0, x1,…, xk – конечная система точек фазового пространства X и ес-
ли существует управление ui(t), переводящее фазовую точку из положения x
i – 1
в положение xi и придающее функционалу (2.6) значение Ji, i = 1, …, k, то су- ществует управление u(t), переводящее фазовую точку из положения x0 в поло­жение xk и придающее функционалу (2.5) значение J1 + J2 + … + JK. В самом де­ле, в силу возможности сдвигать управления вдоль оси времени, мы можем считать, что отрезки, на которых определены управления ui(t), непосредственно примыкают один к другому, т. е. что управление ui(t) задано на отрезке t
< t <ti, где t0 < t1 <… <tk. Обозначим через u(t) управление, заданное на отрезке
1
t0 ≤ t ≤ tk и совпадающее на полуинтервале t
< t ≤ ti с управлением ui(t), т. е.
i – 1
i –
«объединение» всех управлений ui(t). Непосредственно проверяется, что управ­ление u(t) переводит фазовую точку из положения x0 в положение xk и придает функционалу (2.5) значение J1+J2+…+JK . Заметим, что указанная операция «объединения» нескольких управлений была бы невозможна в классе непре­рывных управлений (так как в точках t1, t2, …, t
построенное управление u(t)
k – 1
может иметь разрывы первого рода, даже если управления ui(t) были непрерыв­ными).
3. Всякий кусок оптимальной траектории также является оптимальной тра-
екторией (и аналогично для оптимальных управлений). Более точно: пусть u(t), t0 ≤ t ≤ t1 оптимальное управление, соответствующее переходу из положения x0 в положение x1, а x(t) –соответствующая оптимальная траектория. Тогда если
t0 ≤ τ0 ≤ τ1 ≤ 1, то управление u(t), рассматриваемое на отрезке τ0 ≤ t ≤ τ
, являет-
ся оптимальным управлением, соответствующим переходу из положения x(τ0) в положение x(τ1), а x(t), τ0 ≤ t ≤ τ1 является соответствующей оптимальной траек­торией. Обозначим значения интеграла (2.5), взятого по отрезкам t0 ≤ t ≤τ0, τ
≤ t ≤τ
0
переводящее фазовую точку из положения x0 в положение x
, τ
≤ t ≤t1, соответственно через J1, J2, J3. Тогда управление u(t), t0 ≤ t ≤t1,
1
, придает функци-
оналу (2.5) значение J = J1 + J2 + J3. Если бы управление u(t), рассматриваемое
на отрезке τ
≤ t ≤ τ1 не было оптимальным, то существовало бы некоторое
0
управление v(t), переводящее фазовую точку из положения x(τ0) в положение x(τ1) и придающее функционалу (2.5) значение J
’
< J
. Но тогда мы получили
2
бы управление, переводящее фазовую точку из положения x0 в положение x1 и придающее функционалу (2.5) значение J1 + J2 + J3 < J, что противоречит опти- мальности управления u(t), t0 ≤ t ≤ t1.
28
2.8. Варианты ограничений вдоль траектории
gi(x(t), u(t), t) = 0 для i
1
,1 k
, k1 ≤ n;
(2.9)
hi(x(t), u(t), t) ≤ 0 для i
kk ,11
,
(2.10)
Ограничения вдоль траектории в общем случае описываются системой
ограничений
которые и определяют область G, указанную в формулировке задачи оптималь­ного управления. Частными случаями являются ограничения на управление и
ограничения на фазовые переменные.
Ограничения на управление часто записывают в виде u(t)G(t) для t[t0, T], где множества G(t) для t[t0, T] описаны соотношениями вида (2.2), (2.3) без
зависимости от x(t) в левых частях. Если ограничения на управление отсут­ствуют (как в задаче Лагранжа), то G(t) = Rm для всех t.
Ограничения на фазовые переменные записывают в виде (2.9) без зависи­мости от u(t) в левых частях. К таким ограничениям (при t{t0, T}) относятся и краевые условия.
2.9. Варианты краевых условий
Задачу оптимального управления, в которой t0 или T фиксировано, назы­вают задачей с закрепленным начальным или, соответственно, конечным мо-
ментом.
Задача, в которой начальный и конечный моменты закреплены, называется
задачей с фиксированным временем.
Левый (правый) конец траектории закреплен, если задано краевое условие
x(t0) = x0 (x(T) = x
). Левый (правый) конец траектории свободен, если краевые
условия на соответствующем конце не зависят от состояния. В остальных слу-
чаях говорят, что левый (правый) конец траектории является подвижным.
Связи между значениями t и x(t) на подвижном конце описывают равен­ствами вида (2.9) при t{t0, T} без зависимости от u(t) в левых частях. Эти ра- венства определяют многообразия B и E, о которых говорится в формулировке задачи оптимального управления.
3. ДОСТАТОЧНЫЕ УСЛОВИЯ ОПТИМАЛЬНОСТИ
В теории оптимального управления для решения задач применяется спе­цифический математический аппарат, который использует различные идеи
отыскания оптимальных процессов, использующих свойства и признаки, отли­чающие их от остальных допустимых процессов.
29
В данном разделе излагается содержание методов решения задач опти-
1
0
0Tt
f

(t, x(t), u(t))→min,
(3.1)
( ( ), ( ))x t u t
( ( ), ( ))x t u t
f0(t,
))(),(( tutx
= min
x,uV
tf0
(t,
x, u
).
(3.2)
мального управления на основе достаточных условий оптимальности. Эти ме­тоды отличаются от других методов своим подходом. В них формулируются такие свойства допустимого процесса, которые являются достаточными, т. е. гарантируют его оптимальность. Из опыта решения различных математических
задач известно, что наиболее эффективным средством отыскания решений яв-
ляются необходимые условия. Поэтому, если мы хотим применять достаточные условия, нужно быть уверенным в их близости к необходимым. Этому требова­нию и отвечают предлагаемые ниже достаточные условия оптимальности. По­этому их можно использовать как при аналитическом, так и при численном ре-
шении задач.
В дальнейшем достаточные условия оптимальности будут иметь особое значение. Это связано с методикой, принятой для изложения других методов отыскания оптимальных процессов. Достаточные условия оптимальности будут в этом случае играть существенную роль при выводе количественных соотно-
шений, характерных для этих методов, а также при их обосновании.
3.1. Вспомогательные математические конструкции
Рассмотрим вспомогательную задачу оптимизации, решение которой будет
нами использоваться в дальнейшем.
Пусть задан функционал
где x(t) = (x1(t), x2(t), …, xn(t)) – вектор состояния системы; u(t) = (u1(t),u2(t), …, ur(t)) – вектор управления, на которые наложены условия (x(t), u(t)) Vt, t = 0,1, …, T – 1.
Требуется отыскать минимальное значение функционала (3.1) при задан­ных ограничениях.
Эту задачу можно рассматривать как частный случай задачи оптимального
управления в тривиальном случае, когда среди ограничений, определяющих множество М допустимых процессов, отсутствуют уравнения процесса.
В данной задаче нетрудно получить необходимые и достаточные условия, которым должно удовлетворять оптимальное решение
, минимизиру-
ющее функционал (3.1). Эти условия можно сформулировать в виде теоремы.
Теорема 3.1. Для того чтобы процесс
был оптимальным, т. е.
минимизировал функционал (3.1), необходимо и достаточно, чтобы при всех t = 0, 1, …, T – 1
30
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]