Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Методы оптимальных решений. Учебное пособие-1
.pdf
Началом этой кривой является фиксированное начальное состояние
00
)( xtx
11
)( xtx
t
12
( ), ( ), ..., ( )
r
u t u t u t
)(tu
12
( ), ( ),..., ( )
r
u t u t u t
n
E
)(tu
r
Etu )(
10
ttt
t
10
ttt
)(tu
10
ttt
U
10
ttt
)(tu
U
, а
окончание – конечное состояние
, которое во многих задачах требуется
определить.
Выборы (решения), которые нужно осуществлять в каждый момент времени
из указанного интервала, характеризуются с помощью r вещественных
чисел
, называемых управляющими параметрами. Составлен-
ный из управляющих параметров r-мерный вектор-столбец
(
)",
называемый управляющим вектором, можно интерпретировать геометрически
как точку в
. Управлением называется функция
={
|
}.
Требуется, чтобы каждый управляющий параметр являлся кусочно-
непрерывной функцией времени. Поэтому управление представляет собой ку-
сочно-непрерывную функцию времени. Значениями этой функции в каждый
момент времени
из указанного промежутка являются управляющие векторы.
С геометрической точки зрения управление представляет собой некоторую
кривую, состоящую из точек пространства, причем эта кривая непрерывна всюду, за исключением, возможно, некоторого конечного числа точек разрывов
первого рода.
Предполагается, что возможные значения управляющих параметров удовлетворяют некоторым ограничениям. Эти ограничения в общей форме состоят
в том, что управляющий вектор в каждый момент времени из интервала
должен принадлежать некоторому фиксированному непустому под-
множеству
r-мерного евклидова пространства
,
.
Обычно предполагается, что множество
(область управления) является
выпуклым и компактным (т. е. замкнутым и ограниченным). Управление называется допустимым, если оно представляет собой кусочно-непрерывную вектор-функцию времени, значения которой в любой момент времени из указанно-
го интервала принадлежат . Множество управлений
– это множество всех
допустимых управлений, т. е. таких управлений, которые являются кусочно-
непрерывными функциями времени, заданными в промежутке
. При
этом их значения в любой момент времени из указанного промежутка принад-
лежат . Управление должно принадлежать указанному множеству управле-
ний, т. е.
.
21

Фазовая траектория
)(tx
)),(),(()( ttutxftx
)(t
dt
dx
j
)(tx
j
12
( ( ), ( ),..., ( )
jn
f x t x t x t
12
( ), ( ),..., ( ); ),
r
u t u t u t t
1,2,..., .jn
(...)
1
f,(...)
2
f
(...)
n
f
,)( BuAxtx
A
nn
B
rn
)(tu
)(tx
00
)( xtx
1
t
ttx ),(
T
1
tt
T
1nE
1
t
)(1tx
определяется из уравнений движения, т. е. из си-
стемы дифференциальных уравнений, в которых скорость изменения каждой
фазовой координаты представлена в виде функции фазовых координат, управ-
ляющих параметров и времени
или в развернутом виде
=
,
Предполагается, что каждая из заданных n-функций
…,
является непрерывно дифференцируемой. Если дифференциальные
уравнения не зависят явно от времени, то уравнения движения называются ав-
тономными. Примером такой системы являются линейные автономные уравнения движения
где
размерности
– фиксированная матрица размерности
.
, а
– фиксированная матрица
Фиксированные начальные значения фазовых координат являются гра-
ничными условиями для уравнений движения. Если заданы начальные значения
и управление
, то существует единственная фазовая траектория
, удо-
влетворяющая уравнениям движения и граничным условиям. Эту траекторию
можно найти интегрированием дифференциальных уравнений при данных
начальных условиях
. Фазовая траектория, найденная в результате ре-
,
шения уравнений движения при данном начальном состоянии с использованием допустимого управления, называется допустимой, а любая фазовая точка на
фазовой траектории, которую можно достичь за конечное время, называется
достижимой.
Конечный момент времени
где
– заданное подмножество в
Важными частными случаями задачи управления являются задача с фиксиро-
ванным временем, когда конечный момент времени
параметр задачи, и задача с закрепленным концом, когда
форме как вектор параметров задачи.
22
определяется условием
при
,
, называемое конечной поверхностью.
задан в явной форме как
задан в явной

Целевой функционал, максимум которого требуется найти, представляет
)(tuJJ
1
0
( ), ( ),
t
t
I x t u t t
11
( , ).dt F x t
ttutxI ),(),(
),,( tuxI
12
( ( ), ( ),..., );
n
I x t x t x
12
( ), ( ), ..., ( ); )
r
u t u t u t t
01
t t t
11
,txF
11
,txF
1 1 2 1 1 1
, ,..., ; .
n
F x t x t x t t
( ), ( ),I x t u t t
11
,F x t
...f
0
x
tu
tx
1
0
, , ,
t
t
J I x u t dt
11
,txFJ
tu
max
1
0
11
, , ,
t
t
J I x u t dt F x t
tuxfx ;;
0
t
00
xtx
,x t t T
Ututt ,
1
собой отображение управлений (функций времени) на точки вещественной
прямой. Этот функционал будет рассматриваться в следующей форме:
Подынтегральная функция
=
показывает, что функционал зависит
от фазовых координат и управляющих параметров, являющихся функциями
времени, и от времени, т. е.
=
, где
.
Второе слагаемое
в выражении для функционала, которое мы зовем
функцией конечных параметров, показывает, что функционал зависит от ко-
нечного состояния и от конечного момента времени:
Предполагается, что как
, так и
являются фиксирован-
ными, непрерывно дифференцируемыми функциями. Целевой функционал записан как функционал, зависящий от управлений, потому что если вектор-
функция
и вектор
заданы, то управление
определяет фазовую тра-
екторию
.
Задачу с целевым функционалом обычно называют задачей Больца. Если
функция конечных параметров тождественно равна нулю так, что
то такую задачу называют задачей Лагранжа. Задачу, в которой подынтеграль-
ная функция тождественно равна нулю так, что
,
называют обычно задачей Майера.
Итак, общая задача управления состоит в следующем: требуется найти
при условии, что
и
фиксированы,
при
[1].
23

2.3. Виды управлений
ut
0
t
tx
ttxu ,
)),(),(()( ttutxftx
В задачах управления встречаются два вида управления. Один из них –
управление по разомкнутому контуру. В этом случае оптимальное управление,
являющееся решением функционала, определяется как функция времени
.
Управление по разомкнутому контуру полностью определяется в начальный момент
, а фазовая траектория
отыскивается в результате интегри-
рования уравнений движения при фиксированных начальных условиях.
Другой вид управления – управление по замкнутому контуру (с обратной
связью). В этом случае оптимальное управление определяется как функция текущих фазовых координат и времени
.
В отличие от управления по разомкнутому контуру, когда все решения
принимаются заранее, при управлении по замкнутому контуру решения можно
пересматривать с учетом новой информации, которую несут текущие фазовые
координаты. Задача определения оптимального управления по замкнутому контуру называется задачей синтеза.
Примеры этих двух видов управления существуют в экономике. Автоматические стабилизаторы, такие как страхование по безработице и прогрессив-
ный подоходный налог, представляют собой системы управления с обратной
связью. Так, например, рост безработных приводит к росту суммы выплат пособий по безработице, что в свою очередь противодействует росту безработицы. Аналогично этому расширение инфляции приводит при действующей системе прогрессивного налогообложения к соответствующему увеличению подоходного налога, что противодействует росту инфляции. Управляющие параметры в каждом из этих случаев (пособия по безработице и налоговые отчисле-
ния) соответствуют текущему состоянию экономики.
В дальнейшем предполагается, что задача управления не содержит случай-
ных переменных и что все необходимые параметры, функции и множества пол-
ностью определены. В этом случае управление по замкнутому контуру и управ-
ление с обратной связью приводят к одинаковым результатам. В двух типах
задач управления управление по замкнутому контуру имеет преимущество пе-
ред управлением по разомкнутому контуру, так как первое доставляет большое
максимальное значение целевого функционала. Этими двумя типами задач яв-
ляются задачи стохастического управления.
2.4. Общая формулировка задачи оптимального управления
Определения
Допустим, что заданы: множество допустимых управлений U; система
дифференциальных связей
; ограничения вдоль траектории
(x(t), u(t), t)G; краевые условия (x(t0), t0)B и (x(T), T)E. Процесс x0(t), u0(t)
является допустимым, если существуют числа t0 и T (t0 < T) такие, что:
24

а) функция u0(t) кусочно-непрерывна и определена на [t0, T];
*
0
t
T
t
dttuxF
0
),,(
3
4
б) функция x0(t) кусочно-дифференцируема на [t0, T];
в) t0, T, x0(t0) и x0(T) удовлетворяют краевым условиям;
г) для процесса x0(t), u0(t) выполняются ограничения вдоль траектории;
д) функция x0(t) на отрезке [t0, T] является единственным решением задачи
Коши для системы дифференциальных связей при u(t) = u0(t) с начальным усло-
вием x(t0) = x0(t0).
Задача оптимального управления формулируется следующим образом:
найти вектор-функции u*(t), x*(t), которые максимизируют функционал J(x(t),
u(t)) на множестве допустимых процессов.
Здесь J(x(t), u(t)) – целевой функционал, определенный на всех допустимых
процессах, критерий качества управления; u*(t) – оптимальное управление;
x*(t) – оптимальная траектория; x*(t), u*(t) – оптимальный процесс;
G Rn Rm R – замкнутая область3; B и E – многообразия4 в Rn R. Заметим,
что вместе с оптимальным процессом x*(t), u*(t) определяются и значения t0 =
и T = T*, фигурирующие в определении допустимого процесса.
Основные проблемы, относящиеся к теории оптимального управления:
– управляемость (существование допустимого управления, удовлетворя-
ющего граничным условиям);
– разрешимость (существование оптимального управления);
– необходимые условия оптимальности;
– достаточные условия оптимальности;
– единственность оптимального решения.
2.5. Основные типы функционалов
Интегральный функционал от процесса x(t), u(t) имеет вид
J(x(t), u(t), t0, T) =
.
Если ограничения вдоль траектории отсутствуют, то задача оптимизации
интегрального функционала при дифференциальных связях и краевых условиях
называется задачей Лагранжа.
Рассмотрим чаcтный случай поставленной выше задачи оптимизации. Если в интегральном функционале F(x, u, t) 1, то J(x(t), u(t), t0, T) = (T – t
), и оп-
0
тимальность управления u(t) означает минимальность времени перехода из положения x0 в положение x
. Задача минимизации этого функционал при диффе-
1
ренциальных связях и краевых условиях (частный случай задачи Лагранжа)
называется задачей оптимального быстродействия.
См. разд. 4.2.4.
См. разд. 4.2.5.
25

Терминальный функционал от процесса x(t), u(t) имеет вид J(x(t), u(t), T) =
T
t
dttuxF
0
),,(
dt
dx
0
dt
dx
i
= f
i
( u1, …, ur) f i(x, u) при i{0, …, n},
(2.7)
ddty
= f(x,u),
(2.8)
5
Φ(x(T), T). Задачу оптимизации терминального функционала при дифференци-
альных связях и краевых условиях называют задачей Майера.
Теорема 2.1. Задача Лагранжа является частным случаем задачи Майера5.
Более общей является задача Больца: при дифференциальных связях и
краевых условиях оптимизировать функционал
J(x(t), u(t), t0, T) =
+ Φ(x(T), T).
Здесь первое (интегральное) слагаемое можно интерпретировать как эффект,
полученный в течение процесса, а второе (терминальное) – как остаточный эффект, возникающий после завершения процесса.
2.6. Необходимое условие оптимальности
Для формулировки и доказательства необходимого условия оптимальности
будет удобно дать иную формулировку поставленной выше задачи. Добавим к
фазовым координатам x1, x2, …, xn еще одну координату x
0
, закон изменения
которой имеет вид
= f 0(x1, x2, …, xn, u),
где f 0 – подинтегральная функция функционала (J(x(t), u(t), t0, T). Иначе говоря,
будем рассматривать систему дифференциальных уравнений
правые части которых не зависят от переменной x
0
. Введя в рассмотрение век-
тор
y = (x0, x1, x2, …, xn) = (x0, x)X
n + 1
перепишем систему (2.7) в векторной форме:
где f(x,u) = (f 0(x,u), …, f n(x,u)) – вектор пространства X
f(x, u) не зависит от координаты x0 вектора y.
Доказательство: Павлов В. Н. Математическая экономика. – Новосибирск : Изд-во СО РАН, 2005. –
С. 21.
26
,
n + 1
. Заметим, что вектор

Пусть теперь u(t) – некоторое допустимое управление, переводящее x0 в x1,
1
00
,...,
n
xx
1
00
,...,
n
xx
0
0
( ( ), ( ) ,
t
t
f t t dt
xu
1
0
0
( ( ), ( )
t
t
f t t dt
xu
а x = x(t) – соответствующее решение уравнения (2.4) с начальным условием
x(t0) = x0. Обозначим y0 точку (0, x0) пространства X
n + 1
, имеющую координаты
(0,
), где (
) = x0 Xn.
Ясно, что решение уравнения (2.8) с начальным условием x(t0) = x
, соот-
0
ветствующее управлению u(t), определено на отрезке [t0, t1] и имеет вид
y(t) =
x = x(t).
В частности, мы получим
y(t1) =
= J, x(t1) = x1,
т. е. решение x(t) уравнения (2.8) с начальным условием x(t0) = x0 проходит при
t = t1 через точку y = (J, x1).
Иначе говоря, обозначив через П прямую линию, проходящую в простран-
стве X через точку x = (0, x1) параллельно оси x0 (эта прямая П образована всеми точками (ξ, x1)), где число ξ произвольно. Можно сказать, что решение x(t)
проходит в момент t = t1 через точку, лежащую на прямой П и имеющую координату x0 = J. Обратно, если u(t) – такое допустимое управление, что соответствующее ему решение x(t) уравнения с начальным условием x(t0)= x0 =(0, x0)
проходит в некоторый момент t1 через точку x1П с координатой x0 = J, то
управление u(t) переводит (в пространстве X) фазовую точку из положения x0 в
положение x1, причем функционал (2.5) принимает значение J.
Таким образом, можем сформулировать поставленную выше оптимальную
задачу в следующем эквивалентном виде.
В фазовом пространстве X размерности n + 1 даны точка x0=(0, x0) и прямая П, параллельная оси x0 и проходящая через точку (0, x1). Среди всех допустимых управлений u = u(t), обладающих тем свойством, что соответствующее
решение x(t) уравнения (2.8) с начальным условием x(t0) = x0 пересекает пря-
мую П, найти такое, для которого точка пересечения с прямой П имеет
наименьшую координату x0.
Эта задача и будет решаться далее. Термины «оптимальное управление» и
«оптимальная траектория» сохраним и для задачи в этой новой формулировке.
2.7. Свойства оптимальных управлений и траекторий
Отметим некоторые простые свойства оптимальных управлений и траек-
торий, непосредственно вытекающие из формулировки основной задачи.
1. Из автономности системы (2.6) вытекает, что при сдвиге вдоль оси t
свойства управлений не меняются. Иначе говоря, если управление u(t), t0 ≤ t ≤t1
27

переводит фазовую точку из положения x0 в положение x1 и придает функционалу (2.5) значение J, то при любом действительном h управление u(t + h), t0 –
h≤ t ≤t1 – h также переводит фазовую точку из положения x0 в положение x1 и
придает функционалу (2.5) то же значение J. Это позволяет перемещать
начальную точку t0 отрезка t0 ≤ t ≤ t1, на котором задано управление u(t), в любую точку оси времени.
2. Если x0, x1,…, xk – конечная система точек фазового пространства X и ес-
ли существует управление ui(t), переводящее фазовую точку из положения x
i – 1
в положение xi и придающее функционалу (2.6) значение Ji, i = 1, …, k, то су-
ществует управление u(t), переводящее фазовую точку из положения x0 в положение xk и придающее функционалу (2.5) значение J1 + J2 + … + JK. В самом деле, в силу возможности сдвигать управления вдоль оси времени, мы можем
считать, что отрезки, на которых определены управления ui(t), непосредственно
примыкают один к другому, т. е. что управление ui(t) задано на отрезке t
< t <ti, где t0 < t1 <… <tk. Обозначим через u(t) управление, заданное на отрезке
1
t0 ≤ t ≤ tk и совпадающее на полуинтервале t
< t ≤ ti с управлением ui(t), т. е.
i – 1
i –
«объединение» всех управлений ui(t). Непосредственно проверяется, что управление u(t) переводит фазовую точку из положения x0 в положение xk и придает
функционалу (2.5) значение J1+J2+…+JK . Заметим, что указанная операция
«объединения» нескольких управлений была бы невозможна в классе непрерывных управлений (так как в точках t1, t2, …, t
построенное управление u(t)
k – 1
может иметь разрывы первого рода, даже если управления ui(t) были непрерывными).
3. Всякий кусок оптимальной траектории также является оптимальной тра-
екторией (и аналогично для оптимальных управлений). Более точно: пусть u(t),
t0 ≤ t ≤ t1 оптимальное управление, соответствующее переходу из положения x0
в положение x1, а x(t) –соответствующая оптимальная траектория. Тогда если
t0 ≤ τ0 ≤ τ1 ≤ 1, то управление u(t), рассматриваемое на отрезке τ0 ≤ t ≤ τ
, являет-
1
ся оптимальным управлением, соответствующим переходу из положения x(τ0) в
положение x(τ1), а x(t), τ0 ≤ t ≤ τ1 является соответствующей оптимальной траекторией. Обозначим значения интеграла (2.5), взятого по отрезкам t0 ≤ t ≤τ0,
τ
≤ t ≤τ
0
переводящее фазовую точку из положения x0 в положение x
, τ
≤ t ≤t1, соответственно через J1, J2, J3. Тогда управление u(t), t0 ≤ t ≤t1,
1
1
, придает функци-
1
оналу (2.5) значение J = J1 + J2 + J3. Если бы управление u(t), рассматриваемое
на отрезке τ
≤ t ≤ τ1 не было оптимальным, то существовало бы некоторое
0
управление v(t), переводящее фазовую точку из положения x(τ0) в положение
x(τ1) и придающее функционалу (2.5) значение J
’
< J
. Но тогда мы получили
2
2
бы управление, переводящее фазовую точку из положения x0 в положение x1 и
придающее функционалу (2.5) значение J1 + J2 + J3 < J, что противоречит опти-
мальности управления u(t), t0 ≤ t ≤ t1.
28

2.8. Варианты ограничений вдоль траектории
gi(x(t), u(t), t) = 0 для i
1
,1 k
, k1 ≤ n;
(2.9)
hi(x(t), u(t), t) ≤ 0 для i
kk ,11
,
(2.10)
Ограничения вдоль траектории в общем случае описываются системой
ограничений
которые и определяют область G, указанную в формулировке задачи оптимального управления. Частными случаями являются ограничения на управление и
ограничения на фазовые переменные.
Ограничения на управление часто записывают в виде u(t)G(t) для t[t0,
T], где множества G(t) для t[t0, T] описаны соотношениями вида (2.2), (2.3) без
зависимости от x(t) в левых частях. Если ограничения на управление отсутствуют (как в задаче Лагранжа), то G(t) = Rm для всех t.
Ограничения на фазовые переменные записывают в виде (2.9) без зависимости от u(t) в левых частях. К таким ограничениям (при t{t0, T}) относятся и
краевые условия.
2.9. Варианты краевых условий
Задачу оптимального управления, в которой t0 или T фиксировано, называют задачей с закрепленным начальным или, соответственно, конечным мо-
ментом.
Задача, в которой начальный и конечный моменты закреплены, называется
задачей с фиксированным временем.
Левый (правый) конец траектории закреплен, если задано краевое условие
x(t0) = x0 (x(T) = x
1
). Левый (правый) конец траектории свободен, если краевые
условия на соответствующем конце не зависят от состояния. В остальных слу-
чаях говорят, что левый (правый) конец траектории является подвижным.
Связи между значениями t и x(t) на подвижном конце описывают равенствами вида (2.9) при t{t0, T} без зависимости от u(t) в левых частях. Эти ра-
венства определяют многообразия B и E, о которых говорится в формулировке
задачи оптимального управления.
3. ДОСТАТОЧНЫЕ УСЛОВИЯ ОПТИМАЛЬНОСТИ
В теории оптимального управления для решения задач применяется специфический математический аппарат, который использует различные идеи
отыскания оптимальных процессов, использующих свойства и признаки, отличающие их от остальных допустимых процессов.
29

В данном разделе излагается содержание методов решения задач опти-
1
0
0Tt
f
(t, x(t), u(t))→min,
(3.1)
( ( ), ( ))x t u t
( ( ), ( ))x t u t
f0(t,
))(),(( tutx
= min
x,uV
tf0
(t,
x, u
).
(3.2)
мального управления на основе достаточных условий оптимальности. Эти методы отличаются от других методов своим подходом. В них формулируются
такие свойства допустимого процесса, которые являются достаточными, т. е.
гарантируют его оптимальность. Из опыта решения различных математических
задач известно, что наиболее эффективным средством отыскания решений яв-
ляются необходимые условия. Поэтому, если мы хотим применять достаточные
условия, нужно быть уверенным в их близости к необходимым. Этому требованию и отвечают предлагаемые ниже достаточные условия оптимальности. Поэтому их можно использовать как при аналитическом, так и при численном ре-
шении задач.
В дальнейшем достаточные условия оптимальности будут иметь особое
значение. Это связано с методикой, принятой для изложения других методов
отыскания оптимальных процессов. Достаточные условия оптимальности будут
в этом случае играть существенную роль при выводе количественных соотно-
шений, характерных для этих методов, а также при их обосновании.
3.1. Вспомогательные математические конструкции
Рассмотрим вспомогательную задачу оптимизации, решение которой будет
нами использоваться в дальнейшем.
Пусть задан функционал
где x(t) = (x1(t), x2(t), …, xn(t)) – вектор состояния системы; u(t) = (u1(t),u2(t),
…, ur(t)) – вектор управления, на которые наложены условия (x(t), u(t)) Vt,
t = 0,1, …, T – 1.
Требуется отыскать минимальное значение функционала (3.1) при заданных ограничениях.
Эту задачу можно рассматривать как частный случай задачи оптимального
управления в тривиальном случае, когда среди ограничений, определяющих
множество М допустимых процессов, отсутствуют уравнения процесса.
В данной задаче нетрудно получить необходимые и достаточные условия,
которым должно удовлетворять оптимальное решение
, минимизиру-
ющее функционал (3.1). Эти условия можно сформулировать в виде теоремы.
Теорема 3.1. Для того чтобы процесс
был оптимальным, т. е.
минимизировал функционал (3.1), необходимо и достаточно, чтобы при всех
t = 0, 1, …, T – 1
30
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
