Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Обобщенные решения уравнений в частных производных первого порядка. Перспективы динамической оптимизации

.pdf
Скачиваний:
0
Добавлен:
07.09.2026
Размер:
2 Мб
Скачать
☆
13. СТАБИЛЬНЫЕ МОСТЫ И ЭКСТРЕМАЛЬНЫЕ СТРАТЕГИИ 151
множество M ⊂ Rn. Игрок P стремится гарантировать выполнение усло­вия x(θ) ∈M. Предполагается, как и в предыдущих разделах, что игрок P знает текущую позицию (t, x(t)) и формирует свое управление p(t) на осно­вании обратной связи. Как и прежде, динамика управляемой системы опи­сывается уравнением
˙x = f (t, x, p, q). (13.1)
Функция f :[0,θ] × R
n
× P × Q → Rnпредполагается непрерывной. Она
удовлетворяет условию Липшица
(1)
f(t, x
,p,q) − f (t, x
для всех (t, p, q) ∈ [0,θ]×P ×Q, x
(2)
,p,q) λx
(1),x(2)
(1)
(2)
− x
(13.2)
∈ Rn. Кроме того, предполагаем,
что имеет место следующее равенство
min
max
p∈P
s, f (t, x,p, q) =max
q∈Q
для всех (t, x,s) ∈ [0,θ] ×R
q∈Q
n
× Rn.
max
s, f (t, x,p, q) = H(t, x,s) (13.3)
p∈P
Заметим, что в задаче M-сближения игрок P стремится добиться того, чтобы фазовая точка достигла целевого множества в фиксированный, апри­орно заданный момент времени t = θ. В параграфе 19 будет рассмотрена другая дифференциальная игра, а именно, игра на оптимальное время, в ко­торой игрок P минимизирует время достижения цели, т. е. время до первого попадания траектории управляемой системы на целевое множество.
Теперь введем одно важное понятие, которое будет использоваться для решения задачи M -сближения.
Многозначное отображение
[0,θ] t → W (t) ⊂ R
n
называется стабильным мостом в задаче M-сближения, если W (θ) ⊂ M ,а график этого многозначного отображения
W := {(t, w): t ∈ [0,θ],w∈ W (t)}
n
замкнут в [0,θ]×R
и слабо инвариантен относительно дифференциального
включения
˙x ∈ co f (t, x, P, q) (13.4)
при любом q ∈ Q. Здесь и ниже используется обозначение
f(t, x, P, q):={f(t,x, p, q): p ∈ P }.
152 ГЛАВА III
Условие слабой инвариантности означает, что для любых q ∈ Q и (t
) ∈ W существует выживающая траектория x(·): [t0,θ] → Rn,ко-
0,x0
торая удовлетворяет дифференциальному включению (13.4), начальному условию x(t для всех t ∈ [t
)=x0и следующему условию выживаемости: x(t) ∈ W (t)
0
,θ]. В теории позиционных дифференциальных игр это
0
свойство было названо условием u-стабильности.
АМЕЧАНИЕ. Пусть множество f (t, x, P, q) выпукло для всех
З
(t, x, q) ∈ [0,θ] × R
выполнение следующего условия: для любой точки (t измеримого управления [t ление [t
,θ]  t → p(t) ∈ P такое, что соответствующая траектория x(·)
0
n
× Q. Тогда свойство u-стабильности подразумевает
) ∈ W илюбого
,θ]  t → q(t) ∈ Q существует измеримое управ-
0
0,x0
дифференциального уравнения
˙x(t)=f (t, x(t),p(t),q(t))
c начальным условием x(t то есть x(t) ∈ W(t) при всех t ∈ [t
)=x0проходит внутри стабильного моста W ,
0
,θ]. Вышеупомянутый факт следует из
0
теоремы Филиппова (см., например, [72, 225]).
Свойство слабой инвариантности множества W относительно диффе­ренциального включения (13.4) (свойство u-стабильности) может быть вы­ражено с помощью различных средств математического аппарата. Ниже рассматриваются некоторых из них.
Определим индикаторную функцию множества W
u(t, x):=
0, если x ∈ W(t), 1, в иных точках.
(13.5)
Отметим, что функция u полунепрерывна снизу. Покажем, что функция u — верхнее решение уравнения
∂u
+ H(t, x, D
∂t
u)=0. (13.6)
x
Полагаем
E(t, x, q):=co{(f (t, x, p, q), 0) ∈ R
n
× R : p ∈ P }.
Очевидно, что
min{s, f −g :(f, g) ∈ E(t, x, q)} = H(t, x, s)
max
q∈Q
для любых (t, x, q) ∈ [0,θ]×R значное отображение (t, x) → E(t, x, q) непрерывно. Следовательно, отоб­ражение E удовлетворяет всем условиям (j), (jj), (jjj
n
×Q.МножествоE(t, x, q) выпукло. Много-
+
), (jv+), сформулиро-
ванным в разделе 6.2.
13. СТАБИЛЬНЫЕ МОСТЫ И ЭКСТРЕМАЛЬНЫЕ СТРАТЕГИИ 153
Пусть (t0,x0) ∈ [0,θ] × Rn, q ∈ Q.Нужнодоказать,чтосуществует траектория (x(t),z(t)), t ∈ [t
,θ], которая удовлетворяет включению
0
(˙x, ˙z) ∈ E(t, x, q), (13.7)
начальному условию x(t
z(t)=z
Возможны два случая: u(t
)=x0, z(t0)=u(t0,x0) и неравенству
0
= u(t0,x0)  u(t, x(t)), при t ∈ [t0,θ]. (13.8)
0
)=1и u(t0,x0)=0.Еслиu(t0,x0)=1,то
0,x0
очевидно, что неравенство (13.8) справедливо, т. к. функция u принимает только значения 0 или 1. Если u(t
)=0,тоx0∈ W (t0). Из определения
0,x0
стабильного моста следует, что существует такая траектория дифференци­ального включения (13.7), что x(t) ∈ W (t). Из этого факта и вытекает требуемое условие (13.8). Таким образом, показано, что функция u удо­влетворяет критерию (U2) в определении 6.5. Следовательно, функция u является верхним решением уравнения (13.6).
Согласно теореме 6.4, критерии (U2) и (U5), приведенные в пункте 6.3, эквивалентны. Поэтому рассматриваемая функция u удовлетворяет следу­ющему условию
−
inf{d
u(t, x;1,f) −s, f + H(t, x, s): f ∈ Rn}  0 (13.9)
n
при любых s ∈ R
, (t, x) ∈ (0,θ) × Rn.Отметим,чтоu — индикаторная функция замкнутого множества. Если (t, x) ∈ W, то существует окрест­ность точки (t, x), в который функция принимает значение 1. Поэтому
−
d
u(t, x;1,f)=0для всех f ∈ Rn. Следовательно в этом случае имеет
место условие (13.9) (при f = Ks,гдеK — достаточно большое число).
Такимобразом,требуетсяпроверитьусловие(13.9) толькодля (t, x)∈W . Вэтомслучаеu(t,x)=0, и из (13.5) вытекает, что d Поэтому неравенство (13.9) эквивалентно следующему условию: для любой точки (t, x) ∈ W , t<θсуществует вектор f ∈ R
−
d
u(t, x;1,f)=0, s, f H(t, x, s).
−
Из определения производной d ство
{f ∈ R
n
: d−u(t, x;1,f)=0} = DtW (t∗; x∗),
u(t, x;1,f) (cм. (6.8)) следует также равен-
−
u(t, x;1,f) ∈{0, ∞}.
n
,такой,что
где множество
D
W (t; x):=f ∈ Rn: lim inf
t
dist (x + δf;W (t + δ))
δ↓0
δ
=0
(13.10)
является правосторонней производной по t многозначного отображения
[0,θ] t → W (t) ⊂ R
n
вточке(t, x) ∈ W .
154 ГЛАВА III
Таким образом, приходим к следующему условию
W (t; x) ∩{f ∈ Rn: s, f   H(t, x, s)} = ∅, (13.11)
D
t
для любых t ∈ [0,θ), x ∈ W (t), s ∈ R жество D
W (t; x) может быть заменено его выпуклой оболочкой. Данные
t
n
. Легко заметить, что здесь мно-
условия эквивалентны первоначальному определению свойства стабильно­сти.
Точно так же можно доказать, что для рассматриваемой индикатор­ной функции u условие (U3) в определении 6.5 может быть переписано следующим образом
co D
W (t; x) ∩ co f(t, x, P, q) = ∅, (13.12)
t
для любых t ∈ [0,θ), x ∈ W(t), q ∈ Q.
13.2. Экстремальная стратегия
Ниже будут использоваться следующие обозначения
W
(t, x)=Arg min
e
e
S
(t, x)={se= we− x: we∈ We(t, x)}.
Если W (t)=∅, то полагаем формально S вольно s
e
(t, x) ∈ Se(t, x) и
w∈W (t)
x −w,
e
(t, x)={0}. Выберем произ-
U
(t, x) ∈ Arg max
e
p∈P
min
f(t, x, p,q),se(t, x). (13.13)
q∈Q
Определенную таким образом функцию U
:[0,θ]×Rn→ P будем называть
e
стратегией, экстремальной к стабильному мосту W .
Поясним идею, мотивирующую такую конструкцию стратегии U гласно определению, W рые являются ближайшими к точке x. Поэтому можно сказать, что век-
e
тор s
(t, x) соединяет точку x имножествоW (t) самым коротким путем.
Условие (13.13) означает, что управление U
(t, x) — это подмножество точек из W (t),кото-
e
(t, x) выбрано так, чтобы на
e
.Со-
e
маленьком интервале времени [t, t + δ] это управление гарантировало мак­симальный сдвиг фазовой точки в направлении множества W(t).
Ниже сформулирован основной результат относительно стратегий, ко­торые являются экстремальными к стабильным мостам. Формулировка это­го результата имеет более компактную форму, если вместо кусочно-посто­янных управлений p(t)=U
,x(ti)), t ∈ [ti,t
e(ti
i+1
), ti,t
∈ Δ исоот-
i+1
ветствующих пошаговых движений рассматривать предельные процедуры, в которых diam (Δ) → 0. Упомянутые конструкции вводятся следующим образом.
13. СТАБИЛЬНЫЕ МОСТЫ И ЭКСТРЕМАЛЬНЫЕ СТРАТЕГИИ 155
Пусть задана начальная позиция (t0,x0) ∈ [0,θ]×RnПусть (U, Δ) —по­шаговая процедура, выбранная игроком P (здесь U :[0,θ]×R тегия по принципу обратной связи, и Δ:={t разбиение интервала времени [t
,θ]). Обозначим символом X(t0,x0,U,Δ)
0
0<t1
< ··· <t
множество абсолютно непрерывных функций x(·): [t удовлетворяют начальному условию x(t
)=x0и дифференциальному
0
n
→ P —стра-
= θ} —
m+1
,θ] → Rn, которые
0
включению
˙x(t) ∈ co {f(t, x(t),p(t),q): q ∈ Q}
для почти всех t ∈ [t
,θ],где
0
p(t)=U(t
,x(ti)),ti t<t
i
,i∈ 0,m.
i+1
Далее, введем
X(t
,U) := lim sup
0,x0
diam Δ↓0
X(t0,x0,U,Δ), (13.14)
где символ lim sup обозначает верхний топологический предел (см. прило­жение, параграф A2). Согласно этому определению, функция x(·): [t
n
является элементом множества X(t0,x0,U) тогда и только тогда, ко-
→ R
гда существуют такие последовательности Δ
и xk(·) ∈ X(t0,x0,U,Δk)
k
,θ] →
0
(k =1, 2,...),что
lim
diam Δk=0, lim
k→∞
Множество X(t
,U) называется пучком предельных траекторий,
0,x0
k→∞
max
xk(t) −x(t) =0.
t∈[t0,θ]
порожденных стратегией U .
13.3. Теорема
Пусть W —стабильныймоствзадачеM -сближения, и пусть U
— по-
e
зиционная стратегия, которая является экстремальной к множеству W. Предположим, что начальная позиция (t
) принадлежит множе-
0,x0
ству W .Тогда
(t, x(t)) ∈ W, ∀ x(·) ∈ X (t
0,x0,Ue
и, в частности, x(θ) ∈ W(θ) ⊂ M , т. е. стратегия U
), ∀t ∈ [t0,θ],
гарантирует сбли-
e
жение с множеством M в фиксированный конечный момент времени t = θ при условии, что начальная позиция (t
) лежит на стабильном мосту.
0,x0
Доказательство будет дано ниже. Прежде всего прокомментируем это утверждение.
156 ГЛАВА III
Напомним, что множество W называется слабо (сильно) инвариантным относительно динамической системы, если для любого начального состоя­ния, которое принадлежит этому множеству, по крайней мере одна траекто­рия (любая траектория) проходит внутри множества W . Поэтому, согласно теореме 13.3, слабая инвариантность множества W относительно диффе­ренциальных включений (13.4) порождает сильную инвариантность этого множества относительно управляемых процессов, генерируемых позицион­ной стратегией, которая экстремальна к множеству W .
Следующее замечание касается задачи M -сближения, в которой иг- рок P имеет информационное δ-преимущество. А именно, рассмотрим иг­ру, в которой игроки выбирают их управления согласно следующим прави­лам. В начальный момент времени t = t ние q(t), которое будет выбрано противником на интервале времени [t
t
= t0+ δ. Базируясь на этой информации и знании начального со-
1
стояния, игрок P выбирает управление p(t) на первом интервале [t Вмоментвремениt
игрок P знает текущую позицию игры (t1,x(t1))
1
и управление q(t) игрока Q на интервале времени [t так далее. Предположим также, что множество f (t, x, P, q) выпукло для всех (t, x,q) ∈ [0,θ] × R
n
× Q. Пусть начальная позиция (t0,x0) принад-
игрок P знает заранее управле-
0
), t2= t1+ δ и
1,t2
0,t1
0,t1
лежит стабильному мосту W. Согласно вышеупомянутым предположени­ям, игрок P может выбирать управление p(·): [t
(t
,x(ti)) ∈ W для любого ti,включаяtk= θ, и поэтому игрок P гаран-
i
) → P так, чтобы
i,ti+1
тирует сближение x(θ) ∈ W(θ) ⊂ M при любом выборе игроком Q управ­ления q(·): [t
) → Q. Этот факт следует немедленно из определения
i,ti+1
стабильного моста.
Вышеизложенная постановка вряд ли является реалистичной, но мож­но полагать, что информация об управлении противника q(τ) на предстоя­щий интервал времени [t мацией об управлении на предшествовавшем интервале [t
i,ti+1
), t
= ti+ δ может быть заменена инфор-
i+1
−δ, ti). Действи-
i
тельно, известно, что для некоторого класса управляемых систем различие между этими двумя постановками не является существенным в следующем смысле. Если параметр δ мал, то результат, гарантированный для игрока P при наличии информационного δ-преимущества, близок к результату, ко­торый гарантирован в указанной модификации. Однако, и эта измененная постановка также неприменима к реально существующим задачам управле­ния, т. к. фактически невозможно измерять управления (или помехи) q(τ ),
− δ, ti), с необходимой точностью.
τ ∈ [t
i
Поэтому предлагаемая постановка задачи в классе стратегий по прин­ципу обратной связи кажется более предпочтительной в этом отношении. Построение позиционной стратегии, которая является экстремальной к дан­ному стабильному мосту, — относительно простая задача. Главная вычис­лительная проблема — построение соответствующего стабильного моста.
),
).
13. СТАБИЛЬНЫЕ МОСТЫ И ЭКСТРЕМАЛЬНЫЕ СТРАТЕГИИ 157
Некоторые результаты, связанные с такими проблемами, будут рассматри­ваться в параграфе 16.
13.4. Доказательство теоремы 13.3
Рассмотрим индикаторную функцию для множества W ,определяемую равенством (13.5). Напомним, что эта функция является верхним решением уравнения (13.6). Полагаем
w(t, x, y)=e
−2λt
x −y2,
v(t, x):=min
Определим стратегию U
подобно конструкции из раздела 12.2. А именно,
∗
[u(t, y)+w(t, x, y)].
n
y∈R
выберем точку
y(t, x) ∈ Arg min
[u(t, y)+w(t, x, y)]
n
y∈R
и определим вектор
s(t, x):=D
w(t, x, y(t, x)) = 2e
x
−2λt
(x −y(t, x)).
Напомним, что λ — коэффициент из условия Липшица (13.2). Стратегия U задается соотношением
U
(t, x) ∈ Arg min
∗
p∈P
[max
s(t, x),f(t, x, p,q)], (13.15)
q∈Q
которым завершается это определение.
Отметим, что в области
N := {(t, x) ∈ [0,θ] × R
экстремальная стратегия U тегией вида U
(13.15). Действительно, если (t, x) ∈ N ,тоy(t, x) —точкаиз
∗
множества W (t),ближайшаякточкеx. Ясно также, что вектор s(t, x), рас­сматриваемый здесь, и вектор s
ны равенством s(t, x)=−2e
, определенная в пункте 13.2, совпадает со стра-
e
e
(t, x), определенный в разделе 13.2, связа-
−2λtse
n
: v(t, x) <e
(t, x). Поэтому условия (13.13) и (13.15)
−2λt
}
эквивалентны. Заметим еще, что функция w(t,x, y) удовлетворяет условию
∗
∂w
+ H(t, x, D
∂t
w) − H(t, y, −Dyw) 0.
x
После вышеизложенных предварительных замечаний докажем теперь теорему 13.3.
158 ГЛАВА III
Пусть x0∈ W (t0). Рассмотрим движение x(·) ∈ X (t0,x0,Ue, Δ).Из
−2λt
того, что x
∈ W (t0),следуетv(t0,x0)=0<e
0
неравенства v(t (здесь t
∈ Δ; напомним, что Δ={ti: i ∈ 0,m+1, t
i
Следовательно, (t
,x(ti)) <e
i
,x(ti)) ∈ N и Ue(ti,x(ti)) = U∗(ti,x(ti)), i ∈ 0,k.
i
−2λt
i
выполнены для каждого i =0,1, ...,km
0
.Предположим,что
= θ).
m+1
Принимая во внимание, что в рассматриваемой задаче интегрант g равняет­ся нулю, и повторяя оценки, представленные в доказательстве теоремы 12.3, получаем
,x(ti))  ζ(δ), где lim
v(t
i
для каждого i ∈
Выберем достаточно малое число δ>0, такое, что выполняется нера­венство ζ(δ) <e при всех t дого t
∈ Δ. Нетрудно видеть, что для каждого ti∈ Δ ивсехt ∈ [ti,t
i
0,k+1.
−2λθ
. Тогда предположение v(ti,x(ti)) <e
∈ Δ. Следовательно, оценки (13.16) также выполнены для каж-
i
ζ(δ)=0,δ=diamΔ, (13.16)
δ→0
−2λt
i
выполнено
i+1
справедливы оценки
dist ((t, x(t)); W ) dist ((t
,x(ti)); W )+cδ  e
i
λθ
ζ(δ)+cδ, (13.17)
где c — некоторая константа. Переходя к пределу при δ → 0,приходимк требуемому утверждению.
13.5. Оптимальность стратегий, экстремальных к множествам уровня
функции цены
Оптимальные стратегии в дифференциальных играх с платой ви­да (11.2) могут быть сконструированы в форме стратегий, которые являются экстремальными к соответствующим стабильным мостам. Сначала рассмот­рим случай, когда функция g(t, x, p,q) тождественно равна нулю. Поэтому равенство (11.2), которое определяет функционал платы, имеет здесь вид
]
γ(x(·)) = σ(x(θ)), (13.18)
где σ : R
+ x)R
n
→ R — непрерывная функция (ограничение вида |σ(x)|  (1 +
не будет использоваться). Как и выше, движение управляемой
σ
системы описывается уравнением (13.1), в котором предполагается, что функция f удовлетворяет всем требованиям, указанным в разделе 13.1.
Рассмотрим задачу Коши
∂u
+ H(t, x, D
∂t
u)=0,u(θ, x)=σ(x), (13.19)
x
13. СТАБИЛЬНЫЕ МОСТЫ И ЭКСТРЕМАЛЬНЫЕ СТРАТЕГИИ 159
где H — гамильтониан, определенный равенствами (13.3). Отметим, что га­мильтониан H и краевая функция σ удовлетворяют предположениям, сфор­мулированным в теореме 8.1. Поэтому, согласно этой теореме, существует единственное минимаксное решение в задаче (13.19).
Пусть u — минимаксное решение рассматриваемой задачи. Выберем число c, и определим для функции u соответствующее множество Лебега, т. е.
W
:= {(t,x) ∈[0,θ] ×Rn: u(t, x)  c}. (13.20)
c
Так как функция u — верхнее решение, ее надграфик является слабо инвари­антным относительно дифференциального включения (13.7). Это свойство подразумевает, что множество W ференциального включения (13.4), поэтому W задаче M
-сближения, где Mc= {x ∈ Rn: σ(x) c}.
c
Пусть задана начальная позиция (t случае очевидно, что начальная позиция принадлежит множеству W
U
— позиционная стратегия, которая является экстремальной к множе-
0
ству W рии x(·) ∈ X (t
. Теорема 13.3 утверждает, что x(θ) ∈ Mcдля любой траекто-
c
0,x0,U0
). Следовательно, γ(x(·)) c = u(t0,x0).Поопреде-
лениям пучка траекторий X(t
слабо инвариантно относительно диф-
c
0,x0,U0
0,x0
) (см. раздел 13.2) и гарантированного
— стабильное множество в
c
). Полагаем c = u(t0,x0).Вэтом
.Пусть
c
результата (11.14), получаем
Γ
1(t0,x0,U0
Точно так же можно определить стратегию V
) u(t0,x0).
для игрока Q, которая
0
является экстремальной к множеству
c
:= {(t,x) ∈ [0,θ] × Rn: u(t, x)  c = u(t0,x0)}.
W
Из того, что для любой траектории x(·) ∈ X(t ка γ(x(·)) u(t
), результат, гарантируемый стратегией V0, оценивается
0,x0
0,x0,V0
) справедлива оцен-
неравенством
Γ
2(t0,x0,V0
) u(t0,x0).
Используя соотношение (11.17), приходим к равенствам
Val (t
Таким образом, доказана оптимальность стратегий U являются экстремальными к множествам W
)=Γ1(t0,x0,U0)=Γ2(t0,x0,V0)=u(t0,x0).
0,x0
и Wcсоответственно. Эти
c
и V0, которые
0
стратегии формируют седловую точку в рассматриваемой дифференциаль­ной игре.
160 ГЛАВА III
Сравним полученное решение с решением, представленным в парагра­фе 12. В силу теоремы 12.3, стратегии U
, определенные в пункте 12.2,
ε
гарантируют оценки
Γ
1(t0,x0,Uε
) u(t0,x0)+ζ,
где u =Val— минимаксное решение в задаче (13.19) и одновременно цена рассматриваемой игры. Из того, что число ζ>0 может быть выбрано произвольно малым, вышеупомянутые оценки означают, что стратегии U субоптимальны (почти оптимальны) для игрока P . Однако, в общем случае, эти стратегии могут не быть в точности оптимальными.
В этом отношении качество конструкции, представленной в парагра­фе 12, оказывается, формально, хуже, чем у рассмотренной здесь.
С другой стороны, конструкция из параграфа 12 обладает важным свой­ством универсальности, которое определяется следующим образом.
Позиционная стратегия U игрока P называется универсальной ζ-оп­тимальной в области D ⊂ [0,θ] × R
n
, если она гарантирует выполнение
неравенства
Γ
1(t0,x0
,U0) Val (t0,x0)+ζ, ∀(t0,x0) ∈ D. (13.21)
Точно так же определяются универсальные ζ-оптимальные стратегии игро­ка Q.
Согласно теореме 12.3 (где u равно Val ), для любого ζ>0 идлялю­бого ограниченного множества D,стратегииU
и Vε, определенные как
ε
суперпозиции предстратегий и квазиградиентов, являются универсально ζ-оптимальными в области D.
Стратегии U
и V0, которые являются экстремальными к множествам
0
Лебега функции цены, могут не быть универсальными в данном смысле.
13.6. Экстремальное прицеливание к надграфику функции цены
ε
Напомним кратко определения устойчивых мостов и экстремальных стратегий в дифференциальной игре (11.1), (11.2). Пусть Val(t, x) —функ- ция цены дифференциальной игры (11.1), (11.2). Полагаем
W
:= epiVal = {(t,x, z) ∈ [0,θ] × Rn× R : z Val (t, x)}.
Так как надграфик функции цены слабо инвариантен относительно диффе­ренциального включения
(˙x, ˙z) ∈ co {(f(t, x, p, q),g(t, x,p, q)): p ∈ P },
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]