Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Обобщенные решения уравнений в частных производных первого порядка. Перспективы динамической оптимизации

.pdf
Скачиваний:
0
Добавлен:
07.09.2026
Размер:
2 Мб
Скачать
☆
16. КОНСТРУКТИВНЫЕ И ЧИСЛЕННЫЕ МЕТОДЫ... 201
нения движения зависит от фазовой переменной x линейно (если не при­нимать во внимание позиционные способы управления). Вместе с тем этот термин не означает, что линейность наследуется стратегиями игроков. На­против, оптимальные позиционные стратегии, как правило, нелинейны; бо­лее того, они могут быть разрывными. В этом отношении эти задачи су­щественно отличаются от линейно-квадратичных дифференциальных игр, в которых оптимальные стратегии игроков оказываются линейными функ­циями фазовых векторов.
16.2. Стабильные дорожки и стабильные многообразия
Как было показано в параграфе 13, решение задач позиционного управ­ления может быть сведено к построению соответствующих стабильных мо­стов. Однако, в общем случае, численное построение этих мостов является довольно трудной проблемой. Поэтому важным становится (при изучении специфических типов дифференциальных игр) развивать специальные, ме­нее сложные методы построения стабильных мостов. Простейшие методы такого типа рассматриваются в данном разделе.
Рассмотрим сначала дифференциальную игру, в которой движение управляемой системы описывается уравнением
˙x = f (t, x, p, q), (16.19)
а функционал платы имеет вид
γ(x(·)) = σ(x(θ)). (16.20)
Функция f непрерывна по (t, x, p, q) и удовлетворяет условию Липшица по x. Будем предполагать, что оценка
max
(p,q)∈P ×Q
f(t, x, p, q)λ(1 + x) (16.21)
и равенство
max
H(t, x, s):=min
p∈P
s, f (t, x,p, q) =max
q∈Q
имеют место при всех (t, x) ∈ [0,θ] × R
min
q∈Q
n
, s ∈ Rn.Последнееравенство
s, f (t, x,p, q) (16.22)
p∈P
определяет гамильтониан рассматриваемой игры.
Предположим, что существует линейная мажоранта функции H(t, x, ·), т. е. существует f
∈ Rnтакой, что
∗
f
,s H(t, x, s), ∀s ∈ Rn.
∗
202 ГЛАВА III
Определим множество всех векторовf∗, обладающих указанным свойством. Полагаем
H
(t, x, f):= inf
∗
F
(t, x):={f ∈ Rn: H∗(t, x, f) > −∞}. (16.23)
∗
[s, f −H(t, x, s)] ,
n
s∈R
Поскольку функция H (t, x,·) положительно однородна, то сопряженная функция H Учитывая это замечание, получаем, что F ством. Будем предполагать, что F
Нетрудно проверить, что множество F лее того, для любых f ∈ F
(t, x, ·) может принимать лишь одно из двух значений 0 и −∞.
∗
(t, x) = ∅ при всех (t, x) ∈ [0,θ] × Rn.
∗
(t, x) справедлива оценка fλ(1 + x),где
∗
(t, x) является искомым множе-
∗
(t, x) — выпуклый компакт, бо-
∗
λ — коэффициент в условии Липшица (16.21). Отметим также, что много­значное отображение (t, x) → F
Пусть (t
→ w(t) ∈ R
) — заданная начальная позиция. Пусть [t0,θ] t →
0,x0
n
— некоторая траектория дифференциального включения
(t, x) полунепрерывно.
∗
˙w(t) ∈ F
проходящая через начальную точку (t
W := {(t, w(t)): t ∈ [t
(t, w(t)), (16.24)
∗
). Рассмотрим множество
0,x0
,θ]}, (16.25)
0
которое является графиком этой траектории. Покажем, что это множество обладает свойством стабильности, сформулированным в пункте 13.1. Вы­берем произвольно s ∈ R
n
, (t, w) ∈ W . Воспользуемся критерием ста­бильности в форме условия (13.11). В рассматриваемом случае, для мно­жества W вида (16.25) имеем D Из определения множества F любого f ∈ F
(t, w). Следовательно, рассматриваемое множество W удо-
∗
W (t; w) = ∅ и DtW (t; w) ⊂ F∗(t, w).
t
(t, w) следует, что s, f H(t, w, s) для
∗
влетворяет условию (13.11), и поэтому оно u-стабильно.
Множество W , определенное соотношениями (16.24), (16.25), называ­ется стабильной дорожкой. Согласно конструкции (13.13), определим стра­тегию U
, экстремальную к стабильной дорожке. Очевидно, что в рассмат-
e
риваемом случае
0
W
(t, x):=Arg min
w∈W (t)
x −w = {w(t)}.
Поэтому
(t, x) ∈ Arg max
U
e
Из теоремы 13.3 следует, что в данном случае пучок траекторийX(t порожденный стратегий U
[min
p∈P
и любыми управлениями игрока Q, состоит из
e
f(t, x, p,q),w(t) −x]. (16.26)
q∈Q
0,x0,Ue
),
16. КОНСТРУКТИВНЫЕ И ЧИСЛЕННЫЕ МЕТОДЫ... 203
единственной траектории w(t). Поэтому результат, гарантированный игро­ку P в дифференциальной игре (16.19), (16.20), равен величине σ(w(θ)). Поскольку игрок P стремится минимизировать плату, то из стабильных дорожек он выбирает ту, для которой значение σ(w(θ)) минимально.
Таким образом возникает следующая задача оптимального управле­ния. Пусть W(t чения (16.24), удовлетворяющих начальному условию w(t ется определить траекторию w
) — множество траекторий дифференциального вклю-
0,x0
0
(·) ∈ W(t0,x0), на которой достигается
)=x0.Требу-
0
минимум
0
σ(w
(θ)) = min
σ(w(θ)) при w(·) ∈ W(t0,x0).
w(·)
Получаем, что стратегия вида (16.26), где полагаем w(t)=w рует игроку P результат γ
= σ(w0(θ)).
0
(t), гаранти-
0
Определим стабильное многообразие. Будем предполагать, что в диф­ференциальной игре (16.19), (16.20) гамильтониан H(t, x, s) является вогну­тым по переменной s. Пусть, по-прежнему, множество F
(t, x) определено
∗
равенством (16.23). Полагаем
(
W := {(t, w(t)): t
(
W (t)={w ∈ R
 t  θ, w(·) ∈ W(t0,x0)},
0
n
:(t, w) ∈(W }.
В теории дифференциальных включений множество(W называется инте­гральной воронкой дифференциального включения (16.24). В теории диф-
ференциальных игр множество(W , определенное указанным образом, на­зывается стабильным интегральным многообразием.
Покажем, что для любого p ∈ P многозначное отображение t →(W (t) слабо инвариантно относительно дифференциального включения
˙x ∈ co {f(t,x, p, q): q ∈ Q}.
Полагаем
(
D
W (t; x):=f ∈ R
t
(
W , то из определения множества(W и непрерывности много-
значного отображения F
n
: liminf
следует, что F∗(t, x) ⊂ D
∗
dist (x + δf;W (t + δ))
δ↓0
δ
(
W (t; x).
t
=0.
Покажем, что
F
(t, x) ∩co {f(t,x, p, q): q ∈ Q} = ∅ (16.27)
∗
204 ГЛАВА III
для любых (t, x, p) ∈ [0,θ] × Rn× P . Допустим противное, тогда, со- гласно теореме Хана– Банаха, существует такой вектор s ∈ R неравенство s, f
> s, fсправедливо для любых f∗∈ F∗(t, x)
∗
n
,что
и f ∈ co {f(t,x, p, q): q ∈ Q}. Получаем
H(t, x, s)= min
f∗∈F∗(t,x)
s, f∗ > max
q∈Q
s, f (t, x,p, q)
min
max
p∈P
s, f (t, x,p) = H(t,x, s)
q∈Q
(первое равенство следует из вогнутости функции H(t, x, ·)).Итак,получа­ем противоречие, которое доказывает соотношение (16.27).
Таким образом, имеем
(
D
W (t; x) ∩ co {f(t,x, p, q): q ∈ Q} = ∅
t
для любых (t, x) ∈(W и p ∈ P. Используя рассуждения, аналогичные тем, что приведены в пункте 13.1 для обоснования критериев (13.11), (13.12),
получаем, что множество(W слабо инвариантно относительно дифферен­циального включения (16.24).
Рассмотрим V
— стратегию игрока Q, экстремальную к множе-
e
ству(W . По определению стабильного интегрального многообразия име­ем (t ному многообразию(W ,т.е.(t, x(t)) ∈(W для всех t ∈[t
рий x(·) ∈ X(t
) ∈(W .СтратегияVeобеспечивает движение системы по стабиль-
0,x0
,θ] и всех траекто-
0
0,x0,Ve
). Определение стратегии Veи обоснование упомя- нутого результата проводятся подобно тому, как это сделано в параграфе 13 (с учетом того, что роль игрока P теперь исполняет игрок Q). Стратегия V
e
выбранная игроком Q, обеспечивает выполнение условия (θ,x(θ)) ∈(W .
Из определения стабильного многообразия(W следует, что результатом,
который гарантирует стратегия V
, является величина
e
,
γ
=min{σ(w(θ)) : w(·) ∈ W(t0,x0)}.
0
Учитывая, что такойже результат может гарантировать себеигрок P при вы­боре указанной выше стратегии U
, заключаем, что в рассматриваемом слу-
e
чае этот результат является ценой дифференциальной игры (16.19), (16.20), астратегииU
и Veоптимальны и образуют седловую точку.
e
Опишем совсем кратко некоторые детали аналогичного подхода к ре­шению дифференциальной игры, в которой движение управляемой системы по-прежнему описывается уравнением (16.19), а функционал платы имеет
16. КОНСТРУКТИВНЫЕ И ЧИСЛЕННЫЕ МЕТОДЫ... 205
вид
θ
γ(t
,x(·),p(·),q(·)) := σ(x(θ)) −
0
g(t, x(t),p(t),q(t))dt. (16.28)
t
0
Будем предполагать, что выполняется условие (11.5) (условие седловой точ­ки в маленькой игре). Пусть H(t, x, s) — гамильтониан рассматриваемой дифференциальной игры, определенный равенством (11.5).
Полагаем
(t, x, f):= inf
H
∗
F
(t, x):={f ∈ Rn: H∗(t, x, f) > −∞}.
∗
Отметим, что функцияH
(t, x, ·) вогнута. Поскольку гамильтониан H(t, x,s)
∗
удовлетворяет условию Липшица по переменной s,томножествоF
s, f −H(t, x, s),
n
s∈R
(t, x)
∗
ограничено. Рассмотрим многозначное отображение
Пусть [t
E(t, x):={(f,g): f ∈ dom H
,θ]  t → (x∗(t),z∗(t)) ∈ Rn× R — некоторая траектория диффе-
0
(t, x, ·),gH∗(t, x, f)}.
∗
ренциального включения
(˙x, ˙z) ∈ E(t,x), (16.29)
удовлетворяющая начальному условию x
)=x0, z∗(t0)=0.Таким
∗(t0
образом, предполагается, что, по крайней мере, вдоль этой траектории мно­жество E(t, x) не пусто.
Рассмотрим функцию
z
(t), если x = x∗(t),
u(t, x):=
∗
K + L(θ −t), если x = x
∗
(t),
(16.30)
где K и L — достаточно большие числа, такие, что
K> max
Можно проверить, что в некоторой окрестности траектории {(t, x
,θ]} функция u является верхним решением соответствующего урав-
t ∈ [t
0
z∗(t),L>max
t∈[t0,θ]
t∈[t0,θ]
H(t, x∗(t), 0).
(t)):
∗
нения Айзекса– Беллмана.
Далее можно определить позиционную стратегию U
игрока P ,экс-
e
тремальную к надграфику функции u. Эта стратегия гарантирует игроку P
206 ГЛАВА III
выполнение оценки γ(t0,x(·),p(·),q(·)) σ(x∗(θ)) − z∗(θ). Среди траек­торий дифференциального включения (16.29) игрок P может выбрать тра­екторию, которая минимизирует функционал σ(x ция H(t, x, ·) вогнута при всех (t, x) ∈ [0,θ] × R
(θ)) −z∗(θ).Еслифунк-
∗
n
,товрамкахпредла­гаемой конструкции можно определить оптимальный результат игрока P , равный цене Va l (t
) рассматриваемой игры. Можно определить также
0,x0
стабильное многообразие и экстремальную к нему стратегию, которая будет в рассматриваемом случае оптимальной позиционной стратегией игрока Q.
Конструкции, описанные в этом разделе, являются достаточно простым методом решения дифференциальных игр. Согласно этому методу, постро­ение позиционных стратегий сводится в основном к выбору подходящих траекторий дифференциальных включений или построению интегральных воронок. Стабильные дорожки и стабильные многообразия можно исполь­зовать для решения дифференциальных игр с различными типами функцио­налов платы. Вместе с тем необходимо отметить, что условия, при которых возможны предлагаемые построения, являются весьма жесткими и выпол­няются для узкого круга дифференциальных игр.
Основные идеи этого метода были предложены в 60-х годах в рабо­тах Л. С.Понтрягина и Н. Н.Красовского [108, 170]. К этому направлению относится серия работ, опубликованных, в основном, в 60-х–70-х годах (см., например, [130, 154, 216]). Более подробное изложение рассмотрен­ных выше конструкций можно найти в книгах [122, 123]. Приведенное в этом разделе изложение, по существу, следует результатам указанных работ, но отличается от них по форме тем, что опирается на конструкции теории обобщенных решений уравнений Гамильтона –Якоби.
16.3. Минимаксные рекуррентные аппроксимации
В этом разделе будут рассматриваться дифференциальные игры ви­да (16.19), (16.20). Будем предполагать, что выполняется условие (16.22). Напомним следующие обозначения f (t, x, P, q):={f(t, x, p, q): p ∈ P }. Для t
∈ [0,θ], x∗∈ Rn, q ∈ Q и τ ∈ [t∗,θ] обозначим символом X(t∗,x∗,q)
∗
множество решений [0,θ] t → x(t) ∈ R
n
дифференциального включения
˙x(t) ∈ co f(t, x(t),P,q), (16.31)
удовлетворяющих условию x(t
A(t
,τ,q)={x(τ): x(·) ∈ X(t∗,x∗,q)} (16.32)
∗,x∗
)=x∗.Дляτ ∈ [t∗,θ] множество
∗
называется областью достижимости дифференциального включе­ния (16.31).
16. КОНСТРУКТИВНЫЕ И ЧИСЛЕННЫЕ МЕТОДЫ... 207
Опишем оператор программного поглощения, рекуррентное примене­ние которого позволяет определить функцию, близкую к функции цены.
Пусть Δ={θ = τ (моменты времени τ
i
лим функцию [0,θ]×R
(θ, x)=uΔ(τ0,x)=σ(x), ∀x ∈ Rn.
u
Δ
0>τ1
занумерованы здесь в порядке их убывания). Опреде-
n
> ··· >τk=0} — разбиение отрезка [0,θ]
 (t, x) → uΔ(t, x) следующим образом. Полагаем
Пусть функция u сти [τ
) ×Rnфункцию uΔопределим равенством
i+1,τi
u
Δ(t∗,x∗
определена в области [τi,τ0] × Rn.Тогдавобла-
Δ
)=max
min{uΔ(τi,x): x ∈ A(t∗,x∗,τi,q)}. (16.33)
q∈Q
Используя соотношение (16.33) последовательно при i =0, 1,...,k− 1, получаем функцию u
, определенную во всей области [0,θ]×Rn.Известно,
Δ
что
lim u
(t, x)=u(t, x)=Val(t, x), когда diam Δ → 0.
Δ
Здесь Val — функция цены дифференциальной игры (16.19), (16.20), u —ми­нимаксное решение задачи Коши для уравнения Айзекса –Беллмана. Функ­ции u ласти G
сходятся к функции цены равномерно в каждой ограниченной об-
Δ
⊂ [0,θ] × Rn.Известнотакже,чтоuΔ Va l ,т.е.функцииu
∗
Δ
аппроксимируют функцию цены снизу.
Отметим, что величина u
Δ(t∗,x∗
в игре, которая рассматривается на промежутке времени [t
) является оптимальным результатом
] иосуще-
∗,τi
ствляется по следующим правилам. Игрок P минимизирует функционал платы γ
(x·)=uΔ(τi,x(τi)) на множестве траекторий дифференциального
i
включения (16.31), где q — постоянное управление, выбранное игроком Q. Игрок Q выбирает управление q ∈ Q, которое максимизирует этот минимум
min{γ
(x(·)): x(·) ∈ X(t∗,x∗,q)}.
i
Заметим также, что соотношение (16.33) может быть переписано следую­щим образом
u
Δ(t∗,x∗
)=max
q∈Q
inf
uΔ(τi,x[τi; t∗,x∗,p(·),q]),
p(·)
где x[τ
; t∗,x∗,p(·),q] — решение дифференциального включения
i
˙x(t)=f (t, x(t),p(t),q),
удовлетворяющее условию x(t
)=x∗, а инфимум берется по множеству
∗
программных управлений игрока P ,т.е.помножествувсехизмеримых
208 ГЛАВА III
функций p(·): [t∗,τi] → P. Согласно этому равенству, величина uΔ(t∗,x∗) называется программным максимином. Понятно, что эти конструкции мож­но рассматривать как определение цены минорантной игры (см. пункт 14.1).
Эти построения можно ограничить построениями на компактном мно­жестве D ⊂ [0,θ] × R
n
, которое сильно инвариантно относительно диффе-
ренциального включения
˙x ∈ co f(t, x, P, Q).
Другими словами, множество D должно обладать следующим свойством: любая траектория этого дифференциального включения x(·): [0,θ] → R стартующая на множестве D:
(0,x(0)) ∈ D,
не покидает этого множества
(t, x(t)) ∈ D, при всех t ∈ [0,θ].
Соотношение (16.33) допускает некоторые модификации. Например, вместо множеств достижимости A(t
,τ,q) можно использовать множе-
∗,x∗
ства вида
∗
A
(t∗,x∗,τ,q):={x∗+(τ −t∗)f : f ∈ co f(t∗,x∗,P,q)}.
Далее вместо (16.31) можно использовать дифференциальное включение
˙x ∈ F (t, x, ψ),
где многозначное отображение
[0,θ] ×R
n
× Ψ  (t, x,ψ) → F (t, x,ψ) ∈ conv (Rn)
непрерывно и удовлетворяет условиям
max
min{s, f : f ∈ F(t, x, ψ)} =max
ψ∈Ψ
fK (1 + x), ∀(t, x, ψ) ∈[0,θ] ×R
Функцию цены можно аппроксимировать сверху функциями u
min
v∈Q
s, f (t, x,p, q),
p∈P
n
× Ψ,f∈ F (t,x, ψ).
Δ
,кото-
рые определены следующей рекуррентной операцией
n
,
Δ
u
(t∗,x∗)=min
max{uΔ(τi,x): x ∈ A(t∗,x∗,τi,p)}, (16.34)
p∈P
16. КОНСТРУКТИВНЫЕ И ЧИСЛЕННЫЕ МЕТОДЫ... 209
при (t∗,x∗) ∈ [τ
) ×Rn.ЗдесьA(t∗,x∗,τi,p) — область достижимости
i+1,τi
дифференциального включения
˙x(t) ∈ co f(t, x(t),p,Q).
Для функций u
где предел является равномерным в каждой ограниченной области G
⊂ [0,θ] ×R
Δ
имеем оценки
Δ
Va l , lim uΔ(t, x)=Val(t, x) при diam Δ → 0,
u
n
.
⊂
∗
Аппроксимации функций цены дифференциальных игр с помощью операторов программного поглощения и другой соответствующей техники рассматривались многими авторами. Результаты, полученные в этой обла­сти, представлены в большом числе работ. Отметим только, что некоторые из названных конструкций были использованы в репрезентативных фор­мулах для вязкостных решений уравнений Гамильтона – Якоби, а именно, для аппроксимации этих решений с помощью рекуррентных минимаксных (и/или максиминных) операторов (см., например, [24, 189]).
16.4. Построение стабильных мостов
Рассмотрим построение стабильного моста в задаче M-наведения, сформулированной в пункте 13.1. Будем предполагать, что движение управ­ляемой системы описывается уравнением (16.19), функция f удовлетворяет условиям, указанным в пункте 11.1. Напомним, что в задаче наведения требуется определить стратегию игрока P по принципу обратной связи, ко­торая обеспечивает выполнение условия x(θ) ∈ M . Согласно результатам параграфа 13, если в задаче M -сближения известен u-стабильный мост, то решение этой задачи можно определить в форме стратегии, экстремальной к стабильному мосту. Известно также, что решение многих типов дифферен­циальных игр можно свести к построению соответствующих стабильных мостов для соответствующих задач сближения.
Опишем операторы программного поглощения, которые используются для приближенного построения стабильных мостов. Пусть 0 t ипустьM
— некоторое компактное множество в пространстве Rn.Опре-
∗
<τ θ,
∗
делим
∗
(t∗,τ,q,M∗)={x∗∈ Rn: A(t∗,x∗,τ,q) ∩ M∗= ∅},
M
∗
M
(t∗,τ,M∗)=
M∗(t∗,τ,q,M∗),
q∈Q
210 ГЛАВА III
где A(t∗,x∗,τ,q) — область достижимости, определенная соотношени- ем (16.32). Оператор M граммного поглощения. Его значение M программного поглощения для исходного множества M
Пусть по-прежнему Δ={θ = τ
→ M∗(t∗,τ,M∗) называется оператором про-
∗
∗
(t∗,τ,M∗) называется множеством
.
>τ1> ··· >τk=0} — некоторое
0
∗
разбиение отрезка [0,θ]. Определим множества
W
)=M, WΔ(τ1)=M∗(τ1,τ0,WΔ(τ0)),
Δ(τ0
Δ(τi+1
)=M∗(τ
W
W
= {(t,w): w ∈ WΔ(τi),t∈ (τ
Δ
i+1,τi,WΔ(τi
i+1,τi
)),
],i∈ 0,k − 1}.
Известно, что при некоторых условиях невырожденности (см. например, [176, 213, 218]), которые не очень ограничительны, данная процедура опре­деляет систему множеств, которая аппроксимирует максимальный стабиль­ный мост W множества W
в рассматриваемой задаче M -сближения (максимальность
0
означает, что это множество является объединением всех
0
стабильных мостов для этой задачи), т. е.
dist [W
Здесь dist [·,·] — хаусдорфово расстояние между множествами.
Отметим, что вместо M
] → 0, когда diamΔ → 0.
Δ,W0
∗
(t∗,τ,q,M∗) можно использовать более про-
стой оператор (конечно-разностный вариант оператора программного по­глощения), который определяется следующим образом
M(t
,τ,q,M∗)={x∗∈ Rn: x∗+(τ −t∗)co f(t∗,x∗,P,q) ∩M∗= ∅},
∗
т. е. x
∈ co f(t
∈M(t∗,τ,q,M∗) тогда и только тогда, когда существуют f∗∈
∗
,P,q) и m∗∈ M∗,такие,чтоx∗+(τ −t∗)f∗= m∗.
∗,x∗
Для реализации в вычислительных программах необходимы дальней­шие модификации рассматриваемых операторов. Например, операторы про­граммного поглощения могут быть определены на семействе многогран­ников (вообще говоря, невыпуклых и несвязных) и имеющих значениями многогранники из этого семейства. Вычислительные алгоритмы и програм­мы для аппроксимации стабильных мостов многогранниками разработаны В. Н. Ушаковым, В. А. Вахрушевым и А. П. Хрипуновым [212, 213]. В этих алгоритмах основная задача, которая решается на каждом шаге τ
∈ Δ,за-
i
ключается в построениях объединений и пересечений невыпуклых много­гранников. Понятно, что вычислительные алгоритмы и программы, предна­значенные для решения нелинейных дифференциальных игр, оказываются гораздо более сложными и требуют больших вычислительных ресурсов.
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]