Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Обобщенные решения уравнений в частных производных первого порядка. Перспективы динамической оптимизации
.pdf
16. КОНСТРУКТИВНЫЕ И ЧИСЛЕННЫЕ МЕТОДЫ... 201
нения движения зависит от фазовой переменной x линейно (если не принимать во внимание позиционные способы управления). Вместе с тем этот
термин не означает, что линейность наследуется стратегиями игроков. Напротив, оптимальные позиционные стратегии, как правило, нелинейны; более того, они могут быть разрывными. В этом отношении эти задачи существенно отличаются от линейно-квадратичных дифференциальных игр,
в которых оптимальные стратегии игроков оказываются линейными функциями фазовых векторов.
16.2. Стабильные дорожки и стабильные многообразия
Как было показано в параграфе 13, решение задач позиционного управления может быть сведено к построению соответствующих стабильных мостов. Однако, в общем случае, численное построение этих мостов является
довольно трудной проблемой. Поэтому важным становится (при изучении
специфических типов дифференциальных игр) развивать специальные, менее сложные методы построения стабильных мостов. Простейшие методы
такого типа рассматриваются в данном разделе.
Рассмотрим сначала дифференциальную игру, в которой движение
управляемой системы описывается уравнением
˙x = f (t, x, p, q), (16.19)
а функционал платы имеет вид
γ(x(·)) = σ(x(θ)). (16.20)
Функция f непрерывна по (t, x, p, q) и удовлетворяет условию Липшица
по x. Будем предполагать, что оценка
max
(p,q)∈P ×Q
f(t, x, p, q) λ(1 + x) (16.21)
и равенство
max
H(t, x, s):=min
p∈P
s, f (t, x,p, q) =max
q∈Q
имеют место при всех (t, x) ∈ [0,θ] × R
min
q∈Q
n
, s ∈ Rn.Последнееравенство
s, f (t, x,p, q) (16.22)
p∈P
определяет гамильтониан рассматриваемой игры.
Предположим, что существует линейная мажоранта функции H(t, x, ·),
т. е. существует f
∈ Rnтакой, что
∗
f
,s H(t, x, s), ∀s ∈ Rn.
∗

202 ГЛАВА III
Определим множество всех векторовf∗, обладающих указанным свойством.
Полагаем
H
(t, x, f):= inf
∗
F
(t, x):={f ∈ Rn: H∗(t, x, f) > −∞}. (16.23)
∗
[s, f −H(t, x, s)] ,
n
s∈R
Поскольку функция H (t, x,·) положительно однородна, то сопряженная
функция H
Учитывая это замечание, получаем, что F
ством. Будем предполагать, что F
Нетрудно проверить, что множество F
лее того, для любых f ∈ F
(t, x, ·) может принимать лишь одно из двух значений 0 и −∞.
∗
(t, x) = ∅ при всех (t, x) ∈ [0,θ] × Rn.
∗
(t, x) справедлива оценка f λ(1 + x),где
∗
(t, x) является искомым множе-
∗
(t, x) — выпуклый компакт, бо-
∗
λ — коэффициент в условии Липшица (16.21). Отметим также, что многозначное отображение (t, x) → F
Пусть (t
→ w(t) ∈ R
) — заданная начальная позиция. Пусть [t0,θ] t →
0,x0
n
— некоторая траектория дифференциального включения
(t, x) полунепрерывно.
∗
˙w(t) ∈ F
проходящая через начальную точку (t
W := {(t, w(t)): t ∈ [t
(t, w(t)), (16.24)
∗
). Рассмотрим множество
0,x0
,θ]}, (16.25)
0
которое является графиком этой траектории. Покажем, что это множество
обладает свойством стабильности, сформулированным в пункте 13.1. Выберем произвольно s ∈ R
n
, (t, w) ∈ W . Воспользуемся критерием стабильности в форме условия (13.11). В рассматриваемом случае, для множества W вида (16.25) имеем D
Из определения множества F
любого f ∈ F
(t, w). Следовательно, рассматриваемое множество W удо-
∗
W (t; w) = ∅ и DtW (t; w) ⊂ F∗(t, w).
t
(t, w) следует, что s, f H(t, w, s) для
∗
влетворяет условию (13.11), и поэтому оно u-стабильно.
Множество W , определенное соотношениями (16.24), (16.25), называется стабильной дорожкой. Согласно конструкции (13.13), определим стратегию U
, экстремальную к стабильной дорожке. Очевидно, что в рассмат-
e
риваемом случае
0
W
(t, x):=Arg min
w∈W (t)
x −w = {w(t)}.
Поэтому
(t, x) ∈ Arg max
U
e
Из теоремы 13.3 следует, что в данном случае пучок траекторийX(t
порожденный стратегий U
[min
p∈P
и любыми управлениями игрока Q, состоит из
e
f(t, x, p,q),w(t) −x]. (16.26)
q∈Q
0,x0,Ue
),

16. КОНСТРУКТИВНЫЕ И ЧИСЛЕННЫЕ МЕТОДЫ... 203
единственной траектории w(t). Поэтому результат, гарантированный игроку P в дифференциальной игре (16.19), (16.20), равен величине σ(w(θ)).
Поскольку игрок P стремится минимизировать плату, то из стабильных
дорожек он выбирает ту, для которой значение σ(w(θ)) минимально.
Таким образом возникает следующая задача оптимального управления. Пусть W(t
чения (16.24), удовлетворяющих начальному условию w(t
ется определить траекторию w
) — множество траекторий дифференциального вклю-
0,x0
0
(·) ∈ W(t0,x0), на которой достигается
)=x0.Требу-
0
минимум
0
σ(w
(θ)) = min
σ(w(θ)) при w(·) ∈ W(t0,x0).
w(·)
Получаем, что стратегия вида (16.26), где полагаем w(t)=w
рует игроку P результат γ
= σ(w0(θ)).
0
(t), гаранти-
0
Определим стабильное многообразие. Будем предполагать, что в дифференциальной игре (16.19), (16.20) гамильтониан H(t, x, s) является вогнутым по переменной s. Пусть, по-прежнему, множество F
(t, x) определено
∗
равенством (16.23). Полагаем
(
W := {(t, w(t)): t
(
W (t)={w ∈ R
t θ, w(·) ∈ W(t0,x0)},
0
n
:(t, w) ∈(W }.
В теории дифференциальных включений множество(W называется интегральной воронкой дифференциального включения (16.24). В теории диф-
ференциальных игр множество(W , определенное указанным образом, называется стабильным интегральным многообразием.
Покажем, что для любого p ∈ P многозначное отображение t →(W (t)
слабо инвариантно относительно дифференциального включения
˙x ∈ co {f(t,x, p, q): q ∈ Q}.
Полагаем
(
D
W (t; x):=f ∈ R
t
(
W , то из определения множества(W и непрерывности много-
значного отображения F
n
: liminf
следует, что F∗(t, x) ⊂ D
∗
dist (x + δf;W (t + δ))
δ↓0
δ
(
W (t; x).
t
=0.
Покажем, что
F
(t, x) ∩co {f(t,x, p, q): q ∈ Q} = ∅ (16.27)
∗

204 ГЛАВА III
для любых (t, x, p) ∈ [0,θ] × Rn× P . Допустим противное, тогда, со-
гласно теореме Хана– Банаха, существует такой вектор s ∈ R
неравенство s, f
> s, f справедливо для любых f∗∈ F∗(t, x)
∗
n
,что
и f ∈ co {f(t,x, p, q): q ∈ Q}. Получаем
H(t, x, s)= min
f∗∈F∗(t,x)
s, f∗ > max
q∈Q
s, f (t, x,p, q)
min
max
p∈P
s, f (t, x,p) = H(t,x, s)
q∈Q
(первое равенство следует из вогнутости функции H(t, x, ·)).Итак,получаем противоречие, которое доказывает соотношение (16.27).
Таким образом, имеем
(
D
W (t; x) ∩ co {f(t,x, p, q): q ∈ Q} = ∅
t
для любых (t, x) ∈(W и p ∈ P. Используя рассуждения, аналогичные тем,
что приведены в пункте 13.1 для обоснования критериев (13.11), (13.12),
получаем, что множество(W слабо инвариантно относительно дифференциального включения (16.24).
Рассмотрим V
— стратегию игрока Q, экстремальную к множе-
e
ству(W . По определению стабильного интегрального многообразия имеем (t
ному многообразию(W ,т.е.(t, x(t)) ∈(W для всех t ∈[t
рий x(·) ∈ X(t
) ∈(W .СтратегияVeобеспечивает движение системы по стабиль-
0,x0
,θ] и всех траекто-
0
0,x0,Ve
). Определение стратегии Veи обоснование упомя-
нутого результата проводятся подобно тому, как это сделано в параграфе 13
(с учетом того, что роль игрока P теперь исполняет игрок Q). Стратегия V
e
выбранная игроком Q, обеспечивает выполнение условия (θ,x(θ)) ∈(W .
Из определения стабильного многообразия(W следует, что результатом,
который гарантирует стратегия V
, является величина
e
,
γ
=min{σ(w(θ)) : w(·) ∈ W(t0,x0)}.
0
Учитывая, что такойже результат может гарантировать себеигрок P при выборе указанной выше стратегии U
, заключаем, что в рассматриваемом слу-
e
чае этот результат является ценой дифференциальной игры (16.19), (16.20),
астратегииU
и Veоптимальны и образуют седловую точку.
e
Опишем совсем кратко некоторые детали аналогичного подхода к решению дифференциальной игры, в которой движение управляемой системы
по-прежнему описывается уравнением (16.19), а функционал платы имеет

16. КОНСТРУКТИВНЫЕ И ЧИСЛЕННЫЕ МЕТОДЫ... 205
вид
θ
γ(t
,x(·),p(·),q(·)) := σ(x(θ)) −
0
g(t, x(t),p(t),q(t))dt. (16.28)
t
0
Будем предполагать, что выполняется условие (11.5) (условие седловой точки в маленькой игре). Пусть H(t, x, s) — гамильтониан рассматриваемой
дифференциальной игры, определенный равенством (11.5).
Полагаем
(t, x, f):= inf
H
∗
F
(t, x):={f ∈ Rn: H∗(t, x, f) > −∞}.
∗
Отметим, что функцияH
(t, x, ·) вогнута. Поскольку гамильтониан H(t, x,s)
∗
удовлетворяет условию Липшица по переменной s,томножествоF
s, f −H(t, x, s),
n
s∈R
(t, x)
∗
ограничено. Рассмотрим многозначное отображение
Пусть [t
E(t, x):={(f,g): f ∈ dom H
,θ] t → (x∗(t),z∗(t)) ∈ Rn× R — некоторая траектория диффе-
0
(t, x, ·),g H∗(t, x, f)}.
∗
ренциального включения
(˙x, ˙z) ∈ E(t,x), (16.29)
удовлетворяющая начальному условию x
)=x0, z∗(t0)=0.Таким
∗(t0
образом, предполагается, что, по крайней мере, вдоль этой траектории множество E(t, x) не пусто.
Рассмотрим функцию
z
(t), если x = x∗(t),
u(t, x):=
∗
K + L(θ −t), если x = x
∗
(t),
(16.30)
где K и L — достаточно большие числа, такие, что
K> max
Можно проверить, что в некоторой окрестности траектории {(t, x
,θ]} функция u является верхним решением соответствующего урав-
t ∈ [t
0
z∗(t),L>max
t∈[t0,θ]
t∈[t0,θ]
H(t, x∗(t), 0).
(t)):
∗
нения Айзекса– Беллмана.
Далее можно определить позиционную стратегию U
игрока P ,экс-
e
тремальную к надграфику функции u. Эта стратегия гарантирует игроку P

206 ГЛАВА III
выполнение оценки γ(t0,x(·),p(·),q(·)) σ(x∗(θ)) − z∗(θ). Среди траекторий дифференциального включения (16.29) игрок P может выбрать траекторию, которая минимизирует функционал σ(x
ция H(t, x, ·) вогнута при всех (t, x) ∈ [0,θ] × R
(θ)) −z∗(θ).Еслифунк-
∗
n
,товрамкахпредлагаемой конструкции можно определить оптимальный результат игрока P ,
равный цене Va l (t
) рассматриваемой игры. Можно определить также
0,x0
стабильное многообразие и экстремальную к нему стратегию, которая будет
в рассматриваемом случае оптимальной позиционной стратегией игрока Q.
Конструкции, описанные в этом разделе, являются достаточно простым
методом решения дифференциальных игр. Согласно этому методу, построение позиционных стратегий сводится в основном к выбору подходящих
траекторий дифференциальных включений или построению интегральных
воронок. Стабильные дорожки и стабильные многообразия можно использовать для решения дифференциальных игр с различными типами функционалов платы. Вместе с тем необходимо отметить, что условия, при которых
возможны предлагаемые построения, являются весьма жесткими и выполняются для узкого круга дифференциальных игр.
Основные идеи этого метода были предложены в 60-х годах в работах Л. С.Понтрягина и Н. Н.Красовского [108, 170]. К этому направлению
относится серия работ, опубликованных, в основном, в 60-х–70-х годах
(см., например, [130, 154, 216]). Более подробное изложение рассмотренных выше конструкций можно найти в книгах [122, 123]. Приведенное в
этом разделе изложение, по существу, следует результатам указанных работ,
но отличается от них по форме тем, что опирается на конструкции теории
обобщенных решений уравнений Гамильтона –Якоби.
16.3. Минимаксные рекуррентные аппроксимации
В этом разделе будут рассматриваться дифференциальные игры вида (16.19), (16.20). Будем предполагать, что выполняется условие (16.22).
Напомним следующие обозначения f (t, x, P, q):={f(t, x, p, q): p ∈ P }.
Для t
∈ [0,θ], x∗∈ Rn, q ∈ Q и τ ∈ [t∗,θ] обозначим символом X(t∗,x∗,q)
∗
множество решений [0,θ] t → x(t) ∈ R
n
дифференциального включения
˙x(t) ∈ co f(t, x(t),P,q), (16.31)
удовлетворяющих условию x(t
A(t
,τ,q)={x(τ): x(·) ∈ X(t∗,x∗,q)} (16.32)
∗,x∗
)=x∗.Дляτ ∈ [t∗,θ] множество
∗
называется областью достижимости дифференциального включения (16.31).

16. КОНСТРУКТИВНЫЕ И ЧИСЛЕННЫЕ МЕТОДЫ... 207
Опишем оператор программного поглощения, рекуррентное применение которого позволяет определить функцию, близкую к функции цены.
Пусть Δ={θ = τ
(моменты времени τ
i
лим функцию [0,θ]×R
(θ, x)=uΔ(τ0,x)=σ(x), ∀x ∈ Rn.
u
Δ
0>τ1
занумерованы здесь в порядке их убывания). Опреде-
n
> ··· >τk=0} — разбиение отрезка [0,θ]
(t, x) → uΔ(t, x) следующим образом. Полагаем
Пусть функция u
сти [τ
) ×Rnфункцию uΔопределим равенством
i+1,τi
u
Δ(t∗,x∗
определена в области [τi,τ0] × Rn.Тогдавобла-
Δ
)=max
min{uΔ(τi,x): x ∈ A(t∗,x∗,τi,q)}. (16.33)
q∈Q
Используя соотношение (16.33) последовательно при i =0, 1,...,k− 1,
получаем функцию u
, определенную во всей области [0,θ]×Rn.Известно,
Δ
что
lim u
(t, x)=u(t, x)=Val(t, x), когда diam Δ → 0.
Δ
Здесь Val — функция цены дифференциальной игры (16.19), (16.20), u —минимаксное решение задачи Коши для уравнения Айзекса –Беллмана. Функции u
ласти G
сходятся к функции цены равномерно в каждой ограниченной об-
Δ
⊂ [0,θ] × Rn.Известнотакже,чтоuΔ Va l ,т.е.функцииu
∗
Δ
аппроксимируют функцию цены снизу.
Отметим, что величина u
Δ(t∗,x∗
в игре, которая рассматривается на промежутке времени [t
) является оптимальным результатом
] иосуще-
∗,τi
ствляется по следующим правилам. Игрок P минимизирует функционал
платы γ
(x·)=uΔ(τi,x(τi)) на множестве траекторий дифференциального
i
включения (16.31), где q — постоянное управление, выбранное игроком Q.
Игрок Q выбирает управление q ∈ Q, которое максимизирует этот минимум
min{γ
(x(·)): x(·) ∈ X(t∗,x∗,q)}.
i
Заметим также, что соотношение (16.33) может быть переписано следующим образом
u
Δ(t∗,x∗
)=max
q∈Q
inf
uΔ(τi,x[τi; t∗,x∗,p(·),q]),
p(·)
где x[τ
; t∗,x∗,p(·),q] — решение дифференциального включения
i
˙x(t)=f (t, x(t),p(t),q),
удовлетворяющее условию x(t
)=x∗, а инфимум берется по множеству
∗
программных управлений игрока P ,т.е.помножествувсехизмеримых

208 ГЛАВА III
функций p(·): [t∗,τi] → P. Согласно этому равенству, величина uΔ(t∗,x∗)
называется программным максимином. Понятно, что эти конструкции можно рассматривать как определение цены минорантной игры (см. пункт 14.1).
Эти построения можно ограничить построениями на компактном множестве D ⊂ [0,θ] × R
n
, которое сильно инвариантно относительно диффе-
ренциального включения
˙x ∈ co f(t, x, P, Q).
Другими словами, множество D должно обладать следующим свойством:
любая траектория этого дифференциального включения x(·): [0,θ] → R
стартующая на множестве D:
(0,x(0)) ∈ D,
не покидает этого множества
(t, x(t)) ∈ D, при всех t ∈ [0,θ].
Соотношение (16.33) допускает некоторые модификации. Например,
вместо множеств достижимости A(t
,τ,q) можно использовать множе-
∗,x∗
ства вида
∗
A
(t∗,x∗,τ,q):={x∗+(τ −t∗)f : f ∈ co f(t∗,x∗,P,q)}.
Далее вместо (16.31) можно использовать дифференциальное включение
˙x ∈ F (t, x, ψ),
где многозначное отображение
[0,θ] ×R
n
× Ψ (t, x,ψ) → F (t, x,ψ) ∈ conv (Rn)
непрерывно и удовлетворяет условиям
max
min{s, f : f ∈ F(t, x, ψ)} =max
ψ∈Ψ
f K (1 + x), ∀(t, x, ψ) ∈[0,θ] ×R
Функцию цены можно аппроксимировать сверху функциями u
min
v∈Q
s, f (t, x,p, q),
p∈P
n
× Ψ,f∈ F (t,x, ψ).
Δ
,кото-
рые определены следующей рекуррентной операцией
n
,
Δ
u
(t∗,x∗)=min
max{uΔ(τi,x): x ∈ A(t∗,x∗,τi,p)}, (16.34)
p∈P

16. КОНСТРУКТИВНЫЕ И ЧИСЛЕННЫЕ МЕТОДЫ... 209
при (t∗,x∗) ∈ [τ
) ×Rn.ЗдесьA(t∗,x∗,τi,p) — область достижимости
i+1,τi
дифференциального включения
˙x(t) ∈ co f(t, x(t),p,Q).
Для функций u
где предел является равномерным в каждой ограниченной области G
⊂ [0,θ] ×R
Δ
имеем оценки
Δ
Va l , lim uΔ(t, x)=Val(t, x) при diam Δ → 0,
u
n
.
⊂
∗
Аппроксимации функций цены дифференциальных игр с помощью
операторов программного поглощения и другой соответствующей техники
рассматривались многими авторами. Результаты, полученные в этой области, представлены в большом числе работ. Отметим только, что некоторые
из названных конструкций были использованы в репрезентативных формулах для вязкостных решений уравнений Гамильтона – Якоби, а именно,
для аппроксимации этих решений с помощью рекуррентных минимаксных
(и/или максиминных) операторов (см., например, [24, 189]).
16.4. Построение стабильных мостов
Рассмотрим построение стабильного моста в задаче M-наведения,
сформулированной в пункте 13.1. Будем предполагать, что движение управляемой системы описывается уравнением (16.19), функция f удовлетворяет
условиям, указанным в пункте 11.1. Напомним, что в задаче наведения
требуется определить стратегию игрока P по принципу обратной связи, которая обеспечивает выполнение условия x(θ) ∈ M . Согласно результатам
параграфа 13, если в задаче M -сближения известен u-стабильный мост, то
решение этой задачи можно определить в форме стратегии, экстремальной к
стабильному мосту. Известно также, что решение многих типов дифференциальных игр можно свести к построению соответствующих стабильных
мостов для соответствующих задач сближения.
Опишем операторы программного поглощения, которые используются
для приближенного построения стабильных мостов. Пусть 0 t
ипустьM
— некоторое компактное множество в пространстве Rn.Опре-
∗
<τ θ,
∗
делим
∗
(t∗,τ,q,M∗)={x∗∈ Rn: A(t∗,x∗,τ,q) ∩ M∗= ∅},
M
∗
M
(t∗,τ,M∗)=
M∗(t∗,τ,q,M∗),
q∈Q

210 ГЛАВА III
где A(t∗,x∗,τ,q) — область достижимости, определенная соотношени-
ем (16.32). Оператор M
граммного поглощения. Его значение M
программного поглощения для исходного множества M
Пусть по-прежнему Δ={θ = τ
→ M∗(t∗,τ,M∗) называется оператором про-
∗
∗
(t∗,τ,M∗) называется множеством
.
>τ1> ··· >τk=0} — некоторое
0
∗
разбиение отрезка [0,θ]. Определим множества
W
)=M, WΔ(τ1)=M∗(τ1,τ0,WΔ(τ0)),
Δ(τ0
Δ(τi+1
)=M∗(τ
W
W
= {(t,w): w ∈ WΔ(τi),t∈ (τ
Δ
i+1,τi,WΔ(τi
i+1,τi
)),
],i∈ 0,k − 1}.
Известно, что при некоторых условиях невырожденности (см. например,
[176, 213, 218]), которые не очень ограничительны, данная процедура определяет систему множеств, которая аппроксимирует максимальный стабильный мост W
множества W
в рассматриваемой задаче M -сближения (максимальность
0
означает, что это множество является объединением всех
0
стабильных мостов для этой задачи), т. е.
dist [W
Здесь dist [·,·] — хаусдорфово расстояние между множествами.
Отметим, что вместо M
] → 0, когда diamΔ → 0.
Δ,W0
∗
(t∗,τ,q,M∗) можно использовать более про-
стой оператор (конечно-разностный вариант оператора программного поглощения), который определяется следующим образом
M(t
,τ,q,M∗)={x∗∈ Rn: x∗+(τ −t∗)co f(t∗,x∗,P,q) ∩M∗= ∅},
∗
т. е. x
∈ co f(t
∈M(t∗,τ,q,M∗) тогда и только тогда, когда существуют f∗∈
∗
,P,q) и m∗∈ M∗,такие,чтоx∗+(τ −t∗)f∗= m∗.
∗,x∗
Для реализации в вычислительных программах необходимы дальнейшие модификации рассматриваемых операторов. Например, операторы программного поглощения могут быть определены на семействе многогранников (вообще говоря, невыпуклых и несвязных) и имеющих значениями
многогранники из этого семейства. Вычислительные алгоритмы и программы для аппроксимации стабильных мостов многогранниками разработаны
В. Н. Ушаковым, В. А. Вахрушевым и А. П. Хрипуновым [212, 213]. В этих
алгоритмах основная задача, которая решается на каждом шаге τ
∈ Δ,за-
i
ключается в построениях объединений и пересечений невыпуклых многогранников. Понятно, что вычислительные алгоритмы и программы, предназначенные для решения нелинейных дифференциальных игр, оказываются
гораздо более сложными и требуют больших вычислительных ресурсов.
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
