Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Обобщенные решения уравнений в частных производных первого порядка. Перспективы динамической оптимизации
.pdf
12. ДОКАЗАТЕЛЬСТВО СУЩЕСТВОВАНИЯ ФУНКЦИИ ЦЕНЫ ... 141
Согласно (11.2), (11.14), заключаем
Γ
1(t0,x0,U0
) u(t0,x0).
Точно так же можно показать, что
Γ
2(t0,x0,V0
) u(t0,x0).
Согласно (11.17), (11.18), приходим к следующему выводу.
Если существует классическое решение u в задаче (11.19), то позици-
онная стратегия U
(стратегия V0), определенная, как суперпозиция пред-
0
стратегии (11.23) (предстратегии (11.24)) и градиента функции u,—оптимальна для игрока P (игрока Q). Функция u совпадает с функцией цены
дифференциальной игры (11.1), (11.2).
12. Доказательство существования функции цены
дифференциальной игры
В этом параграфе рассматриваются конструкции ε-оптимальных позиционных стратегий. Построения, предложенные ниже, подобны конструкциям оптимальных стратегий, которые определены в пункте 11.5 с помощью суперпозиции предcтратегий и градиентов минимаксного решения. Но
в отличие от случая, рассматриваемого в пункте 11.5, здесь не предполагается гладкость минимаксного решения уравнения Айзекса – Беллмана. Таким
образом, желаемые стратегии конструируются с помощью суперпозиции
тех же самых предcтратегий и неких квазиградиентов, определения которых вводятся в пункте 12.2. Из результатов, представленных в настоящем
параграфе, вытекает справедливость теоремы 11.4 о существовании цены
дифференциальной игры (11.1), (11.2). Следует сказать, что представленные
ниже построения подсказаны конструкциями универсальных субоптимальных стратегий, предложенными Н. Н.Красовским [113, 114].
12.1. Стабильные функции
Определим следующие многозначные отображения
+
(t, x, q):=co{(f(t, x,p, q),g(t, x,p, q)) ∈ Rn× R : p ∈ P }, (12.1)
E
−
E
(t, x, p):=co{((t,x, p, q),g(t, x, p, q)) ∈Rn× R : q ∈ Q}. (12.2)
Напомним, что в дифференциальной игре (11.1), (11.2) функции f и g
удовлетворяют условиям (A1) – (A3), приведенным в пункте 11.1. Поэтому многозначные отображения E
+
и E−имеют следующие свойства. Для

142 ГЛАВА III
любых (t, x) ∈ [0,θ] × Rn, p ∈ P , q ∈ Q множества E+(t, x, q) и E−(t, x, p)
выпуклы и компактны. Многозначные отображения (t, x, q) → E
и (t, x, p) → E
−
(t, x, p) непрерывны и удовлетворяют равенствам
min{f,s−g:(f,g) ∈ E+(t, x, q)} = H(t, x, s),
max
q∈Q
max{f,s−g:(f,g) ∈ E−(t, x, p)} = H(t, x,s).
min
p∈P
+
(t, x, q)
Заметим, что эти соотношения следуют из условия (11.5) и равенств
l(w)= min
min
w∈W
которые справедливы для любого компакта W ⊂ R
функции R
m
w → l(w) ∈ R.
w∈co W
l(w), max
w∈W
l(w)= max
w∈co W
m
l(w),
и любой линейной
Таким образом, многозначные отображения (12.1) и (12.2) удовлетворяют всем требованиям (j) – (jv), сформулированным в пункте 6.2.
Согласно определениям 6.5 и 7.1, можно принять следующие формулировки. Полунепрерывная снизу (сверху) функция (t, x) → u(t, x): [0,θ]×
n
×R
→ R является верхним (нижним) решением задачи Коши (11.19), если
u удовлетворяет конечному условию u(θ, x)=σ(x),идлялюбоговекто-
ра q ∈ Q (p ∈ P ) надграфик (подграфик) u слабо инвариантен относительно
дифференциального включения (12.3) [(12.4)]
+
(˙x, ˙z) ∈ E
(˙x, ˙z) ∈ E
Если множество {(f (t, x, p, q),g(t, x, p, q)) ∈ R
выпуклым, то свойство слабой инвариантности для верхнего решения эквивалентно следующему условию: для любой точки (t
(t, x, q), (12.3)
−
(t, x, p). (12.4)
n
×R: p ∈ P } является
) ∈ [0,θ] × R
0,x0
n
и для любого постоянного управления q ∈ Q игрока Q существует такое
измеримое управление p(·): [t
x(t)=x
z(t)=u(t
удовлетворяет неравенству z(t) u(t, x(t)) при всех t
,θ] → P игрока P , что траектория
0
t
+
f(τ,x(τ),p(τ),q)dτ,
0
t
0
t
)+
0,x0
g(τ, x(τ),p(τ),q)dτ
t
0
t θ.Аналогич-
0
ный факт справедлив и для нижнего решения.

12. ДОКАЗАТЕЛЬСТВО СУЩЕСТВОВАНИЯ ФУНКЦИИ ЦЕНЫ ... 143
ЗАМЕЧАНИЕ. В теории позиционных дифференциальных игр (см.,
например, [122, 123]) используются другие термины для рассмотренных свойств. Функции, чьи надграфики (подграфики) слабо инвариантны
относительно дифференциального включения вида (12.3) ((12.4)), называются u-стабильными (v-стабильными). Таким образом, любая u-стабильная (v-стабильная) функция является верхним (нижним) решением задачи (11.19) и наоборот. Эти понятия являются ключевыми для теории позиционных дифференциальных игр.
12.2. Конструкции ε-оптимальных стратегий
Согласно утверждению 8.4, любое верхнее решение u задачи Коши для
уравнения Гамильтона–Якоби удовлетворяет неравенству u(t, x) u
(функция u
была определена в названном утверждении). Используя усло-
−
(t, x)
−
вия (A1) – (A3), можно показать, что в рассматриваемой задаче функция u
удовлетворяет оценке u−(t, x) −K(1 + x),гдеK — положительное
число. Таким образом, для любого верхнего решения задачи (11.19) выполняется следующая оценка
u(t, x) −K(1 + x) ∀(t, x) ∈ [0,θ] × R
Пусть u:[0,θ]×R
n
→ R — верхнее решение задачи (11.19).Рассмотрим
n
. (12.5)
для этой функции u преобразование вида
u
(t, x):=min
ε
[u(t, y)+wε(t, x, y)], (12.6)
n
y∈R
−
где функция w
определена следующим образом
ε
w
(t, x, y):=
ε
e
−λt
ε
− ε
ε4+ x −y2. (12.7)
Здесь λ — константа из оценки (11.4), а ε — положительный малый параметр.
Отметим, что та же самая функция w
использовалась в доказательстве
ε
теоремы 7.3 о единственности минимаксного решения в задаче Коши для
уравнения Гамильтона–Якоби (см. (7.14)).
Нетрудно проверить, что функция w
∂w
ε
+ H(t, x, D
∂t
) −H(t, y, −Dywε) 0. (12.8)
xwε
удовлетворяет неравенству
ε
Действительно, справедливо
D
(t, x, y)=−Dywε(t, x, y)=αε(t)
xwε
x −y
rε(x, y)
,

144 ГЛАВА III
где
(x, y):=ε4+ x −y2,
r
ε
−λt
e
− ε
α
ε
(t):=
.
ε
Используя следующее условие Липшица (см. (7.5))
|H(t, x
(1)
,s) − H(t, x
(2)
,s)| λ(1 + s)x
(1)
− x
(2)
,
получаем
−λt
ε
x −y
r
(x, y)=−
ε
∂w
∂t
ε
.
H(t, x, D
) −H(t, y, −Dywε) λ1+
xwε
λ(1 + α
ε
(t)x −y
α
ε
rε(x, y)
(t))rε(x, y)=λ
e
Таким образом получаем, что неравенство (12.8) справедливо.
Выберем теперь такое достаточно малое число ε>0, что имеет место
следующее неравенство
−λθ
e
− ε
L(ε):=
>K. (12.9)
ε
Отметим, что
u(t, y)+w
(t, x, y) −K(1 + y)+L(ε)x − y→∞,
ε
когда y→∞. Принимая во внимание, что функция y → u(t, y)+
(t, x, y) полунепрерывна снизу, заключаем, что минимум в (12.6) до-
+ w
ε
стигается.
Выберем
y
(t, x) ∈ Arg min
ε
[u(t, y)+wε(t, x, y)]. (12.10)
n
y∈R
Покажем, что
lim
yε(t, x) −x =0. (12.11)
ε↓0
Из определений (12.6), (12.7) вытекает, что
u
(t, x) u(t, x)+wε(t, x, x) u(t, x)+ε. (12.12)
ε

12. ДОКАЗАТЕЛЬСТВО СУЩЕСТВОВАНИЯ ФУНКЦИИ ЦЕНЫ ... 145
Чтобы упростить обозначения, полагаем η := yε(t, x). Справедливы оценки
u
(t, x)=u(t, η)+wε(t, x, η) −K(1 + η)+L(ε)x −η
ε
(L(ε) − K)x −η−K(1 + x).
Принимая во внимание соотношения (12.12), получаем неравенства
(L(ε) −K)x − η−K(1 + x) u
(t, x) u(t, x)+ε,
ε
из которых следует оценка
y
(t, x) −x
ε
u(t, x)+K(1 + x)+ε
(L(ε) −K)
. (12.13)
Из условия L(ε) →∞,когдаε ↓ 0, получаем требуемое соотноше-
ние (12.11).
Обозначим
s
(t, x):=Dxwε(t, x, yε(t, x)) = −Dywε(t, x, yε(t, x)). (12.14)
ε
Если функция y → u(t, y) — непрерывно дифференцируема в некоторой
окрестности точки x, то для достаточно малого ε эта окрестность содержит
точку y
Поэтому s
(t, x), и можно использовать необходимое условие экстремума
ε
D
u(t, yε(t, x)) + Dywε(t, x, yε(t, x)) = 0.
y
(t, x):=Dyu(t, yε(t, x)). Принимая во внимание (12.11), полу-
ε
чаем
lim
sε(t, x)=Dxu(t, x).
ε→0
Наличие этой взаимосвязи позволяет назвать вектор s
(t, x) квазиградиен-
ε
том функции u по переменной x.
Теперь позиционную стратегию игрока P определим с помощью ра-
венства
u
(t, x):=p0(t, x, sε(t, x)), (12.15)
ε
где p
(t, x, s) — предстратегия (игрока P ), определенная в (11.23).
0
Если в данных конструкциях функция u — это минимаксное решение
задачи (11.19), то, как показывается ниже, соответствующая стратегия U
субоптимальна для игрока P. Это означает, что такая стратегия гарантирует
игроку P результат, который является сколь угодно близким к оптимальному, при условии, что параметр ε выбран достаточно малым. Отметим еще
ε

146 ГЛАВА III
раз, что, в отличие от случая, рассматривавшегося в пункте 11.5, здесь не
предполагается, что функция u дифференцируема.
Точно так же конструируется стратегия V
А именно, пусть u:[0,θ] ×R
n
→ R — нижнее решение задачи (11.19).
игрока Q.
ε
Выберем произвольную точку
(ε)
y
(t, x) ∈ Arg max
[u(t, y) −wε(t, x, y)], (12.16)
n
y∈R
где функция w
(t, x, s) — предстратегия игрока Q, определенная соотношени-
где q
0
определена с помощью (12.7). Полагаем
ε
(ε)
(t, x):=−Dxwε(t, x, y
s
V
(t, x):=q0(t, x, s
ε
(ε)
(t, x)), (12.17)
(ε)
(t, x)), (12.18)
ем (11.24).
12.3. Теорема
Пусть u – верхнее (нижнее) решение задачи (11.19). Пусть стратегия U
(t, x, s) вида (11.23) (предстратегии q0(t, x, s) вида (11.24)) и квазигра-
p
0
диента s
для любого компактного множества D ⊂ [0,θ] × R
тельного числа ζ существуют такие ε>0 и δ
(стратегия Vε) определена как суперпозиция предстратегии
ε
(t, x) вида (12.14) (квазиградиента s
ε
(ε)
(t, x) вида (12.17)). Тогда
n
и любого положи-
> 0,чтооценка(12.19)
0
(оценка (12.20))
справедлива для всех (t
условию diam Δ δ
Д
ОКАЗАТЕЛЬСТВО.Пусть
(t
) ∈ D, (x(·),p(·),q(·)) ∈ S(t0,x0,Uε, Δ),ti,t
0,x0
.
0
Γ
1(t0,x0,Uε
Γ
2(t0,x0,Vε
0,x0
, Δ) u(t0,x0)+ζ, (12.19)
, Δ) u(t0,x0) −ζ (12.20)
) ∈ D и любых разбиений Δ,удовлетворяющих
∈ Δ.
i+1
Используем обозначения
= τ, t
t
i
= τ + δ, x(ti)=ξ, Uε(τ,ξ)=p∗.
i+1
Доказательство утверждения (12.19) основано на оценке
τ +δ
(τ + δ, x(τ + δ)) −
u
ε
g(t, x(t),p∗,q(t))dt −ζ1(δ)δ uε(τ,ξ). (12.21)
τ

12. ДОКАЗАТЕЛЬСТВО СУЩЕСТВОВАНИЯ ФУНКЦИИ ЦЕНЫ ... 147
Здесь ζ1(δ) → 0,когдаδ → 0. Из доказательства будет видно, что величина ζ
и величины ζi, используемые ниже, зависят только от δ иявляются
1
независимыми от выбора начальных точек (t
управляемых процессов (x(·),p(·),q(·)) ∈ S(t
) ∈ D, разбиений Δ и
0,x0
0,x0,Uε
, Δ).
Из оценки (12.21) следует, что
θ
(θ, x(θ)) −
u
ε
где ζ
(δ) → 0,когдаδ := diamΔ →0. Согласно (12.10) и (12.11), имеем
2
u
(θ, x)=u(θ, yε(θ, x)) + wε(θ, x, yε(θ, x)) >σ(yε(θ, x)).
ε
g(τ, x(τ),p(τ),q(τ))dτ uε(t0,x0)+ζ2(δ), (12.22)
t
0
Непрерывность функции σ и оценки (12.6), (12.13) влекут за собой, что для
любого ограниченного множества M ⊂ R
n
существует такое число ν(ε),
что
u
(θ, x) σ(x) − ν(ε), lim
ε
ν(ε)=0. (12.23)
ε↓0
Комбинируя оценки (12.12), (12.22) и (12.23), заключаем, что
θ
γ(x(·),p(·),q(·)) = σ(x(θ)) −
g(t, x(t),p(t),q(t))dt
t
0
u(t
0,x0
)+ζ2(δ)) + ε + ν(ε).
Поэтому из оценки (12.21) получается желаемое неравенство.
Таким образом, остается доказать соотношение (12.21). Ниже используются также следующие обозначения
∗
s
= sε(τ,ξ),η= yε(τ,ξ),q∗= q0(τ,η,s∗),
τ +δ
1
∗
f
=
∗
=
g
(t, x, s) — предстратегия, определенная соотношением (11.24).
где q
0
f(t, x(t),p∗,q(t))dt,
δ
τ
τ +δ
1
g(t, x(t),p∗,q(t))dt, (12.24)
δ
τ

148 ГЛАВА III
Согласно (12.6) и (12.10), имеем
(τ,ξ)=u(τ,η)+wε(τ,ξ,η). (12.25)
u
ε
Из определения верхнего решения (а именно, из свойства слабой инвариантности его надграфика по отношению к дифференциальному включению (12.3)) вытекает, что существует такой вектор (f
) ∈ Rn× R,что
∗,g∗
),E+(τ,η,q∗)) ζ3(δ),
∗,g∗
δ u(τ + δ, η + f∗δ). (12.26)
∗
Пусть h := w
dist ((f
u(τ,η)+g
(τ + δ, ξ + f∗δ, η + f∗δ) −wε(τ,ξ,η). Из соотношений (12.25)
ε
и (12.26) следует, что
u
(τ,ξ) u(τ + δ,η + f∗δ)+wε(τ,ξ,η) − g∗δ =
ε
= u(τ + δ, η + f
δ)+wε(τ + δ, ξ + f∗δ, η + f∗δ) − h −g∗δ
∗
(τ + δ, ξ + f∗δ) − h −g∗δ.
u
ε
Последняя оценка вытекает из (12.6). Из того, что ξ + f
получаем
u
(τ,ξ) uε(τ + δ, x(τ + δ)) −h −g∗δ. (12.27)
ε
Теперь оценим величину h. Функция w
h [∂w
∗
где s
= Dxwε(τ,ξ,η)=−Dywε(τ,ξ,η).
Напомним, что p
∗
,f(τ,ξ, p∗,q)−g(τ,ξ,p∗,q) H(τ,ξ,s∗) для всех q ∈ Q.
s
Следовательно,
Отметим также, что q
∗
s
,f(τ,η, p,q∗)−g(τ, η,p,q∗) H(τ, η, s∗) для всех p ∈ P.
(τ,ξ,η)/∂t + s∗,f∗−s∗,f∗]δ + ζ4(δ)δ,
ε
∗
= Uε(τ,ξ)=p0(τ,ξ,s∗). Согласно (11.23), имеем
∗,f∗
−g∗ H(τ,ξ,s∗)+ζ5(δ).
s
= q0(τ,η,s∗). Поэтому из (11.24) следует
∗
дифференцируема, поэтому
ε
∗
δ = x(τ + δ),
Таким образом,
∗
,f∗−g∗ H(τ,η,s∗) −ζ6(δ).
s
Принимая во внимание (12.8), получаем
∗
δ −g∗δ +(ζ5(δ)+ζ6(δ))δ.
h ≤ g

12. ДОКАЗАТЕЛЬСТВО СУЩЕСТВОВАНИЯ ФУНКЦИИ ЦЕНЫ ... 149
Подставляем эту оценку в (12.27) и приходим к неравенству
u
(τ,ξ) uε(τ + δ, x(τ + δ)) −(g∗− ζ5(δ) − ζ6(δ))δ.
ε
∗
Напомним, что величина g
определена равенством (12.24). Таким образом
мы получили требуемую оценку (12.21).
Утверждение относительно верхних решений и стратегий игрока P
доказано. Точно так же может быть доказано второе утверждение теоремы 12.3.
Отметим, что по определению величин, которые оценивают качество
стратегий по принципу обратной связи (см. (11.14), (11.15)), неравенства (12.19) и (12.20) можно переписать следующим образом
Γ
1(t0,x0,Uε
Γ
2(t0,x0,Vε
) u(t0,x0)+ζ, (12.28)
) u(t0,x0) −ζ. (12.29)
АМЕЧАНИЕ. Штрафная функция w
З
вида (12.7) — не единственная сре-
ε
ди тех функций, которые могут использоваться в предложенных конструкциях. Для некоторых типов дифференциальная игр удобнее рассматривать
штрафные функции специального вида. Рассмотрим случай, когда функционал платы не содержит интегрального члена, т.е. g(t, x, p, q)=0.Вэтом
случае гамильтониан H(t, x, s) положительно однороден по s,т.е.
H(t, x, αs)=αH (t, x, s), ∀α 0
и удовлетворяет следующему условию Липшица по переменной s
|H(t, x, s
(1)
для всех (t, x) ∈ [0,θ] ×R
) −H(t, x,s
n
(1),s(2)
, s
(2)
)| λs
(1)
(2)
− s
(12.30)
∈ Rn. В этом случае в преобразова-
нии (12.6) можно использовать функцию
2ε(t)
2
,
где ε(t)=ε
w
(t, x, y):=
ε
2λt
e
, ε0— положительное число, λ — константа из условия
0
x −y
Липшица (12.30). Заметим, что равенство
u
(t, x):=min
ε
[u(t, y)+wε(t, x, y)] = min
n
y∈R
y∈R
u(t, y)+
n
x −y
2ε(t)
2
описывает преобразование, известное в выпуклом анализе (в некоторых
работах оно называется преобразованием Иосиды – Моро). Если функция u(t, ·) выпукла, то, как известно, функция u
(t, ·) непрерывно диффе-
ε
ренцируема, т.е. рассмотренное преобразование является «сглаживающим».

150 ГЛАВА III
12.4. Доказательство теоремы 11.4
Нетрудно видеть, что из теорем 8.1 и 12.3 следует справедливость теоремы 11.4. Действительно, как показано в пункте 11.1, в задаче Коши (11.19)
удовлетворены все требования теоремы 8.1, согласно которой минимаксное
решение u этой задачи существует и единственно. Так как функция u являет-
ся одновременно верхним и нижним решением задачи (11.19), то, применяя
теорему 12.3, получаем оценки (12.28) и (12.29). Согласно определению
оптимальных результатов (11.16), имеем
0
Γ
(t0,x0) Γ1(t0,x0,Uε) u(t0,x0)+ζ
1
Γ
2(t0,x0,Vε
)+2ζ Γ
0
(t0,x0)+2ζ.
2
Эти неравенства справедливы для любого положительного числа ζ,следовательно,
0
Γ
(t0,x0) u(t0,x0) Γ
1
0
(t0,x0).
2
Принимая во внимание неравенство (11.17), заключаем, что
0
(t0,x0)=u(t0,x0)=Γ
Γ
1
0
(t0,x0)=Val(t0,x0). (12.31)
2
Теорема 11.4 доказана.
13. Стабильные мосты и экстремальные стратегии
В 12-м параграфе было приведено относительно компактное доказательство существования цены для дифференциальных игр в классе позиционных стратегий. Однако практическое применение предложенных конструкций возможно либо если функция цены задана явной формулой, либо
если ее можно с высокой точностью приблизить численно. Класс таких
задач довольно узок в обоих случаях. Поэтому важно знать конструкции,
которые являются более грубыми в том смысле, что они не требуют точного
вычисления функции цены и менее чувствительны к ошибкам в измерении
текущей позиции (фазового вектора) системы. Одна из таких конструкций
рассматривается в этом параграфе. Обсуждение проблемы устойчивости решений в классе стратегий по принципу обратной связи будет продолжено в
разделах 14.4 и 14.5.
13.1. Устойчивые мосты в задачах M -сближения
Задача M -сближения, обозначенная в заголовке, состоит в следующем. Пусть заданы начальная позиция (t
) ∈ [0,θ] × Rnизамкнутое
0,x0
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
