Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Обобщенные решения уравнений в частных производных первого порядка. Перспективы динамической оптимизации
.pdf
19. ДИФФЕРЕНЦИАЛЬНЫЕ ИГРЫ НА ОПТИМУМ ВРЕМЕНИ 261
min
p∈P
(1),x(2)
max
q∈Q
∈ Rn, p ∈ P , q ∈ Q. Предполагается также, что
s, f (x, p, q) =max
n
и x ∈ Rn. Заметим, что (19.5) называется условием Айзек-
q∈Q
min
s, f (x, p, q) := H(x,s) (19.5)
p∈P
при всех x
для всех s ∈R
са, его называют также условием седловой точки в маленькой игре. Функция H(x, s), определенная равенством (19.5), называется гамильтонианом в
дифференциальной игре быстродействия (игре на оптимум времени). Согласно сформулированным выше предположениям, для любой начальной
точки x
q(·): R
единственно и может быть продолжено на всю полуось R
платы на пространстве C(R
∈ Rnи при любом выборе измеримых управлений p(·): R+→ P ,
0
+
→ Q, соответствующее решение уравнения (19.3) существует,
Пусть задано замкнутое множество M ⊂ R
+
; Rn) всех непрерывных функций x(·):R+→R
n
. Определим функционал
+
:= [0,∞).
с помощью равенства
+
τ(x(·)) := min{t ∈ R
Если x(t) ∈ M при всех t ∈ R
+
, то полагаем τ(x(·)=∞.
: x(t) ∈ M}. (19.6)
Функционал τ полунепрерывен снизу. Это свойство состоит в следующем. Пусть x
тогда τ(x
(·) ∈C(R+; Rn), xk(·) → x∗(·) и τ(xk(·)) → τ∗при k →∞,
k
(·)) τ∗.Здесьxk(·) → x∗(·) означает равномерную сходимость
∗
на любом интервале [0,θ],т.е.,длялюбогоθ>0:
max
xk(t) −x∗(t)→0, когда k →∞.
0tθ
Отметим, что предельная функция x
что τ
и τ (x∗(·)) могут быть бесконечными.
∗
(·) непрерывна на R+. Отметим также,
∗
Ясно, что описанные выше игры преследования– уклонения являются
частными случаями дифференциальной игры быстродействия вида (19.3),
(19.6). Чтобы заметить это, достаточно вместо пары уравнений (19.1), (19.2)
рассмотреть одно уравнение (19.3), в котором полагается
n
n = l + m,
x =(x
,...,xn)=(ξ1,ξ2,...,ξl,η1,η2,...,ηm),
1,x2
и определить терминальное множество с помощью одного из следующих
равенств
M = {x ∈ R
M =x ∈ R
n
n
:
: xi= x
h
(xi− x
i=1
,i∈ 1,h},
i+l
)2 r
i+l
2
.

262 ГЛАВА IV
19.3. Цена дифференциальной игры быстродействия
Введем позиционные стратегии игроков и цену в дифференциальной
игре быстродействия.
Функция U : R
n
→ P (функция V : Rn→ Q) называется стратегией
по принципу обратной связи или позиционной стратегией преследователя
(убегающего). Отметим, что, в отличие от случая, рассмотренного в параграфе 11, функции U и V не зависят от переменной t (от текущего времени).
Пусть задана начальная точка x
∈ Rn. Пусть преследователь выбрал
0
позиционную стратегию U и разбиение
Δ:={0=t
Обозначим символом X(x
< ···},ti→∞, когда i →∞.
0<t1
,U,Δ) множество пошаговых движений диффе-
0
ренциального включения
˙x(t) ∈ co {f(x(t),U(x(t
t<t
t
i
, i =0, 1, 2,.... Элементами множества X(x0,U,Δ) являются
i+1
непрерывные функции x(·): R
условию x(0) = x
. Для любого θ>0 их сужения на отрезок [0,θ] абсо-
0
+
→ Rn, которые удовлетворяют начальному
)),q): q ∈ Q} (19.7)
i
лютно непрерывны и удовлетворяют дифференциальному включению (19.7)
при почти всех t ∈ [0,θ].
Точно так же пусть убегающий игрок выбрал позиционную страте-
гию V : R
n
→ Q и свое разбиение Δ.СимволомX(x0,V,Δ) обозначается
множество пошаговых движений дифференциального включения
t<t
t
i
˙x(t) ∈ co {f(x(t),p,V(x(t
, i =0, 1, 2,.... Очевидно, что для любой пары (U, V ) страте-
i+1
))): p ∈ P } (19.8)
i
гий по принципу обратной связи преследователя и убегающего эти стратегии совместимы в следующем смысле: для произвольных разбиений Δ
(2)
и Δ
, выбранных преследователем и убегающим, существует (и един-
(1)
ственно) движение системы (19.3), где
Поэтому X(x
,U,Δ
0
p(t)=U(x(t
(1)
∈ Δ
t
i
q(t)=V (x(t
(2)
t
∈ Δ
j
(1)
) ∩X(x0,V,Δ
(1)
i
(1)
,i=0, 1, 2,...;
(2)
j
(2)
,j=0, 1, 2,....
(1)
)),t
i
(2)
)),t
j
(2)
) = ∅.
t<t
t<t
(1)
i+1
(2)
j+1
,
,

19. ДИФФЕРЕНЦИАЛЬНЫЕ ИГРЫ НА ОПТИМУМ ВРЕМЕНИ 263
Ниже будут использоваться обозначения
diam (Δ) := sup
(t
− ti) для i =0, 1, 2,.... (19.9)
i+1
i
Так как функционал платы (19.6), вообще говоря, может быть разрывным, то для того, чтобы определить цену в дифференциальной игре быстродействия, будут нужны некоторые дополнительные конструкции. Введем
функционал
τ
(x(·)) := min{t ∈ R+: x(t) ∈ Mε}. (19.10)
ε
Если x(t) ∈ M
положительное число, M
именно,
ε
для всех t ∈ R+, то полагаем τε(x(·)) := ∞.Здесьε —
ε
— ε-окрестность терминального множества M ,а
ε
M
:= {x + y: x ∈ M, y ε}.
Далее, введем величины
ε
T
(x0,U,Δ) := sup{τε(x(·)): x(·) ∈ X(x0,U,Δ)},
1
ε
(x0,U) := lim sup
T
1
T
T
Очевидно, что T
дует, что предел в последнем из приведенных соотношений существует.
Величина T
дователя в классе стратегий по принципу обратной связи. Предположим, что T
ε
(x0) T
1
0
(x0) называется оптимальным результатом для пресле-
1
0
(x0) < ∞. Согласно определению, получаем немедленно,
1
что для любых ε>0 и θ>T
онная стратегия U
ния x(·) ∈ X(x
ичислоδ>0, что для любого пошагового движе-
∗
, Δ),гдеdiam (Δ) δ,точкаx(t) достигает ε-окрест-
0,U∗
diam (Δ)↓0
ε
(x0):=infUT
1
0
(x0) := lim
1
ε
1
ε↓0
(x0) для ε ε.Изэтоймонотонностисле-
0
(x0) могут быть найдены такая позици-
1
ε
T
(x0,U,Δ),
1
ε
(x0,U),
1
ε
T
(x0,U). (19.11)
1
ности множества M не позже, чем за время θ.
Аналогично определяется оптимальный результат для убегающего. Полагаем
ε
T
(x0,V,Δ) := inf{τε(x(·)): x(·) ∈ X(x0,V,Δ)},
2
ε
T
(x0,V) := lim inf
2
T
T
diam (Δ)↓0
ε
(x0):=supVT
2
0
(x0) := lim
2
ε
T
(x0,V,Δ),
2
ε
(x0,V),
2
ε
T
(x0,V). (19.12)
2
ε↓0

264 ГЛАВА IV
Величина T
в классе стратегий по принципу обратной связи. Из этого определения
вытекает следующее: для любого θ<T
зиционная стратегия V
ние x(·) ∈ X(x
0
(x0) называется оптимальным результатом для убегающего
2
0
(x0) существуют ε>0,по-
и δ>0, такие, что любое пошаговое движе-
∗
, Δ) избегает на интервале времени [0,θ] встречи с
0,V∗
2
ε-окрестностью множества M,еслиdiam (Δ) δ.
Для произвольных пошаговыхпроцедуруправления(U,Δ
(1)
) и (V,Δ
(2)
выбранных преследователем и убегающим, справедливы неравенства
где
Поэтому T
T
0
(x0) T
1
ε
(x0,U,Δ
1
x
∗
(1)
) τε(x∗(·)) T
(·) ∈ X(x0,U,Δ
0
(x0).
2
(1)
) ∩X(x0,V,Δ
ε
(x0,V,Δ
2
(2)
).
(2)
),
Известно, что, при сделанных в разделе 19.2 предположениях, цена Val
в дифференциальной игре быстродействия существует, так что
0
справедливо равенство
Val (x
):=T
0
0
(x0)=T
1
0
(x0). (19.13)
2
Доказательство этого факта содержится, например, в книгах [120, 122, 123].
Доказательство, приведенное ниже, основано на теореме 18.6.
Следует упомянуть, что формализация дифференциальной игры быстродействия, представленная выше, не является единственно возможной.
В теории дифференциальных игр известны различные определения цены
в игре на оптимум времени и различные доказательства ее существования
(см., например, [67, 166, 174]).
),
19.4. Уравнения Айзекса–Беллмана в дифференциальных играх
быстродействия
Рассмотрим следующую краевую задачу
n
H(x, Dv(x)) + 1 = 0,x∈ G := R
\M, (19.14)
v(x)=0,x∈ ∂G, (19.15)
где H(x, s) — гамильтониан, определенный в (19.5). Для рассматриваемой
дифференциальной игры уравнение (19.14) называется уравнением Айзекса – Беллмана. Напомним один хорошо известный результат (см., например, [92]).
Пусть непрерывная функция v :
G → R+удовлетворяет краевому усло-
вию (19.15). Пусть эта функция непрерывно дифференцируема в области G

19. ДИФФЕРЕНЦИАЛЬНЫЕ ИГРЫ НА ОПТИМУМ ВРЕМЕНИ 265
и удовлетворяют уравнению (19.14). Тогда функция v совпадает с функцией
цены дифференциальной игры быстродействия.
Более того, в этом случае оптимальные позиционные стратегии U
и V
0
преследователя и убегающего могут быть сконструированы следующим образом. Определим экстремальные предстратегии с помощью соотношений
(x, s) ∈ Arg min
p
0
p∈P
s, f (x, p, q), (19.16)
max
q∈Q
q
(x, s) ∈ Arg max
0
Оптимальные позиционные стратегии U
q∈Q
max
s, f (x, p, q). (19.17)
p∈P
и V0можно определить как су-
0
перпозиции предстратегий и градиента Dv,т.е.
U
(x):=p0(x, Dv(x)),V0(x):=q0(x, Dv(x)). (19.18)
0
Доказательство этого утверждения опущено. Оно имеет много общего
с доказательством подобного факта для игры с фиксированной продолжительностью, приведенным в пункте 11.5.
Известно, что функция цены является дифференцируемой всюду в исключительно редких ситуациях. Однако, будет показано, что, в общем случае, соотношения вида (19.18), в которых вместо градиента Dv(x) используются квазиградиенты, определяют субоптимальные (почти оптимальные)
стратегии.
0
19.5. Конструкции ε-оптимальных стратегий преследователя в общем
случае
Намереваясь применить результаты, полученные в предшествующем
параграфе, используем при этом преобразование Кружкова [127]
u(x):=1−exp(−v(x)). (19.19)
Можно заметить, что функция v удовлетворяет (19.14) и (19.15) тогда и
только тогда, когда соответствующая функция u удовлетворяет уравнению
H(x, Du(x)) + 1 − u(x)=0,x∈ G := R
n
\ M (19.20)
и краевому условию
u(x)=0,x∈ ∂G. (19.21)
Это заключение, очевидно, справедливо для функций v и u, дифференцируемых в области G.

266 ГЛАВА IV
Ниже рассматривается минимаксное решение краевой задачи (19.20),
(19.21). Отметим, что функция H(x, s)=H(x, s)+1удовлетворяет требованиям (H1) –(H3), сформулированным в пункте 18.1. Краевая функция σ
равняется нулю, поэтому условие (H4) также выполнено. Ясно, что константа c в оценках (18.5) и (18.8) может быть выбрана равной c =1.Отметим
также, что функция
u
(x)=0, ∀x ∈ G
является нижним решением задачи (19.20), (19.21).
Таким образом, согласно теореме 18.6, существует единственное минимаксное решение u :
G → [0, 1] задачи (19.20), (19.21). Напомним также,
что функция u полунепрерывна снизу, и ее надграфик слабо инвариантен
относительно верхних характеристических включений, введенных в разделе 2.5.
В частности, надграфик минимаксного решения слабо инвариантен от-
носительно следующего дифференциального включения
(˙x(t), ˙z(t)) ∈E(x(t),z(t),q). (19.22)
Здесь многозначное отображение E определено как
E(x, z, q):=co{(f(x, p, q),g) ∈ R
где x ∈ G, z ∈ R, q ∈ Q. Легко проверить, что многозначное отображение E
удовлетворяет всем условиям (i), (ii), (iii
пункте 2.5. Например, проверим условие (iv
max
min{s, f −g :(f, g) ∈ E(x, z, q)} =
q∈Q
=max
q∈Q
min
s, f (x, p, q)−z +1=H(x, s)+1− z = H(x, s) − z.
p∈P
Так как в рассматриваемом случае F (x, z, s)=H (x, s) − z,тоизприведенных равенств следует, что отображение E удовлетворяет условию (iv
Выполнение других требований (i), (ii) и (iii
n
× R : p ∈ P, g = z −1},
+
), и (iv+), сформулированным в
+
). Из (19.5) вытекает
+
)очевидно.
+
).
Отметим, что в соотношении (19.22) для переменной z(t) имеет место
уравнение ˙z = z −1, которое влечет выполнение равенства z(t)=(z(0) −
t
− 1)e
+1.
Пусть η ∈ G, q
множество траекторий y(·): [0,τ] → R
∈ Q, τ>0.ПустьсимволомY(η, q∗) обозначено
∗
˙y(t) ∈ co {f(y(t),p,q
n
дифференциального включения
): p ∈ P }, (19.23)
∗

19. ДИФФЕРЕНЦИАЛЬНЫЕ ИГРЫ НА ОПТИМУМ ВРЕМЕНИ 267
удовлетворяющих начальному условию y(0) =η.Предположим,чтоy(t) ∈ G
для любой y(·) ∈ Y(η, q
ектория y(·) ∈ Y(η, q
) ипривсехt ∈ [0,τ]. Тогда существует такая тра-
∗
),что
∗
(u(η) − 1)e
τ
u(y(τ)) −1. (19.24)
Этот факт следует из слабой инвариантности надграфика минимаксного решения u относительно (19.22). Здесь полагаем (x
∈ epi u и используем равенство z(τ)=(u(η)− 1)e
τ
+1. Важно отметить, что
)=(η, u(η)) ∈
0,z0
указанное выше свойство есть форма проявления так называемого условия
u-стабильности для дифференциальной игры быстродействия (см., например, [122, 123]).
Покажем, что функция цены дифференциальной игры быстродействия
и минимаксное решение задачи (19.20), (19.21) связаны равенством
u(x)=1−exp(−Va l (x)),x∈
G. (19.25)
Болeе того, применяя результаты, полученные для минимаксных решений,
построим ε-оптимальные стратегии игроков по принципу обратной связи
следующим образом.
Пусть u:
G → [0, 1] — минимаксное решение в задаче (19.20), (19.21).
Введем следующее преобразование функции u
u
(x):=min
α
[u(y)+wα(x, y)]. (19.26)
y∈G
Здесь
2/ν
+ x −y2)
w
(x, y):=
α
(α
ν =(2+2λ)
α
−1
0 <α<min{1/3, [λ(1 + λ)]
где λ — коэффициент из условия Липшица (19.4). Отметим, что w
ν
, (19.27)
,
−1
}, (19.28)
—это
α
та же самая функция, что и в (18.13), которая использовалась в предыдущем параграфе при доказательстве единственности минимаксного решения.
Очевидно, что функция w
H(x, D
(x, y)) −H(y, −Dywα(x, y)) −wα(x, y) 0 (19.29)
xwα
удовлетворяет неравенству
α
при любых (x, y) ∈ G × G таких, что x −y 1. Фактически это неравенство было проверено в разделе 18.1.

268 ГЛАВА IV
Покажем, что минимум в (19.26) достигается в точке yα,такой,что
x − y
+α 1+1/3. C другой стороны, для любого y ∈
имеем u(y)+w
2α. Очевидно, что uα(x) u(x)+wα(x, x)=u(x)+α 1+
α
G такого, что x−y 1,
(x, y) wα(x, y) 3. Так как функция y → u(y)+wα(x, y)
α
полунепрерывна снизу, минимум в выражении (19.26) достигается в точке y
,такой,что x − yα 1. Далее, имеет место wα(x, yα)=uα(x) −
α
−u(y
) uα(x) 1+α. Из (19.27), (19.28), и последней оценки получаем
α
2/ν
[α
+ x −y2]ν (1 + α)α,
x −y
2
[(1 + α)α]
1/ν
− α
2/ν
[(1 + α)α]2 2α2.
Таким образом, имеем оценки
u
(x) u(x)+α, x −yα 2α. (19.30)
α
Определим позиционную стратегию U
: G → P преследователя ра-
α
венством
U
(x)=p0(x, sα(x)). (19.31)
α
Здесь функция p
в (19.16), вектор s
(x):=(Dxwα)(x, yα(x)) = −(Dywα)(x, yα(x)), (19.32)
s
α
— это экстремальная предстратегия, определенная
0
(x) задается соотношениями
α
где
(x) ∈ Arg min
y
α
[u(y)+wα(x, y)]. (19.33)
y∈G
Если функция u непрерывно дифференцируема в окрестности точки x ∈ G, то из (19.26) и (19.33) следует, что
(x)) + (Dywα)(x, yα(x)) = 0.
Du(y
α
Вследствие (19.32) и (19.30), имеем s
мая во внимание это соотношение, будем называть s
(x) → Du(x),когдаα → 0. Прини-
α
(x) квазиградиентом
α
функции u вточкеx.
Заметим также, что стратегию U
венства
U
(x)=p0(x, s
α
где s
(x)=sα(x)(1 − u(x))−1. В силу выполнения (19.19), разумно назы-
α
вать s
квазиградиентом функции цены дифференциальной игры быстро-
α
можно определять при помощи ра-
α
(x)),
α
действия.

19.6. Теорема
19. ДИФФЕРЕНЦИАЛЬНЫЕ ИГРЫ НА ОПТИМУМ ВРЕМЕНИ 269
Пусть x
Пусть ε и θ — произвольные числа, такие, что ε>0 и θ>−ln(1 −u(x
Тогда существуют числа α>0 и δ
если diam(Δ) δ
теля, определенная (19.31), а величина T
—точкаобластиG, удовлетворяющая неравенству u(x0) < 1.
0
> 0, для которых выполняется оценка
0
ε
(x0,Uα, Δ) θ, (19.34)
T
1
.ЗдесьUα— позиционная стратегия преследова-
0
ε
(x0,Uα, Δ) задается равен-
1
)).
0
ством (19.11).
ОКАЗАТЕЛЬСТВО.ОбозначимчерезX(x
Д
+
рий x(·): R
→ Rnдифференциального включения
) множествовсехтраекто-
0
˙x(t) ∈ co {f(x(t),p,q): p ∈ P, q ∈ Q},
удовлетворяющих начальному условию x(0) = x
n
K := {x(t) ∈ R
: x(·) ∈ X(x0),t∈ [0,θ]},
. Определим
0
m := sup{f(x + h, p, q): x ∈ K, p ∈ P, q ∈ Q, h 1}. (19.35)
Отметим, что множество K ограничено, и m<∞. Выберем числа α>0
и δ
> 0, удовлетворяющие оценкам
0
3α ε, δ
m α, 3α<1. (19.36)
0
Ниже будет доказано следующее утверждение.
Пусть
0,Uα
τ −t
i
, Δ).
+(τ −ti)e
τ −t
i
h(δ). (19.37)
Пусть t
го τ ∈ [t
x(·) ∈ X(x
∈ Δ, ti<θ,ипустьdist (x(ti); M ) > 3α. Тогда для любо-
i
] ∩[0,θ] справедливо неравенство
i,ti+1
u
(x(τ)) 1 −[1 −uα(x(ti)]e
α
Здесь δ =diam(Δ), h(δ) → 0,когдаδ → 0. Величина h(δ) зависит только
от δ и не зависит от x(·) ∈ X(x
0,Uα
, Δ).
Помимо (19.36), будем требовать, чтобы параметры α и δ удовлетворяли неравенству
θ
e
[α + θ ·h(δ)] <e
где через ω обозначена величина −ln(1 − u(x
θ−ω
− 1, (19.38)
)).Отметим,чтоθ>ωпо
0
предположению. Следовательно, (19.38) выполняется для достаточно малых α и δ.

270 ГЛАВА IV
Покажем, что приведенные выше оценки доставляют требуемое неравенство (19.34). Рассмотрим следующие два случая: (i) существует t
такой, что t
ство dist (x(t
ограничению t
<θи dist (x(ti); M ) 3α; (ii) противоположное неравен-
i
); M ) > 3α имеет место при всех ti∈ Δ, удовлетворяющих
i
<θ.
i
i
∈ Δ
Из того, что 3α ε, в случае (i) мы немедленно получаем (19.34).
Рассмотрим случай (ii). Из рекуррентных оценок (19.37) можно получить
u
(x(θ)) 1 − [1 −uα(x0)]eθ+ θeθh(δ).
α
Так как ω = −ln(1 −u(x
)), из (19.30) следует, что
0
u
) u(x0)+α =1−e−ω+ α.
α(x0
Поэтому
u
(x(θ)) 1 − [1 −uα(x0)]eθ+ eθθh(δ) 1 −e
α
θ−ω
+ eθα + eθθh(δ) < 0.
Последнее неравенство следует из (19.38). Таким образом, в случае (ii) приходим к неравенству u
u
(x(θ)) > 0. Таким образом, получено противоречие, из которого следует,
α
(x(θ)) < 0. С другой стороны, из (19.26) вытекает
α
что случай (ii) невозможен.
Чтобы завершить доказательство, остается получить оценку (19.37).
Напомним, что рассматривается пошаговое движение x(·) ∈ X(x
Предполагается, что t
∈ Δ, ti<θ, t ∈ [ti,t
i
]∩[0,θ] и dist(x(ti); M ) > 3α.
i+1
0,Uα
, Δ).
Введем следующие обозначения
ξ = x(t
∗
p
Так как функция f (x, p, q) и позиционная стратегия U
менной t, можно полагать t
где ˙x(t) ∈ co {f(x(t),p
),η= yα(ξ),s∗= sα(ξ),
i
= Uα(ξ)=p0(ξ,s∗),q∗= q0(η, s∗). (19.39)
не зависят от пере-
=0.Пустьf∗определено равенствами
i
τ
x(τ) −ξ
∗
=
f
∗
,q): q ∈ Q}. Нужно показать справедливость нера-
τ
1
=
˙x(t)dt, (19.40)
τ
0
α
венства
(ξ) e−τ[1 −uα(ξ + f∗τ)] + τh(τ ). (19.41)
1 −u
α
Из неравенства dist (ξ; M) > 3α и второй оценки в (19.30) вытекает,
что dist (η,M) >α.Напомним,чтоδ
m α. Эта оценка и определение m
0
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
