Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Обобщенные решения уравнений в частных производных первого порядка. Перспективы динамической оптимизации

.pdf
Скачиваний:
0
Добавлен:
07.09.2026
Размер:
2 Мб
Скачать
☆
15. СМЕШАННЫЕ ПОЗИЦИОННЫЕ СТРАТЕГИИ И КОНТРСТРАТЕГИИ 191
где Hcs(t, x, s) — гамильтониан рассматриваемой дифференциальной игры, который определен соотношениями (15.25).
Подобная же теорема верна и для дифференциальных игр, рассматрива­емых в классе позиционных стратегий игрока P и контрcтратегий игрока Q. Опустим доказательство этого результата, т. к. оно может быть получено из доказательства сформулированной выше теоремы путем обмена ролей у игроков P и Q.
15.7. Доказательство теорем 15.3 и 15.6
Существование цен для вышеупомянутых типов дифференциальных игр можно доказать в рамках общей схемы, которая приведена в парагра­фе 12.
Опишем кратко, как эта схема может применяться к дифференциаль­ной игре в классе смешанных стратегий по принципу обратной связи. Напо­мним, что в рассматриваемом случае может быть нарушено так называемое условие седловой точки в маленькой игре (11.5). Вместо этого условия в доказательстве теоремы 15.3 будет использовано равенство (15.10).
Предлагаемые конструкции субоптимальных смешанных стратегий по­добны конструкциям чистых стратегий по принципу обратной связи из
раздела 12.2. А именно, определим субоптимальную стратегиюU
n
×R
→ rpm (P ) игрока P как cуперпозицию экстремальной предстратегии
:[0,θ]×
ε
и квазиградиента.
Напомним, что предстратегия, используемая для построения позици­онной (чистой) стратегии, была определена соотношениями (11.23). Что­бы сконструировать субоптимальную смешанную стратегию по принципу обратной связи, используем здесь предстратегию, которая определена сле­дующими соотношениями
μ
(t, x, s) ∈ Arg min
0
μ∈rpm (P )
ν∈rpm (Q)
max
h(t, x, s,μ, ν), (15.27)
h(t, x, s, μ, ν):=s,f(t, x, μ, ν)−g(t, x, μ,ν), (15.28)
где используются обозначения (15.9).
Определим позиционную смешанную стратегиюUεформулой
U
(t, x):=μ0(t, x, sε(t, x)). (15.29)
ε
Здесь s
(t, x) — квазиградиент, определенный соотношениями вида (12.10),
ε
(12.14), в которых u — это верхнее решение в задаче Коши (15.20). Отметим, что согласно теоремам об измеримых селекторах, стратегияU
(t, x) может
ε
192 ГЛАВА III
быть выбрана так, что отображение x →Uεизмеримо по Борелю (см., например, [4, 39, 131, 225]).
Следующее утверждение является аналогом теоремы 12.3.
Пусть u — верхнее решение задачи (15.20). Пусть смешанная позици­онная стратегииU
компактного множества D ⊂ [0,θ] ×R существуют такие положительные числа ε>0 и δ
определена соотношением (15.29). Тогда для любого
ε
Γ
1(t0,x0
,Uε, Δ) u(t0,x0)+ζ (15.30)
n
и любого положительного числа ζ
> 0,чтооценка
0
справедлива для всех начальных позиций (t удовлетворяющих условию diam Δ δ
.
0
Уточним некоторые различия в доказательствах утверждений, сфор­мулированных выше, и теоремы 12.3. Вместо p
) ∈ D и всех разбиений Δ,
0,x0
∗
∈ P , q∗∈ Q и (f∗,g∗), использовавшихся при доказательстве теоремы 12.3, здесь используются, соответственно,
∗
μ
:=Uε(τ,ξ)),
ν
∈ Arg max
∗
∗
f
∗
g
ν∈rpm (Q)
τ +δ
1
=
δ
τ
τ +δ
1
=
δ
τ
h(τ,η,s
min
μ∈rpm (P )
f(t, x(t),μ
∗
g(t, x(t),μ∗,ν
,ν
(t)
(t)
∗
)dt,
)dt.
,μ,ν),
Из определения верхнего решения задачи (15.20) следует, что суще-
ствует такой вектор (f
) ∈ Rn× R,что
∗,g∗
dist ((f
∗,g∗
u(τ,η)+g
);E+(τ,η,ν∗)) ζ3(δ),
δ u(τ + δ, η + f∗δ). (15.31)
∗
Здесь вместо (12.1) используется
+
E
(t, x, ν):={(f(t, x, μ,ν), g(t, x, μ, ν)) : μ ∈ rpm (P )}.
Остальная часть доказательства совпадает с доказательством теоремы 12.3.
15. СМЕШАННЫЕ ПОЗИЦИОННЫЕ СТРАТЕГИИ И КОНТРСТРАТЕГИИ 193
Точно так же позиционную смешанную стратегиюVεигрока Q можно
сконструировать как суперпозицию экстремальной предстратегии
ν
(t, x, s) ∈ Arg max
0
и квазиградиента s
min
ν∈rpm (Q)
(ε)
(t, x), определенного соотношениями вида (12.16),
μ∈rpm (P )
h(t, x, s,μ, ν)
(12.17), в которых u — это нижнее решение задачи Коши (15.20). Стра­тегияV
гарантирует оценку
ε
Γ
2(t0,x0
,Vε, Δ) u(t0,x0) −ζ. (15.32)
Здесь ζ — произвольное положительное число, diamΔ δ,аε, δ достаточно малы.
В случае, когда u — минимаксное решение задачи (15.20) (т.е. когда оно одновременно является и верхним, и нижним решением этой задачи), оценки (15.30) и (15.30) доставляют справедливость теоремы 15.3.
Опишем очень кратко основные конструкции, используемые при дока­зательстве теоремы 15.6.
Чтобы определить субоптимальную контрстратегию игрока P , введем предстратегию вида
cs
p
(t, x, s, q) ∈ Arg min
0
[s, f (t, x,p, q)−g(t, x, p, q)] . (15.33)
p∈P
Далее полагаем
Здесь s
(t, x) — квазиградиент, определенный соотношениями вида (12.10),
ε
cs
(t, x, q):=p
U
ε
cs
(t, x, sε(t, x),q). (15.34)
0
(12.14).
Субоптимальную позиционную стратегию V
игрока Q определим со-
ε
отношениями (12.16) – (12.18). Заметим, что функция u, используемая в со­отношениях (12.10), (12.14), (12.16) и (12.14), — это минимаксное решение задачи Коши (15.26). Используя теоремы об измеримом выборе, можно вы­брать предстратегию p измеримым по Борелю (см., например, [4, 39, 131, 225]).
Очевидно, что управление p
cs
такой, что отображение q → p
0
cs
(t, x, s, q) можно рассматривать как опти-
0
cs
(t, x, s, q) будет
0
мальный выбор игрока P в так называемой маленькой игре, определенной на множестве U
× Q (напомним, что Ucc— это множество всех контру-
cc
правлений игрока P ). Величина
s, f (t, x,p(q),q)−g(t, x, p(q),q)
194 ГЛАВА III
— это плата в маленькой игре. Элементы множеств Uccи Q — стратегии иг­роков P и Q в маленькой игре. Дифференциальные игры, которые происхо­дят в процессе реализации предложенных пошаговых процедур управления, могут рассматриваться как развертывание во времени последовательности принятия решений в статических маленьких играх с указанной выше функ­цией платы, и где s — квазиградиенты функции цены дифференциальной игры.
Данная интерпретация может применяться ко всем типам дифференци­альных игр, рассмотренных в этом параграфе. Если маленькая игра имеет седловую точку, то существует цена дифференциальной игры, которая опре­делена для соответствующих классов стратегий игроков.
В заключении этого параграфа обращаем внимание на то, что кон­струкции, описанные для дифференциальных игр с платой вида (15.2), мо­гут применяться и к другим типам дифференциальных игр. Например, эти конструкции могут использоваться для построения решений игр преследо­вания – уклонения с функционалом платы вида
γ(x(·)) := min{t t
где M —замкнутоемножествов[0, ∞)×R
:(t, x(t)) ∈ M },
0
n
. Особенностью этих игр являет­ся то, что их функции цены могут быть разрывными. Игры преследования– уклонения будут рассматриваться в параграфе 19.
В исследованиях некоторых типов дифференциальных игр возникает необходимость использовать полную информацию о движении управляемой системы, т. е. игрокам нужно знать траекторию x(·): [t
,t] → Rn, реализо-
0
вавшуюся ранее до текущего момента времени t. В таком случае вводятся так называемые стратегии с памятью. Если для управляемой системы вы­полнено условие
min
max
p∈P
f(t, x, p,q),s =max
q∈Q
q∈Q
min
f(t, x, p,q),s,
p∈P
то дифференциальная игра с любым непрерывным функционалом платы x(·) → γ(x(·)) имеет седловую точку в классе стратегий с памятью. Если вышеупомянутое условие может быть нарушено, то можно доказать су­ществование седловой точки в классе смешанных стратегий с памятью. Может быть доказано также существование цены этой игры в классе кон­трcтратегий с памятью у одного из игроков и классе чистых стратегий с памятью у другого игрока. Субоптимальные стратегии для этих игр могут быть сконструированы в виде суперпозиций экстремальных предcтратегий и соответствующих квазиградиентов функции цены. Некоторые результаты, полученные для дифференциальных игр с памятью, представлены в моно­графии [123].
16. КОНСТРУКТИВНЫЕ И ЧИСЛЕННЫЕ МЕТОДЫ... 195
16. Конструктивные и численные методы теории
дифференциальных игр
Большое внимание в теории дифференциальных игр уделяется раз­работкам конструктивных и вычислительных методов. К этому направле­нию относятся, во-первых, исследования отдельных типов дифференциаль­ных игр, для которых удается получить явные аналитические выражения для функции цены или оптимальных стратегий; во-вторых, изучение диф­ференциальных игр, решение которых сводится к относительно простым вычислительным задачам; в-третьих, разработки специальных алгоритмов вычисления функции цены, построения стабильных мостов и экстремаль­ных стратегий. Исследования и разработки в этой области представлены обширной библиографией. Приведенные в данном параграфе результаты могут дать некоторое представление об этих исследованиях. Вместе с тем, этот параграф не следует рассматривать как обзор, претендующий на ка­кую-либо полноту.
16.1. Экстремальное прицеливание
Рассмотрим предложенный Н. Н. Красовским метод экстремального прицеливания. Пусть движение управляемой системы описывается урав­нением
˙x(t)=A(t)x(t)+ξ(t, p(t),q(t)). (16.1)
Предполагается, что x ∈ R A(t) — n×n-матрица, элементы которойзависят непрерывно от параметра t. Управления игроков удовлетворяют ограничениям p(t) ∈ P , q(t) ∈ Q,где P и Q — компактные множества.
Сначала рассмотрим случай, когда функционал платы задается равен­ством
γ(t
,x(·),p(·),q(·)) := s,x−σ∗−
0
Здесь s ∈ R
n
— фиксированный вектор, σ∗—число,e:[0,θ] → R и ϕ :[0,θ] × P × Q → R — непрерывные функции. Предполагаем, что равенство
n
, ξ:[0,θ]×P ×Q → Rn— непрерывная функция,
θ
[e(t),x(t)+ϕ(t, p(t),q(t))]dt. (16.2)
t
0
n
min
h(t, ψ):=max
q∈Q
[ψ, ξ(t, p, q)−ϕ(t, p, q)] =
p∈P
выполняется при всех ψ ∈ R
=min
p∈P
n
и t ∈ [0,θ].
max
[ψ, ξ(t, p, q)−ϕ(t, p, q)] (16.3)
q∈Q
196 ГЛАВА III
Пусть ψ(t, s) — это решение уравнения
dψ(t, s)
dt
удовлетворяющее условию ψ(θ, s)=s (символ
= −A
T
(t)ψ(t, s)+e(t), (16.4)
T
обозначает транспониро-
вание).
Определим функцию
θ
v(t, x):=ψ(t, s),x +
Проверим, что v — это функция цены дифференциальной игры (16.1), (16.2). Ясно, что v(θ,x)=s, x−σ
∗
. Функция v(t, x) непрерывно дифференци-
h(τ,ψ(τ,s))dτ − σ∗. (16.5)
t
руема. Поэтому достаточно проверить, что эта функция является решением (в классическом смысле) соответствующего уравнения Айзекса – Беллмана. Нетрудно посчитать
∂v
= x, −A
∂t
T
(t)ψ(t, s)+e(t)−h(t, ψ(t, s)),
v = ψ(t, s). (16.6)
D
x
Для рассматриваемой дифференциальной игры уравнение Айзекса –
Беллмана имеет вид
∂u
+ A(t)x, D
∂t
u−e(t),x + h(t, Dxu)=0.
x
Из (16.3), (16.6) следует, что функция v удовлетворяет этому последнему уравнению. Следовательно, эта функция является функцией цены диффе­ренциальной игры (16.1), (16.2).
Теперь рассмотрим случай, когда функционал платы имеет вид
θ
,x(·),p(·),q(·)) := σ(x(θ)) −
γ(t
0
Предположим, что σ : R
n
→ R — выпуклая функция, которая удовлетворяет
[e(t),x(t) + ϕ(t, p(t),q(t))]dt. (16.7)
t
0
условию Липшица
|σ(x
(1)
) −σ(x
(2)
)| λx
(1)
(2)
− x
(16.8)
16. КОНСТРУКТИВНЫЕ И ЧИСЛЕННЫЕ МЕТОДЫ... 197
при всех x
где
— это функция, сопряженная к функции σ (см. теорему A4.1).
(1),x(2)
∈ Rn. Напомним, что имеет место следующее равенство
σ(x)= sup
∗
σ
(s):= sup
Очевидно, что функция σ
[s, x−σ∗(s)], (16.9)
n
s∈R
[s, x−σ(x)]
n
x∈R
∗
: Rn→ (−∞, ∞] является полунепрерыв-
ной снизу. Из условия Липшица (16.8) следует, что множество
∗
dom σ
:= {s ∈ Rn: σ∗(s) < ∞}
ограничено.
Определим функцию
u
(t, x):=max
p
v(t, x,s). (16.10)
n
s∈R
Здесь используется обозначение
θ
v(t, x,s):=ψ(t, s),x+
h(τ,ψ(τ,s))dτ − σ∗(s),
t
где, как и выше, ψ(·,s) — это решение уравнения (16.4), удовлетворяю- щее условию ψ(θ, s)=s; величина h(t, ψ) определена равенствами (16.3). В формуле (16.10) пишется «max», т.к. множество dom σ функция v(t,x, ·) полунепрерывна сверху, и поэтому супремум по R
∗
ограничено, а
n
отно-
сительно s достигается. Докажем следующее утверждение.
Пусть для любого t ∈ [0,θ] функция
θ
s →
h(τ,ψ(τ,s))dτ − σ∗(ψ(t, s)) ∈ [−∞, ∞) (16.11)
t
— это функция цены дифференциальной игры (16.1),
p
n
R
вогнута. Тогда u
(16.7).
Д
ОКАЗАТЕЛЬСТВО. Покажем, что u
— минимаксное решение в задаче
p
Коши для уравнения Айзекса – Беллмана
∂u
+ A(t)x, D
∂t
u−e(t),x + h(t, Dxu)=0, (16.12)
x
u(θ, x)=σ(x). (16.13)
Краевое условие u
(θ, x)=σ(x) следует из (16.10), (16.9) и равенства
p
ψ(θ, s)=s.
198 ГЛАВА III
Как было показано выше,для любого фиксированного вектораs∈dom σ функция (t, x) → v(t, x, s) удовлетворяет уравнению (16.12) в классическом смысле. Поэтому, функции (t, x) → v(t, x,s) являются нижними решени­ями уравнения (16.12). Согласно замечанию, сделанному в пункте 3.1, их верхняя огибающая u
Таким образом, остается проверить, что функция u решением уравнения Айзекса – Беллмана (16.12). Покажем, что u
является нижним решением этого уравнения.
p
является верхним
p
удовле-
p
творяет условию (U3) (см. определение 6.5). Чтобы проверить это условие, обратимся к утверждению A5.2. Согласно этому утверждению, производная функции u
вточке(t,x) ∈ (0,θ) ×Rnпо направлению (1,f) существует и
p
определена равенством
(t, x;1,f)= max
du
p
s∈S0(t,x)
∂v(t, x, s)
∂t
v(t, x,s),f=
+ D
x
=max
s∈S0(t,x)
J(t, x, s,f), (16.14)
где
S
(t, x):={s ∈ Rn: v(t, x,s)=up(t, x)}, (16.15)
0
J(t, x, s,f):=&x, −A
T
(t)ψ(t, s)+e(t)'− h(t, ψ(t, s)) + ψ(t, s),f.
Пусть
+
E
(t, x, q):=co{(A(t)x + ξ(t, p, q), e(t),x + ψ(t, p, q)) : p ∈ P }.
Ясно, что многозначное отображение E
+
удовлетворяеттребованиям(j)–(jv),
сформулированным в пункте 6.2. Итак, установим неравенство
d := min
+
где (f, g) ∈ E
(t, x, q), s ∈ S0(t, x).
Очевидно, что множество S пуклость функции S
θ
(t, x) s → h(t, ψ(t, s)) ∈ R. Из (16.15) получаем
0
maxs[J(t, x, s,f) −g] 0, (16.16)
(f,g)
(t, x) выпукло и компактно. Покажем вы-
0
h(τ,ψ(τ,s))dτ − σ∗(ψ(t, s)) = up(t, x) −ψ(t, s),x
t
при любых s ∈ S
(t, x). В соответствии со сделанными предположениями,
0
функция
θ
h(τ,ψ(τ,s))dτ − σ∗(ψ(t, s))
t+δ
R
n
s →
∗
16. КОНСТРУКТИВНЫЕ И ЧИСЛЕННЫЕ МЕТОДЫ... 199
является вогнутой. Так как функция ψ(t,·) линейна, получаем, что функция
t+δ
S
(t, x)  s →
0
h(τ,ψ(τ,s))dτ
t
является выпуклой для любого δ ∈ (0,θ − t]. Следовательно, функция s → h(t, ψ(t, s)) выпукла на S
(t, x).
0
В формуле (16.16) выражение в квадратных скобках зависит линейно от (f,g) и выпукло относительно s. Поэтому, в соответствии с теоремой о минимаксе [71, 98, 162], операции min и max можно поменять местами. Из определения множеств E
+
(t, x, q) следует равенство
d := max
min
s
[J(t, x, s,f) −g]=maxsmin
(f,g)
[−h(t, ψ(t, s)) + ψ(t, s),ξ−ϕ],
(ξ,ϕ)
где
(t, x), (f, g) ∈ E+(t, x, q),
s ∈ S
0
(ξ,ϕ) ∈ co {(ξ(p, q),ϕ(p, q): p ∈ P }.
Согласно (16.3), справедливо
[ψ(t, s),ξ−ϕ] h(t, ψ(t,s)).
min
(ξ,ϕ)
Неравенство (16.16) доказано.
Мы таким образом показали, что u
является функцией цены диффе-
p
ренциальной игры (16.1), (16.7).
k
Приведем некоторые замечания. Пусть P ⊂ R
,иQ ⊂ Rl. Предполо-
жим, что
ξ(t, p, q)=B(t)p + C(t)q,
ϕ(t, p, q)=b(t),p + c(t),q. (16.17)
Здесь b(t) ∈ R
k
, c(t) ∈ Rl; B(t) и C(t) — матрицы размерности k × n и l×n соответственно; предполагается, что функции b(·), c(·) и компоненты матриц непрерывны на [0,θ]. Определим программный максимин
u
p(t0,x0
Здесь p(·) ∈ L([0,θ],P), q(·) ∈ L([0,θ],Q),символx[·; t значает решение x(·): [0,θ] → R вию x(t
0
)=x0.
):=sup
p(·)
inf
γ(t0,x[·; t0,x0,p(·),q(·)],p(·),q(·)). (16.18)
q(·)
,p(·),q(·)] обо-
n
уравнения (16.1), удовлетворяющее усло-
0,x0
200 ГЛАВА III
Нетрудно проверить, что в рассматриваемом случае для программного максимина справедлива формула (16.10). Как показано выше, если функции вида (16.11) вогнуты при всех t ∈ [0,θ], то программный максимин совпа- дает с функцией цены рассматриваемой дифференциальной игры. Поэтому игрок Q (максимизирующий плату) вместо позиционной стратегии может выбрать оптимальное (максиминное) программное управление (т. е. управ­ление, на котором достигается супремум в формуле (16.18)). Для любой фиксированной начальной позиции (t
) оптимальные результаты игро-
0,x0
ка Q в классе позиционных стратегий и программных управлений совпада­ют.
Кроме рассмотренного здесь условия вогнутости функций вида (16.11), известны другие условия, при которых программный максимин совпадает с ценой позиционной дифференциальной игры.
Если выполнено рассмотренное условие вогнутости, то вычисление функции цены можно провести, используя формулу (16.10), т. е. это вычис­ление сводится к решению относительно простой задачи выпуклого про­граммирования.
Более того, если предположить, что функции вида (16.11) строго вогну­ты, тогда S
(t, x)={s0(t, x)} (т. е. всякое множество вида (16.15) является
0
одноэлементным), и оптимальную стратегию игрока P можно определить следующим образом
p∈P
max
[s0(t, x),ξ(t, p, q)−ϕ(t,p, q)].
q∈Q
0
U
(t, x) ∈ Arg min
Заметим, что в этом случае функция цены будет гладкой, и вектор s
(t, x)
0
будет ее градиентом.
Отметим, что формула (16.10) определяет программный максимин не только в случае, когда выполняются соотношения (16.17). Однако в более общих случаях требуется иное определение программных управлений иг­роков.
Первые работы, относящиеся к методу экстремального прицеливания, были опубликованы начале 60-х годов (см., например, [107, 116, 110]). В последующие годы, в рамках этого метода, были изучены различные типы задач (в том числе и нелинейные дифференциальные игры). Сле­дуя этому подходу, построение стабильных мостов, функций цены и син­тез оптимальных стратегий можно свести к решению задач программного поглощения. Полученные в этом направлении результаты представлены в книгах [122, 123, 200]. В результате введения стохастических программных конструкций удалось существенно расширить возможности этого подхода [114, 115].
Рассмотренные в этом параграфе дифференциальные игры обычно на­зывают линейными. В этом названии отражено то, что правая часть урав-
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]