Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Обобщенные решения уравнений в частных производных первого порядка. Перспективы динамической оптимизации
.pdf
15. СМЕШАННЫЕ ПОЗИЦИОННЫЕ СТРАТЕГИИ И КОНТРСТРАТЕГИИ 191
где Hcs(t, x, s) — гамильтониан рассматриваемой дифференциальной игры,
который определен соотношениями (15.25).
Подобная же теорема верна и для дифференциальных игр, рассматриваемых в классе позиционных стратегий игрока P и контрcтратегий игрока Q.
Опустим доказательство этого результата, т. к. оно может быть получено из
доказательства сформулированной выше теоремы путем обмена ролей у
игроков P и Q.
15.7. Доказательство теорем 15.3 и 15.6
Существование цен для вышеупомянутых типов дифференциальных
игр можно доказать в рамках общей схемы, которая приведена в параграфе 12.
Опишем кратко, как эта схема может применяться к дифференциальной игре в классе смешанных стратегий по принципу обратной связи. Напомним, что в рассматриваемом случае может быть нарушено так называемое
условие седловой точки в маленькой игре (11.5). Вместо этого условия в
доказательстве теоремы 15.3 будет использовано равенство (15.10).
Предлагаемые конструкции субоптимальных смешанных стратегий подобны конструкциям чистых стратегий по принципу обратной связи из
раздела 12.2. А именно, определим субоптимальную стратегиюU
n
×R
→ rpm (P ) игрока P как cуперпозицию экстремальной предстратегии
:[0,θ]×
ε
и квазиградиента.
Напомним, что предстратегия, используемая для построения позиционной (чистой) стратегии, была определена соотношениями (11.23). Чтобы сконструировать субоптимальную смешанную стратегию по принципу
обратной связи, используем здесь предстратегию, которая определена следующими соотношениями
μ
(t, x, s) ∈ Arg min
0
μ∈rpm (P )
ν∈rpm (Q)
max
h(t, x, s,μ, ν), (15.27)
h(t, x, s, μ, ν):=s,f(t, x, μ, ν)−g(t, x, μ,ν), (15.28)
где используются обозначения (15.9).
Определим позиционную смешанную стратегиюUεформулой
U
(t, x):=μ0(t, x, sε(t, x)). (15.29)
ε
Здесь s
(t, x) — квазиградиент, определенный соотношениями вида (12.10),
ε
(12.14), в которых u — это верхнее решение в задаче Коши (15.20). Отметим,
что согласно теоремам об измеримых селекторах, стратегияU
(t, x) может
ε

192 ГЛАВА III
быть выбрана так, что отображение x →Uεизмеримо по Борелю (см.,
например, [4, 39, 131, 225]).
Следующее утверждение является аналогом теоремы 12.3.
Пусть u — верхнее решение задачи (15.20). Пусть смешанная позиционная стратегииU
компактного множества D ⊂ [0,θ] ×R
существуют такие положительные числа ε>0 и δ
определена соотношением (15.29). Тогда для любого
ε
Γ
1(t0,x0
,Uε, Δ) u(t0,x0)+ζ (15.30)
n
и любого положительного числа ζ
> 0,чтооценка
0
справедлива для всех начальных позиций (t
удовлетворяющих условию diam Δ δ
.
0
Уточним некоторые различия в доказательствах утверждений, сформулированных выше, и теоремы 12.3. Вместо p
) ∈ D и всех разбиений Δ,
0,x0
∗
∈ P , q∗∈ Q и (f∗,g∗),
использовавшихся при доказательстве теоремы 12.3, здесь используются,
соответственно,
∗
μ
:=Uε(τ,ξ)),
ν
∈ Arg max
∗
∗
f
∗
g
ν∈rpm (Q)
τ +δ
1
=
δ
τ
τ +δ
1
=
δ
τ
h(τ,η,s
min
μ∈rpm (P )
f(t, x(t),μ
∗
g(t, x(t),μ∗,ν
,ν
(t)
(t)
∗
)dt,
)dt.
,μ,ν),
Из определения верхнего решения задачи (15.20) следует, что суще-
ствует такой вектор (f
) ∈ Rn× R,что
∗,g∗
dist ((f
∗,g∗
u(τ,η)+g
);E+(τ,η,ν∗)) ζ3(δ),
δ u(τ + δ, η + f∗δ). (15.31)
∗
Здесь вместо (12.1) используется
+
E
(t, x, ν):={(f(t, x, μ,ν), g(t, x, μ, ν)) : μ ∈ rpm (P )}.
Остальная часть доказательства совпадает с доказательством теоремы 12.3.

15. СМЕШАННЫЕ ПОЗИЦИОННЫЕ СТРАТЕГИИ И КОНТРСТРАТЕГИИ 193
Точно так же позиционную смешанную стратегиюVεигрока Q можно
сконструировать как суперпозицию экстремальной предстратегии
ν
(t, x, s) ∈ Arg max
0
и квазиградиента s
min
ν∈rpm (Q)
(ε)
(t, x), определенного соотношениями вида (12.16),
μ∈rpm (P )
h(t, x, s,μ, ν)
(12.17), в которых u — это нижнее решение задачи Коши (15.20). СтратегияV
гарантирует оценку
ε
Γ
2(t0,x0
,Vε, Δ) u(t0,x0) −ζ. (15.32)
Здесь ζ — произвольное положительное число, diamΔ δ,аε, δ достаточно
малы.
В случае, когда u — минимаксное решение задачи (15.20) (т.е. когда
оно одновременно является и верхним, и нижним решением этой задачи),
оценки (15.30) и (15.30) доставляют справедливость теоремы 15.3.
Опишем очень кратко основные конструкции, используемые при доказательстве теоремы 15.6.
Чтобы определить субоптимальную контрстратегию игрока P , введем
предстратегию вида
cs
p
(t, x, s, q) ∈ Arg min
0
[s, f (t, x,p, q)−g(t, x, p, q)] . (15.33)
p∈P
Далее полагаем
Здесь s
(t, x) — квазиградиент, определенный соотношениями вида (12.10),
ε
cs
(t, x, q):=p
U
ε
cs
(t, x, sε(t, x),q). (15.34)
0
(12.14).
Субоптимальную позиционную стратегию V
игрока Q определим со-
ε
отношениями (12.16) – (12.18). Заметим, что функция u, используемая в соотношениях (12.10), (12.14), (12.16) и (12.14), — это минимаксное решение
задачи Коши (15.26). Используя теоремы об измеримом выборе, можно выбрать предстратегию p
измеримым по Борелю (см., например, [4, 39, 131, 225]).
Очевидно, что управление p
cs
такой, что отображение q → p
0
cs
(t, x, s, q) можно рассматривать как опти-
0
cs
(t, x, s, q) будет
0
мальный выбор игрока P в так называемой маленькой игре, определенной
на множестве U
× Q (напомним, что Ucc— это множество всех контру-
cc
правлений игрока P ). Величина
s, f (t, x,p(q),q)−g(t, x, p(q),q)

194 ГЛАВА III
— это плата в маленькой игре. Элементы множеств Uccи Q — стратегии игроков P и Q в маленькой игре. Дифференциальные игры, которые происходят в процессе реализации предложенных пошаговых процедур управления,
могут рассматриваться как развертывание во времени последовательности
принятия решений в статических маленьких играх с указанной выше функцией платы, и где s — квазиградиенты функции цены дифференциальной
игры.
Данная интерпретация может применяться ко всем типам дифференциальных игр, рассмотренных в этом параграфе. Если маленькая игра имеет
седловую точку, то существует цена дифференциальной игры, которая определена для соответствующих классов стратегий игроков.
В заключении этого параграфа обращаем внимание на то, что конструкции, описанные для дифференциальных игр с платой вида (15.2), могут применяться и к другим типам дифференциальных игр. Например, эти
конструкции могут использоваться для построения решений игр преследования – уклонения с функционалом платы вида
γ(x(·)) := min{t t
где M —замкнутоемножествов[0, ∞)×R
:(t, x(t)) ∈ M },
0
n
. Особенностью этих игр является то, что их функции цены могут быть разрывными. Игры преследования–
уклонения будут рассматриваться в параграфе 19.
В исследованиях некоторых типов дифференциальных игр возникает
необходимость использовать полную информацию о движении управляемой
системы, т. е. игрокам нужно знать траекторию x(·): [t
,t] → Rn, реализо-
0
вавшуюся ранее до текущего момента времени t. В таком случае вводятся
так называемые стратегии с памятью. Если для управляемой системы выполнено условие
min
max
p∈P
f(t, x, p,q),s =max
q∈Q
q∈Q
min
f(t, x, p,q),s,
p∈P
то дифференциальная игра с любым непрерывным функционалом платы
x(·) → γ(x(·)) имеет седловую точку в классе стратегий с памятью. Если
вышеупомянутое условие может быть нарушено, то можно доказать существование седловой точки в классе смешанных стратегий с памятью.
Может быть доказано также существование цены этой игры в классе контрcтратегий с памятью у одного из игроков и классе чистых стратегий с
памятью у другого игрока. Субоптимальные стратегии для этих игр могут
быть сконструированы в виде суперпозиций экстремальных предcтратегий
и соответствующих квазиградиентов функции цены. Некоторые результаты,
полученные для дифференциальных игр с памятью, представлены в монографии [123].

16. КОНСТРУКТИВНЫЕ И ЧИСЛЕННЫЕ МЕТОДЫ... 195
16. Конструктивные и численные методы теории
дифференциальных игр
Большое внимание в теории дифференциальных игр уделяется разработкам конструктивных и вычислительных методов. К этому направлению относятся, во-первых, исследования отдельных типов дифференциальных игр, для которых удается получить явные аналитические выражения
для функции цены или оптимальных стратегий; во-вторых, изучение дифференциальных игр, решение которых сводится к относительно простым
вычислительным задачам; в-третьих, разработки специальных алгоритмов
вычисления функции цены, построения стабильных мостов и экстремальных стратегий. Исследования и разработки в этой области представлены
обширной библиографией. Приведенные в данном параграфе результаты
могут дать некоторое представление об этих исследованиях. Вместе с тем,
этот параграф не следует рассматривать как обзор, претендующий на какую-либо полноту.
16.1. Экстремальное прицеливание
Рассмотрим предложенный Н. Н. Красовским метод экстремального
прицеливания. Пусть движение управляемой системы описывается уравнением
˙x(t)=A(t)x(t)+ξ(t, p(t),q(t)). (16.1)
Предполагается, что x ∈ R
A(t) — n×n-матрица, элементы которойзависят непрерывно от параметра t.
Управления игроков удовлетворяют ограничениям p(t) ∈ P , q(t) ∈ Q,где
P и Q — компактные множества.
Сначала рассмотрим случай, когда функционал платы задается равенством
γ(t
,x(·),p(·),q(·)) := s,x−σ∗−
0
Здесь s ∈ R
n
— фиксированный вектор, σ∗—число,e:[0,θ] → R
и ϕ :[0,θ] × P × Q → R — непрерывные функции. Предполагаем, что
равенство
n
, ξ:[0,θ]×P ×Q → Rn— непрерывная функция,
θ
[e(t),x(t)+ϕ(t, p(t),q(t))]dt. (16.2)
t
0
n
min
h(t, ψ):=max
q∈Q
[ψ, ξ(t, p, q)−ϕ(t, p, q)] =
p∈P
выполняется при всех ψ ∈ R
=min
p∈P
n
и t ∈ [0,θ].
max
[ψ, ξ(t, p, q)−ϕ(t, p, q)] (16.3)
q∈Q

196 ГЛАВА III
Пусть ψ(t, s) — это решение уравнения
dψ(t, s)
dt
удовлетворяющее условию ψ(θ, s)=s (символ
= −A
T
(t)ψ(t, s)+e(t), (16.4)
T
обозначает транспониро-
вание).
Определим функцию
θ
v(t, x):=ψ(t, s),x +
Проверим, что v — это функция цены дифференциальной игры (16.1), (16.2).
Ясно, что v(θ,x)=s, x−σ
∗
. Функция v(t, x) непрерывно дифференци-
h(τ,ψ(τ,s))dτ − σ∗. (16.5)
t
руема. Поэтому достаточно проверить, что эта функция является решением
(в классическом смысле) соответствующего уравнения Айзекса – Беллмана.
Нетрудно посчитать
∂v
= x, −A
∂t
T
(t)ψ(t, s)+e(t)−h(t, ψ(t, s)),
v = ψ(t, s). (16.6)
D
x
Для рассматриваемой дифференциальной игры уравнение Айзекса –
Беллмана имеет вид
∂u
+ A(t)x, D
∂t
u−e(t),x + h(t, Dxu)=0.
x
Из (16.3), (16.6) следует, что функция v удовлетворяет этому последнему
уравнению. Следовательно, эта функция является функцией цены дифференциальной игры (16.1), (16.2).
Теперь рассмотрим случай, когда функционал платы имеет вид
θ
,x(·),p(·),q(·)) := σ(x(θ)) −
γ(t
0
Предположим, что σ : R
n
→ R — выпуклая функция, которая удовлетворяет
[e(t),x(t) + ϕ(t, p(t),q(t))]dt. (16.7)
t
0
условию Липшица
|σ(x
(1)
) −σ(x
(2)
)| λx
(1)
(2)
− x
(16.8)

16. КОНСТРУКТИВНЫЕ И ЧИСЛЕННЫЕ МЕТОДЫ... 197
при всех x
где
— это функция, сопряженная к функции σ (см. теорему A4.1).
(1),x(2)
∈ Rn. Напомним, что имеет место следующее равенство
σ(x)= sup
∗
σ
(s):= sup
Очевидно, что функция σ
[s, x−σ∗(s)], (16.9)
n
s∈R
[s, x−σ(x)]
n
x∈R
∗
: Rn→ (−∞, ∞] является полунепрерыв-
ной снизу. Из условия Липшица (16.8) следует, что множество
∗
dom σ
:= {s ∈ Rn: σ∗(s) < ∞}
ограничено.
Определим функцию
u
(t, x):=max
p
v(t, x,s). (16.10)
n
s∈R
Здесь используется обозначение
θ
v(t, x,s):=ψ(t, s),x+
h(τ,ψ(τ,s))dτ − σ∗(s),
t
где, как и выше, ψ(·,s) — это решение уравнения (16.4), удовлетворяю-
щее условию ψ(θ, s)=s; величина h(t, ψ) определена равенствами (16.3).
В формуле (16.10) пишется «max», т.к. множество dom σ
функция v(t,x, ·) полунепрерывна сверху, и поэтому супремум по R
∗
ограничено, а
n
отно-
сительно s достигается. Докажем следующее утверждение.
Пусть для любого t ∈ [0,θ] функция
θ
s →
h(τ,ψ(τ,s))dτ − σ∗(ψ(t, s)) ∈ [−∞, ∞) (16.11)
t
— это функция цены дифференциальной игры (16.1),
p
n
R
вогнута. Тогда u
(16.7).
Д
ОКАЗАТЕЛЬСТВО. Покажем, что u
— минимаксное решение в задаче
p
Коши для уравнения Айзекса – Беллмана
∂u
+ A(t)x, D
∂t
u−e(t),x + h(t, Dxu)=0, (16.12)
x
u(θ, x)=σ(x). (16.13)
Краевое условие u
(θ, x)=σ(x) следует из (16.10), (16.9) и равенства
p
ψ(θ, s)=s.

198 ГЛАВА III
Как было показано выше,для любого фиксированного вектораs∈dom σ
функция (t, x) → v(t, x, s) удовлетворяет уравнению (16.12) в классическом
смысле. Поэтому, функции (t, x) → v(t, x,s) являются нижними решениями уравнения (16.12). Согласно замечанию, сделанному в пункте 3.1, их
верхняя огибающая u
Таким образом, остается проверить, что функция u
решением уравнения Айзекса – Беллмана (16.12). Покажем, что u
является нижним решением этого уравнения.
p
является верхним
p
удовле-
p
творяет условию (U3) (см. определение 6.5). Чтобы проверить это условие,
обратимся к утверждению A5.2. Согласно этому утверждению, производная
функции u
вточке(t,x) ∈ (0,θ) ×Rnпо направлению (1,f) существует и
p
определена равенством
(t, x;1,f)= max
du
p
s∈S0(t,x)
∂v(t, x, s)
∂t
v(t, x,s),f=
+ D
x
=max
s∈S0(t,x)
J(t, x, s,f), (16.14)
где
S
(t, x):={s ∈ Rn: v(t, x,s)=up(t, x)}, (16.15)
0
J(t, x, s,f):=&x, −A
T
(t)ψ(t, s)+e(t)'− h(t, ψ(t, s)) + ψ(t, s),f.
Пусть
+
E
(t, x, q):=co{(A(t)x + ξ(t, p, q), e(t),x + ψ(t, p, q)) : p ∈ P }.
Ясно, что многозначное отображение E
+
удовлетворяеттребованиям(j)–(jv),
сформулированным в пункте 6.2. Итак, установим неравенство
d := min
+
где (f, g) ∈ E
(t, x, q), s ∈ S0(t, x).
Очевидно, что множество S
пуклость функции S
θ
(t, x) s → h(t, ψ(t, s)) ∈ R. Из (16.15) получаем
0
maxs[J(t, x, s,f) −g] 0, (16.16)
(f,g)
(t, x) выпукло и компактно. Покажем вы-
0
h(τ,ψ(τ,s))dτ − σ∗(ψ(t, s)) = up(t, x) −ψ(t, s),x
t
при любых s ∈ S
(t, x). В соответствии со сделанными предположениями,
0
функция
θ
h(τ,ψ(τ,s))dτ − σ∗(ψ(t, s))
t+δ
R
n
s →
∗

16. КОНСТРУКТИВНЫЕ И ЧИСЛЕННЫЕ МЕТОДЫ... 199
является вогнутой. Так как функция ψ(t,·) линейна, получаем, что функция
t+δ
S
(t, x) s →
0
h(τ,ψ(τ,s))dτ
t
является выпуклой для любого δ ∈ (0,θ − t]. Следовательно, функция
s → h(t, ψ(t, s)) выпукла на S
(t, x).
0
В формуле (16.16) выражение в квадратных скобках зависит линейно
от (f,g) и выпукло относительно s. Поэтому, в соответствии с теоремой о
минимаксе [71, 98, 162], операции min и max можно поменять местами. Из
определения множеств E
+
(t, x, q) следует равенство
d := max
min
s
[J(t, x, s,f) −g]=maxsmin
(f,g)
[−h(t, ψ(t, s)) + ψ(t, s),ξ−ϕ],
(ξ,ϕ)
где
(t, x), (f, g) ∈ E+(t, x, q),
s ∈ S
0
(ξ,ϕ) ∈ co {(ξ(p, q),ϕ(p, q): p ∈ P }.
Согласно (16.3), справедливо
[ψ(t, s),ξ−ϕ] h(t, ψ(t,s)).
min
(ξ,ϕ)
Неравенство (16.16) доказано.
Мы таким образом показали, что u
является функцией цены диффе-
p
ренциальной игры (16.1), (16.7).
k
Приведем некоторые замечания. Пусть P ⊂ R
,иQ ⊂ Rl. Предполо-
жим, что
ξ(t, p, q)=B(t)p + C(t)q,
ϕ(t, p, q)=b(t),p + c(t),q. (16.17)
Здесь b(t) ∈ R
k
, c(t) ∈ Rl; B(t) и C(t) — матрицы размерности k × n
и l×n соответственно; предполагается, что функции b(·), c(·) и компоненты
матриц непрерывны на [0,θ]. Определим программный максимин
u
p(t0,x0
Здесь p(·) ∈ L([0,θ],P), q(·) ∈ L([0,θ],Q),символx[·; t
значает решение x(·): [0,θ] → R
вию x(t
0
)=x0.
):=sup
p(·)
inf
γ(t0,x[·; t0,x0,p(·),q(·)],p(·),q(·)). (16.18)
q(·)
,p(·),q(·)] обо-
n
уравнения (16.1), удовлетворяющее усло-
0,x0

200 ГЛАВА III
Нетрудно проверить, что в рассматриваемом случае для программного
максимина справедлива формула (16.10). Как показано выше, если функции
вида (16.11) вогнуты при всех t ∈ [0,θ], то программный максимин совпа-
дает с функцией цены рассматриваемой дифференциальной игры. Поэтому
игрок Q (максимизирующий плату) вместо позиционной стратегии может
выбрать оптимальное (максиминное) программное управление (т. е. управление, на котором достигается супремум в формуле (16.18)). Для любой
фиксированной начальной позиции (t
) оптимальные результаты игро-
0,x0
ка Q в классе позиционных стратегий и программных управлений совпадают.
Кроме рассмотренного здесь условия вогнутости функций вида (16.11),
известны другие условия, при которых программный максимин совпадает
с ценой позиционной дифференциальной игры.
Если выполнено рассмотренное условие вогнутости, то вычисление
функции цены можно провести, используя формулу (16.10), т. е. это вычисление сводится к решению относительно простой задачи выпуклого программирования.
Более того, если предположить, что функции вида (16.11) строго вогнуты, тогда S
(t, x)={s0(t, x)} (т. е. всякое множество вида (16.15) является
0
одноэлементным), и оптимальную стратегию игрока P можно определить
следующим образом
p∈P
max
[s0(t, x),ξ(t, p, q)−ϕ(t,p, q)].
q∈Q
0
U
(t, x) ∈ Arg min
Заметим, что в этом случае функция цены будет гладкой, и вектор s
(t, x)
0
будет ее градиентом.
Отметим, что формула (16.10) определяет программный максимин не
только в случае, когда выполняются соотношения (16.17). Однако в более
общих случаях требуется иное определение программных управлений игроков.
Первые работы, относящиеся к методу экстремального прицеливания,
были опубликованы начале 60-х годов (см., например, [107, 116, 110]).
В последующие годы, в рамках этого метода, были изучены различные
типы задач (в том числе и нелинейные дифференциальные игры). Следуя этому подходу, построение стабильных мостов, функций цены и синтез оптимальных стратегий можно свести к решению задач программного
поглощения. Полученные в этом направлении результаты представлены в
книгах [122, 123, 200]. В результате введения стохастических программных
конструкций удалось существенно расширить возможности этого подхода
[114, 115].
Рассмотренные в этом параграфе дифференциальные игры обычно называют линейными. В этом названии отражено то, что правая часть урав-
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
