Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Обобщенные решения уравнений в частных производных первого порядка. Перспективы динамической оптимизации

.pdf
Скачиваний:
0
Добавлен:
07.09.2026
Размер:
2 Мб
Скачать
☆
11. ОСНОВНЫЕ ПОНЯТИЯ ТЕОРИИ ДИФФЕРЕНЦИАЛЬНЫХ ИГР 131
Эти свойства могут быть выражены с помощью различных техниче­ских средств, включая различный аппарат негладкого анализа: производ­ные по направлению, субдифференциалы, контингентные касательные ко­нуса и т. д. Методы позиционных дифференциальных игр оказываются при­годными для исследований широких классов краевых задач и задач Коши для различных типов УЧП первого порядка. С другой стороны, как демон­стрируется в этой главе, техника теории обобщенных решений УЧП нахо­дит хорошее применение при конструировании оптимальных стратегий по принципу обратной связи.
В этой главе приведены основные понятия и результаты теории пози­ционных дифференциальных игр. Изложение начинается со случая, когда функционал платы имеет вид (11.2). Некоторые дифференциальные игры других типов будут рассмотрены в главе IV. Настоящая глава включает также короткое обсуждение проблемы устойчивости решений дифференци­альных игр и некоторые результаты относительно численных и конструк­тивных методов. Позиционные дифференциальные игры рассматриваются более подробно в книгах [122, 123] и статьях, цитируемых ниже.
11.1. Управляемая система и функционал платы
Рассмотрим дифференциальную игру, в которойдинамика управляемой системы описывается обычным дифференциальным уравнением
˙x(t)=f (t, x(t),p(t),q(t)),t
t θ. (11.1)
0
Здесь p(t) ∈ P и q(t) ∈ Q — управления игрока P и игрока Q соответствен­но; множества P и Q компактны. Эти управления выбираются на основании обратной связи, т.е. в зависимости от текущей позиции (t, x(t)). Игрок P стремится минимизировать функционал платы:
θ
γ(t
,x(·),p(·),q(·)) := σ(x(θ)) −
0
где t
∈ [0,θ] — начальный момент времени. Игрок Q, напротив, желает
0
g(t, x(t),p(t),q(t))dt, (11.2)
t
0
максимизировать этот функционал.
Функции f, g и σ удовлетворяют следующим предположениям. (A1) Функции f :[0,θ] × R
и σ : R
n
→ R являются непрерывными и удовлетворяют ограничениям
f(t, x, p, q) (1 + x)R
n
× P × Q → Rn, g :[0,θ] × Rn× P × Q → R
, |g(t, x,p, q)| (1 + x)Rg,
f
|σ(x)|  (1 + x)R
σ
(11.3)
132 ГЛАВА III
для всех (t, x, p, q) ∈ [0,θ] × Rn× P × Q (здесь Rf, Rgи Rσ—поло-
жительные числа).
(A2) Функции f и g удовлетворяют условию Липшица по переменной x
f(t, x + y,p,q) − f (t, x, p, q) + |g(t, x + y,p,q) −g(t, x, p, q)| λy
(11.4)
для всех (t, x,p, q) ∈ [0,θ] × R
q∈Q
n
min
p∈P
(A3) Для любых s ∈ R
max
min
p∈P
[s, f (t, x,p, q)−g(t, x, p, q)] =
q∈Q
=max
n
× P × Q, y ∈ Rn.
и (t, x) ∈ [0,θ] ×Rnимеет место равенство
[s, f (t, x,p, q)−g(t, x, p, q)] = H(t, x,s). (11.5)
Предположение (A3) называют условием седловой точки в маленькой игре, оно также носит название условия Айзекса. Величина H,опреде­ленная равенствами (11.5), называется гамильтонианом дифференциальной игры (11.1), (11.2). В параграфе 15 будут рассмотрены дифференциальные игры без предположения о выполнении условия (11.5).
Покажем, что при выполнении вышеупомянутых предположений га­мильтониан H удовлетворяет условиям (H1) –(H3), сформулированным в пункте 7.2. Нетрудно видеть, что гамильтониан H непрерывен по пере­менным (t, x, s). Покажем, что выполняется условие Липшица (7.3). Пусть
(t, x) ∈ [0,θ] × R
цию P p → q

(p) ∈Q,что
p
∈ Arg min
n
, s,s∈ Rn. Выберем такие вектор p∈ P ифунк-
max
p∈P
[s,f(t,x, p, q)−g(t, x,p, q)],
q∈Q

(p) ∈ Arg max
q
Напомним, что Arg min
[s,f(t,x, p, q)−g(t, x, p, q)] .
q∈Q
μ(p) и Arg max
p∈P
ν(q) —множества
q∈Q
минимизирующих и максимизирующих элементов, т. е.
Arg min
Arg max
μ(p):={p0∈ P : μ(p0)  μ(p) ∀p ∈ P},
p∈P
ν(q):={q0∈ Q : ν(q0)  ν(q) ∀q ∈ Q},
q∈Q
где P p → μ(p) ∈ R и Q q → ν(q) ∈ R — произвольные непрерывные функции.
Справедливо
H(t, x, s
11. ОСНОВНЫЕ ПОНЯТИЯ ТЕОРИИ ДИФФЕРЕНЦИАЛЬНЫХ ИГР 133
)=min
p∈P
=max
max
[s,f(t,x, p, q)−g(t, x, p, q)] =
q∈Q
[s,f(t,x, p,q)−g(t, x, p,q)]
q∈Q
,f(t,x, p,q(p))−g(t, x,p,q(p)),
s
H(t, x, s

)=min
p∈P
max
max
[s,f(t,x, p, q)−g(t, x, p, q)]
q∈Q
[s,f(t,x, p,q)−g(t, x, p,q)] =
q∈Q

,f(t,x, p,q(p))−g(t, x,p,q(p)).
= s
Следовательно
H(t, x, s
) −H(t, x,s) s− s,f(t,x, p,q(p))
−s
− sf (t, x, p,q(p)) −s− s(1 + x)Rf.
Последнее неравенство следует из оценки (11.3). Точно так же получается оценка
H(t, x, s
) −H(t, x,s) s− s (1 + x)Rf.
Таким образом, мы получили, что гамильтониан H вида (11.5) удовлетво­ряет условию (7.3).
Немедленно, из (11.5) и (11.3)следует, что гамильтониан удовлетворяет оценке (7.4).
Теперь покажем, что гамильтониан удовлетворяет условию Липшица по переменной x. Выберем
p
∈ Arg min

(p) ∈ Arg max
q
p∈P
max
[s, f (t, x,p,q)−g(t, x,p,q)],
q∈Q
[s, f (t, x,p,q)−g(t, x,p,q)] .
q∈Q
Справедливо
H(t, x
,s) −H(t, x,s)
s, f(t, x
−s, f(t, x
−f(t, x
+ |g(t, x
,p,q(p
,p,q(p
,p,q(p
,p,q(p
))−g(t, x,p,q(p))−
)) + g(t, x,p,q(p))
)) −f(t,x,p,q(p))+
)) −g(t, x,p,q(p))|(1 + s)
−λx
− x (1 + s).
Последняя оценка следует из условия (11.4).
134 ГЛАВА III
Таким образом, доказано, что гамильтониан H вида (11.5) удовлетво­ряет условиям (H1) –(H3) пункта 7.2.
11.2. Стратегии по принципу обратной связи и пошаговые процедуры
управления
Пусть задана начальная позиция (t лом S(t
(x(·),p(·),q(·)),гдеp(·) ∈ L([t
) обозначим множество, элементами которого являются тройки
0,x0
,θ],P), q(·) ∈ L([t0,θ],Q),аx(·): [t0,θ] → R
0
) ∈ [0,θ] × Rn.Симво-
0,x0
является абсолютно непрерывной функцией, удовлетворяющей уравне­нию (11.1) и условию x(t и L([t
t → p(t) ∈ P и [t
,θ],Q) обозначаются множества всех измеримых функций [t0,θ]
0
0
)=x0. Напомним, что символами L([t0,θ],P)
0
,θ] t → q(t) ∈ Q. Тройка (x(·),p(·),q(·)) ∈ S(t0,x0) называется управляемым процессом. Функция x(·) называется движением системы (11.1), порождаемым управлениями p(·) и q(·). Заметим, что из предположений (A1) и (A2) следует, что при любых p(·) ∈ L([t и q(·) ∈ L([t
,θ],Q) существует единственное решение уравнения (11.1),
0
,θ],P)
0
продолжаемое до конечного момента времени t = θ.
Игроки выбирают стратегии, которые формируют управления на осно-
вании обратной связи. Произвольная функция
[0,θ] ×R
n
 (t, x) → U (t, x) ∈ P
называется стратегией по принципу обратной связи (позиционной страте­гией) для игрока P .
Точно так же произвольная функция
[0,θ] ×R
n
 (t, x) → V (t, x) ∈ Q
называется стратегией по принципу обратной связи (позиционной страте­гией) для игрока Q. Подчеркнем, что функции U (t, x) и V (t, x) могут быть разрывными.
Пусть игрок P выбрал некоторую стратегию U и некоторое разбиение
n
Δ={t
Символом S(t ∈ S(t
),таких,чтоq(·): [t0,θ] → Q — произвольная измеримая функ-
0,x0
: i ∈ 0,m+1},t0<t1< ···<t
i
,U,Δ) обозначим множество троек (x(·),p(·),q(·)) ∈
0,x0
= θ. (11.6)
m+1
ция, а p(·) — кусочно-постоянное управление, которое сформировано по следующему правилу на основе обратной связи
p(t)=U(t
,x(ti)),ti t<t
i
,i=0,1,...,m. (11.7)
i+1
11. ОСНОВНЫЕ ПОНЯТИЯ ТЕОРИИ ДИФФЕРЕНЦИАЛЬНЫХ ИГР 135
Согласно концепции гарантированного результата, качество пошаговой процедуры управления (U, Δ), выбранной игроком P , оценивается величи­ной
Γ
=sup{γ(t
1(t0,x0
,U,Δ) := sup γ(t0, S(t0,x0,U,Δ)) = (11.8)
,x(·),p(·),q(·)): (x(·),p(·),q(·)) ∈ S(t0,x0,U,Δ)}.
0
Оптимальный результат в классе пошаговых процедур управления игрока P определяется следующим образом
∗
(t0,x0):=inf
Γ
1
Γ1(t0,x0,U,Δ). (11.9)
U,Δ
Точно так же оптимальный результат в классе пошаговых процедур управления для игрока Q определяется формулами
∗
Γ
(t0,x0):=sup
2
Γ
2(t0,x0
,V,Δ) := inf γ(t0, S(t0,x0,V,Δ)). (11.11)
Здесь V и Δ — стратегия и разбиение, выбранные игроком Q, S(t все такие тройки (x(·),p(·),q(·)) ∈ S(t
Γ2(t0,x0,V,Δ), (11.10)
V,Δ
),чтоq(·) — кусочно-постоянное
0,x0
0,x0
,V, Δ) —
управление игрока Q, формируемое на основе обратной связи и имеющее вид
q(t)=V (t
,x(ti)),ti t<t
i
,i=0, 1,...,m,
i+1
x(·) — траектория системы (11.1), порождаемая некоторым измеримым управлением p(·): [t
,θ] → P игрока P и управлением q(·), сформиро-
0
ванным, как указано выше.
Заметим, что
S(t
для любых стратегий U , V и разбиений Δ
,U,Δ1) ∩S(t0,x0,V,Δ2) = ∅
0,x0
1
, Δ2. Поэтому имеют место
неравенства
Γ
1(t0,x0
,U,Δ1) Γ2(t0,x0,V,Δ2),
∗
Γ
(t0,x0) Γ
1
∗
(t0,x0). (11.12)
2
Последнее из этих неравенств подобно известному неравенству для макси­мина и минимакса. В тех случаях, когда в (11.12) имеет место равенство, это равенство определяет цену Val
∗
(t0,x0) дифференциальной игры в клас-
се пошаговых процедур управления. Таким образом, эта цена определяется равенствами
∗
Val
(t0,x0):=Γ
∗
(t0,x0)=Γ
1
∗
(t0,x0).
2
Цена игры зависит от начальной позиции. Поэтому может быть определена функция цены игры
) → Val∗(t0,x0): [0,θ] ×Rn→ R.
(t
0,x0
136 ГЛАВА III
11.3. Цена позиционной дифференциальной игры
Основные понятия теории дифференциальных игр могут быть форма­лизованы несколькими способами. Ниже в параграфе 14 мы даем краткое описание некоторых из этих подходов. Отметим, что основные формали­зации оказываются эквивалентными в том смысле, что цена игры во всех этих постановках — одна и та же.
Сейчас изменим несколько определение цены дифференциальной иг­ры, данное в предыдущем подразделе. Цель этой модификации — сфо­кусировать внимание на главном вопросе, а именно, на конструкции оп­тимальных (или ε-оптимальных) стратегий по принципу обратной связи. Предлагаемые ниже способы построения позиционных стратегий таковы, что в соответствующих пошаговых процедурах управления фиксированная стратегия по принципу обратной связи может быть использована в паре с произвольным разбиением Δ (11.6) достаточно малого диаметра
diam Δ = max{t
− ti: i ∈ 0,.}. (11.13)
i+1
Итак, введем следующие величины
Γ
1(t0,x0
Γ
2(t0,x0
,U) := lim sup
diam Δ↓0
,V) := lim inf
diam Δ↓0
Γ1(t0,x0,U,Δ), (11.14)
Γ2(t0,x0,V,Δ). (11.15)
Эти величины используются как качественные характеристики для по­зиционных стратегий игроков. Оптимальные результаты игрока P и игро­ка Q, гарантированные в классе стратегий по принципу обратной связи, определяются следующим образом:
0
Γ
(t0,x0):=infUΓ1(t0,x0,U),
1
0
Γ
(t0,x0):=supVΓ2(t0,x0,V). (11.16)
2
Позиционная стратегия U (ε-оптимальной) для игрока P , если справедливо равенство Γ
0
=Γ
(t0,x0) (неравенство Γ1(t0,x0,Uε) Γ
1
0
(стратегия Uε) называется оптимальной
0
(t0,x0)+ε). Оптимальная и
1
1(t0,x0
,U0)=
ε-оптимальная стратегии игрока Q определяются аналогичным образом.
Как и в (11.12), здесь имеет место
0
Γ
(t0,x0) Γ
1
0
(t0,x0). (11.17)
2
11. ОСНОВНЫЕ ПОНЯТИЯ ТЕОРИИ ДИФФЕРЕНЦИАЛЬНЫХ ИГР 137
Если в (11.17) имеет место равенство, то это равенство определяет цену дифференциальной игры в классе стратегий по принципу обратной связи
Val (t
0,x0
)=Γ
0
(t0,x0)=Γ
1
Заметим, что это определение цены эквивалентно определению, данно­му в пункте 11.2,т. е. можно показать справедливость равенства Val
0
(t0,x0). (11.18)
2
∗
=Val.
11.4. Теорема
При выполнении предположений (A1) – (A3) существует цена пози­ционной дифференциальной игры (11.1), (11.2), т. е. справедливо равен- ство (11.18). Функция цены совпадает с минимаксным решением задачи Коши
∂u
+ H(t, x, D
∂t
u)=0,u(θ, x)=σ(x), (11.19)
x
где гамильтониан H(t, x, s) определен равенством (11.5).
Заметим, что УЧП, рассматриваемое здесь, называется уравнением Ай­зекса– Беллмана. Его называют также основным уравнением теории диф­ференциальных игр.
Доказательство теоремы 11.4 будет дано в параграфе 12. Отметим, что это доказательство сведено к доказательству следующего ключевого со­отношения между верхними (нижними) решениями уравнения Айзекса – Беллмана и результатами, гарантированными для игрока P (для игрока Q) в классе позиционных стратегий. Пусть u — это верхнее решение зада­чи (11.19); тогда для любого ε>0 можно построить стратегию по принципу обратной связи U
для игрока P ,такую,что
ε
Γ
1(t0,x0,Uε
) u(t0,x0)+ε. (11.20)
Точно так же для любого нижнего решения u задачи (11.19) и для любо­го ε>0 можно построить позиционную стратегию V
Γ
2(t0,x0,Vε
) u(t0,x0) −ε. (11.21)
,такую,что
ε
Как было показано в предыдущей главе, существует и единственно ми­нимаксное решение u в задаче Коши (11.19). Как мы знаем, минимаксное ре­шение является одновременно верхним и нижним решением задачи (11.19). Поэтому из (11.16), (11.20) и (11.21) вытекают неравенства
0
(t0,x0) u(t0,x0)+ε  Γ
Γ
1
0
(t0,x0)+2ε.
2
138 ГЛАВА III
Так как эти оценки справедливы для любого положительного числа ε и имеет место оценка (11.17), получаем
Val (t
0,x0
)=Γ
0
(t0,x0)=Γ
1
0
(t0,x0)=u(t0,x0).
2
Таким образом, из указанного результата следует, что функция цены диф­ференциальной игры (11.1), (11.2) существует и совпадает с минимаксным решением задачи Коши для соответствующего уравнения Айзекса – Беллма­на.
11.5. Оптимальные стратегии в случае гладкой функции цены
Предположим, что существует решение в задаче Коши (11.19), которое является непрерывно дифференцируемым в области (0,θ) × R
n
.Хотяэта гипотеза выполнена в довольно редких ситуациях, полезно рассмотреть кон­струкции оптимальных стратегий в этом случае, поскольку эти конструкции понятны и могут быть использованы, как отправная точка для построений в общем случае.
Итак, пусть функция u :[0,θ] ×R
n
→ R является классическим реше- нием задачи Коши для уравнения Айзекса – Беллмана, т.е. u удовлетворяет следующим требованиям. Эта функция непрерывна, и для нее выполняется конечное условие u(θ, x)=σ(x). В области (0,θ) × R
n
функция u непре­рывно дифференцируема и удовлетворяет уравнению Айзекса – Беллмана в классическом смысле. Известно, что в этом случае оптимальные стратегии игроков могут быть построены следующим образом.
Определим функции
h(t, x, s, p, q):=s, f(t, x, p, q)−g(t, x,p, q), (11.22)
(t, x, s) ∈ Arg min
p
0
q
(t, x, s) ∈ Arg max
0
Ясно, что в общем случае функции p
max
p∈P
q∈Q
h(t, x, s, p, q), (11.23)
q∈Q
min
h(t, x, s, p, q). (11.24)
p∈P
(t, x, s) и q0(t, x, s) могут быть опре-
0
делены из соотношений (11.23) и (11.24) неединственным образом. Для предложенных конструкций можно использовать любые функции, кото­рые удовлетворяют вышеупомянутым условиям. Функция p ция q
(t, x, s)) будет называться здесь предстратегией игрока P (игрока Q).
0
(t, x, s) (функ-
0
Далее, определим стратегии игроков по принципу обратной связи с
помощью равенств
(t, x)=p0(t, x, Dxu(t, x)), (11.25)
U
0
(t, x)=q0(t, x, Dxu(t, x)). (11.26)
V
0
11. ОСНОВНЫЕ ПОНЯТИЯ ТЕОРИИ ДИФФЕРЕНЦИАЛЬНЫХ ИГР 139
Здесь u(t, x) — классическое решение задачи (11.19). Поэтому стратегии U и V0определены как cуперпозиции предcтратегий и градиентов функции u (которая совпадает с функцией цены, как это будет показано ниже).
Докажем, что стратегия U
ложим, что функция U
0
оптимальна для игрока P. Сначала предпо-
0
непрерывна. Выберем произвольную траекторию
управляемой системы
˙x(t)=f (t, x(t),U
где [t
,θ]  t → q(t) ∈ Q — некоторое измеримое управление игрока Q.Это
0
(t, x(t)),q(t)),t0 t θ, (11.27)
0
управление может быть сформировано игроком Q на основании обратной связи, например, согласно равенству q(t)=V (t, x(t)),гдеV — некоторая стратегия игрока Q, или согласно некоторому другому правилу.
Теперь оценим производную функции u[t]=u(t, x(t)). Используя при­мечание (11.22) при s(t)=D ния стратегии U
Du[t]
=
dt
получаем
0
∂u(t,x(t))
∂t
∂u(t,x(t))
=
∂u(t,x(t))
∂t
+ D
∂t
u(t, x(t)) и p0[t]=U0(t, x(t)), из определе-
x
u(t, x(t)),f(t, x(t),p0[t],q(t))=
x
+ h(t, x(t),s(t),p
+max
h(t, x(t),s(t),p0[t],q)+g[t]=
q∈Q
∂u(t,x(t))
=
∂t
[t],q(t)) + g[t]
0
+ H(t, x(t),s(t)) + g[t]=g[t],
0
где g[t]:=g(t, x(t),p
u(θ, x(θ)) u(t
[t],q(t)).Поэтому
0
)+
0,x0
θ
g(t, x(t),p0[t],q(t))dt.
t
0
Так как u(θ,x(θ)) = σ(x(θ)), то, согласно (11.2), получаем
γ(t
,x(·),p0[·],q(·))  u(t0,x0).
0
Аналогичную оценку получим и для случая, когда непрерывность стра­тегии U траекторий x(·): [t вию x(t
не предполагается. Обозначим символом X(t0,x0) множество
0
)=x0и дифференциальному включению
0
,θ] → Rn, которые удовлетворяют начальному усло-
0
˙x(t) ∈ co {f(t, x, p, q): p ∈ P, q ∈ Q}.
140 ГЛАВА III
Полагаем
D := {(t, x(t)) ∈ [t
,θ] × Rn: x(·) ∈ X(t0,x0)}.
0
Заметим, что множество D замкнуто и ограничено. Пусть
Λ:=max{f (t, x, p, q): t ∈ [t
Ясно, что
для любого x(·) ∈ X(t
x(t
) −x(t)Λ|t− t| (11.28)
) илюбыхt,t∈ [t0,θ].
0,x0
Рассмотрим пошаговую процедуру (U управляемый процесс (x(·),p(·),q(·)) ∈ S(t
,θ],x∈ D, p ∈ P, q ∈ Q}.
0
, Δ). Выберем произвольный
0
0,x0,U0
, Δ). Будем использо-
вать следующее обозначение
ζ(t):=
где s(t):=D
u(t, x(t)) и величина h(t, x,s, p, q) определена соотношени-
x
ем (11.22). Из равенства p(t)=p(t
∂u(t,x(t))
∂t
+max
h(t, x(t),s(t),p(t),q),
q∈Q
)=U0(ti,x(ti)) для t ∈ [ti,t
i
соотношений (11.5), (11.19), (11.23) и (11.25) следует, что ζ(t производная функции u[t]=u(t, x(t)) на интервале [t
i,ti+1
оценена следующим образом
Du[t]
dt
∂u(t,x(t))
=
=
∂t
+ D
∂u(t,x(t))
∂t
u(t, x(t)),f(t, x(t),p(ti),q(t))=
x
+ h(t, x(t),s(t),p(t
),q(t)) + g[t]
i
ζ(t)+g[t]=ζ(t)+g(t, x(t),p(t
) и
i+1
)=0. Теперь
i
) может быть
),q(t)).
i
Функции (t, x) → D
u(t, x) и (t, x) → ∂u(t, x)/∂t являются равномерно
x
непрерывными на множестве D. Рассматриваемая траектория x(·) принад­лежит множеству X(t же, что ζ(t
)=0.Поэтомудлялюбогоε>0 можно выбрать δ>0 так,
i
что для любого управляемого процесса (x(·),p(·),q(·)) ∈ S(t
) и удовлетворяет оценке (11.28). Напомним так-
0,x0
0,x0,U0
, Δ), удовлетворяющего условию diam Δ δ верна оценка ζ(t) ε для всех t ∈ [t
σ(x(θ)) = u(θ,x(θ)) u(t
), ti∈ Δ. Таким образом, получили
i,ti+1
)+
0,x0
t
0
θ
g(t, x(t),p(t),q(t))dt +(θ −t0)ε.
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]