Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Обобщенные решения уравнений в частных производных первого порядка. Перспективы динамической оптимизации
.pdf
13. СТАБИЛЬНЫЕ МОСТЫ И ЭКСТРЕМАЛЬНЫЕ СТРАТЕГИИ 161
то множество Wявляется стабильным мостом для управляемой системы
˙x(t)=f (t, x(t),p(t),q(t)), ˙z(t)=g(t, x(t),p(t),q(t)). (13.22)
Рассмотрим задачу M
-сближения для этой системы, где
:= epiσ = {(x, z) ∈Rn× R : z σ(x).
M
Применяя конструкции, описанные в разделе 13.2, определим для игрока P стратегию, которая является экстремальной к множеству W
Для (t, x,z) ∈ [0,θ] × R
W
(t):={(w, y) ∈ Rn× R :(t,w, y) ∈W},
(t, x, z):=Arg min
W
e
(t, x, z):={ (se,ζe)=(we− x, ye− z): (we,ye) ∈ W
S
e
Выберем произвольно (s
(t, x, z) ∈ Arg max
U
e
Пусть задана начальная позиция (t
=Val(t
).ОбозначимсимволомX(t0,x0,z0,U
0,x0
лютно непрерывных функций (x(·),z(·)) : [t
творяют начальному условию (x(t
n
× R полагаем
(w,y)∈W(t)
) ∈ S
e,ζe
min
p∈P
q∈Q
(t, x, z) и
e
x −w
2
+(z −y)
2
,
(t, x, z)}.
e
se,f(t,x, p, q)−ζeg(t, x,p, q).
) ∈ [0,θ] × Rnипустьz0=
0,x0
,θ] → Rn×R, которые удовле-
),z(t0)) = (x0,z0) и дифференциально-
0
0
, Δ) множество абсо-
e
му включению
(˙x(t), ˙z(t)) ∈ co {(f(t,x(t),p(t),q),g(t, x(t),p(t),q): q ∈ Q},
где
p(t)=U
(ti,x(ti),z(ti)),ti t<t
e
,i=0,1,...,m. (13.23)
i+1
Далее, определим (см. подобную конструкцию в (13.14))
(t0,x0,z0,U
X
) := lim sup
e
diam Δ↓0
X(t0,x0,z0,U
, Δ). (13.24)
e
.
Равенство z
как множество W
тегия U
обеспечивает движение системы внутри множества W,и,поэтому,
e
=Val(t0,x0) подразумевает, что (t0,x0,z0) ∈ W.Так
0
является стабильным мостом для системы (13.22), стра-
гарантирует выполнение условия
(x(θ),z(θ)) ∈ W
для любых (x(·),z(·)) ∈ X
(t0,x0,z0,U
(θ)=M
).
e
(13.25)

162 ГЛАВА III
Последнее утверждение фактически следует из теоремы 13.3. Обратим
внимание, что теорема 13.3 была доказана в предположении, что выполняется (13.3). Для рассматриваемой здесь системы (13.22) имеем
H
(t, x, s, ζ):=min
=max
q∈Q
для ζ>0 и для любого s ∈ R
max
p∈P
min
[s, f (t, x,p, q)−ζg(t, x, p, q)] = ζH(t, x, s/ζ ) (13.26)
p∈P
[s, f (t, x,p, q)−ζg(t, x, p, q)] =
q∈Q
n
. Здесь минимакс равен максимину в силу
условия (11.5). Переходя к пределу при ζ ↓ 0, получаем, что это равенство
справедливо и для ζ =0. Условие (13.26) может быть нарушено для ζ<0.
Однако, для конструкции, предложенной здесь, достаточно, чтобы гамильтониан H
чание, отметим, что множество W
(w, y) ∈ W
для каждой точки (we,ye) ∈ W
(t, x, s, ζ) был определен для ζ 0. Чтобы подтвердить это заме-
(t),то(w,y + r) ∈ W(t) для любого r 0. Следовательно,
− x2+(ye− z)2 we− x2+(ye+ r −z)
w
e
обладает следующим свойством: если
2
(t, x, z).Следовательно,2r(ye−z)+r2 0.
e
Так как последнее неравенство справедливо для любого r 0,приходим
к оценке ζ
ясь к доказательству теоремы 13.3, заключаем, что стратегия U
рождаемые ею движения системы внутри множества W
включение (13.25).
Обозначим символом S(t
(t, x, z):=ye− z 0. Используя это неравенство и обраща-
e
,U
0,x0,z0
, Δ) все тройки (x(·),p(·),q(·)),
e
ведет по-
e
и обеспечивает
где p(·) — управление, сформированное в соответствии с правилом (13.23),
q(·): [t
торая удовлетворяет первому уравнению системы (13.22) и условию x(t
= x
любых (x(·),z(·)) ∈ X
= lim sup
где (x(·),p(·),q(·)) ∈ S(t
оптимальный результат. Заметим, что, в отличие от субоптимальной стратегии U
,θ] → Q — произвольная измеримая функция, x(·) — траектория, ко-
0
. По определению множества M=epiσ, имеем z(θ) σ(θ) для
0
lim sup
diam Δ↓0
sup γ(t0, S(t0,x0,z0,U
sup
diam Δ↓0
(x(·),p(·),q(·))
Таким образом, получили, что стратегия U
, определенной в параграфе 12, стратегия U
ε
(t0,x0,z0,U
σ(x(θ)−
0,x0,z0
). Из (13.24) и (13.25) следует, что
e
, Δ) =
e
θ
g(t, x(t),p(t), (t))dt z0=Val(t0,x0),
t
0
,U
, Δ).
e
гарантирует для игрока P
e
зависит не только
e
)=
0

13. СТАБИЛЬНЫЕ МОСТЫ И ЭКСТРЕМАЛЬНЫЕ СТРАТЕГИИ 163
от переменных (t, x), но также и от переменной z, которая удовлетворяет
второму уравнению системы (13.22).
В заключение этого параграфа напомним известное преобразование
дифференциальной игры с платой (11.2) в дифференциальную игру с функционалом платы вида (13.18). Полагаем
где функции f
x := (x
f(·):=(f
(t, x, p, q) — это компоненты вектор-функции f(t, x, p,q),
i
,...,xn,x
1,x2
(·),f2(·),...,fn(·),g(·)),
1
n+1
),
стоящей в правой части уравнения (11.1), а g(t, x,p, q) — функция, проин-
тегрированная в функционале (11.2) относительно управляемого процесса.
Рассмотрим вспомогательную управляемую систему
dx(t)
=f(t, x(t),p(t),q(t)). (13.27)
dt
Введем следующий функционал платы
γ(x(·)) := σ(x(θ)) −x
(θ). (13.28)
n+1
Предполагаем, что траектории системы (13.27) подчинены начальному
условию x(t
Таким образом, вводя дополнительную фазовую переменную x
)=x0, x
0
)=0.Ясно,чтоγ(t0,x(·),p(·),q(·)) = γ(x(·)).
n+1(t0
n+1
(t),
получаем, что функционал платы в преобразованной дифференциальной
игре не содержит интегрального члена.
ПустьVal (t,x, x
(13.28). Пусть [0,θ]×R
) — функция цены дифференциальной игры (13.27),
n+1
n
(t, x) → u(t, x) ∈ R — это минимаксное решение
в задаче Коши (11.19). Как мы знаем, это решение существует, единственно
и совпадает со значением функции цены дифференциальной игры (11.1),
(11.2). Нетрудно показать, что
Val (t, x, x
)=Val(t, x) −x
n+1
= u(t,x) −x
n+1
n+1
.
Полагаем
W
:= {(t,x, x
c
и определим стратегиюU
множествуW
) ∈[0,θ] × Rn× R : u(t, x) − x
n+1
(t, x, x
0
. Для заданной начальной позиции (t0,x0, 0) эта страте-
c
), которая является экстремальной к
n+1
c = u(t0,x0)}
n+1
гия гарантирует игроку P оптимальный результат в дифференциальной

164 ГЛАВА III
игре (13.27), (13.28). Для начальный позиции (t0,x0) та же самая стратегия гарантирует игроку P оптимальный результат в дифференциальной
игре (11.1), (11.2).
Отметим, что для стратегииU
о текущих значениях переменной x
требуется дополнительная информация
0
. Эта информация не используется,
n+1
когда мы применяем субоптимальные стратегии, определенные в разделе 12.2.
14. Некоторые замечания
В данном параграфе приведено краткое описание нескольких различных концепций стратегий игроков и цены дифференциальной игры. Дано
сравнение постановок задач, используемых в теории дифференциальных
игр. Показано, почему необходимо рассматривать разрывные стратегии по
принципу обратной связи и использовать пошаговые процедуры управления. Обсуждается также проблема устойчивости позиционных стратегий,
и описываются процедуры управления с поводырем, которые порождают
решения, устойчивые к информационным шумам.
14.1. Многошаговые аппроксимации
Первое строгое определение цены дифференциальной игры было введено У. Х.Флемингом (см., например, [75, 76]). Его подход был основан
на аппроксимации дифференциальной игры некоторыми многошаговыми
играми. Далее кратко описаны эти конструкции.
Рассмотрим дифференциальную игру вида (11.1), (11.2). Пусть x
) — начальное состояние управляемой системы в начальный момент
= x(t
0
времени t
. Интервал времени [t0,θ] разбит множеством точек
0
=
0
t
= t0+ iδk,δk=(θ −t0)2−k,i∈ 0,m, m=2k.
i
Многошаговая аппроксимация вводится следующим образом. Управляемая
система (11.1) и функционал платы (11.2) заменяются их конечно-разностными приближениями
)=x(ti)+f(ti,x(ti),pi,qi)δk,i=0, 1,...,m− 1,
x(t
i+1
m−1
γ(t
0,x0,p0,q0
,...,p
m−1,qm−1
)=σ(x(θ)) −δ
Игроки P и Q выбирают управления p
∈ P и qi∈ Q соответственно. Иг-
i
g(ti,x(ti),pi,qi).
k
i=0
рок P стремится минимизировать плату, а игрок Q хочет максимизировать

14. НЕКОТОРЫЕ ЗАМЕЧАНИЯ 165
ее. У. Х.Флеминг рассмотрел два типа аппроксимаций, а именно, мажорантную и минорантную многошаговые игры.
В мажорантной игре игрок P вмоментвремениt
позицию (t
. Игрок Q также знает начальную позицию (t0,x0),помимоэтого
ние p
0
он/она в момент времени t
). Зная эту информацию, игрок P выбирает свое управле-
0,x0
знает управление p0выбранноеего/еепротив-
0
ником. Используя эту информацию, игрок Q выбирает управление q
Вмоментвремениt
о текущей позиции (t
предыдущих позициях (t
биравшихся до текущего момента времени t
(i ∈ 1,m−1) игрок P получает информацию
i
,x(ti)), он/она имеет также полную информацию о
i
,x(tj)) и управлениях (pj,qj)(j ∈ 0,i−1),вы-
j
этим игроком и противником.
i
Используя эту информацию, игрок P выбирает управление p
знает начальную
0
0
∈ P .Вдо-
i
∈ Q.
полнение к информации, доступной игроку P , игрок Q вмоментвремениt
знает управление piвыбранное противником. Опираясь на эту информацию,
игрок Q выбирает управление q
рующий игрок имеет информационное преимущество.
Естественным путем определения цены Val
. Поэтому в мажорантной игре максимизи-
i
+
(t0,x0) мажорантной
Δ
k
игры на разбиении
Δ
= {ti= t0+ iδk: i =0, 1,...,m =2k}
k
является следующий. Эта величина задается формулой
+
(t0,x0):= min
Val
Δ
k
p
m−1
max
q
m−1
···min
p
0
max
γ(t0,x0,p0,q0,...,p
q
0
m−1,qm−1
),
i
где min
берется по pi, изменяющимся в P ,аmax
p
i
берется по qi,изменяю-
q
i
щимся в Q.
Точно так же можно рассматривать минорантную игру, в который минимизирующий игрок P имеет информационное преимущество. Цена в минорантной игре задается формулой
−
(t0,x0):=max
Val
Δ
k
Ясно, что Val
lim
Val
k→∞
то величина Va l
+
Δ
k
Fl(t0,x0
min
p
m−1
···max
k→∞
q
m−1
+
(t0,x0) Val
Δ
k
(t0,x0) = lim
) называется ценой дифференциальной игры в
min
q
Val
γ(t0,x0,p0,q0,...,p
p
0
0
−
(t0,x0).Если
Δ
k
−
(t0,x0)=ValFl(t0,x0), (14.1)
Δ
k
m−1,qm−1
).
смысле Флеминга.
Подход, основанный на многошаговых приближениях, был развит и
расширен в ряде работ (см., например, [83, 166, 220]) для различных типов

166 ГЛАВА III
дифференциальных игр. В рамках этого подхода, модификации определения
цены дифференциальной игры базировались на соотношениях вида (14.1).
При этом рассматривались управляемые системы общего вида и различные
типы функционалов платы. Исследовались мажорантные и миноратные игры, в которых игроки принимают свои решения в дискретные моменты
времени t
и выбирают кусочно-программные управления. Отметим, что,
i
в отличие от первых работ [75, 76] (имевших дело с конечно-разностной
динамикой в мажорантных и минорантных играх), в последующих работах
исследовались, главным образом, многошаговые игры, динамика которых
описывается дифференциальными уравнениями.
Отметим, что в случаях, когда обе величины: цена в смысле Флеминга Va l
(14.1) и цена Val (11.18) позиционной дифференциальной игры,
Fl
определенная в параграфе 11, существуют, — они совпадают, т.е. справедливо равенство
Val (t
)=ValFl(t0,x0). (14.2)
0,x0
Аппроксимирующие многошаговые игры фактически имеют дискретную природу, и стратегии игроков определяются только для выбранного
разбиения Δ интервала времени. Дискретно-временной характер многошаговых моделей затрудняет применение аппарата математического анализа.
Важное отличие формализации позиционных дифференциальных игр
состоит в том, что стратегии определены, как функции U(t, x) и V (t,x),
которые не зависят от разбиений, выбираемых игроками. Исследования позиционных дифференциальная игр базируются на различных результатах
выпуклого, негладкого, и многозначного анализа. Как было продемонстрировано выше, эта теория близко связана с теорией обобщенных решений
УЧП первого порядка. Доказательство существования цены и седловой точки дифференциальной игры не является единственной целью этой теории.
Много внимания уделяется конструктивным методам вычисления функции
цены и субоптимальных стратегий по принципу обратной связи. Этот подход весьма удобен и для того, чтобы связать вместе различные абстрактные
модели и практически реализуемые конструкции управлений.
Следует упомянуть, что в 60–70-е (когда были сформированы основные направления исследований в области теории дифференциальных игр),
исследования, выполненные Л.С. Понтрягиным и Б. Н. Пшеничным, были
определяющими для развития этой теории. Л. С. Понтрягин предложил прямой метод и метод альтернированного интеграла для решения задач преследования. Он разработал также оригинальную теорию задач уклонения.
Эти и другие результаты, полученные Л.С.Понтрягиным и его коллегами,
представлены в недавнем обзоре [155]. Б. Н.Пшеничный разработал операторные конструкции для определения цены дифференциальной игры. Он
получил явные решения для ряда интересных задач преследования и уклонения. В своих исследованиях Б.Н. Пшеничный разработал новые подходы,

14. НЕКОТОРЫЕ ЗАМЕЧАНИЯ 167
основанные на методах выпуклого анализа и негладкой оптимизации (см.,
например, [174, 176, 177]).
14.2. Квазиcтратегии
Во многих работах, имеющих дело с дифференциальными играми, используется следующее определение стратегии.
Пусть P и Q— множества всех измеримых функций [0,θ] t →p(t) ∈P
и [0,θ] t → q(t) ∈ Q соответственно. Отображение
α: Q →P (14.3)
называется квазистратегией игрока P , если оно является неупреждающим,
т. е.
(q
(t)=q2(t), для почти всех t ∈ [0,τ]) ⇒
1
(t)=p2(t), для почти всех t ∈ [0,τ]),
⇒ (p
1
где p
(·)=α(qi(·)), i =1, 2. Аналогично, отображение β : P →Qна-
i
зывается квазистратегией игрока Q, если оно является неупреждающим.
Наиболее вероятно, что такое понятие стратегий берет начало из работ
С. Р. Нардзевского [153].
Обозначим множество всех неупреждающих отображений α вида (14.3)
символом A. Множество всех квазиcтратегий игрока Q обозначим символом B.
Цена дифференциальной игры в классе квазиcтратегий определяется
следующим образом. Пусть S(t
,α) —этомножествовсехтакихтроек
0,x0
(x(·),p(·),q(·)),чтоq(·) ∈Q, p(·)=α(q(·)), x(·) — решения уравнения
˙x(t)=f (t, x(t),p(t),q(t)),
удовлетворяющие условию x(t
)=x0.МножествоS(t0,x0,β) определяет-
0
ся аналогично. Пусть
Γ
1(t0,x0
Γ
,α):=supγ(t0,S(t0,x0,α)),
∗
Γ
(t0,x0):= inf
1
2(t0,x0
,β):=infγ(t0,S(t0,x0,β)),
∗
Γ
(t0,x0):=sup
2
Γ1(t0,x0,α),
α∈A
Γ2(t0,x0,β).
β∈B
Если имеет место равенство
∗
Γ
(t0,x0)=Γ
1
∗
(t0,x0):=Val∗(t0,x0), (14.4)
2
то игра, рассматриваемая в классе квазиcтратегий игроков P и Q, имеет
цену, равную Val
∗(t0,x0
).

168 ГЛАВА III
Р.Дж. Эллиотт и Н. Дж. Калтон доказали существование цены Val∗для
широкого класса дифференциальная игр (см., например, [67, 66]). В частности, известно, что при выполнении условий (A1)– (A3), сформулированных
в разделе 11.1, существует цена Val
дифференциальной игры (11.1), (11.2)
∗
в классе квазиcтратегий.
Квазиcтратегии являются инструментом, популярным при изучении
свойств функции цены. Дифференциальные игры в рамках этой формализации были исследованы во многих работах. Как показано в ряде статей,
функция цены Val
совпадает с вязкостным решением соответствующего
∗
уравнения Айзекса – Беллмана (см., например, [70]).
Обратим внимание, что в случае, когда существуют обе цены: цена Val (11.18) в классе позиционных стратегий и цена Val
в классе ква-
∗
зиcтратегий, — они совпадают, и справедливо
Val (t
)=Val∗(t0,x0). (14.5)
0,x0
Рассмотрим частный случай квазиcтратегий, которые определяются с
помощью измеримых по Борелю функций U :[0,θ] × Q → P и V :[0,θ]×
×P → Q. Эти функции U и V называются контруправлениями. Заметим,
что они также называются стробоскопическими (stroboscopic) стратегиями
(см., например, [88]).
Пусть U :[0,θ] × Q → P — контруправление игрока P .Введемопера-
тор α, отображающий функции q(·) ∈Qв функции [0,θ] t → p(t)=
= U(t, q(t)) ∈ P . Этот оператор является квазистратегией. Действи-
тельно, так как функция U измерима по Борелю, то для любой измеримой по Лебегу функции q(·): [0,θ] → Q, соответствующая функция
p(·)=α(q(·)) — измерима [101]. Ясно, что отображение α является неупре-
ждающим. Аналогично, любое контруправление V представляет собой ква-
зистратегию
β : P →Q.
Отметим, что произвольная пара квазистратегий α и β может оказаться
несовместной. Пусть, например, P = Q =[−1, 1],
α(q(·))(t)=−sign (q(t)),
β(p(·))(t)=sign(p(t)).
В этом случае нет никаких управлений p(t) и q(t), удовлетворяющих системе равенств
p(t)=α(q(·))(t),q(t)=β(p(·))(t).
Так как квазиуправления представляют собой специфический тип квазиcтратегий, заключаем, что, вообще говоря, невозможно определить дифференциальную игру в так называемой нормальной форме на прямом произведении A × B множеств квазиcтратегий игроков P и Q.Следуеттакже упомянуть, что квазиcтратегии неприменимы в физически реализуемых

14. НЕКОТОРЫЕ ЗАМЕЧАНИЯ 169
конструкциях, потому что управление p(t)=α(q(·))(t) определяется в зависимости от помехи (или управления противника) q(·), реализовавшейся
до текущего времени t, но фактически эта информация недоступна.
14.3. Непрерывные позиционные стратегии
Ясно, что при математических постановках позиционных дифференциальных игр было бы желательным сузить класс стратегий и рассматривать
только непрерывные функции, если это возможно. В этом случае не нужно вводить пошаговые процедуры управления с кусочно-постоянными реализациями управлений вида (11.7) и предельные процедуры (11.14). Итак
объясним необходимость введения разрывных позиционных стратегий. Рассмотрим пример, в котором оптимальный результат не только недостижим в
классе непрерывных стратегий по принципу обратной связи, но и не может
быть аппроксимирован этими стратегиями (последнее является наиболее
важным).
П
РИМЕР. Пусть движение фазовой точки x(t) ∈ R
2
описывается урав-
нением
˙x(t)=p(t)+(2− t)q(t), 0=t
ипустьx
ный момент времени t
и Q, соответственно, которые удовлетворяют ограничениям p(t) ∈ P = B
и q(t) ∈ Q = B,гдеB = {y ∈ R
= 0 ∈ R2— начальное состояние в фиксированный началь-
0
=0.Здесьp(t) и q(t) — управления игроков P
0
2
: y 1}. Игрок P (игрок Q) желает
t θ =2,
0
минимизировать (максимизировать) плату
γ(x(·),p(·),q(·)) := −x(θ).
Пусть [0, 2] × R
2
(t, x) → U(t, x) ∈ B — непрерывная функция,
удовлетворяющая условию Липшица по x. Выберем точку q ∈ Q = B,и
рассмотрим уравнение
t
x(t)=
[U(τ,x(τ)) + (2 −τ )q]dτ.
0
Это уравнение имеет единственное решение, которое обозначим символом x(·,q). Полагаем
2
1
U(τ,x(τ))dτ, q ∈ B.
2
0
y(q):=
x(2,q)
2
− q =

170 ГЛАВА III
Отметим, что функция y(q) непрерывна и удовлетворяет оценке y(q) 1,
∀q ∈ B. Таким образом, получаем, что непрерывная функция q → y(q) отоб-
ражает шар B на себя. Согласно известной теореме Брауэра (см., например,
[225]), заключаем, что существует такая точка q
следовательно, x(2,q
Обозначим символом S
)=0.
∗
(U) множество всех троек (x(·),p(·),q(·)),где
c
∈ B,чтоq∗= y(q∗),и,
∗
q(·): [0, 2] → B — произвольная измеримая функция,
t
p(t)=U(t, x(t)),x(t)=
[p(τ)+(2− τ)q(τ )]dτ.
0
Из вышеизложенного следует, что
c
Γ
(U):=supγ(Sc(U)) = 0. (14.6)
1
Напомним, что здесь γ(x(·),p(·),q(·)) := −x(2).
В рассматриваемом случае предполагалось, что функция U(t, x) непрерывна и удовлетворяет условию Липшица по x. Можно показать, что равенство (14.6) остается справедливым для любой непрерывной функции U ,
т. е. условие Липшица может быть опущено. Можно заметить также, что
Γ
(U, Δ) = 0 для любой непрерывной стратегии U и для любого разбие-
1
ния Δ.ЗдесьΓ
(U, Δ) — результат, гарантированный пошаговой процедурой
1
управления (U, Δ) (см. (11.8)).
Теперь рассмотрим разрывную позиционную стратегию
U
(x)=
∗
−1
xx
,x=0,
(1, 0),x=0.
(14.7)
Заметим, что при x =0в качестве значения U
(x) может быть выбран
∗
любой единичный вектор. Покажем, что
1
, (14.8)
2
где Γ
)=−
Γ
1(U∗
) — результат, гарантированный стратегией U∗(напомним, что эта
1(U∗
величина определяется согласно (11.8), (11.14)).
Пусть выбрано разбиение Δ:={0=t
Рассмотрим тройки (x(·),p(·),q(·)) ∈ S(U
<t1< ··· <t
0
, Δ).Здесьq(·): [0, 2] → B —
∗
m+1
=2}.
измеримая функция, траектория x(·) удовлетворяет начальному условию x(0) = 0 и уравнению
˙x(t)=p(t)+(2− t)q(t),
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
