Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Обобщенные решения уравнений в частных производных первого порядка. Перспективы динамической оптимизации

.pdf
Скачиваний:
0
Добавлен:
07.09.2026
Размер:
2 Мб
Скачать
☆
13. СТАБИЛЬНЫЕ МОСТЫ И ЭКСТРЕМАЛЬНЫЕ СТРАТЕГИИ 161
то множество Wявляется стабильным мостом для управляемой системы
˙x(t)=f (t, x(t),p(t),q(t)), ˙z(t)=g(t, x(t),p(t),q(t)). (13.22)
Рассмотрим задачу M
-сближения для этой системы, где
:= epiσ = {(x, z) ∈Rn× R : z σ(x).
M
Применяя конструкции, описанные в разделе 13.2, определим для иг­рока P стратегию, которая является экстремальной к множеству W
Для (t, x,z) ∈ [0,θ] × R
W
(t):={(w, y) ∈ Rn× R :(t,w, y) ∈W},
(t, x, z):=Arg min
W
e
(t, x, z):={ (se,ζe)=(we− x, ye− z): (we,ye) ∈ W
S
e
Выберем произвольно (s
(t, x, z) ∈ Arg max
U
e
Пусть задана начальная позиция (t =Val(t
).ОбозначимсимволомX(t0,x0,z0,U
0,x0
лютно непрерывных функций (x(·),z(·)) : [t творяют начальному условию (x(t
n
× R полагаем
(w,y)∈W(t)
) ∈ S
e,ζe
min
p∈P
q∈Q
(t, x, z) и
e
x −w
2
+(z −y)
2
,
(t, x, z)}.
e
se,f(t,x, p, q)−ζeg(t, x,p, q).
) ∈ [0,θ] × Rnипустьz0=
0,x0
,θ] → Rn×R, которые удовле-
),z(t0)) = (x0,z0) и дифференциально-
0
0
, Δ) множество абсо-
e
му включению
(˙x(t), ˙z(t)) ∈ co {(f(t,x(t),p(t),q),g(t, x(t),p(t),q): q ∈ Q},
где
p(t)=U
(ti,x(ti),z(ti)),ti t<t
e
,i=0,1,...,m. (13.23)
i+1
Далее, определим (см. подобную конструкцию в (13.14))
(t0,x0,z0,U
X
) := lim sup
e
diam Δ↓0
X(t0,x0,z0,U
, Δ). (13.24)
e
.
Равенство z как множество W
тегия U
обеспечивает движение системы внутри множества W,и,поэтому,
e
=Val(t0,x0) подразумевает, что (t0,x0,z0) ∈ W.Так
0
является стабильным мостом для системы (13.22), стра-
гарантирует выполнение условия
(x(θ),z(θ)) ∈ W
для любых (x(·),z(·)) ∈ X
(t0,x0,z0,U
(θ)=M
).
e
(13.25)
162 ГЛАВА III
Последнее утверждение фактически следует из теоремы 13.3. Обратим внимание, что теорема 13.3 была доказана в предположении, что выполня­ется (13.3). Для рассматриваемой здесь системы (13.22) имеем
H
(t, x, s, ζ):=min
=max
q∈Q
для ζ>0 и для любого s ∈ R
max
p∈P
min
[s, f (t, x,p, q)−ζg(t, x, p, q)] = ζH(t, x, s/ζ ) (13.26)
p∈P
[s, f (t, x,p, q)−ζg(t, x, p, q)] =
q∈Q
n
. Здесь минимакс равен максимину в силу условия (11.5). Переходя к пределу при ζ ↓ 0, получаем, что это равенство справедливо и для ζ =0. Условие (13.26) может быть нарушено для ζ<0. Однако, для конструкции, предложенной здесь, достаточно, чтобы гамиль­тониан H
чание, отметим, что множество W
(w, y) ∈ W
для каждой точки (we,ye) ∈ W
(t, x, s, ζ) был определен для ζ 0. Чтобы подтвердить это заме-
(t),то(w,y + r) ∈ W(t) для любого r 0. Следовательно,
− x2+(ye− z)2 we− x2+(ye+ r −z)
w
e
обладает следующим свойством: если
2
(t, x, z).Следовательно,2r(ye−z)+r2 0.
e
Так как последнее неравенство справедливо для любого r 0,приходим к оценке ζ
ясь к доказательству теоремы 13.3, заключаем, что стратегия U рождаемые ею движения системы внутри множества W
включение (13.25).
Обозначим символом S(t
(t, x, z):=ye− z 0. Используя это неравенство и обраща-
e
,U
0,x0,z0
, Δ) все тройки (x(·),p(·),q(·)),
e
ведет по-
e
и обеспечивает
где p(·) — управление, сформированное в соответствии с правилом (13.23),
q(·): [t
торая удовлетворяет первому уравнению системы (13.22) и условию x(t = x любых (x(·),z(·)) ∈ X
= lim sup
где (x(·),p(·),q(·)) ∈ S(t
оптимальный результат. Заметим, что, в отличие от субоптимальной стра­тегии U
,θ] → Q — произвольная измеримая функция, x(·) — траектория, ко-
0
. По определению множества M=epiσ, имеем z(θ) σ(θ) для
0
lim sup
diam Δ↓0
sup γ(t0, S(t0,x0,z0,U
sup
diam Δ↓0
(x(·),p(·),q(·))
Таким образом, получили, что стратегия U
, определенной в параграфе 12, стратегия U
ε
(t0,x0,z0,U
σ(x(θ)−
0,x0,z0
). Из (13.24) и (13.25) следует, что
e
, Δ) =
e
θ
g(t, x(t),p(t), (t))dt z0=Val(t0,x0),
t
0
,U
, Δ).
e
гарантирует для игрока P
e
зависит не только
e
)=
0
13. СТАБИЛЬНЫЕ МОСТЫ И ЭКСТРЕМАЛЬНЫЕ СТРАТЕГИИ 163
от переменных (t, x), но также и от переменной z, которая удовлетворяет второму уравнению системы (13.22).
В заключение этого параграфа напомним известное преобразование дифференциальной игры с платой (11.2) в дифференциальную игру с функ­ционалом платы вида (13.18). Полагаем
где функции f
x := (x
f(·):=(f
(t, x, p, q) — это компоненты вектор-функции f(t, x, p,q),
i
,...,xn,x
1,x2
(·),f2(·),...,fn(·),g(·)),
1
n+1
),
стоящей в правой части уравнения (11.1), а g(t, x,p, q) — функция, проин- тегрированная в функционале (11.2) относительно управляемого процесса. Рассмотрим вспомогательную управляемую систему
dx(t)
=f(t, x(t),p(t),q(t)). (13.27)
dt
Введем следующий функционал платы
γ(x(·)) := σ(x(θ)) −x
(θ). (13.28)
n+1
Предполагаем, что траектории системы (13.27) подчинены начальному условию x(t
Таким образом, вводя дополнительную фазовую переменную x
)=x0, x
0
)=0.Ясно,чтоγ(t0,x(·),p(·),q(·)) = γ(x(·)).
n+1(t0
n+1
(t), получаем, что функционал платы в преобразованной дифференциальной игре не содержит интегрального члена.
ПустьVal (t,x, x
(13.28). Пусть [0,θ]×R
) — функция цены дифференциальной игры (13.27),
n+1
n
(t, x) → u(t, x) ∈ R — это минимаксное решение в задаче Коши (11.19). Как мы знаем, это решение существует, единственно и совпадает со значением функции цены дифференциальной игры (11.1), (11.2). Нетрудно показать, что
Val (t, x, x
)=Val(t, x) −x
n+1
= u(t,x) −x
n+1
n+1
.
Полагаем
W
:= {(t,x, x
c
и определим стратегиюU множествуW
) ∈[0,θ] × Rn× R : u(t, x) − x
n+1
(t, x, x
0
. Для заданной начальной позиции (t0,x0, 0) эта страте-
c
), которая является экстремальной к
n+1
c = u(t0,x0)}
n+1
гия гарантирует игроку P оптимальный результат в дифференциальной
164 ГЛАВА III
игре (13.27), (13.28). Для начальный позиции (t0,x0) та же самая стра­тегия гарантирует игроку P оптимальный результат в дифференциальной игре (11.1), (11.2).
Отметим, что для стратегииU
о текущих значениях переменной x
требуется дополнительная информация
0
. Эта информация не используется,
n+1
когда мы применяем субоптимальные стратегии, определенные в разде­ле 12.2.
14. Некоторые замечания
В данном параграфе приведено краткое описание нескольких различ­ных концепций стратегий игроков и цены дифференциальной игры. Дано сравнение постановок задач, используемых в теории дифференциальных игр. Показано, почему необходимо рассматривать разрывные стратегии по принципу обратной связи и использовать пошаговые процедуры управле­ния. Обсуждается также проблема устойчивости позиционных стратегий, и описываются процедуры управления с поводырем, которые порождают решения, устойчивые к информационным шумам.
14.1. Многошаговые аппроксимации
Первое строгое определение цены дифференциальной игры было вве­дено У. Х.Флемингом (см., например, [75, 76]). Его подход был основан на аппроксимации дифференциальной игры некоторыми многошаговыми играми. Далее кратко описаны эти конструкции.
Рассмотрим дифференциальную игру вида (11.1), (11.2). Пусть x
) — начальное состояние управляемой системы в начальный момент
= x(t
0
времени t
. Интервал времени [t0,θ] разбит множеством точек
0
=
0
t
= t0+ iδk,δk=(θ −t0)2−k,i∈ 0,m, m=2k.
i
Многошаговая аппроксимация вводится следующим образом. Управляемая система (11.1) и функционал платы (11.2) заменяются их конечно-разност­ными приближениями
)=x(ti)+f(ti,x(ti),pi,qi)δk,i=0, 1,...,m− 1,
x(t
i+1
m−1
γ(t
0,x0,p0,q0
,...,p
m−1,qm−1
)=σ(x(θ)) −δ
Игроки P и Q выбирают управления p
∈ P и qi∈ Q соответственно. Иг-
i
g(ti,x(ti),pi,qi).
k
i=0
рок P стремится минимизировать плату, а игрок Q хочет максимизировать
14. НЕКОТОРЫЕ ЗАМЕЧАНИЯ 165
ее. У. Х.Флеминг рассмотрел два типа аппроксимаций, а именно, мажорант­ную и минорантную многошаговые игры.
В мажорантной игре игрок P вмоментвремениt позицию (t
. Игрок Q также знает начальную позицию (t0,x0),помимоэтого
ние p
0
он/она в момент времени t
). Зная эту информацию, игрок P выбирает свое управле-
0,x0
знает управление p0выбранноеего/еепротив-
0
ником. Используя эту информацию, игрок Q выбирает управление q
Вмоментвремениt о текущей позиции (t
предыдущих позициях (t биравшихся до текущего момента времени t
(i ∈ 1,m−1) игрок P получает информацию
i
,x(ti)), он/она имеет также полную информацию о
i
,x(tj)) и управлениях (pj,qj)(j ∈ 0,i−1),вы-
j
этим игроком и противником.
i
Используя эту информацию, игрок P выбирает управление p
знает начальную
0
0
∈ P .Вдо-
i
∈ Q.
полнение к информации, доступной игроку P , игрок Q вмоментвремениt знает управление piвыбранное противником. Опираясь на эту информацию, игрок Q выбирает управление q рующий игрок имеет информационное преимущество.
Естественным путем определения цены Val
. Поэтому в мажорантной игре максимизи-
i
+
(t0,x0) мажорантной
Δ
k
игры на разбиении
Δ
= {ti= t0+ iδk: i =0, 1,...,m =2k}
k
является следующий. Эта величина задается формулой
+
(t0,x0):= min
Val
Δ
k
p
m−1
max
q
m−1
···min
p
0
max
γ(t0,x0,p0,q0,...,p
q
0
m−1,qm−1
),
i
где min
берется по pi, изменяющимся в P ,аmax
p
i
берется по qi,изменяю-
q
i
щимся в Q.
Точно так же можно рассматривать минорантную игру, в который ми­нимизирующий игрок P имеет информационное преимущество. Цена в ми­норантной игре задается формулой
−
(t0,x0):=max
Val
Δ
k
Ясно, что Val
lim
Val
k→∞
то величина Va l
+ Δ
k
Fl(t0,x0
min
p
m−1
···max
k→∞
q
m−1
+
(t0,x0) Val
Δ
k
(t0,x0) = lim
) называется ценой дифференциальной игры в
min
q
Val
γ(t0,x0,p0,q0,...,p
p
0
0
−
(t0,x0).Если
Δ
k
−
(t0,x0)=ValFl(t0,x0), (14.1)
Δ
k
m−1,qm−1
).
смысле Флеминга.
Подход, основанный на многошаговых приближениях, был развит и расширен в ряде работ (см., например, [83, 166, 220]) для различных типов
166 ГЛАВА III
дифференциальных игр. В рамках этого подхода, модификации определения цены дифференциальной игры базировались на соотношениях вида (14.1). При этом рассматривались управляемые системы общего вида и различные типы функционалов платы. Исследовались мажорантные и миноратные иг­ры, в которых игроки принимают свои решения в дискретные моменты времени t
и выбирают кусочно-программные управления. Отметим, что,
i
в отличие от первых работ [75, 76] (имевших дело с конечно-разностной динамикой в мажорантных и минорантных играх), в последующих работах исследовались, главным образом, многошаговые игры, динамика которых описывается дифференциальными уравнениями.
Отметим, что в случаях, когда обе величины: цена в смысле Флемин­га Va l
(14.1) и цена Val (11.18) позиционной дифференциальной игры,
Fl
определенная в параграфе 11, существуют, — они совпадают, т.е. справед­ливо равенство
Val (t
)=ValFl(t0,x0). (14.2)
0,x0
Аппроксимирующие многошаговые игры фактически имеют дискрет­ную природу, и стратегии игроков определяются только для выбранного разбиения Δ интервала времени. Дискретно-временной характер многоша­говых моделей затрудняет применение аппарата математического анализа.
Важное отличие формализации позиционных дифференциальных игр состоит в том, что стратегии определены, как функции U(t, x) и V (t,x), которые не зависят от разбиений, выбираемых игроками. Исследования по­зиционных дифференциальная игр базируются на различных результатах выпуклого, негладкого, и многозначного анализа. Как было продемонстри­ровано выше, эта теория близко связана с теорией обобщенных решений УЧП первого порядка. Доказательство существования цены и седловой точ­ки дифференциальной игры не является единственной целью этой теории. Много внимания уделяется конструктивным методам вычисления функции цены и субоптимальных стратегий по принципу обратной связи. Этот под­ход весьма удобен и для того, чтобы связать вместе различные абстрактные модели и практически реализуемые конструкции управлений.
Следует упомянуть, что в 60–70-е (когда были сформированы основ­ные направления исследований в области теории дифференциальных игр), исследования, выполненные Л.С. Понтрягиным и Б. Н. Пшеничным, были определяющими для развития этой теории. Л. С. Понтрягин предложил пря­мой метод и метод альтернированного интеграла для решения задач пре­следования. Он разработал также оригинальную теорию задач уклонения. Эти и другие результаты, полученные Л.С.Понтрягиным и его коллегами, представлены в недавнем обзоре [155]. Б. Н.Пшеничный разработал опе­раторные конструкции для определения цены дифференциальной игры. Он получил явные решения для ряда интересных задач преследования и укло­нения. В своих исследованиях Б.Н. Пшеничный разработал новые подходы,
14. НЕКОТОРЫЕ ЗАМЕЧАНИЯ 167
основанные на методах выпуклого анализа и негладкой оптимизации (см., например, [174, 176, 177]).
14.2. Квазиcтратегии
Во многих работах, имеющих дело с дифференциальными играми, ис­пользуется следующее определение стратегии.
Пусть P и Q— множества всех измеримых функций [0,θ] t →p(t) ∈P и [0,θ] t → q(t) ∈ Q соответственно. Отображение
α: Q →P (14.3)
называется квазистратегией игрока P , если оно является неупреждающим, т. е.
(q
(t)=q2(t), для почти всех t ∈ [0,τ]) ⇒
1
(t)=p2(t), для почти всех t ∈ [0,τ]),
⇒ (p
1
где p
(·)=α(qi(·)), i =1, 2. Аналогично, отображение β : P →Qна-
i
зывается квазистратегией игрока Q, если оно является неупреждающим. Наиболее вероятно, что такое понятие стратегий берет начало из работ С. Р. Нардзевского [153].
Обозначим множество всех неупреждающих отображений α вида (14.3) символом A. Множество всех квазиcтратегий игрока Q обозначим симво­лом B.
Цена дифференциальной игры в классе квазиcтратегий определяется следующим образом. Пусть S(t
,α) —этомножествовсехтакихтроек
0,x0
(x(·),p(·),q(·)),чтоq(·) ∈Q, p(·)=α(q(·)), x(·) — решения уравнения
˙x(t)=f (t, x(t),p(t),q(t)),
удовлетворяющие условию x(t
)=x0.МножествоS(t0,x0,β) определяет-
0
ся аналогично. Пусть
Γ
1(t0,x0
Γ
,α):=supγ(t0,S(t0,x0,α)),
∗
Γ
(t0,x0):= inf
1
2(t0,x0
,β):=infγ(t0,S(t0,x0,β)),
∗
Γ
(t0,x0):=sup
2
Γ1(t0,x0,α),
α∈A
Γ2(t0,x0,β).
β∈B
Если имеет место равенство
∗
Γ
(t0,x0)=Γ
1
∗
(t0,x0):=Val∗(t0,x0), (14.4)
2
то игра, рассматриваемая в классе квазиcтратегий игроков P и Q, имеет цену, равную Val
∗(t0,x0
).
168 ГЛАВА III
Р.Дж. Эллиотт и Н. Дж. Калтон доказали существование цены Val∗для широкого класса дифференциальная игр (см., например, [67, 66]). В частно­сти, известно, что при выполнении условий (A1)– (A3), сформулированных в разделе 11.1, существует цена Val
дифференциальной игры (11.1), (11.2)
∗
в классе квазиcтратегий.
Квазиcтратегии являются инструментом, популярным при изучении свойств функции цены. Дифференциальные игры в рамках этой форма­лизации были исследованы во многих работах. Как показано в ряде статей, функция цены Val
совпадает с вязкостным решением соответствующего
∗
уравнения Айзекса – Беллмана (см., например, [70]).
Обратим внимание, что в случае, когда существуют обе цены: це­на Val (11.18) в классе позиционных стратегий и цена Val
в классе ква-
∗
зиcтратегий, — они совпадают, и справедливо
Val (t
)=Val∗(t0,x0). (14.5)
0,x0
Рассмотрим частный случай квазиcтратегий, которые определяются с помощью измеримых по Борелю функций U :[0,θ] × Q → P и V :[0,θ]× ×P → Q. Эти функции U и V называются контруправлениями. Заметим, что они также называются стробоскопическими (stroboscopic) стратегиями (см., например, [88]).
Пусть U :[0,θ] × Q → P — контруправление игрока P .Введемопера- тор α, отображающий функции q(·) ∈Qв функции [0,θ] t → p(t)= = U(t, q(t)) ∈ P . Этот оператор является квазистратегией. Действи- тельно, так как функция U измерима по Борелю, то для любой изме­римой по Лебегу функции q(·): [0,θ] → Q, соответствующая функция p(·)=α(q(·)) — измерима [101]. Ясно, что отображение α является неупре- ждающим. Аналогично, любое контруправление V представляет собой ква- зистратегию
β : P →Q.
Отметим, что произвольная пара квазистратегий α и β может оказаться несовместной. Пусть, например, P = Q =[−1, 1],
α(q(·))(t)=−sign (q(t)),
β(p(·))(t)=sign(p(t)).
В этом случае нет никаких управлений p(t) и q(t), удовлетворяющих систе­ме равенств
p(t)=α(q(·))(t),q(t)=β(p(·))(t).
Так как квазиуправления представляют собой специфический тип ква­зиcтратегий, заключаем, что, вообще говоря, невозможно определить диф­ференциальную игру в так называемой нормальной форме на прямом про­изведении A × B множеств квазиcтратегий игроков P и Q.Следуеттак­же упомянуть, что квазиcтратегии неприменимы в физически реализуемых
14. НЕКОТОРЫЕ ЗАМЕЧАНИЯ 169
конструкциях, потому что управление p(t)=α(q(·))(t) определяется в за­висимости от помехи (или управления противника) q(·), реализовавшейся до текущего времени t, но фактически эта информация недоступна.
14.3. Непрерывные позиционные стратегии
Ясно, что при математических постановках позиционных дифференци­альных игр было бы желательным сузить класс стратегий и рассматривать только непрерывные функции, если это возможно. В этом случае не нуж­но вводить пошаговые процедуры управления с кусочно-постоянными ре­ализациями управлений вида (11.7) и предельные процедуры (11.14). Итак объясним необходимость введения разрывных позиционных стратегий. Рас­смотрим пример, в котором оптимальный результат не только недостижим в классе непрерывных стратегий по принципу обратной связи, но и не может быть аппроксимирован этими стратегиями (последнее является наиболее важным).
П
РИМЕР. Пусть движение фазовой точки x(t) ∈ R
2
описывается урав-
нением
˙x(t)=p(t)+(2− t)q(t), 0=t
ипустьx ный момент времени t и Q, соответственно, которые удовлетворяют ограничениям p(t) ∈ P = B
и q(t) ∈ Q = B,гдеB = {y ∈ R
= 0 ∈ R2— начальное состояние в фиксированный началь-
0
=0.Здесьp(t) и q(t) — управления игроков P
0
2
: y1}. Игрок P (игрок Q) желает
t θ =2,
0
минимизировать (максимизировать) плату
γ(x(·),p(·),q(·)) := −x(θ).
Пусть [0, 2] × R
2
(t, x) → U(t, x) ∈ B — непрерывная функция, удовлетворяющая условию Липшица по x. Выберем точку q ∈ Q = B,и рассмотрим уравнение
t
x(t)=
[U(τ,x(τ)) + (2 −τ )q]dτ.
0
Это уравнение имеет единственное решение, которое обозначим симво­лом x(·,q). Полагаем
2
1
U(τ,x(τ))dτ, q ∈ B.
2
0
y(q):=
x(2,q)
2
− q =
170 ГЛАВА III
Отметим, что функция y(q) непрерывна и удовлетворяет оценке y(q) 1, ∀q ∈ B. Таким образом, получаем, что непрерывная функция q → y(q) отоб- ражает шар B на себя. Согласно известной теореме Брауэра (см., например, [225]), заключаем, что существует такая точка q следовательно, x(2,q
Обозначим символом S
)=0.
∗
(U) множество всех троек (x(·),p(·),q(·)),где
c
∈ B,чтоq∗= y(q∗),и,
∗
q(·): [0, 2] → B — произвольная измеримая функция,
t
p(t)=U(t, x(t)),x(t)=
[p(τ)+(2− τ)q(τ )]dτ.
0
Из вышеизложенного следует, что
c
Γ
(U):=supγ(Sc(U)) = 0. (14.6)
1
Напомним, что здесь γ(x(·),p(·),q(·)) := −x(2).
В рассматриваемом случае предполагалось, что функция U(t, x) непре­рывна и удовлетворяет условию Липшица по x. Можно показать, что ра­венство (14.6) остается справедливым для любой непрерывной функции U , т. е. условие Липшица может быть опущено. Можно заметить также, что
Γ
(U, Δ) = 0 для любой непрерывной стратегии U и для любого разбие-
1
ния Δ.ЗдесьΓ
(U, Δ) — результат, гарантированный пошаговой процедурой
1
управления (U, Δ) (см. (11.8)).
Теперь рассмотрим разрывную позиционную стратегию
U
(x)=
∗
−1
xx
,x=0,
(1, 0),x=0.
(14.7)
Заметим, что при x=0в качестве значения U
(x) может быть выбран
∗
любой единичный вектор. Покажем, что
1
, (14.8)
2
где Γ
)=−
Γ
1(U∗
) — результат, гарантированный стратегией U∗(напомним, что эта
1(U∗
величина определяется согласно (11.8), (11.14)).
Пусть выбрано разбиение Δ:={0=t Рассмотрим тройки (x(·),p(·),q(·)) ∈ S(U
<t1< ··· <t
0
, Δ).Здесьq(·): [0, 2] → B —
∗
m+1
=2}.
измеримая функция, траектория x(·) удовлетворяет начальному усло­вию x(0) = 0 и уравнению
˙x(t)=p(t)+(2− t)q(t),
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]