Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Обобщенные решения уравнений в частных производных первого порядка. Перспективы динамической оптимизации

.pdf
Скачиваний:
0
Добавлен:
07.09.2026
Размер:
2 Мб
Скачать
☆
15. СМЕШАННЫЕ ПОЗИЦИОННЫЕ СТРАТЕГИИ И КОНТРСТРАТЕГИИ 181
Предположим, что игрок P формирует своё управление согласно правилу
0
(t)=U(q(t)) = π sign (q(t)) −q(t), (15.5)
p
где q(t) — управление, выбранное игроком Q. В рассматриваемом случае игрок P знает управление q(t), выбранное противником в текущее время t, что делает допустимым вышеизложенный метод управления. Как следует из (15.3), (15.5), ˙x
(t)=−1 для любого допустимого управления игрока Q.
1
Следовательно,
γ(x(·)) = x
) −(θ −t0).
1(t0
Ясно также, что если игрок Q выбирает постоянное управление q(t)=
∈ [−π, π], то для любого допустимого управления игрока P выполня-
= q
∗
ется неравенство γ(x(·)) x Val
1(t0,x0
)=x1(t0) − (θ − t0),гдеVa l1(t0,x0) — цена рассматриваемой
) −(θ −t0). Таким образом получаем, что
1(t0
дифференциальной игры.
Второй тип дифференциальной игры будет рассмотрен чуть ниже. Сна­чала получим решение в случае, когда информационное преимущество име­ет игрок Q.
С
ЛУЧАЙ III. Определим функцию V (p)=−p (p ∈ P ). Полагаем, что
игрок Q формирует своё управление согласно правилу
0
q
(t)=V (p(t)) = −p(t). (15.6)
Такой метод управления допустим, так как игрок Q знает управление p(t), выбранное игроком P вмоментвремениt. Из (15.3), (15.4) и (15.6) получа­ем, что игрок Q может обеспечить выполнение равенства
γ(x(·)) = x
)+(θ −t0).
1(t0
С другой стороны, если игрок P выбирает любое постоянное управление, то для любого допустимого управления игрока Q, справедливо неравенство
γ(x(·)) x
где Val
3(t0,x0
)+(θ −t0). Следовательно, Val3(t0,x0)=x1(t0)+(θ −t0),
1(t0
) — цена дифференциальной игры (15.3), (15.4), в случае
информационной дискриминации игрока P.
Теперь вернемся к дифференциальной игре второго типа. Сначала рас­смотрим формальное решение этой игры в классе смешанных стратегий, а затем определим стохастическую процедуру, которая будет аппроксимиро­вать это решение.
С
ЛУЧАЙ II. Рассмотрим множества
P =rpm(P ),Q =rpm(Q).
182 ГЛАВА III
Напомним, что здесь P = Q =[−π, π],асимволrpm (S) обозначает множе- ство всех регулярных вероятностных мер, нормированных на множестве S.
В общем случае игроки P и Q могут выбирать смешанные управле- ния μ
и νtв зависимости от реализовавшейся позиции (t, x(t)). В частно-
t
сти, они могут использовать программные смешанные управления
,θ] t → μt∈P, [t0,θ] t → νt∈Q.
[t
0
Формально полагаем, что движения управляемой системы, порожденные программными смешанными управлениями, определяются обычными диф­ференциальными уравнениями
π
π
˙x
(t)=
1
˙x
(t)=
2
cos(p + q)μt(dp)νt(dq),
−π
−π
π
π
sin(p + q)μt(dp)νt(dq). (15.7)
−π
−π
Таким образом, рассматривается дифференциальная игра для уравне­ния (15.7) и функционала платы вида (15.4). В уравнении (15.7) управления
игроков P и Q удовлетворяют ограничениям μ
∈P и νt∈Q.Отметим,
t
что в рассматриваемом теперь случае, условие седловой точки в маленькой игре выполнено, т. е.
π
π
min
μ∈P
=max
max
ν∈Q
ν∈Q
(s1cos(p + q)+s2sin(p + q))μ(dp)ν(dq)=
−π
−π
π
π
min
μ∈P
(s1cos(p + q)+s2sin(p + q))μ(dp)ν(dq)=0. (15.8)
−π
−π
Легко проверить что дифференциальная игра (15.4), (15.7) имеет цену
Val
2(t0,x0
центрированная в двух точках p т. е. μ({p
ν({q
обеспечивает выполнение равенств ˙x управлении игрока Q. Таким же образом, выбирая ν равенство γ(x(·)) = x
)=x1(t0). Действительно, пусть μ0— вероятностная мера, скон-
= −π/2 и p2= π/2 с равными весами,
1
})=μ({p2})=1/2.Точнотакжепустьν0∈Q — такая мера, что
1
})=ν({q2})=1/2,гдеq1= −π/2, q2= π/2.Выбираяμ0, игрок P
1
). Отсюда получается, что Val2(t0,x0)=x1(t0).
1(t0
=0 и γ(x(·)) = x1(t0) при любом
1
, игрок Q обеспечивает
0
15. СМЕШАННЫЕ ПОЗИЦИОННЫЕ СТРАТЕГИИ И КОНТРСТРАТЕГИИ 183
Более того, как было показано, пара смешанных управлений (μ0,ν0) со­ставляет седловую точку.
Итак, вернемся к управляемой системе (15.3). Рассмотрим следующую процедуру управления этой системой. Пусть игрок P выбирает смешанное управление μ
, а игрок Q выбирает произвольное смешанное управление νt.
0
Обратим внимание, что чистое (не вероятностное) управление q(t) может рассматриваться как специфический случай смешанного управления ν
,ко-
t
торое сконцентрировано с вероятностью 1 в точке q(t). Пусть задано разби­ение Δ интервала времени [t игроки принимают решения и выбирают случайные управления p Случайное управление p ми, равными 1/2, в то время, как управление q тервала [−π, π] с вероятностью, определяемой с помощью меры ν отметить, что случайный выбор управлений p
,θ]. В каждый момент разбиения t = ti∈ Δ
0
принимает значения −π/2 и π/2 свероятностя-
i
принимает значения из ин-
i
и qiпроизводится взаимно
i
и qi.
i
.Важно
t
i
независимо. Согласно процедуре, описанной выше, получаем множество движений системы (15.3), на котором вероятностное распределение может быть определено естественным образом.
Можно показать, что для любого ε>0 существует такое число δ>0, что для любого разбиения Δ, удовлетворяющего diam Δ δ,идля любого случайного или детерминированного управления игрока Q,сто­хастическое управление игрока P обеспечивает выполнение неравенства
γ(x(·)) x
)+ε с вероятностью, не меньшей, чем 1 − ε.Аналогич-
1(t0
ным образом можно определить стохастическую процедуру управления для игрока Q, и получить, что она гарантирует оценку γ(x(·)) x
1(t0
) −ε с
вероятностью, сколь угодно близкой к единице.
Таким образом, стохастические процедуры управления, описанные вы­ше, приближают оптимальный результат, который был формально опреде­лен для дифференциальной игры (15.7), (15.4). Далее в разделе 15.4 бу­дут рассмотрены аппроксимационные свойства стохастических процедур управления для общего случая нелинейной дифференциальной игры. Заме­тим, что эти свойства являются следствием известного в теории вероятно­стей закона больших чисел. Подчеркнем еще раз, что использование сме­шанных стратегий и их приближений возможно только тогда, когда каждый из игроков выбирает управление независимо от управления, осуществляе­мого в данный момент времени его противником.
Таким образом, рассмотрены три типа дифференциальных игр с тремя вариантами распределения информации об управлениях, выбираемых иг­роками. Для этих дифференциальная игр определены их цены и получены следующие соотношения
Val
1(t0,x0
)=x1(t0) −(θ −t0) < Val2(t0,x0)=x1(t0) <
< Val
3(t0,x0
)=x1(t0)+(θ − t0),
184 ГЛАВА III
которые демонстрируют, что решения дифференциальная игр зависят от того, обладает или нет игрок дополнительной информацией об управлении, выбранном противником.
15.2. Смешанные позиционные стратегии
Обратимся теперь к формализации дифференциальной игры в классе смешанных стратегий по принципу обратной связи. Введем некоторые поня­тия и определения. Напомним, что символы rpm(P ) и rpm(Q) обозначают множества регулярных вероятностных мер, нормированных на компактных множествах P и Q, соответственно. Элементы множеств rpm(P) и rpm (Q) будут обозначаться буквами μ и ν.Пусть
(t, x, μ, ν) ∈ [0,θ] ×R
n
× rpm(P ) × rpm(Q).
Полагаем
f(t, x, μ, ν):=
f(t, x, p,q)μ(dp)ν(dq),
PQ
g(t, x, μ, ν):=
g(t, x,p, q)μ(dp)ν(dq). (15.9)
PQ
Справедливо
min
μ∈rpm (P )
=max
ν∈rpm (Q)
max
ν∈rpm (Q)
μ∈rpm (P )
s,f(t, x, μ, ν)−g(t, x, μ,ν)=
min
s,f(t, x, μ,ν)−g(t, x,μ, ν)=H(t, x, s). (15.10)
Отметим, что здесь можно использовать теорему о минимаксе (см., напри­мер, [98, 162]) и поменять местами операции min и max. ВеличинаH
называется гамильтонианом дифференциальной игры в классе смешанных позиционных стратегий.
Напомним, что функция [t
,θ] t → μt∈ rpm (P ) называется слабо
0
измеримой, если для любой непрерывной функции P p → h(p) ∈ R, функция
,θ] t →
[t
0
h(p)μt(dp) ∈ R
P
является измеримой (см., например, [225]). Аналогичным образом опреде­ляются слабо измеримые функции [t
,θ] t → νt∈ rpm (Q).
0
15. СМЕШАННЫЕ ПОЗИЦИОННЫЕ СТРАТЕГИИ И КОНТРСТРАТЕГИИ 185
Символами L([t0,θ], rpm(P )) и L([t0,θ], rpm(Q)) будут обозначать- ся множества всех слабо измеримых функций μ
и ν
:[t0,θ] → rpm(Q) соответственно. Для заданной начальной пози-
(·)
ции (t троек (x(·),μ
и x(·): [t
) ∈ [0,θ] × Rn,обозначимсимволомS(t0,x0) множество всех
0,x0
,θ] → Rn— абсолютно-непрерывные функции, удовлетворяющие
0
(·),ν(·)
),гдеμ
∈ L([t0,θ], rpm(P )), ν
(·)
:[t0,θ] → rpm (P )
(·)
∈ L([t0,θ], rpm(Q))
(·)
уравнению
) (15.11)
t,νt
и начальному условию x(t
˙x(t)=f(t, x(t),μ
)=x0. Функционал платы определен следую-
0
щим образом
θ
γ(t
,x(·),μ
0
(·),ν(·)
):=σ(x(θ)) −
g(t, x(t),μt,νt)dt. (15.12)
t
0
Функции
U :[0,θ] ×R
n
→ rpm (P ),V :[0,θ] × Rn→ rpm (Q)
называются смешанными позиционными стратегиями игроков P и Q соот­ветственно.
Будем требовать, чтобы эти функции были измеримы относитель­но x в следующем смысле. Пусть μ
=U(t, x) и ν
t,x
=V (t, x).Пред-
t,x
полагаем, что для любого t ∈ [0,θ] и для любых непрерывных функ- ций P p → ϕ(p) ∈ R, Q q → ψ(q) ∈ R, отображения
n
R
x →
P
ϕ(p)μ
(dp) ∈ R,
t,x
n
R
x →
Q
ψ(q)ν
(dq) ∈ R
t,x
измеримы по Борелю. Отметим, что это требование нужно для того, что­бы дать строгие определения вероятностным пространствам, порожденным стохастическими процедурами управления, которые аппроксимируют пози­ционные смешанные стратегии.
Пусть игрок P выбирает некоторую смешанную стратегию по прин­ципу обратной связиU и некоторое разбиение Δ интервала времени [t ПустьS(t
ν
∈ L([t0,θ], rpm(Q)) — произвольная слабо измеримая функция, а μ
(·)
,U,Δ) —множествотроек(x(·),μ
0,x0
) ∈S(t0,x0),где
(·),ν(·)
0
(·)
,θ].
—
186 ГЛАВА III
кусочно-постоянное смешанное управление игрока P, которое формируется согласно правилу
μ
=U(ti,x(ti)),ti t<t
t
,ti∈ Δ. (15.13)
i+1
По аналогии с в пунктом 11.2, где были введены показатели качества чистых стратегий по принципу обратной связи, определим показатель каче-
ства пошаговой процедуры управления (U,Δ), выбранной игроком P ,как величину
Γ
1(t0,x0
Следует отметить, что γ(t
,U,Δ) := supγ(t0,S(t0,x0,U,Δ)). (15.14)
,x(·),μ
0
) иΓ1(t0,x0,U,Δ) выглядят как
(·),ν(·)
детерминированные величины, которые не зависят от случайных событий. Пошаговая процедура управления, определенная здесь, основана на мате­матической идеализации, которая допускает, что значения управлений сме­шиваются мгновенно. Ниже в пункте 15.4 будет определена физически осу­ществимая аппроксимация смешанных стратегий, в которой смешивание значений управлений занимает какое-то время.
Далее, мы полагаем
Γ
1(t0,x0
,U) := lim sup
diam Δ↓0
Γ
1(t0,x0
,U,Δ). (15.15)
Оптимальный гарантированный результат в классе смешанных позицион­ных стратегий игрока P определен следующим образом
0
Γ
(t0,x0):=inf
1
U
Γ
1(t0,x0
,U). (15.16)
Аналогично, пусть (V,Δ) — пошаговая процедура управления, вы- бранная игроком Q.ЗдесьV — смешанная стратегия по принципу обратной
связи, Δ — разбиение интервала времени [t
,θ]. Качество этой процедуры
0
характеризуется величиной
Γ
2(t0,x0
,V,Δ) := inf γ(t0,S(t0,x0,V,Δ)). (15.17)
Оптимальный гарантированный результат в классе смешанных стратегий по принципу обратной связи для игрока Q определен как
0
Γ
(t0,x0):=sup
2
V
Γ
2(t0,x0
,V ), (15.18)
где
Γ
2(t0,x0
,V ) := lim inf
diam Δ↓0
Γ
2(t0,x0
,V,Δ). (15.19)
Справедливо следующее утверждение.
15. СМЕШАННЫЕ ПОЗИЦИОННЫЕ СТРАТЕГИИ И КОНТРСТРАТЕГИИ 187
15.3. Теорема
Пусть выполнены предположения (A1) и (A2) (см. раздел 11.1). То- гда существует цена дифференциальной игры (15.11), (15.12), рассмат- риваемой в классе позиционных смешанных стратегий, т. е. имеет место равенство
%
Val (t
0,x0
):=Γ
0
(t0,x0)=Γ
1
0
(t0,x0).
2
Функция цены%Val совпадает с минимаксным решением задачи Коши
∂u
+H(t,x, D
∂t
u)=0,u(θ, x)=σ(x), (15.20)
x
гдеH(t, x, s) — гамильтониан дифференциальной игры (15.11), (15.12), определенный равенством (15.10).
Доказательство этого утверждения приводится ниже, в пункте 15.7.
Отметим еще раз, что в этой теореме рассматривается идеализиро­ванное решение дифференциальной игры в классе смешанных стратегий по принципу обратной связи. Согласно этой идеализации, пошаговые дви­жения конструируются с помощью управлений, смешиваемых мгновенно; обычные управления p ∈ P и q ∈ Q заменены управлениями –мерами (обобщенными управлениями) μ ∈ rpm (P) и ν ∈ rpm (Q), а дифференци- альная игра (15.1), (15.2) заменена дифференциальной игрой (15.11), (15.12). Однако в реальной жизни управляемый объект, мгновенно смешивающий значения управления, невозможен. Итак, нужны физически осуществимые процедуры управления, которые аппроксимируют формальные решения.
15.4. Стохастические процедуры управления
Пусть игроки P ,иQ выбрали смешанные позиционные стратегииU иV . Пусть задано также разбиение Δ интервала времени [t
из моментов t = t случайных значений своих управлений p(t)=p(t
t
t<t
i
. Распределения этих постоянных управлений задаются веро-
i+1
ятностными мерами μ(dp)=U(t
∈ Δ игроки производят взаимно независимый выбор
i
,x(ti)), ν(dq)=V (ti,x(ti)).
i
) ∈ P , q(t)=q(ti) ∈ Q,
i
,θ].Вкаждый
0
Стохастическая процедура управления, определенная выше, будет обо­значаться символом SCP(U,V,Δ). Эта процедура порождает вероятност-
ное распределение кусочно-постоянных управлений p(·), q(·) и траекто­рий x(·) системы (15.1). Следующие утверждения являются следствием за­конов больших чисел, хорошо известных в теории вероятностей.
188 ГЛАВА III
Для любой парыU,V позиционных смешанных стратегий игроков P и Q и для любого положительного числа ε можно выбрать такое положи­тельное число δ>0, что для любой стохастической процедуры управле-
ния SCP(U,V,Δ), удовлетворяющей оценкам diam Δ δ, неравенства
Γ
2(t0,x0
,V ) −ε γ(t0,x(·),p(·),q(·)) Γ1(t0,x0,U)+ε
выполнены с вероятностью, не меньшей, чем 1 −ε.
ПустьU
иVα— α-оптимальные смешанные позиционные стратегии P
α
и Q,т.е.
Γ
1(t0,x0
Γ
2(t0,x0
,Uα) %Val (t0,x0)+α,
,Vα) %Val (t0,x0) −α.
Тогда для любого ε>0 существует такое число δ>0,чтодлялюбогораз­биения Δ, удовлетворяющего оценке diam Δ δ и для любой позиционной
смешанной стратегииV игрока Q, неравенство
γ(x(·),p(·),q(·)) %Val (t
0,x0
)+α + ε
выполняется с вероятностью, не меньшей, чем 1 − ε, где вероятностное распределение порождено процедурой SCP(U
,V,Δ).
α
Аналогично, для любого ε>0 можно найти такое число δ>0,чтодля любого разбиения Δ, удовлетворяющего условию diam Δ δ,идлялюбой
смешанной позиционной стратегииU игрока P , неравенство
γ(x(·),p(·),q(·)) %Val (t
0,x0
) −α − ε
выполняется с вероятностью, не меньшей, чем 1 − ε, где вероятностное распределение определяется процедурой SCP (U,V
, Δ).
α
Согласно этим утверждениям, рассмотренную выше математическую формализацию, качество которой оценивается величинами (15.14) – (15.19), и предполагающую идеальное, т. е. мгновенное смешивание значений управлений, можно аппроксимировать физически реализуемой процедурой, формирующей кусочно-постоянные случайные управления игроков. Еще раз подчеркнем важность того требования, что на каждом шаге t
∈ Δ в
i
рассматриваемой стохастической процедуре игроки выбирают свои случай­ные управления независимо в стохастическом смысле.
В случае, когда разбиения Δ
и Δ2, выбранные игроком P и игро-
1
ком Q, не совпадают, можно, как и выше, использовать предположение, что игрок P (игрок Q) выбирает случайное управление, независимое от теку­щего управления, выбранного противником. Это предположение особенно
15. СМЕШАННЫЕ ПОЗИЦИОННЫЕ СТРАТЕГИИ И КОНТРСТРАТЕГИИ 189
важно при наличии информационных погрешностей в измерениях текущих позиций. Строгие постановки и доказательства результатов относительно упомянутых здесь стохастические процедур, даны в [123, 124].
15.5. Контрcтратегии
Теперь рассмотрим постановку дифференциальной игры в случае I (см. пункт 15.1). Мы полагаем, что в текущий момент времени t игрок P знает управление q(t), выбранное игроком Q, в то время как игрок Q не знает управления p(t), реализованного игроком P . Предполагается также, что каждый из игроков знает реализовавшуюся позицию игры (t, x(t)).
Определим дифференциальную игру в классе контрcтратегий игрока P
вводятся следующим образом.
Пусть заданы функции
[0,θ] ×R
Полагаем, что для всех (t, x) ∈ [0,θ]×R измеримы по Борелю. Верхний индекс
n
× Q  (t, x,q) → Ucs(t, x, q) ∈ P.
n
функции Q q → Ucs(t, x, q) ∈ P
cs
используется здесь, чтобы отли-
чить контрcтратегии от позиционных стратегий (t, x) → U (t, x).
Пусть задана начальная позиция (t выбирает разбиение Δ интервала времени [t измеримая функция. В пошаговой процедуре управления контрстрате-
cs
гия U
где t
формирует управление игрока P согласно правилу
p(t)=U(t
∈ Δ. Как известно (см., например, [101]), функция t → p(t),
i
,x(ti),q(t)),ti t<t
i
) ∈ [0,θ) ×Rn, и пусть игрок P
0,x0
,θ].Пустьq(·) ∈ L([t0,θ],Q) —
0
,i∈ 0,m, (15.21)
i+1
определенная этим равенством, является измеримой, т. к. на каждом ин­тервале [t ции q → U
) эта функция является суперпозицией борелевской функ-
i,ti+1
cs
(ti,x(ti),q) и измеримой (в смысле Бореля или Лебега) функ-
ции t → q(t).
Напомним (cм. пункт 11.2), что символом S(t жество всех троек (x(·),p(·),q(·)),гдеp(·) ∈ L([t
x(·): [t
,θ] → Rn— абсолютно непрерывные функции, которые удовле-
0
творяют уравнению (15.1) и условию x(t лом S(t где q(·) ∈ L([t
,Ucs, Δ) множество всех троек (x(·),p(·),q(·)) ∈ S(t0,x0),
0,x0
,θ],Q) — произвольные измеримые управления игрока Q,
0
0
)=x0.Обозначимсимво-
0
а p(·) — управления игрока P , которые сформированы контрстратегией U согласно правилу (15.21).
Качество пошаговой процедуры управления (U
) обозначается мно-
0,x0
,θ],P), q(·) ∈ L([t0,θ],Q),
cs
, Δ), выбранной игро-
cs
ком P , оценивается величиной
,x0,Ucs, Δ) := supγ(t0, S(t0,x0,Ucs, Δ)). (15.22)
Γ
1(t0
190 ГЛАВА III
Далее, определяем показатель качества для контрстратегии следующим об­разом
Γ
1(t0,x0
,Ucs) := lim sup
diam Δ↓0
Γ1(t0,x0,Ucs, Δ). (15.23)
Оптимальный результат, гарантированный игроку P в классе контрcтрате­гий, вводится с помощью равенства
cs
Γ
(t0,x0):=inf
1
Γ1(t0,x0,Ucs). (15.24)
cs
U
Ниже будет сформулирована теорема существования ситуации равно­весия в классе контрcтратегий игрока P и позиционных стратегий игрока Q. Чтобы установить этот результат, следует ввести некоторые понятия.
Обозначим через U ций Q q → p(q) ∈ P . Напомним, что функции p(·) ∈ U
множество всех измеримых по Борелю функ-
cc
называются
cc
контруправлениями (или стробоскопическими стратегиями) игрока P .Га­мильтониан рассматриваемой теперь дифференциальной игры определяется равенствам
min
max
[s, f (t, x,p(q),q)−g(t, x, p(q),q)] =
p(·)∈U
q∈Q
cc
=max
=max
q∈Q
q∈Q
min
p(·)∈U
min
p∈P
[s, f (t, x,p(q),q)−g(t, x, p(q),q)] =
cc
[s, f (t, x, p, q)−g(t, x,p, q)] = Hcs(t, x, s). (15.25)
Напомним также, что символом Γ
0
(t0,x0) обозначается оптимальный
2
результат, гарантированный в классе чистых позиционных стратегий игро­ка Q (см. пункт 11.3, (11.15), (11.16)).
15.6. Теорема
Пусть выполнены предположения (A1) и (A2) (см. раздел 11.1).Тогда существует цена дифференциальной игры (15.1), (15.2), рассматриваемой в классе контрcтратегий игрока P и позиционных стратегий игрока Q, т. е. справедливы равенства
Функция цены Val
cs
(t0,x0):=Γ
Val
cs
совпадает с минимаксным решением задачи Коши
∂u ∂t
cs
(t, x, Dxu)=0,u(θ, x)=σ(x), (15.26)
+ H
cs
(t0,x0)=Γ
1
0
(t0,x0).
2
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]