Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Обобщенные решения уравнений в частных производных первого порядка. Перспективы динамической оптимизации
.pdf
15. СМЕШАННЫЕ ПОЗИЦИОННЫЕ СТРАТЕГИИ И КОНТРСТРАТЕГИИ 181
Предположим, что игрок P формирует своё управление согласно правилу
0
(t)=U(q(t)) = π sign (q(t)) −q(t), (15.5)
p
где q(t) — управление, выбранное игроком Q. В рассматриваемом случае
игрок P знает управление q(t), выбранное противником в текущее время t,
что делает допустимым вышеизложенный метод управления. Как следует
из (15.3), (15.5), ˙x
(t)=−1 для любого допустимого управления игрока Q.
1
Следовательно,
γ(x(·)) = x
) −(θ −t0).
1(t0
Ясно также, что если игрок Q выбирает постоянное управление q(t)=
∈ [−π, π], то для любого допустимого управления игрока P выполня-
= q
∗
ется неравенство γ(x(·)) x
Val
1(t0,x0
)=x1(t0) − (θ − t0),гдеVa l1(t0,x0) — цена рассматриваемой
) −(θ −t0). Таким образом получаем, что
1(t0
дифференциальной игры.
Второй тип дифференциальной игры будет рассмотрен чуть ниже. Сначала получим решение в случае, когда информационное преимущество имеет игрок Q.
С
ЛУЧАЙ III. Определим функцию V (p)=−p (p ∈ P ). Полагаем, что
игрок Q формирует своё управление согласно правилу
0
q
(t)=V (p(t)) = −p(t). (15.6)
Такой метод управления допустим, так как игрок Q знает управление p(t),
выбранное игроком P вмоментвремениt. Из (15.3), (15.4) и (15.6) получаем, что игрок Q может обеспечить выполнение равенства
γ(x(·)) = x
)+(θ −t0).
1(t0
С другой стороны, если игрок P выбирает любое постоянное управление,
то для любого допустимого управления игрока Q, справедливо неравенство
γ(x(·)) x
где Val
3(t0,x0
)+(θ −t0). Следовательно, Val3(t0,x0)=x1(t0)+(θ −t0),
1(t0
) — цена дифференциальной игры (15.3), (15.4), в случае
информационной дискриминации игрока P.
Теперь вернемся к дифференциальной игре второго типа. Сначала рассмотрим формальное решение этой игры в классе смешанных стратегий, а
затем определим стохастическую процедуру, которая будет аппроксимировать это решение.
С
ЛУЧАЙ II. Рассмотрим множества
P =rpm(P ),Q =rpm(Q).

182 ГЛАВА III
Напомним, что здесь P = Q =[−π, π],асимволrpm (S) обозначает множе-
ство всех регулярных вероятностных мер, нормированных на множестве S.
В общем случае игроки P и Q могут выбирать смешанные управле-
ния μ
и νtв зависимости от реализовавшейся позиции (t, x(t)). В частно-
t
сти, они могут использовать программные смешанные управления
,θ] t → μt∈P, [t0,θ] t → νt∈Q.
[t
0
Формально полагаем, что движения управляемой системы, порожденные
программными смешанными управлениями, определяются обычными дифференциальными уравнениями
π
π
˙x
(t)=
1
˙x
(t)=
2
cos(p + q)μt(dp)νt(dq),
−π
−π
π
π
sin(p + q)μt(dp)νt(dq). (15.7)
−π
−π
Таким образом, рассматривается дифференциальная игра для уравнения (15.7) и функционала платы вида (15.4). В уравнении (15.7) управления
игроков P и Q удовлетворяют ограничениям μ
∈P и νt∈Q.Отметим,
t
что в рассматриваемом теперь случае, условие седловой точки в маленькой
игре выполнено, т. е.
π
π
min
μ∈P
=max
max
ν∈Q
ν∈Q
(s1cos(p + q)+s2sin(p + q))μ(dp)ν(dq)=
−π
−π
π
π
min
μ∈P
(s1cos(p + q)+s2sin(p + q))μ(dp)ν(dq)=0. (15.8)
−π
−π
Легко проверить что дифференциальная игра (15.4), (15.7) имеет цену
Val
2(t0,x0
центрированная в двух точках p
т. е. μ({p
ν({q
обеспечивает выполнение равенств ˙x
управлении игрока Q. Таким же образом, выбирая ν
равенство γ(x(·)) = x
)=x1(t0). Действительно, пусть μ0— вероятностная мера, скон-
= −π/2 и p2= π/2 с равными весами,
1
})=μ({p2})=1/2.Точнотакжепустьν0∈Q — такая мера, что
1
})=ν({q2})=1/2,гдеq1= −π/2, q2= π/2.Выбираяμ0, игрок P
1
). Отсюда получается, что Val2(t0,x0)=x1(t0).
1(t0
=0 и γ(x(·)) = x1(t0) при любом
1
, игрок Q обеспечивает
0

15. СМЕШАННЫЕ ПОЗИЦИОННЫЕ СТРАТЕГИИ И КОНТРСТРАТЕГИИ 183
Более того, как было показано, пара смешанных управлений (μ0,ν0) составляет седловую точку.
Итак, вернемся к управляемой системе (15.3). Рассмотрим следующую
процедуру управления этой системой. Пусть игрок P выбирает смешанное
управление μ
, а игрок Q выбирает произвольное смешанное управление νt.
0
Обратим внимание, что чистое (не вероятностное) управление q(t) может
рассматриваться как специфический случай смешанного управления ν
,ко-
t
торое сконцентрировано с вероятностью 1 в точке q(t). Пусть задано разбиение Δ интервала времени [t
игроки принимают решения и выбирают случайные управления p
Случайное управление p
ми, равными 1/2, в то время, как управление q
тервала [−π, π] с вероятностью, определяемой с помощью меры ν
отметить, что случайный выбор управлений p
,θ]. В каждый момент разбиения t = ti∈ Δ
0
принимает значения −π/2 и π/2 свероятностя-
i
принимает значения из ин-
i
и qiпроизводится взаимно
i
и qi.
i
.Важно
t
i
независимо. Согласно процедуре, описанной выше, получаем множество
движений системы (15.3), на котором вероятностное распределение может
быть определено естественным образом.
Можно показать, что для любого ε>0 существует такое число δ>0,
что для любого разбиения Δ, удовлетворяющего diam Δ δ,идля
любого случайного или детерминированного управления игрока Q,стохастическое управление игрока P обеспечивает выполнение неравенства
γ(x(·)) x
)+ε с вероятностью, не меньшей, чем 1 − ε.Аналогич-
1(t0
ным образом можно определить стохастическую процедуру управления для
игрока Q, и получить, что она гарантирует оценку γ(x(·)) x
1(t0
) −ε с
вероятностью, сколь угодно близкой к единице.
Таким образом, стохастические процедуры управления, описанные выше, приближают оптимальный результат, который был формально определен для дифференциальной игры (15.7), (15.4). Далее в разделе 15.4 будут рассмотрены аппроксимационные свойства стохастических процедур
управления для общего случая нелинейной дифференциальной игры. Заметим, что эти свойства являются следствием известного в теории вероятностей закона больших чисел. Подчеркнем еще раз, что использование смешанных стратегий и их приближений возможно только тогда, когда каждый
из игроков выбирает управление независимо от управления, осуществляемого в данный момент времени его противником.
Таким образом, рассмотрены три типа дифференциальных игр с тремя
вариантами распределения информации об управлениях, выбираемых игроками. Для этих дифференциальная игр определены их цены и получены
следующие соотношения
Val
1(t0,x0
)=x1(t0) −(θ −t0) < Val2(t0,x0)=x1(t0) <
< Val
3(t0,x0
)=x1(t0)+(θ − t0),

184 ГЛАВА III
которые демонстрируют, что решения дифференциальная игр зависят от
того, обладает или нет игрок дополнительной информацией об управлении,
выбранном противником.
15.2. Смешанные позиционные стратегии
Обратимся теперь к формализации дифференциальной игры в классе
смешанных стратегий по принципу обратной связи. Введем некоторые понятия и определения. Напомним, что символы rpm(P ) и rpm(Q) обозначают
множества регулярных вероятностных мер, нормированных на компактных
множествах P и Q, соответственно. Элементы множеств rpm(P) и rpm (Q)
будут обозначаться буквами μ и ν.Пусть
(t, x, μ, ν) ∈ [0,θ] ×R
n
× rpm(P ) × rpm(Q).
Полагаем
f(t, x, μ, ν):=
f(t, x, p,q)μ(dp)ν(dq),
PQ
g(t, x, μ, ν):=
g(t, x,p, q)μ(dp)ν(dq). (15.9)
PQ
Справедливо
min
μ∈rpm (P )
=max
ν∈rpm (Q)
max
ν∈rpm (Q)
μ∈rpm (P )
s,f(t, x, μ, ν)−g(t, x, μ,ν)=
min
s,f(t, x, μ,ν)−g(t, x,μ, ν)=H(t, x, s). (15.10)
Отметим, что здесь можно использовать теорему о минимаксе (см., например, [98, 162]) и поменять местами операции min и max. ВеличинаH
называется гамильтонианом дифференциальной игры в классе смешанных
позиционных стратегий.
Напомним, что функция [t
,θ] t → μt∈ rpm (P ) называется слабо
0
измеримой, если для любой непрерывной функции P p → h(p) ∈ R,
функция
,θ] t →
[t
0
h(p)μt(dp) ∈ R
P
является измеримой (см., например, [225]). Аналогичным образом определяются слабо измеримые функции [t
,θ] t → νt∈ rpm (Q).
0

15. СМЕШАННЫЕ ПОЗИЦИОННЫЕ СТРАТЕГИИ И КОНТРСТРАТЕГИИ 185
Символами L([t0,θ], rpm(P )) и L([t0,θ], rpm(Q)) будут обозначать-
ся множества всех слабо измеримых функций μ
и ν
:[t0,θ] → rpm(Q) соответственно. Для заданной начальной пози-
(·)
ции (t
троек (x(·),μ
и x(·): [t
) ∈ [0,θ] × Rn,обозначимсимволомS(t0,x0) множество всех
0,x0
,θ] → Rn— абсолютно-непрерывные функции, удовлетворяющие
0
(·),ν(·)
),гдеμ
∈ L([t0,θ], rpm(P )), ν
(·)
:[t0,θ] → rpm (P )
(·)
∈ L([t0,θ], rpm(Q))
(·)
уравнению
) (15.11)
t,νt
и начальному условию x(t
˙x(t)=f(t, x(t),μ
)=x0. Функционал платы определен следую-
0
щим образом
θ
γ(t
,x(·),μ
0
(·),ν(·)
):=σ(x(θ)) −
g(t, x(t),μt,νt)dt. (15.12)
t
0
Функции
U :[0,θ] ×R
n
→ rpm (P ),V :[0,θ] × Rn→ rpm (Q)
называются смешанными позиционными стратегиями игроков P и Q соответственно.
Будем требовать, чтобы эти функции были измеримы относительно x в следующем смысле. Пусть μ
=U(t, x) и ν
t,x
=V (t, x).Пред-
t,x
полагаем, что для любого t ∈ [0,θ] и для любых непрерывных функ-
ций P p → ϕ(p) ∈ R, Q q → ψ(q) ∈ R, отображения
n
R
x →
P
ϕ(p)μ
(dp) ∈ R,
t,x
n
R
x →
Q
ψ(q)ν
(dq) ∈ R
t,x
измеримы по Борелю. Отметим, что это требование нужно для того, чтобы дать строгие определения вероятностным пространствам, порожденным
стохастическими процедурами управления, которые аппроксимируют позиционные смешанные стратегии.
Пусть игрок P выбирает некоторую смешанную стратегию по принципу обратной связиU и некоторое разбиение Δ интервала времени [t
ПустьS(t
ν
∈ L([t0,θ], rpm(Q)) — произвольная слабо измеримая функция, а μ
(·)
,U,Δ) —множествотроек(x(·),μ
0,x0
) ∈S(t0,x0),где
(·),ν(·)
0
(·)
,θ].
—

186 ГЛАВА III
кусочно-постоянное смешанное управление игрока P, которое формируется
согласно правилу
μ
=U(ti,x(ti)),ti t<t
t
,ti∈ Δ. (15.13)
i+1
По аналогии с в пунктом 11.2, где были введены показатели качества
чистых стратегий по принципу обратной связи, определим показатель каче-
ства пошаговой процедуры управления (U,Δ), выбранной игроком P ,как
величину
Γ
1(t0,x0
Следует отметить, что γ(t
,U,Δ) := supγ(t0,S(t0,x0,U,Δ)). (15.14)
,x(·),μ
0
) иΓ1(t0,x0,U,Δ) выглядят как
(·),ν(·)
детерминированные величины, которые не зависят от случайных событий.
Пошаговая процедура управления, определенная здесь, основана на математической идеализации, которая допускает, что значения управлений смешиваются мгновенно. Ниже в пункте 15.4 будет определена физически осуществимая аппроксимация смешанных стратегий, в которой смешивание
значений управлений занимает какое-то время.
Далее, мы полагаем
Γ
1(t0,x0
,U) := lim sup
diam Δ↓0
Γ
1(t0,x0
,U,Δ). (15.15)
Оптимальный гарантированный результат в классе смешанных позиционных стратегий игрока P определен следующим образом
0
Γ
(t0,x0):=inf
1
U
Γ
1(t0,x0
,U). (15.16)
Аналогично, пусть (V,Δ) — пошаговая процедура управления, вы-
бранная игроком Q.ЗдесьV — смешанная стратегия по принципу обратной
связи, Δ — разбиение интервала времени [t
,θ]. Качество этой процедуры
0
характеризуется величиной
Γ
2(t0,x0
,V,Δ) := inf γ(t0,S(t0,x0,V,Δ)). (15.17)
Оптимальный гарантированный результат в классе смешанных стратегий
по принципу обратной связи для игрока Q определен как
0
Γ
(t0,x0):=sup
2
V
Γ
2(t0,x0
,V ), (15.18)
где
Γ
2(t0,x0
,V ) := lim inf
diam Δ↓0
Γ
2(t0,x0
,V,Δ). (15.19)
Справедливо следующее утверждение.

15. СМЕШАННЫЕ ПОЗИЦИОННЫЕ СТРАТЕГИИ И КОНТРСТРАТЕГИИ 187
15.3. Теорема
Пусть выполнены предположения (A1) и (A2) (см. раздел 11.1). То-
гда существует цена дифференциальной игры (15.11), (15.12), рассмат-
риваемой в классе позиционных смешанных стратегий, т. е. имеет место
равенство
%
Val (t
0,x0
):=Γ
0
(t0,x0)=Γ
1
0
(t0,x0).
2
Функция цены%Val совпадает с минимаксным решением задачи Коши
∂u
+H(t,x, D
∂t
u)=0,u(θ, x)=σ(x), (15.20)
x
гдеH(t, x, s) — гамильтониан дифференциальной игры (15.11), (15.12),
определенный равенством (15.10).
Доказательство этого утверждения приводится ниже, в пункте 15.7.
Отметим еще раз, что в этой теореме рассматривается идеализированное решение дифференциальной игры в классе смешанных стратегий
по принципу обратной связи. Согласно этой идеализации, пошаговые движения конструируются с помощью управлений, смешиваемых мгновенно;
обычные управления p ∈ P и q ∈ Q заменены управлениями –мерами
(обобщенными управлениями) μ ∈ rpm (P) и ν ∈ rpm (Q), а дифференци-
альная игра (15.1), (15.2) заменена дифференциальной игрой (15.11), (15.12).
Однако в реальной жизни управляемый объект, мгновенно смешивающий
значения управления, невозможен. Итак, нужны физически осуществимые
процедуры управления, которые аппроксимируют формальные решения.
15.4. Стохастические процедуры управления
Пусть игроки P ,иQ выбрали смешанные позиционные стратегииU
иV . Пусть задано также разбиение Δ интервала времени [t
из моментов t = t
случайных значений своих управлений p(t)=p(t
t
t<t
i
. Распределения этих постоянных управлений задаются веро-
i+1
ятностными мерами μ(dp)=U(t
∈ Δ игроки производят взаимно независимый выбор
i
,x(ti)), ν(dq)=V (ti,x(ti)).
i
) ∈ P , q(t)=q(ti) ∈ Q,
i
,θ].Вкаждый
0
Стохастическая процедура управления, определенная выше, будет обозначаться символом SCP(U,V,Δ). Эта процедура порождает вероятност-
ное распределение кусочно-постоянных управлений p(·), q(·) и траекторий x(·) системы (15.1). Следующие утверждения являются следствием законов больших чисел, хорошо известных в теории вероятностей.

188 ГЛАВА III
Для любой парыU,V позиционных смешанных стратегий игроков P
и Q и для любого положительного числа ε можно выбрать такое положительное число δ>0, что для любой стохастической процедуры управле-
ния SCP(U,V,Δ), удовлетворяющей оценкам diam Δ δ, неравенства
Γ
2(t0,x0
,V ) −ε γ(t0,x(·),p(·),q(·)) Γ1(t0,x0,U)+ε
выполнены с вероятностью, не меньшей, чем 1 −ε.
ПустьU
иVα— α-оптимальные смешанные позиционные стратегии P
α
и Q,т.е.
Γ
1(t0,x0
Γ
2(t0,x0
,Uα) %Val (t0,x0)+α,
,Vα) %Val (t0,x0) −α.
Тогда для любого ε>0 существует такое число δ>0,чтодлялюбогоразбиения Δ, удовлетворяющего оценке diam Δ δ и для любой позиционной
смешанной стратегииV игрока Q, неравенство
γ(x(·),p(·),q(·)) %Val (t
0,x0
)+α + ε
выполняется с вероятностью, не меньшей, чем 1 − ε, где вероятностное
распределение порождено процедурой SCP(U
,V,Δ).
α
Аналогично, для любого ε>0 можно найти такое число δ>0,чтодля
любого разбиения Δ, удовлетворяющего условию diam Δ δ,идлялюбой
смешанной позиционной стратегииU игрока P , неравенство
γ(x(·),p(·),q(·)) %Val (t
0,x0
) −α − ε
выполняется с вероятностью, не меньшей, чем 1 − ε, где вероятностное
распределение определяется процедурой SCP (U,V
, Δ).
α
Согласно этим утверждениям, рассмотренную выше математическую
формализацию, качество которой оценивается величинами (15.14) – (15.19),
и предполагающую идеальное, т. е. мгновенное смешивание значений
управлений, можно аппроксимировать физически реализуемой процедурой,
формирующей кусочно-постоянные случайные управления игроков. Еще
раз подчеркнем важность того требования, что на каждом шаге t
∈ Δ в
i
рассматриваемой стохастической процедуре игроки выбирают свои случайные управления независимо в стохастическом смысле.
В случае, когда разбиения Δ
и Δ2, выбранные игроком P и игро-
1
ком Q, не совпадают, можно, как и выше, использовать предположение, что
игрок P (игрок Q) выбирает случайное управление, независимое от текущего управления, выбранного противником. Это предположение особенно

15. СМЕШАННЫЕ ПОЗИЦИОННЫЕ СТРАТЕГИИ И КОНТРСТРАТЕГИИ 189
важно при наличии информационных погрешностей в измерениях текущих
позиций. Строгие постановки и доказательства результатов относительно
упомянутых здесь стохастические процедур, даны в [123, 124].
15.5. Контрcтратегии
Теперь рассмотрим постановку дифференциальной игры в случае I
(см. пункт 15.1). Мы полагаем, что в текущий момент времени t игрок P
знает управление q(t), выбранное игроком Q, в то время как игрок Q не
знает управления p(t), реализованного игроком P . Предполагается также,
что каждый из игроков знает реализовавшуюся позицию игры (t, x(t)).
Определим дифференциальную игру в классе контрcтратегий игрока P
вводятся следующим образом.
Пусть заданы функции
[0,θ] ×R
Полагаем, что для всех (t, x) ∈ [0,θ]×R
измеримы по Борелю. Верхний индекс
n
× Q (t, x,q) → Ucs(t, x, q) ∈ P.
n
функции Q q → Ucs(t, x, q) ∈ P
cs
используется здесь, чтобы отли-
чить контрcтратегии от позиционных стратегий (t, x) → U (t, x).
Пусть задана начальная позиция (t
выбирает разбиение Δ интервала времени [t
измеримая функция. В пошаговой процедуре управления контрстрате-
cs
гия U
где t
формирует управление игрока P согласно правилу
p(t)=U(t
∈ Δ. Как известно (см., например, [101]), функция t → p(t),
i
,x(ti),q(t)),ti t<t
i
) ∈ [0,θ) ×Rn, и пусть игрок P
0,x0
,θ].Пустьq(·) ∈ L([t0,θ],Q) —
0
,i∈ 0,m, (15.21)
i+1
определенная этим равенством, является измеримой, т. к. на каждом интервале [t
ции q → U
) эта функция является суперпозицией борелевской функ-
i,ti+1
cs
(ti,x(ti),q) и измеримой (в смысле Бореля или Лебега) функ-
ции t → q(t).
Напомним (cм. пункт 11.2), что символом S(t
жество всех троек (x(·),p(·),q(·)),гдеp(·) ∈ L([t
x(·): [t
,θ] → Rn— абсолютно непрерывные функции, которые удовле-
0
творяют уравнению (15.1) и условию x(t
лом S(t
где q(·) ∈ L([t
,Ucs, Δ) множество всех троек (x(·),p(·),q(·)) ∈ S(t0,x0),
0,x0
,θ],Q) — произвольные измеримые управления игрока Q,
0
0
)=x0.Обозначимсимво-
0
а p(·) — управления игрока P , которые сформированы контрстратегией U
согласно правилу (15.21).
Качество пошаговой процедуры управления (U
) обозначается мно-
0,x0
,θ],P), q(·) ∈ L([t0,θ],Q),
cs
, Δ), выбранной игро-
cs
ком P , оценивается величиной
,x0,Ucs, Δ) := supγ(t0, S(t0,x0,Ucs, Δ)). (15.22)
Γ
1(t0

190 ГЛАВА III
Далее, определяем показатель качества для контрстратегии следующим образом
Γ
1(t0,x0
,Ucs) := lim sup
diam Δ↓0
Γ1(t0,x0,Ucs, Δ). (15.23)
Оптимальный результат, гарантированный игроку P в классе контрcтратегий, вводится с помощью равенства
cs
Γ
(t0,x0):=inf
1
Γ1(t0,x0,Ucs). (15.24)
cs
U
Ниже будет сформулирована теорема существования ситуации равновесия в классе контрcтратегий игрока P и позиционных стратегий игрока Q.
Чтобы установить этот результат, следует ввести некоторые понятия.
Обозначим через U
ций Q q → p(q) ∈ P . Напомним, что функции p(·) ∈ U
множество всех измеримых по Борелю функ-
cc
называются
cc
контруправлениями (или стробоскопическими стратегиями) игрока P .Гамильтониан рассматриваемой теперь дифференциальной игры определяется
равенствам
min
max
[s, f (t, x,p(q),q)−g(t, x, p(q),q)] =
p(·)∈U
q∈Q
cc
=max
=max
q∈Q
q∈Q
min
p(·)∈U
min
p∈P
[s, f (t, x,p(q),q)−g(t, x, p(q),q)] =
cc
[s, f (t, x, p, q)−g(t, x,p, q)] = Hcs(t, x, s). (15.25)
Напомним также, что символом Γ
0
(t0,x0) обозначается оптимальный
2
результат, гарантированный в классе чистых позиционных стратегий игрока Q (см. пункт 11.3, (11.15), (11.16)).
15.6. Теорема
Пусть выполнены предположения (A1) и (A2) (см. раздел 11.1).Тогда
существует цена дифференциальной игры (15.1), (15.2), рассматриваемой
в классе контрcтратегий игрока P и позиционных стратегий игрока Q,
т. е. справедливы равенства
Функция цены Val
cs
(t0,x0):=Γ
Val
cs
совпадает с минимаксным решением задачи Коши
∂u
∂t
cs
(t, x, Dxu)=0,u(θ, x)=σ(x), (15.26)
+ H
cs
(t0,x0)=Γ
1
0
(t0,x0).
2
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
