Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Обобщенные решения уравнений в частных производных первого порядка. Перспективы динамической оптимизации
.pdf
14. НЕКОТОРЫЕ ЗАМЕЧАНИЯ 171
где p(t)=U∗(x(ti)), ti t<t
лов [t
] справедливо равенство
i,ti+1
x(t
)=x(ti)+(t
i+1
, i =0, 1,...,m. На любом из интерва-
i+1
t
i+1
− ti)U∗(x(ti)) +
i+1
t
i
Поэтому
x(t
) x(ti)+(t
i+1
По определению U
)+(t
x(t
i
− ti)U∗(x(ti))−
i+1
имеем, что
∗
− ti)U∗(x(ti)) = x(ti) +(t
i+1
Справедливо также неравенство
t
i+1
(2 −t)q(t)dt
t
i
2(t
i+1
− ti) −
t
2
i+1
Таким образом, приходим к следующему неравенству
2
2
− t
t
i+1
x(t
) x(ti) +
i+1
i
− (t
2
i+1
(2 −t)q(t)dt.
t
i+1
(2 −t)q(t)dt
t
i
− ti).
i+1
2
− t
i
.
2
− ti).
.
Успешно используя это неравенство, начиная с некоторого момента времени t
и до конечного момента t
j
x(2) = x(t
Выберем число t
из условия |1 − tj| =mini|1 − ti| для i ∈ 0,m+1.
j
Полагаем α := 1 − t
)
m+1
, тогда предшествующее неравенство может быть
j
= θ =2, получаем
m+1
2
t
m+1
2
− t
2
j
− (t
− tj)=tj−
m+1
2
t
j
.
2
переписано как
2
1 −α
γ(x(·),p(·),q(·)) := −x(2) −
.
2

172 ГЛАВА III
Это неравенство справедливо для любой тройки (x(·),p(·),q(·)) ∈
∈ S(U
результат Γ
творяет неравенству Γ
, Δ).Отметим,что|α| diam Δ. Таким образом, получено, что
∗
), гарантированный позиционной стратегией U∗,удовле-
1(U∗
1(U∗
) −
1
. Прослеживая путь предшествующих
2
рассуждений, можно проверить, что полученная оценка точна, т. е., в действительности, имеет место равенство (14.8).
Сравнивая (14.6) и (14.8), заключаем, что результат, гарантированный
разрывной стратегией U
, не может быть аппроксимирован непрерывными
∗
стратегиями. Непрерывные стратегии не используют в полной мере возможности управляемой системы при данном объеме информации.
Обсудим кратко другой подход к определению дифференциальных игр.
Пусть U :[0, 2] ×R
2
→ B — некоторая функция (возможно непрерывная).
Следуя по хорошо известному пути (см., например, [73, 74]), введем многозначное отображение
U(t, x):=
(t, x):={(τ, ξ) ∈ [0, 2] × R2:(t −τ)2+ x − ξ2 ε2}.Обозначим
где O
ε
co {U (τ, ξ): (τ,ξ) ∈ Oε(t, x)},
ε>0
символом S(U) множество всех троек (x(·),p(·),q(·)),где
t
x(t)=
[p(τ)+(2− τ)q(τ )]dτ, 0 t 2,
0
p(·) — измеримая функция, удовлетворяющая включению p(t) ∈U(t, x(t))
при почти всех t ∈ [0, 2],иq(·): [0, 2] → B — произвольная измеримая
функция, как это было выше. Пусть
Γ
(U):=supγ(S(U)).
1
Можно показать, что Γ
(U)=0при любом выборе позиционной страте-
1
гии U . Поэтому та формализация разрывных стратегий по принципу обратной связи, которая базируется на технике дифференциальных включений,
также оказывается неудачной. Она наследует недостатки непрерывных стратегий по принципу обратной связи.
Также уместно отметить, что в случае, когда функция цены является
выпуклой по фазовой переменной, использование техники дифференциальных включений для формализации стратегий по принципу обратной связи
обеспечивает оптимальный результат игроку P (минимизирующему плату).
Оценки результатов, гарантированных в классе непрерывных позиционных

14. НЕКОТОРЫЕ ЗАМЕЧАНИЯ 173
стратегий и в классе многозначных стратегий, изучались в ряде работ (см.,
например, статьи [9, 10], которые непосредственно связаны с задачами,
обсуждавшимися в данном разделе). Более детальное изложение представленных результатов содержится в книге [123].
14.4. Проблема устойчивости позиционных стратегий
Выше предполагалось, что для формирования управления с помощью
пошаговой процедуры, доступна точная информация о реализовавшейся позиции. Однако, в действительности, информационный шум является неизбежным. Как оказалось, в некоторых ситуациях даже небольшие информационные помехи могут разрушить предложенное управление по принципу обратной связи. В этих случаях решения теоретико-игровых проблем
управления являются неустойчивыми по отношению к информационным
помехам, и возникает задача регуляризации этих решений.
Рассмотрим простой пример, в котором информационный шум разрушает идеальное решение. Пусть три точки y, z
(1)
плоскости. Для ясности полагаем, что точка y — позиция собаки, а z
(2)
и z
— позиции двух зайцев. Уравнения движения имеют вид
и z
(2)
движутся на
(1)
˙y(t)=p(t), ˙z
(1)
Полагаем, что скорости точек y, z
(t)=q
(1)
(1)
(t), ˙z
и z
(1)
(t)=q
(2)
ограничены, т. e. выполняются
неравенства
(i)
p(t) α, q
(t) β, (i =1, 2),α>β.
Рассмотрим следующую позиционную стратегию для собаки
⎧
(1)
⎪
z
(1)
z
(2)
z
(2)
z
(1),z(2)
− y
, 0 < z
(1)
− y z
(2)
− y
− y
, 0 < z
(2)
− y < z
(1)
− y
(1)
− y, z
(2)
) ∈ R6, 0 =(0, 0) ∈ R2. Если функционал платы
⎪
⎪
⎪
⎪
⎪
⎪
(x):=
⎨
⎪
⎪
⎪
⎪
⎪
⎪
⎪
⎩
0
U
Здесь x =(y, z
α
α
0, min{z
имеет вид
γ(x(·)) = min{z
(1)
(θ) − y(θ), z
(2)
(θ) − y(θ)},
(2)
(t).
− y,
− y,
− y} =0.
(14.9)

174 ГЛАВА III
то стратегия U0оптимальна для собаки. Заметим, что эта стратегия также
является оптимальной и для случая, когда функционалом платы является
время, необходимое для того, чтобы точка y(t) встретилась с одной из
точек z
ющим образом. В момент времени t = t
(i)
(t)(i =1, 2).
В пошаговой процедуре (U
0
, Δ) управление p(t) сформировано следу-
∈ Δ собака определяет самого
i
близкого из двух зайцев и направляет вектор своей скорости на этого зайца.
Этот вектор остается неизменным на полуинтервале [t
).Такойметод
i,ti+1
управления обеспечивает ε-оптимальный результат для собаки.
Это заключение справедливо при условии, что расстояния между собакой и зайцами измерены точно. Если же они измерены с ошибками, то этот
информационный шум может разрушить предложенный способ управления.
Действительно, пусть движению собаки сформировано следующим
способом
p
(t)=p∗(ti)=U0(x∗(ti)),ti t<t
∗
= ti+ δ. (14.10)
i+1
Здесь x
) — результат измерения фазового вектора x(ti). Пусть ошибки
∗(ti
измерения удовлетворяют ограничению
x
) −x(ti) ξ. (14.11)
∗(ti
Согласно концепции «гарантированного результата», следует принять
во внимание ситуацию, когда этот информационный шум реализуется наиболее неблагоприятным образом. Рассмотрим следующую ситуацию: пусть
точка y
от точек z
идвигаютсяполучамA
находится в малой окрестности линии AB, одинаково отдаленной
0
(1)
(2)
и z
0
. Пусть зайцы z
0
1B1
(1)
(t) и z
(2)
(t) стартуют из этих позиций
и A2B2соответственно, оставаясь всегда на
равном расстоянии от оси AB. Из-за неправильного определения самого
близкого из зайцев в моменты времени t = t
, может иметь место движение
i
собаки вблизи луча AB. Это может произойти в результате альтернативного прицеливания то на ложную точку z
(1)
(ti), то на ложную точку z
∗
(2)
∗
(ti).
Такое движение собаки не будет сближаться ни с одним из зайцев.
Отметим, что такое скользящее движение может появиться в случае, когда число δ в соотношении (14.10) и число ξ в ограничении (14.11) связаны
неравенством δ δ
(ξ), где величина δ0(ξ) имеет тот же порядок малости,
0
что и как величина ξ. Поэтому возможна следующая рекомендация: для
того, чтобы ошибки не разрушали пошаговую процедуру управления, следует ограничить снизу расстояние между моментами разбиения t
такая рекомендация страдает тем дефектом, что требование t
0,m, может привести к ненужной грубости пошаговой процедуры. Та-
i ∈
i+1−ti
.Однако
i
>δ(ξ),
ким образом, эту рекомендацию следует отклонить.

14. НЕКОТОРЫЕ ЗАМЕЧАНИЯ 175
Рис. 14.1
В рассмотренном примере можно попытаться заменить разрывную
стратегию U
дующим образом. В начальный момент времени t = t
из двух точек z
времени t ∈ [t
0
(14.9) некоторой непрерывной стратегией, определенной сле-
выбирается одна
(1)
(t0) и z
∗
,θ] собака целится только на эту точку. Нетрудно видеть,
0
(2)
(t0), та, которая ближе к y∗(t0). И в течение
∗
0
что пошаговая процедура управления, выработанная в соответствии с такой
стратегией, оказывается устойчивой относительно информационного шума.
Однако такую регуляризацию, основанную на переходе к непрерывной
стратегии, не всегда возможно осуществить. Возможны также ситуации,
когда решение задачи доставляет разрывная стратегия, которая не может
быть аппроксимирована или подходящим образом заменена непрерывной
стратегией (этот фундаментальный факт был проиллюстрирован простым
примером в разделе 14.3).
В заключение обратим внимание на то, что стратегии, определенные в
пунктах 12.2, 13.2, и 13.5, могут, в общем случае, также оказаться неустойчивыми по отношению к информационному шуму. С другой стороны, можно показать, что информационные погрешности не могут разрушить действие стратегий минимизирующего игрока, если функции x → u(t, x) или
множества W (t), рассмотренные в упомянутых разделах, являются выпуклыми. Более полное обсуждение этих вопросов приведено в [123].

176 ГЛАВА III
14.5. Процедура управления с поводырем
Перейдем теперь к описанию регуляризаций позиционных стратегий,
которые приводят к решениям, устойчивым по отношению к информационным шумам. Рассмотрим процедуру управления с поводырем для задачи
M-сближения. Пусть движение управляемой системы описывается уравнением
˙x(t)=f (t, x(t),p(t),q(t)). (14.12)
Полагаем, что функция f :[0,θ]×R
n
×P ×Q → Rnудовлетворяет условиям,
сформулированным в разделе 13.1.
Рассмотрим пошаговую процедуру, в который управление p(t) сформировано в соответствии со следующим правилом
p(t)=U(t
Здесь U :[0,θ] × R
интервала [t
,θ]. Функция U и разбиение Δ выбраны игроком P .
0
),ξ(ti)),ti t<t
i,x∗(ti
n
× Rn→ P — функция, ti∈ Δ,гдеΔ — разбиение
,i∈ 0,m. (14.13)
i+1
Таким образом, управление p(t) (14.13) выбирается в зависимости от
векторов x
) и ξ(ti). Первый из этих векторов — результат измерения
∗(ti
позиции управляемого объекта. Предполагаем, что погрешности измерения
удовлетворяют ограничению
) −x(ti) ζ. (14.14)
x
∗(ti
Второй вектор называется фазовым состоянием поводыря в момент времени t = t
. Он получается в результате моделирования движения вспо-
i
могательной системы на компьютере. Алгоритмы, которые оценивают вектор ξ(t
поводырем в задаче M -сближения. Сначала определим функции U
), описаны ниже.
i
Теперь обратимся к формальной конструкции процедуры управления с
0
(t, x, w)
иV (t, x, w), удовлетворяющие условиям
p∈P
q∈Q
min
f(t, x, p,q),w− x, (14.15)
q∈Q
max
f(t, x, p,q),w− x. (14.16)
p∈P
0
иV
0
(t, x, w) ∈ Arg max
U
V (t, x, w) ∈ Arg min
Заметим, что, вообще говоря, эти условия определяют функции U
не единственным образом. Для успешных построений можно использо-
вать любую пару функций U
0
иV , удовлетворяющую указанным выше
условиям. Пусть W — стабильный мост в задаче M-сближения. Выберем
разбиение Δ={t
: i ∈ 0,m+1} интервала [t0,θ]. В начальный момент
i

14. НЕКОТОРЫЕ ЗАМЕЧАНИЯ 177
времени t = t0игрок P производит измерение вектора начального состояния x
точку ξ(t
= x(t0).Пустьx∗(t0) — результат этого измерения. Определим
0
) ∈ Rnиз условия
0
ξ(t
) ∈ Arg min
0
w∈W (t0)
x∗(t0) −w. (14.17)
Таким образом, ξ(t
(если есть несколько таких точек ξ(t
На первом временном интервале [t
0
= U
(t0,x∗(t0),ξ(t0)), вместе с некоторым измеримым управлением q(t)
) — точка из множества W (t0),ближайшаякточкеx∗(t0)
0
), то можно взять любую из них).
0
) управление игрока P , p(t)=
0,t1
для игрока Q, порождают движение управляемой системы (14.12). На первом временном интервале генерируется также движение поводыря. Для этой
цели выбирается постоянное управление q
=V (t0,x∗(t0),ξ(t0)) и рассмат-
0
ривается дифференциальное включение (см. (13.4))
Напомним, что (t
˙
ξ(t) ∈ co f(t, ξ(t),P,q
,ξ(t0)) ∈ W . Поэтому, согласно определению стабиль-
0
).
0
ного моста W , среди решений дифференциального включения существует
решение ξ(t), удовлетворяющее условию (t
,ξ(t1)) ∈ W . Возьмем это ре-
1
шение дифференциального включения в качестве движения поводыря на
интервале [t
Пусть x(t
дыря в момент времени t = t
вого состояния x(t
постоянное управление p(t)=U
].
0,t1
) и ξ(ti) — фазовые состояния управляемой системы и пово-
i
). На следующем интервале [ti,t
i
.Пустьx∗(ti) — результат измерения фазо-
i
0
(ti,x∗(ti),ξ(ti)). Это управление, вме-
) игрок P выбирает
i+1
сте с некоторым измеримым управлением q(t) игрока Q, порождают движение x(t), которое удовлетворяет уравнению (14.12). Чтобы определить
движение поводыря ξ(t), t ∈ [t
=V (t
),ξ(ti)) и рассмотрим дифференциальное включение
i,x∗(ti
˙
ξ(t) ∈ co f (t, ξ(t),P,q
], выберем постоянное управление qi=
i,ti+1
).
i
В результате построений на предшествующих интервалах времени, имеем,
что (t
,ξ(ti)) ∈ W . Тогда, согласно определению стабильного моста, это
i
дифференциальное включение имеет решение ξ(t), которое удовлетворяет
условию (t
i+1
,ξ(t
поводыря на интервале [t
)) ∈ W . Возьмем это решение в качестве движения
i+1
i,ti+1
].
Наконец, обращаем внимание на то, что формирование движения ξ(t)
может интерпретироваться как дифференциальная игра, в который игрок P
обладает информационным преимуществом, т.е. в момент времени t =
он/она знает не только реализовавшуюся позицию (ti,ξ(ti)),нотакже
= t
i

178 ГЛАВА III
и постоянное управление qi, которое будет использовано противником на
интервале [t
) (напомним, что подобные игры обсуждались в разде-
i,ti+1
лах 13.3 и 14.1). Фактически, в этой игре игрок P играет сам с собой и
назначает управление q
согласно равенству qi=V (ti,x∗(ti),ξ(ti)).Его/ее
i
противником является фиктивный игрок.
Можно показать, что эти конструкции обеспечивают взаимное отслеживание движений управляемой системы и поводыря. Ясно, что ξ(θ) ∈
∈ W (θ) ⊂ M . Процедура управления, описанная выше, доставляет реше-
ние задачи M-сближения, которое устойчиво относительно информационных погрешностей. Справедливо следующее утверждение.
Пусть (t
) ∈ W,гдеW — стабильный мост в задаче M-сближения.
0,x0
Тогда для любого ε>0, можно выбрать такие δ>0 и ζ>0, что процедура,
описанная выше, гарантирует выполнение условия dist (x(θ); M) ε для
любого измеримого управления игрока Q, любого разбиения Δ, удовлетворяющего ограничению diam Δ δ, и любых информационных погрешно-
стей, удовлетворяющих ограничению (14.14).
Следует подчеркнуть, что здесь не требуется, чтобы diam Δ >δ
∗
(ζ),
т. е. для заданной величины ζ , связанной ограничением (14.14), расстояние
между моментами времени t
может быть произвольно малым.
i
Очевидно, что свойство стабильности предложенного решения может
быть описано в традиционных выражениях: « . . . для любого ε>0 можно выбрать такие δ>0 и ζ>0, что . . .». Однако, с практической точки
зрения, значения параметров δ и ζ, которые являются допустимыми для данного значения ε, могут оказаться сколь угодно малыми. Основная причина
этого состоит в следующем. Оценка расстояния между фазовыми состояниями x(θ) и ξ(θ) управляемой системы и поводыря имеет вид (см. подобную
оценку в (13.17))
x(θ) − ξ(θ) e
λθ
h(δ, ζ ),
где h(δ, ζ) → 0,когдаδ → 0 и ζ → 0. Эта оценка содержит экспоненциальный коэффициент, который может принимать достаточно большие значения,
если интервал времени [t
,θ] велик.
0
Упомянем кратко подход, который позволяет преодолеть этот недостаток. Охарактеризуем процедуру с поводырем, используя понятия и терминологию теории устойчивости и теории стабилизации (см., например, [146]).
Определим разность s(t)=x(t) − ξ(t), которая будет называться возмущением. Процедура построения управления, описанная выше, может быть
рассмотрена как один из методов стабилизации возмущенного движения
s(·)=x(·) − ξ(·). Чтобы оценить эти возмущения, используем функцию
−2λt
s → w(t, s)=e
но (14.15) и (14.16), управления p(t
s2, которая играет роль функции Ляпунова. Соглас-
) и qiвыбирались из условия, кото-
i
рое обеспечивало как можно меньшее значение производной dw(t, s(t))/dt.

15. СМЕШАННЫЕ ПОЗИЦИОННЫЕ СТРАТЕГИИ И КОНТРСТРАТЕГИИ 179
Функция w(t, s):=e
−2λt
s2— вероятно, самая простая функция Ляпу-
нова, которая может использоваться для этой цели. Усовершенствование
процедуры управления с поводырем может быть достигнуто выбором более подходящей функции Ляпунова. А это, в действительности, одна из
задач теории стабилизации движений. Некоторые результаты, полученные
в этом направлении, представлены в работах [122, 123].
В данном параграфе была рассмотрена процедура управления с поводырем для задачи M -сближения. Подобные конструкции могут использоваться и в дифференциальной игре с функционалом платы (11.2), а также в
дифференциальных играх других типов.
15. Смешанные позиционные стратегии и контрстратегии
В дифференциальных играх, рассмотренных в предыдущих параграфах, предполагалось, что позиция (t, x(t)), реализовавшаяся в текущий момент времени t, известна обоим игрокам. Если один из игроков получает информацию об управлении, реализованном противником в текущий момент
времени, то можно заметить, что эта дополнительная информация не влияет на оптимальный гарантированный результат. Это положение имеет место
в случае, когда управляемая система удовлетворяет предположению (11.5)
(условию седловой точки в маленькой игре). Однако, если это условие нарушено, то постановки и решения дифференциальных игр в большой степени
зависят от того, обладает ли действительно игрок дополнительной информацией об управлении, выбранном противником. В пунктах 15.2 –15.4 будет
исследован случай взаимно независимого выбора игроками своих управлений. В разделах 15.5 и 15.6 будут рассмотрены случаи, когда один из
игроков обладает информационным преимуществом.
15.1. Предварительные соображения
Рассмотрим управляемую систему, движение которой описывается
уравнением
˙x(t)=f (t, x(t),p(t),q(t)). (15.1)
Функционал платы определен равенством
θ
γ(t
,x(·),p(·),q(·)) = σ(x(θ)) −
0
g(t, x(t),p(t),q(t))dt. (15.2)
t
0
Предполагаем, что функции f, g и σ удовлетворяют условиям (A1) и (A2)
(см. раздел 11.1). Подчеркнем еще раз, что теперь условие (A3) не тре-

180 ГЛАВА III
буется. Изучим следующие три варианта распределения информации об
управлениях, выбираемых игроками.
С
ЛУЧАЙ I. В текущий момент времени t игрок P знает управление q(t),
выбранное игроком Q, в то время как игрок Q не знает управления p(t),
реализованного игроком P .
С
ЛУЧАЙ II. Ни один из игроков не знает управление, используемое против-
ником в текущее время.
С
ЛУЧАЙ III. В текущий момент времени t игрок Q знает управление p(t),
выбранное игроком P, в то время как игрок P не знает управления q(t),
выбранного игроком P .
Во всех описанных выше случаях каждый из игроков знает реализовавшуюся позицию игры (t, x(t)). Ясно, что первый и третий случаи отличают-
ся переменой местами игроков P и Q.Помимоэтихтрехслучаеввозможны
также и другие варианты распределения информации о выборе управлений
игроками. Однако ниже рассматриваются только основные случаи I–III.
Чтобы пояснить различие между этими тремя типами дифференциальных игр, рассмотрим следующий простой пример. Пусть управляемая
система описывается уравнением
˙x
=cos(p + q), ˙x2=sin(p + q), (15.3)
1
|p| π, |q| π.
Пусть функционал платы определен равенством
γ(x(·)) = x
(θ). (15.4)
1
В рассматриваемом примере условие (11.5) не выполнено. Действительно, имеет место
2
maxq[s1cos(p + q)+s2sin(p + q)] =$s
min
p
minp[s1cos(p + q)+s2sin(p + q)] = −$s
max
q
1
+ s
2
1
+ s
2
,
2
2
.
2
Рассмотрим три типа дифференциальных игр для данных управляемой системы и функционала платы.
ЛУЧАЙ I. Пусть функция U : Q → P определена равенством
С
U(q)=πsign(q) − q =
π − q, q 0,
−π − q, q < 0.
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
