Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Обобщенные решения уравнений в частных производных первого порядка. Перспективы динамической оптимизации

.pdf
Скачиваний:
0
Добавлен:
07.09.2026
Размер:
2 Мб
Скачать
☆
14. НЕКОТОРЫЕ ЗАМЕЧАНИЯ 171
где p(t)=U∗(x(ti)), ti t<t лов [t
] справедливо равенство
i,ti+1
x(t
)=x(ti)+(t
i+1
, i =0, 1,...,m. На любом из интерва-
i+1
t
i+1
− ti)U∗(x(ti)) +
i+1
t
i
Поэтому
 
x(t
)x(ti)+(t
i+1
По определению U
)+(t
x(t
i
− ti)U∗(x(ti))−
i+1
имеем, что
∗
− ti)U∗(x(ti)) = x(ti) +(t
i+1
 
Справедливо также неравенство
t
i+1
  
(2 −t)q(t)dt
t
i
   
2(t
i+1
− ti) −
t
2 i+1
Таким образом, приходим к следующему неравенству
2
2
− t
t
i+1
x(t
)x(ti)+
i+1
i
− (t
2
i+1
(2 −t)q(t)dt.
t
i+1
(2 −t)q(t)dt
t
i
− ti).
i+1
2
− t
i
.
2
− ti).
  
.
Успешно используя это неравенство, начиная с некоторого момента време­ни t
и до конечного момента t
j
x(2)= x(t
Выберем число t
из условия |1 − tj| =mini|1 − ti| для i ∈ 0,m+1.
j
Полагаем α := 1 − t
)
m+1
, тогда предшествующее неравенство может быть
j
= θ =2, получаем
m+1
2
t
m+1
2
− t
2
j
− (t
− tj)=tj−
m+1
2
t
j
.
2
переписано как
2
1 −α
γ(x(·),p(·),q(·)) := −x(2)−
.
2
172 ГЛАВА III
Это неравенство справедливо для любой тройки (x(·),p(·),q(·)) ∈
∈ S(U
результат Γ творяет неравенству Γ
, Δ).Отметим,что|α| diam Δ. Таким образом, получено, что
∗
), гарантированный позиционной стратегией U∗,удовле-
1(U∗
1(U∗
) −
1
. Прослеживая путь предшествующих
2
рассуждений, можно проверить, что полученная оценка точна, т. е., в дей­ствительности, имеет место равенство (14.8).
Сравнивая (14.6) и (14.8), заключаем, что результат, гарантированный
разрывной стратегией U
, не может быть аппроксимирован непрерывными
∗
стратегиями. Непрерывные стратегии не используют в полной мере воз­можности управляемой системы при данном объеме информации.
Обсудим кратко другой подход к определению дифференциальных игр.
Пусть U :[0, 2] ×R
2
→ B — некоторая функция (возможно непрерывная). Следуя по хорошо известному пути (см., например, [73, 74]), введем мно­гозначное отображение
U(t, x):=
(t, x):={(τ, ξ) ∈ [0, 2] × R2:(t −τ)2+ x − ξ2 ε2}.Обозначим
где O
ε
co {U (τ, ξ): (τ,ξ) ∈ Oε(t, x)},
ε>0
символом S(U) множество всех троек (x(·),p(·),q(·)),где
t
x(t)=
[p(τ)+(2− τ)q(τ )]dτ, 0 t 2,
0
p(·) — измеримая функция, удовлетворяющая включению p(t) ∈U(t, x(t)) при почти всех t ∈ [0, 2],иq(·): [0, 2] → B — произвольная измеримая функция, как это было выше. Пусть
Γ
(U):=supγ(S(U)).
1
Можно показать, что Γ
(U)=0при любом выборе позиционной страте-
1
гии U . Поэтому та формализация разрывных стратегий по принципу обрат­ной связи, которая базируется на технике дифференциальных включений, также оказывается неудачной. Она наследует недостатки непрерывных стра­тегий по принципу обратной связи.
Также уместно отметить, что в случае, когда функция цены является выпуклой по фазовой переменной, использование техники дифференциаль­ных включений для формализации стратегий по принципу обратной связи обеспечивает оптимальный результат игроку P (минимизирующему плату). Оценки результатов, гарантированных в классе непрерывных позиционных
14. НЕКОТОРЫЕ ЗАМЕЧАНИЯ 173
стратегий и в классе многозначных стратегий, изучались в ряде работ (см., например, статьи [9, 10], которые непосредственно связаны с задачами, обсуждавшимися в данном разделе). Более детальное изложение представ­ленных результатов содержится в книге [123].
14.4. Проблема устойчивости позиционных стратегий
Выше предполагалось, что для формирования управления с помощью пошаговой процедуры, доступна точная информация о реализовавшейся по­зиции. Однако, в действительности, информационный шум является неиз­бежным. Как оказалось, в некоторых ситуациях даже небольшие инфор­мационные помехи могут разрушить предложенное управление по прин­ципу обратной связи. В этих случаях решения теоретико-игровых проблем управления являются неустойчивыми по отношению к информационным помехам, и возникает задача регуляризации этих решений.
Рассмотрим простой пример, в котором информационный шум раз­рушает идеальное решение. Пусть три точки y, z
(1)
плоскости. Для ясности полагаем, что точка y — позиция собаки, а z
(2)
и z
— позиции двух зайцев. Уравнения движения имеют вид
и z
(2)
движутся на
(1)
˙y(t)=p(t), ˙z
(1)
Полагаем, что скорости точек y, z
(t)=q
(1)
(1)
(t), ˙z
и z
(1)
(t)=q
(2)
ограничены, т. e. выполняются
неравенства
(i)
p(t)α, q
(t)β, (i =1, 2),α>β.
Рассмотрим следующую позиционную стратегию для собаки
⎧
(1)
⎪
z
(1)
z
(2)
z
(2)
z
(1),z(2)
− y , 0 < z
(1)
− yz
(2)
− y
− y , 0 < z
(2)
− y< z
(1)
− y
(1)
− y, z
(2)
) ∈ R6, 0 =(0, 0) ∈ R2. Если функционал платы
⎪
⎪
⎪
⎪
⎪
⎪
(x):=
⎨
⎪
⎪
⎪
⎪
⎪
⎪
⎪
⎩
0
U
Здесь x =(y, z
α
α
0, min{z
имеет вид
γ(x(·)) = min{z
(1)
(θ) − y(θ), z
(2)
(θ) − y(θ)},
(2)
(t).
− y,
− y,
− y} =0.
(14.9)
174 ГЛАВА III
то стратегия U0оптимальна для собаки. Заметим, что эта стратегия также является оптимальной и для случая, когда функционалом платы является время, необходимое для того, чтобы точка y(t) встретилась с одной из
точек z
ющим образом. В момент времени t = t
(i)
(t)(i =1, 2).
В пошаговой процедуре (U
0
, Δ) управление p(t) сформировано следу-
∈ Δ собака определяет самого
i
близкого из двух зайцев и направляет вектор своей скорости на этого зайца. Этот вектор остается неизменным на полуинтервале [t
).Такойметод
i,ti+1
управления обеспечивает ε-оптимальный результат для собаки.
Это заключение справедливо при условии, что расстояния между соба­кой и зайцами измерены точно. Если же они измерены с ошибками, то этот информационный шум может разрушить предложенный способ управления.
Действительно, пусть движению собаки сформировано следующим способом
p
(t)=p∗(ti)=U0(x∗(ti)),ti t<t
∗
= ti+ δ. (14.10)
i+1
Здесь x
) — результат измерения фазового вектора x(ti). Пусть ошибки
∗(ti
измерения удовлетворяют ограничению
x
) −x(ti) ξ. (14.11)
∗(ti
Согласно концепции «гарантированного результата», следует принять во внимание ситуацию, когда этот информационный шум реализуется наи­более неблагоприятным образом. Рассмотрим следующую ситуацию: пусть точка y
от точек z идвигаютсяполучамA
находится в малой окрестности линии AB, одинаково отдаленной
0
(1)
(2)
и z
0
. Пусть зайцы z
0
1B1
(1)
(t) и z
(2)
(t) стартуют из этих позиций
и A2B2соответственно, оставаясь всегда на равном расстоянии от оси AB. Из-за неправильного определения самого близкого из зайцев в моменты времени t = t
, может иметь место движение
i
собаки вблизи луча AB. Это может произойти в результате альтернативно­го прицеливания то на ложную точку z
(1)
(ti), то на ложную точку z
∗
(2)
∗
(ti).
Такое движение собаки не будет сближаться ни с одним из зайцев.
Отметим, что такое скользящее движение может появиться в случае, ко­гда число δ в соотношении (14.10) и число ξ в ограничении (14.11) связаны неравенством δ δ
(ξ), где величина δ0(ξ) имеет тот же порядок малости,
0
что и как величина ξ. Поэтому возможна следующая рекомендация: для того, чтобы ошибки не разрушали пошаговую процедуру управления, сле­дует ограничить снизу расстояние между моментами разбиения t такая рекомендация страдает тем дефектом, что требование t
0,m, может привести к ненужной грубости пошаговой процедуры. Та-
i ∈
i+1−ti
.Однако
i
>δ(ξ),
ким образом, эту рекомендацию следует отклонить.
14. НЕКОТОРЫЕ ЗАМЕЧАНИЯ 175
Рис. 14.1
В рассмотренном примере можно попытаться заменить разрывную стратегию U дующим образом. В начальный момент времени t = t
из двух точек z времени t ∈ [t
0
(14.9) некоторой непрерывной стратегией, определенной сле-
выбирается одна
(1)
(t0) и z
∗
,θ] собака целится только на эту точку. Нетрудно видеть,
0
(2)
(t0), та, которая ближе к y∗(t0). И в течение
∗
0
что пошаговая процедура управления, выработанная в соответствии с такой стратегией, оказывается устойчивой относительно информационного шума.
Однако такую регуляризацию, основанную на переходе к непрерывной стратегии, не всегда возможно осуществить. Возможны также ситуации, когда решение задачи доставляет разрывная стратегия, которая не может быть аппроксимирована или подходящим образом заменена непрерывной стратегией (этот фундаментальный факт был проиллюстрирован простым примером в разделе 14.3).
В заключение обратим внимание на то, что стратегии, определенные в пунктах 12.2, 13.2, и 13.5, могут, в общем случае, также оказаться неустой­чивыми по отношению к информационному шуму. С другой стороны, мож­но показать, что информационные погрешности не могут разрушить дей­ствие стратегий минимизирующего игрока, если функции x → u(t, x) или множества W (t), рассмотренные в упомянутых разделах, являются выпук­лыми. Более полное обсуждение этих вопросов приведено в [123].
176 ГЛАВА III
14.5. Процедура управления с поводырем
Перейдем теперь к описанию регуляризаций позиционных стратегий, которые приводят к решениям, устойчивым по отношению к информаци­онным шумам. Рассмотрим процедуру управления с поводырем для задачи M-сближения. Пусть движение управляемой системы описывается уравне­нием
˙x(t)=f (t, x(t),p(t),q(t)). (14.12)
Полагаем, что функция f :[0,θ]×R
n
×P ×Q → Rnудовлетворяет условиям,
сформулированным в разделе 13.1.
Рассмотрим пошаговую процедуру, в который управление p(t) сфор­мировано в соответствии со следующим правилом
p(t)=U(t
Здесь U :[0,θ] × R интервала [t
,θ]. Функция U и разбиение Δ выбраны игроком P .
0
),ξ(ti)),ti t<t
i,x∗(ti
n
× Rn→ P — функция, ti∈ Δ,гдеΔ — разбиение
,i∈ 0,m. (14.13)
i+1
Таким образом, управление p(t) (14.13) выбирается в зависимости от векторов x
) и ξ(ti). Первый из этих векторов — результат измерения
∗(ti
позиции управляемого объекта. Предполагаем, что погрешности измерения удовлетворяют ограничению
) −x(ti) ζ. (14.14)
x
∗(ti
Второй вектор называется фазовым состоянием поводыря в момент вре­мени t = t
. Он получается в результате моделирования движения вспо-
i
могательной системы на компьютере. Алгоритмы, которые оценивают век­тор ξ(t
поводырем в задаче M -сближения. Сначала определим функции U
), описаны ниже.
i
Теперь обратимся к формальной конструкции процедуры управления с
0
(t, x, w)
иV (t, x, w), удовлетворяющие условиям
p∈P
q∈Q
min
f(t, x, p,q),w− x, (14.15)
q∈Q
max
f(t, x, p,q),w− x. (14.16)
p∈P
0
иV
0
(t, x, w) ∈ Arg max
U
V (t, x, w) ∈ Arg min
Заметим, что, вообще говоря, эти условия определяют функции U не единственным образом. Для успешных построений можно использо-
вать любую пару функций U
0
иV , удовлетворяющую указанным выше условиям. Пусть W — стабильный мост в задаче M-сближения. Выберем разбиение Δ={t
: i ∈ 0,m+1} интервала [t0,θ]. В начальный момент
i
14. НЕКОТОРЫЕ ЗАМЕЧАНИЯ 177
времени t = t0игрок P производит измерение вектора начального состо­яния x точку ξ(t
= x(t0).Пустьx∗(t0) — результат этого измерения. Определим
0
) ∈ Rnиз условия
0
ξ(t
) ∈ Arg min
0
w∈W (t0)
x∗(t0) −w. (14.17)
Таким образом, ξ(t (если есть несколько таких точек ξ(t
На первом временном интервале [t
0
= U
(t0,x∗(t0),ξ(t0)), вместе с некоторым измеримым управлением q(t)
) — точка из множества W (t0),ближайшаякточкеx∗(t0)
0
), то можно взять любую из них).
0
) управление игрока P , p(t)=
0,t1
для игрока Q, порождают движение управляемой системы (14.12). На пер­вом временном интервале генерируется также движение поводыря. Для этой
цели выбирается постоянное управление q
=V (t0,x∗(t0),ξ(t0)) и рассмат-
0
ривается дифференциальное включение (см. (13.4))
Напомним, что (t
˙
ξ(t) ∈ co f(t, ξ(t),P,q
,ξ(t0)) ∈ W . Поэтому, согласно определению стабиль-
0
).
0
ного моста W , среди решений дифференциального включения существует решение ξ(t), удовлетворяющее условию (t
,ξ(t1)) ∈ W . Возьмем это ре-
1
шение дифференциального включения в качестве движения поводыря на интервале [t
Пусть x(t дыря в момент времени t = t вого состояния x(t постоянное управление p(t)=U
].
0,t1
) и ξ(ti) — фазовые состояния управляемой системы и пово-
i
). На следующем интервале [ti,t
i
.Пустьx∗(ti) — результат измерения фазо-
i
0
(ti,x∗(ti),ξ(ti)). Это управление, вме-
) игрок P выбирает
i+1
сте с некоторым измеримым управлением q(t) игрока Q, порождают дви­жение x(t), которое удовлетворяет уравнению (14.12). Чтобы определить движение поводыря ξ(t), t ∈ [t
=V (t
),ξ(ti)) и рассмотрим дифференциальное включение
i,x∗(ti
˙
ξ(t) ∈ co f (t, ξ(t),P,q
], выберем постоянное управление qi=
i,ti+1
).
i
В результате построений на предшествующих интервалах времени, имеем, что (t
,ξ(ti)) ∈ W . Тогда, согласно определению стабильного моста, это
i
дифференциальное включение имеет решение ξ(t), которое удовлетворяет условию (t
i+1
,ξ(t
поводыря на интервале [t
)) ∈ W . Возьмем это решение в качестве движения
i+1
i,ti+1
].
Наконец, обращаем внимание на то, что формирование движения ξ(t) может интерпретироваться как дифференциальная игра, в который игрок P обладает информационным преимуществом, т.е. в момент времени t =
он/она знает не только реализовавшуюся позицию (ti,ξ(ti)),нотакже
= t
i
178 ГЛАВА III
и постоянное управление qi, которое будет использовано противником на интервале [t
) (напомним, что подобные игры обсуждались в разде-
i,ti+1
лах 13.3 и 14.1). Фактически, в этой игре игрок P играет сам с собой и назначает управление q
согласно равенству qi=V (ti,x∗(ti),ξ(ti)).Его/ее
i
противником является фиктивный игрок.
Можно показать, что эти конструкции обеспечивают взаимное отсле­живание движений управляемой системы и поводыря. Ясно, что ξ(θ) ∈ ∈ W (θ) ⊂ M . Процедура управления, описанная выше, доставляет реше- ние задачи M-сближения, которое устойчиво относительно информацион­ных погрешностей. Справедливо следующее утверждение.
Пусть (t
) ∈ W,гдеW — стабильный мост в задаче M-сближения.
0,x0
Тогда для любого ε>0, можно выбрать такие δ>0 и ζ>0, что процедура, описанная выше, гарантирует выполнение условия dist (x(θ); M) ε для любого измеримого управления игрока Q, любого разбиения Δ, удовлетво­ряющего ограничению diam Δ δ, и любых информационных погрешно- стей, удовлетворяющих ограничению (14.14).
Следует подчеркнуть, что здесь не требуется, чтобы diam Δ >δ
∗
(ζ), т. е. для заданной величины ζ , связанной ограничением (14.14), расстояние между моментами времени t
может быть произвольно малым.
i
Очевидно, что свойство стабильности предложенного решения может быть описано в традиционных выражениях: « . . . для любого ε>0 мож­но выбрать такие δ>0 и ζ>0, что . . .». Однако, с практической точки зрения, значения параметров δ и ζ, которые являются допустимыми для дан­ного значения ε, могут оказаться сколь угодно малыми. Основная причина этого состоит в следующем. Оценка расстояния между фазовыми состояни­ями x(θ) и ξ(θ) управляемой системы и поводыря имеет вид (см. подобную оценку в (13.17))
x(θ) − ξ(θ)e
λθ
h(δ, ζ ),
где h(δ, ζ) → 0,когдаδ → 0 и ζ → 0. Эта оценка содержит экспоненциаль­ный коэффициент, который может принимать достаточно большие значения, если интервал времени [t
,θ] велик.
0
Упомянем кратко подход, который позволяет преодолеть этот недоста­ток. Охарактеризуем процедуру с поводырем, используя понятия и термино­логию теории устойчивости и теории стабилизации (см., например, [146]). Определим разность s(t)=x(t) − ξ(t), которая будет называться возму­щением. Процедура построения управления, описанная выше, может быть рассмотрена как один из методов стабилизации возмущенного движения s(·)=x(·) − ξ(·). Чтобы оценить эти возмущения, используем функцию
−2λt
s → w(t, s)=e но (14.15) и (14.16), управления p(t
s2, которая играет роль функции Ляпунова. Соглас-
) и qiвыбирались из условия, кото-
i
рое обеспечивало как можно меньшее значение производной dw(t, s(t))/dt.
15. СМЕШАННЫЕ ПОЗИЦИОННЫЕ СТРАТЕГИИ И КОНТРСТРАТЕГИИ 179
Функция w(t, s):=e
−2λt
s2— вероятно, самая простая функция Ляпу-
нова, которая может использоваться для этой цели. Усовершенствование процедуры управления с поводырем может быть достигнуто выбором бо­лее подходящей функции Ляпунова. А это, в действительности, одна из задач теории стабилизации движений. Некоторые результаты, полученные в этом направлении, представлены в работах [122, 123].
В данном параграфе была рассмотрена процедура управления с пово­дырем для задачи M -сближения. Подобные конструкции могут использо­ваться и в дифференциальной игре с функционалом платы (11.2), а также в дифференциальных играх других типов.
15. Смешанные позиционные стратегии и контрстратегии
В дифференциальных играх, рассмотренных в предыдущих парагра­фах, предполагалось, что позиция (t, x(t)), реализовавшаяся в текущий мо­мент времени t, известна обоим игрокам. Если один из игроков получает ин­формацию об управлении, реализованном противником в текущий момент времени, то можно заметить, что эта дополнительная информация не влия­ет на оптимальный гарантированный результат. Это положение имеет место в случае, когда управляемая система удовлетворяет предположению (11.5) (условию седловой точки в маленькой игре). Однако, если это условие нару­шено, то постановки и решения дифференциальных игр в большой степени зависят от того, обладает ли действительно игрок дополнительной информа­цией об управлении, выбранном противником. В пунктах 15.2 –15.4 будет исследован случай взаимно независимого выбора игроками своих управ­лений. В разделах 15.5 и 15.6 будут рассмотрены случаи, когда один из игроков обладает информационным преимуществом.
15.1. Предварительные соображения
Рассмотрим управляемую систему, движение которой описывается уравнением
˙x(t)=f (t, x(t),p(t),q(t)). (15.1)
Функционал платы определен равенством
θ
γ(t
,x(·),p(·),q(·)) = σ(x(θ)) −
0
g(t, x(t),p(t),q(t))dt. (15.2)
t
0
Предполагаем, что функции f, g и σ удовлетворяют условиям (A1) и (A2) (см. раздел 11.1). Подчеркнем еще раз, что теперь условие (A3) не тре-
180 ГЛАВА III
буется. Изучим следующие три варианта распределения информации об управлениях, выбираемых игроками.
С
ЛУЧАЙ I. В текущий момент времени t игрок P знает управление q(t),
выбранное игроком Q, в то время как игрок Q не знает управления p(t),
реализованного игроком P .
С
ЛУЧАЙ II. Ни один из игроков не знает управление, используемое против-
ником в текущее время.
С
ЛУЧАЙ III. В текущий момент времени t игрок Q знает управление p(t),
выбранное игроком P, в то время как игрок P не знает управления q(t),
выбранного игроком P .
Во всех описанных выше случаях каждый из игроков знает реализовав­шуюся позицию игры (t, x(t)). Ясно, что первый и третий случаи отличают- ся переменой местами игроков P и Q.Помимоэтихтрехслучаеввозможны также и другие варианты распределения информации о выборе управлений игроками. Однако ниже рассматриваются только основные случаи I–III.
Чтобы пояснить различие между этими тремя типами дифференци­альных игр, рассмотрим следующий простой пример. Пусть управляемая система описывается уравнением
˙x
=cos(p + q), ˙x2=sin(p + q), (15.3)
1
|p| π, |q| π.
Пусть функционал платы определен равенством
γ(x(·)) = x
(θ). (15.4)
1
В рассматриваемом примере условие (11.5) не выполнено. Действи­тельно, имеет место
2
maxq[s1cos(p + q)+s2sin(p + q)] =$s
min
p
minp[s1cos(p + q)+s2sin(p + q)] = −$s
max
q
1
+ s
2 1
+ s
2
,
2
2
.
2
Рассмотрим три типа дифференциальных игр для данных управляемой си­стемы и функционала платы.
ЛУЧАЙ I. Пусть функция U : Q → P определена равенством
С
U(q)=πsign(q) − q =
π − q, q 0,
−π − q, q < 0.
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]