Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Специальные методы исследования операций и математические модели. Курс лекций
.pdf
3.4. Интерпретации
n,1
n,1
)(
2
2
x
hf
)(x
hf
)(
2
2
x
hf
)(x
h
f
h
0λ
))λ((
λ
hxf
0λ
))λ((
λ
j
j
j
hx
x
f
0λ
2
λ
)λ(
))λ((
j k
k
j
kj
d
dx
hx
xx
f
j k
kj
kj
hhx
xx
f
)(
2
,,1 m
m,1
Теорема 3.14 (о второй производной по направлению). Пусть функция
f : Rn → R дважды дифференцируема в точке x = (xj | j
направление h = (hj | j
)T. Тогда
= h
T
f
''(x) h.
)T. Зафиксируем
Доказательство. Положим x() = x + h, где R, и (x, ) = f (x()). По
следствию 2.4
= f '(x) h.
Используя правило дифференцирования сложной функции и учитывая,
что xj() = xj + hj, получим:
=
=
=
=
=
= h
T
''(x) h. #
f
=
В этом разделе будем работать с ЗВП без ограничений-равенств:
f (x) → max при условиях gi(x) ≤ bi для i
x ≥ 0n,
предполагая, что функция f (x) вогнута, функции gi(x) выпуклы и все
функции дважды дифференцируемы на множестве X допустимых планов.
В разд. 2.5.2 мы показали, что эта задача является моделью оптимизации
плана деятельности некоторой экономической системы, будем называть ее
предприятием. Множество допустимых планов выпукло по утверждению (а)
теоремы 3.7.
Пусть b = (bi | i
). Предприятие имеет запас ингредиента i, если bi >
0, и обязательство по производству ингредиента i, если bi < 0. Если планы x1 и
x2 допустимы, то и любой промежуточный (средневзвешенный) план является
допустимым, то есть позволяет выполнить обязательства, указанные отрицательными координатами вектора b, не превышая ресурсных запасов, указанных
его положительными координатами.
Предположим, что выполняется условие Слейтера: существует план x0 ≥ 0n,
для которого gi(x) < bi при всех i. Это значит, что можно перевыполнить все
обязательства, сохранив неиспользованные остатки всех ресурсов. Из непрерывности функций gi следует, что неравенства gi(x) < bi выполняются для всех x
из некоторой окрестности точки x0 и в этой окрестности найдется точка x > 0n,
то есть существует план (не обязательно оптимальный), использующий все
технологические способы. Эта точка является внутренней для множества X.
Поскольку int X , матрица Гессе для функции gi положительно полуопределена (утверждение (а) теоремы 3.6). По теореме 3.14 это означает, что
вторая производная функции gi по любому направлению неотрицательна, а первая производная, следовательно, не убывает. Другими словами, с ростом произ-
41

водства не убывает не только потребление каждого ингредиента, но и предель-
j
x
n,1
i
у
m,1
)(
x
x
f
j
–
m
i
j
i
i
x
x
g
y
1
)(
≤ 0, с равенством при
j
x
> 0, для j
;,1 n
(3.8)
i
у
(gi(x*) – bi) = 0 для i
;,1 m
(3.9)
y* 0m.
(3.10)
*
i
у
.ε
i
у
i
у
i
уε
i
у
i
у
ное потребление, отсутствует экономия от масштаба. Заметим, что при bi < 0
«ускорение потребления» ингредиента i означает замедление его производства.
Этот вывод можно получить, не используя дифференцируемость функций
gi. Действительно, по определению выпуклой функции имеем gi(0.5(x1 + x2)) ≤
≤ 0.5(gi(x1) + gi(x2)) для любых x1 и x2 из X. При x1 = x и x2 = x + 2x получим:
gi(x + x) ≤ 0.5(gi(x) + gi(x + 2x)), или
gi(x + 2x) – gi(x + x) ≥ gi(x + x) – gi(x).
Следовательно, каждая следующая «порция» прироста плана потребует
не меньше ресурсов и произведет не больше продуктов, чем предыдущая. В области строгой выпуклости функции gi последнее неравенство является строгим:
ресурсоемкость плана возрастает, а продуктивность – убывает.
Аналогичные рассуждения показывают, что ЦФ задачи имеет невозрастающую производную по любому направлению, рост полезности не ускоряется
с ростом производства. Если ЦФ строго вогнута, то прирост полезности
уменьшается с каждым следующим приростом плана, продуктивность убывает
и в этом смысле.
Пусть x* = (
| j
)T и y* = (
| i
) – оптимальное решение и век-
тор множителей Лагранжа для рассматриваемой задачи. Будем считать, что задача удовлетворяет условиям теоремы 3.11 и предположим сначала, что ЦФ задачи описывает доход.
Условия Куна – Таккера имеют вид:
По теореме 3.12 множитель Лагранжа
– это производная функции мак-
симумов по правой части bi ограничения i. Это значит, что, с одной стороны,
при увеличении bi на ε максимальный доход вырастет примерно на
вательно,
– это максимальная цена, неотрицательная по (3.10), по которой
Следо-
предприятие могло бы без ущерба приобрести небольшое количество ингредиента i. С другой стороны, уменьшение bi на ε снизит максимальный доход
предприятия на
. Тогда
– это минимальная цена, по которой предприятие
согласилось бы продать небольшое количество ингредиента i.
Определение. Множитель Лагранжа называют теневой ценой соответ-
ствующего ингредиента.
Если bi ≥ 0, то можно считать ингредиент i ресурсом, а его теневую цену –
максимальной приемлемой ценой при покупке и минимальной приемлемой ценой при продаже некоторого (небольшого) количества этого ресурса. Если
bi < 0, то | bi | мы интерпретируем как величину обязательной поставки ингредиента i во внешнюю среду. Тогда, при небольших вариациях bi,
42
– это макси-

мальный штраф, который предприятие готово заплатить за уменьшение постав-
)(
x
x
f
j
m
i
j
i
i
x
x
g
y
1
)(
m,1
zj(x*, p) =
)(
x
x
f
j
–
m
i
j
i
i
x
x
g
p
1
)(
.
(3.11)
ε
δ
i
)(
x
x
g
j
i
j
x
ки на единицу, и минимальная приемлемая оплата дополнительной единицы
обязательной поставки.
При такой интерпретации множителей Лагранжа левая часть условия
(3.8) с номером j указывает предельный эффект от увеличения интенсивности
технологического способа j: предельный прирост дохода за вычетом предельного прироста затрат на потребление ингредиентов. Заметим, что затраты измерены в теневых ценах, а прирост потребления ингредиента может быть отрицательным.
Определение. Величину
zj(x*, y*) =
–
называют эффективностью способа j.
Условие (3.8) утверждает, что технологические способы, имеющие отрицательную эффективность, не могут использоваться в оптимальном плане с
ненулевой интенсивностью. Одновременно это условие запрещает положительную эффективность способа в оптимальном плане. Таким образом, в оптимальном плане используются только способы с максимальной эффективностью, но
эта эффективность равна нулю.
Предположим, что зафиксирован вектор p = (pi | i
) цен, по которым
предприятие может покупать и продавать ингредиенты. В этих ценах можно
измерить затраты на приобретение дополнительных ресурсов, выручку от продажи продукции и излишних ресурсов, ущерб от снижения производства. Пусть
Увеличение интенсивности способа j (по сравнению с планом x*) на ε > 0
влечет прирост δi чистого потребления ингредиента i. Если способ j потребляет
ингредиент i, то δi > 0 и приобретение дополнительного количества ингредиента i требует затрат piδi. Если способ j производит ингредиент i, то δi < 0, чистое
производство ингредиента возрастает на –δi. Дополнительно произведенное количество ингредиента i может быть продано с доходом –piδi (что эквивалентно
затратам piδi < 0). Но
→
при ε → 0,
поэтому вычитаемое в (3.11) – это суммарные предельные затраты, связанные с
изменением интенсивности способа j. Тогда zj(x*, p) – предельная эффективность технологического способа j относительно цен p при плане x* (затраты измерены в текущих ценах). При zj(x*, p) > 0 предприятию выгодно немного уве-
личить, а при zj(x*, p) < 0 и
> 0 – немного уменьшить интенсивность способа
j. В обоих случаях предприятие стремилось бы купить / продать некоторые ко-
личества ингредиентов, вследствие чего их исходное распределение между
предприятиями было бы неустойчивым.
43

Если же цены ингредиентов совпадают с множителями Лагранжа, кото-
m,1
i
уε
)(ε b
b
С
i
i
у
,
0
i
p
,
0
i
p
i
у
i
у
i
у
i
у
рые неотрицательны по (3.10), то из (3.8) и (3.9) следует, что предприятие не
может получить выгоду от изменения исходного запаса ингредиентов. В этом
смысле теневые цены являются ценами равновесия.
Условие дополняющей нежесткости (3.9) утверждает, что в оптимальном
плане ресурс с положительной теневой ценой должен быть израсходован полностью, а обязательство с положительной теневой ценой не может быть перевыполнено. Эквивалентная формулировка: теневая цена недоиспользованного
ресурса или перевыполненного обязательства должна быть нулевой.
Если ЦФ задачи описывает условно чистый доход или прибыль, то предшествующие интерпретации модифицируются, а именно будем считать, что
условно чистый доход «очищен» от некоторых элементов затрат, в частности,
учтены затраты C(b), связанные с формированием вектора правых частей огра-
ничений (запасов ингредиентов) b = (bi | i
нительного количества ε ингредиента i по цене pi даст примерно
)T. Тогда приобретение допол-
единиц
условно чистого дохода при затратах εpi. Часть этих затрат, в размере примерно
= εci(b)
учтена в ЦФ. Следовательно, предельный условно чистый доход в рассматриваемом случае равен
– [ pi – ci(b)]. Величина pi – ci(b) – это предельные затра-
ты на приобретение ингредиента i, не учтенные в ЦФ. Например, если исходный запас bi ресурса i был приобретен по цене
то ci(b) =
тогда pi – ci(b) –
это прирост цены. При текущей цене pi предприятию выгодно некоторое количество ингредиента i приобрести, если
Следовательно,
– это максимальный прирост цены, при котором предприя-
> pi – ci(b), и продать – если
< pi – ci(b).
тие согласилось бы купить (и минимальный прирост цены, при котором предприятие согласилось бы продать) некоторое количество ингредиента i.
Другими словами, если ЦФ выражает условно чистый доход, то
– это
разница между равновесной ценой и учтенными в модели предельными затратами на приобретение ингредиента i.
Дополнительная литература к разделу 3
1. Васильев, Ф. П. Численные методы решения экстремальных задач. – М.:
Наука, 1980 (§ 1–3, 5, 8, 9, гл. 4).
4. Динамическое программирование
4.1. Задача динамического программирования
В разд. 2.1 на основании предположений 1.1 – 1.4 и 2.1 мы сформулировали модель выбора решения в виде задачи математического программирования (2.1):
f(x) → max при условии x X Rn.
44

Эту задачу можно записать как задачу динамического программирования
n,1
n,1
.),(
1
1
n
k
kkk
sxf
.,1 n
38
39
40
(ДП), если выполнены сформулированные ниже предположения 4.1 – 4.4.
Предположение 4.1. Задача принятия решения является многоэтапной,
то есть процесс выбора решения (управления) x = (x1, …, xn)T Rn можно представить как последовательность шагов (этапов) с номерами k
таких, что
на шаге k ЛПР определяет значение xk (управление на шаге k) 38.
Предположение 4.2. После шага k (и в начале шага k + 1) объект управления находится в состоянии sk, которое определяется значениями m числовых
показателей (фазовых координат), то есть sk Rm. Известны функции перехода
(фазовые уравнения) sk = k(xk, s
) для k
k–1
(здесь s0 – начальное состояние
объекта, которое обычно считают известным).
Функция перехода k действует из R Rm в Rm. Это, в сущности, функция
реализации39 для шага k. Запись sk = k(xk, s
) означает, что состояние объекта
k–1
после шага k зависит от состояния в начале этого шага и управления на шаге k,
но не зависит от того, через какую последовательность состояний и управлений
объект пришел в состояние s
. Это свойство системы управления называют
k–1
отсутствием последействия.
Предположение 4.3. Целевая функция f (x) аддитивно сепарабельна, то
есть
f (x) =
В соответствии с предположением 4.3 эффект от применения управления
x к объекту, находящемуся в состоянии s0, складывается из эффектов, получен-
ных на отдельных шагах. На шаге k под воздействием управления xk объект,
находящийся в состоянии s
ем эффекта fk(xk, s
k –1
).
, переходит в состояние sk = k(xk, s
k–1
) с получени-
k –1
Предположение 4.4. Множество допустимых (возможных, реализуемых)
управлений на шаге k зависит только от состояния объекта в начале этого шага.
Определения и обозначения.
Xk(s
объекта s
) – множество допустимых управлений на шаге k при состоянии
k –1
в начале этого шага.
k–1
Sk – множество возможных состояний, в которых может находиться объ-
ект управления в конце шага k; S0 = {s0} по определению.
k
Следствие 4.1 40. S0 = {s0}; Sk = {k(xk, s
k –1
) | s
k –1
S
, xk Xk(s
k –1
)} для
k –1
Принципиальная схема пошагового управления показана на рис. 7. Отрезки горизонтальной линии соответствуют этапам процесса управления. На
состояние объекта влияют управляющие воздействия (стрелки вверху). На каж-
Если управление шага k описано несколькими числовыми показателями, то xk является вектором. Более
того, размерность вектора xk может зависеть от k. Но мы для упрощения предполагаем, что все xk – скалярные
величины.
См. предположение 1.2 в разд. 1.3.
Доказательство очевидно.
45

дом шаге возникает некоторый эффект, и эти эффекты суммируются (стрелки
Fn(x, s0) =
n
k
kkk
sxf
1
1
),(
→ max при условиях:
(4.1)
x = (x1, …, xn)T Rn; xk Xk(s
k –1
) и sk = k(xk, s
k –1
) для k
,,1 n
sn S
*
.
(4.2)
,),...,(
T1
n
xx
),,...,,(
10
n
sss
k
s
),(φ
*1
kkk
sx
s
0
s
1
s
k–1 sk
s
n
xxx
x
f1(x1, s0)
f
k –1(xk –1
, s
k –2
)
fk(xk, s
k –1
)
fn(xn, s
n –1
)
f (x)
x1 x2 x
k–1 xk xn
Рис. 7. Схема пошагового управления с аддитивно сепарабельной
целевой функцией
внизу), формируя интегральный эффект.
Обозначение. S
*
– множество желательных (терминальных) состояний
после шага n.
Учитывая принятые предположения и обозначения, исходную задачу математического программирования можно записать следующим образом.
Определения и обозначения
Задачу (4.1) – (4.2) будем называть задачей динамического программирования и обозначать Pn(s0, S
*
).
Вектор s0 и множество S * устанавливают граничные условия задачи Pn(s0, S *).
Вектор x* =
доставляющий максимум целевой функции (4.1),
называют оптимальным управлением.
Последовательность состояний s* =
где
=
– это
оптимальная траектория объекта управления в фазовом пространстве (про-
странстве состояний).
Мы не накладываем никакие условия на множества и функции, фигурирующие в задаче (4.1) – (4.2). Поэтому задача может быть неразрешимой. Если
же оптимальное решение существует, то его (или хорошее приближение к
нему) во многих случаях удается найти с помощью подхода, изложенного в
разд. 4.3.
Задачу Pn(s0, S *) можно сформулировать следующим образом: найти
управление, которое с наибольшим эффектом за n шагов переводит объект из
состояния s0 в одно из состояний s S *.
46

Определения и обозначения
1
j
S
1
j
S
j
ik
kkk
sxf ),(
1
,, ji
.
1
j
S
1
j
S
.
1
j
S
T
1
),...,(
n
xx
0
s
k
s
),(φ
1kkk
sx
,,1 n
1
n
S
1
k
S
k
s
.1,1 n
T
),...,(
ji
xx
).,(
1
11 jiij
SsP
).,(
1
11 jiij
SsP
1i
s
,, ji
1
j
S
j
ik
kkk
sxf ),(
1
j
ik
kkk
sxf ),(
1
0
k
x
n,1
0
k
x
k
x
1,1 i
,,nj
0
k
x
., ji
1
1
1
),(
i
k
kkk
sxf
)),(,(
11
jixsF
iij
n
jk
kkk
sxf
1
1
),(
1
1
1
),(
i
k
kkk
sxf
)),(,(
11
jixsF
iij
n
jk
kkk
sxf
1
1
),(
n,1
nk,
,,1 n
nk,
.,nk
чим P
Пусть x Rn, 1 ≤ i ≤ j ≤ n, x(i, j) = (xi, …, xj)T, s
,
j –i+1(si –1
Задача P
) следующую задачу оптимизации:
F
j–i+1
xk Xk(s
j –i+1(si –1
(x(i, j), s
k –1
,
) определяет последовательность управлений для ша-
) =
i –1
) и sk = k(xk, s
→ max при условиях
) для всех k
k –1
i –1
S
i –1
sj
,
Sj. Обозна-
гов с номерами от i до j, которая с максимальным эффектом переводит систему
из состояния s
в одно из состояний, входящих в
i –1
Теорема 4.1 (оптимальность частей оптимального решения). Пусть
x* =
=
вектор x*(i, j) =
– оптимальное решение задачи Pn(s0, Sn). Положим
для k
= S * и
=
для k
Если 1 ≤ i ≤ j ≤ n, то
является оптимальным решением задачи
= s0,
Доказательство. Предположим, что вектор x*(i, j) не является оптималь-
ным решением задачи
и последовательность состояний s
sk = k(xk, s
) для всех k
k –1
Тогда существуют вектор x(i, j) = (xi, …, xj)T
sj
, …, sj такие, что s
i –1
и
i –1
=
, xk Xk(s
k –1
),
F
(x*(i, j), s
j –i+1
Построим вектор x0 = (
=
) =
i –1
для k
| k
<
= F
j –i+1
)T следующим образом:
= xk для k
(x(i, j), s
i –1
).
Вектор x0 удовлетворяет условиям (4.2) и
Fn(x*, s0) =
<
+
+
+
+
<
= Fn(x0, s0),
что противоречит выбору x*. #
Теорема 4.1 доказывает, что всякий «отрезок» оптимального управления
тоже является оптимальным управлением в соответствующей задаче ДП.
Обозначение. Для k
и s S
положим Qk(s) = P
k –1
n –k +1
(s, S *).
Задача Qk(s) находит управление, которое оптимально для шагов с номе-
рами i
при условии, что к шагу k система приходит в состоянии s. Понят-
но, что эта задача Qk(s) может быть неразрешима.
Определения и обозначения. Пусть k
s S
и задача Qk(s) раз-
k –1
решима.
x(k, s) = (xj(k, s) | j
ное управление для шагов с номерами j
)T – решение задачи Qk(s). Это условно оптималь-
47

)(*sZ
k
= F
)(*sZ
k
B(n, s) = max{ fn(xn, s) | xn Xn(s), n(xn, s) S
*
} для s S
n –1
,
(4.3)
B(k, s) = max{ fk(xk, s) + B(k + 1, k(xk, s)) | xk Xk(s)} для k
,1,1 n
s S
k –1
.
(4.4)
n,1
)(*sZ
k
= sup{
n
kj
jjj
sxf ),(
1
| s
k –1
= s, sn S * и sj = j(xj, s
j –1
), xj Xj(s
j –1
)
для j
nk,
}.
(4.5)
B(n, s) = sup{ fn(xn, s) | xn Xn(s), n(xn, s) S
*
}.
(4.6)
B(k, s) = sup{ fk(xk, s) + B(k + 1, k(xk, s)) | xk Xk(s)}.
(4.7)
)(*sZ
k
41
(x(k, s), s) – условный максимум 41 при состоянии s на шаге k.
n –k +1
– это максимальный эффект, достижимый на шагах k, …, n, если
шаг k начинается в состоянии s.
4.2. Уравнения Беллмана
Рассмотрим систему функциональных уравнений
Определения и обозначение
Функцию B(k, s) называют функцией Беллмана, а уравнения (4.3), (4.4) –
уравнениями Беллмана.
Задачу максимизации, решение которой определяет значение B(k, s) в соответствии с (4.3) и (4.4), обозначим Ak(s).
Уравнение Беллмана для k < n использует значения функции B( j, s) при
j = k + 1 для вычисления ее значений при j = k. Такие уравнения называют ре-
куррентными.
Понятно, что значение B(k, s) R определено для k
и s S
, если и
k –1
только если соответствующая задача Ak(s) разрешима. В частности, значение
B(n, s) в (4.3) не определено, если никакое управление xn Xn(s) не переводит
объект из состояния s в одно из терминальных состояний. При вычислении
B(k, s) для k < n по формуле (4.4) учитываются, естественно, только те xk
Xk(s), для которых значение B(k + 1, k(xk, s)) определено.
Чтобы обойти трудности, связанные с возможной неразрешимостью задач
Qk(s) и Ak(s), заменим в этих задачах максимумы супремумами.
Определения
Если M = , то sup M = – и inf M = + .
Задача Qk(s), k ≤ n, s S
Задача An(s), s S
n –1
:
Задача Ak(s), k < n, s S
k –1
k –1
:
:
При таких формулировках задач Qk(s) и Ak(s), допуская бесконечные зна-
чения функций
В теории оптимизации термин «условный максимум» имеет другое значение.
48
и B(k, s), можем доказать основной результат теории ДП.

Теорема 4.2 (оптимальность функции Беллмана). B(k, s) =
)(*sZ
k
n,1
n,1
)(
*
1sZk
)),(φ(
*
1
sxZ
kk
n
kj
jjj
sxf ),(
1
nk,
).(*sZ
k
).(*sZ
k
nk ,1
n
kj
jjj
sxf
1
1
),(
)).,(φ(
*
1
sxZ
kkk
)(*sZ
k
n
kj
jjj
sxf ),(
1
nk,
)),(φ(
*
1
sxZ
kkk
)(*sZ
k
,,1 n
nk,
.,nk
.,nk
)(*sZ
n
= max{ fn(xn, s) | xn Xn(s), n(xn, s) S *} для s S
n –1
,
(4.8)
)(*sZ
k
= max{ fk(xk, s) +
)),(φ(
*
1
sxZ
kkk
| xk Xk(s)} для k
1,1 n
, s S
k –1
.
(4.9)
42
для k
и s S
.
k –1
Доказательство. Проведем индукцию по k
, начиная с k = n. Задачи
Qn(s) и An(s) совпадают, поэтому теорема верна при k = n.
Допустим, что теорема верна для k + 1:
Тогда для любых s S
fk(x, s) + B(k + 1, k(x, s)) = fk(x, s) +
≤ sup{
| s
k –1
и x Xk(s) имеем
k–1
= s, sn S * и sj = j(xj, s
), xj Xj(s
j –1
= B(k+1, s) для всех s Sk.
≤
) для всех j
j –1
} =
(Здесь неравенство обосновано следующим рассуждением: левая часть
неравенства – это наилучший результат, который можно получить, если на шаге k в состоянии s применить управление x, а далее использовать условно оптимальное управление; правая же часть неравенства – это наилучший результат,
который можно получить, начиная с шага k в том же состоянии).
Следовательно, B(k, s) = sup{ fk(x, s) + B(k + 1, k(x, s)) | x Xk(s)} ≤
Если же sn S *, xk Xk(s), sk = k(xk, s) и для всех j
соотношения sj = j(xj, s
) и xj Xk(s
j –1
j –1
), то
≤
выполняются
Поэтому, используя предположение индукции, получим
= sup{
для всех j
} ≤ sup{ fk(xk, s) +
| s
= s, sn S * и sj = j(xj, s
k –1
), xj Xk(s
j –1
| xk Xk(s)} =
j –1
)
= sup{ fk(xk, s) + B(k+1, k(xk, s)) | xk Xk(s)} = B(k, s).
Следовательно,
= B(k, s). #
Следствие 4.242. Пусть задачи Qk(s) и Ak(s) записаны в виде (4.5) – (4.7).
(а) Если одна из задач Qk(s) и Ak(s) несовместна или неограниченна, то и
другая несовместна или, соответственно, неограниченна.
(б) Пусть k
x = (xj | j
)T, s
= s S
k–1
, sj = j(xj, s
k –1
) для всех j
j –1
Вектор x является решением задачи Qk(s), если и только если xj является решением задачи Aj(s
) для каждого j
j–1
Учитывая теорему (4.2) и предполагая, что супремумы в задачах Ak(s) до-
стигаются, запишем уравнения Беллмана следующим образом:
Уравнение (4.8) формализует следующее интуитивно ясное соображение.
Если к последнему шагу система пришла в состоянии s, то эффекты предыдущих шагов уже определены, поэтому задача максимизации суммарного эффек-
Доказательство – в приложении А.
49

та сводится к поиску допустимого на шаге n управления, которое с максималь-
)(*sZ
k
)(
*
1sZk
)(
*
1sZk
= max{ f
k –1(xk –1
, s) +
)),((
11
*
sxZ
kkk
| x
k –1
X
k –1
(s)}.
(4.10)
)),((
11
*
sxZ
kkk
)(
*
1sZk
)(*sZ
k
n,2
)(
*
1
sZ
= max{ f1(x1, s) +
)),((
11*2
sxZ
| x1 X1(s)}.
(4.11)
)(
*
1
sZ
,1,1 n
),(
*
1 kksZ
)(*sZ
k
)(*sZ
k
ным эффектом переводит систему в одно из терминальных состояний. Другими
словами, формула (4.8) при фиксированном s описывает задачу оптимизации по
переменной xn при ограничениях xn Xn(s) и n(xn, s) S *. Сложность этой задачи определяется свойствами функций fn(xn, s), n(xn, s) и множеств Xn(s), S * и
увеличивается тем, что задачу нужно решить для всех s S
(параметрическая
n –1
оптимизация).
Формула (4.9) утверждает, что оптимальное управление для шага k < n (в
отличие от управления для шага n) не обязательно максимизирует эффект, полученный на текущем шаге. Это управление следует выбрать так, чтобы максимизировать сумму эффекта, полученного на шаге k, и наилучшего суммарного
результата, который можно получить на шагах с номерами от k + 1 до n из того
состояния, в котором система закончит шаг k.
Если k > 1 и удалось вычислить функцию
нение (4.9) позволяет построить функцию
для всех s S
для всех s S
, то урав-
k –1
. Действи-
k –2
тельно, заменим k на k – 1 в (4.9):
Если s S
му в (4.10) значения
каждого s S
ной x
при ограничении x
k –1
Если xk – скалярная переменная, то вычисление
и x
k –2
вычисление
k –2
k –1
X
k –1
(s), то
k –1
X
k –1(xk –1
, s) S
определены для всех x
по следствию 4.1, поэто-
k –1
k –1
X
(s). Тогда для
k –1
является задачей оптимизации по перемен-
(s).
k –1
для каждого k
–
это одномерная задача параметрической оптимизации, так как нужно найти
максимум Zk(xk, s) по xk при всех значениях параметра s из множества S
. Фор-
k –1
мулы (4.8) и (4.9), в принципе, позволяют последовательно решать эти задачи
для значений k от n до 2.
При k = 1 формула (4.9) принимает вид
Функцию
нужно найти для s S0 = {s0}, поэтому здесь оптимизация
не параметрическая: достаточно решить задачу оптимизации при s = s0.
Обозначения
Для k
s S
и xk Xk(s) положим Zk(xk, s) = fk(xk, s) +
k –1
где
sk = k(xk, s).
Для s S
и xn Xn(s) положим Zn(xn, s) = fn(xn, s).
n –1
Zk(xk, s) – это максимальный эффект, достижимый на шагах k, …, n, если шаг
k начинается в состоянии s и на этом шаге применяется управление xk. Вспомним,
что
начинается в состоянии s. Следовательно,
– это максимальный эффект, достижимый на шагах k, …, n, если шаг k
= sup{Zk(xk, s) | xk Xk(s)}.
50
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
