Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Методы оптимизации сложных систем. Учебное пособие
.pdf
61
3. Теорема представляет собой лишь необходимое условие оптимально-
1
()vt
2
v
2
v
h
0
h
2
v
0
h
2
v
1
v
2
v
Д
h
2
v
t
сти (…если процесс оптимальный …, то …). В этом обнаруживается сходство с
другими задачами оптимизации (условие экстремума функции многих пере-
менных, уравнение Эйлера-Лагранжа и др.). На практике условие обычно
является и достаточным.
4. Теорема не содержит непосредственных указаний по методике поиска
решения, хотя и дает для этого «ключи». Техника поиска должна стать яснее
после его демонстрации на приводимом ниже примере.
§ 4.3. Оптимальный регулятор уровня
Рассмотрим цилиндрическую емкость с плоским дном и площадью поперечного сечения S(рис. 4.2), в которую осуществляется подвод жидкости через
трубу с изменяемым проходным сечением, характеризуемый текущим значением объемного расхода
(t – время). Изменение проходного сечения
достигается путем поворота расположенной в трубе заслонки на некоторый
угол
. В свою очередь, угол изменяется за счет вращения исполнительного
двигателя Д с угловой скоростью . Ее можно изменять, обеспечивая тем самым управление объектом.
а б
Рис. 4.2. Схема объекта (а) и примерный график изменения
Отбор жидкости с переменным расходом
трубу, в результате чего уровень
от заданного значения
требителя жидкости, но редко, сохраняя постоянные значения на интервалах,
достаточно больших, чтобы была возможность вернуть уровень к
Следовательно, на рассматриваемых далее промежутках времени
ная величина.
жидкости изменяется и может отклоняться
. Считается, что расход
(б)
происходит через вторую
меняется по желанию по-
(рис. 4.2, б).
– постоян-

62
Время возврата требуется сделать минимальным за счет управления дви-
0
00
12
dh
S v v
dt
11
vk
2
d
k
dt
1
k
2
k
1
v
h
2
v
10
x Sh Sh
2 1 2
x v v
12
k k k
uk
,u
00
u u u
00
uk
1
2
,dxxdt
2
.dxudt
гателем. Таким образом, имеет место задача оптимального быстродействия.
Уточним теперь приведенные положения, ориентируясь на формулировки из
предыдущего параграфа. Прежде всего, укажем ограничение технического характе-
ра, согласно которому угловая скорость двигателя по абсолютной величине не может
превосходить некоторого значения
, определяемого конструкцией двигателя
. (4.15)
Введенные выше показатели связаны несколькими простыми уравнениями:
, (4.16)
, (4.17)
. (4.18)
Первое из них – это уравнение баланса объемов. Второе констатирует пропор-
циональность расхода углу открытия заслонки с коэффициентом
, зависящим
от геометрических размеров и других параметров содержащего ее узла. Урав-
нение (4.18) отражает пропорциональность скорости изменения угла частоте
вращения двигателя с коэффициентом
, определяемым параметрами механи-
ческой передачи от двигателя к заслонке.
В уравнениях допущены некоторые упрощения: связь между
самом деле сложнее, чем (4.17), угол
ных пределах, что не учтено в (4.18). Уровень
ограничены и возможные значения
может изменяться лишь в ограничен-
не может быть отрицательным,
в (4.16). Учитывая иллюстративный ха-
и на
рактер рассматриваемого примера, со всем этим можно мириться.
Введем несколько обозначений, чтобы приблизиться к символике, приня-
той в предыдущем параграфе.
Условие (4.3), наложенное на единственное управление
,
, (4.19)
,
.
приобретет теперь
более конкретный вид
где
.
, (4.20)
Уравнения (4.4) запишутся в виде
(4.21)

63
Очевидно также, что
1 2 2
, , 2, 1.f x f u n r
0t
0
h
1
v
2
v
10 20
0, 0xx
к
tt
12
0, 0
кк
xx
0
h
1
v
2
v
0u
1 1 2 2 1 2 2
H f f x u
1
1
2
1
2
0,
.
dH
dt x
dH
dt x
1
2
11
2 1 2
,,C
C t C
1
C
2
C
2
2
0
uu
2
0
uu
2
1
02
signuu
1
Начальное (при
ным от
уровнем и разными расходами
говоря,
) состояние характеризуется в общем случае отлич-
и могут принимать произвольные значения (с учетом
(4.22)
и
. Вследствие этого, вообще
упомянутых после формул (4.16) – (4.18) ограничений).
Конечному состоянию (при
результате управления должен быть достигнут уровень
) отвечают
, поскольку в
, а расходы
и
должны уравняться для его сохранения.
Поскольку в конечном состоянии обычно требуется установившийся ре-
жим, в этом состоянии всегда должно быть
(двигатель остановлен,
заслонка неподвижна). Следует заметить, что это требование формально нигде
не выдвигается, так как оптимальное быстродействие достигается независимо
от того, остановится процесс в конечном состоянии или «проскочит» его.
Приступим к решению. Составим функцию (4.11)
(4.23)
и систему уравнений (4.12)
Эта система имеет нетривиальное решение для функций
содержащее две произвольные постоянные
бых постоянных
как линейная функция времени t во всем диапазоне его
возможных значений может менять знак не более одного раза (график
и
(4.24)
и
. Существенно, что при лю-
мо-
жет иметь не более одного пересечения с осью t).
В силу требования (4.13), в соответствии с выражением (4.23) и с учетом
ограничений (4.20) получается, что следует выбирать управление по правилу
которое может быть записано и в форме, использующей функцию «знак»
, если
, если
> 0,
< 0,
. (4.25)
анализ.
Считают, что sign(0) = 0. Впрочем, это уточнение ничего не вносит в дальнейший

64
Принимая во внимание только что отмеченный характер изменения
2
u
u
1
0
uu
2 0 3
x u t C
2
1 0 3 4
0
1
2
x u t C C
u
2
2
14
0
2
x
xC
u
12
,xx
4
C
10 20
,xx
2
0
0
dx
udt
4
0C
0
uu
1
0
x
1
x
2
0
x
1
x
2
C
4
=0
C′4=0
,
можно дать еще одну формулировку:
есть кусочно-постоянная функция,
имеющая не более двух интервалов постоянства. Введя для изменения знака
термин «переключение» можно сказать и так: управление может иметь не более
одного переключения
Обратимся теперь к уравнениям (4.21). Если
.
, то
, (4.26)
а вслед за тем
. (4.27)
Исключив t, найдем
. (4.28)
Получилось уравнение семейства фазовых траекторий для координат
Они представляют собой параболы, расположение которых зависит от постоянной
. Ее можно определить из начальных значений
, в чем пока
(увидим, что и потом) нет необходимости. Эти траектории (назовем их семейством 1) показаны на рис. 4.3, а. Изображающая точка движется по ним по
.
стрелкам снизу вверх, поскольку везде
. Одна из траекторий (при
) проходит через начало координат.
Пусть теперь
. Получится семейство парабол, подчиняющихся
уравнению
а б
Рис. 4.3. Фазовые траектории семейства 1 (а) и семейства 2 (б)
Выбор u = 0 в конце процесса переключением не считается ввиду обсуждавшейся пе-
ред формулой (4.23) формальной причины.

65
2
2
14
0
2
x
xC
u
4
C
4
C
10 20
,xx
0
uu
0
uu
0u
0
uu
0
x
1
x
2
0
x
1
x
2
Точка
переключения
x
10, x20
, (4.29)
показанное на рис. 4.3, б (семейство 2 фазовых траекторий; движение сверху
вниз). Пояснения к константе
в той же мере относятся и к
.
На основе анализа этих траекторий уже можно сформулировать определенные предложения по выбору управления. Пусть, например, начальное
состояние таково, что точка
находится в третьем квадранте (рис. 4.4, а).
Из двух значений, диктуемых правилом (4.25), следует выбрать
и сохра-
нять его вплоть до единственного переключения, «разрешенного» доводами,
следующими после формулы (4.25). Изображающая точка будет двигаться по
одной из траекторий семейства 1. После достижения ею траектории семейства
2, ведущей в начало координат, следует выполнить переключение: положить
, а по достижении начала координат положить
. Получающаяся на
фазовой плоскости картина показана на упомянутом рисунке.
а б
Если вначале выбрать
в третьем квадранте, двигаясь по траектории семейства 2, и последующее
единственное переключение не переведет ее на траекторию, ведущую в начало
координат.
Таким образом, необходимые условия оптимального быстродействия для
управления, приводящего к картине рис. 4.4, а, выполнены (можно убедиться и
Рис. 4. 4. Пример оптимальной траектории (а)
и общая картина переключений (б)
, то точка останется еще некоторое время

66
в справедливости неравенства (4.14), хотя для решения оно ничего дополни-
0
uu
0
uu
0
uu
тельно не дает).
Полученные результаты легко обобщаются на случай любого начального
состояния. На рис. 4.4, б показаны части семейств фазовых траекторий, по ко-
торым допускается движение изображающей точки при оптимальном
управлении. Жирными линиями обозначены траектории обоих семейств, веду-
щие в начало координат. Вместе они образуют множество точек, которое
назовем линией переключений.
Если точка начального состояния находится выше этой линии, то следует
выбрать
. Дальнейшее движение будет происходить по траектории се-
мейства 2, проходящей через эту точку, вплоть до достижения изображающей
точкой линии переключений. После этого следует выбрать
; произойдет
переход в начало координат.
Если точка начального состояния находится ниже линии переключений,
то следует выбрать
, а затем осуществить переключение и «спуск» в
начало координат.
В заключение остановимся на некоторых технических соображениях, которые не следуют из теории, но представляют самостоятельный интерес.
максимально возможной скорости, а затем реверсируется и останавливается в
нужные моменты.
Пока предполагалось, что эти моменты определяются графически по фа-
зовым траекториям. Однако поскольку уравнения фазовых траекторий
известны на основании (4.28) и (4.29), графические построения вполне могут
быть заменены вычислениями и поручены ЭВМ в контуре управления.
Важно также отметить, что полученное решение не предполагает нахождения управлений в виде функций времени. Осталось не найденным и само
значение минимального времени перехода в конечное состояние. В принципе
можно получить ответы на эти вопросы, используя зависимости (4.26), (4.27) и
определяя константы из начального состояния.
Однако техническую реализацию это, скорее всего, только затруднит,
увеличивая объем вычислений и погрешности от неточного знания параметров
системы. Поэтому управление в зависимости не от времени, а от фазовых координат (в данном примере это текущий уровень и разность расходов) даже
предпочтительнее. Требуется только иметь соответствующие датчики.
Наконец, заметим, что большинство обсуждавшихся в этом параграфе
особенностей оптимального управления обнаруживается и в других системах
управления, в том числе более сложных.

67
ГЛАВА 5. ДИНАМИЧЕСКОЕ ПРОГРАММИРОВАНИЕ (ДП)
m
,W
W
( 1, 2,..., )
i
w i m
1
m
i
i
Ww
2
i
u
U
12
, ,...,
m
U u u u
M
U M
1
2
§ 5.1. Постановка и примеры задач ДП
Динамическое программирование – это метод решения задач оптимиза-
ции, специально приспособленный к так называемым многошаговым
(многоэтапным) процессам. В то же время многие задачи, изначально не обна-
руживающие признаков многошаговых процессов, могут быть приведены к
нужной для ДП постановке путем изменений первоначальных формулировок,
не приводящих к искажению окончательного результата.
Пусть имеется процесс, который можно разделить на ряд последователь-
ных шагов общим числом
. Это число в одних случаях может быть
фиксировано, а в других – оставаться неопределенным до конца решения задачи. Далее рассматриваются только первые случаи.
Пусть эффективность процесса в целом оценивается показателем (крите-
рием)
который условимся называть затратами или стоимостью проведения
процесса, и уменьшение которого желательно1. Предположим также, что
складывается из затрат
на отдельных шагах процесса
. (5.1)
Критерии, обладающие этим свойством, называют аддитивными. Это свойство
(аддитивность) критерия является обязательным условием применения метода
ДП
.
Считается, что процессом можно управлять, т. е. принимать решения,
влияющие на ход процесса и на критерий. Решение, принимаемое на каждом
шаге i, назовем шаговым управлением
. Решение необязательно является
числом, а может быть набором величин, функцией или задаваться словесным
описанием. Поэтому будем далее говорить не о векторе, а о совокупности ша-
говых управлений. Назовем ее управлением
для процесса в целом и
обозначим
, (5.2)
поместив в фигурные скобки перечень шаговых управлений.
Шаговые управления, вообще говоря, не произвольны, а должны удовле-
творять системе ограничений, согласно которой их совокупность должна
принадлежать некоторому допустимому множеству
:
. (5.3)
рыш» путем перемены знака критерия и ставить целью достижение его максимума.
Как и в других задачах оптимизации, можно свободно заменять «затраты» на «выиг-
Некоторые комментарии к этому условию будут приведены ниже.

68
Требуется найти такое управление U с соблюдением условия (5.3), при
*
W
()WU
*
min ( )W W U
UM
1
1
1
А ●
● B
котором достигается минимум
критерия
, чему соответствует запись
. (5.4)
Такая постановка задачи обнаруживает много общего с формулировками
задач вариационного исчисления и оптимального управления, рассмотренными
ранее. Ее основная особенность заключается в дискретном характере шаговых
управлений
, вследствие чего снимаются вопросы непрерывности, игравшие
важную роль в этих задачах. Кроме того, расширяются возможности применения
численных методов, а значит, компьютерных процедур. Отложив пока более подробное обсуждение достоинств и недостатков ДП, обратимся к примерам.
▲Пример 5.1. Задача о прокладке оптимального пути
Эта задача с различными вариациями упоминается в большинстве учебни-
ков, затрагивающих вопросы динамического программирования. Есть две точки
A и B на местности (можно считать, на карте), между которыми нужно проло-
жить трассу, требующую минимальных затрат при ее реальной постройке.
Соединим точки прямой линией и свяжем с ней сетку с делениями разной
величины (рис. 5.1). Одно деление сетки в основном направлении A – B – это
шаг процесса прокладки (всего их m). Величина деления в перпендикулярном к
основному (поперечном) направлении определяет возможности отклонения
трассы от линии AB. Шаг процесса, а также размер делений и их количество в
поперечном направлении выбираются произвольно, но после того, как выбор
сделан, эти значения сохраняются вплоть до конца решения. Такая ситуация
типична для многих решаемых методом ДП задач, хотя достаточно распространены и случаи появления сетки с параметрами, однозначно определяемыми
сутью задачи.
Известна стоимость прокладки трассы на любом участке между узлами
сетки (точками пересечения ее линий). Требуется выбрать трассу, для которой
общая стоимость прокладки была бы минимальной. Условие (5.1) соблюдается.
они не рассматриваются. Примеры таких задач можно найти в [1].
Рис. 5.1. К примеру 5.1
Существуют постановки и решения задач ДП и для непрерывных процессов. Здесь

69
Решение на каждом шаге
i
i
i
/2
1
12
, ,...,
m
u u u
1
m
i
i
uK
()
ii
wu
( 1, 2,..., )im
1
()
m
ii
i
W w u max
1
ном направлении или угла
состоит в выборе очередного узла в попереч-
наклона трассы к линии AB, как это показано на
рис. 5.1 для первого шага. На решения (шаговые управления) могут быть нало-
жены ограничения, соответствующие условию (5.3). Например, очередной
выбираемый узел не должен выходить за пределы сетки или угол
не должен
быть больше
му направлению, «попятных» движений
по модулю, чтобы не возникало противоположных основно-
.
В приведенной формулировке точки A и B фиксированы. Возможны и
случаи, когда их тоже стоит варьировать. Скажем, трасса – это канал через пе-
ремычку, разделяющую два побережья. Тогда целесообразно задаваться
некоторыми множествами точек на побережьях и выбирать из них начало и конец трассы. Получается ситуация, аналогичная «задаче с незакрепленными
концами» в вариационном исчислении или условиям (4.6), (4.7) в задаче оптимального управления.▼
▲Пример 5.2. Задача об эксплуатации оборудования
Имеется агрегат, который предполагается эксплуатировать m лет. В нача-
ле каждого года принимается решение о мероприятиях по его обслуживанию на
предстоящий год. В частности, это может быть просто отсутствие обслуживания, профилактика отдельных узлов, их замена и т. д. вплоть до приобретения
нового и замены агрегата в целом. Считаются известными затраты на обслужи-
вание и ликвидацию возможных отказов по мере нарастания срока
эксплуатации. Известны также доходы от использования агрегата, которые по-
сле вычитания затрат требуется максимизировать.
Отметим качественный характер шаговых (ежегодных) управлений, до-
ступных в основном словесному описанию.▼
▲Пример 5.3. Задача о распределении ресурсов
Существует m предприятий и предназначенный для них однородный ре-
сурс (деньги, сырье, оборудование и т. п.) величины K. Ресурс должен быть
распределен между предприятиями в объемах
с соблюдением усло-
вия полного его расходования
Каждое из предприятий приносит доход, зависящий от величины вло-
женного ресурса
Требуется так выбрать объемы, чтобы суммарный доход достигал макси-
мума
В общем случае попятные перемещения все же могут быть частями оптимальной
трассы. Вспомним хотя бы «серпантины» горных дорог.
. (5.5)
.
. (5.6)

70
В отличие от первых двух примеров с этой постановкой задачи не связан
i
u
n
()j
i
S
никакой процесс. В то же время для использования приемов ДП процесс может
быть искусственно создан. Предприятия можно расположить в некотором порядке (произвольно) и поочередно присваивать им некоторый объем ресурса с
соблюдением условия (5.5). Получится та или иная последовательность значе-
ний объемов
, которую уже можно рассматривать как процесс, где шагом
является переход от одного предприятия к другому. Затем выбирается последо-
вательность, наилучшая с точки зрения критерия (5.6).▼
§ 5.2. Траектории в пространстве состояний. Принцип оптимальности
Для формулировки задачи ДП в общем виде полезно использовать поня-
тие состояния процесса, понимая под ним набор признаков, характеризующих
процесс на каждом его шаге. Конкретный вид этих признаков определяется ре-
альным содержанием задачи. Так, для прокладываемой трассы (пример 5.1) –
это положение точки трассы на местности (или на карте). Для процесса обслу-
живания оборудования (пример 5.2) – это перечень возможных мероприятий на
предстоящий год. В задаче о распределении ресурсов (пример 5.3) – это размер
ресурса, оставшегося к моменту выбора его величины для очередного предпри-
ятия. Последовательность состояний, получающуюся в ходе их выбора, назовем
траекторией в пространстве состояний. В некоторых случаях с траекторией
можно связать ту или иную систему физических пространственных координат,
как в ситуации с прокладкой трассы. Тогда ей может быть дана естественная
геометрическая трактовка. В других случаях это не удается, а геометрическое
истолкование может быть только условным в соответствии, например, с такой
схемой.
Пронумеруем все возможные состояния процесса натуральными числами
от 1 до
и введем для них обозначения
, где в скобках указан номер состо-
яния, а нижний индекс указывает номер шага, на котором это состояние может
реализоваться. Введем систему двух декартовых координат, в которой по оси
абсцисс отложим числа шагов от 1 до m, а символом 0 обозначим начало пер-
вого шага. По оси ординат отложим номера состояний. В этой системе для
каждого шага укажем точку, отвечающую одному из возможных состояний.
Совокупность этих точек и образует некоторую траекторию. Для выразитель-
ности можно соединить точки отрезками прямых, как это сделано на рис. 5.2.
Там же приведено обозначение одного из состояний (показано стрелкой). Можно отметить внешнее сходство рис. 5.1 и 5.2.
Для практических приложений интересно, заданы ли состояния в начале
первого и в конце последнего шага (концы траектории «закреплены») или толь-
ко указана их принадлежность к некоторым множествам, как это обсуждалось в
конце примера 5.1. Из дальнейшего будет видно, что на процессе решения разница между этими вариантами сказывается мало.
Важно, что для решения геометрические построения, подобные изображенным на рис. 5.2, совершенно необязательны. Необходимы лишь вычислительные
операции. Это позволяет в полной мере полагаться на возможности современных
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
