Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Теория оптимального управления вводный курс лекций. Учебное пособие

.pdf
Скачиваний:
0
Добавлен:
11.08.2026
Размер:
533 Кб
Скачать

г) задача для нижней границы конечной интегральной воронки

 

k (t) = bumax Akα (t)ent μk (t), k (T ) = kT .

(19)

Все эти задачи решаются в явном виде, так как можно записать общее решение дифференциального уравнения Бернулли (см. приложение 3) и, используя начальное или конечное условие, найти произвольную постоянную.

Далее оптимальная траектория k (t) составляется из участков магистрали, границ интегральных воронок и, возможно, прямой k = kmin в соответствии с правилом, сформулированным в начале этого пункта. Конкретный вид оптимальной траектории зависит от взаимного расположения упомянутых графиков.

Рассмотрим один из типичных случаев. На рис. 11 показаны: магистраль (1), границы интегральных воронок (2), (3), (4), (5) и минимально допустимый уровень фондовооруженности (6).

В данном случае оптимальная траектория определяется следующим образом.

А) На промежутке [0,t1 ], где t1 – первая точка переключения (момент пересечения кривой (3) с прямой (6)), движение происходит из начального положения k0 по нижней границе начальной интегральной воронки (3), так как для каждого фиксированного t из [0,t1 ] точки этой кривой ближе к точке магистрали (1), чем все другие допустимые точки.

Рис. 11

61

Б) На промежутке [t1,t2 ] (от первой точки переключения до второй точки переключения) движение происходит с минимально допустимым уровнем

фондовооруженности kmin до пересечения с магистралью (1).

В) На промежутке [t2 ,t3 ] магистраль (1) попадает в множество допустимых значений фондовооруженности, поэтому здесь движение происходит по магистрали до ее пересечения с нижней границей (5) конечной интеграль-

ной воронки.

Г) На промежутке [t3,T ] эта часть оптимальной траектории совпадает с

нижней границей (5) конечной интегральной воронки.

7. Построим оптимальное управление.

После построения оптимальной траектории k (t) оптимальное управле-

ние находится из уравнения динамики (1)

 

 

 

k (t) = bu(t) Akα (t)ent μk (t), t [0,T ]

(20)

после подстановки в него

 

 

(t):

 

k

 

 

 

 

 

(t) =

 

k

(t) + μ

 

(t)

, t [0,T ] .

 

 

 

 

u

k

(21)

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

Abk α (t) ent

 

На участках движения по границам интегральных воронок оптимальное

управление

u

(t) принимает одно из граничных значений – umax

и umin , по-

этому формула (21) используется практически только для нахождения u (t)

на промежутке движения по магистрали или по прямой k = kmin . Оптимальное управление, соответствующее рис. 11, показано на рис. 12.

62

Рис. 12 8. Найдем оптимальное значение функционала.

Максимальное значение интегрального среднедушевого дисконтированного потребления находится подстановкой под знак интеграла в (7):

1) оптимального управления u(t) = u (t), 2) максимальной производительности труда, соответствующей оптимальной фондовооруженности: x(t) = Akα (t)ent = Ak α (t)ent . После этого находится Imax . При этом ин-

теграл по всему промежутку [0,T ] разбивается на сумму интегралов по час-

тичным промежуткам [0, t1], [t1,t2 ], [t2 ,t3 ], [t3,T ], на каждом из которых

используются соответствующие формулы для u (t) и k (t).

63

7. СИНТЕЗ ОПТИМАЛЬНОГО УПРАВЛЕНИЯ. МЕТОД ГАМИЛЬТОНА – БЕЛЛМАНА

Все рассмотренные ранее задачи оптимального управления решались в классе так называемых программных управлений, т. е. управлений u(t) – функций одного переменного t , времени. Построенное программное управление решает задачу, если система не подвержена внешним воздействиям и нет необходимости корректировать построенную программу. В случае когда требуется учитывать реальное состояние системы и строить управление с учетом этого состояния, приходится решать задачу в классе позиционных

управлений u(t, x) – функций двух переменных, времени t и фазовой пере-

менной x . В таком случае говорят о синтезе управления – построении такой

функции u(t, x) , которая

при подстановке текущего состояния

x(t):

u(t, x)

 

x=x(t) =u(t, x(t)) порождает текущее управляющее воздействие.

 

 

 

 

 

Рассмотрим задачу оптимального управления

 

 

 

T

 

 

 

 

 

I (x,u) = f

(t,x(t),u(t))dt + F(x(T)) min ,

(1)

0

 

 

 

 

 

x(t) = ϕ (t,x(t),u(t)),

t [0,T ],

(2)

 

 

 

x(0) = x0 ,

(3)

 

 

(x(t),u(t)) V t ,

t [0,T ],

(4)

рассмотренную ранее в п. 4, как задачу синтеза оптимального управления. Воспользуемся основной теоремой о достаточных условиях оптимальности (вариант с терминальным слагаемым в минимизируемом функционале). В силу этой теоремы следует максимизировать функцию

R(t,x,u) =

W +

W ϕ (t,x,u) f (t, x,u)

(5)

 

t

x

 

при каждом t как функцию (x,u) и минимизировать функцию

Φ(x) =W (T,x) +F(x)

(6)

64

как функцию аргумента x. Начнем с частичного решения первой задачи и будем искать управление, максимизирующее функцию R(t, x,u) по u при

фиксированных t и x : maxR(t, x,u) . Здесь множество V t x представляет со-

u V t x

бой сечение множества V t при фиксированном x : V t x ={u :(u,x) V t}. На-

помним, что в конструкцию функции R(t, x,u) входит функция W(t, x), от которой зависит результат упомянутой максимизации. Функцию W(t, x)

можно выбрать так, чтобы функция maxR(t, x,u) не зависела от x :

u V t x

maxR(t, x,u) =c(t), t [0,T] .

(7)

u V t x

 

Если, кроме того, W(t, x) такова, что Φ(x) =W (T,x) +F(x) оказывается кон-

стантой:

Φ(x) =W (T,x) +F(x) =d ,

(8)

то при каждом x функция

 

u(t, x) =argmax R(t,x,v)

(9)

v V t x

 

удовлетворяет условиям основной теоремы, и поэтому для решения задачи синтеза оптимального управления остается сформулировать соотношения

для нахождения функции W(t,x), удовлетворяющей условиям (7) и (8). Эти

соотношения представляют собой краевую задачу Гамильтона Беллмана

W +max{

W ϕ t, x,u

f

t,x,u }=c(t), t [0,T],

(10)

t u V t x

x

( )

 

( )

 

 

 

W(T,x) =d F(x) .

(11)

Если W(t, x)– решение этой краевой задачи, то функция u(t, x) =u(t, x), определенная равенством (9), решает задачу синтеза оптимального управления.

Для приближенного построения функции W(t, x) можно воспользоваться следующей схемой. Для определенности положим c(t) =0, d =0 . Заменим в

уравнении (10) производную

W(t, x)

разностным отношением

 

t

 

W (t,x)W(t ,x)

Δ=T / N ,

, задав достаточно малое значение

65

и запишем возникающее таким образом уравнение в виде

 

W(t ,x) =W (t,x) max{W (t, x) ϕ t, x,u

)

f

t,x,u }, t [0,T]. (12)

 

u V t x

x

(

 

 

 

(

 

)

Будем искать решение этого уравнения

 

 

 

 

 

 

 

 

W(t,x), удовлетворяющее краевому

условию

 

 

 

 

 

 

 

 

 

 

 

W(T,x) =−F(x) .

 

 

 

 

 

(13)

Для t =T имеем

 

 

 

 

 

 

 

 

 

 

W(T , x) =−F(x) max{

W(T,x) ϕ T,x,u

f T,x,u }, t [0,T].

 

u VT x

x

 

(

 

)

 

 

(

)

Далее находим

 

 

 

 

 

 

 

 

 

 

 

W(T 2 ,x) =W(T ,x) +

 

 

 

 

max {

W (T ,x) ϕ T

,x,u

f

 

T

,x,u }, t [0,T];

u VT, x

x

(

)

 

(

 

 

 

)

Продолжая этот процесс, на последнем шаге построим сечение W (0,x) .

Отметим, что для систем с дискретным временем задача синтеза оптимального управления решается за конечное число шагов с точным построением функции W(T,x) . Действительно, вернемся к постановке задачи для дискретного времени:

T1

 

I(x,u) =f (t,x(t),u(t)) +F(x(T)) min

(14)

t=0

 

x(t +1) =ϕ(t, x(t),u(t)), t =0,1,...,T 1,

(15)

x(0) = x0 ,

(16)

(x(t),u(t)) V t , t =0,1,...,T 1, x(T) VT .

(17)

x

 

Снова воспользуемся основной теоремой о достаточных условиях оптимальности (вариант с терминальным слагаемым в минимизируемом функционале), которая формулируется с использованием функций R(t, x,u)и

Φ(x), определенных равенствами

R(t,x,u) = W (t +1,ϕ(t,x,u)) W (t, x) f (t, x,u),

Φ(x) = W(T, x) + F(x).

66

Как и в случае непрерывного времени, сначала максимизируем функцию

R(t, x,u) по u при фиксированных t и x : maxR(t, x,u) . Здесь множество

 

u V t x

V t x

представляет собой сечение множества V t при фиксированном x :

V t x

={u :(u,x) V t}. Напомним, что в конструкцию функции R(t, x,u)

входит функция W(t, x), от которой зависит результат упомянутой максими-

зации. Функцию W(t, x) можно выбрать так, чтобы функция

maxR(t, x,u)

 

u V t x

не зависела от x :

 

maxR(t, x,u) =c(t), t =0,1,...,T 1.

(18)

u V t x

 

Если, кроме того, W(t, x) такова, что Φ(x) =W (T,x) +F(x) оказывается кон-

стантой:

 

Φ(x) =W (T,x) +F(x) =d ,

(19)

то при каждом x функция

 

u(t, x) =argmax R(t,x,v)

(20)

v V t x

 

удовлетворяет условиям основной теоремы, и поэтому для решения задачи синтеза оптимального управления остается сформулировать соотношения для нахождения функции W(t, x), удовлетворяющей условиям (18) и (19). Эти соотношения представляют собой краевую задачу Гамильтона Беллмана

max{W(t +1,ϕ(t, x,u))W (t, x))f (t, x,u)}=c(t),

t =0,...,T 1,

(21)

u V t x

 

 

 

 

 

 

 

 

 

 

W(T,x) =d F(x) .

 

(22)

Уравнение (21) допускает запись в рекуррентном виде

 

W(t,x)

=max{W (t +1,ϕ(t,x,u))f (t, x,u)}c(t),

t =0,...,T 1,

 

 

u V t x

 

 

 

 

 

 

позволяющем

последовательно

найти

все

сечения

функции

W(t,x), t =T,T 1,...,0

начиная с W(T,x) , определенного равенством (22).

Если

W(t, x)

решение краевой задачи (21), (22), то

функция

u(t, x) =u(t, x), определенная равенством (20), решает задачу синтеза оптимального управления.

67

Приведем в качестве примера задачи (14)–(17), задачу, возникающую при оптимизации распределения капитальных вложений между предприятиями (см. [2], с. 250).

Пусть А – заданный фонд капитальных вложений, который надо распределить с максимальной эффективностью между n предприятий, для каждого из которых задана эффективность реализации капитальных вложений

ψi (y), i =1,...,n. Предполагается, что функции ψi – неотрицательные и неубывающие. Математическая модель этой задачи имеет вид

n

n

 

ψi (yi ) max,

yi = A, yi 0, i =1,...,n.

(23)

i=1

i=1

 

Сведем задачу (23) к задаче (14)–(17). Для этого введем обозначения

T =n, t =i1, u(t) = yi , t =1,...,T, f (t,u(t)) =−ψi (yi ).

В новых обозначениях задача (23) принимает вид задачи оптимального управления с дискретным временем:

T1

I(x,u) =f (t,x(t)) min,

t=0

x(t +1) = x(t) +u(t), t =0,1,...,T 1, x(0) =0,

x(T) = A, u(t) 0, t =0,...,T 1.

Избавимся от терминального условия x(T) = A, добавив терминальное слагаемое F(x) = M (xA)2 , где M >0 произвольно большое число, в минимизируемый функционал:

T1

J(x,u) =f (t, x(t)) +M (x(T)A)2 .

t=0

Таким образом, задача (23) сведена к задаче

J(x,u) min, x(t +1) = x(t) +u(t), t =0,...,T 1, x(0) =0, u(t) 0.

68

СПИСОК ЛИТЕРАТУРЫ

1.Теория оптимального управления: программа курса, варианты индивидуальных заданий, вопросы к итоговому экзамену / Перм. ун-т; сост. В. П. Максимов. – Пермь, 2001.

2.Основы теории оптимального управления / под ред. В. Ф. Кротова. М.: Высшая школа, 1990.

3.Лагоша Б.А. Оптимальное управление в экономике. М.: Финансы и статистика, 2003.

4.Алексеев В. М., Тихомиров В. М., Фомин С. В. Оптимальное управление. М.: Наука, 1979.

5.Лутманов С. В. Курс лекций по методам оптимизации. Ижевск: НИЦ Регулярная и хаотическая динамика, 2001.

6.Галеев Э. М., Тихомиров В. М. Оптимизация: теория, примеры, задачи. М.: Эдиториал УРССС, 2000.

7.Алексеев В. М., Галеев Э. М., Тихомиров В. М. Сборник задач по оптимизации. М.: Наука, 1984.

69

ЧАСТЬ 2. ЗАДАЧИ ДЛЯ САМОСТОЯТЕЛЬНОЙ РАБОТЫ

1. Некоторые задачи о быстродействии

Время перемещения материального шарика под действием силы тяжести из точки A(0,0) в точку B(x0, y0 ) по кривой y = f ( x) определяется равенст-

вом (движение вертикально вниз соответствует положительному направлению оси y )

x

T = 0

0

1+y(x) 2

( ) dx (закон Галилея).

2gy x

Решить задачу минимизации T на заданных семействах траекторий,

представляющих собой ломаные ACB , параметризованные координатами

точки C(α,β ) .

Варианты

1.B(1,1); C {(α,β ):α 0,2;0,8 ;0,5α β 0,3+0,5α}.

2.B(1,2); C {(α,β ):β =1;α 0,1;0,9 }.

3.B(1,2); C {(α,β ):α 0,2;0,7 ;α β 2}.

4.B(1,1); C {(α,β ):α 0,1;0,8 ;0,2β 0,4}.

5.B(2,1); C {(α,β ):β 0,1 ;1β α 2β}.

6.B(3,2); C {(α,β ):α 1,2 ;1α β α}.

7.B(2,2); C {(α,β ): α 1 + β 1 1}.

8.B(2,3); C {(α,β ):α 1,5;2 ,β 1,2 }.

9.B(1,4); C {(α,β ):α 0,1 ,α +1β α +2}.

10.B(4,1); C {(α,β ):β 0,1 ,β +1α β + 2}.

11.B(3,3); C {(α,β ):α 2,3 ,β 1,2 }.

12.B(3,3); C {(α,β ):α 0,3 ,β 0,3 ,α 2β α +2}.

13.B(2,2); C {(α,β ):α 1,2 ,β 1,2 }.

14.B(3,2); C {(α,β ):α 2,3 ,β 1,2 }.

70

Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]