Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Аналитическое конструирование оптимальных регуляторов. Учебное пособие

.pdf
Скачиваний:
0
Добавлен:
12.08.2026
Размер:
1 Мб
Скачать

Вопросы для самопроверки

1.К каким системам управления применим принцип максимума?

2.Запишите выражение для гамильтониана.

3.Сформулируйте теорему о максимуме.

4.В чем состоит физический смысл гамильтониана?

5.В чем заключается физический смысл оптимального управления?

6.Сформулируйте область целесообразного использования принципа максимума.

Литература

1.Певзнер Л. Д., Чураков Е. П. Математические основы теории систем: учебное пособие. М.: Высшая школа, 2009. 503 с.: ил.

2.Афанасьев В. Н., Колмановский В. Б., Носов В. Р. Математическая теория конструирования систем управления. М.: Высшая школа, 1998. 574 с.

3.Ванько В. И., Ермошина О. В., Кувыркин Г. Н. Вариационное исчисление и оптимальное управление: учебник для вузов / под ред. В. С. Зарубина, А. П. Крищенко. 2-е изд. М.: Изд-во МГТУ, 2001. 488 с.

4.Куропаткин П. В. Оптимальные и адаптивные системы: учеб. пособие для вузов. М.: Высш. школа, 1980. 287 с.

41

Раздел 5. СИНТЕЗ ОПТИМАЛЬНОГО ПО БЫСТРОДЕЙСТВИЮ УПРАВЛЕНИЯ

План

5.1.Теорема об n интервалах.

5.2.Синтез алгоритмов оптимальных управлений. Метод «сшивания» решений.

5.1. Теорема об n интервалах

Пусть математическая модель одномерного объекта задана уравнениями состояния:

X = AX + Bu(t) при

 

u(t)

 

1.

(5.1)

 

 

Составим функцию Гамильтона для неклассической вариационной задачи оптимального по быстродействию управления

H =ψ T AX + BTψu(t) =ψ1x1 +ψ2 x2

+ +

(5.2)

+ψn1xn ψn (an1xn + an2 xn1 + + a0 x1 ) +b0ψnu(t).

 

Так как от управления u(t) зависит только последнее слагаемое, то функция Гамильтона имеет максимум, когда

b0 ψnu0 (t) = max{bψnu(t)},

u 1

откуда следует закон оптимального по быстродействию управления:

u0 (t) =1 sign ψ

(t)

]

.

(5.3)

[ n

 

 

При этом функция u0(t) принимает два значения:

u0

+1

приψ

n

(t) > 0;

(5.4)

(t) =

 

(t) < 0

 

1

приψn

 

и меняет знак столько раз, сколько кривая ψn(t) пересекает ось времени.

Для нахождения вспомогательной переменной ψn(t) составим сопряженные уравнения Гамильтона

ψ1 (t) = −∂H / x1 = a0ψn (t);

 

 

 

ψ2 (t) = −∂H / x2

= a1ψn (t) ψ1 (t);

 

 

 

(5.5)

........................................................

 

 

 

ψ

n

(t) = −∂H / x = a ψ

(t) ψ

n1

(t).

 

 

n

n1 n

 

 

 

 

 

 

42

 

 

 

 

Приведем систему уравнений (5.5) к одному уравнению. Для этого вычтем из первого уравнения системы (5.5) все остальные, продифференцировав предварительно второе уравнение один раз и умножив на (–1)1, третье – два раза и умножив на (–1)2 и т. д. до последнего, которое дифференцируем (n – 1) раз и умножаем на (–1)(n-1). В результате этого после группирования получим

(1)nψn(n) (t) + (1)(n1) an1ψn(n1) (t) + .

(5.6)

+(1)1 a ψ

n

(t) a ψ

(t) = 0

 

1

0 n

 

 

Предполагаем, что собственные числа матрицы А в (5.1) являются различными вещественными, тогда корни уравнения (5.6) также будут вещественными различными числамиpi. В этом случае

n

 

ψn (t) = Ci epi t .

(5.7)

i=1

Функция ψn(t), определяемая суммой экспонент с вещественными показателями степени, изменит знак не более (n – 1) раз, поэтому управление (5.3) имеет не более n интервалов постоян-

ных значений u =1. Таким образом, доказана теорема об n ин-

тервалах:

Если объект управления описывается линейным дифференциальным уравнением n-го порядка с постоянными коэффициентами и корни его характеристического уравнения различные, отрицательные или нулевые, то для оптимального по быстродействию управления необходимо и достаточно не более n интервалов мак-

симального значения управления u =Umax , а знаки на интервалах должны чередоваться (n – 1) раз.

5.2. Синтез алгоритмов оптимальных управлений. Метод «сшивания» решений

Основная задача при определении алгоритмов оптимальных управлений u0(t) состоит в нахождении моментов переключения реле

tn (n =1,2 ,n) , так как на основании теоремы об n интервалах

управление является релейным с числом интервалов не более n, на которых u0(t) = ±Umax, и имеет место(n – 1) переключение реле.

Определение моментов переключения tν в общем случае является сложной задачей. Моменты переключения сигнала управле-

43

ния со значения + Umax на значение – Umax можно рассчитать различными методами, например методами «сшивания» решений и математического программирования.

Пусть дифференциальное уравнение одномерного линейного объекта при отсутствии ограничений координат выхода и без учета возмущающих воздействий имеет вид

y(n) +

n a

y(ni) = b u .

(5.8)

 

n 1

0

 

i=1

Тогда для определения tν можно применить способ «сшивания» решений уравнения со знакопеременной правой частьюu(t) = ±Umax.

Запишем известное решение уравнения (5.8) при различных вещественных корнях характеристического уравнения объекта на интервалах:

 

 

n

 

 

 

y(t) = x1 (t) = C0n + Cin exp( pi t);

n =1,2, ,n;

 

 

 

 

i=1

 

 

(5.9)

 

 

n

 

 

 

( j1)

 

 

 

xj (t) = y

j1

 

 

 

(t) = pi Cin exp( pi

t); j = 2,3, ,n;

 

 

 

i=1

 

 

 

где Сопределяется на интервалах ν значением u(t) и заданным конечным значением координаты выхода; С– постоянные интегрирования, зависящие от заданного вектора начального и конечного состояний X(t0) и X(T); pi ≠ 0 – корни характеристического уравнения объекта (для устойчивого объекта pi < 0).

Рассмотрим процесс перевода объекта из заданного начально-

го

состояния

t0

= 0,

 

при котором x1 (0) = X10 ; x2 (0) = X20 ;

x

(0) = X

30

;

; x(n)

(0) = X

n0

, в заданное конечное установившееся

3

 

 

 

 

 

 

состояние x1 (T ) = x2 (T ) = x3 (T ) = = x(n) (T ) = 0 .

 

 

Пусть начальное управление u(0) = – Umax, тогда на конце

первого интервала управления

 

 

x1 (t1 ) = C11ep1 t1

+C22ep2 t1

+ +Cn1epn t1 (b0 / a0 )Umax .

(5.10)

 

После переключения реле значение координаты выхода

 

 

x1 (t1 ) = C12ep1 t1

+C22ep2 t1 + +Cn2epn t1 + (b0 / a0 )Umax .

(5.11)

 

 

 

 

 

 

 

44

 

Приравнивая правые части (осуществляя «сшивание» решений), получим

(C11 C12 )ep1 t1 +(C21 C22 )ep2 t1 + +(Cn1 Cn2 )epn t1 =(2b0 / a0 )Umax . (5.12)

Аналогично (5.10–5.12) необходимо записать выражения для x2 (t1 ); x3 (t1 ); ; x(n) (t1 ) . В результате получимn уравнений с2n не-

известными постоянными интегрирования Ci1 и Ci2. Постоянные Ci1 определяются начальными условиями приt = 0, поэтому из уравнений для начала первого интервала запишем

C11 +C21 + +Cn1 (b0 / a0 )Umax = X10 ;

 

 

p1C11 + p2C21 + + pnCn1 = X20 ;

 

(5.13)

...............................................................

 

 

 

 

 

 

 

(n1)

(n1)

(n1)

Cn1 = Xn0

 

 

p1

C11 + p2

C21 + + pn

.

 

Уравнения (5.13) позволяют определить постоянные Ci1, подставив которые в уравнения, записанные после «сшивания» решений в момент первого переключения реле, получим n уравнений для определения постоянных Ci2, которые выражаются через моменты первого переключения t1.

Аналогично продолжаем решение до последнего интервала, для которого постоянные интегрирования Cin будут выражены через tn=T. В результате исключим постоянные интегрирования и получим n трансцендентных уравнений с n неизвестными tν. Решение этих уравнений в общем случае является очень трудоемким

ипроизводится обычно на ЦВМ.

Вслучае, когда уравнение объекта (5.8) имеет n нулевых корней, моменты переключения

tn = 4

 

n

(n 1)!

y(T ) y(0)

 

 

2

 

 

4

b U

 

sin

2n .

(5.14)

 

 

 

 

 

 

0 max

 

 

 

 

На основании выражения (5.14) можно сделать вывод, что моменты переключения tν зависят от начальных и конечных значений координаты выхода объекта, а также от величины Umax.

Если время переходного процесса

T = tn = 4 n

(n 1)!

y(T ) y(0)

 

,

(5.15)

4

b0Umax

 

 

 

45

то моменты tν могут быть определены графически путем деления полуокружности, диаметр которой равен T, на n равных частей и проектирования полученных точек на ось абсцисс.

Особое значение при расчете моментов переключения реле tν имеет выбор знака сигнала управления на первом интервале u10. Если начальное и конечное состояния объекта установившиеся, то

u10 =Umax sign[y(T ) y(0)].

(5.16)

В общем случае выражение для U10 будет более сложным, чем

(5.16).

Вывод.В лекции 5 изложена теорема об n интервалах. Основная задача при определении алгоритмов оптимальных управлений u0(t) состоит в нахождении моментов переключения реле

tn (n =1,2 ,n) , так как на основании теоремы об n интервалах

управление является релейным с числом интервалов не более n, на которых u0(t) = ±Umax, и имеет место (n – 1) переключение реле.

Определение моментов переключения tν в общем случае является сложной задачей. Моменты переключения сигнала управления со значения + Umax на значение – Umax можно рассчитать различными методами, например методами «сшивания» решений, рассмотренными в лекции 5.

Вопросы для самопроверки

1.Сформулируйте теорему «об n интервалах».

2.В чем заключается метод «сшивания» решений?

3.От чего зависят моменты переключения tν?

Литература

1.Певзнер Л. Д., Чураков Е. П. Математические основы теории систем: учебное пособие. М.: Высшая школа, 2009. 503 с.: ил.

2.Афанасьев В. Н., Колмановский В. Б., Носов, В. Р. Математическая теория конструирования систем управления. М.: Высшая школа, 1998. 574 с.

3.Ванько В. И., Ермошина О. В., Кувыркин Г. Н. Вариационное исчисление и оптимальное управление: учебник для вузов / под ред. В. С. Зарубина, А. П. Крищенко. 2-е изд. М.: Изд-во МГТУ, 2001. 488 с.

4.Куропаткин П. В. Оптимальные и адаптивные системы: учеб. пособие для вузов. М.: Высш. школа, 1980. 287 с.

46

Раздел 6. МЕТОД ДИНАМИЧЕСКОГО ПРОГРАММИРОВАНИЯ

План

1.Принцип оптимальности Беллмана. Синтез оптимального управления методом динамического программирования.

2.Численное решение уравнений динамического программирования.

3.Область целесообразного применения.

Метод динамического программирования был разработан почти одновременно с опубликованием принципа максимума. В основе метода динамического программирования лежит принцип оптимальности, сформулированный Беллманом. Согласно этому принципу, оптимальное управление определяется конечной целью управления и состоянием системы в рассматриваемый момент времени, независимо от того, каким образом система пришла в это состояние. Таким образом, будущее оптимальное управление не зависит от его предыстории. Это значит, что любой конечный участок (от любой промежуточной точки до конца) оптимальной траектории является тоже оптимальной траекторией.

Задачей оптимизации считается определение оптимальных управлений U0(t) и траекторий X0(t) из условия минимума (максимума) функционала

J = Tf0 (t, X ,u)dt; T = tк

(6.1)

tн

 

для заданных уравнений состояния объекта

 

X = AX + Bu = f (t, X ,u) ,

(6.2)

а также начальных и конечных фиксированных значений X(tн) и X(T) и интервала tн ≤ t ≤ T при наличии ограничений вида

X (t) Gx и U (t) Gu . Здесь Gx и Gu – заданные допустимые области для координат состояния и управлений.

При этом вводится вспомогательная функция Беллмана

T

S(t, X ) = min[U f0 (t, X ,u)dt] . (6.3)

t

47

Минимум функционала (6.1) при условиях (6.2) зависит от момента времени t+ t, значения X t и конечного момента времени T:

T

S(t′+ ∆t,T, Xt ) = min[U F(t, X ,u)dt], (6.4)

t′+∆t

где t+ t – произвольный промежуточный момент времени в интервале t< t+ t < T;

 

 

– вектор координат состояния в момент

X t = X (t ) + ∆X

времени t+

t.

 

 

 

 

Пусть t

– фиксированный момент времени,

t – малое поло-

жительное число ( t< t

+ t < T). Тогда с учетом (6.4) вспомога-

тельная функция

t′+∆t

T

 

 

 

 

 

 

S(t, X ) = min[u

f0 (t, X ,u)dt + f0 (t, X ,u)dt] =

 

 

 

t

t′+∆t

 

(6.5)

 

t′+∆t

 

 

 

= min[u

f0 (t, X ,u)dt + S(t′+ ∆t,T, Xt )].

 

 

 

t

 

 

 

 

Первое слагаемое в правой части выражения (6.5) с точно-

стью до малых величин более высокого порядка, чем

t, можно

заменить приближенным значением

 

 

 

t′+∆t

 

 

 

 

f0 (t, X ,u)dt = f0 (t, X ,u)t .

 

(6.6)

 

t

 

 

 

 

Второе слагаемое в правой части выражения (6.5), определяю-

щее значение функции

S(t′+ ∆t, X + ∆X ) для

любого

момента

времени t+ t, разложим в ряд Тейлора. Ограничиваясь линейными членами относительно приращений xi и t и переходя к пределу, заменим это слагаемое приближенным значением, если функцияS(t, X) имеет непрерывные частные производные по всемt иxi(t):

S(t + ∆t, X + ∆X ) = S(t, X ) + S

xi + S t =

 

 

 

 

 

n

 

 

 

 

 

 

 

=

x

t

 

 

 

 

 

i 1

i

(6.7)

n

dxi +

S

 

 

 

 

 

 

= S(t, X ) +

S

 

t.

 

 

 

t

 

 

i=1 xi

dt

 

 

 

 

48

На основании (6.5), (6.6)и (6.7) запишем:

 

n

S

dxi +

S

 

t},

S(t, X ) = min{ f0 (t, X ,u)t + S(t, X ) +

 

 

 

u

i=1

xi

dt

t

 

 

 

откуда после деления на t всех членов и перехода к пределу при t 0 получим нелинейное дифференциальное уравнение Беллмана в частных производных относительно неизвестной функции

S(t, X)

 

n

S

fi (t, X ,u) + S} = 0

 

min{ f0 (t, X ,u) +

(6.8)

 

u

i=1

xi

t

 

при условиях

 

xi (t) = fi (t, X ,u) ;

 

 

 

 

 

 

x(t) Gx ,

U (t) Gu ,

tн t T

(6.9)

.

Оптимальное управление U0(t) найдем в результате решения уравнения (6.8). Если координата управления ограничена

U (t) GU , то для внутренней точки области, определяемой множеством GU , условие (6.8) можно заменить функциональными уравнениями в частных производных:

 

 

n

S

 

 

 

 

S

 

 

 

f0 (t, X ,u) +

 

 

fi (t

, X ,u) +

 

= 0;

 

 

x

t

 

 

 

=

 

 

 

 

 

 

 

 

 

i 1

i

 

 

 

 

 

 

(6.10)

 

n

 

S

 

 

 

 

 

 

 

 

 

 

 

 

 

 

f0 (t, X ,u) +

 

 

fi (t, X ,u)

= 0.

 

 

xi

 

 

u

 

i=1

 

 

 

 

 

 

 

Если S не зависит явно от времени, то St = 0 . В этом случае

при решении уравнений (6.10) для квадратичных функций f(…) функционала (6.1) и tн = 0; tк = T = ∞ А. М. Летовым предложено искать вспомогательную функцию в виде квадратичной формы дифференцируемой по всем координатам xi:

n

 

S(X ) = Aij xi xj .

(6.11)

i, j=1

Для линейных объектов функция S(X) является функцией Ляпунова при t → ∞. В результате решения (6.10) с учетом (6.11)

49

найдем оптимальное управление в функции координат вектора состояния U0(X), которое обеспечивает устойчивые процессы.

Таким образом, синтез оптимального управления методом динамического программирования ведется в следующем порядке:

1)из условия равенства частных производных по компонентам вектора управления определяется допустимый вектор U*(S);

2)используя зависимость U*(S), решается уравнение Беллмана при заданных краевых условиях и определяется функция S(X). Решение для S обычно ищут в виде квадратичной формы

S = X T A X ,

где А – симметричная матрица.

S = (x x )

 

a11

a12

 

 

 

x1

 

= a x2

+ 2a x x

+ a x2

;

 

 

 

 

1 2

 

a

a

 

 

 

x

 

11 1

12 1 2

22 2

 

 

 

12

22

 

 

 

2

 

 

 

 

 

3) используя функцию S(X), получаем зависимость U(X). Пример. Определить оптимальное управление объектом, за-

данным уравнением Ty(t) + y(t) = kU (t) или x 1 = a0 x1 +b0u1 , где T и k – постоянная времени и коэффициент усиления объекта

a = −

1

;

b =

k

из

условия

минимума

функционала

0

T

 

0

T

 

 

 

 

 

 

 

 

 

 

 

J = [q1x12 + r1u12 ]dt , где q1 > 0, r1 > 0

– весовые коэффициенты.

0

Вспомогательную функцию зададим в виде

S(X ) = A11x12 .

Для данного случая на основании (6.10) запишем функциональные уравнения Беллмана:

2

2

+ (a0 x1 +b0u1 )S / x1

 

q1x1

+ r1u1

= 0;

2ru

+b S / x = 0,

 

 

1 1

0

1

 

откуда

u10 (t) = −[b0 /(2r1 )]S / x1 ,

или с учетом S(x)

u0 (t) = −[b0 /(2r1 )]A11x1 (t) = ko.c y(t) ,

где ko.c = −A11b0 / r1 .

50

Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]