Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Аналитическое конструирование оптимальных регуляторов. Учебное пособие

.pdf
Скачиваний:
0
Добавлен:
12.08.2026
Размер:
1 Мб
Скачать

Для определения ko.c найдем производную S / x1 и подста-

вим в первое уравнение системы Беллмана

q1x12 + (b02 / r1)A112 x12 + 2a0 A11x12 2(b02 / r1)A112 x12 = 0,

или

b02 A112 2a0r1 A11 q1r1 = 0 ,

Откуда

A11 =[r1 (a0 ± a02 +b02q1 / r1 )]/ b02 .

Подставив значение A11 в выражение для ko.c , получим выражение

ko.c = (a0 a02 +b02q1 / r1 )/ b0 .

Численное решение уравнений динамического программиро-

вания. Уравнение (6.8) и соответствующее ему уравнение (6.10) не всегда удается решить аналитически. Поэтому применяют численное, являющееся приближенным решение в виде многошагового процесса. При этом обычно используется ЦВМ.

Для этого заменяют исходные уравнения объекта (6.2) конеч- но-разностными уравнениями:

Xk = f (Xk 1,uk )t;

 

 

Xk = Xk 1 + ∆Xk ;

 

 

 

(6.12)

X0 = X (t0 ); X N = X (T );

 

 

 

 

 

 

uk = uk 1 + ∆uk ; t = (T t0 )/ N,

 

где k =1, 2, , N; N – число принятых расчетных интервалов

(шагов).

На основании (6.6) функционал

N

 

J = Fk (Xk 1,uk )t .

(6.13)

k =1

На каждом из временных интервалов управление uk сохраняет неизменное значение, принятое в начале интервала. Если найденные

значения управлений на каждом интервале u10 , u20 , , uN0 , такие, что uk U , Xk x и обеспечен минимум функционала (6.13) и X0 = X (t0 ), X N = X (T ), то полученное управление является оптимальным.

51

При численном решении задачи оптимизации участки процесса рассматривают в последовательности, обратной их номеру, т. е. от конца процесса к началу.

Рассмотрим начало последнего участка процесса, т. е. момент времени tN 1 = (N 1)t . Ему соответствуют значения координат

X N 1 . Согласно принципу оптимальности необходимо, чтобы было выбрано оптимальное управление на последнем интервале uN0 ,

переводящее объект из состояния

X N 1

в состояние X N .

Выбор

значения uN0 влияет лишь на последний член суммы (6.13).

 

 

 

JN = FN (X N 1,uN )t .

 

(6.14)

Выберем такое uN0 , чтобы обеспечивался минимум (6.14).

При этом на основании (6.3) получим

 

 

 

 

S

N

(X

N 1

) = min [F

(X

N 1

,u0 )t] .

(6.15)

 

 

u0

N

 

 

N

 

 

 

 

N

U

 

 

 

 

 

 

В результате на первом шаге назад (последнем интервале)

определим значения SN (X N 1 ), X N 1 (tN 1 ) и uN0 (X N 1 ), которые передаются в запоминающее устройство ЦВМ или записываются

в виде таблицы.

Перейдем к предпоследнему интервалу N – 2 (второму шагу назад), т. е. рассмотрим начало момента времени tN 2 = (N 2)t .

Этому интервалу соответствуют значения координат X N 2 . Выберем оптимальное значение uN0 1 из условия минимума двух по-

следних членов суммы (6.13) с учетом того, что uN0 уже известно. При этом

 

 

 

 

 

 

 

 

 

0

 

 

 

 

 

 

 

 

 

 

 

 

JN + JN 1 = FN (X N 1,uN )t + FN 1 (X N 2 ,uN 1 )t;

 

 

(6.16)

 

 

SN 1

 

 

 

 

 

 

 

0

 

 

 

 

 

 

 

 

(X N 2 ) = 0min [FN 1 (X N 2 ,uN 1 )t + SN (X N 1 )].

 

 

 

 

 

 

 

 

 

 

uN 1 U

 

 

 

 

 

 

 

 

 

 

 

 

Так как соответственно (6.12)

 

 

 

 

 

 

 

 

 

 

 

 

 

 

X N 1 = X N 2 + ∆X N 1 = X N 2 + f (X N 2 ,uN0 1 )t ,

 

 

 

 

то вместо (6.16) запишем

 

,u0

 

 

 

 

 

 

,u0

 

 

S

 

(X

 

 

) = min [F

(X

 

)t + S

 

{(X

 

) (X

 

 

)}] .

 

N 1

 

N 2

u0

N 1

 

N 2

N 1

 

N

 

N 1

 

N 2

 

N 1

 

 

 

 

 

 

N 1

U

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

52

 

 

 

 

 

 

 

 

 

 

На предпоследнем интервале (втором шаге назад) получены

значения SN 1 (X N 2 ), X N 2 (tN 2 ) и uN0 1 (X N 2 ), которые передаются в запоминающее устройство ЦВМ.

Таким образом, все расчеты проводят аналогично указанным, шаг за шагом назад, начиная с последнего интервала [см. (6.15)] и кончая первым интервалом (k = 1), по следующим рекуррентным соотношениям (k = N – 1, N – 2,…, 2, 1):

S

 

(X

 

) = min [F (X

 

,u0 )t + S

 

{(X

 

) (X

 

,u0 )}] .

(6.18)

 

k

 

k 1

u0

k

k 1

k

 

k +1

 

k

 

k 1

k

 

 

 

 

k1

U

 

 

 

 

 

 

 

 

 

 

 

В

 

результате

получим

значения

uN0 (X N 1 ), Xk (tk )

uk0 (Xk 1 ), X N (tN ) = X (T ) ,

по которым можно построить прибли-

женную оптимальную траекторию X 0 (t) и найти оптимальное

управление u0 (t) . Таким образом, в результате решения задачи

численным методом получим квазиоптимальное управление. При таком расчете учитываются ограничения X (t) x и u(t) U и

недопустимые варианты управления uk (Xk 1 ) исключаются.

Кроме указанного обратного решения задачи шаг за шагом назад, можно применить прямое решение по следующим рекуррентным соотношениям (k = 1, 2,…, N – 1):

S

 

(X

 

) = min[F

(X

 

,u0 )t];

 

 

 

 

 

 

1

 

 

0

 

 

u10 U

1

 

 

 

0

 

1

 

 

 

 

 

 

(6.19)

S

k +1

(X

k

) = min[S

k

(X

k 1

,u0 )

+ F

(X

k

,u0

)t].

 

 

 

 

0

 

 

 

 

 

k

k +1

 

k +1

 

 

 

 

 

 

 

 

 

uk U

 

 

 

 

 

 

 

 

 

 

 

 

 

 

Следует, однако, отметить, что при высоком порядке уравнений объекта и нескольких координатах управлений объем вычислений численным методом оказывается очень большим.

Область целесообразного применения. Метод динамического программирования успешно применяют для оптимизации дискретных систем. При введении дискретного времени вариационную задачу оптимизации удается свести к N-простым задачам минимизации (максимизации) функций малого числа переменных (управлений). При этом принимают, что внутри каждого интервала управление и координаты объекта не меняются, т. е. используют такой же подход, как и в импульсных системах.

При оптимизации объектов с непрерывными процессами требуется, чтобы вспомогательная функция S(t, X) была дифференцируемой во всех точках фазового пространства.

53

Трудность решения функциональных уравнений Беллмана обусловлена также тем, что функция S(t, X) заранее неизвестна и уравнения (6.10) содержат частные производные. Однако если удается свести задачу синтеза к решению уравнений (6.10) при вспомогательной функции типа (6.11), то решение задачи синтеза U0(X) может быть значительно упрощено.

Общего способа определения S(t ,X) в явной аналитической форме пока не существует, поэтому каждая задача требует особого исследования.

Вывод. Метод динамического программирования был разработан почти одновременно с опубликованием принципа максимума. В основе метода динамического программирования лежит принцип оптимальности, сформулированный Беллманом ,рассмотренный в лекции 6. Кроме того, приведен пример решения задачи нахождения закона оптимального управления объектом с помощью метода динамического программирования. Представлена область его целесообразного применения.

Вопросы для самопроверки

1.В чем заключается принцип оптимальности Беллмана?

2.Запишите функциональные уравнения Беллмана.

3.Какой вид имеет вспомогательная функция S?

4.Назовите основные этапы синтеза оптимального управления методом динамического программирования.

5.В чем заклю чается численное решение уравнений динамического программирования?

6.Сформулируйте область целесообразного применения метода динамического программирования.

Литература

1.Певзнер Л. Д., Чураков Е. П. Математические основы теории систем: учебное пособие. М.: Высшая школа, 2009. 503 с.: ил.

2.Афанасьев В. Н., Колмановский В. Б., Носов В. Р. Математическая теория конструирования систем управления. М.: Высшая школа, 1998. 574 с.

3.Куропаткин П. В. Оптимальные и адаптивные системы: учеб. пособие для вузов. М.: Высш. школа, 1980. 287 с.

54

Раздел 7. АНАЛИТИЧЕСКОЕ КОНСТРУИРОВАНИЕ ОПТИМАЛЬНЫХ РЕГУЛЯТОРОВ (АКОР)

План

7.1.Выбор критериев оптимальности.

7.2.Определение весовых констант по заданному уравнению экстремали.

7.3.Критерии оптимальности, минимизирующие ошибку, и управление.

7.1. Выбор критериев оптимальности

Впервые идеи аналитического конструирования оптимальных регуляторов были выдвинуты А. М. Летовым в 1960 году. Рассмотрим сущность вопросов, связанных с конструированием регуляторов.

Существует традиционная схема синтеза систем регулирования, согласно которой, имея уравнение объекта управления (ОУ) и показатели качества регулирования (время регулирования, перерегулирование) выбирается регулятор. Если при выбранном регуляторе не удовлетворяется заданное качество, то синтезируются корректирующие цепи. В выборе корректирующих цепей собственно и состоял синтез системы регулирования. Данная схема синтеза получила большое распространение, а методы синтеза непрерывно совершенствуются. На основе результатов этого метода сконструированы и выпускаются промышленные регуляторы с различными законами (П, ПИ, ПИД и т. д.). Методика синтеза распространяется на линейные, нелинейные системы, системы с запаздыванием, системы, подвергавшиеся действию случайных возмущающих воздействий.

Однако появились новые идеи, которые позволяют по-другому подойти к задаче синтеза систем. Эти идеи оформились

втеории аналитического конструированияоптимальныхрегуляторов (АКОР). Сущность ее состоит в том, что закон изменения управляемой координаты и управляющего воздействия задается аналитически

ввиде некоторого функционала J (x,u) , который нужно минимизи-

ровать подбором управляющего воздействия. Зная алгоритм управления U (t) или U (x) , конструируют регулятор.

55

Особое значение при аналитическом конструировании регуляторов принимает выбор критериев оптимальности.

Критерий качества должен полностью соответствовать наилучшей работе объекта и в то же время быть достаточно простым для того, чтобы вариационная задача не оказалась слишком сложной или вообще аналитически неразрешимой.

Рассмотрим критерии качества переходных процессов и соответствующие им экстремали.

Кривые переходных процессов, представленные на рис. 7.1а и 7.1б, показывают изменение ошибки в замкнутой системе регулирования при управляющем воздействии в виде единичного скачка.

Рис. 7.1. Кривые переходных процессов в системах управления

56

Рассмотрим интеграл вида

 

J1 = x(t)dt .

(7.1)

0

Такой интеграл рассматривался при анализе оптимальных по быстродействию систем. Чем быстрее протекает процесс, тем меньше будет площадь, заштрихованная на рис. 7.1а, а значит, и меньше величина J1. Таким образом, величина J1 в какой-то мере характеризует качество системы управления. Однако данный критерий имеет существенный недостаток. При рассмотрении колебательного процесса величина J1 может быть весьма малой, однако процесс в системе управления иногда оказывается длительным и резко колебательным, а такие процессы нежелательны. Чтобы избежать недостатков критерия J1, был предложен квадратичный критерий

J2 = x2dt .

(7.2)

0

Данный критерий характеризует площадь, ограниченную кривой x2(t) (рис. 7.1в). Здесь уже учитывается колебательность процесса. Однако нельзя что-либо определенно сказать о характере процесса, т. е. является ли он колеб ательным или монотонным. Большая величина оценки J2 может соответствовать более плавному, но длительному процессу, а меньшая – более колебательному, но и более быстрому. Очевидно, что критерий вида (7.2) также не дает полного представления о характере переходных процессов в системе.

С учетом недостатков критерия J2 был предложен обобщенный интегральный критерий

 

Jν = ν dt ,

(7.3)

0

 

где n = x2 +τ12 x2 + +τn21 (x(n1) )2 .

Смысл данного критерия состоит в том, что запрещаются большие отклонения как самой координаты x, так и ее производных. Поэтому при минимизации Jν должны получаться процессы, протекающие достаточно быстро и без значительных колебаний. Обобщенный интегральный критерий получил большое распространение при косвенной оценке качества переходных процессов.

57

Рассмотрим, каким экстремалям соответствуют минимумы рассмотренных выше интегральных оценок.

Для квадратичного критерияJ2 (7.2) составим уравнение Эйлера

fx dtd fx = 0 ,

откуда получим x = 0.

Физически полученный результат соответствует тому, что координата x должна скачком изменяться от какого-то значения x0 до x = 0, т. е. процесс должен быть скачкообразным при скачкообразном изменении управляющего воздействия. В системе, содержащей инерционности, получить скачкообразные процессы невозможно.

Рассмотрим теперь обобщенный интегральный критерий вида

Jν1 = (x2 +t2 x2 )dt .

(7.4)

0

 

Составим уравнение Эйлера:

(7.5)

2x 2τ2 x = 0 .

Запишем характеристическое уравнение, соответствующее уравнению (7.5):

τ2α2 1 = 0 ,

откуда

α1,2 = ±τ1 .

Решение уравнения Эйлера будет иметь вид

x = C1et /t +C2et /t .

Постоянная интегрирования С2 = 0, так как при t → ∞ x → ∞, т. е. предполагается устойчивая система, имеющая только отрицательные корни характеристического уравнения.

Постоянная интегрирования С1 = x0, так как при t = 0 x = x0. Окончательно имеем решение уравнения Эйлера

x = x0et /t .

Таким образом, экстремалью для функционала Jν1 будет экспонента.

58

Рис. 7.2. Экстремали для функционала Jν1: а) при фиксированном τ; б) при τ = var

Любая другая кривая не будет экстремалью Jν1, а значит, не будет обеспечивать его минимума. Для разных τ получим поле экстремалей. Из этого семейства можно выбрать экстремаль, которая наиболее полно отвечает требованиям, предъявляемым к системе управления.

Рассмотрим более сложный обобщенный критерий

∞ ∞

Jν 2 = ν dt = (x2 +t12 x2 +t22 x2dt) .

0 0

Для нахождения экстремали составим уравнение Эйлера – Пуассона

t2 d 4 x

t2 d 2 x

+ x = 0 .

2 dt4

1 dt2

 

Решая характеристическое уравнение

α4

τ2

α2

+

1

= 0

,

1

 

 

τ2

 

τ2

 

 

 

 

 

2

 

 

2

 

 

получим четыре корня α1 – α4. Из этих корней два будут с положительными действительными частями α3, α4, а два – с отрицательными частями α1, α2. Так как система предполагается устойчивой, то в решении уравнения будем учитывать только корни α1, α2. Таким образом, решение уравнения Эйлера будет иметь вид

x1 = C1eα1t +C2eα2t .

Из начальных условий при t = 0, x(0) = x0 , x(0) = 0 определяем постоянные интегрирования

59

C1 = x0

 

α2

 

,

C2 = −x0

 

α1

 

α

2

α

1

α

2

α

1

 

 

 

 

 

 

 

и окончательно записываем решение уравнения Эйлера– Пуассона

x = α2 x0 α1 (α2eα1t α1eα2t ) .

Таким образом, экстремалью для интеграла Jν2 является решение дифференциального уравнения четвертого порядка. Отметим, что корни α1, α2 могут быть как вещественными, так и ком- плексно-сопряженными. Поэтому экстремаль не обязательно должна состоять из суммы двух экспонент, она может иметь и к о- лебательный характер, что зависит от соотношения параметров системы.

Рассматривая обобщенные интегральные критерии вида

Jn = x2 +t12 x2 + +tn2 (x(n) )2 dt , 0

получим, что ему соответствует экстремаль, являющаяся решением дифференциального уравнения n-го порядка

x1 = C1eα1t +C2eα2t + +Cneαnt .

Изменяя параметры системы τ1,…,τn, получим поле экстремалей, из которого можно выбрать желаемую экстремаль.

7.2. Определение весовых констант по заданному уравнению экстремали

Для системы управления, описываемого каким-либо дифференциальным уравнением, можно найти экстремаль или семейство экстремалей для выбранного критерия оптимальности. Но можно поставить и обратную задачу.

Имеется некоторая экстремаль, характеризующая желаемый переходный процесс x(t) в системе управления. Нужно определить

вид функционала Jν (x) и его константы τ1,…,τn так, чтобы в про-

ектируемой системе процесс наиболее близко приближался к желаемому. Для этого необходимо задать процесс x(t) в виде дифференциального уравнения с определенными коэффициентами. Далее это дифференциальное уравнение привести к уравнению Эйлера – Пуассона, а через него определить коэффициенты τ1, …, τn

60

Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]