Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Корреляционный анализ в системах управления. Учебное пособие

.pdf
Скачиваний:
0
Добавлен:
12.08.2026
Размер:
738 Кб
Скачать

Пример 1.9

Необходимо определить числовые характеристики распределения по данным, представленным в табл. 1.11 и 1.12, виде вариационного и статистического ряда соответственно.

Решение

Для определения числовых характеристик распределения по данным, представленным в виде вариационного ряда, целесообразно воспользоваться вычислением центральных моментов, которые до k-го порядка определяются в соответствии с выражением

mk = M (X MX)k .

Вычислим значения центральных моментов по вариационному ряду:

m1 =27,508; m2 =0,893; m3 =0,123; m4 =1,656.

Эти оценки, кроме математического ожидания, являются смещенными. Несмещенные оценки получим в следующем виде:

m2 =0,913; m3 =0,132; m4 =1,819; s=0.956.

Вычисление оценок моментов на основе статистического ряда дает следующие результаты:

m1 =27,482; m2 =0,805; m3 =0,137; m4 =1,656.

Значения оценок моментов различаются при их вычислении по вариационному ряду и по сгруппированным данным. Можно предположить, что оценки, вычисленные по вариационному ряду, будут точнее оценок, рассчитанных по статистическому ряду.

Анализируя назначение рассмотренных параметров, необходимо отметить следующее: одни параметры характеризует средние величины, а другие – вариацию.

Главное назначение средних величин (оценок начальных моментов и в первую очередь первого момента распределения) заключается в их обобщающей функции. Это обобщение позволяет заменить множество различных индивидуальных значений показателя средней величиной, характеризующей всю

21

однородную совокупность. Иначе говоря, средняя величина является типической характеристикой варианты в конкретной выборке. Иногда средняя величина позволяет обобщить и неоднородные показатели однотипных объектов.

1.2. Основы корреляционно-регрессионного анализа

Втехнологической практике исследователь часто сталкивается с необходимостью установления факта существования функциональных или иных зависимостей между экспериментальными данными; нередко такая связь может быть случайной. Различные постановки задач статистического исследования можно классифицировать следующим образом: задачи корреляционного анализа (задачи исследования наличия взаимосвязей между отдельными группами переменных); задачи регрессионного анализа; задачи дисперсионного анализа.

Корреляционный анализ – это эффективный метод математической статистики, позволяющий по совокупности значений показателей выявлять и описывать связи между показателями.

Цель корреляционного анализа – выявление оценки силы связи между случайными величинами (признаками), которые характеризуют некоторый реальный процесс..

Корреляционной зависимостью Y от X называют функциональную зависимость условной средней ух от x: ух = f (x). Это уравнение называют уравнением регрессии Y на X; функцию f(x) называют регрессией Y на X, а ее график – линией регрессии Y на X.

Врамках корреляционного анализа рассматриваются две основные задачи.

Первая задача теории корреляции – установление формы корреляционной связи, т.е. вида функции регрессии (линейная, квадратичная и т.д.).

Вторая задача теории корреляции – оценка тесноты (силы) корреляционной связи.

О наличии или отсутствии корреляции между двумя случайными величинами качественно можно судить по виду поля корреляции, поместив экспериментальные точки на координатную плоскость.

22

Для количественной оценки тесноты связи служит выборочный коэффициент корреляции r, который вычисляется по значениям функций отклика в области эксперимента и имеет следующие свойства:

–не превосходит единицы по абсолютной величине;

–не изменяется при изменении начала отсчета и масштаба величин.

Коэффициент корреляции характеризует только линейную зависимость. Линейная вероятностная зависимость случайных величин заключается в том, что при возрастании одной случайной величины другая имеет тенденцию к возрастанию (или убыванию) по линейному закону. Коэффициент корреляции характеризует степень тесноты линейной зависимости. В общем случае, когда величины Y и Z связаны произвольной стохастической зависимостью, коэффициент корреляции рассчитывается по формуле

 

 

n

 

 

 

 

 

(yi y)(zi z)

 

r =

 

i=1

 

,

(1.1)

 

 

 

 

 

n

n

 

 

 

(yi y)2

(zi z)2

 

 

 

 

 

 

i=1

i=1

 

1

n

 

1

n

 

где y =

yi;

z =

zi,

 

n

n

 

 

i=1

 

i=1

 

 

 

 

 

 

и может иметь значение в пределах

−1≤r ≤ +1.

Пример 1.10

Сырье, поступающее из ближайшего карьера, содержит два полезных компонента – минералы А и Б. При этом в партиях сырья с повышенным содержанием А обычно обнаруживается и более высокое содержание Б, так что имеются основания ожидать, что эти величины находятся в связи друг с другом.

Анализы 10 образцов сырья, поступившего в разное время, приведены в табл. 1.13. Необходимо определить коэффициент корреляции.

23

Таблица 1.13

Содержание минералов А и Б, %

Номер образца

1

2

3

4

5

6

7

8

9

10

 

 

 

 

 

 

 

 

 

 

 

А (Z)

67

54

72

64

39

22

58

43

46

34

 

 

 

 

 

 

 

 

 

 

 

Б (Y)

24

15

23

19

16

11

20

16

17

13

 

 

 

 

 

 

 

 

 

 

 

Решение

Полученные данные приведены в табл. 1.14.

Таблица 1.14

Результаты расчета коэффициента корреляции

Номер

Z

Y

Z Z

Y Y

(Z Z) (Y Y)

(Z Z )2

(Y Y )2

образца

 

 

 

 

 

 

 

 

1

67

24

17,1

6,6

112,86

292,41

43,56

 

 

 

 

 

 

 

 

2

54

15

4,1

–2,4

–9,84

16,81

5,76

 

 

 

 

 

 

 

 

3

72

23

22,1

5,6

123,76

488,41

31,36

 

 

 

 

 

 

 

 

4

64

19

14,1

1,6

22,56

198,81

2,56

 

 

 

 

 

 

 

 

5

39

16

–10,9

–1,4

15,26

118,81

1,96

 

 

 

 

 

 

 

 

6

22

11

–27,9

–6,4

178,56

778,41

40,96

 

 

 

 

 

 

 

 

7

58

20

8,1

2,6

21,06

65,61

6,76

 

 

 

 

 

 

 

 

8

43

16

–6,9

–1,4

9,66

47,61

1,96

 

 

 

 

 

 

 

 

9

46

17

–3,9

–0,4

1,56

15,21

0,16

 

 

 

 

 

 

 

 

10

34

13

–15,9

–4,4

69,96

252,81

19,36

 

 

 

 

 

 

 

 

Σ

499

174

545,4

2274,9

154,4

 

 

 

 

 

 

 

 

Рассчитаем коэффициент корреляции по формуле (1.1):

r =

545,5

 

=0,92.

 

 

 

 

 

 

 

 

2274,9

154,4

 

 

 

Полученное значение коэффициента корреляции r = 0,92 достаточно высокое. Исходя из этого можно сделать вывод о наличии тесной связи между содержанием минералов А и Б в сырье. Следующим шагом является проведение регрессионного анализа.

24

Корреляционная зависимость характеризует взаимосвязь значений одних случайных величин со средним значением других, хотя в каждом отдельном случае любая взаимосвязанная величина может принимать различные значения.

Используя понятие коэффициента корреляции, матрице экспериментальных данных можно поставить в соответствие квадратную матрицу оценок коэффициентов корреляции (корреляционную матрицу)

 

r11

r12

...

r1m

 

 

 

 

 

 

r=

r21

r22

...

r2m

 

.

(1.2)

 

.

.

.

.

 

 

 

 

rm1

rm2

...

rmm

 

 

 

К числу характерных свойств корреляционной матрицы

относят

симметричность относительно главной диагонали:

rik =rki,

i, k =1, ..., m; единичные значения элементов главной

диагонали: rkk = 1.

Постановка задачи линейного корреляционного анализа

формулируется в следующем виде: для матрицы наблюдений вида (1.2) необходимо определить оценки коэффициентов корреляции для всех или только для заданных пар параметров и оценить их значимость; незначимые оценки приравниваются к нулю.

Принимаются следующие допущения.

1.Выборка имеет достаточный объем. Понятие достаточного объема зависит от целей анализа, требуемой точности и надежности оценки коэффициентов корреляции, от количества факторов. Минимально допустимым считается объем, при котором количество наблюдений не менее чем в 5–6 раз превосходит количество факторов.

2.Выборки по каждому фактору являются однородными. Это допущение обеспечивает несмещенную оценку средних величин.

3.Матрица наблюдений не содержит пропусков. Приведенная задача корреляционного анализа решается в не-

сколько этапов:

–проводится стандартизация исходной матрицы;

–вычисляются парные оценки коэффициентов корреляции;

25

–проверяется значимость оценок коэффициентов корреляции, незначимые оценки приравниваются к нулю; по результатам проверки формулируется вывод о наличии связей между вариантами (факторами).

Пример 1.11

Результаты наблюдений за характеристиками канала представлены в табл. 1.15.

 

 

 

 

 

Таблица 1.15

 

Результаты наблюдений за характеристиками канала

 

 

 

 

 

 

 

 

 

 

Пропускная спо-

Соотношение

Остаточное затухание, дБ,

Номер

 

собность канала,

сигнал/шум,

на частоте, Гц

 

кбит/с

дБ

1020

1800

 

2400

варианты

 

 

 

 

Х1

X2

X3

X4

 

X5

 

 

 

 

 

 

 

 

1

 

26,37

41,98

17,66

16,05

 

22,85

 

 

 

 

 

 

 

 

2

 

28,00

43,83

17,15

15,47

 

23,25

 

 

 

 

 

 

 

 

3

 

27,83

42,83

15,38

17,59

 

24,55

 

 

 

 

 

 

 

 

4

 

31,67

47,28

18,39

16,92

 

26,59

 

 

 

 

 

 

 

 

5

 

23,50

38,75

18,32

15,66

 

26,22

 

 

 

 

 

 

 

 

6

 

21,04

35,12

17,81

17,00

 

27,52

 

 

 

 

 

 

 

 

7

 

16,94

32,07

21,42

16,77

 

25,76

 

 

 

 

 

 

 

 

8

 

37,56

54,25

26,42

15,68

 

23,10

 

 

 

 

 

 

 

 

9

 

18,84

32,70

17,23

15,92

 

23,41

 

 

 

 

 

 

 

 

10

 

25,77

40,51

30,43

15,29

 

25,17

 

 

 

 

 

 

 

 

11

 

33,52

49,78

21,71

15,61

 

25,39

 

 

 

 

 

 

 

 

12

 

28,21

43,84

28,33

15,70

 

24,56

 

 

 

 

 

 

 

 

13

 

28,76

44,03

30,42

16,87

 

24,45

 

 

 

 

 

 

 

 

14

 

24,60

39,46

21,66

15,25

 

23,81

 

 

 

 

 

 

 

 

15

 

24,51

38,78

25,77

16,05

 

24,48

 

 

 

 

 

 

 

 

Необходимо определить наличие линейных корреляционных связей между пропускной способностью и остальными факторами. Предполагается, что выборки по всем вариантам подчиняются нормальному закону. Проверку гипотезы о значимости

26

оценок коэффициентов корреляции произвести с уровнем значимости a, равным 0,1.

Решение

Стандартизация исходной матрицы начинается с вычисления выборочной средней m1, несмещенной оценки дисперсии m2 и среднеквадратического отклонения s по каждой варианте (табл. 1.16).

Таблица 1.16

Данные по оценке параметра распределения

Оценка параметра

 

Значение оценки для варианты

 

распределения

Х1

 

X2

X3

X4

 

X5

m1

26,47

 

41,68

21,87

16,12

 

24,74

m2

29,10

 

36,47

26,37

0,52

 

1,88

s

5,39

 

6,04

5,13

0,72

 

1,37

 

 

 

 

 

 

 

 

В результате перехода к величинам u

 

=

(xij −mj )

формирует-

ij

sj

 

 

 

 

 

 

 

ся стандартизованная матрица исходных данных (табл. 1.17).

Таблица 1.17

Стандартизованная матрица исходных данных

 

Пропускная спо-

Соотношение

Остаточное затухание, дБ,

Номер

собность

сигнал/шум,

на частоте, Гц

варианты

канала, кбит/с

дБ

1020

1800

2400

 

X1

X2

X3

X4

X5

1

–0,02

0,05

–0,82

–0,10

–1,38

 

 

 

 

 

 

2

0,28

0,36

–0,92

–0,90

–1,09

 

 

 

 

 

 

3

0,25

0,19

–1,26

2,03

–0,14

 

 

 

 

 

 

4

0,96

0,93

–0,68

1,10

1,35

 

 

 

 

 

 

5

–0,55

–0,49

–0,69

–0,64

1,08

 

 

 

 

 

 

6

–1,01

–1,09

–0,79

1,21

2,03

 

 

 

 

 

 

7

–1,77

–1,59

–0,09

0,90

0,74

 

 

 

 

 

 

8

2,06

2,08

0,89

–0,61

–1,20

 

 

 

 

 

 

9

–1,42

–1,49

–0,90

–0,28

–0,97

 

 

 

 

 

 

27

10

–0,13

–0,19

 

1,67

–1,15

0,31

 

 

 

 

 

 

 

 

11

1,31

1,34

 

–0,03

–0,71

0,47

 

 

 

 

 

 

 

 

12

0,32

0,36

 

1,26

–0,58

–0,13

 

 

 

 

 

 

 

 

13

0,42

0,39

 

1,66

1,03

–0,21

 

 

 

 

 

 

 

 

14

–0,35

–0,37

 

–0,04

–1,21

–0,68

 

 

 

 

 

 

 

 

15

–0,36

–0,48

 

0,76

–0,10

–0,19

 

 

 

 

 

 

 

 

 

 

 

 

 

 

1

15

 

 

Оценки коэффициентов корреляции r1k =

u1iuki (k =2, 3, 4)

15

 

 

 

 

i=1

 

 

 

 

 

 

 

 

 

 

представлены в табл. 1.18, в которой также приведены значения

статистик критерия Стьюдента t =

| r 1

k|

 

n −2

 

для вычисленных

 

 

 

 

 

 

 

 

1

r2

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

1k

 

 

 

 

 

 

оценок коэффициентов корреляции при п = 15.

 

 

 

 

 

 

 

 

 

 

 

 

Таблица 1.18

Данные по оценке коэффициентов корреляции

 

 

 

 

 

 

 

 

 

Соотношение

 

Остаточное затухание, дБ,

 

 

 

 

 

 

на частоте, Гц

 

 

сигнал/шум,

 

 

 

 

 

 

Критерий оценки

дБ

 

 

1020

 

1800

 

2400

 

 

 

 

 

 

 

 

 

 

 

 

X2

 

 

X3

 

 

 

X4

 

X5

r1k

0,93

 

 

 

0,25

 

 

 

 

– 0,13

 

– 0,22

t

9,12

 

 

 

0,93

 

 

 

 

0,47

 

0,81

 

 

 

 

 

 

 

 

 

 

 

 

 

 

Критическое значение критерия Стьюдента tкр (n–2; a ) = tкр (13; 0,1) = 1,77. Статистика критерия больше критического значения только для r12. Это означает, что только для указанного коэффициента оценка значима (коэффициент корреляции генеральной совокупности не равен нулю), а остальные коэффициенты следует признать равными нулю.

Корреляционная зависимость не обязательно устанавливается только для двух величин, с ее помощью можно анализировать связи между несколькими вариантами (множественная корреляция). А кроме линейной существуют и другие виды корреляции.

28

Регрессионный анализ – метод изучения статистической взаимосвязи между одной зависимой количественной переменной и одной или несколькими независимыми количественными переменными. Зависимая переменная в регрессионном анализе называется результирующей, а переменные факторы – предикторами, или объясняющими переменными.

Взаимосвязь между средним значением результирующей переменной и средними значениями предикторов выражается в виде уравнения регрессии. Уравнение регрессии – математическая функция, которая подбирается на основе исходных статистических данных зависимой и объясняющих переменных. Чаще всего используется линейная функция. В этом случае говорят о линейном регрессионном анализе.

Регрессионный анализ очень тесно связан с корреляционным анализом. В корреляционном анализе исследуется направление

итеснота связи между количественными переменными. В регрессионном анализе исследуется форма зависимости между количественными переменными. Таким образом, фактически оба метода изучают одну и ту же взаимосвязь, но с разных сторон,

идополняют друг друга. На практике корреляционный анализ выполняется перед регрессионным анализом. После доказательства наличия взаимосвязи методом корреляционного анализа можно выразить форму этой связи с помощью регрессионного анализа.

Цель регрессионного анализа – с помощью уравнения регрессии предсказать ожидаемое среднее значение результирующей переменной.

Если сказать шире, то основная цель регрессионного анализа состоит в определении аналитической формы связи, в которой изменение результативного признака обусловлено влиянием одного или нескольких факторных признаков, а множество всех прочих факторов, также оказывающих влияние на результативный признак, принимается за постоянные и средние значения.

Основные задачи регрессионного анализа:

–определение вида и формы аналитической зависимости

между переменными, характеризующими исследуемый процесс;

–оценка параметров уравнения регрессии;

–проверка значимости уравнения регрессии;

29

–проверка значимости отдельных коэффициентов уравнения регрессии;

–построение интервальных оценок коэффициентов;

–исследование характеристик точности модели;

–построение точечных и интервальных прогнозов результирующей переменной.

При решении задач регрессионного анализа получают следующие данные:

–установление формы зависимости.

–относительно характера и формы зависимости между явлениями, различают положительную линейную и нелинейную и отрицательную линейную и нелинейную регрессию.

–определение функции регрессии в виде математического уравнения того или иного типа и установление влияния объясняющих переменных на зависимую переменную;

–оценка неизвестных значений зависимой переменной. С помощью функции регрессии можно воспроизвести значения зависимой переменной внутри интервала заданных значений объясняющих переменных (т. е. решить задачу интерполяции) или оценить течение процесса вне заданного интервала (т. е. решить задачу экстраполяции). Результат представляет собой оценку значения зависимой переменной.

Как и корреляционный анализ, регрессионный анализ отражает только количественные зависимости между переменными. Причинно-следственные зависимости регрессионный анализ не отражает.

Постановка задачи регрессионного анализа формулируется следующим образом: имеется совокупность результатов наблюдений; в этой совокупности один столбец соответствует показателю, для которого необходимо установить функциональную зависимость с параметрами объекта и среды, представленными остальными столбцами.

Будем обозначать показатель через y* и считать, что ему соответствует первый столбец матрицы наблюдений. Остальные т – 1 (m > 1) столбцов соответствуют параметрам (факторам) х2,

х3, …, хт.

Требуется установить количественную взаимосвязь между показателем и факторами. В таком случае задача регрессионного

30

Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]