Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Моделирование химико-технологических процессов. Учебно-методическое пособие
.pdf
21
№7
xi
yi
-1
-2 1 0
2
1
№14
xi
yi
-1 1 0
2
1
3
№8
xi
yi
-1
2
0.5
2
1
2
№15
xi
yi
-2
-5/2
-1
-3/2
0
-1/2
№9
xi
yi
-1
0.5 1 2 2 4
№16
xi
yi
-1
-2 0 -1 1 2
№10
xi
yi
-2 1 -1 0 1
4
№17
xi
yi
1/2 4 1 7 -1
5
№11
xi
yi
-1
-1 1 1
2
5
№18
xi
yi
-1
-4 1 6
2
2,5
№12
xi
yi
-1 3 0.5 0 1
1
№19
xi
yi
-1 2 1
-1 2 0
№13
xi
yi
-1 4 0.5 1 1
2
№ 20
xi
yi 0 3 2 4 3 5

22
2. ЛИНЕЙНЫЕ КОРРЕЛЯЦИОННЫЕ МОДЕЛИ
2.1. Статистическая и корреляционная зависимости
Многие задачи химических производств требуют установить и
оценить зависимость изучаемой случайной величины Y от одной или
нескольких других величин.
Две случайные величины могут быть связаны либо функциональной зависимостью, либо статистической зависимостью, либо могут быть независимыми.
Строгие функциональные зависимости изучаются в курсе математического анализа. В математической статистике рассматриваются «размытые» статистические зависимости.
Зависимость между величинами X и Y, состоящая в том, что
каждому значению одной величины (X) соответствует не одно значение, а распределение значений другой величины, называется стати-
стической зависимостью.
Корреляционной зависимостью называется функциональная
зависимость между значениями одной случайной величины и условными средними значениями другой случайной величины.
Пример. Пусть Y – урожай зерна, X –количество удобрений.
С одинаковых по площади участков земли при равных количествах
внесённых удобрений снимают разный урожай, т.е. Y не является однозначной функцией от X. Это объясняется влиянием случайных
факторов, влияющих на урожай (осадки, температура воздуха и др.).
Однако средний урожай является функцией от количества удобрений, т.е. Y связан с X корреляционной зависимостью.
2.2. Корреляционная таблица
Пусть имеются два ряда выборочных значений зависимых
между собой случайных величин X и Y.
При небольшом числе выборочных значений случайных величин X и Y их записывают в виде таблицы наблюдений:
X
x1
x2
x3 … xn Y y1
y2
y3 … yn

23
При большом числе выборочных значений одно и то же значе-
ние X может встретиться nx раз, а значение Y – ny раз, пара чисел
(X,Y) может наблюдаться nxy раз. Таблица, в которой результаты
наблюдений записаны в порядке возрастания с указанием частоты,
называется корреляционной. Поясним устройство корреляционной
таблицы.
Пример. Для исследования зависимости объёма производства
Y от основных фондов (X, млн.р.), получены выборочные статисти-
ческие данные по предприятиям за год:
Y X ny
12
17
22
32
37
200 3 - 1 - - 4
220 - 5 8 1 - 14
250 2 1 - 2 1 6
nx 5 6 9 3 1 n=24
В первой строке таблицы указаны наблюдаемые значения
(12; 17; 22; 32; 37) признака (случайной величины) X, в первом
столбце указаны наблюдаемые значения (200; 220; 250) признака Y.
На пересечении строк и столбцов находятся частоты nxy наблюдаемых пар значений признаков. Например, частота 8 указывает, что пара чисел (22; 220) наблюдалась 8 раз. Прочерк означает, что соответствующая пара чисел, например (17; 200), не наблюдалась. Все частоты помещены в прямоугольник, стороны которого проведены
жирными отрезками.
В последнем столбце записаны суммы частот строк. Например,
сумма частот первой строки «жирного» прямоугольника равна
ny=3+1=4; это число указывает, что значение признака Y, равное 200,
наблюдалось 4 раза. В последней строке записаны суммы частот
столбцов. Например, число 5 указывает, что значение признака X,
равное 12, наблюдалось 5 раз. В клетке, расположенной в нижнем
правом углу таблицы, помещена сумма всех частот (общее число
всех наблюдений).
Очевидно,
nnn
yx
. В нашем примере
2413965
x
n
и
246144
y
n
.

24
2.3. Выборочные уравнения регрессии
Условным средним
x
y
называется среднее арифметическое
наблюдавшихся значений Y, соответствующих X=x.
Пример. На каждый из 3-х одинаковых участков земли внесены
по 2 единицы удобрения и сняли соответственно 5; 7; 12 единиц зерна. Изучается зависимость между случайными величинами X и Y.
Каждому значению X соответствует несколько значений Y: x1 = 2;
y1 = 5; y2 = 7; y3 = 12. Среднее арифметическое этих чисел (средний
урожай):
8
3
1275
2
1
yy
x
.
Число
1
x
y
является условным средним.
Аналогично определяется условное среднее
y
x
. Условным
средним
y
x
называется среднее арифметическое наблюдавшихся зна-
чений X, соответствующих Y=y.
Корреляционной зависимостью y от x является функциональная
зависимость:
x
y
= f(х). Функцию
xf
называют выборочной ре-
грессией Y на X, а её график – выборочной линией регрессии Y на X.
А уравнение
x
y
= f(х) называется выборочным уравнением регрессии
Y на X.
Корреляционной зависимостью х от у называется функциональная зависимость:
y
x
= φ(x). Функция
x
называется выборочной
регрессией X по Y, уравнение называется выборочным
уравнением регрессии X на Y, а её график – выборочной линией регрессии.
Основные задачи теории корреляции
1. Установить зависимость между случайными величинами в
виде формулы.
2. Оценить тесноту (силу) корреляционной связи.
Поясним последнюю задачу. Теснота корреляционной зависи-
мости, например, Y от X оценивается по величине рассеяния значений Y вокруг условного среднего
x
y
. Большое рассеяние свидетель-
ствует о слабой зависимости Y от X, либо об отсутствии зависимости. Малое рассеяние указывает на наличие сильной зависимости.

25
2.4. Отыскание параметров выборочного уравнения
прямой линии регрессии по неcгруппированным данным
Пусть изучается система количественных признаков (X,Y).
В результате n независимых опытов получены n пар чисел (x1, y1),
(x2, y2),… (xn, yn), записанных в виде таблицы неcгруппированных
выборочных данных. Найдём выборочное уравнение прямой линии
регрессии Y на X
bkxy
x
. Угловой коэффициент прямой линии
регрессии Y на X называют выборочным коэффициентом регрессии
Y на X и обозначают
yx
.
Выборочное уравнение прямой линии ре-
грессии Y на X принимает вид:
bху
ух
х
.
Разности
niyY
ii
,...2,1
niyY
,...2,1
называются отклонениями вы-
борочных значений от теоретических значений признака Y.
Yi – вычисленная по данному уравнению ордината, соответствующая
наблюдаемому значению хi; yi – наблюдаемая выборочная ордината,
соответствующая значению хi.
Подберём параметры
yx
и b так, чтобы сумма квадратов от-
клонений была минимальной (в этом состоит сущность метода
наименьших квадратов). Каждое отклонение зависит от отыскиваемых параметров, поэтому сумма квадратов отклонений есть функция
F этих параметров (временно вместо
yx
будем писать
)
.
n
i
ii
yYbF
1
2
,
или
n
i
ii
ybxbF
1
2
,
.
Для отыскания минимума этой функции найдем и приравняем к
нулю соответствующие частные производные:
02
1
ni
iii
xybx
F
;
02
1
ni
ii
ybx
b
F
.

26
Выполнив преобразования, получим систему уравнений:
.
;
2
ynbx
xyxbx
yx
yx
Решив эту систему, найдём оптимальные значения параметров:
Аналогично можно найти параметры выборочного уравнения
прямой линии регрессии X на Y
x
y
= ρ
xy
+ c:
2
2
yyn
yxxyn
xy
;
.
yyn
xyyxyn
c
2
2
2
Пример. Найти выборочное уравнение прямой линии регрессии
Y на X по данным пяти наблюдений (n=5):
x
1,00
1,50
3,00
4,50
5,00
y
1,25
1,40
1,50
1,75
2,25
Составим расчётную таблицу:
xi
yi
x
i
2
xiyi
1,00
1,25
1,00
1,250
1,50
1,40
2,25
2,100
3,00
1,50
9,00
4,500
4,50
1,75
20,25
7,875
5,00
2,25
25,00
11,250
15
i
x
15,8
i
y
50,57
2
i
x
975,26
ii
yx
Вычислим значения параметров по приведенным выше фор-
мулам.
;202,0155,57515,815975,265
2
xy
.024,15,62975,261515,85,57 b

Уравнение регрессии имеет вид:
.024,1202,0 xY
xi
Yi
yi
Yi-yi
1,00
1,226
1,25
-0,024
1,50
1,327
1,40
-0,073
3,00
1,630
1,50
0,130
4,50
1,933
1,75
0,183
5,00
2,034
2,25
-0,216
xnx
n
x
x
yny
n
y
y
Для того чтобы получить представление, насколько хорошо вычисленные по этому уравнению значения Yi согласуются с наблюдаемыми значениями yi, найдём отклонения Yi – yi. Результаты вычислений приведены в таблице:
Видно, что все отклонения достаточно малы. Это объясняется
малым числом наблюдений.
2.5. Отыскание параметров выборочного уравнения
прямой линии регрессии по сгруппированным данным
Выше была получена система уравнений для определения параметров уравнения прямой линии регрессии Y на X.
Предполагалось, что значения хi и соответствующие им значения yi
наблюдались по одному разу.
Пусть получено большое число данных, среди которых есть
повторяющиеся и пусть они сгруппированы в корреляционной таблице. Запишем систему так, чтобы она отражала данные корреляционной таблицы. Воспользуемся тождествами:
(следствие из
(следствие из
);
);
27

22
xnx
n
x
x
2
2
xynxy
xy
nxy раз).
yx
2
2
xxn
yxnxyn
xy
yx
xyb
yx
bxy
yxx
xxyy
yxx
2
2
yyn
yxnxyn
xy
xy
Cyx
xyy
yxC
xy
yyxx
xyy
yx
tgyx
Подставив правые части исходной системы и сократив на
n, получим:
(следствие из
(учтено, что пара чисел (x,y) наблюдались
);
Решив эту систему, найдём коэффициент регрессии Y на X
.
Параметр «b» найдём из второго уравнения данной системы:
.
Подставив правую часть последнего равенства в уравнение
, получим:
– уравнение прямой линии
регрессии Y на X.
Аналогично можно найти коэффициент регрессии X на Y:
.
:
Учитывая, что
уравнение прямой линии регрессии X на Y:
2.6. Выборочный коэффициент корреляции
В случае положительных коэффициентов регрессии
реляцию называют положительной, в этом случае прямые регрессии
образуют острые углы с соответствующими осями координат (рис.3).
Прямая регрессии Y на X имеет коэффициент регрессии
, где
28
, получим
.
кор-
, где

29
α – острый угол, образованный прямой (1) с осью Ox. Прямая регрессии Х на Y имеет коэффициент регрессии
tg
xy
, где β – острый
угол, образованный прямой (2) с осью Oy.
При отрицательных коэффициентах регрессии корреляцию
называют отрицательной, а прямые регрессии образуют с соответствующими осями тупые углы.
Рис. 3. Прямые регрессии:
Y на X (1), X на Y (2)
О тесноте связи между признаками X и Y можно судить по величине угла, образованного прямыми регрессии. Чем меньше этот
угол, тем теснее корреляционная зависимость между X и Y. При слиянии этих двух прямых в одну между X и Y имеет место не статистическая зависимость, а линейная функциональная зависимость.
В качестве меры тесноты линейной корреляционной зависимости принимается выборочный коэффициент корреляции:
tg
tg
r
xy
yx
B
.
Свойства выборочного коэффициента корреляции:
– Значения коэффициента корреляции изменяются на множестве
1r1:r1;1
BB
.
– Чем больше
B
r
, тем теснее связь между изучаемыми количе-
ственными признаками.
– Если
1r
B
, то корреляционная зависимость является функ-
циональной.

30
– Если
0r
B
, то между изучаемыми признаками нет линейной
корреляционной зависимости, что не исключает существование какого-либо другого вида корреляционной зависимости (параболической,
показательной и др.).
Если
31nr
B
, то связь между случайными величинами
достаточно вероятна. В случае если связь между случайными величинами маловероятна, нахождение уравнений линий регрессии не
имеет смысла.
Рассмотрим некоторые формулы, используемые для вычисле-
ния коэффициентов регрессии и коэффициента корреляции.
yx
B
n
yyxx
r
;
;
n
y
y;
n
x
x
n
1i
i
n
1i
i
;
2
n
x
x
x
;
2
n
y
y
y
22
B
yyxx
yyxx
r
;
;
2
xx
yyxx
yx
.
2
yy
yyxx
xy
2
2
xxn
yxnxyn
xy
yx
;
2
2
yyn
yxnxyn
xy
xy
;
2
x
xy
yx
n
yxnxyn
;
))((
2
2
yyn
xynxyn
xy
xy
;
y
x
xy
B
n
y x n
xy n r
;
.;
y
x
Bxy
x
y
Byx
rr
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
