Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Кореляционно-регресионный анализ в Excel и Mathcad. Лабораторный практикум

.pdf
Скачиваний:
0
Добавлен:
06.09.2026
Размер:
1 Мб
Скачать
Корреляция и регрессия тесно связаны между собой: первая оценивает силу (тесноту) статистической связи, вторая исследует ее форму. И та, и другая служат для установления соотношения между явлениями, для определения наличия или отсутствия связи.
Корреляционно-регрессионный анализ как общее понятие включает в себя измерение тесноты, направление связи и установле­ние аналитического выражения (формы) связи (регрессионный анализ).
3.4. УРАВНЕНИЕ СВЯЗИ
Статистическую связь между признаками выражают с помощью такой математической функции, которая дает наименьшее отклонение от полученных при наблюдении значений признаков. Уравнение та­кой функции является уравнением связи между результативными и факториальными признаками.
Уравнение связи называют также уравнением регрессии.
Регрессионный анализ заключается в определении аналитиче­ского выражения связи, в котором изменение одной величины (назы­ваемой зависимой или результативным признаком) обусловлено влиянием одной или нескольких независимых величин (факторов), а множество всех прочих факторов, также оказывающих влияние на зависимую переменную, принимается за постоянные и средние значе­ния. Регрессия может быть однофакторной (парной) и многофакторно (множественной).
По форме зависимости различают:
а) линейную регрессию, которая выражается уравнением пря­мой (линейной) функцией вида: у = а + bх;
б) нелинейную регрессию, которая выражается уравнениями степенной, показательной, экспоненциальной функций, а также урав­нениями параболы и гиперболы следующего вида:
парабола у = а + bх + сх2; гипербола у = а + b/х и т. д.
По направлению связи различают:
а) прямую регрессию (положительную), возникающую при ус­ловии, если увеличением или уменьшением независимой переменной значения зависимо: переменная также соответственно увеличивается или уменьшаются;
б) обратную (отрицательную) регрессию, появляющуюся при условии, что увеличением или уменьшением независимой перемен­ной зависимая переменная соответственно уменьшается или увеличи­вается.
61
3.5. ОПРЕДЕЛЕНИЕ ПАРАМЕТРОВ УРАВНЕНИЯ
y
=
=
y
∂∂=
)()
yy y
y
y
ЛИНЕЙНОЙ СВЯЗИ
При линейной связи параметры уравнений регрессии находят по способу наименьших квадратов.
Рассмотрим случай, когда имеется п наблюдений двух перемен­ных х и у. Предположив, что у зависит от х, мы хотим подобрать урав­нение:
abx
.
+
(3.3)
Расчетное значение зависимой переменной y и остаток еi, для наблюдения определяются уравнениями
yabx
ii
eyyyabx
=−=−−
ii i i
+
;
.
Сумма квадратов отклонений равна
See e yy==++= −∑∑
22 2
ii i ii
()
Тогда требование наименьших квадратов записывается в виде
Syy=−
()
ii
min
, (3.4)
2
т. е. сумма квадратов отклонений фактических ординат точек корре­ляционного поля от ординат, вычисленных по уравнению (1), должна быть наименьшей.
Отыскание параметров прямой, удовлетворяющей этому требо­ванию, называется способом наименьших квадратов.
Для парной линейной регрессии задача заключается в отыска­нии неизвестных параметров а и b, минимизирующих сумму квадра­тов отклонений, т. е. функцию S:
Se
2
ii i
()
abx=∑ =∑
2
.
Значения а и b, удовлетворяющие минимуму функции S, нахо­дят из уравнений:
SS
00.,
ab
=
(3.5)
Выразим квадрат i-го остатка:
22222
e
=− =−− =++ − +
(
iii i ii i i i ii
62
2
abx
abx ayabx bx
22 2.
Суммируя по всем п наблюдениям, запишем S в виде
x
=
x
x
x
S y na b x a y ab x b x y=+++ ∑∑
2222
iiiiii
Тогда условия минимизации функции S принимают вид
S
b
Подставив в первое уравнение n y вместо y
получим
Следовательно,
Подставив полученное выражение для а во второе уравнение минимизации, имеем
22 2.
S
22 2 0;
an y b x
=− + =
a
∑∑
ii
2220.
bx ax xy
=+−=
2
∑∑
iiii
2220.an ny bx
+=
.aybx
и n
i
вместо x
i
или
или
2222 0.
b x nx y bnx x y+− − =
22
iii
После преобразования получим
11
⎧⎫
bxx xyxy
⎨⎬
nn
⎩⎭
bxxxyxy
22
∑∑
iii
1
⎧⎫
⎨⎬
n
⎩⎭
=−
22
i
Откуда
xy x y
b
=
−⋅
1
xx
n
i
ynxy
b
=
22
=−⋅
,
22
nx
,
(3.6)
,
.
11
yxxyyxyxy
cov ,
() ()()
=−=−∑∑
nn
63
,
а дисперсия равна
(
)
y
xy
y
х
x
y
(
)
y
x
=
σ
σ
=
Var x x x x x
=−=
()
()
11
222
,
nn
то параметр b можно выразить как
cov ,x
b
=
Var x
.
()
Коэффициент корреляции определяется по формуле
x
σσ
xy
, (3.7)
,
средние значе-
средние квадратические
y
=
r
где
y – среднее значение произведений х и у;
ния соответствующих признаков; σx. и σ отклонения, найденные по признаку х и по признаку у.
Коэффициент корреляции можно также установить через пока­затель ковариации:
cov ,
x
r =
Зная значения r, σx, σ
σσ
xy
можно вычислить коэффициенты корре-
y
, (3.8)
ляционного уравнения по следующим формулам:
aybx
br
=⋅
,
y
.
Коэффициент корреляции рассчитан.
3.6. СТАТИСТИЧЕСКИЙ АНАЛИЗ МОДЕЛИ
Оценка параметров парной регрессии выполняется из следую­щих предпосылок. Предположим, что для генеральной совокупности связь между х и у линейна. Наличие случайных отклонений, вызван­ных воздействием на переменную множества других, неучтенных в нашем уравнении факторов и ошибок измерения, приведет к тому, что связь наблюдаемых величин хi, и yi, приобретет вид
64
yx
α+β
iii
. (3.9)
Здесь ε
y
=
()(
=
бы были известны точные значения отклонений ε
случайные ошибки (отклонения, возмущения). Если
i
, то можно было бы
i
рассчитать значения параметров а и β. Однако значения случайных отклонений в выборке неизвестны, и по наблюдениям х, и можно по-
лучить оценки параметров а и β, которые сами являются случайными величинами, поскольку соответствуют случайной выборке. Пусть a –
оценка параметра α, b – оценка параметра β. Тогда оцененное уравне­ние регрессии будет иметь вид
где e
abx e
++
наблюдаемые значения ошибок ε
i
iii
,
(3.10)
.
i
Для того чтобы полученные методом наименьших квадратов оценки а и b обладали желательными свойствами, сделаем следую-
щие предпосылки об отклонениях ε
1) величина ε
2) математическое ожидание ε
3) дисперсия ε
4) значения ε
является случайной переменной;
i
постоянна: D > (ε
i
независимы между собой.
i
:
i
равно нулю;
i
) – D(Ej) для всех I, j;
i
Известно, что если данные условия выполняются, то оценки, сделанные с помощью метода наименьших квадратов, обладают сле­дующими свойствами:
1. Оценки являются несмещенными, т. е. математическое ожи-
дание оценки каждого параметра равно его истинному значению:
М(а) = α; М(b) = β. Это вытекает из того, что М(ε
) = 0, и говорит об
i
отсутствии систематической ошибки в определении положения линии регрессии.
2. Оценки состоятельны, так как дисперсия оценок параметров
при возрастании числа наблюдений стремится к нулю:
lim 0; lim 0.D а Db
=
)
Иначе говоря, надежность оценки при увеличении выборки растет.
3. Оценки эффективны, они имеют наименьшую дисперсию по
сравнению с любыми другими оценками данного параметра.
Перечисленные свойства не зависят от конкретного вида рас­пределения величин ε
, тем не менее обычно предполагается, что они
i
распределены нормально. Эта предпосылка необходима для проверки статистической значимости сделанных оценок и определения для них доверительных интервалов.
65
Если предположения (3) и (4) нарушены, т. е. дисперсия возму­щений непостоянна или значения ε
, связаны друг с другом, то свой-
i
ства несмещенности и состоятельности сохраняются, но свойства эффективности – нет.
Оценка параметров конкретной регрессии является лишь от­дельным этапом длительного и сложного процесса построения мате­матической модели. Первое же оцененное уравнение очень редко яв­ляется удовлетворительным во всех отношениях. Обычно приходится постепенно подбирать формулу связи и состав объясняющих пере­менных, анализируя на каждом этапе качество оцененной зависимо­сти. Этот анализ качества включает статистическую и содержатель­ную составляющую. Проверка статистического качества оцененного уравнения состоит из следующих элементов:
– проверка статистической значимости каждого коэффициента уравнения регрессии;
проверка общего качества уравнения регрессии;
проверка свойств данных, выполнение которых предполага-
лось при оценивании уравнения.
Под содержательной составляющей анализа качества понимает­ся рассмотрение математического (технического) смысла оцененного уравнения регрессии: действительно ли значимыми оказались объяс­няющие факторы, важные с точки зрения теории; положительны или отрицательны коэффициенты, показывающие направление воздейст­вия этих факторов; попали ли оценки коэффициентов регрессии в предполагаемые из теоретических соображений интервалы.
Контрольные вопросы и задания
1. Как получить зависимости и модели для описания изучаемого
явления?
2. Что дает введение случайного компонента в математическую
модель?
3. Что такое корреляция между количественными признаками?
4. Дайте пояснение числовой характеристики случайной вели-
чины.
5. Что используется для характеристики связи между величии-
нами?
6. Что такое корреляция?
7. В каких пределах
изменяется коэффициент корреляции?
8. Что характеризует отрицательная корреляция?
9. Перечислить варианты зависимостей в статистике.
10. Что такое уравнение связи?
66
Лабораторная работа 3
МАТЕМАТИЧЕСКАЯ СТАТИСТИКА I
(НОРМАЛЬНОЕ (ГАУССОВО) РАСПРЕДЕЛЕНИЕ. СТАТИСТИЧЕСКИЕ
ХАРАКТЕРИСТИКИ: ПОСТРОЕНИЕ ГИСТОГРАММ, СРЕДНЕЕ ЗНАЧЕНИЕ
И ДИСПЕРСИЯ, КОРРЕЛЯЦИЯ И КОВАРИАЦИЯ)
(2 часа)
Цель работы:
использование математических статистик в Mathcad: нормальное (гауссово) распределение; статистические ха­рактеристики – построение гистограмм, среднее значение и диспер­сия, корреляция и ковариация.
Задачи работы:
1. Овладеть навыками использования математических статистик
для описания данных.
2. Овладеть навыками графического оформления результатов.
3. Освоить принципы использования математических статистик
при обработке данных.
Обеспечивающие средства: ПВЭМ; программный продукт
Mathcad 15.
Задание: Сгенерировать два вектора с нормальным законом
распределения. (Моделирование размеров стружки, длина – x1 и ши­рина – x2, мм; количество чисел – 25). Для x1: σ = 1, μ = 25; Для x2:
σ = 0,1, μ = 4; М = 25. На рис. 3.2 показан результат моделирования,
на рис. 3.3 – графическое изображение результата.
Краткие теоретические сведения
Нормальное (гауссово) распределение. Перечислим встроенные функции Mathcad для описания нор-
мального распределения вероятностей:
– dnorm (x, μ, σ) – плотность вероятности нормального распре-
деления;
– pnorm (x, μ, σ) – функция нормального распределения; – cnorm (x) – функция нормального распределения для μ = 0,
σ = 1;
– qnorm (p,
μ, σ) – обратная функция нормального распределе-
ния;
– rnorm (M,
μ, σ) – вектор М независимых случайных чисел,
каждое из которых имеет нормальное распределение,
67
где: – x – значение случайной величины; – рзначение вероятности;
μматематическое ожидание; – σсреднеквадратичное отклонение.
Построение гистограмм
Гистограммой называется график, аппроксимирующий по слу­чайным данным плотность их распределения. При построении гисто­граммы область значений случайной величины (а,b) разбивается на некоторое количество bin сегментов, а затем подсчитывается процент попадания в каждый сегмент.
Для построения гистограммы в Mathcad имеется несколько встроенных функций.
Рассмотрим самую сложную по применению, чтобы хорошо ра­зобраться в возможностях каждой функции.
hist(intvls,x) – вектор частоты попадания в интервалы гисто­граммы, где:
intvls – вектор, элементы которого задают сегменты построения гистограммы в порядке возрастания a ≤ intvlsi < b;
Если вектор intvls имеет bin элементов, то и результат hist имеет столько же элементов.
Для анализа взято N = 25 данных с нормальным законом рас­пределения, созданных генератором случайных чисел (третья строка листинга). Далее определяются границы интервала (upper, lower), содержащего внутри себя все случайные значения, и осуществляется его разбиение на количество (bin) одинаковых сегментов, начальные точки которых записываются в вектор int (предпоследняя строка лис­тинга).
Внимание! В векторе int можно задать произвольные границы сегментов разбиения так, чтобы они имели разную ширину.
Обратите внимание, что в последней строке листинга осуществ­лена нормировка значений гистограммы с тем, чтобы она правильно аппроксимировала плотность вероятности, также показанную на гра­фике.
Очень важно переопределение вектора int в самом верху, кото­рое необходимо для перехода от левой границы каждого элементар­ного сегмента к его центру.
68
Если нет необходимости задавать сегменты гистограммы разной ширины, то удобнее воспользоваться упрощенным вариантом функ­ции hist или функцией histogram:
hist(bin,x) – вектор частоты попадания данных в интервалы гис­тограммы;
histogram (bin,x) – матрица гистограммы размером bin×2, со­стоящая из столбца сегмента разбиения и столбца частоты попадания в них данных, где:
bin – количество сегментов построения гистограммы;
x – вектор случайных данных.
Среднее значение и дисперсия
Для расчета числовых статистических характеристик рядов слу­чайных чисел в Mathcad имеется ряд встроенных функций:
– mean(x) – выборочное среднее значение;
– median(x) –выборочная медиана (median) – значение аргумен-
та, которое делит гистограмму плотности вероятностей на две равные части;
– var(x) – выборочная дисперсия (variance);
– stdev(x) – среднеквадратичное (или «стандартное») отклоне- ние (standarddeviation);
– max(x), min(x) – максимальное и минимальное значение вы­борки;
– mode(x) – наиболее часто встречающееся значение вы­борки;
– var(x), stdev(x) – выборочная дисперсия и среднеквадратичное
отклонение в другой нормировке, где x – вектор (или матрица)_ с вы­боркой случайных данных.
Корреляция и ковариация
Функции, устанавливающие связь между парами двух слу­чайных векторов, называются ковариацией и корреляцией (или ко­эффициентом корреляции). Эти два понятия различаются норми­ровкой.
– corr(x) – коэффициент корреляции двух выборок;
– cvar(x) – ковариация двух выборок, где x1, x2 – векторы (или матрицы) одинакового размера с выборками случайных данных.
69
Порядок выполнения работы
σ
μ
4
5
μ
, σ
,
μ
μ
,
r
+
)
Пример генерации случайных чисел представлены на рис. 3.2.
На рис. 3.3, представлены построение гистограммы, на рис. 3.4 графическое изображение.
1:=
x1
=
σ
M 25:=
x1 rnorm M
0
24.024
0
24.716
1
24.644
2
23.856
3
24.905
4
24.733
5
23.464
6 7
...
σ, ():=
25:=
Рис. 3.2. Пример генерации x1, x2
(длины и ширины стружек)
N 25:=
bin5:= x rnorm N 0, 1, ():=
lower floor min x()():=
upper ceil max x()():=
upper lowe
h
:=
bin
j0bin..:=
intjlower h j
:=
f
Nh
0.1:=
M2
:=
x2 rnorm M
:=
():=
0
x2
3.822
17
4.642
18
3.793
19
=
20 21 22 23 24
2.425
3.977
4.367
4.781 ...
1
hist int x, (
:=
Рис. 3.3. Выполнение примера построение гистограммы
70
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]