Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Кореляционно-регресионный анализ в Excel и Mathcad. Лабораторный практикум
.pdf
Корреляция и регрессия тесно связаны между собой: первая
оценивает силу (тесноту) статистической связи, вторая исследует ее
форму. И та, и другая служат для установления соотношения между
явлениями, для определения наличия или отсутствия связи.
Корреляционно-регрессионный анализ как общее понятие
включает в себя измерение тесноты, направление связи и установление аналитического выражения (формы) связи (регрессионный анализ).
3.4. УРАВНЕНИЕ СВЯЗИ
Статистическую связь между признаками выражают с помощью
такой математической функции, которая дает наименьшее отклонение
от полученных при наблюдении значений признаков. Уравнение такой функции является уравнением связи между результативными
и факториальными признаками.
Уравнение связи называют также уравнением регрессии.
Регрессионный анализ заключается в определении аналитического выражения связи, в котором изменение одной величины (называемой зависимой или результативным признаком) обусловлено
влиянием одной или нескольких независимых величин (факторов),
а множество всех прочих факторов, также оказывающих влияние на
зависимую переменную, принимается за постоянные и средние значения. Регрессия может быть однофакторной (парной) и многофакторно
(множественной).
По форме зависимости различают:
а) линейную регрессию, которая выражается уравнением прямой (линейной) функцией вида: у = а + bх;
б) нелинейную регрессию, которая выражается уравнениями
степенной, показательной, экспоненциальной функций, а также уравнениями параболы и гиперболы следующего вида:
парабола у = а + bх + сх2; гипербола у = а + b/х
и т. д.
По направлению связи различают:
а) прямую регрессию (положительную), возникающую при условии, если увеличением или уменьшением независимой переменной
значения зависимо: переменная также соответственно увеличивается
или уменьшаются;
б) обратную (отрицательную) регрессию, появляющуюся при
условии, что увеличением или уменьшением независимой переменной зависимая переменная соответственно уменьшается или увеличивается.
61

3.5. ОПРЕДЕЛЕНИЕ ПАРАМЕТРОВ УРАВНЕНИЯ
y
=
=
y
∂∂=
∂
)()
yy y
y
y
ЛИНЕЙНОЙ СВЯЗИ
При линейной связи параметры уравнений регрессии находят по
способу наименьших квадратов.
Рассмотрим случай, когда имеется п наблюдений двух переменных х и у. Предположив, что у зависит от х, мы хотим подобрать уравнение:
abx
.
+
(3.3)
Расчетное значение зависимой переменной y и остаток еi, для
наблюдения определяются уравнениями
yabx
ii
eyyyabx
=−=−−
ii i i
+
;
.
Сумма квадратов отклонений равна
See e yy==+…+= −∑∑
22 2
ii i ii
()
Тогда требование наименьших квадратов записывается в виде
Syy=−→∑
()
ii
min
, (3.4)
2
т. е. сумма квадратов отклонений фактических ординат точек корреляционного поля от ординат, вычисленных по уравнению (1), должна
быть наименьшей.
Отыскание параметров прямой, удовлетворяющей этому требованию, называется способом наименьших квадратов.
Для парной линейной регрессии задача заключается в отыскании неизвестных параметров а и b, минимизирующих сумму квадратов отклонений, т. е. функцию S:
Se
2
ii i
()
abx=∑ =∑ − −
2
.
Значения а и b, удовлетворяющие минимуму функции S, находят из уравнений:
SS
00.,
ab
=
(3.5)
∂
Выразим квадрат i-го остатка:
22222
e
=− =−− =++ − + −
(
iii i ii i i i ii
62
2
abx
abx ayabx bx
22 2.

Суммируя по всем п наблюдениям, запишем S в виде
x
−
=
∑
−
−
x
x
−
∑
∑
x
S y na b x a y ab x b x y=++∑−∑+ −∑∑∑
2222
iiiiii
Тогда условия минимизации функции S принимают вид
S
∂
b
∂
Подставив в первое уравнение n y вместо ∑y
получим
Следовательно,
Подставив полученное выражение для а во второе уравнение
минимизации, имеем
22 2.
S
∂
∂
22 2 0;
an y b x
=− + =
a
∑∑
ii
2220.
bx ax xy
=+−=
2
∑∑∑
iiii
2220.an ny bx
+=
.aybx
−
и n
i
вместо ∑x
i
или
или
2222 0.
b x nx y bnx x y+− − =
22
iii
После преобразования получим
11
⎧⎫
bxx xyxy
⎨⎬
nn
⎩⎭
bxxxyxy
22
∑∑
iii
1
⎧⎫
∑
⎨⎬
n
⎩⎭
=−⋅
22
i
Откуда
xy x y
b
=
−⋅
1
xx
∑
n
i
ynxy
b
=
22
∑
=−⋅
,
22
−
nx
−
⋅
,
(3.6)
,
.
11
yxxyyxyxy
cov ,
() ()()
=−−=−⋅∑∑
nn
63
,

а дисперсия равна
(
)
y
xy
y
−
х
x
y
(
)
y
x
=
σ
σ
=
Var x x x x x
=−=∑−
()
∑
()
11
222
,
nn
то параметр b можно выразить как
cov ,x
b
=
Var x
.
()
Коэффициент корреляции определяется по формуле
x
σσ
xy
⋅
, (3.7)
,
– средние значе-
– средние квадратические
y
=
r
где
y – среднее значение произведений х и у;
ния соответствующих признаков; σx. и σ
отклонения, найденные по признаку х и по признаку у.
Коэффициент корреляции можно также установить через показатель ковариации:
cov ,
x
r =
Зная значения r, σx, σ
σσ
xy
можно вычислить коэффициенты корре-
y
, (3.8)
ляционного уравнения по следующим формулам:
aybx
br
=⋅
−
,
y
.
Коэффициент корреляции рассчитан.
3.6. СТАТИСТИЧЕСКИЙ АНАЛИЗ МОДЕЛИ
Оценка параметров парной регрессии выполняется из следующих предпосылок. Предположим, что для генеральной совокупности
связь между х и у линейна. Наличие случайных отклонений, вызванных воздействием на переменную множества других, неучтенных
в нашем уравнении факторов и ошибок измерения, приведет к тому,
что связь наблюдаемых величин хi, и yi, приобретет вид
64
yx
α+β +ε
iii
. (3.9)

Здесь ε
y
=
()(
=
бы были известны точные значения отклонений ε
– случайные ошибки (отклонения, возмущения). Если
i
, то можно было бы
i
рассчитать значения параметров а и β. Однако значения случайных
отклонений в выборке неизвестны, и по наблюдениям х, и можно по-
лучить оценки параметров а и β, которые сами являются случайными
величинами, поскольку соответствуют случайной выборке. Пусть a –
оценка параметра α, b – оценка параметра β. Тогда оцененное уравнение регрессии будет иметь вид
где e
abx e
++
– наблюдаемые значения ошибок ε
i
iii
,
(3.10)
.
i
Для того чтобы полученные методом наименьших квадратов
оценки а и b обладали желательными свойствами, сделаем следую-
щие предпосылки об отклонениях ε
1) величина ε
2) математическое ожидание ε
3) дисперсия ε
4) значения ε
является случайной переменной;
i
постоянна: D > (ε
i
независимы между собой.
i
:
i
равно нулю;
i
) – D(Ej) для всех I, j;
i
Известно, что если данные условия выполняются, то оценки,
сделанные с помощью метода наименьших квадратов, обладают следующими свойствами:
1. Оценки являются несмещенными, т. е. математическое ожи-
дание оценки каждого параметра равно его истинному значению:
М(а) = α; М(b) = β. Это вытекает из того, что М(ε
) = 0, и говорит об
i
отсутствии систематической ошибки в определении положения линии
регрессии.
2. Оценки состоятельны, так как дисперсия оценок параметров
при возрастании числа наблюдений стремится к нулю:
lim 0; lim 0.D а Db
=
)
Иначе говоря, надежность оценки при увеличении выборки
растет.
3. Оценки эффективны, они имеют наименьшую дисперсию по
сравнению с любыми другими оценками данного параметра.
Перечисленные свойства не зависят от конкретного вида распределения величин ε
, тем не менее обычно предполагается, что они
i
распределены нормально. Эта предпосылка необходима для проверки
статистической значимости сделанных оценок и определения для них
доверительных интервалов.
65

Если предположения (3) и (4) нарушены, т. е. дисперсия возмущений непостоянна или значения ε
, связаны друг с другом, то свой-
i
ства несмещенности и состоятельности сохраняются, но свойства
эффективности – нет.
Оценка параметров конкретной регрессии является лишь отдельным этапом длительного и сложного процесса построения математической модели. Первое же оцененное уравнение очень редко является удовлетворительным во всех отношениях. Обычно приходится
постепенно подбирать формулу связи и состав объясняющих переменных, анализируя на каждом этапе качество оцененной зависимости. Этот анализ качества включает статистическую и содержательную составляющую. Проверка статистического качества оцененного
уравнения состоит из следующих элементов:
– проверка статистической значимости каждого коэффициента
уравнения регрессии;
– проверка общего качества уравнения регрессии;
– проверка свойств данных, выполнение которых предполага-
лось при оценивании уравнения.
Под содержательной составляющей анализа качества понимается рассмотрение математического (технического) смысла оцененного
уравнения регрессии: действительно ли значимыми оказались объясняющие факторы, важные с точки зрения теории; положительны или
отрицательны коэффициенты, показывающие направление воздействия этих факторов; попали ли оценки коэффициентов регрессии в
предполагаемые из теоретических соображений интервалы.
Контрольные вопросы и задания
1. Как получить зависимости и модели для описания изучаемого
явления?
2. Что дает введение случайного компонента в математическую
модель?
3. Что такое корреляция между количественными признаками?
4. Дайте пояснение числовой характеристики случайной вели-
чины.
5. Что используется для характеристики связи между величии-
нами?
6. Что такое корреляция?
7. В каких пределах
изменяется коэффициент корреляции?
8. Что характеризует отрицательная корреляция?
9. Перечислить варианты зависимостей в статистике.
10. Что такое уравнение связи?
66

Лабораторная работа 3
МАТЕМАТИЧЕСКАЯ СТАТИСТИКА I
(НОРМАЛЬНОЕ (ГАУССОВО) РАСПРЕДЕЛЕНИЕ. СТАТИСТИЧЕСКИЕ
ХАРАКТЕРИСТИКИ: ПОСТРОЕНИЕ ГИСТОГРАММ, СРЕДНЕЕ ЗНАЧЕНИЕ
И ДИСПЕРСИЯ, КОРРЕЛЯЦИЯ И КОВАРИАЦИЯ)
(2 часа)
Цель работы:
использование математических статистик
в Mathcad: нормальное (гауссово) распределение; статистические характеристики – построение гистограмм, среднее значение и дисперсия, корреляция и ковариация.
Задачи работы:
1. Овладеть навыками использования математических статистик
для описания данных.
2. Овладеть навыками графического оформления результатов.
3. Освоить принципы использования математических статистик
при обработке данных.
Обеспечивающие средства: ПВЭМ; программный продукт
Mathcad 15.
Задание: Сгенерировать два вектора с нормальным законом
распределения. (Моделирование размеров стружки, длина – x1 и ширина – x2, мм; количество чисел – 25). Для x1: σ = 1, μ = 25; Для x2:
σ = 0,1, μ = 4; М = 25. На рис. 3.2 показан результат моделирования,
на рис. 3.3 – графическое изображение результата.
Краткие теоретические сведения
Нормальное (гауссово) распределение.
Перечислим встроенные функции Mathcad для описания нор-
мального распределения вероятностей:
– dnorm (x, μ, σ) – плотность вероятности нормального распре-
деления;
– pnorm (x, μ, σ) – функция нормального распределения;
– cnorm (x) – функция нормального распределения для μ = 0,
σ = 1;
– qnorm (p,
μ, σ) – обратная функция нормального распределе-
ния;
– rnorm (M,
μ, σ) – вектор М независимых случайных чисел,
каждое из которых имеет нормальное распределение,
67

где:
– x – значение случайной величины;
– р – значение вероятности;
– μ – математическое ожидание;
– σ – среднеквадратичное отклонение.
Построение гистограмм
Гистограммой называется график, аппроксимирующий по случайным данным плотность их распределения. При построении гистограммы область значений случайной величины (а,b) разбивается на
некоторое количество bin сегментов, а затем подсчитывается процент
попадания в каждый сегмент.
Для построения гистограммы в Mathcad имеется несколько
встроенных функций.
Рассмотрим самую сложную по применению, чтобы хорошо разобраться в возможностях каждой функции.
hist(intvls,x) – вектор частоты попадания в интервалы гистограммы, где:
intvls – вектор, элементы которого задают сегменты построения
гистограммы в порядке возрастания a ≤ intvlsi < b;
Если вектор intvls имеет bin элементов, то и результат hist имеет
столько же элементов.
Для анализа взято N = 25 данных с нормальным законом распределения, созданных генератором случайных чисел (третья строка
листинга). Далее определяются границы интервала (upper, lower),
содержащего внутри себя все случайные значения, и осуществляется
его разбиение на количество (bin) одинаковых сегментов, начальные
точки которых записываются в вектор int (предпоследняя строка листинга).
Внимание! В векторе int можно задать произвольные границы
сегментов разбиения так, чтобы они имели разную ширину.
Обратите внимание, что в последней строке листинга осуществлена нормировка значений гистограммы с тем, чтобы она правильно
аппроксимировала плотность вероятности, также показанную на графике.
Очень важно переопределение вектора int в самом верху, которое необходимо для перехода от левой границы каждого элементарного сегмента к его центру.
68

Если нет необходимости задавать сегменты гистограммы разной
ширины, то удобнее воспользоваться упрощенным вариантом функции hist или функцией histogram:
hist(bin,x) – вектор частоты попадания данных в интервалы гистограммы;
histogram (bin,x) – матрица гистограммы размером bin×2, состоящая из столбца сегмента разбиения и столбца частоты попадания
в них данных, где:
bin – количество сегментов построения гистограммы;
x – вектор случайных данных.
Среднее значение и дисперсия
Для расчета числовых статистических характеристик рядов случайных чисел в Mathcad имеется ряд встроенных функций:
– mean(x) – выборочное среднее значение;
– median(x) –выборочная медиана (median) – значение аргумен-
та, которое делит гистограмму плотности вероятностей на две равные
части;
– var(x) – выборочная дисперсия (variance);
– stdev(x) – среднеквадратичное (или «стандартное») отклоне-
ние (standarddeviation);
– max(x), min(x) – максимальное и минимальное значение выборки;
– mode(x) – наиболее часто встречающееся значение выборки;
– var(x), stdev(x) – выборочная дисперсия и среднеквадратичное
отклонение в другой нормировке, где x – вектор (или матрица)_ с выборкой случайных данных.
Корреляция и ковариация
Функции, устанавливающие связь между парами двух случайных векторов, называются ковариацией и корреляцией (или коэффициентом корреляции). Эти два понятия различаются нормировкой.
– corr(x) – коэффициент корреляции двух выборок;
– cvar(x) – ковариация двух выборок, где x1, x2 – векторы (или
матрицы) одинакового размера с выборками случайных данных.
69

Порядок выполнения работы
σ
μ
4
5
μ
, σ
,
μ
μ
,
r
⋅
+
)
Пример генерации случайных чисел представлены на рис. 3.2.
На рис. 3.3, представлены построение гистограммы, на рис. 3.4
графическое изображение.
1:=
x1
=
σ
M 25:=
x1 rnorm M
0
24.024
0
24.716
1
24.644
2
23.856
3
24.905
4
24.733
5
23.464
6
7
...
σ, ():=
25:=
Рис. 3.2. Пример генерации x1, x2
(длины и ширины стружек)
N 25:=
bin5:=
x rnorm N 0, 1, ():=
lower floor min x()():=
upper ceil max x()():=
upper lowe
h
:=
−
bin
j0bin..:=
intjlower h j
:=
f
Nh⋅
0.1:=
M2
:=
x2 rnorm M
:=
():=
0
x2
3.822
17
4.642
18
3.793
19
=
20
21
22
23
24
2.425
3.977
4.367
4.781
...
1
hist int x, (
⋅:=
Рис. 3.3. Выполнение примера построение гистограммы
70
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
