Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Компьютерная обработка статистических данных. Учебное пособие
.pdf
Далее, вычислим значения поправочных коэффициентов
( ( 1)/2)( ( 1)/2)
ii
R n S n
Т для обеих выборок, введя в ячейке К56 формулу
=СУММКВ(K2:K55)-54 и скопировав ее в ячейку L56.
В ячейке Р56 вычислим значение
, введя формулу
=СУММПРОИЗВ(O2:O55;P2:P55).
Значение коэффициента корреляции Спирмена
вычислим в ячейке О58, введя формулу:
=6*P56/(54^3-54-0,5*(К56+L56)).
Рис.5.4. Вычисление коэффициента ранговой корреляции Спирмена
Полученное значение коэффициента 0,046 близко к 0 и
не требует проверки статистической значимости, тем не
менее, определим критическое значение коэффициента
Спирмена – оно равно 0,226 и превышает вычисленное
значение коэффициента корреляции. Таким образом, можно
сделать вывод об отсутствии линейной корреляционной
связи между содержанием золота и свинца в пробах.
Здесь следует подчеркнуть, что пока мы рассматривали
только гипотезу о наличии линейной корреляции, когда
зависимость математического ожидания одной величины от
значения другой выражается линейным уравнением, и поле
точек соотношений величин представляет собой «облако»,
61

более или менее вытянутое около некоторой прямой. Но
возможны и другие формы зависимости. Отсутствие
линейной корреляции не означает отсутствия
корреляционной связи вообще. Проверка гипотезы о наличии
криволинейной корреляционной связи основывается на
вычислении корреляционного отношения, о котором мы
поговорим немного позже.
Регрессионный анализ
Еще одним инструментом изучения стохастических
зависимостей, является регрессионный анализ.
Регрессионный анализ устанавливает формы зависимости
между случайной величиной Y (зависимой) и значениями
одной или нескольких переменных величин (независимых),
причем значения последних считаются точно заданными.
Такая зависимость обычно определяется некоторой
математической моделью (уравнением регрессии),
содержащей несколько неизвестных параметров. В ходе
регрессионного анализа на основании выборочных данных
находят оценки этих параметров, определяются
статистические ошибки оценок или границы доверительных
интервалов и проверяется соответствие принятой
математической модели экспериментальным данным.
В линейном регрессионном анализе связь между
случайными величинами предполагается линейной. В самом
простом случае в парной линейной регрессионной модели
имеются две переменные Х и Y. И требуется по n парам
наблюдений (X1, Y1), (X2, Y2), ..., (Xn, Yn) построить
(подобрать) прямую линию, называемую линией регрессии,
которая «наилучшим образом» приближает наблюдаемые
значения. Уравнение этой линии y=аx+b является
регрессионным уравнением. С помощью регрессионного
уравнения можно предсказать ожидаемое значение
зависимой величины y, соответствующее заданному
значению независимой переменной x
62

В случае, когда рассматривается зависимость между
одной зависимой переменной Y и несколькими
независимыми X1, X2, ..., Xm, говорят о множественной
линейной регрессии.
В этом случае регрессионное уравнение имеет вид
y = a0+a1x1+a2x2+…+amxm,
где a0, a1, a2, …, am – требующие определения коэффициенты
регрессии.
Коэффициенты уравнения регрессии определяются при
помощи метода наименьших квадратов, добиваясь
минимально возможной суммы квадратов расхождений
реальных значений переменной Y и вычисленных по
регрессионному уравнению. Поэтому уравнение линейной
регрессии может быть построено даже в том случае, когда
линейная корреляционная связь отсутствует.
Мерой эффективности регрессионной модели является
коэффициент детерминации R2 (R-квадрат). Коэффициент
детерминации может принимать значения между 0 и 1 и
определяет, с какой степенью точности полученное
регрессионное уравнение описывает (аппроксимирует)
исходные данные. Исследуется также значимость
регрессионной модели с помощью F-критерия (Фишера) и
достоверность отличия коэффициентов a0, a1, a2, …, am от
нуля проверяется с помощью критерия Стьюдента.
В Excel экспериментальные данные аппроксимируются
линейным уравнением до 16 порядка.
Полную информацию об уравнении линейной регрессии
дает функция ЛИНЕЙН. Кроме того, могут быть
использованы функции НАКЛОН и ОТРЕЗОК для получения
параметров регрессионного уравнения и функция
ТЕНДЕНЦИЯ и ПРЕДСКАЗ для получения предсказанных
значений Y в требуемых точках (для парной регрессии).
Рассмотрим подробно применение функции
ЛИНЕЙН(известные_y, [известные_x], [константа],
[статистика]):
63

известные_у – диапазон известных значений зависимого
Коэффициент а
Коэффициент b
Стандартная ошибка
коэффициента а
Стандартная ошибка
коэффициента b
Коэффициент детерминации
R
2
Стандартная ошибка для
оценки y
Значение F-статистики
Число степеней свободы k2
Регрессионная сумма
квадратов
Остаточная сумма
квадратов
параметра Y – строка или столбец.
известные_х – диапазон известных значений одного или
нескольких независимых параметров Xi. Должен иметь ту же
форму, что и диапазон Y (для нескольких параметров –
соответственно несколько столбцов или строк);
константа – логический аргумент. Если исходя из
практического смысла задачи необходимо, чтобы линия
регрессии проходила через начало координат, то есть
свободный коэффициент был равен 0, значение этого
аргумента следует положить равным 0 (или «ложь»). Если
значение положено 1 (или «истина») или опущено, то
свободный коэффициент вычисляется обычным образом;
статистика – логический аргумент. Если значение
положено 1 (или «истина»), то дополнительно возвращается
регрессионная статистика (см таблицу 5.2), используемая для
оценки эффективности и значимости модели.
В общем случае для парной регрессии y=аx+b результат
применения функции ЛИНЕЙН имеет вид:
Табл.5.2.Выводной диапазон функции ЛИНЕЙН для парного
регрессионного анализа
В случае множественного регрессионного анализа для
уравнения y=a0+a1x1+a2x2+…+amxm в первой строке
выводятся коэффициенты am,…,a1,а0, во второй –
стандартные ошибки для этих коэффициентов. В 3-5 строках
за исключением первых двух столбцов, заполненных
регрессионной статистикой, будет получено значение #Н/Д.
64

Вводить функцию ЛИНЕЙН следует как формулу
массива, выделив вначале массив нужного размера для
результата (m+1 столбец и 5 строк, если требуется
регрессионная статистика) и завершив ввод формулы
нажатием CTRL+SHIFT+ENTER.
Оценка значимости полученной регрессионной модели
проводится следующим образом:
• F-статистика используется для того, чтобы
определить, является ли наблюдаемая связь зависимой и
независимых переменных случайной. Критическое
значение F-критерия рассчитывается при помощи функции
FРАСПОБР(;k1;k2), где k2-полученное число степеней
свободы, k1=n-1-k2. Если значение F-статистики выше
критического, то регрессионная модель в целом значима.
можно также определить вероятность случайного
получения высокого значения F-статистики при помощи
функции FРАСП(F;k1;k2)
• T-статистика позволяет оценить значимость каждого
полученного коэффициента наклона. Для этого следует
разделить коэф.наклона на станд.ошибку и сравнить
полученное значение t-статистики с критическим,
найденным по формуле СТЬЮДРАСПОБР(;k2). Если
значение t-статистики меньше критического, то
соответствующий коэффициент может считаться нулевым,
а это означает, что влияние соответствующей независимой
переменной на зависимую переменную недостоверно, и эта
независимая переменная может быть исключена из
уравнения.
Функцию ЛИНЕЙН можно использовать также для
аппроксимации по методу наименьших квадратов с
помощью других видов моделей, являющихся линейными
по неизвестным параметрам, включая полиномиальные,
логарифмические, экспоненциальные и степенные ряды.
Так, для получения парной квадратичной регрессионной
65

модели следует вычислить квадраты значений аргумента Х
2 2 2 2 2 2 2
( ) , ( ) , ( )
y yx y y yx x
yx
y y n y y n
2
y
2
2
( 2)
( 2)( 4)
(1 )( 2) 2( 4)
yx
y
yx
nm
m n m
mn
и построить линейную регрессионную модель с
аргументами Х и Х2. Однако надо помнить, что чем выше
степень полиномиального регрессионного уравнения, тем
выше его точность (коэффициент детерминации) и тем
меньше значимость при небольшом объеме выборки.
Необходимо иметь хотя бы 5-6 известных пар данных на
каждый определяемый коэффициент уравнения регрессии.
Для вычисления коэффициентов экспоненциальной
регрессии в Excel существует функция ЛГРФПРИБЛ.
Функция РОСТ для экспоненциальной регрессии позволяет
получить значения Y в требуемых точках и имеет тот же
смысл, что и функция ПРЕДСКАЗ для линейной регрессии.
Если полученное уравнение регрессии оказалось
значимо, его используют для прогнозирования значения
зависимого признака Y при конкретных значениях
независимых признаков Xi.Прогноз будет тем точнее, чем
выше коэффициент детерминации.
Кроме того, уравнение парной линейной регрессии (даже
незначимое) используется для определения корреляционного
отношения, характеризующего тесноту криволинейной
корреляционной связи, если доказано отсутствие линейной
корреляции:
где yx – «выровненные» значения y, вычисленные по
уравнению линейной регрессии,
- дисперсия выборки Y (вычисляется в Excel при помощи
функции ДИСПР).
Статистическая значимость отличия корреляционного
отношения от нуля проверяется с помощью критерия
При равенстве истинного корреляционного отношения нулю
66
.

величина
y
y
y
xy
распределена нормально с математическим
ожиданием 0 и дисперсией 1, что позволяет определять
критические значения
для заданных доверительных
вероятностей по таблицам нормального распределения. Если
расчетное значение
превышает критическое, гипотеза об
отсутствии корреляционной связи отвергается.
Корреляционное отношение несимметрично, гипотеза о
наличии криволинейной корреляции проверяется и по
.
Для вычисления корреляционного отношения значимость
уравнения регрессии не важна, поэтому если коэффициент
линейной корреляции статистически не значим,
коэффициенты уравнения парной линейной регрессии
можно определить просто при помощи функций НАКЛОН
(коэффициент а) и ОТРЕЗОК (коэффициент b).
Пример 5.2. Провести регрессионный анализ влияния
содержания Pb на содержание Au (табл. 5.1), построив
уравнения линейной и квадратичной корреляции, проверив
их значимость и сравнить их эффективность.
Решение. Скопируем данные на новый лист Excel. Выделим
массив E2:F6 и введем формулу
=ЛИНЕЙН(C2:C55;B2:B55;1;1), завершив ввод нажатием
CTRL+SHIFT+ENTER (рис.5.5)
Рис.5.5. Выполнение парного регрессионого анализа.
67

В ячейке Е4 содержится коэффициент детерминации.
Его значение крайне низко, что не позволяет использовать
полученное уравнение регрессии для прогнозирования.
Низкое значение F-статистики, в свою очередь, указывает на
незначимость уравнения регрессии. Впрочем, это
неудивительно, поскольку отсутствие линейной корреляции
нами уже было доказано в примере 5.1.
Попробуем построить уравнение квадратичной
регрессии (рис.5.6.). Для этого в столбце А вычислим
квадраты данных столбца В и в массиве E9:G13 применим
функцию ЛИНЕЙН, взяв в качестве второго аргумента
массив А2:В55.
Значение F-статистики выросло довольно значительно.
Проверим значимость полученного уравнения, вычислив
критическое значение в ячейке Н12
Рис.5.6. Построение и оценкаквадратичного уравнения регрессии.
Как видим, значение F-статистики выше критического
при уровне значимости 0,05, так что полученное уравнение
68

(Au)=-0,23126(Pb)+1,138285(Pb2)+0,848124
статистически значимо с доверительной вероятностью 0,95.
Однако его точность все еще продолжает желать лучшего:
коэффициент детерминации всего 0,11.
Решение задач корреляционно-регрессионного анализа
полезно визуализировать, строя точечные диаграммы.
Сделаем это для нашего примера: выделим два столбца
исходных данных и выберем на вкладке «Вставка»:
«график»-«все типы диаграмм»-«точечная» (рис.5.7) Как
видим, поле точек в целом слишком широко и визуально не
прослеживается даже криволинейная корреляция. Но также
можно заметить, что оно как бы распадается на две части –
более узкое поле для бедных по свинцу образцов (<2,5) явно
даст значимую линейную корреляцию.
Рис. 5.7. Корреляционное поле точек примера 5.2.
Таким образом, в целях наиболее полного решения
задачи следует поэтому выделить из всех данных выборку
бедных по свинцу образцов и провести корреляционнорегрессионный анализ для нее.
Однако вернемся пока к построенной диаграмме. На ней
Excel позволяет построить линию регрессии выбранного
типа (линейную, полиномиальную, степенную,
логарифмическую, экспоненциальную). Для этого следует
подвести курсор к одной из точек поля, нажать левую
69

клавишу мыши и выбрать опцию «добавить линию тренда».
год
Пр-во
стали,
всего
Кислор.
конвертер
Электр.
печи
Мартен
печи
Выбросы
СО
2
1997
48 502
26 652
6 215
15 750
94 512
1998
43 822
26 103
5 531
12 190
85 430
1999
51 510
30 327
6 603
14 580
98 095
2000
59 136
34 300
8 610
16 170
114 205
2001
58 970
34 589
8 847
15 534
117 599
2002
59 777
36 725
8 900
14 152
120 498
2003
61 450
38 500
9 350
13 600
119 888
2004
65 583
40 373
10 690
14 520
124 799
2005
66 146
40 750
10 800
14 600
131 418
2006
70 830
41 686
16 269
12 875
133 978
2007
72 387
41 209
19 291
11 887
134 472
2008
68 510
38 907
20 000
11 627
Можно даже при этом поместить на диаграмму коэффициент
детерминации (аппроксимации) этой линии регрессии:
Задание 5
5.1. Построить другие полиномиальные уравнения регрессии
для примера 5.2. и выбрать наилучшее с точки зрения
значимости и точности.
5.2. Выбрать данные бедных по свинцу руд и провести для
них регрессионный анализ.
5.3.Провести регрессионный анализ влияния долевого
распределения способов производства стали на удельные
выбросы СО2 на основании данных по России за 1997-2007
гг, приведенные в таблице 5.3. Для этого:
1) рассчитать долевое распределение способов производства
и удельные выбросы
2) при помощи функции ЛИНЕЙН провести полный
регрессионный анализ для линейной регрессии
3) сделать прогноз о количестве выбросов в 2008 году
Табл.5.3. Производство стали и выбросы СО2 в России
70
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
