Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Статистическая обработка экспериментальных данных. Регрессионный анализ в языке R. Учебное пособие

.pdf
Скачиваний:
0
Добавлен:
07.09.2026
Размер:
1 Мб
Скачать
☆
Введем понятие регрессии. В теории вероятности и

 

󰇛
 󰇛
󰇜
󰇜󰇛
 󰇛
󰇜

󰇜

(6)
Показатели связи переменных
0,1-0,3
0,3-0,5
0,5-0,7
0,7-0,9
0,9-0,99
Характеристи ка силы связи
слабая
умеренная
заметная
высокая
весьма высокая
математической статистике – это математическая функция, в которой описывается связь зависимой и независимых переменных.
Для однофакторной регрессии, описывающей взаимосвязь между двумя переменнымиxи y, выбирают одну, самую влиятельную переменную, для многофакторной (взаимосвязь между 3 и более переменными) — определённое количествоxi или те из них, которые влияют на y
не менее чем в некоторой фиксированной степени. МНК
i
в примере 1 реализовывал однофакторную линейную регрессию.
Степень линейной связности двух переменных может быть выражена через выборочный коэффициент корреляции, который рассчитывается по формуле (6):
где:  
– среднее значение произведения, m– количество пар значений x и
󰇛󰇜
y,

и
󰇛󰇜
– квадрат среднего значения переменных. Выборочный
,
– среднее значение исходных данных,

коэффициент |rxy| ≤ 1 чем ближе к единице, тем сильнее линейная связь. Расчет выборочного коэффициента корреляции (выборочного коэффициента связности) рассмотрим в примере 2.
Для определения качественного значения степени связности часто используется шкала Чеддока, приведенная в таблице 3.
Таблица 3 – Шкала Чеддока
11
На рисунке 3 приведены примеры выборочных коэффициентов корреляции для различных наборов данных. В тех случаях, где коэффициент связности по модулю близок к 1, точки могут быть достаточно точно аппроксимированы с помощью прямой. Если коэффициент близок к нулю, аппроксимация с помощью прямой невозможна.
Степень линейной связности двух переменных также может быть выражена с помощью коэффициента корреляции Пирсона. Для определения качественного значения коэффициента корреляции Пирсона используется шкала Чеддока, приведенная в таблице 3.
Рисунок 3 – Выборочный коэффициент корреляции для различных
наборов данных
Пример 2
В качестве примера рассмотрим расчет выборочного коэффициента связности (выборочного коэффициента корреляции) и коэффициента корреляции Пирсона. На рисунке 4 приведена прямая,
12
полученная путем аппроксимации исходных данных из таблицы 4
Y 3 8 4 5 7 12 7 8
10 X 1
10 3 4 5 15 7 8
21
методом МНК и точки, соответствующие экспериментальным данным.
Таблица 4 – Исходные данные для расчета выборочного коэффициента связности
Рисунок 4 – График подобранного уравнения и точки,
соответствующие исходным данным
Этапы расчета выборочного коэффициента связности:
1. Исходя из исходных данных в таблице, посчитать среднее значение х и у:



=

  


=
 .
2. Посчитать среднее значение произведения:

 

 
3. Посчитать выборочные дисперсии:
(x)=

- 35,7284, (y)=

- 
 
4. Посчитать среднеквадратическое отклонение:
󰇛󰇜
S
󰇛󰇜 S
󰇛󰇜
󰇛󰇜=12,688.
13
5. Посчитать коэффициент корреляции:
y=c(3,8,4,5,7,12,6,8,10)
x=c(1,10,3,4,5,15,7,8,21)
cor(y,x)# расчет корреляции
 

󰇛󰇜󰇛󰇜
 
6. Оценить рассчитанный коэффициент корреляции по шкале Чеддока. В соответствии со шкалой Чеддока (см. таблицу 3) характеристика силы связи переменных весьма высокая. Это свидетельствует о том, что экспериментальные данные могут быть достаточно точно аппроксимированы с помощью прямой.
Реализация расчета коэффициента корреляции Пирсона на
языке R.
Функция cor(y,x) осуществляет расчет линейной корреляция между векторами X и Y. На рисунке 5 приведен результат выполнения подсчета коэффициента корреляции Пирсона.
Рисунок 5 – Результат выполнения подсчета коэффициента
В соответствии со шкалой Чеддока (см. таблица 3) характеристика силы связи переменных высокая. Это свидетельствует о том, что экспериментальные данные могут быть достаточно точно аппроксимированы с помощью прямой.
корреляции Пирсона
14
1.3. Регрессионный анализ
,xfxyE )()|(
,xfy
)(
(6)
МНК является одним из методов регрессионного анализа. Регрессия – это зависимость математического ожидания случайной величины от одной или нескольких других случайных величин (свободных переменных):
где f – функция регрессионной зависимости.
Регрессия может быть представлена в виде суммы неслучайной и случайной составляющих, общий вид уравнения которой представлен в формуле (6):
где  – аддитивная случайная величина с нулевым математическим
ожиданием.
Предположение о характере распределения этой величины называется гипотезой порождения данных. Обычно предполагается, что величина имеет гауссово распределение с нулевым средним и дисперсией.
Выделяют следующие виды регрессии:
1. По количеству независимых переменных:
- одномерная;
- многомерная.
2. По типу функции:
- линейная;
- нелинейная.
3. По типу зависимости переменной:
- параметрическая;
- непараметрическая.
15
Различают регрессию с участием одной независимой переменной – одномерную регрессию и с несколькими независимыми переменными – многомерную регрессию. Предполагается, что мы используем несколько свободных переменных, то есть, свободная переменная — вектор хϵ Rn ( действительное n-мерное пространство).
Различают линейную и нелинейную регрессию. Если регрессионная модель не является линейной комбинацией функций от параметров, то говорят о нелинейной регрессии. Нелинейными моделями являются: экспоненциальные, тригонометрические и другие.
Различают параметрическую и не параметрическую регрессию. Строгую границу между этими двумя типами регрессий провести сложно. Сейчас не существует общепринятого критерия отличия одного типа моделей от другого. Например, считается, что линейные модели являются параметрическими, а модели, включающие усреднение зависимой переменной по пространству свободной переменной — непараметрическими. В целом, непараметрическая регрессия отличается от параметрической тем, что зависимая переменная зависит не от одного значения свободной переменной, а от некоторой заданной окрестности этого значения.
Регрессионный анализ – статистический метод исследования влияния одной или нескольких независимых переменных х1, х2,…,x
m
на
зависимую переменную y. Независимые переменные иначе называют регрессорами или предикторами, а зависимые переменные – критериальными. Регрессионный анализ используется тогда, когда есть основание полагать, что существует связь (линейная, логарифмическая, кубическая) между переменными. Регрессионный анализ нельзя использовать для определения наличия связи между переменными.
16
Этапы регрессионного анализа.
1. Формулировка задачи
На этапе формулировки задачи формулируются предварительные гипотезы о зависимости исследуемых явлений. Такая гипотеза называется регрессионной моделью и подлежит проверке в ходе регрессионного анализа. Регрессионная модель объединяет широкий класс универсальных функций, которые описывают некоторую закономерность. При этом для построения модели в основном используются измеряемые данные, а не знание свойств исследуемой закономерности. Такая модель часто не интерпретируема, но более точна. Это объясняется либо большим числом моделей­претендентов, которые используются для построения оптимальной модели, либо большой сложностью модели. Нахождение параметров регрессионной модели называется обучением модели.
Параметры модели должны быть выбраны так, чтобы наилучшим образом аппроксимировать данные. Для оценки качества приближения обычно используется среднеквадратичная ошибка – сумма квадратов разности значений модели и зависимой переменной.
2. Сбор статистических данных
Данные должны быть собраны для каждой переменной, включённой в регрессионную модель. На данном этапе следует учитывать несколько допущений и условий:
Количество наблюдений должно быть достаточно для
проявления статистических закономерностей относительно факторов и их взаимосвязей.
Обрабатываемые данные содержат некоторые ошибки,
обусловленные погрешностями измерений, воздействием неучтенных факторов.
17
Полученные данные записываются в виде матрицы.
Матрица результатов наблюдений является единственной информацией об изучаемом объекте, имеющейся в распоряжении перед началом исследования.
3. Обработка статистических данных.
На этапе обработки статистических данных нужно выбрать переменные, которые будут рассмотрены в ходе текущего анализа: отбросить незначимые независимые переменные и выбрать одну зависимую. Для отбора входных переменныхxi следует определить коэффициенты корреляции каждой из них с выходным параметромy и друг с другом. Для анализа используем параметры с большим коэффициентом корреляции с выходным значением. Регрессоры, тесно связанные друг с другом, но слабо связанные с критериальной величиной, использовать не рекомендуется.
В некоторых случаях (например, при решении тестовых задач или распределении действий между несколькими исследователями) первые два или три этапа могут быть проведены заранее или пропущены, так как обрабатываются не реальные экспериментальные данные.
4. Формулировка гипотезы о виде регрессии
Вид регрессии характеризуется двумя параметрами: количеством факторов регрессии и функциональной формой связи между ними. Сформулированная на данном этапе гипотеза описывается эмпирическим уравнением регрессии. Таким образом различают:
Парная (однофакторная) регрессия (рассматривается одна
выходная и одна входная переменные). Для данного вида регрессии возможно выразить форму связи между
18
рассматриваемыми переменными в виде типичной функции и изобразить её графически на плоскости. В этом случае различают следующие виды регрессии: линейная, нелинейная, обратная, гиперболическая, логарифмическая, степенная, показательная, полиномиальная, параболическая, периодическая.
Множественная регрессия. В множественной регрессии
рассматривается зависимость критериальной величины сразу от нескольких регрессоров. В этом случае функция регрессии обычно не известна.
5. Определение функции регрессии
Данный этап заключается в расчёте численных значений параметров эмпирического уравнения регрессии и переводе его таким образом в точное уравнение регрессии. Параметры уравнения также называют коэффициентами зависимости. В большинстве случаев для определения параметров функции регрессии используется МНК.
6. Оценка адекватности регрессионного анализа и
интерпретация полученных результатов
По завершению расчёта коэффициентов уравнения регрессии необходимо проверить полученный результат данным эксперимента, т. е. выяснить, соответствует ли полученная модель реальной функции отклика, описывающей данное явление, и будет ли уравнение регрессии предсказывать значение отклика с той же точностью, что и результаты эксперимента.
Модель признаётся адекватной, если расхождение между результатами эксперимента и прогнозами уравнения регрессии вызвано только ошибками эксперимента и не связано с неудачным
19
выбором математической модели. Для проверки этого условия
󰇝󰇞
 
󰇝
󰇞

необходимо использовать два параметра:
дисперсию воспроизводимости; дисперсию адекватности.
Дисперсия воспроизводимости определяет количественную оценку ошибок эксперимента в целом и обозначается как s2{y}. Для получения этого значения необходимо для каждого значения y выполнить повторные эксперименты с неизменными входными значениями.
Если для каждого из K различных опытов проводится соответственно m1, m2, …, mK экспериментов, то дисперсия воспроизводимости рассчитывается по следующей формуле
где s2{yi} – степень разброса значений отклика в i-ом опыте:
 
󰇛 󰇜

где y
󰇝󰇞 
– наблюдаемое значение отклика при u-м повторении i-го
iu
опыта, yi – среднее значение отклика в i-ом опыте.
Расхождение между результатами эксперимента и прогнозируемыми значениями характеризуется дисперсией адекватности, вычисляемой по формуле:
  
 󰇛 󰇜


где K – число различных опытов, d – число коэффициентов проверяемого уравнения регрессии, m
– число повторений i-го опыта.
i
20
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]