Решение прикладных задач в программной среде R. Учебное пособие
.pdfПримечание
Для проверки нулевой гипотезыH0 о равенстве показателя корреляции нулю необходимо alternativeв выбрать
"two.sided".
Критическое значение находят по таблице критических точек распределения Стьюдента с числом степенейf = n - 2 свободы (в R используется функция вычисления квантилей распределения Стьюдента) qt(p,df).
Пример
>x<-c(3.6,7.8,9.6,5.7,8.9) >y<-c(2.7,8.9,6.5,8.8,6.4) >cor.test(x,y,alternative=c("two.sided"), method=c("pearson")
Pearson's product-moment correlationt t = 0.9142, df = 3, p-value = 0.428
95 percent confidence interval: -0.706 0.955 sample estimates: cor = 0.4667999
>cor.test(x,y,alternative= c("two.sided"), method=c("spearman"))
Spearman's rank correlation rho S = 16, p-value = 0.7833 sample estimates: rho = 0.2
Значение
Для обычной линейной корреляции(Пирсона) было получено выборочное значение 0,4668, значение t-статистики 0,9142 при 3 степенях свободы, и p-value, равное 0,428. Это означает, что отвергнуть нулевую гипотезу можно только при допущении ошибки в 42,8 %. 95 % доверительный интервал равен (-0,7063858, 0,9555364) и поскольку он содержит ноль, то нулевая гипотеза принимается на 5 % уровне значимости.
Для ранговой корреляции Спирмена выборочное значение коэффициента корреляции еще меньше (0,2), а p-value еще больше (0,7833). Поэтому и по ранговому критерию отвергается наличие связи между X и Y.
51
9. Линейная регрессия
Описание
Линейная зависимость между переменными описывается уравнением общего вида
y =a0 +a1 × x1 +a2 × x2 +K+an × xn +e,
где y – зависимая переменная; α0, α1,…, αn – неизвестные константы; x0, x1,…, xn - известные (независимые) переменные; ε – нормально распределенная случайная величина с нулевым матожиданием. Задачей построения линейной среднеквадратической модели регрессионной зависимости переменнойy от независимых переменных является получение оценки параметровα0, α1,…, αn и оценка адекватности построенной модели вида:
yˆ = a0 + a1 × x1 + a2 × x2 +K+ an × xn ,
где a0, a1,…, an – оценки параметров α0, α1,…, αn.
В простейшем случае в модели присутствует только одна независимая переменная:
yˆ = a + b × x.
В этом уравнении модели линейной регрессииa – свободный член, а параметр b определяет наклон линии регрессии по отношению к осям координат. Параметры a и b определяются методом наименьших квадратов, который приводит к формуле.
|
|
|
|
|
|
b = r × |
S y |
, a = |
|
- b × |
|
, |
|
|
|
|
|
|
|
y |
x |
|
|||||
|
|
|
|
|
|
Sx |
|
||||||
|
|
|
|
|
|
xy |
|
|
|
|
|
|
|
где |
|
|
, |
|
– |
выборочные |
|
средние |
арифметические; |
||||
|
x |
y |
|
||||||||||
S x , S y |
– выборочные СКО; rxy |
– выборочный коэффициент кор- |
|||||||||||
реляции. |
|
|
|
|
|
|
|
|
|
||||
52
Для построения линейной модели регрессии используется функция lm(formula=f), которая в простейшем случае содержит только формулу от переменных(векторов, содержащих элементы парной выборки); запись y~x означает, что строится модель зависимости y от x.
>x<-c(3.6,7.8,9.6,5.7,8.9) >y<-c(2.7,8.9,6.5,8.8,6.4) >p.lm<-lm(formula=x~y)
>summary(p.lm)
Residuals: |
|
|
|
|
|
1 |
2 |
3 |
4 |
5 |
|
-1.7151 -0.34092.5529 -2.3954 1.8985 |
|
||||
Coefficients: |
|
|
|
|
|
|
Estimate |
Std. Errort |
value |
Pr(>|t|) |
|
(Intercept) |
4.0845 |
3.5050 |
1.165 |
0.328 |
|
y |
0.4558 |
0.4985 |
0.914 |
0.428 |
|
Residual standard error: 2.511 on 3 degrees of |
|||||
freedomMultiple R-Squared: 0.2179, |
|
|
|||
Adjusted R-squared: - |
|
|
|
|
|
0.0428 |
|
|
|
p-value: 0.428 |
|
F-statistic: 0.8358 on 1 and 3 DF, |
|||||
Команда |
summary() выдает |
полную |
информацию о -по |
||
строенной модели:
– значения остатков (residuals – разность модельных и истинных значений переменной y). Если объем выборки большой, то печатается оценка распределения остатков (квартили);
53
– коэффициенты модели и оценка их значимости по критерию Стьюдента (в нашем случае все коэффициенты не значимы, поскольку все вероятности (0,328 и 0,428) больше 0,05 – то есть нельзя считать, что существует линейная зависимость между x и y).
– оценку значимости зависимости по критерию Фишера и квадрат коэффициента корреляции (R-squared), который показывает долю дисперсииy, объясненной с использованием модели (исправленное значение дляR2 равно 0, статистика Фишера F=0,8358, уровень значимости критерия Фишера 42,8 %, т.е. зависимость отсутствует).
Для визуализации построенной модели можно использовать вспомогательные функции.
Описание функций
abline(a, b, untf = FALSE, ...) abline(h=, untf = FALSE, ...) abline(v=, untf = FALSE, ...)
Параметры
a,b – параметры в линейном уравнении;
untf – если TRUE, то рисует линию в преобразованных координатах;
h,v - Y и Х значения для горизонтальной и вертикальной линии соответственно:
plot(x, y, xlim=range(x),ylim=range(y),type="p", main, xlab, ylab, ...)
54
Параметры
X,Y – координаты точек x и y;
xlim, ylim – значения для осей x и y; Type – тип графика(“p” для точек); Main – название графика;
Xlab,ylab – название осей.
Функция abline()строит прямую по найденным a и b. Функция plot() строит экспериментальные точки.
55
БИБЛИОГРАФИЧЕСКИЙ СПИСОК
Основной
Барсегян, А.А. Анализ данных и процессов / А.А. Барсегян, М.С. Куприянов, И.И. Холод [и др.] – Санкт-Петербург: БХВПетербург, 2009. - 512 с. – Текст: непосредственный.
Дьяконов, А.Г. Справочник по базовым командам системы R. / А.Г. Дьяконов. - Москва: 2013. - 91 с. – Текст: непосредственный.
Мастицкий, С.Э. Статистический анализ и визуализация данных с помощью R. / С.Э. Мастицкий, В.К. Шитиков. – 2-е изд. - Москва: ДМК Пресс, 2023. - 497 с. – Текст: непосредственный.
Роберт И. Кабаков, R в действии. Анализ и визуализация данных в программе R / пер. с англ. Полины А. Волковой. – Москва: ДМК Пресс, 2014. – 588 с. – Текст: непосредственный.
Шишкин, В.А Программное обеспечение эконометрических расчетов / В.А. Шишкин. - Пермь: ПГНИУ, 2014. - 273 с. – Текст: непосредственный.
Яу, Н. Искусство визуализации в бизнесе: Как представить сложную информацию простыми образами. / пер. с англ. А. Кирова. - Москва: Манн, Иванов и Фербер, 2013. - 352 с. – Текст: непосредственный.
Дополнительный
Гмурман, В.Е. Теория вероятностей и математическая статистика / В.Е. Гмурман. - Москва: Высшая школа, 2000. - 479 с.
– Текст: непосредственный.
Гайдышев, И. Анализ и обработка данных: специальный справочник / И. Гайдышев. - Санкт-Петербург: Питер, 2001.
– 752 с. – Текст: непосредственный.
Савельев, А.А, Основные понятия языка R / А.А.Савельев, С.С. Мухарамова, А.Г. Пилюгин, Е.А. Алексеева. – Казань: Издво Казан. ун-та, 2007. - 30 с. – Текст: непосредственный.
56
Bretz F., Multiple Comparisons Using R. / Bretz F., T. Hothorn, and P. Westfall. – Boca Raton, FL: Chapman & Hall. – Текст: непо-
средственный
John M. Chambers, Software for Data Analysis. Programming with R. / Springer Science+Business Media, LLC, USA, 2008,
– Текст: непосредственный.
Michael J. Crawley, The R Book / John Wiley & Sons Ltd, The Atrium, Southern Gate, Chichester. 2007. – Текст: непосредст-
венный.
Van Buuren S., MICE: Multivariate Imputation by Chained Equations in R. / van Buuren S., K. Groothuis-Oudshoorn. – Journal of Statistical Software, 2010. – Текст: непосредственный.
57
ОГЛАВЛЕНИЕ
Введение ………………………………………………..……... 3
1.Общие сведения о языке R………………….................... 4
1.1.Запуск программы и начало работы…………………. 4
1.2.Работа со скриптами …………………………………. 7
1.3.Выход из программы, сохранение данных…………... 8
2.Классы объектов, типы данных и структуры
объектов в R…………………………………………………… 8
2.1.Классы объектов вR…………………………………... 8
2.2.Специальные переменные вR………………………... 15
2.3.Создание числовых последовательностей вR………. 17
2.4.Классы данных вR……………………………............. 18
3.Операции над различными переменными.
Математика в R………………………………………………. 18
3.1.Логические операции…………………………………. 18
3.2.Математические функции…………………….............. 20
3.3.Тригонометрические функции……………………….. 24
3.4.Операции над комплексными переменными………... 25
4.Статистические исследования в R…………………….. 26
5.Статистические оценки……………………………........... 29
5.1.Выборочное среднее…………………………………... 29
5.2.Выборочная дисперсия и СКО……………………….. 30
5.3.Медиана и мода………………………………………... 31
58
6. Проверка статистических гипотез………………………. 32
6.1. Критерий c2 Пирсона (проверка гипотезы о нор-
мальном распределении генеральной совокупности)……. 32 6.2. Критерий Фишера (сравнение дисперсий двух генеральных совокупностей)……………………………………. 37
6.3.Критерий Стьюдента (сравнение двух средних нормальных генеральных совокупностей, дисперсии которых неизвестны и одинаковы)……………………………... 38
6.4.Критерии Бартлетта и Кохрана (сравнение несколь-
ких дисперсий нормальных генеральных совокупностей по выборкам)………………………………………………... 41
7.Дисперсионный анализ………………………………….. 44
8.Корреляционный анализ………………………………... 48
8.1.Коэффициент корреляции и проверка гипотезы о его значимости………………………………………………….. 48
8.2.Показатель ранговой корреляции……………………. 49
9.Линейная регрессия……………………………………… 52
Библиографический список………..………………………. 56
59
Учебное издание
Ивлиев Максим Николаевич Никитин Борис Егорович
РЕШЕНИЕ ПРИКЛАДНЫХ ЗАДАЧ
В ПРОГРАММНОЙ СРЕДЕ R
Подписано в печать 08.04.2024. Формат 60x84 1/16.
Усл. печ. л. 3,3. Тираж 50 экз. Заказ . С - 11. ФГБОУ ВО «Воронежский государственный университет инженерных технологий»
(ФГБОУ ВО «ВГУИТ»)
Отдел полиграфии ФГБОУ ВО «ВГУИТ» Адрес университета и отдела полиграфии:
394036, Воронеж, пр. Революции, 19
60
