Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Решение прикладных задач в программной среде R. Учебное пособие

.pdf
Скачиваний:
0
Добавлен:
09.08.2026
Размер:
366 Кб
Скачать

Примечание

Для проверки нулевой гипотезыH0 о равенстве показателя корреляции нулю необходимо alternativeв выбрать

"two.sided".

Критическое значение находят по таблице критических точек распределения Стьюдента с числом степенейf = n - 2 свободы (в R используется функция вычисления квантилей распределения Стьюдента) qt(p,df).

Пример

>x<-c(3.6,7.8,9.6,5.7,8.9) >y<-c(2.7,8.9,6.5,8.8,6.4) >cor.test(x,y,alternative=c("two.sided"), method=c("pearson")

Pearson's product-moment correlationt t = 0.9142, df = 3, p-value = 0.428

95 percent confidence interval: -0.706 0.955 sample estimates: cor = 0.4667999

>cor.test(x,y,alternative= c("two.sided"), method=c("spearman"))

Spearman's rank correlation rho S = 16, p-value = 0.7833 sample estimates: rho = 0.2

Значение

Для обычной линейной корреляции(Пирсона) было получено выборочное значение 0,4668, значение t-статистики 0,9142 при 3 степенях свободы, и p-value, равное 0,428. Это означает, что отвергнуть нулевую гипотезу можно только при допущении ошибки в 42,8 %. 95 % доверительный интервал равен (-0,7063858, 0,9555364) и поскольку он содержит ноль, то нулевая гипотеза принимается на 5 % уровне значимости.

Для ранговой корреляции Спирмена выборочное значение коэффициента корреляции еще меньше (0,2), а p-value еще больше (0,7833). Поэтому и по ранговому критерию отвергается наличие связи между X и Y.

51

9. Линейная регрессия

Описание

Линейная зависимость между переменными описывается уравнением общего вида

y =a0 +a1 × x1 +a2 × x2 +K+an × xn +e,

где y – зависимая переменная; α0, α1,…, αn – неизвестные константы; x0, x1,…, xn - известные (независимые) переменные; ε – нормально распределенная случайная величина с нулевым матожиданием. Задачей построения линейной среднеквадратической модели регрессионной зависимости переменнойy от независимых переменных является получение оценки параметровα0, α1,…, αn и оценка адекватности построенной модели вида:

yˆ = a0 + a1 × x1 + a2 × x2 +K+ an × xn ,

где a0, a1,…, an – оценки параметров α0, α1,…, αn.

В простейшем случае в модели присутствует только одна независимая переменная:

yˆ = a + b × x.

В этом уравнении модели линейной регрессииa – свободный член, а параметр b определяет наклон линии регрессии по отношению к осям координат. Параметры a и b определяются методом наименьших квадратов, который приводит к формуле.

 

 

 

 

 

 

b = r ×

S y

, a =

 

- b ×

 

,

 

 

 

 

 

 

 

y

x

 

 

 

 

 

 

 

Sx

 

 

 

 

 

 

 

xy

 

 

 

 

 

 

где

 

 

,

 

выборочные

 

средние

арифметические;

 

x

y

 

S x , S y

– выборочные СКО; rxy

– выборочный коэффициент кор-

реляции.

 

 

 

 

 

 

 

 

 

52

Для построения линейной модели регрессии используется функция lm(formula=f), которая в простейшем случае содержит только формулу от переменных(векторов, содержащих элементы парной выборки); запись y~x означает, что строится модель зависимости y от x.

>x<-c(3.6,7.8,9.6,5.7,8.9) >y<-c(2.7,8.9,6.5,8.8,6.4) >p.lm<-lm(formula=x~y)

>summary(p.lm)

Residuals:

 

 

 

 

 

1

2

3

4

5

 

-1.7151 -0.34092.5529 -2.3954 1.8985

 

Coefficients:

 

 

 

 

 

Estimate

Std. Errort

value

Pr(>|t|)

(Intercept)

4.0845

3.5050

1.165

0.328

y

0.4558

0.4985

0.914

0.428

Residual standard error: 2.511 on 3 degrees of

freedomMultiple R-Squared: 0.2179,

 

 

Adjusted R-squared: -

 

 

 

 

0.0428

 

 

 

p-value: 0.428

F-statistic: 0.8358 on 1 and 3 DF,

Команда

summary() выдает

полную

информацию о -по

строенной модели:

– значения остатков (residuals – разность модельных и истинных значений переменной y). Если объем выборки большой, то печатается оценка распределения остатков (квартили);

53

– коэффициенты модели и оценка их значимости по критерию Стьюдента (в нашем случае все коэффициенты не значимы, поскольку все вероятности (0,328 и 0,428) больше 0,05 – то есть нельзя считать, что существует линейная зависимость между x и y).

– оценку значимости зависимости по критерию Фишера и квадрат коэффициента корреляции (R-squared), который показывает долю дисперсииy, объясненной с использованием модели (исправленное значение дляR2 равно 0, статистика Фишера F=0,8358, уровень значимости критерия Фишера 42,8 %, т.е. зависимость отсутствует).

Для визуализации построенной модели можно использовать вспомогательные функции.

Описание функций

abline(a, b, untf = FALSE, ...) abline(h=, untf = FALSE, ...) abline(v=, untf = FALSE, ...)

Параметры

a,b – параметры в линейном уравнении;

untf – если TRUE, то рисует линию в преобразованных координатах;

h,v - Y и Х значения для горизонтальной и вертикальной линии соответственно:

plot(x, y, xlim=range(x),ylim=range(y),type="p", main, xlab, ylab, ...)

54

Параметры

X,Y – координаты точек x и y;

xlim, ylim – значения для осей x и y; Type – тип графика(“p” для точек); Main – название графика;

Xlab,ylab – название осей.

Функция abline()строит прямую по найденным a и b. Функция plot() строит экспериментальные точки.

55

БИБЛИОГРАФИЧЕСКИЙ СПИСОК

Основной

Барсегян, А.А. Анализ данных и процессов / А.А. Барсегян, М.С. Куприянов, И.И. Холод [и др.] – Санкт-Петербург: БХВПетербург, 2009. - 512 с. – Текст: непосредственный.

Дьяконов, А.Г. Справочник по базовым командам системы R. / А.Г. Дьяконов. - Москва: 2013. - 91 с. – Текст: непосредственный.

Мастицкий, С.Э. Статистический анализ и визуализация данных с помощью R. / С.Э. Мастицкий, В.К. Шитиков. – 2-е изд. - Москва: ДМК Пресс, 2023. - 497 с. – Текст: непосредственный.

Роберт И. Кабаков, R в действии. Анализ и визуализация данных в программе R / пер. с англ. Полины А. Волковой. – Москва: ДМК Пресс, 2014. – 588 с. – Текст: непосредственный.

Шишкин, В.А Программное обеспечение эконометрических расчетов / В.А. Шишкин. - Пермь: ПГНИУ, 2014. - 273 с. – Текст: непосредственный.

Яу, Н. Искусство визуализации в бизнесе: Как представить сложную информацию простыми образами. / пер. с англ. А. Кирова. - Москва: Манн, Иванов и Фербер, 2013. - 352 с. – Текст: непосредственный.

Дополнительный

Гмурман, В.Е. Теория вероятностей и математическая статистика / В.Е. Гмурман. - Москва: Высшая школа, 2000. - 479 с.

– Текст: непосредственный.

Гайдышев, И. Анализ и обработка данных: специальный справочник / И. Гайдышев. - Санкт-Петербург: Питер, 2001.

– 752 с. – Текст: непосредственный.

Савельев, А.А, Основные понятия языка R / А.А.Савельев, С.С. Мухарамова, А.Г. Пилюгин, Е.А. Алексеева. – Казань: Издво Казан. ун-та, 2007. - 30 с. – Текст: непосредственный.

56

Bretz F., Multiple Comparisons Using R. / Bretz F., T. Hothorn, and P. Westfall. – Boca Raton, FL: Chapman & Hall. – Текст: непо-

средственный

John M. Chambers, Software for Data Analysis. Programming with R. / Springer Science+Business Media, LLC, USA, 2008,

– Текст: непосредственный.

Michael J. Crawley, The R Book / John Wiley & Sons Ltd, The Atrium, Southern Gate, Chichester. 2007. – Текст: непосредст-

венный.

Van Buuren S., MICE: Multivariate Imputation by Chained Equations in R. / van Buuren S., K. Groothuis-Oudshoorn. – Journal of Statistical Software, 2010. – Текст: непосредственный.

57

ОГЛАВЛЕНИЕ

Введение ………………………………………………..……... 3

1.Общие сведения о языке R………………….................... 4

1.1.Запуск программы и начало работы…………………. 4

1.2.Работа со скриптами …………………………………. 7

1.3.Выход из программы, сохранение данных…………... 8

2.Классы объектов, типы данных и структуры

объектов в R…………………………………………………… 8

2.1.Классы объектов вR…………………………………... 8

2.2.Специальные переменные вR………………………... 15

2.3.Создание числовых последовательностей вR………. 17

2.4.Классы данных вR……………………………............. 18

3.Операции над различными переменными.

Математика в R………………………………………………. 18

3.1.Логические операции…………………………………. 18

3.2.Математические функции…………………….............. 20

3.3.Тригонометрические функции……………………….. 24

3.4.Операции над комплексными переменными………... 25

4.Статистические исследования в R…………………….. 26

5.Статистические оценки……………………………........... 29

5.1.Выборочное среднее…………………………………... 29

5.2.Выборочная дисперсия и СКО……………………….. 30

5.3.Медиана и мода………………………………………... 31

58

6. Проверка статистических гипотез………………………. 32

6.1. Критерий c2 Пирсона (проверка гипотезы о нор-

мальном распределении генеральной совокупности)……. 32 6.2. Критерий Фишера (сравнение дисперсий двух генеральных совокупностей)……………………………………. 37

6.3.Критерий Стьюдента (сравнение двух средних нормальных генеральных совокупностей, дисперсии которых неизвестны и одинаковы)……………………………... 38

6.4.Критерии Бартлетта и Кохрана (сравнение несколь-

ких дисперсий нормальных генеральных совокупностей по выборкам)………………………………………………... 41

7.Дисперсионный анализ………………………………….. 44

8.Корреляционный анализ………………………………... 48

8.1.Коэффициент корреляции и проверка гипотезы о его значимости………………………………………………….. 48

8.2.Показатель ранговой корреляции……………………. 49

9.Линейная регрессия……………………………………… 52

Библиографический список………..………………………. 56

59

Учебное издание

Ивлиев Максим Николаевич Никитин Борис Егорович

РЕШЕНИЕ ПРИКЛАДНЫХ ЗАДАЧ

В ПРОГРАММНОЙ СРЕДЕ R

Подписано в печать 08.04.2024. Формат 60x84 1/16.

Усл. печ. л. 3,3. Тираж 50 экз. Заказ . С - 11. ФГБОУ ВО «Воронежский государственный университет инженерных технологий»

(ФГБОУ ВО «ВГУИТ»)

Отдел полиграфии ФГБОУ ВО «ВГУИТ» Адрес университета и отдела полиграфии:

394036, Воронеж, пр. Революции, 19

60

Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]