Добавил:
Upload Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:
Diplom_2014_1.doc
Скачиваний:
0
Добавлен:
01.07.2025
Размер:
1 Мб
Скачать
☆

1. Кореляційний аналіз кількісних та порядкових ознак

1.1. Коефіцієнт детермінації і його використання при оцінюванні нелінійних статистичних зв'язків

Основними показниками, які використовують при оцінюванні нелінійних статистичних зв'язків, є вибірковий коефіцієнт детермінації, а також кореляційне відношення, або індекс кореляції (квадратний корінь з коефіцієнта детермінації) [1,27]. Всі вони тісно пов'язані між собою, тому надалі буду розглядати лише вибірковий коефіцієнт детермінації, який є найбільш універсальним з цих показників. Він відображає частку варіації залежної змінної, яка пояснюється розглянутої моделлю зв'язку. На відміну від коефіцієнта кореляції Пірсона і коефіцієнтів рангової кореляції, він не може приймати від'ємних значень і змінюється в межах від 0 до 1. Це є наслідком того, що нелінійні зв'язки можуть бути не монотонними. І в цьому випадку втрачає сенс оцінювання спрямування цих зв'язків, що відображається знаком показника. Близькість коефіцієнта детермінації до одиниці свідчить про наявність сильної, близької до строго функціональною, зв'язку між досліджуваними ознаками. У цьому випадку використовувана модель пояснює практично 100% варіації залежної змінної, і лише невелика частина цієї варіації припадає на невраховані в моделі або випадкові чинники. Близькість коефіцієнта детермінації до нуля, говорить про те, що зв'язок між аналізованими даними практично відсутня.

У загальному випадку ідея обчислення коефіцієнта детермінації базується на гіпотезі, що ми маємо деяку відому або передбачувану модель зв'язку. Тоді його значення можна розрахувати за формулою:

, (1.1)

Де – оцінка дисперсії залишків цієї моделі, а – загальна дисперсія залежної змінної y. Далі можливі два варіанти. Якщо модель зв'язку задана явно у вигляді функції y = f(X), де X – вектор значень незалежних змінних, то дисперсію залишків можна розрахувати за формулою:

, (1.2)

Де n – кількість елементів в розглянутих вибірках, yi – значення залежної змінної в i-ой точці. Формулу (1.2) використовують при оцінюванні коефіцієнтів детермінації моделей регресії, а також при розробці методів обчислення коефіцієнта детермінації для різних типів моделей зв'язку.

Якщо ж функція зв'язку невідома, то доводиться використовувати її різні апроксимації. У випадку однієї незалежної змінної для цього найбільш часто використовують її представлення у вигляді кусочно-постійної функції. З цією метою значення незалежної змінної впорядковують за зростанням і групують їх по інтервалах. Далі використовують для обчислення коефіцієнта детермінації оцінку(рис.1.1):

, (1.3)

де f(Xi) є статистичною оцінкою невідомого значення функції регресії f (X) у точці Хi , або

, (1.4)

Де m – число інтервалів, νj – число точок в j-му інтервалі, yij – значення залежних змінних для точок, які потрапили в j-й інтервал, yj – їх середні арифметичні. Формулу (1.4) можна застосовувати і в разі декількох незалежних змінних, але формування інтервалів та інтерпретація результатів при цьому значно ускладнюються. Очевидно, що вибір способу формування інтервалів і їх кількості може суттєво впливати на результат обчислення коефіцієнта детермінації. Особливо значущим цей вплив виявляється у випадку сильно нелінійних або немонотонний зв'язків.

Рис.1.1. Коефіцієнт детермінації за двома різними формулами оцінки

Формулу (1.3) застосовують у випадку, коли за результатами попереднього аналізу встановлено, що умовна дисперсія , тобто не залежить від Х. Формулу (1.4) використовують, якщо ця умова не виконується, а також у всіх випадках, коли обчислення здійснюють за згрупованими даними. У цьому випадку необхідно попередньо здійснити групування даних. Для цього їх впорядковують за зростанням значень однієї з знак (ознаки Х). Потім задають кількість та межі інтервалів для цієї ознаки. Підраховують кількості точок, що потрапили до кожного інтервалу (vj), для змінної Y обчислюють загальне середнє y та середні за інтервалами yj й розраховують значення коефіцієнта детермінації за формулами (1.1, 1.2, 1.4).

Величина коефіцієнта детермінації може змінюватися в межах від нуля до одиниці й відображає частку загальної дисперсії досліджуваної ознаки, яка зумовлена зміною функції регресії f (X). При цьому нульове значення коефіцієнта детермінації відповідає відсутності будь-якого зв’язку, а його рівність одиниці – наявності строго функціонального зв’язку [1]. Оскільки цей коефіцієнт є універсальним показником зв’язку, він має відбивати й такі зв’язки, що є немонотонними функціями.

Існує інший підхід до обчислення вибіркового коефіцієнта детермінації [2]. Значення невідомої функції парного зв'язку в розглянутих точках пропонується замінити оцінками, одержуваними в результаті згладжування наявних емпіричних даних. При згладжуванні методом простих ковзних середніх [3], отримуємо формулу:

(1.5)

Де 2p +1 – довжина інтервалу згладжування. Як і число інтервалів, вона визначається суб'єктивно. Однак одержувані оцінки виявляються значно більш стійкими до вибору цього параметра. Додатковою перевагою такого підходу є те, що він не вимагає попереднього упорядкування даних. Тому з'являється можливість оцінювання неоднозначних залежностей, для яких значення залежної змінної визначається не тільки значеннями незалежних змінних, а й її власними попередніми значеннями. Такі залежності досить часто виникають в різних прикладних задачах. Їх прикладами є криві гистерезиса, S – подібні вольт–амперні характеристики та ін.

У той же час для ряду завдань використання формули (1.5) виявляється недоцільними. Зокрема, при оцінюванні нелінійних авто – та крос–кореляцій часових рядів [4, 5] зміна лага не приводить до "зникнення" або "появи" зв'язку. Якщо зв'язок є, то при зміні лага буде змінюватися лише вид відповідної функції, але не сила зв'язку. Тому оцінки коефіцієнта детермінації практично не будуть залежати від обраного лага. З цієї причини виявляється неможливим рішення одним з головних завдань такого аналізу – виявлення циклічності досліджуваних процесів. Метод угруповання, навпаки, може успішно використовуватися при вирішенні таких завдань.

Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]