Добавил:
Upload Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:
goss_legche_nekuda.docx
Скачиваний:
6
Добавлен:
01.07.2025
Размер:
2 Мб
Скачать
☆
  1. Якi ви знаєте визначення вiдстаней для ознак, вимiряних в метричних шкалах?

«Відстань між точками». чи .

  1. Якi ви знаєте визначення вiдстаней для ознак, вимiряних в номiнальних шкалах?

Категоріальні номінальні шкали:

«Геометрична Евклідова відстань». . Простір Розмірності К-ознак. Одиниці вимірювання є однаковими, чи не впливають (або однаково впливають) на результат.

Вагові коефіцієнти для кожного виміру . Пошук вагових коефіцієнтів – емпіричним шляхом. Ваговий коефіцієнт – коефіцієнт стандартизованого рівняння регресії.

  1. Як можна оцiнити надiйнiсть проведеного розбиття на кластери? Можна розділити вибірку на дві частини фільтром тадо кожної з частин застосувати кластерний аналіз. Якщо розбиття на кластери на вибірковій сукупності відповідають розбиттю генеральній, тоді попередньо проведений кластер ний аналіз можна вважати надійним.

  2. Сформулюйте загальну схему iєрархiчного агломеративного кластерного аналiзу?

Ідея ієрархічного кластерного аналізу полягає в наступному. На першому кроці всі N об’єктів поєднуються в N кластерів. Тобто об’єкти називаються кластерами, у кожен кластер входить один об’єкт. Потім відбираються два об’єкти, що найбільш подібні, точніше, що найближчі один від одного в просторі обраних ознак. Ці об’єкти поєднуються в один кластер, тобто кількість кластерів стає рівним N-1. Потім знову знаходяться два найближчих кластери, причому новий кластер, що був отриманий шляхом об’єднання двох кластерів-об’єктів на попередньому кроці, бере участь у розрахунках на рівні з іншими. Процедура повторюється, доки всі кластери не об’єднуються в один. Вся процедура здійснюється покроково.

  1. Скiльки рiзних варіантів розбитя на кластери дає алгоритм iєрархiчного кластерного аналiзу?

«Метод одиночного зв’язку». Він починає процес кластеризації з пошуку двох найбільш схожих об’єктів в матриці подібності. Для об’єднання двох об’єктів потрібен лише один зв’язок між ними. Приєднання визначається лише наявністю єдиного зв’язку між об’єктом та кластером. В даному методі розглядається матриця подібності розмірності NxN (де N – число об’єктів), і поступово об’єднуються найбільш схожі об’єкти. Для повної кластеризації на основі матриці подібності необхідно рівно N-1 кроків. На першому кроці об’єкти розглядаються як самостійні кластери, на останньому всі поєднуються в одну велику групу. Результати застосування цього методу не змінюються при будь-яких перетвореннях даних, відносне впорядкування елементів матриці подібності залишається без змін. Але рішення, що висувається цим методом, не є абсолютно точним відтворенням відомої структури даних.

«Метод повних зв’язків». Правило об’єднання вказує, що подібність між кандидатами на включення в існуючий кластер та будь-яким з елементів цього кластеру не повинна бути менше деякого порогового рівня. Тут є тенденція до знаходження відносно компактних гіперсферичних кластерів, утворених об’єктами з високою подібністю.

«Метод середнього зв'язку». Засіб «боротьби з крайностями» попередніх двох методів. Суть – вирахування середньої подібності об’єкту, що розглядається, з усіма об’єктами у вже існуючому кластері. Потім, якщо знайдене середнє значення подібності досягає чи перевершує деякий заданий пороговий рівень подібності, об’єкт приєднується до цього кластеру. Найчастіше використання – для вирахування середнього арифметичного подібності між об’єктами кластеру та кандидатом на включення. Інші випадки – для вирахування подібності між центрами тяжіння двох кластерів, що мають об’єднатись.

«Метод Уорда». Мета – оптимізувати мінімальну дисперсію всередині кластерів. Це цільова функція, відома як внутрішньо групова сума квадратів чи сума квадратів відхилень (СКВ). , де - значення ознаки j-го об’єкту. На першому кроці, коли кожен кластер складається з одного об’єкту, СКВ=0. Поєднуються ті групи чи об’єкти, для яких СКВ отримує мінімальний приріст. Метод має тенденцію до знаходження чи створення кластерів приблизно рівних розмірів та таких, що мають гіперсферичну форму.

  1. Як Ви знаєте підходи до оцiнювання кiлькості кластерiв при використаннi iєрархiчного кластерного аналiзу? Проблема оцінювання кількості кластерів є однією з невирішених задач кластерного аналізу через відсутність підходящої нульової гіпотези та складної природи багатомірних вибіркових розподілів.

В соціальних науках розвиваються два основних підходи до визначення кількості присутніх кластерів: «Евристичні процедури» та «Формальні тести». Формальний евристичний підхід – графічно зобразити кількість отриманих з ієрархічного дерева кластерів як функцію коефіцієнту злиття чи змішання, рівного кількості способів об’єднання різних об’єктів в кластер. Зазвичай результати цієї процедури залежать від потреб та уявлень дослідників про «правильну» структуру даних. Інша процедура – при новому перегляді значень коефіцієнту злиття знайти значимі «стрибки» значення коефіцієнту. Стрибок означає, що поєднуються два досить несхожих кластери. Тобто, число кластерів, що було перед цим поєднанням, є найбільш вірогідним рішенням. Недолік – може бути багато невеликих стрибків, і вказати, який з них є «правильним» – важко. На основі цього тесту була розроблена процедура, яка стверджує, що груповий рівень чи оптимальне розбиття ієрархічного кластерного рішення виходить, якщо задовольняється нерівність , де z – величина коефіцієнту злиття, zj+1 – величина коефіцієнту на (j+1)-му етапі кластерного процесу, k – стандартне відхилення, z та sz – середнє та стандартне відхилення коефіцієнту злиття. Невиконання нерівності говорить про те, що в даних є лише один кластер. На практиці стандартне відхилення може бути розраховано на кожному етапі кластерного процесу, де k дорівнює .

Тест може працювати лише з однією ознакою. Більшість тестів погано вивчені евристично. Правила визначення кількості кластерів повинні використовуватись поряд з підходящою процедурою перевірки достовірності результатів.

Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]