Добавил:
Upload Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:
goss_legche_nekuda.docx
Скачиваний:
6
Добавлен:
01.07.2025
Размер:
2 Мб
Скачать
☆
  1. Якi методи визначення вiдстаней мiж кластерами ви знаєте?

Для роботи алгоритму кластерного аналізу необхідно обчислювати відстань між кластерами, до яких входять кілька об’єктів. Відстанню між кластерами в такому випадку є (методи визначення відстані):

«Метод найближчого сусіда». Відстань між найближчими сусідами, найближчими об’єктами кластерів.

«Метод найдальшого сусіда». Відстань між найвіддаленішими сусідами.

Середня відстань між кластерами.

«Метод одного зв’язку». Середня відстань між всіма об’єктами пари кластерів з урахуванням відстаней усередині кластерів. Усереднення зв’язку.

«Центроїдний метод». Відстань між центроїдами – відстань між центрами кластерів.

«Метод медіан». Той самий центроїдний метод, але центр об’єднаного кластера обчислюється як медіана всіх об’єктів.

«Метод Варда». За відстань між кластерами береться приріст суми квадратів відстаней об’єктів до центрів кластерів, одержуваний в результаті їхнього об’єднання. Випадок Евклідової відстані. Метод Варда дає компактні кластери.

  1. Які особливості структури матриці вiдстаней?

Матриця відстаней − це двовимірна матриця, перший рядок і перший стовпчик якої містять назви ознак, а в клітинках, що знаходяться на перетині цих рядків і стовпчиків, розміщені математичні відстані між відповідними парами ознаками. Оскільки у рядках і стовпчиках наведені одні й ті само ознаки, то по діагоналі матриці відстані дорівнюють 0 (оскільки відстань ознаки від самої себе дорівнює 0) і ця матриця є симетричною. Матриця містить позитивні або нульові значення відстаней.

  1. Якi алгоритми кластерного аналiзу реалiзованi в пакетi SPSS? Ієрархічний кластерний аналіз та Швидкий кластер (Quick cluster, K-means cluster).

  2. Сформулюйте загальну схему алгоритму Quick cluster (K-means cluster), реалізованого в пакеті SPSS. В чому особливостi цього алгоритму у порiвняннi з iєрархiчним кластерним аналiзом? Процедура ієрархічного КлА має сенс тоді, коли ми можемо інтерпретувати зміст кастера, розглядаючи, які конкретно об’єкти потрапили в цей кластер. Але якщо проведено опитування 2000 респондентів і одержано кластери до яких входять сотні осіб, то дослідника буде мало цікавити, хто коли приєднався до кластера, а лише середні характеристики кластерів за даними ознаками. В такому випадку йде мова про Швидкий Кластер. Ідея методу полягає в наступному. Дослідник задає число кластерів K, яке він хоче отримати в результаті роботи алгоритму. Комп’ютер випадково обирає K об’єктів і на першому кроці ці точки розглядаються як «центри» кластерів. Кожному кластеру відповідає один центр. Далі розраховуються відстані від кожного об’єкта до цих центрів і кожний об’єкт відноситься до кластера з найближчим до даного об’єкта центром. У результаті всі об’єкти розподіляються по k кластерам. Потім знову обчислюються центри вже цих нових кластерів як середні по кожній з координат (тобто середні для кожної ознаки). Потім знову розраховуються відстані від кожного об’єкта до цих центрів і об’єкт приєднується до кластера з найближчим центром. Якщо ми на першому етапі об’єднали в один кластер точки таким чином, що частина з них ближче, а частина далі, то центри кластерів будуть «повзти» до центру ваги, до місця згущення точок. Обчислення центрів та перерозподіл об’єктів відбуватиметься доти, поки центри не стабілізуються, не перестануть «повзати».

До теми "Факторний аналiз"

Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]