Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Многомерный статистический анализ в экономике. Учебное пособие

.pdf
Скачиваний:
0
Добавлен:
07.09.2026
Размер:
1 Мб
Скачать
ЕТОД ГЛАВНЫХ КОМПОНЕНТ
М
Метод главных компонент, предложенный Пирсоном в 1901 г., является одним из основных способов, позволяющих уменьшить размерность данных (сократить число взаимосвязанных (коррелированных) признаков объектов наблюдения), потеряв наименьшее количество информации.
Из числа методов, позволяющих обобщать значения элементарных признаков, метод главных компонент выделяется простой логической структурой, и в то же время на его примере становятся понятными общая идея и целевые установки многочисленных методов факторного анализа.
Метод главных компонент дает возможность по m-числу исходных признаков выделить m факторов (главных компонент), или обобщенных признаков. Каждая главная компонента является линейной комбинацией исходных признаков. Пространство главных компонент ортогонально.
Критерием оптимальности является отношение суммарной дисперсии главных компонент к суммарной дисперсии исходных признаков:
=


()
где () - дисперсия j-й главной компоненты; (
( (
)
,
)
) - дисперсия j-го
исходного признака.
Необходимо найти такие r линейных комбинаций исходных признаков (r главных компонент), которые объясняют максимально возможную долю изменчивости (суммы дисперсий) m исходных признаков.
Геометрическая интерпретация метода главных компонент.
В упрощенном виде, для двумерной случайной величины, процедуру выделения главных компонент можно показать геометрически. В
случае, когда имеются только два признака
и
, характеризующие
каждый объект, данные легко изобразить на плоскости.
Первоначально имеется некоторое эмпирическое распределение
данных в двумерном признаковом пространстве с центром (
;
).
Каждому объекту соответствует точка на плоскости с соответствующими координатами.
21
Центрированием и стандартизацией данных исходное пространство признаков сжимается и система координат переносится в центр распределения данных. Большую часть объектов наблюдения объединяет так называемый эллипсоид рассеяния.
Через центр эллипсоида рассеивания в направлении наибольшего разброса исходных данных проводят прямую линию. Это ось первой главной компоненты. Данная прямая строится как линия регрессии через исходные данные, т.е. сумма квадратов отклонений исходных данных от этой прямой должна стремиться к минимуму.
Проецируем все исходные точки на ось первой главной компоненты. Первая главная компонента максимизирует дисперсию полученных проекций.
Если отклонения исходных данных от первой главной компоненты достаточно малы, можно сказать, что это «шум», а не существенная информация, тогда им можно пренебречь, и одной
первой главной компонентой заменить два исходных признака
и
Если же расстояния от исходных данных до первой главной компоненты достаточно велики, то это полезная информация, и необходимо построить вторую главную компоненту, перпендикулярную первой, также проходящую через центр эллипса. Вторая главная компонента максимизирует оставшуюся дисперсию исходных данных.
Каждой главной компоненте соответствует собственное число. Например, первой главной компоненте соответствует собственное
число
, которое оценивает дисперсию проекций множества
исходных объектов на ось первой главной компоненты и отражает относительную длину соответствующей диагонали эллипса рассеивания, т.е. вес первой главной компоненты, или ее значимость, в описании исходного разброса данных.
Параметры эллипса, описывающего эмпирическое распределение объектов в нормированном признаковом пространстве, находят решением матричного уравнения
(
)=
0. Соответственно устанавливается положение главных компонент
(осей), обобщающих вариацию признаков
и
.
В общем, многомерном случае, процесс выделения главных компонент происходит следующим образом:
1) ищется центр облака данных и туда переносится новое
начало координат – это нулевая главная компонента;
.
22
2) выбирается направление максимального изменения данных
это первая главная компонента;
3) если данные описаны не полностью, то выбирается еще одно
направление, перпендикулярное первому, так чтобы максимально описать оставшееся изменение в данных;
4) и т.д., пока не останется только «шум», т.е. случайный
хаотический набор величин.
Пусть имеются исходные данные исследования n объектов по m элементарным признакам. Тогда имеем матрицу X исходных данных
размерностью × :
где

[×]
- значение j-го признака на i-м объекте (наблюдении).

=




,
Получим матрицу стандартизированных (центрированных и нормированных) значений признаков:
где

[×]

=

.
=




,
Модель метода главных компонент описывается уравнением:

[×]
 

,
где
где
[×]
=
[×]
-матрица индивидуальных значений главных компонент:
[×]
…
…
=
- значение j-й главной компоненты на i-м объекте


(наблюдении).
- матрица факторных нагрузок.
[×]
Матрица факторных нагрузок связывает между собой вновь полученные факторы (главные компоненты) и исходные признаки. Используется для экономической интерпретации главных компонент.





,
[×]
=
23
где
󰆄
- значение факторной нагрузки k-й главной компоненты на j-й

признак.
Свойства матрицы факторных нагрузок:
1.
- это по сути парный коэффициент корреляции между j-

м признаком и k-й главной компонентой.
Например,
- парный коэффициент корреляции между 3-м

признаком и 2-й главной компонентой.
2. Сумма квадратов элементов j-й строки матрицы нагрузок
равна дисперсии j-го исходного признака, т.е. единице:

= 1.


3. Сумма квадратов элементов k-го столбца матрицы нагрузок

:
,
равна дисперсии k-й главной компоненты
= 

где
- собственное значение k-й главной компоненты, показывает
вклад в суммарную дисперсию k-й главной компоненты.
> > >
Наибольший вклад в суммарную дисперсию дает первая главная компонента, т.е. первая главная компонента объясняет наибольшую долю вариации исходных признаков:
- доля дисперсии исходных признаков, объясняемая первой главной
компонентой;
- доля дисперсии исходных признаков, объясняемая k-ой главной
компонентой;
+ + … +
=
,
суммарная дисперсия
где  – число исходных признаков.
Из общего числа главных компонент для исследования, как правило, оставляют r (r<m) наиболее весомых, т.е. вносящих максимальный вклад в объясняемую часть общей дисперсии. Опыт показывает, что r≈(0,1-0,25)m. Для экономической интерпретации полученных результатов самыми наглядными являются случаи, когда
r=1, 2 или 3.
24
Существует несколько подходов к определению числа главных компонент (сколько главных компонент оставлять?):
критерий Кайзера (Kaiser) отбираются главные компоненты с собственными значениями больше единицы;
критерий Кеттеля (B.Cattel) (график «каменистых осыпей» ­график собственных значений главных компонент);
подход, опирающийся на пороговое значение доли объясняемой дисперсии.
Можно отбросить несколько последних главных компонент,
собственные значения которых незначительны, если мы готовы пожертвовать какой-то долей объясняемой вариации исходных признаков. Например, если мы готовы пожертвовать 20% объясняемой дисперсии, то достаточно оставить r первых главных компонент таких, что выполняется условие:
+
+ +
80%.
Таким образом, несмотря на то, что в методе главных компонент для точного воспроизведения корреляций и дисперсий между переменными необходимо найти все компоненты, большая часть дисперсии объясняется небольшим числом главных компонент.
Вычислительные процедуры метода главных компонент.
Решение задачи методом главных компонент сводится к поэтапному преобразованию матрицы исходных данных Х:
где
- матрица исходных данных (нецентрированных и
[×]
ненормированных);
n – число объектов наблюдения; m – число элементарных аналитических признаков;
На подготовительном этапе осуществляются:
1. Стандартизация, т.е. центрирование и нормирование, значений исходных признаков. При этом система координат переносится в центр распределения данных (в точку в координатами, равными среднему (мат. ожиданию) по каждому признаку), а исходное
25
пространство признаков сжимается (что особенно важно, если
признаки измеряются в разных единицах).
матрица стандартизированных значений признаков, элементы
[×]
которой вычисляются по формуле

=

; 
=


.
2. Формирование матрицы парных корреляций элементарных
признаков
[×]
:
1
.
=
Элементами матрицы R являются парные коэффициенты
корреляции между элементарными признаками, т.е.
- парный

коэффициент корреляции между j-м и k-м элементарными признаками.

=




.
Таким образом, матрица R является симметричной, а ее
элементы – числа по модулю меньше или равные единице.
Если предварительная стандартизация данных не проводилась,
то на данном шаге получают ковариационную матрицу
[×]
:
1
.
=
Элементы матрицы Х для расчета S будут центрированными величинами:
= .

Задача компонентного анализа – определить, сколько выделить
компонент и каких именно, чтобы по возможности точно воспроизвести и объяснить с их помощью наблюдаемые связи,
представляемые в виде корреляционной матрицы .
На первом этапе составляется и решается характеристическое
уравнение:
|

|
= 0,
где Е – единичная матрица размерности × .
Теоретической основой является теорема: для любой симметрической положительно определенной матрицы R существует ортогональная матрица U, такая, что
26
0
U
RU = Λ = 󰇭
0
…0…
а все элементы матрицы Λ положительны (
матрицы R положителен
|R|
> 0, все главные миноры матрицы
0 … 0
0
󰇮,
> 0), определитель
положительны. При этом
j-е собственное значение, или характеристический корень
матрицы R;
> > >
.
Шаг 1. Определение собственных чисел.
Множество собственных значений находят решением характеристического уравнения
|
|= 0.
- это характеристики
вариации, точнее, показатели дисперсии каждой главной компоненты.
Суммарное значение признаков Х


. При условии стандартизации исходных данных, когда
= 1,
равна числу элементарных признаков m.
равняется сумме дисперсий элементарных
Таким образом, получаем диагональную матрицу собственных (характеристических) чисел:
0
Λ
[×]
= 󰇭
0
…0…
0 … 0
0
󰇮
Шаг 2. Вычисление собственных (характеристических)
векторов
Собственные векторы
.
находят из матричного уравнения:
(
)= 0.
Реально это означает решение m систем линейных уравнений
для каждого
при = 1,
. В общем виде система уравнений имеет
вид
1 
 


+ + + + 


+ + + 

+
1 

+
1 
+ 
+ + 
  
= 0
= 0
= 0
… …… … … … … … … …… … …

+ + + +1 
= 0

27
Приведенная система объединяет однородные линейные уравнения, и так как число ее уравнений равняется числу неизвестных
, имеет бесконечное множество решений. Конкретные значения

собственных векторов при этом можно найти, задавая произвольно величину одной компоненты каждого вектора, и обычно ее приравнивают единице.
Таким образом, получаем ортогональную матрицу собственных (характеристических) векторов:
[×]
= 󰇭




 

󰇮.
Шаг 3. Формирование матрицы нормированных собственных
векторов
[×]
.
Матрицу нормированных собственных векторов получают преобразованием ненормированных собственных векторов U:
=
+

,
+ +

.
где
- норма вектора 
, т.е.
=

Необходимость повторного, после получения матрицы Z, нормирования пространства теперь уже обобщенных признаков объясняется механическим появлением в ходе предыдущих расчетов результатов, искажающих нормированное пространство.
На этом этапе решается вопрос, сколько главных компонент необходимо оставить в анализе.
На втором этапе получают матрицу нагрузок главных компонент на исходные признаки.
Матрицу факторного отображения
известным данным матрицы собственных чисел Λ
нормированных собственных векторов
= Λ
/
[×]
.
вычисляют по
[×]
по формуле:
[×]
и
Матрица содержит частные коэффициенты корреляции,
представляющие связи исходных признаков
. Соответственно все элементы
могут варьироваться в пределах

и главных компонент
от -1 до +1.
28
 
 

.

=
Например,
- парный коэффициент корреляции между 2-м

исходным признаком
|
|
|
|
|
и 1-й главной компонентой
 
 



Вначале А имеет размерность m × m - по числу элементарных
признаков
, затем в анализе остается r наиболее значащих компонент
(rm), и размерность матрицы становится m × r.
Если исключить нагрузки, близкие к нулю, т.е. нагрузки,
и
отражающие отсутствие связи между
, и оставить только
существенные нагрузки, это приведет к упрощению матрицы.
Каждому признаку
соответствует своя факторная структура, а
каждой факторной структуре – свой набор признаков. Число
существенных нагрузок признака
на факторы называют его
сложностью, а число признаков, формирующих каждую факторную структуру, - компонентой. Например, согласно приведенной матрице нагрузок:

 
0



,
0
-
0
0
0 0

признаки
|

| | | |
 




=
и имеют трехуровневую сложность, а и
двухуровневую, характеризующуюся соответственно тремя и двумя признаками.
По данным матрицы отображения возможна итоговая запись
зависимости значений исходных признаков от значений главных компонент:
= 
или
= + + + = 


,

29
где
- значение j-го стандартизированного признака по i-му объекту

наблюдения;
- k-я главная компонента

- весовой коэффициент (нагрузка) k-й главной компоненты

по i-му объекту наблюдения;
на j-ый признак.
А также зависимости значений главных компонент от значений стандартизированных элементарных признаков:

=
или
1



где
1
=

- весовой коэффициент (характеристика силы связи) j-го

(+ + + 

) =
элементарного признака для k-й главной компоненты.
Здесь второе уравнение является производным от первого.
На третьем этапе осуществляют вращение главных компонент (при необходимости получения упрощенной структуры) и поиск названий для главных компонент. Название должно отражать экономический смысл главной компоненты и определяется
субъективно на основе весовых коэффициентов
из матрицы

факторной нагрузки А.
На четвертом (заключительном) этапе строят матрицу главных компонент.
F – матрица индивидуальных значений главных компонент
размерностью × вычисляется по формуле:

=
;
или
= Λ


;
или
Матрица
/
= Λ
в общем виде записывается:
[×]
|
 
=
| | | |
 






.
 



.
30
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]