Добавил:
Upload Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:
Конспект лекций МиМвИСПР[2].doc
Скачиваний:
86
Добавлен:
26.04.2019
Размер:
1 Мб
Скачать

Тема 1.3. Факторный анализ

  • Сущность факторного анализа. Классификация задач ФА.

  • Этапы проведения ФА.

  • Метод главных компонент.

  • Метод главных факторов.

1. Сущность факторного анализа. Классификация задач фа

В основе факторного анализа лежит идея о том, что за сложными взаимосвязями измеренных признаков стоит определенная структура, отражающая наиболее существенные черты изучаемой системы, а измеренные признаки являются конкретными проявлениями скрытых общих факторов, определяющих эту структуру. Таким образом, поведение каждого исходного признака определяется действием на него совокупности относительно небольшого числа общих факторов, влияющих на все показатели и обусловливающих взаимосвязи между ними, и характерного фактора, воздействующего только на данный показатель. Каждый признак имеет собственную единицу измерения, но это означает несопоставимость его с другими признаками. В этом случае факторы, общие для целого ряда признаков разной размерности, вообще были бы лишены смысла.

Под факторным анализом понимается совокупность методов, которые на основе реально существующих связей между переменными (или объектами) позволяют выявить латентные (неявные) обобщающие характеристики организационной структуры и механизмы развития изучаемых процессов и явлений. Исходный статистический массив данных представляет собой матрицу размерностью n´m.

Исходный статистический массив данных представляет собой матрицу размерностью n´m.

,

где – реализация для i-го объекта переменной .

Факторный анализ позволяет выполнять исследование структуры данных. В зависимости от того, каким образом представлены данные, выделяют техники проведения факторного анализа. Если набор данных характеризует n наблюдений, у которых измерены m переменных, то используются R- и Q-техники.

  • R-техника позволяет выявить латентные факторы на основе взаимосвязей, вычисленных по данным n наблюдений, между m переменными.

  • Q-техника позволяет выявить латентные факторы на основе взаимосвязей, вычисленных по данным m переменных, между n наблюдениями.

В отличие от R- и Q-техники, P- и O-техники основаны на изучении одного объекта, у которого в n различные моменты времени измеряются m переменных.

  • P-техника используется для проведения факторного анализа на основе изучения взаимосвязей между m переменными, характеризующими один объект наблюдения в различные моменты времени.

  • O-техника используется для проведения факторного анализа на основе изучения взаимосвязи между n тактами времени на основании m переменных.

Более 90% исследований проводятся с помощью R-техники. В дальнейшем методы факторного анализа рассматриваются только с использованием этой техники.

  1. Этапы проведения факторного анализа.

Этапы проведения факторного анализа включают решение следующих проблем:

  1. робастности (устойчивого оценивания параметров распределений);

  2. определения общностей (нахождения долей дисперсий переменных, которые поддаются объяснению через общие факторы);

  3. нахождения факторов (определения числа извлекаемых переменных и их вида);

  4. вращения (выбора одной из множества матриц факторного отображения);

  5. оценки значений факторов (получения значений факторных нагрузок);

  6. динамических моделей (сопоставления факторных решений, полученных в течение длительного периода времени).

Общая схема факторного анализа приведена на рисунке.

Рисунок 1 ‑ Схема проведения факторного анализа

В схеме, приведенной на рис. 1, введены следующие обозначения:

n – количество объектов наблюдения;

m – количество элементарных переменных;

p – количество факторов (компонент);

– номер наблюдения;

– номера переменных;

– номер фактора.

Метод главных компонент

Чрезвычайно удобным в качестве метода «сжатия» информации с целью выявления обобщенных характеристик явления является метод главных компонент – разновидность факторного анализа. Главные компоненты независимы, а их число равно числу исходных признаков. Обычно нескольких первых компонент оказывается достаточно для хорошего описания почти всей дисперсии исходных признаков, т.е. для описания в сжатом виде всей исходной информации

Метод главных компонент, отличающийся простой логической структурой, позволяет по переменным выделить главных компонент, которые полностью объясняют дисперсию переменных, т.е. все общности , равны 1.

Последовательность вычисления матриц в методе главных компонент:

. (1)

  1. X – матрица исходных данных:

  1. Z – матрица нормированных данных той же размерности, что и матрица исходных данных.

Нормирование производится по следующей формуле:

, (2)

где – выборочное среднее, вычисленное для переменной ;

σj – выборочное среднеквадратическое отклонение, вычисленное для переменной  .

  1. – диагональная матрица собственных чисел корреляционной (либо ковариационной) матрицы:

.

Собственные числа матрицы упорядочены по не возрастанию и определяются из решения уравнения:

, (3)

где – обозначение детерминанта; – единичная матрица порядка m.

Решение уравнения относительно соответствует нахождению корней характеристического многочлена:

, (4)

где – коэффициенты, зависящие от элементов корреляционной матрицы.

Примечание. Вычисление коэффициентов , а тем более вычисление корней многочлена (6) представляет большие трудности для матриц, имеющих размерность больше чем . В данном случае лучше воспользоваться итерационным методом, например, методом вращения Якоби для нахождения собственных чисел и собственных векторов симметричных матриц. Ортонормированные собственные векторы , представим в матричном виде:

.

Линейная модель метода главных компонент предполагает, что можно записать в виде:

, (5)

где – элементы матрицы – матрицы факторных нагрузок (факторного отображения);  – обозначение -ого фактора (компонента).

Подставив в (7) , – значения матрицы факторов , вычислим для каждого наблюдения значения :

, , . (6)

Матрицу факторного отображения

, (7)

где , находят из теоремы Шура о возможности разложение симметричной матрицы с помощью матрицы собственных векторов.

Теорема Шура. Пусть вещественная симметричная матрица порядка m, тогда существует ортонормированная матрица , в которой столбцы , есть собственные векторы матрицы , и существует диагональная матрица , где - собственные числа матрицы , соответствующие собственным векторам :

, (8)

где - ортонормированная матрица, т.е. . Если собственные числа различные, тогда матрица определяется единственным образом с точностью до знака.

Корреляционная матрица удовлетворяет условиям теоремы – она является вещественной и симметричной. Одновременно умножим левую и правую части уравнения (10) слева на и справа :

.

Матрица является ортонормированной, поэтому

,

где – единичная матрица порядка . Следовательно, корреляционная матрица выражается через матрицы собственных векторов и собственных значений:

.

Матрица неотрицательно определена, поэтому собственные числа являются неотрицательными. Диагональную матрицу , с собственными значениями на главной диагонали, представим в виде:

.

Определение количества главных компонент

Доля объясняемой дисперсии некоторой компонентой нормированных переменных , , равна

; (9)

учитывая, что

,

выражение (11) перепишем в виде:

.

Метод главных компонент позволяет воспроизвести матрицу коэффициентов корреляции между переменными , небольшим числом главных компонент. Для того, чтобы выделить несколько главных компонент, пользуются двумя методами.

  1. Если , при этом , тогда компоненты , объясняют дисперсию , хуже, чем сами переменные , поэтому необходимо выбирать первых главных компонент.

  2. Количество главных компонент можно выбрать исходя из того, какую долю дисперсии исходных переменных нам надо объяснить. Первые главных компонент объясняют

долю дисперсии переменных. Количество компонент в этом случае выбирается из условия , при этом необходимо, чтобы .

Проблема определения общностей в методе главных компонент не решается, т.к. предполагается, что с помощью главных компонент можно полностью объяснить дисперсию переменных. Однако, после того как было определено количество переменных, извлеченные общности можно вычислить по формуле

,

т.е. общности – это элементы главной диагонали редуцированной матрицы

,

где – матрица размером , составленная из первых столбцов матрицы факторных нагрузок .

Интерпретация матрицы факторных нагрузок основана на том, что – элементы матриц факторных нагрузок – характеризуют степень связи между переменными и факторами . Чем ближе значение факторной нагрузки к , тем сильнее влияние фактора на переменную .