Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Многомерный статистический анализ в экономике. Учебное пособие
.pdf
Решим полученное уравнение, чтобы найти собственные числа.
)
1
+ 3(+ 1
(
)
+ 1
+ 3+ 3+ 1 =(
)=(
= 0 = 1.
+ 1)(
)
+ 1
+ 1 + 3)= (+ 1)(+ 2+ 1
+ 3(+ 1
)=(
+ 1)(+
)
=
Собственный вектор для собственного числа = 1 найдем из
системы:
(
)= 0.
(
)=
2 + 1 1 2
5 3 + 1 3
1 0 2 + 1
3+ 2
52+
=
= 0.
Решим однородную систему уравнений:
3
5
+ 2
2+
= 0
= 0
= 0
.
Данная система имеет бесконечное множество решений. Для
того, чтобы найти частное решение примем
уравнения
= 1. Из первого уравнения
= 1. Тогда из третьего
= 1. Таким образом,
собственный вектор, соответствующий собственному числу = 1,
равен
1
=
.
1
1
Задача. Найти собственные числа и собственные векторы
матриц:
=
0 1 0
1 1 2
1 1 0
; =
0 1 0
4 4 0
2 1 2
; =
1 3 1
3 3 1
3 5 1
.
3.1. Используя средства табличного процессора Excel найти
собственные числа матрицы
=
2 2
8 5
023
1
4 2
1 8
1
502
.
Для этого заполнить табл. 1.2.
Определение собственных чисел требует высокой точности
вычислений. Установить относительную погрешность вычислений
равной 0,0000001 (Параметры Excel/ Формулы/ Относительная
погрешность).
11

Таблица 1.2
Вычисление собственных чисел матрицы
Первоначально значение в ячейке В39 принять равным
любому числу. Затем, используя процедуру Подбор параметра
подобрать такое значение , при котором det(
Процедуру повторить 4 раза, чтобы найти все корни
характеристического уравнения (4 корня). Найденные собственные
числа разместить в ячейках В48:В51 в порядке убывания.
3.2. Для каждого найденного собственного числа найти
собственный вектор, решив систему уравнений:
12
)
= 0.

(
)= 0, 0.
Для этого в табл. 1.3 заполнить ячейки А62:D65 элементами матрицы
(
)
. В ячейки F62:F65 занести произвольные значения
компонент вектора Х (т.к. система имеет бесконечное множество
решений, то для определения конкретного собственного вектора
принять х1 равным 1).
Таблица 1.3
Вычисление собственных векторов матрицы
В ячейках А67:А70 записать правые части уравнений. Например,
для первого уравнения:
=A62*F62+B62*F63+C62*F64+D62*F65.
В ячейках Н62:Н65 вычислить произведение
(
).
Используя процедуру Поиск решения найти такие значения х2,
х3 и х4 (изменяя значения ячеек F63:F65), чтобы выполнялось
равенство
(
)= 0. (в ограничениях задать Н62:Н65=0).
Аналогично вычислить собственные векторы для всех
собственных чисел.
13

ТЕМА 2. МЕТОДЫ СНИЖЕНИЯ РАЗМЕРНОСТИ
УЩНОСТЬ ЗАДАЧИ СНИЖЕНИЯ РАЗМЕРНОСТИ
С
Рассмотрим пример. При индивидуальном пошиве одежды
портной замеряет на клиенте от восьми до одиннадцати различных
параметров(рост, размах рук, длину предплечья, длину ног,
окружности груди, бедер, талии и др.). При массовом производстве
одежды ее размеры характеризуются всего двумя факторами: ростом и
размером, являющимися производными от указанных параметров, и в
большинстве случаев указание размера и роста при покупке одежды
приводит к удовлетворительному выбору.
В многомерном статистическом анализе каждый объект
описывается вектором, размерность которого произвольна (но одна и
та же для всех объектов). Пусть при изучении n объектов у каждого из
них измеряется большое количество (m) показателей (признаков).
Если число m достаточно велико, то с ростом n возникает ряд
проблем:
• объем информации очень велик;
• нужно ли хранить весь объем информации?
• как наглядно представить весь этот объем информации.
Человек может непосредственно воспринимать лишь числовые данные
или точки на плоскости. Анализировать скопления точек в трехмерном
пространстве уже гораздо труднее. Непосредственное восприятие
данных более высокой размерности невозможно.
• как извлечь из этой информации некую суть, необходимую
для принятия решения.
Поэтому вполне естественным является желание перейти от
многомерной выборки к данным небольшой размерности, чтобы «на
них можно было посмотреть».
Цели, которые ставятся при решении задачи снижения
размерности, можно разбить на группы:
1) большая наглядность полученных данных, возможность
построения графиков и диаграмм в пространствах небольшого
количества измерений;
2) лаконизм, обозримость и простота зависимостей после
построения математической модели, за счет участия в ней меньшего
14

количества переменных, и, следовательно, упрощение счета и
интерпретации;
3) резкое снижение объемов хранимой информации.
Каким образом можно сократить размерность m задачи?
Очевидно, за счет выбора значительно меньшего числа r (r<m) новых
показателей. Это могут быть как некоторые из уже имевшихся ранее
показателей, так и образованные как комбинации старых. При этом к
новым показателям предъявляются следующие основные требования:
• сохранение наибольшей возможной доли информации,
имевшейся в исходной выборке;
• взаимная независимость новых показателей (или, по крайней
мере, их некоррелированность), что обеспечивает невозможность
сокращения их количества без существенной потери
информативности;
• наименьшее возможное искажение геометрической
структуры данных при переходе от изображения исходной выборки
облаком точек в m-мерном пространстве к такому же изображению в
r-мерном пространстве.
Таким образом, сущность задач снижения размерности
многомерного пространства заключается в выражении большого числа
исходных показателей (признаков), непосредственно измеренных на
объектах, через меньшее (как правило, намного меньшее) число более
емких, максимально информативных, но непосредственно не
наблюдаемых внутренних характеристик объектов. При этом
предполагается, что более емкие признаки будут отражать наиболее
существенные свойства объектов.
Целью методов снижения размерности является исследование
внутренней структуры изучаемой системы m случайных величин,
«сжатие» этой системы без существенной потери содержащейся в ней
информации путем выявления небольшого числа факторов,
объясняющих изменчивость и взаимосвязи исходных случайных
величин.
При решении задачи снижения размерности может быть
построен критерий оптимальности – некоторая числовая
характеристика качества снижения размерности – и поставлена
математическая задача на оптимальное снижение размерности.
Критерии оптимальности бывают внутренние, т. е. определяющиеся
структурой исходных данных и строящиеся только по этим данным, и
внешние, которые для своего построения привлекают соображения,
15

лежащие за пределами самих наблюдений. Внешние критерии
обеспечивают максимальную точность восстановление
результирующего показателя. Критерии автоинформативности
обеспечивают максимальную точность восстановления не только
результирующего показателя, но и исходных переменных.
Имеются следующие основные типы предпосылок к тому, что
задачу снижения размерности удастся эффективно решить:
1) сильная связь между исходными показателями, в результате
которой информация, содержащаяся в них, дублируется;
2) слабая информативность некоторых показателей, которые
состоят в основном из случайных помех. Это чаще всего выражается в
том, что они мало изменяются при переходе от объекта к объекту, что
позволяет исключить их из данных, даже повысив при этом
количество полезной информации в оставшихся данных;
3) возможность объединения нескольких показателей в один,
что бывает возможно, если интересующее нас решение связано не с
каждым показателем в отдельности, а с некоторым интегративным
показателем.
Формальная постановка задачи снижения размерности.
()
Пусть
,
()
показатели (случайные величины), =
, … ,
()
наблюдаемые у каждого из n объектов
()
,
()
, … ,
()
- m-
мерный вектор, = () - r-мерная векторная функция,
()=
Имеется функция
((
()
()
)
), принимающая неотрицательные
, …,
()
()
.
значения – мера информативности или критерий оптимальности. Этот
критерий определяется сущностью решаемой задачи. Задан также
класс f, которому должна принадлежать функция ().
Построить такую функцию ()из класса f, такую, что
()
(
) =
((
)
).
Тот или иной выбор критерия оптимальности и класса
допустимых преобразований приводит к разного рода методам
снижения размерностей, наиболее важными из которых являются:
• метод главных компонент;
• экстремальная группировка признаков;
• многомерное шкалирование;
• отбор показателей для дискриминантного анализа;
• отбор показателей в модели регрессии.
16

ЕТОДЫ ФАКТОРНОГО АНАЛИЗА И ИХ КЛАССИФИКАЦИЯ
М
Под факторным анализом понимают совокупность методов,
которые на основе реально существующих связей элементарных
признаков (или объектов) позволяют выявлять латентные (скрытые)
обобщающие характеристики исследуемой структуры, позволяющие
объяснять механизм развития изучаемых явлений и процессов.
Примерами таких латентных характеристиками могут быть уровень
жизни населения (при исследовании регионов или стран) или качество
продукции (исследование предприятия).
Латентность означает неявность («скрытость») характеристик,
раскрываемых при помощи методов факторного анализа.
Главная цель факторного анализа - сокращение числа
переменных (редукция данных) и определение структуры
взаимосвязей между переменными (классификация переменных).
Вначале мы имеем дело с набором элементарных признаков
()
их взаимодействие предполагает наличие определенных причин,
особенных условий, т.е. существование некоторых скрытых
(латентных) факторов. Изменчивостью этих скрытых факторов
объясняется изменчивость всех наблюдаемых элементарных
признаков. В этом смысле оцениваемые латентные факторы
()
()
, … ,
()
,
()
можно считать причинами, а наблюдаемые признаки
()
, … ,
- следствиями.
Эти факторы устанавливаются в результате обобщения
элементарных признаков и выступают как интегрированные
характеристики, или признаки, но более высокого уровня.
Коррелировать могут не только элементарные признаки
и сами наблюдаемые объекты
, поэтому поиск латентных факторов
()
, но
теоретически возможен как по признаковым, так и по объектным
данным.
Рассмотрим пример. Пусть n наблюдаемых объектов
(автомобилей) оценивается в двумерном признаковом пространстве:
()
- стоимость автомобиля,
мотора. При условии коррелированности
координат х
появляется направленное и достаточно плотное
1-х2
скопление точек, формально отображаемое новыми осями (F
Характерная особенность F
через плотные скопления точек и в свою очередь коррелируют с
()
- длительность рабочего ресурса
и F2 заключается в том, что они проходят
1
()
и
()
в системе
и F2).
1
()
и
,
17

()
. Максимальное число новых осей
будет равно числу
элементарных признаков.
Допуская линейную зависимость
=
=
Интерпретируем оси
- его надежность в эксплуатации. Суждение об и
()
()
: пусть
+
+
на оценке структуры латентных факторов, т.е. оценке весов
, а именно по значениям коэффициентов
в
()
от
, можем записать:
()
()
.
- экономичность автомобиля,
базируется
()
()
и
.
Основными этапами факторного анализа являются:
− вычисление корреляционной матрицы всех переменных,
участвующих в анализе;
− извлечение факторов;
− вращение факторов (при необходимости получения более
простой факторной структуры);
− интерпретация (распознавание) факторов.
Все методы факторного анализа можно разделить на несколько
классификационных групп:
1. Метод главных компонент (Г. Хоттелинг). Строго говоря, его
не относят к факторному анализу, хотя он имеет с ним много общего.
Специфическим является, во-первых, то, что в ходе вычислительных
процедур одновременно получают все главные компоненты и их число
первоначально равно числу элементарных признаков; во-вторых,
постулируется возможность полного разложения дисперсии
элементарных признаков, другими словами, ее полное объяснение
через латентные факторы (обобщенные признаки).
2. Методы факторного анализа. Выявляют k (где k меньше,
чем число исходных признаков) общих для всех исходных признаков
факторов. Дисперсия элементарных признаков здесь объясняется не в
полном объеме, признается, что часть дисперсии остается
нераспознанной и объясняется влиянием специфических факторов.
Факторы обычно выявляются последовательно: первый, объясняющий
наибольшую долю вариации элементарных признаков, затем второй,
объясняющий меньшую, вторую после первого латентного фактора,
часть дисперсии, третий и т.д. Процесс выделения факторов может
быть прерван на любом шаге, если принято решениие о достаточной
доли объясненной дисперсии элементарных признаков или с учетом
интерпретируемости латентных факторов.
18

Методы факторного анализа дополнительно делятся на два
Метод
главных компонент
Простые
методы
Современные
аппроксимирующие методы
• Однофакторная модель
• Главных факторов
• Групповой
• Минимальных остатков
• Бифакторная модель
• Максимального
правдоподобия
• Минимальных остатков
• Центроидный метод
• Канонический
• Распознавания образов
• – факторного анализа
класса: упрощенные и современные аппроксимирующие методы.
Простые методы факторного анализа в основном связаны с
начальными теоретическими разработками. Они имеют ограниченные
возможности в выделении латентных факторов и аппроксимации
факторных решений. Например, однофакторная модель Ч. Спирмена
позволяет выделить только один генеральный латентный и один
характерный факторы. Для возможно существующих других
латентных факторов делается предположение об их незначимости.
Современные аппроксимирующие методы часто предполагают,
что первое, приближенное решение уже найдено каким-либо из
способов, последующими шагами это решение оптимизируется.
Методы отличаются сложностью вычислений.
Общая классификация методов факторного анализа
представлена на схеме:
Факторный анализ
Ч. Спирмена
Г. Хользингера
Л. Тэрстоуна
Основной задачей, которую решают разнообразные методы
факторного анализа, включая и метод главных компонент, является
сжатие информации, переход от множества значений по m
элементарным признакам с объемом информации m*n к
ограниченному множеству элементов матрицы факторного
19

отображения (m*r) или матрицы значений латентных факторов для
каждого наблюдаемого объекта размерностью n*r, причем обычно
r<m.
Среди прикладных задач, решаемых указанными методами,
следует отметить следующие:
• поиск скрытых, но объективно существующих взаимосвязей
между экономическими и социальными показателями, проверка
гипотез о взаимосвязи этих показателей, выявление природы различий
между объектами;
• описание изучаемой системы числом факторов, значительно
меньшим числа исходных признаков, при этом выявленные факторы
или главные компоненты содержат в среднем больше информации,
чем непосредственно зафиксированные на объектах значения
исходных признаков;
• построение обобщенных экономических и социальных
показателей, таких как качество продукции, размер предприятия,
интенсивность ведения хозяйства и т.п.;
• визуализация исходных многомерных наблюдений путем их
проецирования на специально подобранную прямую, плоскость или
трехмерное пространство;
• построение регрессионных моделей по факторам (главным
компонентам), что решает проблему затрудненности построения и
ининтерпретации регрессионных моделей, вызванную
мультиколлинеарностью исходных признаков (главные компоненты,
сохраняя всю информацию об изучаемых объектах, являются
некоррелированными по построению);
• классификация по обобщенным экономическим показателям
(классификация объектов, проведенная по факторам или по главным
компонентам, оказывается более объективной, чем классификация тех
же объектов по исходным признакам; кроме того, по одному-трем
факторам или главным компонентам возможно проведение визуальной
классификации);
• сжатие исходной информации, значительное уменьшение
объемов информации, хранимой в базах данных, без существенных
потерь информативности.
20
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
