Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Многомерный статистический анализ. Ч.1. Методическое пособие

.pdf
Скачиваний:
0
Добавлен:
09.08.2026
Размер:
445 Кб
Скачать

двух градаций, они могут быть неупорядочены (номинальная переменная) или упорядочены (порядковая переменная). В первом случае применяется мультиноминальная логистическая регрессия, во втором – порядковая логистическая регрессия. Мультиноминальная логистическая регрессия следует логике dummy-кодирования: одно из значений зависимой переменной объявляется референтным, и для каждого из оставшихся значений строится логистическое уравнение. Таким образом, если зависимая переменная имеет k градаций, модель будет состоять из k – 1 уравнений. Порядковая модель логистической регрессии также состоит из k – 1 уравнений. Пронумеруем значения зависимой переменной в порядке возрастания от 1 до k. Первое уравнение строится для минимального (первого) значения, второе – для следующего за ним и т.д., за исключением максимального значения. Каждое из уравнений предназначено для вычисления вероятности того, что зависимая переменная превысит соответствующее значение:

 

B0 +B1x1 +B2x2 +…+Bkxk

 

P(y > j)=

1+e eB0 +B1x1 +B2x2 +…+Bkxk ,

(1.16)

для j = 1, 2 … k – 1. Очевидно, что к максимальному значению k эта формула неприложима, так как зависимая переменная y не может превысить это значение.

1.4.  Путевой анализ

Путевой анализ является наиболее простым вариантом подхода, получившего название моделирования структурными уравнениями. Модель путевого анализа можно рассматривать как расширение модели множественной линейной регрессии за счет добавления в нее корреляционных и причинных связей между независимыми переменными. Таким образом, некоторые переменные обретают в путевой модели двойной статус: по отношению к одним переменным они являются зависимыми, по отношению к другим – независимыми. Переменные, рассматриваемые в модели исключительно в качестве независимых, называются экзогенными (порожденными

41

вне системы); переменные, рассматриваемые как зависимые или имеющие двойной статус, – эндогенными (порожденными, хотя бы отчасти, внутри системы).

Пример  1.2 (продолжение)

На рис.  1.6, а представлена «плоская» модель множественной линейной регрессии, в которой структура корреляций между независимыми переменными не рассматривается; на рис.  1.6, б – путевая модель, которая позволяет рассмотреть структуру связей между независимыми переменными, например изучить опосредующее влияние образования, стажа и должности на взаимосвязь пола и зарплаты.

Рис.  1.6. Модель множественной линейной регрессии (а) и путевая модель (б)

Переменные «стаж», «образование» и «должность» имеют в путевой модели двойной статус. Например, «должность» одновременно выступает в качестве независимой переменной по отношению к «зарплате» и в качестве зависимой переменной по отношению к «полу», «образованию» и «стажу». «Зарплата» является только зависимой, «пол» – только независимой переменной. Таким образом, «пол» является в данной модели единственной экзогенной переменной, все остальные переменные – эндогенными.

Путевой граф является основным инструментом представления как гипотез путевого анализа, так и его результатов. Гипотезы путевого анализа касаются наличия причинных связей между переменными и их направленности (являются они прямыми или обратными). Для представления гипотез используются структурные составляющие графа: ребра (линии) – для обозначения корреляционных связей, дуги (стрелки) – для причинных свя-

42

зей. На граф наносятся только те связи, которые соответствуют выдвинутым гипотезам. Так, на рис.  1.6, б отсутствует линия или стрелка между стажем работы и образованием, поскольку наличие такой связи не предполагается.

В соответствии с гипотезами о направленности связей на соответствующих стрелках указываются знаки: «+» для прямой связи или «–» для обратной (рис.  1.7). В модель включаются также остаточные, или ненаблюдаемые, факторы – по одному на каждую эндогенную переменную, объединяющие все не учтенные в данной модели причины, влияющие на нее. Такие факторы принято обозначать буквой U (от англ. unobserved – ненаблюдаемый).

Рис.  1.7. Представление гипотез о наличии и направленности связей на графе путевого анализа

Структурные уравнения. Уравнения, описывающие структуру связей между переменными, входящими в путевую модель, называются структурными и позволяют проверить гипотезы, представленные посредством путевого графа. Количество уравнений равно числу эндогенных переменных – по одному на каждую. В «своем» уравнении эндогенная переменная является зависимой; в качестве независимых используются все переменные, с которыми она связана входящими стрелками.

43

Дополнительно в уравнение включается соответствующий ненаблюдаемый фактор.

Поскольку нас интересует степень влияния переменных друг на друга, структурные уравнения представляются в стандартизированном виде. Коэффициенты, связывающие переменные

впутевой модели, называются путевыми коэффициентами,

их принято обозначать pYX, где Y – зависимая переменная, X – независимая переменная. Путевые коэффициенты pYX для независимых переменных Xi (i = 1, 2, …, k) вычисляются аналогично тому, как вычисляются стандартизированные коэффициенты

вуравнении множественной линейной регрессии.

Если в структуре переменных присутствуют чисто корреляционные связи (без причинной компоненты), для них не вычисляются путевые коэффициенты, а указывается коэффициент парной корреляции.

Путевой коэффициент pYUY для ненаблюдаемого фактора зависимой переменной UY вычисляется по формуле

 

 

 

 

 

 

p

= 1−R2

...X

,

(1.17)

YU

 

Y.X X

 

 

Y

1 2

k

 

 

где RY.X1X2…Xk – коэффициент множественной корреляции для зависимой переменной Y и набора независимых переменных X1, X2 ... Xk.

Путевые коэффициенты для ненаблюдаемых факторов, возведенные в квадрат, являются показателем неадекватности модели, они интерпретируются как доля дисперсии соответствующей зависимой переменной, не объясненной переменными, включенными в модель.

Пример  1.2 (продолжение)

Направленность связей между переменными показана на рис.  1.7. Все связи, представленные на рисунке, можно описать четырьмя уравнениями – по одному на каждую эндогенную переменную. Для краткости изложения обозначим переменные первыми буквами английских названий: F (female) – женский пол; D (durabilty) – стаж работы до поступления в фирму; E (education) – образование; P (position) – должность; S (salary) –

44

начальная зарплата. Остаточные (ненаблюдаемые) факторы обозначим соответственно UD, UE, UP и US. Пол является дихотомической переменной (1 – женский, 0 – мужской). Должность также дихотомизирована (менеджер – 1, все остальные должности – 0). Образование измеряется в годах, стаж работы – в ме­ сяцах.

Наша путевая модель состоит из 4 уравнений:

D = pDF F + pDUD UD;

E = pEF F + pEUE UE;

P = pPF F + pPD D + pPEE + pPUP UP;

S = pSF F + pSD D + pSEE + pSPP + pPUS US.

Для вычисления путевых коэффициентов исключим из этих уравнений ненаблюдаемые факторы:

D = pDF F;

E = pEF F;

P = pPF F + pPDD + pPEE;

S = pSF F + pSDD + pSEE + pSPP,

и используем тот же подход, что и при вычислении стандартизированных коэффициентов линейной регрессии (см. 1.8).

Путевые коэффициенты для остаточных факторов вычисляются таким образом, чтобы сумма квадрата соответствующего путевого коэффициента с квадратом коэффициента множественной корреляции для соответствующего стандартизированного уравнения была равна 1:

pDUD =1−rDF2 ;

pEUE =1−rEF2 ;

45

pPUP =1−RP2.FDE ;

pSUS =1−RS2.FDEP .

Заметим, что стандартизированные уравнения для переменных D и E включают только одну независимую переменную, поэтому вместо коэффициента множественной корреляции используется коэффициент парной корреляции.

Результаты путевого анализа. Окончательная модель (результаты) путевого анализа представляется в виде графа с нанесенными на него вычисленными путевыми коэффициентами (рис.  1.8). Здесь также можно видеть путевые коэффициенты для ненаблюдаемых факторов, характеризующие качество модели.

Пример  1.2 (продолжение)

Для результирующей переменной S (зарплата) путевой коэффициент = 0,55. Будучи возведенным в квадрат, он становится показателем неадекватности модели: 0,55 = 0,3, т.е. 30% дисперсии переменной «зарплата» не объяснено переменными, включенными в модель, и связями между ними. Из этого следует, что модель достаточно хороша, так как в ее рамках объяснено 70% дисперсии зарплаты.

Рис.  1.8. Путевой граф с вычисленными путевыми коэффициентами

46

Декомпозиция коэффициента парной корреляции. Помимо представления структуры связей между переменными, путевой граф может также использоваться для декомпозиции коэффициента корреляции между двумя переменными, т.е. для «разложения» его на составляющие, определения в его составе прямых и опосредованных эффектов, а также обнаружения ложных корреляций. Декомпозиция коэффициента корреляции осуществляется методом трассирования путей, заключающимся в том, чтобы рассмотреть все «пути» взаимодействий между переменными, вносящими свой вклад в значение рассматриваемого коэффициента.

Допустим, нас интересует коэффициент корреляции между переменными с номерами I и J. Прямой эффект независимой переменной I на зависимую переменную J измеряется связывающим их путевым коэффициентом pJI (рис.  1.9).

Рис.  1.9. Прямой эффект независимой переменной I на зави-

симую переменную J

Косвенные эффекты бывают двух видов: опосредующие эффекты и эффекты ложной корреляции. Опосредующий эффект возникает, когда воздействие независимой переменной I на зависимую переменную J опосредуется одной или несколькими переменными, например переменной K. Значение косвенного эффекта вычисляется как произведение путевых коэффициентов по «пути» от I до J через K: pJK pKI (рис.  1.10). Именно этот прием называется трассированием.

Рис.  1.10. Косвенный эффект независимой переменной I на зависимую переменную J, опосредованный переменной K

Эффект ложной корреляции возникает в случае, когда взаимодействие между переменными I и J частично или полностью обусловлено влиянием третьей переменной K (рис.  1.11). Величина ложной корреляции вычисляется как произведение

47

путевых коэффициентов pJK pKI. Отличие ложной корреляции от опосредующих эффектов заключается в направленности причинных связей: стрелки, проходящие через вершину K, направлены в разные стороны. Тем не менее вычисление величины эффекта осуществляется так же.

Рис.  1.11. Эффект ложной корреляции между переменными I и J под воздействием переменной K

Модель адекватно представляет взаимодействие между независимойпеременнойIизависимойпеременнойJ,еслисуммапрямого и всех косвенных эффектов для этих двух переменных равна коэффициенту корреляции между ними rJI. Если сумма эффектов существенно отличается от значения коэффициента корреляции, модель не может рассматриваться как удовлетворительная.

Существуют определенные правила для образования легитимных «путей» между независимой и зависимой переменными при трассировании. Рассмотрим их более подробно.

1.  Пути «проходятся» в обратном порядке – от зависимой переменной J к независимой переменной I, т.е. от «головы» стрелки к «хвосту».

2.  Если путь содержит одну промежуточную переменную K, стрелки могут менять направление, т.е. может иметь место ситуация как промежуточного эффекта, так и ложной корреляции. Путь может также включать двойную стрелку (для двух независимых переменных, коррелирующих друг с другом).

3.  Если путь содержит более одной промежуточной переменной, на его легитимность существует ограничение, заключающееся в том, что «разворот» допускается только один раз. То есть если движение по стрелкам «назад» (от «головы» к «хвосту» стрелки) один раз изменилось на движение «вперед» (от «хво-

48

ста» стрелки к «голове»), повторный «разворот» уже невозможен. Что касается двойных стрелок, путь может содержать только одну такую стрелку.

Пример  1.2 (продолжение)

Рассмотрим влияние пола на начальную зарплату сотрудника в фирме (см. рис.  1.8). Полное значение коэффициента корреляции между женским полом и начальной зарплатой составляет rSF = –0,36.

В данном случае граф включает все возможные связи между переменными, поэтому неудивительно, что сумма эффектов совпала с коэффициентом корреляции.

Таблица  1.17 позволяет осуществить анализ структуры дискриминации женщин в изучаемой организации при приеме на работу, проявляющейся в назначении более низкой зарплаты, чем мужчинам.

 

Таблица  1.17

Декомпозиция коэффициента парной корреляции

 

на прямые и косвенные эффекты

 

 

 

 

Источник корреляции

Вычисление

Значение

 

 

 

Прямой эффект

pSF

–0,29

 

 

 

Косвенные эффекты:

 

 

через должность

pSP pPF = 0,49 × (–0,32)

–0,16

через образование

pSE pEF = 0,38 × 0,16

+0,06

через образование и должность

pSP pPE pEF = 0,49 × 0,65 × 0,16

+0,05

через стаж

pSD pDF = 0,13 × (–0,17)

–0,02

через стаж и должность

pSP pPD pDF = 0,49 × 0,05 × (–0,17)

–0,00

Сумма эффектов

 

–0,36

 

 

 

Коэффициент корреляции

rSF

–0,36

 

 

 

Разность между коэффици-

 

0,00

ентом корреляции и суммой

 

 

эффектов

 

 

 

 

 

1.  Коэффициент корреляции (–0,36) характеризует общие различия в начальной зарплате женщин и мужчин.

2.  Прямой эффект пола на зарплату (–0,29) составляет большую часть коэффициента корреляции; он характеризует дискриминацию женщин непосредственно при назначении начальной зарплаты.

49

3.  Косвенный эффект пола на зарплату через должность (–0,16) характеризует дискриминацию женщин при приеме на должность менеджера, что также сказывается на различиях в зарплате.

4.  Два косвенных эффекта пола на зарплату через образование (в сумме +0,11) показывают, что женщины принимаются на более низкие должности и получают более низкую зарплату, несмотря на более высокий уровень образования, чем у мужчин. Таким образом, более высокое образование женщин маскирует масштабы их дискриминации в данной фирме: если бы у женщин и мужчин был одинаковый образовательный уровень, дискриминация проявилась бы более отчетливо.

50

Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]