Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Многомерный статистический анализ. Ч.1. Методическое пособие

.pdf
Скачиваний:
0
Добавлен:
09.08.2026
Размер:
445 Кб
Скачать

2.  Чем больше опыт работы (стаж), тем выше зарплата. 3.  Зарплата зависит от должности.

4.  Зарплатаженщинвсреднемниже,чемзарплатамужчин.

Уровень измерения переменных:

зависимая переменная «зарплата», независимые переменные «образование» (в годах) и «стаж» (в месяцах) – количественные;

независимые переменные «пол» (две градации) и «должность» (три градации – служащий, охранник, менеджер) являются номинальными и должны быть предварительно преобразованы.

Выбор модели: множественная линейная регрессия.

Оценка параметров уравнения множественной линейной регрессии. Уравнение множественной линейной регрессии существует в двух формах – нестандартизированной и стандартизированной. В нестандартизированном уравнении (1.2) зависимая

инезависимые переменные представлены в оригинальном виде.

Стандартизированное уравнение имеет вид

k

 

zy =bizi,

(1.7)

i=1

где zy – стандартизированная переменная y;

zi (i = 1, 2, … k) – стандартизированные переменные xi; bi (i = 1, 2, … k) – стандартизированные коэффициенты регрессии.

Для получения стандартизированных коэффициентов βi чаще всего применяется метод наименьших квадратов: первые производные по всем параметрам модели регрессии приравнивают к нулю и получают систему из k уравнений:

b1 +r1, 2b2 +r1, 3b3 +…r1, kbk =r1, y;

 

r2, 1b1 +b2 +r2, 3b3 +…r2, kbk =r2, y;

 

r3, 1b1 +r3, 2b2 +b3 +…r3, kbk =r3, y;

(1.8)

...

 

rk, 1b1 +rk, 2b2 +rk, 3b3 +…+bk =rk, y,

 

21

которую решают относительно параметров b1 ... bk. Коэффициенты корреляций между исходными переменными ri, j и ri, y (i, j = 1, 2, … k) вычисляются по исходным данным (1.1).

Нестандартизированные коэффициенты вычисляются по формуле

bi =bi

sy

(i =

 

),

 

1, k

(1.9)

s

 

i

 

где sy и si – стандартные отклонения переменных y и xi соответственно.

Коэффициент b0 (свободный член уравнения регрессии) вычисляется по формуле

k

 

b0 =y bi xi.

(1.10)

i=1

Стандартизированная переменная (z-оценка) для переменной x вычисляется по формуле

z = xsxxi ,

где – среднее арифметическое; xi

sx – стандартное отклонение переменной x. Среднее ариф-

метическое стандартизированной переменной

z = 0, стан-

дартное отклонение sz = 1.

Пример  1.2 (продолжение)

В табл.  1.6 представлена матрица корреляций (в форме нижнего треугольника), средние арифметические и стандартные отклонения для трех количественных переменных (зависимой и двух независимых).

Система уравнений для определения стандартизированных коэффициентов bi:

b1 – 0,25b2 = 0,63; –0,25b1 + b2= 0,05.

22

Стандартизированные коэффициенты (решение системы уравнений):

b1 = 0,69; b2 = 0,21.

Нестандартизированные коэффициенты: b1 = 0,69 × 7870 / 2,9 = 1870;

b2 = 0,21 × 7870 / 105 =16;

b0 = 17 016 – (1870 × 13,5 + 16 × 96) = –9765.

Таким образом, уравнение регрессии имеет следующий вид: y = 1870x1 + 16x2 – 9765.

 

 

 

Таблица  1.6

Матрица корреляций, средние арифметические

и стандартные отклонения

 

 

 

 

 

Переменная

Зарплата

Образование

Стаж

 

 

 

 

Начальная зарплата (y)

1,00

 

 

 

 

 

 

Образование (x1)

0,63

1,00

 

Стаж (x2)

0,05

–0,25

1,00

Среднее арифметическое (xi)

17 016

13,5

96

Стандартное отклонение (si)

7870

2,9

105

Интерпретация параметров уравнения регрессии. Каждый из нестандартизированных коэффициентов регрессии bi показывает, на какую величину в среднем изменится предсказанное значение зависимой переменной y при увеличении значения соответствующей независимой переменной xi на 1. Если bi > 0, значение y увеличится, если bi < 0, значение y уменьшится на величину bi. Таким образом, знак коэффициента bi (а также стандартизированного коэффициента bi) соответствует направлению связи – прямой или обратной.

Свободный член нестандартизированного уравнения регрессии b0 равен значению зависимой переменной y в случае, когда все независимые переменные xi = 0. Значение b0 содержательно интерпретируется, только если значение 0 входит в область определения каждого из предикторов xi. Стандартизированный коэффициент регрессии bi используется для оценки силы влияния независимой переменной на зависимую. Например, если |b1| > |b2|, то предиктор x1 оказывает большее влияние на зависимую переменную y, чем предиктор x2. Не-

23

стандартизированные коэффициенты bi таким свойством не обладают, так как их значения зависят не только от силы связи, но и от масштаба измерения переменных.

Большинство современных программных средств представляют регрессионную модель в виде таблицы коэффициентов регрессии (табл.  1.7). Здесь и далее мы будем использовать именно такую форму представления регрессионных моделей. Имя зависимой переменной указывается под таблицей слева. Независимым переменным (их имена перечислены в первом столбце) соответствуют строки таблицы, причем первая строка («константа») соответствует свободному члену уравнения­ регрессии. Во втором столбце bi находятся нестандартизированные коэффициенты регрессии: в первой строке значение b0, далее значения bi, соответствующие независимым переменным. В четвертом столбце (bi) находятся значения стандартизированных коэффициентов для независимых переменных.

Пример  1.2 (продолжение) Интерпретация параметров регрессии.

Стандартизированные коэффициенты имеют значения

b1 = 0,69, b2 = 0,22. В данном случае |b1| > |b2|, (b1 = 0,69 > b2 = = 0,21), следовательно, образование больше влияет на началь-

ную зарплату в фирме, чем предшествующий опыт работы. Оба коэффициента положительные, значит, повышение уровня образования и увеличение стажа предыдущей работы повышают начальную зарплату при приеме на работу.

Нестандартизированные коэффициенты:

b1 = 1870 – при повышении продолжительности образования на 1 год средняя начальная зарплата увеличивается на 1870 условных единиц;

b2 = 16 – при увеличении стажа предшествующей работы на 1 месяц начальная зарплата в фирме увеличится в среднем на 16 условных единиц;

b0 не интерпретируется, так как образование не может принять значение 0.

24

Таблица  1.7

Коэффициенты уравнения регрессии

 

Нестандартизирован-

Стандартизирован-

Независимая переменная

ный коэффициент

ный коэффициент

 

bi

SE(bi)

bi

t

p

1

2

3

4

5

6

 

 

 

 

 

 

Константа

–9765

1417

–6,99

0,000

 

 

 

 

 

 

Образование (годы)

1870

97

0,69

19,42

0,000

 

 

 

 

 

 

Стаж (месяцы)

16

2,7

0,21

6,17

0,000

 

 

 

 

 

 

Примечание. Зависимая переменная: «начальная зарплата».

Проверка гипотез о влиянии независимых переменных на зависимую в рамках регрессионной модели сводится к проверке знака и статистической значимости коэффициентов регрессии. Знак коэффициента b характеризует направленность причинной связи между независимой переменной xi и зависимой переменной y: является она прямой (bi > 0) или обратной (bi < 0). Статистическая значимость коэффициента регрессии заключается в том, что его значение для генеральной совокупности отличается от 0 с заданной доверительной вероятностью 1 – a, значения которой традиционно выбираются из чисел 0,99; 0,95; 0,9. Величина α, которая, соответственно, может принимать значения 0,01; 0,05; 0,1, называется уровнем значимости.

Для проверки гипотезы о статистической значимости коэффициента регрессии имеются две возможности. Первая возможность состоит в построении доверительного интервала для коэффициента b с использованием значения его стандартной ошибки SE(bi) из 3-го столбца табл.  1.7. Если доверительный интервал, представленный на действительной оси, не включает значение 0, коэффициент регрессии является статистически значимым с соответствующей доверительной вероятностью. Если включает, коэффициент регрессии статистически значимым не является.

Пример  1.2 (продолжение)

При большом объеме выборки стандартная ошибка коэффициента регрессии имеет стандартное нормальное распреде-

25

ление. Поэтому при доверительной вероятности 1 – a = 0,95 доверительный коэффициент Z0,975 = 1,96, и 95%-й доверительный интервал для коэффициента регрессии при независимой переменной «образование» составляет: (1870 – 1,96 × 97; 1870 + 1,96 × 97) или (1680; 2060). Значение «0» не входит в полученный интервал, соответственно, коэффициент регрессии является статистически значимым при a = 0,05. Кроме того, коэффициент регрессии имеет положительное значение. Следовательно, гипотеза о влиянии образования на начальную зарплату подтверждается.

Вторая возможность проверки статистической значимости коэффициента регрессии заключается в использовании t-кри­ терия Стьюдента и связанного с ним p-значения (столбцы 5, 6 в табл.  1.7). Процедура проверки заключается в сравнении p-значения из последнего столбца табл.  1.7 с выбранным уровнем статистической значимости a: если p < a, коэффициент bi является статистически значимым.

Пример  1.2 (продолжение)

Внашемпримеревсекоэффициентырегрессииявляютсястатистически значимыми, так как соответствующие им p < 0,000, что заведомо меньше любого уровня значимости a. Кроме того, оба коэффициента регрессии являются положительными, что соответствует обсуждаемым гипотезам.

Прогнозирование по уравнению регрессии. Уравнение регрессии позволяет предсказать среднее значение зависимой переменной при конкретной комбинации значений независимых переменных. Для этого нужно подставить соответствующие значения в уравнение регрессии:

 

k

 

y(l)=bixi (l)+b0,

(1.11)

i=1

где xi (l) – значение независимой переменной xi (i = 1, 2, …, k)

для объекта l (l = 1, 2, …, n);

y(l) – предсказанное значение зависимой переменной y для объекта l.

26

Пример  1.2 (продолжение)

Предскажем значение зависимой переменной «начальная

зарплата» (y) для сотрудника с образованием 12 лет (x1 = 12)

и предшествующим стажем работы 20 месяцев (x2 = 20): y = = 1870 × 12 + 16 × 20 – 9765 = 12 995. Это значение интерпретируется как средняя начальная зарплата для сотрудников с образованием 12 лет и стажем работы 20 месяцев.

Оценка качества модели множественной регрессии. Аналогично тому, как это делается при оценке качества уравнения парной линейной регрессии, в уравнении множественной линейной регрессии полная дисперсия зависимой переменной S2y может быть представлена как сумма двух составляющих – дисперсии, объясненной влиянием набора независимых перемен-

ных x1, x2 ... xk (S2об), и остаточной дисперсии (S2ост), порожденной неучтенными факторами: S2y = S2об + S2ост.

Показателем качества (объясняющей способности) модели является доля объясненной дисперсии в общей дисперсии зависимой переменной. Можно показать, что она численно равна квадрату коэффициента множественной корреляции (см. 1.6):

 

 

n

 

2

 

 

 

2

 

y(l)y

 

 

 

 

Sоб

 

l=1

 

2

 

 

 

=

 

 

 

=R

,

(1.12)

2

n

 

 

Sy

 

(y(l)y)2

 

 

l=1

где y(l) – значение зависимой переменной y для объекта из вы-

борки с номером l (l = 1, 2, …, n);

y(l) – предсказанное значение зависимой переменной для того же объекта;

y – среднее арифметическое переменной y.

Пример  1.2 (продолжение)

Для данного примера коэффициент множественной корреляции R = 0,668, его квадрат R2 = 0,446, следовательно, дисперсия независимой переменной «начальная зарплата» на 44,6% объясняется двумя независимыми переменными – образованием и стажем предшествующей работы.

27

Включая в уравнение поочередно дополнительные независимые переменные, можно оценить, насколько при этом увеличивается значение R2 в абсолютном исчислении и насколько значимо это увеличение относительно первоначального значения R2. Таким образом можно оценить вклад каждого следующего предиктора в объяснение дисперсии зависимой переменной y. Однако необходимо иметь в виду, что вследствие эффекта мультиколлинеарности результаты могут существенно зависеть от порядка включения независимых переменных в модель.

Множественная регрессия с категориальными независимыми переменными. Как отмечалось выше, «классическая» модель множественной линейной регрессии предполагает использование количественных переменных с уровнем измерения не ниже интервального. Однако в социологии и смежных социальных науках количественные переменные встречаются достаточно редко, преобладают категориальные переменные, измеряемые по номинальным и порядковым шкалам. Здесь мы рассмотрим три вида таких переменных: дихотомические, номинальные с двумя градациями, номинальные и порядковые с числом градаций больше двух. В последних двух случаях применяется подход, получивший название dummy-кодирования и позволяющий из любой категориальной переменной создать набор дихотомических переменных, каждая из которых фиксирует одно свойство объекта.

Дихотомические независимые переменные используются в регрессионных моделях практически без ограничений в своем обычном виде: 0 – отсутствие некоторого свойства у объекта (например, респондента); 1 – наличие. Коэффициент регрессии при независимой дихотомической переменной показывает, насколько в среднем изменится значение зависимой переменной y при наличии данного свойства по сравнению с его отсутствием, что соответствует общему случаю интерпретации коэффициента регрессии, так как «переход» от значения 0 к значению 1 соответствует «увеличению» значения дихотомической переменной на 1.

Номинальная независимая переменная из двух категорий может быть перекодирована в дихотомическую переменную.

28

При этом значением 1 кодируется модальная (наиболее часто встречающаяся) категория или категория, более важная с точки зрения проверки гипотез или анализа данных. Например, если проверяется гипотеза о том, что заработная плата женщин в среднем ниже, чем зарплата мужчин, женский пол следует кодировать значением 1, мужской – значением 0.

Пример  1.2 (продолжение)

Добавим к уравнению регрессии переменную «пол» (табл.  1.8), т.е. будем изучать влияние на зарплату трех независимых переменных: образование, стаж работы и пол. В соответствии с гипотезой пол закодирован дихотомической переменной со значениями: 1 – женский, 0 – мужской.

Таблица  1.8

Коэффициенты уравнения множественной регрессии с дихотомической переменной «пол»

 

Нестандартизирован-

Стандартизирован-

Независимая переменная

ный коэффициент

ный коэффициент

 

b

SE(b)

b

t

p

 

 

 

 

 

 

Константа

–4492

1647

–2,73

0,007

 

 

 

 

 

 

Образование (годы)

1625

103

0,60

15,82

0,000

 

 

 

 

 

 

Стаж (месяцы)

12

2,7

0,16

4,47

0,000

 

 

 

 

 

 

Пол (женский)

–3447

583

–0,22

–5,91

0,000

 

 

 

 

 

 

Примечание. Зависимая переменная: «начальная зарплата».

Коэффициент при независимой переменной «женский пол» равен –3447, из чего следует, что начальная зарплата женщин в среднем на 3447 условных единиц ниже, чем начальная зарплата мужчин, что подтверждает проверяемую гипотезу. Отметим также, что введение в уравнение новой независимой переменной привело к изменению значений коэффициентов регрессии при предикторах «образование» и «стаж» (вследствие эффектов интеркорреляции), однако они остались статистически значимыми.

Значение R2 увеличилось и составило 48,4%. Таким образом, учет пола сотрудника повысил объясняющую способность модели на 3,8%.

29

Категориальные переменные с числом градаций больше двух также могут быть включены в уравнение регрессии посредством dummy-кодирования. Оно заключается в том, что номинальная переменная с k градациями преобразуется в k – 1 дихотомическую переменную, причем потери исходной информации не происходит.

Использование dummy-кодирования предполагает объяв­ ление одного из значений референтным (базовым, ссылочным) и рассмотрение всех остальных значений в сравнении с ним. В качестве референтного может выбираться модальное значение номинальной переменной или, напротив, значение, представляющее наименьший интерес. Для порядковой переменной референтным может стать значение, стоящее в центре распределения, а также максимальное или минимальное значение.

Дихотомические переменные создаются для всех значений, кроме референтного. Они называются dummy-переменными, или фиктивными переменными. Для каждого респондента в наборе dummy-переменных только одна может принимать значение 1, та, которая соответствует категории, выбранной респондентом. Если респондент выбирает референтное значение, все dummy-переменные равны.

Интерпретация коэффициентов регрессии для dummy-пе­ ременных осуществляется по отношению к референтной категории: коэффициент показывает, насколько в среднем изменится значение зависимой переменной y для категории, представленной dummy-переменной, по сравнению с референтной категорией.

Пример  1.2 (продолжение)

Согласно одной из гипотез, начальная зарплата зависит от должности, на которую претендует соискатель. Допустим для простоты, что в организации три основных вида должностей: служащие, охранники и менеджеры, причем большая часть всех работников является служащими. Выберем эту категорию в качестве референтной, а для двух других создадим dummy- переменные «охранник» и «менеджер». Схема кодирования представлена в табл.  1.9.

30

Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]