Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Многомерный статистический анализ. Ч.2. Методическое пособие

.pdf
Скачиваний:
0
Добавлен:
12.08.2026
Размер:
1 Мб
Скачать

Расстояние Чебышева используется для порядковых шкал одинаковой размерности и представляет собой максимальную разность для двух объектов по всем переменным, взятую по абсолютной величине:

dA, B = max

 

xi (A)xi (B)

 

.

(2.3)

 

 

1 ≤ x k

 

 

 

 

 

Пример  2.2. Вычисление расстояния Чебышева. Алгоритм вычисления расстояния Чебышева для двух объ-

ектов А и В представлен в табл.  2.4. Используются 7-балльные порядковые переменные.

Таблица  2.4

Вычисление расстояния Чебышева

Переменный объект

x1

x2

x3

x4

x5

x6

x7

x8

x9

x10

А

1

2

3

4

5

6

7

5

3

1

 

 

 

 

 

 

 

 

 

 

 

В

1

3

5

7

6

5

4

1

2

7

xi(A) – xi(B)

0

1

2

3

1

1

3

4

1

6

В данном случае

dA, B = max xi (A)xi (B) =6.

1 ≤ x ≤ 10

Заметим, что расстояния Хемминга и Чебышева используются как для ортогональных, так и для неортогональных пространств.

Снижение размерности пространства переменных: постановка задачи. Одновременный анализ большого числа переменных, в той или иной степени коррелирующих между собой, вызывает значительные затруднения. Задача снижения размерности заключается в том, чтобы уменьшить число анализируемых переменных, сохранив при этом большую часть исходной информации, и по возможности добиться ортогональности нового пространства, так как большинство методов классификации и изучения причинных связей изначально разработаны для некоррелирующих друг с другом переменных.

Все процедуры снижения размерности основаны на идее о том, что тесно коррелирующие между собой переменные из-

11

меряют близкие по содержанию свойства объектов из выборки и, соответственно, могут быть объединены (интегрированы) в более «крупные» переменные. В многомерном пространстве оси зачастую расположены неравномерно, они образуют «блоки», внутри которых переменные тесно коррелируют друг с другом. Исследование структуры пространства заключается в том, чтобы выделить эти блоки и проинтерпретировать их содержательно. Каждая из проинтерпретированных групп связанных между собой переменных может быть заменена одной новой переменной (рис.  2.3), что и приводит к снижению размерности.

Рис.  2.3. Снижение размерности пространства переменных

Методами снижения размерности могут решаться две задачи: 1)  исследование структуры переменных как самостоятельная задача при изучении ценностей, мотивов, оценок и т.п., а также при проверке внутренней валидности тестов и других

конструируемых индексов; 2)  собственно снижение размерности, т.е. переход к про-

странству с меньшим количеством переменных как предварительный этап построения классификаций или моделирования причинных связей.

Основными методами снижения размерности являются метод главных компонент, факторный анализ, метод многомерного шкалирования. Они различаются теоретическими и математическими моделями конструирования новых интегральных переменных, а также вычислительными процедурами.

12

Самостоятельная работа

Изобразите пространство переменных, соответствующее матрице корреляций (табл.  2.5), в которой представлены переменные, измеряющие предпочтения при выборе горнолыжного курорта. Используются 5-балльные шкалы: 1 – совершенно не важно; 5 – очень важно.

 

 

 

 

 

Таблица  2.5

 

Матрица корреляций предпочтений при выборе курорта

 

 

 

 

 

 

 

 

Переменная

x1

x2

x3

 

x4

x1

– стоимость путевки

1,00

–0,95

–0,06

 

–0,13

x2

– комфорт

–0,95

1,00

–0,09

 

–0,04

x3

– качество снега

–0,06

–0,09

1,00

 

0,99

x4

– качество склонов

–0,13

–0,4

0,99

 

1,00

2.2.  Измерение латентных переменных. Семантический дифференциал

Первичные и вторичные измерения. Одна из методологических проблем социологического исследования заключается в латентности многих социологических показателей, невозможности их непосредственного (прямого) измерения. Наиболее распространенным способом решения данной проблемы является конструирование индексов – вторичных переменных, позволяющих оценить степень выраженности латентных характеристик объектов.

Индексом называется производный показатель, сконструированный из исходных переменных (индикаторов) посредством математических и логических операций. Основными приемами построения индексов являются:

вычисление относительных показателей (например, процент правильных ответов на вопросы теста; индикаторами в данном случае являются общее количество вопросов в тесте и число правильных ответов);

суммирование (например, вычисление конкурсного балла при поступлении в вуз; индикаторы – экзаменационные оценки по предметам);

13

•вычисление среднего арифметического (например, средний балл по аттестату зрелости; индикаторы – оценки по отдельным предметам).

В наиболее общем виде вычисление индекса, основанного на суммировании индикаторов, можно представить в виде линейной комбинации:

k

 

Y =aiXi =a1X1 +a2X2 +…+akXk,

(2.4)

i

где Y – конструируемый индекс;

Xi (i = 1, k) – используемые индикаторы;

ai – весовые коэффициенты, отражающие относительную важность индикаторов, их «вклад» в значение индекса.

Можно легко показать, как из общей формулы (2.4) полу-

чаются частные случаи индексов. Так, если все весовые ко-

эффициенты a = 1 (i = 1, k), индекс представляет собой ариф-

i

метическую сумму индикаторов; если ai = 1 / k (i = 1, k), то индекс – среднее арифметическое индикаторов.

Индекс может конструироваться как до начала исследования (на этапе программирования), так и непосредственно в ходе анализа данных. В первом случае процесс конструирования индекса включает четыре этапа:

1)  перевод понятия в индикаторы посредством операциональных определений;

2)  перевод индикаторов в переменные (выбор шкалы и единицы измерения);

3)  перевод переменных в индекс (выбор техники конструирования, подбор весовых коэффициентов);

4)  проверка индекса на надежность и валидность. Наиболее распространенным примером такого конструиро-

вания являются психометрические шкалы.

Во втором случае индекс конструируется в процессе анализа структуры связей между переменными-индикаторами, например с помощью методов снижения размерности, однако это не освобождает аналитика от проверки полученного индекса (фактора, главной компоненты и т.п.) на надежность и валид-

14

ность. Кроме того, индекс, построенный с помощью формальных методов анализа данных, нуждается в содержательной интерпретации. Предварительным условием построения индексов выступает изучение структуры связей между перемен- ными-индикаторами.

Семантический дифференциал (СД) является, вероятно, наиболее «прозрачным» приложением идеи снижения размерности. Метод происходит из психосемантики, изучающей психологические аспекты восприятия человеком значений и смыслов разного рода объектов. Одна из основных задач психосемантики – построение так называемого семантического пространства, нахождение системы латентных факторов, в рамках которых «испытуемый» (респондент) оценивает окружающий мир – разного рода «объекты», включая субъектов, а также явления, понятия и др., которые в дальнейшем для простоты изложения будем называть объектами. Метод предложен группой американских психологов во главе с Ч. Осгудом в 1957 г. для решения таких задач, как выявление факторов, которые определяют смысловую значимость объектов для респондента, и определение различий в восприятии респондентом разных объектов (отсюда название метода). Таким образом, первоначально СД был сфокусирован на личности респондента, а пространство, образованное выделенными факторами, рассматривалось как индивидуальное семантическое пространство, в которое респондент «помещает» объект в процессе его оценивания. Однако в настоящее время применение данного метода значительно расширилось. Он используется в социологии, политологии, маркетинге и смежных дисциплинах для изучения смыслов, которые респонденты придают самым разнообразным «объектам» – политическим партиям и их лидерам, торговым маркам, рекламным материалам и др.

Первоначально СД разрабатывался как проективная методика, в основе которой лежит явление синестезии – мышления по ассоциации, возникновения одних чувственных восприятий под воздействием других. Это явление отражается в любом языке, когда говорят, например, о горячем сердце, твердом характере и т.д. В частности, плохое ассоциируется с холодным, темным, низким; хорошее – с теплым, светлым, высоким и т.п.

15

Смыслы, которые респонденты приписывают объектам, не могут быть измерены непосредственно и поэтому рассматриваются как латентные факторы. Для их измерения в качестве исходных переменных (индикаторов) в СД используются пары прилага- тельных-антонимов, каждая из которых соответствует некоторому коннотативному континууму: «горячий – холодный», «хороший – плохой», «грязный – чистый» и т.д. Измерения производятся по 7-балльной шкале, например паре «светлый – темный» соответствуют градации: очень светлый (1); светлый (2); не очень светлый (3); ни светлый, ни темный (4); не очень темный (5); темный (6); очень темный (7). Надежность измерений обеспечивается, как это принято в психометрических тестах, применением нескольких шкал оценки каждого фактора. Во избежание «автоматического» заполнения опросного листа респондентами шкалы, относящиеся к разным факторам, «перемешивают» и каждую вторую шкалу «переворачивают» (табл.  2.6).

Таблица  2.6

Фрагмент опросного листа семантического дифференциала (шкала «плохой – хороший» перевернута)

Светлый

1

2

3

4

5

6

7

Темный

 

 

 

 

 

 

 

 

 

Плохой

1

2

3

4

5

6

7

Хороший

 

 

 

 

 

 

 

 

 

Чистый

1

2

3

4

5

6

7

Грязный

 

 

 

 

 

 

 

 

 

Респондентам предъявляется один и тот же список объектов, каждый из которых оценивается по всему набору шкал. Таким образом, для каждого респондента получается индивидуальная матрица данных «объект – переменная», в которой содержатся его оценки всех тестируемых объектов по всем шкалам.

Используя факторный анализ для подтверждения валидности своей методики, Ч. Осгуд показал, что основу семантического пространства многих людей (свой метод, подобно многим психологам, он испытывал на студентах Чикагского университета) составляют три основных фактора, которые он назвал оценкой (шкалы «ценный – ничтожный», «чистый – грязный», «приятный – неприятный»), силой (шкалы «большой – маленький»,

16

«сильный – слабый», «глубокий – мелкий») и активностью (шкалы «быстрый – медленный», «активный – пассивный», «горячий – холодный»). Для каждого респондента и каждого оцениваемого им объекта вычисляется значение каждого фактора как среднее арифметическое входящих в него шкал (после восстановления шкал, которые предварительно были перевернуты). Таким образом, оцениваемые объекты (понятия) располагаются в индивидуальном семантическом пространстве, что и позволяет определять смыслы, приписываемые им данным респондентом.

В индивидуальном пространстве можно также изучать взаимное расположение объектов и степень близости их оценок друг к другу. Пространство, построенное Осгудом, является ортогональным, поэтому в качестве меры близости между объектами используется расстояние Евклида.

Пример  2.3. Семантический дифференциал.

В табл.  2.7 отражены оценки 12 понятий по 9 исходным шкалам-индикаторам, поставленные респондентом (студентом БГУ), и значения для тех же понятий трех интегрированных переменных, представляющих оси персонального семантического пространства. Каждая из интегрированных переменных («оценка», «сила», «активность») получена в результате усреднения значений трех индикаторов, соответствующих каждой из них.

Таблица  2.7

Индивидуальная матрица данных семантического дифференциала (после восстановления «перевернутых» шкал)

Объект

Неприятный / приятный

Маленький / большой

Пассивный / активный

Грязный / чистый

Слабый / сильный

Медленный / быстрый

Ничтожный / ценный

Мелкий / глубокий

Холодный / горячий

Оценка

Сила

Активность

 

 

 

 

 

 

 

 

 

 

 

 

 

 

Любовь

7

6

6

6

6

4

7

5

6

6,67

5,67

5,33

 

 

 

 

 

 

 

 

 

 

 

 

 

Я какой есть

6

5

4

6

5

3

5

5

4

5,67

5,00

3,67

 

 

 

 

 

 

 

 

 

 

 

 

 

Интеллект

6

7

5

5

7

4

6

6

4

5,67

6,67

4,33

Здравый

5

5

3

5

5

4

5

4

2

5,00

4,67

3,00

смысл

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

17

Окончание табл.  2.7

Объект

Неприятный/ приятный

Маленький/ большой

Пассивный/ активный

Грязный/ чистый

Слабый/ сильный

Медленный/ быстрый

Ничтожный/ ценный

Мелкий/ глубокий

Холодный/ горячий

Оценка

Сила

Активность

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

Самокон-

4

4

2

5

5

3

5

6

1

4,67

5,00

2,00

троль

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

Моя мама

6

6

3

6

6

2

6

4

2

6,00

5,33

2,33

 

 

 

 

 

 

 

 

 

 

 

 

 

Я идеальный

6

6

4

6

6

5

6

4

4

6,00

5,33

4,33

 

 

 

 

 

 

 

 

 

 

 

 

 

Любимый

7

6

5

6

7

5

7

5

4

6,67

6,00

4,67

человек

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

Секс

5

4

4

5

4

4

6

3

5

5,33

3,67

4,33

 

 

 

 

 

 

 

 

 

 

 

 

 

Ребенок

6

1

7

5

2

6

6

2

5

5,67

1,67

6,00

Обман

1

4

4

2

5

5

2

3

4

1,67

4,00

4,33

 

 

 

 

 

 

 

 

 

 

 

 

 

Ненависть

2

5

4

3

6

5

2

4

3

2,33

5,00

4,00

 

 

 

 

 

 

 

 

 

 

 

 

 

Трехмерное семантическое пространство респондента трудно изобразить графически, поэтому мы представим результаты на двух двумерных графиках: «оценка» × «сила» и «оценка» × «активность» (рис.  2.4 и  2.5).

Рис.  2.4. Двенадцать понятий в семантическом пространстве респондента, образованном переменными «оценка» и «сила»

18

Рис.  2.5. Двенадцать понятий в семантическом пространстве респондента, образованном переменными «оценка» и «активность»

Использование семантического дифференциала в массовых опросах. При переходе от психосемантического к социологическому использованию СД возникает методологическая проблема, связанная с организацией данных, которые имеют три измерения – респондент, объект, переменная. Например, если опрошены 500 человек, каждый из которых оценил 10 объектов по 20 шкалам, то общая размерность массива данных составляет 500 × 10 × 20 = 100 000 чисел. На каждого респондента в таком массиве, в отличие от «традиционной» матрицы данных, приходится 10 записей (по числу оцененных объектов), в каждой из которых содержатся значения 20 переменных.

Задачи социологического исследования методом СД обычно связаны не с индивидуальными особенностями восприятия, а с изучением «образа» оцениваемых объектов в глазах группы респондентов. Для их решения значения факторов, полученные для каждого объекта от разных респондентов, усредняются.

В пространстве семантического дифференциала можно также «разместить» респондентов в соответствии с оценками, выставленными ими одному из объектов. В этом случае респондентов

19

можно классифицировать по отношению к соответствующему объекту, например электорат одного из кандидатов или лояльные потребители торговой марки.

При использовании СД в непсихологических целях методики не всегда бывают проективными. Другими словами, могут измеряться не скрытые смыслы, а конкретные характеристики оцениваемых объектов. Неизменными остаются методические приемы – 7-балльные (иногда 9-балльные) биполярные шкалыиндикаторы, вычисление интегрированных индексов как среднего арифметического входящих в них шкал, проверка их валидности методами факторного анализа.

Проверка валидности новых методик на базе СД заключается в том, что шкалы, относящиеся к одному индексу, проверяются на взаимную коррелированность. Для анализа структуры измеряемых шкал обычно используются методы снижения размерности (факторный анализ, метод главных компонент).

2.3.  Метод главных компонент

Модели метода главных компонент. Метод главных компонент (МГК) – исторически первый подход к снижению размерности пространства переменных. Метод был разработан английским статистиком К. Пирсоном в 1901 г. для проверки валидности психометрических шкал. Основная идея метода базируется на геометрической интерпретации пространства переменных и состоит в том, чтобы выделить в многомерном пространстве группы тесно коррелирующих между собой переменных и заменить их интегральными индексами (главными компонентами), которые сохранили бы большую часть исходной информации. Другими словами, МГК позволяет заменить набор из k исходных переменных x1, x2 xk набором из l новых переменных (главных компонент) y1, y2 yl, причем l << k, и сохранить при этом большую часть исходной информации.

Сегодня в большинстве случаев МГК используется на первом этапе факторного анализа, несмотря на то, что модель главных компонент существенно отличается от модели факторного анализа. МГК является скорее геометрическим, нежели статистическим, и реализует процесс снижения размерности через

20

Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]