Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Методы проведения социологических исследований. Учебное пособие для студентов специальности 030101.65 Социология

.pdf
Скачиваний:
0
Добавлен:
07.09.2026
Размер:
2 Мб
Скачать
☆
31
Допустим, мы измеряем каждое утро свой вес, и наши весы немного неисправны. Ясно, что наш измеряемый вес будет равен сумме реального веса и той ошибки, которую добавляют весы.
Можно назвать два основных источника ошибок измерения.
Первый. Влияние свойств самих объектов. Например, на ответы людей может влиять степень их образованности, национально-культурные различия, возрастные различия. Предположим, что мы проводим опрос относительно употребления безалкогольных напитков, и люди по-разному понимают смысл слова «безалкогольный»: некоторые считают пиво безалкогольным напитком, а другие так не считают.
Измерительные инструменты могут быть различными: устные интервью, анкеты, которые должен заполнить опрашиваемый. Но интервью требует умения свободно и точно выражать свою мысль, анкета – умение читать и писать. Уровень данных способностей, а он у разных респондентов неодинаков, влияет на их ответы.
Сюда же можно отнести влияние временного фактора. Так, ответы на вопросы анкеты могут определяться настроением или состоянием здоровья отвечающего или впечатлением от только что прошедших событий в политической жизни города. Например, после только что проведенного теракта может резко увеличиться число респондентов, положительно относящихся к введению смертной казни.
Перечисленные ошибки можно разделить на систематические и случайные. Случайными являются ошибки, связанные с временным фактором, который может быть, а может не быть. Остальные ошибки − систематические.
Второй источник ошибок – это влияние условий проведения исследования. Например, на характер ответов могут влиять пол и возраст интервьюера, манера одеваться, например длина юбки интервьюерши. Поэтому анкетеру или проводящему интервью нужно выглядеть максимально нейтрально и не отвлекающе. Сама ситуация интервью может повлиять на ответы, опрашиваемый может стараться отвечать так, как от него ждут, или будет стремиться выглядеть в своих ответах более умным.
На измерение могут оказать влияние ошибки при сборе и записи информации. Интервьюер может неверно понять инструкции и задавать вопросы не так, как предполагал исследователь. Недобросовестный анкетер, чтобы не ходить по квартирам или цехам завода, может сам заполнить анкеты так, как ему представляется правильным. Причиной записи неправильных ответов на вопросы анкеты может быть плохое освещение или усталость анкетера. При проведении интервью может сесть батарейка в диктофоне. Важная информация может быть потеряна при обработке данных.
Все ошибки, связанные с условиями проведения исследования, являются случайными. Их можно устранить или свести к минимуму.
32
Выразим схематически процесс перехода от исходных понятий теории к измерению количественных свойств объектов (рис. 4.2).
Рис. 4.2. Переход от исходных понятий теории
к измерению количественных свойств объектов
33
ТЕМА 5. ВАЛИДНОСТЬ И НАДЕЖНОСТЬ ИЗМЕРЕНИЯ
1. Понятие валидности.
2. Способы валидизации.
3. Надежность измерения.
1. Понятие валидности
Возникает вопрос, как определить, действительно ли выбранный способ операционализации соответствует свойствам интересующего нас понятия. Чаще наши показатели лишь окольным путем измеряют эти свойства. Поэтому не исключено, что они отразят не совсем то, что нас интересует. Для определения степени соответствия выбранного показателя тому, что измеряется, используется понятие валидность. В литературе можно встретить вместо валидности термин «обоснованность».
Валидность, или обоснованность, – это степень соответствия измеряемого показателя тому понятию, которое он призван выразить.
Проблема состоит в том, что невалидность измерений может обнаружиться после того, как исследование проведено и данные собраны. И тогда все результаты исследования теряют свою ценность.
Поэтому необходимо заранее убедиться, что показатели валидны и что мы действительно замеряем то, что необходимо замерить. Обычно показатели проверяются и уточняются в ходе так называемого пилотажного, или пробного, исследования.
Пилотажное исследование – исследование небольшого масштаба для выявления слабых мест в измерительном инструментарии.
2. Способы валидизации
Процесс проверки валидности измерений называется валидизацией. Имеется четыре способа валидизации: прагматический, конструктный, дискриминантный и очевидный.
Прагматическая валидизация состоит в проверке, насколько свойства показателя интересующего нас понятия позволяют предсказывать поведение показателя независимого понятия, не входящего в теорию данного исследования (рис. 5.1).
34
Рис. 5.1. Схема прагматической валидизации
Допустим, мы выдвинули гипотезу, что у более образованных людей, как правило, и более дорогая машина. Мы имеем два абстрактных понятия: образование, А, и стоимость автомашины, B. Гипотеза звучит так: чем выше А, тем выше В.
Теперь нам нужно операционализировать понятия А и В. Отметим, кстати, что не так просто операционализировать понятие «стоимость автомашины». Можно, конечно, узнать в соответствующих инстанциях, за сколько вот этот респондент купил свою автомашину, или спросить у него самого. Но эти данные необязательно точны. Они могут быть занижены из-за разных соображений, например чтобы уменьшить налог на покупку.
Далее, обследование должно быть массовым и анонимным, поэтому очень сложно узнать стоимость машины у тысячи респондентов.
Причем нужно иметь в виду не ту цену, за которую купили автомашину, а сколько она сейчас реально бы стоила, если бы ее решили продавать, значит, учесть степень ее изношенности, так сказать, бэушности. Ясно, что возникли бы свои проблемы с операционализацией понятия «стоимость автомашины».
Но нас в данном случае интересует понятие «образование». Мы знаем, что операционалировать это понятие можно разными способами. Можно построить шкалу типов учебных заведений: неполное среднее образование, среднее, среднее специальное, высшее, т. е. использовать показатель а1 из темы 3. Можно учитывать число лет, проведенных в учебных заведениях, т. е. использовать показатель а2. Можно проверить респондентов на коэффициент интеллекта через число задач, решенных в заданное время, это будет показатель а3.
Допустим, мы решили убедиться в валидности показателя а2. Мы берем независимое понятие, которое тем не менее отражает степень образованности респондентов. В качестве такого показателя примем уровень сложности периодических изданий, на которые подписываются респонденты. Операционализируем это понятие через процент подписчиков на массовую газету «Коммерсантъ» – издание, дающее информацию о курсах акций различных компаний, прогнозы курсов валют и другие данные по экономике. Пусть это и будет показатель d. Очевидно, что среди таких подписчиков должно быть относительно больше тех, кто имеет дорогие
35
машины. И очевидно, что эти подписчиков должны быть более образованными людьми.
И если подтвердится, что более высокому (более низкому) показателю
а
в большинстве случаев соответствует и более высокий (более низкий)
2
показатель d, то есть а2 и d находятся в отношении ковариации, то мы делаем вывод, что показатель а2 валиден. То есть, например, должно подтвердиться, что среди тех, кто затратили больше лет на учебу, относительно больше подписчиков на газету «Коммерсантъ».
Тут можно выделить следующие правила. Первое. Надо найти независимое понятие, которое заведомо должно находиться в отношении ковариации с интересующим нас понятием.
Второе, нужно операционализировать независимое понятие так, чтобы полученный показатель был точно валиден, потому что бессмысленно проверять валидность одного показателя при помощи показателя, который сам нуждается в проверке на валидность.
Проблема заключается в том, что явно валидные показатели встречаются довольно редко. Например, на первый взгляд, можно считать вполне валидной статистику самоубийств при операционализации понятия удовлетворенности жизнью в данной стране. Вроде бы очевидно, что чем меньше самоубийств на 100 000 населения, тем более удовлетворены люди своей жизнью.
Но можно также считать явно валидным показатель средней продолжительности жизни. Потому что ясно, что у более удовлетворенных жизнью людей соответственно и большая в среднем продолжительность жизни.
Но, странным образом, оказывается, что в европейских странах показатели статистики самоубийств и средней продолжительности жизни находятся в отношении ковариации. Там, где в среднем дольше живут, там, как правило, и чаще самоубийства. Но тогда получается противоречие: одновременно люди данного общества удовлетворены жизнью и не удовлетворены жизнью.
А это значит, что по крайней мере один из двух показателей точно невалиден. Но как определить, который из них? Итак, трудно найти независимое понятие с точно валидным показателем.
Поэтому можно применить второй способ валидизации, а именно − конструктную валидизацию. Здесь проверяют, насколько свойства показателя интересующего нас понятия позволяют предсказывать свойства показателя понятия, тоже входящего в теорию исследования. Различают внешнюю и внутреннюю конструктную валидизацию.
При внешней валидизации проверяют, насколько свойства показателя интересующего нас понятия позволяют предсказывать свойства показателя
другого понятия, входящего в теорию исследования (рис. 5.2).
36
Рис. 5.2. Схема внешней конструктной валидизации
На схеме мы проверяем валидность показателя а2, соответствующего понятию А через его сравнение с точно валидным показателем с2, который соответствует понятию С. Причем оба понятия принадлежат одной теории. Пусть понятие А будет снова обозначать образование респондента. А понятие С – стоимость автомобиля респондента. Оба понятия, согласно нашей гипотезе, связаны суждением: чем выше А, тем больше С.
Примем в качестве точно валидного показателя с3 ответы на вопрос: «Сколько раз за последние десять лет вы меняли автомобиль?» Мы рассуждаем следующим образом: чем чаще респондент меняет автомобили, тем, как правило, более дорогим должен быть тот автомобиль, который он сейчас имеет. Потому что обратное маловероятно. Итак, мы принимаем в качестве валидного показатель «количество автомобилей, смененных за последние 10 лет».
Мы распределяем респондентов на группы, нижняя из которых соответствует всего одному купленному автомобилю за 10 лет, а верхняя соответствует смене 4 и больше автомобилей за 10 лет. И если обнаруживается, что при переходе к респондентам, которые больше лет затратили на учебу, растет частота смены автомобилей, то делаем вывод о валидности показателя
а
.
2
Тут снова все упирается в уверенность в валидности показателя с2, через сравнение с которым измеряли валидность а2. Если нет такой уверенности, то вся проверка на валидность показателя а2 теряет смысл. Обычно берут показатели, валидность которых была точно установлена в прежних успешных исследованиях.
При внутренней валидизации проверяют, насколько свойства интересующего нас показателя позволяют предсказывать свойства другого показателя того же самого понятия, входящего в теорию исследования (см.
5.3).
37
Рис. 5.3. Схема внутренней конструктной валидизации
Здесь мы проверяем валидность показателя а1 через сравнение с показателем а3, выражающим то же самое понятие А. Пусть показателем а3 будет количество задач, которые оказался способным решить респондент, например, за полчаса. Примем этот показатель валидным, т. е. более или менее точно отражающим понятие «образование». И действительно, можно закончить сколько угодно учебных заведений, но если везде учился на «тройки», то вся учеба для этого человека будет соответствовать поговорке, «что с гуся вода»: каким вошел в вуз, таким и вышел. Но если человек способен решать умные задачи, значит он не зря окончил учебное заведение.
Снова разобьем респондентов на группы, нижняя из которых будет та, в которой решался минимум задач за полчаса, и вплоть до верхней, в которой в отведенное время решались все задачи. И если четко обозначится связь между уровнем оконченного учебного заведения и количеством решенных задач, значит, показатель а1 тоже валиден.
При дискриминантной валидизации проверяют, насколько свойства показателя интересующего нас понятия не зависят от свойств показателя близкого, но отличного понятия, не входящего в теорию данного исследования. Показатель признается валидным, если нет отношения ковариации с показателем близкого, но независимого понятия (рис. 5.4).
Рис. 5.4. Схема дискриминантной валидизации
Поясним дискриминатную валидизацию на примере из другой области. Допустим, мы хотим измерить понятие «доверие к политическим деятелям». Будем так в лоб и спрашивать: «Доверяете ли вы российским политическим деятелям?», и предложим стандартный набор ответов: «Да», «Скорее да, чем нет», «Скорее нет, чем да», «Нет». На нашей схеме это будет показатель а2.
38
В качестве независимого, но близкого изберем понятие «доверие к
Варианты ответов
Вопрос 1
Вопрос 2
Да Скорее да, чем нет Скорее нет, чем да Нет
4% 48% 34% 14%
5% 46% 36% 13%
людям вообще» и предложим вопрос «Доверяете ли вы людям?» с точно таким же набором ответов. Это будет показатель d. И вот если выяснится, что распределение ответов на первый вопрос примерно такое же, что и распределение ответов на второй вопрос, значит, люди не почувствовали различия между формулировками обоих вопросов, и проверяемый показатель а2 невалиден.
Например, процентное соотношение ответов на первый вопрос и
второй оказалось почти совпадающим (табл. 5.1).
Это означает, что необходимо изменить формулировку вопроса, или варианты ответов, или то и другое. Например, вопрос можно переформулировать следующим образом: «Верите ли вы, что депутаты Государственной Думы при голосовании учитывают ваши интересы?». Можно оставить те же варианты ответов, и вот теперь респондент, скорее всего, почувствует разницу между вопросами.
Таблица 5.1.
Очевидная валидизация. Здесь обоснованность показателя признается
на основании его непосредственной, интуитивной достоверности, в которой можно точно не сомневаться.
Допустим, что нас интересует зависимость между субъективным ощущением жары и объемами продажи пива. Очевидно, что анкета с вопросом «Жаркий ли сегодня день?» и ответами «Да», «Нет», «Не знаю» с достаточной точностью измерит ощущение жары людьми, потому что нужно было измерить именно это ощущение. А затем сравним процент людей, ответивших «Да» в разные дни с количеством проданных в эти дни ящиков пива в нескольких магазинах, и тогда мы сможем говорить о наличии или отсутствии зависимости уровня продаж пива от уровня ощущения жары публикой.
Например, можно построить двойной график, показывающий зависимость продажи пива от ощущения жары людьми (рис. 5.5):
39
Рис. 5.5. График зависимости продажи пива от ощущения жары людьми
И на основании этих исследований мы теперь сможем продать за хорошие деньги совет пивным кампаниям позаботиться о частых поломках кондиционеров в офисах и супермаркетах в жаркие дни.
3. Надежность измерения
От валидности нужно отличать надежность измерения. Надежность измерения означает устойчивость во времени результатов измерения.
То есть надежность означает, что измерения свойств одного и того же объекта в разное время дают одни и те же значения. Если получаются различные значения, это означает, что измерение ненадежно.
Можно провести следующую аналогию: линейка ненадежна, если в разное время показывает, например, в зависимости от температуры воздуха, различные размеры одного и того же объекта, который на самом деле все время оставался тем же самым.
Между надежностью и валидностью имеется следующее отношение. Если измерение ненадежно, то оно и невалидно, потому что несовершенный инструмент не может показывать то, что есть на самом деле.
Измерение может быть надежным, но не валидным. Допустим, мы раз в месяц интересуемся у работников при помощи открытого голосования, как они оценивают работу своего начальника. И каждый раз все 100% опрашиваемых голосуют за оценку «отлично». Таким образом, получаются одни и те же результаты, и измерение вроде бы надежно. Но невалидно, потому что используемый способ измерения не позволяет определить, что люди реально думают о работе начальника.
В советском обществе, в 30-е годы, в конце партийного собрания скромный человек в президиуме вставал и говорил «Да здравствует товарищ
40
Сталин!», и все хлопали в ладоши 20 минут, пока тот же человек и не говорил, достаточно, товарищи коммунисты. Через эти 20 минут измерялась любовь к товарищу Сталину. Измерение получалось вполне надежным, потому что каждый раз повторялись эти же 20 минут. А тот, кто переставал хлопать в ладоши раньше, оказывался, как очень быстро устанавливали соответствующие органы, японским шпионом, который много лет ловко притворялся честным человеком.
Но если измерение валидно, то оно и надежно. А вот если надежно, то необязательно валидно. Это как в высказывании «Если идет дождь, то асфальт мокрый». Но необязательно будет истинно наоборот: «Если асфальт мокрый, то шел дождь». Потому что могла пройти поливальная машина.
В надежности измерения часто бывает очень сложно убедиться. Дело в том, что сами люди могут изменять свое мнение под влиянием опыта или обстоятельств. Трудно отделить воздействие ошибок измерения от действительных колебаний измеряемых объектов.
Имеются два способа установления надежности измерений. Первый – это метод неоднократного тестирования. В этом случае одно и то же измерение применяется несколько раз к одним и тем же объектам. Если получаются одни и те же данные, измерение надежно. Однако сложность состоит в том, что люди могут помнить свои прежние ответы и будут стараться их повторять, независимо от того, что они на самом деле в данный момент думают. Эта зависимость от прежних ответов называется тест-эффект. Чтобы избежать тест-эффекта, необходимо приступать к повторному опросу лишь после значительного промежутка времени. Однако тогда мнения людей могут измениться из-за изменений реальности, и мы не сможем отличить изменения из-за ненадежности измерения от изменений того, что измеряется.
Поэтому практикуется второй способ, который можно подразделить на два приема. Первый прием состоит в том, что в одно и то время к одной и той же группе людей применяются разные, но сходные способы измерения. Это делается так: в разных местах анкеты ставятся близкие по смыслу, но отличающиеся по форме вопросы, и если ответы на эти вопросы однотипны, то измерение надежно.
Второй прием: одно и то же измерение применяется к разным подгруппам людей одной группы. И если ответы подгрупп на один и тот же вопрос однотипны, то измерение надежно (способы подбора однотипных групп мы рассмотрим в теме 10).
Таким образом, исключается тест-эффект. Однако все зависит от того, насколько близки по смыслу различные вопросы и действительно ли подгруппы достаточно однотипны. Чтобы добиться такой однотипности, необходимо подбирать подгруппы из достаточно большой исходной совокупности респондентов, а это не всегда возможно.
При использовании первого приема тоже могут возникнуть проблемы. В одном исследовании психологического климата на заводе в анкете
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]