Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Проблемы оптимизации выборочных данных с неполнотой в диапазоне. Монография

.pdf
Скачиваний:
0
Добавлен:
07.09.2026
Размер:
1 Мб
Скачать
I. Неполный диапазон данных в эмпирических социологических исследованиях...
1) относительная доля выборки, от единиц которой не были
получены данные;
2) то, насколько структура (свойства) по соответствующим характеристикам ответивших респондентов отличается от струк­туры неответивших.
При этом не имеет значения, отсутствуют ли данные по­тому, что респондент отказался участвовать в опросе, или по­тому, что по разным причинам не дал ответа на отдельные во­просы.
Поэтому неполученные ответы в основном имеют два нега­тивных последствия для качества оценок выборочного иссле­дования.
Во-первых, можно уменьшить количество случаев, из кото­рых получаются данные. В результате оценки будут менее точны­ми с ростом случайной ошибки оценки. Во многих исследованиях, например, объем выборки был зафиксирован, а потери нарушали предназначение выборки.
Во-вторых, что более важно, возникает значительная си­стемная ошибка. Вывод относится к тем случаям, когда неотве­тившие респонденты отличаются по соответствующим харак­теристикам от ответивших. Как правило, именно этот случай наблюдается на практике. В конце концов выборка перестает быть репрезентативной, хотя она была таковой запланирована. Ошибки потери данных не могут быть исправлены путем добав­ления дополнительных единиц в выборку (так называемых до­полнений).
Подчеркнем, что сокращение объема выборки как следствие наличия неответивших респондентов напрямую влияет на рас­пределение выборочных оценок. Уровень целостной потери дан­ных (неответивших лиц) выше, чем в ситуации, когда не отвечают только на отдельные вопросы. При уменьшении размеров выбор­ки эффекты обоих типов потери данных объединяются.
31
Глава первая. Проблемы при неполном диапазоне данных в эмпирических исследованиях...
В табл. 11 показана аналогичная ситуация1. Известно, что степень, в которой могут быть получены некорректные результа­ты, зависит от:
1) различий, если таковые существуют, между характеристи­ками распределений исследуемых и неисследованных частей вы­борки;
2) полноты – относительной доли единиц выборки, которые мы смогли исследовать.
2
Таблица 11
Влияние потери данных на объем выборки и стандартные ошибки оценок
Планируемая
выборка
n
1000 1,0 1,0 1000 0,0158
1000 0,9 0,9 810 0,0176
1000 0,9 0,8 720 0,0186
1000 0,8 0,9 720 0,0186
1000 0,8 0,8 640 0,0198
1000 0,7 0,9 630 0,0199
1000 0,7 0,8 560 0,0211
1000 0,6 0,9 540 0,0215
1000 0,6 0,8 480 0,0228
Степень полного
ответа
Степень
частичного
ответа
Фактическая
выборка
n
для P = 50 %
С. О.
оценки
2
1
Если была определена 1000 респондентов и ответов не было получено, стан­дартная ошибка со средним значением 50 % будет 0,0158. Если общий уровень потери данных составляет 70 %, а частичная потеря – 90 %, у нас будет только 630 полностью полученных ответов по отдельной переменной, со стандартной ошибкой 0,0199, т. е. ее рост на 26 %. Если частичная потеря информации упадет до 80 %, стандартная ошибка для той же переменной будет выше – 0,0211, она фактически возрастет на 33,6 % от неответов. Таким образом, оба типа потери информации способствуют более высокой стандартной ошибке, которая заклю­чается в снижении точности оценок, полученных в результате исследования.
2
С. О. – стандартная ошибка оценки (Standard Error of an Estimate).
32
I. Неполный диапазон данных в эмпирических социологических исследованиях...
Последнее может быть установлено путем проведения соот­ветствующей методической регистрации в процессе исследова­ния. Влияние первого фактора лучше всего оценивать с помощью исследований, проводимых специально для этой цели.
Опыт показывает, что слишком часто неполученные данные отличаются от полученных достаточно отчетливо. Их генерали­зация, даже не принимая во внимание этот факт, неизбежно при­водит к серьезным последствиям, которые мы изложили выше.
Многие исследования показывают, что характеристики вы­бранных респондентов меняются в зависимости от количества посещений. В примере Штефана, Маккарти, Киша (табл. 12) при­чины этих изменений заключаются в том, что женщины, имею­щие детей до 2 лет, как правило, находятся дома, когда их посеща­ет интервьюер, в отличие, например, от других категорий членов домохозяйств.
Таблица 12
Особенности респондентов по количеству посещений
Первое посещение
Величина выборки 2072 726 467 0 3265
Относительная доля всех интервьюеров
Относительная доля домо­хозяйств с детьми до 2 лет
63,5 22,2 14,3 100,0
17,2 9,5 6,2 13,9
Второе посещение
щее посещение
Третье или следую-
Неответившие
вание домохозяйств
Общее интервьюиро-
Мерцер и Батлер, изучая характеристики отказавшихся от­вечать в общем опросе домохозяйств в Риверсайде, Калифорния,
33
Глава первая. Проблемы при неполном диапазоне данных в эмпирических исследованиях...
пришли к выводу, что доля отказов составляет около 2 % для до­мохозяйств, где соответствующие респонденты были в возрасте 18–20 лет, и увеличилась до 16 % для респондентов в возрасте 60–70 лет. По представленным данным видно, что в конкретных условиях пожилые люди, как правило, менее склонны давать ин­формацию для проводимых исследований1.
Есть все основания полагать, что различия между ответив- шими и отказниками всегда существуют. Предсказывать умо­зрительным путем мысли отказников непросто и почти всегда рискованно, даже при наличии богатого практического опыта.
Различие между исследованными и неисследованными еди­ницами обусловливает необходимость рассматривать исследуе­мую совокупность как состоящую из двух основных групп: иссле- дуемых единиц и неисследованных единиц.
Выборка дает информацию о RY
знака для группы изучаемых единиц и для
– среднем значении при-
N
R
– относительной
N
доли группы изучаемых единиц, но не дает никакой информации
о
Y – среднем значении соответствующего признака для груп-
NR
пы неисследованных единиц и для доли группы неисследованных
N
NR
единиц
. Поскольку выборочная оценка среднего
N
NN
RNR
YY Y
 (1)
RNR
NN
,
то отклонение между
1
Эту корреляцию следует изучить для конкретных условий. Можно выдвинуть гипотезу о том, что у нас наоборот – пожилые люди чаще дают информацию, потому что они дома (и легкодоступны), кроме того, пожилые люди имеют вы­сокую степень алиенации (в изоляции) и нуждаются в социальных контактах и расширении информационных каналов. Другой вопрос, когда и в какой степе­ни это обеспечивает достоверность ответов.
Y как оценка Y равно
R
34
I. Неполный диапазон данных в эмпирических социологических исследованиях...
N
R
bias1
YYY
() ( ).
R
 (2)
N
RNR
Системная ошибка может быть равна нулю в случаях:
1) если
2) если
YY
RNR
N
NR
0.
;
N
Когда
0
Y или 1 и, следовательно,
NR
YPR
R
,
YP и
NR
NR
PNR лежат на отрезке (0, 1), можно вычислить приемлемые дове-
рительные границы для pR.
При гауссовом распределении 67 %-ные доверительные гра­ницы задаются формулами:
NN
(),
Pp
Pp
RNR
  (3)
LR
NnRN
NN
RNR
(),
  (4)
UR
NnRN
pRqR
pRqR
где предполагается, что для всех, для кого отсутствуют данные,
0
Y или 1
i
Выборка с большим объемом уменьшает член
Y одновременно.
i
pRqR
в (4).
nR
N
R
Члены, включающие
, остаются постоянными, и поэтому
N
не рекомендуется значительное снижение доверительных преде-
N
лов, если
R
не уменьшается.
N
1
Bias – нестохастическая (систематическая) ошибка (англ.). В формуле для удоб­ства сохранен английский термин.
35
Глава первая. Проблемы при неполном диапазоне данных в эмпирических исследованиях...
Для генеральной совокупности в большинстве случаев прак­тически невозможно или полностью невозможно уменьшить долю неисследованных единиц NNR до нуля.
Единственное исключение из этого – если доля неисследо­ванных единиц в выборке nNR станет равной нулю. И стратегия должна заключаться не в достижении нуля, а в том, чтобы свести долю неисследованных единиц к некоторому минимуму. Это во многих случаях может быть достигнуто относительно легко, ино­гда с небольшими дополнительными затратами.
Традиционный подход заключается в том, чтобы уменьшить количество неохваченных единиц путем повторного обхода тер­ритории, используя хорошо работающие инструкции и вспомога­тельные средства, такие как карты и фотографии. Для почтовых и телефонных исследований – с помощью обновленных списков адресов и телефонных номеров. И в любом случае – за счет при­влечения хорошо подготовленных специалистов и разработки удобных схем организации полевых работ, позволяющих избе­жать ошибок и нежелательно большой доли неответивших.
Число респондентов, которые «отсутствуют дома», уменьша­ется за счет повторных посещений, а количество «отказавшихся отвечать» – с помощью привлекательных вопросов, искусно про­веденных интервью, разумно составленных (структурированных) анкет. С точки зрения затрат стоит вопрос об их оптимизации. В принципе, повторные визиты могут быть достаточно экономич­ными, если правильно определить вероятность того, когда ре­спондент окажется дома, и соответственно планировать время и день интервью. Можно сделать вывод, что гораздо лучшей стра­тегией исследователя будет направить усилия на сокращение доли в неполном диапазоне данных (отсутствующих и неответивших), чем потом искать компенсирующие процедуры и искусственные решения.
36
II. Статистические аспекты пробелов в диапазоне данных
II. Статистические аспекты пробелов
в диапазоне данных
Когда дело доходит до проблем, возникающих из-за неполно­ты в диапазоне (или ошибок в ответах), очевидно, следует уточ­нить тип и силу возникающих «шумов» в полученной инфор­мации. Для того чтобы подобрать наиболее подходящий метод оптимизации качества информации, необходимо обязательно об­ратить внимание на характер и тип допущенных ошибок, а также на их влияние на достоверность результатов.
1. Случайные и системные ошибки
Известно, что эмпирические исследования подразделяются на случайные (выборочные)1 и сплошные, и на этой основе дела­ется первое деление допускаемых в совокупности ошибок – слу- чайные и системные (рис. 1).
ʦ

 
ˁ
;Ϳ

ʻ


ˁ
ˁ

ʧ
ʰ

Рис. 1. Виды ошибок по совокупной информации эмпирических исследований
1
Выборочные исследования являются случайными, когда выборка сформирова­на случайным образом, и системными, когда она не формируется путем слу­чайного отбора.
˃

37
Глава первая. Проблемы при неполном диапазоне данных в эмпирических исследованиях...
Случайная ошибка обусловлена случайными факторами, действовавшими в процессе выборочного изучения, и зависит в основном от объема выборки – количества наблюдаемых случаев. Известно, что она связана с механизмом формирования репре­зентативных выборок и с переходом (экстраполяцией) оценок на выборке к оценке генеральной совокупности. Как правило, ошиб­ки оценки тем меньше, чем больше единиц подвергается наблюде­нию в выборке (исследовании).
Системная ошибка возникает из-за пробелов и недостатков в изучаемой совокупности и обработке эмпирической информа­ции, и это приводит к «...отклонению от истины, искажению дей­ствительности...» [7]. Системные ошибки возникают независимо от случайных как при выборочных, так и при комплексных исследова­ниях. Причины их появления явно не сформулированы, как, напри­мер, общий закон случайных ошибок выборочного исследования, поэтому они описываются и определяются, но не могут быть сде­ланы предварительные оценки их ожидаемых размеров. Источники системной ошибки следует искать на каждом этапе и в каждом эле­менте технологии проведения эмпирических исследований, в том числе при выборе эмпирических индикаторов, т. е. при переходе от теоретического понятия к объекту, через его понятийные показа­тели к эмпирическому показателю, что дает возможность замерить эмпирический уровень социологического познания.
В последнее время выдвигается идея ошибок, порожденных непониманием фактического содержания и смысла полученных оценок или целенаправленными манипуляциями с данными эм­пирических исследований. Однако мы не будем заниматься этим, поскольку это выходит за пределы очерченных рамок нашего ис­следования.
По общей и довольно условной классификации системные ошибки бывают несистематическими, систематическими и гру- быми.
38
II. Статистические аспекты пробеловв диапазоне данных
В эмпирических исследованиях несистематические ошибки допускаются как в одном, так и в другом направлении по отно­шению к разновидностям или значениям исследуемого признака. Ожидается, что они компенсируют друг друга и при этом не бу­дут влиять на некоторые обобщенные оценки (например, среднее арифметическое). Предполагается, что в эмпирических исследо­ваниях несистематическая системная ошибка в конечном итоге будет давать эффекты, близкие к ожидаемым случайным ошиб­кам, если объем выборки будет достаточно большим.
Систематические системные ошибки допускаются много- кратно, но ориентированы они в основном в одном направле­нии по отношению к разновидностям или значениям исследу­емого признака. Их основным эффектом является нарушение достоверности информация по совокупности, и именно они порождают системное отклонение оценок – неадекватно отра­жаются свойства исследуемого объекта. Эти ошибки вызывают различные отклонения в оценках обобщенных свойств исследу­емого объекта от действительных значений и делают ненадеж­ными (отклоненными) различные обобщенные статистические показатели.
Стратегии по отношению к двум компонентам1 системной ошибки, соответственно, различны. В первом случае решение состоит в том, чтобы обеспечить достаточно большой объем вы­борки и воспользоваться законом больших чисел, при котором суммарный эффект от ошибок будет достаточно близок к нулю. Стратегии по отношению к систематическому компоненту си­стемной ошибки по характеру значительно различаются. Реко­мендуется реализовывать их путем планирования защитных и контрольных действий, направленных на обеспечение желаемой степени достоверности эмпирической информации. Усилия на-
1
Несистематический и систематический компоненты.
39
Глава первая. Проблемы при неполном диапазоне данных в эмпирических исследованиях...
правлены прежде всего на предотвращение системной (система­тической) составляющей ошибки.
Грубые ошибки – это те, которые резко отличаются от раз­новидностей или значений исследуемого признака1. В результате снова наблюдается смещение усредненного значения Y в одну или другую сторону, причем ни направление, ни величина этого смещения не могут быть установлены чисто умозрительным пу­тем. Например, при сравнительном анализе изменения среднего заработка работников какой-либо фирмы такая грубая ошибка может возникнуть, если будут показаны зарплаты членов совета директоров, которые обычно в несколько раз превышают зара­ботную плату персонала.
В литературе [16] указываются различные критерии, по кото­рым оценивается, насколько резко отличаются некоторые значе­ния исследуемого признака от остальных значений.
Системные ошибки, в частности систематические и грубые, подразделяются на инструментальные и теоретические.
Системные инструментальные ошибки могут быть обу­словлены как неадекватностью самого инструмента, так и его использованием. Неудачно сформулированный или неудачно за­данный интервьюером вопрос (в анкете) приведет к его непра­вильному и различному восприятию респондентами, а также к их необоснованным и искаженным ответам.
Системные теоретические ошибки (системные ошибки те­оретического характера) связаны с несовершенством концепту­альной модели (теории) – при построении измерительного ин­струментария с неадекватными методиками и пр. Эти ошибки допускаются при подготовке инструментария эмпирических ис-
1
Грубые ошибки очень легко обнаруживаются при рассмотрении одномерных распределений по данному признаку и в отдельных случаях могут быть немед­ленно исправлены. Пример выборки взрослого населения (18+ лет), значение признака «возраст» = 8 (8 лет) нелогично – допущена грубая ошибка.
40
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]