Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Проблемы оптимизации выборочных данных с неполнотой в диапазоне. Монография
.pdf
I. Оптимизация выборки при неполном диапазоне данных
Данные по основной выборке по сравнению с резервами
Таблица 43
(%)
Основная выборка (n2) 46 54 6 18 21 20 17 18
Замещение (q) 46 54 7 23 23 20 13 14
(%)
Основная выборка (n2) 13 32 22 33
Замещение (q) 17 35 22 26
Пол Возраст
М Ж 15–20 21–30 31–40 41–50 51–60 60+
Населенный пункт
Столица
Большой
город
Маленький
город
Село
полнения оказались эффективными. Результаты показывают, что
также существуют различия (расхождения) между характеристиками выборки и соответствующими параметрами генеральной
совокупности. Исходя из этой задачи, к проверке был применен
интегральный коэффициент. Он, как известно, дает возможность
делать сравнения не парами, а с учетом общей неравномерности
структур (распределений) и с учетом степени смещения.
Для этого анализа необходимо измерить разницу между двумя одномерными структурами, чтобы выявить их сравнительную
неравномерность (если таковая имеется). В нашем случае речь
идет об исследовании неравномерности в трех аспектах (направлениях):
1) между основной реализованной выборкой (n1 + n2), с од-
ной стороны, и генеральной совокупностью (N), с другой;
2) между планируемым дополнением (резервы – n2) и гене-
ральной совокупностью;
3) между избыточным расширением (q) (замена квоты) и ге-
неральной совокупностью.
181

Глава третья. Сравнительные преимущества и ограничения различных методов оптимизации...
Оценки делаются по формуле
()
vv
и vj – относительные доли соответственно в обеих структу-
где v
i
K
PR
22
vv
ij
2
ij
(60)
,
рах (например, основная реализованная выборка со структурой–
параметр генеральной совокупности). Теоретически интегральный коэффициент находится в пределах от 0 до 1. Чем он ближе к
0, тем различие между двумя совокупностями незначительнее, и
наоборот – когда коэффициент равен 1, существует полное расхождение (несоответствие) между двумя структурами.
Результаты показали, что наиболее существенное различие
(табл. 44) имеется при планируемом расширении (резервах) по
признаку «возраст» – 0,5093.
Таблица 44
Интегральный коэффициент сравнительной неравномерности
Выборка Пол Возраст Населенный пункт
Основная выборка + резервы 0,0280 0,1328 0,0244
Основная выборка 0,0424 0,1216 0,0235
Резервы 0,0504 0,5093 0,2352
Замещение по квоте 0,0424 0,1496 0,1183
Резервы показывают отклонение от выборки и по признаку
«населенный пункт». В целом замена квоты не оказала существенного влияния на точность выборки, хотя по возрасту и местоположению коэффициенты также имеют значения, отличные от
нуля. Основная выборка дает отклонение по признаку «возраст»
(0,1216). Для всех остальных признаков интегральный коэффициент невысок.
182

I. Оптимизация выборки при неполном диапазоне данных
При группировке структур основная выборка + резервы интегральный коэффициент понижается в значении только по признаку «пол» и повышается при признаках «возраст» и «населенный пункт». Этот факт интригует, потому что:
во-первых, исследования показали, что запланированная выборка (т. е. основная выборка и резервы) не выполняется в строгом соответствии с условиями;
во-вторых, резервы, выделенные случайным образом (при
прочих равных условиях), демонстрируют отклонение, которое
выходит за рамки допустимого – в определенной степени наблюдается противоречие с предписаниями методики отбора;
в-третьих, то обстоятельство, что выборка имеет относительно большой объем, ни в коем случае не гарантирует ее сохранение в качестве представительной1 после подобных методических
вмешательств.
Из проведенного анализа можно сделать вывод, что усилия
исследователей по компенсации объема выборки и соблюдению статистической процедуры во время полевых работ имеют
большое значение. И самая совершенная модель исследования
легко может быть опорочена несоблюдением требований к выбору поля. При решении этой проблемы исследователи часто
попадают в центр порочного круга. С одной стороны, использование списков адресов является рекомендацией для того,
чтобы выбор был действительно случайным и обеспечивал
репрезентативную выборку, что касается возможностей контроля над сетью интервьюеров. С другой – эти списки часто не
актуализированы, а потому – неточны. Последствий этого по
крайней мере два:
1) нарушение случайного характера отбора;
2) увеличение доли недостающих данных.
1
Одно из главных преимуществ больших по объему случайных выборок.
183

Глава третья. Сравнительные преимущества и ограничения различных методов оптимизации...
Наше видение состоит в том, что число и доля неохваченных
единиц могут быть уменьшены с помощью ряда профилактических, контрольных и других процедур, а также путем привлечения хорошо подготовленных специалистов и разработки удобных
рабочих схем, позволяющих уменьшить неблагополучие поля.
Количество неучаствующих респондентов по причине «их
нет дома» можно уменьшить путем повторных посещений, а количество «отказавшихся отвечать» минимизировать с помощью
различных процедур, которые мы обсуждали в предыдущих разделах. Хороший исследовательский подход заключается в том,
чтобы сосредоточить значительную часть усилий, финансовых
расходов, время и материалы для сокращения недостающих данных, вместо того чтобы использовать те же ресурсы на более
поздних этапах для работы с неполными данными.
Исследования по этой теме показывают, что методы оптимизации выборки с неполным диапазоном данных (после того как полевая работа завершена) слишком разнообразны. Каждый из них
имеет не только плюсы, но и минусы, а также различные по характеру ограничения, и выбрать наиболее подходящий из них– задача
не из легких. Результаты также показали, что даже хорошее и подробное знание различных подходов, методов и процедур не дает
никаких оснований использовать их рецептурно и только умозрительно. Напротив, выбор каждого из них может быть успешным
только тогда, когда через призм» изложенных в работе критериев
обязательно проводятся конкретные исследования для выявления
и оценки особых ситуаций и проверяется, насколько действительны для каждой из них предположения (гипотезы), закрепленные в
различных методологических подходах и решениях.
Мы также видели, что большой объем выборки не всегда является гарантией сохранения ее репрезентативного характера в
стадии сбора первичной социологической информации. Врассматриваемом выше исследовании различия между характеристиками
184

II. Сравнительный анализ использования методов взвешивания и атрибуции значений
выборки и параметрами генеральной совокупности оказались значительными – некоторые из них превышали ожидаемые случайные
колебания. Отклонения могли быть обусловлены несоблюдением
процедуры отбора со стороны анкетеров, а также «шумами», которые привносят дополнение по квотам1 к случайной выборке.
Поиск решения проблем, вызванных отсутствующими данными, всегда является хорошей исследовательской стратегией. Однако
если используются подходы, противоречащие механизму случайного отбора (не согласованные с ним), риск того, что результаты будут
обременены неконтролируемыми и непредсказуемыми по размеру
и направлению отклонениями (системными ошибками), составляет почти 100 %. Существует реальная опасность того, что подобные
«дополнения» могут исказить распределение выборки. В целом оно
может перестать быть «микромоделью» генеральной совокупности.
В любом случае выбор соответствующих подходов, методов и процедур обязательно должен предшествовать и обосновываться серьезными исследованиями – иначе легко попасть в ловушку.
II. Сравнительный анализ использования методов
взвешивания и атрибуции значений
Сравнительный анализ проводится по нескольким выбранным критериям:
1) выдвигаемые гипотезы о механизме потери данных, а также о формировании той совокупности, которая будет рассматриваться;
1
Необходимо подчеркнуть, что использование квотных выборок в практике
эмпирических исследований значительно возрастает. Эта выборочная модель
имеет как свои неоспоримые преимущества (недорогая, быстрая, нетрудоемкая и др.), так и ряд ограничений (системных). К квоте относят качества, которыми она не обладает. Результаты таких выборок представляются «репрезентативными», что недопустимо.
185

Глава третья. Сравнительные преимущества и ограничения различных методов оптимизации...
2) применяемые методы оптимизации и их модификации;
3) оценка результатов, т. е. эффективность внесенных корректировок.
Как мы уже отмечали, одним из часто применяемых в российской практике методов оптимизации выборки при неполном
диапазоне данных является взвешивание. Наши исследования
показали, что здесь нередко делают анализы только на основе
полученных данных. Часто используемой стратегией при анализе данных с неответившими являются исследовательские усилия
по ограничению полученных случаев (собранной информации) и
восприятие реализованной совокупности как случайной выборки
генеральной совокупности (несмотря на нарушения и объема, и
структуры). Однако это может привести к выводам, обремененным смещением, если ответы зависят от наблюдаемых (или ненаблюдаемых) переменных, связей и взаимодействий.
Метод атрибуции значений (Imputation) недостающих данных недостаточно известен и не применяется широко в нашей
практике эмпирических исследований. Это обстоятельство потребовало изучить сравнительную эффективность многомерной
атрибуции через призму и по данным опыта тех исследователей,
которыми она используется.
В сравнительном аспекте мы проанализируем последствия
применения трех групп подходов и методов:
1) наиболее часто применяемые подвиды атрибуции;
2) несколько модификаций классического метода взвешива-
ния данных;
3) исключение единиц, для которых отсутствуют данные, и
анализ только тех, для которых получена информация (далее для
краткости мы будем называть последний консервативным подхо-
дом). Некоторые ограничения в исследованиях в этой части работы
были вызваны трудностями доступа к конкретным эмпирическим
данным. Поэтому сравнительный анализ большей частью основан
186

II. Сравнительный анализ использования методов взвешивания и атрибуции значений
на обобщенных данных из литературных источников. Были использованы выводы и обобщения западных авторов, сделана попытка систематизации и критической оценки достигнутого.
1. Базовые гипотезы сравнения
В приведенном примере [110] были использованы различные
современные методы решения проблем с недостающими данными. Дело касается фактически проведенного лонгитюдинального
исследования. Авторские решения основаны на нескольких рабочих гипотезах, характерных для метода атрибуции значений недостающих данных. Вкратце они сводятся к следующему:
1) неответившие рассматриваются исходя из предположения,
что механизм отсутствия ответа можно игнорировать;
2) характер величины недостающей информации, вероятно,
зависит от характера наблюдаемых показателей;
3) существует также зависимость от волн (повторений) про-
водимого выборочного исследования.
Основная гипотеза анализа заключается в том, что данные
были потеряны случайным образом – missing at random (MAR).
Последнее обосновывается тем, что при множественных повторениях (волнах) потерянные данные чаще всего полностью теряются случайным образом (MCAR) или MAR.
Еще одна важная рабочая гипотеза заключается в том, что неответившие имеют одинаковые характеристики, достаточно близкие к характеристикам ответивших во всех волнах или, по крайней мере, к ответам в последней волне при последнем повторении
исследования (Бартоломе [37]; Кокрен [13]; Самаранаяк [118]).
Иначе говоря, авторы предположили и заложили идею приблизительно одинаковых распределений для обеих частей выборки– ответивших и неответивших. Во второй главе (подразделIV)
было выяснено, что методы взвешивания используются для
уменьшения систематического отклонения в оценках выборочно-
187

Глава третья. Сравнительные преимущества и ограничения различных методов оптимизации...
го исследования. Для их применения ставится обратная (противоположная) гипотеза о том, что вероятность получения ответов
различается у ответивших и неответивших и что каким-то образом различные значения вероятности известны или могут быть
оценены. Исследователи применяют несколько способов взвешивания, при этом для веса служат эти различные значения вероятности. Некоторые из них требуют наличия информации о связях
и зависимостях между всеми респондентами [43; 90], в том числе и гипотезы о наличии связей между частью переменных (или
между всеми), а также о характере (модели) переменных.
Авторы [111] попытались доказать, что атрибуция значений
(Imputation) является обоснованным, более продвинутым методом при работе с потерянными данными. Таким образом, техника
атрибуции может успешно заместить определенные значения для
неответивших. Для этого используются имеющиеся данные при
презумпции для различных типов распределений ответивших и
неответивших.
Чтобы справиться с изменчивостью и неточностью недостающих данных, Рубин [115] предлагает многократное присвоение
значений, а затем – синтезирование (объединение) результатов.
Таким способом он надеялся получить обобщенные оценки (Рубин [115]; Рубин, Шафер [117]; Mедоу [91]). Ожидалось, что эти
оценки устранят как «внутриимпутационную», так и «межимпутационную» неточность.
В лонгитюдинальном исследовании, посвященном использованию контрацептивных средств [111], для решения проблем с отсутствующими данными были применены несколько методов после
того, как авторы заложили в анализ четыре ключевые гипотезы:
1) неответившие лица не отличаются от ответивших по при-
знаку «возраст»;
2) неответившие отличаются от ответивших в последней вол-
не, контролируемых по возрасту;
188

II. Сравнительный анализ использования методов взвешивания и атрибуции значений
3) вероятность применения/неприменения контрацептивов
(объект исследовательского интереса) может быть спроектирована
(оценена) через тренд между различными волнами исследования;
4) существует неслучайная регрессионная связь между частью
переменных в обеих группах. В данном случае – связь между возрастом ответивших/неответивших и очередной волной исследования.
2. Модель исследования сравнения методов
Мы представляем исследование команды [111] с целью сделать некоторые сравнительные оценки выбранных методов и
проведенных процедур. Отметим, что главное различие между
сравниваемыми методами связано с формированием той сово-
купности, которая служит основой исследования (ответившие,
неотвечающие, все респонденты всех волн, только одной волны
и т.д.). Мы оцениваем это исследование как оригинальный исследовательский подход, затрагивающий непосредственно анализируемые в данном научном исследовании проблемы.
В табл. 45 мы анализируем различия (в сравнительном аспекте) между применяемыми процедурами оптимизации. Критериями сравнительных оценок в данном случае являются:
1) базовая совокупность;
2) принятые рабочие гипотезы и др.
Основные характеристики сравниваемых методов
Метод
Консервативный
подход
Взвешивающие
показатели по
ячейкам
Базовая
совокупность
Только ответы МСАR
Отвечали и не
отвечали
Первый показатель, контролируется по
возрасту. Второй показатель контролируется по возрасту и волне исследования
Таблица 45
Гипотезы и другие условия
189

Глава третья. Сравнительные преимущества и ограничения различных методов оптимизации...
Окончание табл. 45
Метод
«Hot deck» атрибуция
Предиктивная
атрибуция
«Hot deck» атрибуция
Предиктивная
атрибуция
Конкретизированная модель
Базовая
совокупность
Все респонденты Неответившие распределены,
Все респонденты Неотвечающие ничем не отличаются от
Ответили в последней волне
Ответили в последней волне
Ответили в последней волне
Гипотезы и другие условия
как ответившие, в каждой возрастной
группе
ответивших
Ответившие распределены аналогично
ответившим в последней волне в каждой
возрастной группе
Неотвечающие, как ответившие в последней волне
Волны в исследовании рассматривались
как интервальная переменная. Модель
контролируется по волнам и возрасту
2.1. Анализ данных,
полученных при консервативном подходе
Игнорирование недостающих данных с помощью анализа
только полученной информации мы назвали консервативным
подходом. Авторы использовали результаты консервативного
подхода в качестве основы для сравнения эффектов:
1) при исследовании;
2) при отсутствии действий по компенсации недостающих
данных из информационного массива.
Для этого анализируются только ответы. Неответившие лица
полностью игнорируются. Предположение в этом случае заключается в том, что механизм потери данных – это полностью поте-
рянные случайным образом (MCAR). Это равнозначно гипотезе о
том, что два распределения достаточно близки, различия между
190
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
