Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Проблемы оптимизации выборочных данных с неполнотой в диапазоне. Монография

.pdf
Скачиваний:
0
Добавлен:
07.09.2026
Размер:
1 Мб
Скачать
I. Оптимизация выборки при неполном диапазоне данных
Данные по основной выборке по сравнению с резервами
Таблица 43
(%)
Основная выборка (n2) 46 54 6 18 21 20 17 18
Замещение (q) 46 54 7 23 23 20 13 14
(%)
Основная выборка (n2) 13 32 22 33
Замещение (q) 17 35 22 26
Пол Возраст
М Ж 15–20 21–30 31–40 41–50 51–60 60+
Населенный пункт
Столица
Большой
город
Маленький
город
Село
полнения оказались эффективными. Результаты показывают, что также существуют различия (расхождения) между характеристи­ками выборки и соответствующими параметрами генеральной совокупности. Исходя из этой задачи, к проверке был применен интегральный коэффициент. Он, как известно, дает возможность делать сравнения не парами, а с учетом общей неравномерности структур (распределений) и с учетом степени смещения.
Для этого анализа необходимо измерить разницу между дву­мя одномерными структурами, чтобы выявить их сравнительную неравномерность (если таковая имеется). В нашем случае речь идет об исследовании неравномерности в трех аспектах (направ­лениях):
1) между основной реализованной выборкой (n1 + n2), с од-
ной стороны, и генеральной совокупностью (N), с другой;
2) между планируемым дополнением (резервы – n2) и гене-
ральной совокупностью;
3) между избыточным расширением (q) (замена квоты) и ге-
неральной совокупностью.
181
Глава третья. Сравнительные преимущества и ограничения различных методов оптимизации...
Оценки делаются по формуле
()
vv
и vj – относительные доли соответственно в обеих структу-
где v
i
K
PR
22
vv
ij

2
ij
(60)
,
рах (например, основная реализованная выборка со структурой– параметр генеральной совокупности). Теоретически интеграль­ный коэффициент находится в пределах от 0 до 1. Чем он ближе к 0, тем различие между двумя совокупностями незначительнее, и наоборот – когда коэффициент равен 1, существует полное рас­хождение (несоответствие) между двумя структурами.
Результаты показали, что наиболее существенное различие (табл. 44) имеется при планируемом расширении (резервах) по признаку «возраст» – 0,5093.
Таблица 44
Интегральный коэффициент сравнительной неравномерности
Выборка Пол Возраст Населенный пункт
Основная выборка + резервы 0,0280 0,1328 0,0244
Основная выборка 0,0424 0,1216 0,0235
Резервы 0,0504 0,5093 0,2352
Замещение по квоте 0,0424 0,1496 0,1183
Резервы показывают отклонение от выборки и по признаку «населенный пункт». В целом замена квоты не оказала существен­ного влияния на точность выборки, хотя по возрасту и местопо­ложению коэффициенты также имеют значения, отличные от нуля. Основная выборка дает отклонение по признаку «возраст» (0,1216). Для всех остальных признаков интегральный коэффици­ент невысок.
182
I. Оптимизация выборки при неполном диапазоне данных
При группировке структур основная выборка + резервы ин­тегральный коэффициент понижается в значении только по при­знаку «пол» и повышается при признаках «возраст» и «населен­ный пункт». Этот факт интригует, потому что:
во-первых, исследования показали, что запланированная вы­борка (т. е. основная выборка и резервы) не выполняется в стро­гом соответствии с условиями;
во-вторых, резервы, выделенные случайным образом (при прочих равных условиях), демонстрируют отклонение, которое выходит за рамки допустимого – в определенной степени наблю­дается противоречие с предписаниями методики отбора;
в-третьих, то обстоятельство, что выборка имеет относитель­но большой объем, ни в коем случае не гарантирует ее сохране­ние в качестве представительной1 после подобных методических вмешательств.
Из проведенного анализа можно сделать вывод, что усилия исследователей по компенсации объема выборки и соблюде­нию статистической процедуры во время полевых работ имеют большое значение. И самая совершенная модель исследования легко может быть опорочена несоблюдением требований к вы­бору поля. При решении этой проблемы исследователи часто попадают в центр порочного круга. С одной стороны, исполь­зование списков адресов является рекомендацией для того, чтобы выбор был действительно случайным и обеспечивал репрезентативную выборку, что касается возможностей кон­троля над сетью интервьюеров. С другой – эти списки часто не актуализированы, а потому – неточны. Последствий этого по крайней мере два:
1) нарушение случайного характера отбора;
2) увеличение доли недостающих данных.
1
Одно из главных преимуществ больших по объему случайных выборок.
183
Глава третья. Сравнительные преимущества и ограничения различных методов оптимизации...
Наше видение состоит в том, что число и доля неохваченных единиц могут быть уменьшены с помощью ряда профилактиче­ских, контрольных и других процедур, а также путем привлече­ния хорошо подготовленных специалистов и разработки удобных рабочих схем, позволяющих уменьшить неблагополучие поля.
Количество неучаствующих респондентов по причине «их нет дома» можно уменьшить путем повторных посещений, а ко­личество «отказавшихся отвечать» минимизировать с помощью различных процедур, которые мы обсуждали в предыдущих раз­делах. Хороший исследовательский подход заключается в том, чтобы сосредоточить значительную часть усилий, финансовых расходов, время и материалы для сокращения недостающих дан­ных, вместо того чтобы использовать те же ресурсы на более поздних этапах для работы с неполными данными.
Исследования по этой теме показывают, что методы оптимиза­ции выборки с неполным диапазоном данных (после того как по­левая работа завершена) слишком разнообразны. Каждый из них имеет не только плюсы, но и минусы, а также различные по харак­теру ограничения, и выбрать наиболее подходящий из них– задача не из легких. Результаты также показали, что даже хорошее и под­робное знание различных подходов, методов и процедур не дает никаких оснований использовать их рецептурно и только умозри­тельно. Напротив, выбор каждого из них может быть успешным только тогда, когда через призм» изложенных в работе критериев обязательно проводятся конкретные исследования для выявления и оценки особых ситуаций и проверяется, насколько действитель­ны для каждой из них предположения (гипотезы), закрепленные в различных методологических подходах и решениях.
Мы также видели, что большой объем выборки не всегда яв­ляется гарантией сохранения ее репрезентативного характера в стадии сбора первичной социологической информации. Врассма­триваемом выше исследовании различия между характеристиками
184
II. Сравнительный анализ использования методов взвешивания и атрибуции значений
выборки и параметрами генеральной совокупности оказались зна­чительными – некоторые из них превышали ожидаемые случайные колебания. Отклонения могли быть обусловлены несоблюдением процедуры отбора со стороны анкетеров, а также «шумами», кото­рые привносят дополнение по квотам1 к случайной выборке.
Поиск решения проблем, вызванных отсутствующими данны­ми, всегда является хорошей исследовательской стратегией. Однако если используются подходы, противоречащие механизму случайно­го отбора (не согласованные с ним), риск того, что результаты будут обременены неконтролируемыми и непредсказуемыми по размеру и направлению отклонениями (системными ошибками), составля­ет почти 100 %. Существует реальная опасность того, что подобные «дополнения» могут исказить распределение выборки. В целом оно может перестать быть «микромоделью» генеральной совокупности. В любом случае выбор соответствующих подходов, методов и про­цедур обязательно должен предшествовать и обосновываться се­рьезными исследованиями – иначе легко попасть в ловушку.
II. Сравнительный анализ использования методов
взвешивания и атрибуции значений
Сравнительный анализ проводится по нескольким выбран­ным критериям:
1) выдвигаемые гипотезы о механизме потери данных, а так­же о формировании той совокупности, которая будет рассматри­ваться;
1
Необходимо подчеркнуть, что использование квотных выборок в практике эмпирических исследований значительно возрастает. Эта выборочная модель имеет как свои неоспоримые преимущества (недорогая, быстрая, нетрудоем­кая и др.), так и ряд ограничений (системных). К квоте относят качества, кото­рыми она не обладает. Результаты таких выборок представляются «репрезента­тивными», что недопустимо.
185
Глава третья. Сравнительные преимущества и ограничения различных методов оптимизации...
2) применяемые методы оптимизации и их модификации;
3) оценка результатов, т. е. эффективность внесенных коррек­тировок.
Как мы уже отмечали, одним из часто применяемых в рос­сийской практике методов оптимизации выборки при неполном диапазоне данных является взвешивание. Наши исследования показали, что здесь нередко делают анализы только на основе полученных данных. Часто используемой стратегией при анали­зе данных с неответившими являются исследовательские усилия по ограничению полученных случаев (собранной информации) и восприятие реализованной совокупности как случайной выборки генеральной совокупности (несмотря на нарушения и объема, и структуры). Однако это может привести к выводам, обременен­ным смещением, если ответы зависят от наблюдаемых (или нена­блюдаемых) переменных, связей и взаимодействий.
Метод атрибуции значений (Imputation) недостающих дан­ных недостаточно известен и не применяется широко в нашей практике эмпирических исследований. Это обстоятельство по­требовало изучить сравнительную эффективность многомерной атрибуции через призму и по данным опыта тех исследователей, которыми она используется.
В сравнительном аспекте мы проанализируем последствия применения трех групп подходов и методов:
1) наиболее часто применяемые подвиды атрибуции;
2) несколько модификаций классического метода взвешива-
ния данных;
3) исключение единиц, для которых отсутствуют данные, и анализ только тех, для которых получена информация (далее для краткости мы будем называть последний консервативным подхо- дом). Некоторые ограничения в исследованиях в этой части работы были вызваны трудностями доступа к конкретным эмпирическим данным. Поэтому сравнительный анализ большей частью основан
186
II. Сравнительный анализ использования методов взвешивания и атрибуции значений
на обобщенных данных из литературных источников. Были ис­пользованы выводы и обобщения западных авторов, сделана по­пытка систематизации и критической оценки достигнутого.
1. Базовые гипотезы сравнения
В приведенном примере [110] были использованы различные современные методы решения проблем с недостающими данны­ми. Дело касается фактически проведенного лонгитюдинального исследования. Авторские решения основаны на нескольких рабо­чих гипотезах, характерных для метода атрибуции значений не­достающих данных. Вкратце они сводятся к следующему:
1) неответившие рассматриваются исходя из предположения,
что механизм отсутствия ответа можно игнорировать;
2) характер величины недостающей информации, вероятно,
зависит от характера наблюдаемых показателей;
3) существует также зависимость от волн (повторений) про-
водимого выборочного исследования.
Основная гипотеза анализа заключается в том, что данные были потеряны случайным образом – missing at random (MAR). Последнее обосновывается тем, что при множественных повторе­ниях (волнах) потерянные данные чаще всего полностью теряют­ся случайным образом (MCAR) или MAR.
Еще одна важная рабочая гипотеза заключается в том, что не­ответившие имеют одинаковые характеристики, достаточно близ­кие к характеристикам ответивших во всех волнах или, по край­ней мере, к ответам в последней волне при последнем повторении исследования (Бартоломе [37]; Кокрен [13]; Самаранаяк [118]). Иначе говоря, авторы предположили и заложили идею прибли­зительно одинаковых распределений для обеих частей выбор­ки– ответивших и неответивших. Во второй главе (подразделIV) было выяснено, что методы взвешивания используются для уменьшения систематического отклонения в оценках выборочно-
187
Глава третья. Сравнительные преимущества и ограничения различных методов оптимизации...
го исследования. Для их применения ставится обратная (проти­воположная) гипотеза о том, что вероятность получения ответов различается у ответивших и неответивших и что каким-то обра­зом различные значения вероятности известны или могут быть оценены. Исследователи применяют несколько способов взвеши­вания, при этом для веса служат эти различные значения вероят­ности. Некоторые из них требуют наличия информации о связях и зависимостях между всеми респондентами [43; 90], в том чис­ле и гипотезы о наличии связей между частью переменных (или между всеми), а также о характере (модели) переменных.
Авторы [111] попытались доказать, что атрибуция значений (Imputation) является обоснованным, более продвинутым мето­дом при работе с потерянными данными. Таким образом, техника атрибуции может успешно заместить определенные значения для неответивших. Для этого используются имеющиеся данные при презумпции для различных типов распределений ответивших и неответивших.
Чтобы справиться с изменчивостью и неточностью недоста­ющих данных, Рубин [115] предлагает многократное присвоение значений, а затем – синтезирование (объединение) результатов. Таким способом он надеялся получить обобщенные оценки (Ру­бин [115]; Рубин, Шафер [117]; Mедоу [91]). Ожидалось, что эти оценки устранят как «внутриимпутационную», так и «межимпу­тационную» неточность.
В лонгитюдинальном исследовании, посвященном использова­нию контрацептивных средств [111], для решения проблем с отсут­ствующими данными были применены несколько методов после того, как авторы заложили в анализ четыре ключевые гипотезы:
1) неответившие лица не отличаются от ответивших по при-
знаку «возраст»;
2) неответившие отличаются от ответивших в последней вол-
не, контролируемых по возрасту; 188
II. Сравнительный анализ использования методов взвешивания и атрибуции значений
3) вероятность применения/неприменения контрацептивов (объект исследовательского интереса) может быть спроектирована (оценена) через тренд между различными волнами исследования;
4) существует неслучайная регрессионная связь между частью переменных в обеих группах. В данном случае – связь между возрас­том ответивших/неответивших и очередной волной исследования.
2. Модель исследования сравнения методов
Мы представляем исследование команды [111] с целью сде­лать некоторые сравнительные оценки выбранных методов и проведенных процедур. Отметим, что главное различие между сравниваемыми методами связано с формированием той сово- купности, которая служит основой исследования (ответившие, неотвечающие, все респонденты всех волн, только одной волны и т.д.). Мы оцениваем это исследование как оригинальный иссле­довательский подход, затрагивающий непосредственно анализи­руемые в данном научном исследовании проблемы.
В табл. 45 мы анализируем различия (в сравнительном аспек­те) между применяемыми процедурами оптимизации. Критерия­ми сравнительных оценок в данном случае являются:
1) базовая совокупность;
2) принятые рабочие гипотезы и др.
Основные характеристики сравниваемых методов
Метод
Консервативный подход
Взвешивающие показатели по ячейкам
Базовая
совокупность
Только ответы МСАR
Отвечали и не отвечали
Первый показатель, контролируется по возрасту. Второй показатель контроли­руется по возрасту и волне исследования
Таблица 45
Гипотезы и другие условия
189
Глава третья. Сравнительные преимущества и ограничения различных методов оптимизации...
Окончание табл. 45
Метод
«Hot deck» атри­буция
Предиктивная атрибуция
«Hot deck» атри­буция
Предиктивная атрибуция
Конкретизиро­ванная модель
Базовая
совокупность
Все респонденты Неответившие распределены,
Все респонденты Неотвечающие ничем не отличаются от
Ответили в по­следней волне
Ответили в по­следней волне
Ответили в по­следней волне
Гипотезы и другие условия
как ответившие, в каждой возрастной группе
ответивших
Ответившие распределены аналогично ответившим в последней волне в каждой возрастной группе
Неотвечающие, как ответившие в по­следней волне
Волны в исследовании рассматривались как интервальная переменная. Модель контролируется по волнам и возрасту
2.1. Анализ данных,
полученных при консервативном подходе
Игнорирование недостающих данных с помощью анализа только полученной информации мы назвали консервативным подходом. Авторы использовали результаты консервативного подхода в качестве основы для сравнения эффектов:
1) при исследовании;
2) при отсутствии действий по компенсации недостающих
данных из информационного массива.
Для этого анализируются только ответы. Неответившие лица полностью игнорируются. Предположение в этом случае заклю­чается в том, что механизм потери данных – это полностью поте- рянные случайным образом (MCAR). Это равнозначно гипотезе о том, что два распределения достаточно близки, различия между
190
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]