Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Проблемы оптимизации выборочных данных с неполнотой в диапазоне. Монография

.pdf
Скачиваний:
0
Добавлен:
07.09.2026
Размер:
1 Мб
Скачать
III. Методы сокращения доли выпадающих единиц
Отметим, что эти методы контроля, к сожалению, не широко используются в практике эмпирических исследований.
Обновление списка генеральной совокупности по данным из других источников информации не является легкой задачей. Еще не создана единая база данных (информационный архив) эмпи­рических исследований, которая была бы очень полезной не толь­ко для эмпирической социологии.
Одним из наиболее часто используемых методов контро­ля является сравнение испытуемых в полевых исследованиях со списком выборочной совокупности. Обычно интервьюерам пре­доставляется список основных (но не всех доступных) данных респондента, в то время как у исследователей есть полная инфор­мация. Сравнение может проводиться, например, в зависимости от возраста.
Часто в практике эмпирических исследований упускается возможность повторного контакта с назначенными для иссле­дования лицами (в основном по финансовым причинам), когда именно это и необходимо. Вместо этой контрольной процедуры, исследователи работают с «напряженной» выборкой (с большим объемом), в которой планируются резервы, заменяющие отказав­шихся и отсутствующих респондентов. Как мы увидим дальше, эта стратегия не всегда дает положительный результат.
III. Методы сокращения доли выпадающих единиц
Указанные методы контроля неполного диапазона данных (доли выпадающих единиц) соответствуют специфике эмпириче­ских социологических исследований, в которых обычно исследу­ются выборки с большим количеством людей. Поскольку выбор­ка делается накануне исследования (список конкретных единиц в многоуровневых выборках), можно предположить, что лица, на­значенные для исследования, находятся по своим адресам. И во-
101
Глава вторая. Методы поиска решений при неполном диапазоне данных выборки
прос сводится к тому, действительно ли их посещали для прове­дения опроса1. При этом человек может быть посещен и он может не предоставить запрашиваемую информацию. По отдельным вопросам в анкете в этой ситуации также возникают пропуски (выпадающие единицы) в полноте охвата. Для преодоления этого существует ряд методов, с помощью которых можно уменьшить долю неответивших лиц. В различных ситуациях могут быть использованы следующие методы для снижения относительной доли неответивших или последствий этого.
1. Совершенствование процедур сбора данных в полевых
исследованиях.
Сюда относятся такие защитные меры, как:
1) обеспечение анонимности опрошенных (у нас аноним­ность2 формулируется как принцип методики регистрации дан­ных);
2) обеспечение мотивации опрошенных к участию в опросе, т. е. к добровольному предоставлению запрашиваемой информа­ции;
3) возбуждение интереса опрашиваемых к темам исследова­ния, и в частности к вопросам, посредством четких вводных за­мечаний и разъяснений;
4) предварительные сообщения (в средствах массовой ин­формации) о том, что они будут посещаться в связи с проводи­мым эмпирическим социологическим исследованием с целью
1
В связи с этим контроль при переписи населения более сложен: лицо, времен­но отсутствующее (командировка, отдых, в гостях и др.) в пункте своего посто­янного места жительства, должно быть учтено как в этом населенном пункте, так и в том, где его застигнет перепись. Поэтому при контрольном пересчете полноты охвата применяются более сложные методы контроля.
2
Мы можем ожидать определенных административных ограничений при про­ведении эмпирических исследований в связи с принятием закона о защите личных данных.
102
III. Методы сокращения доли выпадающих единиц
предупредить потенциальных респондентов о необходимости на­ходиться дома.
2. Повторные визиты.
Данный метод успешен не только для индивидуального интер­вью, но и при почтовом анкетировании, когда мы повторно обра­щаемся к лицам, которые не вернули заполненные анкеты. Вэтом методе разработаны математические модели, которые связывают количество возможных повторных посещений с затратами на их вы­полнение. Кокран указывает, чтό можно ожидать: каждый последу­ющий визит будет более дорогостоящим по сравнению со средним расходом на один общий опрос1, поскольку опросы проводятся в до­мах, расположенных в малонаселенных районах, где жители обычно проводят меньше времени дома, чем в других (например, отдален­ные и труднодоступные сельские районы, горные массивы и пр.).
Однако некоторые специальные исследования в этом направ­лении показывают, что последующие визиты могут быть не таки­ми дорогими, как можно было бы ожидать [13]2.
3. Подвыборка выпадающих единиц.
Идея этого метода состоит в том, чтобы после первого визи­та сделать случайную выборку из неопрошенных и неответивших и приложить максимум усилий для получения из нее информа­ции– изучить их. При этом могут применяться различные мето­дики. Например, при первичном посещении следует использовать групповую анкету, а для выборки неопрошенных – индивидуаль­ное интервью. Выше мы указали, что была разработана матема­тическая модель оптимальной величины отбора неопрошенных с
1
Под полным опросом – Completed interview – понимается заполнение всей ан­кеты без необходимости повторного посещения респондента.
2
Приводятся данные исследования, в которых показано, что трехкратный визит увеличивает расходы в среднем на один общий опрос, по сравнению с однора­зовым посещением, только на 4 % при обследовании любых лиц (взрослых) и на 10 % при обследовании случайно избираемых лиц (Кокрен [13]).
103
Глава вторая. Методы поиска решений при неполном диапазоне данных выборки
минимизацией затрат на получение искомой информации от ис­следуемых лиц [13].
4. Оценка эффекта при отказе отвечать.
Этот подход основан на предположении, что небольшие ошибки вследствие отказа респондентов отвечать, вероятно, не оказывают существенного влияния на выборочные оценки, т. е. достоверность информации по совокупности. Когда есть дан­ные о неответивших лицах, исследователю легче делать предпо­ложения об их влиянии на выводы и обобщения. В связи с этим рекомендуется установить, встречаются ли неответившие лица случайно с одинаковой частотой во всех группах испытуемых (на­пример, пол, возраст, образование и т. д.).
Если частота приблизительно одинакова, то неответившие лица исключаются из групп. Если в некоторых подгруппах выборки доля неответивших лиц будет относительно больше, то следует оценить величину систематической ошибки с помощью соответствующих перекрестных группировок. И, если возможно, исследовать при этом особенности и мотивацию у неответивших (в том числе причину ответа «не знаю»). Иногда на практике превышение определенной границы относительной доли неответивших воспринимается как от­клонение информации по соответствующему вопросу анкеты.
5. Замена неответивших.
При планировании выборки предусматривается немного боль­ше единиц, которые используются, когда возникают выпадающие единицы (неотвечающие лица). Здесь явно подчеркивается, что су­ществует большая опасность допустить ошибку, так как «замените­ли» больше похожи на ответивших, чем на неответивших лиц [4].
6. Восстановительная процедура1.
Этот метод находит применение в повторных исследовани- ях и основан на возможности использования данных о не отве-
1
Replacement procedure (англ.).
104
III. Методы сокращения доли выпадающих единиц
тивших в прошлых исследованиях лицах в качестве данных о не отвечавших в настоящем исследовании [80]. Для этого в текущем исследовании наряду с новыми адресами включаются некоторые адреса не ответивших по предыдущим исследованиям с анало­гичной схемой выборки. Затем восстанавливаются адреса, по ко­торым были указаны неответившие лица, как не ответившие по адресам текущего исследования [80]. В этой процедуре использу­ются результаты посещений (опросов) респондентов, не ответив­ших в предыдущем исследовании, которые считаются актуальны­ми для текущего исследования.
7. Схема Политца и Саймонса.
Она направлена на устранение смещений в оценках выборки, вызванных выпадающими данными в диапазоне по причине от­сутствия дома. При этом следует избегать повторных посещений, а результаты первых корректируются с помощью оценки вероят­ности обнаружения испытуемого. Для этого предполагается, что все визиты проходят за 6 дней в неделю. Испытуемый при первом и единственном посещении сообщает, был ли он дома в течение каждого из 5 вечеров, предшествующих посещению. По этому признаку результаты первого посещения делятся на 6 групп в со­ответствии с количеством дней нахождения дома (0, 1, 2, 3, 4, 5). Располагая групповыми средними по признаку и числу лиц в них, получают общую среднюю по совокупностям, взвешенную с от­носительной частотой времени, в течение которого испытуемый находился дома.
Таким образом, предполагается, что смещение оценки для об­щей средней меньше, чем для той же средней по данным только при первом посещении.
Наш анализ выявил, что в практике эмпирических исследо­ваний в основном используется метод замещения неответивших или отсутствующих дома лиц. То есть могут быть замещены лица, которые будут найдены при втором, третьем или последующем
105
Глава вторая. Методы поиска решений при неполном диапазоне данных выборки
посещении. Напомним, что вознаграждение анкетеров связано не с количеством посещений, а с количеством успешно заполненных анкет. И интервьюер не заинтересован в повторных посещениях, а стремится немедленно заменить отсутствующего человека дру­гим, это предполагает, что тот при первом же посещении будет участвовать в опросе (заполнит анкету). Такая практика является одной из основных причин того, что у части результатов эмпири­ческих исследований проблемы с репрезентативностью.
IV. Взвешивание данных
Очень часто в специальной литературе выдвигается мнение, что «лучшая стратегия» по уменьшению эффекта потери данных заключается в том, чтобы в первую очередь достичь наименьше­го числа неответивших, насколько это возможно и когда это воз­можно.
Кроме того, большинство современных авторов ищут реше­ние проблемы с помощью двух основных групп методов сниже­ния эффекта потерянных данных, а именно:
1) путем взвешивания;
2) путем приписывания значений (атрибуции) отсутствую-
щих данных.
Считается, что до недавнего времени предпочтительным ре­шением проблем с недостающими данными для большинства исследователей традиционно были «...относительно специализи­рованные практики удаления случаев» [122]. Современные инно­вации и открытия в теоретической статистике и вычислительной технике порождают новое поколение гибких процедур (методов), базирующихся на прочной статистической основе [122].
Было отмечено, что наличие системных ошибок обычно при­водит к искажениям в распределении исследуемых лиц по пере­менным, которые нас интересуют. Последние часто возникают
106
IV. Взвешивание данных
из-за проблем с выпадающими данными в диапазоне – ошибок в ответах и пропусков в диапазоне.
В результате при сопоставлении выборочного распределения с распределением генеральной совокупности получаются боль­шие или меньшие расхождения, т. е. существует системная (систе­матическая) ошибка. Системные ошибки не зависят от объема выборки. С увеличением объема не достигается никакого опти­мизирующего эффекта – он связан только со случайной ошибкой. В статистике предлагаются известные методы для решения этой проблемы, объединенные под названием «методы взвешивания выборочных данных». Речь идет о процедурах, с помощью ко­торых можно выравнять или приблизить выборочное распреде­ление к распределению генеральной совокупности. Но для этого необходимо располагать данными.
1. Необходимость взвешивания
Взвешивание данных используется для уменьшения систе­матического отклонения оценок в выборочном исследовании (системной ошибки). В рамках него была выдвинута гипотеза о том, что вероятности получения ответа различны в двух частях выборки – ответивших и неответивших. В различных исследова­ниях применяются различные методы взвешивания. Некоторые из них требуют информации о существующих связях и зависимо­стях между всеми респондентами [93].
Взвешивание проводится по трем основным причинам1:
1. Необходимость компенсации различий при вероятностном (случайном) отборе индивидуальных случаев. Эти различия могут увеличиваться из-за сложности программы исследования. Специ­фичное исследование может преднамеренно переоценить (неза-
1
Определение этапов взвешивания, таким образом представленное в [70], Гровс заимствует у Киша из [81].
107
Глава вторая. Методы поиска решений при неполном диапазоне данных выборки
служенно выделить) одну или несколько подгрупп генеральной совокупности. Например, более представительным может быть региональное исследование в выборке мелких административных единиц для сбора информации о большем количестве случаев и при формировании отдельных оценок для этих административных единиц1. В другом случае различия в вероятностных отборах могут быть увеличены как непреднамеренный эффект выборочной стра­тегии. Например, при телефонном опросе домохозяйств более чем одним телефонным сообщением имеется больше шансов попасть в выборку, чем домохозяйствам с одной линией, а те, у кого нет теле­фона, попасть в выборку не имеют никаких шансов. В обоих случаях оценки всей выборки могут быть обременены, и обычно обремене­ны, системными ошибками. Выход из этого поиска – взвешивание данных надлежащим образом. Веса (коэффициенты) необходимы для компенсации преднамеренных и непреднамеренных отклонений от равновероятностного отбора единиц в выборку2. В некоторых источниках взвешивание происходит под термином «факторинг».
2. Необходимость компенсировать различия для подгрупп в уровнях ответов. Даже если выборка является репрезентативной для большей части генеральной совокупности, различия в уров­нях ответов часто приводят к системным расхождениям между параметрами генеральной совокупности и их оценками по вы­борке. Например, в индивидуальном интервью количество чле­нов семьи может быть связано с вероятностью предоставления домохозяйством запрошенной информации. Различия в уров­нях полученных ответов внутри подгрупп выборки, как прави­ло, производят системную ошибку оценки. Цель взвешивания – уменьшить эту ошибку.
1
Например, исследование с напряженной выборкой по регионам («перенапря­жение» для Москвы и Московской области или «омоложение» выборки и т. д.).
2
Equal probability sampling (англ.).
108
IV. Взвешивание данных
3. Необходимость компенсировать нестабильность параме­тров генеральной совокупности. Скажем, если какой-то регион является более представленным в выборочном исследовании, можно использовать дополнительные данные (например, по переписи населения) для выравнивания выборки с распреде­лением параметров в генеральной совокупности. Кроме того, выравнивание данных с известными значениями генеральной совокупности может уменьшить влияние выпадающих единиц (неполного диапазона данных) на выборочные оценки (напри­мер, пропуск лиц в домохозяйствах без телефонов при телефон­ном опросе и т. д.).
2. Процедуры взвешивания
Чаще всего взвешивание проводится в три этапа [81]. Пер-
вый имеет задачу компенсировать различия в отборе; второй –
различия по подгруппам в уровнях ответа; третий – различия между оценками в выборке и параметрами в генеральной сово­купности.
2.1. Первый этап: базис взвешивания
Первоначальный (базовый) вес (Wij) для каждого случая (на­пример, лицо, домашнее хозяйство и др.) рассчитывается как зна­чение, обратно пропорциональное вероятности отбора (Pri), т. е.
1
WPr (32)
ij
.
i
Любой приемлемый выбор единиц – независимо от того, включены они в исследование или нет, – требует получать (ба­зово) вес. Вероятность отбора (также называемая выборочным уровнем – Sampling rate) – это механизм отбора единиц в выбор­ку. При случайном телефонном опросе единицами генеральной совокупности, соответственно и выборки, являются телефонные
109
Глава вторая. Методы поиска решений при неполном диапазоне данных выборки
номера. В одном телефонном исследовании Киш предположил [81], что в некоем районе есть 150 квартальных телефонных (або­нентских) станций (например, 863-ХХХХ). Если емкость каждой из них составляет 10 000 возможных номеров, то для всех воз­можных телефонных номеров генеральная совокупность состоит из 1 500 000. Если в выборку отобрано 1500 номеров (каждый с одинаковой вероятностью), то вероятность выбора отдельного случая равна 0,001 (1500/1 500 000).
И выборка, и генеральная совокупность, из которой мы из­влекаем единицы, содержат кроме частных, которые на самом деле исключительно подходят для конкретного исследования, не­рабочие и служебные телефоны. Если единицей исследуемой со­вокупности являются фирмы, службы, то выбор происходит, нао­борот, из последних.
Для стратифицированных выборок соответствующая им ге­неральная совокупность сначала делится на подгруппы (так на­зываемые страты), в каждой из которых извлекаются отдельные подвыборки (формирующие общую для генеральной совокупно­сти выборку). На практике часто для разных страт используются разные выборочные вероятности, т. е. отбор непропорциональ­ный. Например, регион исследования может быть разделен на ча­сти в зависимости от частоты использования жителями различ­ных видов транспорта. Население городских районов может быть представлено в выборках так, чтобы значительно увеличить под­выборку с количеством респондентов, которые ходят пешком, ис­пользуют велосипеды или общественный транспорт. Выборочная модель может быть реализована, чтобы обеспечить автономные оценки для описанных разных субрегионов. Если телефонные но­мера в отдельных кварталах есть объекты различного выбороч­ного уровня, то тогда отдельные вероятности выбора рассчиты­ваются для каждого квартала отдельно. Киш показывает, как это можно сделать (табл. 21).
110
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]