Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Проблемы оптимизации выборочных данных с неполнотой в диапазоне. Монография
.pdf
III. Методы сокращения доли выпадающих единиц
Отметим, что эти методы контроля, к сожалению, не широко
используются в практике эмпирических исследований.
Обновление списка генеральной совокупности по данным из
других источников информации не является легкой задачей. Еще
не создана единая база данных (информационный архив) эмпирических исследований, которая была бы очень полезной не только для эмпирической социологии.
Одним из наиболее часто используемых методов контроля является сравнение испытуемых в полевых исследованиях со
списком выборочной совокупности. Обычно интервьюерам предоставляется список основных (но не всех доступных) данных
респондента, в то время как у исследователей есть полная информация. Сравнение может проводиться, например, в зависимости
от возраста.
Часто в практике эмпирических исследований упускается
возможность повторного контакта с назначенными для исследования лицами (в основном по финансовым причинам), когда
именно это и необходимо. Вместо этой контрольной процедуры,
исследователи работают с «напряженной» выборкой (с большим
объемом), в которой планируются резервы, заменяющие отказавшихся и отсутствующих респондентов. Как мы увидим дальше,
эта стратегия не всегда дает положительный результат.
III. Методы сокращения доли выпадающих единиц
Указанные методы контроля неполного диапазона данных
(доли выпадающих единиц) соответствуют специфике эмпирических социологических исследований, в которых обычно исследуются выборки с большим количеством людей. Поскольку выборка делается накануне исследования (список конкретных единиц в
многоуровневых выборках), можно предположить, что лица, назначенные для исследования, находятся по своим адресам. И во-
101

Глава вторая. Методы поиска решений при неполном диапазоне данных выборки
прос сводится к тому, действительно ли их посещали для проведения опроса1. При этом человек может быть посещен и он может
не предоставить запрашиваемую информацию. По отдельным
вопросам в анкете в этой ситуации также возникают пропуски
(выпадающие единицы) в полноте охвата. Для преодоления этого
существует ряд методов, с помощью которых можно уменьшить
долю неответивших лиц. В различных ситуациях могут быть
использованы следующие методы для снижения относительной
доли неответивших или последствий этого.
1. Совершенствование процедур сбора данных в полевых
исследованиях.
Сюда относятся такие защитные меры, как:
1) обеспечение анонимности опрошенных (у нас анонимность2 формулируется как принцип методики регистрации данных);
2) обеспечение мотивации опрошенных к участию в опросе,
т. е. к добровольному предоставлению запрашиваемой информации;
3) возбуждение интереса опрашиваемых к темам исследования, и в частности к вопросам, посредством четких вводных замечаний и разъяснений;
4) предварительные сообщения (в средствах массовой информации) о том, что они будут посещаться в связи с проводимым эмпирическим социологическим исследованием с целью
1
В связи с этим контроль при переписи населения более сложен: лицо, временно отсутствующее (командировка, отдых, в гостях и др.) в пункте своего постоянного места жительства, должно быть учтено как в этом населенном пункте,
так и в том, где его застигнет перепись. Поэтому при контрольном пересчете
полноты охвата применяются более сложные методы контроля.
2
Мы можем ожидать определенных административных ограничений при проведении эмпирических исследований в связи с принятием закона о защите
личных данных.
102

III. Методы сокращения доли выпадающих единиц
предупредить потенциальных респондентов о необходимости находиться дома.
2. Повторные визиты.
Данный метод успешен не только для индивидуального интервью, но и при почтовом анкетировании, когда мы повторно обращаемся к лицам, которые не вернули заполненные анкеты. Вэтом
методе разработаны математические модели, которые связывают
количество возможных повторных посещений с затратами на их выполнение. Кокран указывает, чтό можно ожидать: каждый последующий визит будет более дорогостоящим по сравнению со средним
расходом на один общий опрос1, поскольку опросы проводятся в домах, расположенных в малонаселенных районах, где жители обычно
проводят меньше времени дома, чем в других (например, отдаленные и труднодоступные сельские районы, горные массивы и пр.).
Однако некоторые специальные исследования в этом направлении показывают, что последующие визиты могут быть не такими дорогими, как можно было бы ожидать [13]2.
3. Подвыборка выпадающих единиц.
Идея этого метода состоит в том, чтобы после первого визита сделать случайную выборку из неопрошенных и неответивших
и приложить максимум усилий для получения из нее информации– изучить их. При этом могут применяться различные методики. Например, при первичном посещении следует использовать
групповую анкету, а для выборки неопрошенных – индивидуальное интервью. Выше мы указали, что была разработана математическая модель оптимальной величины отбора неопрошенных с
1
Под полным опросом – Completed interview – понимается заполнение всей анкеты без необходимости повторного посещения респондента.
2
Приводятся данные исследования, в которых показано, что трехкратный визит
увеличивает расходы в среднем на один общий опрос, по сравнению с одноразовым посещением, только на 4 % при обследовании любых лиц (взрослых) и
на 10 % при обследовании случайно избираемых лиц (Кокрен [13]).
103

Глава вторая. Методы поиска решений при неполном диапазоне данных выборки
минимизацией затрат на получение искомой информации от исследуемых лиц [13].
4. Оценка эффекта при отказе отвечать.
Этот подход основан на предположении, что небольшие
ошибки вследствие отказа респондентов отвечать, вероятно, не
оказывают существенного влияния на выборочные оценки, т. е.
достоверность информации по совокупности. Когда есть данные о неответивших лицах, исследователю легче делать предположения об их влиянии на выводы и обобщения. В связи с этим
рекомендуется установить, встречаются ли неответившие лица
случайно с одинаковой частотой во всех группах испытуемых (например, пол, возраст, образование и т. д.).
Если частота приблизительно одинакова, то неответившие лица
исключаются из групп. Если в некоторых подгруппах выборки доля
неответивших лиц будет относительно больше, то следует оценить
величину систематической ошибки с помощью соответствующих
перекрестных группировок. И, если возможно, исследовать при этом
особенности и мотивацию у неответивших (в том числе причину
ответа «не знаю»). Иногда на практике превышение определенной
границы относительной доли неответивших воспринимается как отклонение информации по соответствующему вопросу анкеты.
5. Замена неответивших.
При планировании выборки предусматривается немного больше единиц, которые используются, когда возникают выпадающие
единицы (неотвечающие лица). Здесь явно подчеркивается, что существует большая опасность допустить ошибку, так как «заменители» больше похожи на ответивших, чем на неответивших лиц [4].
6. Восстановительная процедура1.
Этот метод находит применение в повторных исследовани-
ях и основан на возможности использования данных о не отве-
1
Replacement procedure (англ.).
104

III. Методы сокращения доли выпадающих единиц
тивших в прошлых исследованиях лицах в качестве данных о не
отвечавших в настоящем исследовании [80]. Для этого в текущем
исследовании наряду с новыми адресами включаются некоторые
адреса не ответивших по предыдущим исследованиям с аналогичной схемой выборки. Затем восстанавливаются адреса, по которым были указаны неответившие лица, как не ответившие по
адресам текущего исследования [80]. В этой процедуре используются результаты посещений (опросов) респондентов, не ответивших в предыдущем исследовании, которые считаются актуальными для текущего исследования.
7. Схема Политца и Саймонса.
Она направлена на устранение смещений в оценках выборки,
вызванных выпадающими данными в диапазоне по причине отсутствия дома. При этом следует избегать повторных посещений,
а результаты первых корректируются с помощью оценки вероятности обнаружения испытуемого. Для этого предполагается, что
все визиты проходят за 6 дней в неделю. Испытуемый при первом
и единственном посещении сообщает, был ли он дома в течение
каждого из 5 вечеров, предшествующих посещению. По этому
признаку результаты первого посещения делятся на 6 групп в соответствии с количеством дней нахождения дома (0, 1, 2, 3, 4, 5).
Располагая групповыми средними по признаку и числу лиц в них,
получают общую среднюю по совокупностям, взвешенную с относительной частотой времени, в течение которого испытуемый
находился дома.
Таким образом, предполагается, что смещение оценки для общей средней меньше, чем для той же средней по данным только
при первом посещении.
Наш анализ выявил, что в практике эмпирических исследований в основном используется метод замещения неответивших
или отсутствующих дома лиц. То есть могут быть замещены лица,
которые будут найдены при втором, третьем или последующем
105

Глава вторая. Методы поиска решений при неполном диапазоне данных выборки
посещении. Напомним, что вознаграждение анкетеров связано не
с количеством посещений, а с количеством успешно заполненных
анкет. И интервьюер не заинтересован в повторных посещениях,
а стремится немедленно заменить отсутствующего человека другим, это предполагает, что тот при первом же посещении будет
участвовать в опросе (заполнит анкету). Такая практика является
одной из основных причин того, что у части результатов эмпирических исследований проблемы с репрезентативностью.
IV. Взвешивание данных
Очень часто в специальной литературе выдвигается мнение,
что «лучшая стратегия» по уменьшению эффекта потери данных
заключается в том, чтобы в первую очередь достичь наименьшего числа неответивших, насколько это возможно и когда это возможно.
Кроме того, большинство современных авторов ищут решение проблемы с помощью двух основных групп методов снижения эффекта потерянных данных, а именно:
1) путем взвешивания;
2) путем приписывания значений (атрибуции) отсутствую-
щих данных.
Считается, что до недавнего времени предпочтительным решением проблем с недостающими данными для большинства
исследователей традиционно были «...относительно специализированные практики удаления случаев» [122]. Современные инновации и открытия в теоретической статистике и вычислительной
технике порождают новое поколение гибких процедур (методов),
базирующихся на прочной статистической основе [122].
Было отмечено, что наличие системных ошибок обычно приводит к искажениям в распределении исследуемых лиц по переменным, которые нас интересуют. Последние часто возникают
106

IV. Взвешивание данных
из-за проблем с выпадающими данными в диапазоне – ошибок в
ответах и пропусков в диапазоне.
В результате при сопоставлении выборочного распределения
с распределением генеральной совокупности получаются большие или меньшие расхождения, т. е. существует системная (систематическая) ошибка. Системные ошибки не зависят от объема
выборки. С увеличением объема не достигается никакого оптимизирующего эффекта – он связан только со случайной ошибкой.
В статистике предлагаются известные методы для решения этой
проблемы, объединенные под названием «методы взвешивания
выборочных данных». Речь идет о процедурах, с помощью которых можно выравнять или приблизить выборочное распределение к распределению генеральной совокупности. Но для этого
необходимо располагать данными.
1. Необходимость взвешивания
Взвешивание данных используется для уменьшения систематического отклонения оценок в выборочном исследовании
(системной ошибки). В рамках него была выдвинута гипотеза о
том, что вероятности получения ответа различны в двух частях
выборки – ответивших и неответивших. В различных исследованиях применяются различные методы взвешивания. Некоторые
из них требуют информации о существующих связях и зависимостях между всеми респондентами [93].
Взвешивание проводится по трем основным причинам1:
1. Необходимость компенсации различий при вероятностном
(случайном) отборе индивидуальных случаев. Эти различия могут
увеличиваться из-за сложности программы исследования. Специфичное исследование может преднамеренно переоценить (неза-
1
Определение этапов взвешивания, таким образом представленное в [70], Гровс
заимствует у Киша из [81].
107

Глава вторая. Методы поиска решений при неполном диапазоне данных выборки
служенно выделить) одну или несколько подгрупп генеральной
совокупности. Например, более представительным может быть
региональное исследование в выборке мелких административных
единиц для сбора информации о большем количестве случаев и
при формировании отдельных оценок для этих административных
единиц1. В другом случае различия в вероятностных отборах могут
быть увеличены как непреднамеренный эффект выборочной стратегии. Например, при телефонном опросе домохозяйств более чем
одним телефонным сообщением имеется больше шансов попасть в
выборку, чем домохозяйствам с одной линией, а те, у кого нет телефона, попасть в выборку не имеют никаких шансов. В обоих случаях
оценки всей выборки могут быть обременены, и обычно обременены, системными ошибками. Выход из этого поиска – взвешивание
данных надлежащим образом. Веса (коэффициенты) необходимы
для компенсации преднамеренных и непреднамеренных отклонений
от равновероятностного отбора единиц в выборку2. В некоторых
источниках взвешивание происходит под термином «факторинг».
2. Необходимость компенсировать различия для подгрупп в
уровнях ответов. Даже если выборка является репрезентативной
для большей части генеральной совокупности, различия в уровнях ответов часто приводят к системным расхождениям между
параметрами генеральной совокупности и их оценками по выборке. Например, в индивидуальном интервью количество членов семьи может быть связано с вероятностью предоставления
домохозяйством запрошенной информации. Различия в уровнях полученных ответов внутри подгрупп выборки, как правило, производят системную ошибку оценки. Цель взвешивания –
уменьшить эту ошибку.
1
Например, исследование с напряженной выборкой по регионам («перенапряжение» для Москвы и Московской области или «омоложение» выборки и т. д.).
2
Equal probability sampling (англ.).
108

IV. Взвешивание данных
3. Необходимость компенсировать нестабильность параметров генеральной совокупности. Скажем, если какой-то регион
является более представленным в выборочном исследовании,
можно использовать дополнительные данные (например, по
переписи населения) для выравнивания выборки с распределением параметров в генеральной совокупности. Кроме того,
выравнивание данных с известными значениями генеральной
совокупности может уменьшить влияние выпадающих единиц
(неполного диапазона данных) на выборочные оценки (например, пропуск лиц в домохозяйствах без телефонов при телефонном опросе и т. д.).
2. Процедуры взвешивания
Чаще всего взвешивание проводится в три этапа [81]. Пер-
вый имеет задачу компенсировать различия в отборе; второй –
различия по подгруппам в уровнях ответа; третий – различия
между оценками в выборке и параметрами в генеральной совокупности.
2.1. Первый этап: базис взвешивания
Первоначальный (базовый) вес (Wij) для каждого случая (например, лицо, домашнее хозяйство и др.) рассчитывается как значение, обратно пропорциональное вероятности отбора (Pri), т. е.
1
WPr (32)
ij
.
i
Любой приемлемый выбор единиц – независимо от того,
включены они в исследование или нет, – требует получать (базово) вес. Вероятность отбора (также называемая выборочным
уровнем – Sampling rate) – это механизм отбора единиц в выборку. При случайном телефонном опросе единицами генеральной
совокупности, соответственно и выборки, являются телефонные
109

Глава вторая. Методы поиска решений при неполном диапазоне данных выборки
номера. В одном телефонном исследовании Киш предположил
[81], что в некоем районе есть 150 квартальных телефонных (абонентских) станций (например, 863-ХХХХ). Если емкость каждой
из них составляет 10 000 возможных номеров, то для всех возможных телефонных номеров генеральная совокупность состоит
из 1 500 000. Если в выборку отобрано 1500 номеров (каждый с
одинаковой вероятностью), то вероятность выбора отдельного
случая равна 0,001 (1500/1 500 000).
И выборка, и генеральная совокупность, из которой мы извлекаем единицы, содержат кроме частных, которые на самом
деле исключительно подходят для конкретного исследования, нерабочие и служебные телефоны. Если единицей исследуемой совокупности являются фирмы, службы, то выбор происходит, наоборот, из последних.
Для стратифицированных выборок соответствующая им генеральная совокупность сначала делится на подгруппы (так называемые страты), в каждой из которых извлекаются отдельные
подвыборки (формирующие общую для генеральной совокупности выборку). На практике часто для разных страт используются
разные выборочные вероятности, т. е. отбор непропорциональный. Например, регион исследования может быть разделен на части в зависимости от частоты использования жителями различных видов транспорта. Население городских районов может быть
представлено в выборках так, чтобы значительно увеличить подвыборку с количеством респондентов, которые ходят пешком, используют велосипеды или общественный транспорт. Выборочная
модель может быть реализована, чтобы обеспечить автономные
оценки для описанных разных субрегионов. Если телефонные номера в отдельных кварталах есть объекты различного выборочного уровня, то тогда отдельные вероятности выбора рассчитываются для каждого квартала отдельно. Киш показывает, как это
можно сделать (табл. 21).
110
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
