Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Проблемы оптимизации выборочных данных с неполнотой в диапазоне. Монография

.pdf
Скачиваний:
0
Добавлен:
07.09.2026
Размер:
1 Мб
Скачать
I. Разработка методов оптимизации при отсутствующих данных
к определенной территории (окрестности, область); xij является значением одного и того же признака в наблюдаемых случаях, т.е. случаи, о которых имеются данные исследования; β – константа (коэффициент регрессии), измеряющая связь между yij и харак­теристикой, к которой относится домашнее хозяйство (арендная плата, стоимость жилья и т. д.); εij – влияние случайных факторов на изучаемый признак (y).
Для использования этого метода на практике достаточно вы­числить только приблизительные оценки μ, ai и β. После этого остаются только чисто технические операции, чтобы приемле­мым образом удовлетворить требования к восстановлению ба­ланса в данных выборки. Один частный случай описанного ме­тода – это когда отсутствует возможность оценить ai и βi. Тогда следует предположение о том, что ai = 0 и βi = 0. Оценки yi прини­маются равными средней по всей совокупности. Как мы увидим, этот метод несет определенные риски и имеет нежелательные по­следствия для оценок yi и случайной ошибки.
Другой вариант метода, довольно привычный для практи­ки, заключается в том, что мы исследуем соседей с неисследо­ванными лицами из того же района (микрорайона, квартала и т. д.). Тогда эти домохозяйства включаются в выборку два или более раз. Таким образом, на самом деле заменяются «потерян­ные» данные, и в этом методе осуществляется грубая оценка μ и ai, но при предположении, что β = 0. Если мы удачно выбрали соседа (соседнюю единицу) с аналогичным значением Xij, нет необходимости вычислять ai и β, они окажутся неявно оценен­ными.
Основное преимущество рассматриваемого метода и его ва­риаций заключается в том, что он обеспечивает недостающие ха­рактеристики баланса без необходимости сложных вычислений и без использования значений ai и β. Отметим, что если значение
Xij не берется во внимание и β предположительно равно нулю, то
91
Глава вторая. Методы поиска решений при неполном диапазоне данных выборки
(24) проблема заключается в оценке μ. Для этого используется со­ответствующая формула:
n
где
n
ности,

Y
i
– относительная доля выборки из генеральной совокуп-
1
n
– количество наблюдаемых единиц, а разница
i
n

n
ij
i
(),
(25)
1
n
i
nn
ii
1
Y
единицы, для которых информация отсутствует.
Не углубляясь в детальное обсуждение недостатков и пре­имуществ метода с дублированием единиц при прямой оцен­ке или при использовании влияния, отметим лишь, что метод достаточно примитивен и приблизителен. И обоснованность результатов в нем в наибольшей степени зависит от обосно­ванности заявленных допущений. К сожалению, в специальной литературе исследования в этом отношении до сих пор относи­тельно скудны.
2. Оценка как функция сопротивления
Другой метод оценки потерянных данных основан на пред­положении, что значение наблюдаемых характеристик функци­онально связано с трудностями наблюдения. В этом методе ис­пользуются оценки среднего значения (Y
), полученные при более
k
чем одном посещении (при опросе через интервью) или ответе на вопросы (при заполнении анкеты). Скажем, из оценок при трех последовательных посещениях (опросах) мы оцениваем недоста­ющие значения, ожидаемые при последующих посещениях. И да­лее после оценки потерянных значений получается общая оцен­ка
. Метод не лишен определенной привлекательности, но если
Y
i
процент потерянных данных велик, опасность ошибки на отдель­ных стадиях оценки (повторные посещения) значительна и не должна игнорироваться.
92
I. Разработка методов оптимизации при отсутствующих данных
3. Оценка с помощью вероятности потерь
Метод был предложен Хартли и впоследствии доработан По­литцем и Саймонсом. Он интересен тем, что повторный отбор выборочных единиц не требуется. Джессен [7] упоминает, что исследования в этот период показывают: если обратить внимание на финансовые ресурсы, рассматриваемый метод может конкури­ровать со стандартным методом, но на самом деле он не превос­ходит последний. Однако рассматриваемый метод обладает опре­деленными преимуществами, если исследование должно быть проведено в течение короткого времени.
Предположим, что исследование домохозяйств проводится в точно определенные часы (например, с 18 до 19 часов) в те­чение недели. Домохозяйства выбираются случайным образом и исследуются в случайном порядке. Если респондент дома, то собеседование проводится в обычном порядке. Однако воз­никает дополнительный вопрос: «В течение прошлой недели сколько вечеров в это время вы были дома?» Если во всех до­мохозяйствах были дома в течение одной или нескольких но­чей на прошлой неделе, считается, что вероятность безопасного
интервью для каждого домохозяйства равна
k
, где k означает
K
количество вечеров, проведенных дома, K – общее количество вечеров.
Оценка суммарного значения (y) для выборки может быть определена по формуле (26). Из нее видно, что речь идет о взве-
K
шенных оценках со значением
:
k
где
11
(),
k
K
(26)
k
Ynky
1
y
– выборочная средняя для К-й группы домохозяйств.
k
K
k
1
93
Глава вторая. Методы поиска решений при неполном диапазоне данных выборки
Оценка ,Y
согласно [108], определяется как отношение вида
1
yk
1
nk
Y
ps
,
k
,
(27)
1
nk
k
где n’ k – число случаев (единиц) выборки, участвующих в исследо­вании и отнесенных к группе K. Поскольку эта оценка представ­ляет собой отношение двух случайных переменных, она является в некоторой степени смещенной. Однако для достаточно больших выборок смещение не представляет серьезной опасности. Что вы­зывает опасения, так это величина дисперсии. Последняя, в свою очередь, находится в обратной зависимости от объема выборки (n).
4. Повторный отбор
при выпадающих (отсутствующих) единицах
Этот метод был разработан Хансеном и Хорвитцем [72] и в основе своей является разновидностью двойного отбора. В зна­чительной степени этот подход представляет собой сочетание ме­тодов сбора индивидуальной информации и поиск компромисса между затратами и потерей информации.
Подход основан на идее повторного исследования с допол­нительной выборкой. Исследование проводится обычным спо­собом. При большой доле потерянных данных общее количество опрошенных случаев значительно увеличивается и, естествен­но, возникает проблема эффективности. Вместо этого можно использовать альтернативные способы измерения потерянных данных. У большинства из них – с большими задержками ре­зультатов. Тогда проблема заключается в том, как организовать исследование, чтобы оптимально распределить ресурсы време­ни и средств между первоначальным и последующим исследо­ваниями.
94
I. Разработка методов оптимизации при отсутствующих данных
Например, если необходимо провести исследование по почте, но обоснованно предполагается, что можно ожидать большое ко­личество неответивших лиц. Чтобы уменьшить возникающие в связи с этим неприятности, исследователь выделяет часть ресур­сов для проведения интервью по подвыборке из не отвечавших респондентов по почте, с целью определения их характеристик.
Окончательная оценка будет проведена по объемам двух вы­борок – nR и nNR следующим образом:
1
l l l
YnYnY
нн R NR
(),
.
RNR
n
(28)
где n – объем выборки в фазе I, т. е. количество отправленных по почте вопросников;
n
– количество ответов, т. е. количество анкет, возвращен-
R
ных по почте;
nNR – количество отказов:
n = nR + nNR;
Y – среднее значение по данным ответчиков;
R
Y
среднее значение для выборки неответивших респон-
NR
дентов объемом r.
1
YY
NR
r
r
.
(29)
i
i
1
При отсутствии отказов на ответы во время интервью оценка
(28) сводится к невесомой средней оценке (
Y
).
Дисперсия этой оценки равна
где k = n
22
()( ) ( ) ,
yWS

í í NR NR
/r – отношение числа неответивших лиц nNR и участво-
NR
NnS k
..
2

Nn n
1
(30)
вавших в последнем интервью по почте r; WNR – доля неответив­ших лиц в общем объеме выборки, а S
2
– дисперсия их среднего
NR
значения.
95
Глава вторая. Методы поиска решений при неполном диапазоне данных выборки
Если неответившие лица отсутствуют, второй член в выраже­нии отпадает и (30) сводится к стандартному методу дисперсии при простой случайной выборке. Второй член в правой части вы­ражения представляет собой дополнительную дисперсию, связан­ную с выборкой не ответивших по почте. Хансен и Хорвитц [73] решили задачу оптимального выбора n и k, когда известны еди- ничные затраты и общий бюджет исследования.
Если S
2
= S2 или выполняется приблизительное равенство,
NR
то оптимальное значение k равно
cW
k
opt
ccW
01
NR R
,
(31)
R
где это единичные затраты на получение и обработку наблюде­ний для не ответивших по почте, соответственно c
, c1 – это еди-
0
ничные затраты на отправку анкеты по почте и обработку от­ветов; WR – это доля тех, кто ответил по почте, а произведение
c
×WR – ожидаемые единичные затраты на получение и обра-
NR
ботку неотвеченных (так как WR = 1 – WNR), c0 + c1WR – ожидае­мые единичные затраты на получение и обработку ответов. Сле­довательно, k затратами двух частей выборки. Большие значения k
является квадратным корнем отношения между
opt
оказыва-
opt
ются подходящими только тогда, когда различия в расходах до­статочно велики.
Чтобы избежать неизвестных и вызывающих тревогу изме­нений, целесообразно провести определенный повторный отбор, выбрав некоторые оптимальные значения для К > 1. Преимуще- ство метода заключается прежде всего в возможности оптимиза­ции затрат на проведение исследования, а также в том, что при проведении интервью среди части неотвечавших набирается цен­ная информация о фактическом распределении этой части вы­борки.
96
I. Разработка методов оптимизации при отсутствующих данных
5. Выпадающие единицы как подвыборка
Киш и Гесс [82] доказали, что там, где исследование прово­дится неоднократно (например, панельные, лонгитюдинальные исследования), «неотвечающие» могут формировать отдельную группу. Информация по ним, собираемая специальными метода­ми, накапливается и используется в текущих исследованиях.
Для подобных регулярных исследований в специальной литературе отмечено1, что раннее отделение «неответивших» должно содержать постоянную долю от изучаемых единиц в текущий момент времени, и все текущие наблюдения должны осуществляться при одном контакте, т. е. без повторного посе­щения. Впрактике используется и другая разновидность этого подхода, которая начинается с предположения, что лица неуча­ствовавшие и неответившие могут рассматриваться как случай- ная выборка для сравнения общего количества неответивших и ответивших. Число неучаствовавших и неответивших компен­сируется дублированием информации [11]. Это относительно простая операция после того, как индивидуальная информация собрана и записана.
В данном случае достоверность информации по рассматрива­емой совокупности остается сохраненной лишь в той мере, в ка­кой предположение дублированной информации действительно является адекватным отражением неучаствовавших и неответив­ших при проведении исследования в поле. К сожалению, прак­тика показывает, что это редко реализуется таким образом. По крайней мере, до сих пор нет никаких аргументированных проце­дур проверки заложенного в основу предположения. Как мы уже упоминали выше, подобный подход таит в себе опасность генера­ции ошибок в обобщенных оценках.
1
Пример показан Джессеном [7].
97
Глава вторая. Методы поиска решений при неполном диапазоне данных выборки
II. Контрольные методы снижения
потерь данных
Средства для снижения относительной доли неучаство­вавших и неответивших также ищут с помощью различных методов контроля. Эти методы влияют, с одной стороны, на процедуры проектирования и организации подготовки эм­пирических исследований, а с другой – на методы и действия при сборе индивидуальной информации в поле. Они очень разнообразны, и это связано прежде всего с типом допущен­ных ошибок, среди которых преобладают потери из-за выпа­дающих значений вследствие отсутствия респондентов у себя дома.
Методы контроля можно подразделить на несколько основ­ных групп:
1. Сравнение списка генеральной совокупности (рабочий
список) с другими списками, составленными по другим поводам и для других целей (верификационные списки).
Для населения чаще всего таким другим списком могут быть списки системы МВД, Госстата и ЗАГСа. При этом важно, чтобы список, взятый для сверки, был актуальным и точным.
Сравнение рабочего и верификационного списка может быть полным и выборочным. Когда выявленные ошибки сравне­ния при выборочном подходе превышают определенный мини­мум (например, 4–5 %), можно принять решение о проведении полной проверки. Формирование выборки для сравнения мо­жет происходить путем случайного отбора. Последнее позво­ляет сделать случайную оценку выявленных ошибок сравнения. При использовании списков системы регистрации гражданского состояния следует иметь в виду, что существует определенный риск ошибок, потому что при регистрации граждан эта система
98
II. Контрольные методы снижения потерь данных
не всегда обновляется, так как она не особенно гибкая и эффек­тивная1.
2. Актуализация списка генеральной совокупности данных
из определенных источников информации.
Последние могут быть должностными лицами, которые мо­гут предоставить необходимую информацию (главы админи­страций и т. д.); обновление также может быть выборочным, что зависит от времени, средств и исполнителей. При актуализации есть возможность расширить проверку не только по адресным данным (ФИО, населенный пункт, улица, номер, квартира и т. д.), но и по другим признакам (пол, возраст, образование, социальная принадлежность и др.).
3. Сравнение списка выборочной совокупности со списком
генеральной совокупности, из которого была сформирована вы­борка для эмпирических социологических исследований.
Это, так сказать, последняя проверка выборки, прежде чем идти в поле. Таким образом достигается полная уверенность в том, что выборочная совокупность правильно извлечена, т. е. что отбор был осуществлен в соответствии с запланированной моде­лью и объемом выборки и были устранены ошибки, допущенные по причине небрежности, неполноты и замены. По усмотрению исследователя сравнение двух списков может быть полным (в ряде случаев это лучшее решение) или выборочным.
4. Повторный методический контакт с назначенными для
исследования лицами.
Это контроль, который осуществляется в полевых условиях в ходе проведения эмпирических социологических исследований или через некоторое время после их завершения. Цель повтор-
1
Нельзя не упомянуть об участившихся проблемах, связанных с практикой по­лучения «случайных выборок по адресным спискам» с нарушенной структу­рой: недостаточное и чрезмерное представление отдельных социально-демо­графических характеристик (возраст, этническая принадлежность и т. д.).
99
Глава вторая. Методы поиска решений при неполном диапазоне данных выборки
ного контакта – выяснить, действительно ли определенная для исследования единица была посещена интервьюером. Формы контроля многообразны – например, запрос человеку о том, по­сещали ли его в указанном интервале времени для проведения исследования. Часто причины расширяются – устанавливаются различные факторы и условия, которые действовали при прове­дении исследования и имеют значение для достоверности инфор­мации и т. д.
В своей стандартной форме повторный контакт может быть исчерпывающим для всей выборки. При использовании расширен­ной формы с развернутыми методическими задачами готовится специальный вопросник, а затем его выборочно проверяют. Из вы­борки для эмпирических исследований делается подвыборка, и по­вторный методический контроль превращается в небольшое иссле­дование в дополнение к основному, с собственной организацией и аппаратом, отдельными средствами его осуществления. Конечно, методическое исследование времени, территории и выполнения вплетается в организацию основного эмпирического исследова­ния, чтобы не создавать трудностей для его успешного проведения.
5. Сравнение испытуемых лиц в полевых исследованиях
(их анкет) со списком выборочной совокупности.
Эта проверка проводится, когда материалы эмпирических социологических исследований были получены исследователем и нужно подготовить их к механической обработке. В списке вы­борочной совокупности для каждой единицы указан пункт так называемых идентификационных кодов. Последние представля­ют собой закодированную информацию о единице (порядковый номер в списке, место нахождения, другие данные – пол, соци­альная принадлежность и др.), на основании которой она может быть идентифицирована в списке выборочной совокупности. Те же коды записываются и вверху анкеты для исследуемой анкете­ром единицы.
100
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]