Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Проблемы оптимизации выборочных данных с неполнотой в диапазоне. Монография
.pdf
I. Разработка методов оптимизации при отсутствующих данных
к определенной территории (окрестности, область); xij является
значением одного и того же признака в наблюдаемых случаях, т.е.
случаи, о которых имеются данные исследования; β – константа
(коэффициент регрессии), измеряющая связь между yij и характеристикой, к которой относится домашнее хозяйство (арендная
плата, стоимость жилья и т. д.); εij – влияние случайных факторов
на изучаемый признак (y).
Для использования этого метода на практике достаточно вычислить только приблизительные оценки μ, ai и β. После этого
остаются только чисто технические операции, чтобы приемлемым образом удовлетворить требования к восстановлению баланса в данных выборки. Один частный случай описанного метода – это когда отсутствует возможность оценить ai и βi. Тогда
следует предположение о том, что ai = 0 и βi = 0. Оценки yi принимаются равными средней по всей совокупности. Как мы увидим,
этот метод несет определенные риски и имеет нежелательные последствия для оценок yi и случайной ошибки.
Другой вариант метода, довольно привычный для практики, заключается в том, что мы исследуем соседей с неисследованными лицами из того же района (микрорайона, квартала и
т. д.). Тогда эти домохозяйства включаются в выборку два или
более раз. Таким образом, на самом деле заменяются «потерянные» данные, и в этом методе осуществляется грубая оценка μ
и ai, но при предположении, что β = 0. Если мы удачно выбрали
соседа (соседнюю единицу) с аналогичным значением Xij, нет
необходимости вычислять ai и β, они окажутся неявно оцененными.
Основное преимущество рассматриваемого метода и его вариаций заключается в том, что он обеспечивает недостающие характеристики баланса без необходимости сложных вычислений и
без использования значений ai и β. Отметим, что если значение
Xij не берется во внимание и β предположительно равно нулю, то
91

Глава вторая. Методы поиска решений при неполном диапазоне данных выборки
(24) проблема заключается в оценке μ. Для этого используется соответствующая формула:
n
где
n
ности,
Y
i
– относительная доля выборки из генеральной совокуп-
1
n
– количество наблюдаемых единиц, а разница
i
n
n
ij
i
(),
(25)
1
n
i
nn
ii
1
–
Y
единицы, для которых информация отсутствует.
Не углубляясь в детальное обсуждение недостатков и преимуществ метода с дублированием единиц при прямой оценке или при использовании влияния, отметим лишь, что метод
достаточно примитивен и приблизителен. И обоснованность
результатов в нем в наибольшей степени зависит от обоснованности заявленных допущений. К сожалению, в специальной
литературе исследования в этом отношении до сих пор относительно скудны.
2. Оценка как функция сопротивления
Другой метод оценки потерянных данных основан на предположении, что значение наблюдаемых характеристик функционально связано с трудностями наблюдения. В этом методе используются оценки среднего значения (Y
), полученные при более
k
чем одном посещении (при опросе через интервью) или ответе на
вопросы (при заполнении анкеты). Скажем, из оценок при трех
последовательных посещениях (опросах) мы оцениваем недостающие значения, ожидаемые при последующих посещениях. И далее после оценки потерянных значений получается общая оценка
. Метод не лишен определенной привлекательности, но если
Y
i
процент потерянных данных велик, опасность ошибки на отдельных стадиях оценки (повторные посещения) значительна и не
должна игнорироваться.
92

I. Разработка методов оптимизации при отсутствующих данных
3. Оценка с помощью вероятности потерь
Метод был предложен Хартли и впоследствии доработан Политцем и Саймонсом. Он интересен тем, что повторный отбор
выборочных единиц не требуется. Джессен [7] упоминает, что
исследования в этот период показывают: если обратить внимание
на финансовые ресурсы, рассматриваемый метод может конкурировать со стандартным методом, но на самом деле он не превосходит последний. Однако рассматриваемый метод обладает определенными преимуществами, если исследование должно быть
проведено в течение короткого времени.
Предположим, что исследование домохозяйств проводится
в точно определенные часы (например, с 18 до 19 часов) в течение недели. Домохозяйства выбираются случайным образом
и исследуются в случайном порядке. Если респондент дома, то
собеседование проводится в обычном порядке. Однако возникает дополнительный вопрос: «В течение прошлой недели
сколько вечеров в это время вы были дома?» Если во всех домохозяйствах были дома в течение одной или нескольких ночей на прошлой неделе, считается, что вероятность безопасного
интервью для каждого домохозяйства равна
k
, где k означает
K
количество вечеров, проведенных дома, K – общее количество
вечеров.
Оценка суммарного значения (y) для выборки может быть
определена по формуле (26). Из нее видно, что речь идет о взве-
K
шенных оценках со значением
:
k
где
11
(),
k
K
(26)
k
Ynky
1
y
– выборочная средняя для К-й группы домохозяйств.
k
K
k
1
93

Глава вторая. Методы поиска решений при неполном диапазоне данных выборки
Оценка ,Y
согласно [108], определяется как отношение вида
1
yk
1
nk
Y
ps
,
k
,
(27)
1
nk
k
где n’ k – число случаев (единиц) выборки, участвующих в исследовании и отнесенных к группе K. Поскольку эта оценка представляет собой отношение двух случайных переменных, она является
в некоторой степени смещенной. Однако для достаточно больших
выборок смещение не представляет серьезной опасности. Что вызывает опасения, так это величина дисперсии. Последняя, в свою
очередь, находится в обратной зависимости от объема выборки (n).
4. Повторный отбор
при выпадающих (отсутствующих) единицах
Этот метод был разработан Хансеном и Хорвитцем [72] и в
основе своей является разновидностью двойного отбора. В значительной степени этот подход представляет собой сочетание методов сбора индивидуальной информации и поиск компромисса
между затратами и потерей информации.
Подход основан на идее повторного исследования с дополнительной выборкой. Исследование проводится обычным способом. При большой доле потерянных данных общее количество
опрошенных случаев значительно увеличивается и, естественно, возникает проблема эффективности. Вместо этого можно
использовать альтернативные способы измерения потерянных
данных. У большинства из них – с большими задержками результатов. Тогда проблема заключается в том, как организовать
исследование, чтобы оптимально распределить ресурсы времени и средств между первоначальным и последующим исследованиями.
94

I. Разработка методов оптимизации при отсутствующих данных
Например, если необходимо провести исследование по почте,
но обоснованно предполагается, что можно ожидать большое количество неответивших лиц. Чтобы уменьшить возникающие в
связи с этим неприятности, исследователь выделяет часть ресурсов для проведения интервью по подвыборке из не отвечавших
респондентов по почте, с целью определения их характеристик.
Окончательная оценка будет проведена по объемам двух выборок – nR и nNR следующим образом:
1
l l l
YnYnY
нн R NR
(),
.
RNR
n
(28)
где n – объем выборки в фазе I, т. е. количество отправленных по
почте вопросников;
n
– количество ответов, т. е. количество анкет, возвращен-
R
ных по почте;
nNR – количество отказов:
n = nR + nNR;
Y – среднее значение по данным ответчиков;
R
Y
– среднее значение для выборки неответивших респон-
NR
дентов объемом r.
1
YY
NR
r
r
.
(29)
i
i
1
При отсутствии отказов на ответы во время интервью оценка
(28) сводится к невесомой средней оценке (
Y
).
Дисперсия этой оценки равна
где k = n
22
()( ) ( ) ,
yWS
í í NR NR
/r – отношение числа неответивших лиц nNR и участво-
NR
NnS k
..
2
Nn n
1
(30)
вавших в последнем интервью по почте r; WNR – доля неответивших лиц в общем объеме выборки, а S
2
– дисперсия их среднего
NR
значения.
95

Глава вторая. Методы поиска решений при неполном диапазоне данных выборки
Если неответившие лица отсутствуют, второй член в выражении отпадает и (30) сводится к стандартному методу дисперсии
при простой случайной выборке. Второй член в правой части выражения представляет собой дополнительную дисперсию, связанную с выборкой не ответивших по почте. Хансен и Хорвитц [73]
решили задачу оптимального выбора n и k, когда известны еди-
ничные затраты и общий бюджет исследования.
Если S
2
= S2 или выполняется приблизительное равенство,
NR
то оптимальное значение k равно
cW
k
opt
ccW
01
NR R
,
(31)
R
где это единичные затраты на получение и обработку наблюдений для не ответивших по почте, соответственно c
, c1 – это еди-
0
ничные затраты на отправку анкеты по почте и обработку ответов; WR – это доля тех, кто ответил по почте, а произведение
c
×WR – ожидаемые единичные затраты на получение и обра-
NR
ботку неотвеченных (так как WR = 1 – WNR), c0 + c1WR – ожидаемые единичные затраты на получение и обработку ответов. Следовательно, k
затратами двух частей выборки. Большие значения k
является квадратным корнем отношения между
opt
оказыва-
opt
ются подходящими только тогда, когда различия в расходах достаточно велики.
Чтобы избежать неизвестных и вызывающих тревогу изменений, целесообразно провести определенный повторный отбор,
выбрав некоторые оптимальные значения для К > 1. Преимуще-
ство метода заключается прежде всего в возможности оптимизации затрат на проведение исследования, а также в том, что при
проведении интервью среди части неотвечавших набирается ценная информация о фактическом распределении этой части выборки.
96

I. Разработка методов оптимизации при отсутствующих данных
5. Выпадающие единицы как подвыборка
Киш и Гесс [82] доказали, что там, где исследование проводится неоднократно (например, панельные, лонгитюдинальные
исследования), «неотвечающие» могут формировать отдельную
группу. Информация по ним, собираемая специальными методами, накапливается и используется в текущих исследованиях.
Для подобных регулярных исследований в специальной
литературе отмечено1, что раннее отделение «неответивших»
должно содержать постоянную долю от изучаемых единиц в
текущий момент времени, и все текущие наблюдения должны
осуществляться при одном контакте, т. е. без повторного посещения. Впрактике используется и другая разновидность этого
подхода, которая начинается с предположения, что лица неучаствовавшие и неответившие могут рассматриваться как случай-
ная выборка для сравнения общего количества неответивших и
ответивших. Число неучаствовавших и неответивших компенсируется дублированием информации [11]. Это относительно
простая операция после того, как индивидуальная информация
собрана и записана.
В данном случае достоверность информации по рассматриваемой совокупности остается сохраненной лишь в той мере, в какой предположение дублированной информации действительно
является адекватным отражением неучаствовавших и неответивших при проведении исследования в поле. К сожалению, практика показывает, что это редко реализуется таким образом. По
крайней мере, до сих пор нет никаких аргументированных процедур проверки заложенного в основу предположения. Как мы уже
упоминали выше, подобный подход таит в себе опасность генерации ошибок в обобщенных оценках.
1
Пример показан Джессеном [7].
97

Глава вторая. Методы поиска решений при неполном диапазоне данных выборки
II. Контрольные методы снижения
потерь данных
Средства для снижения относительной доли неучаствовавших и неответивших также ищут с помощью различных
методов контроля. Эти методы влияют, с одной стороны, на
процедуры проектирования и организации подготовки эмпирических исследований, а с другой – на методы и действия
при сборе индивидуальной информации в поле. Они очень
разнообразны, и это связано прежде всего с типом допущенных ошибок, среди которых преобладают потери из-за выпадающих значений вследствие отсутствия респондентов у себя
дома.
Методы контроля можно подразделить на несколько основных групп:
1. Сравнение списка генеральной совокупности (рабочий
список) с другими списками, составленными по другим поводам
и для других целей (верификационные списки).
Для населения чаще всего таким другим списком могут быть
списки системы МВД, Госстата и ЗАГСа. При этом важно, чтобы
список, взятый для сверки, был актуальным и точным.
Сравнение рабочего и верификационного списка может
быть полным и выборочным. Когда выявленные ошибки сравнения при выборочном подходе превышают определенный минимум (например, 4–5 %), можно принять решение о проведении
полной проверки. Формирование выборки для сравнения может происходить путем случайного отбора. Последнее позволяет сделать случайную оценку выявленных ошибок сравнения.
При использовании списков системы регистрации гражданского
состояния следует иметь в виду, что существует определенный
риск ошибок, потому что при регистрации граждан эта система
98

II. Контрольные методы снижения потерь данных
не всегда обновляется, так как она не особенно гибкая и эффективная1.
2. Актуализация списка генеральной совокупности данных
из определенных источников информации.
Последние могут быть должностными лицами, которые могут предоставить необходимую информацию (главы администраций и т. д.); обновление также может быть выборочным, что
зависит от времени, средств и исполнителей. При актуализации
есть возможность расширить проверку не только по адресным
данным (ФИО, населенный пункт, улица, номер, квартира и т. д.),
но и по другим признакам (пол, возраст, образование, социальная
принадлежность и др.).
3. Сравнение списка выборочной совокупности со списком
генеральной совокупности, из которого была сформирована выборка для эмпирических социологических исследований.
Это, так сказать, последняя проверка выборки, прежде чем
идти в поле. Таким образом достигается полная уверенность в
том, что выборочная совокупность правильно извлечена, т. е. что
отбор был осуществлен в соответствии с запланированной моделью и объемом выборки и были устранены ошибки, допущенные
по причине небрежности, неполноты и замены. По усмотрению
исследователя сравнение двух списков может быть полным (в
ряде случаев это лучшее решение) или выборочным.
4. Повторный методический контакт с назначенными для
исследования лицами.
Это контроль, который осуществляется в полевых условиях
в ходе проведения эмпирических социологических исследований
или через некоторое время после их завершения. Цель повтор-
1
Нельзя не упомянуть об участившихся проблемах, связанных с практикой получения «случайных выборок по адресным спискам» с нарушенной структурой: недостаточное и чрезмерное представление отдельных социально-демографических характеристик (возраст, этническая принадлежность и т. д.).
99

Глава вторая. Методы поиска решений при неполном диапазоне данных выборки
ного контакта – выяснить, действительно ли определенная для
исследования единица была посещена интервьюером. Формы
контроля многообразны – например, запрос человеку о том, посещали ли его в указанном интервале времени для проведения
исследования. Часто причины расширяются – устанавливаются
различные факторы и условия, которые действовали при проведении исследования и имеют значение для достоверности информации и т. д.
В своей стандартной форме повторный контакт может быть
исчерпывающим для всей выборки. При использовании расширенной формы с развернутыми методическими задачами готовится
специальный вопросник, а затем его выборочно проверяют. Из выборки для эмпирических исследований делается подвыборка, и повторный методический контроль превращается в небольшое исследование в дополнение к основному, с собственной организацией и
аппаратом, отдельными средствами его осуществления. Конечно,
методическое исследование времени, территории и выполнения
вплетается в организацию основного эмпирического исследования, чтобы не создавать трудностей для его успешного проведения.
5. Сравнение испытуемых лиц в полевых исследованиях
(их анкет) со списком выборочной совокупности.
Эта проверка проводится, когда материалы эмпирических
социологических исследований были получены исследователем и
нужно подготовить их к механической обработке. В списке выборочной совокупности для каждой единицы указан пункт так
называемых идентификационных кодов. Последние представляют собой закодированную информацию о единице (порядковый
номер в списке, место нахождения, другие данные – пол, социальная принадлежность и др.), на основании которой она может
быть идентифицирована в списке выборочной совокупности. Те
же коды записываются и вверху анкеты для исследуемой анкетером единицы.
100
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
