Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Проблемы оптимизации выборочных данных с неполнотой в диапазоне. Монография

.pdf
Скачиваний:
0
Добавлен:
07.09.2026
Размер:
1 Мб
Скачать
III. Влияние неполного диапазона данных на достоверность и точность оценок
pq
1, 96 ,
Dn
11
(23)
где D – полуширина доверительного интервала (выше показана ширина доверительного интервала); nε – эквивалентный объем выборки при предположении полноты диапазона неполного диа­пазона данных, т. е. W
= 0.
2
При p1 = 5 % и W2 = 5 % ширина доверительного интервала для P составляет 11,1 – 3,4 = 7,7, а ее половина D = 3,85. Если заменить ее формулой (21) и решить относительно nε, получа­ется, что для обеспечения такой же ширины доверительного интервала для P, но при W2 = 0 достаточно исследовать 123 че­ловека вместо 1000. При W2 = 10 % соответствующий размер уменьшится до 46 человек, т. е. по сравнению с nε при W2 = 5 % эквивалентный объем выборки уменьшился более чем в 2,5 раза (для преодоления возможных проблем с обоими влияниями – случайной и системной ошибками, связанными с исследуемым явлением).
Каковы приблизительные масштабы пробелов диапазона данных в проводимых эмпирических исследованиях?
Чтобы проиллюстрировать проблему, используем результа­ты контрольного пересчета полноты охвата диапазона данных при переписи населения. Несмотря на некоторые специфиче­ские черты объекта переписи (использование групп постоянно присутствующих, временно отсутствующих и временно прожи­вающих лиц и возможность подсчета одного и того же лица бо­лее одного раза в разных населенных пунктах), ее организация и методика во многом соответствуют эмпирическим исследова­ниям. Более того, известно, что при подсчете требуются квали­фицированные усилия и высокая профессиональная подготовка анкетерского состава. Создается специальная организация для работы в поле. Подготовка инструментария начинается задолго
81
Глава первая. Проблемы при неполном диапазоне данных в эмпирических исследованиях...
до выхода в поле и основывается на давних традициях и опы­те. Проводится пробное исследование для оценки достоверно­сти анкеты. В связи с этим подчеркнем, что не всегда при эм­пирических исследованиях предусмотрены условия, создающие предпосылки для высоконаучного уровня их подготовки, орга­низации и проведения. Поэтому, рассматривая результаты кон­трольного пересчета по полноте охвата при переписи населения, ориентировочно можно судить об ошибках диапазона и в эмпи­рических исследованиях, но только в сравнительном плане и с большей долей пессимизма.
Наиболее общие результаты контрольной переписи пока­зывают, что при переписи населения остались неучтенными 27000(±8700) человек, а дважды было опрошено 32 300 (±7850) лиц, т. е. была допущена чистая ошибка в +5300 человек, что по отношению к общей численности составляло 0,6 %. Общая чис­ленность населения завышена на 5300 человек. Пробелы полноты диапазона охвата также нашли свое отражение в распределениях опрошенных лиц по признакам, включенным в программу пере­писи. При контрольном пересчете это отражение по понятным причинам установлено лишь по некоторым признакам – полу, возрасту, месту жительства и т. д.
У мужчин на 1000 человек из-за ошибки в охвате диапазона было ошибочно приписано 12 человек, а у женщин – 9. В резуль­тате этих ошибок количество мужчин было завышено на 0,8 %, а женщин – на 0,2 %.
Частота ошибок, допущенных в охвате населения при пе­ресчете, значительно варьируется в зависимости от возраста лиц. Пропуски в охвате чаще встречаются среди молодых людей, что логично ожидать, поскольку у них миграционные процессы зна­чительно более интенсивны. Данные табл. 19 и 20 демонстрируют эти выводы.
82
III. Влияние неполного диапазона данных на достоверность и точность оценок
Таблица 19
Выпадающие единицы в диапазонах данных по возрастным группам
Возраст Выпадающие единицы в диапазоне данных
до 5 лет 23 ‰
5–15 лет 7,8 ‰
15–25 лет 23,2 ‰
25–35 лет 9,7 ‰
35–75 лет 3,0–6,3 ‰
старше 75 лет 8,6 ‰
В результате компенсации между неучтенными и учтенными дважды увеличение численности населения в возрастных группах составило:
Таблица 20
Значения пробелов в диапазонах данных по возрастным группам
Возраст Пробелы в диапазоне данных
до 5 лет с 5,6 ‰
15–25 лет с 0,7 ‰
25–35 лет с 0,9 ‰
старше 75 лет с 1,5 ‰
В остальных возрастных группах численность понизилась с 0,2 до 0,6 %.
Отмечается тенденция к увеличению числа лиц в более млад­ших возрастных категориях (единственным исключением явля­ется завышение пожилых людей старше 75 лет) и снижение их в средних и старших возрастных группах (от 35 до 65 лет). Как под­черкивалось, эта тенденция объясняется более высокой мобиль­ностью молодых людей, которые отделяются от своих родителей (в том числе и маленькие дети для опеки за бабушками и дедуш-
83
Глава первая. Проблемы при неполном диапазоне данных в эмпирических исследованиях...
ками) и (или) отправляются учиться и работать в другие населен­ные пункты, с этим связано указание двух мест жительства.
Анализ этих и других данных позволил по контрольному пересчету полноты охвата сделать ряд предложений о принятии более специальных мер для правильного и более полного охвата населения при будущих переписях населения.
84
Глава вторая.
МЕТОДЫ ПОИСКА РЕШЕНИЙ
ПРИ НЕПОЛНОМ ДИАПАЗОНЕ ДАННЫХ ВЫБОРКИ
Как мы видели, в практике выборочных исследований всег­да присутствует проблема «недостающих данных»1. Правильно и точно смоделированная и извлеченная выборка, к сожалению, не является достаточной гарантией совпадения полученных выбо­рочных данных с параметрами генеральной совокупности в пре­делах принятой статистической точности (погрешности). Ранее указывалось, что различные этапы любого социологического ис­следования обременены множеством источников ошибок, кото­рые в конечном итоге приводят к различным по характеру и раз­меру отклонениям оценок от фактических значений2. Эти ошибки часто бывают настолько значительными, что не допускают пра­вильных обобщений в выводах, полученных по выборке, это, по сути, сводит на нет ее предназначение и смысл проведенной ра­боты. Большая беда в том, что мы не всегда отдаем себе отчет в серьезности последствий наличия систематических ошибок и, со­ответственно, не предпринимаем адекватных исследовательских стратегий, которые если не ликвидируют эти негативные послед­ствия, то хотя бы создают условия для их удержания в пределах
1
Помимо терминов «недостающие данные», «выпадающие данные», в литературе можно встретить также неохват, потерянные данные, неисследованные, необна­руженные единицы и т. д. В тексте мы используем в основном термины «недо­стающие», «потерянные данные» или «выпадающие данные» как синонимы.
2
См. подразделы II и III главы первой.
85
Глава вторая. Методы поиска решений при неполном диапазоне данных выборки
разумного минимума. Конечно, проблема борьбы с систематиче­скими (системными) ошибками максимально обширна, посколь­ку она присутствует на каждом этапе и в каждом компоненте процесса эмпирических исследований. Здесь мы ограничиваемся лишь одной их частью – ошибками, связанными с потерей дан­ных при сборе первичной социологической информации.
Определенно, пробелы и ошибки, возникающие в результа­те «неполного диапазона данных»1, являются результатом оши­бок из-за неполучения данных о части исследуемой совокуп­ности (о выпадающих единицах). Понятно, что финансовые и временные ограничения часто затрудняют поиск всех единиц выборки. Основной вопрос здесь заключается в том, когда и при каких условиях указанные единицы могут смещать результаты эмпирических исследований до такой степени, что они становят­ся неопределенными, неинформативными и не заслуживающими нашего доверия. И есть ли такой порог, до которого эти смещения и негативные последствия не беспокоят исследователей, но за его пределами возникают настоящие проблемы? Ответ на эти вопро­сы не однозначен. И для того, чтобы он был корректным, необхо­димо подвергнуть оценке несколько моментов:
1) относительная доля неохваченных (неответивших) лиц;
2) общие и специфические характеристики неохваченных (неответивших) лиц, сравнимые с характеристиками всей выбор­ки (и генеральной совокупности);
3) в том случае, если допустимый порог превышен, какими были бы не умозрительные, а реальные неблагоприятные воздей­ствия на правильность и обоснованность полученных оценок;
4) что можно было бы сделать практически для того, чтобы успешно решать обозначенные здесь проблемы.
1
Неполный диапазон данных – разница между планируемой и реализованной в поле выборкой.
86
Глава вторая. Методы поиска решений при неполном диапазоне данных выборки
Начнем с первого вопроса: относительная доля предусмотрен­ных проектом, но не охваченных исследованием лиц. Существует мнение (широко подкрепленное практикой эмпирических исследо­ваний), что, если доля лиц, для которых не собрана полностью или частично искомая информация, не превышает 10–15 %, оснований для беспокойства быть не должно. Как мы видели по результатам исследований, описанных ранее, это представление оказалось не­обоснованным. На самом деле даже при небольшой относительной доле негативного влияния точность искомых оценок может оказать­ся не пренебрежимо низкой. И фактически сделает эти оценки не­адекватными и неинформативными из-за слишком большого раз­мера системной ошибки, а также из-за произвольного увеличения размера случайной ошибки. С другой стороны, в отдельных случаях даже большая доля недостающих данных может не угрожать резуль­татам исследования. Однако этого можно ожидать в очень редких случаях, особенно в эмпирических социологических исследованиях.
Проблема интерпретации результатов выборки с неполным диапазоном вытекает прежде всего из вероятности того, что неот­ветившие лица существенно отличаются от ответивших по очень важным для исследователя характеристикам. При выборочных ис­следованиях с повторной волной (омнибусы, панельные или лон­гитюдинальные исследования) респонденты одной волны могут отличаться от респондентов другой неконтролируемым и неиз­вестным образом. Генезис этих различий не может быть объяснен только действием случайных факторов. Поэтому приходится ис­кать альтернативные решения, учитывающие это обстоятельство. Здесь мы фокусируемся на некоторых методах и процедурах, кото­рые в разной степени предлагают решение проблемы недостающих данных. Также будет изучен вопрос о том, в какой степени после применения подобных процедур исследователь имеет право интер­претировать данные как достаточно близкие к полученным из пол­ностью реализованной репрезентативной выборки.
87
Глава вторая. Методы поиска решений при неполном диапазоне данных выборки
I. Разработка методов оптимизации
при отсутствующих данных
Мы заранее уточним, что здесь акцент делается на методах, которые применяются после того, как индивидуальная первич­ная информация уже собрана, полевая работа завершена, иссле­дователь поставлен перед свершившимся фактом недостающих данных в диапазоне совокупности. Некоторые авторы называют эти процедуры «методами отладки в информационном массиве» [110]. Другие методы, связанные с недостающими данными диа­пазона, будут представлены только в общем плане. В историче­ском аспекте разработка методов исправления диапазона из-за недостающих (выпадающих) данных может быть разделена на не­сколько периодов.
Первый, 1960-е гг. – методы, определяющие выпадающие еди­ницы как выборку из выборки (Йейтс [12]) – через так называе­мое дублирование информации.
Второй, 1970-е гг. – появление различных ad hoc процедур: удаление случаев, взвешивание, единичная атрибуция (приписы­вание).
Третий, 1980-е гг. – процедуры оценки, основанные на ве­роятностных моделях и прямой оценке выпавших (утраченных) значений: алгоритм, ЕМ1 (максимизация ожиданий) и др.
Четвертый, 1990-е гг. – многомерная атрибуция значений не­достающих данных (Multiple Imputation), метод Монте-Карло с марковскими цепями (рядами), байесовскими методами и др.
Можно сказать, что за последние десятилетия достигнут значительный прогресс в разработке статистических методов
1
EM, или Expectation Maximization, в буквальном переводе означает «максими­зация ожиданий». Метод измеряет средние, ковариационные матрицы и кор­реляцию количественных переменных с отсутствующими значениями через итерацию. Более подробно рассмотрим алгоритм в подразделе V главы второй.
88
I. Разработка методов оптимизации при отсутствующих данных
оптимизации недостающих данных. В конце 1970-х гг. Демп­стер, Лэрд и Рубин [50] разработали и формализовали для этой цели алгоритм максимизации ожиданий (EM). Это вычисли­тельный метод для относительно эффективных оценок непол­ного массива данных. Исследователи доказали, что при боль­ших массивах данных EМ является не только полезным, но и единственно возможным методом поиска большого количества скорректированных оценок. Идея, лежащая в основе алгорит­ма, представляет собой фундаментальное изменение в наблю­дении исследователей за оценками недостающих данных. Ранее недостающие данные понимались скорее как неудобство, как то, от чего мы должны избавиться либо путем устранения слу­чаев, либо путем приписывания искусственных чисел. После продвижения алгоритма максимизации ожиданий исследова­тели начали рассматривать феномен «недостающих данных» как проблему, для которой можно искать более обоснован­ные альтернативные решения. В массивах с неполными дан­ными наблюдаемые значения используются прямо и косвенно для оценки возможных значений выпадающих (недостающих) единиц. Это обстоятельство сочеталось с «безошибочными», в соответствии с Шафером [120], предположениями (описанны­ми ниже). Конечная цель состоит в том, чтобы достичь оценок распределения и прогнозных величин для отсутствующих зна­чений. Последние могут быть выше средних1 в статистическом анализе, чтобы получить более обоснованные, а не просто «умозрительные» оценки того, что не было собрано при работе в поле.
1
Современные методы оптимизации недостающих данных учитывают это усреднение по-разному. Алгоритмы ЭМ выполняют усреднение детерминиро­ванным и неслучайным образом. Позже Рубин [115] развил многомерную па­радигму атрибуции, которая занимается усреднением посредством симуляции (Averaging via Simulation).
89
Глава вторая. Методы поиска решений при неполном диапазоне данных выборки
В своей классификации методов оптимизации недостающих данных Джессен [7] сформулировал два подхода (стратегии). По его словам, при наличии потери данных возможно:
1) ничего не предпринимать;
2) попытаться надлежащим образом уменьшить нежелатель-
ные эффекты потерянных данных.
«Ничего не делать» – самая простая форма адаптации к по­добной ситуации. Но обычно и чаще всего «что-то делается».
Для этого используется широкий спектр методов. Согласно тому же автору, последние можно разделить на четыре категории:
1) прямая оценка потерянных значений; 2) оценка вероятностей ответа с последующими оценками запрашиваемых данных; 3) от­сутствие ответа как задача двойного отбора; 4) другие методы.
Задачи, которые предстоит сформулировать и решить, требу­ют, чтобы эти группы методов были рассмотрены более подробно.
1. Прямая оценка отсутствующих значений
При применении этого метода выпавшие (отсутствующие) значения рассматриваются как функция тех же характеристик, которые наблюдались или были известны из других источников информации. Например, доход домохозяйства неизвестен, но из­вестно его нахождение (квартал, район и т. д.). Также известны параметры дома (аренда или оценочная стоимость дома). Пред­полагается, что между данными из других источников информа­ции и недостающими данными существует тесная корреляцион­ная связь. Это позволяет получить оценку утраченных значений, используя приблизительную и довольно упрощенную модель:
где
y
является искомым индивидуальным значением перемен-
ij
y
= μ + ai + βxij + εij, (24)
ij
ной; μ – среднее значение для всей совокупности; ai является компонентом yij, связанным с принадлежностью домохозяйства
90
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]