Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Проблемы оптимизации выборочных данных с неполнотой в диапазоне. Монография
.pdf
III. Влияние неполного диапазона данных на достоверность и точность оценок
pq
1, 96 ,
Dn
11
(23)
где D – полуширина доверительного интервала (выше показана
ширина доверительного интервала); nε – эквивалентный объем
выборки при предположении полноты диапазона неполного диапазона данных, т. е. W
= 0.
2
При p1 = 5 % и W2 = 5 % ширина доверительного интервала
для P составляет 11,1 – 3,4 = 7,7, а ее половина D = 3,85. Если
заменить ее формулой (21) и решить относительно nε, получается, что для обеспечения такой же ширины доверительного
интервала для P, но при W2 = 0 достаточно исследовать 123 человека вместо 1000. При W2 = 10 % соответствующий размер nε
уменьшится до 46 человек, т. е. по сравнению с nε при W2 = 5 %
эквивалентный объем выборки уменьшился более чем в 2,5 раза
(для преодоления возможных проблем с обоими влияниями –
случайной и системной ошибками, связанными с исследуемым
явлением).
Каковы приблизительные масштабы пробелов диапазона
данных в проводимых эмпирических исследованиях?
Чтобы проиллюстрировать проблему, используем результаты контрольного пересчета полноты охвата диапазона данных
при переписи населения. Несмотря на некоторые специфические черты объекта переписи (использование групп постоянно
присутствующих, временно отсутствующих и временно проживающих лиц и возможность подсчета одного и того же лица более одного раза в разных населенных пунктах), ее организация
и методика во многом соответствуют эмпирическим исследованиям. Более того, известно, что при подсчете требуются квалифицированные усилия и высокая профессиональная подготовка
анкетерского состава. Создается специальная организация для
работы в поле. Подготовка инструментария начинается задолго
81

Глава первая. Проблемы при неполном диапазоне данных в эмпирических исследованиях...
до выхода в поле и основывается на давних традициях и опыте. Проводится пробное исследование для оценки достоверности анкеты. В связи с этим подчеркнем, что не всегда при эмпирических исследованиях предусмотрены условия, создающие
предпосылки для высоконаучного уровня их подготовки, организации и проведения. Поэтому, рассматривая результаты контрольного пересчета по полноте охвата при переписи населения,
ориентировочно можно судить об ошибках диапазона и в эмпирических исследованиях, но только в сравнительном плане и с
большей долей пессимизма.
Наиболее общие результаты контрольной переписи показывают, что при переписи населения остались неучтенными
27000(±8700) человек, а дважды было опрошено 32 300 (±7850)
лиц, т. е. была допущена чистая ошибка в +5300 человек, что по
отношению к общей численности составляло 0,6 %. Общая численность населения завышена на 5300 человек. Пробелы полноты
диапазона охвата также нашли свое отражение в распределениях
опрошенных лиц по признакам, включенным в программу переписи. При контрольном пересчете это отражение по понятным
причинам установлено лишь по некоторым признакам – полу,
возрасту, месту жительства и т. д.
У мужчин на 1000 человек из-за ошибки в охвате диапазона
было ошибочно приписано 12 человек, а у женщин – 9. В результате этих ошибок количество мужчин было завышено на 0,8 %, а
женщин – на 0,2 %.
Частота ошибок, допущенных в охвате населения при пересчете, значительно варьируется в зависимости от возраста лиц.
Пропуски в охвате чаще встречаются среди молодых людей, что
логично ожидать, поскольку у них миграционные процессы значительно более интенсивны. Данные табл. 19 и 20 демонстрируют
эти выводы.
82

III. Влияние неполного диапазона данных на достоверность и точность оценок
Таблица 19
Выпадающие единицы в диапазонах данных по возрастным группам
Возраст Выпадающие единицы в диапазоне данных
до 5 лет 23 ‰
5–15 лет 7,8 ‰
15–25 лет 23,2 ‰
25–35 лет 9,7 ‰
35–75 лет 3,0–6,3 ‰
старше 75 лет 8,6 ‰
В результате компенсации между неучтенными и учтенными
дважды увеличение численности населения в возрастных группах
составило:
Таблица 20
Значения пробелов в диапазонах данных по возрастным группам
Возраст Пробелы в диапазоне данных
до 5 лет с 5,6 ‰
15–25 лет с 0,7 ‰
25–35 лет с 0,9 ‰
старше 75 лет с 1,5 ‰
В остальных возрастных группах численность понизилась с
0,2 до 0,6 %.
Отмечается тенденция к увеличению числа лиц в более младших возрастных категориях (единственным исключением является завышение пожилых людей старше 75 лет) и снижение их в
средних и старших возрастных группах (от 35 до 65 лет). Как подчеркивалось, эта тенденция объясняется более высокой мобильностью молодых людей, которые отделяются от своих родителей
(в том числе и маленькие дети для опеки за бабушками и дедуш-
83

Глава первая. Проблемы при неполном диапазоне данных в эмпирических исследованиях...
ками) и (или) отправляются учиться и работать в другие населенные пункты, с этим связано указание двух мест жительства.
Анализ этих и других данных позволил по контрольному
пересчету полноты охвата сделать ряд предложений о принятии
более специальных мер для правильного и более полного охвата
населения при будущих переписях населения.
84

Глава вторая.
МЕТОДЫ ПОИСКА РЕШЕНИЙ
ПРИ НЕПОЛНОМ ДИАПАЗОНЕ ДАННЫХ ВЫБОРКИ
Как мы видели, в практике выборочных исследований всегда присутствует проблема «недостающих данных»1. Правильно и
точно смоделированная и извлеченная выборка, к сожалению, не
является достаточной гарантией совпадения полученных выборочных данных с параметрами генеральной совокупности в пределах принятой статистической точности (погрешности). Ранее
указывалось, что различные этапы любого социологического исследования обременены множеством источников ошибок, которые в конечном итоге приводят к различным по характеру и размеру отклонениям оценок от фактических значений2. Эти ошибки
часто бывают настолько значительными, что не допускают правильных обобщений в выводах, полученных по выборке, это, по
сути, сводит на нет ее предназначение и смысл проведенной работы. Большая беда в том, что мы не всегда отдаем себе отчет в
серьезности последствий наличия систематических ошибок и, соответственно, не предпринимаем адекватных исследовательских
стратегий, которые если не ликвидируют эти негативные последствия, то хотя бы создают условия для их удержания в пределах
1
Помимо терминов «недостающие данные», «выпадающие данные», в литературе
можно встретить также неохват, потерянные данные, неисследованные, необнаруженные единицы и т. д. В тексте мы используем в основном термины «недостающие», «потерянные данные» или «выпадающие данные» как синонимы.
2
См. подразделы II и III главы первой.
85

Глава вторая. Методы поиска решений при неполном диапазоне данных выборки
разумного минимума. Конечно, проблема борьбы с систематическими (системными) ошибками максимально обширна, поскольку она присутствует на каждом этапе и в каждом компоненте
процесса эмпирических исследований. Здесь мы ограничиваемся
лишь одной их частью – ошибками, связанными с потерей данных при сборе первичной социологической информации.
Определенно, пробелы и ошибки, возникающие в результате «неполного диапазона данных»1, являются результатом ошибок из-за неполучения данных о части исследуемой совокупности (о выпадающих единицах). Понятно, что финансовые и
временные ограничения часто затрудняют поиск всех единиц
выборки. Основной вопрос здесь заключается в том, когда и при
каких условиях указанные единицы могут смещать результаты
эмпирических исследований до такой степени, что они становятся неопределенными, неинформативными и не заслуживающими
нашего доверия. И есть ли такой порог, до которого эти смещения
и негативные последствия не беспокоят исследователей, но за его
пределами возникают настоящие проблемы? Ответ на эти вопросы не однозначен. И для того, чтобы он был корректным, необходимо подвергнуть оценке несколько моментов:
1) относительная доля неохваченных (неответивших) лиц;
2) общие и специфические характеристики неохваченных
(неответивших) лиц, сравнимые с характеристиками всей выборки (и генеральной совокупности);
3) в том случае, если допустимый порог превышен, какими
были бы не умозрительные, а реальные неблагоприятные воздействия на правильность и обоснованность полученных оценок;
4) что можно было бы сделать практически для того, чтобы
успешно решать обозначенные здесь проблемы.
1
Неполный диапазон данных – разница между планируемой и реализованной в
поле выборкой.
86

Глава вторая. Методы поиска решений при неполном диапазоне данных выборки
Начнем с первого вопроса: относительная доля предусмотренных проектом, но не охваченных исследованием лиц. Существует
мнение (широко подкрепленное практикой эмпирических исследований), что, если доля лиц, для которых не собрана полностью или
частично искомая информация, не превышает 10–15 %, оснований
для беспокойства быть не должно. Как мы видели по результатам
исследований, описанных ранее, это представление оказалось необоснованным. На самом деле даже при небольшой относительной
доле негативного влияния точность искомых оценок может оказаться не пренебрежимо низкой. И фактически сделает эти оценки неадекватными и неинформативными из-за слишком большого размера системной ошибки, а также из-за произвольного увеличения
размера случайной ошибки. С другой стороны, в отдельных случаях
даже большая доля недостающих данных может не угрожать результатам исследования. Однако этого можно ожидать в очень редких
случаях, особенно в эмпирических социологических исследованиях.
Проблема интерпретации результатов выборки с неполным
диапазоном вытекает прежде всего из вероятности того, что неответившие лица существенно отличаются от ответивших по очень
важным для исследователя характеристикам. При выборочных исследованиях с повторной волной (омнибусы, панельные или лонгитюдинальные исследования) респонденты одной волны могут
отличаться от респондентов другой неконтролируемым и неизвестным образом. Генезис этих различий не может быть объяснен
только действием случайных факторов. Поэтому приходится искать альтернативные решения, учитывающие это обстоятельство.
Здесь мы фокусируемся на некоторых методах и процедурах, которые в разной степени предлагают решение проблемы недостающих
данных. Также будет изучен вопрос о том, в какой степени после
применения подобных процедур исследователь имеет право интерпретировать данные как достаточно близкие к полученным из полностью реализованной репрезентативной выборки.
87

Глава вторая. Методы поиска решений при неполном диапазоне данных выборки
I. Разработка методов оптимизации
при отсутствующих данных
Мы заранее уточним, что здесь акцент делается на методах,
которые применяются после того, как индивидуальная первичная информация уже собрана, полевая работа завершена, исследователь поставлен перед свершившимся фактом недостающих
данных в диапазоне совокупности. Некоторые авторы называют
эти процедуры «методами отладки в информационном массиве»
[110]. Другие методы, связанные с недостающими данными диапазона, будут представлены только в общем плане. В историческом аспекте разработка методов исправления диапазона из-за
недостающих (выпадающих) данных может быть разделена на несколько периодов.
Первый, 1960-е гг. – методы, определяющие выпадающие единицы как выборку из выборки (Йейтс [12]) – через так называемое дублирование информации.
Второй, 1970-е гг. – появление различных ad hoc процедур:
удаление случаев, взвешивание, единичная атрибуция (приписывание).
Третий, 1980-е гг. – процедуры оценки, основанные на вероятностных моделях и прямой оценке выпавших (утраченных)
значений: алгоритм, ЕМ1 (максимизация ожиданий) и др.
Четвертый, 1990-е гг. – многомерная атрибуция значений недостающих данных (Multiple Imputation), метод Монте-Карло с
марковскими цепями (рядами), байесовскими методами и др.
Можно сказать, что за последние десятилетия достигнут
значительный прогресс в разработке статистических методов
1
EM, или Expectation Maximization, в буквальном переводе означает «максимизация ожиданий». Метод измеряет средние, ковариационные матрицы и корреляцию количественных переменных с отсутствующими значениями через
итерацию. Более подробно рассмотрим алгоритм в подразделе V главы второй.
88

I. Разработка методов оптимизации при отсутствующих данных
оптимизации недостающих данных. В конце 1970-х гг. Демпстер, Лэрд и Рубин [50] разработали и формализовали для этой
цели алгоритм максимизации ожиданий (EM). Это вычислительный метод для относительно эффективных оценок неполного массива данных. Исследователи доказали, что при больших массивах данных EМ является не только полезным, но и
единственно возможным методом поиска большого количества
скорректированных оценок. Идея, лежащая в основе алгоритма, представляет собой фундаментальное изменение в наблюдении исследователей за оценками недостающих данных. Ранее
недостающие данные понимались скорее как неудобство, как
то, от чего мы должны избавиться либо путем устранения случаев, либо путем приписывания искусственных чисел. После
продвижения алгоритма максимизации ожиданий исследователи начали рассматривать феномен «недостающих данных»
как проблему, для которой можно искать более обоснованные альтернативные решения. В массивах с неполными данными наблюдаемые значения используются прямо и косвенно
для оценки возможных значений выпадающих (недостающих)
единиц. Это обстоятельство сочеталось с «безошибочными», в
соответствии с Шафером [120], предположениями (описанными ниже). Конечная цель состоит в том, чтобы достичь оценок
распределения и прогнозных величин для отсутствующих значений. Последние могут быть выше средних1 в статистическом
анализе, чтобы получить более обоснованные, а не просто
«умозрительные» оценки того, что не было собрано при работе
в поле.
1
Современные методы оптимизации недостающих данных учитывают это
усреднение по-разному. Алгоритмы ЭМ выполняют усреднение детерминированным и неслучайным образом. Позже Рубин [115] развил многомерную парадигму атрибуции, которая занимается усреднением посредством симуляции
(Averaging via Simulation).
89

Глава вторая. Методы поиска решений при неполном диапазоне данных выборки
В своей классификации методов оптимизации недостающих
данных Джессен [7] сформулировал два подхода (стратегии). По
его словам, при наличии потери данных возможно:
1) ничего не предпринимать;
2) попытаться надлежащим образом уменьшить нежелатель-
ные эффекты потерянных данных.
«Ничего не делать» – самая простая форма адаптации к подобной ситуации. Но обычно и чаще всего «что-то делается».
Для этого используется широкий спектр методов. Согласно
тому же автору, последние можно разделить на четыре категории:
1) прямая оценка потерянных значений; 2) оценка вероятностей
ответа с последующими оценками запрашиваемых данных; 3) отсутствие ответа как задача двойного отбора; 4) другие методы.
Задачи, которые предстоит сформулировать и решить, требуют, чтобы эти группы методов были рассмотрены более подробно.
1. Прямая оценка отсутствующих значений
При применении этого метода выпавшие (отсутствующие)
значения рассматриваются как функция тех же характеристик,
которые наблюдались или были известны из других источников
информации. Например, доход домохозяйства неизвестен, но известно его нахождение (квартал, район и т. д.). Также известны
параметры дома (аренда или оценочная стоимость дома). Предполагается, что между данными из других источников информации и недостающими данными существует тесная корреляционная связь. Это позволяет получить оценку утраченных значений,
используя приблизительную и довольно упрощенную модель:
где
y
является искомым индивидуальным значением перемен-
ij
y
= μ + ai + βxij + εij, (24)
ij
ной; μ – среднее значение для всей совокупности; ai является
компонентом yij, связанным с принадлежностью домохозяйства
90
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
