Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Проблемы оптимизации выборочных данных с неполнотой в диапазоне. Монография

.pdf
Скачиваний:
0
Добавлен:
07.09.2026
Размер:
1 Мб
Скачать
IV. Взвешивание данных
При группировке по переменным А и В получаем:
Значения без взвешивания в ячейке
Таблица 28
Значение В
3 (мужчины до 30) × 1,138 = 3,414
Значение А
Всего 6 7,099 ≈ 7
1
2 (женщины до 30) × 1,429 = 2,858
1 (женщины старше 51) × 0,827 = 0,828
1
В этом случае без взвешивания в ячейке (см. табл. 28) должно быть 6 лиц (это лица из некорректированной выборки, т. е. опро­шенные). После взвешивания в ячейке будет 7 лиц, потому что в ней есть:
3 мужчины до 30 лет, вес 1,138, или всего – 3,414;
2 женщины до 30 лет, вес 1,429, или всего – 2,858;
1 женщина старше 51 года, вес 0,827, или всего – 0,827.
Все – 7,099, или, если приравнять к целому числу, это будет 7лиц.
4. Модифицированные процедуры взвешивания данных
4.1. Взвешивание по суммарным оценкам параметров генеральной совокупности
1
В некоторых случаях можно пропустить три основных этапа взвешивания и вместо этого создать веса в зависимости от харак­теристик генеральной совокупности по формуле
N
1
Гровс использует термин «Factoring to population totals» [70].
Wn
j
.
ij
(39)
j
121
Глава вторая. Методы поиска решений при неполном диапазоне данных выборки
В этой формуле Nj – суммарная оценка параметров генераль­ной совокупности для взвешенной ячейки j, а nj – количество случаев, полученных в той же ячейке. Необходима дополнитель­ная информация о параметрах генеральной совокупности. Кроме того, для использования этой разновидности метода важно, что­бы выборка была составлена так, чтобы получилась одинаковая вероятность отбора внутри каждой (социально-демографиче­ской) подгруппы.
Предположим, например, что мы применяем этот способ взвешивания для ранее упомянутого гипотетического исследо­вания по Нью-Йорку1. В ячейках, используемых для взвешива­ния, есть данные о разных кварталах, и этот метод принесет те же результаты, что и в трехступенчатой процедуре. Тем не менее мы должны учитывать, что внутри каждого квартала выборка бу­дет переоценивать (выделять) домохозяйства с более чем одной телефонной линией. Как правило, простой метод взвешивания
игнорирует все различия в выборных вероятностях внутри взве­шенных ячеек. Поэтому мы бы не рекомендовали этот подход, за
исключением случаев, когда выборка структурирована с одинако­выми выборными вероятностями для каждой ячейки.
4.2. Комбинаторное взвешивание (более сложный подход)
Как мы уже отметили, метод постстратификации требует, чтобы исследователь располагал данными о параметрах генераль­ной совокупности для каждой взвешенной ячейки. Иногда дан­ные доступны для каждой переменной, используемой при опреде­лении ячеек, но не для любой комбинации этих переменных. Это могут быть данные об общем количестве домохозяйств в каждой административной единице, о размере (количестве членов) до-
1
Пример Киша [81].
122
IV. Взвешивание данных
мохозяйства в сочетании с количеством собственных (личных) транспортных средств, но без информации о трехмерном сочета­нии между административным подразделением, количеством лиц в домашнем хозяйстве и количеством собственных транспортных средств. Тем не менее можно было бы иметь в виду все три пе­ременных, используя метод, который мы нашли в специальной литературе под несколькими различными названиями: многомер­ное выравнивание (multidimensional raking), итеративное пропор­циональное приспособление (iterative proportional  tting), проце­дура Деминга – Стивена (Deming – Stephan) или метод Фратара (Fratar; фратирование).
Принцип этой процедуры заключается в том, чтобы веса были адаптированы для выравнивания оценок исследования с определенной комбинацией параметров генеральной совокупно­сти; затем они адаптируются в соответствии с другой комбина­цией параметров. На следующем этапе веса корректируются еще раз в соответствии с первой комбинацией параметров и т. д., в то время как выборочные веса полностью уравновешиваются с обеими (или столькими, сколько предусмотрено) комбинациями параметров генеральной совокупности.
Проиллюстрируем этот метод следующим примером: мы предполагаем, что у нас есть информация о параметрах ге­неральной совокупности (табл. 29) для каждого из четырех классов домохозяйств и для каждого из двух регионов, но не для ячеек, формирующих их двумерное распределение. Цель состоит в том, чтобы выравнять суммы выборочных весов с этими основными параметрами. Данные переписи показыва­ют общее количество 200 000 домохозяйств для исследуемого участка.
Предварительные веса, предшествующие постстратифика­ции, составляют в общей сложности 180 000, распределенных, как показано в табл. 30.
123
Глава вторая. Методы поиска решений при неполном диапазоне данных выборки
Доступные данные по генеральной совокупности
Таблица 29
Подгруппа
Классификация домохозяйств
Без транспортных средств 25 000
Один человек в домохозяйстве / один автомобиль 50 000
Два человека в домохозяйстве / один автомобиль 75 000
Два или более транспортных средств 50 000
Классификация регионов
Административные единицы с низким уровнем ответов 120 000
Административные единицы с высоким уровнем ответов 80 000
Суммы выборочных весов по взвешенным группам (классам)
Регион
Подгруппа
Без транспортных средств 12 000 8 000 20 000
Один человек в домохозяй­стве / один автомобиль
Два человека в домохозяй­стве / один автомобиль
Два и более транспортных средств
Всего 100 000 80 000
Низкий уровень
ответов
Домохозяйства
40 000 20 000 60 000
28 000 32 000 60 000
20 000 20 000 40 000
Высокий уровень
Генеральная
совокупность
Таблица 30
Всего
ответов
Обратим внимание, что не только общая сумма меньше (180000 по сравнению с 200 000), но и суммы в строке и столбце также не совпадают с соответствующими параметрами табл. 29.
124
IV. Взвешивание данных
Выравнивание обеих групп происходит с корректировкой: сначала сумм по строкам, а затем – по столбцам.
Новые веса, скорректированные по отношению к генераль­ной совокупности по порядку, будут старыми, некорректирован­ными, но выравненными с корректирующим фактором:
N
j
где T
это сумма весов для данной ячейки, Тj – сумма весов меж-
jk –
WW
ду ячейками в строке j, а T
lr
,0
ijk
сумма между ячейками в столбце
+k
(40)
,
ijk
0
T
j
k. Для обозначения различных связей ячеек в столбце k исполь­зуются градуированные показатели. А с 0 представлены первона­чальные веса и суммы до выравнивания с параметрами генераль­ной совокупности.
После применения корректирующего фактора сумма весов в каждой строке становится равной параметру генеральной сово­купности для ряда (Nj+) (табл. 31), но суммы по столбцам до сих пор не совпадают с характеристиками генеральной совокупности.
Новые веса корректируются с суммами столбцов по формуле
N
k
lc lr
,,
(41)
WW
ijk ijk
.
0
T
j
Весь процесс повторяется, при этом веса одного повторения (итерации) (m + 1) корректируют те, которые были произведены в предыдущем повторении (m), и т. д.:
N
k
mc mr

1, 1,
WW
ijk ijk
mr mc
1, ,
WW
(43)
ijk ijk
mr
T
N
lr
T
;
(42)
1,
k
j
.
,
k
Данные после корректировки значений в столбцах приведе­ны в табл. 32.
125
Глава вторая. Методы поиска решений при неполном диапазоне данных выборки
Таблица 31
Суммы выборочных весов после первоначальной корректировки по строкам
Регион
Подгруппа
Без транспортных средств 15 000 10 000 25 000
Один человек в домохозяй­стве / один автомобиль
Два человека в домохозяй­стве / один автомобиль
Два и более транспортных средств
Всего 108 333 91 667
Суммы выборочных весов после корректировки по столбцам
Подгруппа
Без транспортных средств 6 615 8 727 25 342
Один человек в домохозяй­стве / один автомобиль
Два человека в домохозяй­стве / один автомобиль
Два и более транспортных средств
Всего 119 999 80 000
Низкий уровень
ответов
Домохозяйства
33 333 16 667 50 000
35 000 40 000 75 000
25 000 25 000 50 000
Низкий уровень
ответов
Домохозяйства
36 923 14 546 51 469
38 769 34 909 73 678
27 692 21 818 49 510
Высокий уровень
ответов
Регион
Высокий уровень
ответов
Всего
Таблица 32
Всего
Анализ показывает, что обычно процедура создает довольно небольшие изменения после третьего или четвертого повторения. Этот итеративный метод может использоваться не только с дву-
126
IV. Взвешивание данных
мя переменными, как показано в примере, но и с тремя или более величинами1.
Веса могут быть скорректированы в соответствии с суммами характеристик генеральной совокупности, даже если у нас есть данные только для отдельных переменных. Итеративная пропор­циональная корректировка (взвешивание) может применяться, когда для каждой взвешенной ячейки неизвестны параметры (не­зависимые) генеральной совокупности, но у нас есть данные о суммах в строке и в столбце.
Подведем итог. Взвешивание имеет три основных преимущества:
во-первых, оно позволяет уменьшить (или исправить) си­стемную (систематическую) ошибку оценок;
во-вторых, взвешивание предлагает последующую оптимиза­цию данных (когда исследователь «сжат» обстоятельствами);
в-третьих, применяется легко и быстро, потому что все со­временные статистические программные продукты предлагают автоматизированный и облегченный алгоритм.
В частности, привлекательность взвешивания вытекает из возможностей компенсации:
1) различий в вероятностях отбора отдельных (индивидуаль-
ных) случаев;
2) различий для подгрупп в уровнях ответа;
3) нестабильности параметров генеральной совокупности.
Основной спецификой метода является требование наличия (и доступа) дополнительных данных об исследуемых параметрах генеральной совокупности. Мы должны подчеркнуть, что приме-
нение взвешивания всегда должно быть адаптировано к кон­кретным исследовательским задачам и возможностям.
1
Большинство специализированных программных продуктов (SAS, STATA, SPSS) предлагают возможности программирования алгоритма для выполнения этой модификации взвешивания.
127
Глава вторая. Методы поиска решений при неполном диапазоне данных выборки
Его эффективность и целесообразность зависят от следую­щих факторов:
1) объема недостающих данных;
2) актуальности информации, на базе которой будут вырав-
ниваться характеристики выборки;
3) гарантированного наличия корреляции между взвешиваю-
щими признаками и полученной от исследования информацией.
Если доля недостающих данных превышает допустимый по­рог, то независимо от того, какой метод будет использоваться, выборка будет только казаться оптимизированной. Механическое выравнивание выборочных оценок с параметрами генеральной совокупности не всегда означает улучшение качества выборки. Это скрытый, латентный, но чрезвычайно серьезный недостаток взвешивания, который не всегда учитывается исследователями. Неслучайно, если данные какого-то исследования взвешены, ча­сто этот факт держится в строжайшей фирменной тайне.
Анализ ситуации показывает, что в последние 10–12 лет в российской практике эмпирических социологических исследо­ваний взвешивание данных используется часто. Как правило, метод применяется в ограниченном варианте – в основном для компенсации выборки по параметрам генеральной совокупно­сти (описанная выше третья задача). Обычно взвешивающие веса рассчитываются на основе нескольких (чаще всего до трех) со­циально-демографических характеристик, которые, как известно (или предположительно), имеют корреляцию с характеристика­ми, востребованными в исследовании. Например, пол, возраст, образование и (или) населенный пункт (город/деревня). Для взве­шивания в основном используются данные переписи населения. Без ответа остается вопрос: как (в каком направлении) изменя­ется распределение содержательных переменных после взвешива­ния, особенно когда только предполагается наличие корреляции между взвешивающими признаками и темой исследования? Эта
128
V. Методы атрибуции значений отсутствующих данных (Imputation)
проблема заслуживает того, чтобы стать предметом дальнейших исследований.
Во всех случаях крайне важно вести строгую методическую до­кументацию об условиях, ограничениях, этапах проведения и дру­гих соображениях, по которым выполняется взвешивание, а также всегда хранить копию оригинального (необработанного) инфор­мационного массива. Профессиональная корректность обязывает всегда сопровождать представление взвешенных данных методиче­ской информацией о масштабах и характере воздействий.
V. Методы атрибуции значений отсутствующих данных
(Imputation)
До недавнего времени основным методом решения проблем оценки недостающих данных для большинства исследователей было удаление случаев [122].
Сегодня в статистическую теорию и практику усиленно вне­дряются новые поколения гибких процедур и методов, направ­ленных не на удаление единиц массива, для которых отсутствуют первичные данные, а на замещение их оценочными, хотя и при­близительными данными. По словам Шафера, большинство из этих методов подкреплены прочной теоретической базой.
В предыдущей части монографии были представлены и ис­следованы методы, основанные на взвешивании. Однако некото­рые авторы поддерживают тезис о том, что существуют серьезные проблемы при применении методов взвешивания. По их мнению, метод атрибуции значений (Imputation) имеет преимущество в нахождении решения этих проблем. По этой причине «...он стал одним из самых популярных методов, используемых для компен­сации недостающих данных в выборочных исследованиях» [94].
Добавим, что в методах взвешивания получение оценок не­достающих данных опирается на более или менее формальные
129
Глава вторая. Методы поиска решений при неполном диапазоне данных выборки
подходы и принципы, которые во многих случаях несут риски и могут вводить в заблуждение – то, о чем мы говорили в подразде­ле IV этой главы.
1. Сущность метода атрибуции
Термин imputation1 в буквальном переводе означает «атрибу­ция». В самом общем смысле атрибуция – это метод симуляцион­ной техники, при котором любое недостающее значение (едини­ца) заменяется соответствующим значением переменной. Версия (после атрибуции) m полного массива данных анализируется стандартными статистическими методами для анализа полного массива данных.
Основная задача атрибуции, в соответствии с Мин-сю и Сальвуччи [95], заключается в том, чтобы дать возможность ис­следователям применять существующие статистические методы по отношению к любому информационному массиву, содержаще­му недостающие данные, без изменения объема выборки, при от­носительном сохранении структуры, при условии, что в доступ­ном виде массив потерянных данных не существует. Стремление исследователей при использовании разновидностей метода – вы­полнить эту основную задачу, но, как мы увидим дальше, часто это порождает серьезные проблемы.
Важной задачей атрибуции является также обеспечение ста­тистической достоверности. С этой целью применяются различ­ные модели для атрибуции отсутствующих значений. Исходят из презумпции, что основные данные полного массива статистиче­ски валидны для конкретного исследования. При применении тех же аналитических подходов к неполному массиву данных резуль­таты должны оставаться статистически достоверными для той же
1
В словарях обозначен только глагол impute (англ.), его первое значение – «при­писывать».
130
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]