Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Проблемы оптимизации выборочных данных с неполнотой в диапазоне. Монография
.pdf
IV. Взвешивание данных
При группировке по переменным А и В получаем:
Значения без взвешивания в ячейке
Таблица 28
Значение В
3 (мужчины до 30) × 1,138 = 3,414
Значение А
Всего 6 7,099 ≈ 7
1
2 (женщины до 30) × 1,429 = 2,858
1 (женщины старше 51) × 0,827 = 0,828
1
В этом случае без взвешивания в ячейке (см. табл. 28) должно
быть 6 лиц (это лица из некорректированной выборки, т. е. опрошенные). После взвешивания в ячейке будет 7 лиц, потому что в
ней есть:
3 мужчины до 30 лет, вес 1,138, или всего – 3,414;
2 женщины до 30 лет, вес 1,429, или всего – 2,858;
1 женщина старше 51 года, вес 0,827, или всего – 0,827.
Все – 7,099, или, если приравнять к целому числу, это будет
7лиц.
4. Модифицированные процедуры взвешивания данных
4.1. Взвешивание по суммарным оценкам параметров
генеральной совокупности
1
В некоторых случаях можно пропустить три основных этапа
взвешивания и вместо этого создать веса в зависимости от характеристик генеральной совокупности по формуле
N
1
Гровс использует термин «Factoring to population totals» [70].
Wn
j
.
ij
(39)
j
121

Глава вторая. Методы поиска решений при неполном диапазоне данных выборки
В этой формуле Nj – суммарная оценка параметров генеральной совокупности для взвешенной ячейки j, а nj – количество
случаев, полученных в той же ячейке. Необходима дополнительная информация о параметрах генеральной совокупности. Кроме
того, для использования этой разновидности метода важно, чтобы выборка была составлена так, чтобы получилась одинаковая
вероятность отбора внутри каждой (социально-демографической) подгруппы.
Предположим, например, что мы применяем этот способ
взвешивания для ранее упомянутого гипотетического исследования по Нью-Йорку1. В ячейках, используемых для взвешивания, есть данные о разных кварталах, и этот метод принесет те
же результаты, что и в трехступенчатой процедуре. Тем не менее
мы должны учитывать, что внутри каждого квартала выборка будет переоценивать (выделять) домохозяйства с более чем одной
телефонной линией. Как правило, простой метод взвешивания
игнорирует все различия в выборных вероятностях внутри взвешенных ячеек. Поэтому мы бы не рекомендовали этот подход, за
исключением случаев, когда выборка структурирована с одинаковыми выборными вероятностями для каждой ячейки.
4.2. Комбинаторное взвешивание
(более сложный подход)
Как мы уже отметили, метод постстратификации требует,
чтобы исследователь располагал данными о параметрах генеральной совокупности для каждой взвешенной ячейки. Иногда данные доступны для каждой переменной, используемой при определении ячеек, но не для любой комбинации этих переменных. Это
могут быть данные об общем количестве домохозяйств в каждой
административной единице, о размере (количестве членов) до-
1
Пример Киша [81].
122

IV. Взвешивание данных
мохозяйства в сочетании с количеством собственных (личных)
транспортных средств, но без информации о трехмерном сочетании между административным подразделением, количеством лиц
в домашнем хозяйстве и количеством собственных транспортных
средств. Тем не менее можно было бы иметь в виду все три переменных, используя метод, который мы нашли в специальной
литературе под несколькими различными названиями: многомерное выравнивание (multidimensional raking), итеративное пропорциональное приспособление (iterative proportional tting), процедура Деминга – Стивена (Deming – Stephan) или метод Фратара
(Fratar; фратирование).
Принцип этой процедуры заключается в том, чтобы веса
были адаптированы для выравнивания оценок исследования с
определенной комбинацией параметров генеральной совокупности; затем они адаптируются в соответствии с другой комбинацией параметров. На следующем этапе веса корректируются еще
раз в соответствии с первой комбинацией параметров и т. д., в
то время как выборочные веса полностью уравновешиваются с
обеими (или столькими, сколько предусмотрено) комбинациями
параметров генеральной совокупности.
Проиллюстрируем этот метод следующим примером: мы
предполагаем, что у нас есть информация о параметрах генеральной совокупности (табл. 29) для каждого из четырех
классов домохозяйств и для каждого из двух регионов, но не
для ячеек, формирующих их двумерное распределение. Цель
состоит в том, чтобы выравнять суммы выборочных весов с
этими основными параметрами. Данные переписи показывают общее количество 200 000 домохозяйств для исследуемого
участка.
Предварительные веса, предшествующие постстратификации, составляют в общей сложности 180 000, распределенных, как
показано в табл. 30.
123

Глава вторая. Методы поиска решений при неполном диапазоне данных выборки
Доступные данные по генеральной совокупности
Таблица 29
Подгруппа
Классификация домохозяйств
Без транспортных средств 25 000
Один человек в домохозяйстве / один автомобиль 50 000
Два человека в домохозяйстве / один автомобиль 75 000
Два или более транспортных средств 50 000
Классификация регионов
Административные единицы с низким уровнем ответов 120 000
Административные единицы с высоким уровнем ответов 80 000
Суммы выборочных весов по взвешенным группам (классам)
Регион
Подгруппа
Без транспортных средств 12 000 8 000 20 000
Один человек в домохозяйстве / один автомобиль
Два человека в домохозяйстве / один автомобиль
Два и более транспортных
средств
Всего 100 000 80 000
Низкий уровень
ответов
Домохозяйства
40 000 20 000 60 000
28 000 32 000 60 000
20 000 20 000 40 000
Высокий уровень
Генеральная
совокупность
Таблица 30
Всего
ответов
Обратим внимание, что не только общая сумма меньше
(180000 по сравнению с 200 000), но и суммы в строке и столбце
также не совпадают с соответствующими параметрами табл. 29.
124

IV. Взвешивание данных
Выравнивание обеих групп происходит с корректировкой:
сначала сумм по строкам, а затем – по столбцам.
Новые веса, скорректированные по отношению к генеральной совокупности по порядку, будут старыми, некорректированными, но выравненными с корректирующим фактором:
N
j
где T
это сумма весов для данной ячейки, Тj – сумма весов меж-
jk –
WW
ду ячейками в строке j, а T
lr
,0
ijk
сумма между ячейками в столбце
+k –
(40)
,
ijk
0
T
j
k. Для обозначения различных связей ячеек в столбце k используются градуированные показатели. А с 0 представлены первоначальные веса и суммы до выравнивания с параметрами генеральной совокупности.
После применения корректирующего фактора сумма весов в
каждой строке становится равной параметру генеральной совокупности для ряда (Nj+) (табл. 31), но суммы по столбцам до сих
пор не совпадают с характеристиками генеральной совокупности.
Новые веса корректируются с суммами столбцов по формуле
N
k
lc lr
,,
(41)
WW
ijk ijk
.
0
T
j
Весь процесс повторяется, при этом веса одного повторения
(итерации) (m + 1) корректируют те, которые были произведены
в предыдущем повторении (m), и т. д.:
N
k
mc mr
1, 1,
WW
ijk ijk
mr mc
1, ,
WW
(43)
ijk ijk
mr
T
N
lr
T
;
(42)
1,
k
j
.
,
k
Данные после корректировки значений в столбцах приведены в табл. 32.
125

Глава вторая. Методы поиска решений при неполном диапазоне данных выборки
Таблица 31
Суммы выборочных весов после первоначальной корректировки по строкам
Регион
Подгруппа
Без транспортных средств 15 000 10 000 25 000
Один человек в домохозяйстве / один автомобиль
Два человека в домохозяйстве / один автомобиль
Два и более транспортных
средств
Всего 108 333 91 667
Суммы выборочных весов после корректировки по столбцам
Подгруппа
Без транспортных средств 6 615 8 727 25 342
Один человек в домохозяйстве / один автомобиль
Два человека в домохозяйстве / один автомобиль
Два и более транспортных
средств
Всего 119 999 80 000
Низкий уровень
ответов
Домохозяйства
33 333 16 667 50 000
35 000 40 000 75 000
25 000 25 000 50 000
Низкий уровень
ответов
Домохозяйства
36 923 14 546 51 469
38 769 34 909 73 678
27 692 21 818 49 510
Высокий уровень
ответов
Регион
Высокий уровень
ответов
Всего
Таблица 32
Всего
Анализ показывает, что обычно процедура создает довольно
небольшие изменения после третьего или четвертого повторения.
Этот итеративный метод может использоваться не только с дву-
126

IV. Взвешивание данных
мя переменными, как показано в примере, но и с тремя или более
величинами1.
Веса могут быть скорректированы в соответствии с суммами
характеристик генеральной совокупности, даже если у нас есть
данные только для отдельных переменных. Итеративная пропорциональная корректировка (взвешивание) может применяться,
когда для каждой взвешенной ячейки неизвестны параметры (независимые) генеральной совокупности, но у нас есть данные о
суммах в строке и в столбце.
Подведем итог. Взвешивание имеет три основных преимущества:
во-первых, оно позволяет уменьшить (или исправить) системную (систематическую) ошибку оценок;
во-вторых, взвешивание предлагает последующую оптимизацию данных (когда исследователь «сжат» обстоятельствами);
в-третьих, применяется легко и быстро, потому что все современные статистические программные продукты предлагают
автоматизированный и облегченный алгоритм.
В частности, привлекательность взвешивания вытекает из
возможностей компенсации:
1) различий в вероятностях отбора отдельных (индивидуаль-
ных) случаев;
2) различий для подгрупп в уровнях ответа;
3) нестабильности параметров генеральной совокупности.
Основной спецификой метода является требование наличия
(и доступа) дополнительных данных об исследуемых параметрах
генеральной совокупности. Мы должны подчеркнуть, что приме-
нение взвешивания всегда должно быть адаптировано к конкретным исследовательским задачам и возможностям.
1
Большинство специализированных программных продуктов (SAS, STATA,
SPSS) предлагают возможности программирования алгоритма для выполнения
этой модификации взвешивания.
127

Глава вторая. Методы поиска решений при неполном диапазоне данных выборки
Его эффективность и целесообразность зависят от следующих факторов:
1) объема недостающих данных;
2) актуальности информации, на базе которой будут вырав-
ниваться характеристики выборки;
3) гарантированного наличия корреляции между взвешиваю-
щими признаками и полученной от исследования информацией.
Если доля недостающих данных превышает допустимый порог, то независимо от того, какой метод будет использоваться,
выборка будет только казаться оптимизированной. Механическое
выравнивание выборочных оценок с параметрами генеральной
совокупности не всегда означает улучшение качества выборки.
Это скрытый, латентный, но чрезвычайно серьезный недостаток
взвешивания, который не всегда учитывается исследователями.
Неслучайно, если данные какого-то исследования взвешены, часто этот факт держится в строжайшей фирменной тайне.
Анализ ситуации показывает, что в последние 10–12 лет в
российской практике эмпирических социологических исследований взвешивание данных используется часто. Как правило,
метод применяется в ограниченном варианте – в основном для
компенсации выборки по параметрам генеральной совокупности (описанная выше третья задача). Обычно взвешивающие веса
рассчитываются на основе нескольких (чаще всего до трех) социально-демографических характеристик, которые, как известно
(или предположительно), имеют корреляцию с характеристиками, востребованными в исследовании. Например, пол, возраст,
образование и (или) населенный пункт (город/деревня). Для взвешивания в основном используются данные переписи населения.
Без ответа остается вопрос: как (в каком направлении) изменяется распределение содержательных переменных после взвешивания, особенно когда только предполагается наличие корреляции
между взвешивающими признаками и темой исследования? Эта
128

V. Методы атрибуции значений отсутствующих данных (Imputation)
проблема заслуживает того, чтобы стать предметом дальнейших
исследований.
Во всех случаях крайне важно вести строгую методическую документацию об условиях, ограничениях, этапах проведения и других соображениях, по которым выполняется взвешивание, а также
всегда хранить копию оригинального (необработанного) информационного массива. Профессиональная корректность обязывает
всегда сопровождать представление взвешенных данных методической информацией о масштабах и характере воздействий.
V. Методы атрибуции значений отсутствующих данных
(Imputation)
До недавнего времени основным методом решения проблем
оценки недостающих данных для большинства исследователей
было удаление случаев [122].
Сегодня в статистическую теорию и практику усиленно внедряются новые поколения гибких процедур и методов, направленных не на удаление единиц массива, для которых отсутствуют
первичные данные, а на замещение их оценочными, хотя и приблизительными данными. По словам Шафера, большинство из
этих методов подкреплены прочной теоретической базой.
В предыдущей части монографии были представлены и исследованы методы, основанные на взвешивании. Однако некоторые авторы поддерживают тезис о том, что существуют серьезные
проблемы при применении методов взвешивания. По их мнению,
метод атрибуции значений (Imputation) имеет преимущество в
нахождении решения этих проблем. По этой причине «...он стал
одним из самых популярных методов, используемых для компенсации недостающих данных в выборочных исследованиях» [94].
Добавим, что в методах взвешивания получение оценок недостающих данных опирается на более или менее формальные
129

Глава вторая. Методы поиска решений при неполном диапазоне данных выборки
подходы и принципы, которые во многих случаях несут риски и
могут вводить в заблуждение – то, о чем мы говорили в подразделе IV этой главы.
1. Сущность метода атрибуции
Термин imputation1 в буквальном переводе означает «атрибуция». В самом общем смысле атрибуция – это метод симуляционной техники, при котором любое недостающее значение (единица) заменяется соответствующим значением переменной. Версия
(после атрибуции) m полного массива данных анализируется
стандартными статистическими методами для анализа полного
массива данных.
Основная задача атрибуции, в соответствии с Мин-сю и
Сальвуччи [95], заключается в том, чтобы дать возможность исследователям применять существующие статистические методы
по отношению к любому информационному массиву, содержащему недостающие данные, без изменения объема выборки, при относительном сохранении структуры, при условии, что в доступном виде массив потерянных данных не существует. Стремление
исследователей при использовании разновидностей метода – выполнить эту основную задачу, но, как мы увидим дальше, часто
это порождает серьезные проблемы.
Важной задачей атрибуции является также обеспечение статистической достоверности. С этой целью применяются различные модели для атрибуции отсутствующих значений. Исходят из
презумпции, что основные данные полного массива статистически валидны для конкретного исследования. При применении тех
же аналитических подходов к неполному массиву данных результаты должны оставаться статистически достоверными для той же
1
В словарях обозначен только глагол impute (англ.), его первое значение – «приписывать».
130
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
