Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Проблемы оптимизации выборочных данных с неполнотой в диапазоне. Монография
.pdf
IV. Взвешивание данных
Таблица 21
Расчет начальных весов при стратифицированном случайном телефонном
интервью
Район
Нью-Йорк 1 500 1 510 000 0,00099 1006,7
Кингс 1 500 1 750 000 0,00086 1166,7
Куинс 1 500 1 500 000 0,00100 1000,0
Бронкс 1 200 880 000 0,00136 733,3
Ричмонд 800 280 000 0,00286 350,0
Примечание. Выборка (первый столбец) и генеральная совокупность представляют собой телефонные номера; W
(единиц) выборки.
Количество вы-
бранных единиц
Генеральная
совокупность
обозначает начальный вес элементов
1
Вероятность
выбора
W
1
В табл. 21 показана стратифицированная выборка телефонных номеров с различными уровнями отборки для каждого из
пяти районов. Стандартная процедура определения базового веса
для i-го домохозяйства (1/Pr1i) производится по формуле
W’
= 1/(Pr
1i
∙ ti). (33)
1i
При исследовании, в котором предусмотрен специальный отбор (рекрутирование) домохозяйств и создание подвыборок для
сбора информации, базовый вес будет соответствовать выборным вероятностям для двух фаз отбора – Pr
и Pr2i, или:
1i
W
где Pr
выборку, а Pr
означает вероятность отбора случая в рекрутинговую
1i
вероятность сохранения единицы в основной
2i –
= 1/(Pr1i ∙ Pr2i), (34)
1i
выборке.
Если взвешивание было проведено корректно, суммы представляют собой оценку величины генеральной совокупности, из
которой была извлечена выборка. Например, в каждой подгруппе
111

Глава вторая. Методы поиска решений при неполном диапазоне данных выборки
табл. 21 взвешенные суммы для страт – это части генеральной совокупности.
2.2. Второй этап: компенсация недостающей информации
от неответивших
Базовый вес (W1 или W’1) применяется для компенсации эффекта «неответившие». Выравнивание неответивших гарантирует, что суммы весов не будут зависеть от неполученных ответов.
Это становится возможным путем перераспределения весов, связанных с неответившими среди респондентов. И регулирование
доли неответивших может уменьшить системную ошибку из-за
потерянных данных, компенсируя разницу в уровнях «неответов»
внутри подгрупп выборки.
В гипотетическом исследовании1, представленном Кишем,
регулируемыми ячейками могут быть пять субрегионов. Для случая в ячейке j (номера телефонов в Бронксе) взвешенный уровень
ответов (Rj) выглядит следующим образом:
n
rj
W
1
RW
j
где числитель – это сумма весов для респондентов в ячейке j (и n
ij
1
,
n
1
(35)
ej
1
ij
–
rj
число респондентов в данной ячейке), а знаменатель представляет
собой сумму весов для всех соответствующих случаев в ячейке.
Корректирующий вес (W2) – это базовый вес, разделенный на
взвешенный уровень отклика (Rj):
W
1
ij
WR
2
ij
(36)
.
i
Для неответивших и не подходящих для исследования случаев корректирующий вес принимается равным нулю. Сумма кор-
1
См.: Kish [81], Groves [70].
112

IV. Взвешивание данных
ректирующих весов для респондентов в ячейке j будет равна сумме базовых весов для соответствующих случаев в той же ячейке.
Как можно обеспечить начальные веса, показано в табл. 22
[70]. Следует отметить, что в этом примере различные случаи будут начинаться с разных базовых весов.
Таблица 22
Расчет скорректированных весов в стратифицированном случайном
телефонном интервью
Район
Нью-Йорк 604 000 (600) 483 200 (480) 0,80 1006,7 1258,3
Кингс 787 500 (675) 583 350 (500) 0,74 1166,7 1575,0
Куинс 700 000 (700) 560 000 (560) 0,80 1000,0 1250,0
Бронкс 352 000 (480) 228 800 (312) 0,65 733,3 1128,2
Ричмонд 112 000 (320) 67 200 (192) 0,60 350,0 583,3
Примечание. Числа, указанные во втором и третьем столбцах, являются
взвешенными (используется W
в скобках в этих столбцах представляют собой количество подходящих случаев и
респондентов по порядку, W2 – скорректированный вес.
Количество подхо-
дящих единиц
Количество
респондентов
– базовый вес для выборочных случаев); числа
1
Уровень
ответов
W
1
W
2
В общем случае скорректированные ячейки должны быть
созданы с использованием переменных, связанных также с вероятностью случаев «без ответа» и значимыми для исследования
признаками (например, миграционное поведение; мобильность).
Часто возможности исследователя довольно ограничены, потому
что слишком мало известно о неответивших. А также потому, что
и ответившие, и неответившие лица должны быть классифицированы в этих корректирующих ячейках.
Например, при телефонном исследовании единственно доступной информацией о неответивших может быть их код региона и телефонная станция. Следовательно, неответившие лица
должны быть классифицированы в корректирующих ячейках с
113

Глава вторая. Методы поиска решений при неполном диапазоне данных выборки
использованием любой информации, доступной для неответивших. При исследованиях с двумя фазами сбора информации –
специальным отбором (рекрутированием) и основным (фактическим) интервью – необходимо рассчитать индивидуальные
корректировки неответивших по каждой фазе. Фактически рекрутинговые данные подходят для компенсации случаев «без ответа» на базовом этапе сбора данных. Если R1j – это взвешенный
уровень ответов на первом этапе сбора информации, а R2k – взвешенный уровень ответов на втором этапе, то скорректированный
вес будет
W
ijk
W
ijk
2
1
(37)
RR
jk
12
для ответивших и ноль для неответивших.
2.3. Третий этап: постстратификация по параметрам
генеральной совокупности
Как мы уже отмечали, суммы весов представляют собой
оценку объема генеральной совокупности. Иногда исследователь
располагает самостоятельными оценками величины генеральной
совокупности (например, переписи населения). Метод, называемый постстратификацией, используется для формирования
веса в соответствии с фактическим распределением генеральной
совокупности.
Цель состоит в том, чтобы исправить два типа ошибок выборочных оценок – случайную (выборочную) ошибку и ошибку диапазона. Случайная ошибка относится к случайным пропускам (непопаданиям) единиц из генеральной совокупности,
выбранным для извлечения в выборку, и, как мы уже указывали, случайная ошибка уменьшается по мере увеличения размера выборки. Ошибка неполного диапазона данных относится
к систематическим ошибкам исследования – кто включен или
исключен из выборки. Постстратификация может уменьшить
114

IV. Взвешивание данных
эффект этой ошибки, когда параметр генеральной совокупности основан на лучшем охвате диапазона, чем исследование конкретной выборки.
Пример, характерный для практики: если мы используем телефонное обследование, выборка обязательно исключит домохозяйства, в которых нет телефона. Чтобы решить проблему, часто
используют в качестве источника информации данные переписи
населения. Для них характерен гораздо более высокий уровень
охвата единиц генеральной совокупности, чем для других исследований (даже с большими выборками).
Будем использовать перепись населения, которая предоставляет данные по возрасту–расе1–полу (подгруппам) по районам и
малым населенным пунктам. Корректировка путем постстратификации рассчитывается соответствующими корректирующими
весами по формуле
N
j
.
WW
ij ij
32
(38)
W
ij
2
В табл. 23 мы представляем расчет постстратифицированных
весов с данными гипотетического телефонного исследования.
Сумма скорректированных весов (W
) для района Куинс состав-
2
ляет 700,000; согласно переписи, общее количество домохозяйств
составляет около 720,149. Постстратифицированный корректирующий фактор составляет приблизительно 1,029, а конечный вес
(W3) = 1285,98 (1,250 ∙ 1,029).
Характеристики генеральной совокупности для постстратификационных корректировок (значения Nj в формуле (38))
могут быть получены из данных переписи, демографических
или других исследований, проводимых статистическими институциями.
1
Этническая принадлежность.
115

Глава вторая. Методы поиска решений при неполном диапазоне данных выборки
Расчет постстратифицированных весов
Таблица 23
Взвешенное
Район
Нью-Йорк 604 000 (480) 716 422 1,186 1258,3 1492,55
Кингс 787 500 (500) 828 199 1,052 1575,0 1656,40
Куинс 700 000 (560) 720 149 1,029 1250,0 1285,98
Бронкс 352 000 (312) 424 112 1,205 1128,2 1359,33
Ричмонд 112 000 (192) 130 519 1,165 583,3 679,77
Примечание. Параметры генеральной совокупности относятся к переписи
населения и представляют собой количество домохозяйств в каждом отдельном
районе; W
количество
респондентов
– скорректированный вес; W3 – постстратифицированный вес.
2
Параметр
генеральной
совокупности
Корректи-
рующий
фактор
W
W
2
3
Какой источник подходит для использования, будет зависеть
от того, насколько актуальны данные, основаны ли они на удовлетворительных размерах выборки, и содержат ли они соответствующие групповые переменные (например, достаточное количество социально-демографических признаков).
По мнению некоторых исследователей, к наиболее часто используемым на практике видам взвешивания относятся:
1) стратификация склонности к ответам. В этом случае
взвешивание создается на основе дополнительной переменной,
для которой информация набирается обеими группами – ответившими и неответившими, при некоторых допущениях;
2) стратификация предполагаемой (гипотетической) сред-
ней1. Регрессия используется для прогнозирования ответов и
взвешивания классов.
1
R. Sowmya Rao [110] указывает на Cox, 1985, Little, 1986 [88] для получения дополнительной информации об этих разновидностях взвешивания.
116

IV. Взвешивание данных
3. Взвешивание данных на практике
Чтобы лучше проиллюстрировать сущность метода, будем
использовать следующие два примера. Каждый из них рассматривает взвешивание в зависимости от набора условий. Условия в
первом примере следующие (табл. 24).
Во-первых, у нас есть данные по генеральной совокупности,
и мы предполагаем, что модель выборки «идеальна». Поэтому
точная реализация запланированной выборки в полевых исследованиях точно отразила бы пропорции в генеральной совокупности.
Во-вторых, у нас есть данные об опрошенных и неопрошенных (по разным причинам) по полу и возрасту.
Таблица 24
Данные примера при условии, что модель выборки «идеальна»
(1) (2) (3) (4)
Опро-
шенные
Мужчины до 30 лет 150 15 165 9,1
Мужчины 31–50 лет 180 20 200 10,0
Мужчины 51+ лет 90 25 115 21,7
Женщины до 30 лет 120 15 135 11,1
Женщины 31–50 лет 240 10 250 4,0
Женщины 51+ лет 120 15 135 11,1
Всего 900 100 1000 10,0
Неопро-
шенные, %
Всего
% неответивших от
общего количества
Мы можем дублировать неопрошенных в каждой группе через случайную выборку респондентов. Например, в группе мужчин до 30 лет (табл. 25) при случайном выборе необходимо дублировать 15 анкетных карт из 150 полученных анкетных карт
для этой группы и т. д. для остальных групп.
117

Глава вторая. Методы поиска решений при неполном диапазоне данных выборки
Таблица 25
Данные до и после дублирования при условии,
что модель выборки «идеальна»
Без дублирования (кол. 1) После дублирования (кол. 3)
Мужчин 420 46,7 480 48,0
Женщин 480 53,3 520 52,0
Всего 900 100,0 1000 100,0
Для выбора оптимальной стратегии необходимо дополнительно обсудить следующие предположения:
1. Если существует высокая корреляция между дублирующими переменными (полом и возрастом) и другими переменными,
включенными в программу исследования, то дублирование является удачной операцией, так как через нее происходит более
адекватное соотношение значений переменных в корректируемой
выборке (опрошенные + дублированные) по сравнению с планируемой, соответственно генеральной совокупностью.
2. Если нет сильной корреляции, то процедура дублирования
является избыточной, потому что истинное соотношение между планируемой выборкой и генеральной совокупностью будет
достигнуто только для дублирующих переменных, а не для всех
остальных, т. е. делаются расходы на дублирование, которые могут быть сэкономлены.
3. Если имеются значительные отклонения по дублирующим
переменным между опрошенными и неопрошенными лицами, то
дублирование является хорошей операцией из-за вышеупомянутого в п. 1 соображения.
4. Если существенных отклонений по дублирующим переменным нет, то процедура дублирования является излишней из-за
сходства между распределениями опрошенных и неопрошенных.
Проиллюстрируем технику дублирования следующим примером:
для группы мужчин до 30 лет необходимо продублировать 15 анкет.
118

IV. Взвешивание данных
Было установлено распределение 15 карт по регионам. Например, на Багаевский район выпадает 3 карты для дублирования. Эти 3 карты дублируются полученными анкетами для мужчин до 30 лет в Багаевском районе. Далее необходимо следить за
соотношением город – село.
Если в Багаевском районе получены анкеты для мужчин до
30 лет меньше тех, которые должны быть дублированы, то берется (рассматривается) область, в которую входит Багаевский район. Таким образом, количество анкетных карт, для которых будут
сделаны дубликаты, окажется по крайней мере в 3 раза больше,
чем количество дубликатов. В нашем примере их должно быть не
менее 9, чтобы сделать из них 3 дубликата.
Одним из оснований для осуществления данной процедуры
может быть то, что люди связаны территориально, т. е. они похожи друг на друга из-за соответствующих местных особенностей,
общих региональных влияний, взаимодействий и т. д. (Kish [80]).
Во втором примере (табл. 26 и 27) мы определяем доступные данные для генеральной совокупности переменных пола и возраста.
Предполагаемая выборка была объемом 1000 человек, но были
исследованы 900.
Соотношение данных в выборке и генеральной совокупности
Мужчины
до 30 лет
Мужчины
31–50 лет
Мужчины
51+ лет
Отн. доля
Выборка
150 0,167 – 0,190 – 1,138
180 0,200 0,467 0,230 0,540 1,150
в выбор-
ке
90 0,100 – 0,120 – 1,200
Всего
по груп-
пам
Отн. доля в
генеральной
совокупности
Таблица 26
Всего
по груп-
пам
Вес
N/n
119

Глава вторая. Методы поиска решений при неполном диапазоне данных выборки
Окончание табл. 26
Отн. доля
Выборка
Женщины
до 30 лет
Женщины
31–50 лет
Женщины
51+ лет
Всего 900 1,000 – 1,000 – –
Лица
в выборке
Мужчины
до 30 лет
Мужчины
31–50 лет
120 0,133 – 0,190 – 1,429
240 0,267 0,533 0,160 0,460 0,600
120 0,133 – 0,110 – 0,827
Доступные данные для генеральной совокупности
Без взвешивания
в выбор-
ке
переменных пола и возраста
150 150 × 1,138 = 171 0,190
180 180 × 1,150 = 207 0,230
Всего
по груп-
пам
После взвешивания
(выборка × вес)
Отн. доля в
генеральной
совокупности
Всего
по груп-
пам
Относительная доля во
взвешенной выборке
Вес
N/n
Таблица 27
Мужчины
51+ лет
Женщины
до 30 лет
Женщины
31–50 лет
Женщины
51+ лет
Всего 900 900 1,000
90 90 × 1,200 = 108 0,120
120 120 × 1,429 = 171 0,190
240 240 × 0,600 = 144 0,160
120 120 × 0,827 = 99 0,110
120
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
