Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Проблемы оптимизации выборочных данных с неполнотой в диапазоне. Монография

.pdf
Скачиваний:
0
Добавлен:
07.09.2026
Размер:
1 Мб
Скачать
IV. Взвешивание данных
Таблица 21
Расчет начальных весов при стратифицированном случайном телефонном
интервью
Район
Нью-Йорк 1 500 1 510 000 0,00099 1006,7
Кингс 1 500 1 750 000 0,00086 1166,7
Куинс 1 500 1 500 000 0,00100 1000,0
Бронкс 1 200 880 000 0,00136 733,3
Ричмонд 800 280 000 0,00286 350,0
Примечание. Выборка (первый столбец) и генеральная совокупность пред­ставляют собой телефонные номера; W (единиц) выборки.
Количество вы-
бранных единиц
Генеральная
совокупность
обозначает начальный вес элементов
1
Вероятность
выбора
W
1
В табл. 21 показана стратифицированная выборка телефон­ных номеров с различными уровнями отборки для каждого из пяти районов. Стандартная процедура определения базового веса для i-го домохозяйства (1/Pr1i) производится по формуле
W’
= 1/(Pr
1i
ti). (33)
1i
При исследовании, в котором предусмотрен специальный от­бор (рекрутирование) домохозяйств и создание подвыборок для сбора информации, базовый вес будет соответствовать выбор­ным вероятностям для двух фаз отбора – Pr
и Pr2i, или:
1i
W
где Pr выборку, а Pr
означает вероятность отбора случая в рекрутинговую
1i
вероятность сохранения единицы в основной
2i
= 1/(Pr1i ∙ Pr2i), (34)
1i
выборке.
Если взвешивание было проведено корректно, суммы пред­ставляют собой оценку величины генеральной совокупности, из которой была извлечена выборка. Например, в каждой подгруппе
111
Глава вторая. Методы поиска решений при неполном диапазоне данных выборки
табл. 21 взвешенные суммы для страт – это части генеральной со­вокупности.
2.2. Второй этап: компенсация недостающей информации от неответивших
Базовый вес (W1 или W’1) применяется для компенсации эф­фекта «неответившие». Выравнивание неответивших гарантиру­ет, что суммы весов не будут зависеть от неполученных ответов. Это становится возможным путем перераспределения весов, свя­занных с неответившими среди респондентов. И регулирование доли неответивших может уменьшить системную ошибку из-за потерянных данных, компенсируя разницу в уровнях «неответов» внутри подгрупп выборки.
В гипотетическом исследовании1, представленном Кишем, регулируемыми ячейками могут быть пять субрегионов. Для слу­чая в ячейке j (номера телефонов в Бронксе) взвешенный уровень ответов (Rj) выглядит следующим образом:
n
rj
W
1
RW
j
 
где числитель – это сумма весов для респондентов в ячейке jn
ij
1
,
n
1
(35)
ej
1
ij
–
rj
число респондентов в данной ячейке), а знаменатель представляет собой сумму весов для всех соответствующих случаев в ячейке.
Корректирующий вес (W2) – это базовый вес, разделенный на взвешенный уровень отклика (Rj):
W
1
ij
WR
2
ij
(36)
.
i
Для неответивших и не подходящих для исследования случа­ев корректирующий вес принимается равным нулю. Сумма кор-
1
См.: Kish [81], Groves [70].
112
IV. Взвешивание данных
ректирующих весов для респондентов в ячейке j будет равна сум­ме базовых весов для соответствующих случаев в той же ячейке.
Как можно обеспечить начальные веса, показано в табл. 22 [70]. Следует отметить, что в этом примере различные случаи бу­дут начинаться с разных базовых весов.
Таблица 22
Расчет скорректированных весов в стратифицированном случайном
телефонном интервью
Район
Нью-Йорк 604 000 (600) 483 200 (480) 0,80 1006,7 1258,3
Кингс 787 500 (675) 583 350 (500) 0,74 1166,7 1575,0
Куинс 700 000 (700) 560 000 (560) 0,80 1000,0 1250,0
Бронкс 352 000 (480) 228 800 (312) 0,65 733,3 1128,2
Ричмонд 112 000 (320) 67 200 (192) 0,60 350,0 583,3
Примечание. Числа, указанные во втором и третьем столбцах, являются взвешенными (используется W в скобках в этих столбцах представляют собой количество подходящих случаев и респондентов по порядку, W2 – скорректированный вес.
Количество подхо-
дящих единиц
Количество
респондентов
– базовый вес для выборочных случаев); числа
1
Уровень
ответов
W
1
W
2
В общем случае скорректированные ячейки должны быть созданы с использованием переменных, связанных также с ве­роятностью случаев «без ответа» и значимыми для исследования признаками (например, миграционное поведение; мобильность). Часто возможности исследователя довольно ограничены, потому что слишком мало известно о неответивших. А также потому, что и ответившие, и неответившие лица должны быть классифициро­ваны в этих корректирующих ячейках.
Например, при телефонном исследовании единственно до­ступной информацией о неответивших может быть их код реги­она и телефонная станция. Следовательно, неответившие лица должны быть классифицированы в корректирующих ячейках с
113
Глава вторая. Методы поиска решений при неполном диапазоне данных выборки
использованием любой информации, доступной для неответив­ших. При исследованиях с двумя фазами сбора информации – специальным отбором (рекрутированием) и основным (факти­ческим) интервью – необходимо рассчитать индивидуальные корректировки неответивших по каждой фазе. Фактически ре­крутинговые данные подходят для компенсации случаев «без от­вета» на базовом этапе сбора данных. Если R1j – это взвешенный уровень ответов на первом этапе сбора информации, а R2k – взве­шенный уровень ответов на втором этапе, то скорректированный вес будет
W
ijk
W
ijk
2
1
(37)
RR
jk
12
для ответивших и ноль для неответивших.
2.3. Третий этап: постстратификация по параметрам генеральной совокупности
Как мы уже отмечали, суммы весов представляют собой оценку объема генеральной совокупности. Иногда исследователь располагает самостоятельными оценками величины генеральной совокупности (например, переписи населения). Метод, называ­емый постстратификацией, используется для формирования веса в соответствии с фактическим распределением генеральной совокупности.
Цель состоит в том, чтобы исправить два типа ошибок вы­борочных оценок – случайную (выборочную) ошибку и ошиб­ку диапазона. Случайная ошибка относится к случайным про­пускам (непопаданиям) единиц из генеральной совокупности, выбранным для извлечения в выборку, и, как мы уже указыва­ли, случайная ошибка уменьшается по мере увеличения разме­ра выборки. Ошибка неполного диапазона данных относится к систематическим ошибкам исследования – кто включен или исключен из выборки. Постстратификация может уменьшить
114
IV. Взвешивание данных
эффект этой ошибки, когда параметр генеральной совокупно­сти основан на лучшем охвате диапазона, чем исследование кон­кретной выборки.
Пример, характерный для практики: если мы используем те­лефонное обследование, выборка обязательно исключит домохо­зяйства, в которых нет телефона. Чтобы решить проблему, часто используют в качестве источника информации данные переписи населения. Для них характерен гораздо более высокий уровень охвата единиц генеральной совокупности, чем для других иссле­дований (даже с большими выборками).
Будем использовать перепись населения, которая предостав­ляет данные по возрасту–расе1–полу (подгруппам) по районам и малым населенным пунктам. Корректировка путем постстрати­фикации рассчитывается соответствующими корректирующими весами по формуле
N
j
.
WW
ij ij
32
(38)
W
ij
2
В табл. 23 мы представляем расчет постстратифицированных весов с данными гипотетического телефонного исследования. Сумма скорректированных весов (W
) для района Куинс состав-
2
ляет 700,000; согласно переписи, общее количество домохозяйств составляет около 720,149. Постстратифицированный корректиру­ющий фактор составляет приблизительно 1,029, а конечный вес (W3) = 1285,98 (1,250 ∙ 1,029).
Характеристики генеральной совокупности для постстра­тификационных корректировок (значения Nj в формуле (38)) могут быть получены из данных переписи, демографических или других исследований, проводимых статистическими ин­ституциями.
1
Этническая принадлежность.
115
Глава вторая. Методы поиска решений при неполном диапазоне данных выборки
Расчет постстратифицированных весов
Таблица 23
Взвешенное
Район
Нью-Йорк 604 000 (480) 716 422 1,186 1258,3 1492,55
Кингс 787 500 (500) 828 199 1,052 1575,0 1656,40
Куинс 700 000 (560) 720 149 1,029 1250,0 1285,98
Бронкс 352 000 (312) 424 112 1,205 1128,2 1359,33
Ричмонд 112 000 (192) 130 519 1,165 583,3 679,77
Примечание. Параметры генеральной совокупности относятся к переписи населения и представляют собой количество домохозяйств в каждом отдельном районе; W
количество
респондентов
– скорректированный вес; W3 – постстратифицированный вес.
2
Параметр
генеральной
совокупности
Корректи-
рующий
фактор
W
W
2
3
Какой источник подходит для использования, будет зависеть от того, насколько актуальны данные, основаны ли они на удов­летворительных размерах выборки, и содержат ли они соответ­ствующие групповые переменные (например, достаточное коли­чество социально-демографических признаков).
По мнению некоторых исследователей, к наиболее часто ис­пользуемым на практике видам взвешивания относятся:
1) стратификация склонности к ответам. В этом случае взвешивание создается на основе дополнительной переменной, для которой информация набирается обеими группами – отве­тившими и неответившими, при некоторых допущениях;
2) стратификация предполагаемой (гипотетической) сред-
ней1. Регрессия используется для прогнозирования ответов и
взвешивания классов.
1
R. Sowmya Rao [110] указывает на Cox, 1985, Little, 1986 [88] для получения до­полнительной информации об этих разновидностях взвешивания.
116
IV. Взвешивание данных
3. Взвешивание данных на практике
Чтобы лучше проиллюстрировать сущность метода, будем использовать следующие два примера. Каждый из них рассматри­вает взвешивание в зависимости от набора условий. Условия в первом примере следующие (табл. 24).
Во-первых, у нас есть данные по генеральной совокупности, и мы предполагаем, что модель выборки «идеальна». Поэтому точная реализация запланированной выборки в полевых иссле­дованиях точно отразила бы пропорции в генеральной совокуп­ности.
Во-вторых, у нас есть данные об опрошенных и неопрошен­ных (по разным причинам) по полу и возрасту.
Таблица 24
Данные примера при условии, что модель выборки «идеальна»
(1) (2) (3) (4)
Опро-
шенные
Мужчины до 30 лет 150 15 165 9,1
Мужчины 31–50 лет 180 20 200 10,0
Мужчины 51+ лет 90 25 115 21,7
Женщины до 30 лет 120 15 135 11,1
Женщины 31–50 лет 240 10 250 4,0
Женщины 51+ лет 120 15 135 11,1
Всего 900 100 1000 10,0
Неопро-
шенные, %
Всего
% неответивших от
общего количества
Мы можем дублировать неопрошенных в каждой группе че­рез случайную выборку респондентов. Например, в группе муж­чин до 30 лет (табл. 25) при случайном выборе необходимо ду­блировать 15 анкетных карт из 150 полученных анкетных карт для этой группы и т. д. для остальных групп.
117
Глава вторая. Методы поиска решений при неполном диапазоне данных выборки
Таблица 25
Данные до и после дублирования при условии,
что модель выборки «идеальна»
Без дублирования (кол. 1) После дублирования (кол. 3)
Мужчин 420 46,7 480 48,0
Женщин 480 53,3 520 52,0
Всего 900 100,0 1000 100,0
Для выбора оптимальной стратегии необходимо дополни­тельно обсудить следующие предположения:
1. Если существует высокая корреляция между дублирующи­ми переменными (полом и возрастом) и другими переменными, включенными в программу исследования, то дублирование яв­ляется удачной операцией, так как через нее происходит более адекватное соотношение значений переменных в корректируемой выборке (опрошенные + дублированные) по сравнению с плани­руемой, соответственно генеральной совокупностью.
2. Если нет сильной корреляции, то процедура дублирования является избыточной, потому что истинное соотношение меж­ду планируемой выборкой и генеральной совокупностью будет достигнуто только для дублирующих переменных, а не для всех остальных, т. е. делаются расходы на дублирование, которые мо­гут быть сэкономлены.
3. Если имеются значительные отклонения по дублирующим переменным между опрошенными и неопрошенными лицами, то дублирование является хорошей операцией из-за вышеупомяну­того в п. 1 соображения.
4. Если существенных отклонений по дублирующим перемен­ным нет, то процедура дублирования является излишней из-за сходства между распределениями опрошенных и неопрошенных.
Проиллюстрируем технику дублирования следующим примером:
для группы мужчин до 30 лет необходимо продублировать 15 анкет. 118
IV. Взвешивание данных
Было установлено распределение 15 карт по регионам. На­пример, на Багаевский район выпадает 3 карты для дублирова­ния. Эти 3 карты дублируются полученными анкетами для муж­чин до 30 лет в Багаевском районе. Далее необходимо следить за соотношением город – село.
Если в Багаевском районе получены анкеты для мужчин до 30 лет меньше тех, которые должны быть дублированы, то берет­ся (рассматривается) область, в которую входит Багаевский рай­он. Таким образом, количество анкетных карт, для которых будут сделаны дубликаты, окажется по крайней мере в 3 раза больше, чем количество дубликатов. В нашем примере их должно быть не менее 9, чтобы сделать из них 3 дубликата.
Одним из оснований для осуществления данной процедуры может быть то, что люди связаны территориально, т. е. они похо­жи друг на друга из-за соответствующих местных особенностей, общих региональных влияний, взаимодействий и т. д. (Kish [80]). Во втором примере (табл. 26 и 27) мы определяем доступные дан­ные для генеральной совокупности переменных пола и возраста. Предполагаемая выборка была объемом 1000 человек, но были исследованы 900.
Соотношение данных в выборке и генеральной совокупности
Мужчины до 30 лет
Мужчины 31–50 лет
Мужчины 51+ лет
Отн. доля
Выборка
150 0,167 0,190 1,138
180 0,200 0,467 0,230 0,540 1,150
в выбор-
ке
90 0,100 0,120 1,200
Всего
по груп-
пам
Отн. доля в
генеральной
совокупности
Таблица 26
Всего
по груп-
пам
Вес N/n
119
Глава вторая. Методы поиска решений при неполном диапазоне данных выборки
Окончание табл. 26
Отн. доля
Выборка
Женщины до 30 лет
Женщины 31–50 лет
Женщины 51+ лет
Всего 900 1,000 1,000
Лица
в выборке
Мужчины до 30 лет
Мужчины 31–50 лет
120 0,133 0,190 1,429
240 0,267 0,533 0,160 0,460 0,600
120 0,133 0,110 0,827
Доступные данные для генеральной совокупности
Без взвешивания
в выбор-
ке
переменных пола и возраста
150 150 × 1,138 = 171 0,190
180 180 × 1,150 = 207 0,230
Всего
по груп-
пам
После взвешивания
(выборка × вес)
Отн. доля в
генеральной
совокупности
Всего
по груп-
пам
Относительная доля во
взвешенной выборке
Вес
N/n
Таблица 27
Мужчины 51+ лет
Женщины до 30 лет
Женщины 31–50 лет
Женщины 51+ лет
Всего 900 900 1,000
90 90 × 1,200 = 108 0,120
120 120 × 1,429 = 171 0,190
240 240 × 0,600 = 144 0,160
120 120 × 0,827 = 99 0,110
120
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]