Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Проблемы оптимизации выборочных данных с неполнотой в диапазоне. Монография
.pdf
I. Оптимизация выборки при неполном диапазоне данных
Помимо запланированного дополнения, которое у нас получило распространение как «напряженная выборка», методика
выборки допускает и одно сверхрасширение – замену по квотной
матрице. Оно было проведено при соблюдении следующих правил: если интервьюер не провел 9 назначенных интервью в одном гнезде, он имеет право дополнить объем гнезда, подбирая по
квотным признакам лиц, проживающих в соседней квартире, на
соседнем этаже или по соседнему адресу. При замене квоты требуется выполнение квотной матрицы по социодемографическим
признакам:
1) пол;
2) возраст, близкий к возрасту выбывшего из списка интер-
вьюера лица;
3) этническая принадлежность;
Ранее мы указывали, что на практике исследователи моделировали напряженную выборку, в основном с целью компенсации
недостающих данных (планируемая компенсация неполного диапазона данных). Выборка исследования также была напряженной,
несмотря на ее большой объем – 2963 человека, по сравнению с
принятым стандартом около 1200 человек. Реализованные резервы (планируемое дополнение) не составляют значительной доли–
только 4 %, тогда как замена квоты, которая является дополнительной, незапланированной процедурой, значительна – 29%.
В модели исследования предусмотрен методический опросник, с помощью которого можно собрать информацию о характере, мотивах и масштабах отсеявшихся из исследования единиц.
Это представляется очень хорошей идеей, но, к сожалению, подобная стратегия используется в практике эмпирических исследований только как исключение.
Анализ показал, что причины отсева единиц из выборки
в основном следующие (табл. 35) с распределением по квотам
(табл.36).
171

Глава третья. Сравнительные преимущества и ограничения различных методов оптимизации...
Причины отсева единиц из выборки
Причина исключения Количество Относительная доля
Отказ 110 3,5
Отсутствующие в период исследования
(в больнице, военные, студенты, командировка, вне населенного пункта по другой
причине)
Отсутствие по указанному адресу (снесенные дома, временно проживающие, уже по
другому адресу)
Умершие 16 0,5
Всего 1034 33,0
Распределение по выборке
Выборка Количество лиц Относительная доля
Основная выборка 1985 67,2
501 16,0
407 13,0
Таблица 35
Таблица 36
Планируемое дополнение (резервы) 123 4,2
Избыточное расширение (замена по
квоте)
Всего 2952 100
844 28,6
Замена квоты оценивается как существенная по относительной доле, по сравнению с запланированным расширением, и особенно – по ожидаемым рискам «искажения» репрезентативности
выборки. Первоначальная программа полевых работ не предусматривала такого соотношения. Эта проблема возникает, по всей
вероятности, в основном из-за неудачно решенных организационных проблем в поле.
172

I. Оптимизация выборки при неполном диапазоне данных
2. Сравнение характеристик выборки
с параметрами генеральной совокупности
Чтобы проанализировать, в какой степени на репрезентативность
выборки повлияли эти замены, мы провели сравнение между оценками выборки и параметрами генеральной совокупности (по имеющимся официальным данным – перепись населения). Из-за специфики в
методике отбора, помимо первоначального распределения выборки,
мы также использовали распределение объединенной выборки.
Реализованная выборка = основная выборка + планируемое дополнение (резервы).
Номинальные данные выборки при распределении по признакам пола, возраста и населенного пункта приведены в табл. 37.
Таблица 37
Номинальные данные выборки при распределении по признакам
Данные В выборке п, %
Мужчины 46 49 (3)
Женщины 54 51 (-3)
15–30 25 31 (6)
31–40 21 18 (-3)
41–50 20 19 (-1)
51–60 16 16 (0)
61–98 18 16 (-2)
Населенный пункт
Ростов-на-Дону 14 14 (0)
Большой город 33 31 (-2)
Маленький город 22 22 (0)
Село 31 33 (2)
В ген. совокупности
N, %
Пол
Возраст
Отклонение
(N – п), %
173

Глава третья. Сравнительные преимущества и ограничения различных методов оптимизации...
Были выявлены расхождения между характеристиками выборки и параметрами генеральной совокупности. Они как будто превосходят определенную случайную точность. Например,
признак «возраст». Мы оцениваем это отклонение только как видимое, учитывая уменьшенный объем выборки по группам, что
неизбежно увеличивает размер случайной ошибки. В остальных
сравниваемых группах отклонение не превышает ожидаемого
размера.
3. Влияния на выборку
Рассмотрим эту проблему, проанализировав, что распределяется, когда мы делим выборку на части: базовая выборка,
планируемые резервы, замена квоты, базовая выборка плюс
резервы.
Результаты представлены в табл. 38. Основным аргументом
для такого разделения выборки является случайный и системный
характер различных подвыборок (частей выборки).
Чтобы определить, какое влияние оказывает избыточное
расширение (замена квоты) на репрезентативность выборки, мы
анализируем распределение после того, как выборка разделена на
составные части (основные, резервы, замена квоты).
Мы исходим из предположения, что избыточное расширение (замена квоты) является выборкой из выборки и отклонения
(если таковые имеются) не будут иметь существенного значения
для репрезентативности информации просто потому, что мы
сравниваем именно те доли квоты, которые при корректной замене не должны давать отклонений. Если эта гипотеза неверна,
то сдвиги в данных не могут контролироваться, и их даже невозможно было бы предсказать.
При сравнении распределения реализованной выборки и
планируемого расширения (резервов) получаем следующие результаты (табл. 39).
174

I. Оптимизация выборки при неполном диапазоне данных
Сравнение характеристик выборки с параметрами
генеральной совокупности
Таблица 38
Ос-
новная
выборка,
(%)
Мужчины 46 53 46 47 49
Женщины 54 47 54 53 51
15–20 6 1 7 6 12
21–30 18 2 23 17 19
31–40 21 8 23 20 18
41–50 20 25 20 20 19
51–60 17 24 13 17 16
60+ 18 40 14 20 16
Ростов-на-Дону 13 6 17 13 14
Большой город 32 43 35 32 31
Маленький
город
Село 33 24 26 33 33
22 27 22 22 21
Планируемые
резервы
(%)
Населенный пункт
Замещение
по квотам
(%)
Пол
Возраст
Основная
выборка +
резервы
(%)
Генераль-
ная сово-
купность
(%)
И здесь различия, которые мы наблюдаем, также могут быть
связаны со случайными факторами, поскольку подвыборка резервов имеет небольшой объем (n2 = 123). Как относительная доля
резервы больше у мужчин в больших и малых городах, а также у
людей старше 41 года. Однако распределение выборки не сбалансировано. Вероятно, систематическое отклонение было допущено
еще при моделировании.
175

Глава третья. Сравнительные преимущества и ограничения различных методов оптимизации...
Результаты сравнения распределения реализованной выборки
и планируемого расширения
Распределения Основная выборка (n1), (%) Резервы (n2), (%)
Пол
Мужчины 46 53
Женщины 54 47
Возраст
15–30 24 3
31–40 21 8
41–50 20 25
51–60 17 24
61–98 18 40
Населенный пункт
Ростов-на-Дону 13 6
Большой город 32 43
Маленький город 22 27
Село 33 24
Таблица 39
Мы постараемся объединить основную выборку и резервы.
Ее анализ необходим из-за вероятностного отбора и по причине
того, что на самом деле он представляет собой основную реализованную случайную выборку. Сравнение с распределением подвыборки по квоте показало следующие результаты (табл. 40).
Приведенные сводные данные показывают несколько важных моментов. Во-первых, замена квоты отличается относитель-
ной долей основной выборки. Исключение из этого есть в небольших городах, по полу и по возрасту (в возрастном интервале
41–50 лет). По признаку «пол» отклонение находится в пределах
принятой статистической точности. Результат не удивляет – его
следовало ожидать из-за механизма квотной замены.
176

I. Оптимизация выборки при неполном диапазоне данных
Сравнение с распределением подвыборки по квоте
Таблица 40
Распределения
Мужчины 47 4б (l)
Женщины 53 54 (-1)
Всего 100 100 –
15–30 23 29 (-6)
31–40 20 23 (-3)
41–50 20 21 (-1)
51–60 17 13 (4)
61–98 20 14 (6)
Всего 100 100 –
Ростов-на-Дону 13 17 (-4)
Большой город 32 35 (-3)
Маленький город 22 22 (0)
Село 33 2б (7)
Всего 100 100 –
Основная выборка +
резервы (nl + п2), (%)
Пол
Возраст
Населенный пункт
Замещение
по квоте (q), (%)
Отклонение
(nl + n2) – q, (%)
Во-вторых, наблюдаемые отклонения вызывают вопросы, касающиеся «работоспособности» и эффективности предложенных
методологических решений с целью компенсации не участвовавших в интервью. Причин в основном две:
1) выборка была напряженной заранее, и ожидается, что резервы компенсируют возникающие потери от неполного диапазона данных;
2) выборочный объем значительно превышает (более чем в
два раза) традиционно используемые объемы.
177

Глава третья. Сравнительные преимущества и ограничения различных методов оптимизации...
Обозначим следующий вопрос: как замена квоты влияет на
репрезентативность выборки? Имеет ли это смысл, насколько
обеспечивает она «выборку из выборки»1, и сохраняет ли она вообще репрезентативный характер выборки, если это оценивается
по характеристикам, участвующим в замене квоты?
Чтобы проверить это, мы применили2 метод χ2. Коэффици-
2
ент χ
оказался относительно высоким для всех сравниваемых
EM
характеристик, за исключением распределения по полу, где характеристика χ
2
статистически значима при неприемлемом риске
EM
ошибок 1-го рода (α = 0,79932). Все остальные результаты были
статистически значимыми при α < 0,05. В данном примере есть
основания полагать, что замена не обеспечила «выборку из выборки». Наблюдаемые результаты не могут быть объяснены только случайными влияниями, поэтому нет оснований полагать, что
примененные процедуры обеспечили сохранение репрезентативного характера выборки. Доказательством этого является то обстоятельство, что ожидаемого выравнивания ее характеристик
с характеристиками генеральной совокупности не получилось
(результаты в табл. 41). Тот факт, что для распределения по полу
результат остается реально статистически незначимым, не опровергает, а скорее подтверждает сделанный вывод.
При сравнении основной выборки планируемое расширение (резервы) и избыточное расширение (замена по квоте) (см.
табл.38) также выделяются различия.
Во-первых, между основной выборкой и генеральной совокупностью наблюдается несовпадение по всем трем социально-демографическим признакам – полу, возрасту и населенному
пункту. Женщины были представлены 53 % против 51 % по гене-
1
Более подробную информацию по этому вопросу можно найти у Киша [82],
Джессена [7].
2
См.: Девятко И. Ф. Методы социологического исследования. Екатеринбург:
Изд-во Урал. ун-та, 1998. 208 с.
178

I. Оптимизация выборки при неполном диапазоне данных
Таблица 41
Результаты проведенного исследования
2
Социально-демографическая
характеристика
Пол 0,6463 0,79932
Возраст 31,75545 0,00000
Населенный пункт 13,29509 0,00404
Коэффициент
Пирсона
χ
Статистическая
значимость
1
ральной совокупности. По признаку «возраст» мы регистрируем
увеличение лиц в возрасте 31–40 лет и старше 60 лет. По признаку
«населенный пункт» разногласия были незначительными. Полное
совпадение по селам (см. табл. 38).
1
Вывод состоит в том, что даже при большом объеме планируемой выборки (3132 человека) ее реализация не привела к желаемым компенсациям и не была эффективной, несмотря на планируемое дополнение (резервы) в количестве 1044 единицы. Из
планируемой выборки было вовлечено только 1985 человек, или
67,2 %, из резервов – 123 человека, или 4,2 %, что составляет всего
12 % от общего объема резервов. Общие потери из-за неполного набора данных были компенсированы во время исследования
путем чрезмерного расширения (замены квоты) – 28,6 %, или
844человека.
Во-вторых, создается впечатление, что планируемое дополнение и чрезмерное расширение имеют разную структуру (распределения) (табл. 42). В распределении по социально-демографическим признакам нет ни одного совпадения. Выполнение
1
В конкретном примере пол не влияет на тему исследования – «электоральные
отношения». По поэтому связь между двумя переменными не является существенной. Возможно исключить эту характеристику из дальнейшего статистического анализа.
179

Глава третья. Сравнительные преимущества и ограничения различных методов оптимизации...
квотной замены осталось далеко за рамками, указанными в модели исследования. Логическое объяснение этого расхождения следует искать в организации работы в поле.
Таблица 42
Распределение планируемых дополнений
(%)
Резервы (n2) 53 47 1 2 8 25 24 40
Замещение (q) 46 54 7 23 23 20 13 14
(%)
Резервы (n2) 6 43 27 24
Замещение (q) 17 35 22 26
Пол Возраст
М Ж 15–20 21–30 31–40 41–50 51–60 60+
Населенный пункт
Столица
Большой
город
Маленький
город
Село
В-третьих, квотная замена имеет более близкие характеристики к основной выборке по сравнению с резервами, привлекаемыми случайным образом, и это логично ожидать, поскольку
она задается самой моделью замены, а также в общей выборке.
Поэтому сходство с основной выборкой объяснить несложно –
оно является следствием модели квотного замещения. Добавим,
что, как правило, доступным для исполнения при замене квоты
является признак «пол». Нет серьезных оснований утверждать,
что в этом случае квотная подвыборка имеет бόльшую точность,
чем резервы. Что касается выполнения условий выборки в поле
(табл.43), можно только предположить, были ли они выполнены
в соответствии с предписанием.
И здесь был использован метод χ2 (кси-квадрат), чтобы выяснить, являются ли различные дополнения (запланированные
и/или незапланированные) «выборкой из выборки», сохраняется ли репрезентативный характер выборки, и насколько эти до-
180
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
