Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Проблемы оптимизации выборочных данных с неполнотой в диапазоне. Монография

.pdf
Скачиваний:
0
Добавлен:
07.09.2026
Размер:
1 Мб
Скачать
I. Оптимизация выборки при неполном диапазоне данных
Помимо запланированного дополнения, которое у нас по­лучило распространение как «напряженная выборка», методика выборки допускает и одно сверхрасширение – замену по квотной матрице. Оно было проведено при соблюдении следующих пра­вил: если интервьюер не провел 9 назначенных интервью в од­ном гнезде, он имеет право дополнить объем гнезда, подбирая по квотным признакам лиц, проживающих в соседней квартире, на соседнем этаже или по соседнему адресу. При замене квоты тре­буется выполнение квотной матрицы по социодемографическим признакам:
1) пол;
2) возраст, близкий к возрасту выбывшего из списка интер-
вьюера лица;
3) этническая принадлежность;
Ранее мы указывали, что на практике исследователи модели­ровали напряженную выборку, в основном с целью компенсации недостающих данных (планируемая компенсация неполного диа­пазона данных). Выборка исследования также была напряженной, несмотря на ее большой объем – 2963 человека, по сравнению с принятым стандартом около 1200 человек. Реализованные резер­вы (планируемое дополнение) не составляют значительной доли– только 4 %, тогда как замена квоты, которая является дополни­тельной, незапланированной процедурой, значительна – 29%.
В модели исследования предусмотрен методический опро­сник, с помощью которого можно собрать информацию о харак­тере, мотивах и масштабах отсеявшихся из исследования единиц. Это представляется очень хорошей идеей, но, к сожалению, по­добная стратегия используется в практике эмпирических иссле­дований только как исключение.
Анализ показал, что причины отсева единиц из выборки в основном следующие (табл. 35) с распределением по квотам (табл.36).
171
Глава третья. Сравнительные преимущества и ограничения различных методов оптимизации...
Причины отсева единиц из выборки
Причина исключения Количество Относительная доля
Отказ 110 3,5
Отсутствующие в период исследования (в больнице, военные, студенты, команди­ровка, вне населенного пункта по другой причине)
Отсутствие по указанному адресу (снесен­ные дома, временно проживающие, уже по другому адресу)
Умершие 16 0,5
Всего 1034 33,0
Распределение по выборке
Выборка Количество лиц Относительная доля
Основная выборка 1985 67,2
501 16,0
407 13,0
Таблица 35
Таблица 36
Планируемое дополнение (резервы) 123 4,2
Избыточное расширение (замена по квоте)
Всего 2952 100
844 28,6
Замена квоты оценивается как существенная по относитель­ной доле, по сравнению с запланированным расширением, и осо­бенно – по ожидаемым рискам «искажения» репрезентативности выборки. Первоначальная программа полевых работ не предус­матривала такого соотношения. Эта проблема возникает, по всей вероятности, в основном из-за неудачно решенных организаци­онных проблем в поле.
172
I. Оптимизация выборки при неполном диапазоне данных
2. Сравнение характеристик выборки
с параметрами генеральной совокупности
Чтобы проанализировать, в какой степени на репрезентативность выборки повлияли эти замены, мы провели сравнение между оценка­ми выборки и параметрами генеральной совокупности (по имеющим­ся официальным данным – перепись населения). Из-за специфики в методике отбора, помимо первоначального распределения выборки, мы также использовали распределение объединенной выборки.
Реализованная выборка = основная выборка + планируе­мое дополнение (резервы).
Номинальные данные выборки при распределении по при­знакам пола, возраста и населенного пункта приведены в табл. 37.
Таблица 37
Номинальные данные выборки при распределении по признакам
Данные В выборке п, %
Мужчины 46 49 (3)
Женщины 54 51 (-3)
15–30 25 31 (6)
31–40 21 18 (-3)
41–50 20 19 (-1)
51–60 16 16 (0)
61–98 18 16 (-2)
Населенный пункт
Ростов-на-Дону 14 14 (0)
Большой город 33 31 (-2)
Маленький город 22 22 (0)
Село 31 33 (2)
В ген. совокупности
N, %
Пол
Возраст
Отклонение
(N – п), %
173
Глава третья. Сравнительные преимущества и ограничения различных методов оптимизации...
Были выявлены расхождения между характеристиками вы­борки и параметрами генеральной совокупности. Они как буд­то превосходят определенную случайную точность. Например, признак «возраст». Мы оцениваем это отклонение только как ви­димое, учитывая уменьшенный объем выборки по группам, что неизбежно увеличивает размер случайной ошибки. В остальных сравниваемых группах отклонение не превышает ожидаемого размера.
3. Влияния на выборку
Рассмотрим эту проблему, проанализировав, что распре­деляется, когда мы делим выборку на части: базовая выборка, планируемые резервы, замена квоты, базовая выборка плюс резервы.
Результаты представлены в табл. 38. Основным аргументом для такого разделения выборки является случайный и системный характер различных подвыборок (частей выборки).
Чтобы определить, какое влияние оказывает избыточное расширение (замена квоты) на репрезентативность выборки, мы анализируем распределение после того, как выборка разделена на составные части (основные, резервы, замена квоты).
Мы исходим из предположения, что избыточное расшире­ние (замена квоты) является выборкой из выборки и отклонения (если таковые имеются) не будут иметь существенного значения для репрезентативности информации просто потому, что мы сравниваем именно те доли квоты, которые при корректной за­мене не должны давать отклонений. Если эта гипотеза неверна, то сдвиги в данных не могут контролироваться, и их даже невоз­можно было бы предсказать.
При сравнении распределения реализованной выборки и планируемого расширения (резервов) получаем следующие ре­зультаты (табл. 39).
174
I. Оптимизация выборки при неполном диапазоне данных
Сравнение характеристик выборки с параметрами
генеральной совокупности
Таблица 38
Ос-
новная
выборка,
(%)
Мужчины 46 53 46 47 49
Женщины 54 47 54 53 51
15–20 6 1 7 6 12
21–30 18 2 23 17 19
31–40 21 8 23 20 18
41–50 20 25 20 20 19
51–60 17 24 13 17 16
60+ 18 40 14 20 16
Ростов-на-Дону 13 6 17 13 14
Большой город 32 43 35 32 31
Маленький город
Село 33 24 26 33 33
22 27 22 22 21
Плани­руемые
резервы
(%)
Населенный пункт
Замещение
по квотам
(%)
Пол
Возраст
Основная
выборка +
резервы
(%)
Генераль-
ная сово-
купность
(%)
И здесь различия, которые мы наблюдаем, также могут быть связаны со случайными факторами, поскольку подвыборка резер­вов имеет небольшой объем (n2 = 123). Как относительная доля резервы больше у мужчин в больших и малых городах, а также у людей старше 41 года. Однако распределение выборки не сбалан­сировано. Вероятно, систематическое отклонение было допущено еще при моделировании.
175
Глава третья. Сравнительные преимущества и ограничения различных методов оптимизации...
Результаты сравнения распределения реализованной выборки
и планируемого расширения
Распределения Основная выборка (n1), (%) Резервы (n2), (%)
Пол
Мужчины 46 53
Женщины 54 47
Возраст
15–30 24 3
31–40 21 8
41–50 20 25
51–60 17 24
61–98 18 40
Населенный пункт
Ростов-на-Дону 13 6
Большой город 32 43
Маленький город 22 27
Село 33 24
Таблица 39
Мы постараемся объединить основную выборку и резервы. Ее анализ необходим из-за вероятностного отбора и по причине того, что на самом деле он представляет собой основную реализо­ванную случайную выборку. Сравнение с распределением подвы­борки по квоте показало следующие результаты (табл. 40).
Приведенные сводные данные показывают несколько важ­ных моментов. Во-первых, замена квоты отличается относитель- ной долей основной выборки. Исключение из этого есть в не­больших городах, по полу и по возрасту (в возрастном интервале 41–50 лет). По признаку «пол» отклонение находится в пределах принятой статистической точности. Результат не удивляет – его следовало ожидать из-за механизма квотной замены.
176
I. Оптимизация выборки при неполном диапазоне данных
Сравнение с распределением подвыборки по квоте
Таблица 40
Распределения
Мужчины 47 (l)
Женщины 53 54 (-1)
Всего 100 100
15–30 23 29 (-6)
31–40 20 23 (-3)
41–50 20 21 (-1)
51–60 17 13 (4)
61–98 20 14 (6)
Всего 100 100
Ростов-на-Дону 13 17 (-4)
Большой город 32 35 (-3)
Маленький город 22 22 (0)
Село 33 (7)
Всего 100 100
Основная выборка + резервы (nl + п2), (%)
Пол
Возраст
Населенный пункт
Замещение
по квоте (q), (%)
Отклонение
(nl + n2) – q, (%)
Во-вторых, наблюдаемые отклонения вызывают вопросы, ка­сающиеся «работоспособности» и эффективности предложенных методологических решений с целью компенсации не участвовав­ших в интервью. Причин в основном две:
1) выборка была напряженной заранее, и ожидается, что ре­зервы компенсируют возникающие потери от неполного диапазо­на данных;
2) выборочный объем значительно превышает (более чем в два раза) традиционно используемые объемы.
177
Глава третья. Сравнительные преимущества и ограничения различных методов оптимизации...
Обозначим следующий вопрос: как замена квоты влияет на репрезентативность выборки? Имеет ли это смысл, насколько обеспечивает она «выборку из выборки»1, и сохраняет ли она во­обще репрезентативный характер выборки, если это оценивается по характеристикам, участвующим в замене квоты?
Чтобы проверить это, мы применили2 метод χ2. Коэффици-
2
ент χ
оказался относительно высоким для всех сравниваемых
EM
характеристик, за исключением распределения по полу, где харак­теристика χ
2
статистически значима при неприемлемом риске
EM
ошибок 1-го рода (α = 0,79932). Все остальные результаты были статистически значимыми при α < 0,05. В данном примере есть основания полагать, что замена не обеспечила «выборку из вы­борки». Наблюдаемые результаты не могут быть объяснены толь­ко случайными влияниями, поэтому нет оснований полагать, что примененные процедуры обеспечили сохранение репрезентатив­ного характера выборки. Доказательством этого является то об­стоятельство, что ожидаемого выравнивания ее характеристик с характеристиками генеральной совокупности не получилось (результаты в табл. 41). Тот факт, что для распределения по полу результат остается реально статистически незначимым, не опро­вергает, а скорее подтверждает сделанный вывод.
При сравнении основной выборки планируемое расшире­ние (резервы) и избыточное расширение (замена по квоте) (см. табл.38) также выделяются различия.
Во-первых, между основной выборкой и генеральной со­вокупностью наблюдается несовпадение по всем трем социаль­но-демографическим признакам – полу, возрасту и населенному пункту. Женщины были представлены 53 % против 51 % по гене-
1
Более подробную информацию по этому вопросу можно найти у Киша [82], Джессена [7].
2
См.: Девятко И. Ф. Методы социологического исследования. Екатеринбург: Изд-во Урал. ун-та, 1998. 208 с.
178
I. Оптимизация выборки при неполном диапазоне данных
Таблица 41
Результаты проведенного исследования
2
Социально-демографическая
характеристика
Пол 0,6463 0,79932
Возраст 31,75545 0,00000
Населенный пункт 13,29509 0,00404
Коэффициент
Пирсона
χ
Статистическая
значимость
1
ральной совокупности. По признаку «возраст» мы регистрируем увеличение лиц в возрасте 31–40 лет и старше 60 лет. По признаку «населенный пункт» разногласия были незначительными. Полное совпадение по селам (см. табл. 38).
1
Вывод состоит в том, что даже при большом объеме плани­руемой выборки (3132 человека) ее реализация не привела к же­лаемым компенсациям и не была эффективной, несмотря на пла­нируемое дополнение (резервы) в количестве 1044 единицы. Из планируемой выборки было вовлечено только 1985 человек, или 67,2 %, из резервов – 123 человека, или 4,2 %, что составляет всего 12 % от общего объема резервов. Общие потери из-за неполно­го набора данных были компенсированы во время исследования путем чрезмерного расширения (замены квоты) – 28,6 %, или 844человека.
Во-вторых, создается впечатление, что планируемое допол­нение и чрезмерное расширение имеют разную структуру (рас­пределения) (табл. 42). В распределении по социально-демогра­фическим признакам нет ни одного совпадения. Выполнение
1
В конкретном примере пол не влияет на тему исследования – «электоральные отношения». По поэтому связь между двумя переменными не является суще­ственной. Возможно исключить эту характеристику из дальнейшего статисти­ческого анализа.
179
Глава третья. Сравнительные преимущества и ограничения различных методов оптимизации...
квотной замены осталось далеко за рамками, указанными в моде­ли исследования. Логическое объяснение этого расхождения сле­дует искать в организации работы в поле.
Таблица 42
Распределение планируемых дополнений
(%)
Резервы (n2) 53 47 1 2 8 25 24 40
Замещение (q) 46 54 7 23 23 20 13 14
(%)
Резервы (n2) 6 43 27 24
Замещение (q) 17 35 22 26
Пол Возраст
М Ж 15–20 21–30 31–40 41–50 51–60 60+
Населенный пункт
Столица
Большой
город
Маленький
город
Село
В-третьих, квотная замена имеет более близкие характери­стики к основной выборке по сравнению с резервами, привле­каемыми случайным образом, и это логично ожидать, поскольку она задается самой моделью замены, а также в общей выборке. Поэтому сходство с основной выборкой объяснить несложно – оно является следствием модели квотного замещения. Добавим, что, как правило, доступным для исполнения при замене квоты является признак «пол». Нет серьезных оснований утверждать, что в этом случае квотная подвыборка имеет бόльшую точность, чем резервы. Что касается выполнения условий выборки в поле (табл.43), можно только предположить, были ли они выполнены в соответствии с предписанием.
И здесь был использован метод χ2 (кси-квадрат), чтобы вы­яснить, являются ли различные дополнения (запланированные и/или незапланированные) «выборкой из выборки», сохраняет­ся ли репрезентативный характер выборки, и насколько эти до-
180
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]