Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Проблемы оптимизации выборочных данных с неполнотой в диапазоне. Монография

.pdf
Скачиваний:
0
Добавлен:
07.09.2026
Размер:
1 Мб
Скачать
II. Статистические аспекты пробеловв диапазоне данных
ты исследования, чем соответствующие им выборочные отклоне­ния и случайные невыборочные ошибки. Однако и случайные, и
системные ошибки могут увеличиваться как в результате опе­раций с выборкой, так и в результате операций, не связанных с выборкой. Многие потенциальные источники ошибок могут быть
обнаружены в каждой из этих групп, в то время как каждая опе­рация является потенциальным источником случайных и систем­ных ошибок.
Во-вторых, различные отклонения могут восприниматься как сумма констант, определенных и ограниченных общими ус­ловиями исследования, хотя их значения в значительной степени остаются неизвестными. Отклонение может быть положитель- ным или отрицательным сообразно с тем, увеличивается или уменьшается значение соответствующего показателя.
В-третьих, общее отклонение – это алгебраическая сум­ма всех отклонений. Одни могут отклоняться в положительную сторону, а другие в отрицательную и тем самым взаимно уничто­жать друг друга. Поэтому уменьшение одного источника ошибок может даже увеличивать общее отклонение. Случайные ошибки
2
Sv
2
принимают положительное значение

от дисперсии,
m
v
которая определена второй степенью.
В-четвертых, большинство системных компонентов ошибок возможно уменьшить, но не за счет увеличения объема выбор­ки, а за счет улучшения качества действий по сбору информации, т. е. необходимо «делать вещи лучше». И наоборот, уменьшение случайных ошибок зависит от увеличения объема выборки – увеличения количества единиц mv какого-либо вида. Изменение системных ошибок в основном зависит от различных методов, внешних для проводимого исследования. Это можно сделать дву­мя способами.
51
Глава первая. Проблемы при неполном диапазоне данных в эмпирических исследованиях...
Первый – строгая проверка качества выборки, когда сравни- ваются принятые стандарты с возможностями метода исследова­ния, могут измеряться индивидуальные отклонения, их вариации и отдельные источники ошибок.
Второй – сравнение с внешним источником информации – может установить (и проверить) только индивидуальное откло­нение, сумму нескольких или всех отклонений одного вида.
В-пятых, последствия системных и случайных ошибок раз­личны при применении различных статистических методов. На­пример, системные ошибки с большим эффектом для средней всей выборки могут иметь незначительный эффект при сравне­нии средних или при регрессионном анализе. И наоборот, слу­чайные ошибки с незначительным влиянием на среднее большой выборки могут иметь большое значение при сравнении малых подгрупп и при регрессионном анализе.
Отклонения в диапазоне данных могут искажать выбороч­ные оценки в больших выборках значительнее, чем в малых. Источники отклонений могут быть в процедурах отбора, а в случайных (вероятностных) выборках они обычно могут кор­ригировать с соответствующими оценочными методами. От­клонения в диапазоне данных связаны с риском отклонения при оценке неравномерного отбора единиц. Например, выбор одной единицы из разного количества взрослых людей, живущих в разных жилищных условиях, приводит к неравным выборным вероятностям на совокупности взрослых. Взвешивание может устранить это отклонение. Другой пример – выбор из списка, который содержит точное перечисление единиц. Отклонение можно устранить путем повторного взвешивания. Устранение этих источников отклонения выборочного отбора и, соответ­ственно, оценка выборки – серьезная задача для исследователя. При сплошных исследованиях (например, перепись населения) мы можем столкнуться с теми же отклонениями, хотя их ис-
52
II. Статистические аспекты пробеловв диапазоне данных
правление будет более легким, за исключением отсутствующих единиц или неполного диапазона данных.
«Устойчивые» выборочные отклонения, вызванные посто­янными (устойчивыми) факторами, уменьшаются с увеличе­нием размера выборки и полностью исчезают при сплошном исследовании (при 100 % – когда исследуется вся генеральная совокупность).
Мы используем термин «устойчивый» в статистическом смысле: на самом деле отклонение «неустойчиво» в том смысле, что его значение изменяется с размером выборки. Для каждого фиксированного выборочного объема, как и для других откло­нений, выборка имеет постоянный эффект для показателей. Хо­рошая модель выборки может уменьшить эти устойчивые откло­нения до незначительных соотношений, сопоставимых с другими источниками ошибок (рис. 2).
ʰ
ˁ

ˁ

ʿ
ʻ
ʰ
Рис. 2. Источники ошибок
ʽ
«˄»
ʻ
ʻ
ʿ:
ʻ:
Теория и практика показывают, что системные ошибки созда­ют серьезные проблемы для корректного измерения и контроля. Их источники находятся повсюду в различных научных обла­стях. Эти ошибки влияют на величину параметров совокупности, а также на выборочную оценку (наряду с другими статистически­ми отклонениями), так как характеризуют разницу между вели-
53
Глава первая. Проблемы при неполном диапазоне данных в эмпирических исследованиях...
чиной оценки в выборке и фактическим значением в генеральной совокупности. Это различие очерчивает «трещину» между задан­ными задачами исследования и целым набором основных усло­вий для его протекания.
Среди системных ошибок разграничиваются ошибки наблю- дения и ошибки, не связанные с наблюдением1. Последние увеличи­ваются при невозможности осуществлять наблюдение за некото­рыми частями совокупности, а также из-за неполноты диапазона (неполный диапазон данных, неполная выборка) или в случае с отказавшимися отвечать респондентами. Ошибки наблюдения связаны с неточным получением и записью информации. Здесь можно также определить два вида отклонений. Первое из них увеличивается при полевых работах – выполнении исследования путем опроса, перечисления, наблюдения и т. д. Это так называе­мые системные ошибки в ответах (Response Biases). Второй вид – ошибки, полученные при обработке данных: вводе, кодировании, расчете и т. д.
Случайные ошибки включают как выборочные, так и невы­борочные. Выборочные ошибки могут состоять из любого количе­ства компонентов, в зависимости от модели выборки. Например, дисперсия средней в модели, включающей трехступенчатый слу­чайный отбор с заменой из одинаковых гнезд, была бы представ­лена тремя компонентами [80]:
222
Sa Sb Sc
2
() .
y
 (11)
aababc
Знаменатели в равенстве показывают m
= a единицы первой
1
ступени, единицы m2 = ab – второй ступени и n = abc единицы, выбранные на третьей ступени. В первых двух случаях m1 и m2
1
Здесь под наблюдением понимается установление и регистрация первичной социологической информации.
54
II. Статистические аспекты пробеловв диапазоне данных
представляют собой количество гнезд в выборке первой и второй ступени отбора, а n – общий объем выборки третьей ступени.
На рис. 3 три компонента объединены в гипотенузу
hABC для случайных ошибок.
ʻ
ʿ
Общая ошибка – алгебраическая сумма всех ошибок (случайных и системных)
222
ˁ



Рис. 3. Классификация источников ошибок в исследовании
Выборочные ошибки показаны тремя компонентами. Случайные ошибки,
выборочные и невыборочные, сочетаются с их «квадратами».
ˁ
ʽ
ʦ

h
ʤ
ʦ
ˁ
Модель нуждается в улучшениях для адаптации к сложной выборочной структуре. Например, отбор без замены представля­ет ограниченные возможности для корректировки совокупности;
стратификация уменьшает вариацию единиц; неравные гнезда и взвешивание являются предпосылкой для дальнейших осложне-
ний. Однако основная формула имеет исключительное значение для компонентов дисперсии – каждая ее часть разделена на такое же количество частей.
Невыборочные случайные ошибки также могут быть представ­лены как сумма квадратичных компонентов. Это сходство более известных свойств случайных ошибок является хорошим преи­муществом модели. Рисунок 3 отображает компоненты полевых
55
Глава первая. Проблемы при неполном диапазоне данных в эмпирических исследованиях...
(диапазона данных) ошибок и ошибок обработки. Их можно раз­делить по-разному: например, ошибки обработки единиц – коди­рование и вычисление, а полевые ошибки как компоненты опро­са, наблюдения и контроля. Ошибки из-за отказа отвечать могут быть включены, но они влияют на отклонения больше, чем слу­чайные ошибки.
Каждый респондент обычно дает только один ответ, а коли­чество единиц равно числу респондентов, поэтому mv = n. Если выборка респондентов гнездовая, их ошибки в ответах могут быть коррелированы внутри гнезд, как и их характеристики. Эти случайные ошибки респондента обычно включаются в расчетное отклонение средней.
Средний эффект одного респондента от всех ответов ni, ко­торые он сделал, определяет его собственное отклонение – его ошибку. Каждый анкетер имеет индивидуальное среднее «анке­терское отклонение» ответов, и можно считать, что эффект этих отклонений в случайной выборке влияет на отклонение выбороч­ной средней. Этот эффект (анкетерское отклонение) уменьшает- ся пропорционально количеству анкетеров.
По мнению ряда авторов (например, [115]), преимуществен-
но важный эффект потери данных связан именно с системной ошибкой. Неполучение ответов имеет эффект, схожий с исключе-
нием части генеральной совокупности из возможности попасть в выборочную. В обоих случаях исследование пропускает часть ге­неральной совокупности неслучайным образом. Это создает воз­можность системной ошибки, и ее последствия могут быть значи­тельными. Из-за выпадения из диапазона данных «отказавшихся отвечать» выборка перестает быть репрезентативной для всей интересующей исследователя генеральной совокупности. Если далее в анализе не учитываются (игнорируются) последствия по­тери данных, неявно предполагается, что лица, не ответившие на вопросы, системно не отличаются от ответивших по каким-либо
56
II. Статистические аспекты пробеловв диапазоне данных
характеристикам. В случае, если неответившие лица отличаются от ответивших, результаты будут обременены системной ошибкой.
Различия между ответившими и неответившими. Неответив­шие редко бывают распределены случайным образом в выбор­ке. Как мы уже говорили в начале первой главы, уровни ответа значительно различаются среди подгрупп генеральной совокуп­ности, а переменные исследования часто связаны с характери­стиками этих подгрупп. Гровс [70] приводит следующий пример: уровень неответивших респондентов, как правило, намного выше в городах, чем в пригородах, поскольку и предпочтения в отноше­нии видов транспорта могут отличаться в зависимости от места жительства респондентов. Из-за того, что оценивается представ­ление жителей городов, исследование может, например, оценить количество поездок на автобусе или метро. В специальной лите­ратуре приведен пример того, как в одном исследовании неотве­тившие привели к недооценке размера целых сегментов выбороч­ной совокупности на 50 % [77].
Для средних и относительных долей величина системати­ческой ошибки вследствие отказов зависит от уровня ответов (response rate – RR) и разницы в средних (или относительных до­лях) для респондентов (RX ) и отказников (NRX ) [85]:
(1 )( ).
BRXX (12)
RR NR
В специальной литературе широко обсуждается вопрос о до­пустимом уровне системной (систематической) ошибки, свя-
занной с потерей данных. Во многих исследованиях достигается 80 и более процентов реализации запланированной выборки. Однако, когда полнота диапазона данных низкая, т. е. получено менее 60–70 % из запланированного диапазона данных, возмож­ности системных отклонений весьма вероятны. Подчеркивается, что средний респондент был бы хорошей оценкой для средней генеральной совокупности только тогда, когда ответившие и от-
57
Глава первая. Проблемы при неполном диапазоне данных в эмпирических исследованиях...
казавшиеся имели приблизительно одинаковые распределения. Если эта гипотеза неверна, то необработанная и нерассчитанная средняя произведет систематически смещенные оценки для всей генеральной совокупности. И, как мы уже говорили, отклонения будут неизвестными по направлению и величине.
Помимо реализации объема выборки, конечно, необходимо до­полнительно проследить дифференциацию ответивших респондентов по важным для исследования факторам, коррелирующим с результа­тами. Например, распределение город – деревня в электоральных ис­следованиях. Кроме этого, реализованная (но неполная) выборка по своей структуре должна быть такой же, как и запланированная.
При параллельной переписи секционных протоколов (напри­мер, второй тур, местные выборы) через случайную, представитель­ную (как для некоего муниципалитета) выборку в нашем анализе мы сталкиваемся со следующей ситуацией: при 80 %-ной реализованной выборке один из кандидатов в мэры мог лидировать с отрывом в 15,63 %. На первый взгляд этот результат кажется правдоподоб­ным, особенно после анализа предварительных данных (возможных предвыборных региональных исследований), но, как могло оказать­ся впоследствии, – слишком неточных. При 100 %-ной реализации выборки разница между двумя кандидатами с 15,63 % становится незначительной – всего 2,25 %. Серьезная проблема возникает из­за того, что количество голосов за второго кандидата увеличилось более чем на 6 %, причем только по данным, полученным из прото­колов на избирательном участке одного населенного пункта. Кроме того, разница в 2,25 % находится в пределах случайной ошибки, и, следовательно, рискованно интерпретировать это как победу1, пото­му что это будет иметь нечеткий смысл.
1
В конце концов результаты, объявленные ЦИК, подтвердили результаты 100 % реализованной выборки с разницей в 0,52 %. Кандидат в мэры выиграл с раз­ницей в 3,64 %.
58
II. Статистические аспекты пробеловв диапазоне данных
Приведенный пример свидетельствует о том, что иногда даже 80 %-ная реализация выборки недостаточна для обобщения ре­зультатов, особенно когда (как в этом примере) получение дан­ных от единиц выборки не зависит от случайных факторов и не воспроизводит исходную структуру выборки. Популярный на практике факт, что 80 %-ный диапазон неполных данных (про­цент реализации запланированной выборки) есть значение «в пределах нормы», должен пройти подробный методический ана­лиз. И, вероятно, он окажется действительным для одних частных случаев и недействительным для других.
Важно отметить, что стратегия «ничего не делать» в отноше­нии потерянных данных основана на (часто неправдоподобном) предположении, что по своей структуре ответившие и неответив­шие лица существенно не отличаются друг от друга. При подсче­те средней или иных общих оценок простейшая гипотеза состоит в том, что средняя участвовавших респондентов равна средней неучаствовавших (неотвечавших). Альтернативная гипотеза за­ключается в том, что недостающие данные (выпавшие единицы) были потеряны случайным образом. Согласно ей, отвечавшие и неответившие могут различаться в каждой конкретной выбор­ке, но среди всех возможных гипотетических выборок средние двух групп (отвечавших и неотвечавших) будут оставаться оди­наковыми. Однако, если эта гипотеза окажется ошибочной, даже низкие уровни потери данных (от 10 до 20 %) могут привести к значительной системной ошибке. Таблица 15 показывает, как си­стемная ошибка увеличивается в зависимости от уровня неот­ветивших. Мы видим, как относительные доли, оцениваемые в данном исследовании, могут быть искажены из-за количества не­ответивших.
Когда 20 % выборки не отвечали, а 20 % от ответивших имеют некоторые интересующие нас характеристики против 50 % от не­ответивших, выборочная оценка составит 20 % (на основе респон-
59
Глава первая. Проблемы при неполном диапазоне данных в эмпирических исследованиях...
Таблица 15
Системная ошибка по уровню неотвечавших [70]
Уровень
неответивших
0.10 0.2 0.3 0.01
0.10 0.2 0.4 0.02
0.10 0.2 0.5 0.03
0.20 0.2 0.3 0.02
0.20 0.2 0.4 0.04
0.20 0.2 0.5 0.06
0.40 0.2 0.3 0.04
0.40 0.2 0.4 0.08
0.40 0.2 0.5 0.12
Относительная доля с важными
характеристиками
среди ответивших среди неответивших
Системная
ошибка
дентов). Однако неотклоненная оценка (на основе ответивших и неответивших) составит 26 % – разница в 6 %.1 Не обремененная отклонением оценка всей генеральной совокупности составля­ет 0,20 для 80 %-ной генеральной совокупности, представленной респондентами, и 0,50 для 20 %-ной генеральной совокупности, представленной неответившими. Объединение двух групп про­изводит 0,80 × 0,20 плюс 0,20 × 0,50, или 0,26. Если необходимо построить доверительные границы, то, безусловно, окажется, что граница ошибки из-за системной составляющей от неответивших (Nonresponse Bias) в несколько раз шире, чем границы случайной ошибки. Таким образом, случайная ошибка, оцененная точно, ста-
1
Системная ошибка (bias) – это разница между ожидаемым значением выбороч­ных оценок и характеристиками генеральной совокупности, которые должны быть оценены [70].
60
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]