Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Проблемы оптимизации выборочных данных с неполнотой в диапазоне. Монография
.pdf
II. Статистические аспекты пробеловв диапазоне данных
ты исследования, чем соответствующие им выборочные отклонения и случайные невыборочные ошибки. Однако и случайные, и
системные ошибки могут увеличиваться как в результате операций с выборкой, так и в результате операций, не связанных с
выборкой. Многие потенциальные источники ошибок могут быть
обнаружены в каждой из этих групп, в то время как каждая операция является потенциальным источником случайных и системных ошибок.
Во-вторых, различные отклонения могут восприниматься
как сумма констант, определенных и ограниченных общими условиями исследования, хотя их значения в значительной степени
остаются неизвестными. Отклонение может быть положитель-
ным или отрицательным сообразно с тем, увеличивается или
уменьшается значение соответствующего показателя.
В-третьих, общее отклонение – это алгебраическая сумма всех отклонений. Одни могут отклоняться в положительную
сторону, а другие в отрицательную и тем самым взаимно уничтожать друг друга. Поэтому уменьшение одного источника ошибок
может даже увеличивать общее отклонение. Случайные ошибки
2
Sv
2
принимают положительное значение
от дисперсии,
m
v
которая определена второй степенью.
В-четвертых, большинство системных компонентов ошибок
возможно уменьшить, но не за счет увеличения объема выборки, а за счет улучшения качества действий по сбору информации,
т. е. необходимо «делать вещи лучше». И наоборот, уменьшение
случайных ошибок зависит от увеличения объема выборки –
увеличения количества единиц mv какого-либо вида. Изменение
системных ошибок в основном зависит от различных методов,
внешних для проводимого исследования. Это можно сделать двумя способами.
51

Глава первая. Проблемы при неполном диапазоне данных в эмпирических исследованиях...
Первый – строгая проверка качества выборки, когда сравни-
ваются принятые стандарты с возможностями метода исследования, могут измеряться индивидуальные отклонения, их вариации
и отдельные источники ошибок.
Второй – сравнение с внешним источником информации –
может установить (и проверить) только индивидуальное отклонение, сумму нескольких или всех отклонений одного вида.
В-пятых, последствия системных и случайных ошибок различны при применении различных статистических методов. Например, системные ошибки с большим эффектом для средней
всей выборки могут иметь незначительный эффект при сравнении средних или при регрессионном анализе. И наоборот, случайные ошибки с незначительным влиянием на среднее большой
выборки могут иметь большое значение при сравнении малых
подгрупп и при регрессионном анализе.
Отклонения в диапазоне данных могут искажать выборочные оценки в больших выборках значительнее, чем в малых.
Источники отклонений могут быть в процедурах отбора, а в
случайных (вероятностных) выборках они обычно могут корригировать с соответствующими оценочными методами. Отклонения в диапазоне данных связаны с риском отклонения при
оценке неравномерного отбора единиц. Например, выбор одной
единицы из разного количества взрослых людей, живущих в
разных жилищных условиях, приводит к неравным выборным
вероятностям на совокупности взрослых. Взвешивание может
устранить это отклонение. Другой пример – выбор из списка,
который содержит точное перечисление единиц. Отклонение
можно устранить путем повторного взвешивания. Устранение
этих источников отклонения выборочного отбора и, соответственно, оценка выборки – серьезная задача для исследователя.
При сплошных исследованиях (например, перепись населения)
мы можем столкнуться с теми же отклонениями, хотя их ис-
52

II. Статистические аспекты пробеловв диапазоне данных
правление будет более легким, за исключением отсутствующих
единиц или неполного диапазона данных.
«Устойчивые» выборочные отклонения, вызванные постоянными (устойчивыми) факторами, уменьшаются с увеличением размера выборки и полностью исчезают при сплошном
исследовании (при 100 % – когда исследуется вся генеральная
совокупность).
Мы используем термин «устойчивый» в статистическом
смысле: на самом деле отклонение «неустойчиво» в том смысле,
что его значение изменяется с размером выборки. Для каждого
фиксированного выборочного объема, как и для других отклонений, выборка имеет постоянный эффект для показателей. Хорошая модель выборки может уменьшить эти устойчивые отклонения до незначительных соотношений, сопоставимых с другими
источниками ошибок (рис. 2).
ʰ
ˁ
ˁ
ʿ
ʻ
ʰ
Рис. 2. Источники ошибок
ʽ
«˄»
ʻ
ʻ
ʿ:
ʻ:
Теория и практика показывают, что системные ошибки создают серьезные проблемы для корректного измерения и контроля.
Их источники находятся повсюду в различных научных областях. Эти ошибки влияют на величину параметров совокупности,
а также на выборочную оценку (наряду с другими статистическими отклонениями), так как характеризуют разницу между вели-
53

Глава первая. Проблемы при неполном диапазоне данных в эмпирических исследованиях...
чиной оценки в выборке и фактическим значением в генеральной
совокупности. Это различие очерчивает «трещину» между заданными задачами исследования и целым набором основных условий для его протекания.
Среди системных ошибок разграничиваются ошибки наблю-
дения и ошибки, не связанные с наблюдением1. Последние увеличиваются при невозможности осуществлять наблюдение за некоторыми частями совокупности, а также из-за неполноты диапазона
(неполный диапазон данных, неполная выборка) или в случае с
отказавшимися отвечать респондентами. Ошибки наблюдения
связаны с неточным получением и записью информации. Здесь
можно также определить два вида отклонений. Первое из них
увеличивается при полевых работах – выполнении исследования
путем опроса, перечисления, наблюдения и т. д. Это так называемые системные ошибки в ответах (Response Biases). Второй вид –
ошибки, полученные при обработке данных: вводе, кодировании,
расчете и т. д.
Случайные ошибки включают как выборочные, так и невыборочные. Выборочные ошибки могут состоять из любого количества компонентов, в зависимости от модели выборки. Например,
дисперсия средней в модели, включающей трехступенчатый случайный отбор с заменой из одинаковых гнезд, была бы представлена тремя компонентами [80]:
222
Sa Sb Sc
2
() .
y
(11)
aababc
Знаменатели в равенстве показывают m
= a единицы первой
1
ступени, единицы m2 = ab – второй ступени и n = abc единицы,
выбранные на третьей ступени. В первых двух случаях m1 и m2
1
Здесь под наблюдением понимается установление и регистрация первичной
социологической информации.
54

II. Статистические аспекты пробеловв диапазоне данных
представляют собой количество гнезд в выборке первой и второй
ступени отбора, а n – общий объем выборки третьей ступени.
На рис. 3 три компонента объединены в гипотенузу
hABC для случайных ошибок.
ʻ
ʿ
Общая ошибка – алгебраическая сумма всех ошибок (случайных и системных)
222
ˁ
Рис. 3. Классификация источников ошибок в исследовании
Выборочные ошибки показаны тремя компонентами. Случайные ошибки,
выборочные и невыборочные, сочетаются с их «квадратами».
ˁ
ʽ
ʦ
h
ʤ
ʦ
ˁ
Модель нуждается в улучшениях для адаптации к сложной
выборочной структуре. Например, отбор без замены представляет ограниченные возможности для корректировки совокупности;
стратификация уменьшает вариацию единиц; неравные гнезда и
взвешивание являются предпосылкой для дальнейших осложне-
ний. Однако основная формула имеет исключительное значение
для компонентов дисперсии – каждая ее часть разделена на такое
же количество частей.
Невыборочные случайные ошибки также могут быть представлены как сумма квадратичных компонентов. Это сходство более
известных свойств случайных ошибок является хорошим преимуществом модели. Рисунок 3 отображает компоненты полевых
55

Глава первая. Проблемы при неполном диапазоне данных в эмпирических исследованиях...
(диапазона данных) ошибок и ошибок обработки. Их можно разделить по-разному: например, ошибки обработки единиц – кодирование и вычисление, а полевые ошибки как компоненты опроса, наблюдения и контроля. Ошибки из-за отказа отвечать могут
быть включены, но они влияют на отклонения больше, чем случайные ошибки.
Каждый респондент обычно дает только один ответ, а количество единиц равно числу респондентов, поэтому mv = n. Если
выборка респондентов гнездовая, их ошибки в ответах могут
быть коррелированы внутри гнезд, как и их характеристики. Эти
случайные ошибки респондента обычно включаются в расчетное
отклонение средней.
Средний эффект одного респондента от всех ответов ni, которые он сделал, определяет его собственное отклонение – его
ошибку. Каждый анкетер имеет индивидуальное среднее «анкетерское отклонение» ответов, и можно считать, что эффект этих
отклонений в случайной выборке влияет на отклонение выборочной средней. Этот эффект (анкетерское отклонение) уменьшает-
ся пропорционально количеству анкетеров.
По мнению ряда авторов (например, [115]), преимуществен-
но важный эффект потери данных связан именно с системной
ошибкой. Неполучение ответов имеет эффект, схожий с исключе-
нием части генеральной совокупности из возможности попасть в
выборочную. В обоих случаях исследование пропускает часть генеральной совокупности неслучайным образом. Это создает возможность системной ошибки, и ее последствия могут быть значительными. Из-за выпадения из диапазона данных «отказавшихся
отвечать» выборка перестает быть репрезентативной для всей
интересующей исследователя генеральной совокупности. Если
далее в анализе не учитываются (игнорируются) последствия потери данных, неявно предполагается, что лица, не ответившие на
вопросы, системно не отличаются от ответивших по каким-либо
56

II. Статистические аспекты пробеловв диапазоне данных
характеристикам. В случае, если неответившие лица отличаются
от ответивших, результаты будут обременены системной ошибкой.
Различия между ответившими и неответившими. Неответившие редко бывают распределены случайным образом в выборке. Как мы уже говорили в начале первой главы, уровни ответа
значительно различаются среди подгрупп генеральной совокупности, а переменные исследования часто связаны с характеристиками этих подгрупп. Гровс [70] приводит следующий пример:
уровень неответивших респондентов, как правило, намного выше
в городах, чем в пригородах, поскольку и предпочтения в отношении видов транспорта могут отличаться в зависимости от места
жительства респондентов. Из-за того, что оценивается представление жителей городов, исследование может, например, оценить
количество поездок на автобусе или метро. В специальной литературе приведен пример того, как в одном исследовании неответившие привели к недооценке размера целых сегментов выборочной совокупности на 50 % [77].
Для средних и относительных долей величина систематической ошибки вследствие отказов зависит от уровня ответов
(response rate – RR) и разницы в средних (или относительных долях) для респондентов (RX ) и отказников (NRX ) [85]:
(1 )( ).
BRXX (12)
RR NR
В специальной литературе широко обсуждается вопрос о допустимом уровне системной (систематической) ошибки, свя-
занной с потерей данных. Во многих исследованиях достигается
80 и более процентов реализации запланированной выборки.
Однако, когда полнота диапазона данных низкая, т. е. получено
менее 60–70 % из запланированного диапазона данных, возможности системных отклонений весьма вероятны. Подчеркивается,
что средний респондент был бы хорошей оценкой для средней
генеральной совокупности только тогда, когда ответившие и от-
57

Глава первая. Проблемы при неполном диапазоне данных в эмпирических исследованиях...
казавшиеся имели приблизительно одинаковые распределения.
Если эта гипотеза неверна, то необработанная и нерассчитанная
средняя произведет систематически смещенные оценки для всей
генеральной совокупности. И, как мы уже говорили, отклонения
будут неизвестными по направлению и величине.
Помимо реализации объема выборки, конечно, необходимо дополнительно проследить дифференциацию ответивших респондентов
по важным для исследования факторам, коррелирующим с результатами. Например, распределение город – деревня в электоральных исследованиях. Кроме этого, реализованная (но неполная) выборка по
своей структуре должна быть такой же, как и запланированная.
При параллельной переписи секционных протоколов (например, второй тур, местные выборы) через случайную, представительную (как для некоего муниципалитета) выборку в нашем анализе мы
сталкиваемся со следующей ситуацией: при 80 %-ной реализованной
выборке один из кандидатов в мэры мог лидировать с отрывом в
15,63 %. На первый взгляд этот результат кажется правдоподобным, особенно после анализа предварительных данных (возможных
предвыборных региональных исследований), но, как могло оказаться впоследствии, – слишком неточных. При 100 %-ной реализации
выборки разница между двумя кандидатами с 15,63 % становится
незначительной – всего 2,25 %. Серьезная проблема возникает изза того, что количество голосов за второго кандидата увеличилось
более чем на 6 %, причем только по данным, полученным из протоколов на избирательном участке одного населенного пункта. Кроме
того, разница в 2,25 % находится в пределах случайной ошибки, и,
следовательно, рискованно интерпретировать это как победу1, потому что это будет иметь нечеткий смысл.
1
В конце концов результаты, объявленные ЦИК, подтвердили результаты 100 %
реализованной выборки с разницей в 0,52 %. Кандидат в мэры выиграл с разницей в 3,64 %.
58

II. Статистические аспекты пробеловв диапазоне данных
Приведенный пример свидетельствует о том, что иногда даже
80 %-ная реализация выборки недостаточна для обобщения результатов, особенно когда (как в этом примере) получение данных от единиц выборки не зависит от случайных факторов и не
воспроизводит исходную структуру выборки. Популярный на
практике факт, что 80 %-ный диапазон неполных данных (процент реализации запланированной выборки) есть значение «в
пределах нормы», должен пройти подробный методический анализ. И, вероятно, он окажется действительным для одних частных
случаев и недействительным для других.
Важно отметить, что стратегия «ничего не делать» в отношении потерянных данных основана на (часто неправдоподобном)
предположении, что по своей структуре ответившие и неответившие лица существенно не отличаются друг от друга. При подсчете средней или иных общих оценок простейшая гипотеза состоит
в том, что средняя участвовавших респондентов равна средней
неучаствовавших (неотвечавших). Альтернативная гипотеза заключается в том, что недостающие данные (выпавшие единицы)
были потеряны случайным образом. Согласно ей, отвечавшие и
неответившие могут различаться в каждой конкретной выборке, но среди всех возможных гипотетических выборок средние
двух групп (отвечавших и неотвечавших) будут оставаться одинаковыми. Однако, если эта гипотеза окажется ошибочной, даже
низкие уровни потери данных (от 10 до 20 %) могут привести к
значительной системной ошибке. Таблица 15 показывает, как системная ошибка увеличивается в зависимости от уровня неответивших. Мы видим, как относительные доли, оцениваемые в
данном исследовании, могут быть искажены из-за количества неответивших.
Когда 20 % выборки не отвечали, а 20 % от ответивших имеют
некоторые интересующие нас характеристики против 50 % от неответивших, выборочная оценка составит 20 % (на основе респон-
59

Глава первая. Проблемы при неполном диапазоне данных в эмпирических исследованиях...
Таблица 15
Системная ошибка по уровню неотвечавших [70]
Уровень
неответивших
0.10 0.2 0.3 0.01
0.10 0.2 0.4 0.02
0.10 0.2 0.5 0.03
0.20 0.2 0.3 0.02
0.20 0.2 0.4 0.04
0.20 0.2 0.5 0.06
0.40 0.2 0.3 0.04
0.40 0.2 0.4 0.08
0.40 0.2 0.5 0.12
Относительная доля с важными
характеристиками
среди ответивших среди неответивших
Системная
ошибка
дентов). Однако неотклоненная оценка (на основе ответивших и
неответивших) составит 26 % – разница в 6 %.1 Не обремененная
отклонением оценка всей генеральной совокупности составляет 0,20 для 80 %-ной генеральной совокупности, представленной
респондентами, и 0,50 для 20 %-ной генеральной совокупности,
представленной неответившими. Объединение двух групп производит 0,80 × 0,20 плюс 0,20 × 0,50, или 0,26. Если необходимо
построить доверительные границы, то, безусловно, окажется, что
граница ошибки из-за системной составляющей от неответивших
(Nonresponse Bias) в несколько раз шире, чем границы случайной
ошибки. Таким образом, случайная ошибка, оцененная точно, ста-
1
Системная ошибка (bias) – это разница между ожидаемым значением выборочных оценок и характеристиками генеральной совокупности, которые должны
быть оценены [70].
60
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
