Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Проблемы оптимизации выборочных данных с неполнотой в диапазоне. Монография

.pdf
Скачиваний:
0
Добавлен:
07.09.2026
Размер:
1 Мб
Скачать
III. Влияние неполного диапазона данных на достоверность и точность оценок
гаются усилия для недопущения системных ошибок, особенно в крупномасштабных эмпирических исследованиях с большими выборками.
В зависимости от источников системных ошибок необходимо применять различные стратегии контроля и оценки (на всех эта­пах эмпирического исследования):
1) профилактический контроль – при формировании (реа-
лизации модели) случайной выборки;
2) текущий контроль процесса сбора и регистрации инди-
видуальной первичной информации;
3) последующий контроль – обработка и анализ информа- ции, а также обобщенный анализ корректного выполнения про­цедур комплексного проведения исследования.
В нашей практике эмпирических исследований до сих пор нет целенаправленных контрольных проверок достоверности ответов опрошенных респондентов при сборе индивидуальной информации в поле. О размерах допускаемых ошибок в этом от­ношении можно судить в основном по результатам контрольных подсчетов точности регистрации, применявшихся при последних переписях населения (в том числе в 2021 г.).
Поясним на примере. Рассмотрим полученные результаты контрольных проверок только по трем признакам – возрасту, се­мейному положению и образованию, которые чаще всего включа­ются в анкеты эмпирических исследований.
Допустим, что выборка контрольного исследования включа­ет 7539 человек. При проверке было установлено, что на признак «возраст» правильно ответили 7354 человека, ошиблись 185 чело­век, т. е. 2,5 % опрошенных. Другими словами, на каждые 200ре­спондентов пятеро дали неверный ответ относительно своего возраста. Распределение ошибки по возрасту показано по абсо­лютному значению следующим образом: до 3 лет – 84,9 %; от 4 до 6 лет – 5,9 %; от 7 до 9 лет – 2,2 %; 10 лет и старше – 7 %.
71
Глава первая. Проблемы при неполном диапазоне данных в эмпирических исследованиях...
Отмечается, что преобладают небольшие отклонения (около 58 % ошибочно имеют 1 год отклонения по возрасту, установлен­ного при проверке). Если принять во внимание еще и направле­ние (знак) ошибок, то будет установлено, что 54,1 % опрошенных увеличили свой возраст, а 45,9 % понизили его. В конечном сче­те это приводит только к незначительному завышению среднего возраста населения по сравнению с фактическим.
По признаку «семейное положение» число ошибившихся лиц составляет 154, т. е. 2 %. По разновидностям признака они распределяются способом, отраженным в табл. 17.
Таблица 17
Число ошибившихся лиц по признаку «семейное положение»
Признак
Правильно
Семейное положение
Холост/не замужем 2507 14 23 37 1,5 –9 –0,4
Женат/юр. брак 4248 63 69 132 3,1 –6 –0,1
Женат/гражд. брак 76 56 28 84 80,8 28 26,9
Разведен/а 85 9 10 19 20,0 –1 –1,1
Разделен/а 12 7 4 11 68,8 3 18,8
Вдовец/вдова 457 5 20 25 5,2 –15 –3,2
подсчитано
Неправиль-
но
Вкл.
Грубая
ошибка
Искл.
Кол-во
Чистая
ошибка
%
%
Кол-во
Наименьшие ошибки при типичных разновидностях при­знака – «не женат», «женат», «разведен», «вдовец» (см. табл. 17). Развертывание разновидности «женатые» в двух формах, с юри­дическим браком и гражданским браком, привело к большой ошибке при заполнении второй формы. Вероятно, появление дополнительной разновидности «разделен» также повлияло на возникновение большой ошибки в ответе на эту разновидность признака. Обобщенное влияние допущенных ошибок выражает-
72
III. Влияние неполного диапазона данных на достоверность и точность оценок
ся в завышении доли женатых только с фактически оформлен­ным браком и разделенных за счет занижения доли лиц по дру­гим разновидностям признака. Эти результаты свидетельствуют о том, что в эмпирических исследованиях желательно использо­вать только четыре классические разновидности признака «се­мейное положение».
При подсчете в графах по признаку «образование» выделя- ется большое количество разновидностей, и признак представ­ляет собой собственно образование и грамотность: «ребенок», «неграмотный», «только читает», «читает и пишет», «начальное», «неполное среднее», «ПТУ», «среднее общее», «среднее специаль­ное», «СПТУ», «высшее неполное» и «высшее». При этом число лиц, указавших неправильный ответ, составляет 611, т. е. поряд­ка 8,1 %. Относительно большие общие ошибки в разновидно­стях со «среднего специального» (36,8 %), «ПТУ» (25,8 %) и по «начальное» (24,3 %). Это происходит как из-за неправильного включения в эти разновидности ответов респондентов, так и из­за исключения из них. У некоторых разновидностей признаков, однако, явное преобладание одной из двух групп – неправильно включены или исключены. При разновидности «неполное выс­шее» количество включенных значительно преобладает над ис­ключенными, поэтому и чистая ошибка самая высокая – 6,6 % (табл. 18).
В целом результаты последнего столбца табл. 18 показы­вают, что при пересчете завышен уровень образования насе­ления. Эта тенденция проявляется в основном в разновидно­стях «среднее» и «высшее» образование. Поэтому имеет смысл оценить, насколько необходимо в вопросе образования фор­мулировать большое количество разновидностей или же ис­пользовать более укрупненные группы классического типа: «начальное», «неполное среднее (включая ПТУ)», «среднее» и «высшее», так как «неоконченное высшее» по усмотрению ис-
73
Глава первая. Проблемы при неполном диапазоне данных в эмпирических исследованиях...
Таблица 18
Результаты контрольных проверок по признаку «образование»
Признак
Правильно
Образование
Ребенок 820 22 31 53 6,2 –9 –1,1
Начальное 2293 299 342 641 24,3 –43 –1,6
Неполное среднее 2053 152 102 254 11,7 50 2,3
ПТУ 131 16 24 40 25,8 –8 –5,2
Среднее общее 542 49 33 82 14,3 16 2,8
Среднее специальное 113 27 23 50 36,8 4 2,9
СПТУ 562 33 51 84 13,7 –18 –2,8
Колледж 121 9 1 10 8,2 8 6,6
Высшее 293 4 4 8 2,7 0
Все 6928 611 611 1122
подсчитано
Непра­вильно
Вкл.
Искл.
Грубая
ошибка
Кол-во
%
Чистая
ошибка
%
Кол-во
следователя относится к среднему или высшему образованию. Проблемы с признаком «образование» теперь еще более акту­альны из-за введения образовательных степеней «бакалавр» и «магистр» и последующего отказа от разновидности «неокон­ченное высшее» образование.
Сравнение количества ошибок, допущенных при удовлетво­рении трем признакам – возрасту, семейному положению и об­разованию, показывает, что наибольший риск допуска ошибок в признаке «образование», где каждый 13-й человек показыва­ет недостоверный ответ. Более умеренным является этот риск в двух других признаках, где каждый 50-й человек показывает не­достоверный ответ. Такое сравнение особенно полезно (при этом желательно включить в него и ряд других признаков), поскольку
74
III. Влияние неполного диапазона данных на достоверность и точность оценок
позволяет оценить усилия исследователя по их преодолению при подготовке эмпирических исследований1.
2. Возможности ограничения влияния выпадающих единиц в диапазоне данных на достоверность
Неполнота охвата в любом случае повлияла бы на достовер­ность эмпирической информации, полученной как из сплошного, так и из выборочного эмпирического исследования. Проблема в том, в какой степени это происходит, при каких обстоятельствах необходимо принимать стратегии защиты, а также с помощью ка­ких подходов и методов эти стратегии могут быть реализованы.
Ранее мы указывали, что в выборочном исследовании, поми-
мо достоверности, неполнота данных диапазона также влияет на репрезентативность эмпирической информации. Возникает
вопрос: когда это влияние настолько значимо, что выборка не мо­жет быть использована для получения выводов и обобщений для экстраполяции на генеральную совокупность? В практике и тео­рии эмпирических исследований были предприняты многочис­ленные попытки оценить эффект пробелов в диапазоне данных в исследовании. Согласно Кокрену [13], влияние этого явления на результаты выборочного эмпирического исследования происхо­дит следующим образом:
1. Оценки совокупных свойств исследуемого объекта могут
оказаться смещенными (причина этого была обсуждена ранее). Было выяснено, что часть выборочной совокупности, не охва-
1
Следует отметить, что аналогичные проблемы возникают особенно в между­народных сравнительных исследованиях, в которых используются подробные классификаторы профессий (более 50 крупных классов с подкатегориями). Обычно такие вопросы обременены риском ошибок в ответах, потерянными данными, а их результаты – нарушениями точности. Как правило, недостовер­ные ответы могут быть получены и при вопросах, касающихся экономического статуса респондента – доходов, расходов, налогов и т. д.
75
Глава первая. Проблемы при неполном диапазоне данных в эмпирических исследованиях...
ченная в поле, может отличаться от исследуемой. Подтверждения этого предположения были найдены во многих эксперименталь­ных исследованиях, а также в теоретических методологических разработках. Отсюда вытекает и самое главное следствие – появ­ление системной ошибки. Проверки в этом направлении обычно показывают, что непроинтервьюированные единицы отличаются от ответивших различными признаками, включенными в про­грамму исследования. Различия иногда меняются слишком силь­но, а иногда – лишь незначительно.
2. Дисперсия оценок неизбежно возрастает, так как фактически реализованный объем выборки меньше заранее запланированного. Это отражается на выявлении случайных ошибок оценки. Если мы допустим, что информация о 20 % случаев в выборке не была полу­чена, то это при прочих равных условиях будет означать, что пред­сказанная случайная ошибка будет увеличена на множитель
1
0,80n
т. е. около 12 %. (15)
1,12,
n
Неблагоприятный эффект становится еще более впечатляю­щим, когда относительная доля ответивших респондентов падает до 60 %. Тогда величина ошибки вырастет до 29 %. Но это все же меньшая беда. Если бы только это, легче всего было бы предска­зать (по опыту) приблизительную относительную долю без ответа, и планируемый объем выборки увеличился бы на тот же процент. В качестве односторонней оборонительной стратегии эта возмож­ность остается, и она часто используется на практике. Бόльшая беда исходит из упомянутого первого эффекта – появления системной ошибки, из-за которой оценки неизбежно становятся сомнительно достоверными и ненадежными. Это делает исследовательскую про­блему настолько серьезной, что для ее преодоления ищутся другие защитные методологические подходы и решения.
76
III. Влияние неполного диапазона данных на достоверность и точность оценок
При исследовании влияния появления выпадающих единиц на результаты эмпирических исследований принимается установка о том, что вся совокупность делится на две группы. Первая включает в себя все единицы, которые, попав в выборку, опрашиваются и в поле, т. е. по ним получена запрашиваемая информация, а вторая– единицы, которые не могут быть опрошены, и от них не получена запрашиваемая информация (в эту группу также попадают едини­цы, с которыми установлен контакт, но из-за их отказа отвечать или по иным причинам информация не получена). Это деление считается весьма условным, так как в этом случае предполагается, что вероятность поиска для каждой единицы одинакова. Но факти­чески в зависимости от конкретного случая эта вероятность может варьировать в широких пределах и принимать различные значения для разных единиц. Несмотря на эту условность, принятая схема позволяет далее перейти к оценке последствий, вносимых непо­лучением части искомой информации (от выпадающих единиц). Иболее того – с помощью этого создается база оценок (конечно, условных и приблизительных) для недостающих данных.
Две упомянутые выше группы обозначаются следующим об­разом:
N1 – количество единиц в первой группе (по которым запра-
шиваемая информация была получена);
N2 – количество единиц во второй группе (по которым запра-
шиваемая информация не была получена).
Теперь можно рассчитать относительную долю единиц в обе­их группах по отношению к генеральной совокупности:
N
WN – для первой группы; (16)
1
1
N
WN
2
2
– для второй группы. (17)
Далее предполагается, что из генеральной совокупности из­влекается простая случайная выборка. После проведения опро-
77
Глава первая. Проблемы при неполном диапазоне данных в эмпирических исследованиях...
са имеется запрашиваемая информация о простой случайной выборке первой группы, но нет никакой информации о второй группе. Величина смещения выборочной оценки может быть установлена по формуле средней арифметической:
где
Y
– средняя для первой группы;
1
1112
(),YYY WYWY  (18)
12
Y – средняя для второй
2
группы; Y – общая средняя для всей совокупности.
При выборочном эмпирическом исследовании получается информация о
Y
, W1 и для W2 (относительная доля неучаство-
1
вавших и неответивших лиц).
После некоторой обработки с использованием выражения
W1 = 1 – W2 приведенная выше формула приобретает вид
112
().YYWYY (19)
2
Видно, что величина смещения выборочной оценки, как след­ствие неполноты диапазона охвата, представляет собой произве­дение относительной доли неучаствовавших (в том числе неотве-
1
тивших) лиц и разницы средних по обеим группам выборка не дает никаких сведений о значении
. Поскольку
Y , то величина
2
смещения остается неизвестной, если только невозможно указать границы для
Y из других источников.
2
При непрерывных признаках (например, при интервальной шкале измерения – доход, площадь жилища, сбережения и т. д.) границы
Y
часто настолько широки, что практически беспо-
1
лезно делать для них какие-либо оценки. Именно по этой при­чине при таких признаках, независимо от того, каково значение
1
При исследовании проблемы смещения оценки из-за неполучения запрашива­емой информации (неполнота охвата) предполагается, что для группы 1 полу­чены достоверные данные (т. е. последние являются адекватным отражением свойств охваченных единиц [13]).
78
III. Влияние неполного диапазона данных на достоверность и точность оценок
W2 ≠ 0, невозможно указать приемлемые доверительные преде-
лы для Y (общая средняя) по данным, полученным только из выборки.
Однако, когда создается выборка для оценки относитель­ных долей (таковы большинство показателей в эмпирических исследованиях, где в основном используются качественные признаки), ситуация упрощается, потому что неизвестная от­носительная доля P2 для второй группы (неучаствовавших и неответивших) находится между 0 и 1. Тогда, если значение
W2 известно из выборки, то границы для P2 (т. е. 0 ≤ P2 ≤ 1)
позволяют построить доверительные пределы для общего P в генеральной совокупности (известно, что P = P1W1 + P2W2, как
W1 + W2 = 1).
Здесь также верно предположение о том, что была извлече­на простая случайная выборка объемом N единиц, и из нее была получена запрашиваемая информация (p1) для n1 единиц. Если n1 достаточно большое, то 95 %-ный доверительный предел для P1 будут выглядеть так1:
pq
Nn
P
 (20)
1, 96 ,
1
11
nN
1
где P1 – интересующая нас относительная доля в генеральной со­вокупности;
p1 – оценка P1 по выборке2; q1 = 1 – p1;
n1 – количество опрошенных единиц в выборке;
1
Второй компонент формулы (20) более известен как
нимать во внимание, поскольку выборки составляют небольшую долю общих совокупностей.
2
Здесь мы сохраняем оригинальные обозначения, данные Кокреном [13], вме-
ˆ
сто принятых у нас (например, оценка купности P1 и др.).
p
– относительная доля в общей сово-
1
n
1,
и его можно при-
N
79
Глава первая. Проблемы при неполном диапазоне данных в эмпирических исследованиях...
n – планируемый объем выборки;
N – число единиц в генеральной совокупности.
Если нужно получить доверительные границы для P (об­щая относительная доля в генеральной совокупности), то, ис­пользуя вышеприведенную формулу, чтобы найти нижнюю границу Rд, считаем, что P2 = 0, и соответственно для нахожде­ния верхней границы Rг – что P2 = 1. Эти границы [13] выгля­дят так:
pq
P
P
= W1(p1 – 1,96
Д
= W1(p1 – 1,96
Г
11
) + W2, (21)
n
1
pq
11
) + W2. (22)
n
1
Кокрен [13] показывает, что при росте W
ширина довери-
2
тельного интервала для P быстро возрастает, т. е. доверительные утверждения для P становятся очень нестабильными. Если, на­пример, в одной выборке из 1000 человек выборочная оценка p1 составляет 5 %, доверительный предел P будет в зависимости от процента неучаствовавших и неответивших (W2), следовательно, при W2 = 0 % P будет в пределах от 3,6 до 6,4 %, при W2 = 5 % значение P будет между 3,4 и 11,1 %, а при W2 = 20 % величина P будет в пределах от 2,8 до 25,2 %.
В процентном значении максимальная случайная ошибка
(Δ %) была бы между
2,8 %
и
25,2 %
,5% т. е. от 56 до 500 %!
5%
Формулы доверительных границ Р позволяют увидеть реали­зацию первой из упомянутых выше стратегий, т. е. решить зада­чу, каким должен быть объем выборки, чтобы обеспечить тот же доверительный интервал, но при W
= 0. Для этого используется
2
формула 80
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]