Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Проблемы оптимизации выборочных данных с неполнотой в диапазоне. Монография
.pdf
III. Влияние неполного диапазона данных на достоверность и точность оценок
гаются усилия для недопущения системных ошибок, особенно
в крупномасштабных эмпирических исследованиях с большими
выборками.
В зависимости от источников системных ошибок необходимо
применять различные стратегии контроля и оценки (на всех этапах эмпирического исследования):
1) профилактический контроль – при формировании (реа-
лизации модели) случайной выборки;
2) текущий контроль процесса сбора и регистрации инди-
видуальной первичной информации;
3) последующий контроль – обработка и анализ информа-
ции, а также обобщенный анализ корректного выполнения процедур комплексного проведения исследования.
В нашей практике эмпирических исследований до сих пор
нет целенаправленных контрольных проверок достоверности
ответов опрошенных респондентов при сборе индивидуальной
информации в поле. О размерах допускаемых ошибок в этом отношении можно судить в основном по результатам контрольных
подсчетов точности регистрации, применявшихся при последних
переписях населения (в том числе в 2021 г.).
Поясним на примере. Рассмотрим полученные результаты
контрольных проверок только по трем признакам – возрасту, семейному положению и образованию, которые чаще всего включаются в анкеты эмпирических исследований.
Допустим, что выборка контрольного исследования включает 7539 человек. При проверке было установлено, что на признак
«возраст» правильно ответили 7354 человека, ошиблись 185 человек, т. е. 2,5 % опрошенных. Другими словами, на каждые 200респондентов пятеро дали неверный ответ относительно своего
возраста. Распределение ошибки по возрасту показано по абсолютному значению следующим образом: до 3 лет – 84,9 %; от 4 до
6 лет – 5,9 %; от 7 до 9 лет – 2,2 %; 10 лет и старше – 7 %.
71

Глава первая. Проблемы при неполном диапазоне данных в эмпирических исследованиях...
Отмечается, что преобладают небольшие отклонения (около
58 % ошибочно имеют 1 год отклонения по возрасту, установленного при проверке). Если принять во внимание еще и направление (знак) ошибок, то будет установлено, что 54,1 % опрошенных
увеличили свой возраст, а 45,9 % понизили его. В конечном счете это приводит только к незначительному завышению среднего
возраста населения по сравнению с фактическим.
По признаку «семейное положение» число ошибившихся
лиц составляет 154, т. е. 2 %. По разновидностям признака они
распределяются способом, отраженным в табл. 17.
Таблица 17
Число ошибившихся лиц по признаку «семейное положение»
Признак
Правильно
Семейное положение
Холост/не замужем 2507 14 23 37 1,5 –9 –0,4
Женат/юр. брак 4248 63 69 132 3,1 –6 –0,1
Женат/гражд. брак 76 56 28 84 80,8 28 26,9
Разведен/а 85 9 10 19 20,0 –1 –1,1
Разделен/а 12 7 4 11 68,8 3 18,8
Вдовец/вдова 457 5 20 25 5,2 –15 –3,2
подсчитано
Неправиль-
но
Вкл.
Грубая
ошибка
Искл.
Кол-во
Чистая
ошибка
%
%
Кол-во
Наименьшие ошибки при типичных разновидностях признака – «не женат», «женат», «разведен», «вдовец» (см. табл. 17).
Развертывание разновидности «женатые» в двух формах, с юридическим браком и гражданским браком, привело к большой
ошибке при заполнении второй формы. Вероятно, появление
дополнительной разновидности «разделен» также повлияло на
возникновение большой ошибки в ответе на эту разновидность
признака. Обобщенное влияние допущенных ошибок выражает-
72

III. Влияние неполного диапазона данных на достоверность и точность оценок
ся в завышении доли женатых только с фактически оформленным браком и разделенных за счет занижения доли лиц по другим разновидностям признака. Эти результаты свидетельствуют
о том, что в эмпирических исследованиях желательно использовать только четыре классические разновидности признака «семейное положение».
При подсчете в графах по признаку «образование» выделя-
ется большое количество разновидностей, и признак представляет собой собственно образование и грамотность: «ребенок»,
«неграмотный», «только читает», «читает и пишет», «начальное»,
«неполное среднее», «ПТУ», «среднее общее», «среднее специальное», «СПТУ», «высшее неполное» и «высшее». При этом число
лиц, указавших неправильный ответ, составляет 611, т. е. порядка 8,1 %. Относительно большие общие ошибки в разновидностях со «среднего специального» (36,8 %), «ПТУ» (25,8 %) и по
«начальное» (24,3 %). Это происходит как из-за неправильного
включения в эти разновидности ответов респондентов, так и изза исключения из них. У некоторых разновидностей признаков,
однако, явное преобладание одной из двух групп – неправильно
включены или исключены. При разновидности «неполное высшее» количество включенных значительно преобладает над исключенными, поэтому и чистая ошибка самая высокая – 6,6 %
(табл. 18).
В целом результаты последнего столбца табл. 18 показывают, что при пересчете завышен уровень образования населения. Эта тенденция проявляется в основном в разновидностях «среднее» и «высшее» образование. Поэтому имеет смысл
оценить, насколько необходимо в вопросе образования формулировать большое количество разновидностей или же использовать более укрупненные группы классического типа:
«начальное», «неполное среднее (включая ПТУ)», «среднее» и
«высшее», так как «неоконченное высшее» по усмотрению ис-
73

Глава первая. Проблемы при неполном диапазоне данных в эмпирических исследованиях...
Таблица 18
Результаты контрольных проверок по признаку «образование»
Признак
Правильно
Образование
Ребенок 820 22 31 53 6,2 –9 –1,1
Начальное 2293 299 342 641 24,3 –43 –1,6
Неполное среднее 2053 152 102 254 11,7 50 2,3
ПТУ 131 16 24 40 25,8 –8 –5,2
Среднее общее 542 49 33 82 14,3 16 2,8
Среднее специальное 113 27 23 50 36,8 4 2,9
СПТУ 562 33 51 84 13,7 –18 –2,8
Колледж 121 9 1 10 8,2 8 6,6
Высшее 293 4 4 8 2,7 0 –
Все 6928 611 611 1122 – – –
подсчитано
Неправильно
Вкл.
Искл.
Грубая
ошибка
Кол-во
%
Чистая
ошибка
%
Кол-во
следователя относится к среднему или высшему образованию.
Проблемы с признаком «образование» теперь еще более актуальны из-за введения образовательных степеней «бакалавр» и
«магистр» и последующего отказа от разновидности «неоконченное высшее» образование.
Сравнение количества ошибок, допущенных при удовлетворении трем признакам – возрасту, семейному положению и образованию, показывает, что наибольший риск допуска ошибок
в признаке «образование», где каждый 13-й человек показывает недостоверный ответ. Более умеренным является этот риск в
двух других признаках, где каждый 50-й человек показывает недостоверный ответ. Такое сравнение особенно полезно (при этом
желательно включить в него и ряд других признаков), поскольку
74

III. Влияние неполного диапазона данных на достоверность и точность оценок
позволяет оценить усилия исследователя по их преодолению при
подготовке эмпирических исследований1.
2. Возможности ограничения влияния выпадающих единиц
в диапазоне данных на достоверность
Неполнота охвата в любом случае повлияла бы на достоверность эмпирической информации, полученной как из сплошного,
так и из выборочного эмпирического исследования. Проблема в
том, в какой степени это происходит, при каких обстоятельствах
необходимо принимать стратегии защиты, а также с помощью каких подходов и методов эти стратегии могут быть реализованы.
Ранее мы указывали, что в выборочном исследовании, поми-
мо достоверности, неполнота данных диапазона также влияет
на репрезентативность эмпирической информации. Возникает
вопрос: когда это влияние настолько значимо, что выборка не может быть использована для получения выводов и обобщений для
экстраполяции на генеральную совокупность? В практике и теории эмпирических исследований были предприняты многочисленные попытки оценить эффект пробелов в диапазоне данных в
исследовании. Согласно Кокрену [13], влияние этого явления на
результаты выборочного эмпирического исследования происходит следующим образом:
1. Оценки совокупных свойств исследуемого объекта могут
оказаться смещенными (причина этого была обсуждена ранее).
Было выяснено, что часть выборочной совокупности, не охва-
1
Следует отметить, что аналогичные проблемы возникают особенно в международных сравнительных исследованиях, в которых используются подробные
классификаторы профессий (более 50 крупных классов с подкатегориями).
Обычно такие вопросы обременены риском ошибок в ответах, потерянными
данными, а их результаты – нарушениями точности. Как правило, недостоверные ответы могут быть получены и при вопросах, касающихся экономического
статуса респондента – доходов, расходов, налогов и т. д.
75

Глава первая. Проблемы при неполном диапазоне данных в эмпирических исследованиях...
ченная в поле, может отличаться от исследуемой. Подтверждения
этого предположения были найдены во многих экспериментальных исследованиях, а также в теоретических методологических
разработках. Отсюда вытекает и самое главное следствие – появление системной ошибки. Проверки в этом направлении обычно
показывают, что непроинтервьюированные единицы отличаются
от ответивших различными признаками, включенными в программу исследования. Различия иногда меняются слишком сильно, а иногда – лишь незначительно.
2. Дисперсия оценок неизбежно возрастает, так как фактически
реализованный объем выборки меньше заранее запланированного.
Это отражается на выявлении случайных ошибок оценки. Если мы
допустим, что информация о 20 % случаев в выборке не была получена, то это при прочих равных условиях будет означать, что предсказанная случайная ошибка будет увеличена на множитель
1
0,80n
т. е. около 12 %. (15)
1,12,
n
Неблагоприятный эффект становится еще более впечатляющим, когда относительная доля ответивших респондентов падает
до 60 %. Тогда величина ошибки вырастет до 29 %. Но это все же
меньшая беда. Если бы только это, легче всего было бы предсказать (по опыту) приблизительную относительную долю без ответа,
и планируемый объем выборки увеличился бы на тот же процент.
В качестве односторонней оборонительной стратегии эта возможность остается, и она часто используется на практике. Бόльшая беда
исходит из упомянутого первого эффекта – появления системной
ошибки, из-за которой оценки неизбежно становятся сомнительно
достоверными и ненадежными. Это делает исследовательскую проблему настолько серьезной, что для ее преодоления ищутся другие
защитные методологические подходы и решения.
76

III. Влияние неполного диапазона данных на достоверность и точность оценок
При исследовании влияния появления выпадающих единиц на
результаты эмпирических исследований принимается установка о
том, что вся совокупность делится на две группы. Первая включает
в себя все единицы, которые, попав в выборку, опрашиваются и в
поле, т. е. по ним получена запрашиваемая информация, а вторая–
единицы, которые не могут быть опрошены, и от них не получена
запрашиваемая информация (в эту группу также попадают единицы, с которыми установлен контакт, но из-за их отказа отвечать
или по иным причинам информация не получена). Это деление
считается весьма условным, так как в этом случае предполагается,
что вероятность поиска для каждой единицы одинакова. Но фактически в зависимости от конкретного случая эта вероятность может
варьировать в широких пределах и принимать различные значения
для разных единиц. Несмотря на эту условность, принятая схема
позволяет далее перейти к оценке последствий, вносимых неполучением части искомой информации (от выпадающих единиц).
Иболее того – с помощью этого создается база оценок (конечно,
условных и приблизительных) для недостающих данных.
Две упомянутые выше группы обозначаются следующим образом:
N1 – количество единиц в первой группе (по которым запра-
шиваемая информация была получена);
N2 – количество единиц во второй группе (по которым запра-
шиваемая информация не была получена).
Теперь можно рассчитать относительную долю единиц в обеих группах по отношению к генеральной совокупности:
N
WN – для первой группы; (16)
1
1
N
WN
2
2
– для второй группы. (17)
Далее предполагается, что из генеральной совокупности извлекается простая случайная выборка. После проведения опро-
77

Глава первая. Проблемы при неполном диапазоне данных в эмпирических исследованиях...
са имеется запрашиваемая информация о простой случайной
выборке первой группы, но нет никакой информации о второй
группе. Величина смещения выборочной оценки может быть
установлена по формуле средней арифметической:
где
Y
– средняя для первой группы;
1
1112
(),YYY WYWY (18)
12
Y – средняя для второй
2
группы; Y – общая средняя для всей совокупности.
При выборочном эмпирическом исследовании получается
информация о
Y
, W1 и для W2 (относительная доля неучаство-
1
вавших и неответивших лиц).
После некоторой обработки с использованием выражения
W1 = 1 – W2 приведенная выше формула приобретает вид
112
().YYWYY (19)
2
Видно, что величина смещения выборочной оценки, как следствие неполноты диапазона охвата, представляет собой произведение относительной доли неучаствовавших (в том числе неотве-
1
тивших) лиц и разницы средних по обеим группам
выборка не дает никаких сведений о значении
. Поскольку
Y , то величина
2
смещения остается неизвестной, если только невозможно указать
границы для
Y из других источников.
2
При непрерывных признаках (например, при интервальной
шкале измерения – доход, площадь жилища, сбережения и т. д.)
границы
Y
часто настолько широки, что практически беспо-
1
лезно делать для них какие-либо оценки. Именно по этой причине при таких признаках, независимо от того, каково значение
1
При исследовании проблемы смещения оценки из-за неполучения запрашиваемой информации (неполнота охвата) предполагается, что для группы 1 получены достоверные данные (т. е. последние являются адекватным отражением
свойств охваченных единиц [13]).
78

III. Влияние неполного диапазона данных на достоверность и точность оценок
W2 ≠ 0, невозможно указать приемлемые доверительные преде-
лы для Y (общая средняя) по данным, полученным только из
выборки.
Однако, когда создается выборка для оценки относительных долей (таковы большинство показателей в эмпирических
исследованиях, где в основном используются качественные
признаки), ситуация упрощается, потому что неизвестная относительная доля P2 для второй группы (неучаствовавших и
неответивших) находится между 0 и 1. Тогда, если значение
W2 известно из выборки, то границы для P2 (т. е. 0 ≤ P2 ≤ 1)
позволяют построить доверительные пределы для общего P в
генеральной совокупности (известно, что P = P1W1 + P2W2, как
W1 + W2 = 1).
Здесь также верно предположение о том, что была извлечена простая случайная выборка объемом N единиц, и из нее была
получена запрашиваемая информация (p1) для n1 единиц. Если n1
достаточно большое, то 95 %-ный доверительный предел для P1
будут выглядеть так1:
pq
Nn
P
(20)
1, 96 ,
1
11
nN
1
где P1 – интересующая нас относительная доля в генеральной совокупности;
p1 – оценка P1 по выборке2; q1 = 1 – p1;
n1 – количество опрошенных единиц в выборке;
1
Второй компонент формулы (20) более известен как
нимать во внимание, поскольку выборки составляют небольшую долю общих
совокупностей.
2
Здесь мы сохраняем оригинальные обозначения, данные Кокреном [13], вме-
ˆ
сто принятых у нас (например, оценка
купности P1 и др.).
p
– относительная доля в общей сово-
1
n
1,
и его можно при-
N
79

Глава первая. Проблемы при неполном диапазоне данных в эмпирических исследованиях...
n – планируемый объем выборки;
N – число единиц в генеральной совокупности.
Если нужно получить доверительные границы для P (общая относительная доля в генеральной совокупности), то, используя вышеприведенную формулу, чтобы найти нижнюю
границу Rд, считаем, что P2 = 0, и соответственно для нахождения верхней границы Rг – что P2 = 1. Эти границы [13] выглядят так:
pq
P
P
= W1(p1 – 1,96
Д
= W1(p1 – 1,96
Г
11
) + W2, (21)
n
1
pq
11
) + W2. (22)
n
1
Кокрен [13] показывает, что при росте W
ширина довери-
2
тельного интервала для P быстро возрастает, т. е. доверительные
утверждения для P становятся очень нестабильными. Если, например, в одной выборке из 1000 человек выборочная оценка p1
составляет 5 %, доверительный предел P будет в зависимости от
процента неучаствовавших и неответивших (W2), следовательно,
при W2 = 0 % P будет в пределах от 3,6 до 6,4 %, при W2 = 5 %
значение P будет между 3,4 и 11,1 %, а при W2 = 20 % величина P
будет в пределах от 2,8 до 25,2 %.
В процентном значении максимальная случайная ошибка
(Δ %) была бы между
2,8 %
и
25,2 %
,5% т. е. от 56 до 500 %!
5%
Формулы доверительных границ Р позволяют увидеть реализацию первой из упомянутых выше стратегий, т. е. решить задачу, каким должен быть объем выборки, чтобы обеспечить тот же
доверительный интервал, но при W
= 0. Для этого используется
2
формула
80
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
