Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Проблемы оптимизации выборочных данных с неполнотой в диапазоне. Монография

.pdf
Скачиваний:
0
Добавлен:
07.09.2026
Размер:
1 Мб
Скачать
II. Статистические аспекты пробеловв диапазоне данных
новится бессмысленной. Что еще более важно, ошибка, вызван­ная не ответом респондентов, не будет случайной, и ее нулевое
значение в среднесрочном процессе не ожидается.
3. Механизм выпадающих единиц.
Классификация отсутствующих данных
За последние десятилетия, основываясь на предположении, что неответившие и ответивщие лица одинаковы как распределе­ние, в специальной литературе (Рубин [115]; Шафер [123]) приво­дится классификация недостающих данных.
Шафер [123] указывает, что каждый метод решения проблем с недостающими данными был разработан в соответствии с не­которыми «довольно непроверенными» статистическими предпо­ложениями о том, как недостающие данные были потеряны, т. е. без знания механизмов выпадающих единиц. Некоторые методы предполагают, что этот механизм преодолим, его воздействие мо­жет быть устранено, в смысле, определяемом Рубином [115].
Другим подходом, в основном близким к идее Рубина, явля­ется принятие предположения о случайном характере механизма недостающих данных диапазона (или потерянных1 (отсутствую­щих) случайным образом) (Missing at Random – MAR) [115; 116]. Эта гипотеза формулируется следующим образом: элементы, еди­ницы (данные) не отсутствуют случайным образом, а вероятность того, что значения отсутствует, зависит от значений переменных, которые фактически измеряются. Другими словами, отсутствие одной переменной или значения переменной представляет собой данные, потерянные случайным образом (MAR), когда, задавая им значения других, доступных переменных, респонденты полу-
1
Мы должны указать, что термины «недостающие» и «потерянные» данные принимаем за синонимы, поскольку указанные гипотезы о механизме потери данных не учитывают способов и методов их обработки (и возможной поте­ри), а только характеристики распределения «ответили» и «не ответили».
61
Глава первая. Проблемы при неполном диапазоне данных в эмпирических исследованиях...
чают недостающие значения, которые случайным образом отли­чаются от других респондентов. Является ли единица (оценка) на­блюдаемой или нет, не зависит от другой единицы (оценки), если последняя отсутствует, но она может зависеть от последней при наблюдении за ней (о ней была получена информация).
Несмотря на свое название, термин «случайно потерянные данные» (МАR) не означает, что недостающие значения должны быть поняты как случайная подвыборка всего массива.
Второе предположение, известное как «данные, полностью отсутствующие случайным образом» или «missing completely at random (MCAR)», является гораздо более ограничительным и ча­сто нереалистичным. Единицы отсутствуют по причинам, не свя­занным с какой-либо характеристикой или ответом респондента, включая недостающее значение и отсутствие единицы (Keppel [77]).
Другими словами, гипотеза о «полностью потерянных слу­чайным образом данных» означает, что вероятность отсутствия (потеря информации) может зависеть от значений наблюдаемых единиц, но не от тех, которые не наблюдались, а от тех, для кото­рых отсутствуют данные.
Чтобы проиллюстрировать смысл предположения о случайно потерянных данных, мы рассмотрим двухмерное распределение определенного количества единиц. В нем по переменной Х каждая единица имеет свое значение, т. е. данные о единицах признака. По второй переменной Y отсутствуют значения для некоторых еди­ниц. Согласно предположению, вероятность того, что Y будет от­сутствовать для единиц выборки, может быть связана с получени­ем (от единиц) значения для X, но никогда со значением Y.
Таким образом, мы определяем показатель ответов R с дихо- томическими значениями: он равен единице, если Y наблюдается (есть данные), и нулю, если они отсутствуют.
Предположение о потерянных случайным образом данных заключается в том, что Y и R могут иметь связь друг с другом, но
62
II. Статистические аспекты пробеловв диапазоне данных
только косвенно, через их взаимосвязь с X. Согласно предполо- жению о случайно потерянных данных, значения Y для неотве­тивших лиц могут быть систематически выше или ниже, чем для ответивших. Но гипотеза о случайных причинах потери данных MAR допускает, что статистическая связь (в смысле регрессия) между Y и X в среднем не отличается для обеих групп. Если усло­вие MAR было выполнено, то мы могли бы оценить регрессион­ную связь между Y и X для ответивших. А использовать получен­ную таким образом оценку могли, чтобы найти неотклоненные, не обремененные системной ошибкой оценки для Y, т. е. для не- ответивших лиц.
Дополнение этого простого примера более сложными си­туациями – скажем, когда отсутствуют значения и для Х, и для Y – для нас менее интуитивны и сложнее в описании. Однако приведенный здесь принцип прогнозирования применим и для них. Этот механизм закреплен в некоторых методах получения косвенным путем недостающих (потерянных) данных в эмпири­ческом исследовании. «Данные, отсутствующие случайным об­разом» является официальным, формальным предположением, которое позволяет измерять связи между переменными из распо­лагаемых данных, а затем, используя оценки этих связей между наблюдаемыми единицами, получить неотклоненные оценки для отсутствующих значений.
В предположении о случайно потерянных данных заслужива­ют внимания некоторые дополнительные условия.
Первое определяется в связи с переменными, представленны­ми в информационном массиве. Если потеря информации по пере­менной X связана с отсутствием значений для других переменных или с полной потерей ряда переменных, а переменная X удалена из массива, то условие для случайно потерянных данных больше не будет актуальным. По этой причине одной из практик в процеду­рах оптимизации является включение переменных, отсутствие (по-
63
Глава первая. Проблемы при неполном диапазоне данных в эмпирических исследованиях...
терю) которых можно предсказать. Потому что тогда MAR-гипоте­за может быть более правдоподобной и более приемлемой.
Второе: предположения о случайной потере данных не могут быть проверены непосредственно по имеющимся данным. Чтобы сделать это, необходимо знание о недостающих значениях само по себе, которое «замыкает круг», что сделало бы эту задачу не­решаемой.
Третье: данные, отсутствие которых запланировано из-за модели исследования (при исследовании с запланированным не­полным диапазоном данных), считаются случайно потерянными в целом.
Когда информация отсутствует по причинам, зависящим от контроля исследователей, никогда нельзя быть уверенным, что предположение о случайно потерянных данных вступило в силу. На самом деле зачастую неправильно говорить об отдельном «механизме потери данных», потому что в большинстве иссле­дований пропущенные значения зависят от множества причин. Некоторые из этих причин могут быть абсолютно независимы­ми от данных, о которых идет речь, а вот другие причины могут быть с ними тесно связаны. Допустим, проблемы с «выходом в поле» в случае школьного лонгитюдинального (повторяющегося во времени) исследования употребления наркотиков подростка­ми [123]. После первого этапа исследования некоторые респон­денты могут быть потеряны просто потому, что они перешли в другую школу, другие могут отказаться от проблемного поведе­ния, связанного с употреблением наркотиков, у третьих могут возникнуть проблемы со здоровьем и т. д. Неконтролируемая потеря единиц усиливается сочетанием незначительных и важ­ных факторов и источников1.
1
Подробное обсуждение этих проблем с примерами по запланированной и не­контролируемой потере единиц представлено у Graham, Hofer и Piccinin [66].
64
II. Статистические аспекты пробеловв диапазоне данных
К сожалению, невозможно освободиться от гипотезы о слу­чайно потерянных данных осмысленным образом без замены ее другими, одинаково не проверенными предположениями. Аль­тернатива состоит в том, чтобы построить и предложить фор­мальную вероятностную модель для ответов, а аналитик будет работать в соответствии с этой моделью. Обычно это требует зна­чительных усилий и возможности технической экспертизы. Такие анализы делаются по-разному, но методы имеют слишком боль­шие проблемы и не генерализуются хорошо1.
Помимо двух указанных гипотез о характере потери данных (а точнее, о характеристиках выделения выпавших единиц), в литературе приводится третий вид – так называемые «информа­тивно отсутствующие данные» (Informative Missing – IM). Более вероятно, что единицы будут отсутствовать, если их фактические значения для интересующих нас переменных ситуационно выше или ниже. Например, респондент с более низким экономическим статусом может с меньшей вероятностью дать информацию о своем личном доходе при собеседовании.
Наше рассмотрение вопроса показало, что информативно недостающие данные можно встретить в литературе под форму­лировкой «непренебрегаемое (которым мы не можем пренебречь) отсутствие ответа» – «Nonignorable Nonresponse». Этот тип по­тери данных является самым сложным для контроля, обработки и поиска оптимальных решений. Во многих случаях проблема информативных недостатков не может быть преодолена, несмо­тря на возможность использования данных для проверки и под­тверждения ее наличия.
1
Большинство современных методов, работающих с проблемой «недостаю­щих данных», предполагают, что данные были потеряны случайным образом (MAR).
65
Глава первая. Проблемы при неполном диапазоне данных в эмпирических исследованиях...
III. Влияние неполного диапазона данных
на достоверность и точность оценок
1. Влияние на достоверность информация по совокупности
Допущение ошибок в ответах опрошенных респондентов при сборе индивидуальной информации в полевых исследованиях не­избежно отражается на достоверности информации по совокуп­ности. Оно выражается в искажении распределения исследуемых единиц по значениям интересующего нас признака (признаков). В результате вычисляются обобщающие статистические показа­тели, такие как относительные величины, средние величины, по­казатели рассеивания, корреляционные коэффициенты и др., ко­торые отличаются в той или иной степени от своих достоверных значений. Только в очень редких случаях, при полной компенса­ции ошибок в ответах респондентов по количеству и величине значения, они могут и не отражаться на части статистических по­казателей (например, на среднем арифметическом). В остальных случаях, даже после такой компенсации, неизбежно происходит смещение в оценках исследуемой совокупности, т. е. существует системная ошибка.
В литературе (Кокрен [13]) была предпринята попытка по­строить общую математическую модель ошибок, допущенных в ответах респондентов при сборе индивидуальной информации в поле. Модель предполагает, что при проведении эмпирических исследований (опросов) присутствуют два вида информации: об истинном значении признака (достоверный ответ испытуемого) и допущенная ошибка по отношению к тому же значению признака (ошибка ответа). Тогда мысленно можно представить, что можно сделать большое количество независимых опросов с одной еди­ницей совокупности (или, другими словами, гипотетически мы задаем одному человеку много раз один и тот же вопрос и полу-
66
III. Влияние неполного диапазона данных на достоверность и точность оценок
чаем столько раз ответ на один и тот же вопрос). Мы будем ис­пользовать следующие обозначения:
Yik – ответ i-го исследуемого лица в ходе опроса;
μi – достоверный ответ на заданный вопрос;
lik – ошибка, допущенная в ответе i-го исследуемого лица в k-м вопросе.
Тогда ответ i-го исследуемого лица, которому мы задали большое количество вопросов, при k-м вопросе можно предста- вить так:
Y
= μi + l
ik
. (13)
ik
Когда мы рассматриваем все, а не только один k-й вопрос, ошибка l
, допущенная в ответе, будет иметь какое-то частотное
i
распределение. Для последнего можно рассчитать две основные характеристики – среднее и дисперсию, которые относятся к i-му
2
исследуемому лицу. Назовем их βi и
S
. Здесь βi представляет со-
i
бой смещение в ответе i-го исследуемого лица при задании соот­ветствующего вопроса из вопросника.
Далее возникает вопрос: как изменяется ошибка, допущенная в ответе на соответствующий вопрос, при переходе от одного ис­следуемого лица к другому, т. е. что происходит с βi в исследуемой совокупности лиц, потому что в эмпирических исследованиях исследователь, как правило, изучает не одно лицо, а целые сово­купности? Здесь у нас будет столько же βi, сколько лиц в совокуп­ности. Затем мы можем вычислить общее среднее значение для βi, которое будет представлять собой среднее (одно и то же) смеще­ние β, относящееся ко всем лицам в исследуемой совокупности. Это средняя ошибка, допущенная в ответах всех опрошенных.
Отклонение (βi – β) будет удельным средним смещением в со­вокупности при (βi – β) > 0, или будет меньше, когда (βi – β) < 0, или совпадает с ним при (βi – β) = 0. Кроме этого, здесь есть еще одна составляющая ошибки, которая представлена как
67
Глава первая. Проблемы при неполном диапазоне данных в эмпирических исследованиях...
dik = lik – βi. (14)
Это происходит при переходе от одного вопроса к другому для одного и того же испытуемого i. Этот компонент называется флуктуирующей (колеблющейся, непостоянной) ошибкой. Он не появляется систематически, как β
.
i
Ошибки lik в исследуемой совокупности могут коррелировать друг с другом – например, в групповом анонимном опросе, когда испытуемые не могут разговаривать друг с другом, а при иссле­довании неодушевленных предметов, данные о которых получа­ются с помощью натуральных переборов (измерений), ошибки не коррелируют. Однако в большинстве случаев между ошибками существуют корреляции. Это может быть связано как с исполь­зуемыми инструментами (например, систематическое заниже­ние больших значений и завышение малых значений μi), так и с участием людей в опросе (например, влияние интервьюеров) или с другими побочными условиями (наличие третьих лиц при опросе). Наличие корреляций между ошибками требует удвое­ния усилий исследователя по созданию полноценных условий для получения достоверной индивидуальной информации в поле. Не­обходимость таких усилий может быть проиллюстрирована при­мером.
Лесли Киш провел исследование выборки владельцев домов с целью получения от них оценки своих домовладений по стои­мости (рыночной цене). При опросе была получена средняя сто­имость одного дома 9200 долларов. Позже на той же выборке была проведена повторная оценка профессиональными оценщи­ками, оценки которых были признаны достоверными. Средняя стоимость одного дома, по данным профессиональных оценщи­ков, составила 8880 долларов, т. е. существует отклонение между установленной средней опроса и достоверной средней в размере 320долларов. Это, по сути, систематическая ошибка, допущенная в индивидуальной информации. Относительная доля ошибки в
68
III. Влияние неполного диапазона данных на достоверность и точность оценок
заданной средней при опросе составляет 3,5 %. Возникает вопрос: эта ошибка маленькая или большая?
Чтобы оценить влияние указанной системной ошибки, необ­ходимо рассмотреть ее одновременно с выборочной (случайной) ошибкой при различных (вариативных) объемах выборки (рис. 4, табл. 16).
Bias=0,32
5,7/
я
10000
ˁ
Рис. 4. Иллюстрация эффекта ошибки в разных объемах выборки
Только случайная часть общей ошибки составляет
5,7/я1000
5,7/я100
5, 7
1
2
,n при
добавлении системной ошибки общая ошибка принимает значение
2
5, 7
(0,32).
2
Из приведенного соотношения можно увидеть в
n
выборках разного объема, какова роль малой системной ошибки (в приведенном выше примере 3,5 %) в общей ошибке.
1
Для удобства на графике оставлен термин bias – системная ошибка (Kish [80]).
69
Глава первая. Проблемы при неполном диапазоне данных в эмпирических исследованиях...
Таблица 16
Эффект ошибки в разных объемах выборки
n = 100 n = 1000 n = 10 000
2
Случайная ошибка =
Системная ошибка = 0,32 0,32 0,32 0,32
Общая ошибка =
Относительная доля системной ошибки в общей ошибке (в %)
Необходимый объем выборки для устране-
ния системной ошибки =
5,7
n
2
5,7
(0,32)
n
2
5,7
2
5,7
n
2
0,32
2
5,7
2
0,57 0,18 0,06
0,65 0,37 0,32
49,2 86,5 100,0
76 240 308
В небольших выборках (n < 100) системная ошибка почти вы­равнивается со случайной. По мере увеличения объема выборки она становится полностью доминирующей, несмотря на ее не­большие абсолютные размеры. Это связано с тем, что большой объем выборки является важным фактором снижения случайной ошибки, в то время как системная ошибка практически не зави- сит от объема выборки. Здесь не учитывается тот факт, что для больших выборок требуется привлечение значительного числа анкетеров (интервьюеров), а это само по себе может стать допол­нительным источником системной ошибки.
Влияние системной ошибки можно оценить и с другой точки зрения. Проведенные расчеты системной ошибки при ее устра­нении показывают для требуемого объема выборки, насколько быстро этот объем уменьшается при одинаковых требованиях к статистической точности (фиксированная Δ), когда прила-
70
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]