Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Проблемы оптимизации выборочных данных с неполнотой в диапазоне. Монография
.pdf
II. Статистические аспекты пробеловв диапазоне данных
новится бессмысленной. Что еще более важно, ошибка, вызванная не ответом респондентов, не будет случайной, и ее нулевое
значение в среднесрочном процессе не ожидается.
3. Механизм выпадающих единиц.
Классификация отсутствующих данных
За последние десятилетия, основываясь на предположении,
что неответившие и ответивщие лица одинаковы как распределение, в специальной литературе (Рубин [115]; Шафер [123]) приводится классификация недостающих данных.
Шафер [123] указывает, что каждый метод решения проблем
с недостающими данными был разработан в соответствии с некоторыми «довольно непроверенными» статистическими предположениями о том, как недостающие данные были потеряны, т. е.
без знания механизмов выпадающих единиц. Некоторые методы
предполагают, что этот механизм преодолим, его воздействие может быть устранено, в смысле, определяемом Рубином [115].
Другим подходом, в основном близким к идее Рубина, является принятие предположения о случайном характере механизма
недостающих данных диапазона (или потерянных1 (отсутствующих) случайным образом) (Missing at Random – MAR) [115; 116].
Эта гипотеза формулируется следующим образом: элементы, единицы (данные) не отсутствуют случайным образом, а вероятность
того, что значения отсутствует, зависит от значений переменных,
которые фактически измеряются. Другими словами, отсутствие
одной переменной или значения переменной представляет собой
данные, потерянные случайным образом (MAR), когда, задавая
им значения других, доступных переменных, респонденты полу-
1
Мы должны указать, что термины «недостающие» и «потерянные» данные
принимаем за синонимы, поскольку указанные гипотезы о механизме потери
данных не учитывают способов и методов их обработки (и возможной потери), а только характеристики распределения «ответили» и «не ответили».
61

Глава первая. Проблемы при неполном диапазоне данных в эмпирических исследованиях...
чают недостающие значения, которые случайным образом отличаются от других респондентов. Является ли единица (оценка) наблюдаемой или нет, не зависит от другой единицы (оценки), если
последняя отсутствует, но она может зависеть от последней при
наблюдении за ней (о ней была получена информация).
Несмотря на свое название, термин «случайно потерянные
данные» (МАR) не означает, что недостающие значения должны
быть поняты как случайная подвыборка всего массива.
Второе предположение, известное как «данные, полностью
отсутствующие случайным образом» или «missing completely at
random (MCAR)», является гораздо более ограничительным и часто нереалистичным. Единицы отсутствуют по причинам, не связанным с какой-либо характеристикой или ответом респондента,
включая недостающее значение и отсутствие единицы (Keppel [77]).
Другими словами, гипотеза о «полностью потерянных случайным образом данных» означает, что вероятность отсутствия
(потеря информации) может зависеть от значений наблюдаемых
единиц, но не от тех, которые не наблюдались, а от тех, для которых отсутствуют данные.
Чтобы проиллюстрировать смысл предположения о случайно
потерянных данных, мы рассмотрим двухмерное распределение
определенного количества единиц. В нем по переменной Х каждая
единица имеет свое значение, т. е. данные о единицах признака. По
второй переменной Y отсутствуют значения для некоторых единиц. Согласно предположению, вероятность того, что Y будет отсутствовать для единиц выборки, может быть связана с получением (от единиц) значения для X, но никогда со значением Y.
Таким образом, мы определяем показатель ответов R с дихо-
томическими значениями: он равен единице, если Y наблюдается
(есть данные), и нулю, если они отсутствуют.
Предположение о потерянных случайным образом данных
заключается в том, что Y и R могут иметь связь друг с другом, но
62

II. Статистические аспекты пробеловв диапазоне данных
только косвенно, через их взаимосвязь с X. Согласно предполо-
жению о случайно потерянных данных, значения Y для неответивших лиц могут быть систематически выше или ниже, чем для
ответивших. Но гипотеза о случайных причинах потери данных
MAR допускает, что статистическая связь (в смысле регрессия)
между Y и X в среднем не отличается для обеих групп. Если условие MAR было выполнено, то мы могли бы оценить регрессионную связь между Y и X для ответивших. А использовать полученную таким образом оценку могли, чтобы найти неотклоненные,
не обремененные системной ошибкой оценки для Y, т. е. для не-
ответивших лиц.
Дополнение этого простого примера более сложными ситуациями – скажем, когда отсутствуют значения и для Х, и для
Y – для нас менее интуитивны и сложнее в описании. Однако
приведенный здесь принцип прогнозирования применим и для
них. Этот механизм закреплен в некоторых методах получения
косвенным путем недостающих (потерянных) данных в эмпирическом исследовании. «Данные, отсутствующие случайным образом» является официальным, формальным предположением,
которое позволяет измерять связи между переменными из располагаемых данных, а затем, используя оценки этих связей между
наблюдаемыми единицами, получить неотклоненные оценки для
отсутствующих значений.
В предположении о случайно потерянных данных заслуживают внимания некоторые дополнительные условия.
Первое определяется в связи с переменными, представленными в информационном массиве. Если потеря информации по переменной X связана с отсутствием значений для других переменных
или с полной потерей ряда переменных, а переменная X удалена из
массива, то условие для случайно потерянных данных больше не
будет актуальным. По этой причине одной из практик в процедурах оптимизации является включение переменных, отсутствие (по-
63

Глава первая. Проблемы при неполном диапазоне данных в эмпирических исследованиях...
терю) которых можно предсказать. Потому что тогда MAR-гипотеза может быть более правдоподобной и более приемлемой.
Второе: предположения о случайной потере данных не могут
быть проверены непосредственно по имеющимся данным. Чтобы
сделать это, необходимо знание о недостающих значениях само
по себе, которое «замыкает круг», что сделало бы эту задачу нерешаемой.
Третье: данные, отсутствие которых запланировано из-за
модели исследования (при исследовании с запланированным неполным диапазоном данных), считаются случайно потерянными
в целом.
Когда информация отсутствует по причинам, зависящим от
контроля исследователей, никогда нельзя быть уверенным, что
предположение о случайно потерянных данных вступило в силу.
На самом деле зачастую неправильно говорить об отдельном
«механизме потери данных», потому что в большинстве исследований пропущенные значения зависят от множества причин.
Некоторые из этих причин могут быть абсолютно независимыми от данных, о которых идет речь, а вот другие причины могут
быть с ними тесно связаны. Допустим, проблемы с «выходом в
поле» в случае школьного лонгитюдинального (повторяющегося
во времени) исследования употребления наркотиков подростками [123]. После первого этапа исследования некоторые респонденты могут быть потеряны просто потому, что они перешли в
другую школу, другие могут отказаться от проблемного поведения, связанного с употреблением наркотиков, у третьих могут
возникнуть проблемы со здоровьем и т. д. Неконтролируемая
потеря единиц усиливается сочетанием незначительных и важных факторов и источников1.
1
Подробное обсуждение этих проблем с примерами по запланированной и неконтролируемой потере единиц представлено у Graham, Hofer и Piccinin [66].
64

II. Статистические аспекты пробеловв диапазоне данных
К сожалению, невозможно освободиться от гипотезы о случайно потерянных данных осмысленным образом без замены ее
другими, одинаково не проверенными предположениями. Альтернатива состоит в том, чтобы построить и предложить формальную вероятностную модель для ответов, а аналитик будет
работать в соответствии с этой моделью. Обычно это требует значительных усилий и возможности технической экспертизы. Такие
анализы делаются по-разному, но методы имеют слишком большие проблемы и не генерализуются хорошо1.
Помимо двух указанных гипотез о характере потери данных
(а точнее, о характеристиках выделения выпавших единиц), в
литературе приводится третий вид – так называемые «информативно отсутствующие данные» (Informative Missing – IM). Более
вероятно, что единицы будут отсутствовать, если их фактические
значения для интересующих нас переменных ситуационно выше
или ниже. Например, респондент с более низким экономическим
статусом может с меньшей вероятностью дать информацию о
своем личном доходе при собеседовании.
Наше рассмотрение вопроса показало, что информативно
недостающие данные можно встретить в литературе под формулировкой «непренебрегаемое (которым мы не можем пренебречь)
отсутствие ответа» – «Nonignorable Nonresponse». Этот тип потери данных является самым сложным для контроля, обработки
и поиска оптимальных решений. Во многих случаях проблема
информативных недостатков не может быть преодолена, несмотря на возможность использования данных для проверки и подтверждения ее наличия.
1
Большинство современных методов, работающих с проблемой «недостающих данных», предполагают, что данные были потеряны случайным образом
(MAR).
65

Глава первая. Проблемы при неполном диапазоне данных в эмпирических исследованиях...
III. Влияние неполного диапазона данных
на достоверность и точность оценок
1. Влияние на достоверность информация по совокупности
Допущение ошибок в ответах опрошенных респондентов при
сборе индивидуальной информации в полевых исследованиях неизбежно отражается на достоверности информации по совокупности. Оно выражается в искажении распределения исследуемых
единиц по значениям интересующего нас признака (признаков).
В результате вычисляются обобщающие статистические показатели, такие как относительные величины, средние величины, показатели рассеивания, корреляционные коэффициенты и др., которые отличаются в той или иной степени от своих достоверных
значений. Только в очень редких случаях, при полной компенсации ошибок в ответах респондентов по количеству и величине
значения, они могут и не отражаться на части статистических показателей (например, на среднем арифметическом). В остальных
случаях, даже после такой компенсации, неизбежно происходит
смещение в оценках исследуемой совокупности, т. е. существует
системная ошибка.
В литературе (Кокрен [13]) была предпринята попытка построить общую математическую модель ошибок, допущенных в
ответах респондентов при сборе индивидуальной информации
в поле. Модель предполагает, что при проведении эмпирических
исследований (опросов) присутствуют два вида информации: об
истинном значении признака (достоверный ответ испытуемого) и
допущенная ошибка по отношению к тому же значению признака
(ошибка ответа). Тогда мысленно можно представить, что можно
сделать большое количество независимых опросов с одной единицей совокупности (или, другими словами, гипотетически мы
задаем одному человеку много раз один и тот же вопрос и полу-
66

III. Влияние неполного диапазона данных на достоверность и точность оценок
чаем столько раз ответ на один и тот же вопрос). Мы будем использовать следующие обозначения:
Yik – ответ i-го исследуемого лица в ходе опроса;
μi – достоверный ответ на заданный вопрос;
lik – ошибка, допущенная в ответе i-го исследуемого лица в
k-м вопросе.
Тогда ответ i-го исследуемого лица, которому мы задали
большое количество вопросов, при k-м вопросе можно предста-
вить так:
Y
= μi + l
ik
. (13)
ik
Когда мы рассматриваем все, а не только один k-й вопрос,
ошибка l
, допущенная в ответе, будет иметь какое-то частотное
i
распределение. Для последнего можно рассчитать две основные
характеристики – среднее и дисперсию, которые относятся к i-му
2
исследуемому лицу. Назовем их βi и
S
. Здесь βi представляет со-
i
бой смещение в ответе i-го исследуемого лица при задании соответствующего вопроса из вопросника.
Далее возникает вопрос: как изменяется ошибка, допущенная
в ответе на соответствующий вопрос, при переходе от одного исследуемого лица к другому, т. е. что происходит с βi в исследуемой
совокупности лиц, потому что в эмпирических исследованиях
исследователь, как правило, изучает не одно лицо, а целые совокупности? Здесь у нас будет столько же βi, сколько лиц в совокупности. Затем мы можем вычислить общее среднее значение для βi,
которое будет представлять собой среднее (одно и то же) смещение β, относящееся ко всем лицам в исследуемой совокупности.
Это средняя ошибка, допущенная в ответах всех опрошенных.
Отклонение (βi – β) будет удельным средним смещением в совокупности при (βi – β) > 0, или будет меньше, когда (βi – β) < 0,
или совпадает с ним при (βi – β) = 0. Кроме этого, здесь есть еще
одна составляющая ошибки, которая представлена как
67

Глава первая. Проблемы при неполном диапазоне данных в эмпирических исследованиях...
dik = lik – βi. (14)
Это происходит при переходе от одного вопроса к другому
для одного и того же испытуемого i. Этот компонент называется
флуктуирующей (колеблющейся, непостоянной) ошибкой. Он не
появляется систематически, как β
.
i
Ошибки lik в исследуемой совокупности могут коррелировать
друг с другом – например, в групповом анонимном опросе, когда
испытуемые не могут разговаривать друг с другом, а при исследовании неодушевленных предметов, данные о которых получаются с помощью натуральных переборов (измерений), ошибки не
коррелируют. Однако в большинстве случаев между ошибками
существуют корреляции. Это может быть связано как с используемыми инструментами (например, систематическое занижение больших значений и завышение малых значений μi), так и
с участием людей в опросе (например, влияние интервьюеров)
или с другими побочными условиями (наличие третьих лиц при
опросе). Наличие корреляций между ошибками требует удвоения усилий исследователя по созданию полноценных условий для
получения достоверной индивидуальной информации в поле. Необходимость таких усилий может быть проиллюстрирована примером.
Лесли Киш провел исследование выборки владельцев домов
с целью получения от них оценки своих домовладений по стоимости (рыночной цене). При опросе была получена средняя стоимость одного дома 9200 долларов. Позже на той же выборке
была проведена повторная оценка профессиональными оценщиками, оценки которых были признаны достоверными. Средняя
стоимость одного дома, по данным профессиональных оценщиков, составила 8880 долларов, т. е. существует отклонение между
установленной средней опроса и достоверной средней в размере
320долларов. Это, по сути, систематическая ошибка, допущенная
в индивидуальной информации. Относительная доля ошибки в
68

III. Влияние неполного диапазона данных на достоверность и точность оценок
заданной средней при опросе составляет 3,5 %. Возникает вопрос:
эта ошибка маленькая или большая?
Чтобы оценить влияние указанной системной ошибки, необходимо рассмотреть ее одновременно с выборочной (случайной)
ошибкой при различных (вариативных) объемах выборки (рис. 4,
табл. 16).
Bias=0,32
5,7/
я
10000
ˁ
Рис. 4. Иллюстрация эффекта ошибки в разных объемах выборки
Только случайная часть общей ошибки составляет
5,7/я1000
5,7/я100
5, 7
1
2
,n при
добавлении системной ошибки общая ошибка принимает значение
2
5, 7
(0,32).
2
Из приведенного соотношения можно увидеть в
n
выборках разного объема, какова роль малой системной ошибки (в
приведенном выше примере 3,5 %) в общей ошибке.
1
Для удобства на графике оставлен термин bias – системная ошибка (Kish [80]).
69

Глава первая. Проблемы при неполном диапазоне данных в эмпирических исследованиях...
Таблица 16
Эффект ошибки в разных объемах выборки
n = 100 n = 1000 n = 10 000
2
Случайная ошибка =
Системная ошибка = 0,32 0,32 0,32 0,32
Общая ошибка =
Относительная доля системной ошибки в
общей ошибке (в %)
Необходимый объем выборки для устране-
ния системной ошибки =
5,7
n
2
5,7
(0,32)
n
2
5,7
2
5,7
n
2
0,32
2
5,7
2
0,57 0,18 0,06
0,65 0,37 0,32
49,2 86,5 100,0
76 240 308
В небольших выборках (n < 100) системная ошибка почти выравнивается со случайной. По мере увеличения объема выборки
она становится полностью доминирующей, несмотря на ее небольшие абсолютные размеры. Это связано с тем, что большой
объем выборки является важным фактором снижения случайной
ошибки, в то время как системная ошибка практически не зави-
сит от объема выборки. Здесь не учитывается тот факт, что для
больших выборок требуется привлечение значительного числа
анкетеров (интервьюеров), а это само по себе может стать дополнительным источником системной ошибки.
Влияние системной ошибки можно оценить и с другой точки
зрения. Проведенные расчеты системной ошибки при ее устранении показывают для требуемого объема выборки, насколько
быстро этот объем уменьшается при одинаковых требованиях
к статистической точности (фиксированная Δ), когда прила-
70
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
