Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Проблемы оптимизации выборочных данных с неполнотой в диапазоне. Монография

.pdf
Скачиваний:
0
Добавлен:
07.09.2026
Размер:
1 Мб
Скачать
VI. Многомерная атрибуция значений
Чтобы понять допущения для MAR, мы рассмотрим двумер­ный массив с одной переменной (X), при этом всегда наблюдается вторая переменная (Y), для которой в отдельных случаях данные отсутствуют. Согласно предположению о потере данных случай­ным образом, вероятность того, что значение Y будет отсутство­вать для единицы выборки, может быть связана со значением X, но никогда с собственным значением Y. Иначе говоря, потеря значения переменной (Y) зависит исключительно и только от зна- чений другой переменной (X).
Если определить индикатор ответов R, который равен едини­це, когда наблюдается Y, и равен нулю, если Y отсутствует, и пред­положить, что Y и R связаны, то их взаимосвязь существует толь- ко косвенно, через их связь с X. Согласно МAR, значения Y для неответивших лиц могут быть систематически выше или ниже, чем у ответивших. Если условие потери данных случайным обра­зом выполнено, то может быть зависимость Y от X для ответив­ших. В таком случае оценочная связь может быть использована для получения неотклоненных значений Y для неответивших лиц.
Вообще, при этой основной для многомерного приписывания гипотезе информация о недостающих значениях создается кос- венным путем через связь между переменными.
Рассматриваемая гипотеза является официальной, формаль­ной основой, позволяющей измерить связи между переменными от полученных данных. На такой базе получаются несмещенные оценки для недостающих значений.
К сожалению, предположение о данных, потерянных случай­ным образом (MAR), не принимается единогласно и на самом деле довольно часто оспаривается в литературе. Соображения при этом выдвигаются следующие.
Во-первых, гипотеза определяется только по отношению к переменным, представленным в информационном массиве. Если переменная X связана с отсутствующими значениями для других
161
Глава вторая. Методы поиска решений при неполном диапазоне данных выборки
переменных и X отсутствует в массиве, то предположение «поте­ряно случайным образом» не будет удовлетворено.
Во-вторых, гипотеза для данных, потерянных случайным об­разом (MAR), не может быть проверена доступными данными. Это может быть сделано только на данных о недостающих значе­ниях самих по себе, но из других (не из массива) источников.
В-третьих, данные, которые отсутствуют из-за модели ис­следования (например, при запланированном неполном наборе данных всего диапазона), определенно теряются случайным об- разом, в целом, согласно законам теории выборки.
Если данные отсутствуют по причинам, зависящим от кон­троля исследователей, невозможно быть уверенным, когда пред­положение о случайной потере вступит в силу. На самом деле это будет вводить в заблуждение, если говорить об отдельном «ме­ханизме потери данных». Потому что в большинстве исследова­ний недостающие значения зависят не от одной-единственной, а от множества разнонаправленных по характеру причин. Шафер поддерживает свой тезис примером из лонгитюдинального иссле­дования об уровне употребления наркотиков среди подростков [120]; неконтролируемая потеря единиц была увеличена комбина­цией между причинами, которыми исследователи как пренебрег­ли, так и не пренебрегли1.
По мнению того же автора [120], невозможно избавиться от предположения о случайном характере потери информации значимым образом, не заменив его другими, одинаково дискус­сионными гипотезами. Альтернативой является работа с веро­ятностной моделью. Такой анализ проводится по-разному, но применение методов связано с большими проблемами: получен­ные выводы и заключения не могут быть обобщены.
1
Детальное обсуждение этих проблем с примерами запланированных и некон­тролируемых потерь единиц см. у Graham, Hofer и Piccini [66].
162
VI. Многомерная атрибуция значений
В настоящее время нет принципиальных, категорических до­казательств, лежащих в основе методов атрибуции значений не­достающих данных и позволяющих применять их в любых ситу­ациях, т. е. они не являются и не могут быть универсальными. До тех пор пока такие методы не станут доступными, Шафер [121] рекомендует осторожно использовать игнорирующие (ignorable)1 процедуры с четким учетом их ограничений. В большинстве ис­следований принципиальные методы, которые предполагают по­терю случайным образом, были бы лучше, чем процедуры ad hoc (например, удаление случаев или просто атрибуция средних, ко­торые мы представили ранее). Даже когда предположение о МAR кажется нереалистичным, игнорирующие процедуры, которые работают с ковариациями, могут производить меньшую или ни­какую системную ошибку по сравнению со сложными неигнори­рующими процедурами2.
4. Правила обобщения при многомерной атрибуции
Когда создаются многомерные атрибутивы, база данных мо­жет быть проанализирована практически всеми методами, как только данные заполнены3. Например, можно работать с линей­ной или логистической регрессией, а также использовать все до­ступные стандартные программные продукты. При этом каждая модель может быть применена и оценена m раз – всегда для каж- дого обработанного (путем атрибуции) массива данных. Конечно, результаты всех массивов будут варьироваться как эффект нео-
1
Под ignorable методами Шафер имеет в виду те, которые игнорируют причины потери данных.
2
Более подробная информация о неигнорирующих альтернативах была пред­ставлена Шафером [120].
3
Далее в тексте методы анализа, использующие неоптимизированный массив данных – с исключенными отсутствующими значениями (без лечения), будут называться «консервативный подход».
163
Глава вторая. Методы поиска решений при неполном диапазоне данных выборки
пределенности отсутствующих данных. Чтобы получить общий набор оценочных коэффициентов и стандартных ошибок, можно было бы выбрать и объединить оценки и стандартные ошибки из каждого атрибутированного массива данных m в соответствии с правилами, указанными Рубином [115]. Через объединение мно­гомерной атрибуции заявляется, возможно, слишком амбици­озное преимущество для преодоления проблем неадекватности приписываемых значений по сравнению с другими одномерными модификациями, рассмотренными выше.
Правила Рубина [115] действуют следующим образом. Давайте через Q1 обозначим параметр интересующей нас генеральной сово­купности и через U – оцененную дисперсию. Например, Q может быть оцененным коэффициентом регрессии, а U – квадратичной ошибкой. После проведения анализа каждого приписываемого мас­сива данных получаем m равно приемлемых оценок

, , ...,
QQ Q
12
m
с соответствующими дисперсиями U1, U2, ..., Um. Тогда общая оцен­ка многомерной атрибуции (комбинации всех m раз обработанных массивов данных), или общая оценка, представляется по формуле
1
m
QQ
m
.
(52)
i
1
i
Общая дисперсия оценки имеет два компонента, которые учитывают рассеяние внутри каждого массива данных и между массивами. Средняя «внутриимпутационная» дисперсия будет вычисляться по формуле
1
m
UU
m
(53)
,
i
1
i
т. е. средняя из оценок дисперсий всех m раз приписываемых мас­сивов с данными.
1
Мы сохраняем оригинальные обозначения, данные Рубином в [115].
164
VI. Многомерная атрибуция значений
«Межимпутационная» дисперсия (дисперсия между оценка­ми) вычисляется по формуле
1
m
BQQ

m
().
1
i
2
i
(54)
Общая дисперсия T – это сумма двух компонентов с допол­нительным корректирующим фактором для расчета симуляцион­ной ошибки
.
Q
1
(1 ) .TU B

(55)
m
Квадратный корень из T – это общая стандартная ошибка, связанная с

, , ...,
QQ Q были бы идентичны и B было бы равно 0, а общая
12
. Конечно, если бы данные не отсутствовали, то
Q
m
дисперсия T была бы равна U.
Доверительный интервал при гарантийной вероятности 95 % может быть получен как
. Тем не менее в целом лучше
2QT
рассчитать интервалы, используя приближение
,
Qt T (56)
df
где tdf – квантиль от t-распределения Стьюдента со степенями свободы
df m
 
(1)(1 ).
mU
mB
(1)
2
(57)
Проверка гипотезы о том, что Q = 1 является статистически значимым, может быть выполнена путем сравнения отношения
/QT
с t-распределением.
При бесконечном числе атрибуций (m = ∞) общая диспер- сия сводится к первому компоненту (U ), а доверительный ин­тервал строится при предположении о нормальном распределе­нии (df= ∞). В общем случае степени свободы зависят от числа атрибутивов и относительных размеров B и U . Когда B больше
165
Глава вторая. Методы поиска решений при неполном диапазоне данных выборки
(доминирует над) U , степени свободы близки к минимальному значению m – 1, но когда U больше, чем B, степени свободы скло- няются к бесконечности.
Если вычисленное значение df очень мало – скажем, меньше 10, – то предполагается, что бόльшая эффективность (т. е. более точные оценки и более узкие интервалы) может быть получена за счет увеличения числа атрибутивов m. Однако если значение df большое, предполагается, что оно получит немного больше m.
Рубин [115] также показывает, что отношение между недоста­ющей информацией и объемом генеральной совокупности Q равно
2/( 3)
rdf


r
,
1
(58)
где
1
(1 )
mB
r
(59)
,
U
и увеличивается в зависимости от дисперсии у неответивших. Оба квантиля являются полезными статистическими индикато­рами, показывающими, насколько сильно выборочная оценка интересующего нас параметра генеральной совокупности может зависеть от недостающих данных.
Добавим, что важные статистические вопросы не могут най­ти ответа с помощью доверительных интервалов или проверки гипотез обособленного параметра Q. Некоторые авторы [122] часто занимаются определением размера общей статистической значимости группы коэффициентов в одной модели или провер­кой мощности критерия модели отбора. Основные правила для многомерных параметрических выводов и заключений по дан­ным, которые были обработаны с помощью многомерной (мно­жественной) атрибуции, можно увидеть в работе Шаферa [120].
К сожалению, применение этих правил с использованием доступных статистических программ не всегда понятно и легко.
166
VI. Многомерная атрибуция значений
Вспециальной литературе говорится, что проводятся исследова­ния по разработке методов проверки эффективности при выборе значений (goodness-to- t) и моделей для структурных равенств.
При анализе массивов данных, обремененных отсутствующи­ми значениями, в последние годы появились реальные достижения. Современные методы недостающих данных, которые значительно конкурируют со старыми ad hoc процедурами, теперь полностью доступны аналитикам. По мнению Шафера [120], среди этих новых методов многомерная атрибуция является особенно мощным ин­струментом из-за ее общепринятой применимости. Он утверждает, что стандартные программы анализа данных, такие как SAS, SPSS, LISREL, как правило, были разработаны не для обработки инфор­мационных массивов с высоким процентом отсутствующих зна­чений. Вероятно, поэтому при решении проблемы недостающих данных эти программы не предлагают лучших решений. В этом смысле многомерное программное обеспечение атрибуции, кото­рое предлагает Шафер, дополняет, но ни в коем случае не вытесня­ет традиционные статистические программные продукты.
Многомерная атрибуция напоминает старые методы удаления случаев (case deletion) и аd hoc атрибуции тем, что она обрабаты­вает недостающие данные в самом начале, еще до анализа. Однако, в отличие от методов ad hoc, многомерное приписывание решает проблему неполного диапазона данных статистически защищае­мым способом, объединяя неустановленный характер недостающих данных во всех статистических выводах. Подчеркнем, что многомер­ная атрибуция не единственный современный метод компенсации недостающих данных. Некоторые производители статистического программного обеспечения начали вводить способы обработки не­полных данных непосредственно в определенные типы методов мо­делирования. Эти процедуры близки к многомерной атрибуции тем, что усредняют предполагаемое распределение недостающих данных. Разница заключается в том, что усреднение производится с исполь-
167
Глава вторая. Методы поиска решений при неполном диапазоне данных выборки
зованием аналитических или численных методов вместо описанного моделирования. Программы многомерного регрессионного моде­лирования, включая HLM [43] и SAS proc MIXED [115], позволяют использовать случайные, произвольные закономерности отсутству­ющих значений в результирующей переменной. Две программы моделирования структурных уравнений, MH [91] и Amos, могут сделать прямую оценку максимального правдоподобия с использо­ванием обоих типов данных – с полными и неполными случаями. При уместно больших объемах выборки эти прямые методы оцен­ки максимального правдоподобия приведут к абсолютно тем же ре­зультатам, что и многомерное приписывание. Фактически, прямые методы оценки максимального правдоподобия были бы немного бо­лее эффективными по сравнению с многомерной атрибуцией, пото­му что они не полагались на симуляцию. В той степени, в какой эти прямые методы доступны, Шафер рекомендует их. Однако во мно­гих типах исследовательских задач все еще используются косвенные процедуры. Например, не был создан статистический программный продукт, способный работать с логистической регрессионной моде­лью с отсутствующими значениями результативных и факторных переменных. Прямые методы оценки максимального правдоподо­бия слишком сложны в расчетах и требуют специализированного применения каждого нового типа модели. С другой стороны, мно­гомерная атрибуция – это техника, которая может быть немедленно применена к большому количеству проблем в модели.
Важной характеристикой атрибуции является то, что ее основа – единичный случай, в отличие от взвешивания, которое обрабатыва­ет совокупность единиц. По этой причине метод уделяет присталь­ное внимание типу распределения (реального или предполагаемого), а также причинам отсева единиц. Различные рабочие гипотезы ме­тода и его модификации, несмотря на усилия сторонников, пока не могут освободиться от некоторых весьма серьезных недостатков и во всех случаях еще долго будут вызывать дискуссию.
168
Глава третья.
СРАВНИТЕЛЬНЫЕ ПРЕИМУЩЕСТВА
И ОГРАНИЧЕНИЯ РАЗЛИЧНЫХ МЕТОДОВ ОПТИМИЗАЦИИ
ВЫБОРОЧНЫХ ДАННЫХ
I. Оптимизация выборки
при неполном диапазоне данных
Для оптимизации выборки при неполном наборе данных были проанализированы данные реально проведенного выбороч­ного эмпирического социологического исследования. Основные аргументы в пользу выбора именно этой выборки для анализа за­ключаются в следующем:
во-первых, возможности, которые она предлагает нам со строгой руководящей документацией и проведенным методиче­ским исследованием характера и масштаба потерянных данных;
во-вторых, большой и подчеркнуто нетипичный выбороч­ный объем;
в-третьих, выбор был предопределен усилиями исследовате­лей по решению проблемы недостающих данных с помощью до­полнительной системной процедуры, а также предоставленной нам возможностью использовать эти результаты.
Отличительным в данном случае является то, что исследуе­мая совокупность неоднородна по характеру. Помимо основной, случайной выборки и планового расширения, была предпринята попытка компенсировать потерянную в полевых исследованиях информацию путем замены квоты. Заранее с сожалением отме-
169
Глава третья. Сравнительные преимущества и ограничения различных методов оптимизации...
тим, что добавление единиц с помощью нестохастических проце­дур в случайной выборке – это обычное явление, не решающее проблемы в социологической практике.
1. Характеристика выборки
Основная планируемая выборка состоит из 348 гнезд, с n =3132 лица и планируемыми запасами 1044 человека (по три резерва для гнезда).
В поле было реализовано 341 гнездо1 n = 3069 человек и за­планированное дополнение из 123 человек, в том числе:
Планируемые лица в целом: 3069 человек Планируемые гнезда: 341 гнездо Планируемые лица в одном гнезде: 9 лиц Фактически опрошенные лица: 2963 лица Из них 28,5 % заменены по квоте: 844 лица
Доверительный интервал в 95 % гарантийной вероятности соответственно для относительных долей:
10 % = ±1 %; 20 % = ± 2 %; 30 % = ± 2,5 %.
Отбор единиц производился на основе избирательных спи­сков и осуществлялся ВЦИОМом.
Выборка двухступенчатая гнездовая.
На первой ступени путем случайного отбора извлекаются
гнезда – избирательные участки по всей территории страны.
На второй ступени из списка выбранных простым случай­ным отбором разделов выбираются случайным образом по 12 че­ловек – 9 основных и 3 резерва. Интервьюер работает по поряд­ку с предоставленным ему списком. Исключаются лица, которые больше не живут по указанному адресу или которые отказывают­ся участвовать в исследовании.
1
Было выбрано семь гнезд небольших населенных пунктов вокруг столицы.
170
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]