Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Проблемы оптимизации выборочных данных с неполнотой в диапазоне. Монография
.pdf
VI. Многомерная атрибуция значений
Чтобы понять допущения для MAR, мы рассмотрим двумерный массив с одной переменной (X), при этом всегда наблюдается
вторая переменная (Y), для которой в отдельных случаях данные
отсутствуют. Согласно предположению о потере данных случайным образом, вероятность того, что значение Y будет отсутствовать для единицы выборки, может быть связана со значением X,
но никогда с собственным значением Y. Иначе говоря, потеря
значения переменной (Y) зависит исключительно и только от зна-
чений другой переменной (X).
Если определить индикатор ответов R, который равен единице, когда наблюдается Y, и равен нулю, если Y отсутствует, и предположить, что Y и R связаны, то их взаимосвязь существует толь-
ко косвенно, через их связь с X. Согласно МAR, значения Y для
неответивших лиц могут быть систематически выше или ниже,
чем у ответивших. Если условие потери данных случайным образом выполнено, то может быть зависимость Y от X для ответивших. В таком случае оценочная связь может быть использована
для получения неотклоненных значений Y для неответивших лиц.
Вообще, при этой основной для многомерного приписывания
гипотезе информация о недостающих значениях создается кос-
венным путем через связь между переменными.
Рассматриваемая гипотеза является официальной, формальной основой, позволяющей измерить связи между переменными
от полученных данных. На такой базе получаются несмещенные
оценки для недостающих значений.
К сожалению, предположение о данных, потерянных случайным образом (MAR), не принимается единогласно и на самом
деле довольно часто оспаривается в литературе. Соображения
при этом выдвигаются следующие.
Во-первых, гипотеза определяется только по отношению к
переменным, представленным в информационном массиве. Если
переменная X связана с отсутствующими значениями для других
161

Глава вторая. Методы поиска решений при неполном диапазоне данных выборки
переменных и X отсутствует в массиве, то предположение «потеряно случайным образом» не будет удовлетворено.
Во-вторых, гипотеза для данных, потерянных случайным образом (MAR), не может быть проверена доступными данными.
Это может быть сделано только на данных о недостающих значениях самих по себе, но из других (не из массива) источников.
В-третьих, данные, которые отсутствуют из-за модели исследования (например, при запланированном неполном наборе
данных всего диапазона), определенно теряются случайным об-
разом, в целом, согласно законам теории выборки.
Если данные отсутствуют по причинам, зависящим от контроля исследователей, невозможно быть уверенным, когда предположение о случайной потере вступит в силу. На самом деле это
будет вводить в заблуждение, если говорить об отдельном «механизме потери данных». Потому что в большинстве исследований недостающие значения зависят не от одной-единственной, а
от множества разнонаправленных по характеру причин. Шафер
поддерживает свой тезис примером из лонгитюдинального исследования об уровне употребления наркотиков среди подростков
[120]; неконтролируемая потеря единиц была увеличена комбинацией между причинами, которыми исследователи как пренебрегли, так и не пренебрегли1.
По мнению того же автора [120], невозможно избавиться
от предположения о случайном характере потери информации
значимым образом, не заменив его другими, одинаково дискуссионными гипотезами. Альтернативой является работа с вероятностной моделью. Такой анализ проводится по-разному, но
применение методов связано с большими проблемами: полученные выводы и заключения не могут быть обобщены.
1
Детальное обсуждение этих проблем с примерами запланированных и неконтролируемых потерь единиц см. у Graham, Hofer и Piccini [66].
162

VI. Многомерная атрибуция значений
В настоящее время нет принципиальных, категорических доказательств, лежащих в основе методов атрибуции значений недостающих данных и позволяющих применять их в любых ситуациях, т. е. они не являются и не могут быть универсальными. До
тех пор пока такие методы не станут доступными, Шафер [121]
рекомендует осторожно использовать игнорирующие (ignorable)1
процедуры с четким учетом их ограничений. В большинстве исследований принципиальные методы, которые предполагают потерю случайным образом, были бы лучше, чем процедуры ad hoc
(например, удаление случаев или просто атрибуция средних, которые мы представили ранее). Даже когда предположение о МAR
кажется нереалистичным, игнорирующие процедуры, которые
работают с ковариациями, могут производить меньшую или никакую системную ошибку по сравнению со сложными неигнорирующими процедурами2.
4. Правила обобщения при многомерной атрибуции
Когда создаются многомерные атрибутивы, база данных может быть проанализирована практически всеми методами, как
только данные заполнены3. Например, можно работать с линейной или логистической регрессией, а также использовать все доступные стандартные программные продукты. При этом каждая
модель может быть применена и оценена m раз – всегда для каж-
дого обработанного (путем атрибуции) массива данных. Конечно,
результаты всех массивов будут варьироваться как эффект нео-
1
Под ignorable методами Шафер имеет в виду те, которые игнорируют причины
потери данных.
2
Более подробная информация о неигнорирующих альтернативах была представлена Шафером [120].
3
Далее в тексте методы анализа, использующие неоптимизированный массив
данных – с исключенными отсутствующими значениями (без лечения), будут
называться «консервативный подход».
163

Глава вторая. Методы поиска решений при неполном диапазоне данных выборки
пределенности отсутствующих данных. Чтобы получить общий
набор оценочных коэффициентов и стандартных ошибок, можно
было бы выбрать и объединить оценки и стандартные ошибки из
каждого атрибутированного массива данных m в соответствии с
правилами, указанными Рубином [115]. Через объединение многомерной атрибуции заявляется, возможно, слишком амбициозное преимущество для преодоления проблем неадекватности
приписываемых значений по сравнению с другими одномерными
модификациями, рассмотренными выше.
Правила Рубина [115] действуют следующим образом. Давайте
через Q1 обозначим параметр интересующей нас генеральной совокупности и через U – оцененную дисперсию. Например, Q может
быть оцененным коэффициентом регрессии, а U – квадратичной
ошибкой. После проведения анализа каждого приписываемого массива данных получаем m равно приемлемых оценок
, , ...,
QQ Q
12
m
с соответствующими дисперсиями U1, U2, ..., Um. Тогда общая оценка многомерной атрибуции (комбинации всех m раз обработанных
массивов данных), или общая оценка, представляется по формуле
1
m
QQ
m
.
(52)
i
1
i
Общая дисперсия оценки имеет два компонента, которые
учитывают рассеяние внутри каждого массива данных и между
массивами. Средняя «внутриимпутационная» дисперсия будет
вычисляться по формуле
1
m
UU
m
(53)
,
i
1
i
т. е. средняя из оценок дисперсий всех m раз приписываемых массивов с данными.
1
Мы сохраняем оригинальные обозначения, данные Рубином в [115].
164

VI. Многомерная атрибуция значений
«Межимпутационная» дисперсия (дисперсия между оценками) вычисляется по формуле
1
m
BQQ
m
().
1
i
2
i
(54)
Общая дисперсия T – это сумма двух компонентов с дополнительным корректирующим фактором для расчета симуляционной ошибки
.
Q
1
(1 ) .TU B
(55)
m
Квадратный корень из T – это общая стандартная ошибка,
связанная с
, , ...,
QQ Q были бы идентичны и B было бы равно 0, а общая
12
. Конечно, если бы данные не отсутствовали, то
Q
m
дисперсия T была бы равна U.
Доверительный интервал при гарантийной вероятности 95
% может быть получен как
. Тем не менее в целом лучше
2QT
рассчитать интервалы, используя приближение
,
Qt T (56)
df
где tdf – квантиль от t-распределения Стьюдента со степенями
свободы
df m
(1)(1 ).
mU
mB
(1)
2
(57)
Проверка гипотезы о том, что Q = 1 является статистически
значимым, может быть выполнена путем сравнения отношения
/QT
с t-распределением.
При бесконечном числе атрибуций (m = ∞) общая диспер-
сия сводится к первому компоненту (U ), а доверительный интервал строится при предположении о нормальном распределении (df= ∞). В общем случае степени свободы зависят от числа
атрибутивов и относительных размеров B и U . Когда B больше
165

Глава вторая. Методы поиска решений при неполном диапазоне данных выборки
(доминирует над) U , степени свободы близки к минимальному
значению m – 1, но когда U больше, чем B, степени свободы скло-
няются к бесконечности.
Если вычисленное значение df очень мало – скажем, меньше
10, – то предполагается, что бόльшая эффективность (т. е. более
точные оценки и более узкие интервалы) может быть получена за
счет увеличения числа атрибутивов m. Однако если значение df
большое, предполагается, что оно получит немного больше m.
Рубин [115] также показывает, что отношение между недостающей информацией и объемом генеральной совокупности Q равно
2/( 3)
rdf
r
,
1
(58)
где
1
(1 )
mB
r
(59)
,
U
и увеличивается в зависимости от дисперсии у неответивших.
Оба квантиля являются полезными статистическими индикаторами, показывающими, насколько сильно выборочная оценка
интересующего нас параметра генеральной совокупности может
зависеть от недостающих данных.
Добавим, что важные статистические вопросы не могут найти ответа с помощью доверительных интервалов или проверки
гипотез обособленного параметра Q. Некоторые авторы [122]
часто занимаются определением размера общей статистической
значимости группы коэффициентов в одной модели или проверкой мощности критерия модели отбора. Основные правила для
многомерных параметрических выводов и заключений по данным, которые были обработаны с помощью многомерной (множественной) атрибуции, можно увидеть в работе Шаферa [120].
К сожалению, применение этих правил с использованием
доступных статистических программ не всегда понятно и легко.
166

VI. Многомерная атрибуция значений
Вспециальной литературе говорится, что проводятся исследования по разработке методов проверки эффективности при выборе
значений (goodness-to- t) и моделей для структурных равенств.
При анализе массивов данных, обремененных отсутствующими значениями, в последние годы появились реальные достижения.
Современные методы недостающих данных, которые значительно
конкурируют со старыми ad hoc процедурами, теперь полностью
доступны аналитикам. По мнению Шафера [120], среди этих новых
методов многомерная атрибуция является особенно мощным инструментом из-за ее общепринятой применимости. Он утверждает,
что стандартные программы анализа данных, такие как SAS, SPSS,
LISREL, как правило, были разработаны не для обработки информационных массивов с высоким процентом отсутствующих значений. Вероятно, поэтому при решении проблемы недостающих
данных эти программы не предлагают лучших решений. В этом
смысле многомерное программное обеспечение атрибуции, которое предлагает Шафер, дополняет, но ни в коем случае не вытесняет традиционные статистические программные продукты.
Многомерная атрибуция напоминает старые методы удаления
случаев (case deletion) и аd hoc атрибуции тем, что она обрабатывает недостающие данные в самом начале, еще до анализа. Однако,
в отличие от методов ad hoc, многомерное приписывание решает
проблему неполного диапазона данных статистически защищаемым способом, объединяя неустановленный характер недостающих
данных во всех статистических выводах. Подчеркнем, что многомерная атрибуция не единственный современный метод компенсации
недостающих данных. Некоторые производители статистического
программного обеспечения начали вводить способы обработки неполных данных непосредственно в определенные типы методов моделирования. Эти процедуры близки к многомерной атрибуции тем,
что усредняют предполагаемое распределение недостающих данных.
Разница заключается в том, что усреднение производится с исполь-
167

Глава вторая. Методы поиска решений при неполном диапазоне данных выборки
зованием аналитических или численных методов вместо описанного
моделирования. Программы многомерного регрессионного моделирования, включая HLM [43] и SAS proc MIXED [115], позволяют
использовать случайные, произвольные закономерности отсутствующих значений в результирующей переменной. Две программы
моделирования структурных уравнений, MH [91] и Amos, могут
сделать прямую оценку максимального правдоподобия с использованием обоих типов данных – с полными и неполными случаями.
При уместно больших объемах выборки эти прямые методы оценки максимального правдоподобия приведут к абсолютно тем же результатам, что и многомерное приписывание. Фактически, прямые
методы оценки максимального правдоподобия были бы немного более эффективными по сравнению с многомерной атрибуцией, потому что они не полагались на симуляцию. В той степени, в какой эти
прямые методы доступны, Шафер рекомендует их. Однако во многих типах исследовательских задач все еще используются косвенные
процедуры. Например, не был создан статистический программный
продукт, способный работать с логистической регрессионной моделью с отсутствующими значениями результативных и факторных
переменных. Прямые методы оценки максимального правдоподобия слишком сложны в расчетах и требуют специализированного
применения каждого нового типа модели. С другой стороны, многомерная атрибуция – это техника, которая может быть немедленно
применена к большому количеству проблем в модели.
Важной характеристикой атрибуции является то, что ее основа –
единичный случай, в отличие от взвешивания, которое обрабатывает совокупность единиц. По этой причине метод уделяет пристальное внимание типу распределения (реального или предполагаемого),
а также причинам отсева единиц. Различные рабочие гипотезы метода и его модификации, несмотря на усилия сторонников, пока не
могут освободиться от некоторых весьма серьезных недостатков и
во всех случаях еще долго будут вызывать дискуссию.
168

Глава третья.
СРАВНИТЕЛЬНЫЕ ПРЕИМУЩЕСТВА
И ОГРАНИЧЕНИЯ РАЗЛИЧНЫХ МЕТОДОВ ОПТИМИЗАЦИИ
ВЫБОРОЧНЫХ ДАННЫХ
I. Оптимизация выборки
при неполном диапазоне данных
Для оптимизации выборки при неполном наборе данных
были проанализированы данные реально проведенного выборочного эмпирического социологического исследования. Основные
аргументы в пользу выбора именно этой выборки для анализа заключаются в следующем:
во-первых, возможности, которые она предлагает нам со
строгой руководящей документацией и проведенным методическим исследованием характера и масштаба потерянных данных;
во-вторых, большой и подчеркнуто нетипичный выборочный объем;
в-третьих, выбор был предопределен усилиями исследователей по решению проблемы недостающих данных с помощью дополнительной системной процедуры, а также предоставленной
нам возможностью использовать эти результаты.
Отличительным в данном случае является то, что исследуемая совокупность неоднородна по характеру. Помимо основной,
случайной выборки и планового расширения, была предпринята
попытка компенсировать потерянную в полевых исследованиях
информацию путем замены квоты. Заранее с сожалением отме-
169

Глава третья. Сравнительные преимущества и ограничения различных методов оптимизации...
тим, что добавление единиц с помощью нестохастических процедур в случайной выборке – это обычное явление, не решающее
проблемы в социологической практике.
1. Характеристика выборки
Основная планируемая выборка состоит из 348 гнезд, с
n =3132 лица и планируемыми запасами 1044 человека (по три
резерва для гнезда).
В поле было реализовано 341 гнездо1 n = 3069 человек и запланированное дополнение из 123 человек, в том числе:
Планируемые лица в целом: 3069 человек
Планируемые гнезда: 341 гнездо
Планируемые лица в одном гнезде: 9 лиц
Фактически опрошенные лица: 2963 лица
Из них 28,5 % заменены по квоте: 844 лица
Доверительный интервал в 95 % гарантийной вероятности
соответственно для относительных долей:
10 % = ±1 %; 20 % = ± 2 %; 30 % = ± 2,5 %.
Отбор единиц производился на основе избирательных списков и осуществлялся ВЦИОМом.
Выборка двухступенчатая гнездовая.
На первой ступени путем случайного отбора извлекаются
гнезда – избирательные участки по всей территории страны.
На второй ступени из списка выбранных простым случайным отбором разделов выбираются случайным образом по 12 человек – 9 основных и 3 резерва. Интервьюер работает по порядку с предоставленным ему списком. Исключаются лица, которые
больше не живут по указанному адресу или которые отказываются участвовать в исследовании.
1
Было выбрано семь гнезд небольших населенных пунктов вокруг столицы.
170
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
