Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Проблемы оптимизации выборочных данных с неполнотой в диапазоне. Монография

.pdf
Скачиваний:
0
Добавлен:
07.09.2026
Размер:
1 Мб
Скачать
VI. Многомерная атрибуция значений
Рассмотренные методы и процедуры демонстрируют неве­роятное изобилие подходов и модификаций атрибуции значений отсутствующих данных. На наш взгляд, это говорит, с одной сто­роны, о разнонаправленных поисках исследователями оптими­зированных решений, с другой – об использовании различных базовых гипотез и подходов разной доказательной ценности, а с третьей – о том, что универсальных, приоритетных или наиболее эффективных подходов не существует. Об этом свидетельствуют указанные нами недостатки, ограничения и связанные с ними ри­ски появления ошибок. Поэтому поиски в этой области продол­жаются. А многочисленные модификации атрибуции, очевидно, связаны с разнообразным характером эмпирических данных.
VI. Многомерная атрибуция значений
1. Развитие идеи многомерной атрибуции значений
Многомерная атрибуция [115] представляет собой метод си­муляции, с помощью которого каждая недостающая единица за-
меняется серией m > 1 вероятных значений. Версии m полного, завершенного массива данных анализируются стандартными статистическими методами для данных без отсутствующих значе­ний. В отличие от других разновидностей атрибуции, результаты здесь объединяются с использованием простых правил произво­дных оценок, стандартных ошибок и вероятностного отбора, ко-
1
торые «торжественным образом»
объединяют неопределенность
Когда данные собираются путем анкетирования, респонден­ты могут отказаться от участия или не иметь возможности отве­тить на некоторые вопросы, они могут не заполнить отдельные
1
Как эмоционально описывает Дж. Шафер [120].
151
Глава вторая. Методы поиска решений при неполном диапазоне данных выборки
части анкеты из-за нехватки времени или интереса. В лонгитюди­нальных исследованиях часть респондентов может отказаться от участия в выборке до завершения исследования. Эти типы недо­стающих данных тем не менее неизбежны, непреднамеренны и не контролируемы исследователем.
Многие авторы (Рубин [115], Шафер [123], Рао [110] и др.) неоднократно подчеркивали тот факт, что до недавнего времени единственные методы, широко используемые для анализа непол­ных наборов данных, были сосредоточены в основном на удале­нии единиц с отсутствующими данными; игнорировании респон­дентов с неполной информацией или замене их приемлемыми значениями для отсутствующих значений с помощью средних или регрессионных коэффициентов, проверке гипотез и т. д.
Эти методы ad hoc, несомненно, просты в применении, но имеют серьезные недостатки [126]. Для многомерных анализов, включающих большое количество переменных, процедура уда­ления случаев может быть безрезультатной и неэффективной. Часто большая часть единиц в выборке неприемлемо сокращает­ся. Даже если неполнота информации по переменным является низкой, некоторые респонденты могут иметь полные данные для всех переменных. Кроме того, удаление случаев может привести к системному смещению результатов, если единицы, предоставляю­щие полные данные, не соответствуют целому образцу.
Замена отсутствующих значений простым средним арифме­тическим может серьезно исказить связь между переменными, в результате чего корреляции будут искусственно переоценены или занижены. Однако, несмотря на качества метода, приписываемые значения являются лишь оценками неизвестных исследователю действительных значений.
Анализы, которые не учитывают неопределенность и не­стабильность недостающих данных, приведут к ситуации, когда стандартные ошибки слишком малы, вероятность отбора искус-
152
VI. Многомерная атрибуция значений
ственно занижена, а ошибки первого рода выше фиксированных уровней. Соответственно, гарантийная вероятность, используе­мая в интервальных оценках, остается меньше, чем указанная ис­следователем.
В современной специальной литературе отмечается, что за последние два десятилетия был достигнут значительный прогресс в разработке методов компенсации недостающих данных. В ка­честве поворотного пункта выдвигается формализация в конце 1970-х гг. алгоритма достижения максимизации ожиданий, пред­ложенного Демпстером, Лэрдом и Рубином. Идея, лежащая в ос­нове метода, представляет собой фундаментальное изменение в обработке недостающих данных. До этого их воспринимали как неудобство, от которого нужно избавиться в основном двумя способами: устранением случаев и приписыванием. После при­менения алгоритма статистики начинают смотреть на недостаю­щие данные как на источник изменчивости, которая может быть выше средней.
Для массивов с неполными данными наблюдаемые единицы косвенно представляют доказательство вероятного значения не­наблюдаемых единиц.
Современные методы заполнения недостающих данных предлагают это (сверх) усреднение различными способами. Ал­горитмы ЭМ выполняют усреднение детерминированным и не­случайным образом. Рубин разработал парадигму многомерной атрибуции (Multiple Imputation), в основе которой лежит проце­дура «усреднения путем симуляции».
Многомерное приписывание было впервые описано более 30 лет назад [115], но оставалось неизвестным и редко исполь­зовалось. Основной причиной этого «непонимания», по словам Шафера, было отсутствие вычислительных инструментов для создания многомерной атрибуции. В статистической литературе в последнее время появились разнообразные симуляционные ме-
153
Глава вторая. Методы поиска решений при неполном диапазоне данных выборки
тоды и модели, известные под названием «методы Монте-Карло с марковскими цепями (рядами)». Они стали причиной револю­ции в применении параметрического моделирования (Джилкс, Ричардсон, Шпигельхальтер [64]). Шафер [120] адаптировал и применил методы Монте-Карло с марковскими рядами для нужд многомерной атрибуции1. Есть основания полагать, что таким об­разом появляются реальные предпосылки для применения мето­дов и в эмпирических социологических исследованиях.
2. Сущность метода многомерной атрибуции значений
В начале раздела мы отметили, что при многомерной атри­буции любое недостающее значение заменяется набором m > 1 приемлемых значений, взятых (извлеченных) из соответствующе­го гипотетического распределения. На рис. 5 представлен массив данных, обработанный многомерной (множественной) атрибуци­ей. Сущность многомерной модификации метода состоит в ите­рациях нескольких единичных атрибуций значений (например, m раз). Затем их результаты объединяются (и усредняются) для по­лучения общей оценки, которая дает необходимую исследователю информацию. Иными словами, результаты (оценки и стандарт­ные ошибки) этих грязных, обработанных уже приписываемыми массивами, данных объединяются (собираются) с использовани­ем правил Рубина и других авторов для получения общих оценок и стандартных ошибок с воздействием на неустановленность (скрытую картину) отсутствующих данных.
Одним из основных преимуществ многомерной атрибуции по Шаферу является то, что метод может быть эффективен даже при небольших значениях m (небольшое количество повторе-
1
Шафер создал некоторые из основных программных продуктов и приложений для многомерной атрибуции неполных многомерных данных. Некоторые из этих программ работают как автономное приложение под Windows.
154
VI. Многомерная атрибуция значений
ний). Во многих случаях достаточно от 3 до 5 итераций атрибу­ции, которые после обобщения дают хорошие результаты.
ʰ
 ʤ
m
2
1
?
?
?
?
Рис. 5. Матрица данных с отсутству ющими значениями
и многомерная атрибуция
Рубин [115] представляет эффективность оценки, основан­ной на m атрибутивах, приблизительно равной
1
(1 ) ,
(50)
m
где γ – часть недостающей информации. Элемент γ количествен­но выражает, насколько более точной может быть оценка, если отсутствуют недостающие данные; m = количество итераций, с помощью которых редуцирует γ. Теоретически коэффициент (50) может изменяться от 0 (полное отсутствие данных) до 100 % (полная компенсация недостающих данных). Преобразуем фор­мулу (50) так:
155
Глава вторая. Методы поиска решений при неполном диапазоне данных выборки

11


(1 ) 100 ( ) 100
mm
m
или 100.
m
m
(51)
Если γ = 0, эффективность составляет 100 %. Когда γ > 0, эф­фективность, соответственно, снижается. При различном коли­честве итераций полезные эффекты на уровни недостающей ин­формации показаны в табл. 34.
Таблица 34
Процент эффективности (снижение доли недостающих данных)
при различном количестве итераций m и различной доле
недостающих данных γ
γ
m
3 97 91 86 81 77
5 98 94 91 88 85
10 99 95 95 93 92
20 100 98 98 97 96
0.1 0.3 0.5 0.7 0.9
Использованный критерий и данные (см. табл. 34) показыва­ют, что преимущества быстро снижаются после первых несколь­ких итеративных атрибуций. Мы принимаем столбец за 30 % недостающей информации (γ = 0,3), в большинстве случаев как один приемлемый и умеренный уровень (эффективность 91 % достигается на третьей итерации). При m = 5 повторениям атри­буции эффективность достигает 94 %. Увеличивая количество по­вторений до m = 10, мы достигаем 97 % эффективности. Наблю­дается тенденция к незначительному улучшению по сравнению с увеличением вычислительных усилий и затрат. При m=20 итера­циям расходы выросли на 400 %, в то время как снижение недо­стающих данных составляло всего 4 %, т. е. соотношение 100:1! Аналогичными являются изменения производительности в лю­бом другом столбце табл. 34.
156
VI. Многомерная атрибуция значений
3. Основные гипотезы метода многомерной атрибуции значений
Как и любой статистический метод, многомерное приписы­вание базируется на нескольких основных предположениях. Его корректное использование требует обоснования этих предполо­жений и (или) адекватной оценки возможных выводов при по­следующем анализе, если предположения окажутся ложными.
Предположения касаются:
1) распределения генеральной совокупности;
2) распределения параметров модели;
3) причины для категории «неответившие».
3.1. Выбор модели для атрибутирования значений
Для создания атрибутивов для отсутствующих значений не­обходимо построить и использовать вероятностную модель по отношению к общему массиву данных (наблюдаемых и отсутству­ющих значений) и их предполагаемому распределению1.
В большинстве приложений модель, используемая для соз­дания атрибутивов, будет в лучшем случае приблизительно со­ответствовать действительности. По мнению Шафера [120], «...к счастью, неоднократные попытки показали, что результаты и тренды многомерной атрибуции устойчивы к отклонениям в “атрибутивной” модели». Например, при обработке дихотомиче­ских или категориальных переменных часто допустимо приписы­вать в соответствии с предположением о нормальности распреде-
1
Каждый из пакетов программного обеспечения применяет свой класс много­мерных моделей для обработки полных массивов данных. Например, NORM использует многомерное нормальное распределение. CAT основан на логлине­арных моделях, которые традиционно используются общественными науками для описания связей между переменными в комбинированных сгруппирован­ных данных.
157
Глава вторая. Методы поиска решений при неполном диапазоне данных выборки
ления, а затем округлять приписываемые непрерывные значения до ближайшего числа. Переменные, распределения которых силь­но искажены, могут быть преобразованы (с использованием лога­рифмов) до приблизительно нормальных, а затем повторно пре­образованы в их исходные шкалы после атрибуции1.
Несмотря на эти обнадеживающие результаты, было бы наи­вно предполагать, что многомерная атрибуция может осущест­вляться в любых случаях или что выбор модели атрибуции не будет влиять на конечные результаты. Модель должна быть подо­брана так, чтобы она была (по крайней мере приблизительно) со­вместима и соответствовала анализу, который впоследствии будет сделан на оптимизированных (путем атрибуции) наборах данных.
В частности, модель должна быть достаточно содержательной (чтобы дать больше возможностей) для сохранения связей и за­висимостей между переменными, которые будут в центре даль­нейших исследований.
Например, предположим, что переменная Y приписывается с использованием модели нормального распределения, которая включает переменную X1. После процедуры атрибуции исследо­ватель может дополнительно использовать линейную регрессию для прогнозирования характеристик переменной Y по данным переменной X1 и любой другой переменной (X2), которая не была частью модели атрибуции. Рассчитанный коэффициент регрес­сии для X2 должен быть близок к нулю, потому что переменная
Y была приписан без учета ее возможных взаимозависимостей с X2. Поэтому все ссылки, которые могут оказаться важными для
последующего анализа, должны учитываться моделью атрибуции.
Обратное правило может быть неверным. Если Y был про- писан в соответствии с моделью, которая включает X2, то нет не-
1
Имитационные исследования, показывающие силу многомерной атрибуции по отношению к отклонениям в модели, предложены Шафером [120].
158
VI. Многомерная атрибуция значений
обходимости включать X2 в предстоящий анализ, относящийся к Y, если связь между ними не представляет дальнейшего интереса
для исследователя. Результаты, относящиеся к Y, не могут быть искажены из-за включения дополнительных переменных в фазу атрибуции. Поэтому рекомендуется использовать более богатую атрибутивную модель, которая сохранит большое количество взаимосвязей (корреляций).
3.2. Фактическое распределение параметров многомерной атрибуции
Статистическая теория, основа многомерной атрибуции, включает фундаментальный закон вероятности, известный как теорема Байеса (Bayes’  eorem)1.
Байесовский характер многомерной атрибуции требует опре­деления фактического распределения параметров атрибутивной модели. В байесовской парадигме это базовое распределение определяет количественно допущения для параметров модели до того, как мы узнаем данные. Байесовские подходы (методы) ино­гда рассматриваются как субъективные и ненаучные, потому что различные основные распределения могут привести к различным результатам [122]. Однако на практике результаты таких проце­дур кажутся гораздо более чувствительными к выбору модели, чем к выбору основы. В тех случаях, когда объем выборки доста­точен, почти все фактически существующие распределения при­ведут к принципиально одинаковым результатам.
Шафер [123] предлагает рассматривать фактическое распре­деление как «необходимое зло», как математическое удобство, которое позволяет генерировать приписываемые атрибутивы в принципе. В некоторых программах атрибуции были применены так называемые «неинформативные» фактические распределения
1
Суть байесовской теоремы изложена Swinburne [127].
159
Глава вторая. Методы поиска решений при неполном диапазоне данных выборки
параметров, связанные с незнанием параметров модели [122]. Внекоторых необычных ситуациях – маленькие выборки, данные с большой дисперсией или высоким уровнем неполного диапазо­на данных – может потребоваться информативное распределение параметров модели [120].
3.3. Механизм выпадающих единиц
При использовании каждого метода решения проблем с не­достающими данными должны быть сделаны некоторые предпо- ложения о том, как были потеряны данные. Методы атрибуции допускают, что механизм отсутствия (потери) преодолим и может быть устранен в смысле, определяемом Рубином [115]. На наш взгляд, этот вопрос является дискуссионным. Другим, в основном близким, подходом является предположение о данных, потерян­ных случайным образом (MAR) [115; 117]. Несмотря на свое на­звание, термин «данные, потерянные случайным образом – МАR» не обязательно означает, что недостающие значения являются случайной подвыборкой из всего массива (рис. 6).
160
ʧ
˄ ʻ
ʿ

Рис. 6. Классификация респондентов по участию
в эмпирическом исследовании
ˋ 
ʰ-
 
ʿ


Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]