Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Проблемы оптимизации выборочных данных с неполнотой в диапазоне. Монография
.pdf
VI. Многомерная атрибуция значений
Рассмотренные методы и процедуры демонстрируют невероятное изобилие подходов и модификаций атрибуции значений
отсутствующих данных. На наш взгляд, это говорит, с одной стороны, о разнонаправленных поисках исследователями оптимизированных решений, с другой – об использовании различных
базовых гипотез и подходов разной доказательной ценности, а с
третьей – о том, что универсальных, приоритетных или наиболее
эффективных подходов не существует. Об этом свидетельствуют
указанные нами недостатки, ограничения и связанные с ними риски появления ошибок. Поэтому поиски в этой области продолжаются. А многочисленные модификации атрибуции, очевидно,
связаны с разнообразным характером эмпирических данных.
VI. Многомерная атрибуция значений
1. Развитие идеи многомерной атрибуции значений
Многомерная атрибуция [115] представляет собой метод симуляции, с помощью которого каждая недостающая единица за-
меняется серией m > 1 вероятных значений. Версии m полного,
завершенного массива данных анализируются стандартными
статистическими методами для данных без отсутствующих значений. В отличие от других разновидностей атрибуции, результаты
здесь объединяются с использованием простых правил производных оценок, стандартных ошибок и вероятностного отбора, ко-
1
торые «торжественным образом»
объединяют неопределенность
Когда данные собираются путем анкетирования, респонденты могут отказаться от участия или не иметь возможности ответить на некоторые вопросы, они могут не заполнить отдельные
1
Как эмоционально описывает Дж. Шафер [120].
151

Глава вторая. Методы поиска решений при неполном диапазоне данных выборки
части анкеты из-за нехватки времени или интереса. В лонгитюдинальных исследованиях часть респондентов может отказаться от
участия в выборке до завершения исследования. Эти типы недостающих данных тем не менее неизбежны, непреднамеренны и не
контролируемы исследователем.
Многие авторы (Рубин [115], Шафер [123], Рао [110] и др.)
неоднократно подчеркивали тот факт, что до недавнего времени
единственные методы, широко используемые для анализа неполных наборов данных, были сосредоточены в основном на удалении единиц с отсутствующими данными; игнорировании респондентов с неполной информацией или замене их приемлемыми
значениями для отсутствующих значений с помощью средних
или регрессионных коэффициентов, проверке гипотез и т. д.
Эти методы ad hoc, несомненно, просты в применении, но
имеют серьезные недостатки [126]. Для многомерных анализов,
включающих большое количество переменных, процедура удаления случаев может быть безрезультатной и неэффективной.
Часто большая часть единиц в выборке неприемлемо сокращается. Даже если неполнота информации по переменным является
низкой, некоторые респонденты могут иметь полные данные для
всех переменных. Кроме того, удаление случаев может привести к
системному смещению результатов, если единицы, предоставляющие полные данные, не соответствуют целому образцу.
Замена отсутствующих значений простым средним арифметическим может серьезно исказить связь между переменными, в
результате чего корреляции будут искусственно переоценены или
занижены. Однако, несмотря на качества метода, приписываемые
значения являются лишь оценками неизвестных исследователю
действительных значений.
Анализы, которые не учитывают неопределенность и нестабильность недостающих данных, приведут к ситуации, когда
стандартные ошибки слишком малы, вероятность отбора искус-
152

VI. Многомерная атрибуция значений
ственно занижена, а ошибки первого рода выше фиксированных
уровней. Соответственно, гарантийная вероятность, используемая в интервальных оценках, остается меньше, чем указанная исследователем.
В современной специальной литературе отмечается, что за
последние два десятилетия был достигнут значительный прогресс
в разработке методов компенсации недостающих данных. В качестве поворотного пункта выдвигается формализация в конце
1970-х гг. алгоритма достижения максимизации ожиданий, предложенного Демпстером, Лэрдом и Рубином. Идея, лежащая в основе метода, представляет собой фундаментальное изменение в
обработке недостающих данных. До этого их воспринимали как
неудобство, от которого нужно избавиться в основном двумя
способами: устранением случаев и приписыванием. После применения алгоритма статистики начинают смотреть на недостающие данные как на источник изменчивости, которая может быть
выше средней.
Для массивов с неполными данными наблюдаемые единицы
косвенно представляют доказательство вероятного значения ненаблюдаемых единиц.
Современные методы заполнения недостающих данных
предлагают это (сверх) усреднение различными способами. Алгоритмы ЭМ выполняют усреднение детерминированным и неслучайным образом. Рубин разработал парадигму многомерной
атрибуции (Multiple Imputation), в основе которой лежит процедура «усреднения путем симуляции».
Многомерное приписывание было впервые описано более
30 лет назад [115], но оставалось неизвестным и редко использовалось. Основной причиной этого «непонимания», по словам
Шафера, было отсутствие вычислительных инструментов для
создания многомерной атрибуции. В статистической литературе
в последнее время появились разнообразные симуляционные ме-
153

Глава вторая. Методы поиска решений при неполном диапазоне данных выборки
тоды и модели, известные под названием «методы Монте-Карло
с марковскими цепями (рядами)». Они стали причиной революции в применении параметрического моделирования (Джилкс,
Ричардсон, Шпигельхальтер [64]). Шафер [120] адаптировал и
применил методы Монте-Карло с марковскими рядами для нужд
многомерной атрибуции1. Есть основания полагать, что таким образом появляются реальные предпосылки для применения методов и в эмпирических социологических исследованиях.
2. Сущность метода многомерной атрибуции значений
В начале раздела мы отметили, что при многомерной атрибуции любое недостающее значение заменяется набором m > 1
приемлемых значений, взятых (извлеченных) из соответствующего гипотетического распределения. На рис. 5 представлен массив
данных, обработанный многомерной (множественной) атрибуцией. Сущность многомерной модификации метода состоит в итерациях нескольких единичных атрибуций значений (например, m
раз). Затем их результаты объединяются (и усредняются) для получения общей оценки, которая дает необходимую исследователю
информацию. Иными словами, результаты (оценки и стандартные ошибки) этих грязных, обработанных уже приписываемыми
массивами, данных объединяются (собираются) с использованием правил Рубина и других авторов для получения общих оценок
и стандартных ошибок с воздействием на неустановленность
(скрытую картину) отсутствующих данных.
Одним из основных преимуществ многомерной атрибуции
по Шаферу является то, что метод может быть эффективен даже
при небольших значениях m (небольшое количество повторе-
1
Шафер создал некоторые из основных программных продуктов и приложений
для многомерной атрибуции неполных многомерных данных. Некоторые из
этих программ работают как автономное приложение под Windows.
154

VI. Многомерная атрибуция значений
ний). Во многих случаях достаточно от 3 до 5 итераций атрибуции, которые после обобщения дают хорошие результаты.
ʰ
ʤ
m
2
1
?
?
?
?
Рис. 5. Матрица данных с отсутству ющими значениями
и многомерная атрибуция
…
…
…
…
Рубин [115] представляет эффективность оценки, основанной на m атрибутивах, приблизительно равной
1
(1 ) ,
(50)
m
где γ – часть недостающей информации. Элемент γ количественно выражает, насколько более точной может быть оценка, если
отсутствуют недостающие данные; m = количество итераций,
с помощью которых редуцирует γ. Теоретически коэффициент
(50) может изменяться от 0 (полное отсутствие данных) до 100 %
(полная компенсация недостающих данных). Преобразуем формулу (50) так:
155

Глава вторая. Методы поиска решений при неполном диапазоне данных выборки
11
(1 ) 100 ( ) 100
mm
m
или 100.
m
m
(51)
Если γ = 0, эффективность составляет 100 %. Когда γ > 0, эффективность, соответственно, снижается. При различном количестве итераций полезные эффекты на уровни недостающей информации показаны в табл. 34.
Таблица 34
Процент эффективности (снижение доли недостающих данных)
при различном количестве итераций m и различной доле
недостающих данных γ
γ
m
3 97 91 86 81 77
5 98 94 91 88 85
10 99 95 95 93 92
20 100 98 98 97 96
0.1 0.3 0.5 0.7 0.9
Использованный критерий и данные (см. табл. 34) показывают, что преимущества быстро снижаются после первых нескольких итеративных атрибуций. Мы принимаем столбец за 30 %
недостающей информации (γ = 0,3), в большинстве случаев как
один приемлемый и умеренный уровень (эффективность 91 %
достигается на третьей итерации). При m = 5 повторениям атрибуции эффективность достигает 94 %. Увеличивая количество повторений до m = 10, мы достигаем 97 % эффективности. Наблюдается тенденция к незначительному улучшению по сравнению с
увеличением вычислительных усилий и затрат. При m=20 итерациям расходы выросли на 400 %, в то время как снижение недостающих данных составляло всего 4 %, т. е. соотношение 100:1!
Аналогичными являются изменения производительности в любом другом столбце табл. 34.
156

VI. Многомерная атрибуция значений
3. Основные гипотезы метода многомерной атрибуции
значений
Как и любой статистический метод, многомерное приписывание базируется на нескольких основных предположениях. Его
корректное использование требует обоснования этих предположений и (или) адекватной оценки возможных выводов при последующем анализе, если предположения окажутся ложными.
Предположения касаются:
1) распределения генеральной совокупности;
2) распределения параметров модели;
3) причины для категории «неответившие».
3.1. Выбор модели для атрибутирования значений
Для создания атрибутивов для отсутствующих значений необходимо построить и использовать вероятностную модель по
отношению к общему массиву данных (наблюдаемых и отсутствующих значений) и их предполагаемому распределению1.
В большинстве приложений модель, используемая для создания атрибутивов, будет в лучшем случае приблизительно соответствовать действительности. По мнению Шафера [120],
«...к счастью, неоднократные попытки показали, что результаты
и тренды многомерной атрибуции устойчивы к отклонениям в
“атрибутивной” модели». Например, при обработке дихотомических или категориальных переменных часто допустимо приписывать в соответствии с предположением о нормальности распреде-
1
Каждый из пакетов программного обеспечения применяет свой класс многомерных моделей для обработки полных массивов данных. Например, NORM
использует многомерное нормальное распределение. CAT основан на логлинеарных моделях, которые традиционно используются общественными науками
для описания связей между переменными в комбинированных сгруппированных данных.
157

Глава вторая. Методы поиска решений при неполном диапазоне данных выборки
ления, а затем округлять приписываемые непрерывные значения
до ближайшего числа. Переменные, распределения которых сильно искажены, могут быть преобразованы (с использованием логарифмов) до приблизительно нормальных, а затем повторно преобразованы в их исходные шкалы после атрибуции1.
Несмотря на эти обнадеживающие результаты, было бы наивно предполагать, что многомерная атрибуция может осуществляться в любых случаях или что выбор модели атрибуции не
будет влиять на конечные результаты. Модель должна быть подобрана так, чтобы она была (по крайней мере приблизительно) совместима и соответствовала анализу, который впоследствии будет
сделан на оптимизированных (путем атрибуции) наборах данных.
В частности, модель должна быть достаточно содержательной
(чтобы дать больше возможностей) для сохранения связей и зависимостей между переменными, которые будут в центре дальнейших исследований.
Например, предположим, что переменная Y приписывается
с использованием модели нормального распределения, которая
включает переменную X1. После процедуры атрибуции исследователь может дополнительно использовать линейную регрессию
для прогнозирования характеристик переменной Y по данным
переменной X1 и любой другой переменной (X2), которая не была
частью модели атрибуции. Рассчитанный коэффициент регрессии для X2 должен быть близок к нулю, потому что переменная
Y была приписан без учета ее возможных взаимозависимостей с
X2. Поэтому все ссылки, которые могут оказаться важными для
последующего анализа, должны учитываться моделью атрибуции.
Обратное правило может быть неверным. Если Y был про-
писан в соответствии с моделью, которая включает X2, то нет не-
1
Имитационные исследования, показывающие силу многомерной атрибуции по
отношению к отклонениям в модели, предложены Шафером [120].
158

VI. Многомерная атрибуция значений
обходимости включать X2 в предстоящий анализ, относящийся к
Y, если связь между ними не представляет дальнейшего интереса
для исследователя. Результаты, относящиеся к Y, не могут быть
искажены из-за включения дополнительных переменных в фазу
атрибуции. Поэтому рекомендуется использовать более богатую
атрибутивную модель, которая сохранит большое количество
взаимосвязей (корреляций).
3.2. Фактическое распределение параметров
многомерной атрибуции
Статистическая теория, основа многомерной атрибуции,
включает фундаментальный закон вероятности, известный как
теорема Байеса (Bayes’ eorem)1.
Байесовский характер многомерной атрибуции требует определения фактического распределения параметров атрибутивной
модели. В байесовской парадигме это базовое распределение
определяет количественно допущения для параметров модели до
того, как мы узнаем данные. Байесовские подходы (методы) иногда рассматриваются как субъективные и ненаучные, потому что
различные основные распределения могут привести к различным
результатам [122]. Однако на практике результаты таких процедур кажутся гораздо более чувствительными к выбору модели,
чем к выбору основы. В тех случаях, когда объем выборки достаточен, почти все фактически существующие распределения приведут к принципиально одинаковым результатам.
Шафер [123] предлагает рассматривать фактическое распределение как «необходимое зло», как математическое удобство,
которое позволяет генерировать приписываемые атрибутивы в
принципе. В некоторых программах атрибуции были применены
так называемые «неинформативные» фактические распределения
1
Суть байесовской теоремы изложена Swinburne [127].
159

Глава вторая. Методы поиска решений при неполном диапазоне данных выборки
параметров, связанные с незнанием параметров модели [122].
Внекоторых необычных ситуациях – маленькие выборки, данные
с большой дисперсией или высоким уровнем неполного диапазона данных – может потребоваться информативное распределение
параметров модели [120].
3.3. Механизм выпадающих единиц
При использовании каждого метода решения проблем с недостающими данными должны быть сделаны некоторые предпо-
ложения о том, как были потеряны данные. Методы атрибуции
допускают, что механизм отсутствия (потери) преодолим и может
быть устранен в смысле, определяемом Рубином [115]. На наш
взгляд, этот вопрос является дискуссионным. Другим, в основном
близким, подходом является предположение о данных, потерянных случайным образом (MAR) [115; 117]. Несмотря на свое название, термин «данные, потерянные случайным образом – МАR»
не обязательно означает, что недостающие значения являются
случайной подвыборкой из всего массива (рис. 6).
160
ʧ
˄ ʻ
ʿ
Рис. 6. Классификация респондентов по участию
в эмпирическом исследовании
ˋ
ʰ-
ʿ
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
