Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Проблемы оптимизации выборочных данных с неполнотой в диапазоне. Монография
.pdf
V. Методы атрибуции значений отсутствующих данных (Imputation)
2.2.6. Внутригрупповая стохастическая атрибуция
значений
Стохастическая модификация «hot deck» представляет собой
специфический стохастический внутригрупповой метод атрибуции значений. Между различными типами внутригрупповой
атрибуции есть два важных элемента, которые присутствуют в
разной степени и, соответственно, порождают две проблемы: как
сформировать импутационные группы и как вытащить атрибутивы, прописанные внутри каждого из них. Три наиболее часто
применяемых модификации метода конструирования классов
импутации можно представить следующим образом:
1) Импутационные группы (классы) создаются при помощи
нескольких дополнительных (вспомогательных) переменных.
Случаи, которые объединяются в соответствии с дополнительными переменными, ранжируются внутри самой импутационной группы. Недостатком этого метода является то, что если
количество дополнительных переменных увеличивается, импутационные группы растут, и их число может стать огромным.
Это ограничивает использование дополнительной информации
в атрибуции.
2) Импутационные группы строятся с использованием многомерной регрессионной модели. Случаи с близкими предиктивными регрессионными значениями классифицируются в общую
импутационную группу. С помощью этого статистического метода использование дополнительных переменных неограниченно
(по крайней мере теоретически).
3) Импутационные группы создаются с использованием ме-
тода измерения склонности. Основная цель состоит в том, чтобы
найти единичную функцию значения β переменных X. А атри-
буция происходит путем классификации βi. Презюмируется, что
механизм потери информации независим от наблюдаемой переменной Y, а зависит в основном от X, которая переносит (на-
141

Глава вторая. Методы поиска решений при неполном диапазоне данных выборки
следует) склонность. Таким образом, атрибуция не обременена
отклонением. Вычисление склонности (измерение βi) чаще всего
осуществляется с помощью логистической регрессионной кривой
(Розенбаум и Рубин [112]).
Разработаны еще несколько методов, которые, подобно байесовским самостоятельной атрибуции, извлекают значения из каждого импутационного класса – подвыборки простым случайным
возвратным или безвозвратным отбором1. Используется также
стохастическая стратегия через оценку максимального правдоподобия2 (подробное описание см. у Джимотти и Брауна [65]).
2.3. Детерминированные методы атрибуции значений
на моделируемой базе
Адекватное моделирование недостающих данных должно
быть основной задачей исследователя, поскольку у него есть
информация о причинах отказа от ответов (неучастия) в исследовании. В большинстве случаев эта конфиденциальная и
подробная информация не предназначена для широкой публики.
Считается, что детерминированные методы на моделируемой
базе произведут более точные приписывания значений, чем статистические, если предположения, включенные в моделирование,
будут удовлетворены (Мин-сю, Сальвуччи [95]). Сложность применения методов, работающих на моделируемой основе, вытекает
из того факта, что предположения обычно не могут быть проверены, и поэтому очень сложно обосновать выбор наиболее подходящей атрибуции для конкретного исследования. Прежде чем
проведем общую оценку их преимуществ и ограничений, кратко
рассмотрим наиболее важные из них.
1
«Resampling using simple random sampling with or without replacement».
2
«Randomized strategy using maximum likelihood estimates».
142

V. Методы атрибуции значений отсутствующих данных (Imputation)
2.3.1. Пропорциональная атрибуция значений
Сущность метода выражается в следующем: пусть Ytk представляет собой величину k-й единицы в совокупности r за период
t (месяц, год и т. д.), а t + 1 – это следующий период, и для него
отсутствует значение для k-й единицы. Чтобы получить значение,
которое будет приписываться на место недостающего, мы должны использовать усредненный коэффициент, полученный на основе других единиц совокупности r:
(1)
Yt r
(45)
Y
tr
или
(1)
Yt r
n
(46)
1
r
,
Y
tr
где n – количество исследуемых единиц, П – знак умножения, а k r.
Среднее значение Y для двух последовательных периодов для
коэффициента – выражение (45) получается по известной формуле средней арифметической после обработки первичной информации. Значение Y (t + 1) k из совокупности r для периода t + 1,
а также Y
для периода t не включается в расчет. Коэффициент
tk
(46) есть средняя геометрическая Y для совокупности r для двух
последовательных периодов (Бергдал [40]).
Значение, которое будет приписываться, получается по формуле
или
(1)
Yt r
YY
(1)
tk
YY
n
(48)
(1)
t
(47)
Y
n
1
rtr
tr
Y
(1)
tr
Y
tk
tr
.
143

Глава вторая. Методы поиска решений при неполном диапазоне данных выборки
Пропорциональная атрибуция может обеспечить очень точные результаты, но при условии, что отсутствующие значения переменной Y в основном зависят от сильно с ней коррелирующей
дополнительной переменной X. Однако это слишком ограничительная гипотеза. На практике более вероятно, что недостающее
значение зависит не от одной, а от нескольких дополнительных
переменных. Тот факт, что при пропорциональной атрибуции используется только одна дополнительная переменная, делает метод во многих случаях практически неприменимым и неточным.
С другой стороны, когда число классификационных переменных
растет, соответствующее количество классов импутации также
очень быстро растет. И для некоторых из них недостаточно данных, чтобы получить удовлетворительно точные пропорциональные оценки.
2.3.2. Прогнозная регрессионная атрибуция значений
Авторы, такие как Эззати-Рис [55], Литтл, Мин-сю и Сальвуччи [95], предлагают исследовать переменную Yt для автокорреляции. Если существует сильная автокорреляция (Фулл [62]), то
метод регрессионной атрибуции считается ненадежным. Кроме
того, он может применяться к любому классу импутации. Основным недостатком этого метода является сокращение среднего изза устранения автокорреляции.
2.3.3. Алгоритм максимизации ожиданий метода атрибуции
значений
Для метода атрибуции был разработан алгоритм достижения
максимизации ожидания – Expectation Maximization (Демпстер,
Лэрд, Рубин [50]). Проводится он в два этапа:
1) так называемый этап О (ожидание – expectation) – расчет
ожиданий статистических показателей из полного массива наблюдаемых данных и конкретных параметрических оценок;
144

V. Методы атрибуции значений отсутствующих данных (Imputation)
2) этап M (максимизация – maximization) – на этом этапе обновляются параметрические оценки. Для этого рассчитывается
максимальное правдоподобие на основе конкретных оценок статистических показателей из полных данных. Алгоритм работает
по итеративному принципу. Итерации повторяются до тех пор,
пока значения двух последовательных параметрических оценок
достаточно сблизятся (converge) в соответствии с заранее выбранным критерием оценки достаточности. Для каждого отсутствующего значения при заданных конечных параметрических оценках
и наблюдаемых данных присваиваются ожидаемые значения.
Алгоритм EM может использоваться для атрибуции каждого индивидуально отсутствующего значения и часто применяется для оценки параметров генеральной совокупности. Оценки
максимального правдоподобия появления конкретных значений
параметров получить достаточно легко. Если предположение о
нормальном распределении единиц верно, вывод неверен для распределений с «ненормальным» законом. Недостатком метода является то, что приближение в итеративном процессе может быть
медленным и не всегда гарантируется алгоритмом EМ – например, при работе с «рассеянными» данными (данными с большим
рассеянием). Когда требуется итеративный процесс получения
оценок максимального правдоподобия, приближение (конвергенция) достигается еще медленнее. Метод характерен также сокращением (снижением, уменьшением) средней, т. е. появляется
системная ошибка. В качестве преимущества EМ-алгоритма выдвигается его стабильная конвергенция. Это означает, что повторения (итерации) увеличивают вероятность.
2.3.4. Метод главного компонента
Здесь переменные xi преобразуются в zi с целью уменьшения
их числа. Для этого строится модель главного компонента. Недостающие значения получаются как его функция. Исходные дан-
145

Глава вторая. Методы поиска решений при неполном диапазоне данных выборки
ные – наблюдаемых значения xi и yi. Подробное описание этих
процедур было дано Mин-сю и Сальвуччи ([95]). Преимуществом
метода является то, что никаких предварительных гипотез о типе
распределения единиц не требуется. Недостатком является то,
что из-за использования метода «стирания случаев» при получении корреляционной матрицы метод не подходит для массивов
данных с малым количеством полностью наблюдаемых случаев1.
Анализ показывает, что при таком способе приписывания используется известный метод компонентного анализа, или метод
главных компонентов. Идея состоит в том, чтобы создать условия
для уменьшения числа факторных (объяснительных) признаков,
которые влияют на результат Y, путем преобразования и уменьшения их до меньшего числа переменных.
2.3.5. Декомпозиция единичного значения для атрибуции
значений
Эта разновидность метода может быть легко использована
для атрибуции значений (Кржановский [83]). Метод несложен
для вычислений, реализуется в три этапа:
1) значение i-го случая (строки) опускается, а отсутствующее
значение вычисляется из оставшихся значений (n – 1) × p матрицы данных;
2) значение j-го столбца с переменной X опускается, а недостающее значение вычисляется из оставшейся матрицы данных
(n – 1) × p;
3) приписываются для (i, j)-го случая недостающие значения,
полученные из выражения
2
1
Этот метод имеет множество модификаций, например, такую как метод основного компонента с повторениями. Последние два этапа повторяются многократно, до тех пор пока успешно приписанные значения существенно не меняются.
2
Обычно в специальной литературе символом (*) обозначается приписываемое
значение.
146

V. Методы атрибуции значений отсутствующих данных (Imputation)
1
P
*1/21/2
xudyd
ij j
()( ).
1
t
(49)
При более чем одном недостающем значении существующая процедура применяется по итеративной схеме. Процесс
повторяется до тех пор, пока не будет достигнута стабильность приписываемых значений. Преимуществ у метода в основном два:
1) он легко выполняется;
2) никаких условий (ограничивающих предположений) не
требуется.
2.4. Стохастические методы атрибуции
на смоделированной базе
2.4.1. Извлечение значений из гипотетических распределений
Эта группа методов всегда требует знания о типе распределения или законе, на который они опираются. Поэтому атрибутивы могут генерироваться только тогда, когда у нас есть
некоторая информация о типе распределения единиц (его приближении к конкретному распределению вероятностей). Располагаемые данные используются для оценки неизвестных параметров известного вероятностного распределения. Считается,
что, когда предположение о типе распределения приблизительно верно (т. е. отклонение между теоретическим и фактическим
распределением статистически незначимо), этот метод даст лучшие результаты, чем любой другой, который предлагает атрибуцию значений из наблюдаемых данных. Проблема в том, что это
требование не всегда обеспечено.
Например, если используется выборка объемом 1000 человек, из которых 500 ответили и 500 не ответили. Распределение
500ответов было «полунормальным». Если из других источников
известно, что генеральная совокупность распределена нормально, то можно использовать данные по совокупности 500 респон-
147

Глава вторая. Методы поиска решений при неполном диапазоне данных выборки
дентов для оценки средней и дисперсии и обеспечения приписываемых значений с нормальным распределением со средней
оценкой и дисперсией. Таким образом, можно восстановить и
вторую половину нормального распределения. Недостатком метода является то, что необходима информация для формулирования предположения (гипотезы) о распределении и последующей
проверки его обоснованности.
2.4.2. Статистическая атрибуция значений с использованием
регрессионных связей
Как мы уже указывали выше, описываемый метод страдает
от уменьшения среднего. Выход из этого состоит в том, чтобы
сделать небольшие статистические перемешивания возможных
значений с целью увеличения рассеяния. Эти так называемые маленькие статистические перемешивания выполняются с использованием различных методов:
1) стохастическое перемешивание из распределения N (0, )
со средней 0 и дисперсией ;
2) стохастическое перемешивание отвечавших, участвующих
в регрессионной модели;
3) смешанное стохастическое перемешивание.
Все это делается для предотвращения появления нелинейности и неадекватности при исследовании регрессионной
связи.
Метод обеспечивает широкий диапазон добавления или
ограничения на различных этапах при выборе атрибутивных значений.
148

V. Методы атрибуции значений отсутствующих данных (Imputation)
2.5. Методы атрибуции значений, связанные
с байесовской парадигмой
2.5.1. Метод увеличения количества данных1
Это байесовский итеративный метод, впервые предложенный
Таннером и Вонгом [128]. При этом допускается наличие двух вероятностных распределений: распределение единиц и распределение
частоты параметров. И здесь, как и в случае с алгоритмом достижения максимизации ожидания, процедура выполняется в два этапа:
1) приписывание (П-этап) – атрибутивы для недостающих
значений вероятностного распределения заносятся с использованием оценок конкретных параметров;
2) оценка параметров (ОП-этап) – получение параметрических оценок из их апостериорного распределения – одновременно из наблюдаемых и приписываемых данных. В этом и заключается смысл увеличения. В итеративном процессе используется
алгоритм максимизации ожиданий для получения исходных параметрических оценок на первом этапе.
Метод использует связи между переменными для построения атрибутивных значений. При удовлетворении требованиям
простого случайного отбора единиц в выборке метод генерирует
точные многомерные атрибутивные значения в соответствии с
моделью Рубина [115]. Недостатком является то, что при увеличении данных необходимы повторения (итерации), при которых
конвергенция может быть очень медленной.
2.5.2. Метод последующей атрибуции значений
Другие авторы [129] предлагают процедуры для последующей
атрибуции. По их мнению, во многих ситуациях эта модификация
1
Шафер делает ставку на этот метод в своих программных продуктах для атрибуции значений отсутствующих данных. Модификация Шафера заключается в
использовании моделей для прерывистых, категориальных признаков, а также
для смешанных – постоянных и категориальных признаков.
149

Глава вторая. Методы поиска решений при неполном диапазоне данных выборки
метода может дать хорошие результаты, причем без необходимости
повторений. Основная цель – найти апостериорное распределение.
Имеющиеся единицы в выборке декомпозируются на ответивших
и неответивших. Случаи «ответивших» обрабатываются первыми.
«Неответившие» обрабатываются дополнительно, поэтому недостающие значения приписываются как можно большему количеству респондентов. Одним из преимуществ здесь является то, что
атрибуция данных обеспечивается даже тогда, когда они собираются в разное время (например, медицинские и другие исследования).
Кроме того, итерации не требуются, и метод дает возможность непосредственно оценить вероятностную модель. Эта модификация
может быть очень эффективной при наличии информативных потерь (некоторые значения для переменной могут отсутствовать).
По нашему мнению, применение атрибуции для создания
полного массива данных (без потерянных значений) может иметь
следующие преимущества:
Во-первых, исследователь обычно обладает более конкретными знаниями, «внутренней» информацией о главных причинах
потери данных. Это знание может быть использовано в качестве
основы для атрибуции.
Во-вторых, недостающие значения усложняют структуру
данных, поэтому при использовании взвешивания необходимо
включать в анализ более сложные статистические методы, которые также усложняют процесс, а часто и существенно отдаляют
нас от фактических значений. Процедура атрибуции предлагает
решения, позволяющие избежать этого затруднения.
В-третьих, когда используемые статистические методы обязательно требуют полного массива данных (например, при регрессионном анализе), атрибуция может предотвратить потерю информации, вызванную удалением случаев неполных записей.
В-четвертых, в некоторых отдельных ситуациях атрибуция может
уменьшить системную ошибку, внесенную неответившими лицами.
150
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
