Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Проблемы оптимизации выборочных данных с неполнотой в диапазоне. Монография

.pdf
Скачиваний:
0
Добавлен:
07.09.2026
Размер:
1 Мб
Скачать
V. Методы атрибуции значений отсутствующих данных (Imputation)
2.2.6. Внутригрупповая стохастическая атрибуция значений
Стохастическая модификация «hot deck» представляет собой специфический стохастический внутригрупповой метод атри­буции значений. Между различными типами внутригрупповой атрибуции есть два важных элемента, которые присутствуют в разной степени и, соответственно, порождают две проблемы: как сформировать импутационные группы и как вытащить атрибу­тивы, прописанные внутри каждого из них. Три наиболее часто применяемых модификации метода конструирования классов импутации можно представить следующим образом:
1) Импутационные группы (классы) создаются при помощи нескольких дополнительных (вспомогательных) переменных. Случаи, которые объединяются в соответствии с дополнитель­ными переменными, ранжируются внутри самой импутацион­ной группы. Недостатком этого метода является то, что если количество дополнительных переменных увеличивается, импу­тационные группы растут, и их число может стать огромным. Это ограничивает использование дополнительной информации в атрибуции.
2) Импутационные группы строятся с использованием мно­гомерной регрессионной модели. Случаи с близкими предиктив­ными регрессионными значениями классифицируются в общую импутационную группу. С помощью этого статистического ме­тода использование дополнительных переменных неограниченно (по крайней мере теоретически).
3) Импутационные группы создаются с использованием ме- тода измерения склонности. Основная цель состоит в том, чтобы найти единичную функцию значения β переменных X. А атри- буция происходит путем классификации βi. Презюмируется, что механизм потери информации независим от наблюдаемой пе­ременной Y, а зависит в основном от X, которая переносит (на-
141
Глава вторая. Методы поиска решений при неполном диапазоне данных выборки
следует) склонность. Таким образом, атрибуция не обременена отклонением. Вычисление склонности (измерение βi) чаще всего осуществляется с помощью логистической регрессионной кривой (Розенбаум и Рубин [112]).
Разработаны еще несколько методов, которые, подобно байе­совским самостоятельной атрибуции, извлекают значения из каж­дого импутационного класса – подвыборки простым случайным
возвратным или безвозвратным отбором1. Используется также стохастическая стратегия через оценку максимального правдо­подобия2 (подробное описание см. у Джимотти и Брауна [65]).
2.3. Детерминированные методы атрибуции значений на моделируемой базе
Адекватное моделирование недостающих данных должно быть основной задачей исследователя, поскольку у него есть информация о причинах отказа от ответов (неучастия) в ис­следовании. В большинстве случаев эта конфиденциальная и подробная информация не предназначена для широкой пуб­лики.
Считается, что детерминированные методы на моделируемой базе произведут более точные приписывания значений, чем ста­тистические, если предположения, включенные в моделирование, будут удовлетворены (Мин-сю, Сальвуччи [95]). Сложность при­менения методов, работающих на моделируемой основе, вытекает из того факта, что предположения обычно не могут быть прове­рены, и поэтому очень сложно обосновать выбор наиболее под­ходящей атрибуции для конкретного исследования. Прежде чем проведем общую оценку их преимуществ и ограничений, кратко рассмотрим наиболее важные из них.
1
«Resampling using simple random sampling with or without replacement».
2
«Randomized strategy using maximum likelihood estimates».
142
V. Методы атрибуции значений отсутствующих данных (Imputation)
2.3.1. Пропорциональная атрибуция значений
Сущность метода выражается в следующем: пусть Ytk пред­ставляет собой величину k-й единицы в совокупности r за период t (месяц, год и т. д.), а t + 1 – это следующий период, и для него отсутствует значение для k-й единицы. Чтобы получить значение, которое будет приписываться на место недостающего, мы долж­ны использовать усредненный коэффициент, полученный на ос­нове других единиц совокупности r:
(1)
Yt r
(45)
Y
tr
или
(1)
Yt r
n
(46)
1
r
,
Y
tr
где n – количество исследуемых единиц, П – знак умножения, а k r.
Среднее значение Y для двух последовательных периодов для коэффициента – выражение (45) получается по известной форму­ле средней арифметической после обработки первичной инфор­мации. Значение Y (t + 1) k из совокупности r для периода t + 1, а также Y
для периода t не включается в расчет. Коэффициент
tk
(46) есть средняя геометрическая Y для совокупности r для двух последовательных периодов (Бергдал [40]).
Значение, которое будет приписываться, получается по фор­муле
или
(1)
Yt r
YY
(1)
tk
YY
n
 (48)
(1)
t
(47)
Y
n
1
rtr
tr
Y
(1)
tr
Y
tk
tr
.
143
Глава вторая. Методы поиска решений при неполном диапазоне данных выборки
Пропорциональная атрибуция может обеспечить очень точ­ные результаты, но при условии, что отсутствующие значения пе­ременной Y в основном зависят от сильно с ней коррелирующей дополнительной переменной X. Однако это слишком ограничи­тельная гипотеза. На практике более вероятно, что недостающее значение зависит не от одной, а от нескольких дополнительных переменных. Тот факт, что при пропорциональной атрибуции ис­пользуется только одна дополнительная переменная, делает ме­тод во многих случаях практически неприменимым и неточным. С другой стороны, когда число классификационных переменных растет, соответствующее количество классов импутации также очень быстро растет. И для некоторых из них недостаточно дан­ных, чтобы получить удовлетворительно точные пропорциональ­ные оценки.
2.3.2. Прогнозная регрессионная атрибуция значений
Авторы, такие как Эззати-Рис [55], Литтл, Мин-сю и Сальвуч­чи [95], предлагают исследовать переменную Yt для автокорре­ляции. Если существует сильная автокорреляция (Фулл [62]), то метод регрессионной атрибуции считается ненадежным. Кроме того, он может применяться к любому классу импутации. Основ­ным недостатком этого метода является сокращение среднего из­за устранения автокорреляции.
2.3.3. Алгоритм максимизации ожиданий метода атрибуции значений
Для метода атрибуции был разработан алгоритм достижения максимизации ожидания – Expectation Maximization (Демпстер, Лэрд, Рубин [50]). Проводится он в два этапа:
1) так называемый этап О (ожидание – expectation) – расчет ожиданий статистических показателей из полного массива на­блюдаемых данных и конкретных параметрических оценок;
144
V. Методы атрибуции значений отсутствующих данных (Imputation)
2) этап M (максимизация – maximization) – на этом этапе об­новляются параметрические оценки. Для этого рассчитывается максимальное правдоподобие на основе конкретных оценок ста­тистических показателей из полных данных. Алгоритм работает по итеративному принципу. Итерации повторяются до тех пор, пока значения двух последовательных параметрических оценок достаточно сблизятся (converge) в соответствии с заранее выбран­ным критерием оценки достаточности. Для каждого отсутствую­щего значения при заданных конечных параметрических оценках и наблюдаемых данных присваиваются ожидаемые значения.
Алгоритм EM может использоваться для атрибуции каждо­го индивидуально отсутствующего значения и часто применя­ется для оценки параметров генеральной совокупности. Оценки максимального правдоподобия появления конкретных значений параметров получить достаточно легко. Если предположение о нормальном распределении единиц верно, вывод неверен для рас­пределений с «ненормальным» законом. Недостатком метода яв­ляется то, что приближение в итеративном процессе может быть медленным и не всегда гарантируется алгоритмом EМ – напри­мер, при работе с «рассеянными» данными (данными с большим рассеянием). Когда требуется итеративный процесс получения оценок максимального правдоподобия, приближение (конвер­генция) достигается еще медленнее. Метод характерен также со­кращением (снижением, уменьшением) средней, т. е. появляется системная ошибка. В качестве преимущества EМ-алгоритма вы­двигается его стабильная конвергенция. Это означает, что повто­рения (итерации) увеличивают вероятность.
2.3.4. Метод главного компонента
Здесь переменные xi преобразуются в zi с целью уменьшения их числа. Для этого строится модель главного компонента. Недо­стающие значения получаются как его функция. Исходные дан-
145
Глава вторая. Методы поиска решений при неполном диапазоне данных выборки
ные – наблюдаемых значения xi и yi. Подробное описание этих процедур было дано Mин-сю и Сальвуччи ([95]). Преимуществом метода является то, что никаких предварительных гипотез о типе распределения единиц не требуется. Недостатком является то, что из-за использования метода «стирания случаев» при получе­нии корреляционной матрицы метод не подходит для массивов данных с малым количеством полностью наблюдаемых случаев1.
Анализ показывает, что при таком способе приписывания ис­пользуется известный метод компонентного анализа, или метод главных компонентов. Идея состоит в том, чтобы создать условия для уменьшения числа факторных (объяснительных) признаков, которые влияют на результат Y, путем преобразования и умень­шения их до меньшего числа переменных.
2.3.5. Декомпозиция единичного значения для атрибуции значений
Эта разновидность метода может быть легко использована для атрибуции значений (Кржановский [83]). Метод несложен для вычислений, реализуется в три этапа:
1) значение i-го случая (строки) опускается, а отсутствующее значение вычисляется из оставшихся значений (n – 1) × p матри­цы данных;
2) значение j-го столбца с переменной X опускается, а недо­стающее значение вычисляется из оставшейся матрицы данных (n – 1) × p;
3) приписываются для (i, j)-го случая недостающие значения, полученные из выражения
2
1
Этот метод имеет множество модификаций, например, такую как метод основ­ного компонента с повторениями. Последние два этапа повторяются многократ­но, до тех пор пока успешно приписанные значения существенно не меняются.
2
Обычно в специальной литературе символом (*) обозначается приписываемое значение.
146
V. Методы атрибуции значений отсутствующих данных (Imputation)
1
P
*1/21/2
xudyd
ij j

()( ).
1
t
(49)
При более чем одном недостающем значении существую­щая процедура применяется по итеративной схеме. Процесс повторяется до тех пор, пока не будет достигнута стабиль­ность приписываемых значений. Преимуществ у метода в ос­новном два:
1) он легко выполняется;
2) никаких условий (ограничивающих предположений) не
требуется.
2.4. Стохастические методы атрибуции на смоделированной базе
2.4.1. Извлечение значений из гипотетических распределений
Эта группа методов всегда требует знания о типе распре­деления или законе, на который они опираются. Поэтому атри­бутивы могут генерироваться только тогда, когда у нас есть некоторая информация о типе распределения единиц (его при­ближении к конкретному распределению вероятностей). Распо­лагаемые данные используются для оценки неизвестных пара­метров известного вероятностного распределения. Считается, что, когда предположение о типе распределения приблизитель­но верно (т. е. отклонение между теоретическим и фактическим распределением статистически незначимо), этот метод даст луч­шие результаты, чем любой другой, который предлагает атрибу­цию значений из наблюдаемых данных. Проблема в том, что это требование не всегда обеспечено.
Например, если используется выборка объемом 1000 чело­век, из которых 500 ответили и 500 не ответили. Распределение 500ответов было «полунормальным». Если из других источников известно, что генеральная совокупность распределена нормаль­но, то можно использовать данные по совокупности 500 респон-
147
Глава вторая. Методы поиска решений при неполном диапазоне данных выборки
дентов для оценки средней и дисперсии и обеспечения припи­сываемых значений с нормальным распределением со средней оценкой и дисперсией. Таким образом, можно восстановить и вторую половину нормального распределения. Недостатком ме­тода является то, что необходима информация для формулирова­ния предположения (гипотезы) о распределении и последующей проверки его обоснованности.
2.4.2. Статистическая атрибуция значений с использованием регрессионных связей
Как мы уже указывали выше, описываемый метод страдает от уменьшения среднего. Выход из этого состоит в том, чтобы сделать небольшие статистические перемешивания возможных значений с целью увеличения рассеяния. Эти так называемые ма­ленькие статистические перемешивания выполняются с исполь­зованием различных методов:
1) стохастическое перемешивание из распределения N (0,  )
со средней 0 и дисперсией  ;
2) стохастическое перемешивание отвечавших, участвующих
в регрессионной модели;
3) смешанное стохастическое перемешивание.
Все это делается для предотвращения появления нели­нейности и неадекватности при исследовании регрессионной связи.
Метод обеспечивает широкий диапазон добавления или ограничения на различных этапах при выборе атрибутивных зна­чений.
148
V. Методы атрибуции значений отсутствующих данных (Imputation)
2.5. Методы атрибуции значений, связанные с байесовской парадигмой
2.5.1. Метод увеличения количества данных1
Это байесовский итеративный метод, впервые предложенный Таннером и Вонгом [128]. При этом допускается наличие двух веро­ятностных распределений: распределение единиц и распределение частоты параметров. И здесь, как и в случае с алгоритмом достиже­ния максимизации ожидания, процедура выполняется в два этапа:
1) приписывание (П-этап) – атрибутивы для недостающих значений вероятностного распределения заносятся с использова­нием оценок конкретных параметров;
2) оценка параметров (ОП-этап) – получение параметриче­ских оценок из их апостериорного распределения – одновремен­но из наблюдаемых и приписываемых данных. В этом и заклю­чается смысл увеличения. В итеративном процессе используется алгоритм максимизации ожиданий для получения исходных па­раметрических оценок на первом этапе.
Метод использует связи между переменными для построе­ния атрибутивных значений. При удовлетворении требованиям простого случайного отбора единиц в выборке метод генерирует точные многомерные атрибутивные значения в соответствии с моделью Рубина [115]. Недостатком является то, что при увели­чении данных необходимы повторения (итерации), при которых конвергенция может быть очень медленной.
2.5.2. Метод последующей атрибуции значений
Другие авторы [129] предлагают процедуры для последующей атрибуции. По их мнению, во многих ситуациях эта модификация
1
Шафер делает ставку на этот метод в своих программных продуктах для атри­буции значений отсутствующих данных. Модификация Шафера заключается в использовании моделей для прерывистых, категориальных признаков, а также для смешанных – постоянных и категориальных признаков.
149
Глава вторая. Методы поиска решений при неполном диапазоне данных выборки
метода может дать хорошие результаты, причем без необходимости повторений. Основная цель – найти апостериорное распределение. Имеющиеся единицы в выборке декомпозируются на ответивших и неответивших. Случаи «ответивших» обрабатываются первыми. «Неответившие» обрабатываются дополнительно, поэтому недо­стающие значения приписываются как можно большему количе­ству респондентов. Одним из преимуществ здесь является то, что атрибуция данных обеспечивается даже тогда, когда они собирают­ся в разное время (например, медицинские и другие исследования). Кроме того, итерации не требуются, и метод дает возможность не­посредственно оценить вероятностную модель. Эта модификация может быть очень эффективной при наличии информативных по­терь (некоторые значения для переменной могут отсутствовать).
По нашему мнению, применение атрибуции для создания полного массива данных (без потерянных значений) может иметь следующие преимущества:
Во-первых, исследователь обычно обладает более конкретны­ми знаниями, «внутренней» информацией о главных причинах потери данных. Это знание может быть использовано в качестве основы для атрибуции.
Во-вторых, недостающие значения усложняют структуру данных, поэтому при использовании взвешивания необходимо включать в анализ более сложные статистические методы, кото­рые также усложняют процесс, а часто и существенно отдаляют нас от фактических значений. Процедура атрибуции предлагает решения, позволяющие избежать этого затруднения.
В-третьих, когда используемые статистические методы обяза­тельно требуют полного массива данных (например, при регрес­сионном анализе), атрибуция может предотвратить потерю ин­формации, вызванную удалением случаев неполных записей.
В-четвертых, в некоторых отдельных ситуациях атрибуция может уменьшить системную ошибку, внесенную неответившими лицами.
150
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]