Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Проблемы оптимизации выборочных данных с неполнотой в диапазоне. Монография
.pdf
V. Методы атрибуции значений отсутствующих данных (Imputation)
исследовательской цели. Поэтому необходимо, чтобы заложенная
в информационном массиве модель была адекватной. К сожалению, для некоторых разновидностей метода достижение этой
цели зачастую невозможно.
В последние годы было создано множество техник атрибуции1 и соответствующих программных продуктов. Различные
модификации могут давать хорошие результаты при различных
обстоятельствах. Целесообразно использовать «сенситивный
подход», когда для определенного выборочного исследования
подбирается метод атрибуции.
2. Модификации метода атрибуции значений
Существует множество различных модификаций метода
атрибуции значений отсутствующих данных (Imputation). Они
классифицируются по различным критериям. Рассмотрим некоторые.
1. По виду признака, значения которого приписываются, мо-
дификации могут быть:
– количественные;
– качественные.
2. В зависимости от того, как недостающие значения призна-
ка приписываются, они представлены как включающие позиции:
–донор (определенным образом выбирается подходящая еди-
ница, которая является донором; недостающие значения за-
меняются характеристиками донора);
– математическая или логическая процедура (например, когда
используется мода при категориальных признаках) – обнару-
живается характеристика, которая приписывается отсутству-
ющему значению.
1
В современной специальной литературе описано более 40 модификаций метода атрибуции значений недостающих данных.
131

Глава вторая. Методы поиска решений при неполном диапазоне данных выборки
3. По количеству признаков, по которым происходит припи-
сывание, оно бывает одномерным или многомерным. Например,
усреднение результатов нескольких циклов атрибуции значений
недостающих данных более чем одного признака характеризуется так называемой многомерной атрибуцией (а также существуют
различные смешанные методы).
4. Согласно классификации1 Мин-сю и Сальвуччи [95], атрибуция может быть представлена и другими основными группами:
стохастической (случайной) и детерминистической2 (по выбору)
атрибуцией.
По классификации этих авторов различают пять основных
групп методов атрибуции, а именно:
1) Простая детерминированная атрибуция.
2) Простая стохастическая атрибуция.
3) Детерминистическая атрибуция при использовании моделируемой базы.
4) Статистическая атрибуция при использовании моделируемой базы.
5) Методы, связанные с байесовскими законами.
Характерным для детерминистического подхода является
определение одного и только одного возможного значения, которое приписывается каждой недостающей единице (или отсутствующему значению по данной переменной). Как только массив
данных обрабатывается один раз с помощью атрибуции, результат уникален и неповторим и создает имитируемую базу данных.
С другой стороны, стохастический подход случайным образом
вытягивает значения, которые можно отнести либо к наблюдаемым данным, либо к их предполагаемому, вероятностному рас-
1
Далее мы будем использовать эту классификацию для представления сущности, а также преимуществ и недостатков отдельных разновидностей метода.
2
В англоязычной методической литературе прямо говорится, что термины «случайно» и «стохастично» являются синонимами (random = stochastic).
132

V. Методы атрибуции значений отсутствующих данных (Imputation)
пределению. При этом такой подход (метод) искусственно уменьшает вариацию и приводит, но только фиктивно, к уменьшению
случайной ошибки.
Альтернативой этому являются стохастические методы атрибуции, которые в целом обеспечивают бόльшую изменчивость
(вариабельность) в данных, чем детерминированные.
Основной гипотезой в атрибуции значений недостающих
данных является предположение, что механизм «неответившие»
можно игнорировать, но что недостающая информация, по всей
вероятности, зависит по крайней мере от любой из наблюдаемых
переменных. Ранее мы указывали, что такой тип данных называется «потерянные случайным образом – missing at random» или
«полностью потерянные случайным образом – missing completely
at random (MCAR)».
Вторая, базовая для метода, гипотеза заключается в том, что
неответившие лица имеют приблизительно одинаковое распределение с ответившими (Бартоломе [37], Кокрен [13], Самарана-
як [118]). Учитывая возможности и преимущества, которые предлагают методы атрибуции, а также их непопулярность в практике
эмпирических исследований, мы остановимся более подробно на
основных из них, а именно: на простой детерминированной атрибуции; простой стохастической атрибуции; детерминистических
методах на моделируемой базе; стохастических методах на моделируемой базе; методах, связанных с байесовской парадигмой.
2.1. Простая детерминированная атрибуция значений
В литературе встречается несколько основных модификаций.
2.1.1. Дедуктивная атрибуция значений
С помощью этого метода оцениваются недостающие значения в доступной информации с использованием данных о переменных, полученных из предыдущих выборочных исследований
133

Глава вторая. Методы поиска решений при неполном диапазоне данных выборки
или от других переменных в конкретном исследовании, связанных с теми, для которых будут приписываться значения. Применение метода происходит на основе некоторой детерминирующей
связи между недостающим значением и значениями и данными
из других источников.
В так называемой «cold deck»1 атрибуции используется информация о той же переменной из предыдущих исследований.
Вцелом с помощью дедуктивного подхода невозможно найти достаточно информации, чтобы прописать все недостающие значения. Поэтому метод может быть использован для компенсации
только части недостающих данных. Дедуктивная атрибуция значений может использоваться перед любым другим методом импутации, когда есть условия, потому что она обеспечивает более точные или удовлетворительно точные значения для отсутствующих
случаев. Однако следует отметить, что действие и результаты дедуктивной атрибуции полностью зависят от имеющихся данных.
2.1.2. Атрибуция значений по общей средней2
Это самый простой, но и наименее привлекательный метод
восстановления значений. Здесь используется общая выборочная средняя, которой заменяются все недостающие значения. Понятно, что таким образом метод может обеспечить неизменные
оценки средней или суммы генеральной совокупности только
при условии, что недостающие значения полностью потеряны
случайным образом (MCAR), т. е. что распределение на две части
выборки – на наблюдаемых и ненаблюдаемых – идентично структуре. Атрибуция средней ячейки сначала использует некоторые
1
Из-за невозможности найти адекватный перевод в тексте используется оригинальное название на английском языке.
2
Также называется «атрибуция регулируемой средней арифметической (Adjusted
Mean Imputation)» или метод замены (Мин-сю и Сальвуччи). Разновидность метода встречается под названием «импутация на моделируемой базе».
134

V. Методы атрибуции значений отсутствующих данных (Imputation)
вспомогательные, дополнительные переменные для формирования импутационных ячеек, а затем недостающие значения в каждой ячейке заменяются выборочной средней.
Метод может гарантировать невозмещенные оценки среднего или суммарного значения в генеральной совокупности, если
недостающие (потерянные) значения зависят исключительно от
дополнительных переменных, которые используются для создания импутационных ячеек. Распределение данных, по существу,
будет искажено, потому что концентрация всех приписываемых
значений вокруг среднего в ячейках неизбежно создает помехи
в распределении. Поэтому оценки будут обременены системной
ошибкой, дисперсии будут существенно занижены.
Мы проиллюстрируем трудности в применении этой атрибуции значений с оговоркой, что на практике нам трудно встретить
такую упрощенную модель (табл. 33).
Таблица 33
Данные упрощенной модели
№ еди-
ницы
Пол Возраст Наличие
водительского
удостоверения
1 ж 14 не известно 4000 4000
2 ж 26 да 12 100 12 100
3 м 30 нет 25 400 25 300
4 ж 41 нет 46 900 40 000
5 м 15 нет 3500 3500
6 ж 57 да 36 500 36 500
7 м 13 нет 4000 не известно
8 м 12 нет 5500 4000
9 ж 28 да 4000 3500
10 м 31 да 28 600 28 600
11 ж 45 да 69 000 69 000
12 м 38 да 25 000 25 000
Индивидуальный
среднемесячный
доход (руб.)
Индивидуальный
среднемесячный
расход (руб.)
135

Глава вторая. Методы поиска решений при неполном диапазоне данных выборки
Атрибуции подлежат один категориальный и один количественный признак – «наличие водительского удостоверения» и
«среднемесячные расходы» (см. табл. 33). «Среднемесячные расходы» рассчитываются по формуле
n
Y
r
1
Y
r
r
Y
(44)
,
tr
исключая единицу с недостающим значением yr в 22 864 рубля.
Если припишем это значение на место недостающего значения,
получим неадекватный результат, потому что единица № 7, с возрастом 13 лет, получит среднемесячный доход в 4000 рублей.
Модой признака «наличие водительского удостоверения» является «да». Если она отнесена к единице № 1, то для всей совокупности потребуется новая редакция (так как в 14 лет человек
не может иметь водительские права). Это эксплицирует проблему
использования аналогичного метода атрибуции.
При классической средней атрибуции (Buck [44], Little [89])
исследуемая совокупность делится на страты (группы). Средняя
арифметическая величина соответствующих страт фиксируется в
данных интервальной шкалы (или моды в данных более слабых
шкал) после исключения единицы с отсутствующим значением
признака. Полученные значения приписываются соответственно
в тех же стратах.
Общим для методов атрибуции значений, построенных на
основе математической или логической процедуры (с использованием таких свойств показателей, как среднее, медиана, мода,
коэффициенты регрессии и т. д.), является то, что они также известны под названием «импутация (замещение) в моделируемую базу».
136

V. Методы атрибуции значений отсутствующих данных (Imputation)
2.1.3. Детерминированная «hot deck» атрибуция значений 1
Модификация атрибуции «hot deck» является одним из наиболее часто используемых методов атрибуции значений на практике. Он прост и интуитивно внушает доверие исследователям,
которые не обладают серьезной статистической подготовкой.
Статистическая модель не применяется. Основной недостаток
заключается в том, что метод не может восстановить типичные
значения для объекта с определенными характеристиками, если
в наблюдении не участвуют такие же респонденты. «Hot deck»
атрибуция также имеет несколько разновидностей.
«Hot deck» атрибуция с обращением к ближайшему «соседу»,
который выбирается донором. Первым шагом является использование нескольких дополнительных переменных для определения
импутационных классов. Внутри каждого импутационного класса выделяется некая начальная точка с одним-единственным значением2. Оно может быть средним для класса или любого другого
заранее определенного значения.
Затем записи массива данных из различных исследований
рассматриваются отдельно. Если в одной из записей есть ответ
для переменной, на которую направлена атрибуция, то найденное
значение предназначено для замены в этом импутационном классе. Если запись содержит недостающее значение, ей приписывается значение, имеющееся в другом массиве, и т. д.
Метод основан на выборе донора через «наименьшее» расстояние между единицей недостающего значения и остальными
единицами.
1
Процесс импутации – это замещение ошибочных, противоречивых и отсутствующих ответов в процессе редактирования данных другими ответами –
значениями показателей. Стратегия проведения импутации определяется заранее при подготовке методологии проведения статистического наблюдения.
2
Речь идет о стратификации массива данных для создания импутационного
класса – группы, или страты.
137

Глава вторая. Методы поиска решений при неполном диапазоне данных выборки
Основным преимуществом метода является экономия в расчетах, поскольку все приписывания выполняются при одном обзоре информационного массива. Недостатком метода является
опасность частого использования одних и тех же доноров – это
может привести к потере точности выборочных оценок.
Многомерное сочетание. В этом методе доноры и акцепторы
(получатели) объединяются в соответствии с несколькими дополнительно определенными переменными. Для каждого недостающего случая в каждом классе выбирается ближайший донор. Если
в классе его нет, он объединяется с другими классами до получения донора.
Метод не особенно удобен для применения без компьютерной техники. Поэтому был создан алгоритм атрибуции – замены
значений единиц. Донор и акцептор объединяются по всем дополнительным переменным, если присутствуют доноры. В противном случае компьютер автоматически находит донора, который
соответствует только некоторым переменным. Это, к сожалению,
деформирует классы выбора (группы, страты).
Согласование в соответствии с функцией расстояния. В
этом методе наиболее близкое значение присваивается каждому
отсутствующему случаю с использованием различных функций
расстояния с одной переменной. Например, по законам многомерного евклидова пространства (Multi-dimensional Euclidean
Space), расстояния Махаланобиса (Mahalanobis Distance), различия между заданными значениями с помощью регрессионной
модели и пр.
Все рассмотренные модификации имеют свои преимущества
и ограничения. И, похоже, нет ни одной, которая была бы в привилегированном положении.
138

V. Методы атрибуции значений отсутствующих данных (Imputation)
2.2. Простая стохастическая атрибуция значений
2.2.1. Атрибуция значений по общей средней или средней ячейки
путем случайного перемешивания
Чтобы преодолеть недооцененное рассеяние, типичное для
метода атрибуции средней, мы используем случайное перемешивание в распределении со средней ноль и наблюдаемую ковариационную матрицу. В случайном перемешивании чаще всего заложена гипотеза о нормальном распределении с использованием
его свойств.
2.2.2. Стохастичный метод атрибуции значений «hot deck»
Стохастичная «hot deck» атрибуция является одним из самых
популярных методов на практике. Применяется он в три этапа:
1) Определение дополнительных переменных, с которыми бу-
дут сочетаться доноры и акцепторы.
2) Случайная загрузка значений атрибуции из данных, по частоте – взвешенная и невзвешенная – внутри каждого отобранного класса.
3) Если в отобранном классе отсутствуют наблюдаемые значения, то он объединяется с другими классами, а приписывание
производится на этой новой основе.
2.2.3. Общая статистическая атрибуция значений
По своей сути эта модификация относится к загрузке случайным образом значений атрибуции из наблюдаемых данных с использованием различных схем выборки. Наиболее часто используемой схемой является получение подвыборок с возвратом или
без возврата – возвратный или безвозвратный отбор. Это один из
самых простых в применении методов, потому что он не основан
на дополнительных переменных, и поэтому риск увеличения систематических ошибок от невыполнения минимален.
139

Глава вторая. Методы поиска решений при неполном диапазоне данных выборки
2.2.4. Приблизительная байесовская самостоятельная
атрибуция значений
В этом методе сначала извлекаются случайным образом r значения с возвратом из r наблюдаемых значений Y1, ..., Yr для создания Y
возвратом из Y
*, а затем случайным образом извлекаются m значения с
obs
*, такие как приписываемые значения для m недо-
obs
стающих значений переменной Y. Атрибутивы извлекаются из подвыборки, а не непосредственно из наблюдаемых данных. Это вызывает дополнительное рассеивание, делая метод приблизительно
«точным» для многомерных атрибутивов в соответствии с теорией
Рубина. Метод был назван «приблизительным байесовским самостоятельным описанием», потому что он очень близок к байесовскому самоописанию (Bayesian bootstrap), рассмотренному ниже.
2.2.5. Байесовская самостоятельная атрибуция значений
Этот тип атрибуции значений состоит из двух этапов:
1) Скачать r – 1 однородные случайные числа между 0 и 1, при-
чем их упорядоченные значения представлены в виде a1, ..., a
r–1
также a0 = 0 и ar = 1, где r – количество наблюдаемых значений.
2) Загрузить каждое из m отсутствующих значений из Y1,...,Yr
с вероятностями (a1 – a0), (a2 – a1), (1 – a
). Извлекаются все од-
r-1
нородные случайные числа u, отдельное число m и прописывает-
ся Yi, если a
≤ u ≤ ai, (i = 1, 2, ..., r).
i-1
Разница между приблизительным самостоятельным байесовским приписыванием и самостоятельным байесовским приписыванием (2.2.4 и 2.2.5) состоит в том, что основные параметры
данных дают вероятность того, что каждый компонент Y
* будет
obs
получен по шкале с более чем двумя категориями (мультиноминальной) с самостоятельной байесовской атрибуцией, кроме распределения Дирихле. Оба распределения имеют одинаковые средние и корреляции, но дисперсии первого в (1 + 1/r) раза больше
дисперсии самостоятельной байесовской атрибуции [88].
;
140
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
