Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Проблемы оптимизации выборочных данных с неполнотой в диапазоне. Монография

.pdf
Скачиваний:
0
Добавлен:
07.09.2026
Размер:
1 Мб
Скачать
V. Методы атрибуции значений отсутствующих данных (Imputation)
исследовательской цели. Поэтому необходимо, чтобы заложенная в информационном массиве модель была адекватной. К сожале­нию, для некоторых разновидностей метода достижение этой цели зачастую невозможно.
В последние годы было создано множество техник атрибу­ции1 и соответствующих программных продуктов. Различные модификации могут давать хорошие результаты при различных обстоятельствах. Целесообразно использовать «сенситивный подход», когда для определенного выборочного исследования подбирается метод атрибуции.
2. Модификации метода атрибуции значений
Существует множество различных модификаций метода атрибуции значений отсутствующих данных (Imputation). Они классифицируются по различным критериям. Рассмотрим неко­торые.
1. По виду признака, значения которого приписываются, мо-
дификации могут быть:
количественные; – качественные.
2. В зависимости от того, как недостающие значения призна-
ка приписываются, они представлены как включающие позиции:
–донор (определенным образом выбирается подходящая еди-
ница, которая является донором; недостающие значения за-
меняются характеристиками донора);
математическая или логическая процедура (например, когда
используется мода при категориальных признаках) – обнару-
живается характеристика, которая приписывается отсутству-
ющему значению.
1
В современной специальной литературе описано более 40 модификаций мето­да атрибуции значений недостающих данных.
131
Глава вторая. Методы поиска решений при неполном диапазоне данных выборки
3. По количеству признаков, по которым происходит припи- сывание, оно бывает одномерным или многомерным. Например, усреднение результатов нескольких циклов атрибуции значений недостающих данных более чем одного признака характеризует­ся так называемой многомерной атрибуцией (а также существуют различные смешанные методы).
4. Согласно классификации1 Мин-сю и Сальвуччи [95], атри­буция может быть представлена и другими основными группами: стохастической (случайной) и детерминистической2 (по выбору) атрибуцией.
По классификации этих авторов различают пять основных
групп методов атрибуции, а именно:
1) Простая детерминированная атрибуция.
2) Простая стохастическая атрибуция.
3) Детерминистическая атрибуция при использовании моде­лируемой базы.
4) Статистическая атрибуция при использовании моделируе­мой базы.
5) Методы, связанные с байесовскими законами.
Характерным для детерминистического подхода является определение одного и только одного возможного значения, ко­торое приписывается каждой недостающей единице (или отсут­ствующему значению по данной переменной). Как только массив данных обрабатывается один раз с помощью атрибуции, резуль­тат уникален и неповторим и создает имитируемую базу данных. С другой стороны, стохастический подход случайным образом вытягивает значения, которые можно отнести либо к наблюдае­мым данным, либо к их предполагаемому, вероятностному рас-
1
Далее мы будем использовать эту классификацию для представления сущно­сти, а также преимуществ и недостатков отдельных разновидностей метода.
2
В англоязычной методической литературе прямо говорится, что термины «слу­чайно» и «стохастично» являются синонимами (random = stochastic).
132
V. Методы атрибуции значений отсутствующих данных (Imputation)
пределению. При этом такой подход (метод) искусственно умень­шает вариацию и приводит, но только фиктивно, к уменьшению случайной ошибки.
Альтернативой этому являются стохастические методы атри­буции, которые в целом обеспечивают бόльшую изменчивость (вариабельность) в данных, чем детерминированные.
Основной гипотезой в атрибуции значений недостающих данных является предположение, что механизм «неответившие» можно игнорировать, но что недостающая информация, по всей вероятности, зависит по крайней мере от любой из наблюдаемых переменных. Ранее мы указывали, что такой тип данных называ­ется «потерянные случайным образом – missing at random» или «полностью потерянные случайным образом – missing completely at random (MCAR)».
Вторая, базовая для метода, гипотеза заключается в том, что
неответившие лица имеют приблизительно одинаковое распре­деление с ответившими (Бартоломе [37], Кокрен [13], Самарана-
як [118]). Учитывая возможности и преимущества, которые пред­лагают методы атрибуции, а также их непопулярность в практике эмпирических исследований, мы остановимся более подробно на основных из них, а именно: на простой детерминированной атри­буции; простой стохастической атрибуции; детерминистических методах на моделируемой базе; стохастических методах на моде­лируемой базе; методах, связанных с байесовской парадигмой.
2.1. Простая детерминированная атрибуция значений
В литературе встречается несколько основных модификаций.
2.1.1. Дедуктивная атрибуция значений
С помощью этого метода оцениваются недостающие значе­ния в доступной информации с использованием данных о пере­менных, полученных из предыдущих выборочных исследований
133
Глава вторая. Методы поиска решений при неполном диапазоне данных выборки
или от других переменных в конкретном исследовании, связан­ных с теми, для которых будут приписываться значения. Приме­нение метода происходит на основе некоторой детерминирующей связи между недостающим значением и значениями и данными из других источников.
В так называемой «cold deck»1 атрибуции используется ин­формация о той же переменной из предыдущих исследований. Вцелом с помощью дедуктивного подхода невозможно найти до­статочно информации, чтобы прописать все недостающие значе­ния. Поэтому метод может быть использован для компенсации только части недостающих данных. Дедуктивная атрибуция значе­ний может использоваться перед любым другим методом импута­ции, когда есть условия, потому что она обеспечивает более точ­ные или удовлетворительно точные значения для отсутствующих случаев. Однако следует отметить, что действие и результаты де­дуктивной атрибуции полностью зависят от имеющихся данных.
2.1.2. Атрибуция значений по общей средней2
Это самый простой, но и наименее привлекательный метод восстановления значений. Здесь используется общая выбороч­ная средняя, которой заменяются все недостающие значения. По­нятно, что таким образом метод может обеспечить неизменные оценки средней или суммы генеральной совокупности только при условии, что недостающие значения полностью потеряны случайным образом (MCAR), т. е. что распределение на две части выборки – на наблюдаемых и ненаблюдаемых – идентично струк­туре. Атрибуция средней ячейки сначала использует некоторые
1
Из-за невозможности найти адекватный перевод в тексте используется ориги­нальное название на английском языке.
2
Также называется «атрибуция регулируемой средней арифметической (Adjusted Mean Imputation)» или метод замены (Мин-сю и Сальвуччи). Разновидность ме­тода встречается под названием «импутация на моделируемой базе».
134
V. Методы атрибуции значений отсутствующих данных (Imputation)
вспомогательные, дополнительные переменные для формирова­ния импутационных ячеек, а затем недостающие значения в ка­ждой ячейке заменяются выборочной средней.
Метод может гарантировать невозмещенные оценки средне­го или суммарного значения в генеральной совокупности, если недостающие (потерянные) значения зависят исключительно от дополнительных переменных, которые используются для созда­ния импутационных ячеек. Распределение данных, по существу, будет искажено, потому что концентрация всех приписываемых значений вокруг среднего в ячейках неизбежно создает помехи в распределении. Поэтому оценки будут обременены системной ошибкой, дисперсии будут существенно занижены.
Мы проиллюстрируем трудности в применении этой атрибу­ции значений с оговоркой, что на практике нам трудно встретить такую упрощенную модель (табл. 33).
Таблица 33
Данные упрощенной модели
№ еди-
ницы
Пол Возраст Наличие
водительского
удостоверения 1 ж 14 не известно 4000 4000 2 ж 26 да 12 100 12 100 3 м 30 нет 25 400 25 300 4 ж 41 нет 46 900 40 000 5 м 15 нет 3500 3500 6 ж 57 да 36 500 36 500 7 м 13 нет 4000 не известно 8 м 12 нет 5500 4000 9 ж 28 да 4000 3500
10 м 31 да 28 600 28 600 11 ж 45 да 69 000 69 000 12 м 38 да 25 000 25 000
Индивидуальный
среднемесячный
доход (руб.)
Индивидуальный
среднемесячный
расход (руб.)
135
Глава вторая. Методы поиска решений при неполном диапазоне данных выборки
Атрибуции подлежат один категориальный и один количе­ственный признак – «наличие водительского удостоверения» и «среднемесячные расходы» (см. табл. 33). «Среднемесячные рас­ходы» рассчитываются по формуле
n
Y
r
1
Y
r
r
Y
(44)
,
tr
исключая единицу с недостающим значением yr в 22 864 рубля. Если припишем это значение на место недостающего значения, получим неадекватный результат, потому что единица № 7, с воз­растом 13 лет, получит среднемесячный доход в 4000 рублей.
Модой признака «наличие водительского удостоверения» яв­ляется «да». Если она отнесена к единице № 1, то для всей сово­купности потребуется новая редакция (так как в 14 лет человек не может иметь водительские права). Это эксплицирует проблему использования аналогичного метода атрибуции.
При классической средней атрибуции (Buck [44], Little [89]) исследуемая совокупность делится на страты (группы). Средняя арифметическая величина соответствующих страт фиксируется в данных интервальной шкалы (или моды в данных более слабых шкал) после исключения единицы с отсутствующим значением признака. Полученные значения приписываются соответственно в тех же стратах.
Общим для методов атрибуции значений, построенных на основе математической или логической процедуры (с использо­ванием таких свойств показателей, как среднее, медиана, мода, коэффициенты регрессии и т. д.), является то, что они также из­вестны под названием «импутация (замещение) в моделируе­мую базу».
136
V. Методы атрибуции значений отсутствующих данных (Imputation)
2.1.3. Детерминированная «hot deck» атрибуция значений 1
Модификация атрибуции «hot deck» является одним из наи­более часто используемых методов атрибуции значений на прак­тике. Он прост и интуитивно внушает доверие исследователям, которые не обладают серьезной статистической подготовкой. Статистическая модель не применяется. Основной недостаток заключается в том, что метод не может восстановить типичные значения для объекта с определенными характеристиками, если в наблюдении не участвуют такие же респонденты. «Hot deck» атрибуция также имеет несколько разновидностей.
«Hot deck» атрибуция с обращением к ближайшему «соседу», который выбирается донором. Первым шагом является использо­вание нескольких дополнительных переменных для определения импутационных классов. Внутри каждого импутационного клас­са выделяется некая начальная точка с одним-единственным зна­чением2. Оно может быть средним для класса или любого другого заранее определенного значения.
Затем записи массива данных из различных исследований рассматриваются отдельно. Если в одной из записей есть ответ для переменной, на которую направлена атрибуция, то найденное значение предназначено для замены в этом импутационном клас­се. Если запись содержит недостающее значение, ей приписывает­ся значение, имеющееся в другом массиве, и т. д.
Метод основан на выборе донора через «наименьшее» рас­стояние между единицей недостающего значения и остальными единицами.
1
Процесс импутации – это замещение ошибочных, противоречивых и отсут­ствующих ответов в процессе редактирования данных другими ответами – значениями показателей. Стратегия проведения импутации определяется зара­нее при подготовке методологии проведения статистического наблюдения.
2
Речь идет о стратификации массива данных для создания импутационного класса – группы, или страты.
137
Глава вторая. Методы поиска решений при неполном диапазоне данных выборки
Основным преимуществом метода является экономия в рас­четах, поскольку все приписывания выполняются при одном об­зоре информационного массива. Недостатком метода является опасность частого использования одних и тех же доноров – это может привести к потере точности выборочных оценок.
Многомерное сочетание. В этом методе доноры и акцепторы (получатели) объединяются в соответствии с несколькими допол­нительно определенными переменными. Для каждого недостаю­щего случая в каждом классе выбирается ближайший донор. Если в классе его нет, он объединяется с другими классами до получе­ния донора.
Метод не особенно удобен для применения без компьютер­ной техники. Поэтому был создан алгоритм атрибуции – замены значений единиц. Донор и акцептор объединяются по всем допол­нительным переменным, если присутствуют доноры. В против­ном случае компьютер автоматически находит донора, который соответствует только некоторым переменным. Это, к сожалению, деформирует классы выбора (группы, страты).
Согласование в соответствии с функцией расстояния. В этом методе наиболее близкое значение присваивается каждому отсутствующему случаю с использованием различных функций расстояния с одной переменной. Например, по законам много­мерного евклидова пространства (Multi-dimensional Euclidean Space), расстояния Махаланобиса (Mahalanobis Distance), раз­личия между заданными значениями с помощью регрессионной модели и пр.
Все рассмотренные модификации имеют свои преимущества и ограничения. И, похоже, нет ни одной, которая была бы в при­вилегированном положении.
138
V. Методы атрибуции значений отсутствующих данных (Imputation)
2.2. Простая стохастическая атрибуция значений
2.2.1. Атрибуция значений по общей средней или средней ячейки путем случайного перемешивания
Чтобы преодолеть недооцененное рассеяние, типичное для метода атрибуции средней, мы используем случайное перемеши­вание в распределении со средней ноль и наблюдаемую ковари­ационную матрицу. В случайном перемешивании чаще всего за­ложена гипотеза о нормальном распределении с использованием его свойств.
2.2.2. Стохастичный метод атрибуции значений «hot deck»
Стохастичная «hot deck» атрибуция является одним из самых популярных методов на практике. Применяется он в три этапа:
1) Определение дополнительных переменных, с которыми бу-
дут сочетаться доноры и акцепторы.
2) Случайная загрузка значений атрибуции из данных, по ча­стоте – взвешенная и невзвешенная – внутри каждого отобранно­го класса.
3) Если в отобранном классе отсутствуют наблюдаемые зна­чения, то он объединяется с другими классами, а приписывание производится на этой новой основе.
2.2.3. Общая статистическая атрибуция значений
По своей сути эта модификация относится к загрузке случай­ным образом значений атрибуции из наблюдаемых данных с ис­пользованием различных схем выборки. Наиболее часто исполь­зуемой схемой является получение подвыборок с возвратом или без возврата – возвратный или безвозвратный отбор. Это один из самых простых в применении методов, потому что он не основан на дополнительных переменных, и поэтому риск увеличения си­стематических ошибок от невыполнения минимален.
139
Глава вторая. Методы поиска решений при неполном диапазоне данных выборки
2.2.4. Приблизительная байесовская самостоятельная атрибуция значений
В этом методе сначала извлекаются случайным образом r зна­чения с возвратом из r наблюдаемых значений Y1, ..., Yr для созда­ния Y возвратом из Y
*, а затем случайным образом извлекаются m значения с
obs
*, такие как приписываемые значения для m недо-
obs
стающих значений переменной Y. Атрибутивы извлекаются из под­выборки, а не непосредственно из наблюдаемых данных. Это вы­зывает дополнительное рассеивание, делая метод приблизительно «точным» для многомерных атрибутивов в соответствии с теорией Рубина. Метод был назван «приблизительным байесовским само­стоятельным описанием», потому что он очень близок к байесов­скому самоописанию (Bayesian bootstrap), рассмотренному ниже.
2.2.5. Байесовская самостоятельная атрибуция значений
Этот тип атрибуции значений состоит из двух этапов:
1) Скачать r – 1 однородные случайные числа между 0 и 1, при-
чем их упорядоченные значения представлены в виде a1, ..., a
r–1
также a0 = 0 и ar = 1, где r – количество наблюдаемых значений.
2) Загрузить каждое из m отсутствующих значений из Y1,...,Yr
с вероятностями (a1 – a0), (a2 – a1), (1 – a
). Извлекаются все од-
r-1
нородные случайные числа u, отдельное число m и прописывает- ся Yi, если a
u ≤ ai, (i = 1, 2, ..., r).
i-1
Разница между приблизительным самостоятельным байесов­ским приписыванием и самостоятельным байесовским припи­сыванием (2.2.4 и 2.2.5) состоит в том, что основные параметры данных дают вероятность того, что каждый компонент Y
* будет
obs
получен по шкале с более чем двумя категориями (мультиноми­нальной) с самостоятельной байесовской атрибуцией, кроме рас­пределения Дирихле. Оба распределения имеют одинаковые сред­ние и корреляции, но дисперсии первого в (1 + 1/r) раза больше дисперсии самостоятельной байесовской атрибуции [88].
;
140
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]