Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Проблемы оптимизации выборочных данных с неполнотой в диапазоне. Монография

.pdf
Скачиваний:
0
Добавлен:
07.09.2026
Размер:
1 Мб
Скачать
II. Статистические аспекты пробеловв диапазоне данных
следований и программы обработки, анализа и обобщения дан­ных. Их наличие подразумевает нарушение условий достоверно­сти еще до начала полевых работ.
В практике эмпирических исследований (не только в соци­ологии) было сделано много попыток оценить влияние типов ошибок на достоверность информации (индивидуальной и сово­купной). Наиболее значимые достижения были сделаны в теории репрезентативных исследований для оценки случайных ошибок в информации по совокупности. С обоснованиями закона Гаус­са для ошибок выборки и последующими методологическими и методическими решениями этой проблемы строится теория ошибок как достаточно строго обоснованная и работающая на практике. Таким образом, из всех перечисленных компонентов ошибки случайная ошибка полностью находится под контролем исследователей – поэтому она и наименее опасна. Как мы увидим позже, большой проблемой является системная ошибка (систе­матическая и грубая), которая при этом затрагивает и случайную ошибку. Это относится к последствиям потери данных, предмету исследования в этой работе.
Теория случайных ошибок исходит из нескольких предвари­тельных условий возможных источников ошибок, которые могут повлиять на оценки. Отметим наиболее важные:
1) в выборочных эмпирических социологических исследова­ниях выборка создается совершенно случайно, т. е. заранее из­вестна вероятность включения каждой единицы в выборку;
2) каждая попавшая в выборку единица фактически будет ис­следована, т. е. ее замена не допускается;
3) полученное значение признака исследуемой единицы явля­ется действительным, адекватным отражением этого признака.
При соблюдении указанных условий считается, что един-
ственным источником ошибок в оценках исследуемых свойств являются случайные факторы, которые действовали при форми-
41
Глава первая. Проблемы при неполном диапазоне данных в эмпирических исследованиях...
ровании выборки в связи с тем, что наблюдается лишь часть ис­следуемой совокупности.
На практике эти условия очень трудно соблюдать, особенно последние, вследствие чего допускается появление системных ошибок.
При изучении влияния случайных и системных ошибок они обычно объединяются в так называемую общую ошибку. На этой основе была построена статистико-математическая модель для оценки общей ошибки эмпирического исследования. Основное предположение состоит в том, что у нас есть несколько выборок, с помощью которых мы оцениваем определенное свойство иссле­дуемой совокупности по определенному признаку. Мы вычис­ляем среднее арифметическое, чтобы охарактеризовать средний уровень исследований. Для этого используем следующие обозна­чения1:
Y
оценка по данной выборке C (множественность таких
C
оценок CY
);
Y – действительное значение средней;
r
()EY
– математическое ожидание Y (среднее от выборочных
оценок – средних).
Математическое ожидание формируется путем выражения
[][()][()].
EY Y EY EY EY Y  (5)
222
Cr C C C r
Равенство (5) выражает вариацию выборочных оценок сред­ней вокруг действительного (true) значения средней, содержащей две составляющие: вариацию выборочных оценок вокруг средней из этих оценок и отклонения средней выборочных оценок от дей­ствительного значения средней, т. е. bias.
Компонент в левой части равенства выражает вариацию об­щей ошибки отдельной единицы (OО, Totall Error). Компоненты
1
Далее в формулах (5) и (6) используются оригинальные обозначения автора.
42
II. Статистические аспекты пробеловв диапазоне данных
справа – вариация случайных ошибок (СО, Variable Errors) и раз­мер системной ошибки (НО, Bias) оценки.
Уместно заменить вышеприведенное равенство на обозначе­ния в скобках и освободиться от квадрата в левой части выраже­ния. Тогда получается
OO CO HO . (6)
22
Эта формула показывает, что при проведении эмпирическо­го выборочного исследования к случайной ошибке оценки пока­зателей только части генеральной совокупности, порожденной действием случайных факторов, добавляется системная ошибка, которая «...раздувает выборочную вариацию так, чтобы, если она не будет учтена, была бы недооценена выборочная оценка» [15].
Для соотношения случайных и системных ошибок вводятся понятия точности (precision) и правильности (accuracy) показа- телей в эмпирическом исследовании [80]. Полученные оценки вы­борочного эмпирического исследования будут точными (ргесіѕе), если они связаны с небольшими случайными ошибками. Точность не связана с наличием системной ошибки в оценке. Правильность результатов в эмпирических исследованиях (accuracy) связана с небольшими общими ошибками и также включает эффект систем­ных ошибок. Данные результаты будут правильными, когда они
точны и имеют нулевые или небольшие системные ошибки.
Проведем сопоставление между этими терминами и исполь­зуемыми в нашей литературе понятиями репрезентативности, статистической точности и достоверности информации в эмпири­ческих исследованиях. Репрезентативность зависит от способа от­бора единиц в выборку. Статистическая точность связана с величи­ной допускаемых случайных ошибок и зависит от объема выборки, в связи с чем поглощается понятием precision. Достоверность на уровне индивидуальной информации связана с отклонением меж­ду установленным и объективно существующим значением при-
43
Глава первая. Проблемы при неполном диапазоне данных в эмпирических исследованиях...
знака для отдельной исследуемой единицы. На уровне информа­ции по совокупности «...достоверность может быть использована в более широком и более узком значении. При более широком значе­нии учитываются оба компонента вышеуказанной формулы (6) – случайная и системная ошибка. При такой формулировке это ком­промисс между достоверностью и accuracy»1. Вболее узком смысле достоверность в основном связана с системной ошибкой, потому что в выборочных исследованиях наличие случайных ошибок не­избежно по определению, и она включается в оценки с предвари­тельно или в последующем заданным размером.
Какова связь двух компонентов общей ошибки с достовер­ностью совокупной информации эмпирических исследований и исследованиями проблемы ошибок при неполном диапазоне дан­ных (потере информации)?
Случайная ошибка нарушает достоверность информации по совокупности, если она рассматривается сама по себе как откло­нение выборочной оценки от действительного значения изучае­мого параметра совокупности. Это не характерно при так назы­ваемых точечных оценках выборки2. Характерным для точечных оценок является то, что они не дают никакой информации о воз­можном отклонении оценки от действительного значения изуча­емого совокупного свойства, т. е. они не говорят о величине ком­понентов ошибки, хотя те существуют.
Выход из этой ситуации – так называемые интервальные оценки, полученные при объединении точечной оценки и оценки случайной ошибки, или:
1
При переводе W. Cochran «Sampling technics» на русский язык – У. Кокрен «Ме­тоды выборочного исследования» – термин «accuracy» переведен как «досто­верность».
2
Это расчетные показатели – относительные величины, средние величины, дис­персии, корреляционные коэффициенты и т. д., которые представлены фикси­рованным числом.
44
II. Статистические аспекты пробеловв диапазоне данных
Ӫ – Δ ≤ Ӫ + Δ, (7) где – действительное значение изучаемого совокупного свой-
ства, Ӫ – его точечная оценка по репрезентативной выборке и
– случайная ошибка оценки.
Δ
Интервальной оценкой определяются границы, в которых при определенной вероятности можно утверждать, что находится действительное значение изучаемого совокупного свойства (с по­мощью какого-либо статистического показателя)1, без учета эф­фекта системной ошибки.
Однако проявление системной ошибки не поддается форма­лизации, и не существует общепринятых методов и процедур для прогнозирования ее размеров. Усилия направлены на то, чтобы избежать систематической ошибки, которая является наиболее распространенной и опасной составляющей системной ошибки. При анализе достоверности информации по совокупности име­ется в виду именно систематическая ошибка (термином bias опре­деляется прежде всего среднее систематическое отклонение, неза­висимо от источников его возникновения).
Очевидно, что труднее регистрировать и контролировать вли­яние системных несистематических ошибок на совокупную ин- формацию. Наиболее распространенным предположением отно­сительно них является то, что «в общем случае они компенсируют друг друга» [16]. Другая гипотеза заключается в том, что они малы и по количеству, и по величине – следовательно, не оказывают суще­ственного влияния на достоверность информации по совокупности. Однако гипотеза взаимной компенсации относится только к неси­стематическому компоненту системной ошибки и может ожидаться только в конкретных статистических показателях. Для других (си-
1
Поэтому интервальная оценка гораздо более информативна. При публикации цифровой совокупной информации по эмпирическим социологическим иссле­дованиям было бы правильнее указывать на случайные ошибки, содержащиеся в показателях.
45
Глава первая. Проблемы при неполном диапазоне данных в эмпирических исследованиях...
стематической и грубой) взаимная компенсация невозможна. В ре­зультате происходит искажение оценки характеристик исследуемых объектов. Чтобы прояснить это, приведем гипотетический пример.
Предполагается, что было проведено исследование с участи­ем 10 лиц и были получены значения по признаку, при этом име­лась информация о его фактических значениях из другого инфор­мационного источника (табл. 13).
Таблица 13
Значения по признаку для исследования 10 лиц
№ испытуемого
1 4 2
2 2 2
3 2 3
4 3 3
5 3 4
6 4 4
7 5 5
8 6 5
9 7 6
10 4 6
Установленные значения
признака
Действительные
значения признака
Шесть из десяти респондентов указали неправильные дан­ные – недооценивая или переоценивая фактические значения признака. В данном примере ошибки полностью компенсируются по размеру и количеству.
Компенсация в допущенных (несистематических) ошибках отражается на достоверности. Мы вычисляем среднее значение признака для 10 испытуемых и рассеивание вокруг этого средне­го, что соответствует средней ошибке.
Вычисляем среднее арифметическое, дисперсию и среднеква­дратичное отклонение (табл. 14).
46
II. Статистические аспекты пробеловв диапазоне данных
Расчет статистик для выборки из 10 лиц
Таблица 14
На измеренных значениях
На действительных значениях
Среднее арифме-
тическое
X
4 2,4 1,55
4 2,0 1,41
Дисперсия
2
S
Среднеквадратич-
ное отклонение S
При полной компенсации несистематические ошибки ни­как не отразились на среднем арифметическом. По отношению к этому показателю информация по совокупности достоверна, несмотря на наличие несистематических ошибок. Однако это не относится к двум другим показателям, независимо от полной компенсации ошибки. Наблюдается небольшое увеличение дис­персии и среднеквадратичного отклонения по сравнению с их фактическим значением.
Можно сделать вывод, что при отсутствии компенсации не-
систематических ошибок характер нарушений достоверности информации по совокупности остается таким же, как при си­стематических и грубых ошибках.
2. Источники ошибок
При анализе источников ошибок понятие индивидуального действительного значения одной переменной для каждой едини-
цы генеральной совокупности является хорошей основой в каче­стве начала. Оно был разработано Хансеном, Хорвитцем и Медоу [73] для удовлетворения трех основных критериев:
«1) фактическое значение должно быть определено одно­значно;
2) фактическое значение должно быть определено таким об-
разом, чтобы достичь целей исследования;
47
Глава первая. Проблемы при неполном диапазоне данных в эмпирических исследованиях...
3) насколько это возможно для удовлетворения первых двух критериев, фактическое значение должно быть определено в со­ответствии с операциями, которые должны обязательно соблю­даться (даже если это сложно или дорого)».
В практической ситуации критерии могут противоречить друг другу и требовать выбора или компромисса между ними. Игнорирование критериев в практическом плане может приве­сти к системной ошибке. В противном случае мы можем теоре­тически устранить ее путем определения фактического значе­ния, но исключительно операционным способом. Однако этот подход может вывести нас далеко за пределы целей исследова­ния. В некоторых случаях фактическое значение может быть получено относительно легко, хотя данные «пола» и «возраста» вызывают много ошибок. Для таких признаков, как «доход», «имущественное положение» или «электоральное поведение», фактическое значение может быть точно определено, но его очень сложно измерить. Для других же даже определение факти­ческого значения невозможно – например, ожидания, отноше­ния и мнения.
Основные условия исследования определяют теоретически ожидаемые (средние) результаты выборочных наблюдений, отсю­да и отклонения в результатах исследования. Следовательно, важ­но определить эти основные условия, насколько это возможно, обстоятельно и целостно. Тем не менее их описание всегда может оставаться незавершенным. Кроме того, эти условия только опре­деляют отклонение в исследовании – эффекты случайных ошибок остаются «скрытыми» в результатах выборки.
Исследование включает в себя множество действий, и ка­ждое из них может быть предметом (источником) ошибки.
Суммарно это можно сформулировать так [80]:
,
yY D
ii ir
r
48
(8)
II. Статистические аспекты пробеловв диапазоне данных
где Yi – это наблюдаемое индивидуальное значение для отдельно­го случая из генеральной совокупности, а Dir – отклонение или ошибка измерения вносимые r-м источником. Следовательно, yi– это значение с ошибками измерения для i-го элемента генераль­ной совокупности. К сожалению, такое представление слишком просто и, по сути, непригодно для практического использования. Поэтому необходимо искать другие решения.
Уместно было бы прежде всего отделить постоянные откло­нения от случайных ошибок, или
.
yY B V
ii r ir

(9)
Представим Dir = Br + Vir, где Br – постоянная для всех элементов, а переменная Vir со средней, равной нулю. Это произвольное деле­ние является первой модификацией по переходу к удобной модели. Тем не менее в очень общем виде можно сказать, что это может быть адекватной основой для концепций и измерений во время эмпири­ческой работы. Переменная Vir, специфичная для каждого элемента и каждого источника ошибки, может быть определена, хотя практи­чески это трудновыполнимо. Необходимы дальнейшие усилия, но тогда мы не сможем достичь общепринятой полной целостности, не слишком усложнив ситуацию. Например, формула
yY B e 
ii r r

rr
(10)
может быть достаточно точной с обозначенными независимыми случайными переменными er, каждая со средней, равной нулю, и дисперсией 2,r но этого будет недостаточно, поэтому сделано три предположения, которые, по нашему мнению, часто нереали­стичны.
Во-первых, для некоторых оценок могут существовать кова­риации1.
1
Ковариация – мера силы корреляции между элементами (σ
).
ijr
49
Глава первая. Проблемы при неполном диапазоне данных в эмпирических исследованиях...
Во-вторых, ковариации между оценками (σ ствовать, как и ковариация (σ
) между оценкой и переменной
iyr
) могут суще-
irs
исследования. Нет необходимости вставлять другие возможные ковариации, чтобы доказать сложность проблемы.
В-третьих, постоянная и нормальная дисперсия (
2
), при-
r
нятая для всех элементов, не может быть изменена. Она может быть определена для единичного измерения каждого элемента генеральной совокупности (N). Более реалистичным, как и более гибким, было бы определить «случайную», а не «фиксированную» модель, вычислив дисперсию вне гипотетической бесконечности.
Условия исследования меняются и зависят также от персо­нального, личного суждения исследователя, но всегда лучше при­нять видимые преимущества простой модели.
Модель представляет ошибки для выборочной средней лучше в целом, чем для отдельных элементов, как это показано в форму­ле (8). Этот подход более точно корреспондируется с эмпириче­скими исследованиями и использованием величин ошибок, дает особенно разумную основу для желаемых эффектов, таких как стабильность и нормальное распределение случайных ошибок. Сдругой стороны, модель нуждается в улучшениях для проведе­ния другого статистического анализа. Например, ее необходимо модифицировать при агрегировании и сравнении средних. Для регрессии и анализа при помощи других аналитических измери­тельных инструментов модель должна радикально (в основе) из­мениться.
Модель противопоставляет системные ошибки случайным. Она адаптирует ковариации, причем критерии часто задаются не явно, а по умолчанию.
В качестве обобщения: между случайными и системными ошибками существует несколько общих отличий.
Во-первых, случайные и системные ошибки выборки требу­ют больше внимания и оказывают больший эффект на результа-
50
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]