Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Проблемы оптимизации выборочных данных с неполнотой в диапазоне. Монография
.pdf
II. Статистические аспекты пробеловв диапазоне данных
следований и программы обработки, анализа и обобщения данных. Их наличие подразумевает нарушение условий достоверности еще до начала полевых работ.
В практике эмпирических исследований (не только в социологии) было сделано много попыток оценить влияние типов
ошибок на достоверность информации (индивидуальной и совокупной). Наиболее значимые достижения были сделаны в теории
репрезентативных исследований для оценки случайных ошибок
в информации по совокупности. С обоснованиями закона Гаусса для ошибок выборки и последующими методологическими
и методическими решениями этой проблемы строится теория
ошибок как достаточно строго обоснованная и работающая на
практике. Таким образом, из всех перечисленных компонентов
ошибки случайная ошибка полностью находится под контролем
исследователей – поэтому она и наименее опасна. Как мы увидим
позже, большой проблемой является системная ошибка (систематическая и грубая), которая при этом затрагивает и случайную
ошибку. Это относится к последствиям потери данных, предмету
исследования в этой работе.
Теория случайных ошибок исходит из нескольких предварительных условий возможных источников ошибок, которые могут
повлиять на оценки. Отметим наиболее важные:
1) в выборочных эмпирических социологических исследованиях выборка создается совершенно случайно, т. е. заранее известна вероятность включения каждой единицы в выборку;
2) каждая попавшая в выборку единица фактически будет исследована, т. е. ее замена не допускается;
3) полученное значение признака исследуемой единицы является действительным, адекватным отражением этого признака.
При соблюдении указанных условий считается, что един-
ственным источником ошибок в оценках исследуемых свойств
являются случайные факторы, которые действовали при форми-
41

Глава первая. Проблемы при неполном диапазоне данных в эмпирических исследованиях...
ровании выборки в связи с тем, что наблюдается лишь часть исследуемой совокупности.
На практике эти условия очень трудно соблюдать, особенно
последние, вследствие чего допускается появление системных
ошибок.
При изучении влияния случайных и системных ошибок они
обычно объединяются в так называемую общую ошибку. На этой
основе была построена статистико-математическая модель для
оценки общей ошибки эмпирического исследования. Основное
предположение состоит в том, что у нас есть несколько выборок,
с помощью которых мы оцениваем определенное свойство исследуемой совокупности по определенному признаку. Мы вычисляем среднее арифметическое, чтобы охарактеризовать средний
уровень исследований. Для этого используем следующие обозначения1:
Y
– оценка по данной выборке C (множественность таких
C
оценок CY
);
Y – действительное значение средней;
r
()EY
– математическое ожидание Y (среднее от выборочных
оценок – средних).
Математическое ожидание формируется путем выражения
[][()][()].
EY Y EY EY EY Y (5)
222
Cr C C C r
Равенство (5) выражает вариацию выборочных оценок средней вокруг действительного (true) значения средней, содержащей
две составляющие: вариацию выборочных оценок вокруг средней
из этих оценок и отклонения средней выборочных оценок от действительного значения средней, т. е. bias.
Компонент в левой части равенства выражает вариацию общей ошибки отдельной единицы (OО, Totall Error). Компоненты
1
Далее в формулах (5) и (6) используются оригинальные обозначения автора.
42

II. Статистические аспекты пробеловв диапазоне данных
справа – вариация случайных ошибок (СО, Variable Errors) и размер системной ошибки (НО, Bias) оценки.
Уместно заменить вышеприведенное равенство на обозначения в скобках и освободиться от квадрата в левой части выражения. Тогда получается
OO CO HO . (6)
22
Эта формула показывает, что при проведении эмпирического выборочного исследования к случайной ошибке оценки показателей только части генеральной совокупности, порожденной
действием случайных факторов, добавляется системная ошибка,
которая «...раздувает выборочную вариацию так, чтобы, если она
не будет учтена, была бы недооценена выборочная оценка» [15].
Для соотношения случайных и системных ошибок вводятся
понятия точности (precision) и правильности (accuracy) показа-
телей в эмпирическом исследовании [80]. Полученные оценки выборочного эмпирического исследования будут точными (ргесіѕе),
если они связаны с небольшими случайными ошибками. Точность
не связана с наличием системной ошибки в оценке. Правильность
результатов в эмпирических исследованиях (accuracy) связана с
небольшими общими ошибками и также включает эффект системных ошибок. Данные результаты будут правильными, когда они
точны и имеют нулевые или небольшие системные ошибки.
Проведем сопоставление между этими терминами и используемыми в нашей литературе понятиями репрезентативности,
статистической точности и достоверности информации в эмпирических исследованиях. Репрезентативность зависит от способа отбора единиц в выборку. Статистическая точность связана с величиной допускаемых случайных ошибок и зависит от объема выборки,
в связи с чем поглощается понятием precision. Достоверность на
уровне индивидуальной информации связана с отклонением между установленным и объективно существующим значением при-
43

Глава первая. Проблемы при неполном диапазоне данных в эмпирических исследованиях...
знака для отдельной исследуемой единицы. На уровне информации по совокупности «...достоверность может быть использована в
более широком и более узком значении. При более широком значении учитываются оба компонента вышеуказанной формулы (6) –
случайная и системная ошибка. При такой формулировке это компромисс между достоверностью и accuracy»1. Вболее узком смысле
достоверность в основном связана с системной ошибкой, потому
что в выборочных исследованиях наличие случайных ошибок неизбежно по определению, и она включается в оценки с предварительно или в последующем заданным размером.
Какова связь двух компонентов общей ошибки с достоверностью совокупной информации эмпирических исследований и
исследованиями проблемы ошибок при неполном диапазоне данных (потере информации)?
Случайная ошибка нарушает достоверность информации по
совокупности, если она рассматривается сама по себе как отклонение выборочной оценки от действительного значения изучаемого параметра совокупности. Это не характерно при так называемых точечных оценках выборки2. Характерным для точечных
оценок является то, что они не дают никакой информации о возможном отклонении оценки от действительного значения изучаемого совокупного свойства, т. е. они не говорят о величине компонентов ошибки, хотя те существуют.
Выход из этой ситуации – так называемые интервальные
оценки, полученные при объединении точечной оценки и оценки
случайной ошибки, или:
1
При переводе W. Cochran «Sampling technics» на русский язык – У. Кокрен «Методы выборочного исследования» – термин «accuracy» переведен как «достоверность».
2
Это расчетные показатели – относительные величины, средние величины, дисперсии, корреляционные коэффициенты и т. д., которые представлены фиксированным числом.
44

II. Статистические аспекты пробеловв диапазоне данных
Ӫ – Δ ≤ ≤ Ӫ + Δ, (7)
где – действительное значение изучаемого совокупного свой-
ства, Ӫ – его точечная оценка по репрезентативной выборке и
– случайная ошибка оценки.
Δ
Интервальной оценкой определяются границы, в которых
при определенной вероятности можно утверждать, что находится
действительное значение изучаемого совокупного свойства (с помощью какого-либо статистического показателя)1, без учета эффекта системной ошибки.
Однако проявление системной ошибки не поддается формализации, и не существует общепринятых методов и процедур для
прогнозирования ее размеров. Усилия направлены на то, чтобы
избежать систематической ошибки, которая является наиболее
распространенной и опасной составляющей системной ошибки.
При анализе достоверности информации по совокупности имеется в виду именно систематическая ошибка (термином bias определяется прежде всего среднее систематическое отклонение, независимо от источников его возникновения).
Очевидно, что труднее регистрировать и контролировать влияние системных несистематических ошибок на совокупную ин-
формацию. Наиболее распространенным предположением относительно них является то, что «в общем случае они компенсируют
друг друга» [16]. Другая гипотеза заключается в том, что они малы и
по количеству, и по величине – следовательно, не оказывают существенного влияния на достоверность информации по совокупности.
Однако гипотеза взаимной компенсации относится только к несистематическому компоненту системной ошибки и может ожидаться
только в конкретных статистических показателях. Для других (си-
1
Поэтому интервальная оценка гораздо более информативна. При публикации
цифровой совокупной информации по эмпирическим социологическим исследованиям было бы правильнее указывать на случайные ошибки, содержащиеся
в показателях.
45

Глава первая. Проблемы при неполном диапазоне данных в эмпирических исследованиях...
стематической и грубой) взаимная компенсация невозможна. В результате происходит искажение оценки характеристик исследуемых
объектов. Чтобы прояснить это, приведем гипотетический пример.
Предполагается, что было проведено исследование с участием 10 лиц и были получены значения по признаку, при этом имелась информация о его фактических значениях из другого информационного источника (табл. 13).
Таблица 13
Значения по признаку для исследования 10 лиц
№ испытуемого
1 4 2
2 2 2
3 2 3
4 3 3
5 3 4
6 4 4
7 5 5
8 6 5
9 7 6
10 4 6
Установленные значения
признака
Действительные
значения признака
Шесть из десяти респондентов указали неправильные данные – недооценивая или переоценивая фактические значения
признака. В данном примере ошибки полностью компенсируются
по размеру и количеству.
Компенсация в допущенных (несистематических) ошибках
отражается на достоверности. Мы вычисляем среднее значение
признака для 10 испытуемых и рассеивание вокруг этого среднего, что соответствует средней ошибке.
Вычисляем среднее арифметическое, дисперсию и среднеквадратичное отклонение (табл. 14).
46

II. Статистические аспекты пробеловв диапазоне данных
Расчет статистик для выборки из 10 лиц
Таблица 14
На измеренных
значениях
На действительных
значениях
Среднее арифме-
тическое
X
4 2,4 1,55
4 2,0 1,41
Дисперсия
2
S
Среднеквадратич-
ное отклонение S
При полной компенсации несистематические ошибки никак не отразились на среднем арифметическом. По отношению
к этому показателю информация по совокупности достоверна,
несмотря на наличие несистематических ошибок. Однако это
не относится к двум другим показателям, независимо от полной
компенсации ошибки. Наблюдается небольшое увеличение дисперсии и среднеквадратичного отклонения по сравнению с их
фактическим значением.
Можно сделать вывод, что при отсутствии компенсации не-
систематических ошибок характер нарушений достоверности
информации по совокупности остается таким же, как при систематических и грубых ошибках.
2. Источники ошибок
При анализе источников ошибок понятие индивидуального
действительного значения одной переменной для каждой едини-
цы генеральной совокупности является хорошей основой в качестве начала. Оно был разработано Хансеном, Хорвитцем и Медоу
[73] для удовлетворения трех основных критериев:
«1) фактическое значение должно быть определено однозначно;
2) фактическое значение должно быть определено таким об-
разом, чтобы достичь целей исследования;
47

Глава первая. Проблемы при неполном диапазоне данных в эмпирических исследованиях...
3) насколько это возможно для удовлетворения первых двух
критериев, фактическое значение должно быть определено в соответствии с операциями, которые должны обязательно соблюдаться (даже если это сложно или дорого)».
В практической ситуации критерии могут противоречить
друг другу и требовать выбора или компромисса между ними.
Игнорирование критериев в практическом плане может привести к системной ошибке. В противном случае мы можем теоретически устранить ее путем определения фактического значения, но исключительно операционным способом. Однако этот
подход может вывести нас далеко за пределы целей исследования. В некоторых случаях фактическое значение может быть
получено относительно легко, хотя данные «пола» и «возраста»
вызывают много ошибок. Для таких признаков, как «доход»,
«имущественное положение» или «электоральное поведение»,
фактическое значение может быть точно определено, но его
очень сложно измерить. Для других же даже определение фактического значения невозможно – например, ожидания, отношения и мнения.
Основные условия исследования определяют теоретически
ожидаемые (средние) результаты выборочных наблюдений, отсюда и отклонения в результатах исследования. Следовательно, важно определить эти основные условия, насколько это возможно,
обстоятельно и целостно. Тем не менее их описание всегда может
оставаться незавершенным. Кроме того, эти условия только определяют отклонение в исследовании – эффекты случайных ошибок
остаются «скрытыми» в результатах выборки.
Исследование включает в себя множество действий, и каждое из них может быть предметом (источником) ошибки.
Суммарно это можно сформулировать так [80]:
,
yY D
ii ir
r
48
(8)

II. Статистические аспекты пробеловв диапазоне данных
где Yi – это наблюдаемое индивидуальное значение для отдельного случая из генеральной совокупности, а Dir – отклонение или
ошибка измерения вносимые r-м источником. Следовательно, yi–
это значение с ошибками измерения для i-го элемента генеральной совокупности. К сожалению, такое представление слишком
просто и, по сути, непригодно для практического использования.
Поэтому необходимо искать другие решения.
Уместно было бы прежде всего отделить постоянные отклонения от случайных ошибок, или
.
yY B V
ii r ir
(9)
Представим Dir = Br + Vir, где Br – постоянная для всех элементов,
а переменная Vir со средней, равной нулю. Это произвольное деление является первой модификацией по переходу к удобной модели.
Тем не менее в очень общем виде можно сказать, что это может быть
адекватной основой для концепций и измерений во время эмпирической работы. Переменная Vir, специфичная для каждого элемента
и каждого источника ошибки, может быть определена, хотя практически это трудновыполнимо. Необходимы дальнейшие усилия, но
тогда мы не сможем достичь общепринятой полной целостности, не
слишком усложнив ситуацию. Например, формула
yY B e
ii r r
rr
(10)
может быть достаточно точной с обозначенными независимыми
случайными переменными er, каждая со средней, равной нулю,
и дисперсией 2,r но этого будет недостаточно, поэтому сделано
три предположения, которые, по нашему мнению, часто нереалистичны.
Во-первых, для некоторых оценок могут существовать ковариации1.
1
Ковариация – мера силы корреляции между элементами (σ
).
ijr
49

Глава первая. Проблемы при неполном диапазоне данных в эмпирических исследованиях...
Во-вторых, ковариации между оценками (σ
ствовать, как и ковариация (σ
) между оценкой и переменной
iyr
) могут суще-
irs
исследования. Нет необходимости вставлять другие возможные
ковариации, чтобы доказать сложность проблемы.
В-третьих, постоянная и нормальная дисперсия (
2
), при-
r
нятая для всех элементов, не может быть изменена. Она может
быть определена для единичного измерения каждого элемента
генеральной совокупности (N). Более реалистичным, как и более
гибким, было бы определить «случайную», а не «фиксированную»
модель, вычислив дисперсию вне гипотетической бесконечности.
Условия исследования меняются и зависят также от персонального, личного суждения исследователя, но всегда лучше принять видимые преимущества простой модели.
Модель представляет ошибки для выборочной средней лучше
в целом, чем для отдельных элементов, как это показано в формуле (8). Этот подход более точно корреспондируется с эмпирическими исследованиями и использованием величин ошибок, дает
особенно разумную основу для желаемых эффектов, таких как
стабильность и нормальное распределение случайных ошибок.
Сдругой стороны, модель нуждается в улучшениях для проведения другого статистического анализа. Например, ее необходимо
модифицировать при агрегировании и сравнении средних. Для
регрессии и анализа при помощи других аналитических измерительных инструментов модель должна радикально (в основе) измениться.
Модель противопоставляет системные ошибки случайным.
Она адаптирует ковариации, причем критерии часто задаются не
явно, а по умолчанию.
В качестве обобщения: между случайными и системными
ошибками существует несколько общих отличий.
Во-первых, случайные и системные ошибки выборки требуют больше внимания и оказывают больший эффект на результа-
50
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
