Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Методы несплошного статистического наблюдения. Учебное пособие
.pdf
Формулы расчета необходимого объема выборки для некоторых
способов формирования выборочной совокупности приведены в таблице 4.1.
Таблица 4.1 – Расчет необходимого объема выборки
91

Чтобы обеспечить представительность, выборочные данные по
основным характеристикам должны адекватно отражать генеральную
совокупность. Следовательно, размер выборки определяется повторными
расчетами, исходя из приемлемых уровней погрешностей для различных
измерений, чьи значения в целом для совокупности уже установлены.
Обычно, реализация многофазной выборки весьма затруднительна,
поскольку существует риск нарушить принцип случайности выборки.
Следовательно, для гарантии репрезентативности целесообразнее выделить
дополнительные ресурсы на включение в выборку бóльшего объема
элементов совокупности.
Применение многофазной выборки оправдано, когда соотношение
между вычисленными размерами выборок составляет минимум 1 : 6.
Исчисление адекватного размера выборочной группы базируется на
предварительной оценке колеблемости совокупности. Следовательно, важно
принять во внимание следующие указания:
- абсолютную величину n округлять только верх;
- долю отбора – строго вниз, значит, из предосторожности следует
проектировать объем выборки выше, чем это следует из расчетов.
Учитывая, что использование многоступенчатого метода выборки
приводит к увеличению ошибки из-за выборочных расхождений, эксперты
советуют расширять размер такой выборки минимум на 10 % от изначально
определенного объема.
Выборка должна быть такой, чтобы выборочные показатели по всем
основным характеристикам были репрезентативны. Поэтому численность
выборки рассчитывают многократно исходя из допустимых ошибок разных
показателей, значения которых в генеральной совокупности известны.
Т.к. репрезентируемые признаки могут иметь разную размерность, то
допустимая погрешность для каждого из них задается в виде относительной
величины (
: x
). В этом случае вместо дисперсии в формуле (5.1) берется
квадрат коэффициента вариации.
92

После расчета объема выборки на основе каждой из характеристик,
необходимо взять максимальное значение. В случае наличия резких различий
необходимых объемов выборки для разных вопросов программы проводится
многофазный отбор.
Как правило, многофазный отбор довольно сложно организовать, так
как может быть нарушен принцип случайности отбора. В связи с этим, для
обеспечения репрезентативности выгоднее затратить больше средств на учет
большего числа единиц совокупности.
Определение необходимой численности выборки основывается на
предположительных данных о колеблемости в совокупности. Поэтому
необходимо соблюдать следующие рекомендации:
- абсолютную величину n округлять только верх;
- долю отбора – только вниз, т.е. из предосторожности планировать
несколько больший объем выборки, чем показывают расчеты.
В связи с тем, что многоступенчатость отбора увеличивает ошибку
выборки, объем многоступенчатой выборки рекомендуется увеличивать не
менее чем на 10 % от рассчитанной численности.
4.2 Определение вероятности того, что ошибка выборки не
превысит допустимой погрешности
При сравнении границ допускаемых ошибок с предельными
значениями ошибок выборки, специалисты делают выводы о ее
адекватности. Если предельная ошибка, вычисленная при установленной
вероятности, превышает допустимые погрешности, необходимо вычислить
шанс, что ошибка выборки окажется в пределах приемлемого уровня. Это
достигается путем расчета с использованием формулы максимальной ошибки
выборки. Затем, основываясь на таблице вероятностей, определяют значение,
93

соответствующее выбранному уровню доверия. Далее вычисляется
)(tF
t
t
)(tF
t
2
)(1
1
tF
вероятность того, что наблюдаемое среднее не превысит установленного
порога, что приводит к оценке "вероятности
риска".
Таким же способом рассчитывают вероятность того, что абсолютная
ошибка пропорции не будет больше разрешенной ошибки пропорции.
Определение достоверности статистических выборочных данных дает
возможность делать обоснованные выводы о параметрах всей основной
массы.
4.3 Информационная несопоставимость статистических данных
при проведении выборочного обследования
В анализе статистической информации одним из основных вопросов
является устранение несопоставимости данных. Эта проблема часто
возникает из-за ошибок в разработке программы выборочного исследования,
в которой могут отсутствовать некоторые категории анализируемых
параметров. Это приводит к ситуациям, когда изучаемые объекты
описываются неполным или разнообразным набором характеристик, что
включает в себя и отсутствие данных по некоторым из них. Кроме того,
проведение исследований в разные временные интервалы может
способствовать возникновению хронологической несопоставимости из-за
изменений или появления новых признаков, обусловленных определенными
внешними факторами. Также анализ данных может столкнуться с
территориальной несопоставимостью, когда исследование охватывает разные
регионы, что влияет на однородность характеристик объектов.
В период формирования рыночной экономики в России возможны
94

случаи информационного дисбаланса, возникающего из-за быстрого
появления и исчезновения мелких и частных компаний. Это явление влияет
на структуру и объем выборочных данных при исследованиях.
Дополнительно, учитывая защиту коммерческой тайны при сборе данных от
коммерческих и финансовых учреждений, происходит изменение в структуре
и объеме выборок. Таким образом, информационная несопоставимость
происходит из-за отсутствия данных, различия в характеристиках выборок,
проведенных по одной программе, но с различиями по регионам или
времени, а также из-за наличия объектов, вносящих существенные отличия в
данные.
В процессе выполнения разнообразных статистических исследований
часто сталкиваются с невозможностью получить исчерпывающие сведения
по всем элементам исследуемой совокупности. Так, во время исследований
небольших фирм статистическими органами фиксируются случаи, когда по
некоторым критериям отсутствует информация до 40 %, и при анализе
данных о домохозяйствах этот показатель варьируется между 7 % и 30 %.
Тематика неполных данных является общей и для локальных, и для
международных статистических проектов, рассматривается как один из
ключевых вызовов, и находится в центре внимания известных мировых
статистиков и исследователей [19].
Существует много факторов, вызывающих возникновение пропусков
данных. К примеру, ответы на вопросы о заработке часто отсутствуют,
поскольку респонденты склонны уклоняться от их раскрытия либо вовсе
игнорируют такие вопросы; в исследованиях, требующих последовательных
ответов от участников, выбранные объекты зачастую прекращают участие и
не предоставляют информацию после начальных этапов. Каждый случай
несет уникальные аспекты и обстоятельства, способствующие отсутствию
данных (например, в исследованиях малых компаний причинами недостачи
информации могут стать временное приостановление деятельности,
изменения в структуре владения или объединение с другой компанией,
95

изменения адресов и контактных данных, что делает компанию
недостижимой для связи и т.п.).
Анализ неполных данных малоэффективен, приводит к различию
статистических выводов, сделанных при наличии неответов (пропусков
информации) и при их отсутствии, за исключением очень редко
встречающихся ситуаций, когда структура неполной выборки вполне
соответствует структуре генеральной совокупности. Таким образом, одной из
главных задач при проведении любого статистического наблюдения является
предупреждение получения неответов.
Выделяют полный и частичный неответ.
Полное отсутствие ответов происходит, когда участник исследования
не дает реакций на любой из вопросов опросника. В случае частичного
отсутствия ответов, испытуемый предоставляет информацию лишь по
отдельным элементам заданного списка вопросов.
В этой связи различают следующие методы восстановления данных:
– метод перевзвешивания (при полных неответах);
– методы замещения недостающих величин:
а) логический метод (при частичных неответах);
б) заполнение средними значениями (при полных и частичных
неответах);
в) метод случайного подбора донора для замещения (при полных
неответах); г) последовательное замещение (при частичных неответах);
д) прогнозирование с помощью регрессионной модели (для
частичных неответов);
е) замена единиц наблюдения [8].
Метод перевзвешивания данных используется, когда невозможно
собрать данные по всем анализируемым характеристикам.
Принцип описываемой методики основан на корректировке величины
вклада опрошенных участников при проецировании результатов выборки на
всю генеральную совокупность.
96

Суть данного метода заключается в увеличении веса ответивших
j
N
j
n
jj
nN /
1)(
j
p
)(/
jjj
mnN
j
m
100
j
N
j
n
jj
nN /
410
100
jj
j
mn
N
единиц, который учитывается при распространении данных выборочного
наблюдения на генеральную совокупность. Так если при проведении
типической выборки из j-й группы с
совокупности извлекают
объектов с вероятностью pj, то каждый
извлеченный объект представляет
присваивается вес
при распространении результатов на генеральную
единицами в генеральной
объектов совокупности и ему
совокупность. В случае наличия пропусков данных этот вес увеличивается, и
каждая ответившая единица представляет в j-й типической группе
единиц генеральной совокупности (где
количество
полученных неответов в j-й группе).
«Например, пусть j-я группа содержит в генеральной совокупности
единиц. В результате 10 %-ного отбора из нее извлекают
= 10
единиц. Тогда каждая отобранная единица должна представлять 10 единиц
(
= 100 / 10). Если не ответили четыре единицы, то при распространении
выборочных данных вес ответивших единиц увеличивается, и они
представляют уже приблизительно 17 единиц (
) j-той
типической группы генеральной совокупности.»
Методы замещения представляют собой заполнение пропущенных
данных для каждого экземпляра с недостающей информацией хотя бы по
одному показателю. Суть данных методик заключается в подстановке
отсутствующей информации «приемлемыми» значениями.
Метод логического вывода используется для извлечения ответов из
контекста самой анкеты. К примеру, в ситуации, где участнику опроса,
который является четырнадцатилетним, не задан вопрос о наличии высшего
образования, логичным выводом будет предположение об его отсутствии.
Этот подход широко применяется для коррекции данных, включая в себя
анализ и использование логически обоснованных связей между различными
97

параметрами.
Заполнение средними значениями является наиболее элементарным
способом борьбы с отсутствующими данными. При таком подходе дыры в
данных "закрываются" за счет применения среднего арифметического,
рассчитанного из имеющихся значений определенного параметра. Важно
подчеркнуть, что использование групповых средних значений в случае их
доступности вместо общего среднего представляет собой более точную
стратегию заполнения. Это обусловлено тем, что применение групповых
метрик позволяет уменьшить искажение результатов анализа, повышая
репрезентативность выводов по отношению к исследуемой группе или
совокупности.
Преимуществом техники заполнения пропущенных данных средними
значениями является её лёгкость реализации, однако она обладает
определёнными ограничениями. Прежде всего, стандартные методы оценки
дисперсии не могут быть эффективно применены к модифицированным
данным, поскольку исключение пропущенных значений фактически
сокращает объём выборки, что ведёт к недооценке истинного уровня
дисперсии. Кроме того, внедрение средних значений вносит искажения в
эмпирическое распределение данных, что может затруднять анализ
распределения, например, при использовании гистограмм или других
визуальных методов исследования данных.
Метод случайного подбора донора для замещения основывается на
выборке донора для заполнения пропусков в данных, где значения из
случайно выбранного респондента замещают отсутствующую информацию.
Этот процесс может быть осуществлён как из общей массы данных, так и из
определённых групп со схожими характеристиками для более точного
соответствия, что считается более эффективным подходом. Выборка для
заполнения может быть организована как с возможностью повторения, так и
без него.
Прогнозирование с помощью модели регрессии, заключается в
98

заполнении отсутствующих данные значениями, выведенными через
регрессионные уравнения от имеющихся переменных к отсутствующим для
исследуемого объекта. Обычно, эти уравнения рассчитываются на основе
данных объектов без пропусков.
Замена – это техника обработки данных, применяемая для управления
пропусками в данных в процессе сбора информации. Этот метод включает
подмену наблюдения, у которого отсутствуют данные, на наблюдение извне
исследуемой группы. Например, если изучаемый отказывается отвечать на
вопросы опросника, то его можно заменить другим лицом, которое
изначально не входило в рамки выборки. Но такая новообразованная выборка
не может считаться исчерпывающей, поскольку могут существовать
системные различия между откликами участников, заполняющих анкету, и
теми, кто в опросе не участвовал. Этот аспект важно учитывать при
последующем анализе данных.
Когда проблема несовместимости данных возникает из-за разночтений
в характеристиках, используемых в рамках одного исследования, первым
делом необходим анализ основных классов признаков, по которым
проводилось изучение. В случае, когда основные классы признаков между
исследовательскими методиками совпадают, а отличия заключаются лишь в
количестве используемых признаков или в их идентификации внутри каждой
категории, задача устранения информационной несопоставимости
информации решается с применением многомерного статистического
анализа, в частности, метода главных компонент.
4.4 Методы распространения результатов выборочного
обследования на генеральную совокупность
Финальная стадия выборочного наблюдения заключается в
99

экстраполяции полученных данных на всю генеральную совокупность, что
%100
~
%
Х
х
%100
%
p
W
подразумевает оценку этой совокупности по информации, собранной через
выборку. Следует это из предпосылки, что все средние значения по выборке
и показатели относительных величин точно и адекватно отражают
характеристики всей генеральной совокупности. Часто в контексте
статистического анализа социальных и экономических процессов, перед
реализацией этого этапа проводится анализ выполнимости такого обобщения
результатов наблюдения.
Однако, нельзя ограничиваться лишь анализом качества начальных
данных при определении пригодности распространения выбранной
информации. Надежнее использовать оценку относительной ошибки как
критерий [4]:
для средней:
; (4.4)
для доли:
, (4.5)
где X - генеральная средняя,
p- генеральная доля.
Собранные и при необходимости скорректированные выборочные
данные экстраполируются на всю генеральную совокупность. Выделяют два
метода экстраполяции - прямой пересчет и метод коэффициентов.
В методике прямого пересчета основная операция - это умножение
среднего показателя характеристики выборочной совокупности на всю
численность генеральной совокупности. Например, при анализе
потребностей образовательных учреждений в дополнительных местах для
учащихся, изучение начинается с выборки из 2000 семей. Основная задача оценить число необходимых мест в первых классах. Применив метод
100
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
