Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Методы несплошного статистического наблюдения. Учебное пособие

.pdf
Скачиваний:
0
Добавлен:
07.09.2026
Размер:
2 Мб
Скачать
☆
следует соблюдать следующее правило: точность результатов вычислений не должна быть больше точности исходных данных. В противном случае, следует точность результативного показателя устанавливать по исходному показателю с наименьшей точностью.
Также можно выделить достижимую и необходимую точность.
Достижимая точность – это максимальная точность, которая может быть достигнута по объективным условиям наблюдения, контроля и обработки. Необходимая точность – это точность, определяемая требованиями тех задач, для решения которых применяется изучаемый показатель.
Расхождения между установленными статистическим наблюдением и
действительными значениями изучаемых величин называются ошибками
наблюдения.
Существуют различные категории ошибок, которые можно
классифицировать по их источникам:
а) методические ошибки происходят из-за применения несовершенных
подходов, использования неверных теоретических предпосылок, лежащих в основе исследования.
б) ошибки регистрации возникают при сборе информации об
отдельных элементах совокупности из-за ошибочного выявления фактов во время наблюдения или их некорректной фиксации. Эти ошибки можно подразделить на:
– непреднамеренные (объективные), которые происходят из-за
неточного восприятия наблюдаемых данных, неисправности измерительных устройств или ошибок в записи информации;
– преднамеренные (субъективные), возникающие вследствие
умышленного искажения данных (замалчивание, добавление ложных фактов, фальсификация отчетов, при которых сознательно предоставляются неверные сведения).
в) ошибки репрезентативности (представительности) возникают
исключительно при несплошном наблюдении, когда выборка для изучения
21
не полностью отражает характеристики всей исследуемой совокупности.
Наличие и размер ошибок наблюдения зависят от разработки
программы наблюдения и организационного плана наблюдения, а именно от того насколько четко сформулированы вопросы формуляра, разработана инструкция, насколько большое внимание уделено обучению работников.
Применяются следующие виды контроля достоверности данных:
1) синтаксический, при котором проверяется документ на правильность
структуры, наличие в нем обязательных реквизитов, полноту заполнения;
2) логический, при котором проверяется правильность записи кодов, их
соответствия наименованиям и значениям показателей, взаимосвязи между показателями, сопоставляются ответы на разные вопросы и выявляются несовместимые сочетания;
3) арифметический, при котором сравниваются полученные итоги с
предварительно посчитанными контрольными суммами по строкам, графам.
Контроль достоверности результатов осуществляется на всех этапах
проведения статистического наблюдения.
Ошибки репрезентативности возможны только при несплошном
наблюдении и представляют собой расхождение между величиной полученных по выборке показателей и величиной этих показателей, которые были получены при проведении с одинаковой степенью точности сплошном наблюдении. Они могут быть:
а) систематическими – в связи с особенностями принятой системы
отбора и обработки данных наблюдения или в связи с нарушением установленных правил отбора.
Систематические ошибки репрезентативности возникают из-за
неправильного, тенденциозного отбора единиц, при котором нарушается основной принцип научно организованной выборки – принцип случайности;
б) случайными – при недостаточно равномерном представлении в
выборочной совокупности различных категорий единиц генеральной совокупности, в силу чего распределение отобранной совокупности единиц
22
не вполне точно воспроизводит распределение единиц генеральной
.)(Е,0)(Екактак
,B)(
)()(Е)(2)(Е)()(Е)(Е)(СКО
22
22
2
2
совокупности.
Случайная ошибка возникает в силу того, что выборочное
статистическое наблюдение является несплошным наблюдением, и выборка недостаточно точно воспроизводит (репрезентирует) генеральную совокупность.
Ошибки репрезентативности возникают лишь в случае проведения
несплошного наблюдения и представляют собой расхождение между результатами, полученными по выборки, и реальными результатами, которые могли бы быть получены при сплошном наблюдении с тем же уровнем точности. Такие ошибки могут быть:
а) систематическими – обусловлены особенностями выбора и
обработки данных или нарушением правил выбора.
Данный вид ошибок возникает из-за неправильного выбора единиц, что
нарушает принцип случайности в выборке;
б) случайными – из-за неравномерного представления различных
категорий единиц в выборке, что приводит к неточному отражению распределения в генеральной совокупности.
Возникновение случайной ошибки обусловлено неполнотой выборки,
которая не совсем точно отражает генеральную совокупность.
Для измерения ошибки выборки, а также сравнения двух оценок, т.е.
выявления более эффективной оценки, используют средний квадрат ошибки оценки (СКО), который измеряет ошибку относительно оцениваемого параметра совокупности:
(1.1)
где Е – символ, заменяющий выражение «математическое
ожидание величины»;
 – оценка некоторой характеристики совокупности ,
23
получаемая согласно некоторой схеме отбора и примененной формуле
ˆ
B
)(
2
Nn
yN
оценивания;
 – математическое ожидание;
– среднее значение, взятое по всем возможным выборкам;
– смещение оценки;
– дисперсия оценки» [25,19].
Таким образом, СКО является критерием достоверности оценки,
который характеризует величину отклонений от истинного значения
характеристики совокупности  .
Так как на практике трудно проследить, чтобы оценки не давали
никаких смещений, для характеристики оценки используется понятие «точности», относящееся к величине отклонений от усредненного значения
.
Степень точности оценки характеризуется ее дисперсией, стандартной
ошибкой, коэффициентом вариации (относительной стандартной ошибкой) и доверительным интервалом.
Точность оценки, полученной по выборке, зависит от двух факторов:
от способа, с помощью которого вычисляется оценка по данным выборки, и от способа формирования самой выборки.
«В выборочных обследованиях способ оценивания называется
состоятельным, если оценка становится в точности равной оцениваемому параметру для совокупности при
, т.е. когда выборку составляет вся
совокупность. При простом случайном отборе выборочное среднее y и
произведение
представляют собой состоятельные оценки
соответственно среднего и суммарного значений для совокупности [19].
Способ оценивания называется несмещенным, если среднее значение
оценки, взятое по всем возможным выборкам данного объема n, в точности равно истинному значению для совокупности, и это утверждение
24
справедливо для любой конечной совокупности значений
i
y
и для любого n.
В теории и практике выборочных обследований часто приходится
рассматривать смещенные оценки, что обусловлено следующими причинами:
1) в некоторых случаях смещенные оценки дают более достоверные
результаты, чем несмещенные;
2) даже в случае использования теоретически несмещенных оценок
ошибки наблюдения и неполучение ответов от респондентов могут привести к смещениям в распространенных результатах.
При проведении выборочного наблюдения крайне важно учитывать
возможные и фактически допущенные ошибки выборки. Размер ошибки является ключевым показателем надежности результатов выборки и необходим для корректного определения параметров генеральной совокупности. Планирование будущих выборочных наблюдений основывается на анализе возможных ошибок и их влиянии на результаты исследования.
Величина случайной ошибки репрезентативности зависит от
нескольких факторов:
1) метода формирования выборки (выбора единицы отбора,
равномерности представления групп в выборке);
2) объема выборки;
3) изменчивости (колеблемости) изучаемого признака в генеральной
совокупности.
При расчете величины ошибки репрезентативности предполагается, что
ошибка регистрации равна нулю. Оценка ошибки проводится с использованием формул для ошибки выборочной доли и ошибки выборочной средней. Систематическая ошибка выборки возникает при нарушении правил отбора единиц из генеральной совокупности, особенно в случае предвзятого отбора. Такая ошибка может привести к недостоверности результатов исследования.
«Ошибка репрезентативности – это разность между величиной
25
параметра в генеральной совокупности и его величиной, вычисленной по
ХХ
х
~
N
X
Х
N
i
i
1
n
X
Х
n
i
i
1
~
x
t
результатам выборочного наблюдения. Для среднего значения ошибка определяется по формуле:
, (1.2)
где
Величина
чайной.
1.5 Предельные теоремы закона больших чисел
- генеральная средняя;
выборочная средняя.»
называется предельной ошибкой выборки и является слу-
Предельные теоремы закона больших чисел отражают закономерности
случайных ошибок. Наиболее популярно эти закономерности раскрыты в теореме П.Л.Чебышева, которую можно сформулировать следующим образом: при достаточно большом числе независимых наблюдений можно с вероятностью, близкой к единице (т.е. почти с достоверностью) утверждать, что отклонение выборочной средней от генеральной будет сколь угодно малым. П.Л.Чебышев доказал, что величина ошибки не должна превышать
. В свою очередь величина , выражающая среднее квадратическое
отклонение выборочной средней от генеральной средней, зависит от колеблемости признака в генеральной совокупности  и числа отобранных единиц n. Эта зависимость выражается формулой [8]:
26
n
2
n
1
2 ~
2
n
n
xx
, (1.3)
где
- генеральная дисперсия,
п - объем выборочной совокупности.»
Величину
— называют средней ошибкой выборки.
«Рассмотрим, как влияет на величину средней ошибки число
отбираемых единиц n. Логически нетрудно убедиться, что при отборе большого числа единиц расхождения между средними будут меньше, то есть существует обратная связь между средней ошибкой выборки и числом отобранных единиц. При этом здесь образуется не только просто обратная математическая зависимость, а такая зависимость, которая показывает, что квадрат расхождения между средними, обратно пропорционален числу отобранных единиц.»
На величину ошибки выборки также влияет колеблемость признака в
генеральной совокупности. При этом, с увеличением колеблемости признака увеличивается среднее квадратическое отклонения, а значит, и ошибка.
Среднее квадратичное отклонение будет равно нулю, а, следовательно,
ошибка выборки исчезнет в том случае, если все единицы будут иметь одинаковую величину признака. Тогда отпадает необходимость применять выборку. Следует учитывать тот факт, что величина колеблемости признака в генеральной совокупности бывает часто не известна, так как неизвестен ее объем. В этом случае можно рассчитывать лишь колеблемость признака в выборочной совокупности [25].
Соотношение между дисперсиями генеральной и выборочной сово-
купности выражается формулой [24]:
. (1.4)
27
1n
n
)(
2
1
~
2
2
tdtexxp
t
t
t
x
n
x
2
14,3
хх~
Отношение
при достаточно больших п стремится к 1, поэтому
можно приближенно считать, что выборочная дисперсия равна генеральной.
«Следовательно, средняя ошибка выборки показывает, какие возможны
отклонения характеристик выборочной совокупности от соответствующих характеристик генеральной совокупности. Однако о величине этой ошибки можно судить с определенной вероятностью. На величину вероятности ука­зывает множитель t.»
В теореме А.М. Ляпунова доказано, что распределение выборочных
средних (а, следовательно, и их отклонений от генеральной средней) при достаточно большом числе независимых наблюдений приближенно нормально при условии, что генеральная совокупность обладает конечной средней и ограниченной дисперсией.
«Математически теорема Ляпунова имеет вид:
, (1.5)
где
− предельная ошибка выборки, которая дает возможность
выяснить, в каких пределах находится величина генеральной средней;
«Значения этого интеграла для различных значений коэффициента вы-
» [19].
числены и приводятся в специальных математических таблицах:
при t = 1 Ф(t) = 0,683; при t = 1,5 Ф(t) = 0,866; при t =2 Ф(t) = 0,954; при t = 2,5 Ф (t) = 0,988; при t = 3 Ф(t) =0,997; при t = 3,5 Ф(t) = 0,999.»
«Так как t указывает на вероятность расхождения
, т.е. на ве-
роятность того, на какую величину генеральная средняя будет отличаться от
28
выборочной средней, то это может быть прочитано так: с вероятностью 0,683
х
~
x
хх
ххх
~~
1
tpwp
можно утверждать, что разность между выборочной и генеральной средними не превышает одной величины средней ошибки выборки. Другими словами, в 68,3 % случаев ошибка репрезентативности не выйдет за пределы. С вероятностью 0,954 можно утверждать, что ошибка репрезентативности не превышает 2
(т.е. в 95 % случаев). С вероятностью 0,997, т.е. довольно
близкой к единице, можно ожидать, что разность между выборочной и генеральной средней не превзойдет трехкратной средней ошибки выборки и т.д.» [8]
Логическая связь здесь выглядит довольно ясно: чем больше пределы,
в которых допускается возможная ошибка, тем с большей вероятностью су­дят о ее величине.
«Для различных способов отбора предельная ошибка рассчитывается
при проведении выборки по-разному. Зная выборочную среднюю величину признака
предельную ошибку выборки
, можно определить границы
(пределы), в которых заключена генеральная средняя:
.»
Частным случаем теоремы Чебышева - Ляпунова является теорема
Бернулли, хотя была доказана раньше последней. В ней рассматривается ошибка выборки для альтернативного признака, т.е. признака, у которого возможны только два исхода: наличие признака (1) и отсутствие его (0).
В данной теореме утверждается, что при достаточно большом объеме
выборки вероятность расхождения между долей признака в выборочной со­вокупности и долей признака в генеральной совокупности р будет стремиться к единице.
«В математических символах выражение теоремы Бернулли будет иметь
вид:
, т.е. с вероятностью, сколь угодно близкой к единице,
можно утверждать, что при достаточно большом объеме выборки частость
29
признака (выборочная доля) сколько угодно мало будет отличаться от доли
n
n
pq
pw
n
ww )1(
tw
признака (в генеральной совокупности) [17].»
Так как вероятность расхождения между частостью и долей
принадлежит закону нормального распределения, ее можно найти по функции F(t) в зависимости от задаваемой величины t.
«Из теоремы Бернулли следует, что величина расхождения между долей
признака в выборочной совокупности (частостью) и долей этого признака в генеральной совокупности зависит, так же как и в расхождениях средних, от средней ошибки выборки.»
«Поскольку
, а среднее квадратическое отклонение в генеральной
совокупности для альтернативного признака равно р∙q, где q=1-p, то средняя ошибка выборки для альтернативного признака должна быть найдена по формуле:
. « (2.6)
В виду неизвестности доли признака в выборочной совокупности, ее
следует заменить на долю того же признака в генеральной совокупности, т.е. принять
, а дисперсию альтернативного признака принять за w(1-w). В
этом случае средняя ошибка выборки определяется по формуле:
. (2.7)
«
Предельная величина разности между частостью и долей называется
предельной ошибкой выборки. О величине предельной ошибки можно судить с некоторой вероятностью, которая зависит от множителя t, поскольку
.» [8]
30
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]