Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Компьютерная обработка статистических данных. Учебное пособие

.pdf
Скачиваний:
0
Добавлен:
07.09.2026
Размер:
2 Мб
Скачать
☆
выделив его «мышью».
Рис.1.7. Построение гистограммы
Рис.1.8. Построение гистограммы, результат
Числовые характеристики выборки
Средние величины исчисляются для характеристики
уровня цен, заработной платы, численности населения, выбросов загрязняющих веществ и т.п. Средняя величина должна характеризовать качественно однородную совокупность и исчисляться по данным большого числа
11
единиц совокупности, то есть отображать массовые явления.
x
Формула
средней
Наименование средней
Арифметическая
Квадратическая
Простая (по выборке)
i
x x n
2
i
x x n
в Excel
СРЗНАЧ(массив)
КОРЕНЬ((СУММКВ(массив)/n)
Взвешенная (по ВР)
ii
x x n n
2
ii
x x n n
в Excel
Вычисляются с применением функции
СУММПРОИЗВ(массив1;массив2)
Применяются две категории средних: степенные средние и структурные средние.
Степенные средние дают обобщающую характеристику совокупности и являются абстрактными величинами, полученными расчетным путем. Обозначаются средние
обычно через х. В дальнейшем это обозначение мы будем использовать для генеральной средней, а выборочную
среднюю будем обозначать
. Выбор средней
осуществляется в зависимости от задачи и вида исходных данных. Наиболее часто используется средняя арифметическая, которая является точечной оценкой математического ожидания распределения изучаемого признака как случайной величины.
Средние величины могут быть вычислены как по выборке (простая средняя), так и по вариационному ряду (взвешенная средняя) в зависимости от вида исходной информации
Таблица 1.1. Виды средних величин
Для вычисления средней по интервальном ряду нужно
перейти к дискретному ряду, заменив каждый интервал его средним значением.
Степенные средние не отражают всех особенностей
совокупности, они могут быть различными для одинаковых
12
совокупностей или иметь одинаковое значение для
1
11
( ) ( )
Mo Mo
Mo
Mo Mo Mo Mo
nn
Mo x d
n n n n


1
0,5
i Me
Me
Me
nS
Me x d
n


совокупности с различным строением.
Структурные средние используются для более полной
характеристики совокупности:
Мода (Мо)– это варианта с наибольшей частотой; Медиана (Ме)– это варианта, делящая совокупность на
две равные части, для дискретного ВР это то значение варианты, для которого накопленная частота впервые превышает половину объема выборки.
Для нахождения моды и медианы по выборке в Excel
используются соответственно функции МОДА(массив данных) и МЕДИАНА (массив данных).
Для интервального ряда моду вычисляют по формуле:
,
где xMo – нижняя граница модального интервала, nMo – частота модального интервала, n предшествующего модальному, n
– частота интервала,
Mo-1
– частота интервала,
Mo+1
следующего за модальным. Медиана для интервального вариационного ряда вычисляется по формуле:
где xMе – нижняя граница медианного интервала (в котором накопленная частота превышает половину объема выборки),
d – величина интервала, nMе – частота медианного интервала, S
Me-1
медианному. Показатели вариации характеризуют изменчивость
(вариацию) признака.
развитие отдельных единиц совокупности. Чем более разнообразны условия, тем больше ее вариация.
,
– накопленная частота интервала, предшествующего
Вариация обусловлена действием различных факторов на
13
Наиболее простой характеристикой вариации признака
2
2
i
s x x n
2
2
i i i
s x x n n

2
ss
является размах вариации:
где x
R=x
max
– x
max
min
,
– наибольшее, x
– наименьшее значения в
min
выборке.
Недостаток размаха вариации в том, что он не отражает
отклонений всех значений признака.
Наибольшее применение в практике статистических
работ находит дисперсия признака:
(простая);
(взвешенная).
В Excel дисперсия выборки вычисляется при помощи
функции
ДИСПР(массив данных) Корень квадратный из дисперсии – это среднее
квадратическое отклонение или стандартное отклонение
, в Excel его можно вычислить при помощи функции
СТАНДОТКЛОН(массив данных).
Среднее квадратическое отклонение дает обобщенную
характеристику признака совокупности и показывает, во сколько раз в среднем колеблется величина признака совокупности. Среднее квадратическое отклонение является мерой надежности средней величины: чем оно меньше, тем точнее средняя арифметическая, тем совокупность более однородна
Задание 1
Для определения петрографического типа пород из горизонта неогеновых лав отобрано и проанализировано на содержание SiO2 (%) 30 проб (табл. 1.2.)
1.1. Построить ряд распределения по типам лав:
андезитобазальты (<57,2%); андезиты (<62,1%); андезит-дациты (<63,0%); дациты (<68,5%); риолит-дациты (<70,5%); риолиты.
14
1.2. Определить средний состав лав.
№
SiO2 №
SiO2 №
SiO2 №
SiO2 №
SiO2 №
SiO2 1
59,5
6
69,2
11
62,9
16
61,2
21
71,4
26
67,5
2
66,8
7
61,2
12
62,4
17
69,3
22
67,7
27
65,3
3
60,5
8
66,3
13
71,6
18
64,6
23
63,6
28
69,9
4
63,7
9
73,2
14
65,8
19
67,8
24
61,1
29
73,2
5
72,5
10
64,6
15
63,1
20
56,6
25
63,8
30
60,7
1.3. Определить преобладающий состав лав.
1.4. Построить частотное распределение (равноинтервальный
ВР) содержания SiO2 в неогеновых лавах.
1.5. Определить характеристики распределения по выборке и
по ВР.
Таблица 1.2.Содержание оксида кремния в пробах неогеновых лав
2. Оценки характеристик генеральной совокупности. Случайные ошибки.
Выборочный метод – основной метод, используемый в математической статистике – основан на том, что суждение о свойствах изучаемой генеральной совокупности (ГС), или о свойствах распределения изучаемой случайной величины. выносят по некоторой ее части – выборке. Чтобы по выборочным данным можно было судить о свойствах генеральной совокупности, выборка должна быть отобрана случайно. Используется два способа образования выборки:
- повторный отбор, когда каждый элемент, случайно отобранный и обследованный, возвращается в генеральную совокупность и, теоретически, может быть повторно отобран. Например, если в течение некоторого времени на предприятии каждый день опрашивают сотрудника, пришедшего первым.
- бесповторный отбор, когда отобранный элемент не возвращается в общую совокупность. При этом если объем генеральной совокупности велик, любой случайный выбор считают бесповторным.
15
Оценка параметра  генеральной совокупности одним
n
Параметр
(генеральная
характеристика)
Оценка
(выборочная
характеристика)
Функция
в
Excel
Генеральная средняя
X
– для конечной ГС;
математическое ожидание М(Х) – для бесконечной ГС
Выборочная средняя
1
n
ii
i
xn
x
n
СРЗНАЧ
Дисперсия
2
ГС
дисперсия
2
распределения признака Х
Исправленная выборочная дисперсия
2
2
1
()
ˆ
11
n
ii
i
x x n
n
s
nn


ДИСП
Доля р элементов в ГС, обладающих указанным свойством; Вероятность р появления указанного свойства
Доля в выборке
m
n
СЧЁТЕСЛИ/
СЧЁТ
Мода Mo ГС
Mo
выборки
МОДА
Медиана Me ГС
Me
выборки
МЕДИАНА
числом
называется точечной оценкой. Приведем точечные
оценки основных параметров распределения признака в ГС:
Таблица 2.1. Точечные оценки основных характеристик ГС
Между признаками выборочной совокупности и соответствующими признаками генеральной совокупности, как правило, существует некоторое расхождение, которое называется ошибкой статистического наблюдения:
• Ошибки регистрации, или технические ошибки,
связаны с недостаточной квалификацией наблюдателей, неточностью подсчетов, несовершенством приборов и т.п.
• Ошибки репрезентативности – расхождение между
16
выборочной характеристикой и разыскиваемой (истинной)
X
,t

характеристикой генеральной совокупности. Здесь возможны систематические ошибки, связанные с нарушением установленных правил отбора, и случайные ошибки, которые объясняются недостаточно равномерным представлением в выборочной совокупности различных категорий единиц генеральной совокупности.
В результате систематической ошибки выборка может оказаться смещенной, т.к. при отборе каждой единицы допускается ошибка, всегда направленная в одну и ту же сторону (например, возраст при анкетировании часто оказывается округлен в меньшую сторону, а стаж работы – в большую). Эта ошибка получила название ошибки смещения. Ее размер может превышать величину случайной ошибки, определить его, как правило, сложно или невозможно. Особенность ошибки смещения состоит в том, что, являясь постоянной частью ошибки репрезентативности, она увеличивается с увеличением объема выборки.
Случайная ошибка с увеличением объема выборки уменьшается. Величину случайной ошибки можно определить с заранее заданной степенью надежности.
Для генеральной средней предельную ошибку выборки (или точность) можно представить в виде
где  - стандартная или средняя ошибка выборки, t – коэффициент доверия, связанный с доверительной вероятностью – вероятностью того, что случайная ошибка репрезентативности на самом деле не превосходит вычисленную предельную ошибку.
и генеральной доли р
В случае большой выборки (n>100) определение
предельной ошибки для среднего и доли основано на центральной предельной теореме, вследствие которой среднее и доля при большом числе измерений имеют
17
распределения близкие к нормальному. Поэтому
2
2
0
1 2
t
x
x e dt

 
2 t
22
22
0
11
0,5
22
tt
xx
x e dt e dt




Повторный отбор (или n<<N, или
N=)
Бесповторный отбор (или n сравнимо с N)
Для генер. средней
2
ˆ
x
sn
2
ˆ
1
x
s n n N
Для генер. доли
(1 ) n

(1 ) 1n n N
коэффициент доверия t вычисляется по таблицам функции
Лапласа
из условия
. При
работе с таблицами Excel для вычисления коэффициента доверия по заданной доверительной вероятности используют функцию НОРМСТОБР, а для определения доверительной вероятности по коэффициенту доверия – функцию НОРМРАСП. Однако следует иметь в виду, что функция НОРМСТОБР(х) возвращает вероятность принятия нормально распределенной случайной величиной значения меньше х, т.е. величину
. Таким образом,
Р(t)=(НОРМСТРАСП(t)-0,5)*2; обратно, t=НОРМСТОБР(0,5*P(t)+0,5).
Стандартная ошибка большой выборки для генеральной
средней и генеральной доли рассчитывается в зависимости от условий отбора в соответствии с таблицей 2.2:
Таблица 2.2. Расчет стандартных ошибок большой выборки
Следует отметить, что предельную ошибку для среднего
большой выборки можно рассчитать в Excel также при помощи функции ДОВЕРИТ(альфа; станд.откл; размер) Здесь альфа – допустимая вероятность ошибки, так
18
называемый уровень значимости: =1-; станд.откл. –
s
ˆ
X
( ; )xx   
.P X x
( ; )

  
Повторный отбор (или n<<N, или N=)
Бесповторный отбор (или n сравнимо с N)
Для генер. средней
2 2 2
n t s
2 2 2 2 2
()n Nt s t s N
Для генер. доли
22
(1 )nt

2
22
(1 )
(1 )
Nt
n
tN


2
,1
( 1),
n
t s n
 
,1n
t
генеральное среднее квадратическое отклонение, предполагающееся известным, или его оценка
; размер –
текущий объем выборки n.
При помощи формулы предельной ошибки выборки решают следующие задачи:
Определение доверительного интервала с заданной
доверительной вероятностью для генерального среднего
:
. При этом
Определение доверительного интервала с заданной
доверительной вероятностью для генеральной доли р:
Определение необходимого объема выборки n для
определения доверительного интервала с заданной точностью и доверительной вероятностью . Формулы
объема выборки приведены в таблице 2.3:
Таблица 2.3. Расчет необходимого объема выборки
В случае малой выборки (n<30) при отсутствии данных о
нормальности распределения признака предельная ошибка для генеральной средней определяется по формуле:
- табличное значение критерия Стьюдента для
вероятности при числе степеней свободы n-1. В Excel
19
коэффициент доверия для малой выборки рассчитывается
ЦФО
Р.Дагестан
22,3
Ям-Нен.АО
5,4
Белг. обл.
4,1
Р.Ингушетия
58,5
Челяб. обл.
5,1
Брянск. обл.
5,6
Каб.-балк.р.
20,7
Сибирский ФО
Влад. обл.
6,8
Р.Калмыкия
16,7
Р. Алтай
11,6
Ворон. обл.
10,9
Кар.-Черк.р.
19,4
Р. Бурятия
13,4
Иван. обл.
5,5
Р.Сев.Осетия
8,5
Р. Тыва
20,5
Калуж. обл
4,2
Чеч. р.
66,9
Р.Хакас.
9,1
Костр. обл.
5,6
Краснод. край
7,4
Алт. край
8,8
Курск. обл.
5,0
Ставроп. край
8,9
Краснояр. край
9,9
Липецк. обл.
7,3
Арханг. обл.
7,9
Тайм. АО
10,0
Моск. обл.
4,9
Волгогр. обл.
8,6
Эвенк. АО
3,9
Орл. обл.
3,0
Рост.обл.
8,0
Иркутс. обл
8,9
Ряз. обл.
6,0
Приволжский ФО
Усть-Орд. АО
12,6
Смол. обл.
5,2
Р.Башкорт.
6,5
Кемер.обл.
7,3
Тамб. обл.
8,0
Р.Марий Эл
10,2
Новосиб. обл.
7,4
Тверск. обл.
8,7
Р.Мордовия
4,7
Томск. обл.
9,3
Тульск. обл.
4,5
Р.Татарстан
5,6
Чит. обл.
9
при помощи функции СТЬЮДРАСПОБР(вероятность;степени свободы), где за аргумент вероятность принимается величина =1-.
Для 30<n<100 причисление выборки к категории
«большой» или «малой» индивидуально, зависит от постановки задачи и от дисперсии выборки. Четкой границы между большой и малой выборками в общем случае указать невозможно. Выборка, сделанная из совокупности с небольшим разбросом признака, может считаться большой, тогда как выборка такого же объема, произведенная из более разнородной совокупности, окажется малой.
Пример 2.1.
Данные по уровню безработицы в России в 2006 году приведены в табл.2.4:
Табл.2.4. Безработица в регионах России в 2006 г.
20
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]