Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Обработка экспериментальных данных. В 2 частях. Ч.1. Учебное пособие

.pdf
Скачиваний:
2
Добавлен:
07.09.2026
Размер:
2 Мб
Скачать
☆
выборочной совокупности, называется ее частотой (эмпирической
Варианты xi
x1
x2
. . .
xk
Частоты ni
n1
n2
. . .
nk
nk
nnk lg221,31log1
2
Варианты-интервалы
[x0 ; x1]
( x1 ;x2]
. . .
( x
k-1
; xk]
( x
i-1
;xi )
Частоты ni
n1
n2
. . .
nk
частотой). Частоты вариант называются их весами. Отношение wi=ni/n частоты ni к объему n выборки называют относительной частотой варианты хi.
Различают дискретные и непрерывные вариационные ряды. Дискретный вариационный ряд записывают в виде таблицы:
Здесь ni - частота появления значения xi.
Если объем n выборки большой (n>30), то результаты наблюдений сводят в интервальный вариационный ряд, который формируется следующим образом.
Вычисляют размах R варьирования признака Х как разность между наибольшим x
R =x
max-xmin
.
и наименьшим x
max
значениями признака:
min
Размах R варьирования признака Х делится на k равных частей. Число k выбирают, пользуясь одним из следующих правил:
1) 6≤k≤20, 2)
, 3)
. Длина h
каждого частичного интервала определяется по формуле: h=R/k.
Величину h обычно округляют. Например, если результаты xi признака Х - целые числа, то h округляют до целого значения, если xi содержат десятичные знаки, то h округляют до разряда d, содержащего такое же число десятичных знаков, что и значения признака xi. Затем подсчитывается частота ni, с которой значения xi признака Х попадают в i-й интервал.
Значение xi, которое попадает на границу интервала, относят к какому-либо определенному концу, например к левому. За начало x0 первого интервала рекомендуется [6] брать величину x0=x Конец xk последнего интервала находят по формуле xk=x
min
max
-0,5h.
+0,5h.
Сформированный интервальный вариационный ряд записывают в виде таблицы:
Интервальный вариационный ряд изображают в виде гистограммы частот ni или гистограммы относительных частот
wi=ni/(n∙h).
11
Гистограммой называется ступенчатая фигура, для построения
Варианты xi
x1
x2
. . .
xk
Частоты ni
n1
n2
. . .
nk
Варианты xi
х
1
х
2
х
k
Относительные
частоты
wi=ni/n
w1
w2 wk
ki
i
w11
которой по оси абсцисс откладывают отрезки, изображающие частичные интервалы (x
) варьирования признака Х, и на этих
i-1;xi
отрезках, как на основаниях, строят прямоугольники с высотами, равными частотам соответствующих интервалов.
Для расчета статистик (выборочной средней, выборочной дисперсии, асимметрии и эксцесса) переходят от интервального вариационного ряда к дискретному. Для этого в качестве вариант x этого ряда берут середины интервалов (x
]. Дискретный
i-1;xi
вариационный ряд записывается в виде таблицы :
i
В последнем случае
полигона частот (соответственно в виде полигона относительных частот). Для этого на числовую плоскость наносят точки (xi;ni) (точки
(xi;wi)), затем через них проводят ломаную, которую называют
полигоном. Если плотность распределения генеральной совокупности является достаточно гладкой функцией, то полигон относительных частот является лучшим приближением плотности, чем гистограмма.
кумулятивной кривой (кривой сумм - кумуляты). При построении кумуляты дискретного вариационного ряда на оси абсцисс откладывают варианты xi, а по оси ординат - соответствующие им накопленные относительные частоты Wi. Соединяя точки (xi;Wi) отрезками, получаем ломаную, которую называют кумулятой. Для получения накопленных частот и дальнейшего построения точек
(xi;Wi) составляется расчетная таблица:
.
Графически дискретный вариационный ряд изображают в виде
Вариационные ряды графически можно изобразить в виде
12
Варианты xi
x1
x2 … xk
Относительные
частоты
wi= ni / n
w1= n1 / n
w2= n2/ n
…
wk= nk / n
Накопленные
относительные
частоты
Wi= W
i-1
+ wi
W1= w
1
(W0=0)
W2= W1 +
w2
…
Wk=W
k-1
+
wk
,
1
)(
*
xx
in
i
n
n
xF
xxi
0)(*xF
n
1
xx
1)(*xF
n
n
xx
],(
1 n
xx
)(*xF
n
)(*xF
n
)(xF
X
1))()((
lim
*
xFxFP
Xn
n
)(*xF
n
)(xF
X
При построении кумуляты интервального вариационного ряда левому концу первого интервала сопоставляется частота, равная нулю, а правому — частота этого интервала. Правому концу второго интервала соответствует накопленная частота первых двух интервалов, т.е. сумма частот этих интервалов и т. д. Правая граница последнего интервала равна сумме всех частот, т.е. объему n выборки.
Для характеристики свойств статистического распределения в математической статистике вводится понятие эмпирической функции распределения. Эмпирическая функция распределения вычисляется по формуле
(1.1)
где суммируются частоты тех элементов выборки, для которых выполняется неравенство
. Очевидно, что
при
и
неубывающую кусочно-постоянную функцию.
определяется теоремой Гливенко. Пусть функция распределения, построенная по выборке объема n из генеральной совокупности с функцией распределения
для любого x и любого ε>0
при
. На промежутке
представляет собой
Значение эмпирической функции распределения для статистики
- эмпирическая
. Тогда
. (1.2)
Таким образом, для любого x
сходится по вероятности к
и, следовательно, при большом объеме выборки может служить
13
оценкой функции распределения генеральной совокупности в каждой
n
xxx ,...,,
21
точке x (рис. 1.1).
Рис. 1.1.Кумулята и эмпирическая функция распределения
1.3. Расчет выборочных характеристик статистического
распределения
Пусть имеется выборка объема n со значениями x1, x2, . . ., xn признака Х. Для характеристики важнейших свойств статистического распределения используют средние показатели, называемые выборочными числовыми характеристиками или оценками неизвестных параметров распределения генеральной совокупности.
Для отдельного параметра совокупности может существовать несколько выборочных статистик, которые могут служить оценками. Например, любая из статистик – выборочная средняя, мода, медиана – может показаться вполне приемлемой для оценивания среднего значения совокупности. Любая статистика, вычисленная по наблюдениям выборки, может рассматриваться как случайная величина.
Пусть FX(x,) – функция распределения СВХ, содержащая неизвестный параметр , а(
) – выборка наблюдений этой СВ.
Точечной оценкой числового параметра называется функция выборочных значений:
14
n
n
xxx
^
21
^
),...,,(
, (1.3)
^
n
M
1)(
^
n
P
.n
n
^
^
n
M
0
^
n
D
n
n
^
n
xxx ,...,,
21
2
n
i
i
x
n
xXM
1
^
1
)(
,)(
11
)(
11
 
 
n
i
i
n
i
i
m
n
nm
XM
n
x
n
MxM
.при0)(
1
)(
11
)(
1
2
1
2
2
22
1
 
 
n
nn
n
XD
n
xD
n
x
n
DxD
n
i
n
i
ii
n
i
i
которая в определенном статистическом смысле близка к истинному значению этого параметра. Важнейшие статистические свойства оценки, определяющие ее близость к истинному значению числовой характеристики, это свойства несмещенности, состоятельности и эффективности. Оценка параметра называется несмещенной, если ее математическое ожидание равно оцениваемому параметру, т.е.
.Оценка называется состоятельной, если при увеличении
объема выборки n она сходится по вероятности к оцениваемому
параметру, т.е.
оценки
во многих случаях может быть установлена с помощью
теоремы: если
>0
и
при
при
Состоятельность
, то
- состоятельная
оценка параметра . Оценка называется эффективной, если при заданном объеме выборки n она имеет наименьшую дисперсию в данном классе оценок. Пусть (
) - выборка из генеральной
совокупности с конечным математическим ожиданием M(X)=m и дисперсией D(X)=
.В качестве оценки математического ожидания
возьмем оценку:
Эта оценка – несмещенная и состоятельная оценка математического ожидания М(Х). Доказательство:
Если значения x
признака Х не сгруппированы в вариационные
i
ряды и объем выборки n большой, то оценки неизвестных математического ожидания m и дисперсии σ2 находят по следующим формулам:
15
- для математического ожидания
,
1
1
n
i
i
x
n
x
n
i
n
i
ii
xx
n
xx
n
S
1 1
2
222
1
)(
1
,,
1
11
k
i
ii
k
i
i
nnnx
n
x
.
1
)(
1
1 1
2
222
k
i
k
i
iiii
xnx
n
nxx
n
S
,)(
1
1
1
22
n
i
i
xx
n
s
,)(
1
1
1
22
k
i
ii
nxx
n
s
2
SS
.2ss
(1.4)
- для дисперсии (1.5)
Если результаты наблюдений сгруппированы в дискретный
вариационный ряд, то те же оценки находят по формулам
(1.6)
(1.7)
Формулы (1.4) и (1.6), как и (1.5) и (1.7), дают одинаковые
результаты соответственно для и S2.
По формуле (1.7) оценивают дисперсию в случае, если объем выборки n>50. Если же n≤50, то вычисляют несмещенную оценку дисперсии или исправленную дисперсию:
(1.8)
для простой выборки, или
(1.9)
для группированной выборки.
В зависимости от объема выборки выборочное среднее квадратическое отклонение находят по формулам
или
(1.10)
Для анализа вариационных рядов вычисляют такие статистики, как моду и медиану.
Медианой Me называют варианту, которая делит вариационный
ряд на две равные по числу вариант части. Поскольку оценки медианы более робастны, ее оценивание может быть более предпочтительным для распределений с «тяжелыми» хвостами. (Робастность в статистике – это устойчивость к влиянию на результат исследования различного рода выбросов [1]).
16
При нечетном объеме выборки n=2k+1 медиана равна Me=x
xi 3 5 8 12
15
ni 6 2 4 5
8
12
2
1n
k
,
2
1
kk
e
xx
M
xi 2 5 7 10
12
14
ni 3 4 8 2 3 6
.7
2
77
2
1413
xx
M
e
,
2
1ee
ee
M
M
MMe
n
S
n
hxM
1e
M
S
Например, для вариационного ряда
k+1
.
объем выборки n=25,
. Если представить выборку в виде
несгруппированного вариационного ряда, то медиана соответствует варианте, стоящей на 13 позиции, т.е. Me =12.
Если имеется четное количество вариант и два средних значения различаются, то медианой может служить любое число между ними. Так, в выборке {1 2 3 4} медианой может служить любое число из интервала (2, 3). На практике в этом случае чаще всего берут среднее арифметическое двух средних значений:
где xk, x
- варианта, которая находится соответственно слева и справа
k+1
от середины вариационного ряда. Например, для следующего вариационного ряда:
объем выборки n=26, k=13.Медиана
Если данные заданы в виде интервального ряда, медиану подсчитывают по формуле [7]
где xMe — нижняя граница медианного интервала; hMe — ширина медианного интервала; n — объем выборки;
— суммарное
количество наблюдений, которое было накоплено до начала медианного интервала, т.е. накопленная частота предмедианного интервала; nMe — число наблюдений в медианном интервале.
17
Для примера рассчитаем медиану по следующим данным:
Интервал
ni Wi·n
Wi·100%
0.765-0.795
4 4 8%
0.795-0.825
7
11
22%
0.825-0.855
7
18
36%
0.855-0.885
11
29
58%
0.885-0.915
14
43
86%
0.915-0.945
1
44
88%
0.945-0.975
3
47
94%
0.975-1.005
3
50
100%
Итого
50
181
e
M
S
.874.0
11
18
2
50
03.0855.0
2
1
ee
ee
M
M
MMe
n
S
n
hxM
xi 4 9
14
19
ni 3 7 2 5
,
)()(
11
1
0
ooo
oo
o
mmmm
mm
mo
nnnn
nn
hxM
o
m
x
o
m
n
1om
n
По последнему столбцу определяем медианный интервал –
0.855-0.885 (накопленная доля впервые более 50 %). Ширина
интервала hMe=0.03, xMe=0.855, n=50,
, nMe =11. Подставляя
соответствующие данные в приведенную на с. 17 формулу, получаем
Модой Mo называют варианту, которая имеет наибольшую
частоту. Например, для вариационного ряда
мода равна Mo=9. Если наибольшая частота встречается m раз, то и мода принимает m соответствующих значений.
по формуле
где интервала;
Для интервального вариационного ряда моду можно рассчитать
— нижняя граница модального интервала; h — ширина
— частота модального интервала;
18
— частота
интервала, предшествующего модальному;
1om
n
.9075.0
)114()1114(
1114
03.0885.0
o
M
,
3
3
S
m
As
.)(
1
1
3
3
k
i
ii
nxx
n
m
,3
4
4
S
m
E
x
.)(
1
1
4
4
k
i
ii
nxx
n
m
— частота
интервала, следующего за модальным.
В приведенном выше примере
Асимметрия и эксцесс являются статистиками, характеризующими отклонение распределения признака относительного нормального распределения (см. с. 72). Выборочный коэффициент асимметрии используется для проверки распределения на симметричность, а также для грубой проверки на нормальность. Асимметрию рассчитывают по формуле
(1.11)
где m3 - центральный момент третьего порядка
(1.12)
Если As>0, то асимметрия является правосторонней (рис.1.2); если As<0, то асимметрия левосторонняя (рис.1.3).
Эксцесс – величина островершинности. Если вершина
распределения плоская, то такое распределение называется плосковершинным(Ex<0). Когда Ex>0, распределение называется островершинным (рис. 1.4).
Эксцесс рассчитывают по формуле
(1.13)
где m4 - центральный момент четвертого порядка
(1.14)
19
Рис. 1.2. График функции плотности распределения случайной
величины с правосторонней асимметрией
Рис. 1.3. График функции плотности распределения случайной
величины с левосторонней асимметрией
20
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]