Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Методы обработки и анализа экспериментальных данных. Учебное пособие

.pdf
Скачиваний:
0
Добавлен:
07.09.2026
Размер:
2 Мб
Скачать
☆
Пример.
А1 → А2 → А3
А4
Рис.1. Путевая модель: А1 – семья с ее состоянием; А2 –
количество детей; А3 – наличие мальчиков; А4 – наличие
аистов
Этот граф отражает путевую модель причинных связей между перечисленными событиями. Из нее следует, что причинных связей между А3 иА4 нет, и если эта связь проявилась при обработке статистического материала, то она опосредована через вершиныА1 и А2.
Учитывая, что результаты статистического анализа предназначены для использования в будущем (иначе выводы теряют практическую ценность), статистика опирается на постулат существования статистической совокупности, обладающей устойчивыми средними характеристиками (под средними характеристиками не обязательно понимаются среднеарифметические). В каждом конкретном исследовании статистическая устойчивость, постулированная априори, должна подвергаться проверке по мере поступления экспериментального материала и в ходе его обработки. Априори – до опыта, апостериори – в ходе опыта, априорные знания – знания, накопленные до опыта, апостериорные знания – знания, полученные в ходе исследования.
3. Статистические характеристики одномерной случайной
величины
При обработке собранного статистического материала, как уже отмечалось ранее, пытаются выявить некоторые общие, в определенном смысле средние характеристики, позволяющие судить о поведении случайной
11
величины. Если изучается поведение одной случайной величины без ее
x
взаимосвязи с другими, то говорят об исследовании одномерной случайной величины. Если случайных величин несколько и исследование предполагает их совместное рассмотрение, то говорят о рассмотрении многомерной или векторной случайной величины. Рассмотрение последних будет в более поздних разделах пособия.
Из теории вероятностей известно, что поведение случайной величины однозначно описывается ее законом распределения вероятностей. При этом различают функцию накопленных вероятностейF(x ), где х – случайная величина, представляющая собой вероятность того, что случайная величина не превысит некоторого определенного заданного значенияF(x) = р (х<хi), гдеiпринадлежит всей числовой оси. Функция накопленных вероятностей представляет собой не убывающую при движении из – ∞ в +∞кривую, которая нарастает от 0 до 1. Р(-∞)=0, Р(+∞) = 1. Бесконечные предельные значения в реальной практике приобретают некоторые конечные значения.
Пример.
Рис.2. Функция накопленных вероятностей
Примерно так выглядитF(x)для нормального (Гауссовского) закона распределения вероятностей. На практике часто пользуются неF(x), а плотностью распределения вероятностейf(x),которые математически представляют собой производную F(x):
f(x) =
󰇛󰇜
.

12
И физический смысл ее есть вероятность попадания случайной величины в некоторый заданный интервал. Для приведенного примераf(x) примет вид:
Рис.3. Плотность распределения вероятностей
Площадь подf(x) на отрезке (x
) характеризует вероятность
1;х2
попадания случайной величины в интервал [x1;x2].
При обработке экспериментального материала в качестве выборочного аналога вероятностей говорят о частотеh. Аналогом же плотности распределения вероятностей является выборочный закон распределения вероятностей, в которомf(x )называют гистограммой. Для построения гистограммы весь интервал случайной величины разбивают на несколько отрезков, после чего подсчитывают частоту попадания экспериментальных данных в эти отрезки. Причем для отрезка ∆xiчастота hi рассчитывается как

hi=
, (1)
гдеN – объем выборки (количество собранных экспериментальных данных); Ni – количество данных, попавших вi -й интервал.
Как правило, количество интервалов выбирают нечетным. Их число обычно назначается равным 5, 7, 9, 11, реже – 3. Количество интервалов напрямую зависит от объема выборки N. Чем больше N, тем больше можно брать интервалов, чтобы точно описать поведение случайной величины. При графическом изображении гистограммы над каждым интервалом строится столбик, высота которого равняется hi.
13
Пример.
ji 1
hi (x)
1,0
0,3 0,2 0,1
x0x
1 x2 x3 x4
x5
Рис. 4. Гистограмма
Из формулы (1) следует, что

,где п – количество интервалов в
гистограмме. Это соответствует теоретическому результату теории вероятностей, в соответствии с которым площадь над кривой f(х) равняется 1,

т.е.
󰇛󰇜 

Физический смысл этого заключается в том, что с
вероятностью 1 случайная величина примет любое из значений своего рабочего диапазона. Из h(x) можно легко получить выборочный аналог функции накопленных вероятностей F(x) путем последовательного суммирования hi:
Hj=
hi, ,
где j>i. Ее принято называть кумулятой.
Пример.
Рис. 5. Кумулята
При ручном подсчете и построении гистограмм полезно рассматривать данные последовательно, сразу «раскидывая» их по уже выбранным интервалам. Если данных в интервал попадает мало, то выборка является ненадежной оценкой вероятности попадания величины в этот интервал.
14
Кроме построения гистограмм, исследователя обычно интересуют
ˆ
Nix1
х
nix1
х
11n
i
x
х
х
nix1
11n
i
x
х
х
х
х
х
х
различные числовые характеристики поведения случайной величины. Они делятся на две группы:
1) характеристики положения случайной величины;
2) характеристики разброса случайных величин.
Характеристики положения случайных величин:
1. Среднее значение – выборочная оценка математического ожидания
μх=
󰇛󰇜;
= x=
x
.
.
i
Часто удобно эту формулу перевести в рекуррентный вид, осуществляя расчет среднего по мере поступления экспериментальных данных. Выведем эту
=
=
n

;
i
.
i
формулу. В случае п < N среднее будет
n – 1
Вычтем из предыдущей формулы последующую, предварительно перенеся знаменатель из правой в левую сторону
n
– (n – 1)
n
n
󰇛󰇜
=
n – 1
=
n – 1
+
–
i
 
xn .
= xn;
i
Эту формулу дальше нетрудно преобразовать к виду
=
n
n – 1
+
(xn–
n – 1
)
Это рекуррентная формула расчета накопительной средней. Вычисления осуществляются по мере поступления новых экспериментальных данных. Новое среднее значение при этом рассчитывается, как предыдущая средняя, скорректированная на величину вновь поступившей информацииxn–
n – 1
,
взятой с весом 1/п.
15
Формулы, аналогичные приведенной выше, широко используются в численных методах вычислительной математики (при анализе временных рядов, задачах адаптации и самообучения).
2. Другой характеристикой положения случайной величины является
мода. Мода – есть наивысшее значение плотности распределения вероятностей, то есть это наиболее вероятное значение случайной величины. Мода соответствует значению случайной величины, в которомf(x) принимает максимальное значение. Выборочная оценка моды определяется из построенной гистограммы.
3. Медиана – есть центральное значение упорядоченного по
возрастанию или убыванию ряда значений случайной величины.
Пример. хi = {3,8,2,6,4,10,5} – это исходный ряд данных. Упорядоченный, ранжированный ряд данных, составленный из исходного x
(i)
=
{2,3,4,5,6,8,10} есть ранжированная последовательность. Медиана равна 5.
При обработке статистических данных довольно часто пользуются упорядоченными по возрастанию или убыванию последовательностями. Выборку упорядоченных данных принято называть ранжированной выборкой. Как правило, элементы ранжированной выборки обозначаются с индексом, заключенным в скобки x
. Часто x
(i)
называют ранговой статистикой.
(i)
Кроме перечисленных выше характеристик положений случайной величины, в некоторых практических случаях пользуются комбинированными оценками, довольно часто при практической обработке данных используют комбинацию арифметического среднего и медианы.
Пример. Совместное использование медианы и арифметического среднего применяется при обработке оценок судей на выступлениях фигуристов: максимальная и минимальная оценка отбрасываются, по остальным судейским оценкам ищется среднее арифметическое. Такая оценка более надежна, чем чисто арифметическая средняя, ибо исключает предвзятое отношение судей с радикальным мнением. В принципе можно было бы отбросить и по две крайние оценки. Если судей 5, то мы в этом случае
16
получаем чистую медианную оценку. Если судей 7, то получаем
2
ˆ
x
2
1
)( xx
N
i
i
xx
D
ˆ
комбинированную оценку, в которой увеличивается вес медианы и уменьшается вес среднего арифметического.
Комбинация арифметического среднего и медианы делает оценки более устойчивыми к аномальным всплескам в исходных данных. Отметим, что в статистике оценки, устойчивые к различного рода аномалиям выборки (например, резкий "всплеск"), принято называть робастными оценками. При оценке положения случайной величины медиана и ее комбинация с арифметическим средним относится к классу робастных оценок.
Другая группа характеристик случайной величины – это характеристики ее разброса относительно центра расположения. К ним относятся дисперсия, среднеквадратическое отклонение, среднемодульное отклонение и размах. Дисперсия вычисляется по формуле
Dx =
=

,
т.е. дисперсия есть среднее значение квадрата отклонения случайной величины от арифметического среднего. Деление в этой формуле на N – 1, а не на N, осуществляется с той целью, чтобы получить несмещенную оценку истинной дисперсии. Из формулы дисперсии видно, что она асимптотически несмещенная, ибо с ростом N смещенность стремится к нулю. Из формулы это следует таким образом: оценки, полученные при делении на N и на N – 1, приближаются друг к другу с ростом N. Неудобства пользования дисперсией как характеристикой разброса заключается в том, что ее масштаб равен квадрату масштаба исходной случайной величины. Поэтому на практике удобно оперировать величиной, называемой среднеквадратическим отклонением, которая представляет собой
.
Дисперсия и среднеквадратическое отклонение из-за того, что в формуле используется возведение в квадрат, весьма чувствительны к резким
17
отклонениям исходных данных от центра. Для повышения устойчивости
х
характеристик разброса принимают оценку среднемодульного отклонения
GMx=

–
 .
i
Она значительно более устойчива к большим отклонениям от центра в исходных данных.
В прикидочных ускоренных расчетах часто пользуются при оценке разброса случайной величины характеристикой, называемой размахом. Размах– есть разница между максимальным и минимальным значением случайной величины Рx = x
max
– x
. Полуразмах Р
min
= (x
х/2
max
– x
)/2 приближенно
min
характеризует отклонение случайной величины от центра, если закон распределения вероятностей симметричен.
Некоторые практические замечания. Если случайная величина имеет закон распределения вероятностей, симметричный относительно моды, то:
1) значение моды, медианы и арифметического среднего совпадают;
2) полуразмах характеризует симметричное и равное в обе стороны
отклонение от центра.
Если случайная величина подчиняется нормальному (Гауссовскому) распределению вероятностей, то дополнительно к вышесказанному можно добавить, что:
1) дисперсия или арифметическая средняя являются наилучшими
оценками центра распределения и разброса;
2) в интервал [±σx] попадает около 67% данных, в интервал [±2σx] –
более 95%, в интервал [±3σx]– более 99,5%, то есть справедливо утверждение, что с вероятностью более 0,995 все данные попадают в интервал [±3σx]. Это правило носит название правила трех сигм;
3) экспертную оценку σx можно получить путем деления размаха Рх на
6 (следствие привила трех сигм). Если закон распределения вероятностей отличается от нормального длинными крайними хвостами, то вместо средней арифметической полезней пользоваться медианой, либо комбинированной
18
оценкой, рассмотренной выше, а вместо дисперсии – среднемодульным
dxxfx
n
)(


N
i
n
i
n
x
N
M
1
0
1
,)(
1
1
0
n
N
i
i
n
xx
N
M
.)()(
0
dxxfxM
n
n

отклонением.
Иногда, кроме перечисленных характеристик разброса и положения случайной величины, прибегают к вычислению более сложных оценок. Как правило, для этого применяют так называемые моменты высокого порядка. Момент случайной величины n-го порядка вычисляется по формуле
Mn=
Выборочная его оценка равна
приn = 1 имеем среднее арифметическое.
Вместо моментов п-го порядка часто пользуются центральными
Выборочная оценка
.
,
моментами
при п = 2 имеем формулу дисперсии, т.е. дисперсия есть центральный момент второго порядка. Центральные моменты отличаются от обычных (нецентральных) тем, что из значений случайной величины вычитается его арифметическая средняя. В принципе, центральный момент первого порядка при n = 1 не имеет смысла, так как легко доказывается, что он равен нулю. Ко­гда пользуются моментами второго и высших порядков n≥ 2, прибегают к расчету центральных моментов, приводя этим центр распределения к нулевому значению.
Несмотря на то, что моменты выше второго порядка в практических расчетах используются крайне редко, отметим, что центральный момент третьего порядка (n = 3) называют асимметрией, а четвертого (п = 4) -
19
эксцессом. Асимметрия характеризует степень несимметричности закона
;0xxx
i
i
N,1
)(н
i
x
)(н
i
x
i
x
)(н
i
x
i
x
x
i
x
i
xx
x
ˆˆ
0
N,1
распределения вероятностей относительно его моды, т.е. вершины. Эксцесс характеризует степень "притупленности" либо, наоборот, "остроты" вершины закона распределения, т.е. отражает поведение плотности распределения вероятностей в окрестности моды.
После того как нами введены понятия математического ожидания и дисперсии, а также их выборочных оценок, необходимо ввести два типа преобразования случайной величины в исходной выборке. Центрированная случайная величина (иногда пользуются определением "центрированная выборка") – это значение случайной величины с нулевым арифметическим средним. Как правило, центрированная случайная величина обозначается той же буквой, что исходная, но с кружочком сверху и вычисляется вычитанием из
исходных значений средней
i =
.
Часто, кроме операции центрирования, значения выборки случайной величины подвергают дополнительной нормировке, переводя их к безразмерному масштабу со стандартным разбросом, при котором дисперсия равняется единице. Значения нормированной случайной величины обозначают
введением дополнительного индекса
подстрочным индексом исходной случайной величины
,либо обозначают греческой буквой с
=
.
Значения нормированной случайной величины рассчитываются по формуле
=
=
,i =
.
Как следует из предыдущего изложения, среднее значение нормированной случайной величины равняется нулю, а дисперсия, равно как и среднеквадратическое отклонение, равна единице. Нормированная случайная величина оказывается весьма полезной при изучении связей случайных величин между собой. В одномерном же случае приведение исходной выборки случайной величины к нормированному виду оказывается полезным при
20
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]