Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Методы обработки и анализа экспериментальных данных. Учебное пособие

.pdf
Скачиваний:
0
Добавлен:
07.09.2026
Размер:
2 Мб
Скачать
☆
анализе формы и вида плотности распределения вероятностей, при проверке
N,1
степени близости выборочного закона распределения вероятностей (гистограммы) к одному из типовых законов распределения вероятностей (нормальному, равномерному, экспоненциальному и т.д.).
4. Статистические характеристики многомерных случайных величин
Многомерной векторной случайной величиной называется вектор,
состоящий из нескольких случайных величинX = {x1, x2,…,xn}. Для представления и отображения операций над векторными случайными величинами для удобства и компактности часто используют векторную и матричную алгебру.
Как для одномерной случайной величины, так и в векторном случае, для элементов вектора X рассчитывают все характеристики, о которых говорилось в предыдущем разделе. Кроме этих характеристик, для многомерного случая появляется новый класс оценок, дающий возможность оценить взаимосвязи между компонентами векторной случайной величины. Появляется и понятие многомерной плотности распределения вероятностей, а следовательно, и ее выборочного аналога – многомерной гистограммы.
Рассмотрение этих понятий начнем с двумерного случая, т.е. когда Xi =
= (х
поле, которое строится путем нанесения точек Хi с координатами (x
1 i
, x
2 i
),i=
. Двумерным аналогом гистограммы является корреляционное
; х2) на
1
плоскость.
21
Рис.6. Корреляционное поле
Для того чтобы получить более близкий аналог гистограммы, х1 и х2 разбивают на некоторое количество интервалов. На каждой из осей строят одномерную гистограмму.
Рис. 7. Корреляционное поле с гистограммами
Часто возникает практическая необходимость расчета вероятности
попадания двумерной случайной величины в определенный "квадратик" корреляционного поля. Один из таких "квадратиков" заштрихован. Получив частоты попадания двумерной случайной величины в каждый из таких "квадратиков", мы получаем трехмерную гистограмму. Возможно ее представление и в виде трехмерной графики.
22
2121221121
),())(( dxdxxxfxxM
xxxx


))((
1
221
1
12,1
21
xxxx
N
kK
i
N
i
ixx
Рис. 8. Трехмерный график корреляционного поля
Можно изобразить вместо столбиков вертикальные линии, восходящие
из центра каждого квадратика, высотой, равной частоте попадания в этот диапазон. Такой рисунок выглядит более «прозрачно» и удобен для анализа.
5. Переход к корреляции
Уже из вида корреляционного поля можно сделать качественную оценку взаимосвязей переменных х1 и х2. Численная оценка степени линейной связи между двумя переменными осуществляется с помощью расчета оценок вторых центральных смешанных моментов. Второй центральный смешанный момент записывается в виде выражения
гдеf(x1;x2) – двумерная плотность распределения вероятностей случайных величин.
Статистическая оценка второго смешанного момента называется коэффициентом ковариации и рассчитывается по формуле
.
Коэффициент ковариации несколько неудобен для оценки степени линейной связи, т.к. его значение зависит также и от масштаба переменных х1 и
23
х2. Поэтому чаще пользуются нормированным значением коэффициента
21
2,1
2,121
ˆˆ
k
rr
xx
)(
2
1
)(
12,1
1
1
н
i
N
i
н
i
xx
N
r
0 2
1
0
12,1
1
1
i
N
i
i
xx
N
K
ковариации, называемым коэффициентом корреляции
.
Если выборка исходных наблюдений зах1 и х2 предварительно нормирована (см. конец 4-го раздела), то
;
.
Коэффициент корреляции принимает значения от минус единицы до плюс единицы: r[-1;+1]. Причемr=±1 соответствует строго детерминированной прямой (+1) или обратной (-1) линейной связи между переменными. Корреляционное поле в этом случае вырождается в прямую линию. Если r = 0, то это означает полное отсутствие линейной связи между переменными. Корреляционное поле для нормированных переменных представляет собой скопление точек в виде окружности, а для ненормированных переменных имеет форму эллипса с главными диагоналями, параллельными осям координат. Промежуточное значение коэффициента корреляции свидетельствует об определенной линейной статистической связи между переменными, причем, чем ближе r к ±1, тем теснее эта связь. Наличие линейной связи приближенно можно оценить по виду корреляционного поля. Чем более узок эллипс экспериментальных данных, и чем больше угол между главными осями эллипса данных и осями координат, тем теснее эта связь. Следует помнить, что корреляция отражает только линейную связь. Рассмотрим пример, подтверждающий это.
Пример. Рассмотрим строго функциональную параболическую связь между переменными х1 и х2.
24
2
х
085,02)65,0(1)65,0185,02(
4
1
r
2
1
х
2
1
х
Возьмем пять точек на этой кривой
Х1
-2
-1 0 1
2
Х2
2,3
0,8 0 0,8
2,3
Рис. 9. Параболическая связь и корреляция
Очевидно, что среднее значение
= 1,45.
.
Мы видим, что при наличии даже строго функциональной де­терминированной, но нелинейной связи между переменными (в данном
случаех2 = а
), коэффициент корреляции может быть равен 0.
Анализ нелинейных связей требует специфического подхода. Для выбора вида нелинейности необходимо анализировать структуру корреляционных полей. В случае нашего примера, если бы мы ввели
дополнительную переменную х3=
, то коэффициент корреляции r
2,3
=
1.Поэтому для анализа нелинейных связей необходимо вводить
дополнительные переменные, представляющие собой различного рода нелинейные функции от переменных исходной выборки. На факт возможной нелинейной связи между случайными величинами всегда необходимо обращать пристальное внимание. Другой момент, на который следует особо обратить внимание начинающего исследователя статистических данных, заключается в том, что величина коэффициента корреляции непропорциональна степени
25
линейной связи. Для того, чтобы более однозначно понять, насколько тесны связи между случайными величинами, вводится коэффициент детерминации.
d = r2 – 100%.
Коэффициент детерминации имеет четкий физический смысл. Он говорит о том, на сколько процентов поведение одной переменной объясняется за счет поведения другой.
Пример.
r = 0,2;d = 4%;
r = 0,5;d = 25%;
r = 0,7;d ≈ 50%;
r = 0,9;d ≈ 80%.
Поэтому, с практической точки зрения, о более или менее значимой линейной связи между случайными величинами можно говорить при r больше
0,5.
Если анализу подвергается многомерная случайная величина с числом переменных более двух, то совместному анализу подлежат все парные взаимосвязи между компонентами вектора многомерной случайной величины.
В качестве многомерных аналогов коэффициентов ковариации и корреляции выступают соответственно ковариационная и корреляционная матрица. Ковариационная матрица для n-мерной случайной величины записывается в виде
Любой произвольный элемент этой матрицы представляет собой коэффициент ковариации Kji переменных xj и хi, и Kjjв случае i=j, что соответствует ковариации переменной самой с собой, и, очевидно, представляет из себя дисперсию этой переменной. Таким образом, главная диагональ ковариационной матрицы представляет собой значения дисперсий
26
случайных величин. Ковариационная матрица является симметричной
12rs
относительно главной диагонали, т.е., Kji = Kij, что также очевидно (бесспорно) следует из формулы для расчета коэффициента ковариации.
Корреляционная матрица записывается в виде
Она также симметрична относительно главной диагонали. На главной диагонали стоят единицы, т.к. переменные нормированы, т.е. имеют единичную дисперсию.
При записи корреляционных и/или ковариационных матриц, учитывая их симметричность, часто пользуются отображением только верхней или нижней их треугольных частей. Например
Иногда, по аналогии с понятиями медианы, среднемодульного отклонения, размаха, вводят огрубленные оценки линейной связи между порядковыми случайными величинами. При этом рассматривают ранговые и знаковые коэффициенты корреляции. Среди ранговых коэффициентов корреляции наиболее известными являются коэффициенты Спирмана и Кендела.
Наиболее простой из них – коэффициент Спирмана
между
переменнымиx1 и х2.
 
󰇛  󰇜


27
󰇛
󰇜
 󰇛
󰇛
󰇜

󰇜
гдеR(•) – ранговый номер соответствующего значения случайной величины x
Х1
3 5 1 8 6
Х1
4 2 1 9 7
Х
1(i)
1 3 5 6 8
Х
2(i)
1 4 2 7
9
R(x
1(i)
)
1 2 3 4 5
R(x
2(i)
)
1 3 2 4 5
.1)00110(
425
6
1
2
12
r
s
или х2 в ранжированной последовательности.
Пример.
Xi = {3,5,1,8,6} – исходная выборка;
Xi= {1,3,5,6,8} – ранжированная последовательность;
Xi = {1,2,3,4,5} – ранговые номера.
При расчете коэффициента Спирмана ранжируется первая переменная, вторая же по наблюдениям представляется в той же последовательности, в которой была упорядочена первая, после чего осуществляют вычисления по вышеприведенной формуле.
Пример.
1
Чтобы упорядочить х1, соответствующим образом переставим х2 и получим:
Каждому наблюдению становится в соответствие его номер в ранговой шкале. Подсчитаем коэффициент Спирмана
Можно признать связь очень высокой. На уровне рангов она представляет собой даже детерминированную линейную связь. Если рассчитать по этим данным классический коэффициент корреляции, то его значение будет меньше 1, но более 0,9.
28
Знаковые коэффициенты корреляции основаны на анализе совпадения
(+)
х
2
(–)
(+)
х
1
(–)
N
11 N12
N21
N22
.
))()()((
2212211122211211
22112112
21
NNNNNNNN
NNNN
a
xx
знаков отклонения двух случайных величин от среднего значения. Такие коэффициенты в статистике часто называют тетрахорическими. Для их расчета составляется таблица.
К оценке тетрахорического коэффициента
гдеN11 – число наблюдений, в которых отклонение от среднего у х1 и х2 одновременно положительно; N22 – то же, но одновременно отрицательно; N12 – то же, но х1>0, а х2<0; N21 – то же, нох1<0,а х2>0.
Из-за этой таблицы коэффициенты называются тетрахорическими. Наиболее простым из тетрахорических коэффициентов является знаковый коэффициент ассоциации
В знаменателе стоит произведение сумм элементов обеих строк и обоих столбцов. Знаменатель выполняет функцию нормировки.
Для прикидочного анализа взаимосвязей эти коэффициенты являются весьма удобными, их легко получить прямо из корреляционного поля.
Рис. 10. Корреляционное поле к оценке тетрахорического коэффициента
Если случайных величин больше двух, то из ранговых и знаковых коэффициентов могут также составляться корреляционные матрицы.
29
6. Доверительные интервалы и вероятности
ˆ
ˆ
Если собрать статистический материал и разложить его на несколько равных по объему выборок, а затем на каждой из этих выборок рассчитать оценки статистических характеристик, то от выборки к выборке эти оценки будут отличаться друг от друга. Это свидетельствует о том, что выборочные оценки, в свою очередь, обладают определенной случайностью, предопределяющей точность расчета этой оценки относительно ее истинного значения.
Пример. Возьмем дискретную случайную величину – метание монеты, где 0 – орел, а 1 – решка. Зададимся целью подсчитать оценку вероятности выпадения орла и решки. Бросим монету 20 раз. Пусть в первых десяти случаях имело место: 0, 1, 0, 1, 0, 0, 0, 0, 1, 0. А во вторых десяти – 1, 1, 1, 1, 0, 0, 1, 1, 0,
0. Частота выпадения орла в первом случае – 0,7, а решки – 0,3. Во втором случае-орла – 0,4, а решки – 0,6. Полученные оценки вероятности выпадения орла и решки, как видим, в разных выборках различны, причем сильно отличаются от истинного значения, равного 0,5. Если за выборку взять все данные, то получим частоту выпадения орла – 0,55, а решки – 0,45. Очевидно, что с ростом числа наблюдений' выборочная оценка приближается к ее истинному значению. В данном примере, если используемая для метания монета правильно отцентрирована, то истинное значение вероятности нам заведомо известно и равняется 0,5. Поэтому мы даже можем оценить точность полученной нами оценки: при N = 20 имеет место 10%-ная ошибка.
В реальной практике при сборе и обработке статистических данных истинное значение оценок (вероятностей, средних значений, дисперсий и т.д.) неизвестно. Поэтому о достоверности этих выборочных оценок можно говорить только с определенной доверительной вероятностью. Для оценки точности вводится понятие доверительного интервала.
Как правило, доверительный интервал задается в окрестности полученной выборочной оценки (
– ∆,
30
+ ∆), причем попадание истинного
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]