Основы технического творчества и научных исследований. Учебное пособие
.pdf
Пример 1. Пусть необходимо извлечь выборку объёма N = 25 независимых наблюдений нормально распределённой случайной величины x(k) с математиче-
ским ожиданием μx = 10 и дисперсией σ2 = 4. Определим интервал, в который
x r
с вероятностью 95% будет заключено среднее значение. Выборочное среднее x
представляет собой одно значение, выбранное из нормально распределённых
случайных величин с μx =10 и σ2x |
= |
|
4 |
|
. Используем нормированную величину |
||||||||
25 |
|||||||||||||
|
|
|
|
|
|
|
|
|
|
||||
z = |
x |
−μx |
|
= |
x −10 |
= |
(x −10) 5 |
. |
|||||
|
σx |
|
|
|
4 |
|
2 |
||||||
|
|
|
|
|
|
|
|
|
|||||
|
|
|
|
|
|
|
25 |
|
|
|
|
||
Для того чтобы найти интервал, в который с вероятностью 95% заключены значения x , необходимо задать такие границы этого интервала, что вероятностьrпопадания x слева от интервала составляет 2,5% и вероятность попадания x справа от интервала составляет 2,5%.
P |
z |
< |
|
(x −10) 5 |
≤ z |
α / 2 |
=1−α ; |
|||||||
|
|
|
|
|||||||||||
|
|
|
1−α/ 2 |
|
2 |
|
|
|
|
|||||
|
|
|
|
|
|
|
|
|
|
|||||
|
|
|
|
α =1−0,95 = 0,05 . |
|
|
||||||||
По таблице находим −z1−α/ 2 = zα/ 2 = z0,025 =1,96 , т.е. |
||||||||||||||
|
|
|
|
( |
|
−10) 5 |
|
|
|
|
||||
|
|
|
x |
|
|
|
||||||||
P −1,96 |
< |
|
|
|
|
|
|
≤1,96 |
= 0,95; |
|||||
2 |
|
|||||||||||||
|
|
|
|
|
|
|
|
|
||||||
|
|
|
−1,96 2 |
|
+10 < x ≤ |
|
1,96 2 |
+10, |
||||||
|
|
5 |
|
|
5 |
|
||||||||
|
|
|
|
|
|
|
|
|
|
|||||
а значит 9,21 < x ≤10,78 .
В случае если случайная величина распределена по закону, отличному от нормального, из следствий центральной предельной теоремы вытекает, что при увеличении объёма выборки N выборочное распределение выборочного среднего значения выборки приближается к нормальному распределению независимо от вида распределения исходной величины x(k).
С точкиr зрения практики предположение о нормальности выборочного среднего x становится приемлемым во многих случаях при N > 4 и вполне
хорошо оправдывается при объёмах N > 10. Следовательно, при достаточно больших объёмах выборок в качестве выборочного распределения среднего значения выборки x для случайной величины можно использовать выражение
|
( |
|
−μx ) |
N |
|
z(k) = |
x |
независимо от закона распределения случайной величины. |
|||
|
|
σx |
|
||
|
|
|
|
|
Рассмотрим дисперсию S2 выборки объёма N независимых наблюдений случайной величины x(k). Пусть величина x(k) имеет нормальное распределе-
ние со средним значением μx и дисперсией σ2x . Найдём распределение выбо-
|
nS 2 |
2 |
|
n = N −1. Величина χ |
2 |
рочной дисперсии |
|
= χn |
, |
подчиняется распределе- |
|
σ2 |
|||||
|
x |
|
|
|
|
51
нию χ2 с n = N – 1 степенями свободы. Отсюда следует вероятностное утверждение относительно выборочной дисперсии до извлечения выборки
|
σ2 |
χ2 |
|
|
P S 2 > |
x |
n, α |
|
= α . |
|
n |
|||
|
|
|
|
|
|
|
|
|
|
Для примера 1 найдём интервал, в который с вероятностью 95% будет попадать дисперсия. Этот интервал может быть вычислен по формуле
|
2 |
< |
24S 2 |
2 |
|
=1−α . |
P χ24, 1−α/ 2 |
4 |
≤ χ24, |
α/ 2 |
|||
|
|
|
|
|
|
|
|
|
По статистическим таблицам находим χ242 |
, 0,975 =12,4 , χ242 |
, 0,025 = 39,36 , |
|||
P |
12,4 < 24S 2 |
≤ 39,36 |
= 0,95; 2,07 < S 2 |
≤ 6,56 . |
|
|
|
|
|
4 |
|
|
|
|
|
|
|
|
|
|
|
|
|
Пусть величина x(k) имеет нормальное распределение со средним значе-
|
|
Stn, α |
|
|
|
нием μx и неизвестной дисперсией. Тогда |
P x > |
|
+μx |
= α. |
|
N |
|||||
|
|
|
|
Пример 2. Пусть необходимо извлечь выборку объёма N = 25 независимых наблюдений нормально распределённой случайной величины x(k) с математическим ожиданием μx = 10 и неизвестной дисперсией. Определим интервал, в который с вероятностью 95% будет заключено выборочное среднее значение.
|
Stn, α |
|
|
|
Из формулыP x > |
|
+μx |
= α следует, что |
|
N |
||||
|
|
|
P t |
24, 1−α/ 2 |
< |
(x −10) |
25 |
≤ t |
24, |
|
=1−α . |
||
|
|
|
|
|||||||
|
|
|
S |
|
|
|
α/ 2 |
|||
|
|
|
|
|
|
|
|
|
|
|
По статистическим таблицам t24, 0,025 = – t24, 0,975 = 2,064, тогда |
||||||||||
|
|
|
|
(x −10) |
5 |
|
|
|
|
|
|
P − 2,064 |
< |
|
|
≤ 2,064 |
= 0,95 |
||||
|
S |
|
||||||||
|
|
|
|
|
|
|
|
|
|
|
и 10 −0,413S < x ≤10 + 0,413S . |
|
|
|
|
|
|
|
|
||
Рассмотрим дисперсии двух выборок: одной, состоящей из Nx независимых наблюденных значений случайной величины x(k), и другой, состоящей из Ny
независимых наблюдаемых значений случайной величины |
y(k). Выборочная |
||||
|
1 |
|
N |
|
|
дисперсия определяется формулой S 2 = |
|
∑(xi − x)2 . Пусть величина x(k) |
|||
N −1 |
|||||
|
i =1 |
|
|||
|
|
|
и дисперсией σ2x , |
||
подчиняется нормальному закону со средним значением μx |
|||||
величина y(k) подчиняется нормальному закону со средним значением μy и дис-
персией σ2y . Укажемраспределениявыборочныхзначенийдисперсий Sx2 и Sy2 .
52
S 2 |
σ2 |
|
|
x |
x |
= F |
, |
|
|
||
Sy2 |
|
nx, ny |
|
σ2y |
|
||
где nx = Nx – 1, ny = Ny – 1.
Величина Fnx, ny имеет F-распределение с nx и ny степенями свободы.
Отсюда вытекает следующее вероятностное утверждение об отношении выборочных дисперсий:
S 2 |
|
σ2 |
|
|
|
||
P |
x |
> |
x |
F |
|
= α . |
|
S 2 |
|||||||
|
|
σ2 |
nx, ny; α |
|
|
||
y |
|
y |
|
|
|||
|
|
|
|
|
|
|
|
Если выборки состоят из наблюдений над одной и той же случайной ве-
S 2
личиной x(k) = y(k), то формула примет вид Sx2 > Fnx, ny .
y
Пример 3. Пусть производится выборка наблюдений объёма Nx = 25 из независимых наблюдений нормально распределённой величины x(k) с матема-
тическим ожиданием μx = 10 и дисперсией σ2x = 4 и выборка наблюдений объёма Ny = 10 из независимых наблюдений нормально распределённой величины x(k) с математическим ожиданием μy = 100 и дисперсией σ2y = 8. Определим
интервал, в который с вероятностью 95% будет заключено отношение выборочных дисперсий:
|
|
|
|
2 |
4 |
|
|
|
|
|
|
|
|
|
|
P F |
< |
Sx |
≤ F |
|
|
α/ 2 |
|
=1 |
−α . |
|
|||||
|
|
|
|
|
|||||||||||
|
21,9; 1−α/ 2 |
|
S |
2 |
8 |
|
21,9; |
|
|
|
|
|
|||
|
|
|
y |
|
|
|
|
|
|
|
|
|
|
||
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
По статистическим таблицам |
F |
|
|
|
|
= |
|
1 |
|
= 0,37 , 0,18 < |
Sx2 |
≤1,8 . |
|||
|
|
|
|
|
|
|
|||||||||
|
|
|
21,9; 0,975 |
|
|
F21,9; 0,025 |
|
Sy2 |
|
||||||
|
|
|
|
|
|
|
|
|
|
|
|||||
5.9. ТОЧЕЧНАЯ ОЦЕНКА ЭКСПЕРИМЕНТАЛЬНЫХ ДАННЫХ
Точечная оценка предполагает нахождение единственной числовой величины, которая и принимается за значение параметра. Такую оценку целесообразно определять в тех случаях, когда объём экспериментальных данных достаточно велик. Не существует единого понятия о достаточном объёме экспериментальных данных, его значение зависит от вида оцениваемого параметра. Предварительно будем считать достаточной выборку, содержащую не менее чем 10 значений. При малом объёме экспериментальных данных точечные оценки могут значительно отличаться от истинных значений параметров, что делает их непригодными для использования.
Задача точечной оценки параметров в типовом варианте постановки состоит в следующем.
53
Имеется выборка наблюдений (x1, x2, …, xn) за случайной величиной Х. объём выборки n фиксирован. Известен вид закона распределения величины Х, например, в форме плотности распределения f (T, x), где T – неизвестный (в общем случае векторный) параметр распределения. Параметр является неслучайной величиной. Требуется найти оценку θ параметра T закона распределения.
Существует несколько методов решения задачи точечной оценки параметров. Наиболее употребительными из них являются методы максимального (наибольшего) правдоподобия, моментов и квантилей.
Метод максимального правдоподобия предложен Р. Фишером в 1912 г. Метод основан на исследовании вероятности получения выборки наблюдений
(x1, x2, …, xn). Эта вероятность равна f (х1, T) f (х2, T) … f (хп, T) dx1 dx2 … dxn.
Совместная плотность вероятности
L(x1, x2, …, xn; T) = f (х1, T) f (х2, T) … f (хп, T), |
(21) |
рассматриваемаякакфункцияпараметраT, называетсяфункциейправдоподобия. В качестве оценки θ параметра T следует взять то значение, которое обращает функцию правдоподобия в максимум. Для нахождения оценки необходимо заменить в функции правдоподобия Т на f (х1, T),f (х2, T), … , f (хп, T) и
решить уравнение ∂L / ∂θ = 0.
Для упрощения вычислений переходят от функции правдоподобия к её логарифму ln L. Такое преобразование допустимо, так как функция правдоподобия – положительная функция, и она достигает максимума в той же точке, что и её логарифм. Если параметр распределения векторная величина
θ = (θ1, θ2, …, θп),
то оценки максимального правдоподобия находят из системы уравнений
∂ln L(θ1, θ2 , ..., θn ) = 0; |
|
∂θ1 |
|
∂ln L(θ1, θ2 , ..., θn ) = 0; |
|
∂θ2 |
|
…………………………. |
|
∂ln L(θ1, θ2 , ..., θn ) = 0. |
(22) |
∂θn |
|
Для проверки того, что точка оптимума соответствует максимуму функции правдоподобия, необходимо найти вторую производную от этой функции. И если вторая производная в точке оптимума отрицательна, то найденные значения параметров максимизируют функцию.
Нахождение оценок максимального правдоподобия включает следующие этапы: построение функции правдоподобия (её натурального логарифма); дифференцирование функции по искомым параметрам и составление системы уравнений; решение системы уравнений для нахождения оценок; определение второй производной функции, проверку её знака в точке оптимума первой производной и формирование выводов.
54
Метод максимального правдоподобия позволяет получить состоятельные, эффективные, достаточные, асимптотически нормально распределённые оценки. Метод особенно полезен при малых выборках. Если функция максимального правдоподобия имеет несколько максимумов, то из них выбирают глобальный.
Метод моментов предложен К. Пирсоном в 1894 г. Сущность метода:
–выбирается столько эмпирических моментов, сколько требуется оценить неизвестных параметров распределения. Желательно применять моменты младших порядков, так как погрешности вычисления оценок резко возрастают
сувеличением порядка момента;
–вычисленные по экспериментальным данным оценки моментов приравниваются к теоретическим моментам;
–параметры распределения определяются через моменты, и составляются уравнения, выражающие зависимость параметров от моментов, в результате получается система уравнений. Решение этой системы даёт оценки параметров распределения генеральной совокупности.
Метод моментов позволяет получить состоятельные, достаточные оценки, которые при довольно общих условиях распределены асимптотически нормально. Смещение удаётся устранить введением поправок. Эффективность оценок невысокая, т.е. даже при больших объёмах выборок дисперсия оценок относительно велика (за исключением нормального распределения, для которого метод моментов даёт эффективные оценки). В реализации метод моментов проще метода максимального правдоподобия. Метод целесообразно применять для оценки не более чем четырёх параметров, так как точность выборочных моментов резко падает с увеличением их порядка.
Сущность метода квантилей схожа с сущностью метода моментов: выбирается столько квантилей, сколько требуется оценить параметров; неизвестные теоретические квантили, выраженные через параметры распределения, приравниваются к эмпирическим квантилям. Решение полученной системы уравнений даёт искомые оценки параметров.
Дисперсия D(xa) выборочной квантили обратно пропорциональна квадрату плотности распределения
D(xa) = [α(1 – α)] / [nf 2(xa)] |
(23) |
в окрестностях точки xa. Поэтому следует выбирать квантили вблизи тех значений х, в которых плотность вероятности максимальна.
Метод квантилей позволяет получить асимптотически нормальные оценки, однако они несут в себе некоторый субъективизм, связанный с относительно произвольным выбором квантилей. Эффективность оценок не выше метода моментов. Определение оценок может приводить к необходимости численного решения достаточно сложных систем уравнений.
5.10. ИНТЕРВАЛЬНАЯ ОЦЕНКА ПАРАМЕТРОВ РАСПРЕДЕЛЕНИЯ
Интервальный метод оценивания параметров распределения случайных величин заключается в определении интервала (а не единичного значения), в котором с заданной степенью достоверности будет заключено значение оце-
55
ниваемого параметра. Интервальная оценка характеризуется двумя числами – концами интервала, внутри которого предположительно находится истинное значение параметра. Иначе говоря, вместо отдельной точки для оцениваемого параметра можно установить интервал значений, одна из точек которого является своего рода «лучшей» оценкой. Интервальные оценки являются более полными и надёжными по сравнению с точечными; они применяются как для больших, так и для малых выборок. Совокупность методов определения промежутка, в котором лежит значение параметра Т, получила название методов интервального оценивания. К их числу принадлежит метод Неймана.
Постановка задачи интервальной оценки параметров заключается в следующем.
Имеется выборка наблюдений (x1, x2, …, xn) за случайной величиной Х. Объём выборки n фиксирован.
Необходимо с доверительной вероятностью γ = 1 – α определить интервал от t0 до t1 (t0 < t1), который накрывает истинное значение неизвестного скалярного параметра Т.
Эта задача решается путём построения доверительного утверждения, которое состоит в том, что интервал от t0 до t1 накрывает истинное значение параметра Т с доверительной вероятностью не менее γ. Величины t0 и t1 называются нижней и верхней доверительными границами. Доверительные границы интервала выбирают так, чтобы выполнялось условие P (t0 ≤ θ < t1) = γ.
В инженерных задачах доверительную вероятность γ назначают в пределах от 0,95 до 0,99. В доверительном утверждении считается, что статистики t0 и t1 являются случайными величинами и изменяются от выборки к выборке. Это означает, что доверительные границы определяются неоднозначно, существует бесконечное количество вариантов их установления.
На практике применяют два варианта задания доверительных границ:
– устанавливают симметрично относительно оценки параметра, т.е. t0 = θ− Eg , t1 = θ+ Eg , где Eg выбирают так, чтобы выполнялось доверитель-
ное утверждение. Следовательно, величина абсолютной погрешности оценивания Eg равна половине доверительного интервала;
–устанавливают из условия равенства вероятностей выхода за верхнюю
инижнюю границу P(T > θ+ E1) = P(T < θ− E1) = α/ 2 .
В общем случае величина Е1 не равна Е2. Для симметричных распределений случайного параметра θ в целях минимизации величины интервала значения Е1 и Е2 выбирают одинаковыми, следовательно, в таких случаях оба варианта эквивалентны.
Нахождение доверительных интервалов требует знания вида и параметров закона распределения случайной величины θ. Для ряда практически важных случаев этот закон можно определить из теоретических соображений.
Общий метод построения доверительных интервалов позволяет по имеющейся случайной выборке построить функцию и(Т, θ), распределённую
56
асимптотически нормально с нулевым математическим ожиданием и единичной дисперсией. В основе метода лежат следующие положения. Пусть
–f (х, θ) – плотность распределения случайной величины Х;
–ln [L(x, θ)] – логарифм функции правдоподобия;
–y = ∂∂θ ln f (x, θ) ;
–дисперсия y.
Если математическое ожидание М(у) = 0 и дисперсия у конечна, то рас-
пределение случайной величины w = |
1 |
|
|
∂ |
ln L(x, θ) асимптотически нор- |
|
A |
n ∂θ |
|||||
|
|
|||||
мально с параметрами 0 и 1 при неограниченном увеличении n.
Рассмотрим случай, когда среднее значение x выборки объёма N значений случайной величины x(k) используется в качестве оценки истинного значения μx. Практически полезнее находить для истинного среднего значения μx такой интервал x ± d , в который с некоторой степенью достоверности будет
заключено истинное значение μx. Этот интервал можно найти, если известно выборочное распределение используемой в качестве оценки выборочной величины. Для нормально распределённой случайной величины с неизвестным средним значением и дисперсией эту вероятность находят следующим образом:
|
|
(x −μx ) N |
|
|
|
|
|
P tn, 1−α/ 2 |
< |
|
≤ tn, α/ 2 |
|
=1−α, n = N. |
(24) |
|
s |
|||||||
|
|
|
|
|
|
После извлечения выборки значения x и s принимают определённые числовые значения, а значит, не являются случайными. Поэтому данное выраже-
ние для вероятности уже не приемлемо, так как величина |
(x −μx ) |
N |
либо |
s |
|
||
|
|
|
попадает, либо не попадает в указанные пределы, т.е. после того, как выборка
извлечена, |
|
теоретически верное |
выражение для вероятности имеет вид |
|||||||||
|
|
( |
|
−μ |
|
) N |
|
|
|
0 |
|
|
|
x |
x |
|
|
|
|||||||
P tn, 1−α/ 2 |
< |
|
|
|
|
|
≤ tn, α/ 2 |
|
= . |
Будет ли точное значение вероятности |
||
|
|
|
s |
|
||||||||
|
|
|
|
|
|
|
|
|
1 |
|
||
равно 0 или 1 обычно не известно. Однако если повторно извлекается большое
число выборок и по каждой из выборок вычисляются x |
и s, то следует ожи- |
||
дать, что доля случаев, для которых отношение |
(x −μx ) |
N |
будет попадать |
s |
|
||
|
|
|
|
винтервал от tn, 1 – α/2 до tn, α/2 , составит 1 − α.
Втаких случаях можно указать интервал, в который, как можно ожидать,
отношение |
(x −μx ) |
N |
попадёт с большой степенью достоверности. Такой |
s |
|
||
|
|
|
интервал называют доверительным интервалом.
При оценке среднего значения доверительный интервал можно получить по известным выборочным величинам x и s.
57
|
|
|
|
|
|
|
|
|
( |
|
|
−μx ) |
|
N |
|
|
|
|
|
||||
|
|
tn, 1−α/ 2 < |
x |
≤ tn, α/ 2; |
|
||||||||||||||||||
|
|
|
|
|
|
|
s |
|
|
|
|
|
|||||||||||
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
tn, 1−α/ 2 = −tn, α/ 2 ; |
|
|
|
|
|||||||||||||
|
|
|
|
|
tn, α/ 2s |
|
|
|
|
|
|
tn, α/ 2s |
|
|
|
|
|||||||
|
|
x − |
|
≤ μx < |
+ x . |
(25) |
|||||||||||||||||
|
|
|
|
N |
|
|
|
|
|
|
N |
||||||||||||
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|||
Доверительная вероятность, соответствующая данному интервалу, со- |
|||||||||||||||||||||||
ставляет 1 − α. |
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
Аналогичные выводы можно сделать для оценок любых параметров. |
|
||||||||||||||||||||||
Например, из формулы |
|
ns2 |
|
|
2 |
можно получить доверительный интер- |
|||||||||||||||||
|
|
|
|
= χn |
|||||||||||||||||||
|
σ2 |
||||||||||||||||||||||
вал при оценке дисперсии |
|
|
x |
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|||||
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|||||
|
|
ns2 |
|
|
|
|
|
|
2 |
|
|
ns2 |
, n |
= N −1. |
|
||||||||
|
|
|
|
|
|
|
≤ σx ≤ |
|
|
|
|
|
|
||||||||||
|
χ |
|
|
|
|
|
χ |
|
|
|
|
|
|||||||||||
|
n, 1−α/ 2 |
|
|
|
|
|
n, |
α/ 2 |
|
|
|
|
|
||||||||||
|
|
|
|
|
|
|
|
|
|
|
|
|
|||||||||||
Пример 4. Пусть имеется нормально распределённая случайная величина x(k). Произведено N = 31 независимых наблюдений этой величины x:
60 |
61 |
47 |
56 |
61 |
65 |
69 |
54 |
59 |
43 |
63 |
61 |
55 |
61 |
56 |
48 |
67 |
65 |
60 |
58 |
57 |
62 |
57 |
58 |
53 |
59 |
58 |
61 |
67 |
62 |
54 |
|
|
|
|
|
|
|
|
|
Найдём 90 %-е доверительные интервалы для среднего значения и дисперсии случайной величины х. Определим доверительный интервал с уровнем доверия 1 − α для среднего значения μx по выборочному среднему x и дисперсии s2 при размере выборки N = 31:
|
|
|
x − |
t30, α/ 2s |
|
≤ μx < |
|
t30, α/ 2s |
+ x . |
|
||||||
|
|
|
|
31 |
|
|
31 |
|
|
|||||||
|
|
|
|
|
|
|
|
|
|
|
|
|
||||
|
По статистическим таблицам для α = 0,1 находим t30; 0,05 = 43,77, значит |
|||||||||||||||
интервал имеет вид |
|
−0,3048s ≤ μx < 0,3048s + |
|
. |
|
|
|
|||||||||
x |
x |
|
|
|
||||||||||||
|
Доверительный интервал дисперсии σ2x с уровнем доверия 1 − α строится |
|||||||||||||||
по выборочной дисперсии s2 при размере выборки N = 31: |
|
|||||||||||||||
|
|
|
|
|
30s2 |
2 |
|
30s2 |
|
|
|
|||||
|
|
|
|
|
|
|
|
≤ σx < |
|
|
|
|
|
. |
|
|
|
|
|
|
χ2 |
|
|
χ2 |
|
|
|||||||
|
|
|
|
α/ 2 |
|
|
|
|
||||||||
|
|
|
|
|
30, |
|
|
30, 1−α/ 2 |
|
|||||||
|
По статистическим таблицам |
для |
α = 0,1 находим χ302 |
; 0,05 = 43,77 и |
||||||||||||
χ302 |
; 0,9518,49 , поэтому интервал имеет вид 0,6854s2 ≤ σ2x <1,622s2. |
|||||||||||||||
|
Вычислим выборочное среднее и выборочную дисперсию и подставим |
|||||||||||||||
полученные значения в формулы доверительных интервалов. Выборочное среднее вычислим по формуле
58
x = 1 ∑N xi = 58,61.
N i =1
Выборочную дисперсию находим по формуле
|
1 |
N |
|
s2 = |
∑(xi − x)2 = 33,43. |
||
|
|||
|
N −1 i=1 |
||
Доверительные интервалы с уровнем доверия 90% для среднего значения и дисперсии случайной величины таковы:
56,58 ≤ μx < 60,37;
22,91 ≤ σ2x <154,22.
5.11. КОРРЕЛЯЦИОННЫЙ АНАЛИЗ
Величины, характеризующие различные свойства объектов, могут быть независимыми или взаимосвязанными. Различают два вида зависимостей между величинами (факторами): функциональную и статистическую.
При функциональной зависимости двух величин значению одной из них обязательно соответствует одно или несколько точно определённых значений другой величины. Функциональная связь двух факторов возможна лишь при условии, что вторая величина зависит только от первой и не зависит ни от каких других величин. Функциональная связь одной величины с множеством других возможна, если эта величина зависит только от этого множества факторов. В реальных ситуациях существует бесконечно большое количество свойств самого объекта и внешней среды, влияющих друг на друга, поэтому такого рода связи не существуют, иначе говоря, функциональные связи являются математическими абстракциями. Их применение допустимо тогда, когда соответствующая величина в основном зависит от соответствующих факторов.
При исследовании функционирования систем многие параметры следует считать случайными, что исключает проявление однозначного соответствия значений. Воздействие общих факторов, наличие объективных закономерностей в поведении объектов приводят лишь к проявлению статистической зависимости. Статистической называют зависимость, при которой изменение одной из величин влечёт изменение распределения других (другой), и эти другие величины принимают некоторые значения с определёнными вероятностями. Функциональную зависимость в таком случае следует считать частным случаем статистической: значению одного фактора соответствуют значения других факторов с вероятностью, равной единице. Однако на практике такое рассмотрение функциональной связи применения не нашло.
Более важным частным случаем статистической зависимости является корреляционная зависимость, характеризующая взаимосвязь значений одних случайных величин со средним значением других, хотя в каждом отдельном случае любая взаимосвязанная величина может принимать различные значения.
Если же у взаимосвязанных величин вариацию имеет только одна переменная, а другая является детерминированной, то такую связь называют
59
не корреляционной, а регрессионной. Например, при анализе скорости обмена с жёсткими дисками можно оценивать регрессию этой характеристики на определённые модели, но не следует говорить о корреляции между моделью и скоростью.
При исследовании зависимости между одной величиной и такими характеристиками другой, как, например, моменты старших порядков (а не среднее значение), то эта связь будет называться статистической, а не корреляционной.
Термин «корреляция» впервые применил французский палеонтолог Ж. Кювье, который вывел «закон корреляции частей и органов животных» (этот закон позволяет восстанавливать по найденным частям тела облик всего животного). В статистику указанный термин ввел английский биолог и статистик Ф. Гальтон (не просто связь – relation, а «как бы связь» – co-relation). Корреляционная связь описывает следующие виды зависимостей:
–причинную зависимость между значениями параметров. Примером такой зависимости является взаимосвязь пропускной способности канала передачи данных и соотношения сигнал/шум (на пропускную способность влияют и другие факторы – характер помех, амплитудно-частотные характеристики канала, способ кодирования сообщений и др.). Установить однозначную связь между конкретными значениями указанных параметров не удаётся. Но очевидно, что пропускная способность зависит от соотношения уровней сигнала и помех в канале. Иногда причину и следствие особо не выделяют. В некоторых случаях такая корреляция является бессмысленной, например: если в качестве исходного фактора взять доходы разработчиков антивирусных программ, а за результат – количество вновь появляющихся вирусов, то можно сделать вывод, что разработчики антивирусов «стимулируют» создание вирусов;
–«зависимость» между следствиями общей причины. Подобная зависимость характерна, в частности, для скорости и безошибочности набора текста оператором (указанные факторы зависят от квалификации оператора).
Существование взаимных связей двух и более случайных величин и их относительную силу можно измерить с помощью корреляционного момента (коэффициента ковариации):
|
1 |
N |
|
|
ξx, y = |
∑(xi −μx ) ( yi −μy ). |
(26) |
||
N |
||||
|
i=1 |
|
||
|
|
|
Этот показатель неудобен для практического применения, так как имеет размерность, равную произведению размерностей вариант, и по его величине трудно судить о зависимости параметров.
Коэффициент ковариации ρx, y нормированных случайных величин называют коэффициентом корреляции, его оценка
|
N |
|
|
|
|
∑(xi −μx ) ( yi −μy ) |
|
||
ρx, y = |
i =1 |
|
. |
(27) |
N |
|
|||
|
N |
|
||
|
∑(xi −μx )2 |
∑( yi −μy )2 |
|
|
|
i=1 |
i =1 |
|
|
60
