Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Основы научных исследований. Учебное пособие-3

.pdf
Скачиваний:
1
Добавлен:
07.09.2026
Размер:
2 Мб
Скачать
☆
71
exp(θ
1x1
)+exp(θ2x2).
В дальнейшем будут рассмотрены в основном линейные модели вида:
θ
0f0(X1,X2
,…)+θ1f1(X1,X2,…),
где fi – известные функции.
Примером простой линейной модели (физической) является закон Ома, со­гласно которому ток I, протекающий через сопротивление R, связан с падением напряжения U соотношением I=U/R. Эта прямая линия, проходящая через начало прямоугольных координат. Величину θ определяют из графика по наклону эмпи­рической линии.
Кроме разумной интерпретации полученных результатов регрессионный анализ позволяет предсказывать значение Y для будущих значений Х. Для надежности предсказаний, необходима уверенность в справедливости принятой модели.
Статистическими задачами регрессионного анализа являются:
–
получение наилучших точечных и интервальных оценок неизвестных пар
–
метров регрессии;
–
проверка гипотезы относительно этих параметров;
–
проверка адекватности предлагаемой модели.
Для решения поставленных выше статистических задач необходимо соблю­дение следующих условий:
–
погрешность в определении аргумента Х должна быть значительно
меньше, чем погрешность Y;
–
результаты наблюдений должны представлять собой независимые нор-
мально распределенные случайные величины;
–
выборочные дисперсии должны быть однородны.
Наиболее часто в качестве модели используется степенной полином вида:
   

где a1+a2x+…+am – параметры модели.
Такая модель при правильном выборе порядка полинома позволяет с любой необходимой точностью аппроксимировать истинную регрессионную зависи­мость. Достоинством модели является также то, что функция линейна относи­тельно неизвестных параметров а1, а2,…аm, что упрощает обработку наблюдений. В данном случае вопрос выбора модели сводится к выбору порядка m-1 полино­ма.
После выбора вида регрессионной модели вычисляют ее параметры. Для
(6.3.8)
(6.3.7)
(6.3.9)
72
модели (6.3.9) необходимо получить оценки параметров а1,а2,…аm.
Для аналитического определения параметров предположим, что Yi (i=1,2,…,n)- это значения выходного параметра объекта, определяемые регресси­онной зависимостью отX1, а Yi– соответствующие результаты измерений выход-
ного параметра. Составим разности между
i
и Yiдля каждого экспериментально-
го значения
i
.
ε
1
=
1-Y1
=
1-a1-a2x2-a3(x1
)2-....-am(x1)
m-1
;
ε
2
=
2-Y2
=
2-a1-a2x2-a3(x2
)2-....-am(x2)
m-1
;
ε
n
=
n-Yn
=
n-a1-a2xn-a3(xn
)2-....-am(xn)
m-1
.
Для нахождения неизвестных констант потребуем минимума квадратичной формы вида

󰇛󰇜

󰇛
 󰇜

Дифференцируя последнее выражение по параметрам аi и приравнивая по­лученные соотношения нулю, получим систему нормальных уравнений
󰇟

󰇛   
󰇛
󰇜

󰇜󰇠

󰇟

󰇛   
󰇛
󰇜

󰇜󰇠
 
󰇟

󰇛   
󰇛
󰇜

󰇜󰇠
 󰇛󰇜


Преобразовав ее к стандартному виду, получим:
  

  
󰇛
󰇜





󰇛
󰇜  
󰇛
󰇜



󰇛
󰇜

 
󰇛
󰇜


 
󰇛
󰇜
󰇛
󰇜


󰇛
󰇜

  
󰇛
󰇜



В соответствии с формулами (6.3.10) задача поиска коэффициентов ai сведе­на к решению системы линейных уравнений. Методы решения их достаточно хо-
(6.3.10)
73
рошо разработаны, и имеются соответствующие программы на ЭВМ. Вычисли­тельные значения ai обеспечивают многочлену минимальное квадратичное откло­нение от заданных точек.
В случае линейной зависимости типа y=a+bx решают систему нормальных уравнений:
  


.
При этом получают следующие выражения для коэффициентов:

󰇛
󰇜




 
󰇛
󰇜 󰇛
󰇜



 



 
󰇛
󰇜 󰇛

󰇜

Не следует сужать область использования этой модели только линейными зависимостями. Имеются и существенно нелинейные соотношения, к которым можно при определенных условиях применять аппарат линейной регрессии [18]. Для этого используется некоторое преобразование, позволяющее наблюдаемую нелинейную зависимость путем преобразований представить в линейном виде. Если преобразование такого вида произведено и получена прямая линия, то пара­метры нелинейной модели можно найти из модифицированной линейной модели.
6.4 Применение дисперсионного анализа для проверки статистической
однородности ряда экспериментов
Дисперсионный анализ – статистический метод анализа результатов наблю­дений, зависящих от различных одновременно действующих факторов, выбор наиболее важных факторов и оценки их влияния. Наблюдения могут проводиться как в экспериментальных науках (например, в электросвязи), так и в не экспери­ментальных науках (например, в экономике). Теория анализа результатов наблю­дений подсказывает, как планировать проведение наблюдения, то есть приводит к планированию эксперимента.
Влияние изучаемых факторов может быть двояким: они могут изменять как
дисперсию наблюдений
, так и истинный результат (среднее) наблюдений. При сравнении между собой результатов наблюдений необходимо установить, можно ли считать различие между этими результатами достаточным, чтобы иметь уве­ренность в его неслучайном происхождении. С этой целью необходимо:
1. Проверить гипотезу о равенстве генеральных дисперсий с сравниваемых сериях наблюдений по критерию Фишера или Кохрена.
(6.3.11)
(6.3.12)
(6.3.13)
74
2. Сравнить между собой среднее значение результатов наблюдений по
критерию Стьюдента.
Рассмотренные ниже методы справедливы при нормальном законе распре-
деления результатов наблюдений.
Статическая обработка ряда наблюдений дает достоверные результаты, если результаты выборки статистически устойчивы (однородны), то есть принадлежат одной генеральной совокупности. Проверка однородности ряда наблюдений осу­ществляется путем разбиения ряда наблюдений на группы и сравнения их стати­стических характеристик. Если результаты наблюдений этих групп принадлежат одной генеральной совокупности, то вычисленные групповые оценки диспер-
сий󰇛
)2 есть суть оценки дисперсии этой генеральной совокупности, поэтому их
различие должно быть не слишком большим и удовлетворять определенным ста­тистическим закономерностям. Проверка этой нулевой гипотезы может осу­ществлена с помощью ряда статистических критериев Аббе, Бартлета, Кохрена, Фишера).
Пусть из нормально распределенной совокупности, имеющей дисперсию 󰏂
,
взяты две независимые случайные выборки объемов n1 и n6. Обозначим диспер-
сии выборок через (
)
2
и (
)2 :
󰇛

󰇜

󰇛

󰇜

󰇛 󰇜
󰇛

󰇜

󰇛
 
󰇜

󰇛 󰇜
󰇛󰇜Отношение оценок дисперсий выборок, так называемый показательно до-
стоверности:
э=(
)
2
/(
)
2
Как установил Р.Фишер, является случайной величиной, подчиняющейся
определенному закону, и зависит только от числа степеней свободы =  и
= [22]
F=(P,,) = (
)
2
  / ((
)
2
 
), (6.4.4)
где (
)
2
и (
)2 – распределение К.Пирсона (хи-квадрат);
F=(P,,
) – критическое значение распределения Фишера (таблица приложения
Х), зависящее от доверительной вероятности Р и чисел степеней свободы  и
,
причем
соответствует большей дисперсии.
Проверку нулевой гипотезы о принадлежности выборок n1 и n2 к одной ге­неральной совокупности осуществляется путем сравнения фактического (экспе-
риментального) отношения оценок дисперсий э=(
)
2
/(
)2 ( в числитель ставят
большую оценку) с теоретическим значением Fт , определенным согласно распре­делению Р.Фишера для заданной вероятности Ркр, из соотношения:
(6.4.1)
(6.4.2)
(6.4.3)
75
Р(
)
2
/(
)2<Fт=Ркр.
Величину q=1- Р
кр
называют уровнем значимости, значение которого обыч-
но выбирается в пределах 0.001-0.05. Это соответствует классификации явлений на: редкие (q=0.05), очень редкие (q=0.01) и чрезвычайно редкие (q=0.001). Уро­вень значимости q характеризует вероятность того, что справедливая гипотеза бу­дет отвергнута.
При выборе значения уровня значимости q следует учитывать, что с его уменьшением возрастает вероятность принятия несправедливой гипотезы (в из­мерительной технике чаще всего выбирают q=0.05). Если значение Fэ<Fт , то группа принадлежит к совокупности, в противном случае к разным совокупно­стям и ряда наблюдений, из которых они взяты, статистически неоднороден.
Если выборка содержит большое число наблюдений n (n>40), то ее целесо­образно разбить на группы равных объёмов. В этом случае однородность диспер­сий и пригодность результатов анализа для совместной обработки удобно прове­рить с помощью критерия Кохрена.
Для этого вычисляют все выборочные дисперсии (
)2 и составляют отно-
шение наибольшей из дисперсий к общей сумме всех выборочных дисперсий:
󰇛
макс
󰇜
󰇛с󰇜

Дисперсия считаются однородными, если рассчитанное значение критерия
Кохрена  меньше табличного т. Распределение случайной величины
т
зави-
сит только от суммируемых дисперсий k и числа степеней свободы ν, с которым определена каждая дисперсия. В таблице ХI приведены критические точки рас­пределения Кохрена для уровня значимости 0.05 (k- число сравниваемых диспер­сий).
Всю совокупность экспериментальных данных называют генеральной сово- купностью, а количество данных N- объемом генеральной совокупности. Если N велико, то часто удобно полагать, что N бесконечно. Случайной выборкой назы­вают наугад выбранную часть генеральной совокупности, а количество данных в выборке - n объемом выборки. Можно представить выборку [6]
{Xi. i=1,2,..,n}.
Как результат изменения величины Х в n экспериментах, выполненных в одинаковых условиях. Поскольку выборок может быть много и в каждой выборке могут быть свои значения Хi, то все Хi в выборке можно рассматривать как слу­чайные величины.
Пусть А- некоторый статистический параметр, характеризующий случай­ную величину Х. приближенное значение этого параметра, полученное с помо-
щью выборки, называют выборочной оценкой и обозначают А*, А или А в отличие
(6.4.6)
(6.4.7)
(6.4.3)
76
от точной, статистической величины А. Следовательно, выборочная оценка- одна из статистик [6]:
󰆹
󰆻
[(Xi; i=1,2,…,n)].
Статистиками могут быть оценки моментов, квантилей, моды распределе­ний, параметров в функциональных выражениях для плотностей распределения и др. различают точечные и интервальные оценки. Точечные оценки дают одно зна­чение оцениваемой величины, интервальные - некоторый интервал значений. По­скольку оценки-функции случайных выборок, они тоже являются случайными ве­личинами и при их анализе следует пользоваться методами теории вероятностей.
Пусть была измерена величина Х. Систематические погрешности устране­ны, проводятся повторные наблюдения в одинаковых условиях. Разумно предпо­ложить, что наилучшей оценкой Х для данной выборки будет так называемое ма- тематическое ожидание случайной величины. Приближенной оценки математи­ческого ожидания, в свою очередь, будет среднее данного ряда (выборки) чисел (иногда его называют «средним арифметическим»):
󰇛󰇜

󰇛󰇜
󰇛 󰇜
 
(6.4.9)
где
󰇛󰇜
и
- выборочные оценки математического ожидания;
Х
– среднее арифметическое из наблюдений;
 – случайные величины в выборке;
 – число случайных величин в выборке.
Но Х дает только точечную оценку измеряемой величины, поэтому необхо­дим еще один параметр, учитывающий степень разброса результатов вокруг сред­него. Для этой цели вводят понятие среднего квадратического отклонения выбор- ки. Необходимость ввода такого понятия обусловлена непригодностью показателя усредненного отклонения для оценки степени разброса случайных величин от арифметического среднего, так как отклонения разных знаков при суммировании компенсируют друг друга. Следовательно, необходимо усреднять не сами откло­нения, а их квадраты, а для того, чтобы получить отклонение такой же размерно­сти, что и измеряемая величина, надо извлечь из этого среднего квадратный ко­рень. Тогда выражение для отклонения примет вид:
   
 

󰇛 󰇜

где *
xi
- смещенная оценка среднего квадратического отклонения.
Этот показатель называют стандартным отклонением данный выборки значений случайной величины.
Существуют теоретические аргументы, согласно которым для устранения смещения оценки число n в знаменателе формулы (6.1.4) следует заменить на n-1,
поэтому окончательно определим как:
(6.4.8)
(6.4.10)
77

 

󰇛 󰇜

При больших значениях n оценки по формулам (6.4.21) и (6.4.22) практиче­ски не различаются. В области измерений этот показатель имеет смысл среднего квадратического отклонения результата наблюдения.
Если же имеется необходимость определения относительной погрешности
через 
x
, то вводят так называемый коэффициент вариации:


Другим распространённым статистическим параметром выборки является
дисперсия (
хi
)2 которая является квадратом стандартного отклонения и вычисля-
ется по формуле:
󰇛󰇜
󰇛
  
󰇜

󰇛  󰇜

Среднеквадратическое отклонение среднего результата измерения опреде­ляется как:


Преимущество этого показателя в том, что в него введена зависимость от числа наблюдений n. Это соответствует нашему интуитивному представлению о том, что с увеличением числа измерений точность предсказания Х должна повы­шаться. Следует заметить, что эта зависимость не строго обратно пропорциональ­ная, а в степени (-1/2).
Вместо стандартного отклонения xi или величины х применяют иногда
вероятную ошибку (ВО), то есть такое отклонение, когда результат с вероятно­стью 50% попадает в интервал Х+-ВО:
ВО=0.67 
xi
-для результата наблюдения
ВО=0.67 
х
– для результата измерения
Расчет статистических параметром выброски целесообразно проводить на программируемом микрокалькуляторе или ЭВМ. Необходимые программы даны в литературе (7-13). Перечень некоторых из них в табл. 6.1 [2].
Другим характерным интервалом является так называемый «трехсигмовый диапазон» :
󰇟
   
х
   
х
󰇠
(6.4.14) (6.4.11)
(6.4.12)
(6.4.13)
(6.4.15)
78
Если погрешности распределены по нормальному закону, выход измеряе­мой величины за такой широкий интервал очень маловероятен (вероятность тако­го события равно 0.0027). Если в выборе небольшого объема все же встречаются выходящие за трехсигмовый предел результаты, их можно расценивать как гру­бые ошибки. Это может также означать, что закон распределения данной выброс­ки отличается от нормального и тогда необходимо использовать другую стати­стическую модель.
6.5 Проверка выборки на ее соответствие нормальному закону
Все приведенные выше оценки как средних, так среднеквадратических зна­чений основанные на гипотезе нормальности закона распределения случайных величин в выборке и поэтому могут применяться лишь до тех пор, пока результа­ты эксперимента не противоречат этой гипотезе. Действующая нормативно­техническая документация [17] устанавливает правила проверки согласия распре­деления величины, полученной по результатам наблюдений, с предполагаемым теоретическим распределением. В соответствии с этим документом наблюдения необходимо производить в практически одинаковых условиях, исследуемая сово­купность результатов должна быть однородной. При числе наблюдений n>100 ре­комендуется применять критерий Колмогорова и х2 (критерий Пирсона); если n>50, то критерий ω2 (Мизеса-Смирнова). Данные критерии позволяют проверять соответствие полученных данных не только нормальному распределению. При числе наблюдений n<50 нормальность их распределения проверяют при помощи составного критерия, состоящего из двух критериев.
Проверка гипотезы по составному критерию. В соответствии с гипотезой согласия по составному критерию распределения признается нормальным, если оно с заданными уровнями значимости удовлетворяет одновременно двум крите­риям.
Критерий 1. Вычисляют отношение
󰆹
󰇛󰇜

 󰏂 

где *
xi
– смещенная оценка среднего квадратического отклонения, вычис-
ляемая по формуле (6.1.4).
Результаты наблюдений можно считать распределенными нормально, если справедливо неравенство


󰆹
где


и 

– квантили распределения, получаемые из таблицы
(6.5.1)
(6.5.2)
79
(Приложение 1) для числа наблюдений n, q
1/2
и 1-q
1/2
, причем q1 – заранее выбран-
ный уровень значимости критерия.
Критерий 6. Можно считать, что результаты наблюдений принадлежат
нормальному распределению, если не более m разностей |Xi-
превзошло значе-
ние Z
p/2
 xi, где 
xi
- оценка среднего квадратичного отклонения, вычисляемая по
формуле (6.1.5), а Z
p/2
- верхняя квантиль распределения нормированной функции
Лапласа, отвечающая вероятности Р/2 ( напомним, что точка Zp, в которой инте­гральная функция распределения F переходит от значений, меньших Р, к значени­ям, большим Р, называется квантилью порядка Р: F(Zp)≤P, F(Zp+0)≥P. Значений Р
определяются из таблицы (приложение 11) по выбранному уровню значимости
и числу результатов наблюдений n. При уровне значимости, отличном от преду­смотренных в таблице приложения 11, значение Р находят путем линейной ин­терполяции.
В случае, если при проверке нормальности распределения результатов
наблюдений группы для критерия 1 выбран уровень значимости
, а для крите-
рия 2-q2, то результирующий уровень значимости составного критерия
 
. (6.5.3)
В случае, если хотя бы один из критериев не соблюдается, то считают, что распределение результатов наблюдений группы не соответствует нормальному.
Проверка гипотезы по критерию ω2 (критерию Мизеса-Смирнова). Как бы­ло отмечено выше, критерий ω2 считается более мощным критерием, особенно при числе наблюдений 50≤ n≤ 100. Он основан на не сгруппированных экспери­ментальных данных наблюдений случайной величины [18].
Если обозначить F(Х) экспериментальное распределение, а F0(Х) – извест­ное теоретическое распределение, то в качестве меры отклонения F0(Х) от F(Х) определяют средний квадрат отклонений по всем возможным значения аргумента.
 󰇛󰇜 󰇛󰇜
󰇛󰇜

󰇛󰇜

󰇛󰇜

где
(X) – гипотетическая функция плотности вероятностей.
Если экспериментальные данные представить в виде вариационного ряда
X1<X2<X3,….,
, то экспериментальная функция распределения F(X) определя-
ется следующим образом:
󰇛󰇜
 
  

В точке разрыва Х=X
i
функция 󰇛
󰇜
переходит скачком от значения

к
(для X
i-1
≤X<Xi). Вся область интегрирования в определении ω2 разби-
(6.5.4)
80
вается на интервалы (-∞, Х1) (, ) (,),…(

, ) (
,∞ ).
И теперь все определения ω2можно переписать в виде [18]

󰇛󰇜


󰇛󰇜
 󰇟



󰇛󰇜󰇠
󰇛󰇜
 󰇟  󰇛󰇜
∞
󰇠
󰇛󰇜
 
  
󰇟󰇛

󰇜 
󰇛
    
󰇜
󰇛
  
󰇜
󰇠
Выражение (6.5.5) используется для вычисления ω2 по данным выборки, ко­торые предварительно записывают в форме вариационного варианта.
Ниже приведены некоторые критические значения величины Пω2 для раз­личных уровней значимости.
Табл. 6.1. КРИТИЧЕСКИЕ ЗНАЧЕНИЯ ВЕЛИЧИНЫ (Пω2) кр
Уровень
значимости
(Пω2) кр
Уровень
значимости
(Пω2) кр
0.5
0.4
0.3
0.2
0.1
0.1184
0.1467
0.1843
0.2412
0.3473
0.05
0.03
0.02
0.01
0.001
0.4614
0.5489
0.6198
0.7435
1.1679
Этими данными можно пользоваться при n>40.
Критерий согласия λ- Колмогорова. Этот метод очень прост, но его выпол­нение требует реализации двух ограничений: во-первых, распределение должно быть непрерывным и, во-вторых, параметры проверяемого распределения должны быть известны и не могут заменяться их оценками, получаемыми на основе наблюдений [19]
В качестве меры близости статистического (выборочного) и исследуемого распределений принимается максимальное значений разности их функций рас­пределений:
= [
n(X)-F(X)], (6.5.6)
где
n(X) – выборочная функция распределения;
F(X) – исследуемое распределение.
А.Н. Коломогоровым было показано, что при увеличении объема выборки n, распределение случайной величины λn=Dn*
стремиться к виду
F(λ)=P(λn<λ)=
󰇛󰇜
∞
∞
k
* exp(-2k2λ2) . (6.5.7)
(6.5.5)
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]