Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Планирование и техника эксперимента. Учебное пособие

.pdf
Скачиваний:
0
Добавлен:
12.08.2026
Размер:
710 Кб
Скачать

Рn (k1;k2 ) (x2 ) (x1 ) ,

где

 

 

 

 

 

 

 

x

k1 np

;

x

 

 

k2 np

 

npq

 

npq .

1

 

 

2

 

Значения функции Лапласа Ф(x) берутся по таблице (прил. 2). Приближенные формулы Лапласа тем точнее, чем больше количество

повторных испытаний n.

Наивероятнейшее число появлений события. Пусть в n повторных испытаниях событие А появляется k раз, где k может принимать значения: 0; 1; 2; 3; …; n (то есть 0 k n). Для каждого из этих значений k можно найти соответствующую ему вероятность по формулам Бернулли или Лапласа.

То значение k, которому соответствует самая большая вероятность, называется наивероятнейшим числом появления события А.

Наивероятнейшее число k0 находится как целое число из промежутка np q k0 np p ,

k0 может принимать либо одно значение, либо два соседних целых значения, когда вероятности их одинаковы.

Вероятность Рn(kо), соответствующую значению k = k0, находим либо по формуле Бернулли, при n 10, либо по локальной формуле Лапласа, при n 10.

Появление события хотя бы один раз. Вероятность появления со-

бытия «хотя бы один раз» в n испытаниях находится с помощью противоположного ему события «ни одного раза»:

Рn (событие наступит хотя бы один раз) = 1 – Рn (ни разу) =

1 Р

(0) 1

n!

p0 qn 0

1 qn

,

 

n

 

0! n!

 

 

 

 

 

при этом учтено, что 0! = 1 и p0 1.

Событие наступит «хотя бы один раз» означает, что оно наступит один или более раз, поэтому можно записать

Pn(k 1) 1 qn .

21

3.СТАТИСТИЧЕСКОЕ РАСПРЕДЕЛЕНИЕ ВЫБОРКИ

ИЕГО ОСНОВНЫЕ ЧИСЛОВЫЕ ХАРАКТЕРИСТИКИ

Выборочный метод – один из основных методов математической статистики. Его сущность заключается в том, что изучение большой совокупности объектов относительно некоторого количественного признака Х производится по сравнительно небольшому числу случайно отобранных объектов.

Генеральной совокупностью называется множество всех изучаемых объектов, из которых производится выборка.

Выборочной совокупностью (выборкой) называется множество объектов, отобранных для изучения из генеральной совокупности.

Выборка должна быть организована случайным образом, чтобы правильно представлять генеральную совокупность.

Объемом совокупности называется количество объектов в совокупности. Объем выборки n, как правило, значительно меньше объема N генеральной совокупности: n N.

Данные выборки записываются в виде таблицы, называемой статистическим распределением выборки:

xi

х1

х2

хk

ni

n1

n2

nk

Впервой строке перечислены все наблюдаемые значения признака Х

впорядке их возрастания (или убывания). Они называются вариантами

xi(i = 1, 2, 3, …, k). Во второй строке указаны частоты ni соответствующих вариант xi. Они показывают, сколько раз наблюдалось каждое значение признака Х.

Очевидно, что сумма всех частот ni равна объему выборки n:

k

n1 n2 ... nk ni n.

i 1

Основные числовые характеристики выборки

1. Средняя выборочная (среднее взвешенное значение признака в выборке):

22

 

 

 

к

 

 

 

 

 

 

 

 

 

 

 

 

 

 

хi ni

 

1 (х

 

 

 

 

 

 

 

 

x

в

 

i 1

 

n

х

n

2

... х

n

k

).

 

 

 

n

 

n

1

1

2

 

k

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

2. Дисперсия выборочная. Характеризует разброс (рассеяние) значений вариант xi от выборочного среднего значения xв и измеряется в квад-

ратных единицах признака Х:

D 1

 

k

(х x )2

n

1 (х

x )2 n

(х x )2 n

... (х

x

)2 n .

в

n

 

 

i в

i

n

1

 

в

1

2

в

2

к

в

k

 

 

i 1

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

Для вычисления дисперсии используется также другая, часто более

удобная формула

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

Dв

 

(xв )2 ,

 

 

 

 

 

 

 

 

 

 

 

 

 

 

xв2

 

 

 

 

 

где

 

 

 

 

xв

1 xi ni ;

 

 

 

 

xв2

1 xi2ni .

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

k

 

 

 

 

 

 

 

 

 

k

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

n i 1

 

 

 

 

 

 

 

 

n

i 1

 

 

 

3. Среднее квадратичное отклонение выборки – характеристика рассеяния значений признака в выборке от среднего выборочного в единицах признака Х:

в Dв .

Спомощью найденных выборочных характеристик xв, Dв, в оцениваются соответствующие генеральные характеристики:

x– генеральная средняя;

D – генеральная дисперсия;

– генеральное среднее квадратичное отклонение. Оценки имеют следующий вид:

 

 

 

 

D

n

 

 

 

 

x xв ;

 

n

 

 

 

Dв Sв2 ;

 

 

n 1

Sв

,

 

n 1

 

 

 

 

 

 

 

 

 

где 2 – так называемая исправленная выборочная дисперсия. Приведенные оценки носят случайный характер, так как зависят от вы-

борки. Ониназываютсяточечнымииудовлетворяютследующимтребованиям: несмещенность (отсутствие систематических ошибок);

23

состоятельность (увеличение объема выборки повышает вероятность правильности оценки);

эффективность (имеют самый незначительный разброс по сравнению с другими возможными оценками).

Основные характеристики выборки xв , Dв , в лишь приближенно характеризуют генеральную совокупность и могут оказаться далекими от со-

ответствующих характеристик генеральной совокупности: x а , D, . Поэтому для последних используют интервальные оценки, когда неизвестная характеристика заключена в некотором интервале с заданной надежностью (вероятностью) . Такой интервал называется доверительным. Значения надежности берутся, как правило, высокими: 0,9; 0,95; 0,99 или 0,999, что соответствует 90; 95; 99 или 99,9 %.

Если количественный признак X в генеральной совокупности распределен по нормальному закону, причем среднее квадратичное отклонение этого распределения известно, то с вероятностью доверительный интервал, заданный выражением

(xв t / n; xв t / n),

покрывает неизвестное математическое ожидание а. Здесь параметр t нахо-

дится из соотношения 2 Ф(t) с помощью таблицы значений для интегральной функции Лапласа (прил. 2).

Часто статистическое распределение выборки носит интервальный характер. В этом случае указывают числовые частичные интервалы, куда попадают значения признака X, и ni – количество значений, попавших в интервал с номером i. В качестве значений xi выбирают середины частичных интервалов.

Значения ni называются абсолютными частотами, их сумма равна

объему выборки: n

i

n . Относительные частоты w

i

 

ni

показыва-

n

 

 

 

 

ют долю значений xi в общем объеме выборки (иногда обозначают p*). Очевидно, что сумма всех относительных частот (долей) равна 1:

wi 1 .

Графически дискретное статистическое распределение изображается в виде полигона частот, обычно относительных. Полигон представляет собой ломаную линию, соединяющую соседние точки с координатами (xi; wi).

24

Интервальное статистическое распределение изображается на графике в виде гистограммы относительных частот. Гистограмма – это ступенчатая фигура, состоящая из прямоугольников. В основании каждого прямоугольника лежит частичный интервал, а высота прямоугольника определяется относительной частотой wi, а чаще величиной w i , где hi – длина час-

h i

тичного интервала. При таком построении площадь каждого частичного прямоугольника равна относительной частоте wi, а сумма всех площадей, то

есть площадь ступенчатой фигуры, равна единице: wi 1.

25

4. ОЦЕНКА ПАРАМЕТРОВ ФУНКЦИИ РАСПРЕДЕЛЕНИЯ

Нормальность закона распределения случайной величины для обработки результатов опытов позволяет допускать определение только двух статистических оценок параметров распределения: математического ожидания и дисперсии. В связи с этим проверка нормальности распределения составляет основное содержание предварительной обработки результатов эксперимента.

Проверка или установление функции распределения эмпириче-

ской величины. При анализе технологического процесса достаточно иногда бывает использование группировки по интервалам (построение полигона частот) выборки. Чаще всего графический метод совмещают с количественными методами оценки нормальности распределения. Для этого анализу подвергаются коэффициенты асимметрии и эксцесса.

Коэффициент асимметрии вычисляется по формуле

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

γ1 = μ3x3,

 

 

 

коэффициент эксцесса –

 

 

 

γ2 = (μ4x4) – 3,

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

n

 

 

 

 

 

 

 

 

 

 

 

 

где 3

 

 

 

1

 

xi

 

3 pi – третий центральный момент;

 

 

 

x

 

 

 

 

 

 

 

n 1 i 1

 

 

 

 

 

 

 

 

 

 

 

 

4

 

1

 

 

n

xi

 

4 pi

 

 

 

 

 

 

 

x

– четвертый центральный момент.

n

1

i 1

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

Для

нормального

 

распределения эти

коэффициенты равны нулю

3 = 0, μ4/ e4 = 3). Тогда

 

 

 

 

 

 

 

 

 

 

 

 

 

 

– несмещенные оценки для асимметрии и эксцесса находят по фор-

мулам:

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

1*

 

n n 1

1 ;

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

n 2

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

*

n 1

 

 

n 1

 

 

6 .

 

 

 

 

 

 

 

 

 

 

 

2

n 2 n 3

2

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

– среднее квадратичное отклонение для показателей асимметрии и эксцесса соответственно равны:

26

 

 

 

 

 

 

 

1

 

6n n 1

 

 

;

 

 

 

 

 

 

 

 

n 2 n 1 n

3

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

2

 

 

 

 

24n n 1 2

 

 

 

.

 

 

 

 

 

 

 

 

n 3 n 2 n 3 n 5

Таким образом, гипотеза о нормальности распределения подтвержда-

ется, если

 

1 *

 

3 1

и

 

2 *

 

5 2 .

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

Основные характеристики выборки xв, Dв, в лишь приближенно характеризуют генеральную совокупность и могут оказаться далекими от со-

ответствующих характеристик генеральной совокупности: x а , D, . Поэтому для последних используют интервальные оценки, когда неизвестная характеристика заключена в некотором интервале с заданной надежностью (вероятностью) . Такой интервал называется доверительным. Значения надежности берутся, как правило, высокими: 0,9; 0,95; 0,99 или 0,999, что соответствует 90; 95; 99 или 99,9 %.

Если количественный признак X в генеральной совокупности распределен по нормальному закону, причем среднее квадратичное отклонение этого распределения известно, то с вероятностью доверительный интервал, заданный выражением

(

xв

t / n;

 

xв

t / n),

покрывает неизвестное математическое

ожидание а. Здесь параметр t на-

ходится из соотношения 2 Ф(t) с помощью таблицы значений для инте-

гральной функции Лапласа. Длина полуинтервала = t /

n характеризу-

ет точность оценки. Величина

называется предельной ошибкой оценки.

Оценка тем точнее, чем меньше

и, следовательно, доверительный интер-

вал становится более узким. Величина зависит от n,

и t. Очевидно, с

увеличением объема выборки n уменьшается и повышается точность оценки. При увеличении рассеяния длина интервала увеличивается, т.е. оценка делается менее точной.

Увеличение надежности ведет к росту вспомогательного параметра t и расширению доверительного интервала (надежнее попасть в большой интервал). Это делает оценку менее точной. Таким образом, при повышении надежностиоценкиухудшаетсяееточность.

27

Выбор правильного решения из двух противоположных предположений о генеральной совокупности называется статистической проверкой. Предположительная количественная оценка параметра генеральной совокупности называется статистическим оцениванием.

На практике ставится задача о принятии решений относительно рассматриваемых совокупностей, представляющих собой соответствующие вероятностные утверждения о реальном объекте. При этом одну из гипотез принимают за основную и называют ее нулевой гипотезой (Н0), а сравниваемую с ней – альтернативной гипотезой (Н1). Альтернативных гипотез может быть несколько.

Проверку гипотез осуществляют с помощью критериев значимости. При этом сопоставляют критерий, вычисленный по выборке, с критическим значением критерия, найденного в предположении, что проверяемая статистическая гипотеза верна.

Критерии значимости, основанные на предположения нормальности распределений, для сравнения двух дисперсий – критерий Фишера; двух средних значений –критерий Стьюдента. В обоих случаях, когда соответствующие критериальные соотношения выполняются, можно считать, что различие между оценками незначимо и нулевые гипотезы принимаются, в противном случае – отвергаются. Статистическая проверка гипотез может

дать ошибки двух родов: ошибка первого рода – ошибка, при которой отвергается правильная гипотеза; ошибка второго рода – принятие неверной гипотезы.

Вероятность принятия ложной гипотезы зависит от мощности критерия (чем больше мощность критерия, тем меньше вероятность принятия ложной гипотезы). Принятая гипотеза (Н0 или Н1) используется в качестве рабочей до тех пор, пока новые накопленные результаты испытаний не позволят ее отвергнуть.

При проверке гипотезы H0 : x1 x2 по критерию Стьюдента возможны два варианта:

• Сравнение среднего арифметического значения выборки xв с эталоном (генеральной средней) x .

Среднее арифметическое значение выборки не отличается от эталона, если выполняется следующее неравенство:

28

 

 

 

 

ta / 2, f

x

 

xв

x

 

,

 

n

 

 

 

 

 

 

где xв – среднее арифметическое значение случайной величины в испытуемой выборке; x – значение случайной величины в базовой выборке (эталон); σx – среднеквадратическое отклонение случайной величины; n – объем

выборки; t f ,a / 2 – табличное значение критерия Стьюдента для уровня значимости α/2 и числа степеней свободы f = n – 1.

• Сравнение средних двух исследуемых выборок.

Средние арифметические значения двух выборок 1 и 2 не отличаются, если выполняется следующее неравенство:

 

 

 

 

 

 

 

 

t

 

S

 

 

n1 n2 ,

 

 

x

x

2

 

f ,a / 2

 

 

 

1

 

 

 

 

 

 

 

 

n1n2

где

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

S

 

 

(n 1) 2 (n

2

1) 2

 

 

 

 

1

1

 

 

2

.

 

 

 

 

 

n1 n2

 

 

 

 

 

 

 

 

 

 

 

 

2

Гипотеза о дисперсиях по критерию Фишера проверяется следующим образом. Дисперсии двух выборок не отличаются, т.е. верна нулевая гипо-

теза H0 : 12 22 , если выполняется неравенство

2

F

F

 

 

max

f1 f2

, ,

2

0

 

min

 

 

 

 

где F0 – расчетное значение критерия Фишера; max2 , min2 – большее и меньшее значения дисперсий двух сравниваемых выборок соответственно; Ff1 f2 ,

– табличное значение критерия Фишера для заданного уровня значимости α и числа степеней свободы f1 = n1 – 1; f2 = n2 – 1 при объеме выборок n1 и n2.

29

5.КОРРЕЛЯЦИОННЫЙ

ИРЕГРЕССИОННЫЙ АНАЛИЗЫ

При исследовании технологических процессов встает задача установления связи между двумя зависимыми случайными величинами. Пусть каждый из выбранных объектов характеризуется двумя количественными признаками Х и Y. Между значениями этих признаков может существовать некоторая зависимость.

Функциональная зависимость – это такая зависимость, когда каждому значению x признака Х соответствует единственное значение y признака Y. Эта зависимость является вполне определенной, однозначной

иназывается строгой (детерминированной). Она задается в виде функции

у= f(х).

Статистическая зависимость – это такая зависимость, когда каждому значению x признака Х соответствует статистическое распределение значений признака Y. Эта зависимость не является строгой и носит вероятностный (стохастический) характер, поскольку на величину признака Y влияют не только значения признака X, но и другие случайные факторы.

Если случайные величины X и Y не являются взаимно независимыми, то в той или иной степени им свойственна стохастическая зависимость.

Корреляционная зависимость – это статистическая зависимость, обладающая тем свойством, что изменение значений x признака Х приводит

к изменению среднего значения признака Y, обозначаемого ух . Связь меж-

ду x и условной средней ух задается с помощью функции f(х) и записыва-

ется в виде уравнения ух f (х) , которое называется уравнением регрессии

Y по Х.

Аналогично, связь между значениями y признака Y и соответствующими условными средними значениями x y записывается в виде уравнения

ху ( у) , которое называется уравнением регрессии Х по Y.

Практически наличие корреляционной связи между признаками X и Y прослеживается как изменение средних значений одного признака при из-

30

Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]