Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Основы научных исследований при разработке энерго- и ресурсосберегающих процессов в химической технологии, нефтехимии и биотехнологии. Учебное пособие
.pdf
– для несгруппированных данных и
,
i i
x x n
n
2
μ)
;
,
i i
x n
2
( )
.
1
n
k
( )
1
i
D
B
2
B
– для сформированного вариационного ряда.
Г е н е р а л ь н а я д и с п е р с и я – среднее арифметическое квадратов отклонений всех вариант генеральной совокупности
от ее средней:
n
(
x
i
1
i
D
Г
D
Г
i
k
1
N
( μ)
N
2
аналогично для несгруппированных данных и сформированного
вариационного ряда соответственно.
Параметры отклонения и дисперсия показывают точность проведенных опытов: чем они меньше, тем качественнее проведены
испытания. Однако они никогда не будут равны нулю. Сам эмпиризм
исследования порождает генеральное линейное отклонение и генеральную дисперсию, которые обусловлены человеческим фактором, погрешностью приборов и т. д. – вплоть до магнитных бурь.
Полученные значения выборочной дисперсии DВ будут давать
систематически заниженную оценку генеральной дисперсии DГ.
Поэтому в формулу выборочной дисперсии следует внести следующую поправку:
n
x x
n
2
s D
– 1 – 1
n n
1
i
B
B
i
Следует отметить, что для большой выборки (от 30 вариант)
этой поправкой можно пренебречь, так как при n дробь
стремится к единице и DВ s2.
111
n

Выборочная дисперсия представляет собой смещенную оцен-
2
.
s s
100 %.
ку генеральной дисперсии. Это означает, что если проводить неоднократные выборки из той же генеральной совокупности, то полученные значения DВ будут систематически заниженно или завышенно оценивать DГ.
Исправленное среднеквадратическое отклонение s определя-
ется следующим образом:
Характеристики s2 и s – это уже несмещенные оценки генеральной дисперсии DГ и генерального стандартного отклонения
соответственно. Чем меньше стандартное отклонение и дисперсия, тем меньше вариация и тем большее количество вариант находится вблизи выборочной средней.
Рассмотренные выше показатели входят в группу абсолютных показателей вариации. Существуют также показатели относительные, самым известным среди которых является коэффициент
вариации.
К о э ф ф и ц и е н т в а р и а ц и и – отношение стандартного отклонения к выборочной средней, выраженное в процентах:
σ
Vx
В статистике можно встретить следующий эмпирический ориентир: если показатель вариации составляет 30 % и меньше, то
статистическая совокупность считается однородной. Это означает,
что большинство вариант находится недалеко от средней и найденное значение x хорошо характеризует центральную тенденцию
совокупности.
Если показатель вариации существенно больше 30 %, то совокупность неоднородна, т. е. значительное количество вариант находятся далеко от х и выборочная средняя плохо характеризует
типичную варианту.
Также при оценке нормальности распределения выборочной совокупности случайных величин пользуются параметрами
а с и м м е т р и я и э к с ц е с с. Показатели асимметрия и экс-
112

цесс характеризуют геометрическую форму распределения случайной величины на основании полученных опытным путем данных
и его отклонения от нормального закона распределения.
Асимметрия характеризует меру скошенности графика влево
или вправо, а эксцесс – меру его высоты.
Коэффициенты асимметрии и эксцесса вычисляют все статистические программы, в том числе Microsoft Excel. Чем их значения
меньше по модулю, тем рассматриваемое эмпирическое распределение ближе к нормальному. Распределение считается нормальным,
если коэффициенты асимметрии и эксцесса по модулю меньше 3.
Простейшим критерием симметрии является равенство средней, моды и медианы, но в реальных результатах такого идеального совпадения не бывает, и поэтому у «почти симметричных» распределений эти показатели должны располагаться очень близко
друг к другу.
5.2.4. Интервальная оценка
математического ожидания
В статистике существует два вида оценок случайной величины: точечные и интервальные. Т о ч е ч н о й называют оценку,
которая определяется одним числом. Например, выборочное среднее или дисперсия. При выборке малого объема точечная оценка
может существенно отличаться от оцениваемого параметра, т. е.
приводить к грубым ошибкам. Также при оценке генеральной совокупности следует иметь в виду, что выборочные характеристики (будь то среднее, дисперсия или какая-нибудь другая величина)
зависят от конкретных выборок. Чтобы учесть этот факт, вводят
понятие интервальной оценки случайной величины.
И н т е р в а л ь н о й называют оценку, которая определяется двумя числами – концами интервала. Интервальные оценки
позволяют оценить точность и надежность проведенных оценок.
Точность оценки характеризует параметр , который подразумевает, что выборочное среднее отклоняется от генерального значения параметра менее чем на величину , т. е.
| – xВ| <
113

По-другому параметр характеризует концы интервала, с по-
,tn
мощью которого описываются результаты испытаний:
± = хВ ±
Чем меньше , тем уже интервал и выше точность оценки.
´
Ввиду того, что статистические методы не позволяют утверждать со 100 %-ной вероятностью, что полученное значение хВ будет соответствовать данному неравенству, при выдаче результатов
указывают вероятность того, что оцениваемый параметр (математическое ожидание генеральной совокупности) будет входить
в указанный интервал. Эту вероятность называют доверительным
уровнем, который характеризует надежность полученных результатов. Интервал хВ ± называют доверительным с определенной
долей вероятности.
Надежность часто задается наперед, популярные варианты
0,95; 0,99; 0,999. Наиболее часто встречающееся значение 0,95.
Следует также отметить, что интервал (хВ – ; хВ + ) имеет
случайные концы, и в зависимости от выборки его границы будут
различными.
Также при оценке надежности результатов пользуются параметром уровень значимости доверительного интервала. Уровень
значимости характеризует ошибку результата, т. е. какая доля интервальных оценок, которые можно получить при исследовании
различных выборок из изучаемой генеральной совокупности, не будет содержать математическое ожидание генеральной совокупности. Наиболее часто встречаемое значение параметра – 0,05.
Доверительный интервал определяется исходя из того, известно
ли значение (среднеквадратическое отклонение генеральной совокупности) по условиям задачи. В некоторых теоретических задачах
по результатам предварительных исследований или справочных данных этот параметр известен, и тогда рассчитывают по формуле:
где n – объем выборки; t – коэффициент доверия. Этот коэффициент отыскивается из соотношения 2Ф (t) = , где Ф(х) – функция
114

Лапласа. По таблице значений функции Лапласа находят крите-
γ γ
t s t s
n n
2 2
( 1) ( 1)
,
n s n s
1
2
α ,χf
2
2
α ,χf
( – 1) ( – 1)
σ .
n s n s
рий t, которому соответствует значение функции Ф(х), равное /2.
Если стандартное отклонение генеральной совокупности неизвестно, что довольно часто встречается на практике, то доверительный интервал находят по схожей формуле:
x x
B B
μ
с той поправкой, что коэффициент доверия t рассчитывается с помощью распределения Стьюдента. Значение t можно найти по справочным таблицам.
Доверительный интервал для оценки неизвестной дисперсии D
нормально распределенной генеральной совокупности определяется следующим образом:
2 2
χ χ
α , α ,
1 2
где 2 – распределение Пирсона или «кси-квадрат», а
D
f f
Г
,
–
его критические значения, вычисленные для 1 = (1 – )/2, 2 =
= (1 + ) /2, f = n – 1.
Данный интервал с вероятностью накрывает истинное значение DГ. И если из всех частей неравенства извлечь корни, то получится соответствующий интервал для оценки генерального стандартного отклонения:
χ χ
α , α ,
f f
1 2
Другой, более простой подход состоит в построении симметричного интервала по формуле:
Г
где значение q отыскивается по соответствующей справочной
таблице.
s(1 – q) < < s(1 + q),
115

С использованием указанных выше величин может быть реше-
2
,
на и другая задача, а именно определение оптимального объема
выборки по заданной величине ошибки и доверительной вероятности по формуле:
S
x
n t
где t – коэффициент Стьюдента.
Обычно находят такой объем выборки, при котором относи-
тельная ошибка определения не превышает 5 % при уровне значимости = 0,05. Эту формулу также можно использовать при определении минимального количества опытов в эксперименте.
5.2.5. Статистические гипотезы и их проверка
Обычно исследования проводятся по следующему плану: из генеральной совокупности извлекается репрезентативная выборка
и на основании изучения этой выборки делается вывод о всей совокупности. В зависимости от целей исследования могут проводиться неоднократные выборки, выборки из нескольких генеральных совокупностей, да и вообще анализироваться произвольные
статистические данные. И в результате анализа этих данных появляются идеи, которые оформляются в статистические гипотезы.
С т а т и с т и ч е с к о й называют гипотезу о законе распределения статистической совокупности либо о числовых параметрах известных распределений. Например:
рост студентов в институте распределен нормально;
дисперсии стрельбы двух стрелков равны между собой,
при этом известно (из ранее проведенных исследований), что точность стрельбы распределена нормально.
В первом случае выдвигается гипотеза о законе распределения, во втором – о числовых характеристиках двух распределений,
закон которых известен.
В обеих гипотезах речь идет о генеральных совокупностях,
и выдвигаются эти гипотезы на основании анализа выборочных
данных.
116

Выдвигаемую гипотезу называют нулевой и обозначают Н0.
В противовес к ней рассматривают альтернативную гипотезу Н.
Альтернативных гипотез может быть несколько.
Чтобы принять или опровергнуть гипотезу еще до получения
выборки, задаются уровнем значимости . Наиболее распространенные уровни значимости – 0,05; 0,01 и 0,001. Уровню значимости
соответствует доверительная вероятность = 1 – .
Проверка гипотез осуществляется с помощью статистических
критериев – специальных случайных величин, которые принимают различные действительные значения.
В результате проверки нулевая гипотеза либо принимается, либо
отвергается в пользу альтернативной. При этом существует возможность допустить ошибки двух типов. Ошибка первого рода
состоит в том, что отвергается гипотеза, которая на самом деле
верна. Вероятность допустить такую ошибку отражает уровень
значимости . Ошибка второго рода состоит в том, что гипотеза
будет принята, но на самом деле она неправильная. Вероятность
совершить эту ошибку зависит от множества факторов, в том числе от типа самой задачи, поэтому оценить ее значение довольно
сложно.
Процесс проверки статистической гипотезы состоит из следующих этапов:
1. Обработка выборочных данных и выдвижение основной Н
и альтернативной Н1 гипотез.
2. Выбор статистического критерия K, при помощи которого
будет проверяться правильность гипотез.
3. Выбор уровня значимости . На практике обычно принима-
ют = 0,05.
4. Нахождение критического значения kкр – это значение слу-
чайной величины K, которое зависит от выбранного уровня значимости и от других параметров задачи. Критическое значение определяет критическую область. Критическая область – это область
отвержения нулевой гипотезы.
5. Далее на основании выборочных данных рассчитывается
наблюдаемое значение критерия k
, которое сравнивается с кри-
набл
тическим:
117
0

если k
212
2
,
sFs
в критическую область не попадает, то гипотеза Н
набл
на уровне значимости принимается;
если k
попадает в критическую область, то нулевая гипо-
набл
теза на уровне значимости отвергается.
Далее приведены примеры наиболее распространенных стати-
стических гипотез.
Сравнение двух дисперсий
Основная гипотеза, которая проверяется: можно ли считать
сравниваемые выборочные дисперсии оценками одной и той же
генеральной совокупности. То есть являются ли выборочные дис-
2
персии s
2
и s
значимо различными или же полученные выборки
1
2
можно рассматривать как взятые из генеральных совокупностей
с равными дисперсиями.
В данном случае проверяется нулевая гипотеза Н0 о равен-
2
стве генеральных дисперсий:
=
1
2
.
2
Статистический критерий, которым пользуются при проверке
гипотезы, – это критерий Фишера F.
Порядок проверки гипотезы при сравнении двух дисперсий
следующий:
1. Принимают предположение о нормальности распределения
генеральных совокупностей, формулируются основная и альтернативная гипотезы.
2. Для двух независимых выборок X и Y объемами nx и ny соот-
2
ветственно определяют выборочные дисперсии s
и s
1
2
.
2
3. Рассчитывается наблюдаемое значение критерия F по формуле:
0
2
где s
значением F
2
> s
.
1
2
4. Сравнивается вычисленное значение F
при заданном уровне значимости и числе степе-
крит
с критическим
набл
ней свободы fx = nx – 1 и fy = ny – 1. Критическое значение критерия
рассчитывается в статистических программах либо находится
в справочных таблицах.
118

5. Нулевая гипотеза принимается верной, если выполняется
неравенство:
F
F
набл
крит
.
В противном случае делается вывод о значимом различии
между выборочными дисперсиями.
Пример задачи, решаемый с помощью статистической гипотезы [13, с. 52]: при оценке точности определения содержания усвояемой формы пятиокиси фосфора в сложном удобрении сернокислотным методом дисперсия воспроизводимости составила s
2
= 0,73,
1
f = 2. Требуется сравнить этот метод анализа с более точным цитратным методом по результатам четырех параллельных определений P2O5: 16,5; 15,9; 16,6; 15,8.
Сравнение двух средних
Эта статистическая гипотеза имеет несколько частных случаев, каждый из которых учитывает определенный объем выборки
и исходные данные о генеральной совокупности. Приведем пример гипотезы, наиболее распространенной при решении химикотехнологических задач и в экспериментах.
Пусть заданы две случайные выборки объемами n и m двух
генеральных совокупностей. Для этих выборок найдены выборочные средние – хВ и уВ соответственно.
Проверяется нулевая гипотеза Н0 о равенстве двух генеральных совокупностей хВ и уВ при условии, что это малые независимые выборки (n < 30, m < 30), генеральные совокупности распределены нормально и дисперсии их неизвестны (но предполагается, что дисперсии одинаковы).
Применяемый критерий: величина T, которая при справедливости нулевой гипотезы имеет t-распределение Стьюдента
с k = n + m – 2 степенями свободы.
Порядок проверки гипотезы:
1. Принимают предположение о нормальности распределения
генеральных совокупностей, формулируются основная и альтернативная гипотезы.
2. Для двух независимых выборок определяют выборочные
2
дисперсии s
и s
x
2
.
y
119

3. Определяют величину Т по формуле:
( 2)
.
х у nm n m
T
( 1) ( 1)
n s m s
2 2
x y
n m
4. Сравнивается вычисленное значение t
чением t
при заданном уровне значимости и числе степеней
крит
с критическим зна-
набл
свободы k = n + m – 2. Критическое значение критерия рассчитывается в статистических программах либо находится в справочных таблицах.
5. Нулевая гипотеза принимается верной, если выполняется
неравенство:
t
набл
< t
крит
Пример задачи, решаемой с помощью данной гипотезы [13, с. 55]:
исследовался процесс радикальной полимеризации солей на основе
4-винилпиридина и двух различных галоидных алкилов – йодистого
бутила и бромистого этила. Сравнить реакционную способность галоидных алкилов, если средний выход (n = 8) полимера при проведении синтеза С4H9I составил 67,72 %, а средний выход (n = 8)
с С2Н5Br – 91,16 %.
5.2.6. Корреляционный и регрессионный анализ
Важную часть методологии научного исследования составляют методы выявления и измерения связей между физическими
величинами. Различают два типа связей: функциональную и статистическую.
Если с изменением значения одной из переменных вторая изменяется строго определенным образом (точечно), то связь между
ними является функциональной.
Если с изменением значения одной из переменных вторая может принимать любые значения в пределах определенного интервала с некоторой вероятностью, тогда связь является статистической.
К о р р е л я ц и о н н о й с в я з ь ю называют вид статистической связи, при котором разным значениям одной переменной соответствуют различные средние значения другой. То есть
120
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
