Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Основы научных исследований при разработке энерго- и ресурсосберегающих процессов в химической технологии, нефтехимии и биотехнологии. Учебное пособие

.pdf
Скачиваний:
0
Добавлен:
07.09.2026
Размер:
1 Мб
Скачать
☆
– для несгруппированных данных и
,
i i
x x n
n
2
μ)
;
,
i i
x n
2
( )
.
1
n
k
( )
1
i
D
B
2
B
– для сформированного вариационного ряда.
Г е н е р а л ь н а я д и с п е р с и я – среднее арифметичес­кое квадратов отклонений всех вариант генеральной совокупности от ее средней:
n
(
x
i
1
i
D
Г
D
Г
i
k
1
N
( μ)
N
2
аналогично для несгруппированных данных и сформированного вариационного ряда соответственно.
Параметры отклонения и дисперсия показывают точность про­веденных опытов: чем они меньше, тем качественнее проведены испытания. Однако они никогда не будут равны нулю. Сам эмпиризм исследования порождает генеральное линейное отклонение и гене­ральную дисперсию, которые обусловлены человеческим факто­ром, погрешностью приборов и т. д. – вплоть до магнитных бурь.
Полученные значения выборочной дисперсии DВ будут давать систематически заниженную оценку генеральной дисперсии DГ. Поэтому в формулу выборочной дисперсии следует внести следую­щую поправку:
n
x x
n
2
s D
– 1 – 1
n n
1
i
B
B
i
Следует отметить, что для большой выборки (от 30 вариант)
этой поправкой можно пренебречь, так как при n  дробь стремится к единице и DВ s2.
111
n
Выборочная дисперсия представляет собой смещенную оцен-
2
.
s s
100 %.
ку генеральной дисперсии. Это означает, что если проводить неод­нократные выборки из той же генеральной совокупности, то полу­ченные значения DВ будут систематически заниженно или завы­шенно оценивать DГ.
Исправленное среднеквадратическое отклонение s определя-
ется следующим образом:
Характеристики s2 и s – это уже несмещенные оценки гене­ральной дисперсии DГ и генерального стандартного отклонения соответственно. Чем меньше стандартное отклонение и диспер­сия, тем меньше вариация и тем большее количество вариант на­ходится вблизи выборочной средней.
Рассмотренные выше показатели входят в группу абсолют­ных показателей вариации. Существуют также показатели относи­тельные, самым известным среди которых является коэффициент вариации.
К о э ф ф и ц и е н т в а р и а ц и и – отношение стандартно­го отклонения к выборочной средней, выраженное в процентах:
σ
Vx
В статистике можно встретить следующий эмпирический ори­ентир: если показатель вариации составляет 30 % и меньше, то статистическая совокупность считается однородной. Это означает, что большинство вариант находится недалеко от средней и най­денное значение x хорошо характеризует центральную тенденцию совокупности.
Если показатель вариации существенно больше 30 %, то сово­купность неоднородна, т. е. значительное количество вариант на­ходятся далеко от х и выборочная средняя плохо характеризует типичную варианту.
Также при оценке нормальности распределения выбороч­ной совокупности случайных величин пользуются параметрами а с и м м е т р и я и э к с ц е с с. Показатели асимметрия и экс-
112
цесс характеризуют геометрическую форму распределения случай­ной величины на основании полученных опытным путем данных и его отклонения от нормального закона распределения.
Асимметрия характеризует меру скошенности графика влево
или вправо, а эксцесс – меру его высоты.
Коэффициенты асимметрии и эксцесса вычисляют все статис­тические программы, в том числе Microsoft Excel. Чем их значения меньше по модулю, тем рассматриваемое эмпирическое распреде­ление ближе к нормальному. Распределение считается нормальным, если коэффициенты асимметрии и эксцесса по модулю меньше 3.
Простейшим критерием симметрии является равенство сред­ней, моды и медианы, но в реальных результатах такого идеально­го совпадения не бывает, и поэтому у «почти симметричных» рас­пределений эти показатели должны располагаться очень близко друг к другу.
5.2.4. Интервальная оценка
математического ожидания
В статистике существует два вида оценок случайной величи­ны: точечные и интервальные. Т о ч е ч н о й называют оценку, которая определяется одним числом. Например, выборочное сред­нее или дисперсия. При выборке малого объема точечная оценка может существенно отличаться от оцениваемого параметра, т. е. приводить к грубым ошибкам. Также при оценке генеральной со­вокупности следует иметь в виду, что выборочные характеристи­ки (будь то среднее, дисперсия или какая-нибудь другая величина) зависят от конкретных выборок. Чтобы учесть этот факт, вводят понятие интервальной оценки случайной величины.
И н т е р в а л ь н о й называют оценку, которая определяет­ся двумя числами – концами интервала. Интервальные оценки позволяют оценить точность и надежность проведенных оценок.
Точность оценки характеризует параметр , который подразу­мевает, что выборочное среднее отклоняется от генерального зна­чения параметра менее чем на величину , т. е.
|– xВ| < 
113
По-другому параметр характеризует концы интервала, с по-
,tn
мощью которого описываются результаты испытаний:
± = хВ ± 
Чем меньше , тем уже интервал и выше точность оценки.
´
Ввиду того, что статистические методы не позволяют утверж­дать со 100 %-ной вероятностью, что полученное значение хВ бу­дет соответствовать данному неравенству, при выдаче результатов указывают вероятность того, что оцениваемый параметр (ма­тематическое ожидание генеральной совокупности) будет входить в указанный интервал. Эту вероятность называют доверительным уровнем, который характеризует надежность полученных резуль­татов. Интервал хВ ±  называют доверительным с определенной долей вероятности.
Надежность часто задается наперед, популярные варианты 0,95; 0,99; 0,999. Наиболее часто встречающееся значение 0,95.
Следует также отметить, что интервал (хВ – ; хВ + ) имеет случайные концы, и в зависимости от выборки его границы будут различными.
Также при оценке надежности результатов пользуются пара­метром уровень значимости доверительного интервала. Уровень значимости характеризует ошибку результата, т. е. какая доля ин­тервальных оценок, которые можно получить при исследовании различных выборок из изучаемой генеральной совокупности, не бу­дет содержать математическое ожидание генеральной совокупнос­ти. Наиболее часто встречаемое значение параметра – 0,05.
Доверительный интервал определяется исходя из того, известно ли значение (среднеквадратическое отклонение генеральной сово­купности) по условиям задачи. В некоторых теоретических задачах по результатам предварительных исследований или справочных дан­ных этот параметр известен, и тогда рассчитывают по формуле:
 
где n – объем выборки; t – коэффициент доверия. Этот коэффици­ент отыскивается из соотношения 2Ф (t) = , где Ф(х) – функция
114
Лапласа. По таблице значений функции Лапласа находят крите-
γ γ
t s t s
n n
2 2
( 1) ( 1)
,
n s n s
1
2
α ,χf
2
2
α ,χf
( – 1) ( – 1)
σ .
n s n s
рий t, которому соответствует значение функции Ф(х), равное /2.
Если стандартное отклонение генеральной совокупности неиз­вестно, что довольно часто встречается на практике, то довери­тельный интервал находят по схожей формуле:
x x
 
B B
μ
с той поправкой, что коэффициент доверия t рассчитывается с по­мощью распределения Стьюдента. Значение t можно найти по спра­вочным таблицам.
Доверительный интервал для оценки неизвестной дисперсии D нормально распределенной генеральной совокупности определяет­ся следующим образом:
2 2
χ χ
α , α ,
1 2
где 2 – распределение Пирсона или «кси-квадрат», а
D
f f
Г
,
–
его критические значения, вычисленные для 1 = (1 – )/2, 2 = = (1 + ) /2, f = n – 1.
Данный интервал с вероятностью накрывает истинное зна­чение DГ. И если из всех частей неравенства извлечь корни, то полу­чится соответствующий интервал для оценки генерального стан­дартного отклонения:
χ χ
α , α ,
f f
1 2
Другой, более простой подход состоит в построении симмет­ричного интервала по формуле:
Г
где значение q отыскивается по соответствующей справочной таблице.
s(1 – q) < < s(1 + q),
115
С использованием указанных выше величин может быть реше-
2
,
на и другая задача, а именно определение оптимального объема выборки по заданной величине ошибки и доверительной веро­ятности по формуле:
S
x
n t
где t – коэффициент Стьюдента.
Обычно находят такой объем выборки, при котором относи-
тельная ошибка определения не превышает 5 % при уровне значи­мости = 0,05. Эту формулу также можно использовать при опре­делении минимального количества опытов в эксперименте.
5.2.5. Статистические гипотезы и их проверка
Обычно исследования проводятся по следующему плану: из ге­неральной совокупности извлекается репрезентативная выборка и на основании изучения этой выборки делается вывод о всей со­вокупности. В зависимости от целей исследования могут прово­диться неоднократные выборки, выборки из нескольких генераль­ных совокупностей, да и вообще анализироваться произвольные статистические данные. И в результате анализа этих данных появ­ляются идеи, которые оформляются в статистические гипотезы.
С т а т и с т и ч е с к о й называют гипотезу о законе распре­деления статистической совокупности либо о числовых парамет­рах известных распределений. Например:
рост студентов в институте распределен нормально;
дисперсии стрельбы двух стрелков равны между собой,
при этом известно (из ранее проведенных исследований), что точ­ность стрельбы распределена нормально.
В первом случае выдвигается гипотеза о законе распределе­ния, во втором – о числовых характеристиках двух распределений, закон которых известен.
В обеих гипотезах речь идет о генеральных совокупностях, и выдвигаются эти гипотезы на основании анализа выборочных данных.
116
Выдвигаемую гипотезу называют нулевой и обозначают Н0. В противовес к ней рассматривают альтернативную гипотезу Н. Альтернативных гипотез может быть несколько.
Чтобы принять или опровергнуть гипотезу еще до получения выборки, задаются уровнем значимости . Наиболее распростра­ненные уровни значимости – 0,05; 0,01 и 0,001. Уровню значимости соответствует доверительная вероятность = 1 – .
Проверка гипотез осуществляется с помощью статистических критериев – специальных случайных величин, которые принима­ют различные действительные значения.
В результате проверки нулевая гипотеза либо принимается, либо отвергается в пользу альтернативной. При этом существует воз­можность допустить ошибки двух типов. Ошибка первого рода состоит в том, что отвергается гипотеза, которая на самом деле верна. Вероятность допустить такую ошибку отражает уровень значимости . Ошибка второго рода состоит в том, что гипотеза будет принята, но на самом деле она неправильная. Вероятность совершить эту ошибку зависит от множества факторов, в том чис­ле от типа самой задачи, поэтому оценить ее значение довольно сложно.
Процесс проверки статистической гипотезы состоит из следую­щих этапов:
1. Обработка выборочных данных и выдвижение основной Н
и альтернативной Н1 гипотез.
2. Выбор статистического критерия K, при помощи которого
будет проверяться правильность гипотез.
3. Выбор уровня значимости . На практике обычно принима-
ют = 0,05.
4. Нахождение критического значения kкр – это значение слу-
чайной величины K, которое зависит от выбранного уровня значи­мости и от других параметров задачи. Критическое значение оп­ределяет критическую область. Критическая область – это область отвержения нулевой гипотезы.
5. Далее на основании выборочных данных рассчитывается
наблюдаемое значение критерия k
, которое сравнивается с кри-
набл
тическим:
117
0
если k
212
2
,
sFs
в критическую область не попадает, то гипотеза Н
набл
на уровне значимости принимается;
если k
попадает в критическую область, то нулевая гипо-
набл
теза на уровне значимости отвергается.
Далее приведены примеры наиболее распространенных стати-
стических гипотез.
Сравнение двух дисперсий
Основная гипотеза, которая проверяется: можно ли считать сравниваемые выборочные дисперсии оценками одной и той же генеральной совокупности. То есть являются ли выборочные дис-
2
персии s
2
и s
значимо различными или же полученные выборки
1
2
можно рассматривать как взятые из генеральных совокупностей с равными дисперсиями.
В данном случае проверяется нулевая гипотеза Н0 о равен-
2
стве генеральных дисперсий:
=
1
2
.
2
Статистический критерий, которым пользуются при проверке гипотезы, – это критерий Фишера F.
Порядок проверки гипотезы при сравнении двух дисперсий следующий:
1. Принимают предположение о нормальности распределения генеральных совокупностей, формулируются основная и альтер­нативная гипотезы.
2. Для двух независимых выборок X и Y объемами nx и ny соот-
2
ветственно определяют выборочные дисперсии s
и s
1
2
.
2
3. Рассчитывается наблюдаемое значение критерия F по фор­муле:
0
2
где s
значением F
2
> s
.
1
2
4. Сравнивается вычисленное значение F
при заданном уровне значимости и числе степе-
крит
с критическим
набл
ней свободы fx = nx – 1 и fy = ny – 1. Критическое значение критерия рассчитывается в статистических программах либо находится
в справочных таблицах.
118
5. Нулевая гипотеза принимается верной, если выполняется
неравенство:
F
F
набл
крит
.
В противном случае делается вывод о значимом различии
между выборочными дисперсиями.
Пример задачи, решаемый с помощью статистической гипоте­зы [13, с. 52]: при оценке точности определения содержания усвоя­емой формы пятиокиси фосфора в сложном удобрении сернокис­лотным методом дисперсия воспроизводимости составила s
2
= 0,73,
1
f = 2. Требуется сравнить этот метод анализа с более точным цит­ратным методом по результатам четырех параллельных определе­ний P2O5: 16,5; 15,9; 16,6; 15,8.
Сравнение двух средних
Эта статистическая гипотеза имеет несколько частных случа­ев, каждый из которых учитывает определенный объем выборки и исходные данные о генеральной совокупности. Приведем при­мер гипотезы, наиболее распространенной при решении химико­технологических задач и в экспериментах.
Пусть заданы две случайные выборки объемами n и m двух генеральных совокупностей. Для этих выборок найдены выбороч­ные средние – хВ и уВ соответственно.
Проверяется нулевая гипотеза Н0 о равенстве двух генераль­ных совокупностей хВ и уВ при условии, что это малые независи­мые выборки (n < 30, m < 30), генеральные совокупности распре­делены нормально и дисперсии их неизвестны (но предполагает­ся, что дисперсии одинаковы).
Применяемый критерий: величина T, которая при справед­ливости нулевой гипотезы имеет t-распределение Стьюдента с k = n + m – 2 степенями свободы.
Порядок проверки гипотезы:
1. Принимают предположение о нормальности распределения генеральных совокупностей, формулируются основная и альтерна­тивная гипотезы.
2. Для двух независимых выборок определяют выборочные
2
дисперсии s
и s
x
2
.
y
119
3. Определяют величину Т по формуле:
( 2)
.
х у nm n m
T
( 1) ( 1)
n s m s
2 2
x y
n m
4. Сравнивается вычисленное значение t
чением t
при заданном уровне значимости и числе степеней
крит
с критическим зна-
набл
свободы k = n + m – 2. Критическое значение критерия рассчиты­вается в статистических программах либо находится в справоч­ных таблицах.
5. Нулевая гипотеза принимается верной, если выполняется
неравенство:
t
набл
< t
крит

Пример задачи, решаемой с помощью данной гипотезы [13, с. 55]: исследовался процесс радикальной полимеризации солей на основе 4-винилпиридина и двух различных галоидных алкилов – йодистого бутила и бромистого этила. Сравнить реакционную способность га­лоидных алкилов, если средний выход (n = 8) полимера при про­ведении синтеза С4H9I составил 67,72 %, а средний выход (n = 8) с С2Н5Br – 91,16 %.
5.2.6. Корреляционный и регрессионный анализ
Важную часть методологии научного исследования составля­ют методы выявления и измерения связей между физическими величинами. Различают два типа связей: функциональную и ста­тистическую.
Если с изменением значения одной из переменных вторая из­меняется строго определенным образом (точечно), то связь между ними является функциональной.
Если с изменением значения одной из переменных вторая мо­жет принимать любые значения в пределах определенного интерва­ла с некоторой вероятностью, тогда связь является статистической.
К о р р е л я ц и о н н о й с в я з ь ю называют вид статис­тической связи, при котором разным значениям одной перемен­ной соответствуют различные средние значения другой. То есть
120
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]