Статистическая обработка данных в среде wxMaxima. Практикум. Учебное пособие
.pdfЗадание (Исходные данные в приложении 1.)
1.Выявить аномальный результат в экспериментальных
данных.
2.Вычислить статистические оценки.
3. Определить |
характер |
объекта |
по |
коэффициенту |
вариации. |
|
|
|
|
4.Проверить нормальность распределения случайной ве-
личины.
5.Решить задачу с помощью wxMaxima, построить график.
6.Записать вывод.
Практическая работа № 2. Проверка статистических гипотез
Цель работы: изучить способы проверки статистических гипотез.
Теоретические сведения
Статистическая гипотеза – это некоторое предположение Н0 о свойствах случайной величины. Альтернативной гипотезой называется гипотеза На, противоречащая Н0.
Задача проверки статистических гипотез состоит в , том чтобы на основании результатов эксперимента установить, насколько данные, полученные из выборки, согласуются с выбранной гипотезой и можно ли, опираясь на эксперимент, принять или опровергнуть гипотезу.
Проверка состоит в следующем.
1.На основании выдвинутой гипотезы подбирается некоторая статистика K = φ(x1,…, xN). Называется эта статистика– статистический критерий. Для каждого типа статистический гипотез придуман свой критерий.
2.Так как в математической статистике не бывает абсолютно достоверных результатов, то заранее оговаривают возможность ошибки при проверке гипотезы.
11
Обозначим α – максимально допустимая вероятность того, что гипотеза будет отвергнута, хотя на самом деле она верна (ошибка 1-го рода) или α – уровень значимости.
В качестве α выбирается маленькая величина(α = 0,05). Ошибка 2-го рода состоит в том, что будет принята неправильная гипотеза Н0. Вероятность ошибки 2-го рода обозначают через β.
Например, допустим, идет суд. Обвиняемый либо виновен, либо невиновен.
Гипотеза Н0: обвиняемый невиновен.
Ошибка 1-го рода – осуждение невиновного, ошибка 2-го рода – оправдание виноватого.
3. Все множество значений статистического критерияК разбивается на два непересекающихся подмножества: 1) область U – область принятия гипотезы Н0; 2) V – область опровержения гипотезы Н0.
Если экспериментальное (вычисленное) значение критерия К попадает в областьU – принимают гипотезу Н0, а если в область V – принимают гипотезу На.
Основной принцип выбора критерия V:
1) P(I) ≤ α; 2)P(II) → min.
Различают правостороннюю, левостороннюю и двустороннюю критические области. Правосторонней называется критическая область, определяемая неравенством К > Rкр, где Rкр – положительное число. Левосторонней называется критическая -об ласть, определяемая неравенством К < Rкр, где Rкр – отрицательное число. Двусторонней называется критическая область, определяемая неравенствами К < R1,K > R2, где R2 > R1 – положительное число.
Проверка статистических гипотез. Статистическая гипотеза
– некоторое суждение о вероятностных свойствах случайной величины. Для проверки статистических гипотез используются специальные методы, основанные на данных эксперимента. На основании такой проверки гипотеза подтверждается или опровергается.
Статистическая гипотеза является абстрактной формой представления (модели) некоторых технических или технологических задач. Проверяя статистические гипотезы, мы решаем эти
12
задачи. Количество различных классов статистических гипотез невелико. Каждый класс гипотез проверятся с помощью своего критерия.
Пример 1. Сравнение среднего значенияmx с заданным числом a. Словесная постановка: можно ли утверждать, что жирность продукта соответствует стандарту – 43 %?
Данные эксперимента: 41,2; 44,8; 42,2; 40,2; 42,8; 41,4.
Статистическая гипотеза Н0: mx = 43, где х – жирность продукта.
Оценка x = 42,08 %, S = 1,593 %. Расхождение x - 43 = -0,92
может быть случайным (в силу того, что x - случайная величина) или закономерным. Если различие закономерно, то статистическая гипотеза неверна. А если случайно, то верна. Для проверки статистической гипотезы 1-го класса используется критерий Стьюдента:
T выч |
= x - a N |
, |
(1) |
|
|
S |
|
|
|
если |T| > Tтабл(α, ν) – то гипотеза неверна, т. к. разница |
x |
- a |
||
слишком велика. Если |T| ≤ Tтабл(α, ν), то гипотезу надо принять верной.
α – уровень значимости (максимальная вероятность ошиб-
ки), a Î [0 . 01 ; 0 . 1 ]. Обычно α = 0,05.
ν = N -1 – параметр Tтабл.
Твыч = -1,414, Tтабл(0,05; 5) = 2,57 – гипотезу следует при-
нять, т. е. жирность продукта соответствует 43 %.
|
Решение в wxMaxima |
(%i1) |
y:[41.2, 44.8, 42.2, 40.2, 42.8, 41.4]; |
(y) |
[41.2, 44.8, 42.2, 40.2, 42.8, 41.4] |
(%i2) |
y1:mean(y); |
(y1) |
42.1 |
(%i3) |
N:length(y); |
(N)6
(%i4) S:sum((y[i]−y1)²,i,1,N)/(N−1);
(S)2.54
13
(%i5) T:abs((y1−43)·√(N)/S); //вычисленное значение критерия Стьюдента
(%o5) |
0.3543307086614177 6 |
(%i6) |
test_mean (y, asymptotic=true, mean=43); |
(%o6) |
|
Результаты, которые возвращает функция:
•mean_estimate: среднее по выборке;
•conf_level: уровень значимости, выбранный пользователем;
•conf_interval: оценка доверительного интервала;
•method: использованная процедура;
•hypotheses: проверяемые статистические гипотезы (нулевая H0 и альтернативная H1);
•statistic: число степеней свободы для проверки нулевой гипотезы;
•distribution: оценка распределения распределения выборки;
•p_value: вероятность ошибочного выбора гипотезыH1, если выполняется H0.
Пример 2. Сравнение двух средних значений mx и my. Словесная постановка: можно ли утверждать, что произво-
дительность двух аппаратов одинакова? Данные эксперимента:
Х: 2,1; 2,7; 2,2; 2,6; 2,4; 2,3
Y: 2,7; 3,1; 2,9; 3,0; 2,6; 2,5; 2,8.
Статистическая гипотеза: mx = my, где х – производительность первого аппарата, y – производительность второго аппарата.
Оценки x =2,38, Sх= 0,2317. y =2,8, Sу= 0,216.
14
T выч = |
x - y |
N x N y ( N x + N y - 2 ) |
|
|
N x S x2 + N y S y2 |
× |
+ N y |
= -3,18, (2) |
|
|
N x |
|||
если |T|<Tтабл(α, ν) – то гипотеза принимается, иначе гипотеза отвергается.
α = 0,05; ν = Nх + Ny -2 ≡ 1; Tтабл = 2,2 – гипотеза отвергается, т. е. производительность аппаратов различна.
Замечание. Для решения 1-й и 2-й задачи использовался критерий Стьюдента, т. е. задачи аналогичны.
Если обозначить z = x – y, то z = x - y Þ x - y = z ~ 0, т. е. в задаче 2 происходит сравнение mz с 0 (как в 1-й mx c 43). Различие в формулах (1) и (2) возникает из-за того, что Nx ≠ Ny. При Nx = Ny задачи 1 и 2 эквивалентны.
Решение в wxMaxima
(%i1) x1: [2.1, 2.7, 2.2, 2.6, 2.4, 2.3];
x2: [2.7, 3.1, 2.9, 3.0, 2.6, 2.5, 2.8]; (x1) [2.1, 2.7, 2.2, 2.6, 2.4, 2.3]
(x2) [2.7, 3.1, 2.9, 3.0, 2.6, 2.5, 2.8]
(%i2) test_means_difference(x1, x2, alternative=twosided);
(%o2)
Вывод результатов test_means_difference не отличается от вывода результатов test_mean.
Пример 3. Сравнение двух дисперсий.
Словесная постановка: можно ли утверждать, что точность 2 приборов одинакова?
15
Данные эксперимента:
Прибор 1: 43,8; 42,7; 44,1; 43,5; 42,9; 44 Прибор 2: 47,2; 46,9; 47; 47,1; 47;46,8; 47.
Статистическая гипотеза: σ1 = σ2 (точность определяется дисперсией измерений эталонного образца, поэтому если дисперсии измерений 2 приборов одинаковы, то точности равны).
Получаем S12 = 0.34, S 22 = 0.0167 . Для проверки используется критерий Фишера:
|
|
|
S |
2 |
|
|
F |
= |
|
max |
|
|
S min2 , |
||||
|
выч |
|
|||
|
|
|
|||
где Smax2 = max{S12 , S22 }, Smin2 |
= min{S12 , S22 }. |
||||
Если Fвыч < Fтабл(νчисл, νзнам, α), |
где νi =Ni – 1, то считаем |
||||
различие между S12 и S 22 |
мало, |
и его можно объяснить случай- |
|||
ными причинами, следовательно, σ1 = σ2 - гипотеза принимается.
Иначе считаем, что различие между S12 и S 22 велико, и оно закономерно – гипотеза отвергается:
|
F |
|
= |
0,34 |
= 20,4 |
. |
|
|
|
||||
|
выч |
0,0167 |
|
|
||
|
|
|
|
следовательно, гипотеза отвергается - |
||
|
Fтабл(5; 6; 0,05) = 4,39, |
|||||
точность различна. |
Решение в wxMaxima |
|||||
|
|
|
|
|
||
(%i1) |
x1: [43.8, 42.7, 44.1, 43.5, 42.9, 44]; |
|||||
|
|
x2: [47.2, 46.9, 47, 47.1, 47, 46.8, 47]; |
||||
(x1) |
[43.8, 42.7, 44.1, 43.5, 42.9, 44] |
|||||
(x2) |
[47.2, 46.9, 47, 47.1, 47, 46.8, 47] |
|||||
(%i2) |
test_variance_ratio(x1, x2, alternative=twosided); |
|||||
(%o2) |
|
|
|
|
|
|
16
Задание (Исходные данные в приложении 2.)
1.Выдвинуть основную и альтернативную гипотезы.
2.Вычислить статистические оценки.
3.Сделать вывод о принятии или отвержении гипотезы.
Практическая работа № 3. Дисперсионный анализ
Цель работы: изучить проведение дисперсионного анализа.
Теоретические сведения
Очень часто изучаемый объект подвергается воздействию различных качественных факторов, т. е. таких, которые нельзя измерить в каких-либо единицах. Например, способы переработки сырья, тип катализатора и т. д.
Качественные факторы дискретны по своей природе, их значениям (уровням) не соответствует никакая шкала, отсюда следует – нельзя говорить, например, о возрастании или убывании качественного фактора. Можно лишь пронумеровать его уровни 1, 2,… или А1, А2…
Пример. Надежность компьютеров определяется временем его безотказной работы до1–го сбоя в каком-либо устройстве. Необходимо заключить договор с одной из трех фирмMITS, APPLE, IBM. При прочих равных условиях выбрать надо фирму,
17
выпускающую наиболее надежные компьютеры. Проведено по четыре испытания компьютеров каждой фирмы с измерение времени безотказной работы (час) (таблица).
Уровни |
Фирмы |
1 |
2 |
3 |
4 |
yi |
Si2 |
1 |
MITS |
51 |
52 |
56 |
57 |
54 |
8.67 |
2 |
APPLE |
52 |
54 |
56 |
58 |
55 |
6.67 |
3 |
IBM |
42 |
44 |
50 |
52 |
47 |
22.67 |
|
|
|
|
|
|
|
|
Необходимо определить различается ли надежность компьютеров у различных фирм.
Математически эту задачу можно сформулировать так: на случайную нормально распределенную величину воздействует качественный фактор А, принимающий значения на N различных уровнях. Необходимо проверить значимо ли его влияние?
Надо проверить гипотезу: my1 = my2 =…= myN, где myi – математическое ожидание случайной величиныу, когда фактор А принимает значения своегоi-го уровня (А = Аi). Если гипотеза верна, то фактор А влияет на случайную величину у.
Способ 1. Применяется если N = 2 (два уровня). В этом случае необходимо проверить гипотезу my1 = my2. Она проверяется по второму критерию Стьюдента.
Способ 2. Если N > 2, то применяют метод дисперсионного анализа. Пусть на каждом уровнеА проведено L измерений, результат l-го измерения при i-м уровне А обозначим уil.
|
|
|
|
|
|
1 |
|
|
|
N |
|
|
|
|
|
||||
|
|
|
|
= |
|
å yil |
|
|
|
|
|
||||||||
1. |
Вычислим |
yi |
- групповое среднее; |
||||||||||||||||
L |
|||||||||||||||||||
|
|
|
|
|
|
|
l =1 |
|
|
|
|
|
|||||||
|
|
|
|
|
|
|
1 |
|
|
N |
|
|
|
|
|
||||
|
|
|
|
= |
|
|
å |
|
|
|
|
|
|
|
|||||
|
|
|
y |
|
yi |
- общее среднее. |
|||||||||||||
|
|
|
N |
|
|||||||||||||||
|
|
|
|
|
|
|
|
l =1 |
|
|
|
|
|
||||||
|
|
|
|
|
|
|
|
|
|
|
L |
|
N |
||||||
|
Вычислим S факт2 = |
|
|
å( |
|
- |
|
) 2 - факторная диспер- |
|||||||||||
2. |
|
|
yi |
y |
|||||||||||||||
|
|
N - 1 |
|||||||||||||||||
|
|
|
|
|
|
|
|
|
|
|
i =1 |
||||||||
сия. Она показывает как различаются между собой y i , т. е. оценивает влияние фактора А и случайные помехи.
18
|
|
|
|
|
1 |
L |
|
|||
|
|
|
S i2 = |
å( yil - |
|
) 2 - групповое среднее; |
||||
3. |
Вычислим |
yi |
||||||||
L |
||||||||||
|
|
|
|
|
i=1 |
|
||||
|
|
1 |
N |
|
|
|
|
|
|
|
S восп2 |
= |
å S i2 |
- дисперсия воспроизводимости. |
|||||||
N |
||||||||||
|
|
i =1 |
|
|
|
|
|
|
||
Она показывает средние величины влияния случайных по- |
||||||||||
мех. Если влияние А незначимо, то S факт2 » S восп2 |
, т. к. они оце- |
|||||||||
нивают влияние только случайных помех, отсюда следует: если
S 2
F выч = факт < Fтабл (a, N -1, N ( L -1)), то фактор А не влияет на у.
Sвосп2
Иначе – влияет. Для рассматриваемого примера Fтабл = 4,62 .
|
|
|
|
|
|
Решение в wxMaxima |
||
(%i1) |
x:matrix([51,52,56,57],[52,54,56,58],[42,44,50,52]); |
|||||||
(x) |
æ51 |
|
52 |
56 |
57 ö |
|||
|
ç |
|
|
54 |
56 |
÷ |
||
|
ç52 |
|
58 ÷ |
|||||
|
ç |
|
|
|
|
|
÷ |
|
|
è42 44 50 52 ø |
|||||||
(%i2) |
mean(x); |
|
|
|
|
|||
(%o2) |
é145 |
|
,50,54, |
167 ù |
||||
ê |
|
|
|
|
ú |
|||
|
|
3 |
|
|||||
|
ë 3 |
|
|
|
û |
|||
(%i3) |
L:4; N:3; |
|
|
|
|
|
||
(L) 4 |
|
|
|
|
|
|
|
|
(N) 3 |
|
|
|
|
|
|
|
|
Групповое среднее |
|
|
|
|
||||
(%i4) |
for i:1 thru 3 do (sum:0,y1[i]:sum(x[i,j],j,1,4)/L,y[i]); |
|||||||
(%o4) done |
|
|
|
|
|
|||
(%i5) |
y1[1]; y1[2]; y1[3]; |
|
|
|||||
(%o6) 54 |
|
|
|
|
|
|||
(%o7) 55 |
|
|
|
|
|
|||
(%o8) 47 |
|
|
|
|
|
|||
19
Общее среднее
(%i9) y:sum(y1[i],i,1,N)/N;
(y) 52
Факторная дисперсия
(%i10) Sf:L·sum((y1[i]−y)²,i,1,N)/(N−1); (Sf) 76
Групповое среднее и дисперсия воспроизводимости
(%i11) for i:1 thru 3 do (sum:0,S[i]:sum((x[i,j]−y1[i])²,j,1,4)/L,S[i]);
(%o11) done
(%i12) S[1]; S[2]; S[3];
(%o13) 13/2
(%o14) 5
(%o15) 17
(%i41) Sv:sum(S[i],i,1,N)/N; (Sv) 19/2
Критерий Фишера
(%i42) Fv:Sf/Sv; (Fv) 8
Вывод: вычисленное значение критерия Фишера больше табличного, следовательно фактор А влияет на у.
Задание (Исходные данные в приложении 3.)
1.Вычислить групповое и общее среднее.
2.Вычислить факторную дисперсию.
3.Определить дисперсию воспроизводимости.
4.Сделать вывод о влиянии случайного фактора.
Практическая работа № 4. Регрессионный анализ
Цель работы: освоить методы построения статистических моделей на основе регрессионного анализа.
20
