Статистическая обработка данных в среде wxMaxima. Практикум. Учебное пособие
.pdf
Теоретические сведения
Изучим метод построения статистических моделей, не делая никаких предположений о распределении выходных параметров.
1. Сведения о матрицах. а) Правило умножения:
C = A × B, A = [m ´ n], B = [n ´ k ], C = [m ´ k ];
N
Cij = åair × brj . r =1
Существует частный случай матриц – матрицы-столбцы и матри- цы-строки:
X = (x1 , x 2 ,..., x N ) - строка; |
|
|
|
|
|
|
|
|||||||||
|
|
|
|
|
|
|
|
æ |
x |
ö |
|
|
|
|
|
|
|
|
|
|
|
|
|
|
ç |
1 |
÷ |
|
|
|
|
|
|
|
|
T |
|
|
|
T |
ç x2 |
÷ |
|
|
|
|
|
|
||
Y = X |
= (x1 , x2 ,..., xN ) |
= |
ç |
M |
÷ - столбец. |
|
|
|
|
|||||||
|
|
|
|
|
|
|
|
ç |
÷ |
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
ç |
|
÷ |
|
|
|
|
|
|
|
|
|
|
|
|
|
|
è xN ø |
|
|
|
|
|
|
||
б) Скалярное произведение: |
|
|
|
|
|
|
|
|
||||||||
|
|
|
N |
|
|
T |
|
|
|
|
|
|
|
|
|
|
X ,Y = å xi × yi = X Y . |
|
|
|
|
|
|
|
|
|
|||||||
|
|
|
i =1 |
|
|
|
|
|
|
|
|
|
|
|
|
|
в) Обратная матрица: |
|
|
|
|
|
|
|
|
|
|
||||||
D = |
|
a11 |
a12 |
|
= a11 |
× a22 |
- a12 |
× a21 ; A |
-1 |
= |
1 éa11 |
a12 |
ù |
|||
|
|
|||||||||||||||
|
a21 |
a22 |
|
|
|
ê |
|
ú . |
||||||||
|
|
|
|
|
||||||||||||
|
|
|
|
|
|
|
|
|
|
|
D ëa21 |
a22 û |
||||
|
|
|
|
|
|
|
|
|
|
|
||||||
2. Метод наименьших квадратов.
Статистической моделью какого-либо объекта называется уравнение вида: y = yдет (x) , т. е. зависимость детерминированной составляющей выхода от входных параметров. Будем искать это уравнение в виде квазилинейных моделей, т. е.
y = b1 f1 ( X ) + L + bk f k ( X ) ,
где fj – некоторые известные функции нескольких переменных; bj – неизвестные коэффициенты модели.
Необходимо найти статистические оценки bj .
21
Метод наименьших квадратов – метод построения стати-
стических моделей, согласно которому оценки bj ищутся из ус-
ловия:
|
N |
) |
2 |
|
) |
||
|
Q = å [b1 f1 ( X i ) + L + bk f k ( X i ) - y iэксп ] ® min , |
||
|
i =1 |
|
|
где |
X i , y iэксп - результаты i-го эксперимента, т. е. коэффициенты |
||
bj |
подбираются таким образом, чтобы разница |
||
Q = åN [y iвыч - yiэксп ]2 ® min . i =1
Согласно необходимому и достаточному условию существования минимума функции запишем:
¶Q |
N |
) |
) |
|
2 |
эксп |
|
||||
) |
= 2å [b1 f1 ( X i ) + L + bk f k ( X i ) - y i |
] × f j ( X j ) = 0. |
|||
¶b j |
i =1 |
|
|
|
) |
Так как количество искомых переменных b j равно k , то получаем систему из k уравнений относительно k неизвестных:
) N b1 å f1
i =1
)N
+bk å
i=1
) N |
|
( X i ) × f j ( X i ) +L+ b j å f j2 ( X i ) +L+ |
|
i =1 |
(*) |
N |
|
f k ( X i ) × f j ( X i ) = å yiэксп f j ( X i ), |
j = 1, k. |
i =1
Систему (*) удобно представить в матричной форме. Для этого введем следующие обозначения:
1)X = {xij} – значение j-го входного параметра в i-м эксперименте; Х – матрица плана эксперимента.
2)F = {Fiu} = {fu( X i )} – регрессионная матрица. Число строк матрицы равно числу экспериментов, число столбцов равно числу функций модели.
3)Y = {y iэксп } - столбец выходных параметров.
4)b = {bu } - столбец искомых коэффициентов.
22
) )
Тогда Q = ( F b - Y ) T (F b - Y ) ® min . Путем преобразова-
¶Q
ния Q и нахождения частных производных¶b = 0 получим матричную запись системы (*):
)
( F T F ) × b = F T Y .
)
Отсюда получим: b = ( F T F ) - 1 × F T Y . 3. Регрессионный анализ.
Регрессионный анализ применяется для построения статистической модели и включает в себя два этапа.
1)Структурный синтез – определение вида модели, напри-
мер, y = a+bx.
2)Параметрический синтез – вычисление неизвестных коэффициентов модели (a и b).
Структуру модели определяем исходя из количества входных параметров. Коэффициенты модели рассчитываем таким образом, чтобы
N
Φ(a,b)= å( yiвыч - (a + bxi )) ® min .
i=1
Для этого:
- составляется регрессионная матрица F = {Fij} = {fj(xi)}. Число строк матрицы равно числу экспериментов, число столбцов равно числу функций модели. Например, y= a + bx = =1× a + b × x , f1 = 1, f2 = x:
|
é1 |
1 |
ù |
|
|
ê |
2 |
ú |
|
F = |
ê1 |
ú |
; |
|
ê |
3 |
ú |
||
|
1 |
ú |
|
|
|
ê |
4 |
|
|
|
ë1 |
û |
|
- составляется столбец выходных параметров:
é10 ù
êú
Y = ê20 ú ;
ê30 ú
êú
ë40 û
23
- b - столбец искомых коэффициентов модели:
é a ù b = ê ú .
ëb û
Затем из уравнения ( F T F ) × b = F T × Y находят значения ко-
эффициентов - вектор b |
. FТ – транспонированная матрица F. |
|||
После построения модели проводится ее статистический |
||||
анализ. |
|
|
|
|
1) Вычисляется значение остаточной дисперсии: |
||||
|
|
1 |
N |
|
S ост2 |
= |
å( yiвыч - yiэксп ) 2 , |
||
N - k |
||||
|
|
i =1 |
||
где k – число коэффициентов модели.
2) Вычисляется коэффициент детерминации:
|
|
|
N |
|
||||
|
|
|
å( yiвыч - |
|
|
)2 |
|
|
|
Qрегр |
|
y |
|
||||
R2 = |
= |
i=1 |
~1. |
|||||
|
N |
|||||||
|
Qобщ å( yiэксп - |
|
)2 |
|
||||
|
y |
|
||||||
i=1
Коэффициент детерминации показывает, какую долю общей суммы квадратов можно объяснить неслучайными причинами.
|
3) |
Проверяется эффективность модели: |
||||||||||
|
|
|
|
|
|
|
F эф |
|
|
|
|
|
|
|
|
|
|
|
K эф = |
выч |
|
>1, |
|||
|
|
|
|
|
|
|||||||
|
|
|
|
|
|
|
Fтабл |
|
|
|
|
|
|
F эф |
= |
S |
2 |
|
|
|
|
|
|
|
|
|
|
рег |
|
|
|
|
|
|
||||
где |
выч |
|
|
- вычисленное значение критерия Фишера; |
||||||||
|
S ост2 |
|||||||||||
|
|
|
|
|
|
1 |
N |
|
|
|
|
|
|
|
|
|
|
S рег2 = |
å( yiвыч |
- |
|
) 2 , |
|||
|
|
|
|
|
y |
|||||||
|
|
|
|
|
k -1 |
|||||||
|
|
|
|
|
|
i=1 |
|
|
|
|
|
|
Fтабл (a, nч , nзн ) ,
24
где α = 0,05 – уровень значимости; nч = k - 1 – число степеней свободы числителя для Sрег2 ; nзн = N – k – число степеней свобо-
ды для знаменателя .
Кэф позволяет оценить, насколько влияние контролируемых параметров сильнее влияния случайных помех.
4) Оценивается значимость коэффициентов модели. Основная гипотеза Н0: bi = 0 – коэффициент незначимый. Альтернативная гипотеза На: bi ¹ 0 – коэффициент значимый.
Проверку проводят с помощью 3-го критерия Стьюдента:
T выч = |
bi |
, |
з i |
Sост2 |
×Сii |
|
где Сii – диагональный элемент обратной матрицы (ΦT Φ)-1 . Определяется табличное значение критерия Стьюдента
Ттабл (α/2, n), где α/2 = 0,025; n = N – k - число степеней свободы
для знаменателя S ост2 .
Если | Tз вычi | > Ттабл (α/2, n), то i-й коэффициент значимый. Если коэффициент незначимый, то его необходимо исключить из модели и пересчитать все заново. Значимость коэффициентов оценивает влияние отдельных входных параметров или каких-то их сочетаний.
Пример расчета
Пусть даны входные и выходные параметры:
х1 |
1 |
2 |
3 |
4 |
х2 |
5 |
6 |
7 |
7 |
уэксп |
6 |
8 |
12 |
15 |
Рассмотрим модель: y = b0 + b1 x1 + b2 x2 . Для данной моде-
ли f0 = 1, f1 = x1, f2 = x2.
Построим регрессионную матрицу:
25
|
|
|
|
é1 |
1 |
5 ù |
|
|
|
|
é 6 ù |
|
|
|
|
é1 |
1 |
1 |
1 ù |
|
|
|
|
|
||||||
|
|
|
|
ê1 2 6 |
ú |
|
|
|
|
ê |
8 |
|
ú |
|
|
|
|
|
|
|
|
|
||||||||
F = |
|
Y = |
|
|
; F |
T |
= |
ê |
1 2 3 4 |
ú |
|
|
|
|
|
|||||||||||||||
ê |
|
|
ú ; |
ê |
ú |
|
|
ê |
ú ; |
|
|
|
|
|
||||||||||||||||
|
|
|
|
ê |
3 |
7 |
ú |
|
|
|
|
ê |
|
|
ú |
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
1 |
|
|
|
|
|
12 |
|
|
|
|
|
|
ê |
5 |
6 |
7 |
7 |
ú |
|
|
|
|
|
|||
|
|
|
|
ê |
|
|
ú |
|
|
|
|
ê |
|
|
ú |
|
|
|
|
|
|
|
|
|
||||||
|
|
|
|
4 |
7 |
|
|
|
|
|
|
|
|
|
|
ë |
û |
|
|
|
|
|
||||||||
|
|
|
|
ë1 |
û |
|
|
|
|
ë15 |
|
û |
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|||
|
|
|
|
|
é 4 |
|
10 |
|
25 ù |
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
||||
F |
T |
F = |
ê |
|
30 |
|
66 |
ú |
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|||||
|
ê10 |
|
|
ú . |
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|||||||||||
|
|
|
|
|
ê |
|
66 |
|
159 |
ú |
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|||
|
|
|
|
|
ë25 |
|
|
û |
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|||||
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
é |
41 ù |
|
|
|
|
|
|
|
|
|
|
|
|
||
|
|
|
|
Вычисляем: |
F |
T |
Y |
= |
ê |
118 |
ú |
|
|
|
|
|
|
|
|
|
|
|
|
|||||||
|
|
|
|
|
ê |
ú . |
|
|
|
|
|
|
|
|
|
|
|
|||||||||||||
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
ê |
|
ú |
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
ë |
267 û |
|
|
|
|
|
|
|
|
|
|
|
|
||
|
|
|
|
Составляем систему: |
B := (Φ T Φ ) - 1 × (Φ T Y ) |
|
|
|
||||||||||||||||||||||
|
|
|
|
Решив систему, находим значения коэффициентов: |
||||||||||||||||||||||||||
b |
0 |
= 4; b = 3 |
1 |
; b |
2 |
= - |
1 |
. |
|
|
|
|
|
|
|
|
|
|
|
|
|
|||||||||
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
||||||||||||||||
|
|
|
|
1 |
|
3 |
|
|
|
|
3 |
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
||||
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
1 |
|
|
1 |
|
||||
|
|
|
|
Таким образом, получили модель: |
y = 4 + 3 |
x1 |
- |
x2 . Да- |
||||||||||||||||||||||
|
|
|
|
3 |
3 |
|||||||||||||||||||||||||
лее проводится статистический анализ полученной модели.
Решение в wxMaxima
(%i1) Φ:matrix([1,1,5],[1,2,6],[1,3,7],[1,4,7]);
(Φ) æ1 |
1 |
5 ö |
ç |
2 |
÷ |
ç1 |
6 ÷ |
ç÷
ç1 |
3 |
7 ÷ |
ç |
4 |
÷ |
è1 |
7 ø |
(%i2) Y:matrix([6],[8],[12],[15]);
(Y)æ6 ö
ç÷
ç8 ÷
ç÷
ç12÷
ç÷
è15ø
(%i3) transpose(Φ);
26
(%o3) æ1 |
|
1 |
1 |
1 ö |
|||
|
ç |
|
|
2 |
3 |
÷ |
|
|
ç1 |
|
4÷ |
||||
|
ç |
|
|
|
|
÷ |
|
|
è5 6 7 7ø |
||||||
(%i4) |
A: transpose(Φ).Φ; |
||||||
(A) |
æ4 |
|
10 |
|
25 ö |
||
|
ç |
|
|
30 |
÷ |
||
|
ç10 |
66 ÷ |
|||||
|
ç |
|
|
|
|
÷ |
|
|
è25 66 159 ø |
||||||
(%i5) C:transpose(Φ).Y; |
|||||||
(C) |
æ41 |
ö |
|
|
|||
|
ç |
|
|
÷ |
|
|
|
|
ç118 ÷ |
|
|
||||
|
ç |
|
|
÷ |
|
|
|
|
è267 ø |
|
|
||||
(%i6) |
|
B:invert(A).C; |
|||||
(B) |
æ4 |
|
ö |
|
|
|
|
|
ç |
|
|
÷ |
|
|
|
|
ç |
|
|
÷ |
|
|
|
|
ç10 |
÷ |
|
|
|
||
|
ç |
3 |
÷ |
|
|
|
|
|
ç |
|
|
÷ |
|
|
|
|
ç |
1 |
|
÷ |
|
|
|
|
ç |
|
÷ |
|
|
|
|
|
ç |
|
|
÷ |
|
|
|
|
è 3 |
|
ø |
|
|
|
|
Задание (Исходные данные в приложении 4.)
1.Определить вид модели. Составить регрессионную
матрицу.
2.Вычислить коэффициенты модели.
3.Провести статистический анализ модели с помощью wxMaxima.
4.Записать вывод.
27
Практическая работа № 5. Параметрический синтез и статистический анализ
Цель работы: освоить методы построения статистических моделей на основе регрессионного анализа.
Теоретические сведения
Параметрический синтез – это определение коэффициентов модели. Одним из методов, используемых для этого, является метод наименьших квадратов (МНК).
Пусть есть данные эксперта:
x- вектор входных параметров;
y- вектор выходных параметров.
Рассмотрим модель объекта, линейную относительно коэффициентов bi:
ˆ |
( x ) + b 2 |
2 ( x ) + L + b k k |
( x ) . |
(1) |
y = b1 1 |
||||
Проведем расчет коэффициентов моделиbi, |
исходя из сле- |
|||
дующего условия: |
|
|
|
|
|
N |
|
|
|
S( b )= å(yi |
- yˆi )2 ® min, |
|
|
|
i=1
где N – объем выборки; yi – экспериментальные выходные значения; yˆi - значения выходных параметры, рассчитанные по моде-
ли (1).
Введем обозначения:
X = {xi} – матрица входных параметров или матрица плана эксперимента;
Y = {yi} – матрица выходных параметров.
Тогда матричная форма записи МНК будет иметь вид
ΦT Φb = ΦT y , |
(2) |
где F = {j j ( x )} - регрессионная матрица:
28
|
çæj1 (x1 ) |
j2 (x1 ) |
L jk (x1 ) ÷ö |
|
|||
|
çj1 (x2 ) j2 (x2 ) L jk ( x2 ) ÷ |
|
|||||
F = |
ç |
M |
M |
M |
M |
÷ |
; |
ç |
÷ |
||||||
|
çj1 (xi ) |
j2 (xi ) L jk |
(xi |
) ÷ |
|
||
|
ç |
(xn ) |
j2 (xn ) |
|
|
÷ |
|
|
èj1 |
L jk (xn ) ø |
|
||||
F T - транспонированная матрица. Операция транспонирования означает, что в матрице F столбцы заменяются на строки;
b - вектор (столбец) коэффициентов модели, b = {bi};
y - вектор (столбец) выходных экспериментальных параметров.
Из (2) получаем, что значения коэффициентов b определяют по формуле
b = ( F T F ) - 1 × F T y ,
где (ΦT Φ)-1 - обратная матрица.
На этом этапе параметрический синтез закончен.
Статистический анализ полученной модели - это оценка качества модели и принятие решения о ее пригодности.
Статистический анализ модели включает в себя следующие этапы.
1. Вычисление остаточной дисперсии, которая определяет
величину разброса выходных параметров y под действием случайных помех:
|
2 |
|
1 |
N |
|
2 |
|
|
|
) |
|
|
|||
S |
ост |
= |
|
å( yi - yi |
) |
|
, |
N - k |
|
||||||
|
|
|
i =1 |
|
|
|
где k – число коэффициентов модели.
2. Вычисление коэффициентов детерминации.
R |
2 |
= 1 - |
å ост |
= |
å рег |
|
|
|
|
, |
|||
|
å общ |
å общ |
||||
29
N
где åост = å( yi - yi )2 - сумма остаточной дисперсии;
i=1
N
åобщ = å( yi - y)2 - сумма общей дисперсии;
i=1
y - среднее экспериментальное;
N
åрег = å( yi - y)2 - сумма регрессионной дисперсии;
i=1
y- среднее модельное.
3.Проверка эффективности модели.
При проверке эффективности модели выдвигаются две гипотезы.
Основная Н0: Sрег2 = Sост2 - модель неэффективна;
Альтернативная На: Sрег2 > Sост2 - модель эффективна.
Проверку проводят с помощью критерия Фишера:
|
|
|
|
|
|
|
|
|
|
S |
2 |
|
|
|
|
|
|
|
|
|
F эф |
= |
|
рег |
, |
|
|
|
|
|
|
|
|
выч |
|
Sост2 |
||
|
|
|
|
|
|
|
|
|
|
|||
|
|
|
1 |
N |
|
|
|
|
|
|
|
|
|
2 |
|
) |
|
|
|
2 |
|
|
|
|
|
|
|
|
|
|
|
|
|
|
||||
где S |
рег |
= |
|
å( yi |
- y) |
- регрессионная дисперсия, которая |
||||||
|
||||||||||||
|
|
|
k -1 i =1 |
|
|
|
|
|
|
|
|
|
показывает разброс модельных выходных параметров относительно их среднего значения.
По значениям Sрег2 и Sост2 принимается одна из гипотез
(Н0 или На). Если модель эффективна, то тогда целесообразно говорить о коэффициенте эффективности. Определяется
Fтабл (a, nч , nзн ) ,
где α – уровень значимости; nч = k-1 – число степеней свободы числителя для Sрег2 ; nзн = N – k – число степеней свободы для
знаменателя Sост2 . Если Fвычэф > Fтабл , то модель эффективна. Определяется коэффициент эффективности модели:
30
