Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Обработка результатов измерений в холодильной технике. Лабораторный практикум
.pdf
При определении измерения содержащего грубую ошибку,
критерии грубых ошибок сравнивают с максимально допустимыми по
таблице 7.
7. Для вариантов имеющих повторную серию замеров
выполнить проверку на воспроизводимость эксперимента по критерию
Кохрена (таблица 8) для доверительной вероятности Рд = 0,95.
8. Сделать выводы по результатам анализа эксперимента и
оформить отчет по работе.
Контрольные вопросы
1. С какой целью проводится тарировка термопары?
2. Какие термопары наиболее распространены в промышлен-
ности и научных исследованиях?
3. В каком температурном диапазоне используются разные виды
термопар?
4. Что такое математическое ожидание измеряемой величины?
5. Что такое дисперсия?
6. Что такое доверительная вероятность?
7. Какие критерии грубых ошибок применяются при змерениях?
8. Как оценить воспроизводимость эксперимента?
9. Какая особенность статистической обработки эксперимента
при малом (менее 20) количестве измерений?
10. Что такое интеграл Лапласа?
11. Что такое нормальное распределение вероятностей и какое
второе название оно имеет?
12. Что такое распределение вероятностей Стьюдента?
13. Что такое доверительный интервал?
14. Как связаны между собой дисперсия и среднеквадратичное
отклонение?
15. Как оценить необходимое количество замеров при
эксперименте?
21

Практическая работа № 1
)x,...,x,x(fy
n21
РЕГРЕССИОННЫЙ АНАЛИЗ ЭКСПЕРИМЕНТАЛЬНЫХ
ДАННЫХ
Регрессионный анализ является одним из наиболее
распространённых методов обработки экспериментальных данных при
изучении зависимостей в физике, биологии, экономике, технике и
других областях. Под этим понятием понимают исследование
закономерностей связи между явлениями (процессами), которые
зависят от многих, иногда неизвестных, факторов.
В регрессионном анализе рассматривается связь между одной
переменной у, называемой откликом, и несколькими другими x1,
x2,…xn, которые могут быть статически связаны между собой.
Переменные x1, x2,… xn называются факторами.
В регрессионном анализе связь представляется с помощью
следующей математической модели:
, (1)
которая называется линией регрессии, или просто регрессией; здесь
функция f(*) отражает функциональную зависимость у от x1,x2,…xn;
а ε - называемая ошибкой, характеризует случайную составляющую
этой зависимости. Случайная ошибка ε характеризует либо
изменчивость внутренне присущую отклику у, либо влияние на
него факторов, не учтенных в модели (1), либо и то и другое.
Следовательно, регрессионные зависимости характеризуются
вероятностными (стохастическими) связями. Поэтому установление
регрессионных зависимостей между величинами y и x возможно лишь
тогда, когда выполнимы статистические измерения.
Статистические зависимости описываются математическими
регрессионными выражениями, связывающими независимые значения
x (факторы) с зависимой переменной y (функция цели). Но выявить
эту закономерность можно только при наличии большого количества
измерений, так как при исследованиях каждой отдельной парной связи
в зависимости y=f(x) наблюдаются большие отклонения.
Суть регрессионного анализа сводится к установлению
уравнения регрессии, т.е. вида кривой наиболее вероятным образом
связывающей случайные величины (аргументами x и функцией y),
оценке тесноты связей между ними, достоверности и адекватности
результатов измерений.
22

Чтобы предварительно определить наличие такой связи между
i
x
i
x
i
y
i
y
x и y, наносят точки на график и строят так называемое
корреляционное поле (рисунок 5). По тесноте группирования точек
вокруг прямой или кривой линии, по наклону линии можно визуально
судить о наличии корреляционной связи.
Рис. 5. Корреляционное поле
Так из рисунка 5а видно, что экспериментальные данные
имеют определенную связь между x и y, а измерения, приведенные на
рисунке 5б, такой связи не показывают.
Корреляционное поле характеризует вид связи между x и y. По
форме поля можно ориентировочно судить о форме графика,
характеризующего прямолинейную или криволинейную зависимости.
Даже для вполне выраженной формы корреляционного поля
вследствие статистического характера связи исследуемого явления
одно значение x может иметь несколько значений y. Если на
корреляционном поле осреднить точки, т.е. для каждого значения
определить
и соединить точки
, то можно будет получить
ломаную линию, называемую экспериментальной регрессионной
зависимостью. Наличие ломаной линии объясняется погрешностями
измерений, недостаточным количеством измерений, физической
сущностью исследуемого явления и др. Если на корреляционном поле
провести плавную линию между
, которая равноудалена от них, то
23

получится новая теоретическая регрессионная зависимость – линия АБ
bxay
nn22110
xа...xаxааy
(см. рисунок 5а).
Регрессия называется парной, если у зависит только от
одного фактора х, в противном случае регрессия называется
множественной. Парная регрессия при парной зависимости может
быть аппроксимирована прямой линией, параболой, гиперболой,
логарифмической, степенной или показательной функцией, полиномом
и др. При множественности связей невозможно чётко разграничить
одни причинные явления от других. В этом случае наиболее
приемлемым способом определения зависимости (уравнения
регрессии) является метод перебора различных уравнений,
реализуемый с помощью компьютера [17, 18].
Регрессия называется линейной, если она имеет вид:
a) в случае парной регрессии
;
б) в случае множественной регрессии
. (2)
При проведении регрессионного анализа приходится,
полностью или частично, преодолевать следующие этапы:
1) выбор модели;
2) нахождение коэффициентов модели;
3) проверка адекватности и работоспособности.
1. Выбор модели. На данном этапе исследователю (самому)
необходимо выбрать вид зависимости (т.е. функцию f), так чтобы
неизвестными были бы только параметры, входящие в эту функцию.
На выбор модели может повлиять:
знание моделей, которыми пользовались другие
исследователи в подобных ситуациях и знание того, как себя проявили
эти модели;
стремление, при выборе функции f(x), отразить реальные
закономерности присущие объекту исследования. Например, при
построении производственной функции может возникнуть желание
выбрать функцию f(x), так чтобы она была выпукла;
использовать простые по форме "подгоночные" формулы,
которые обладают только одним хорошим свойством, они близко
расположены к опытным данным;
в случае парной регрессии расположение точек на графике
может повлиять на выбор модели;
24

выбрать модель, так чтобы ее можно было бы сделать
1421322110
xlnаxxаxаxааy
443322110
zаzаzаzааy
11
xz
22
xz
213
xxz
14
xlnz
2
210
xаxааy
xz1
2
2
xz
22110
zаzааy
xа
0
1
eаy
01
bxbs
ylns
00
alnb
11
ab
kk22110
za...zazaay
)z,...,z,z(z
iki21ii
линейной относительно новых регрессионных переменных z1, z2,..., zk
(см.(2)).
Ниже на примерах показаны типичные приемы линеаризации
модели.
Пример 1. Пусть модель выбрана в виде:
,
тогда, вводя новые переменные (регрессионные), получим линейную
модель:
,
где
,
,
,
.
Пример 2. Пусть выбрана модель:
,
Тогда, вводя переменные
,
, получим линейную модель:
.
Пример 3. Пусть выбрана модель:
.
После логарифмирования получим новую модель относительно новых
регрессионных переменных:
,
где
,
,
.
Очевидно, найдя b0 и b1, легко восстановить значения a0 и a1 исходной
модели.
2. Вычисление коэффициентов модели. После того, как модель
выбрана и произведена ее линеаризация, т.е. относительно
регрессионных переменных модель имеет вид:
, (3)
стоит задача оценки коэффициентов a0, a1,…,ak. Для достижения этой
цели набирают статистический материал, т.е. проводят опыты и
находят значение yi в i-м опыте при заданном значении факторов
. Здесь следует помнить, что число опытов n,
проведенных в различных точках z, должно быть больше числа
оцениваемых параметров, т.е. n>k+1. Если это условие не будет
выполнено, то доверять построенной линии регрессии нельзя.
25

Для нахождения оценок коэффициентов a0, a1,…,ak
n
1i
2
i
min)yy(
используется метод наименьших квадратов, сущность которого
заключается в следующем: из кривых, задаваемых видом функции f(*),
выбирается та, которая "ближе всего" расположена к опытным
данным. Таким образом, при построении теоретической регрессионной
зависимости оптимальной является такая функция, в которой
соблюдаются условия наименьших квадратов
,
где yi – фактические ординаты поля; y - среднее значение ординаты с
абсциссой x.
Метод наименьших квадратов (МНК) позволяет получить
оценки максимального правдоподобия неизвестных коэффициентов
уравнения регрессии при нормальном распределении, но его можно
применять и при любом другом распределении факторов.
В основе МНК лежат следующие положения:
- значения величин ошибок и факторов независимы, а значит, и
некоррелированы, т.е. предполагается, что механизмы порождения
помехи не связаны с механизмом формирования значений факторов;
- математическое ожидание ошибки ε должно быть равно нулю, иначе
говоря, ошибка является центрированной величиной;
- выборочная оценка дисперсии ошибки должна быть минимальна.
Если же линейная модель неточна или параметры измеряются
неточно, то и в этом случае МНК позволяет найти такие значения
коэффициентов, при которых линейная модель наилучшим образом
описывает реальный объект в смысле выбранного критерия
среднеквадратического отклонения.
Качество полученного уравнения регрессии оценивают по
степени близости между результатами наблюдений за показателем и
предсказанными по уравнению регрессии значениями в заданных
точках пространства параметров. Если результаты близки, то задачу
регрессионного анализа можно считать решенной. В противном случае
следует изменить уравнение регрессии и повторить расчеты по оценке
параметров.
3. Проверка адекватности и работоспособности модели.
После того, как модель построена, возникает вопрос об адекватности
модели. Под адекватностью модели подразумевается, что никакая
другая модель не даст существенного улучшения в предсказании
26

отклика у. Один из методов проверки адекватности модели является
т
i
э
i
i
yye
э
i
y
т
i
y
i
e
i
e
n21
е,...,е,e
i
e
i
z
i
y
i
e
анализ остатков:
,
где
модели, i = 1,…, n, все
- опытные данные,
- значения откликов, рассчитанные по
имеют такое же распределение, как
е − чистая ошибка. Очевидно, что если исследователь подобрал модель
"близкую" к той, что есть на самом деле, то остатки
(согласно (1))
являются независимыми нормально распределенными случайными
величинами. Поэтому, последовательность значений
расположенных в том же самом порядке, в котором собирались
данные, позволяет проверить гипотезы о случайности и нормальности.
Однако пакеты статистических программ часто дают
возможность провести этот анализ "глазомерным" способом выводя
графики остатков, т.е. проводить анализ остатков относительно
регрессионных переменных. Приведем шаблоны для принятия
решения об адекватности по графикам остатков.
Случай парной регрессии. Для проверки адекватности модели
можно использовать график
в зависимости от
или
. Если
остатки попадают в горизонтальную полосу с центром на оси абсцисс,
то модель можно признать адекватной (см. рисунок 6а).
Если полоса расширяется, когда z или y возрастает
(рисунок 6б), то это указывает на отсутствие постоянства дисперсии,
что делает необходимым провести преобразование у. График,
показывающий линейный рост (рисунок 6в), дает основание для
введения в модель дополнительной переменной. График вида,
представленного на рисунок 6г, указывает на то, что в модель должен
быть добавлен линейный или квадратичный член, а график вида
рисунок 6д указывает на добавление тригонометрической функции
(периодической).
Случай множественной регрессии. В данном случае можно
получить значительно больше графиков, поскольку остатки
сопоставлять с каждой из z1, z2,..., z
переменной, а также с y.
k
можно
,
27

Рис. 6а
Рис. 6б
Рис. 6в
Рис. 6г
Рис. 6д
i
e
График
в сопоставлении с zik содержит информацию:
- о наличии аномальных наблюдений или случаев отклонения по
переменной zk (см. рисунки 6б, 6в);
28

- о возможном отсутствии линейности по zk (см. рисунок 6г), что
i
e
i
y
)z,...,z(f
k1
,xxryy
x
y
;
n
х
i
х
.
n
y
i
y
)2)iy(
2
i
ym()
2
)ix(
2
i
xm(
yxyxm
r
iiii
может служить указанием для дальнейшего преобразования.
График
выполнении предположений случайности, независимости и на
отсутствие постоянства дисперсии e .
Адекватность модели ещё не означает, что модель будет
"хорошо" предсказывать значения отклика y . Это, например, может
произойти, если значения функции
действие случайной ошибки [4].
Уравнение регрессии прямой можно так же представить
выражением
где σх и σу – средние квадратичные отклонения, определяемые
относительно
доставляет информацию о
"намного меньше", чем
Критерием близости корреляционной зависимости между x и y
к линейной функциональной зависимости является коэффициент
парной корреляции r, показывающий степень тесноты связи x и y и
определяемый отношением
где m – число измерений (число пар значений).
Значение коэффициента корреляции всегда меньше единицы.
При r = 1,0 значения x и y связаны функциональной связью (в данном
случае линейной), т.е. каждому значению x соответствует только одно
значение y. Если r < 1, то строгой линейной связи не существует. При
r 0 линейная корреляционная связь между x и y отсутствует, но
может существовать нелинейная регрессия.
В процессе эксперимента одновременно может измеряться
несколько величин. В ряде случаев необходимо оценить независимость
этих величин друг от друга. Независимость определяется отсутствием
корреляции между этими величинами. Отсутствие корреляции не
означает полное отсутствие связей между величинами, достаточно,
чтобы связь не была линейной. Оценку независимости можно
29
,

произвести при помощи коэффициента парной корреляции. Если
2
д
rk
0,75kд
0,75kд
bxay
))x(xm/()yxxym(b
22
22
2
)x(xm
xyxxy
a
величина коэффициента парной корреляции велика (r > 0,8), замер
одной из величин можно исключить, так как он не вносит
дополнительной информации. При r > 0,5 связь между величинами с
удовлетворительной точностью можно признать линейной.
Для определения процента разброса (изменчивости) искомой
функции y относительно ее среднего значения, определяемого
изменчивостью фактора x, вычисляют коэффициент детерминации
. Если
, то от модели следует отказаться. Если
, то модель может использоваться для прогнозов [4].
Занятие №1. Регрессионный анализ
экспериментальных данных
Цель работы: рассчитать линию регрессии для
экспериментальных данных, полученных в лабораторной работе №1
(таблица 3).
При тарировке термопар поле корреляции аппроксимируется,
как правило, с достаточной точностью уравнением прямой
.
Линию регрессии рассчитывают из условий наименьших квадратов.
При этом теоретическая регрессионная линия наилучшим образом
выравнивает значения постоянных коэффициентов a и b, т.е.
коэффициентов уравнения регрессии. Их вычисляют по выражениям
,
.
Если в результате эксперимента получен статистический ряд
парных измерений x и y, то вычисление уравнения регрессии удобно
вести в табличной форме (см. таблицу 9). При этом в строке со знаком
размещаются суммы всех значений соответствующего столбца.
Величины этих сумм (кроме столбцов 4 и 5) в дальнейшем
используются для вычисления коэффициента корреляции и
коэффициентов уравнения регрессии.
30
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
