Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Введение в анализ данных с интервальной неопределенностью. Учебное пособие

.pdf
Скачиваний:
0
Добавлен:
07.09.2026
Размер:
2 Мб
Скачать
Между мультиинтервалами также могут быть определены арифмети- ческие операции «по представителям» аналогично тому, как это делается на множестве интервалов. Мультиинтервалы можно получать при решении уравнений и систем уравнений.
Пример 2.5.9. Пример мультиинтервалов.
пример, в котором появляются неодносвязные интервалы. Рассмотрим зада- чу нахождения корня уравнения второй степени с различными значениями параметра𝑎.
𝑎 · 𝑥2= [0,5, 1,5].
Возьмем для определенности значения
𝑎 = 0,6и𝑎 = 1,2
Приведем модельный
(2.24)
.
Рис. 2.5.
с разными значениями параметра
Получим решения уравнения (2.24):
𝑎 = 0,6 : 𝑋1= [[2,04, 1,58], [1,58, 2,04]] ;
𝑎 = 1,2 : 𝑋2= [[1, 44, 1,12], [1,12, 1,44]] .
Мультиинтервалы отрезков синего и красного цвета. При изменении коэффициента при стар- шей степени полинома компоненты мультиинтервалов решений уравнения (2.24) меняют и размер, и положение на вещественной оси.
𝑋1, 𝑋2показаны на рис. 2.5 соответственно парами
Решение уравнения (2.24)
𝑎
2.6. Описание измерений
2.6.1. Накрывающие и ненакрывающие измерения
Результат измерения интересующей нас величины может быть либо рав- ным, либо не равным ее истинному значению. В случае измерения непре- рывных физических величин, принадлежащих вещественному типу данных,
31
равенство является исключительным событием, неустойчивым к сколь угод- но малым возмущениям или погрешностям в вычислительных алгоритмах.
Принципиально другая ситуация возникает, если результат измерения может быть интервалом. Невырожденный интервал по своей сути является представительным множеством на вещественной оси (имеющим ненулевую меру), и оно, как правило, устойчиво к малым возмущениям и погрешно- стям вычислений. Для обработки интервальных данных фундаментальный характер имеет следующее определение ([1, 47]):
Определение.
интервальный результат измерения, который гарантированно содержит ис- тинное значение измеряемой величины. Измерение, для которого нельзя утверждать, что оно содержат истинное значение измеряемой величины, бу- дем называть
Отметим, что с точки зрения формальной логики понятия накрывающего и ненакрывающего измерений являются противоположными, но при этом не противоречащими друг другу.
Накрывающее измерение является гарантированной двусторонней вил- кой значений измеряемой величины, тогда как для ненакрывающего изме- рения подобное утверждать нельзя. При перенесении свойства накрытия ис- тинного значения на выборки простейший путь объявить накрывающей выборкой совокупность накрывающих измерений, тогда как выборки, в ко- торых присутствует хотя бы одно ненакрывающее измерение, станут нена- крывающими. Погрешности и выбросы (промахи) неотъемлемо присутству- ют в данных, и проверка свойства «накрытия истинного значения» является нетривиальной.
Далее будем называть которой доминирующая часть (большинство и т.п.) измерений аблюдений) являются накрывающими.
Напротив, выборка называется часть входящих в нее измерений ненакрывающие.
Данное определение нестрогое и использует расплывчатые понятия «большинство», «доминирующая часть» и т.п., которые должны уточняться каждый раз в процессе применения.
Важность введенных понятий обусловлена тем, что накрывающее хва- тывающее) измерение дает не только приближение к интересующему истин- ному значению физической величины, но и двустороннюю оценку этого зна- чения, т. е. его гарантированные оценки снизу и сверху. Это обстоятельство позволяет привлечь для обработки накрывающих измерений более сильные средства, другой математический аппарат частности, некоторые специ- фичные методы интервального анализа) и получить в результате уточнен- ные оценки для истинного значения также в виде двусторонней оценки. Для ненакрывающих измерений и выборок это не всегда достижимо.
Накрывающее измерение
ненакрывающим
(рис. 2.6 и 2.7).
накрывающей выборкой
(накрывающий замер) это
совокупность измерений, в
ненакрывающей
, если преобладающая
32
Истинное значение Истинное значение
R R
- -
Интервал
измерения
Рис. 2.6.
Истинное значение Истинное значение
Рис. 2.7.
измерения интервального истинного значения величины
Тот факт, что интервальный результат измерения не является накрываю- щим, может быть вызван различными причинами: измерение может оказать- ся выбросом, погрешность измерения недооценена, существует неадекват- ность выбранной модели объекта (непостоянство во времени, выбор неверной функциональной зависимости).
Проверка того, является ли данное измерение или выборка накрывающи- ми, находится вне рамок математической теории интервальных измерений, и производится в каждом случае конкретно. Для традиционных точечных измерений аналога введенных понятий не существует, так как все точечные измерения, как правило, ненакрывающие.
Для достижения свойства накрытия нередко прибегают к специальным приемам в процессе предобработки данных (см. пп. 3.5 и 4.5.1).
Накрывающее (слева) и ненакрывающее (справа)
измерения точечного истинного значения величины
R R
- -
Интервал
измерения
Накрывающее (слева) и ненакрывающее (справа)
Интервал
измерения
Интервал
измерения
2.6.2. Информационное множество
Данные измерений, которые были описаны ранее, можно назвать
ными
, так как чаще всего они подвергаются дальнейшей обработке. Таким образом, для определения окончательного результата измерения необходимо дополнить постановку задачи моделью обработки данных (способом обра- ботки данных). Это математическая модель, формализующая требования к результату обработки измерения и оформленная в виде системы уравнений, задачи оптимизации и т. п., которая определяет то, что должно считаться
первич-
33
результатом обработки измерений.
Информационное множество
ство значений параметров, удовлетворяющих математической системе отно- шений, полученной в результате агрегирования информации о математиче- ской модели объекта, первичных данных измерений и модели их обработки. Информационное множество зависит от выбранной модели обработки дан- ных, потому даже для одних и тех же данных может быть определено неедин- ственным образом в зависимости от того, как эти данные обрабатываются и интерпретируются.
Пример 2.6.10. Различные походы к задаче восстановления за-
висимости.
мости некоторого заданного вида по данным измерений. Эта зависимость мо- жет восстанавливаться, например, методом наименьших квадратов (МНК), методом наименьших модулей (МНМ) или с помощью чебышевского (мини- максного) сглаживания. Перечисленные методы представляют собой разные модели обработки данных.
Для одних и тех же данных измерений, т. е. первичных данных, итого- вый результат измерения будет разным в зависимости от того, какая именно методика их обработки применяется МНК, МНМ или минимаксное при- ближение. Следовательно, получатся три различных информационных мно- жества, которые в обычном случае неинтервальных данных, скорее всего, будут одноточечными множествами (см. п. 4.6.19).
Другими словами,
метров задачи, которые совместны с данными измерений в рамках выбран- ной модели их обработки.
информационных множеств, возникающих в задаче оценивания постоянной величины и в задаче восстановления линейной зависимости.
Аналогом информационного множества может отчасти являться понятие доверительного интервала оцениваемой случайной величины в традиционной вероятностной статистике. В определение доверительного интервала входит дополнительный параметр торого понятие становится бессодержательным из-за неограниченности носи- телей большинства вероятностных распределений, но смысл доверительного интервала примерно соответствует информационному множеству.
Предположим, что мы решаем задачу восстановления зависи-
информационное множество это множество пара-
В главах 3 и 4 приведены конкретные определения
для интервальных данных это множе-
уровень статистической значимости
, без ко-
2.7. Выбросы и промахи
Выбросами
результаты которых не привносят информацию об исследуемом объекте в рамках его принятой модели.
Другое определение выбросов (промахов) состоит в том, что это результа- ты измерений, которые в данных условиях резко отличаются от остальных результатов общей выборки. Выбросы нарушают некоторую однородность
34
(или
промахами
) в метрологии называются такие измерения,
(согласованность, непротиворечивость), характерную для большинства на- блюдений выборки по отношению к заданной математической модели (см. п. 4.5). Оба приведенных определения неформальны, так как одно формаль- ное определение для данного важнейного понятия дать нельзя.
Как правило, выбросы стремятся удалить из выборки на этапе ее предва- рительной обработки (предобработки), т.е. перед применением формальных математических методов, так как присутствие выбросов существенно иска- жает оценки истинных значений параметров. Выявление выбросов является нетривиальной и, как правило, трудноформализуемой процедурой, которая опирается на опыт и т.п. Для вероятностной статистики выявление выбро- сов является необходимой составной частью обработки данных, а некоторые процедуры даже рекомендованы в стандартах [14].
Что считать выбросом
в случае интервальных результатов измерений? Из положения, что интервальное измерение не является накрывающим, не следует, что оно представляет выброс (промах). Отождествление выбро- сов (промахов) со свойством ненакрывания противоречит принципу соответ- ствия, сформулированному в п. 1.3.2. При стремлении ширины интерваль- ных измерений к нулю они переходят в точечные измерения, которые, как правило, всегда ненакрывающие.
Если априори известно, что измерение, производимое данным инструмен- том с помощью некоторой определенной методики должно быть накрываю- щим, то получение ненакрывающего результата является признаком выброса (промаха). Более подробно выбросы и промахи, а также методики их выяв- ления будут рассмотрены в гл. 3 и 4.
Г л а в а 3
ИЗМЕРЕНИЕ ПОСТОЯННОЙ
ВЕЛИЧИНЫ
3.1. Выборка измерений
и интервалы их неопределенности
Постоянная величина
цессе сохраняет свое значение неизменным. Например, рост человека не ме- няется заметно в процессе его измерения, поэтому может считаться постоян- ной величиной, хотя на протяжении жизни человека рост непостоянен.
Пусть имеется выборка измерений некоторой величины
это величина, которая в рассматриваемом про-
𝑥1, 𝑥2, . . . , 𝑥𝑛,
или кратко тат измерения, полученный, к примеру, с помощью какой-либо из процедур, описанных ранее. Таким образом, согласно терминологии интервального ана- лиза рассматриваемая выборка это вектор интервалов, или интервальный вектор, будем называть результатам измерений или наблюдений требуется найти оценку интересую- щей нас величины.
будем использовать работу [44]. В табл. 3.1 воспроизведена часть данных из работы [44].
лы в виде графика, изображенного на рис. 3.1, который по статистической традиции называют повернуть картинку и представлять интервалы данных горизонтально (см. рис. 3.5).
неопределенности отдельных измерений выборки. Величину неопределенно- сти всей выборки характеризует вектор радиусов
Часто такая детальность не требуется в представлении неопределенности вы- борки, а нужна какая-либо одна величина, которая агрегированным образом
𝑥 = (𝑥1, 𝑥2, . . . , 𝑥𝑛)
Табличные данные.
Для наглядного представления выборки чертят образующие ее интерва-
Значения
𝑛
{ 𝑥𝑘}
, где𝑘 номер измерения;
𝑘 = 1
длиной выборки
диаграммой рассеяния
rad 𝑥𝑘,
rad 𝑥 = (rad 𝑥1, rad 𝑥2, . . . , rad 𝑥𝑛).
𝑥𝑘 интервальный резуль-
. Число𝑛 размерность вектора данных
(или объемом выборки). По интервальным
В качестве источника данных для ряда примеров
(см. также рис. 3.2 и 3.9). Можно
𝑘 = 1, 2, . . . , 𝑛
показывают величины интервальной
(3.1)
36
Таблица
3.1
Данные табл. 1 для величины
Номер замера Peak
1 2 3 4 5 6 7 8
9 10 0,6 3,4 11 12 13 14 15
представляет данную неопределенность. В этом случае можно взять какую- либо норму вектора
По аналогии с традиционной метрологией будем называть измерения вы-
борки
равноширинными
кова, т.е.
в которых величина неопределенности сти от измерения выборки «имеющие равную неопределенность» и «имеющие неодинаковые неопреде- ленности».
янной величины по выборке интервальных данных будет также интервал, который будем называть это интервал, содержащий значения оцениваемой величины, которые сов- местны с измерениями выборки (согласуются с данными этих измерений). Но конкретный смысл, вкладываемый в понятия «совместные» или «согла- сующиеся», будет различен для разных ситуаций. В частности, он зависит от того, является ли выборка интервальных данных накрывающей или нет.
rad 𝑥𝑘= 𝑟 = const,𝑘 = 1, . . . , 𝑛
Напротив,
Информационным множеством в случае оценивания единичной посто-
rad 𝑥
.
, если неопределенность всех этих измерений одина-
неравноширинными
𝑘 = 1, . .. , 𝑛
информационным интервалом
4,4 2,7
3,4 1,9
6,9 2,4
1,2 2,4
1,0 2,7
10,8 3,5
10,2 2,8
6,3 2,0
10,4 4,1
1,8 2,0
6,6 2,1
4,9 2,1
6,0 2,4
4,0 2,7
.
(разноширинными) называем измерения,
rad 𝑥𝑘может меняться в зависимо-
. Фактически эти термины означают
δ × 105[44]
std
. Другими словами,
Peak
37
𝑥
Номер измерения
1
Рис. 3.1.
. . .
𝑘
. . .
𝑛
Диаграмма рассеяния интервальных измерений
постоянной величины
3.2. Обработка накрывающих выборок
Если истинное значение величины содержится во всех интервалах изме- рений выборки этих интервалов. Следовательно, уточненным интервалом принадлежности истинного значения может быть объединение
Это и будет информационным множеством𝐼оценки измеряемой физиче- ской величины (рис. 3.2) для его левой (нижней) и правой (верхней) границ выражены следующими формулами:
В силу сделанного допущения о том, что выборка накрывает истинное значение величины, имеем ный случай совместной выборки, когда но на пределе совместности, и информационный интервал𝐼вырождается в точку.
Если известен некоторый априорный интервал возможных значений оце- ниваемой постоянной величины рованно содержать ее, то границы результирующего интервала (3.2) могут быть уточнены пересечением
{𝑥𝑘}
𝑛
, то оно должно принадлежать также пересечению
𝑘 = 1
𝐼 =
информационный интервал
𝐼 = max
𝑥𝑘; 𝐼 = min
1𝑘𝑛
𝐼 𝐼
. При этом заслуживает внимания предель-
1 𝑘 𝑛
𝑥𝑘.
1𝑘𝑛
. Явные выражения
𝑥𝑘.
𝐼 = 𝐼 = 𝑥*. Тогда выборка совместна,
𝐼
= [𝐼
, 𝐼
]
апр
апр
, который должен гаранти-
апр
(3.2)
(3.3)
38
𝐼 = 𝐼 𝐼
апр
.
(3.4)
𝑥
𝑥
1
𝑥
𝑁
rad 𝐼
mid 𝐼
6 ?
𝑥
𝑘
ˇ𝑥
𝐼
. . . . . .
Номер измерения
Рис. 3.2.
1 . . . . . .
Обработка накрывающей выборки
𝑘 𝑁
интервальных измерений величины
Отметим, что априорный интервал ничение, если он имеет вид
[𝐼
апр
𝐼
, +]
может задавать одностороннее огра-
апр
или
[−∞, 𝐼
апр
]
.
На практике часто необходимо работать не с интервалами интересующей величины (3.2) или (3.4), а с некоторой точечной оценкойˇ𝑥. Все точки ин- формационного интервала равноценны друг другу, поэтому точечную оценку
ˇ𝑥
можно выбирать произвольно (рис. 3.2). Тем не менее имеет смысл взять из интервала некоторое точечное значение, которое представляет его наилуч- шим образом. В качестве такой величины можно использовать, к примеру, его
центральную оценку
𝑥c:
𝑥𝑐= mid 𝐼 =
1
𝐼 + 𝐼.
2
(3.5)
Cередина интервала обладает определенной оптимальностью, являясь точ- кой, которая наименее удалена от других точек этого интервала.
Пример 3.2.11. Обработка накрывающей выборки.
Выберем из
данных табл. 3.1 накрывающую подвыборку. Это замеры с номерами
{1, 2, 3,8, 12, 13, 14, 15}.
(3.6)
Диаграмма рассеяния выборки (3.6) приводится на рис. 3.3. Также на данном рисунке приведены оценки границы информационного множества (3.3). Численно оценки границ этого информационного множества состав- ляют в единицах
5
10
𝐼 = max
1 𝑘 𝑛
𝑥𝑘= 5, 3; 𝐼 = min
1 𝑘 𝑛
𝑥𝑘= 4, 5.
39
𝑥
𝐼 = 4,5
𝐼 = 5,3
1 8 15
Рис. 3.3.
Центральная оценка
Далее сравним полученные оценки с другими способами оценивания по пол- ной ненакрывающей выборке табл. 3.1.
Пример обработки накрывающей выборки
интервальных измерений
(3.5) в единицах
𝑥𝑐= mid 𝐼 =
10−5равна
1
𝐼 + 𝐼= 4,9.
2
Номер измерения
3.3. Оценки интервальных выборок
В п. 3.3 будут введены различные оценки интервальных выборок, рас- смотрены конкретные примеры и взаимные отношения различных мер.
3.3.1. Мода интервальной выборки
В традиционной статистике важной характеристикой выборки является ее
мода
значение из выборки, которое встречается наиболее часто. Для непрерывного вероятностного распределения мода точка с наибольшей плотностью вероятности.
Имеет смысл распространить понятие моды на обработку интервальных данных, где оно будет обозначать интервал тех значений, которые встреча- ются в интервалах обрабатываемых данных наиболее часто. Фактически это означает, что точки из моды интервальной выборки накрываются наиболь- шим числом интервалов этой выборки. Ясно, что по определению понятие моды имеет наибольший смысл для накрывающих выборок. Следуя работе [45], введем следующее определение.
Определение.
чения ее наибольшей совместной подвыборки.
Модой
интервальной выборки назовем интервал пересе-
40