Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Байесовы технологии. Их реализация в программной среде Hugin и применение в операционном риск-менеджменте. Учебное пособие

.pdf
Скачиваний:
0
Добавлен:
07.09.2026
Размер:
2 Мб
Скачать
Итак, строго БС представляет собой набор [33, 34]
Sick=«sick»
Sick=«not»
0.1
0.9
Табл. 2.2. P(Dry)
Dry=«dry»
Dry=«not»
0.1
0.9
 =󰇛, , 
G = (V, E) – ациклический направленный граф с узлами V = (v
󰇜
, где
, ,v
1
)
n
и направленными дугами E, задающими отношения условной независимости переменных сети так, что если два узла v
󰇛
, то P
󰇜
v
i
= P(vi|v
, );
j
v
i
d-разделены3 при свидетельстве
j
X – набор случайных переменных, представляющих узлы V =
󰇛
v
, ,v
1
дой случайной переменной x
󰇜
графа G;
n
P – набор распределений условных вероятностей P(xV|x
X.
v
pa (V)
) для каж-
Рассмотрим пример БС, ставший уже классическим – «Яблоня» [32]. Про­блемная область данного примера – маленький сад, принадлежащий Джеку. Однажды Джек обнаружил, что его самая лучшая яблоня лишилась листвы. Он хочет выяснить причину произошедшего. Джек знает, что часто листва опадает в случае, если дерево засыхает из-за недостатка влаги, или, если дерево болеет.
Данная ситуация может быть смоделирована БС, содержащей три узла: Sick (Болеет), Dry (Засохло) и Loses (Облетело) (рис. 2.2).
Рис. 2.2. Пример «Яблоня»
Каждый узел данной БС может принимать два возможных состояния: узел
Болеет – состояние «болеет» (sick) и «нет» (not), узел Засохло – состояние «за­сохло» (dry) и «нет» (not), узел Облетело – состояние «да» (yes) и «нет» (not).
Рассматриваемая БС моделирует факт того, что имеется причинно­следственная связь от события Болеет к событию Облетело и от события Засо­хло к событию Облетело. В БС это отображено стрелками.
На рис. 2.2 дано графическое представление БС. Однако это только качест-
венное представление БС. Для того чтобы определить сеть как БС, необходимо ее дополнить количественными данными, то есть ТУВ.
Табл. 2.1. P(Sick)
3
Понятие d-разделения узлов сети вводится в подразделе 2.2.
11
Табл. 2.3. P(Loses | Sick, Dry)
Dry=«dry»
Dry=«not»
Sick=«sick»
Sick=«not»
Sick=«sick»
Sick=«not»
Loses=«yes»
0.95
0.85
0.90
0.02
Loses=«no»
0.05
0.15
0.10
0.98
Заметим, что все три таблицы показывают вероятность нахождения узла в
определенном состоянии, обусловленном комбинацией состояний его роди­тельских узлов. Так как вершины Болеет и Засохло не имеют родительских уз­лов, их вероятности являются маргинальными.
БС, которые моделируют причинно-следственные отношения аналогично данному примеру, называются статическими байесовыми сетями (СБС). СБС отражают только текущую ситуацию. Например, рис. 2.3 моделирует область двух болезней (diseases: D1 и D2), которые могут сопровождаться различными симптомами (symptoms: S1 и S2). Используя информацию о симптомах, можно предсказать вероятность каждой болезни.
Рис. 2.3. Статистическая байесова сеть
Однако некоторые проблемные области невозможно представить без учета фактора времени. В таких случаях СБС должны быть модифицированы путем добавления в них узлов, отражающих изменение системы во времени. Такие се­ти известны как динамические байесовы сети (ДБС). Самый простой способ преобразования СБС в ДБС – «размножение» архитектуры СБС, соответст­вующей различным временным периодам, и их соединение (рис. 2.4).
момент времени t1. Поэтому на рис. 2.4 показана связь между узлами, представ­ляющими «болезнь в момент времени t0» (узлы D1 и D2) и «болезнь в момент времени t1» (узлы D1* и D2 *).
Рис. 2.4. Динамическая байесова сеть
Наличие болезни в момент времени t0 окажет влияние на наличие болезни в
12
2.2. Условная независимость переменных
Ключевое понятие БС – это условная независимость переменных. Два ряда переменных A и B считаются (условно) независимыми при условии ряда пере­менных С, если, в случае, когда значения переменных C становятся известны, знание о значениях переменных B не дает никакой новой информации о значе­ниях переменных A:
P󰇛AB, C󰇜= P󰇛AC󰇜, (2.4)
Условная независимость может быть непосредственно определена из графа сети.
Пусть A, B и C – наборы несовместных переменных, тогда необходимо:
– определить наименьший подграф, который содержит A B C и их
предков;
– добавить ненаправленные ребра между узлами, имеющими общего по-
томка;
– удалить направления всех направленных ребер.
Теперь, если любой путь между переменными А и B содержит переменную C, то A условно независима от B при условии C.
Для иллюстрации понятия условной независимости рассмотрим следую­щую модель (рис. 2.5) [28]. Одышка (dyspnoea: d) может появиться вследствие туберкулеза (tuberculosis: t), рака легкого (lung cancer: c) или бронхита (bronchi­tis: b), а также вследствие ни одного из перечисленных заболеваний или вслед­ствие нескольких из них. Посещение Азии (Asia: a) увеличивает шансы забо­леть туберкулезом. Курение (smoker: s) – фактор риска, как для рака, так и для бронхита. Результат рентгена (X-ray: x) не позволяет различить рак и туберку­лез, также как не определяет факт наличия или отсутствия одышки. Последнее обстоятельство представлено в графе промежуточной переменной (tuberculosis or cancer: t or c), которая соответствует логической функции «или» для родите­лей (t и c) и означает наличие либо одной, либо двух болезней, либо их отсутст­вие.
Рис. 2.5
13
Информация о том, что пациент курильщик (s), определяет доверие отно-
X
Z
X
Z
X
Z
сительно рака (c) и бронхита (b). Однако доверие относительно туберкулеза (t) не изменяется (то есть t условно не зависит от s при данном пустом множестве остальных переменных). Наличие положительного результата рентгена пациен­та (x) повышает доверие относительно туберкулеза (t) и рака (c), но не относи­тельно бронхита (b) (то есть b условно не зависит от x при данном s). Однако, имея информацию, что у пациента одышка (d), результат рентгена (x) изменит доверие относительно бронхита (b) (то есть b условно зависит от x при данном
d).
Другой метод определения условной независимости переменных основан
на понятии т.н. d4-разделения [34]. Для уточнения данного понятия сначала опишем возможные типы отношений между переменными в БС:
последовательная связь (рис. 2.6)
Рис. 2.6
Влияние информации распространяется между переменными при после­довательной связи до тех пор, пока состояние Y не становится известно.
Например, если идет дождь (Y), то знание о наличии темного облака (X) является нерелевантным к доверию о мокрой лужайке (Z). С другой стороны, если не известно идет ли дождь, наличие темного облака увеличивает доверие о дожде, что в свою очередь, увеличивает доверие о мокрой лужайке.
дивергентная или расходящаяся связь (рис. 2.7)
Рис. 2.7
Влияние информации распространяется между переменными при дивер­гентной связи до тех пор, пока состояние Y не становится известно.
Если идет дождь (Y), то информация о том, что лужайка мокрая (X) не дает никаких новых знаний о сводке погоды (Z). С другой стороны, если не известно идет ли дождь, то сообщение о возможности дождя увеличивает доверие о до­жде, что в свою очередь увеличивает доверие о мокрой лужайке.
конвергентная или сходящаяся связь (рис 2.8)
Рис 2.8
4
«d» – от анг. dependence: зависимость
14
Влияние информации распространяется между переменными при конвер­гентной связи, только если информация о состоянии Y доступна.
Если известно, что лужайка мокрая (Y) и на ней находится разбрызгиватель (X), то доверие о дожде (Z) изменится, поскольку состояние лужайки вынужда- ет полагать, что причиной является, скорее всего, разбрызгиватель, нежели дождь. С другой стороны, если нет никакой информации о состоянии лужайки, то информация о том идет ли дождь не влияет на доверие о состоянии разбрыз­гивателя (работал он или нет).
Две переменные X и Z в БС считаются d-разделенными, если на любом пу­ти (без учета направлений ребер), соединяющем эти два узла, найдется проме­жуточная переменная Y, такая что:
связь с Y последовательная или дивергентная, и Y конкретизирована, ли-
бо;
связь с Y конвергентная, нет свидетельств ни о значении Y, ни о каждом из ее потомков.
Важно отметить, что при определении отношений условной зависимости и
независимости переменных в БС существенную роль играет знание (или незна­ние) об их состоянии.
Определим отношения между переменными в ациклическом направленном графе, показанном на рис 2.9, используя указанные выше правила:
переменные C и L d-разделены при отсутствии свидетельств о других
переменных, так как любой путь между ними содержит, по крайней мере, одну конвергентную связь (например, путь C G  K  H  L).
переменные C и L d-связаны при данном K (то есть, если значение K из-
вестно), так как граф содержит несколько путей между C и L, конвергентные связи которых включают конкретизированную переменную К (например, путь C  G  K  H  L), или переменная К является потомком узла на пути меж­ду C и L, входящего с ним в конвергентное соединение (например, путь
C  A  D  B  E  H  L).
Рис 2.9
15
Результаты, полученные при анализе сети на рис 2.5, с помощью правила d-разделения объясняются следующим образом:
переменная t условно не зависит от s при отсутствии свидетельств о дру-
гих переменных (d-разделена), так как любой путь между ними содержит, по крайней мере, одну конвергентную связь (например, путь tt or c cs);
переменная b условно не зависит от x при данном s (d-разделена), так
как путь bsct or cx содержит дивергентную связь с конкретизированной переменной, а путь bdt or cx содержит неконкретизированную конвер­гентную связь;
переменная b условно зависит от x при данном d (d-связана), так как
путь bsct or cx содержит неконкретизированную дивергентную связь, а путь bdt or cx содержит конвергентную связь с конкретизированной пе­ременной.
Верификация модели байесовой сети
Важным этапом при создании модели проблемной области является ее ве­рификация посредством анализа отношений условной зависимости и независи­мости, инициированных структурой модели.
Установление направления связи от следствия к причине (вместо верного: от причины к следствию) – одна из самых распространенных ошибок при по- строении БС. Это может привести к существенным трудностям при определе­нии значений ТУВ, а, следовательно, к неправильному выводу.
Рассмотрим пример верификации структуры модели обнаружения мошен­нических действий с кредитными карточками. Введем три переменные:
A: несколько ПК куплено в течение нескольких дней с использованием од­ной и той же кредитной карточки;
B: кредитная карточка используется практически в одно и то же время в разных местах;
C: мошенничество.
Модель A  C  B на первый взгляд может показаться естественной (пе­ременные A и B используются как «входы» для определения вероятности C). Однако, из правил d-разделения следует, что если состояние С не известно, сведения о А (или B) не изменят доверие о состоянии B (или A). Это неверно, так как сведения о А (или B) увеличивает доверии о C, что, в свою очередь, по­вышает доверие о B (или A).
Модель A  C  B, с другой стороны, делает A и B зависимыми, если нет информации о состоянии C. Когда же значение C конкретизируется, то A и B становятся независимыми, что в данной ситуации кажется весьма разумным (если известно наверняка, что случай мошенничества произошел, то наблюде­ние А (или B) не изменяет доверие о наблюдении B (или A)).
16
2.3. Алгоритм адаптации байесовой сети
Обучение исходных параметров байесовых моделей на основании посту-
пающей о них информации реализуется посредством процедуры адаптации (adaptation). Процедура адаптации [23, 27, 32] БС подразумевает аппроксима­цию распределения вероятностей состояний каждой переменной распределени­ем Дирихле, что объясняется, главным образом, тем, что распределение Дирих­ле является сопряженным приором для мультиномиального (полиномиального) распределения, к которому может быть аппроксимировано распределение лю­бого типа.
Пусть переменная сети имеет конфигурацию состояний родительских переменных и возможных состояний, тогда для определения соответст­вующего распределения Дирихле необходимо задать его параметров: 1, ,. Пусть означает вероятность состояния переменной
, заданного
конфигурацией состояний родительских переменных . Предполагая распреде­ление Дирихле, функция плотности вероятности определяется как
󰇛1,  ,
󰇜
1
,
= 1
=1
, 0   1.
Процедура адаптации предполагает вычисление апостериорного распреде­ления вероятностей состояний переменных сети с учетом поступившего свиде-
тельства (|), которое рассматривается как смесь + 1 распределений Ди­рихле: одного – для набора случаев, когда конфигурация состояний родителей отличается от ; и по одному – для каждого из случаев, когда =
и конфи-
гурация состояний родителей соответствует :
󰇛
󰇜
= 󰇟1,  ,
󰇠
1  󰇛
󰇜
+
󰇟1,  ,+ 1,  ,
=1
󰇠󰇛
, 
󰇜
.
Зададим [23]
=
= 󰇛, 
= 󰇛
= 
+
=
,
,
󰇜
󰇜
,
󰇛
1  󰇜×
,
.
17
Тогда апостериорное среднее Дирихле 󰇛
󰇜
определяется после преобразований [23] как
и дисперсия
 
смеси распределений
 
 
=
1
+ 2
×
 
×
+ 
=
+ 1
󰇛
1  
,
󰇜
+
× (1  
+ 1
)
.
Далее смесь распределений Дирихле аппроксимируется единственным распределением так, чтобы оно имело такой же вектор средних и сумму дис­персий, что и данная смесь, а именно:
1

+ 1
󰇛
×
1  
󰇜
=
1
+ 2
× (1  
󰇛
×
1  
󰇜
+
+ 1
)
.
Отсюда [23]
=  +
(+ ) × ( 
×
󰇛
1  
󰇜
+
󰇛
×
+ 1
)
1  
.
󰇜
Апостериорное среднее
следует рассматривать как условную веро-

ятность состояния  переменной после адаптации. В свою очередь, как из­вестно, дисперсия нится среднее
отражает ожидание относительно того, насколько изме-

при поступлении нового свидетельства (наблюдения),

вследствие чего дисперсия служит мерой доверия к среднему. Тогда параметр
 ( ) распределения Дирихле может рассматриваться как эквивалентный объем выборки (equivalent sample size), показывающий количество наблюдений,
которое необходимо произвести от состояния полного незнания до состояния, в котором доверие к среднему соответствует фактическому. Таким образом, эк­вивалентный объем выборки также отражает доверие к среднему, и, следова­тельно, чем выше его значение, тем выше степень доверия к установленному распределению вероятностей.
2.4. Диаграммы влияния
Диаграмма влияния (ДВ) (influence diagram) – разновидность БС, служащая
для обоснования принимаемых решений в условиях неопределенности. ДВ, как и БС, содержит узлы, представляющие переменные проблемной области, одна­ко, помимо данных узлов (случайных, узлов состояний), ДВ также содержит узлы решения и узлы полезности.
Узел решения представляет переменную, отражающую множество взаимо- исключающих альтернатив решения, принимаемого пользователем.
18
Узел полезности представляет функцию полезности (как правило, в стои-
󰇍
мостном выражении) от нахождения его родителей в определенном состоянии. Узлы полезности не имеют узлов-потомков.
Если состояние случайного узла ДВ оказывает влияние на принятие поль­зователем решения, то в ДВ необходимо добавить связь от данного случайного узла к узлу решения. Таким образом, если состояние случайного узла должно быть известно до момента принятия решения, то в ДВ между ними должен су­ществовать направленный путь.
Так как все решения ДВ могут быть приняты только в определенной по­следовательности, ДВ должна содержать направленный путь, проходящий че­рез все узлы решения. Связь от одной переменной решения к другой показыва­ет хронологический порядок их принятия.
Таким образом, порядок следования случайных узлов и узлов решения в ДВ должен быть следующим:
где I
I0, D1, I1, D2,..., Dn, I
набор случайных узлов, состояние которых известно до принятия
i-1
решения D
для всех = 1,
i
;
,
n
In – набор случайных узлов, состояние которых станет известно после
принятия последнего решения Dn.
Полезность от принятия решения Dk (и всех решений, хронологически сле­дующих за ним) можно определить только после того, как все предыдущие ре­шения D1,..., D менных I0,..., I
были приняты и состояние всех предыдущих случайных пере-
k-1
было конкретизировано.
k-1
Следует заключить, что ДВ – это инструмент нахождения оптимальной
альтернативы решения, которая наиболее выгодна (полезна) в условиях предос­тавленной информации, исходя из принципа максимизации ожидаемой полез­ности.
Тогда ДВ представляет собой [33, 34]
 =󰇛, , , 
󰇜
, где
 = (, ) – ациклический направленный граф с узлами  = (1, ,) и направленными дугами , задающими отношения условной неза- висимости переменных сети так, что если два узла  
детельстве , то 󰇛
󰇜
= (|, );
d-разделены при сви-
ХC – набор случайных переменных, XD – набор переменных решения такие, что =  , представляющих узлы = (1, ,
P – набор распределений условных вероятностей (|
) графа G;
()
) для ка-
ждой случайной переменной  ;
U – набор функций полезности (
) для каждого узла 
󰇜
󰇛
в наборе
узлов полезности   [33, 34].
Для более детального изучения ДВ вернемся к рассмотренному выше при-
меру «Яблоня» (рис. 2.10).
19
Рис. 2.10
Цель изучения данной проблемной области заключается в принятии реше-
ния о том – осуществлять обработку дерева или нет.
Для этого необходимо преобразовать статическую БС (рис. 2.10) в динами­ческую (рис. 2.11) путем добавления в нее узлов Болеет' (Sick'), Засохло' (Dry') и Облетело' (Loses'), которые интерпретируются аналогично предыдущим, но на момент сбора урожая. Вводимые узлы могут принимать те же состояния, что и их аналоги. Разумно предположить наличие причинно-следственной связи между узлами Болеет и Болеет', Засохло и Засохло', так как, например, если де­рево больно в настоящий момент времени, вероятно, оно будет больно и в сле­дующий момент (конечно, сила связи зависит от горизонта прогнозирования).
Рис. 2.11
В ДВ на рис. 2.11 следует добавить узел решения: проводить обработку де­рева или нет (рис. 2.12). Узел решения Обработка (Treat) может принимать со­стояние «обработка» (treat) и «нет» (not). В ДВ указана связь от узла Обработ­ка до узла Болеет', так как разумно ожидать, что обработка дерева окажет воз­действие на его состояние в будущем.
Рис. 2.12
20
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]