Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Байесовы технологии. Их реализация в программной среде Hugin и применение в операционном риск-менеджменте. Учебное пособие
.pdf
Итак, строго БС представляет собой набор [33, 34]
Sick=«sick»
Sick=«not»
0.1
0.9
Табл. 2.2. P(Dry)
Dry=«dry»
Dry=«not»
0.1
0.9
=, ,
– G = (V, E) – ациклический направленный граф с узлами V = (v
, где
, ,v
1
)
n
и направленными дугами E, задающими отношения условной независимости
переменных сети так, что если два узла v
, то P
v
i
= P(vi|v
, );
j
v
i
d-разделены3 при свидетельстве
j
– X – набор случайных переменных, представляющих узлы V =
v
, ,v
1
дой случайной переменной x
графа G;
n
– P – набор распределений условных вероятностей P(xV|x
X.
v
pa (V)
) для каж-
Рассмотрим пример БС, ставший уже классическим – «Яблоня» [32]. Проблемная область данного примера – маленький сад, принадлежащий Джеку.
Однажды Джек обнаружил, что его самая лучшая яблоня лишилась листвы. Он
хочет выяснить причину произошедшего. Джек знает, что часто листва опадает
в случае, если дерево засыхает из-за недостатка влаги, или, если дерево болеет.
Данная ситуация может быть смоделирована БС, содержащей три узла:
Sick (Болеет), Dry (Засохло) и Loses (Облетело) (рис. 2.2).
Рис. 2.2. Пример «Яблоня»
Каждый узел данной БС может принимать два возможных состояния: узел
Болеет – состояние «болеет» (sick) и «нет» (not), узел Засохло – состояние «засохло» (dry) и «нет» (not), узел Облетело – состояние «да» (yes) и «нет» (not).
Рассматриваемая БС моделирует факт того, что имеется причинноследственная связь от события Болеет к событию Облетело и от события Засохло к событию Облетело. В БС это отображено стрелками.
На рис. 2.2 дано графическое представление БС. Однако это только качест-
венное представление БС. Для того чтобы определить сеть как БС, необходимо
ее дополнить количественными данными, то есть ТУВ.
Табл. 2.1. P(Sick)
3
Понятие d-разделения узлов сети вводится в подразделе 2.2.
11

Табл. 2.3. P(Loses | Sick, Dry)
Dry=«dry»
Dry=«not»
Sick=«sick»
Sick=«not»
Sick=«sick»
Sick=«not»
Loses=«yes»
0.95
0.85
0.90
0.02
Loses=«no»
0.05
0.15
0.10
0.98
Заметим, что все три таблицы показывают вероятность нахождения узла в
определенном состоянии, обусловленном комбинацией состояний его родительских узлов. Так как вершины Болеет и Засохло не имеют родительских узлов, их вероятности являются маргинальными.
БС, которые моделируют причинно-следственные отношения аналогично
данному примеру, называются статическими байесовыми сетями (СБС). СБС
отражают только текущую ситуацию. Например, рис. 2.3 моделирует область
двух болезней (diseases: D1 и D2), которые могут сопровождаться различными
симптомами (symptoms: S1 и S2). Используя информацию о симптомах, можно
предсказать вероятность каждой болезни.
Рис. 2.3. Статистическая байесова сеть
Однако некоторые проблемные области невозможно представить без учета
фактора времени. В таких случаях СБС должны быть модифицированы путем
добавления в них узлов, отражающих изменение системы во времени. Такие сети известны как динамические байесовы сети (ДБС). Самый простой способ
преобразования СБС в ДБС – «размножение» архитектуры СБС, соответствующей различным временным периодам, и их соединение (рис. 2.4).
момент времени t1. Поэтому на рис. 2.4 показана связь между узлами, представляющими «болезнь в момент времени t0» (узлы D1 и D2) и «болезнь в момент
времени t1» (узлы D1* и D2 *).
Рис. 2.4. Динамическая байесова сеть
Наличие болезни в момент времени t0 окажет влияние на наличие болезни в
12

2.2. Условная независимость переменных
Ключевое понятие БС – это условная независимость переменных. Два ряда
переменных A и B считаются (условно) независимыми при условии ряда переменных С, если, в случае, когда значения переменных C становятся известны,
знание о значениях переменных B не дает никакой новой информации о значениях переменных A:
PAB, C= PAC, (2.4)
Условная независимость может быть непосредственно определена из графа
сети.
Пусть A, B и C – наборы несовместных переменных, тогда необходимо:
– определить наименьший подграф, который содержит A B C и их
предков;
– добавить ненаправленные ребра между узлами, имеющими общего по-
томка;
– удалить направления всех направленных ребер.
Теперь, если любой путь между переменными А и B содержит переменную
C, то A условно независима от B при условии C.
Для иллюстрации понятия условной независимости рассмотрим следующую модель (рис. 2.5) [28]. Одышка (dyspnoea: d) может появиться вследствие
туберкулеза (tuberculosis: t), рака легкого (lung cancer: c) или бронхита (bronchitis: b), а также вследствие ни одного из перечисленных заболеваний или вследствие нескольких из них. Посещение Азии (Asia: a) увеличивает шансы заболеть туберкулезом. Курение (smoker: s) – фактор риска, как для рака, так и для
бронхита. Результат рентгена (X-ray: x) не позволяет различить рак и туберкулез, также как не определяет факт наличия или отсутствия одышки. Последнее
обстоятельство представлено в графе промежуточной переменной (tuberculosis
or cancer: t or c), которая соответствует логической функции «или» для родителей (t и c) и означает наличие либо одной, либо двух болезней, либо их отсутствие.
Рис. 2.5
13

Информация о том, что пациент курильщик (s), определяет доверие отно-
X
Z
X
Z
X
Z
сительно рака (c) и бронхита (b). Однако доверие относительно туберкулеза (t)
не изменяется (то есть t условно не зависит от s при данном пустом множестве
остальных переменных). Наличие положительного результата рентгена пациента (x) повышает доверие относительно туберкулеза (t) и рака (c), но не относительно бронхита (b) (то есть b условно не зависит от x при данном s). Однако,
имея информацию, что у пациента одышка (d), результат рентгена (x) изменит
доверие относительно бронхита (b) (то есть b условно зависит от x при данном
d).
Другой метод определения условной независимости переменных основан
на понятии т.н. d4-разделения [34]. Для уточнения данного понятия сначала
опишем возможные типы отношений между переменными в БС:
последовательная связь (рис. 2.6)
Рис. 2.6
Влияние информации распространяется между переменными при последовательной связи до тех пор, пока состояние Y не становится известно.
Например, если идет дождь (Y), то знание о наличии темного облака (X)
является нерелевантным к доверию о мокрой лужайке (Z). С другой стороны,
если не известно идет ли дождь, наличие темного облака увеличивает доверие о
дожде, что в свою очередь, увеличивает доверие о мокрой лужайке.
дивергентная или расходящаяся связь (рис. 2.7)
Рис. 2.7
Влияние информации распространяется между переменными при дивергентной связи до тех пор, пока состояние Y не становится известно.
Если идет дождь (Y), то информация о том, что лужайка мокрая (X) не дает
никаких новых знаний о сводке погоды (Z). С другой стороны, если не известно
идет ли дождь, то сообщение о возможности дождя увеличивает доверие о дожде, что в свою очередь увеличивает доверие о мокрой лужайке.
конвергентная или сходящаяся связь (рис 2.8)
Рис 2.8
4
«d» – от анг. dependence: зависимость
14

Влияние информации распространяется между переменными при конвергентной связи, только если информация о состоянии Y доступна.
Если известно, что лужайка мокрая (Y) и на ней находится разбрызгиватель
(X), то доверие о дожде (Z) изменится, поскольку состояние лужайки вынужда-
ет полагать, что причиной является, скорее всего, разбрызгиватель, нежели
дождь. С другой стороны, если нет никакой информации о состоянии лужайки,
то информация о том идет ли дождь не влияет на доверие о состоянии разбрызгивателя (работал он или нет).
Две переменные X и Z в БС считаются d-разделенными, если на любом пути (без учета направлений ребер), соединяющем эти два узла, найдется промежуточная переменная Y, такая что:
связь с Y последовательная или дивергентная, и Y конкретизирована, ли-
бо;
связь с Y конвергентная, нет свидетельств ни о значении Y, ни о каждом
из ее потомков.
Важно отметить, что при определении отношений условной зависимости и
независимости переменных в БС существенную роль играет знание (или незнание) об их состоянии.
Определим отношения между переменными в ациклическом направленном
графе, показанном на рис 2.9, используя указанные выше правила:
переменные C и L d-разделены при отсутствии свидетельств о других
переменных, так как любой путь между ними содержит, по крайней мере, одну
конвергентную связь (например, путь C G K H L).
переменные C и L d-связаны при данном K (то есть, если значение K из-
вестно), так как граф содержит несколько путей между C и L, конвергентные
связи которых включают конкретизированную переменную К (например, путь
C G K H L), или переменная К является потомком узла на пути между C и L, входящего с ним в конвергентное соединение (например, путь
C A D B E H L).
Рис 2.9
15

Результаты, полученные при анализе сети на рис 2.5, с помощью правила
d-разделения объясняются следующим образом:
переменная t условно не зависит от s при отсутствии свидетельств о дру-
гих переменных (d-разделена), так как любой путь между ними содержит, по
крайней мере, одну конвергентную связь (например, путь tt or c cs);
переменная b условно не зависит от x при данном s (d-разделена), так
как путь bsct or cx содержит дивергентную связь с конкретизированной
переменной, а путь bdt or cx содержит неконкретизированную конвергентную связь;
переменная b условно зависит от x при данном d (d-связана), так как
путь bsct or cx содержит неконкретизированную дивергентную связь, а
путь bdt or cx содержит конвергентную связь с конкретизированной переменной.
Верификация модели байесовой сети
Важным этапом при создании модели проблемной области является ее верификация посредством анализа отношений условной зависимости и независимости, инициированных структурой модели.
Установление направления связи от следствия к причине (вместо верного:
от причины к следствию) – одна из самых распространенных ошибок при по-
строении БС. Это может привести к существенным трудностям при определении значений ТУВ, а, следовательно, к неправильному выводу.
Рассмотрим пример верификации структуры модели обнаружения мошеннических действий с кредитными карточками. Введем три переменные:
A: несколько ПК куплено в течение нескольких дней с использованием одной и той же кредитной карточки;
B: кредитная карточка используется практически в одно и то же время в
разных местах;
C: мошенничество.
Модель A C B на первый взгляд может показаться естественной (переменные A и B используются как «входы» для определения вероятности C).
Однако, из правил d-разделения следует, что если состояние С не известно,
сведения о А (или B) не изменят доверие о состоянии B (или A). Это неверно,
так как сведения о А (или B) увеличивает доверии о C, что, в свою очередь, повышает доверие о B (или A).
Модель A C B, с другой стороны, делает A и B зависимыми, если нет
информации о состоянии C. Когда же значение C конкретизируется, то A и B
становятся независимыми, что в данной ситуации кажется весьма разумным
(если известно наверняка, что случай мошенничества произошел, то наблюдение А (или B) не изменяет доверие о наблюдении B (или A)).
16

2.3. Алгоритм адаптации байесовой сети
Обучение исходных параметров байесовых моделей на основании посту-
пающей о них информации реализуется посредством процедуры адаптации
(adaptation). Процедура адаптации [23, 27, 32] БС подразумевает аппроксимацию распределения вероятностей состояний каждой переменной распределением Дирихле, что объясняется, главным образом, тем, что распределение Дирихле является сопряженным приором для мультиномиального (полиномиального)
распределения, к которому может быть аппроксимировано распределение любого типа.
Пусть переменная сети имеет конфигурацию состояний родительских
переменных и возможных состояний, тогда для определения соответствующего распределения Дирихле необходимо задать его параметров:
1, ,. Пусть означает вероятность состояния переменной
, заданного
конфигурацией состояний родительских переменных . Предполагая распределение Дирихле, функция плотности вероятности определяется как
1, ,
1
,
= 1
=1
, 0 1.
Процедура адаптации предполагает вычисление апостериорного распределения вероятностей состояний переменных сети с учетом поступившего свиде-
тельства (|), которое рассматривается как смесь + 1 распределений Дирихле: одного – для набора случаев, когда конфигурация состояний родителей
отличается от ; и по одному – для каждого из случаев, когда =
и конфи-
гурация состояний родителей соответствует :
= 1, ,
1
+
1, ,+ 1, ,
=1
,
.
Зададим [23]
=
= ,
=
=
+
=
,
,
,
1 ×
,
.
17

Тогда апостериорное среднее
Дирихле
определяется после преобразований [23] как
и дисперсия
смеси распределений
=
1
+ 2
×
×
+
=
+ 1
1
,
+
× (1
+ 1
)
.
Далее смесь распределений Дирихле аппроксимируется единственным
распределением так, чтобы оно имело такой же вектор средних и сумму дисперсий, что и данная смесь, а именно:
1
+ 1
×
1
=
1
+ 2
× (1
×
1
+
+ 1
)
.
Отсюда [23]
= +
(+ ) × (
×
1
+
×
+ 1
)
1
.
Апостериорное среднее
следует рассматривать как условную веро-
ятность состояния переменной после адаптации. В свою очередь, как известно, дисперсия
нится среднее
отражает ожидание относительно того, насколько изме-
при поступлении нового свидетельства (наблюдения),
вследствие чего дисперсия служит мерой доверия к среднему. Тогда параметр
( ) распределения Дирихле может рассматриваться как эквивалентный
объем выборки (equivalent sample size), показывающий количество наблюдений,
которое необходимо произвести от состояния полного незнания до состояния, в
котором доверие к среднему соответствует фактическому. Таким образом, эквивалентный объем выборки также отражает доверие к среднему, и, следовательно, чем выше его значение, тем выше степень доверия к установленному
распределению вероятностей.
2.4. Диаграммы влияния
Диаграмма влияния (ДВ) (influence diagram) – разновидность БС, служащая
для обоснования принимаемых решений в условиях неопределенности. ДВ, как
и БС, содержит узлы, представляющие переменные проблемной области, однако, помимо данных узлов (случайных, узлов состояний), ДВ также содержит
узлы решения и узлы полезности.
Узел решения представляет переменную, отражающую множество взаимо-
исключающих альтернатив решения, принимаемого пользователем.
18

Узел полезности представляет функцию полезности (как правило, в стои-
мостном выражении) от нахождения его родителей в определенном состоянии.
Узлы полезности не имеют узлов-потомков.
Если состояние случайного узла ДВ оказывает влияние на принятие пользователем решения, то в ДВ необходимо добавить связь от данного случайного
узла к узлу решения. Таким образом, если состояние случайного узла должно
быть известно до момента принятия решения, то в ДВ между ними должен существовать направленный путь.
Так как все решения ДВ могут быть приняты только в определенной последовательности, ДВ должна содержать направленный путь, проходящий через все узлы решения. Связь от одной переменной решения к другой показывает хронологический порядок их принятия.
Таким образом, порядок следования случайных узлов и узлов решения в
ДВ должен быть следующим:
где I
I0, D1, I1, D2,..., Dn, I
– набор случайных узлов, состояние которых известно до принятия
i-1
решения D
для всех = 1,
i
;
,
n
In – набор случайных узлов, состояние которых станет известно после
принятия последнего решения Dn.
Полезность от принятия решения Dk (и всех решений, хронологически следующих за ним) можно определить только после того, как все предыдущие решения D1,..., D
менных I0,..., I
были приняты и состояние всех предыдущих случайных пере-
k-1
было конкретизировано.
k-1
Следует заключить, что ДВ – это инструмент нахождения оптимальной
альтернативы решения, которая наиболее выгодна (полезна) в условиях предоставленной информации, исходя из принципа максимизации ожидаемой полезности.
Тогда ДВ представляет собой [33, 34]
=, , ,
, где
– = (, ) – ациклический направленный граф с узлами =
(1, ,) и направленными дугами , задающими отношения условной неза-
висимости переменных сети так, что если два узла
детельстве , то
= (|, );
d-разделены при сви-
– ХC – набор случайных переменных, XD – набор переменных решения
такие, что = , представляющих узлы = (1, ,
– P – набор распределений условных вероятностей (|
) графа G;
()
) для ка-
ждой случайной переменной ;
– U – набор функций полезности (
) для каждого узла
в наборе
узлов полезности [33, 34].
Для более детального изучения ДВ вернемся к рассмотренному выше при-
меру «Яблоня» (рис. 2.10).
19

Рис. 2.10
Цель изучения данной проблемной области заключается в принятии реше-
ния о том – осуществлять обработку дерева или нет.
Для этого необходимо преобразовать статическую БС (рис. 2.10) в динамическую (рис. 2.11) путем добавления в нее узлов Болеет' (Sick'), Засохло' (Dry')
и Облетело' (Loses'), которые интерпретируются аналогично предыдущим, но
на момент сбора урожая. Вводимые узлы могут принимать те же состояния, что
и их аналоги. Разумно предположить наличие причинно-следственной связи
между узлами Болеет и Болеет', Засохло и Засохло', так как, например, если дерево больно в настоящий момент времени, вероятно, оно будет больно и в следующий момент (конечно, сила связи зависит от горизонта прогнозирования).
Рис. 2.11
В ДВ на рис. 2.11 следует добавить узел решения: проводить обработку дерева или нет (рис. 2.12). Узел решения Обработка (Treat) может принимать состояние «обработка» (treat) и «нет» (not). В ДВ указана связь от узла Обработка до узла Болеет', так как разумно ожидать, что обработка дерева окажет воздействие на его состояние в будущем.
Рис. 2.12
20
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
