Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Прикладная теория категорий. Монография

.pdf
Скачиваний:
0
Добавлен:
07.09.2026
Размер:
1 Мб
Скачать
☆
Пусть теперь C — декартова категория с коммутативной
:,
fg
→
11
→
→
:,
монадой M. Определим симметричную моноидальную катего­рию M-линз Lens
тов категории C вида
M
. Объекты этой категории — пары объек-
C
−
A
, морфизмы — M-линзы вида
+
A
#
f
f
−
A
+
A
где f : A+ → B+ и f# : A+ × B– → M(A–) — морфизмы категории C
−
B
←
+
→
B
.
Композицией M-линз
#
f
f
−
A
:
+
A
−
B
←
+
→
B
и
#
g
g
−
B
:
+
B
−
C
←
+
→
C
служит M-линза
#
h
h
−
A
:
+
A
−
C
←
+
→
C
такая, что h = g f, а h# является приведенной ниже композицией:
Δ 11
+−
AC AACABC
×→ ×× → ××
#
g
×
1
→
µ
×
1
B
→
Mf
(
→
×
++−
A
−

MA MB MA B
#
)
M
++−
ηη
+
×
MB MA MB
(
+− +−
×
)
(
22
−−
AMA
)
(
A
→ ×
)
)
(
−
A
→
µ.
××
×
−
MB
()
σ
+−
AB
,
→ ×
(
)
++−
+−
()
(
2
(
)
×

1

)
#
Mf
(

#
µ
×
−
B
)
Единичные морфизмы имеют следующий вид:
η
p
−
2
A
id
+
A
где p2 : A+× A– → A– — проекция.
Декартова структура базовой категории C и коммута-
−
 
A
+
A
−
A
←
+
→
A
тивность монады M позволяют задать в категории M-линз моноидальную структуру. Пусть
111
#
:,
−−
++
××
CB BC
−+
×→×
:,
1
2
12
f
f
−
A
:
+
A
−
B
←
+
→
B
и
#
g
g
−
C
:
+
C
← →
−
D
+
D
M-линзы. Их произведением служит M-линза
##
fg
⊗
fg
×
AC
 
AC
−−
×
←
++
→
×
BD
×
BD
×
 
в которой h = g × f, а через f# ⊗ g# обозначена композиция
id iid
++−−
ACBD ABCD
××× → ××× →
##
×
fg
→

MM MAC AC
+−
AD
−− −−
×
)
(
(
+−+−
−−
ACσ,
→ ×
)
(
##
×
fg
,
)
+−
где
Опираясь на строение категории M-линз, можно ввести понятие недетерминированной системы подобно тому, как это было сделано для детерминированных систем.
Под недетерминированной системой понимается M-линза вида
где S — объект состояний, X– — объектов входов (параме­тров), X+ — объектов выходов, f : S → X+ — морфизм выхо­дов, f : S × X– → M(S) — морфизм обратной связи.
Назовем соединением систем
 
с помощью линзы
композицию
SS
 
SS
112
i
#
S
f
1
:
S
f
1
 
×
×
←
 
12
12
— канонический изоморфизм.
f
 
←
1
→
1
#
h
:
h
##
ff
⊗
12
→
ff
×
#
S
S
f
X
X
 
−
1
и
+
−−
XX
×
12
++−+
XXWW
×
12
XX
12
XX
12
−
X
←
+
→
X
#
S
f
2
:
S
f
2
←
→
−−
×
←
++
×
→
←
2
→
2
 
##
h
h
−
X
2
(16)
+
X
(17)
−
W
.
W
(18)
+
 
Соответственно, если система
ϕγ
(
)
(
)
(
)
{}
12
12
−
S
←
S
→
W
+
W
представлена в виде композиции (18), будем называть соеди­нение (18) декомпозицией этой системы.
Рассмотрим категорию линз над категорией множеств со стохастической монадой Dist. Пусть заданы линзы (16) и (17). Опишем композицию (18).
Прямое отображение S1 × S2 → W+ определяется как композиция, так что состояние (s1, s2) ∈ S1 × S2 дает на выхо­де h(f1(s1), f2(s2)).
Опишем теперь возвратное отображение множества S1 × S2 × W– в множество распределений вероятности в про- странстве S1 × S2 .
Пусть (s1, s2, w–) ∈ S1 × S2 × W–. Тогда h#(f1(s1), f2(s2), w–) —
–
распределение вероятности на X
#
Отображение f (s1, s2, x
–
–
, x
) ∈ S1 × S2 × X
1
2
1
#
⊗ f
ставит в соответствие набору
2
–
× X
1
–
× X
.
1
2
–
распределение вероятно-
2
стей α на S1 × S2 такое, что
для всех (s′
α(s′
, s′2) = f
1
, s′2) ∈ S1 × S2 . Монада Dist переводит это отобра-
1
#
1
(s1, x
–
)(s′1) · f
1
#
(s2, x
2
–
)(s′2).
2
жение в отображение
#
Dist(f
#
⊗ f
1
): Dist(S1 × S2 × X
2
–
–
× X
) → Dist2(S1 × S2).
1
2
При этом отображении распределению вероятностей ϕ
–
на S
× S2 × X
1
–
× X
1
ставится в соответствие такое распреде-
2
ление вероятностей Θ на Dist(S1 × S2), что
Θγ
(
)
=
xx
∑
−−
,,sss
ssxx ffssxx
,
−− −−
,, ,| ,, ,
12 12 1212 12
##
⊗
=
.
(19)
для γ ∈ Dist(S1 × S2). Условие из (19) означает, что f
1(s1
, x
–
)(s′1) · f
1
при всех состояниях (s′
#
2
, s′2) ∈ S1 × S2 .
1
(s2, x
–
2
)(s′2) = γ(s′1, s′2) (20)
Пусть теперь (s1, s2, w–) ∈ S1 × S2 × W–. Распределение
–
вероятности ϕ в пространстве S1 × S2 × X
–
× X
, которое мы
1
2
получим, имеет вид
–
ϕ(s′
, s′2, x
1
–
, x
) = δ
1
2
(s′1, s′2) · h#(f1(s1), f2(s2), w–)(x
(s1, s2)
–
–
, x
),
1
2
113
где δ
(
)
(
)
(
)
−−
##
(
)
{}
12
βγ
(
)
(
)
′′
(
)
∑
12
,,
(
)
()(
)
(
)
(
)
(
)
(
)
##
xs
22
,.
(
)
(
)
(
)
{}
{} {}
{}
{}
{}
(s′1, s′2) — вероятностная мера, сосредоточенная в
(s1, s2)
одной точке. Таким образом, ϕ(s
, s′2, x
и ϕ(s′
1
, s2, x
1
–
, x
1
–
, x
) = h#(f1(s1), f2(s2), w–)(x
1
2
–
) = 0, если (s′1, s′2) ≠ (s1, s2).
2
–
, x
1
–
) (21)
2
–
Теперь применим к распределению ϕ отображение
#
Dist(f
Θγ
)
(
#
⊗ f
). Для Θ = Dist(f
1
2
=
hfsfsw xx ffssxx
∑
−−
xx
,
,, ,| ,, ,
)
(
(
11 22 12 121212
Наконец, умножение µ
переводит Θ ∈ Dist2(S1 × S2) в распределение β ∈ Dist(S1 × S2)
)
#
⊗ f
1
−−
S1 × S
#
)(ϕ) ∈ Dist2(S1 × S2) получаем:
2
#
⊗
: Dist2(S1 × S2) → Dist(S1 × S2)
2
−−
=
γ
.
(22)
для которого
=
ss ss
′′
12 12
γ
∈×
SS
Dist
(
γ
⋅
.Θ
)
С учетом (20)—(22) получаем:
,
β
=
ss hfsfsw xx fsxs
,,,, ,
′′
12 11 22 12 1111
∑
−− −−
,
xx XX
∈×
12 12
−−−−
⋅
Таким образом, возвратное отображение в (18) ставит в
соответствие набору (s1, s2, w–) ∈ S1 × S2 × W– распределение на S1 × S2, задаваемое формулой (23).
Пример 8. Пусть системы (16) имеют следующий вид:
#
01
{,}
f
1
:
01 01
{,}
id
←→∗
 
 
{,}
{}
 
и
#
f
2
:
 
id
где {*} — одноточечное множество,
#
(i) = piδ0 +(1 – pi) δ1, 0 ≤ pi} ≤ 1, i = 0, 1,
f
1
#
f
(i, j) = qijδ0 +(1 – qij) δ1, 0 ≤ qij ≤ 1, i, j = 0, 1,
2
(y) = 1, если x = y, и δx(y) = 0, если x ≠ y.
а δ
x
Далее, возьмем в качестве соединительной линзы линзу
#
h
:
 
pr
2
,
01
,, ,
01 01 01
{}×{}
←
 
→
в которой прямое отображение — проекция на второй мно­житель, а возвратное отображение задается формулами
#
(i, j) = rijδ0 + (1 – rij) δ1, 0 ≤ rij ≤ 1, i, j = 0, 1.
h
Построим возвратное отображение композиции
2
{0, 1}
→ Dist({0, 1}2),
используя формулы (22) и (23).
114
′
←
01
,
 
→
01
,
{}
∗
 
,
 
#
⋅
ffs
22
01
 
01
−
′
(23)
,
,
,
Пусть (i, j) ∈ {0, 1}2. Обозначим через βij соответствую­щее распределение вероятности на {0, 1}2. Тогда по формуле (23) имеем:
ij
β
(s, t) = rij · (piδ0(s) + (1 – pi) δ1(s)) · (qj0δ0(t) +
+ (1 – q
) δ1(t)) + (1 – rij) · (piδ0(s) + (1 – pi}) δ1(s)) ×
j0
× (q
(t) + (1 – qj1) δ1(t)).
j1 δ0
Более подробно:
ij
β
(0, 0) = rij · pi · q
ij
β
(0, 1) = rij · pi · (1 – qj0) + (1 – rij) · pi · (1 – qj1);
ij
β
(1, 0) = rij · (1 – pi) · q
ij
β
(1, 1) = rij · (1 – pi) · (1 – qj0) + (1 – rij) · (1 – pi) · (1 – qj1).
+ (1 – rij) · pi · qj1;
j0
+ (1 – rij) · (1 – pi) · qj1;
j0
Заключение
Понятие линзы было введено Геделем как состав­ная часть его диалектической интерпретации (см. [Avigad, 1998]). В этой интерпретации логическая формула марки­ровалась двумя переменными. Значения первой оценивали доводы в пользу того, что формула истинна, второй — что формула ложна. Оценка конъюнкции при этом выглядит достаточно стандартно, а оценкой импликации служит соот­ветствующая линза.
Современное понятие линзы, в том виде, как оно ис­пользуется в настоящей книге, было оформлено в [Foster, 2005]. В соответствии с этой концепцией линза состоит из двух частей. Первая часть — это обычная функция отобра­жающая одно множество данных в другое (например, набо­ры действий по обновлению системы). Кроме того, имеется правило обратного распространения.
В свойствах линз аксиоматизируются в самом об­щем виде действия по обновлению. И в этом смысле линзы дают универсальный метод алгебраического описания об­новлений. В [Fong, 2019] линзы были использованы для построения схемы машинного обучения и с тех пор стали стандартным инструментом формализации в этой области (см. [Capucci, 2021]).
115
Глава 6. Теория категорий и моделирование естественного
языка
Представление значений слов и предложений в форме, пригодной для использования компьютером, является цен­тральной проблемой вычислительной техники. Эта пробле­ма представляет не только теоретический интерес, но также имеет практическое значение. Поиск подходящего представ­ления смысла может значительно повысить эффективность обработки естественного языка.
В моделях естественного языка существует два различ­ных подхода к представлению смысла. При структурно-логи­ческом подходе для представления значений предложений, используется алгебра логики. Логическое представление предложения строится композиционно путем соединения значений его составных частей. В отличие от этого, при дис­трибутивном подходе используются статистические данные о контекстах, в которых встречается слово, извлеченные из большого текстового массива, чтобы обеспечить векторное представление значения отдельного слова.
Таким образом, структурно-логический подход в зна­чительной степени связан с тем, как сочетаются отдельные значения, но оставляет значения элементарных единиц (слов) без анализа; в то время как дистрибутивный подход связан со значениями слов, но мало что может сказать о том, как эти значения сочетаются. С учетом этого, интегрирова­ние обоих подходов в рамках единой модели является важ­ной проблемой.
Некоторые важные технологии искусственного ин­теллекта, используемые в языковом моделировании, пред­ставляют собой процесс выявления структуры и семантики языковых единиц на основе чисто синтаксических свойств. В первом приближении можно считать, что моделирование естественного языка — это раздел теории искусственного ин­теллекта, главной целью которого является создание систем, понимающих человеческий язык. Появившиеся в послед­ние годы языковые модели генеративного искусственного
116
интеллекта показывают впечатляющие результаты, обладая способностью генерировать содержательные тексты на есте­ственном языке в разнообразных формах. До определенной степени обученную нейронную сеть можно рассматривать как модель понимания текста на естественном языке [Bender, 2020]. Получив последовательность знаков естественного языка, такая модель своей ответной реакцией приписыва­ет этой последовательности «смысл». Несмотря на успехи, достигнутые в построении генеративных моделей, интерес к построению «структурных» математических моделей, не снижается. Более того, успехи больших лингвистических моделей (LLM) типа ChatGPT послужили мощным стимулом и интенсифицировали исследования в области моделиро­вания семантики естественного языка. В рамках дистрибу­тивных моделей семантика может быть достаточно хорошо представлена на уровне слов.
Модели глубокого обучения позволяют построить лингвистически значимое пространство, в которое вложен словарь. Математически это можно трактовать как прибли­женную декомпозицию соответствующей матрицы [Levy, 2014]. Более глубокое понимание структуры этого простран­ства и семантики слов может быть достигнуто с использова­нием концепций и аппарата решеток понятий [Wille, 1992], [Pavlovic, 2024].
Для представления семантики на уровне предложений и больших текстовых единиц требуется в той или иной фор­ме учет грамматических конструкций, см. [Hammond, 2023, Lappin, 2024].
Формальные грамматики уже в течение многих деся­тилетий являются объектом интенсивных исследований, в том числе, и математическими методами. В настоящее время среди прочих активно развивается направление, связанное с изучением грамматик, введенных Ламбеком [Lambek, 1958] (см. также [Lamarche, 1999]).
В основе категорного подхода к моделированию семан­тики, идущего от Ламбека, лежит предположение о том, что значение предложения может быть определено значениями его отдельных слов вместе с грамматическими правилами их сочетания. Если компьютер может «понимать» значения отдельных слов и грамматические правила, то ему нужно
117
помочь объединить их, чтобы сформировать осмысленное

целое. Формализовать эту идею можно, моделируя семанти­ку естественного языка с помощью функторов между ком­пактными замкнутыми категориями. Функтор присваива­ет слову грамматический тип, а моноидальные структуры обеспечивают способ объединения значений этих слов (и их грамматических типов) для формирования предложения, значение которого может быть определено с помощью ком­позиции.
Еще одно направление в моделировании естественного языка методами теории категорий связано с так называемы­ми решетками понятий. Модели глубокого обучения позво­ляют построить лингвистически значимое пространство, в которое вложен словарь.
6.1. Дистрибутивные модели
Тенденция последнего десятилетия исследований в об­ласти компьютерной лингвистики — замена слов векторами. Тенденция эта обусловлена в первую очередь применением нейронных сетей в обработке естественного языка. Сложная структура пространства слов, проявляющаяся в их грамма­тической классификации, семантических связях и т.п., не поддается в полной мере математическому моделированию. В то же время механизмы нейронных сетей неявным образом улавливают структуру этого пространства. На сегодняшний день одной из важнейших задач математической лингвисти­ки является выявление и формализация этой структуры.
Приведем краткое описание нейронных сетей глубоко­го обучения, используемых в обработке естественного языка.
В обобщенном виде нейронная сеть может быть пред­ставлена как отображение f :
n
→ m, распадающееся в ком-
позицию отображений
Dnfn
 …
≈→→→→
1
ffng
2
1
k
k
m
,
где D — словарь.
В свою очередь, каждое из отображений fi является композицией функции активации и аффинного отображе-
n
ния, т.е. fi(x) = a(Mix + bi), где x ∈
i–1
, a(y), y ∈
ция активации, Mi — матрица размера ni × n
n
i
, а bi ∈ R
i-1
, — функ-
n
i
—
смещение. Функция g осуществляет вывод. Функция вывода
118
и функции активации фиксируются до обучения. При обу-
D
→→
чении нейронной сети подбираются элементы матриц Mi и координаты векторов смещения bi так, чтобы функция f со­ответствовала поставленной цели.
Для решения задач, связанных с обработкой естествен­ного языка целью, как правило, является минимизация (ме­тодом градиентного спуска) расхождения между фактиче­скими и предполагаемыми выходными данными.
В этой схеме языковые данные (обычно, слова) пред-
n
ставлены в виде векторов в пространстве
. На начальном
этапе естественно представлять слов векторами канониче­ского базиса. Например, если слова в словаре D занумерова­ны положительными целыми числами от 1 до n = |D|, то слово с номером k представляет вектор (α
= 0 при i ≠ k. Во многих современных моделях обучение в
α
i
первом слое
f
D
n
1
1
) ∈ n такой, что αk = 1 и
i
происходит независимо от об-
учения остальных слоев [Smilkov 2016, Rong, 2014].
В результате слову из словаря ставится в соответствие
n
вектор из пространства векторном пространстве
i
. Обнаружилось, что операции в
n
i
имеют лингвистическую значи­мость. Например, оказываются близкими разности векторов «Германия»—«Берлин» и «Франция» — «Париж» [Mikolov, 2013].
Эти результаты, показывают, что некоторые семан­тические свойства могут быть извлечены из формальных манипуляций с синтаксическими конструкциями, т.е. что значение может возникать из формы. Теория категорий яв­ляется с одной стороны инструментом для этого извлечения, с другой — предоставляет для подобного рода действий язык алгебры.
Чтобы показать роль и место теории категорий, рассмо­трим схематично общую идею, лежащую в основе вложения словаря в векторное пространство. В дополнение к словарю D рассмотрим множество контекстов C, в которых встречают­ся слова из словаря. Частота, с которой слово w встречается в контексте c, задает элемент матрицы M размера |C| × |D|. Оптимизация в алгоритме обучения в некотором смысле эк­вивалентна представлению матрицы M в виде произведения
119
матриц XTY, где X имеет размерность |C| × d, а Y — размер-
(
)
ность |D| × d, причем d  |D| . Слова ассоциируются со строка- ми матрицы Y, контексты — со строками матрицы X. Опти­мизационная задача состоит в минимизации ||M – XTY||.
Таким образом, свойства векторов, представляющих слова, определяются в значительной степени алгебраиче­ской структурой, лежащей в основе лингвистических дан­ных, найденных в корпусах текстов.
Распространенной мерой ассоциации слова w и контек­ста c служит величина PMI (pointwise mutual information)
Pcw
PMIcw
,log
=
)
(
где P(c, w) — частота, с которой пара (c, w) встречается в мно- жестве рассматриваемых контекстов, P(w) и P(c) соответ­ственно — частота, с которой в этом множестве встречаются слово w и контекст c.
Если слово w не встречается в контексте c, полагают PMI(c, w) = 0. Более последовательный подход состоит в том, что все отрицательные значения PMI заменяются нулями. Так получается мера PPMI (positive PMI):
PPMI(c, w) = max (PMI(c, w), 0).
Недостатком PMI, который сохраняется и в PPMI, явля­ется его чувствительность к редким контекстам. Редкий кон­текст c, в котором хотя бы один раз встречается целевое слово w, может привести к относительно высокому показателю PMI.
Для понижения размерности (путем разложения ма­трицы M, полученной на основе PPMI) используется сингу­лярное разложение матрицы M. Матрица M представляется в виде произведения трех матриц UΣVT, где U и V — орто- нормальные матрицы, а диагонали сингулярные значения матрицы M, а остальные элементы нули.
Строки матрицы UΣ представляют — контексты, а строки матрицы V — слова. На практике используется пред­ставление d верхних строк так, что Md = UdΣdV новывается на том факте, что если сингулярные значения упорядочены по убыванию, то такое представление дает наи­лучшее приближение матрицы M с заданным ограничением на размерность. Отбрасывая те части матриц из разложения,
120
Σ — матрица, у которой на главной
,
PwPc
()(
,
)
T
. Это ос-
d
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]