Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Прикладная теория категорий. Монография
.pdf
Пусть теперь C — декартова категория с коммутативной
:,
fg
→
11
→
→
:,
монадой M. Определим симметричную моноидальную категорию M-линз Lens
тов категории C вида
M
. Объекты этой категории — пары объек-
C
−
A
, морфизмы — M-линзы вида
+
A
#
f
f
−
A
+
A
где f : A+ → B+ и f# : A+ × B– → M(A–) — морфизмы категории C
−
B
←
+
→
B
.
Композицией M-линз
#
f
f
−
A
:
+
A
−
B
←
+
→
B
и
#
g
g
−
B
:
+
B
−
C
←
+
→
C
служит M-линза
#
h
h
−
A
:
+
A
−
C
←
+
→
C
такая, что h = g f, а h# является приведенной ниже композицией:
Δ 11
+−
AC AACABC
×→ ×× → ××
#
g
×
1
→
µ
×
1
B
→
Mf
(
→
×
++−
A
−
MA MB MA B
#
)
M
++−
ηη
+
×
MB MA MB
(
+− +−
×
)
(
22
−−
AMA
)
(
A
→ ×
)
)
(
−
A
→
µ.
××
×
−
MB
()
σ
+−
AB
,
→ ×
(
)
++−
+−
()
(
2
(
)
×
1
)
#
Mf
(
#
µ
×
−
B
)
Единичные морфизмы имеют следующий вид:
η
p
−
2
A
id
+
A
где p2 : A+× A– → A– — проекция.
Декартова структура базовой категории C и коммута-
−
A
+
A
−
A
←
+
→
A
тивность монады M позволяют задать в категории M-линз
моноидальную структуру. Пусть
111

#
:,
−−
++
××
CB BC
−+
×→×
:,
1
2
12
f
f
−
A
:
+
A
−
B
←
+
→
B
и
#
g
g
−
C
:
+
C
←
→
−
D
+
D
M-линзы. Их произведением служит M-линза
##
fg
⊗
fg
×
AC
AC
−−
×
←
++
→
×
BD
×
BD
×
в которой h = g × f, а через f# ⊗ g# обозначена композиция
id iid
++−−
ACBD ABCD
××× → ××× →
##
×
fg
→
MM MAC AC
+−
AD
−− −−
×
)
(
(
+−+−
−−
ACσ,
→ ×
)
(
##
×
fg
,
)
+−
где
Опираясь на строение категории M-линз, можно ввести
понятие недетерминированной системы подобно тому, как
это было сделано для детерминированных систем.
Под недетерминированной системой понимается
M-линза вида
где S — объект состояний, X– — объектов входов (параметров), X+ — объектов выходов, f : S → X+ — морфизм выходов, f : S × X– → M(S) — морфизм обратной связи.
Назовем соединением систем
с помощью линзы
композицию
SS
SS
112
i
#
S
f
1
:
S
f
1
×
×
←
12
12
— канонический изоморфизм.
f
←
1
→
1
#
h
:
h
##
ff
⊗
12
→
ff
×
#
S
S
f
X
X
−
1
и
+
−−
XX
×
12
++−+
XXWW
×
12
XX
12
XX
12
−
X
←
+
→
X
#
S
f
2
:
S
f
2
←
→
−−
×
←
++
×
→
←
2
→
2
##
h
h
−
X
2
(16)
+
X
(17)
−
W
.
W
(18)
+

Соответственно, если система
ϕγ
(
)
(
)
(
)
{}
12
12
−
S
←
S
→
W
+
W
представлена в виде композиции (18), будем называть соединение (18) декомпозицией этой системы.
Рассмотрим категорию линз над категорией множеств
со стохастической монадой Dist. Пусть заданы линзы (16) и
(17). Опишем композицию (18).
Прямое отображение S1 × S2 → W+ определяется как
композиция, так что состояние (s1, s2) ∈ S1 × S2 дает на выходе h(f1(s1), f2(s2)).
Опишем теперь возвратное отображение множества
S1 × S2 × W– в множество распределений вероятности в про-
странстве S1 × S2 .
Пусть (s1, s2, w–) ∈ S1 × S2 × W–. Тогда h#(f1(s1), f2(s2), w–) —
–
распределение вероятности на X
#
Отображение f
(s1, s2, x
–
–
, x
) ∈ S1 × S2 × X
1
2
1
#
⊗ f
ставит в соответствие набору
2
–
× X
1
–
× X
.
1
2
–
распределение вероятно-
2
стей α на S1 × S2 такое, что
для всех (s′
α(s′
, s′2) = f
1
, s′2) ∈ S1 × S2 . Монада Dist переводит это отобра-
1
#
1
(s1, x
–
)(s′1) · f
1
#
(s2, x
2
–
)(s′2).
2
жение в отображение
#
Dist(f
#
⊗ f
1
): Dist(S1 × S2 × X
2
–
–
× X
) → Dist2(S1 × S2).
1
2
При этом отображении распределению вероятностей ϕ
–
на S
× S2 × X
1
–
× X
1
ставится в соответствие такое распреде-
2
ление вероятностей Θ на Dist(S1 × S2), что
Θγ
(
)
=
xx
∑
−−
,,sss
ssxx ffssxx
,
−− −−
,, ,| ,, ,
12 12 1212 12
##
⊗
=
.
(19)
для γ ∈ Dist(S1 × S2). Условие из (19) означает, что
f
1(s1
, x
–
)(s′1) · f
1
при всех состояниях (s′
#
2
, s′2) ∈ S1 × S2 .
1
(s2, x
–
2
)(s′2) = γ(s′1, s′2) (20)
Пусть теперь (s1, s2, w–) ∈ S1 × S2 × W–. Распределение
–
вероятности ϕ в пространстве S1 × S2 × X
–
× X
, которое мы
1
2
получим, имеет вид
–
ϕ(s′
, s′2, x
1
–
, x
) = δ
1
2
(s′1, s′2) · h#(f1(s1), f2(s2), w–)(x
(s1, s2)
–
–
, x
),
1
2
113

где δ
(
)
(
)
(
)
−−
##
(
)
{}
12
βγ
(
)
(
)
′′
(
)
∑
12
,,
(
)
()(
)
(
)
(
)
(
)
(
)
##
xs
22
,.
(
)
(
)
(
)
{}
{}
{}
{}
{}
{}
(s′1, s′2) — вероятностная мера, сосредоточенная в
(s1, s2)
одной точке. Таким образом,
ϕ(s
, s′2, x
и ϕ(s′
1
, s2, x
1
–
, x
1
–
, x
) = h#(f1(s1), f2(s2), w–)(x
1
2
–
) = 0, если (s′1, s′2) ≠ (s1, s2).
2
–
, x
1
–
) (21)
2
–
Теперь применим к распределению ϕ отображение
#
Dist(f
Θγ
)
(
#
⊗ f
). Для Θ = Dist(f
1
2
=
hfsfsw xx ffssxx
∑
−−
xx
,
,, ,| ,, ,
)
(
(
11 22 12 121212
Наконец, умножение µ
переводит Θ ∈ Dist2(S1 × S2) в распределение β ∈ Dist(S1 × S2)
)
#
⊗ f
1
−−
S1 × S
#
)(ϕ) ∈ Dist2(S1 × S2) получаем:
2
#
⊗
: Dist2(S1 × S2) → Dist(S1 × S2)
2
−−
=
γ
.
(22)
для которого
=
ss ss
′′
12 12
γ
∈×
SS
Dist
(
γ
⋅
.Θ
)
С учетом (20)—(22) получаем:
,
β
=
ss hfsfsw xx fsxs
,,,, ,
′′
12 11 22 12 1111
∑
−− −−
,
xx XX
∈×
12 12
−−−−
⋅
Таким образом, возвратное отображение в (18) ставит в
соответствие набору (s1, s2, w–) ∈ S1 × S2 × W– распределение
на S1 × S2, задаваемое формулой (23).
Пример 8. Пусть системы (16) имеют следующий вид:
#
01
{,}
f
1
:
01 01
{,}
id
←→∗
{,}
{}
и
#
f
2
:
id
где {*} — одноточечное множество,
#
(i) = piδ0 +(1 – pi) δ1, 0 ≤ pi} ≤ 1, i = 0, 1,
f
1
#
f
(i, j) = qijδ0 +(1 – qij) δ1, 0 ≤ qij ≤ 1, i, j = 0, 1,
2
(y) = 1, если x = y, и δx(y) = 0, если x ≠ y.
а δ
x
Далее, возьмем в качестве соединительной линзы линзу
#
h
:
pr
2
,
01
,, ,
01 01 01
{}×{}
←
→
в которой прямое отображение — проекция на второй множитель, а возвратное отображение задается формулами
#
(i, j) = rijδ0 + (1 – rij) δ1, 0 ≤ rij ≤ 1, i, j = 0, 1.
h
Построим возвратное отображение композиции
2
{0, 1}
→ Dist({0, 1}2),
используя формулы (22) и (23).
114
′
←
01
,
→
01
,
{}
∗
,
#
⋅
ffs
22
01
01
−
′
(23)
,
,
,

Пусть (i, j) ∈ {0, 1}2. Обозначим через βij соответствующее распределение вероятности на {0, 1}2. Тогда по формуле
(23) имеем:
ij
β
(s, t) = rij · (piδ0(s) + (1 – pi) δ1(s)) · (qj0δ0(t) +
+ (1 – q
) δ1(t)) + (1 – rij) · (piδ0(s) + (1 – pi}) δ1(s)) ×
j0
× (q
(t) + (1 – qj1) δ1(t)).
j1 δ0
Более подробно:
ij
β
(0, 0) = rij · pi · q
ij
β
(0, 1) = rij · pi · (1 – qj0) + (1 – rij) · pi · (1 – qj1);
ij
β
(1, 0) = rij · (1 – pi) · q
ij
β
(1, 1) = rij · (1 – pi) · (1 – qj0) + (1 – rij) · (1 – pi) · (1 – qj1).
+ (1 – rij) · pi · qj1;
j0
+ (1 – rij) · (1 – pi) · qj1;
j0
Заключение
Понятие линзы было введено Геделем как составная часть его диалектической интерпретации (см. [Avigad,
1998]). В этой интерпретации логическая формула маркировалась двумя переменными. Значения первой оценивали
доводы в пользу того, что формула истинна, второй — что
формула ложна. Оценка конъюнкции при этом выглядит
достаточно стандартно, а оценкой импликации служит соответствующая линза.
Современное понятие линзы, в том виде, как оно используется в настоящей книге, было оформлено в [Foster,
2005]. В соответствии с этой концепцией линза состоит из
двух частей. Первая часть — это обычная функция отображающая одно множество данных в другое (например, наборы действий по обновлению системы). Кроме того, имеется
правило обратного распространения.
В свойствах линз аксиоматизируются в самом общем виде действия по обновлению. И в этом смысле линзы
дают универсальный метод алгебраического описания обновлений. В [Fong, 2019] линзы были использованы для
построения схемы машинного обучения и с тех пор стали
стандартным инструментом формализации в этой области
(см. [Capucci, 2021]).
115

Глава 6. Теория категорий и моделирование естественного
языка
Представление значений слов и предложений в форме,
пригодной для использования компьютером, является центральной проблемой вычислительной техники. Эта проблема представляет не только теоретический интерес, но также
имеет практическое значение. Поиск подходящего представления смысла может значительно повысить эффективность
обработки естественного языка.
В моделях естественного языка существует два различных подхода к представлению смысла. При структурно-логическом подходе для представления значений предложений,
используется алгебра логики. Логическое представление
предложения строится композиционно путем соединения
значений его составных частей. В отличие от этого, при дистрибутивном подходе используются статистические данные
о контекстах, в которых встречается слово, извлеченные из
большого текстового массива, чтобы обеспечить векторное
представление значения отдельного слова.
Таким образом, структурно-логический подход в значительной степени связан с тем, как сочетаются отдельные
значения, но оставляет значения элементарных единиц
(слов) без анализа; в то время как дистрибутивный подход
связан со значениями слов, но мало что может сказать о том,
как эти значения сочетаются. С учетом этого, интегрирование обоих подходов в рамках единой модели является важной проблемой.
Некоторые важные технологии искусственного интеллекта, используемые в языковом моделировании, представляют собой процесс выявления структуры и семантики
языковых единиц на основе чисто синтаксических свойств.
В первом приближении можно считать, что моделирование
естественного языка — это раздел теории искусственного интеллекта, главной целью которого является создание систем,
понимающих человеческий язык. Появившиеся в последние годы языковые модели генеративного искусственного
116

интеллекта показывают впечатляющие результаты, обладая
способностью генерировать содержательные тексты на естественном языке в разнообразных формах. До определенной
степени обученную нейронную сеть можно рассматривать
как модель понимания текста на естественном языке [Bender,
2020]. Получив последовательность знаков естественного
языка, такая модель своей ответной реакцией приписывает этой последовательности «смысл». Несмотря на успехи,
достигнутые в построении генеративных моделей, интерес
к построению «структурных» математических моделей, не
снижается. Более того, успехи больших лингвистических
моделей (LLM) типа ChatGPT послужили мощным стимулом
и интенсифицировали исследования в области моделирования семантики естественного языка. В рамках дистрибутивных моделей семантика может быть достаточно хорошо
представлена на уровне слов.
Модели глубокого обучения позволяют построить
лингвистически значимое пространство, в которое вложен
словарь. Математически это можно трактовать как приближенную декомпозицию соответствующей матрицы [Levy,
2014]. Более глубокое понимание структуры этого пространства и семантики слов может быть достигнуто с использованием концепций и аппарата решеток понятий [Wille, 1992],
[Pavlovic, 2024].
Для представления семантики на уровне предложений
и больших текстовых единиц требуется в той или иной форме учет грамматических конструкций, см. [Hammond, 2023,
Lappin, 2024].
Формальные грамматики уже в течение многих десятилетий являются объектом интенсивных исследований, в
том числе, и математическими методами. В настоящее время
среди прочих активно развивается направление, связанное с
изучением грамматик, введенных Ламбеком [Lambek, 1958]
(см. также [Lamarche, 1999]).
В основе категорного подхода к моделированию семантики, идущего от Ламбека, лежит предположение о том, что
значение предложения может быть определено значениями
его отдельных слов вместе с грамматическими правилами
их сочетания. Если компьютер может «понимать» значения
отдельных слов и грамматические правила, то ему нужно
117

помочь объединить их, чтобы сформировать осмысленное
целое. Формализовать эту идею можно, моделируя семантику естественного языка с помощью функторов между компактными замкнутыми категориями. Функтор присваивает слову грамматический тип, а моноидальные структуры
обеспечивают способ объединения значений этих слов (и их
грамматических типов) для формирования предложения,
значение которого может быть определено с помощью композиции.
Еще одно направление в моделировании естественного
языка методами теории категорий связано с так называемыми решетками понятий. Модели глубокого обучения позволяют построить лингвистически значимое пространство, в
которое вложен словарь.
6.1. Дистрибутивные модели
Тенденция последнего десятилетия исследований в области компьютерной лингвистики — замена слов векторами.
Тенденция эта обусловлена в первую очередь применением
нейронных сетей в обработке естественного языка. Сложная
структура пространства слов, проявляющаяся в их грамматической классификации, семантических связях и т.п., не
поддается в полной мере математическому моделированию.
В то же время механизмы нейронных сетей неявным образом
улавливают структуру этого пространства. На сегодняшний
день одной из важнейших задач математической лингвистики является выявление и формализация этой структуры.
Приведем краткое описание нейронных сетей глубокого обучения, используемых в обработке естественного языка.
В обобщенном виде нейронная сеть может быть представлена как отображение f :
n
→ m, распадающееся в ком-
позицию отображений
Dnfn
…
≈→→→→
1
ffng
2
1
k
k
m
,
где D — словарь.
В свою очередь, каждое из отображений fi является
композицией функции активации и аффинного отображе-
n
ния, т.е. fi(x) = a(Mix + bi), где x ∈
i–1
, a(y), y ∈
ция активации, Mi — матрица размера ni × n
n
i
, а bi ∈ R
i-1
, — функ-
n
i
—
смещение. Функция g осуществляет вывод. Функция вывода
118

и функции активации фиксируются до обучения. При обу-
D
→→
чении нейронной сети подбираются элементы матриц Mi и
координаты векторов смещения bi так, чтобы функция f соответствовала поставленной цели.
Для решения задач, связанных с обработкой естественного языка целью, как правило, является минимизация (методом градиентного спуска) расхождения между фактическими и предполагаемыми выходными данными.
В этой схеме языковые данные (обычно, слова) пред-
n
ставлены в виде векторов в пространстве
. На начальном
этапе естественно представлять слов векторами канонического базиса. Например, если слова в словаре D занумерованы положительными целыми числами от 1 до n = |D|, то слово
с номером k представляет вектор (α
= 0 при i ≠ k. Во многих современных моделях обучение в
α
i
первом слое
f
D
n
1
1
) ∈ n такой, что αk = 1 и
i
происходит независимо от об-
учения остальных слоев [Smilkov 2016, Rong, 2014].
В результате слову из словаря ставится в соответствие
n
вектор из пространства
векторном пространстве
i
. Обнаружилось, что операции в
n
i
имеют лингвистическую значимость. Например, оказываются близкими разности векторов
«Германия»—«Берлин» и «Франция» — «Париж» [Mikolov,
2013].
Эти результаты, показывают, что некоторые семантические свойства могут быть извлечены из формальных
манипуляций с синтаксическими конструкциями, т.е. что
значение может возникать из формы. Теория категорий является с одной стороны инструментом для этого извлечения,
с другой — предоставляет для подобного рода действий язык
алгебры.
Чтобы показать роль и место теории категорий, рассмотрим схематично общую идею, лежащую в основе вложения
словаря в векторное пространство. В дополнение к словарю D
рассмотрим множество контекстов C, в которых встречаются слова из словаря. Частота, с которой слово w встречается
в контексте c, задает элемент матрицы M размера |C| × |D|.
Оптимизация в алгоритме обучения в некотором смысле эквивалентна представлению матрицы M в виде произведения
119

матриц XTY, где X имеет размерность |C| × d, а Y — размер-
(
)
ность |D| × d, причем d |D| . Слова ассоциируются со строка-
ми матрицы Y, контексты — со строками матрицы X. Оптимизационная задача состоит в минимизации ||M – XTY||.
Таким образом, свойства векторов, представляющих
слова, определяются в значительной степени алгебраической структурой, лежащей в основе лингвистических данных, найденных в корпусах текстов.
Распространенной мерой ассоциации слова w и контекста c служит величина PMI (pointwise mutual information)
Pcw
PMIcw
,log
=
)
(
где P(c, w) — частота, с которой пара (c, w) встречается в мно-
жестве рассматриваемых контекстов, P(w) и P(c) соответственно — частота, с которой в этом множестве встречаются
слово w и контекст c.
Если слово w не встречается в контексте c, полагают
PMI(c, w) = 0. Более последовательный подход состоит в том,
что все отрицательные значения PMI заменяются нулями.
Так получается мера PPMI (positive PMI):
PPMI(c, w) = max (PMI(c, w), 0).
Недостатком PMI, который сохраняется и в PPMI, является его чувствительность к редким контекстам. Редкий контекст c, в котором хотя бы один раз встречается целевое слово
w, может привести к относительно высокому показателю PMI.
Для понижения размерности (путем разложения матрицы M, полученной на основе PPMI) используется сингулярное разложение матрицы M. Матрица M представляется
в виде произведения трех матриц UΣVT, где U и V — орто-
нормальные матрицы, а
диагонали сингулярные значения матрицы M, а остальные
элементы нули.
Строки матрицы UΣ представляют — контексты, а
строки матрицы V — слова. На практике используется представление d верхних строк так, что Md = UdΣdV
новывается на том факте, что если сингулярные значения
упорядочены по убыванию, то такое представление дает наилучшее приближение матрицы M с заданным ограничением
на размерность. Отбрасывая те части матриц из разложения,
120
Σ — матрица, у которой на главной
,
PwPc
()(
,
)
T
. Это ос-
d
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
