Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Прикладная теория категорий. Монография

.pdf
Скачиваний:
0
Добавлен:
07.09.2026
Размер:
1 Мб
Скачать
☆
которые не «участвуют» в произведении, получаем аппрок-
tS
CD
∗
(
)
симацию матрицы M вида M′ = U′ размера |C| × d, V′ — матрица размера |D| × d, а
Σ′V′T, где U′ — матрица
Σ′ — диаго-
нальная матрица размера d × d, содержащая на диагонали d наибольших сингулярных значений матрицы M.
Перенос рассмотренного подхода с векторных про­странств на категории приводит к построению решеток по­нятий. В общем этот перенос выглядит следующим образом.
Множество контекстов и множество слов структуриру­ются так, что становятся категориями. В простейшем слу­чае — категориями, порожденными графом, представляющим бинарное отношение. Матрица M заменяется функтором вида
F: Cop × D → Set (1) (такие функторы называют профункторами). Для фиксиро­ванного контекста c функтор F(c, –) : D → Set можно трак­товать как c-строку соответствующей матрицы, а функтор F(–, d) : C → Set — как d-столбец.
Функтор (1) стандартным образом дает функторы C → (Set
По лемме Йонеды категория C вкладывается в категорию контравариантных функторов Set
D)op
, D → Set
op
C
замкнута относительно ко-пределов, функтор C → (SetD)op мож­но продолжить до функтора F* : Set
C
копределы (см. 1.10). Аналогично, D → Set жить до функтора F* : (SetD)op → Set
op
C
. (2)
. Так как категория (SetD)op
op
→ (SetD)op, сохраняющего
op
C
, сохраняющего пределы.
op
C
можно продол-
Функтор F* сопряжен слева к функтору F*:
op
F
Se
→
←
F
*
et
op
.
(3)
По аналогии с правыми и левыми сингулярными векто­рами можно сформировать так называемые ядра профункто­ра (1): пары объектов (C, D) из C
F
*
(C) ≅ D и F*(D) ≅ C (4)
op
× D такие, что
Ядра профунктора подобны абстрактным единицам, а категорные пределы и и копределы предоставляют спо­собы манипулирования этими абстрактными единицами. Категорию множеств в определении профунктора (1) можно заменить какой-нибудь другой категорией. Пусть, напри­мер, X и Y — множества, рассматриваемые как дискретные
121
категории. В этом случае профунктор R: X × Y → {0, 1} — это отображение, задающее бинарное соответствие между мно­жествами X и Y. Функторы R* : 2X → 2Y и R* : 2Y → 2X — ото­бражение, такие что
*
R
(A) = {y ∈ Y | R(x, y) = 1 для всех x ∈ A},
R
(B) = {x ∈ X | R(x, y) = 1 для всех y ∈ B}.
*
Пары множеств (A, B) ∈ 2
*
R
(A) =B, R*(B) =A,
X
× 2Y, для которых
называются формальными понятиями. Формальные поня­тия образуют решетку с операциями
(A
, B1) ∧ (A2, B2) = (A1 ∩ A2, R*R*(B1 ∪ B),
1
(A
, B1) ∨ (A2, B2) = (R*R*(A1 ∪ A2), B1 ∩ B).
1
При оценке интенсивности связи бинарных отношений двоеточие {0, 1} можно заменить более богатой шкалой. Наи­более развита теория формальных понятий с использованием в качестве оценочной шкалы коммутативных резидуальных решеток (см. [Belohlavek, 2012]). При анализе лингвистиче­ских контекстов и вербальных оценок целесообразно отка­заться от коммутативности ([Moot, 2012], [Волкова, 2019]).
6.2. Структурно-логические модели
Дистрибутивные модели помогают компьютеру «по­нимать» значения слов. Однако понимания предложений и более длинных фрагментов текста добиться сложно без учета грамматической структуры текста. С позиций теории категорий одним из наиболее перспективных направлений соединения дистрибутивных и грамматических моделей является использование грамматик, введенных Ламбеком [Lambek, 1958, Lambek, 1999, Lambek, 2008], в рамках, так называемых, моноидальных категорий.
Принцип композиционности положен в основу ра­боты [Coecke, 2010], стимулировавшей интенсивные ис­следования в новом направлении. Используя функторную семантику, авторы моделируют естественный язык как (мо­ноидальный) функтор между компактными замкнутыми категориями, что является своеобразным математическим оформлением идеи о том, что значение предложения может
122
быть определено значениями его отдельных слов вместе с грамматическими правилами.
Удобным математическим инструментом для анализа структуры естественных языков являются предгруппы. Это об­условлено тем, что предгруппы имеют структуру, сходную со структурой векторных пространств, если рассматривать и те, и другие, как категории с тензорными произведениями. Благодаря этому, появляется возможность использовать ком
­пактную замкнутую категорию как математическую структу­ру, в рамках которой «вычисляется» значение предложений. Значения слов — это векторы в векторных пространствах, их грамматические роли — это типы в предгруппе, а тензорное произведение векторных пространств в паре с композицией предгруппы используется для составления пар «значение-тип».
6.3. Предгруппы
Предгруппой называют множество P, на котором зада-
ны частичный порядок ≤, ассоциативное умножение с едини­цей 1, монотонное относительно упорядочения, и две унар­ные операции l и r, такие, что
l
a ≤ 1 ≤ aal и aar ≤ 1 ≤ ara
a
для всех a ∈ P. Элементы al и ar называются соответственно левым и правым сопряженными.
Пример 1. Пусть P множество неограниченных мо-
нотонных отображений множества целых чисел в себя. Умножением служит композиция функций, единицей — тождественное отображение. Для f : → положим
l
(x) = min {y ∈ | x ≤ f(y)};
f
r
(x) = max {y ∈ | f(y) ≤ x}.
f
Пример 2. (алгебра Ламбека). В исчислении Ламбека P — это частично упорядоченный моноид с резидуальным умножением, т.е. в P определены операции \ и / такие, что
ab ≤ c тогда и только тогда, когда b ≤ a \ c и a ≤ c / b.
Если в предгруппе P положить
a / b = ab
l
и a \ b = arb,
получится резидуальный моноид (алгебра Ламбека). В то же время соотношение (ab) / c = a · (b / c) верно в предгруппах, но не во всех резидуальных моноидах.
123
Если рассматривать упорядоченное множество P как ка-
тегорию, то для любого b ∈ P умножение x x · b можно трак­товать как функтор P → P. Тогда отображение y y / b также оказывается функтором. Соотношение x · b ≤ y ⇔ x ≤ y / b пока- зывает, что эти функторы сопряжены.
Если правые и левые сопряженные совпадают для всех
элементов предгруппы, то предгруппа оказывается группой. Предгруппа P называется собственной, если al ≠ ar хотя бы для одного a ∈ P.
Укажем некоторые свойства операций в предгруппе P:
 если a ≤ b, то bl ≤ al и br ≤ ar;  1l = 1 = 1r;  (a · b)l = bl · al и (a · b)r = br · ar для любых a, b ∈ P;  (al)r = a = (ar)l для любого a ∈ P.
При работе с предгруппами для обозначения порядка
наряду с традиционным символом неравенства ≤ принято использовать стрелку → . Тогда, например, определяющие соотношения для сопряженных элементов запишутся в виде
a
l
a → 1 → aal и aar → 1 → ara. (5)
Неравенства вида ualav → uv и uaarv → uv называют
сжатиями, неравенства вида uv → uaalv и uv → uarav рас­ширениями.
Всякое неравенство в предгруппах может быть выведе­но последовательным применением сначала серии сжатий, затем серии расширений. Этот важный факт был установлен в [Lambek, 1999].
В языковых моделях, как правило, используются сво­бодные предгруппы. Приведем описание строения свободной предгруппы на упорядоченном множестве G. Обозначим че­рез Q свободный моноид с множеством образующих G × . Элементами Q являются слова вида (g1, z1)(g2, z1)...(gk, zk), умножением служит конкатенация, пустое слово является единичным элементом (в этом контексте мы будем обозна­чать его единицей).
Операции сопряжения определим рекурсивно:
1l = 1 = 1r;
 (g, z)l = (g, z – 1) и (g, z)r = (g, z + 1) для всех (g, z) ∈ G × ;
 (uv)l = vlul и (uv)r = vrur для любых u, v ∈ Q.
124
Далее, пусть ≤ наименьшее отношение предпорядка на
Q, удовлетворяющее следующим условиям:
(g, z) ≤ (g′, z), если g ≤ g′ и z четно; (g, z)≥ (g′, z), если g ≤ g′ и z нечетно; (g, z)(g, z + 1) ≤ 1 ≤ (g, z + 1)(g, z) для всех (g, z) ∈ G × ; если x ≤ y, то uxv ≤ uyv для любых u, v ∈ Q. Отношение ≤ не является упорядочением. Например, в
соответствии с определением
(g, 0)(g, 1) ≤ 1 ≤ (g, 1)(g, 0).
Умножая на (g, 0) обе части первого неравенства спра-
ва, а второго — слева, получаем
(g, 0)(g, 1)(g, 0) ≤ (g, 0) ≤ (g, 0)(g, 1)(g, 0).
В то же время (g, 0)(g, 1)(g, 0) ≠ (g, 0). Обозначим через P фактормножество множества Q по
отношению эквивалентности, порожденному предпорядком ≤. Множество P с индуцированными операциями и отноше- нием порядка является свободной предгруппой на упорядо­ченном множестве G.
Схематично применение предгрупп для моделирова-
ния структуры предложений выглядит следующим образом.
Пусть
Σ — словарь (множество слов естественного язы-
ка или некоторого его фрагмента), B — множество базисных грамматических типов, T(B) — свободная предгруппа на множестве типов, а D ⊆ Σ × T(B) — (5)
бинарное отношение.
Следуя [Coecke, 2013], грамматикой Ламбека будем
называть пару 〈D, S〉, где D — отношение вида (5), а S — не- которое множество типов, содержащее тип декларативного предложения s.
Последовательность слов из словаря w
... wn будем
1w2
называть грамматически корректной, если существует по­следовательность (wi, ti) ∈ D, i = 1, ..., n, такая, что
t
· t2 · ... · tn → s.
1
Пример 3. Пусть словарь Σ содержит слова
ветер, листья, шляпы, кружит, срывает, сухие
Множество B содержит три базовых грамматических
типа, B = {s, n
, n2}. Соответствие D задается таблицей:
1
125
ветер кружит
n n
срывает
rsdl
сухие листья
l
dd
шляпы
d
Несложно проверить, что предложение «ветер кружит сухие листья» грамматически корректно:
rsdl
n(n
)(ddl)d = (nnr)s(dld)(dld) → 1 · s · 1 · 1 = s.
Точно так же грамматически корректны предложения «ветер кружит листья» «ветер срывает шляпы». Вместе с тем грамматически корректным оказывается предложение «ветер кружит сухие шляпы». Красный свет такому пред­ложению в комплексных лингвистических моделях должна зажечь дистрибутивная компонента.
Произвольную предгруппу P можно рассматривать как категорию P, порожденную упорядочением. Объектами категории P служат элементы предгруппы P. Если a, b ∈ P, то множество Hom
(a, b) содержит единственный морфизм
P
a → b при a ≤ b и пусто в противном случае. Умножение в предгруппе P является тензорным произведением в кате­гории P. Неравенства (5) показывают, что al и ar являются соответственно левым и правым сопряженными к a ∈ P в P как категории с тензорным произведением. Таким образом, P является компактной замкнутой категорией. Чтобы не ус­ложнять терминологию, мы сохраним за такими категория­ми название «предгруппа».
6.4. Дистрибутивная композиционная категорная модель
значения (DisCoCat)
Центральную роль в модели DisCoCat играют катего­рии вида FdV × P, где FdV — категория конечномерных век­торных пространств над полем действительных чисел , а P — предгруппа.
Объектами категории FdV × P являются пары (V, a), где V– конечномерное пространство, а a — элемент предгруппы P. Морфизмами из (V, a) в (W, b) при a → b служат пары вида (f, a → b), где f: V → W — линейное отображение. Если a b, множество морфизмов из (V, a) в (W, b) пусто. Композиция определяется покомпонентно. Единичным морфизмом объекта
126
(V, a) является морфизм (idV, a → a). Тензорное произведение в

wt
UW WV UIVUV
⊗⊗⊗ → ⊗⊗ ⊗
⊗⊗ε
.
FdV × P определяется формулой
(V, a) ⊗ (W, b) = (V ⊗ W, a · b).
Левым и правым сопряженными к объекту (V, a) слу-
жат соответственно (V
*
, al) и (V*, ar) с единицами и коедини-
цами сопряжения следующего вида:
l
η
= (ηl : → V ⊗ V*, 1 → a · al);
(V, a)
r
η
= (ηr : → V* ⊗ V, 1 → ar · a);
(V, a)
l
ε
= (εl : V* ⊗ V → , al · a → 1);
(V, a)
r
ε
= (εr : V ⊗ V* → , a · ar → 1).
(V, a)
Снабженная этой структурой категория FdV × P пре-
вращается в компактную замкнутую категорию.
Пусть далее
Σ — словарь, B — множество базисных
грамматических типов, P = T(B) — свободная предгруппа на множестве типов, D ⊆ Σ × T(B) — бинарное отношение, свя­зывающее слова с их возможными грамматическим типами, а s — тип декларативного предложения.
Общая схема присваивания семантического значения
предложению может быть описана следующим образом.
Предполагается, что каждому грамматическому типу t
∈ P сопоставлено векторное пространство t. Каждое слово w, такое что (w, t) ∈ D, представлено в этом пространстве не-
которым вектором
∈
.
Пусть v = w1 ... wn — последовательность слов, и
(wi, ti) ∈ D, i = 1, ..., n. Положим
и t = t
v = t
· ... · tn. Объект (v, t) категории FdV × P служит про-
1
⊗ ... ⊗ tn
1
странством семантических значений последовательности слов v.
Рассмотрим сжатие вида p · al · a · q → p · q. Предполо-
жим, что уже построены пространства значений (U, p), (V, q) и (W, a). Обозначим через ϕ линейное отображение
∗
UV
W
Тогда
(U ⊗ W
*
⊗ W ⊗ V, palaq) → (U ⊗ V, p · q) —
морфизм в категории FdV × P.
127
Аналогичным образом определяются морфизмы, со­ответствующие сжатиям и расширениям других типов (paarq → pq, pq → paalq и pq → paraq).
Пусть w = w1 ... wn — грамматически корректное пред­ложение, т.е.
t для некоторой последовательности (w
· t2 · ... · tn → s (6)
1
, ti) ∈ D, i = 1, ..., n.
i
Редукцию (6) можно представить в виде последователь­ности сжатий и расширений. Композиция соответствующих морфизмов дает морфизм
(t
⊗ ... ⊗tn, t1 · ... · tn) → (S, s).
1
Образ w
⊗ ... ⊗ wn относительно линейного отображе-
1
ния t1 ⊗ ... ⊗tn →S является одним из возможных зна­чений предложения w = w1 ... wn.
Последовательность слов из словаря w1 w2 ... wn будем называть грамматически корректной, если существует по­следовательность (wi, ti) ∈ D, i = 1, ..., n, такая, что
t
· t2 · ... · tn → s.
1
Рассмотрим более подробно, как в рамках описанной модели выглядят векторные представления слов, относящих­ся к небазисным типам. Пусть, например, базовому типу n (именная группа) соответствует векторное пространство V, и слово мяч представлено в этом пространстве вектором x. При­лагательному красный может быть присвоен тип n · nl. Тип словосочетания красный мяч может быть редуцирован к типу именной группы: (n · nl) · n = n · (nl · n) → n. Соответственно вектор, представляющий прилагательное красный типа n · nl, находится в пространстве V ⊗ V*. Это пространство естествен­но изоморфно пространству линейных отображений V в себя. Таким образом, прилагательное красный должно быть пред­ставлено некоторым линейным отображением f: V → V. Если векторное представление слова мяч было получено в рамках дистрибутивной модели, теми же дистрибутивными методами может быть получено векторное представление именной груп­пы красный мяч. Пусть это будет вектор y ∈ V. Тогда y = f(x).
Если взять набор сочетаний вида красный <суще­ствительное>, получается набор уравнений вида yj = f(xj), j = 1, ..., m. Используя бра-кет обозначения задачу поиска
128
отображения f : V → V можно представить как задачу подбора
ye
i
=
1
коэффициентов αi, минимизирующих некоторую функцию ошибок
n
−
∑
ji
где {e
, ..., en} — базис пространства V.
i
x
α
ij
,
j = 1, ..., m,
6.5. Обогащенные категории и семантика языковых
моделей
Одна из задач, решаемых статистическими языковыми моделями, — приписать вероятность заданной последова­тельности слов (выражений). Этого можно достичь, задав на множестве выражений функцию двух переменных H(x, y) со значениями на промежутке [0, 1]. Число H(x, y) может трак­товаться как условная вероятность p(y | x) того, что выраже­ние y является продолжением выражения x. Такая оценка мо­жет быть получена, например, на основе частотного анализа корпуса текстов, см. [Johnson, 2024, Asudani, 2023] с последу­ющей корректировкой распределений [Kneser, 1995].
Вообще совокупность выражений можно снабдить структурой категории, которую мы обозначим L. Объекта­ми этой категории служат выражения. Укажем теперь, как выглядят множества HomL(x, y). Если выражение y не явля­ется продолжением выражения x, множество морфизмов из x в y пусто, в противном случае HomL(x, y) содержит един- ственный морфизм, который мы будем обозначать x y. Для любого выражения x множество HomL(x, x) содержит единственный морфизм idx.
С учетом введенных обозначений будем писать p(x y) вместо p(y | x). Если y не является продолжением x, будем пи­сать p(x y) = 0.
Если в качестве оценки p(x y) принять относительную частоту, то,
p(x y) · p(y z) = p(x z), (7) если только p(y z) ≠ 0, и p(x y) · p(y z) ≤ p(x z) в общем
случае.
С учетом того, что оценка условной вероятности p(y | x) может быть скорректирована (например, так,
129
как это предлагается в [Kneser, 1995] для оценки редких со­бытий), то (7) можно переписать в более общем виде, заменив умножение t-нормой и равенство неравенством:
p(x y) * p(y z) ≤ p(x z) (8)
Напомним, что t-нормой называют бинарную операцию на промежутке [0, 1], которая ассоциативна, коммутативна и сохраняет 0 и 1, т.е. превращает [0, 1] в коммутативную полу­группу с нулем и единицей. Дополнительно будем предпола­гать, что операция * резидуальна, т.е. для любых a, b ∈ [0, 1] существует такое c ∈ [0, 1], которое мы обозначим b*a что
a * u ≤ b тогда и только тогда, когда u ≤ a b, (9)
Уточним описание категории L и связанных с ней кон­струкций. Пусть A — конечное множество, элементы кото­рого будем называть токенами (как это принято в больших лингвистических моделях). Множество конечных последо­вательностей токенов с операцией конкатенации (свободный моноид, порожденный множеством A) обозначим L. Элемен­ты множества L будем называть строками. Введем на мно­жестве строк отношение частичного порядка, полагая a b, если b = ax для некоторого x ∈ L.
Для x ∈ L обозначим через L
множество всевозможных
x
продолжений текста x:
L
= {y ∈ L | x y}.
x
Покажем теперь, как оценки p(x y) связаны со стан­дартными моделями больших лингвистических систем. В этих системах прогнозирование идет на шаг вперед на основе оценки вероятности следующего токена. Поданный на вход текст x ∈ A
*
задает распределение вероятностей
p(– | x) : A → [0, 1] на множестве возможных продолжений текста x на один токен. Получить продолжение оценок на Lx можно, используя t-норму: если y = xa1a2 ... an, то
hom (x, y) = p(xa
* p(xa
1a2
| x) * p(xa1a2 | xa1) * ... *
1
... an | xa1xa1a2 ... a
n–1
).
Будем дополнительно считать, что hom (x, y) = 0, если строка y не является продолжением строки x, и hom (x, x) = 1 для любой строки x.
Тем самым на множестве строк задается структура обо­гащенной категории над промежутком [0, 1] с t-нормой *.
130
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]