Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Прикладная теория категорий. Монография
.pdf
которые не «участвуют» в произведении, получаем аппрок-
tS
CD
∗
(
)
симацию матрицы M вида M′ = U′
размера |C| × d, V′ — матрица размера |D| × d, а
Σ′V′T, где U′ — матрица
Σ′ — диаго-
нальная матрица размера d × d, содержащая на диагонали d
наибольших сингулярных значений матрицы M.
Перенос рассмотренного подхода с векторных пространств на категории приводит к построению решеток понятий. В общем этот перенос выглядит следующим образом.
Множество контекстов и множество слов структурируются так, что становятся категориями. В простейшем случае — категориями, порожденными графом, представляющим
бинарное отношение. Матрица M заменяется функтором вида
F: Cop × D → Set (1)
(такие функторы называют профункторами). Для фиксированного контекста c функтор F(c, –) : D → Set можно трактовать как c-строку соответствующей матрицы, а функтор
F(–, d) : C → Set — как d-столбец.
Функтор (1) стандартным образом дает функторы
C → (Set
По лемме Йонеды категория C вкладывается в категорию
контравариантных функторов Set
D)op
, D → Set
op
C
замкнута относительно ко-пределов, функтор C → (SetD)op можно продолжить до функтора F* : Set
C
копределы (см. 1.10). Аналогично, D → Set
жить до функтора F* : (SetD)op → Set
op
C
. (2)
. Так как категория (SetD)op
op
→ (SetD)op, сохраняющего
op
C
, сохраняющего пределы.
op
C
можно продол-
Функтор F* сопряжен слева к функтору F*:
op
F
Se
→
←
F
*
et
op
.
(3)
По аналогии с правыми и левыми сингулярными векторами можно сформировать так называемые ядра профунктора (1): пары объектов (C, D) из C
F
*
(C) ≅ D и F*(D) ≅ C (4)
op
× D такие, что
Ядра профунктора подобны абстрактным единицам,
а категорные пределы и и копределы предоставляют способы манипулирования этими абстрактными единицами.
Категорию множеств в определении профунктора (1) можно
заменить какой-нибудь другой категорией. Пусть, например, X и Y — множества, рассматриваемые как дискретные
121

категории. В этом случае профунктор R: X × Y → {0, 1} — это
отображение, задающее бинарное соответствие между множествами X и Y. Функторы R* : 2X → 2Y и R* : 2Y → 2X — отображение, такие что
*
R
(A) = {y ∈ Y | R(x, y) = 1 для всех x ∈ A},
R
(B) = {x ∈ X | R(x, y) = 1 для всех y ∈ B}.
*
Пары множеств (A, B) ∈ 2
*
R
(A) =B, R*(B) =A,
X
× 2Y, для которых
называются формальными понятиями. Формальные понятия образуют решетку с операциями
(A
, B1) ∧ (A2, B2) = (A1 ∩ A2, R*R*(B1 ∪ B),
1
(A
, B1) ∨ (A2, B2) = (R*R*(A1 ∪ A2), B1 ∩ B).
1
При оценке интенсивности связи бинарных отношений
двоеточие {0, 1} можно заменить более богатой шкалой. Наиболее развита теория формальных понятий с использованием
в качестве оценочной шкалы коммутативных резидуальных
решеток (см. [Belohlavek, 2012]). При анализе лингвистических контекстов и вербальных оценок целесообразно отказаться от коммутативности ([Moot, 2012], [Волкова, 2019]).
6.2. Структурно-логические модели
Дистрибутивные модели помогают компьютеру «понимать» значения слов. Однако понимания предложений
и более длинных фрагментов текста добиться сложно без
учета грамматической структуры текста. С позиций теории
категорий одним из наиболее перспективных направлений
соединения дистрибутивных и грамматических моделей
является использование грамматик, введенных Ламбеком
[Lambek, 1958, Lambek, 1999, Lambek, 2008], в рамках, так
называемых, моноидальных категорий.
Принцип композиционности положен в основу работы [Coecke, 2010], стимулировавшей интенсивные исследования в новом направлении. Используя функторную
семантику, авторы моделируют естественный язык как (моноидальный) функтор между компактными замкнутыми
категориями, что является своеобразным математическим
оформлением идеи о том, что значение предложения может
122

быть определено значениями его отдельных слов вместе с
грамматическими правилами.
Удобным математическим инструментом для анализа
структуры естественных языков являются предгруппы. Это обусловлено тем, что предгруппы имеют структуру, сходную
со структурой векторных пространств, если рассматривать и
те, и другие, как категории с тензорными произведениями.
Благодаря этому, появляется возможность использовать ком
пактную замкнутую категорию как математическую структуру, в рамках которой «вычисляется» значение предложений.
Значения слов — это векторы в векторных пространствах, их
грамматические роли — это типы в предгруппе, а тензорное
произведение векторных пространств в паре с композицией
предгруппы используется для составления пар «значение-тип».
6.3. Предгруппы
Предгруппой называют множество P, на котором зада-
ны частичный порядок ≤, ассоциативное умножение с единицей 1, монотонное относительно упорядочения, и две унарные операции l и r, такие, что
l
a ≤ 1 ≤ aal и aar ≤ 1 ≤ ara
a
для всех a ∈ P. Элементы al и ar называются соответственно
левым и правым сопряженными.
Пример 1. Пусть P множество неограниченных мо-
нотонных отображений множества целых чисел в себя.
Умножением служит композиция функций, единицей —
тождественное отображение. Для f : → положим
l
(x) = min {y ∈ | x ≤ f(y)};
f
r
(x) = max {y ∈ | f(y) ≤ x}.
f
Пример 2. (алгебра Ламбека). В исчислении Ламбека
P — это частично упорядоченный моноид с резидуальным
умножением, т.е. в P определены операции \ и / такие, что
ab ≤ c тогда и только тогда, когда b ≤ a \ c и a ≤ c / b.
Если в предгруппе P положить
a / b = ab
l
и a \ b = arb,
получится резидуальный моноид (алгебра Ламбека). В то же
время соотношение (ab) / c = a · (b / c) верно в предгруппах,
но не во всех резидуальных моноидах.
123

Если рассматривать упорядоченное множество P как ка-
тегорию, то для любого b ∈ P умножение x x · b можно трактовать как функтор P → P. Тогда отображение y y / b также
оказывается функтором. Соотношение x · b ≤ y ⇔ x ≤ y / b пока-
зывает, что эти функторы сопряжены.
Если правые и левые сопряженные совпадают для всех
элементов предгруппы, то предгруппа оказывается группой.
Предгруппа P называется собственной, если al ≠ ar хотя бы
для одного a ∈ P.
Укажем некоторые свойства операций в предгруппе P:
если a ≤ b, то bl ≤ al и br ≤ ar;
1l = 1 = 1r;
(a · b)l = bl · al и (a · b)r = br · ar для любых a, b ∈ P;
(al)r = a = (ar)l для любого a ∈ P.
При работе с предгруппами для обозначения порядка
наряду с традиционным символом неравенства ≤ принято
использовать стрелку → . Тогда, например, определяющие
соотношения для сопряженных элементов запишутся в виде
a
l
a → 1 → aal и aar → 1 → ara. (5)
Неравенства вида ualav → uv и uaarv → uv называют
сжатиями, неравенства вида uv → uaalv и uv → uarav расширениями.
Всякое неравенство в предгруппах может быть выведено последовательным применением сначала серии сжатий,
затем серии расширений. Этот важный факт был установлен
в [Lambek, 1999].
В языковых моделях, как правило, используются свободные предгруппы. Приведем описание строения свободной
предгруппы на упорядоченном множестве G. Обозначим через Q свободный моноид с множеством образующих G × .
Элементами Q являются слова вида (g1, z1)(g2, z1)...(gk, zk),
умножением служит конкатенация, пустое слово является
единичным элементом (в этом контексте мы будем обозначать его единицей).
Операции сопряжения определим рекурсивно:
1l = 1 = 1r;
(g, z)l = (g, z – 1) и (g, z)r = (g, z + 1) для всех (g, z) ∈ G × ;
(uv)l = vlul и (uv)r = vrur для любых u, v ∈ Q.
124

Далее, пусть ≤ наименьшее отношение предпорядка на
Q, удовлетворяющее следующим условиям:
(g, z) ≤ (g′, z), если g ≤ g′ и z четно;
(g, z)≥ (g′, z), если g ≤ g′ и z нечетно;
(g, z)(g, z + 1) ≤ 1 ≤ (g, z + 1)(g, z) для всех (g, z) ∈ G × ;
если x ≤ y, то uxv ≤ uyv для любых u, v ∈ Q.
Отношение ≤ не является упорядочением. Например, в
соответствии с определением
(g, 0)(g, 1) ≤ 1 ≤ (g, 1)(g, 0).
Умножая на (g, 0) обе части первого неравенства спра-
ва, а второго — слева, получаем
(g, 0)(g, 1)(g, 0) ≤ (g, 0) ≤ (g, 0)(g, 1)(g, 0).
В то же время (g, 0)(g, 1)(g, 0) ≠ (g, 0).
Обозначим через P фактормножество множества Q по
отношению эквивалентности, порожденному предпорядком
≤. Множество P с индуцированными операциями и отноше-
нием порядка является свободной предгруппой на упорядоченном множестве G.
Схематично применение предгрупп для моделирова-
ния структуры предложений выглядит следующим образом.
Пусть
Σ — словарь (множество слов естественного язы-
ка или некоторого его фрагмента), B — множество базисных
грамматических типов, T(B) — свободная предгруппа на
множестве типов, а
D ⊆ Σ × T(B) — (5)
бинарное отношение.
Следуя [Coecke, 2013], грамматикой Ламбека будем
называть пару 〈D, S〉, где D — отношение вида (5), а S — не-
которое множество типов, содержащее тип декларативного
предложения s.
Последовательность слов из словаря w
... wn будем
1w2
называть грамматически корректной, если существует последовательность (wi, ti) ∈ D, i = 1, ..., n, такая, что
t
· t2 · ... · tn → s.
1
Пример 3. Пусть словарь Σ содержит слова
ветер, листья, шляпы, кружит, срывает, сухие
Множество B содержит три базовых грамматических
типа, B = {s, n
, n2}. Соответствие D задается таблицей:
1
125

ветер кружит
n n
срывает
rsdl
сухие листья
l
dd
шляпы
d
Несложно проверить, что предложение «ветер кружит
сухие листья» грамматически корректно:
rsdl
n(n
)(ddl)d = (nnr)s(dld)(dld) → 1 · s · 1 · 1 = s.
Точно так же грамматически корректны предложения
«ветер кружит листья» «ветер срывает шляпы». Вместе с
тем грамматически корректным оказывается предложение
«ветер кружит сухие шляпы». Красный свет такому предложению в комплексных лингвистических моделях должна
зажечь дистрибутивная компонента.
Произвольную предгруппу P можно рассматривать
как категорию P, порожденную упорядочением. Объектами
категории P служат элементы предгруппы P. Если a, b ∈ P,
то множество Hom
(a, b) содержит единственный морфизм
P
a → b при a ≤ b и пусто в противном случае. Умножение в
предгруппе P является тензорным произведением в категории P. Неравенства (5) показывают, что al и ar являются
соответственно левым и правым сопряженными к a ∈ P в P
как категории с тензорным произведением. Таким образом,
P является компактной замкнутой категорией. Чтобы не усложнять терминологию, мы сохраним за такими категориями название «предгруппа».
6.4. Дистрибутивная композиционная категорная модель
значения (DisCoCat)
Центральную роль в модели DisCoCat играют категории вида FdV × P, где FdV — категория конечномерных векторных пространств над полем действительных чисел , а
P — предгруппа.
Объектами категории FdV × P являются пары (V, a), где
V– конечномерное пространство, а a — элемент предгруппы P.
Морфизмами из (V, a) в (W, b) при a → b служат пары вида
(f, a → b), где f: V → W — линейное отображение. Если a b,
множество морфизмов из (V, a) в (W, b) пусто. Композиция
определяется покомпонентно. Единичным морфизмом объекта
126

(V, a) является морфизм (idV, a → a). Тензорное произведение в
wt
UW WV UIVUV
⊗⊗⊗ → ⊗⊗ ⊗
⊗⊗ε
.
FdV × P определяется формулой
(V, a) ⊗ (W, b) = (V ⊗ W, a · b).
Левым и правым сопряженными к объекту (V, a) слу-
жат соответственно (V
*
, al) и (V*, ar) с единицами и коедини-
цами сопряжения следующего вида:
l
η
= (ηl : → V ⊗ V*, 1 → a · al);
(V, a)
r
η
= (ηr : → V* ⊗ V, 1 → ar · a);
(V, a)
l
ε
= (εl : V* ⊗ V → , al · a → 1);
(V, a)
r
ε
= (εr : V ⊗ V* → , a · ar → 1).
(V, a)
Снабженная этой структурой категория FdV × P пре-
вращается в компактную замкнутую категорию.
Пусть далее
Σ — словарь, B — множество базисных
грамматических типов, P = T(B) — свободная предгруппа на
множестве типов, D ⊆ Σ × T(B) — бинарное отношение, связывающее слова с их возможными грамматическим типами,
а s — тип декларативного предложения.
Общая схема присваивания семантического значения
предложению может быть описана следующим образом.
Предполагается, что каждому грамматическому типу t
∈ P сопоставлено векторное пространство t. Каждое слово
w, такое что (w, t) ∈ D, представлено в этом пространстве не-
которым вектором
∈
.
Пусть v = w1 ... wn — последовательность слов, и
(wi, ti) ∈ D, i = 1, ..., n. Положим
и t = t
v = t
· ... · tn. Объект (v, t) категории FdV × P служит про-
1
⊗ ... ⊗ tn
1
странством семантических значений последовательности
слов v.
Рассмотрим сжатие вида p · al · a · q → p · q. Предполо-
жим, что уже построены пространства значений (U, p), (V, q)
и (W, a). Обозначим через ϕ линейное отображение
∗
UV
W
Тогда
(U ⊗ W
*
⊗ W ⊗ V, palaq) → (U ⊗ V, p · q) —
морфизм в категории FdV × P.
127

Аналогичным образом определяются морфизмы, соответствующие сжатиям и расширениям других типов
(paarq → pq, pq → paalq и pq → paraq).
Пусть w = w1 ... wn — грамматически корректное предложение, т.е.
t
для некоторой последовательности (w
· t2 · ... · tn → s (6)
1
, ti) ∈ D, i = 1, ..., n.
i
Редукцию (6) можно представить в виде последовательности сжатий и расширений. Композиция соответствующих
морфизмов дает морфизм
(t
⊗ ... ⊗ tn, t1 · ... · tn) → (S, s).
1
Образ w
⊗ ... ⊗ wn относительно линейного отображе-
1
ния t1 ⊗ ... ⊗ tn → S является одним из возможных значений предложения w = w1 ... wn.
Последовательность слов из словаря w1 w2 ... wn будем
называть грамматически корректной, если существует последовательность (wi, ti) ∈ D, i = 1, ..., n, такая, что
t
· t2 · ... · tn → s.
1
Рассмотрим более подробно, как в рамках описанной
модели выглядят векторные представления слов, относящихся к небазисным типам. Пусть, например, базовому типу n
(именная группа) соответствует векторное пространство V, и
слово мяч представлено в этом пространстве вектором x. Прилагательному красный может быть присвоен тип n · nl. Тип
словосочетания красный мяч может быть редуцирован к типу
именной группы: (n · nl) · n = n · (nl · n) → n. Соответственно
вектор, представляющий прилагательное красный типа n · nl,
находится в пространстве V ⊗ V*. Это пространство естественно изоморфно пространству линейных отображений V в себя.
Таким образом, прилагательное красный должно быть представлено некоторым линейным отображением f: V → V. Если
векторное представление слова мяч было получено в рамках
дистрибутивной модели, теми же дистрибутивными методами
может быть получено векторное представление именной группы красный мяч. Пусть это будет вектор y ∈ V. Тогда y = f(x).
Если взять набор сочетаний вида красный <существительное>, получается набор уравнений вида yj = f(xj),
j = 1, ..., m. Используя бра-кет обозначения задачу поиска
128

отображения f : V → V можно представить как задачу подбора
ye
i
=
1
коэффициентов αi, минимизирующих некоторую функцию
ошибок
n
−
∑
ji
где {e
, ..., en} — базис пространства V.
i
x
α
ij
,
j = 1, ..., m,
6.5. Обогащенные категории и семантика языковых
моделей
Одна из задач, решаемых статистическими языковыми
моделями, — приписать вероятность заданной последовательности слов (выражений). Этого можно достичь, задав на
множестве выражений функцию двух переменных H(x, y) со
значениями на промежутке [0, 1]. Число H(x, y) может трактоваться как условная вероятность p(y | x) того, что выражение y является продолжением выражения x. Такая оценка может быть получена, например, на основе частотного анализа
корпуса текстов, см. [Johnson, 2024, Asudani, 2023] с последующей корректировкой распределений [Kneser, 1995].
Вообще совокупность выражений можно снабдить
структурой категории, которую мы обозначим L. Объектами этой категории служат выражения. Укажем теперь, как
выглядят множества HomL(x, y). Если выражение y не является продолжением выражения x, множество морфизмов из
x в y пусто, в противном случае HomL(x, y) содержит един-
ственный морфизм, который мы будем обозначать x y.
Для любого выражения x множество HomL(x, x) содержит
единственный морфизм idx.
С учетом введенных обозначений будем писать p(x y)
вместо p(y | x). Если y не является продолжением x, будем писать p(x y) = 0.
Если в качестве оценки p(x y) принять относительную
частоту, то,
p(x y) · p(y z) = p(x z), (7)
если только p(y z) ≠ 0, и p(x y) · p(y z) ≤ p(x z) в общем
случае.
С учетом того, что оценка условной вероятности
p(y | x) может быть скорректирована (например, так,
129

как это предлагается в [Kneser, 1995] для оценки редких событий), то (7) можно переписать в более общем виде, заменив
умножение t-нормой и равенство неравенством:
p(x y) * p(y z) ≤ p(x z) (8)
Напомним, что t-нормой называют бинарную операцию
на промежутке [0, 1], которая ассоциативна, коммутативна и
сохраняет 0 и 1, т.е. превращает [0, 1] в коммутативную полугруппу с нулем и единицей. Дополнительно будем предполагать, что операция * резидуальна, т.е. для любых a, b ∈ [0, 1]
существует такое c ∈ [0, 1], которое мы обозначим b*a что
a * u ≤ b тогда и только тогда, когда u ≤ a b, (9)
Уточним описание категории L и связанных с ней конструкций. Пусть A — конечное множество, элементы которого будем называть токенами (как это принято в больших
лингвистических моделях). Множество конечных последовательностей токенов с операцией конкатенации (свободный
моноид, порожденный множеством A) обозначим L. Элементы множества L будем называть строками. Введем на множестве строк отношение частичного порядка, полагая a b,
если b = ax для некоторого x ∈ L.
Для x ∈ L обозначим через L
множество всевозможных
x
продолжений текста x:
L
= {y ∈ L | x y}.
x
Покажем теперь, как оценки p(x y) связаны со стандартными моделями больших лингвистических систем.
В этих системах прогнозирование идет на шаг вперед на
основе оценки вероятности следующего токена. Поданный
на вход текст x ∈ A
*
задает распределение вероятностей
p(– | x) : A → [0, 1] на множестве возможных продолжений
текста x на один токен. Получить продолжение оценок на Lx
можно, используя t-норму: если y = xa1a2 ... an, то
hom (x, y) = p(xa
* p(xa
1a2
| x) * p(xa1a2 | xa1) * ... *
1
... an | xa1xa1a2 ... a
n–1
).
Будем дополнительно считать, что hom (x, y) = 0, если
строка y не является продолжением строки x, и hom (x, x) =
1 для любой строки x.
Тем самым на множестве строк задается структура обогащенной категории над промежутком [0, 1] с t-нормой *.
130
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
