Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Прикладная теория категорий. Монография
.pdf
Для полноты изложения приведем общее определение
MM
,,,,
()
()
[]
()
↓↓
[]
≈
⊗⊗11
[]
[]
[]
[]
jj
,,,
[]
↑↑
⊗⊗
11
BI
[]
обогащенной категории [Kelly, 1982] (см. [Fong, 2019]).
В ряде интересных случаев множество морфизмов
HomC(X, Y) в категории C имеет дополнительную структуру,
фактически являясь объектом некоторой (возможно, другой) категории V. Например, множество линейных отображений векторного пространства X в векторное пространство
Y является векторным пространством. Множество бинарных
отношений между множествами X и Y имеет структуру решетки и т.п. Введенное Келли [Kelly] понятие обогащенной
категории дает общее алгебраическое описание подобных
ситуаций. Если для «обычной» категории HomC(X, Y) — это
объект категории множеств, в случае обогащенной категории
HomC(X, Y) — это объект категории V. Чтобы понятие композиции имело смысл, категория V должна быть моноидальной.
Пусть V — моноидальная категория.
категория C состоит из множества объектов Ob C и отображений
Ob C × Ob C → Ob V, Ob C × Ob C × Ob C → Mor V, и Ob C → Mor V
удовлетворяющих определенным условиям согласованности.
Образ пары объектов (A, B) относительно первого отображения
принято обозначать C(A, B) или [A, B]. Второе отображение
тройке объектов (A, B, C) ставит в соответствие морфизм
M
: [A, B] ⊗ [B, C] → [A, C],
ABC
называемый композицией. Наконец, третье отображение
для каждого объекту A задает единичный морфизм j
→ [A, A], где I единица относительно тензорного произведе-
ния в категории V. Композиция в естественном смысле должна быть ассоциативной, а единичные морфизмы — быть единицами относительно композиции. Эти условия означают
коммутативность диаграмм вида
AB BC CD AB BC CD
,,
⊗
[]
⊗
[]
[]
←→
Обогащенная
⊗
[]
⊗
[]
над V
: I →
A
,
⊗
BBD AD AC CD
AB
AB BB AB AA AB
[]
,, ,,
,
⊗
[]
⊗→
AB IA
,,
[]
MM
→
MM
→
[]
≈
[]
←
←
||
M
B
←⊗
⊗
,
⊗
[]
AB
,
.
131

Обогащенную над V категорию называют V-категорией.
↓↓
DD
D
SM
≈⊗α
TM
Если C и D — V-категории, V-функтор T : C → D со-
стоит из дух компонентов. Во-первых, имеется отображение T : Ob C → ObD, которое каждому объекту A ∈ ObC ставит в соответствие объект T(A) ∈ ObD, во-вторых, каждой
паре объектов A, B ∈ ObC ставится в соответствие морфизм
TAB : [A, B]C → [T(A), T(B)]D так, что выполняются есте-
ственные условия, которые можно представить коммутативной диаграммой:
AB BC AC
,, ,
[]⊗[]
CC C
TT T
⊗
M
→
[]
TA TB TB TC
,,
)
(
и тождеством T
⊗
)
(
→ jA = j
AA
(
)
)
(
для всех объектов A, B, C из Ob C.
T(A)
MM
,
TA TC→
)
(
(
Пусть T, S : C → D — пара V-функторов. Естественное
V-преобразование α : T ⇒ S задается семейством морфизмов
αA : I → [T(A), S(A)], для которых композиции
AB IABTASASASB
,, ,,
→⊗
[]
[]
AAB
→
()(
⊗
)
()(
→
)
TA SB,
и
≈⊗α
AB AB ITATBTBSB
,, ,,
→
[]
[]
AB B
⊗ →
()(
⊗
)
()(
→
)
TA SB,
совпадают.
Предположим теперь дополнительно, что категория V
замкнута, т.е. для любого объекта Y категории V функтор —
⊗ Y: V → V левым сопряженным к функтору [Y, –]: V → V.
Это означает, что для любых Y, Z из V имеется объект ZYи
естественный изоморфизм
Hom
(X ⊗ Y, Z) ≅ HomC(X, ZY).
C
для любых X, Y, Z.
Отображение (Z, Y) Z
Y
можно рассматривать как
обогащение V над собой.
Пусть C — V-категория. Произвольный объект A ∈ Ob C
дает отображение B [A, B]C из Ob C в Ob V. Далее, для B,
C ∈ Ob C пусть
T
: [B, C]C → [[A, B]C, [B, C]C]V —
B,C
морфизм, сопряженный к морфизму
[A, B]
132
⊗ [B, C]C → [A, C]C.
C
)
()(
()(
)
)

Этим определяется V-функтор HA : C → V, который называется представимым.
Сопоставление объектам A ∈ ObC функторов HA дает
контравариантное вложение категории C в категорию функторов из C в V.
Промежуток [0, 1] с естественным упорядочением можно рассматривать как моноидальную категорию с t-нормой в
качестве тензорного произведения. Обозначим ее I.
Описанная общая конструкция применима в случае категории L как обогащенной категорией над I.
Для этого случая общие определения приобретают следующий вид.
Отображением hom : L × L → [0, 1] задает в L структуру
обогащенной категории с базой I, если
hom (x, x) ≤ 1 и hom (x, y) * hom (y, z) ≤ hom (x, z) (10)
для любых x, y, z ∈ L, что можно интерпретировать как
*-транзитивность нечеткого отношения на L с функцией
принадлежности hom (x, y).
Свойство резидуальности, означает, что моноидальная
категория I замкнута. Для a, b ∈ [0, 1] полагаем
[a, b]
= a b.
I
Несложно проверить, что это определение корректно.
В самом деле, очевидно, a a =1. Далее, условие
(a b) * (b c) ≤ (a c)
в силу резидуальности t-нормы равносильно тому, что
a * (a b) * (b c) ≤ c,
а это неравенство выполняется, поскольку a * (a b) ≤ b и
b * (b c) ≤ c.
Рассмотрим (обогащенную) категорию функторов L → I
и аналог вложения Йонеды обогащенной категории L в обо-
L
гащенную категорию I
. Категория IL полна, кополна, и, вообще, имеет достаточно богатую алгебраическую структуру.
Это позволяет дать семантическую интерпретацию синтаксическим образованиям категории L (см. [Bradley 2022,
Bradley, 2025]).
Приведем соответствующие точные формулировки и
определения. Общее определение обогащенной категории
функторов в случае функторов из L в I приобретает достаточно простой вид.
133

Функтор f : L → I между обогащенными категориями
задается отображением f : L → [0,1] таким, что
hom
(x, y) ≤ [f(x), f(y)]I = f(x) f(y) (11)
L
для любых x, y ∈ L.
Чтобы избежать путаницы, в формуле (11) индексы
указывают на категории. Чтобы различать обычные функторы и функторы между обогащенными категориями будем
называть последние I-функторами.
Если f, g : L → I — I-функторы, положим
hom (f, g) = inf {hom
(f(x), g(x)) | x ∈ L}. (12)
I
Формула (12) превращает множество I-функторов из L
в I в категорию, обогащенную над I.
Чтобы доказать это, достаточно проверить выполнение
условия (4).
Во-первых,
hom (f, f) = inf {f(x) f(x) | x ∈ L} = 1
для любого f. Далее, неравенство
hom (f, g) * hom (g, h) ≤ hom (f, h)
равносильно тому, что
hom (f, g) * hom (g, h) ≤ f(x) h(x)
при любом x ∈ L. Последнее, в свою очередь, означает, что
f(x) * hom (f, g) * hom (g, h) ≤ h(x).
По определению, hom (f, g) ≤ f(x) g(x) и hom (g, h) ≤
≤ g(x) h(x) при любом x ∈ L. Следовательно,
f(x) * hom (f, g) * hom (g, h) ≤ f(x) * (f(x) g(x)) * (g(x) h(x)) ≤ h(x),
что и завершает доказательство.
Обогащенную категорию I-функторов из L в I мы будем
обозначать ΦI(L, I) или просто Φ.
Категория L может быть вложена в категорию ΦI(L, I) с
помощью аналога леммы Йонеды.
Сначала определим представимые функторы для обогащенной категории L.
Для любого u ∈ L отображение hu : L → I, такое что
hu(x) = homL(u, x) является I-функтором. Чтобы доказать это
утверждение достаточно проверить выполнение условия
hom
(x, y) ≤ homI (hu(x), hu(y)) (13)
L
134

т.е., условия
hom
(x, y) ≤ homL(u, x) homL(u, y).
L
Но это условие равносильно тому, что
hom
(u, x) * homL(x, y) ≤ homL(u, y).
L
Это, последнее условие, выполняется по определению
обогащенной категории (см. (10)).
Будем называть I-функтор h
u
представимым I-функто-
ром, ассоциированным с объектом u категории L.
По лемме Йонеды, сопоставляя объекту категории
ассоциированный с ним представимый функтор, мы получаем вложение исходной категории в категорию функторов на
ней со значениями в категории множеств. Аналогичная конструкция имеет место и для обогащенных категорий. В частности, отображение x hx множества объектов категории L
в множество объектов категории ΦI(L, I) оказывается контравариантным вложением.
По аналогии с леммой Йонеды несложно показать, что
для любого I-функтора f : L → I и любого x ∈ L справедливо
равенство
homΦ(hx, f) = f(x). (14)
Для доказательства (14) воспользуемся определением
обогащения в категории функторов (6):
hom
(hx, f) = inf {hx(y) f(y) | y ≤ L}.
Φ
Отсюда
f(x) = 1 f(x) = h
x
(x) f(x) ≥ homΦ(hx, f)
Обратно, по определению I-функтора при любом y ∈ L
имеем
hom
(x, y) ≤ homI(f(x), f(y)) = f(x) f(y).
L
Отсюда hom
(x, y) * f(x) ≤ f(y). Снова используя рези-
L
дульность t-нормы, получаем f(x) ≤ homL(x, y) f(y), т.е.
f(x) ≤ hx(y) f(y). Поскольку это неравенство выполняется
при любом y ∈ L, получаем f(x) ≤ homΦ(hx, f).
Так же, как и в классической лемме Йонеды, для f = hy
имеем
homΦ(hx, hy) = homL(y, x).
Таким образом, вложение x h
x
категории Lop в кате-
горию ΦI(L, I) оказывается изоморфизмом на образ как категорий, обогащенных над I.
135

Заметим, что hx(y) = homL(x, y) оценка возможности
того, что y является продолжением — x. Вложение x hx
тексту x сопоставляет оценку возможности различных его
продолжений в рамках рассматриваемого корпуса текстов.
С учетом этого появляется основание считать hx семантикой текста x, а саму категорию ΦI(L, I) считать категорией
«смыслов».
В категории Φ = ΦI(L, I) несложно ввести логические
операции, используя стандартный подход.
Если f, g : L → I — I-функторы, то f ∧ g : L → I определим, полагая
(f ∧ g)(x) = min (f(x), g(x)). (15)
для всех x ∈ L. Формула (9) задает в категории функторов
произведение.
Точно так же
(f ∨ g)(x) = max (f(x), g(x)). (16)
задает сумму.
Определения (15) и (16) не в полной мере учитывают
обогащение. Более содержательная концепция произведений, сумм и, вообще, пределов и копределов, возникает если
схемы для (ко-)пределов также рассматривать как обогащенные категории.
В случае обогащений над I это можно представить следующим образом.
Обозначим через B множество B ={0, 1}, рассматриваемое как дискретная обогащенная категория над I. Обогащение
β : B → I таково, что β(0, 0) = β(1, 1) = 1 и β(0, 1) = β(1, 0) = 0.
Чтобы задать I-функтор из B в Φ достаточно просто указать пару I-функторов f0, f1 : L → I. Рассмотрим, как выглядит произведение этих функторов в контексте обогащенной
категории Φ.
В случае «обычной» необогащенной категории C произведение пары объектов A0 и A1 характеризуется следующим свойством. Пусть F : B → C — функтор из дискретной
категории B = {0, 1} в категорию C, который задается парой
объектов A0 и A1. Далее, рассмотрим конус с вершиной X и
терминальными вершинами A0 и A1, т.е. в данном случае
пару морфизмов α0 : X → A0 и α1 : X → A1. Для каждой такой
пары однозначно определен морфизм α : X → A0 × A1 такой,
136

что π0α = α0 и π1α = α1, где π0, π1 — проекции. Этот морфизм
можно рассматривать как естественное преобразование конуса (α0, α1) в конус (π0, π1). Если пару объектов (A0, A1) рассматривать как функтор из дискретной категории B = {0, 1} в
категорию C, получаем естественный изоморфизм
Hom
B
где C
— категория функторов из B в C, а через X обозначен
(X, A0 × A1) ≅ Hom
C
B
(X, F), (17)
C
постоянный функтор, переводящий оба объекта из B в X и
оба морфизма в idX.
Отталкиваясь от формулы (17), можно получить опре-
деление произведения в категории Φ, заменяя множество
морфизмов соответствующим элементом категории I, над которой обогащены участвующие в (17) категории. Такое произведение, следуя [Riehl, 2014], будем называть
взвешенным
.
Диаграмма (произведения) в Φ со схемой B = {0, 1} опре-
деляется парой I-функторов w : B → I и F : B → Φ. Функтор w
в данном случае сводится к выбору пары чисел w0 = w(0) ∈ I
и w1 = w(1) ∈ I, а функтор F — к выбору пары I-функторов
f0, f1 : L → I из категории Φ = ΦI(L, I). Произведение (отно-
сительно этой диаграммы) оказывается I-функтор h : L → I
такой, что
h(x) = min {w0 f0(x), w1 f1 (x)}. (18)
Нетрудно убедиться, что (18) действительно задает
I-функтор. Достаточно проверить выполнение условия (11),
которое равносильно тому, что:
hom
Покажем, что hom
(x, y) * h(x) ≤ min {w0 f0(y), w1 f1(y)}. (19)
L
(x, y) * h(x) ≤ w0 f0(y) и homL(x, y)
L
* h(x) ≤ w1 f1(y), что и равносильно (19).
Первое неравенство равносильно неравенству
homL(x, y) * h(x) * w0 ≤ f0(y). Имеем
hom
(x, y) * h(x) * w0 ≤ homL(x, y) * (w0 f0(x)) * w0 ≤
L
≤ homL(x, y) * f0(x),
и hom
(x, y) * f0(x) ≤ f0(y), поскольку f0 — I-функтор. Отсюда
L
и следует нужное неравенство. Второе неравенство доказывается аналогично.
Для h из (18) положим h = f0 ∧ f1.
Пусть f0 = hu и f1 = hv— представимые I-функторы. Так
как hu(x) = hom(u, x) и hv(x) = hom(v, x), то h(x)может быть
137

отличен от нуля, если только x является общим продолжение u и v. Взвешенность придает некоторую дополнительную
числовую оценку семантике. Если взять тривиальные веса
w0 = w1 = 1, конъюнкция сведется к классическому необога-
щенному случаю.
Подобным же образом можно определить суммы и,
вообще, любые пределы и копределы в категории ΦI(L, I).
Таким образом, обогащенная категория, в которой представлена семантика L, обладает достаточно богатой логической
структурой.
Заключение
Дистрибутивная семантика на сегодняшний день является ведущим подходом к представлению лексических
значений в системах обработки естественного языка, в искусственном интеллекте и когнитивном моделировании.
Основанием служит дистрибутивная гипотеза [Harris, 1954;
Sahlgren, 2008], согласно которой слова со сходными лингвистическими контекстами, как правило, имеют сходные
значения. Дистрибутивная семантика приписывает лексическим единицам векторы из вещественного пространства
высокой размерности, которые кодируют их лингвистическое распределение в текстовых корпусах. С момента своего
появления дистрибутивная семантика претерпела глубокие
преобразования.
Можно выделить три поколения моделей, последовательно сменявших друг друга [Lenci, 2022].
Комбинаторные модели. В этих моделях дистрибутивная семантика основывается на построении векторов распределения путем регистрации частот совпадения.
Прогнозные модели. В этих моделях нейронные сети
(как правило, неглубокие) обучаются прогнозировать ближайшее окружение слов, основываясь на вложении лексических единиц в векторное пространство.
Контекстные модели
ся глу
бокие нейронные языковые модели для генерации
. В этих моделях используют-
определяемых контекстом векторов для каждого токена.
Контекстная зависимость вложения в векторное пространство отличает эти модели от моделей предыдущих поколе-
138

ний, в которых каждому слову сопоставляется один фиксированный вектор, так что вложение в векторное пространство
определено на этапе обучения и в дальнейшем не зависит от
контекста.
В исторической перспективе изменения в моделях
дистрибутивной семантики затрагивали способы описания
контекстов, методы генерации векторов слов, саму природу
таких векторов и саму сложность моделей, которая экспоненциально возросла, особенно с появлением последнего поколения глубоких нейронных сетей, содержащих огромное
число параметров и требующих столь же огромных вычислительных ресурсов для обучения.
Естественно считать, что в больших языковых моделях
контекст влияет на значение. Лексическая компетентность
человека также зависит от контекста.
Когда речь заходит о типах слов, испытуемые действительно могут выполнять несколько семантических задач, таких как оценка семантического сходства или группировка по
категориям (Murphy, 2004). Например, тот факт, что собака
и кошка принадлежат к одной семантической категории, является свойством на уровне типа. Это подтверждает гипотезу о том, что значения слов абстрактны и (по крайней мере,
частично) не зависят от конкретных контекстов, в которых
используются их лексемы. Таким образом, слова способны
улавливать некоторые контекстно-независимые аспекты лексического значения. Использование категориальных грамматик Ламбека в рамках описанного в этой главе подхода как
раз и направлено на то, чтобы соединить «относительную»
контекстную семантику с категориальной.
139

Глава 7. Теория категорий и машинное обучение
7.1. Общая схема обучения
Объяснимый искусственный интеллект (XAI) — это
развивающаяся область, целью которой является повышение прозрачности и интерпретируемости моделей машинного обучения (ML). Один из возможных подходов к решению
этой проблемы — использование категорных свойств алгоритмов обучения.
Алгебраическая абстрактность теории категорий позволяет единообразно подойти к описанию различных техник
машинного обучения. Композиционность — конструировать
сложные модели из более простых. Наконец, универсальные
конструкты дают возможность характеризовать компоненты машинного обучения в их взаимодействии.
Поясним эти идеи простыми примерами.
В основе больших языковых моделях лежит категория
Strings, которую можно определить следующим образом.
Объектами этой категории служат текстовые строки. Если
строка X является частью строки Y, включение X в Y задает морфизм X → Y из Strings(X, Y). Единичные морфизмы
и композиция определяются очевидным образом. Используя
технику так называемых нагруженных категорий, морфизмам можно приписать вероятность. Для морфизма X → Y
вероятность p(Y | X) — это вероятность того, что строка Y
продолжает строку X (полученная, например, по частотным
оценкам заданного корпуса текстов).
Рассмотрим теперь алгоритм обучения. В общем виде
систему обучения с учителем (или с подкреплением) можно
рассматривать как поиск «хорошей» аппроксимации функции f : A → B. Для обучения система получает набор пар
(a, b) ∈ A × B, относительно элементов которой предполагается, что они связаны искомой функцией, т.е. b ≈ f(a). Кроме
того учитель определяет класс функций, в котором ищется
аппроксимация. Формализуется этот выбор указанием про-
140
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
