Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Прикладная теория категорий. Монография

.pdf
Скачиваний:
0
Добавлен:
07.09.2026
Размер:
1 Мб
Скачать
☆
Для полноты изложения приведем общее определение
MM
,,,,
()
()
[]
()
↓↓
[]
≈
⊗⊗11
[]
[]
[]
[]
jj
,,,
[]
↑↑
⊗⊗
11
BI
[]
обогащенной категории [Kelly, 1982] (см. [Fong, 2019]).
В ряде интересных случаев множество морфизмов HomC(X, Y) в категории C имеет дополнительную структуру, фактически являясь объектом некоторой (возможно, дру­гой) категории V. Например, множество линейных отобра­жений векторного пространства X в векторное пространство Y является векторным пространством. Множество бинарных отношений между множествами X и Y имеет структуру ре­шетки и т.п. Введенное Келли [Kelly] понятие обогащенной категории дает общее алгебраическое описание подобных ситуаций. Если для «обычной» категории HomC(X, Y) — это объект категории множеств, в случае обогащенной категории HomC(X, Y) — это объект категории V. Чтобы понятие компо­зиции имело смысл, категория V должна быть моноидальной.
Пусть V — моноидальная категория. категория C состоит из множества объектов Ob C и отображений Ob C × Ob C → Ob V, Ob C × Ob C × Ob C → Mor V, и Ob C → Mor V удовлетворяющих определенным условиям согласованности. Образ пары объектов (A, B) относительно первого отображения принято обозначать C(A, B) или [A, B]. Второе отображение тройке объектов (A, B, C) ставит в соответствие морфизм
M
: [A, B] ⊗ [B, C] → [A, C],
ABC
называемый композицией. Наконец, третье отображение для каждого объекту A задает единичный морфизм j → [A, A], где I единица относительно тензорного произведе- ния в категории V. Композиция в естественном смысле долж­на быть ассоциативной, а единичные морфизмы — быть еди­ницами относительно композиции. Эти условия означают коммутативность диаграмм вида
AB BC CD AB BC CD
,,
⊗
[]
⊗
[]
[]
←→
Обогащенная
⊗
[]
⊗
[]
над V
: I →
A
,
⊗
BBD AD AC CD
AB
AB BB AB AA AB
[]
,, ,,
,
⊗
[]
⊗→
AB IA
,,
[]
MM
→
MM
→
[]
≈
[]
←
←
||
M
B
←⊗
⊗
,
⊗
[]
AB
,
.
131
Обогащенную над V категорию называют V-категорией.
↓↓
DD
D
SM
≈⊗α
TM
Если C и D — V-категории, V-функтор T : C → D со-
стоит из дух компонентов. Во-первых, имеется отображе­ние T : Ob C → ObD, которое каждому объекту A ∈ ObC ста­вит в соответствие объект T(A) ∈ ObD, во-вторых, каждой паре объектов A, B ∈ ObC ставится в соответствие морфизм
TAB : [A, B]C → [T(A), T(B)]D так, что выполняются есте-
ственные условия, которые можно представить коммутатив­ной диаграммой:
AB BC AC
,, ,
[]⊗[]
CC C
TT T
⊗
M
→
[]
TA TB TB TC
,,
)
(
и тождеством T
⊗
)
(
→ jA = j
AA
(
)
)
(
для всех объектов A, B, C из Ob C.
T(A)
MM
,
TA TC→
)
(
(
Пусть T, S : C → D — пара V-функторов. Естественное
V-преобразование α : T ⇒ S задается семейством морфизмов
αA : I → [T(A), S(A)], для которых композиции
AB IABTASASASB
,, ,,
→⊗
[]
[]
AAB
→
()(
⊗
)
()(
→
)

TA SB,
и
≈⊗α
AB AB ITATBTBSB
,, ,,
→
[]
[]
AB B
⊗ →
()(
⊗
)
()(
→
)

TA SB,
совпадают.
Предположим теперь дополнительно, что категория V
замкнута, т.е. для любого объекта Y категории V функтор — ⊗ Y: V → V левым сопряженным к функтору [Y, –]: V → V. Это означает, что для любых Y, Z из V имеется объект ZYи естественный изоморфизм
Hom
(X ⊗ Y, Z) ≅ HomC(X, ZY).
C
для любых X, Y, Z.
Отображение (Z, Y) Z
Y
можно рассматривать как
обогащение V над собой.
Пусть C — V-категория. Произвольный объект A ∈ Ob C
дает отображение B [A, B]C из Ob C в Ob V. Далее, для B,
C ∈ Ob C пусть
T
: [B, C]C → [[A, B]C, [B, C]C]V —
B,C
морфизм, сопряженный к морфизму
[A, B]
132
⊗ [B, C]C → [A, C]C.
C
)
()(
()(
)
)
Этим определяется V-функтор HA : C → V, который на­зывается представимым.
Сопоставление объектам A ∈ ObC функторов HA дает контравариантное вложение категории C в категорию фун­кторов из C в V.
Промежуток [0, 1] с естественным упорядочением мож­но рассматривать как моноидальную категорию с t-нормой в качестве тензорного произведения. Обозначим ее I.
Описанная общая конструкция применима в случае ка­тегории L как обогащенной категорией над I.
Для этого случая общие определения приобретают сле­дующий вид.
Отображением hom : L × L → [0, 1] задает в L структуру обогащенной категории с базой I, если
hom (x, x) ≤ 1 и hom (x, y) * hom (y, z) ≤ hom (x, z) (10) для любых x, y, z ∈ L, что можно интерпретировать как
*-транзитивность нечеткого отношения на L с функцией принадлежности hom (x, y).
Свойство резидуальности, означает, что моноидальная категория I замкнута. Для a, b ∈ [0, 1] полагаем
[a, b]
= a b.
I
Несложно проверить, что это определение корректно. В самом деле, очевидно, a a =1. Далее, условие
(a b) * (b c) ≤ (a c)
в силу резидуальности t-нормы равносильно тому, что
a * (ab) * (bc) ≤ c,
а это неравенство выполняется, поскольку a * (ab) ≤ b и b * (b c) ≤ c.
Рассмотрим (обогащенную) категорию функторов L → I и аналог вложения Йонеды обогащенной категории L в обо-
L
гащенную категорию I
. Категория IL полна, кополна, и, во­обще, имеет достаточно богатую алгебраическую структуру. Это позволяет дать семантическую интерпретацию синтак­сическим образованиям категории L (см. [Bradley 2022, Bradley, 2025]).
Приведем соответствующие точные формулировки и определения. Общее определение обогащенной категории функторов в случае функторов из L в I приобретает достаточ­но простой вид.
133
Функтор f : L → I между обогащенными категориями
задается отображением f : L → [0,1] таким, что hom
(x, y) ≤ [f(x), f(y)]I = f(x) f(y) (11)
L
для любых x, y ∈ L.
Чтобы избежать путаницы, в формуле (11) индексы указывают на категории. Чтобы различать обычные функто­ры и функторы между обогащенными категориями будем называть последние I-функторами.
Если f, g : L → I — I-функторы, положим hom (f, g) = inf {hom
(f(x), g(x)) | x ∈ L}. (12)
I
Формула (12) превращает множество I-функторов из L в I в категорию, обогащенную над I.
Чтобы доказать это, достаточно проверить выполнение условия (4).
Во-первых,
hom (f, f) = inf {f(x) f(x) | x ∈ L} = 1
для любого f. Далее, неравенство
hom (f, g) * hom (g, h) ≤ hom (f, h)
равносильно тому, что
hom (f, g) * hom (g, h) ≤ f(x) h(x)
при любом x ∈ L. Последнее, в свою очередь, означает, что
f(x) * hom (f, g) * hom (g, h) ≤ h(x).
По определению, hom (f, g) ≤ f(x) g(x) и hom (g, h) ≤
≤ g(x) h(x) при любом x ∈ L. Следовательно, f(x) * hom (f, g) * hom (g, h) ≤ f(x) * (f(x) g(x)) * (g(x)  h(x)) ≤ h(x),
что и завершает доказательство.
Обогащенную категорию I-функторов из L в I мы будем обозначать ΦI(L, I) или просто Φ.
Категория L может быть вложена в категорию ΦI(L, I) с помощью аналога леммы Йонеды.
Сначала определим представимые функторы для обога­щенной категории L.
Для любого u ∈ L отображение hu : L → I, такое что
hu(x) = homL(u, x) является I-функтором. Чтобы доказать это
утверждение достаточно проверить выполнение условия hom
(x, y) ≤ homI (hu(x), hu(y)) (13)
L
134
т.е., условия
hom
(x, y) ≤ homL(u, x) homL(u, y).
L
Но это условие равносильно тому, что
hom
(u, x) * homL(x, y) ≤ homL(u, y).
L
Это, последнее условие, выполняется по определению
обогащенной категории (см. (10)).
Будем называть I-функтор h
u
представимым I-функто-
ром, ассоциированным с объектом u категории L.
По лемме Йонеды, сопоставляя объекту категории ассоциированный с ним представимый функтор, мы получа­ем вложение исходной категории в категорию функторов на ней со значениями в категории множеств. Аналогичная кон­струкция имеет место и для обогащенных категорий. В част­ности, отображение x hx множества объектов категории L в множество объектов категории ΦI(L, I) оказывается кон­травариантным вложением.
По аналогии с леммой Йонеды несложно показать, что для любого I-функтора f : L → I и любого x ∈ L справедливо равенство homΦ(hx, f) = f(x). (14)
Для доказательства (14) воспользуемся определением обогащения в категории функторов (6):
hom
(hx, f) = inf {hx(y) f(y) | y ≤ L}.
Φ
Отсюда
f(x) = 1 f(x) = h
x
(x) f(x) ≥ homΦ(hx, f)
Обратно, по определению I-функтора при любом y ∈ L имеем
hom
(x, y) ≤ homI(f(x), f(y)) = f(x) f(y).
L
Отсюда hom
(x, y) * f(x) ≤ f(y). Снова используя рези-
L
дульность t-нормы, получаем f(x) ≤ homL(x, y) f(y), т.е. f(x) ≤ hx(y) f(y). Поскольку это неравенство выполняется
при любом y ∈ L, получаем f(x) ≤ homΦ(hx, f).
Так же, как и в классической лемме Йонеды, для f = hy имеем
homΦ(hx, hy) = homL(y, x).
Таким образом, вложение x h
x
категории Lop в кате-
горию ΦI(L, I) оказывается изоморфизмом на образ как кате­горий, обогащенных над I.
135
Заметим, что hx(y) = homL(x, y) оценка возможности того, что y является продолжением — x. Вложение x hx тексту x сопоставляет оценку возможности различных его продолжений в рамках рассматриваемого корпуса текстов. С учетом этого появляется основание считать hx семанти­кой текста x, а саму категорию ΦI(L, I) считать категорией «смыслов».
В категории Φ = ΦI(L, I) несложно ввести логические операции, используя стандартный подход.
Если f, g : L → I — I-функторы, то f ∧ g : L → I опреде­лим, полагая (f ∧ g)(x) = min (f(x), g(x)). (15)
для всех x ∈ L. Формула (9) задает в категории функторов произведение.
Точно так же (f ∨ g)(x) = max (f(x), g(x)). (16) задает сумму.
Определения (15) и (16) не в полной мере учитывают обогащение. Более содержательная концепция произведе­ний, сумм и, вообще, пределов и копределов, возникает если схемы для (ко-)пределов также рассматривать как обогащен­ные категории.
В случае обогащений над I это можно представить сле­дующим образом.
Обозначим через B множество B ={0, 1}, рассматривае­мое как дискретная обогащенная категория над I. Обогащение β : B → I таково, что β(0, 0) = β(1, 1) = 1 и β(0, 1) = β(1, 0) = 0.
Чтобы задать I-функтор из B в Φ достаточно просто ука­зать пару I-функторов f0, f1 : L → I. Рассмотрим, как выгля­дит произведение этих функторов в контексте обогащенной категории Φ.
В случае «обычной» необогащенной категории C про­изведение пары объектов A0 и A1 характеризуется следую­щим свойством. Пусть F : B → C — функтор из дискретной категории B = {0, 1} в категорию C, который задается парой объектов A0 и A1. Далее, рассмотрим конус с вершиной X и терминальными вершинами A0 и A1, т.е. в данном случае пару морфизмов α0 : X → A0 и α1 : X → A1. Для каждой такой пары однозначно определен морфизм α : X → A0 × A1 такой,
136
что π0α = α0 и π1α = α1, где π0, π1 — проекции. Этот морфизм можно рассматривать как естественное преобразование ко­нуса (α0, α1) в конус (π0, π1). Если пару объектов (A0, A1) рас­сматривать как функтор из дискретной категории B = {0, 1} в категорию C, получаем естественный изоморфизм
Hom
B
где C
— категория функторов из B в C, а через X обозначен
(X, A0 × A1) ≅ Hom
C
B
(X, F), (17)
C
постоянный функтор, переводящий оба объекта из B в X и оба морфизма в idX.
Отталкиваясь от формулы (17), можно получить опре-
деление произведения в категории Φ, заменяя множество морфизмов соответствующим элементом категории I, над ко­торой обогащены участвующие в (17) категории. Такое произ­ведение, следуя [Riehl, 2014], будем называть
взвешенным
.
Диаграмма (произведения) в Φ со схемой B = {0, 1} опре-
деляется парой I-функторов w : B → I и F : B → Φ. Функтор w в данном случае сводится к выбору пары чисел w0 = w(0) ∈ I и w1 = w(1) ∈ I, а функтор F — к выбору пары I-функторов
f0, f1 : L → I из категории Φ = ΦI(L, I). Произведение (отно-
сительно этой диаграммы) оказывается I-функтор h : L → I такой, что h(x) = min {w0  f0(x), w1  f1 (x)}. (18)
Нетрудно убедиться, что (18) действительно задает I-функтор. Достаточно проверить выполнение условия (11), которое равносильно тому, что:
hom
Покажем, что hom
(x, y) * h(x) ≤ min {w0  f0(y), w1  f1(y)}. (19)
L
(x, y) * h(x) ≤ w0  f0(y) и homL(x, y)
L
* h(x) ≤ w1  f1(y), что и равносильно (19).
Первое неравенство равносильно неравенству homL(x, y) * h(x) * w0 ≤ f0(y). Имеем
hom
(x, y) * h(x) * w0 ≤ homL(x, y) * (w0  f0(x)) * w0 ≤
L
≤ homL(x, y) * f0(x),
и hom
(x, y) * f0(x) ≤ f0(y), поскольку f0 — I-функтор. Отсюда
L
и следует нужное неравенство. Второе неравенство доказы­вается аналогично.
Для h из (18) положим h = f0 ∧ f1.
Пусть f0 = hu и f1 = hv— представимые I-функторы. Так как hu(x) = hom(u, x) и hv(x) = hom(v, x), то h(x)может быть
137
отличен от нуля, если только x является общим продолже­ние u и v. Взвешенность придает некоторую дополнительную числовую оценку семантике. Если взять тривиальные веса
w0 = w1 = 1, конъюнкция сведется к классическому необога-
щенному случаю.
Подобным же образом можно определить суммы и,
вообще, любые пределы и копределы в категории ΦI(L, I). Таким образом, обогащенная категория, в которой представ­лена семантика L, обладает достаточно богатой логической структурой.
Заключение
Дистрибутивная семантика на сегодняшний день яв­ляется ведущим подходом к представлению лексических значений в системах обработки естественного языка, в ис­кусственном интеллекте и когнитивном моделировании. Основанием служит дистрибутивная гипотеза [Harris, 1954; Sahlgren, 2008], согласно которой слова со сходными линг­вистическими контекстами, как правило, имеют сходные значения. Дистрибутивная семантика приписывает лекси­ческим единицам векторы из вещественного пространства высокой размерности, которые кодируют их лингвистиче­ское распределение в текстовых корпусах. С момента своего появления дистрибутивная семантика претерпела глубокие преобразования.
Можно выделить три поколения моделей, последова­тельно сменявших друг друга [Lenci, 2022].
Комбинаторные модели. В этих моделях дистрибутив­ная семантика основывается на построении векторов распре­деления путем регистрации частот совпадения.
Прогнозные модели. В этих моделях нейронные сети (как правило, неглубокие) обучаются прогнозировать бли­жайшее окружение слов, основываясь на вложении лексиче­ских единиц в векторное пространство.
Контекстные модели
ся глу
бокие нейронные языковые модели для генерации
. В этих моделях используют-
определяемых контекстом векторов для каждого токена. Контекстная зависимость вложения в векторное простран­ство отличает эти модели от моделей предыдущих поколе-
138
ний, в которых каждому слову сопоставляется один фикси­рованный вектор, так что вложение в векторное пространство определено на этапе обучения и в дальнейшем не зависит от контекста.
В исторической перспективе изменения в моделях дистрибутивной семантики затрагивали способы описания контекстов, методы генерации векторов слов, саму природу таких векторов и саму сложность моделей, которая экспо­ненциально возросла, особенно с появлением последнего по­коления глубоких нейронных сетей, содержащих огромное число параметров и требующих столь же огромных вычисли­тельных ресурсов для обучения.
Естественно считать, что в больших языковых моделях контекст влияет на значение. Лексическая компетентность человека также зависит от контекста.
Когда речь заходит о типах слов, испытуемые действи­тельно могут выполнять несколько семантических задач, та­ких как оценка семантического сходства или группировка по категориям (Murphy, 2004). Например, тот факт, что собака и кошка принадлежат к одной семантической категории, яв­ляется свойством на уровне типа. Это подтверждает гипоте­зу о том, что значения слов абстрактны и (по крайней мере, частично) не зависят от конкретных контекстов, в которых используются их лексемы. Таким образом, слова способны улавливать некоторые контекстно-независимые аспекты лек­сического значения. Использование категориальных грам­матик Ламбека в рамках описанного в этой главе подхода как раз и направлено на то, чтобы соединить «относительную» контекстную семантику с категориальной.
139
Глава 7. Теория категорий и машинное обучение
7.1. Общая схема обучения
Объяснимый искусственный интеллект (XAI) — это развивающаяся область, целью которой является повыше­ние прозрачности и интерпретируемости моделей машинно­го обучения (ML). Один из возможных подходов к решению этой проблемы — использование категорных свойств алго­ритмов обучения.
Алгебраическая абстрактность теории категорий позво­ляет единообразно подойти к описанию различных техник машинного обучения. Композиционность — конструировать сложные модели из более простых. Наконец, универсальные конструкты дают возможность характеризовать компонен­ты машинного обучения в их взаимодействии.
Поясним эти идеи простыми примерами.
В основе больших языковых моделях лежит категория Strings, которую можно определить следующим образом. Объектами этой категории служат текстовые строки. Если строка X является частью строки Y, включение X в Y зада­ет морфизм X → Y из Strings(X, Y). Единичные морфизмы и композиция определяются очевидным образом. Используя технику так называемых нагруженных категорий, морфиз­мам можно приписать вероятность. Для морфизма X → Y вероятность p(Y | X) — это вероятность того, что строка Y продолжает строку X (полученная, например, по частотным оценкам заданного корпуса текстов).
Рассмотрим теперь алгоритм обучения. В общем виде систему обучения с учителем (или с подкреплением) можно рассматривать как поиск «хорошей» аппроксимации функ­ции f : A → B. Для обучения система получает набор пар (a, b) ∈ A × B, относительно элементов которой предполага­ется, что они связаны искомой функцией, т.е. b ≈ f(a). Кроме того учитель определяет класс функций, в котором ищется аппроксимация. Формализуется этот выбор указанием про-
140
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]