Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Прикладная теория категорий. Монография
.pdf
[RD.7] Пусть f : A → B. Тогда R[f] : A × B → A и
:.
[]
ιπ
BB
AB
:,
()
()
ιπ
AB
[]
[]
ιπ
R[R[f]] : (A × B) × A → A × B.
Обозначим через g композицию
f
RR
×
1
gA AABA AB B
AA B
× → ×
(
× → ×→
)
Тогда R[g] : (A × A) × B → A × A. Пусть h : (A × A) ×
× B → A — композиция R[g] с проекцией A × A → A на второй
множитель и R[h] : ((A × A) × B) × A → (A × A) × B. Наконец,
обозначим через k композицию
h
×
1
AA
kAAA AA BA AA
×
× → ×
)
(
×
(
×
)
×
→ ×
R[ ]
×→
)
(
где ι
: A × A → (A × A) × B — каноническое вложение.
A× A
Согласно [RD.7] k должно быть инвариантно относительно
перестановки двух последних множителей, т.е. k s = k, где
s : (A × A) × A → (A × A) × A — изоморфизм, переставляющий
второй и третий множитель, т.е. s = 〈π
100
, π
001
, π
010
〉.
Перечисленные условия можно интерпретировать следующим образом. В [RD.1] утверждается, что обратная производная от суммы является суммой обратных производных,
а в [RD.2] — что обратная производная является аддитивной
по своему второму аргументу. Условия [RD.3] и [RD.4] показывают, как вычисляются обратные производные от тождественных отображений и от кортежей. Условие [RD.5] —
это версия правила дифференцирования сложной функции.
Условие [RD.6] постулирует линейность реверсивной производной по своему второму аргументу. Условие [RD.7] говорит
о симметрии смешанных частных обратных производных.
Прямое дифференцирование может быть восстановлено по реверсивному. Если в категории C имеется реверсивное
дифференцирование R, то прямое дифференцирование можно получить, считая, что D[f] получается как композиция
RR
f
×
1
AA
D:
fAAABA AB B
× → ×
×
(
× → ×→
)
для любого морфизма f : A → B.
7.4. Категория обучаемых алгоритмов
Пусть C — аддитивная слева декартова моноидальная ка-
тегория с реверсивным дифференциальным комбинатором R.
Если f : A → B и соответственно R[f] : A × B → A,
то можно
151

заметить, что объекты A и B слева и объект A справа играют
∂
∂
∂
разную роль. Чтобы это подчеркнуть, мы будем иногда отмечать это различие штрихом и писать R[f] : A × B′ → A′.
Действие реверсивного дифференциального комбина-
тора на морфизм f : A → B приводит к появлению линзы:
R[ ]:f
f
A
B
←
A
→
(14)
B
или
R[ ]:f
A
f
A
B
←
′
→
′
B
с учетом сделанных замечаний.
Сопоставляя морфизму f: A → B линзу (14), получаем
функтор R : C → Lens(C) из категории C в категорию линз
над C. Чтобы в этом убедиться, достаточно доказать, что R
сохраняет единичные морфизмы и композицию, что непосредственно следует из условий [RD.3], [RD.5] и определения
единичных морфизмов и композиции в категории линз. Более
того, в силу условия [RD.3] функтор R слабо моноидален.
Пример 5. Рассмотрим гладкую функцию f : 2 →
(морфизм в категории конечномерных пространств и гладких отображений). Отображение R[f] : 2 × → 2 задается
формулой
R,,,,,.fxxy
(
[]
12
f
∂
x
∂
xx y
(
12
1
=
)
∂
f
∂
x
xx y
(
12
1
)
)
Если f : n → m — гладкое отображение, то, используя
векторные обозначения, для отображение R[f] : n × m → n
имеем R[f](x, y) = J(f)
x
=
′
i
∂
T
, так что
y
f
1
xy
() () ... ()
x
iimm
f
2
xy
+
1
x
∂
++
2
f
x
∂
xy
.
m
Используя конструкцию параметризации применительно к категориям C, Lens(C) и функтору R, получаем функтор
Param(R): Param(C) → Param(Lens(C)).
Пусть f : P × A → B — параметризованный морфизм, т.е.
морфизм из A в B в категории Param(C). Ему соответствует
параметризованная линза
152

f
≈⊗
[]
P
A
PA
⊗
P
A
=
×
PA
×
←
→
R[ ]
f
B
B
в категории Param(Lens(C)).
Категория параметризованных линз дает возможность
включить функцию потерь в общую схему обучения.
Под функцией потерь на объекте Y категории C будем
понимать морфизм вида
l : Y × Y → L, (15)
где L играет роль шкалы, а морфизм l рассматривается как
морфизм в категории Param(C).
Нейронная сеть со входом X и выходом Y имеет вид
f : P × X → Y. (16)
В категории параметризованных морфизмов функцию
потерь на выходе нейронной сети можно комбинировать с
этой нейронной сетью. Так, в категории Param(C) определена
композиция нейронной сети (16) с функцией потерь (15):
YP XYPX YY L
⊗
⊗→⊗ ⊗
(
)
(
Bf l
→ ⊗→
)
.
Чтобы использовать функцию потерь для репараметризации нейронной сети, нам нужно перейти в категорию
Param(Lens(C)), предварительно отобразив нейронную сеть
и функцию потерь в категорию линз с помощью функтора R. Это позволяет моделировать обратное распространение
ошибки и, в частности, метод градиентного спуска.
Для нейронной сети (16) в категории линз получаем
морфизм
X
X
R[ ]
←
→
Y
,
(17)
f
Y
P
⊗
P
f
а для функции потерь — морфизм
l
Y
Y
R
←
→
L
.
(18)
l
L
Y
⊗
Y
Рассматривая эти морфизмы как параметризованные
линзы и беря композицию в Param(Lens(C)), получаем
линзу
153

id f
[]
[]
[]
[]
()
⊗
Y
P
⊗
Y
X
⊗
P
X
←
id f
→
R
Y
⊗
⊗
Y
Y
Y
R.l
←
→
L
l
L
Темп обучения также может быть задан с помощью па-
раметризованной линзы:
1
⊗
1
α
←
L
L
→
1
,
(20)
!
1
L
где 1 — терминальный объект, !L: L → 1 — единственный
морфизм из L в терминальный объект, α : L = L × 1 → L —
морфизм, задающий скорость обучения.
Рассмотрим, как в рамках категории линз может быть
представлена оптимизация параметров нейронной сети.
Заметим сначала, что для любого объекта P категории
C имеем линзу
+
←
→
P
P
.
(21)
id
P
P
P
P
Пусть f : P × X → Y — параметризованный морфизм.
Тензорное произведение линзы (21) и единичной линзы
π
←
id
→
2
X
X
X
X
X
в категории линз имеет следующий вид
π
X
←
id id
X
→
+
P
⊗
P
×
P
2
×
PX
i
P
X
P
,
⊗
(22)
X
где
i : (P × X) × (P × X) → (P × P) × (X × X) —
канонический изоморфизм, [+] : P × P → P — сложение на P,
: X × X → X — проекция на второй множитель.
а π
2
Возьмем композицию линз (22) и (17). Получаем линзу вида
P
⊗
P
g
X
←
X
f
→
Y
,
(23)
Y
которую можно рассматривать как репараметризацию нейронной сети: линза (23) представляет собой параметризованный морфизм категории Param(Lens(C)).
154
(19)

Полная схема получается как композиция параметри-
yy
i
,,
=−
()
=
1
[]
()
()
[]
,,
()
()
wx
()
()
зованных линз (23), (18) и (20).
Пример 6. В описанную схему укладывается градиентный спуск, если в качестве C берется категория конечномерных пространств и гладких отображений.
Пусть f : k × n → m — гладкое отображение, где
k — пространство параметров. Зададим функцию потерь
l : m × m → как квадратичную ошибку:
m
ly
()
1
∑
2
2
y
i
i
где y — значение, выдаваемое сетью, а
Тогда
R[l] : m × m × → m ×
и
R:,, ,lyyv yyyyv
Далее, в качестве α : → возьмем постоянное отображение α(x) = c. Возвратное отображение композиции параметризованных отображений
m
m
действует из
Возвратное отображение (k × n) × (k × n) → k × n
линзы (22) таково, что (w, x, w′, x′) (w + w′, x′). Композиция
(23), (18) и (20) — это параметризованная линза вида
где * обозначает нульмерное пространство. Возвратное отображение
как раз и дает преобразование параметров
по методу градиентного спуска.
В категориях параметризованных линз могут быть
представлены и другие схемы обучения.
⊗
m ×
m
←
m
m в
m
⊗
m
m
× k × n → m × k ×
l
R
l
→
m ×
m так, что
k
k
⊗
y
−−
1
и
1
n
←
n
→
— эталонное значение
m
⋅
α
←
⊗
→
yy yyyyc
*
(24)
*
n
ywxy
1
!
1
L
−−
,, ,,
⋅
′
.
.
155

7.5. Развертывание нейронных сетей в категории
u
∂
()
u
av
∂
∂
конечномерных пространств
Вернемся к представлению категории обучаемых алгоритмов, описанной во вводном параграфе. Чтобы не загромождать обозначений, мы будем считать, что C — категория
объектами которой служат конечномерные пространства с
дифференцируемыми отображениями в качестве морфизмов.
Напомним, что в этом случае обучение поиску отображения из X в Y с учителем можно представить четверкой вида
(P, I, U, r), в которую входят пространство параметров, а
также функции имплементации, обновления и запроса:
I : P × X → Y;
U : P × X × Y → P;
r : P × X × Y → X.
Зададим положительное число (темп обучения) α и
дифференцируемую функцию потерь l : × → такую, что
l
функция
темп обучения и функцию ошибок, можно определить функцию потери:
что ее компоненты имеют вид
и определим функцию обновления параметров:
ных пространств и параметризованных гладких отображений.
Описанное соответствие задает функтор L из категории Param
в категорию обучаемых алгоритмов Learn.
ное отношение W ⊆ [n] × [m], где [n] = {1, ..., n}, [m] = {1, ..., m},
задающее связи между нейронами. Схема k-слойной нейронной сети типа (n, m) представляет собой упорядоченный набор слоев вида (n0, n1)(n1, n2) ... (n
156
fv
Далее, пусть f
Обозначим для краткости Param категорию конечномер-
Назовем слоем нейронной сети типа (n, m) ∈ × бинар-
∂
av
=
)
(
,
)
(
обратима при любом a. Используя
Lpxy lIpx y
,, ,,.
=
)
(
(x)
r(p, x, y) = f
U(p, x, y) = p – α ·
∑
: X → X — векторная функция, такая,
)
(
j
x
)
(
fv
)
(
i
(x)
(xE(p, x, y))
E(p, x, y).
x
k–1
j
j
l
=
, nk) с n = n0, m = mk.
,
(
i
)
. Положим

Категория нейронных сетей NNet — это категория, объекта-
im
()
()
()
=+
()
()
≤≤
1
ми которой служат множества [n], а схемы нейронных сетей
типа (n, m) являются морфизмами из [n] в [m]. Композиция
определяется конкатенацией. Единичный морфизм объекта
[n] — 0-слойная сеть, т.е., сеть, имеющая 0 слоев.
При заданной функции активации σ : → разверты-
вание нейронных сетей можно представить как функтор I
: NNet → Param. Объекту [n] он ставит в соответствие про-
странство n, слою W ⊆ [n] × [m] типа (n, m) — параметризо-
ванное отображение
такое, что
I(W) :
k
× n →
m
I Ww wx wx w
(
Чтобы получить образ k-слойной сети, нужно взять в
категории Param параметризованных отображений, соответствующих ее слоям композицию.
Композиция функтора I : NNet → Param с функтором
L : Param → Learn погружает категорию нейронных сетей в
категорию обучаемых алгоритмов.
Заключение
Алгоритмы обучения не изобретают новые свойства:
они просто учатся распознавать свойства данных. Это означает, что при рассмотрении данных просто как набора данных, происходит потеря информации. Один из путей сохранить часть теряемой информации — моделировать данные с
помощью категорий.
Идея о том, что можно использовать теорию категорий
для кодирования структурной информации набора данных,
а затем использовать ее для понимания того, как алгоритм
использует ее для изучения этих отношений, оказывается
достаточно плодотворной.
Для моделей «черного ящика», то есть моделей, внутреннюю работу которых мы не знаем и не понимаем, невозможно
предсказать возможные последствия. В некоторых случаях это
безобидно, но в других побочные эффекты могут быть катастрофическими. Необходимы методы, которые можно объяснить.
Математическое исследование моделей машинного обучения
,, .
)
)
(
ij ij
≤≤ ≤≤
,11
im jn
σ
∑
ij jji
157

ставит перед собой задачу найти ответ на вопрос, как и почему
обученные нейронные сети достигают таких впечатляющих
результатов. Один из подходов к решению этой задачи, который
предлагает теория категория, состоит в анализе структурной информации в наборе данных и отслеживании ее распространения
с помощью алгоритмов. Таким образом, при категорном взгляде
на теорию машинного обучения нас в основном интересует объяснимость моделей.
В этой главе мы сделали попытку показать, как с помощью языка теории категорий можно отобразить различные свойства набора данных. То, что в рамках категорного
формализма, можно сконструировать аналоги алгоритмов,
используемых в нейронных сетях, показывает, что этот язык
может быть использован как инструмент понимания интеллекта нейронных сетей.
158

Литература
Волкова Е.С., Гисин В.Б. Представление отношений толерантности и гранулирование информации в субструктурной логике
// Международная конференция по мягким вычислениям и измерениям. — ЛЭТИ, 2019. — Т. 1. — с. 16—18.
Волкова Е.С., Гисин В.Б. Представление отношений толерантности и гранулирование информации в субструктурной логике
// Международная конференция по мягким вычислениям и измерениям. — ЛЭТИ, 2019. — Т. 1. — с. 16—18.
Гисин В.Б., Цаленко М.Ш. Алгебраическая теория систем и ее
приложения. Ч.1-2. Системные исследования // Системные исследова
ния: Ежегодник. — М.: Наука, 1984. — c. 130—151, 1985. — с. 113—135.
Гисин В.Б. Нечеткие производные отношения и некоторые
их применения. Труды школы-семинара «Семиотические аспекты формализации интеллектуальной деятельности», Кутаиси,
АН груз. ССР, Тб.: 1985, с. 68—69.
Гротендик А. О некоторых вопросах гомологической алгебры. — М.: ИЛ, 1961, 176 с.
Джонстон П.Т. Теория топосов / Под ред. Ю.И. Манина. — М.: Наука, 1986. — 440 с.
Зуева М.М., Кузнецов С.О. Индексы интересности для построения нейронных сетей на основе решеток понятий // Автоматика и телемеханика. — 2024. — №. 3. — c. 51—59.
Кузнецов С. О. Автоматическое обучение на основе анализа
формальных понятий // Автоматика и телемеханика. — 2001. —
№. 10. — c. 3—27.
Маклейн С. Категории для работающего математика. — Физматлит, 2004. — 351 с.
Прикладная и компьютерная лингвистика. / Под ред.
И.С. Николаева, О.В. Матрениной, Т.М. Ландо. — М.: Ленанд,
2016. — 320 с.
Asperti A., Longo G. Categories, Types and Structures. — MIT
press, 1991. — pp. 1—300.
Asudani D.S., Nagwani N.K., Singh P. Impact of word embedding models on text analytics in deep learning environment: a review // Artificial intelligence review. — 2023. — V. 56. — №. 9. —
pp. 10345—10425.
Avigad J., Feferman S. Gödel’s functional (“Dialectica”) interpretation //Studies in Logic and the Foundations of Mathematics. —
Elsevier, 1998. — V. 137. — pp. 337—405.
-
159

Awodey S. Category theory. — OUP Oxford, 2010. — V. 52. —
305 p.
Balkir E., Sadrzadeh M., Coecke B. Distributional sentence entailment using density matrices // Topics in Theoretical Computer
Science: The First IFIP WG 1.8 International Conference, TTCS 2015,
Tehran, Iran, August 26—28, 2015, Revised Selected Papers 1. —
Springer International Publishing, 2016. — pp. 1—22.
Barr M., Wells C. Category theory for computing science. —
New York: Prentice Hall, 1990. — 550 p.
Belohlavek R. Similarity relations in concept lattices // Journal
of Logic and Computation. — 2000. — V. 10. — N 6. — pp. 823—845.
Belohlavek R. Fuzzy relational systems: foundations and principles / Springer Science & Business Media, 2012. — V. 20. — 370 p.
Bělohlavek R., Funioková T. Similarity and fuzzy tolerance
spaces // Journal of Logic and Computation. — 2004. — V. 14. N 6. —
pp. 827—855.
Bender E. M., Koller A. Climbing towards NLU: On meaning,
form, and understanding in the age of data // Proceedings of the 58th
annual meeting of the association for computational linguistics. —
2020. — pp. 5185—5198.
Blute R.F., Cockett J.R.B., Seely R.A.G. Cartesian differential categories // Theory and Applications of Categories. — 2009. — V. 22. —
№. 23. — pp. 622—672.
Bolt J., Coecke B., Genovese F., Lewis M., Marsden D., Piedeleu
R. Interacting conceptual spaces I: Grammatical composition of concepts // Conceptual spaces: Elaborations and applications. — 2019. —
pp. 151—181.
Bradley T. D., Terilla J., Vlassopoulos Y. An enriched category
theory of language: from syntax to semantics // La Matematica. —
2022. — V. 1. — №. 2. — pp. 551—580.
Bradley T. D., Vigneaux J. P. The Magnitude of Categories of Texts Enriched by Language Models // arXiv preprint arXiv:2501.06662. — 2025.
Breiner S., Subrahmanian E., Sriram R. D. Category theory //
Handbook of Model-Based Systems Engineering. — Cham: Springer
International Publishing, 2023. — pp. 1—41.
Calenko M. S., Gisin V. B., Raikov D. A. Ordered categories
with involution. — Instytut Matematyczny Polskiej Akademi Nauk
(Warszawa), 1984. — 114 p. — URL: http://eudml.org/doc/268528
Capucci M. Gavranović B., Hedges J., Rischel E. F. Towards
foundations of categorical cybernetics // Cybernetics, EPTCS 372,
2022. — pp. 235—248.
Carlsson G., Mémoli F. Classifying clustering schemes //Foundations of Computational Mathematics. — 2013. — V. 13. — pp. 221—252.
160
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
