Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Прикладная теория категорий. Монография

.pdf
Скачиваний:
0
Добавлен:
07.09.2026
Размер:
1 Мб
Скачать
☆
[RD.7] Пусть f : A → B. Тогда R[f] : A × B → A и
:.
[]
ιπ
BB
AB
:,
()
()
ιπ
AB
[]
[]
ιπ
R[R[f]] : (A × B) × A → A × B.
Обозначим через g композицию
f
RR
×
1
gA AABA AB B
AA B
× → ×
(
× → ×→
)

Тогда R[g] : (A × A) × B → A × A. Пусть h : (A × A) ×
× B → A — композиция R[g] с проекцией A × A → A на второй
множитель и R[h] : ((A × A) × B) × A → (A × A) × B. Наконец, обозначим через k композицию
h
×
1
AA
kAAA AA BA AA
×
× → ×
)
(
×
(
×
)
×
→ ×
R[ ]
×→
)
(
где ι
: A × A → (A × A) × B — каноническое вложение.
A× A
Согласно [RD.7] k должно быть инвариантно относительно перестановки двух последних множителей, т.е. k s = k, где s : (A × A) × A → (A × A) × A — изоморфизм, переставляющий второй и третий множитель, т.е. s = 〈π
100
, π
001
, π
010
〉.
Перечисленные условия можно интерпретировать сле­дующим образом. В [RD.1] утверждается, что обратная про­изводная от суммы является суммой обратных производных, а в [RD.2] — что обратная производная является аддитивной по своему второму аргументу. Условия [RD.3] и [RD.4] по­казывают, как вычисляются обратные производные от тож­дественных отображений и от кортежей. Условие [RD.5] — это версия правила дифференцирования сложной функции. Условие [RD.6] постулирует линейность реверсивной произ­водной по своему второму аргументу. Условие [RD.7] говорит о симметрии смешанных частных обратных производных.
Прямое дифференцирование может быть восстановле­но по реверсивному. Если в категории C имеется реверсивное дифференцирование R, то прямое дифференцирование мож­но получить, считая, что D[f] получается как композиция
RR
f
×
1
AA
D:
fAAABA AB B
× → ×
×
(
× → ×→
)

для любого морфизма f : A → B.
7.4. Категория обучаемых алгоритмов
Пусть C — аддитивная слева декартова моноидальная ка- тегория с реверсивным дифференциальным комбинатором R. Если f : A → B и соответственно R[f] : A × B → A,
то можно
151
заметить, что объекты A и B слева и объект A справа играют
∂
∂
∂
разную роль. Чтобы это подчеркнуть, мы будем иногда отме­чать это различие штрихом и писать R[f] : A × B′ → A′.
Действие реверсивного дифференциального комбина-
тора на морфизм f : A → B приводит к появлению линзы:
R[ ]:f
 
f
A
B
 
←
A
→
(14)
B
или
 
R[ ]:f
A
f
A
B
←
′
 
→
′
B
с учетом сделанных замечаний.
Сопоставляя морфизму f: A → B линзу (14), получаем
функтор R : C → Lens(C) из категории C в категорию линз над C. Чтобы в этом убедиться, достаточно доказать, что R сохраняет единичные морфизмы и композицию, что непо­средственно следует из условий [RD.3], [RD.5] и определения единичных морфизмов и композиции в категории линз. Более того, в силу условия [RD.3] функтор R слабо моноидален.
Пример 5. Рассмотрим гладкую функцию f : 2 →
(морфизм в категории конечномерных пространств и глад­ких отображений). Отображение R[f] : 2 × → 2 задается формулой
R,,,,,.fxxy
(
[]
12
f
∂
 
x
∂
xx y
(
12
1
=
)
∂
f
∂
x
xx y
(
12
1
)
)
 
Если f : n → m — гладкое отображение, то, используя векторные обозначения, для отображение R[f] : n × m → n имеем R[f](x, y) = J(f)
x
=
′
i
∂
T
, так что
y
f
1
xy
() () ... ()
x
iimm
f
2
xy
+
1
x
∂
++
2
f
x
∂
xy
.
m
Используя конструкцию параметризации применитель­но к категориям C, Lens(C) и функтору R, получаем функтор
Param(R): Param(C) → Param(Lens(C)).
Пусть f : P × A → B — параметризованный морфизм, т.е. морфизм из A в B в категории Param(C). Ему соответствует параметризованная линза
152
f
≈⊗
[]
P
A
PA
⊗
P
A
=
 
×
 
PA
×
←
 
→
R[ ]
f
B
B
в категории Param(Lens(C)).
Категория параметризованных линз дает возможность
включить функцию потерь в общую схему обучения.
Под функцией потерь на объекте Y категории C будем
понимать морфизм вида l : Y × Y → L, (15) где L играет роль шкалы, а морфизм l рассматривается как
морфизм в категории Param(C).
Нейронная сеть со входом X и выходом Y имеет вид
f : P × X → Y. (16)
В категории параметризованных морфизмов функцию потерь на выходе нейронной сети можно комбинировать с этой нейронной сетью. Так, в категории Param(C) определена композиция нейронной сети (16) с функцией потерь (15):
YP XYPX YY L
⊗
⊗→⊗ ⊗
(
)
(
Bf l
→ ⊗→
)
.
Чтобы использовать функцию потерь для репараме­тризации нейронной сети, нам нужно перейти в категорию Param(Lens(C)), предварительно отобразив нейронную сеть и функцию потерь в категорию линз с помощью функто­ра R. Это позволяет моделировать обратное распространение ошибки и, в частности, метод градиентного спуска.
Для нейронной сети (16) в категории линз получаем морфизм
 
X X
R[ ]
←
 
→
Y
,
(17)
f
Y
P
⊗
P
f
а для функции потерь — морфизм
l
Y
 
Y
R
←
 
→
L
.
(18)
l
L
Y
⊗
Y
Рассматривая эти морфизмы как параметризованные линзы и беря композицию в Param(Lens(C)), получаем линзу
153
id f
[]
[]
[]
[]
()
⊗
Y
P
⊗
Y
X
⊗
P
X
←
 
id f
→
R
Y
⊗
⊗
Y
 

Y Y
R.l
←
 
→
L
l
L
Темп обучения также может быть задан с помощью па-
раметризованной линзы:
1
⊗
1
α
←
L
L
→
1
,
(20)
!
1
L
где 1 — терминальный объект, !L: L → 1 — единственный морфизм из L в терминальный объект, α : L = L × 1 → L — морфизм, задающий скорость обучения.
Рассмотрим, как в рамках категории линз может быть
представлена оптимизация параметров нейронной сети.
Заметим сначала, что для любого объекта P категории
C имеем линзу
+
←
 
→
P
P
.
(21)
id
P
P
P
 
P
Пусть f : P × X → Y — параметризованный морфизм.
Тензорное произведение линзы (21) и единичной линзы
π
←
 
id
→
2
X
X
X
X
 
X
в категории линз имеет следующий вид
π
X
←
id id
X
→
+
P
⊗
P
×
P
2
×
PX
i
P
X

 
P
 
,
⊗
(22)
X
где
i : (P × X) × (P × X) → (P × P) × (X × X) —
канонический изоморфизм, [+] : P × P → P — сложение на P,
: X × X → X — проекция на второй множитель.
а π
2
Возьмем композицию линз (22) и (17). Получаем линзу вида
P
⊗
P
g
X
←
X
f
→
Y
,
(23)
Y
которую можно рассматривать как репараметризацию ней­ронной сети: линза (23) представляет собой параметризован­ный морфизм категории Param(Lens(C)).
154
(19)
Полная схема получается как композиция параметри-
yy
i

,,
=−
()
=
1
[]
()
()

[]

,,
()
()
wx
()
()
зованных линз (23), (18) и (20).
Пример 6. В описанную схему укладывается градиент­ный спуск, если в качестве C берется категория конечномер­ных пространств и гладких отображений.
Пусть f : k × n → m — гладкое отображение, где
k — пространство параметров. Зададим функцию потерь
l : m × m → как квадратичную ошибку:
m
ly
()
1
∑
2
2
y
i
i
где y — значение, выдаваемое сетью, а Тогда
R[l] : m × m × → m ×
и
R:,, ,lyyv yyyyv
Далее, в качестве α : → возьмем постоянное отобра­жение α(x) = c. Возвратное отображение композиции пара­метризованных отображений
m
m
действует из
Возвратное отображение (k × n) × (k × n) → k × n линзы (22) таково, что (w, x, w′, x′)  (w + w′, x′). Композиция (23), (18) и (20) — это параметризованная линза вида
где * обозначает нульмерное пространство. Возвратное ото­бражение
как раз и дает преобразование параметров по методу градиентного спуска.
В категориях параметризованных линз могут быть представлены и другие схемы обучения.
⊗
 
m ×
m
←
m
m в
m
⊗
m
m
× k × n → m × k ×
l
R
l
→
m ×
m так, что
k
k
 
⊗
 
 
y
−−
1
и
1
n
←
n
→
— эталонное значение
m
⋅
α
←
⊗
→
yy yyyyc
*
(24)
*
n
ywxy
1
!
1
L
−−
,, ,,
⋅
′
.
.
155
7.5. Развертывание нейронных сетей в категории
u
∂
()
u
av
∂
∂
конечномерных пространств
Вернемся к представлению категории обучаемых алго­ритмов, описанной во вводном параграфе. Чтобы не загро­мождать обозначений, мы будем считать, что C — категория объектами которой служат конечномерные пространства с дифференцируемыми отображениями в качестве морфизмов. Напомним, что в этом случае обучение поиску отображе­ния из X в Y с учителем можно представить четверкой вида (P, I, U, r), в которую входят пространство параметров, а также функции имплементации, обновления и запроса:
I : P × X → Y;
U : P × X × Y → P;
r : P × X × Y → X.
Зададим положительное число (темп обучения) α и дифференцируемую функцию потерь l : × →  такую, что
l
функция
темп обучения и функцию ошибок, можно определить функ­цию потери:
что ее компоненты имеют вид
и определим функцию обновления параметров:
ных пространств и параметризованных гладких отображений. Описанное соответствие задает функтор L из категории Param в категорию обучаемых алгоритмов Learn.
ное отношение W ⊆ [n] × [m], где [n] = {1, ..., n}, [m] = {1, ..., m}, задающее связи между нейронами. Схема k-слойной нейрон­ной сети типа (n, m) представляет собой упорядоченный на­бор слоев вида (n0, n1)(n1, n2) ... (n
156
fv
Далее, пусть f
Обозначим для краткости Param категорию конечномер-
Назовем слоем нейронной сети типа (n, m) ∈ ×  бинар-
∂
av
=
)
(
,
)
(
обратима при любом a. Используя
Lpxy lIpx y
,, ,,.
=
)
(
(x)
r(p, x, y) = f
U(p, x, y) = p – α ·
∑
: X → X — векторная функция, такая,
)
(
j
x
)
(
fv
)
(
i
(x)
(xE(p, x, y))
E(p, x, y).
x
k–1
j
j
l
=
, nk) с n = n0, m = mk.
,
(
i
)
. Положим
Категория нейронных сетей NNet — это категория, объекта-
im
()
()
()
=+
()
()
≤≤
1
ми которой служат множества [n], а схемы нейронных сетей типа (n, m) являются морфизмами из [n] в [m]. Композиция определяется конкатенацией. Единичный морфизм объекта [n] — 0-слойная сеть, т.е., сеть, имеющая 0 слоев.
При заданной функции активации σ : → разверты-
вание нейронных сетей можно представить как функтор I : NNet → Param. Объекту [n] он ставит в соответствие про- странство n, слою W ⊆ [n] × [m] типа (n, m) — параметризо- ванное отображение
такое, что
I(W) :
k
× n →
m
I Ww wx wx w
(
Чтобы получить образ k-слойной сети, нужно взять в
категории Param параметризованных отображений, соот­ветствующих ее слоям композицию.
Композиция функтора I : NNet → Param с функтором
L : Param → Learn погружает категорию нейронных сетей в категорию обучаемых алгоритмов.
Заключение
Алгоритмы обучения не изобретают новые свойства: они просто учатся распознавать свойства данных. Это озна­чает, что при рассмотрении данных просто как набора дан­ных, происходит потеря информации. Один из путей сохра­нить часть теряемой информации — моделировать данные с помощью категорий.
Идея о том, что можно использовать теорию категорий для кодирования структурной информации набора данных, а затем использовать ее для понимания того, как алгоритм использует ее для изучения этих отношений, оказывается достаточно плодотворной.
Для моделей «черного ящика», то есть моделей, внутрен­нюю работу которых мы не знаем и не понимаем, невозможно предсказать возможные последствия. В некоторых случаях это безобидно, но в других побочные эффекты могут быть катастро­фическими. Необходимы методы, которые можно объяснить. Математическое исследование моделей машинного обучения
,, .
)
)
(
ij ij
≤≤ ≤≤
,11
im jn
σ
∑
ij jji
157
ставит перед собой задачу найти ответ на вопрос, как и почему обученные нейронные сети достигают таких впечатляющих результатов. Один из подходов к решению этой задачи, который предлагает теория категория, состоит в анализе структурной ин­формации в наборе данных и отслеживании ее распространения с помощью алгоритмов. Таким образом, при категорном взгляде на теорию машинного обучения нас в основном интересует объ­яснимость моделей.
В этой главе мы сделали попытку показать, как с по­мощью языка теории категорий можно отобразить различ­ные свойства набора данных. То, что в рамках категорного формализма, можно сконструировать аналоги алгоритмов, используемых в нейронных сетях, показывает, что этот язык может быть использован как инструмент понимания интел­лекта нейронных сетей.
158
Литература
Волкова Е.С., Гисин В.Б. Представление отношений толе­рантности и гранулирование информации в субструктурной логике // Международная конференция по мягким вычислениям и изме­рениям. — ЛЭТИ, 2019. — Т. 1. — с. 16—18.
Волкова Е.С., Гисин В.Б. Представление отношений толе­рантности и гранулирование информации в субструктурной логике // Международная конференция по мягким вычислениям и изме­рениям. — ЛЭТИ, 2019. — Т. 1. — с. 16—18.
Гисин В.Б., Цаленко М.Ш. Алгебраическая теория систем и ее приложения. Ч.1-2. Системные исследования // Системные исследова ния: Ежегодник. — М.: Наука, 1984. — c. 130—151, 1985. — с. 113—135.
Гисин В.Б. Нечеткие производные отношения и некоторые их применения. Труды школы-семинара «Семиотические аспек­ты формализации интеллектуальной деятельности», Кутаиси, АН груз. ССР, Тб.: 1985, с. 68—69.
Гротендик А. О некоторых вопросах гомологической алге­бры. — М.: ИЛ, 1961, 176 с.
Джонстон П.Т. Теория топосов / Под ред. Ю.И. Мани­на. — М.: Наука, 1986. — 440 с.
Зуева М.М., Кузнецов С.О. Индексы интересности для по­строения нейронных сетей на основе решеток понятий // Автома­тика и телемеханика. — 2024. — №. 3. — c. 51—59.
Кузнецов С. О. Автоматическое обучение на основе анализа формальных понятий // Автоматика и телемеханика. — 2001. — №. 10. — c. 3—27.
Маклейн С. Категории для работающего математика. — Физ­матлит, 2004. — 351 с.
Прикладная и компьютерная лингвистика. / Под ред. И.С. Николаева, О.В. Матрениной, Т.М. Ландо. — М.: Ленанд,
2016. — 320 с.
Asperti A., Longo G. Categories, Types and Structures. — MIT press, 1991. — pp. 1—300.
Asudani D.S., Nagwani N.K., Singh P. Impact of word embed­ding models on text analytics in deep learning environment: a re­view // Artificial intelligence review. — 2023. — V. 56. — №. 9. — pp. 10345—10425.
Avigad J., Feferman S. Gödel’s functional (“Dialectica”) inter­pretation //Studies in Logic and the Foundations of Mathematics. — Elsevier, 1998. — V. 137. — pp. 337—405.
-
159
Awodey S. Category theory. — OUP Oxford, 2010. — V. 52. —
305 p.
Balkir E., Sadrzadeh M., Coecke B. Distributional sentence en­tailment using density matrices // Topics in Theoretical Computer Science: The First IFIP WG 1.8 International Conference, TTCS 2015, Tehran, Iran, August 26—28, 2015, Revised Selected Papers 1. — Springer International Publishing, 2016. — pp. 1—22.
Barr M., Wells C. Category theory for computing science. — New York: Prentice Hall, 1990. — 550 p.
Belohlavek R. Similarity relations in concept lattices // Journal of Logic and Computation. — 2000. — V. 10. — N 6. — pp. 823—845.
Belohlavek R. Fuzzy relational systems: foundations and prin­ciples / Springer Science & Business Media, 2012. — V. 20. — 370 p.
Bělohlavek R., Funioková T. Similarity and fuzzy tolerance spaces // Journal of Logic and Computation. — 2004. — V. 14. N 6. — pp. 827—855.
Bender E. M., Koller A. Climbing towards NLU: On meaning, form, and understanding in the age of data // Proceedings of the 58th annual meeting of the association for computational linguistics. —
2020. — pp. 5185—5198.
Blute R.F., Cockett J.R.B., Seely R.A.G. Cartesian differential cat­egories // Theory and Applications of Categories. — 2009. — V. 22. — №. 23. — pp. 622—672.
Bolt J., Coecke B., Genovese F., Lewis M., Marsden D., Piedeleu R. Interacting conceptual spaces I: Grammatical composition of con­cepts // Conceptual spaces: Elaborations and applications. — 2019. — pp. 151—181.
Bradley T. D., Terilla J., Vlassopoulos Y. An enriched category theory of language: from syntax to semantics // La Matematica. —
2022. — V. 1. — №. 2. — pp. 551—580.
Bradley T. D., Vigneaux J. P. The Magnitude of Catego­ries of Texts Enriched by Language Models // arXiv preprint arX­iv:2501.06662. — 2025.
Breiner S., Subrahmanian E., Sriram R. D. Category theory // Handbook of Model-Based Systems Engineering. — Cham: Springer International Publishing, 2023. — pp. 1—41.
Calenko M. S., Gisin V. B., Raikov D. A. Ordered categories with involution. — Instytut Matematyczny Polskiej Akademi Nauk (Warszawa), 1984. — 114 p. — URL: http://eudml.org/doc/268528
Capucci M. Gavranović B., Hedges J., Rischel E. F. Towards foundations of categorical cybernetics // Cybernetics, EPTCS 372,
2022. — pp. 235—248.
Carlsson G., Mémoli F. Classifying clustering schemes //Founda­tions of Computational Mathematics. — 2013. — V. 13. — pp. 221—252.
160
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]