Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Прикладная теория категорий. Монография
.pdf
Глава 3. Кластеризация
3.1. Схемы кластеризации
Многие схемы кластеризации определяются путем оптимизации целевой функции, определенной на разбиениях
базового множества конечного метрического пространства.
В этом разделе мы рассмотрим структуру для изучения того,
что происходит, когда мы вводим различные структурные
условия на схемы кластеризации, обладающие свойством
функториальности. Это позволяет сравнивать результаты
алгоритмов кластеризации при изменении набора данных,
например, путем добавления точек или применения к нему
функций.
Методы кластеризации играют очень важную роль в
различных областях анализа данных. Имеется много практически эффективных методов кластеризации. Как правило,
отправной точкой для кластеризации служит набор данных,
снабженный метрикой. Желательные свойства алгоритмов
кластеризации идут от практиков, у которых есть интуитивные представления о том, что представляет собой хорошая
кластеризация. Учитывая разнообразие задач и критериев,
необходимо теоретическое осмысление того, что такое кластеризация и какими свойствами она должна обладать. Ставшая
классической теорема Клейнберга [Kleinberg, 2002] о невозможности построения алгоритма кластеризации с тремя достаточно естественными условиями показывает, что поиск
свойств кластеризации является нетривиальной задачей.
Под схемой кластеризации Клейнберг понимает отображение C, которое сопоставляет каждому конечному метрическому пространству (X, d) некоторое разбиение этого
пространства P.
Укажем «естественные свойства», которыми по Клейнбергу должно обладать отображение C.
(SI) Масштабная инвариантность: C(X, d) = C(X, λ · d)
для любого положительного действительного числа λ.
71

(R) Сюръективность: для любого разбиения P множе-
ства X найдется метрика d, такая что C(X, d) = P.
(C)
Согласованность
: если сократить расстояния между
точками внутри кластера и увеличить расстояния между точками в разных кластерах, функция C даст тот же результат.
Приведем более точную формулировку свойства согла-
сованности. Пусть C(X, d) = P и метрика d′ на множестве X
такова, что d′(x, y) ≤ d(x, y), если x и y попадают в один кластер относительно P и d′(x, y) ≥ d(x, y) в противном случае.
Тогда C(X, d′) = P.
Условие согласованности может быть заменено более
слабым условием слабой согласованности.
(RC) Слабая согласованность: если сократить расстоя-
ния между точками внутри кластера и увеличить расстояния
между точками в разных кластерах, разбиение C(X, d′) должно
быть более мелким, чем разбиение C(X, d) или совпадать с ним.
Теорема о невозможности (Клейнберг). Если множе-
ство X содержит более одного элемента, то не существует схемы кластеризации, удовлетворяющей условиям (SI), (R), (RC).
Введем обозначения, которые потребуются для дальнейшего описания категорного подхода к определению схемы кластеризации.
Начнем с определения категории разбиений E.
Для конечного множества X обозначим через Eqr(X)
множество всех отношений эквивалентности на X, а через
Part(X) — множество всех разбиений множества X. Мно-
жества Eqr(X) и Part(X) находятся в естественном взаимно однозначном соответствии. Мы будем обозначать через
Pe ∈ Part(X) разбиение, соответствующее отношению экви-
валентности e ∈ Eqr(X), и через eP ∈ Eqr(X) — отношение эквивалентности, соответствующее разбиению P ∈ Part(X).
Пусть f : X → Y — отображение множеств. Если
e ∈ Eqr(Y), то f#ef ∈ Eqr(X), где f# — соответствие, обратное
отображению f, а композиция берется в категории бинарных отношений RelSet. Тем самым, получаем отображение
f* : Eqr(Y) → Eqr(X). Естественно, каждому разбиению Q
множества Y при этом соответствует разбиение P множества X. Отображение Q P множества Part(Y) в множество
Part(X) будем обозначать тем же символом f*. Кластерами
разбиения P = f*(Q) служат множества вида f–1(B), где B —
кластер разбиения Q.
72

3.2. Категория разбиений
Определим категорию разбиений Part. Объектами этой
категории служат пары вида (X, e), где X — множество и
e ∈ Eqr(X). Отображение множеств f: X → Y задает морфизм
f : (X, e
) → (Y, eY) в категории Part, если eX ; f ⊆ f ; eY. Это ус-
X
ловие равносильно тому, что eX ⊆ f ; eY ; f#. Последнее означает, что разбиение PeX более мелкое, чем f*(PeY), т.е. если
(x, x′) ∈ eX, то (f(x), f(x′)) ∈ eY.
Рассмотрим теперь категорию метрических пространств
Metr. Объекты этой категории метрические пространства
вида (X, d), где X — конечное множество, а d : X × X → R —
отображение, удовлетворяющее следующим условиям:
d(x, y) ≥ 0 и d(x, y) = 0 тогда и только тогда,
когда x = y ; d(x, y) = d(y, x)
для всех x, y ∈ X.
Заметим, что мы, вообще говоря, не требуем выполнения неравенства треугольника. Впрочем, в дальнейшем под
метрикой можно понимать как метрику в этом смысле, так и
метрику, удовлетворяющую неравенству треугольника.
Отображение множеств f : X → Y задает морфизм
f : (X, d
) → (Y, dY) в категории Metr, если dY(f(x), f(x′)) ≤
X
≤ dX(x, x′) для всех x, x′ ∈ X.
Для δ > 0 пусть (B, dδ) — метрическое пространство, состоящее из двух точек, расстояние между которыми равно δ.
Будем считать, что B = {0, 1} и dδ(0, 1) = δ.
Если x и x′ — точки метрического пространства (X, dX)
и dX(x, x′) ≤ δ, то отображение f(1) = x, f(0) = x′, задает морфизм f: (B, dδ) → (X, dX).
Пусть U ⊆ X и
γ = γ(d
, U) = min{dX(x, x′) | x ∈ U, x′ ∉ U}. (1)
X
Индикаторная функция множества U, т.е. отображение
χU : X → B, такое что χU(x) = 1, если x ∈ U, и χU(x) = 0, если
x ∉ U, задает морфизм метрических пространств χU : (X, dX) →
→ (B, dδ) при δ < γ.
Под функтором кластеризации мы будем понимать
функтор C : Metr → Part такой, что C(X, dX) = (X, eX) для
любого метрического пространства X и C(f) = f : C(X, dX) →
C(Y, dY) для любого морфизма метрических пространств
f : (X, dX) → (Y, dY).
73

Рассмотрим действие функторов кластеризации на
двоеточия вида (B, dδ). Предположим сначала, что C(B, dδ)
имеет два одноточечных кластера. При γ ≥ δ тождественное отображение idB: (B, dγ) → (B, dδ) является морфизмом
метрических пространств. Соответственно idB: C(B, dγ) →
→ C(B, dδ) — морфизм в категории Part. В C(B, dδ) элементы
0 и 1 попадают в разные кластеры. Значит, 0 и 1 попадают в
разные кластеры и в C(B, dγ).
Рассмотрим теперь случай, когда C(B, dδ) имеет один
кластер, содержащий и 0, и 1. Если γ ≤ δ, то idB: (B, dδ) →
→ (B, dγ) — морфизм в категории Metr, а idB: C(B, dδ) →
→ C(B, dγ) — морфизм в категории Part. Так как 0 и 1 эквива-
лентны в C(B, dδ), они должны быть эквивалентны и в C(B, dγ).
Таким образом, функтор кластеризации удовлетворя-
ет условию согласованности (С) применительно к пространствам вида (B, dδ).
Рассмотрим теперь более общий случай. Пусть (X, d) —
конечное метрическое пространство и U ⊆ X — кластер разбиения C(X, d).
Предположим, что d′ — такая метрика на X, что d′(x, y) ≤
≤ d(x, y), если x, y ∈ U и d′(x, y) = d(x, y) в противном случае.
Покажем, что в этом случае U является кластером разбиения
C(X, d′). Тождественное отображение задает морфизм метри-
ческих пространств idX : (X, d) → (X, d′) и соответственно мор-
физм idX : C(X, d) → C(X, d′) в категории разбиений. Отсюда
следует, что множество U содержится в некотором кластере
V разбиения C(X, d′). Значение величины, γ = γ(d, U) определенно формулой (1) и, как легко видеть, совпадает с γ(d′, U).
Следовательно, χU : (X, d′) → (B, dγ) — морфизм метрических
пространств, а χU : C(X, d′) → C(B, dγ) — морфизм разбиений.
Отсюда следует, что V ⊆ χ
–1
(1) = U. Значит, U является кла-
U
стером в C(X, d′). Таким образом, разбиения C(X, d) и C(X, d′)
в этом случае совпадают.
Пусть теперь, что d′ — такая метрика на X, что d′(x, y) ≥
≥ d(x, y), если x и y принадлежат разным кластерам относительно C(X, d). Тогда idX : (X, d′) → (X, d), а с ним и
idX : C(X, d′) → C(X, d) — морфизмы соответственно в Metr и
Part. По определению в этом случае разбиение C(X, d′) долж-
но быть более мелким или таким же как C(X, d).
74

Комбинируя приведенные рассуждения, можно сделать
вывод, что любой функтор кластеризации удовлетворяет условию слабой согласованности (RC) из теоремы Клейнберга.
Пусть (X, dX) — метрическое пространство. Для каждого δ ≥ 0 определим отношение δ-соседства cδX, считая, что
(x, x′) ∈ cδ, если dX(x, x′) ≤ δ. Обозначим через ~δX транзитивное замыкание отношения cδX. Очевидно, ~δX — отношение
эквивалентности на X. Соответствующее разбиение множества X обозначим через PX(δ). Заметим, что если точки
пространства X принадлежат разным кластерам разбиения
PX(δ), расстояние между ними превосходит величину δ.
Зададим функтор Vδ: Metr → Part, δ ≥ 0, полагая
Vδ(X, dX) = (X, ~dX). Если f: (X, dX) → (Y, dY) в категории
Metr, то из dX(x, x′) ≤ δ следует, что dY(f(x), f(x′)) ≤ δ. Это оз-
начает, что c
~δX ⊆ f ; ~
; f ⊆ f ; cdY, откуда cdX ⊆ f; cdY; f#. Но тогда и
δX
; f#. Это означает, что f : (X, ~δX) → (Y, ~δY) явля-
δY
ется морфизмом в Part.
В дальнейшем, если ясно, о каком множестве X идет
речь, мы будем писать просто ~δ и аналогично в других подобных случаях.
При δ = 0 точки x и x′ связаны отношением эквивалентности ~δ, только если x = x′. Таким образом, ~0 = ΔX — диагональ в X × X, и кластеризация V0(X, dX) оказывается дискретной, т.е. все кластеры одноточечные множества. Если δ
больше или равно диаметру пространства X, то ~δ = X × X и
кластеризация V0(X, dX) тривиальная, содержит единственный кластер, совпадающий с X.
Назовем функтор кластеризации C : Metr → Part завер-
шенным, если он обладает следующим свойством.
(Exci) Пусть C(X, dX) = (X, eX) и U ⊆ X — кластер относительно eX и dU — сужение метрики dX на U. Тогда применительно к (U, dU) функтор C дает тривиальный результат,
так что C(U, dU) = (U, U × U).
Таким образом, завершенность функтора кластеризации означает, что после того, как в конечном метрическом
пространстве выделены кластеры, применение той же схемы
кластеризации к полученным кластерам не приводит к дальнейшему дроблению.
Непосредственно из определений следует, что функтор
кластеризации вида Vδ : Metr → Par является завершенным.
75

Теорема 1. Предположим, что для функтора кластери-
зации C: Metr → Part существует такое число γ > 0, что
C(B, dδ) тривиально (0 и 1 попадают в один кластер) при
всех 0 ≤ δ ≤ γ;
C(B, dδ) дискретно (0 и 1 в разных кластерах) при всех
δ > γ.
Тогда C = Vγ.
Доказательство. Пусть C(X, dX) = (X, e) и Vγ(X, dX) =
= (X, ~γ). Покажем сначала, что если расстояние между двумя
точками x и y пространства X не превосходит γ, то (x, y) ∈ e. Это
легко следует из функториальности кластеризации C. В самом
деле, зададим отображение f: (B, dγ) → (X, dX), полагая f(0) = x,
f(1) = y. Так как C(f): C(B, dγ) → (X, e) — морфизм в категории
Part, а 0 и 1 эквивалентны в C(B, dγ), точки x и y должны быть
эквивалентны в (X, e). Таким образом, cgX ⊆ e. Ну, а тогда и
~γ
⊆ e. Докажем обратное включение. Предположим, что точки
x и y находятся в разных кластерах относительно ~γ, и пока-
жем, что они попадают в разные кластеры относительно e. Обозначим через x кластер относительно ~γ, содержащий точку x.
Если точка v не входит в кластер x, то ее расстояние до любой
точки этого кластера больше, чем γ. Пусть
δ = min {dX(x′, v) | x′ ∈ x, v ∈ X \ x}.
Так как X конечно, в силу сделанного замечания, δ > γ.
Зададим отображение f: X → B, полагая f(v) = 1, если v ∈ x
и f(v) = 0, если v ∈ X \ x
. Легко видеть, что при отображении f
расстояние между точками не возрастает, так что f : (X, dX) →
δ
→ (B, d
ение C(B, d
) — морфизм в категории Metr. Так как δ > γ, разби-
δ
) дискретно, при этом f(x) = 1 и f(y) = 0. Значит,
x и y находятся в разных кластерах относительно e.
Для λ > 0 определим функтор масштабирования
Sλ : Metr → Metr, полагая
S
(X, dX) = (X, λ · dX) и Sλ(f) = f: (X, λ · dX) → (Y, λ · dY),
λ
если (X, d
) — объект, а f: (X, dX) → (Y, dY) — морфизм кате-
X
гории Metr.
Инвариантность функтора кластеризации C: Metr → Part
относительно масштабирования означает, что C Sλ = C для
любого λ > 0.
Теорема 2. Функтор кластеризации C : Metr → Part, ин-
вариантный относительно масштабирования, дает тривиальную кластеризацию.
,
76

Доказательство. Пусть (B, d1) — двоеточие, в котором
расстояние между 0 и 1 равно 1. Любое разбиение двоеточия
содержит либо один, либо два кластера. Более того, так как
C(B, dδ) = (C Sδ)(B, d1) в силу масштабной инвариантности,
то двоеточие с любой метрикой приводит к той же кластеризации, что и (B, d1).
Рассмотрим каждый из этих случаев.
Начнем со случая, когда C(B, d1) имеет один кластер.
Пусть (X, dX) — конечное метрическое пространство и x,
x′ ∈ X — произвольная пара точек. Покажем, что x и x′ бу-
дут эквивалентны в C(X, dX). Пусть δ = dX(x, x′). Не теряя
общности, можно считать, что x ≠ x′ и δ > 0. Отображение
f : B → X, при котором f(1) = x и f(0) = x′, задает морфизм
f : (B, dδ) → (X, dX) в категории метрических пространств.
Но тогда f : C(B, dδ) → C(X, dX) — морфизм в категории разбиений. Так как 0 и 1 эквивалентны в C(B, dδ) то x и x′ будут
эквивалентны в C(X, dX).
Предположим теперь, что C(B, d1) имеет два кластера
(0 и 1 не эквивалентны). Пусть (X, dX) — конечное метрическое пространство, и x ∈ X. Покажем, кластер в C(X, dX), содержащий точку x, содержит одну лишь эту точку. Положим
δ = min {d
(x, v) | v ≠ x}.
X
Тогда отображение f : X → B, при котором f(x) = 1
и f(v) = 0, если v ≠ x, задает морфизм f : (X, d
) → (B, dδ) в
X
категории Metr. Так как f : C(X, dX) → C(B, dδ) — морфизм
в категории разбиений, разбиение в C(X, dX) более мелкое, чем разбиение, индуцированное из C(B, dδ). Поскольку f–1(1) = {x} — прообраз кластера из C(B, dδ), кластер в
C(B, dδ), содержащий x, — это {x}.
Описанный подход подсказывает возможные пути «обхода» теоремы о невозможности Клейнберга. Например,
можно рассматривать функторы кластеризации, заменяя
категорию Metr и/или категорию Part. Так в [Carlsson,
2013] помимо категории Metr в качестве входа для функтора кластеризации рассматриваются некоторые ее подкатегории, а категория Part обогащается так, чтобы более полно
учитывать отношения, возникающие между различными
кластеризациями.
77

Заключение
Методы кластеризации играют важную роль в различных областях анализа данных. Понимание структуры
наборов данных проецируется на структуру их исследования и позволяет формировать гипотезы, лежащие в основе
исследований. Существуют различные методы кластеризации, которые с успехом применяются при работе со многими
представляющими интерес наборами данных и считаются
важными методами исследовательского анализа данных.
Большинство методов начинается с набора данных,
снабженного метрикой. Желательные свойства алгоритмов
кластеризации должны соответствовать интуитивным представлениям о том, что представляет собой хорошая кластеризация. Применительно к задачам кластеризации теория
категорий решает две стандартных для применений этой
теории задачи. Первая — оснастить исследователей языком,
используя который можно формализовать представить интуитивные представления и представить их в рамках некоторого универсального контекста. Вторая — систематизировать
методы кластеризации, опираясь на свойства, представленные алгебраическим формализмом.
Конструкции, описанные в этой главе, связаны в основном с категориями Metr и Part, но могут быть перенесены
и на другие категории. Главные инварианты такого переноса — функториальность, т.е. структурная согласованность
категории данных и категории кластеров, и естественность,
которая проявляется в согласованности системы понятий.
Рассмотренная здесь общая концептуальная основа может быть полезным инструментом при изучении алгоритмов
кластеризации. Методы кластеризации, которые обладают
некоторой степенью функциональности, допускают возможность геометрического анализа наборов данных, что может
быть весьма ценным. Общая идея о том, что морфизмы между математическими объектами (вместе с понятием функториальности) оказывается полезной и в ситуации, когда требуется решить, по существу, статистическую задачу.
78

Глава 4. Категорные методы в теории формальных понятий
Теория формальных понятий создает удобную среду
для исследования структур, возникающих из отношения
«объект — свойство». Концепции теории формальных понятий в том или ином виде использовались с середины прошлого столетия и были оформлены в вид самостоятельного
раздела математики в работе [Wille, 1992].
Центральной идеей теории формальных понятий является построение иерархии формальных понятий, которые образуют целостную структуру, известную как решетка
понятий. Теория формальных понятий нашла множество
успешных применений в семантике, включая интеллектуальный анализ данных, машинное обучение, семантические сети, и лингвистику, см. [Ganter, 2024, Ganter, 2005,
Ferre, 2020, Кузнецов, 2001, Зуева 2024, Kuznetsov, 2017],
[Poelmans 2013, Galitsky 2019-2020].
Относительно недавно разработана Коке, Кларком и
Садрзаде [Coecke, 2010] категорная дистрибутивная композиционная модель значения, опирающаяся на теорию предгрупповых грамматик Ламбека [Lambek, 2008]. Эта модель
дает возможность определения значения предложения в терминах значений его отдельных слов, когда они существуют в
автономной категории. Ключевую роль при этом играет подходящая моноидальная категория, см. [Delpeuch, 2020].
Семантика предложения при таком подходе строится
на основе значений составляющих его слов. Предполагается,
что значения слов представлены в категории специального
вида. Как правило, значения слов представляются векторами конечномерных пространств. Вместе с тем достаточно
успешно, используются и другие категории [Balkir 2016,
Selinger 2007, Bolt 2019]. Ключевую роль во всех моделях
семантики играет моноидальная структура категорий, в которых формируется значение. Дистрибутивные модели основываются на гипотезе, утверждающей, что семантическое
значение лексической единицы формируется комбинаторно
79

теми текстами, в которых она встречается. Эти тексты выступают в роли своеобразных признаков. Непосредственная
комбинаторность служит основой для формирования семантики слов в больших языковых моделях. Более тонкая настройка требует типизации контекстов. На этом пути может
быть сформировано, например, формальное представление о
падежах т.п. (см. [Прикладная и компьютерная лингвистика, 2016]). Попытки такого рода предпринимались и в «докомпьютерную» эпоху, см. [Гисин, 1985]).
В этом разделе описаны моноидальные категории формальных контекстов, которые могут служить новыми моделями значения в рамках композиционной семантики.
4.1. Формальные понятия
С точки зрения традиционной логики каждое понятие
характеризуется своим содержанием (совокупностью отличительных признаков) и объемом (совокупностью всех объектов, обладающих отличительными признаками). Математическая модель формального понятия была предложена в
работах Вилле [Wille 1992] (см. также [Ganter 2024, 2016]).
Теория формальных понятий развивалась как в рамках
традиционной математики, так и в контексте многозначных
логик и теории категорий [Belohlavek 2000, 2004], [Harding
2014].
Введем необходимые определения.
Для произвольного множества X пусть P(X) обозначает
частично упорядоченное множество всех подмножеств (булеан) множества X. Пусть R ⊆ X × Y — бинарное отношение.
Для A ⊆ X обозначим через R(A) подмножество в Y, содержащее все такие y ∈ Y, что (a, y) ∈ R для некоторого a ∈ A.
Множество R({a}) будем обозначать просто R(a). Иногда вместо R ⊆ X × Y мы будем писать R: X Y, рассматривая R как
многозначное отображение.
Через R
†
будем обозначать обратное к R отношение.
Таким образом, R† ⊆ Y × X и (y, x) ∈ R† тогда и только тогда, когда (x, y) ∈ R. Отображение P(X) → P(Y), при котором
A R(A), имеет сопряженное отображение R•: P(Y) → P(X)
такое, что
•
R
(B) = {x ∈ X | R(x) ⊆ Y}.
80
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
