Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Прикладная теория категорий. Монография

.pdf
Скачиваний:
0
Добавлен:
07.09.2026
Размер:
1 Мб
Скачать
☆
Глава 3. Кластеризация
3.1. Схемы кластеризации
Многие схемы кластеризации определяются путем оп­тимизации целевой функции, определенной на разбиениях базового множества конечного метрического пространства. В этом разделе мы рассмотрим структуру для изучения того, что происходит, когда мы вводим различные структурные условия на схемы кластеризации, обладающие свойством функториальности. Это позволяет сравнивать результаты алгоритмов кластеризации при изменении набора данных, например, путем добавления точек или применения к нему функций.
Методы кластеризации играют очень важную роль в различных областях анализа данных. Имеется много прак­тически эффективных методов кластеризации. Как правило, отправной точкой для кластеризации служит набор данных, снабженный метрикой. Желательные свойства алгоритмов кластеризации идут от практиков, у которых есть интуитив­ные представления о том, что представляет собой хорошая кластеризация. Учитывая разнообразие задач и критериев, необходимо теоретическое осмысление того, что такое класте­ризация и какими свойствами она должна обладать. Ставшая классической теорема Клейнберга [Kleinberg, 2002] о невоз­можности построения алгоритма кластеризации с тремя до­статочно естественными условиями показывает, что поиск свойств кластеризации является нетривиальной задачей.
Под схемой кластеризации Клейнберг понимает ото­бражение C, которое сопоставляет каждому конечному ме­трическому пространству (X, d) некоторое разбиение этого пространства P.
Укажем «естественные свойства», которыми по Клейн­бергу должно обладать отображение C.
(SI) Масштабная инвариантность: C(X, d) = C(X, λ · d) для любого положительного действительного числа λ.
71
(R) Сюръективность: для любого разбиения P множе-
ства X найдется метрика d, такая что C(X, d) = P.
(C)
Согласованность
: если сократить расстояния между точками внутри кластера и увеличить расстояния между точ­ками в разных кластерах, функция C даст тот же результат.
Приведем более точную формулировку свойства согла-
сованности. Пусть C(X, d) = P и метрика d′ на множестве X такова, что d′(x, y) ≤ d(x, y), если x и y попадают в один кла­стер относительно P и d′(x, y) ≥ d(x, y) в противном случае. Тогда C(X, d′) = P.
Условие согласованности может быть заменено более
слабым условием слабой согласованности.
(RC) Слабая согласованность: если сократить расстоя-
ния между точками внутри кластера и увеличить расстояния между точками в разных кластерах, разбиение C(X, d′) должно быть более мелким, чем разбиение C(X, d) или совпадать с ним.
Теорема о невозможности (Клейнберг). Если множе-
ство X содержит более одного элемента, то не существует схе­мы кластеризации, удовлетворяющей условиям (SI), (R), (RC).
Введем обозначения, которые потребуются для даль­нейшего описания категорного подхода к определению схе­мы кластеризации.
Начнем с определения категории разбиений E.
Для конечного множества X обозначим через Eqr(X) множество всех отношений эквивалентности на X, а через Part(X) — множество всех разбиений множества X. Мно- жества Eqr(X) и Part(X) находятся в естественном взаим­но однозначном соответствии. Мы будем обозначать через
Pe ∈ Part(X) разбиение, соответствующее отношению экви-
валентности e ∈ Eqr(X), и через eP ∈ Eqr(X) — отношение эк­вивалентности, соответствующее разбиению P ∈ Part(X).
Пусть f : X → Y — отображение множеств. Если e ∈ Eqr(Y), то f#ef ∈ Eqr(X), где f# — соответствие, обратное отображению f, а композиция берется в категории бинар­ных отношений RelSet. Тем самым, получаем отображение
f* : Eqr(Y) → Eqr(X). Естественно, каждому разбиению Q
множества Y при этом соответствует разбиение P множе­ства X. Отображение Q P множества Part(Y) в множество Part(X) будем обозначать тем же символом f*. Кластерами разбиения P = f*(Q) служат множества вида f–1(B), где B — кластер разбиения Q.
72
3.2. Категория разбиений
Определим категорию разбиений Part. Объектами этой
категории служат пары вида (X, e), где X — множество и
e ∈ Eqr(X). Отображение множеств f: X → Y задает морфизм f : (X, e
) → (Y, eY) в категории Part, если eX ; f ⊆ f ; eY. Это ус-
X
ловие равносильно тому, что eX ⊆ f ; eY ; f#. Последнее озна­чает, что разбиение PeX более мелкое, чем f*(PeY), т.е. если (x, x′) ∈ eX, то (f(x), f(x′)) ∈ eY.
Рассмотрим теперь категорию метрических пространств
Metr. Объекты этой категории метрические пространства вида (X, d), где X — конечное множество, а d : X × X → R — отображение, удовлетворяющее следующим условиям:
d(x, y) ≥ 0 и d(x, y) = 0 тогда и только тогда,
когда x = y ; d(x, y) = d(y, x)
для всех x, y ∈ X.
Заметим, что мы, вообще говоря, не требуем выполне­ния неравенства треугольника. Впрочем, в дальнейшем под метрикой можно понимать как метрику в этом смысле, так и метрику, удовлетворяющую неравенству треугольника.
Отображение множеств f : X → Y задает морфизм f : (X, d
) → (Y, dY) в категории Metr, если dY(f(x), f(x′)) ≤
X
≤ dX(x, x′) для всех x, x′ ∈ X.
Для δ > 0 пусть (B, dδ) — метрическое пространство, со­стоящее из двух точек, расстояние между которыми равно δ. Будем считать, что B = {0, 1} и dδ(0, 1) = δ.
Если x и x′ — точки метрического пространства (X, dX) и dX(x, x′) ≤ δ, то отображение f(1) = x, f(0) = x′, задает мор­физм f: (B, dδ) → (X, dX).
Пусть U ⊆ X и γ = γ(d
, U) = min{dX(x, x′) | x ∈ U, x′ ∉ U}. (1)
X
Индикаторная функция множества U, т.е. отображение χU : X → B, такое что χU(x) = 1, если x ∈ U, и χU(x) = 0, если x ∉ U, задает морфизм метрических пространств χU : (X, dX) →
→ (B, dδ) при δ < γ.
Под функтором кластеризации мы будем понимать функтор C : Metr → Part такой, что C(X, dX) = (X, eX) для любого метрического пространства X и C(f) = f : C(X, dX) →
C(Y, dY) для любого морфизма метрических пространств f : (X, dX) → (Y, dY).
73
Рассмотрим действие функторов кластеризации на
двоеточия вида (B, dδ). Предположим сначала, что C(B, dδ) имеет два одноточечных кластера. При γ ≥ δ тождествен­ное отображение idB: (B, dγ) → (B, dδ) является морфизмом метрических пространств. Соответственно idB: C(B, dγ) → → C(B, dδ) — морфизм в категории Part. В C(B, dδ) элементы 0 и 1 попадают в разные кластеры. Значит, 0 и 1 попадают в разные кластеры и в C(B, dγ).
Рассмотрим теперь случай, когда C(B, dδ) имеет один
кластер, содержащий и 0, и 1. Если γ ≤ δ, то idB: (B, dδ) →
→ (B, dγ) — морфизм в категории Metr, а idB: C(B, dδ) → → C(B, dγ) — морфизм в категории Part. Так как 0 и 1 эквива-
лентны в C(B, dδ), они должны быть эквивалентны и в C(B, dγ).
Таким образом, функтор кластеризации удовлетворя-
ет условию согласованности (С) применительно к простран­ствам вида (B, dδ).
Рассмотрим теперь более общий случай. Пусть (X, d) —
конечное метрическое пространство и U ⊆ X — кластер раз­биения C(X, d).
Предположим, что d′ — такая метрика на X, что d′(x, y) ≤
≤ d(x, y), если x, y ∈ U и d′(x, y) = d(x, y) в противном случае. Покажем, что в этом случае U является кластером разбиения C(X, d′). Тождественное отображение задает морфизм метри- ческих пространств idX : (X, d) → (X, d′) и соответственно мор- физм idX : C(X, d) → C(X, d′) в категории разбиений. Отсюда следует, что множество U содержится в некотором кластере V разбиения C(X, d′). Значение величины, γ = γ(d, U) опреде­ленно формулой (1) и, как легко видеть, совпадает с γ(d′, U). Следовательно, χU : (X, d′) → (B, dγ) — морфизм метрических пространств, а χU : C(X, d′) → C(B, dγ) — морфизм разбиений. Отсюда следует, что V ⊆ χ
–1
(1) = U. Значит, U является кла-
U
стером в C(X, d′). Таким образом, разбиения C(X, d) и C(X, d′) в этом случае совпадают.
Пусть теперь, что d′ — такая метрика на X, что d′(x, y) ≥
≥ d(x, y), если x и y принадлежат разным кластерам от­носительно C(X, d). Тогда idX : (X, d′) → (X, d), а с ним и
idX : C(X, d′) → C(X, d) — морфизмы соответственно в Metr и Part. По определению в этом случае разбиение C(X, d′) долж-
но быть более мелким или таким же как C(X, d).
74
Комбинируя приведенные рассуждения, можно сделать вывод, что любой функтор кластеризации удовлетворяет ус­ловию слабой согласованности (RC) из теоремы Клейнберга.
Пусть (X, dX) — метрическое пространство. Для каж­дого δ ≥ 0 определим отношение δ-соседства cδX, считая, что (x, x′) ∈ cδ, если dX(x, x′) ≤ δ. Обозначим через ~δX транзитив­ное замыкание отношения cδX. Очевидно, ~δX — отношение эквивалентности на X. Соответствующее разбиение мно­жества X обозначим через PX(δ). Заметим, что если точки пространства X принадлежат разным кластерам разбиения
PX(δ), расстояние между ними превосходит величину δ.
Зададим функтор Vδ: Metr → Part, δ ≥ 0, полагая Vδ(X, dX) = (X, ~dX). Если f: (X, dX) → (Y, dY) в категории Metr, то из dX(x, x′) ≤ δ следует, что dY(f(x), f(x′)) ≤ δ. Это оз-
начает, что c ~δX ⊆ f ; ~
; f ⊆ f ; cdY, откуда cdX ⊆ f; cdY; f#. Но тогда и
δX
; f#. Это означает, что f : (X, ~δX) → (Y, ~δY) явля-
δY
ется морфизмом в Part.
В дальнейшем, если ясно, о каком множестве X идет речь, мы будем писать просто ~δ и аналогично в других по­добных случаях.
При δ = 0 точки x и x′ связаны отношением эквивалент­ности ~δ, только если x = x′. Таким образом, ~0 = ΔX — диа­гональ в X × X, и кластеризация V0(X, dX) оказывается дис­кретной, т.е. все кластеры одноточечные множества. Если δ больше или равно диаметру пространства X, то ~δ = X × X и кластеризация V0(X, dX) тривиальная, содержит единствен­ный кластер, совпадающий с X.
Назовем функтор кластеризации C : Metr → Part завер- шенным, если он обладает следующим свойством.
(Exci) Пусть C(X, dX) = (X, eX) и U ⊆ X — кластер отно­сительно eX и dU — сужение метрики dX на U. Тогда приме­нительно к (U, dU) функтор C дает тривиальный результат, так что C(U, dU) = (U, U × U).
Таким образом, завершенность функтора кластериза­ции означает, что после того, как в конечном метрическом пространстве выделены кластеры, применение той же схемы кластеризации к полученным кластерам не приводит к даль­нейшему дроблению.
Непосредственно из определений следует, что функтор кластеризации вида Vδ : Metr → Par является завершенным.
75
Теорема 1. Предположим, что для функтора кластери-
зации C: Metr → Part существует такое число γ > 0, что
C(B, dδ) тривиально (0 и 1 попадают в один кластер) при
всех 0 ≤ δ ≤ γ;
C(B, dδ) дискретно (0 и 1 в разных кластерах) при всех
δ > γ.
Тогда C = Vγ. Доказательство. Пусть C(X, dX) = (X, e) и Vγ(X, dX) =
= (X, ~γ). Покажем сначала, что если расстояние между двумя точками x и y пространства X не превосходит γ, то (x, y) ∈ e. Это легко следует из функториальности кластеризации C. В самом деле, зададим отображение f: (B, dγ) → (X, dX), полагая f(0) = x,
f(1) = y. Так как C(f): C(B, dγ) → (X, e) — морфизм в категории Part, а 0 и 1 эквивалентны в C(B, dγ), точки x и y должны быть
эквивалентны в (X, e). Таким образом, cgX ⊆ e. Ну, а тогда и ~γ
⊆ e. Докажем обратное включение. Предположим, что точки
x и y находятся в разных кластерах относительно ~γ, и пока-
жем, что они попадают в разные кластеры относительно e. Обо­значим через x кластер относительно ~γ, содержащий точку x. Если точка v не входит в кластер x, то ее расстояние до любой точки этого кластера больше, чем γ. Пусть
δ = min {dX(x′, v) | x′ ∈ x, v ∈ X \ x}.
Так как X конечно, в силу сделанного замечания, δ > γ. Зададим отображение f: X → B, полагая f(v) = 1, если v ∈ x и f(v) = 0, если v ∈ X \ x
. Легко видеть, что при отображении f
расстояние между точками не возрастает, так что f : (X, dX) →
δ
→ (B, d
ение C(B, d
) — морфизм в категории Metr. Так как δ > γ, разби-
δ
) дискретно, при этом f(x) = 1 и f(y) = 0. Значит,
x и y находятся в разных кластерах относительно e.
Для λ > 0 определим функтор масштабирования
Sλ : Metr → Metr, полагая
S
(X, dX) = (X, λ · dX) и Sλ(f) = f: (X, λ · dX) → (Y, λ · dY),
λ
если (X, d
) — объект, а f: (X, dX) → (Y, dY) — морфизм кате-
X
гории Metr.
Инвариантность функтора кластеризации C: Metr → Part относительно масштабирования означает, что C Sλ = C для любого λ > 0.
Теорема 2. Функтор кластеризации C : Metr → Part, ин- вариантный относительно масштабирования, дает тривиаль­ную кластеризацию.
,
76
Доказательство. Пусть (B, d1) — двоеточие, в котором
расстояние между 0 и 1 равно 1. Любое разбиение двоеточия содержит либо один, либо два кластера. Более того, так как C(B, dδ) = (C Sδ)(B, d1) в силу масштабной инвариантности, то двоеточие с любой метрикой приводит к той же кластери­зации, что и (B, d1).
Рассмотрим каждый из этих случаев. Начнем со случая, когда C(B, d1) имеет один кластер.
Пусть (X, dX) — конечное метрическое пространство и x, x′ ∈ X — произвольная пара точек. Покажем, что x и x′ бу- дут эквивалентны в C(X, dX). Пусть δ = dX(x, x′). Не теряя общности, можно считать, что x ≠ x′ и δ > 0. Отображение
f : B → X, при котором f(1) = x и f(0) = x′, задает морфизм f : (B, dδ) → (X, dX) в категории метрических пространств.
Но тогда f : C(B, dδ) → C(X, dX) — морфизм в категории раз­биений. Так как 0 и 1 эквивалентны в C(B, dδ) то x и x′ будут эквивалентны в C(X, dX).
Предположим теперь, что C(B, d1) имеет два кластера
(0 и 1 не эквивалентны). Пусть (X, dX) — конечное метриче­ское пространство, и x ∈ X. Покажем, кластер в C(X, dX), со­держащий точку x, содержит одну лишь эту точку. Положим
δ = min {d
(x, v) | v ≠ x}.
X
Тогда отображение f : X → B, при котором f(x) = 1
и f(v) = 0, если v ≠ x, задает морфизм f : (X, d
) → (B, dδ) в
X
категории Metr. Так как f : C(X, dX) → C(B, dδ) — морфизм в категории разбиений, разбиение в C(X, dX) более мел­кое, чем разбиение, индуцированное из C(B, dδ). Посколь­ку f–1(1) = {x} — прообраз кластера из C(B, dδ), кластер в C(B, dδ), содержащий x, — это {x}.
Описанный подход подсказывает возможные пути «об­хода» теоремы о невозможности Клейнберга. Например, можно рассматривать функторы кластеризации, заменяя категорию Metr и/или категорию Part. Так в [Carlsson, 2013] помимо категории Metr в качестве входа для функто­ра кластеризации рассматриваются некоторые ее подкате­гории, а категория Part обогащается так, чтобы более полно учитывать отношения, возникающие между различными кластеризациями.
77
Заключение
Методы кластеризации играют важную роль в раз­личных областях анализа данных. Понимание структуры наборов данных проецируется на структуру их исследова­ния и позволяет формировать гипотезы, лежащие в основе исследований. Существуют различные методы кластериза­ции, которые с успехом применяются при работе со многими представляющими интерес наборами данных и считаются важными методами исследовательского анализа данных.
Большинство методов начинается с набора данных, снабженного метрикой. Желательные свойства алгоритмов кластеризации должны соответствовать интуитивным пред­ставлениям о том, что представляет собой хорошая класте­ризация. Применительно к задачам кластеризации теория категорий решает две стандартных для применений этой теории задачи. Первая — оснастить исследователей языком, используя который можно формализовать представить инту­итивные представления и представить их в рамках некоторо­го универсального контекста. Вторая — систематизировать методы кластеризации, опираясь на свойства, представлен­ные алгебраическим формализмом.
Конструкции, описанные в этой главе, связаны в основ­ном с категориями Metr и Part, но могут быть перенесены и на другие категории. Главные инварианты такого перено­са — функториальность, т.е. структурная согласованность категории данных и категории кластеров, и естественность, которая проявляется в согласованности системы понятий.
Рассмотренная здесь общая концептуальная основа мо­жет быть полезным инструментом при изучении алгоритмов кластеризации. Методы кластеризации, которые обладают некоторой степенью функциональности, допускают возмож­ность геометрического анализа наборов данных, что может быть весьма ценным. Общая идея о том, что морфизмы меж­ду математическими объектами (вместе с понятием функто­риальности) оказывается полезной и в ситуации, когда тре­буется решить, по существу, статистическую задачу.
78
Глава 4. Категорные методы в теории формальных понятий
Теория формальных понятий создает удобную среду для исследования структур, возникающих из отношения «объект — свойство». Концепции теории формальных по­нятий в том или ином виде использовались с середины про­шлого столетия и были оформлены в вид самостоятельного раздела математики в работе [Wille, 1992].
Центральной идеей теории формальных понятий яв­ляется построение иерархии формальных понятий, кото­рые образуют целостную структуру, известную как решетка понятий. Теория формальных понятий нашла множество успешных применений в семантике, включая интеллекту­альный анализ данных, машинное обучение, семантиче­ские сети, и лингвистику, см. [Ganter, 2024, Ganter, 2005, Ferre, 2020, Кузнецов, 2001, Зуева 2024, Kuznetsov, 2017], [Poelmans 2013, Galitsky 2019-2020].
Относительно недавно разработана Коке, Кларком и Садрзаде [Coecke, 2010] категорная дистрибутивная компо­зиционная модель значения, опирающаяся на теорию пред­групповых грамматик Ламбека [Lambek, 2008]. Эта модель дает возможность определения значения предложения в тер­минах значений его отдельных слов, когда они существуют в автономной категории. Ключевую роль при этом играет под­ходящая моноидальная категория, см. [Delpeuch, 2020].
Семантика предложения при таком подходе строится на основе значений составляющих его слов. Предполагается, что значения слов представлены в категории специального вида. Как правило, значения слов представляются векто­рами конечномерных пространств. Вместе с тем достаточно успешно, используются и другие категории [Balkir 2016, Selinger 2007, Bolt 2019]. Ключевую роль во всех моделях семантики играет моноидальная структура категорий, в ко­торых формируется значение. Дистрибутивные модели ос­новываются на гипотезе, утверждающей, что семантическое значение лексической единицы формируется комбинаторно
79
теми текстами, в которых она встречается. Эти тексты вы­ступают в роли своеобразных признаков. Непосредственная комбинаторность служит основой для формирования семан­тики слов в больших языковых моделях. Более тонкая на­стройка требует типизации контекстов. На этом пути может быть сформировано, например, формальное представление о падежах т.п. (см. [Прикладная и компьютерная лингвисти­ка, 2016]). Попытки такого рода предпринимались и в «до­компьютерную» эпоху, см. [Гисин, 1985]).
В этом разделе описаны моноидальные категории фор­мальных контекстов, которые могут служить новыми моде­лями значения в рамках композиционной семантики.
4.1. Формальные понятия
С точки зрения традиционной логики каждое понятие характеризуется своим содержанием (совокупностью отли­чительных признаков) и объемом (совокупностью всех объ­ектов, обладающих отличительными признаками). Матема­тическая модель формального понятия была предложена в работах Вилле [Wille 1992] (см. также [Ganter 2024, 2016]).
Теория формальных понятий развивалась как в рамках традиционной математики, так и в контексте многозначных логик и теории категорий [Belohlavek 2000, 2004], [Harding 2014].
Введем необходимые определения.
Для произвольного множества X пусть P(X) обозначает частично упорядоченное множество всех подмножеств (буле­ан) множества X. Пусть R ⊆ X × Y — бинарное отношение. Для A ⊆ X обозначим через R(A) подмножество в Y, содер­жащее все такие y ∈ Y, что (a, y) ∈ R для некоторого a ∈ A. Множество R({a}) будем обозначать просто R(a). Иногда вме­сто R ⊆ X × Y мы будем писать R: X Y, рассматривая R как многозначное отображение.
Через R
†
будем обозначать обратное к R отношение.
Таким образом, R† ⊆ Y × X и (y, x) ∈ R† тогда и только тог­да, когда (x, y) ∈ R. Отображение P(X) → P(Y), при котором A R(A), имеет сопряженное отображение R•: P(Y) → P(X) такое, что
•
R
(B) = {x ∈ X | R(x) ⊆ Y}.
80
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]