Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Исследования мировой науки новые подходы и актуальные вопросы. Ч. VI. Монография
.pdf
ܩܫܷ ൌ ܫܷ െ
ห ൫ᇹ൯Τห
. (7)
ȁȁ
По аналогии с IoU, GIoU также является расстоянием и соответствует всем
стандартам метрик, а также инвариантна к масштабированию. GIoU является
нижней границей для IoU. Значение GIoU асимптотически сходится к -1, когда
соотношение между занимающими областями двух фигур |Bp Bgt| и площадью
окружающей фигуры |C| стремится к нулю. Таким образом, это обобщение сохраняет основные свойства IoU, устраняя ее недостатки.
5) Средняя точность (mean Average Precision).
Средняя точность вычисляется как средневзвешенное значение точности
при каждом пороговом значении; вес – это увеличение отзыва по сравнению с
предыдущим пороговым значением:
݉ܣܲ ൌ
ଵ
ୀ
σ
ୀଵ
, (8)
ܣܲ
где ܣܲ – AP для класса k, n – общее число классов.
2 О задаче распознавания объектов при помощи открытого словаря
2.1 О подходе открытых словарей
Классическое обнаружение объектов требует обнаружения объектов из замкнутого набора категорий. Дополнительные аннотации и обучение в свою очередь требуются, если необходимо обнаружить объекты неизвестных категорий.
Это привлекло много
внимания к задаче обнаружения новых категорий без ан-
нотаций или из новой категории, что в настоящее время называется обнаружением открытого словаря (open vocabulary detection, OVD) [10] – это задача обна-
ружения объектов, направленная на обнаружение объектов из новых категорий,
выходящих за рамки базовых категорий, на которых обучен детектор.
Формально детектор обучается на наборе
категорией ܥ
вом входном изображении ܫאܴ
, соответствующей аннотацией региона и протестирована на но-
ுൈௐൈଷ
щих к новому набору категорий ܥ
для обнаружения объектов, принадлежа-
ே
, где ܥתܥேൌٕ. Как правило, базовые
данных обнаружения с базовой
классы используются при обучении или калибровке модели, в то время как новые
классы используются при тестировании модели.
Т.е. в обычной классификационной модели новые классы распознаются и
помечаются с меткой класса "unknown". В подходе с zero-shot модель должна
классифицировать новые классы уже на определенные категории [13]. А в
подходе OVD модель может классифицировать новые классы с помощью большого
языкового словаря C
. Это свойство позволяет использовать дополнительный
L
неразмеченный набор данных или предобученную визуально-языковую модель
(vision language model, VLM), что позволит модели адаптировать знания для но-
вых классов. При этом C
или C
, в том числе набор изображений может также их не покрывать. И, наобо-
N
рот, в C
могут также содержаться слова из заранее определенных новых катего-
L
может не покрывать все классы, содержащиеся в CB
L
рий, что может еще больше расширить возможности обобщения моделей. В последнее время, благодаря быстрому внедрению больших языковых моделей
(Large Language Models, LLM) [14], изучение открытой лексики стало более
11

перспективным направлением, поскольку в мультимодальную архитектуру
можно встроить больше языковых знаний.
Главные преимущества применения подхода OVD:
x повышение робастности и метрик;
x способность к zero и one-shot обучению;
x эффективная процедура извлечения знаний: модель преподавателя и
модель студента;
x способность к распознаванию объектов различных размеров;
x возможность обучения
x скорость распознавания зависит от количества объектов в итоговом
словаре.
2.2 Виды реализации открытых словарей
1) Обнаружение и сегментация объектов на основе пикселей. Этот тип
можно разделить на два аспекта: задачи семантической сегементации и обнаружения объекта. Обнаружение объектов в этом случае использует как двухэтапные,
так и одноэтапные подходы. Оба подхода требуют якоря для регрессии
ограничивающей рамки. Двухэтапные подходы явно исследуют объекты переднего плана, при этом эти объекты обладают лучшим обобщением, чем в одноэтапных подходах. Двухэтапные подходы чаще используются в открытом словаре для задачи обнаружения объектов.
2) Обнаружение и сегментация объектов на основе
них работах в основном используются подходы на основе модели Трансформер
для сегментации, обнаружения и понимания видео. По сравнению с предыдущими подходами на основе пикселей, подходы на основе Трансформер имеют
больше преимуществ в плане гибкости, простоты и робастности. Одной из значимых работ для этого вида является
дартную модель енкодер-декодер. DETR также знакомит с концепциями запроса
объекта для замены дизайна привязки в пиксельных подходах.
Запрос объекта обычно комбинируется с двусторонним сопоставлением
[17] во время обучения, что позволяет однозначно назначать предсказания с достоверностью. Т.е. каждый запрос объекта создает взаимно однозначное
ствие во время обучения. Такое сопоставление основано на функции (метрике)
сопоставления между истинными и предсказанными значениями. Функция сопоставления определяется как расстояние между предсказанием и истинным значением, включая метки, рамки и маски. Путем минимизации этой функции с помощью венгерского алгоритма каждому объектному запросу присваивается соответствующее основное истинное
3) Масштабное предобучение визуально-языковой модели. Улучшение
метрик при помощи предварительного обучения визуально-языковой модели может привести к лучшему пониманию семантики входных данных. Подход фокусируется на исследовании кросс-модальности при помощи изучения визуальной
и плотной (dense) связи между различными модальностями.
на неразмеченных данных;
запросов. В недав-
DETR. Он содержит магистраль CNN, стан-
соответ-
значение.
12

Наиболее распространёнными большими мультимодальными моделями
являются CLIP [19] и Align [21]. В частности, при таком масштабном предобучении CLIP демонстрирует, что простая задача предварительного обучения по про-
гнозированию того, какой класс будет соответствовать тому или иному изображению, уже может привести к созданию более робастных моделей. Соответственно
можно сделать вывод, что подходы с открытым
словарем направлены на извлече-
ние или использование знаний VLM для соответствующих задач.
4) Приведение модели распознавания объектов к задаче открытого
словаря. Распространенным способом создания открытого словаря является за-
мена фиксированных весов классификатора вставками текста из модели VLM
(рис. 2).
Рисунок 2. Схематическое представление приведения модели
распознавания объектов к задаче открытого словаря
В частности, визуальная модель генерирует визуальное представление, ݁
для каждого предложения объекта и вычисляет оценки сходства путем вычисления скалярного произведения с текстовыми внедрениями, ݁
ܥ
, так и из новых классов, ܥே. Оценка классификации рассчитывается следую-
щим образом:
ൌ
ଵା
σ
௫ۃ
ಳ
ห
ೕᇲసభ
ಿ
ೡ
ǡ
ห
௫ۃ
ۄ
ೕ
. (9)
ೡ
ۄ
ǡ
ೕ
௧
, как из базового,
௩
На практике векторные преставления из изображений обучаются с помо-
щью базовых аннотаций, соответствующих векторным представлениям из текста. Т.е. модель сочетает в себе знания VLM и изученные визуальные функции,
а детектор может обнаруживать новые классы с помощью семантически связанных вложений текста.
5) Извлечение знаний. Эти методы направлены на то
, чтобы извлечь зна-
ния из моделей VLM в блок распознавания. Поскольку количество параметров
VLM намного больше, чем в блоке распознавания, то извлечение новых классов
в обученные блоки распознавания на основе этих классов является ключевой
идеей этого подхода.
6) Предварительная мультимодальное обучение. Еще одним преимуще-
ством OVD является доступность крупномасштабных пар наборов данных
"изоб-
ражение-текст", которые можно легко использовать в повседневных задачах, т.к.
эти пары содержат достаточно обширные знания, чтобы охватить новые или
13
,

неизвестные наборы данных для обнаружения и сегментации. Процесс выравнивания текста по регионам позволяет отображать новые классы визуальных и текстовых объектов в выровненном пространстве объектов.
7) Обучение с использованием более сбалансированных данных. Ред-
кие и невидимые данные часто встречаются в наборах данных для классификации изображений. Для решения этой
проблемы можно использовать совместное
обучение. Основная идея этих подходов заключается в использовании более сбалансированных данных, включая наборы данных классификации изображений,
псевдомаркировки из текстовых данных изображений или дополнительные данные.
8) Моделирование на основе текстовых шаблонов. Моделирование тек-
стовых шаблонов (промптов) – эффективный метод адаптации базовых моделей
к различным областям, таким
как языковое моделирование и классификация
изображений. Благодаря включению в базовую модель текстовых подсказок
(шаблонов), модель может лучше переносить свои знания в различные задачи.
Для создания векторных представлений текста классов текстовые подсказки передаются в текстовый енкодер.
10) Выравнивание текста по области. Использование текстового описа-
ния в качестве альтернативы ограничивающей
рамки является альтернативой для
обнаружения объектов с использованием открытого словаря. Но получение достаточного количества аннотаций в таком виде является сложной и дорогостоящей задачей.
2.3 Метрики в задаче распознавания объектов из открытого словаря
Для подхода OVD в задаче обнаружения объектов используются схожие
метрики, основное отличие заключается в том, что
для оценивания способности
моделей выявлять новые классы, условно разделяют метрику AP на две категории: AP
.
novel
novel
и AP
. При этом основное внимание в подходе OVD уделяется AP-
base
Стоит отметить, что оценка AP приводит к разным результатам с исполь-
зованием ранжирования по разным категориям, что можно увидеть на рис. 3.
14

Рисунок 3. Распределённое значение из различных функций потерь для
det/img
AP
APR
APC
APF
100
18.2
6.5
15.8
26.1
300
22.6
12.6
21.1
28.6
1000
25.0
16.8
24.1
29.7
2000
25.6
18.1
24.6
29.9
5000
26.0
19.7
24.9
30.0
10000
26.1
19.8
25.0
30.1
редких (rare), распространенных (common) и часто встречающихся
категорий (frequent) для набора данных LVIS [23]
1) AP
. Наиболее оптимальным вариантом является наличие большого,
fixed
но ограниченного количества обнаружений на изображении. При этом предсказания, превышающие очень высокий предел, крайне маловероятны и, следовательно, могут не повлиять на оценку. Как видно из табл. 1, увеличение лимита
более чем на 5000 не оказывает существенного влияния на AP (‘R’ – для редких
классов, ‘C’ – для распространённых и ‘F’ – для часто встречающихся категорий). Но, это приводит к непомерно медленной оценке при тестировании на LVIS
[25].
Таблица № 1
Влияние увеличение количества распознаваний на метрики
Поэтому вместо того, чтобы отбрасывать обнаружения с низкой оценкой
для каждого изображения, необходимо исключать обнаружения с низкой оценкой для каждого класса в наборе данных. То есть, учитывая результаты модели
в наборе данных для оценки, при тестировании будут оцениваться
только k-
15

лучших прогнозов для каждого класса, исключая остальные. Этот подход к
dets/im
dets/class
AP
APR
APC
APF
100
-
18.2
6.5
15.8
26.1
300
-
22.6
12.6
21.1
28.6
1000
-
25.0
16.8
24.1
29.7
2000
-
25.6
18.1
24.6
29.9
5000 - 26
19.7
24.9
30.0
10000
-
26.1
19.8
25.0
30.1
-
1000
21.9
17.7
22.2
23.5 - 5000
25.0
19.5
24.4
28.2
-
10000
25.6
19.7
24.7
29.1
-
30000
26.0
19.8
24.9
29.8
-
50000
26.0
19.9
25.0
30.0
оценке называется AP
fixed
.
Авторы в работе [23] отметили, что эта стратегия значительно сокращает
требования к хранилищу данных и времени для оценки. В табл. 2 показано, что
при ограничении количества обнаружений до 10000 для каждого класса в наборе
данных достигается хороший баланс. Это ограничение обеспечивает 98,5% полной скорости доступа при увеличении размера файла и времени оценки всего
в 2
раза (по сравнению с 15 раз для стандартного подхода). Это ограничение зависит
от размера оценочного набора, аналогично тому, как стандартное ограничение
на количество изображений зависит от объема словаря и количества классов.
Таблица № 2
Влияние применения AP
fixed
AP
предоставляет собой независимую оценку обнаружения для каждого
fixed
класса. Эта оценка имеет естественную привлекательность, если рассматривать
обнаружение как задачу поиска информации, область, из которой исходит AP:
детектору разрешено "извлекать" до k обнаружений для каждого класса из всего
набора для оценки. Поскольку APfixed не зависит от категории, он не поощряет
изменения ранжирования по категориям. В
результате он больше не подвержен
повторному ранжированию.
2) AP
pool
. AP
должным образом не определяет, как следует использовать
fixed
детекторы в реальных условиях, что требует калибровки по баллам. В простейшем примере может потребоваться создать демонстрационную версию, которая
визуализирует все обнаружения, превышающие глобальный порог оценки
(например, 0.5), и ожидает увидеть согласованные результаты по всем категориям. Учитывая это практическое требование, авторы в работе
метрику AP
, которая напрямую вознаграждает за ранжирование по катего-
pool
[23] придумали
риям.
16

Независимая оценка для каждого класса привлекательна своей простотой,
dets/im
AP
APR
APC
APF
300
26.2
8.0
16.7
27.0
1000
26.8
10.7
19.8
27.6
2000
27.0
11.0
20.5
27.7
5000
27.0
11.3
20.8
27.7
10000
27.0
11.3
20.8
27.7
но большинство практических приложений требуют сравнения достоверности
прогнозов по классам для формирования единого представления об объектах на
изображении. Т.е. детектор может выдавать произвольный диапазон оценок для
каждого класса для действительно независимой оценки: то есть все обнаружения
для одного класса (например, "кот")
могут иметь достоверность выше 0.5, в то
время как все обнаружения для другого класса (например, "собака") имеют достоверность выше 0.5 и ниже 0.5. Использование такого детектора на практике
требует тщательной калибровки оценок по классам.
AP
явно оценивает обнаружения по всем классам вместе. Он состоит из
pool
следующих шагов.
а) Вначале происходит сопоставление предсказанных значений с истин-
ными для каждого класса, следуя стандартной оценке.
б) Вместо вычисления кривой точного возврата для каждого класса, объединяются обнаружения по всем классам, чтобы сгенерировать единую кривую
для всех классов,
чить AP
AP
pool
.
pool
и вычислить среднюю точность по этой кривой, чтобы полу-
обладает двумя ключевыми свойствами: 1) ранжирует обнаружения
по всем классам, чтобы сформировать единую кривую оценки точности, стимулируя детекторы оценивать достоверные прогнозы выше прогнозов с более низкой степенью достоверности; 2) одинаково взвешивает все истинные значения, а
не классы. Это позволяет решить проблему с дисбалансом классов, а также
уменьшает влияние ограничения на
количество обнаружений на изображении,
т.к. предсказания с низкой степенью достоверности для некоторых редких классов не оказывают существенного влияния на оценку. Но из-за этого на оценку в
большей степени влияют часто встречающиеся классы, чем редкие.
Таблица № 3
Влияние применения AP
pool
В табл. 3 проанализировано, как ограничение на количество обнаружений
на изображении влияет на AP
существенного влияния на AP
. Увеличение этого ограничения не оказывает
pool
. Увеличение лимита более чем на 300 обнару-
pool
жений незначительно улучшает показатель для редких классов.
17

2.3. Основные архитектуры открытых словарей для задачи распозна-
вания объектов
1. Кооперативные фундаментальные модели (Cooperative Foundational
Models) [15]. В основе этого подхода лежит проблема обнаружения новых объ-
ектов, направленная на точное обнаружение как известных, так и новых категорий объектов во время вывода. Новый подход преобразовывает существующие
подходы к распознаванию с закрытым набором
Эта трансформация достигается за счет использования дополнительных сильных
сторон предварительно обученных основополагающих моделей, в частности
языковых образов, предварительно обученных на контрастах (Contrastive Lan-
guage-Image Pre-Training, CLIP [16]), и сегментации любой модели (Segment An-
ything Model, SAM [18]), с помощью кооперативного механизма. Кроме того, ин-
тегрируя этот механизм с современными детекторами с открытым набором, устанавливаются
тов.
няют несколько моделей, они могут обеспечить более надежное обобщение на
новые данные и сценарии.
нием, что позволяет CFM использовать множество источников информации
принятия решений.
ленных системах, что делает их масштабируемыми и способными обрабатывать
большие объемы данных.
CFM требует дополнительной работы по согласованию и совместному обучению, что может быть сложно и
и управление вычислительными ресурсами между различными моделями в CFM
может представлять собой сложную задачу.
должна сотрудничать друг с другом, и недостаточная согласованность или взаимодействие может привести к падению производительности системы.
делей, понимание и интерпретация результатов может быть сложным, особенно
при возникновении конфликтов или несогласий между моделями.
(Contrastive Feature Masking Vision Transformer, CFM-ViT) [20] – это подход
обработки изображений, основанный на комбинации преимуществ визуального
трансформера (Vision Transformer, ViT [22]) и обучения на контрастах. Он предназначен для улучшения
вход модели изображений с маскированными признаками и сравнения их через
новые эталонные показатели эффективности обнаружения объек-
Преимуществами модели являются.
– Улучшенная обобщающая способность: За счет того, что CFM объеди-
– Резервирование знаний: Каждая модель может обладать уникальным зна-
– Распределенные вычисления: CFM могут быть реализованы на распреде-
К недостаткам относятся:
– Сложность разработки и обучения: Объединение нескольких моделей в
требовать значительных ресурсов.
– Управление вычислительными ресурсами: Эффективное распределение
– Возможные проблемы совместной работы: В CFM каждая модель
– Сложность
2. Визуальный Трансформер для маскировки признаков контрастов
интерпретации: Поскольку CFM объединяют несколько мо-
обучения модели на изображениях путем подачи на
в подход с открытым словарём.
для
18

контрастный подход. В основе CFM-ViT лежит идея маскирования части признаков в изображениях, чтобы модель могла учиться извлекать более информативные и различимые признаки.
В процессе обучения CFM-ViT изображения подаются на вход модели, а
затем применяется маскирование признаков в этих изображениях. Затем модель
обучается сравнивать исходное изображение с маскированным изображением
контрастном пространстве. Это позволяет модели учиться извлекать признаки,
которые устойчивы к маскированию и более информативны для задачи обработки изображений.
К преимуществам модели относятся.
– Высокая производительность: CFM-ViT обладает хорошей производительностью в сравнении с другими моделями обработки изображений благодаря
комбинации преимуществ ViT и обучения на контрастах.
– Высокий уровень
воляет CFM-ViT получать обобщение на новые данные, что особенно важно при
обработке изображений из различных источников.
– Способность к обучению без размеченных данных: Обучение на контрастах позволяет CFM-ViT извлекать признаки из данных без явной разметки,
что может быть полезно в случаях, когда размеченные
ступны.
– Возможность модификации: CFM-ViT легко адаптируется и расширяется
за счет использования Vision Transformer, что позволяет исследователям и разработчикам экспериментировать с различными аспектами модели.
К недостаткам относятся.
– Высокие вычислительные требования: Обучение CFM-ViT может потребовать значительных вычислительных ресурсов из-за размера модели и необхо-
димости проведения контрастного обучения.
– Сложность реализации: Внедрение и обучение CFM-ViT может потребовать определенного уровня экспертизы и инфраструктуры для работы с моделями глубокого обучения.
– Необходимость большого объема данных: Для эффективного контрастного обучения CFM-ViT может потребоваться большой объем данных, что может быть ограничивающим фактором для некоторых
– Сложность интерпретации: Как и для многих моделей глубокого обучения, интерпретация внутреннего состояния CFM-ViT может быть сложной, особенно при отсутствии прозрачности модели.
3. Предварительное обучение на парах «изображение-текст», ориенти-
рованное на обнаружение (Detection-Oriented Image-Text Pretraining (DITO)
[24]. Данный подход по обнаружению из открытого словаря основан на предвари-
тельном обучении «
преодолеть разрыв между предварительным обучением на уровне изображения и
обнаружением объекта из открытого словаря. На этапе предварительной подготовки заменяется обычно используемая архитектура классификации на архитектуру детектора, которая лучше удовлетворяет потребности обнаружения в распознавании на уровне области, позволяя головам детектора учиться на
обобщения: Применение обучения на контрастах поз-
данные дороги или недо-
приложений.
изображение-текст» с ориентацией на обнаружение, чтобы
в
основе
19

аугментированных пар «изображение-текст». Используя только стандартную потерю контрастов и отсутствие псевдомаркировки, подход представляет собой простое, но эффективное расширение метода обучения на контрастах для изучения
возникающих объектно-семантических сигналов. Кроме того, предлагается подход к обучению со сдвинутым окном на внимании к окну, чтобы сделать представление базовой
Преимущества модели:
– Улучшение качества распознавания объектов: DITO способствует улучшению качества распознавания объектов на изображениях, благодаря предварительному обучению модели на мультимодальных данных, включающих изображения и соответствующие им текстовые описания.
– Улучшенное обучение на меньшем объеме данных: Предварительное
обучение на мультимодальных
зовать информацию из ограниченного объема данных, что особенно важно в случаях, когда доступ к большим объемам данных ограничен.
– Повышенная интерпретируемость: В отличие от некоторых других мето-
дов предварительного обучения, DITO использует текстовые описания объектов
на изображениях, что делает внутренние представления модели более интерпретируемыми
– Универсальность в применении: DITO может быть применен к различным задачам обнаружения объектов на изображениях, включая обнаружение
лиц, автомобилей, предметов одежды и других объектов.
К недостаткам относятся:
– Требования к данным и вычислительным ресурсам: DITO требует наличия большого объема данных, содержащих изображения с соответствующими
текстовыми описаниями объектов,
сурсов для предварительного обучения модели.
– Сложность архитектуры и обучения: Разработка и обучение моделей, использующих DITO, могут быть сложными из-за необходимости согласования ин-
формации между изображениями и текстом и оптимизации многофункциональных целевых функций.
– Возможность переобучения: С увеличением сложности модели и объема
данных
если они не разнообразны.
– Ограничения масштабируемости: Возможно, что DITO будет менее эффективен при работе с очень большими наборами данных, так как его производительность может снижаться из-за сложности обработки мультимодальной информации на больших объемах данных.
4. Языковые образы, предварительно
модистилляцией (Contrastive Language-Image Pre-training Self-Distillation,
CLIPSelf) [26] – это модель, которая адаптирует способность распознавания на
уровне изображения CLIP ViT к локальным областям изображения без необходимости использования пар «регион-текст». CLIPSelf при помощи ViT выравни-
вает представление области, извлеченное из его плотной карты признаков, с
представлением уровня изображения соответствующей региону изображения
модели более робастным и инвариантным к переводу.
данных позволяет модели эффективнее исполь-
и понятными.
а также значительных вычислительных ре-
существует риск переобучения, особенно если данных недостаточно или
обученные на контрастах, с са-
.
20
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
