Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Исследования мировой науки новые подходы и актуальные вопросы. Ч. VI. Монография

.pdf
Скачиваний:
0
Добавлен:
06.09.2026
Размер:
1 Мб
Скачать
ܩܫ݋ܷ ൌ ܫ݋ܷ െ
ห஼ ൫஻೛׫஻ᇹ൯Τห
. (7)
ȁ஼ȁ
По аналогии с IoU, GIoU также является расстоянием и соответствует всем стандартам метрик, а также инвариантна к масштабированию. GIoU является нижней границей для IoU. Значение GIoU асимптотически сходится к -1, когда соотношение между занимающими областями двух фигур |Bp ׫ Bgt| и площадью окружающей фигуры |C| стремится к нулю. Таким образом, это обобщение со­храняет основные свойства IoU, устраняя ее недостатки.
5) Средняя точность (mean Average Precision).
Средняя точность вычисляется как средневзвешенное значение точности при каждом пороговом значении; вес – это увеличение отзыва по сравнению с предыдущим пороговым значением:
݉ܣܲ ൌ
௞ୀ௡
σ
௞ୀଵ
, (8)
ܣܲ
где ܣܲ௞ – AP для класса k, n – общее число классов.
2 О задаче распознавания объектов при помощи открытого словаря
2.1 О подходе открытых словарей
Классическое обнаружение объектов требует обнаружения объектов из за­мкнутого набора категорий. Дополнительные аннотации и обучение в свою оче­редь требуются, если необходимо обнаружить объекты неизвестных категорий. Это привлекло много
внимания к задаче обнаружения новых категорий без ан-
нотаций или из новой категории, что в настоящее время называется обнаруже­нием открытого словаря (open vocabulary detection, OVD) [10] – это задача обна- ружения объектов, направленная на обнаружение объектов из новых категорий, выходящих за рамки базовых категорий, на которых обучен детектор.
Формально детектор обучается на наборе категорией ܥ вом входном изображении ܫאܴ
, соответствующей аннотацией региона и протестирована на но-
ுൈௐൈଷ
щих к новому набору категорий ܥ
для обнаружения объектов, принадлежа-
, где ܥ஻תܥேൌٕ. Как правило, базовые
данных обнаружения с базовой
классы используются при обучении или калибровке модели, в то время как новые классы используются при тестировании модели.
Т.е. в обычной классификационной модели новые классы распознаются и помечаются с меткой класса "unknown". В подходе с zero-shot модель должна классифицировать новые классы уже на определенные категории [13]. А в
под­ходе OVD модель может классифицировать новые классы с помощью большого языкового словаря C
. Это свойство позволяет использовать дополнительный
L
неразмеченный набор данных или предобученную визуально-языковую модель (vision language model, VLM), что позволит модели адаптировать знания для но-
вых классов. При этом C или C
, в том числе набор изображений может также их не покрывать. И, наобо-
N
рот, в C
могут также содержаться слова из заранее определенных новых катего-
L
может не покрывать все классы, содержащиеся в CB
L
рий, что может еще больше расширить возможности обобщения моделей. В по­следнее время, благодаря быстрому внедрению больших языковых моделей
(Large Language Models, LLM) [14], изучение открытой лексики стало более
11
перспективным направлением, поскольку в мультимодальную архитектуру можно встроить больше языковых знаний.
Главные преимущества применения подхода OVD:
x повышение робастности и метрик; x способность к zero и one-shot обучению; x эффективная процедура извлечения знаний: модель преподавателя и
модель студента;
x способность к распознаванию объектов различных размеров; x возможность обучения x скорость распознавания зависит от количества объектов в итоговом
словаре.
2.2 Виды реализации открытых словарей
1) Обнаружение и сегментация объектов на основе пикселей. Этот тип
можно разделить на два аспекта: задачи семантической сегементации и обнару­жения объекта. Обнаружение объектов в этом случае использует как двухэтап­ные,
так и одноэтапные подходы. Оба подхода требуют якоря для регрессии ограничивающей рамки. Двухэтапные подходы явно исследуют объекты перед­него плана, при этом эти объекты обладают лучшим обобщением, чем в одно­этапных подходах. Двухэтапные подходы чаще используются в открытом сло­варе для задачи обнаружения объектов.
2) Обнаружение и сегментация объектов на основе
них работах в основном используются подходы на основе модели Трансформер для сегментации, обнаружения и понимания видео. По сравнению с предыду­щими подходами на основе пикселей, подходы на основе Трансформер имеют больше преимуществ в плане гибкости, простоты и робастности. Одной из зна­чимых работ для этого вида является дартную модель енкодер-декодер. DETR также знакомит с концепциями запроса объекта для замены дизайна привязки в пиксельных подходах.
Запрос объекта обычно комбинируется с двусторонним сопоставлением
[17] во время обучения, что позволяет однозначно назначать предсказания с до­стоверностью. Т.е. каждый запрос объекта создает взаимно однозначное ствие во время обучения. Такое сопоставление основано на функции (метрике) сопоставления между истинными и предсказанными значениями. Функция сопо­ставления определяется как расстояние между предсказанием и истинным зна­чением, включая метки, рамки и маски. Путем минимизации этой функции с по­мощью венгерского алгоритма каждому объектному запросу присваивается со­ответствующее основное истинное
3) Масштабное предобучение визуально-языковой модели. Улучшение
метрик при помощи предварительного обучения визуально-языковой модели мо­жет привести к лучшему пониманию семантики входных данных. Подход фоку­сируется на исследовании кросс-модальности при помощи изучения визуальной и плотной (dense) связи между различными модальностями.
на неразмеченных данных;
запросов. В недав-
DETR. Он содержит магистраль CNN, стан-
соответ-
значение.
12
Наиболее распространёнными большими мультимодальными моделями
являются CLIP [19] и Align [21]. В частности, при таком масштабном предобуче­нии CLIP демонстрирует, что простая задача предварительного обучения по про- гнозированию того, какой класс будет соответствовать тому или иному изображе­нию, уже может привести к созданию более робастных моделей. Соответственно можно сделать вывод, что подходы с открытым
словарем направлены на извлече-
ние или использование знаний VLM для соответствующих задач.
4) Приведение модели распознавания объектов к задаче открытого
словаря. Распространенным способом создания открытого словаря является за-
мена фиксированных весов классификатора вставками текста из модели VLM (рис. 2).
Рисунок 2. Схематическое представление приведения модели
распознавания объектов к задаче открытого словаря
В частности, визуальная модель генерирует визуальное представление, ݁
для каждого предложения объекта и вычисляет оценки сходства путем вычисле­ния скалярного произведения с текстовыми внедрениями, ݁
ܥ
, так и из новых классов, ܥே. Оценка классификации рассчитывается следую-
щим образом:
݌
௜௝
ଵା
σ
௘௫௣ۃ௘
಴ಳ׫಴
ห ೕᇲసభ
ಿ
ǡ௘
௘௫௣ۃ௘
ۄ
. (9)
ۄ
ǡ௘
, как из базового,
На практике векторные преставления из изображений обучаются с помо-
щью базовых аннотаций, соответствующих векторным представлениям из тек­ста. Т.е. модель сочетает в себе знания VLM и изученные визуальные функции, а детектор может обнаруживать новые классы с помощью семантически связан­ных вложений текста.
5) Извлечение знаний. Эти методы направлены на то
, чтобы извлечь зна-
ния из моделей VLM в блок распознавания. Поскольку количество параметров VLM намного больше, чем в блоке распознавания, то извлечение новых классов
в обученные блоки распознавания на основе этих классов является ключевой идеей этого подхода.
6) Предварительная мультимодальное обучение. Еще одним преимуще-
ством OVD является доступность крупномасштабных пар наборов данных
"изоб-
ражение-текст", которые можно легко использовать в повседневных задачах, т.к. эти пары содержат достаточно обширные знания, чтобы охватить новые или
13
,
неизвестные наборы данных для обнаружения и сегментации. Процесс выравни­вания текста по регионам позволяет отображать новые классы визуальных и тек­стовых объектов в выровненном пространстве объектов.
7) Обучение с использованием более сбалансированных данных. Ред-
кие и невидимые данные часто встречаются в наборах данных для классифика­ции изображений. Для решения этой
проблемы можно использовать совместное обучение. Основная идея этих подходов заключается в использовании более сба­лансированных данных, включая наборы данных классификации изображений, псевдомаркировки из текстовых данных изображений или дополнительные дан­ные.
8) Моделирование на основе текстовых шаблонов. Моделирование тек-
стовых шаблонов (промптов) – эффективный метод адаптации базовых моделей к различным областям, таким
как языковое моделирование и классификация изображений. Благодаря включению в базовую модель текстовых подсказок (шаблонов), модель может лучше переносить свои знания в различные задачи. Для создания векторных представлений текста классов текстовые подсказки пе­редаются в текстовый енкодер.
10) Выравнивание текста по области. Использование текстового описа-
ния в качестве альтернативы ограничивающей
рамки является альтернативой для обнаружения объектов с использованием открытого словаря. Но получение до­статочного количества аннотаций в таком виде является сложной и дорогостоя­щей задачей.
2.3 Метрики в задаче распознавания объектов из открытого словаря
Для подхода OVD в задаче обнаружения объектов используются схожие
метрики, основное отличие заключается в том, что
для оценивания способности
моделей выявлять новые классы, условно разделяют метрику AP на две катего­рии: AP
.
novel
novel
и AP
. При этом основное внимание в подходе OVD уделяется AP-
base
Стоит отметить, что оценка AP приводит к разным результатам с исполь-
зованием ранжирования по разным категориям, что можно увидеть на рис. 3.
14
Рисунок 3. Распределённое значение из различных функций потерь для
det/img
AP
APR
APC
APF
100
18.2
6.5
15.8
26.1
300
22.6
12.6
21.1
28.6
1000
25.0
16.8
24.1
29.7
2000
25.6
18.1
24.6
29.9
5000
26.0
19.7
24.9
30.0
10000
26.1
19.8
25.0
30.1
редких (rare), распространенных (common) и часто встречающихся
категорий (frequent) для набора данных LVIS [23]
1) AP
. Наиболее оптимальным вариантом является наличие большого,
fixed
но ограниченного количества обнаружений на изображении. При этом предска­зания, превышающие очень высокий предел, крайне маловероятны и, следова­тельно, могут не повлиять на оценку. Как видно из табл. 1, увеличение лимита более чем на 5000 не оказывает существенного влияния на AP (‘R’ – для редких
классов, ‘C’ – для распространённых и ‘F’ – для часто встречающихся катего­рий). Но, это приводит к непомерно медленной оценке при тестировании на LVIS
[25].
Таблица1
Влияние увеличение количества распознаваний на метрики
Поэтому вместо того, чтобы отбрасывать обнаружения с низкой оценкой
для каждого изображения, необходимо исключать обнаружения с низкой оцен­кой для каждого класса в наборе данных. То есть, учитывая результаты модели в наборе данных для оценки, при тестировании будут оцениваться
только k-
15
лучших прогнозов для каждого класса, исключая остальные. Этот подход к
dets/im
dets/class
AP
APR
APC
APF
100
-
18.2
6.5
15.8
26.1
300
-
22.6
12.6
21.1
28.6
1000
-
25.0
16.8
24.1
29.7
2000
-
25.6
18.1
24.6
29.9
5000 - 26
19.7
24.9
30.0
10000
-
26.1
19.8
25.0
30.1
-
1000
21.9
17.7
22.2
23.5 - 5000
25.0
19.5
24.4
28.2
-
10000
25.6
19.7
24.7
29.1
-
30000
26.0
19.8
24.9
29.8
-
50000
26.0
19.9
25.0
30.0
оценке называется AP
fixed
.
Авторы в работе [23] отметили, что эта стратегия значительно сокращает
требования к хранилищу данных и времени для оценки. В табл. 2 показано, что при ограничении количества обнаружений до 10000 для каждого класса в наборе данных достигается хороший баланс. Это ограничение обеспечивает 98,5% пол­ной скорости доступа при увеличении размера файла и времени оценки всего
в 2 раза (по сравнению с 15 раз для стандартного подхода). Это ограничение зависит от размера оценочного набора, аналогично тому, как стандартное ограничение на количество изображений зависит от объема словаря и количества классов.
Таблица № 2
Влияние применения AP
fixed
AP
предоставляет собой независимую оценку обнаружения для каждого
fixed
класса. Эта оценка имеет естественную привлекательность, если рассматривать обнаружение как задачу поиска информации, область, из которой исходит AP: детектору разрешено "извлекать" до k обнаружений для каждого класса из всего набора для оценки. Поскольку APfixed не зависит от категории, он не поощряет изменения ранжирования по категориям. В
результате он больше не подвержен
повторному ранжированию.
2) AP
pool
. AP
должным образом не определяет, как следует использовать
fixed
детекторы в реальных условиях, что требует калибровки по баллам. В простей­шем примере может потребоваться создать демонстрационную версию, которая визуализирует все обнаружения, превышающие глобальный порог оценки (например, 0.5), и ожидает увидеть согласованные результаты по всем катего­риям. Учитывая это практическое требование, авторы в работе метрику AP
, которая напрямую вознаграждает за ранжирование по катего-
pool
[23] придумали
риям.
16
Независимая оценка для каждого класса привлекательна своей простотой,
dets/im
AP
APR
APC
APF
300
26.2
8.0
16.7
27.0
1000
26.8
10.7
19.8
27.6
2000
27.0
11.0
20.5
27.7
5000
27.0
11.3
20.8
27.7
10000
27.0
11.3
20.8
27.7
но большинство практических приложений требуют сравнения достоверности прогнозов по классам для формирования единого представления об объектах на изображении. Т.е. детектор может выдавать произвольный диапазон оценок для каждого класса для действительно независимой оценки: то есть все обнаружения для одного класса (например, "кот")
могут иметь достоверность выше 0.5, в то время как все обнаружения для другого класса (например, "собака") имеют до­стоверность выше 0.5 и ниже 0.5. Использование такого детектора на практике требует тщательной калибровки оценок по классам.
AP
явно оценивает обнаружения по всем классам вместе. Он состоит из
pool
следующих шагов.
а) Вначале происходит сопоставление предсказанных значений с истин-
ными для каждого класса, следуя стандартной оценке.
б) Вместо вычисления кривой точного возврата для каждого класса, объ­единяются обнаружения по всем классам, чтобы сгенерировать единую кривую для всех классов, чить AP
AP
pool
.
pool
и вычислить среднюю точность по этой кривой, чтобы полу-
обладает двумя ключевыми свойствами: 1) ранжирует обнаружения
по всем классам, чтобы сформировать единую кривую оценки точности, стиму­лируя детекторы оценивать достоверные прогнозы выше прогнозов с более низ­кой степенью достоверности; 2) одинаково взвешивает все истинные значения, а не классы. Это позволяет решить проблему с дисбалансом классов, а также уменьшает влияние ограничения на
количество обнаружений на изображении,
т.к. предсказания с низкой степенью достоверности для некоторых редких клас­сов не оказывают существенного влияния на оценку. Но из-за этого на оценку в большей степени влияют часто встречающиеся классы, чем редкие.
Таблица № 3
Влияние применения AP
pool
В табл. 3 проанализировано, как ограничение на количество обнаружений на изображении влияет на AP существенного влияния на AP
. Увеличение этого ограничения не оказывает
pool
. Увеличение лимита более чем на 300 обнару-
pool
жений незначительно улучшает показатель для редких классов.
17
2.3. Основные архитектуры открытых словарей для задачи распозна-
вания объектов
1. Кооперативные фундаментальные модели (Cooperative Foundational
Models) [15]. В основе этого подхода лежит проблема обнаружения новых объ-
ектов, направленная на точное обнаружение как известных, так и новых катего­рий объектов во время вывода. Новый подход преобразовывает существующие подходы к распознаванию с закрытым набором Эта трансформация достигается за счет использования дополнительных сильных сторон предварительно обученных основополагающих моделей, в частности языковых образов, предварительно обученных на контрастах (Contrastive Lan-
guage-Image Pre-Training, CLIP [16]), и сегментации любой модели (Segment An- ything Model, SAM [18]), с помощью кооперативного механизма. Кроме того, ин-
тегрируя этот механизм с современными детекторами с открытым набором, уста­навливаются тов.
няют несколько моделей, они могут обеспечить более надежное обобщение на новые данные и сценарии.
нием, что позволяет CFM использовать множество источников информации принятия решений.
ленных системах, что делает их масштабируемыми и способными обрабатывать большие объемы данных.
CFM требует дополнительной работы по согласованию и совместному обуче­нию, что может быть сложно и
и управление вычислительными ресурсами между различными моделями в CFM может представлять собой сложную задачу.
должна сотрудничать друг с другом, и недостаточная согласованность или взаи­модействие может привести к падению производительности системы.
делей, понимание и интерпретация результатов может быть сложным, особенно при возникновении конфликтов или несогласий между моделями.
(Contrastive Feature Masking Vision Transformer, CFM-ViT) [20] – это подход обработки изображений, основанный на комбинации преимуществ визуального трансформера (Vision Transformer, ViT [22]) и обучения на контрастах. Он пред­назначен для улучшения вход модели изображений с маскированными признаками и сравнения их через
новые эталонные показатели эффективности обнаружения объек-
Преимуществами модели являются.
Улучшенная обобщающая способность: За счет того, что CFM объеди-
Резервирование знаний: Каждая модель может обладать уникальным зна-
Распределенные вычисления: CFM могут быть реализованы на распреде-
К недостаткам относятся:
Сложность разработки и обучения: Объединение нескольких моделей в
требовать значительных ресурсов.
Управление вычислительными ресурсами: Эффективное распределение
Возможные проблемы совместной работы: В CFM каждая модель
Сложность
2. Визуальный Трансформер для маскировки признаков контрастов
интерпретации: Поскольку CFM объединяют несколько мо-
обучения модели на изображениях путем подачи на
в подход с открытым словарём.
для
18
контрастный подход. В основе CFM-ViT лежит идея маскирования части призна­ков в изображениях, чтобы модель могла учиться извлекать более информатив­ные и различимые признаки.
В процессе обучения CFM-ViT изображения подаются на вход модели, а затем применяется маскирование признаков в этих изображениях. Затем модель обучается сравнивать исходное изображение с маскированным изображением контрастном пространстве. Это позволяет модели учиться извлекать признаки, которые устойчивы к маскированию и более информативны для задачи обра­ботки изображений.
К преимуществам модели относятся.
Высокая производительность: CFM-ViT обладает хорошей производи­тельностью в сравнении с другими моделями обработки изображений благодаря комбинации преимуществ ViT и обучения на контрастах.
Высокий уровень воляет CFM-ViT получать обобщение на новые данные, что особенно важно при обработке изображений из различных источников.
Способность к обучению без размеченных данных: Обучение на кон­трастах позволяет CFM-ViT извлекать признаки из данных без явной разметки, что может быть полезно в случаях, когда размеченные ступны.
Возможность модификации: CFM-ViT легко адаптируется и расширяется за счет использования Vision Transformer, что позволяет исследователям и раз­работчикам экспериментировать с различными аспектами модели.
К недостаткам относятся.
Высокие вычислительные требования: Обучение CFM-ViT может потре­бовать значительных вычислительных ресурсов из-за размера модели и необхо- димости проведения контрастного обучения.
Сложность реализации: Внедрение и обучение CFM-ViT может потребо­вать определенного уровня экспертизы и инфраструктуры для работы с моде­лями глубокого обучения.
Необходимость большого объема данных: Для эффективного контраст­ного обучения CFM-ViT может потребоваться большой объем данных, что мо­жет быть ограничивающим фактором для некоторых
Сложность интерпретации: Как и для многих моделей глубокого обуче­ния, интерпретация внутреннего состояния CFM-ViT может быть сложной, осо­бенно при отсутствии прозрачности модели.
3. Предварительное обучение на парах «изображение-текст», ориенти-
рованное на обнаружение (Detection-Oriented Image-Text Pretraining (DITO)
[24]. Данный подход по обнаружению из открытого словаря основан на предвари- тельном обучении « преодолеть разрыв между предварительным обучением на уровне изображения и обнаружением объекта из открытого словаря. На этапе предварительной подго­товки заменяется обычно используемая архитектура классификации на архитек­туру детектора, которая лучше удовлетворяет потребности обнаружения в распо­знавании на уровне области, позволяя головам детектора учиться на
обобщения: Применение обучения на контрастах поз-
данные дороги или недо-
приложений.
изображение-текст» с ориентацией на обнаружение, чтобы
в
основе
19
аугментированных пар «изображение-текст». Используя только стандартную по­терю контрастов и отсутствие псевдомаркировки, подход представляет собой про­стое, но эффективное расширение метода обучения на контрастах для изучения возникающих объектно-семантических сигналов. Кроме того, предлагается под­ход к обучению со сдвинутым окном на внимании к окну, чтобы сделать представ­ление базовой
Преимущества модели:
Улучшение качества распознавания объектов: DITO способствует улуч­шению качества распознавания объектов на изображениях, благодаря предвари­тельному обучению модели на мультимодальных данных, включающих изобра­жения и соответствующие им текстовые описания.
Улучшенное обучение на меньшем объеме данных: Предварительное обучение на мультимодальных зовать информацию из ограниченного объема данных, что особенно важно в слу­чаях, когда доступ к большим объемам данных ограничен.
Повышенная интерпретируемость: В отличие от некоторых других мето- дов предварительного обучения, DITO использует текстовые описания объектов на изображениях, что делает внутренние представления модели более интерпре­тируемыми
Универсальность в применении: DITO может быть применен к различ­ным задачам обнаружения объектов на изображениях, включая обнаружение лиц, автомобилей, предметов одежды и других объектов.
К недостаткам относятся:
Требования к данным и вычислительным ресурсам: DITO требует нали­чия большого объема данных, содержащих изображения с соответствующими текстовыми описаниями объектов, сурсов для предварительного обучения модели.
Сложность архитектуры и обучения: Разработка и обучение моделей, ис­пользующих DITO, могут быть сложными из-за необходимости согласования ин- формации между изображениями и текстом и оптимизации многофункциональ­ных целевых функций.
Возможность переобучения: С увеличением сложности модели и объема данных если они не разнообразны.
Ограничения масштабируемости: Возможно, что DITO будет менее эф­фективен при работе с очень большими наборами данных, так как его произво­дительность может снижаться из-за сложности обработки мультимодальной ин­формации на больших объемах данных.
4. Языковые образы, предварительно
модистилляцией (Contrastive Language-Image Pre-training Self-Distillation,
CLIPSelf) [26] это модель, которая адаптирует способность распознавания на уровне изображения CLIP ViT к локальным областям изображения без необхо­димости использования пар «регион-текст». CLIPSelf при помощи ViT выравни- вает представление области, извлеченное из его плотной карты признаков, с представлением уровня изображения соответствующей региону изображения
модели более робастным и инвариантным к переводу.
данных позволяет модели эффективнее исполь-
и понятными.
а также значительных вычислительных ре-
существует риск переобучения, особенно если данных недостаточно или
обученные на контрастах, с са-
.
20
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]