Robust Domain Generalization for Multi-modal Object Recognition

Fuente: arXiv
Saved in:
Bibliographic Details
Main Authors: Qiao, Yuxin, Li, Keqin, Lin, Junhong, Wei, Rong, Jiang, Chufeng, Luo, Yang, Yang, Haoyu
Format: Preprint
Published: 2024
Subjects:
Online Access:
Tags: Add Tag
No Tags, Be the first to tag this record!
_version_ 1866909284582817792
author Qiao, Yuxin
Li, Keqin
Lin, Junhong
Wei, Rong
Jiang, Chufeng
Luo, Yang
Yang, Haoyu
author_facet Qiao, Yuxin
Li, Keqin
Lin, Junhong
Wei, Rong
Jiang, Chufeng
Luo, Yang
Yang, Haoyu
contents In multi-label classification, machine learning encounters the challenge of domain generalization when handling tasks with distributions differing from the training data. Existing approaches primarily focus on vision object recognition and neglect the integration of natural language. Recent advancements in vision-language pre-training leverage supervision from extensive visual-language pairs, enabling learning across diverse domains and enhancing recognition in multi-modal scenarios. However, these approaches face limitations in loss function utilization, generality across backbones, and class-aware visual fusion. This paper proposes solutions to these limitations by inferring the actual loss, broadening evaluations to larger vision-language backbones, and introducing Mixup-CLIPood, which incorporates a novel mix-up loss for enhanced class-aware visual fusion. Our method demonstrates superior performance in domain generalization across multiple datasets.
format Preprint
id arxiv_https___arxiv_org_abs_2408_05831
institution arXiv
publishDate 2024
record_format arxiv
spellingShingle Robust Domain Generalization for Multi-modal Object Recognition
Qiao, Yuxin
Li, Keqin
Lin, Junhong
Wei, Rong
Jiang, Chufeng
Luo, Yang
Yang, Haoyu
Computer Vision and Pattern Recognition
Artificial Intelligence
In multi-label classification, machine learning encounters the challenge of domain generalization when handling tasks with distributions differing from the training data. Existing approaches primarily focus on vision object recognition and neglect the integration of natural language. Recent advancements in vision-language pre-training leverage supervision from extensive visual-language pairs, enabling learning across diverse domains and enhancing recognition in multi-modal scenarios. However, these approaches face limitations in loss function utilization, generality across backbones, and class-aware visual fusion. This paper proposes solutions to these limitations by inferring the actual loss, broadening evaluations to larger vision-language backbones, and introducing Mixup-CLIPood, which incorporates a novel mix-up loss for enhanced class-aware visual fusion. Our method demonstrates superior performance in domain generalization across multiple datasets.
title Robust Domain Generalization for Multi-modal Object Recognition
topic Computer Vision and Pattern Recognition
Artificial Intelligence
url https://arxiv.org/abs/2408.05831