Contrastive Visual Data Augmentation
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhou, Yu, Li, Bingxuan, Tang, Mohan, Jin, Xiaomeng, Wu, Te-Lin, Huang, Kuan-Hao, Ji, Heng, Chang, Kai-Wei, Peng, Nanyun |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
REAL: Realism Evaluation of Text-to-Image Generation Models for Effective Data Augmentation
di: Li, Ran, et al.
Pubblicazione: (2025)
di: Li, Ran, et al.
Pubblicazione: (2025)
Learning Contrastive Self-Distillation for Ultra-Fine-Grained Visual Categorization Targeting Limited Samples
di: Fang, Ziye, et al.
Pubblicazione: (2023)
di: Fang, Ziye, et al.
Pubblicazione: (2023)
VisAug: Facilitating Speech-Rich Web Video Navigation and Engagement with Auto-Generated Visual Augmentations
di: Zhao, Baoquan, et al.
Pubblicazione: (2025)
di: Zhao, Baoquan, et al.
Pubblicazione: (2025)
StableDub: Taming Diffusion Prior for Generalized and Efficient Visual Dubbing
di: Chen, Liyang, et al.
Pubblicazione: (2025)
di: Chen, Liyang, et al.
Pubblicazione: (2025)
Instruction-Grounded Visual Projectors for Continual Learning of Generative Vision-Language Models
di: Jin, Hyundong, et al.
Pubblicazione: (2025)
di: Jin, Hyundong, et al.
Pubblicazione: (2025)
Coordinated 2D-3D Visualization of Volumetric Medical Data in XR with Multimodal Interactions
di: Liu, Qixuan, et al.
Pubblicazione: (2025)
di: Liu, Qixuan, et al.
Pubblicazione: (2025)
ARMADA: Attribute-Based Multimodal Data Augmentation
di: Jin, Xiaomeng, et al.
Pubblicazione: (2024)
di: Jin, Xiaomeng, et al.
Pubblicazione: (2024)
Towards Pretraining Robust ASR Foundation Model with Acoustic-Aware Data Augmentation
di: Liu, Dancheng, et al.
Pubblicazione: (2025)
di: Liu, Dancheng, et al.
Pubblicazione: (2025)
MMAPS: End-to-End Multi-Grained Multi-Modal Attribute-Aware Product Summarization
di: Chen, Tao, et al.
Pubblicazione: (2023)
di: Chen, Tao, et al.
Pubblicazione: (2023)
Ask Questions with Double Hints: Visual Question Generation with Answer-awareness and Region-reference
di: Shen, Kai, et al.
Pubblicazione: (2024)
di: Shen, Kai, et al.
Pubblicazione: (2024)
Fit and Prune: Fast and Training-free Visual Token Pruning for Multi-modal Large Language Models
di: Ye, Weihao, et al.
Pubblicazione: (2024)
di: Ye, Weihao, et al.
Pubblicazione: (2024)
Embodied Web Agents: Bridging Physical-Digital Realms for Integrated Agent Intelligence
di: Hong, Yining, et al.
Pubblicazione: (2025)
di: Hong, Yining, et al.
Pubblicazione: (2025)
Towards Flexible Evaluation for Generative Visual Question Answering
di: Ji, Huishan, et al.
Pubblicazione: (2024)
di: Ji, Huishan, et al.
Pubblicazione: (2024)
EAR: Enhancing Uni-Modal Representations for Weakly Supervised Audio-Visual Video Parsing
di: Li, Huilai, et al.
Pubblicazione: (2026)
di: Li, Huilai, et al.
Pubblicazione: (2026)
Synthetic Perception: Can Generated Images Unlock Latent Visual Prior for Text-Centric Reasoning?
di: Huang, Yuesheng, et al.
Pubblicazione: (2025)
di: Huang, Yuesheng, et al.
Pubblicazione: (2025)
Contrast then Memorize: Semantic Neighbor Retrieval-Enhanced Inductive Multimodal Knowledge Graph Completion
di: Zhao, Yu, et al.
Pubblicazione: (2024)
di: Zhao, Yu, et al.
Pubblicazione: (2024)
Not All Attention is Needed: Parameter and Computation Efficient Transfer Learning for Multi-modal Large Language Models
di: Wu, Qiong, et al.
Pubblicazione: (2024)
di: Wu, Qiong, et al.
Pubblicazione: (2024)
Dependency Structure Augmented Contextual Scoping Framework for Multimodal Aspect-Based Sentiment Analysis
di: Liu, Hao, et al.
Pubblicazione: (2025)
di: Liu, Hao, et al.
Pubblicazione: (2025)
Visual Set Program Synthesizer
di: Cheng, Zehua, et al.
Pubblicazione: (2026)
di: Cheng, Zehua, et al.
Pubblicazione: (2026)
MindCross: Fast New Subject Adaptation with Limited Data for Cross-subject Video Reconstruction from Brain Signals
di: Liu, Xuan-Hao, et al.
Pubblicazione: (2025)
di: Liu, Xuan-Hao, et al.
Pubblicazione: (2025)
TeleAntiFraud-28k: An Audio-Text Slow-Thinking Dataset for Telecom Fraud Detection
di: Ma, Zhiming, et al.
Pubblicazione: (2025)
di: Ma, Zhiming, et al.
Pubblicazione: (2025)
ContextBLIP: Doubly Contextual Alignment for Contrastive Image Retrieval from Linguistically Complex Descriptions
di: Lin, Honglin, et al.
Pubblicazione: (2024)
di: Lin, Honglin, et al.
Pubblicazione: (2024)
Delving Deeper: Hierarchical Visual Perception for Robust Video-Text Retrieval
di: Xie, Zequn, et al.
Pubblicazione: (2026)
di: Xie, Zequn, et al.
Pubblicazione: (2026)
Accelerating Multimodal Large Language Models via Dynamic Visual-Token Exit and the Empirical Findings
di: Wu, Qiong, et al.
Pubblicazione: (2024)
di: Wu, Qiong, et al.
Pubblicazione: (2024)
CvhSlicer 2.0: Immersive and Interactive Visualization of Chinese Visible Human Data in XR Environments
di: Qiu, Yue, et al.
Pubblicazione: (2025)
di: Qiu, Yue, et al.
Pubblicazione: (2025)
CMATH: Cross-Modality Augmented Transformer with Hierarchical Variational Distillation for Multimodal Emotion Recognition in Conversation
di: Zhu, Xiaofei, et al.
Pubblicazione: (2024)
di: Zhu, Xiaofei, et al.
Pubblicazione: (2024)
Memento: Augmenting Personalized Memory via Practical Multimodal Wearable Sensing in Visual Search and Wayfinding Navigation
di: Ghosh, Indrajeet, et al.
Pubblicazione: (2025)
di: Ghosh, Indrajeet, et al.
Pubblicazione: (2025)
LipGen: Viseme-Guided Lip Video Generation for Enhancing Visual Speech Recognition
di: Hao, Bowen, et al.
Pubblicazione: (2025)
di: Hao, Bowen, et al.
Pubblicazione: (2025)
SequencePAR: Understanding Pedestrian Attributes via A Sequence Generation Paradigm
di: Jin, Jiandong, et al.
Pubblicazione: (2023)
di: Jin, Jiandong, et al.
Pubblicazione: (2023)
Positive-Augmented Contrastive Learning for Vision-and-Language Evaluation and Training
di: Sarto, Sara, et al.
Pubblicazione: (2024)
di: Sarto, Sara, et al.
Pubblicazione: (2024)
CustomContrast: A Multilevel Contrastive Perspective For Subject-Driven Text-to-Image Customization
di: Chen, Nan, et al.
Pubblicazione: (2024)
di: Chen, Nan, et al.
Pubblicazione: (2024)
Omni-Captioner: Data Pipeline, Models, and Benchmark for Omni Detailed Perception
di: Ma, Ziyang, et al.
Pubblicazione: (2025)
di: Ma, Ziyang, et al.
Pubblicazione: (2025)
Arena: A Patch-of-Interest ViT Inference Acceleration System for Edge-Assisted Video Analytics
di: Peng, Haosong, et al.
Pubblicazione: (2024)
di: Peng, Haosong, et al.
Pubblicazione: (2024)
Not Just What's There: Enabling CLIP to Comprehend Negated Visual Descriptions Without Fine-tuning
di: Xiao, Junhao, et al.
Pubblicazione: (2026)
di: Xiao, Junhao, et al.
Pubblicazione: (2026)
SpeechCraft: A Fine-grained Expressive Speech Dataset with Natural Language Description
di: Jin, Zeyu, et al.
Pubblicazione: (2024)
di: Jin, Zeyu, et al.
Pubblicazione: (2024)
MaVEn: An Effective Multi-granularity Hybrid Visual Encoding Framework for Multimodal Large Language Model
di: Jiang, Chaoya, et al.
Pubblicazione: (2024)
di: Jiang, Chaoya, et al.
Pubblicazione: (2024)
History-Guided Iterative Visual Reasoning with Self-Correction
di: Yang, Xinglong, et al.
Pubblicazione: (2026)
di: Yang, Xinglong, et al.
Pubblicazione: (2026)
Augment Before Copy-Paste: Data and Memory Efficiency-Oriented Instance Segmentation Framework for Sport-scenes
di: Hsu, Chih-Chung, et al.
Pubblicazione: (2024)
di: Hsu, Chih-Chung, et al.
Pubblicazione: (2024)
Patch-level Sounding Object Tracking for Audio-Visual Question Answering
di: Li, Zhangbin, et al.
Pubblicazione: (2024)
di: Li, Zhangbin, et al.
Pubblicazione: (2024)
Where Does Vision Meet Language? Understanding and Refining Visual Fusion in MLLMs via Contrastive Attention
di: Song, Shezheng, et al.
Pubblicazione: (2026)
di: Song, Shezheng, et al.
Pubblicazione: (2026)
Documenti analoghi
-
REAL: Realism Evaluation of Text-to-Image Generation Models for Effective Data Augmentation
di: Li, Ran, et al.
Pubblicazione: (2025) -
Learning Contrastive Self-Distillation for Ultra-Fine-Grained Visual Categorization Targeting Limited Samples
di: Fang, Ziye, et al.
Pubblicazione: (2023) -
VisAug: Facilitating Speech-Rich Web Video Navigation and Engagement with Auto-Generated Visual Augmentations
di: Zhao, Baoquan, et al.
Pubblicazione: (2025) -
StableDub: Taming Diffusion Prior for Generalized and Efficient Visual Dubbing
di: Chen, Liyang, et al.
Pubblicazione: (2025) -
Instruction-Grounded Visual Projectors for Continual Learning of Generative Vision-Language Models
di: Jin, Hyundong, et al.
Pubblicazione: (2025)