Demonstrating and Reducing Shortcuts in Vision-Language Representation Learning
Fuente:
arXiv
Salvato in:
| Autori principali: | Bleeker, Maurits, Hendriksen, Mariya, Yates, Andrew, de Rijke, Maarten |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Multimodal Learned Sparse Retrieval with Probabilistic Expansion Control
di: Nguyen, Thong, et al.
Pubblicazione: (2024)
di: Nguyen, Thong, et al.
Pubblicazione: (2024)
Benchmark Granularity and Model Robustness for Image-Text Retrieval
di: Hendriksen, Mariya, et al.
Pubblicazione: (2024)
di: Hendriksen, Mariya, et al.
Pubblicazione: (2024)
Adapting Vision-Language Models for Evaluating World Models
di: Hendriksen, Mariya, et al.
Pubblicazione: (2025)
di: Hendriksen, Mariya, et al.
Pubblicazione: (2025)
Preventing Shortcuts in Adapter Training via Providing the Shortcuts
di: Goyal, Anujraaj Argo, et al.
Pubblicazione: (2025)
di: Goyal, Anujraaj Argo, et al.
Pubblicazione: (2025)
Enhancing the Safety of Medical Vision-Language Models by Synthetic Demonstrations
di: Xue, Zhiyu, et al.
Pubblicazione: (2025)
di: Xue, Zhiyu, et al.
Pubblicazione: (2025)
The Cartesian Shortcut: Re-evaluate Vision Reasoning in Polar Coordinate Space
di: Hu, Xia, et al.
Pubblicazione: (2026)
di: Hu, Xia, et al.
Pubblicazione: (2026)
CLIP is All You Need for Human-like Semantic Representations in Stable Diffusion
di: Braunstein, Cameron, et al.
Pubblicazione: (2025)
di: Braunstein, Cameron, et al.
Pubblicazione: (2025)
Advancing Multimodal In-Context Learning in Large Vision-Language Models with Task-aware Demonstrations
di: Li, Yanshu
Pubblicazione: (2025)
di: Li, Yanshu
Pubblicazione: (2025)
Sparse Shortcuts: Facilitating Efficient Fusion in Multimodal Large Language Models
di: Zhang, Jingrui, et al.
Pubblicazione: (2026)
di: Zhang, Jingrui, et al.
Pubblicazione: (2026)
BackMix: Mitigating Shortcut Learning in Echocardiography with Minimal Supervision
di: Bransby, Kit Mills, et al.
Pubblicazione: (2024)
di: Bransby, Kit Mills, et al.
Pubblicazione: (2024)
Towards Cross-modal Backward-compatible Representation Learning for Vision-Language Models
di: Jang, Young Kyun, et al.
Pubblicazione: (2024)
di: Jang, Young Kyun, et al.
Pubblicazione: (2024)
The Geometry of Representational Failures in Vision Language Models
di: Savietto, Daniele, et al.
Pubblicazione: (2026)
di: Savietto, Daniele, et al.
Pubblicazione: (2026)
Learning to Detour: Shortcut Mitigating Augmentation for Weakly Supervised Semantic Segmentation
di: Kwon, JuneHyoung, et al.
Pubblicazione: (2024)
di: Kwon, JuneHyoung, et al.
Pubblicazione: (2024)
Representation Calibration and Uncertainty Guidance for Class-Incremental Learning based on Vision Language Model
di: Tan, Jiantao, et al.
Pubblicazione: (2025)
di: Tan, Jiantao, et al.
Pubblicazione: (2025)
CAPT: Confusion-Aware Prompt Tuning for Reducing Vision-Language Misalignment
di: Shao, Maoyuan, et al.
Pubblicazione: (2026)
di: Shao, Maoyuan, et al.
Pubblicazione: (2026)
Invisible Attributes, Visible Biases: Exploring Demographic Shortcuts in MRI-based Alzheimer's Disease Classification
di: Achara, Akshit, et al.
Pubblicazione: (2025)
di: Achara, Akshit, et al.
Pubblicazione: (2025)
TopoPerception: A Shortcut-Free Evaluation of Global Visual Perception in Large Vision-Language Models
di: Zhou, Wenhao, et al.
Pubblicazione: (2025)
di: Zhou, Wenhao, et al.
Pubblicazione: (2025)
Can Machines Imitate Humans? Integrative Turing-like tests for Language and Vision Demonstrate a Narrowing Gap
di: Zhang, Mengmi, et al.
Pubblicazione: (2022)
di: Zhang, Mengmi, et al.
Pubblicazione: (2022)
GTMA: Dynamic Representation Optimization for OOD Vision-Language Models
di: Zhang, Jensen, et al.
Pubblicazione: (2025)
di: Zhang, Jensen, et al.
Pubblicazione: (2025)
KP-INR: A Dual-Branch Implicit Neural Representation Model for Cardiac Cine MRI Reconstruction
di: Lyu, Donghang, et al.
Pubblicazione: (2025)
di: Lyu, Donghang, et al.
Pubblicazione: (2025)
Suppressing Forgery-Specific Shortcuts for Generalizable Deepfake Detection
di: Wang, Yihui, et al.
Pubblicazione: (2026)
di: Wang, Yihui, et al.
Pubblicazione: (2026)
Shortcut Learning in Generalist Robot Policies: The Role of Dataset Diversity and Fragmentation
di: Xing, Youguang, et al.
Pubblicazione: (2025)
di: Xing, Youguang, et al.
Pubblicazione: (2025)
Masked Modeling for Self-supervised Representation Learning on Vision and Beyond
di: Li, Siyuan, et al.
Pubblicazione: (2023)
di: Li, Siyuan, et al.
Pubblicazione: (2023)
Audio-centric Video Understanding Benchmark without Text Shortcut
di: Yang, Yudong, et al.
Pubblicazione: (2025)
di: Yang, Yudong, et al.
Pubblicazione: (2025)
A Simple and Effective Reinforcement Learning Method for Text-to-Image Diffusion Fine-tuning
di: Gupta, Shashank, et al.
Pubblicazione: (2025)
di: Gupta, Shashank, et al.
Pubblicazione: (2025)
Vision-Language Models Provide Promptable Representations for Reinforcement Learning
di: Chen, William, et al.
Pubblicazione: (2024)
di: Chen, William, et al.
Pubblicazione: (2024)
GA-VLN: Geometry-Aware BEV Representation for Efficient Vision-Language Navigation
di: Yang, Jiahao, et al.
Pubblicazione: (2026)
di: Yang, Jiahao, et al.
Pubblicazione: (2026)
HarmoCLIP: Harmonizing Global and Regional Representations in Contrastive Vision-Language Models
di: Zeng, Haoxi, et al.
Pubblicazione: (2025)
di: Zeng, Haoxi, et al.
Pubblicazione: (2025)
Time Series, Vision, and Language: Exploring the Limits of Alignment in Contrastive Representation Spaces
di: Yashwante, Pratham, et al.
Pubblicazione: (2026)
di: Yashwante, Pratham, et al.
Pubblicazione: (2026)
The Multi-View Paradigm Shift in MRI Radiomics: Predicting MGMT Methylation in Glioblastoma
di: Miteva, Mariya, et al.
Pubblicazione: (2025)
di: Miteva, Mariya, et al.
Pubblicazione: (2025)
StarVLA-$α$: Reducing Complexity in Vision-Language-Action Systems
di: Ye, Jinhui, et al.
Pubblicazione: (2026)
di: Ye, Jinhui, et al.
Pubblicazione: (2026)
Mitigating Shortcut Learning with Diffusion Counterfactuals and Diverse Ensembles
di: Scimeca, Luca, et al.
Pubblicazione: (2023)
di: Scimeca, Luca, et al.
Pubblicazione: (2023)
Learning Compositional Behaviors from Demonstration and Language
di: Liu, Weiyu, et al.
Pubblicazione: (2025)
di: Liu, Weiyu, et al.
Pubblicazione: (2025)
Self-Consistency as a Free Lunch: Reducing Hallucinations in Vision-Language Models via Self-Reflection
di: Han, Mingfei, et al.
Pubblicazione: (2025)
di: Han, Mingfei, et al.
Pubblicazione: (2025)
REB: Reducing Biases in Representation for Industrial Anomaly Detection
di: Lyu, Shuai, et al.
Pubblicazione: (2023)
di: Lyu, Shuai, et al.
Pubblicazione: (2023)
Preventing Shortcut Learning in Medical Image Analysis through Intermediate Layer Knowledge Distillation from Specialist Teachers
di: Boland, Christopher, et al.
Pubblicazione: (2025)
di: Boland, Christopher, et al.
Pubblicazione: (2025)
Exposing Image Classifier Shortcuts with Counterfactual Frequency (CoF) Tables
di: Hinns, James, et al.
Pubblicazione: (2024)
di: Hinns, James, et al.
Pubblicazione: (2024)
LVDrive: Latent Visual Representation Enhanced Vision-Language-Action Autonomous Driving Model
di: Mei, Xiaodong, et al.
Pubblicazione: (2026)
di: Mei, Xiaodong, et al.
Pubblicazione: (2026)
Learning Emergent Modular Representations in Multi-modality Medical Vision Foundation Models
di: He, Yuting, et al.
Pubblicazione: (2026)
di: He, Yuting, et al.
Pubblicazione: (2026)
MedUnifier: Unifying Vision-and-Language Pre-training on Medical Data with Vision Generation Task using Discrete Visual Representations
di: Zhang, Ziyang, et al.
Pubblicazione: (2025)
di: Zhang, Ziyang, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Multimodal Learned Sparse Retrieval with Probabilistic Expansion Control
di: Nguyen, Thong, et al.
Pubblicazione: (2024) -
Benchmark Granularity and Model Robustness for Image-Text Retrieval
di: Hendriksen, Mariya, et al.
Pubblicazione: (2024) -
Adapting Vision-Language Models for Evaluating World Models
di: Hendriksen, Mariya, et al.
Pubblicazione: (2025) -
Preventing Shortcuts in Adapter Training via Providing the Shortcuts
di: Goyal, Anujraaj Argo, et al.
Pubblicazione: (2025) -
Enhancing the Safety of Medical Vision-Language Models by Synthetic Demonstrations
di: Xue, Zhiyu, et al.
Pubblicazione: (2025)