MASS: Overcoming Language Bias in Image-Text Matching
Fuente:
arXiv
Saved in:
| Main Authors: | Chung, Jiwan, Lim, Seungwon, Lee, Sangkyu, Yu, Youngjae |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Can visual language models resolve textual ambiguity with visual cues? Let visual puns tell you!
by: Chung, Jiwan, et al.
Published: (2024)
by: Chung, Jiwan, et al.
Published: (2024)
Teaching Metric Distance to Discrete Autoregressive Language Models
by: Chung, Jiwan, et al.
Published: (2025)
by: Chung, Jiwan, et al.
Published: (2025)
Speaking Beyond Language: A Large-Scale Multimodal Dataset for Learning Nonverbal Cues from Video-Grounded Dialogues
by: Kim, Youngmin, et al.
Published: (2025)
by: Kim, Youngmin, et al.
Published: (2025)
Towards Visual Text Design Transfer Across Languages
by: Choi, Yejin, et al.
Published: (2024)
by: Choi, Yejin, et al.
Published: (2024)
CovMatch: Cross-Covariance Guided Multimodal Dataset Distillation with Trainable Text Encoder
by: Lee, Yongmin, et al.
Published: (2025)
by: Lee, Yongmin, et al.
Published: (2025)
CANVAS: Commonsense-Aware Navigation System for Intuitive Human-Robot Interaction
by: Choi, Suhwan, et al.
Published: (2024)
by: Choi, Suhwan, et al.
Published: (2024)
SelMatch: Effectively Scaling Up Dataset Distillation via Selection-Based Initialization and Partial Updates by Trajectory Matching
by: Lee, Yongmin, et al.
Published: (2024)
by: Lee, Yongmin, et al.
Published: (2024)
BiasConnect: Investigating Bias Interactions in Text-to-Image Models
by: Shukla, Pushkar, et al.
Published: (2025)
by: Shukla, Pushkar, et al.
Published: (2025)
Specify and Edit: Overcoming Ambiguity in Text-Based Image Editing
by: Iakovleva, Ekaterina, et al.
Published: (2024)
by: Iakovleva, Ekaterina, et al.
Published: (2024)
Active Learning for Finely-Categorized Image-Text Retrieval by Selecting Hard Negative Unpaired Samples
by: Jo, Dae Ung, et al.
Published: (2024)
by: Jo, Dae Ung, et al.
Published: (2024)
Model-Agnostic Gender Bias Control for Text-to-Image Generation via Sparse Autoencoder
by: Wu, Chao, et al.
Published: (2025)
by: Wu, Chao, et al.
Published: (2025)
FameBias: Embedding Manipulation Bias Attack in Text-to-Image Models
by: Roh, Jaechul, et al.
Published: (2024)
by: Roh, Jaechul, et al.
Published: (2024)
Alignment-Guided Score Matching for Text-to-Image Alignment in Diffusion Models
by: Lee, Jaa-Yeon, et al.
Published: (2026)
by: Lee, Jaa-Yeon, et al.
Published: (2026)
VAGUE: Visual Contexts Clarify Ambiguous Expressions
by: Nam, Heejeong, et al.
Published: (2024)
by: Nam, Heejeong, et al.
Published: (2024)
Advanced Multimodal Deep Learning Architecture for Image-Text Matching
by: Wang, Jinyin, et al.
Published: (2024)
by: Wang, Jinyin, et al.
Published: (2024)
FairImagen: Post-Processing for Bias Mitigation in Text-to-Image Models
by: Fu, Zihao, et al.
Published: (2025)
by: Fu, Zihao, et al.
Published: (2025)
Interaction Field Matching: Overcoming Limitations of Electrostatic Models
by: Manukhov, Stepan I., et al.
Published: (2025)
by: Manukhov, Stepan I., et al.
Published: (2025)
BiasMap: Leveraging Cross-Attentions to Discover and Mitigate Hidden Social Biases in Text-to-Image Generation
by: Chakraborty, Rajatsubhra, et al.
Published: (2025)
by: Chakraborty, Rajatsubhra, et al.
Published: (2025)
Aligned but Stereotypical? The Hidden Influence of System Prompts on Social Bias in LVLM-Based Text-to-Image Models
by: Park, NaHyeon, et al.
Published: (2025)
by: Park, NaHyeon, et al.
Published: (2025)
Overcome Modal Bias in Multi-modal Federated Learning via Balanced Modality Selection
by: Fan, Yunfeng, et al.
Published: (2023)
by: Fan, Yunfeng, et al.
Published: (2023)
CVA: Context-aware Video-text Alignment for Video Temporal Grounding
by: Moon, Sungho, et al.
Published: (2026)
by: Moon, Sungho, et al.
Published: (2026)
Mitigating the Bias in the Model for Continual Test-Time Adaptation
by: Chung, Inseop, et al.
Published: (2024)
by: Chung, Inseop, et al.
Published: (2024)
Receler: Reliable Concept Erasing of Text-to-Image Diffusion Models via Lightweight Erasers
by: Huang, Chi-Pin, et al.
Published: (2023)
by: Huang, Chi-Pin, et al.
Published: (2023)
v1: Learning to Point Visual Tokens for Multimodal Grounded Reasoning
by: Chung, Jiwan, et al.
Published: (2025)
by: Chung, Jiwan, et al.
Published: (2025)
PMPGuard: Catching Pseudo-Matched Pairs in Remote Sensing Image-Text Retrieval
by: Ouyang, Pengxiang, et al.
Published: (2025)
by: Ouyang, Pengxiang, et al.
Published: (2025)
Concept Pinpoint Eraser for Text-to-image Diffusion Models via Residual Attention Gate
by: Lee, Byung Hyun, et al.
Published: (2025)
by: Lee, Byung Hyun, et al.
Published: (2025)
CoreMatching: A Co-adaptive Sparse Inference Framework with Token and Neuron Pruning for Comprehensive Acceleration of Vision-Language Models
by: Wang, Qinsi, et al.
Published: (2025)
by: Wang, Qinsi, et al.
Published: (2025)
Learned Image Compression with Text Quality Enhancement
by: Lai, Chih-Yu, et al.
Published: (2024)
by: Lai, Chih-Yu, et al.
Published: (2024)
Rate-Adaptive Quantization: A Multi-Rate Codebook Adaptation for Vector Quantization-based Generative Models
by: Seo, Jiwan, et al.
Published: (2024)
by: Seo, Jiwan, et al.
Published: (2024)
Operationalizing Fairness in Text-to-Image Models: A Survey of Bias, Fairness Audits and Mitigation Strategies
by: Smith, Megan, et al.
Published: (2026)
by: Smith, Megan, et al.
Published: (2026)
Hidden Bias in the Machine: Stereotypes in Text-to-Image Models
by: Porikli, Sedat, et al.
Published: (2025)
by: Porikli, Sedat, et al.
Published: (2025)
Data Attribution for Text-to-Image Models by Unlearning Synthesized Images
by: Wang, Sheng-Yu, et al.
Published: (2024)
by: Wang, Sheng-Yu, et al.
Published: (2024)
DMQ: Dissecting Outliers of Diffusion Models for Post-Training Quantization
by: Lee, Dongyeun, et al.
Published: (2025)
by: Lee, Dongyeun, et al.
Published: (2025)
Bias Analysis in Unconditional Image Generative Models
by: Zhang, Xiaofeng, et al.
Published: (2025)
by: Zhang, Xiaofeng, et al.
Published: (2025)
Dual-Granularity Cross-Modal Identity Association for Weakly-Supervised Text-to-Person Image Matching
by: Zhang, Yafei, et al.
Published: (2025)
by: Zhang, Yafei, et al.
Published: (2025)
ReflexSplit: Single Image Reflection Separation via Layer Fusion-Separation
by: Lee, Chia-Ming, et al.
Published: (2026)
by: Lee, Chia-Ming, et al.
Published: (2026)
Selective Vision is the Challenge for Visual Reasoning: A Benchmark for Visual Argument Understanding
by: Chung, Jiwan, et al.
Published: (2024)
by: Chung, Jiwan, et al.
Published: (2024)
Fast Data Attribution for Text-to-Image Models
by: Wang, Sheng-Yu, et al.
Published: (2025)
by: Wang, Sheng-Yu, et al.
Published: (2025)
Training-free Editioning of Text-to-Image Models
by: Wang, Jinqi, et al.
Published: (2024)
by: Wang, Jinqi, et al.
Published: (2024)
Neural Image Compression with Text-guided Encoding for both Pixel-level and Perceptual Fidelity
by: Lee, Hagyeong, et al.
Published: (2024)
by: Lee, Hagyeong, et al.
Published: (2024)
Similar Items
-
Can visual language models resolve textual ambiguity with visual cues? Let visual puns tell you!
by: Chung, Jiwan, et al.
Published: (2024) -
Teaching Metric Distance to Discrete Autoregressive Language Models
by: Chung, Jiwan, et al.
Published: (2025) -
Speaking Beyond Language: A Large-Scale Multimodal Dataset for Learning Nonverbal Cues from Video-Grounded Dialogues
by: Kim, Youngmin, et al.
Published: (2025) -
Towards Visual Text Design Transfer Across Languages
by: Choi, Yejin, et al.
Published: (2024) -
CovMatch: Cross-Covariance Guided Multimodal Dataset Distillation with Trainable Text Encoder
by: Lee, Yongmin, et al.
Published: (2025)