Bi-MCQ: Reformulating Vision-Language Alignment for Negation Understanding
Fuente:
arXiv
Saved in:
| Main Authors: | Kim, Tae Hun, Lee, Hyun Gyu |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Topological Alignment of Shared Vision-Language Embedding Space
by: You, Junwon, et al.
Published: (2025)
by: You, Junwon, et al.
Published: (2025)
Topology-Aware Representation Alignment for Semi-Supervised Vision-Language Learning
by: You, Junwon, et al.
Published: (2026)
by: You, Junwon, et al.
Published: (2026)
ERGO: Efficient High-Resolution Visual Understanding for Vision-Language Models
by: Lee, Jewon, et al.
Published: (2025)
by: Lee, Jewon, et al.
Published: (2025)
Towards Gradient-based Time-Series Explanations through a SpatioTemporal Attention Network
by: Lee, Min Hun
Published: (2024)
by: Lee, Min Hun
Published: (2024)
An Unsupervised Tensor-Based Domain Alignment
by: Lee, Chong Hyun, et al.
Published: (2026)
by: Lee, Chong Hyun, et al.
Published: (2026)
Negative Label Guided OOD Detection with Pretrained Vision-Language Models
by: Jiang, Xue, et al.
Published: (2024)
by: Jiang, Xue, et al.
Published: (2024)
Ultrasound Vision-Language Alignment via Contrastive Learning
by: Lyu, Zhuoyang, et al.
Published: (2026)
by: Lyu, Zhuoyang, et al.
Published: (2026)
Attention Guided Alignment in Efficient Vision-Language Models
by: Mahajan, Shweta, et al.
Published: (2025)
by: Mahajan, Shweta, et al.
Published: (2025)
Improved Alignment of Modalities in Large Vision Language Models
by: Jangra, Kartik, et al.
Published: (2025)
by: Jangra, Kartik, et al.
Published: (2025)
Measurement-Consistent Langevin Corrector for Stabilizing Latent Diffusion Inverse Problem Solvers
by: Hyoseok, Lee, et al.
Published: (2026)
by: Hyoseok, Lee, et al.
Published: (2026)
Understanding Task Transfer in Vision-Language Models
by: Sachdeva, Bhuvan, et al.
Published: (2025)
by: Sachdeva, Bhuvan, et al.
Published: (2025)
NegVQA: Can Vision Language Models Understand Negation?
by: Zhang, Yuhui, et al.
Published: (2025)
by: Zhang, Yuhui, et al.
Published: (2025)
Efficient LLaMA-3.2-Vision by Trimming Cross-attended Visual Features
by: Lee, Jewon, et al.
Published: (2025)
by: Lee, Jewon, et al.
Published: (2025)
Fine-Grained Alignment in Vision-and-Language Navigation through Bayesian Optimization
by: Song, Yuhang, et al.
Published: (2024)
by: Song, Yuhang, et al.
Published: (2024)
Dynamic Scene Understanding from Vision-Language Representations
by: Pruss, Shahaf, et al.
Published: (2025)
by: Pruss, Shahaf, et al.
Published: (2025)
ZIP: An Efficient Zeroth-order Prompt Tuning for Black-box Vision-Language Models
by: Park, Seonghwan, et al.
Published: (2025)
by: Park, Seonghwan, et al.
Published: (2025)
Debiased Negative Mining Improves Out-of-distribution Detection with Pre-trained Vision-Language Models
by: Peng, Bo, et al.
Published: (2026)
by: Peng, Bo, et al.
Published: (2026)
Visual Perturbation and Adaptive Hard Negative Contrastive Learning for Compositional Reasoning in Vision-Language Models
by: Huang, Xin, et al.
Published: (2025)
by: Huang, Xin, et al.
Published: (2025)
DarkQA: Benchmarking Vision-Language Models on Visual-Primitive Question Answering in Low-Light Indoor Scenes
by: Park, Yohan, et al.
Published: (2025)
by: Park, Yohan, et al.
Published: (2025)
Analyzing Fine-Grained Alignment and Enhancing Vision Understanding in Multimodal Language Models
by: Jiang, Jiachen, et al.
Published: (2025)
by: Jiang, Jiachen, et al.
Published: (2025)
FLAVARS: A Multimodal Foundational Language and Vision Alignment Model for Remote Sensing
by: Corley, Isaac, et al.
Published: (2025)
by: Corley, Isaac, et al.
Published: (2025)
Improving Adversarial Transferability in MLLMs via Dynamic Vision-Language Alignment Attack
by: Gu, Chenhe, et al.
Published: (2025)
by: Gu, Chenhe, et al.
Published: (2025)
Towards Understanding How Knowledge Evolves in Large Vision-Language Models
by: Wang, Sudong, et al.
Published: (2025)
by: Wang, Sudong, et al.
Published: (2025)
Graph Neural Networks in Vision-Language Image Understanding: A Survey
by: Senior, Henry, et al.
Published: (2023)
by: Senior, Henry, et al.
Published: (2023)
Parallel Tempering Initial Sampling in Inference-Time Reward Alignment
by: Oh, Myeongjun, et al.
Published: (2026)
by: Oh, Myeongjun, et al.
Published: (2026)
VL-SAE: Interpreting and Enhancing Vision-Language Alignment with a Unified Concept Set
by: Shen, Shufan, et al.
Published: (2025)
by: Shen, Shufan, et al.
Published: (2025)
Decoupling Augmentation Bias in Prompt Learning for Vision-Language Models
by: Kim, Gahyeon, et al.
Published: (2025)
by: Kim, Gahyeon, et al.
Published: (2025)
AAPL: Adding Attributes to Prompt Learning for Vision-Language Models
by: Kim, Gahyeon, et al.
Published: (2024)
by: Kim, Gahyeon, et al.
Published: (2024)
LLM-Guided Diagnostic Evidence Alignment for Medical Vision-Language Pretraining under Limited Pairing
by: Yan, Huimin, et al.
Published: (2026)
by: Yan, Huimin, et al.
Published: (2026)
U2-BENCH: Benchmarking Large Vision-Language Models on Ultrasound Understanding
by: Le, Anjie, et al.
Published: (2025)
by: Le, Anjie, et al.
Published: (2025)
Data Selection for Fine-tuning Vision Language Models via Cross Modal Alignment Trajectories
by: Naharas, Nilay, et al.
Published: (2025)
by: Naharas, Nilay, et al.
Published: (2025)
Handling Imbalanced Pseudolabels for Vision-Language Models with Concept Alignment and Confusion-Aware Calibrated Margin
by: Wang, Yuchen, et al.
Published: (2025)
by: Wang, Yuchen, et al.
Published: (2025)
BiVLC: Extending Vision-Language Compositionality Evaluation with Text-to-Image Retrieval
by: Miranda, Imanol, et al.
Published: (2024)
by: Miranda, Imanol, et al.
Published: (2024)
FALCON: False-Negative Aware Learning of Contrastive Negatives in Vision-Language Alignment
by: Kim, Myunsoo, et al.
Published: (2025)
by: Kim, Myunsoo, et al.
Published: (2025)
Bridging Vision and Language Spaces with Assignment Prediction
by: Park, Jungin, et al.
Published: (2024)
by: Park, Jungin, et al.
Published: (2024)
Understanding the Effects of Distractors on Reasoning Vision-Language Models
by: Bae, Jiyun, et al.
Published: (2025)
by: Bae, Jiyun, et al.
Published: (2025)
STELLA: Continual Audio-Video Pre-training with Spatio-Temporal Localized Alignment
by: Lee, Jaewoo, et al.
Published: (2023)
by: Lee, Jaewoo, et al.
Published: (2023)
Vision Language Models are Biased
by: Vo, An, et al.
Published: (2025)
by: Vo, An, et al.
Published: (2025)
Do Vision--Language Models Understand 3D Scenes or Just Catalogue Objects?
by: Maheshwari, Animesh, et al.
Published: (2026)
by: Maheshwari, Animesh, et al.
Published: (2026)
Understanding Multimodal Hallucination with Parameter-Free Representation Alignment
by: Wang, Yueqian, et al.
Published: (2024)
by: Wang, Yueqian, et al.
Published: (2024)
Similar Items
-
Topological Alignment of Shared Vision-Language Embedding Space
by: You, Junwon, et al.
Published: (2025) -
Topology-Aware Representation Alignment for Semi-Supervised Vision-Language Learning
by: You, Junwon, et al.
Published: (2026) -
ERGO: Efficient High-Resolution Visual Understanding for Vision-Language Models
by: Lee, Jewon, et al.
Published: (2025) -
Towards Gradient-based Time-Series Explanations through a SpatioTemporal Attention Network
by: Lee, Min Hun
Published: (2024) -
An Unsupervised Tensor-Based Domain Alignment
by: Lee, Chong Hyun, et al.
Published: (2026)