Mitigating Easy Option Bias in Multiple-Choice Question Answering
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhang, Hao, Li, Chen, Fernando, Basura |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Question-Answering Dense Video Events
par: Qin, Hangyu, et autres
Publié: (2024)
par: Qin, Hangyu, et autres
Publié: (2024)
Navigating the Mirage: A Dual-Path Agentic Framework for Robust Misleading Chart Question Answering
par: Zhang, Yanjie, et autres
Publié: (2026)
par: Zhang, Yanjie, et autres
Publié: (2026)
Boosting Audio Visual Question Answering via Key Semantic-Aware Cues
par: Li, Guangyao, et autres
Publié: (2024)
par: Li, Guangyao, et autres
Publié: (2024)
Can I Trust Your Answer? Visually Grounded Video Question Answering
par: Xiao, Junbin, et autres
Publié: (2023)
par: Xiao, Junbin, et autres
Publié: (2023)
MuKV: Multi-Grained KV Cache Compression for Long Streaming Video Question-Answering
par: Xiao, Junbin, et autres
Publié: (2026)
par: Xiao, Junbin, et autres
Publié: (2026)
VidCtx: Context-aware Video Question Answering with Image Models
par: Goulas, Andreas, et autres
Publié: (2024)
par: Goulas, Andreas, et autres
Publié: (2024)
Learning Trimodal Relation for Audio-Visual Question Answering with Missing Modality
par: Park, Kyu Ri, et autres
Publié: (2024)
par: Park, Kyu Ri, et autres
Publié: (2024)
AdaCoder: Adaptive Prompt Compression for Programmatic Visual Question Answering
par: Ukai, Mahiro, et autres
Publié: (2024)
par: Ukai, Mahiro, et autres
Publié: (2024)
POLYCHARTQA: Benchmarking Large Vision-Language Models with Multilingual Chart Question Answering
par: Xu, Yichen, et autres
Publié: (2025)
par: Xu, Yichen, et autres
Publié: (2025)
Self-Adaptive Sampling for Efficient Video Question-Answering on Image--Text Models
par: Han, Wei, et autres
Publié: (2023)
par: Han, Wei, et autres
Publié: (2023)
ReAG: Reasoning-Augmented Generation for Knowledge-based Visual Question Answering
par: Compagnoni, Alberto, et autres
Publié: (2025)
par: Compagnoni, Alberto, et autres
Publié: (2025)
Augmenting Multimodal LLMs with Self-Reflective Tokens for Knowledge-based Visual Question Answering
par: Cocchi, Federico, et autres
Publié: (2024)
par: Cocchi, Federico, et autres
Publié: (2024)
RacketVision: A Multiple Racket Sports Benchmark for Unified Ball and Racket Analysis
par: Dong, Linfeng, et autres
Publié: (2025)
par: Dong, Linfeng, et autres
Publié: (2025)
Enhancing Human-Centered Dynamic Scene Understanding via Multiple LLMs Collaborated Reasoning
par: Zhang, Hang, et autres
Publié: (2024)
par: Zhang, Hang, et autres
Publié: (2024)
Order Is Not Layout: Order-to-Space Bias in Image Generation
par: Zhang, Yongkang, et autres
Publié: (2026)
par: Zhang, Yongkang, et autres
Publié: (2026)
Concept Conductor: Orchestrating Multiple Personalized Concepts in Text-to-Image Synthesis
par: Yao, Zebin, et autres
Publié: (2024)
par: Yao, Zebin, et autres
Publié: (2024)
Patch-level Sounding Object Tracking for Audio-Visual Question Answering
par: Li, Zhangbin, et autres
Publié: (2024)
par: Li, Zhangbin, et autres
Publié: (2024)
Robust Latent Representation Tuning for Image-text Classification
par: Sun, Hao, et autres
Publié: (2024)
par: Sun, Hao, et autres
Publié: (2024)
LEAF-Mamba: Local Emphatic and Adaptive Fusion State Space Model for RGB-D Salient Object Detection
par: Wu, Lanhu, et autres
Publié: (2025)
par: Wu, Lanhu, et autres
Publié: (2025)
DIRECT: Video Mashup Creation via Hierarchical Multi-Agent Planning and Intent-Guided Editing
par: Li, Ke, et autres
Publié: (2026)
par: Li, Ke, et autres
Publié: (2026)
Enhanced Multimodal Hate Video Detection via Channel-wise and Modality-wise Fusion
par: Zhang, Yinghui, et autres
Publié: (2025)
par: Zhang, Yinghui, et autres
Publié: (2025)
Look One and More: Distilling Hybrid Order Relational Knowledge for Cross-Resolution Image Recognition
par: Ge, Shiming, et autres
Publié: (2024)
par: Ge, Shiming, et autres
Publié: (2024)
Smart Transfer: Leveraging Vision Foundation Model for Rapid Building Damage Mapping with Post-Earthquake VHR Imagery
par: Li, Hao, et autres
Publié: (2026)
par: Li, Hao, et autres
Publié: (2026)
LLM-EvRep: Learning an LLM-Compatible Event Representation Using a Self-Supervised Framework
par: Yu, Zongyou, et autres
Publié: (2025)
par: Yu, Zongyou, et autres
Publié: (2025)
Mitigating Hallucination in Multimodal Large Language Model via Hallucination-targeted Direct Preference Optimization
par: Fu, Yuhan, et autres
Publié: (2024)
par: Fu, Yuhan, et autres
Publié: (2024)
Modality Gap-Driven Subspace Alignment Training Paradigm For Multimodal Large Language Models
par: Yu, Xiaomin, et autres
Publié: (2026)
par: Yu, Xiaomin, et autres
Publié: (2026)
PolySmart @ TRECVid 2024 Medical Video Question Answering
par: Wu, Jiaxin, et autres
Publié: (2024)
par: Wu, Jiaxin, et autres
Publié: (2024)
Q-Ponder: A Unified Training Pipeline for Reasoning-based Visual Quality Assessment
par: Cai, Zhuoxuan, et autres
Publié: (2025)
par: Cai, Zhuoxuan, et autres
Publié: (2025)
Crab$^{+}$: A Scalable and Unified Audio-Visual Scene Understanding Model with Explicit Cooperation
par: Cai, Dongnuan, et autres
Publié: (2026)
par: Cai, Dongnuan, et autres
Publié: (2026)
Efficient Low-Resolution Face Recognition via Bridge Distillation
par: Ge, Shiming, et autres
Publié: (2024)
par: Ge, Shiming, et autres
Publié: (2024)
GiVE: Guiding Visual Encoder to Perceive Overlooked Information
par: Li, Junjie, et autres
Publié: (2024)
par: Li, Junjie, et autres
Publié: (2024)
Regularizing Subspace Redundancy of Low-Rank Adaptation
par: Zhu, Yue, et autres
Publié: (2025)
par: Zhu, Yue, et autres
Publié: (2025)
DIBS: Enhancing Dense Video Captioning with Unlabeled Videos via Pseudo Boundary Enrichment and Online Refinement
par: Wu, Hao, et autres
Publié: (2024)
par: Wu, Hao, et autres
Publié: (2024)
Q-Bench: A Benchmark for General-Purpose Foundation Models on Low-level Vision
par: Wu, Haoning, et autres
Publié: (2023)
par: Wu, Haoning, et autres
Publié: (2023)
EvAnimate: Event-conditioned Image-to-Video Generation for Human Animation
par: Qu, Qiang, et autres
Publié: (2025)
par: Qu, Qiang, et autres
Publié: (2025)
Official-NV: An LLM-Generated News Video Dataset for Multimodal Fake News Detection
par: Wang, Yihao, et autres
Publié: (2024)
par: Wang, Yihao, et autres
Publié: (2024)
ASR-enhanced Multimodal Representation Learning for Cross-Domain Product Retrieval
par: Zhao, Ruixiang, et autres
Publié: (2024)
par: Zhao, Ruixiang, et autres
Publié: (2024)
BlobCtrl: Taming Controllable Blob for Element-level Image Editing
par: Li, Yaowei, et autres
Publié: (2025)
par: Li, Yaowei, et autres
Publié: (2025)
Video-EM: Event-Centric Episodic Memory for Long-Form Video Understanding
par: Wang, Yun, et autres
Publié: (2025)
par: Wang, Yun, et autres
Publié: (2025)
PaveBench: A Versatile Benchmark for Pavement Distress Perception and Interactive Vision-Language Analysis
par: Li, Dexiang, et autres
Publié: (2026)
par: Li, Dexiang, et autres
Publié: (2026)
Documents similaires
-
Question-Answering Dense Video Events
par: Qin, Hangyu, et autres
Publié: (2024) -
Navigating the Mirage: A Dual-Path Agentic Framework for Robust Misleading Chart Question Answering
par: Zhang, Yanjie, et autres
Publié: (2026) -
Boosting Audio Visual Question Answering via Key Semantic-Aware Cues
par: Li, Guangyao, et autres
Publié: (2024) -
Can I Trust Your Answer? Visually Grounded Video Question Answering
par: Xiao, Junbin, et autres
Publié: (2023) -
MuKV: Multi-Grained KV Cache Compression for Long Streaming Video Question-Answering
par: Xiao, Junbin, et autres
Publié: (2026)