MetaRA: Metamorphic Robustness Assessment for Multimodal Large Language Model-based Visual Question Answering Systems
Fuente:
arXiv
Guardado en:
| Autores principales: | Xu, Quanxing, Tian, Yuhao, Zhou, Ling, Zhong, Xian, Huang, Xiaohua, Huang, Rubing, Lin, Chia-Wen |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Enhancing Visual Question Answering with Multimodal LLMs via Chain-of-Question Guided Retrieval-Augmented Generation
por: Xu, Quanxing, et al.
Publicado: (2026)
por: Xu, Quanxing, et al.
Publicado: (2026)
QIRL: Boosting Visual Question Answering via Optimized Question-Image Relation Learning
por: Xu, Quanxing, et al.
Publicado: (2025)
por: Xu, Quanxing, et al.
Publicado: (2025)
OAD-Promoter: Enhancing Zero-shot VQA using Large Language Models with Object Attribute Description
por: Xu, Quanxing, et al.
Publicado: (2025)
por: Xu, Quanxing, et al.
Publicado: (2025)
PC-MNet: Dual-Level Congruity Modeling for Multimodal Sarcasm Detection via Polarity-Modulated Attention
por: Li, Maoheng, et al.
Publicado: (2026)
por: Li, Maoheng, et al.
Publicado: (2026)
Advancing Multimodal Large Language Models in Chart Question Answering with Visualization-Referenced Instruction Tuning
por: Zeng, Xingchen, et al.
Publicado: (2024)
por: Zeng, Xingchen, et al.
Publicado: (2024)
Unmasking Deceptive Visuals: Benchmarking Multimodal Large Language Models on Misleading Chart Question Answering
por: Chen, Zixin, et al.
Publicado: (2025)
por: Chen, Zixin, et al.
Publicado: (2025)
Perception of Knowledge Boundary for Large Language Models through Semi-open-ended Question Answering
por: Wen, Zhihua, et al.
Publicado: (2024)
por: Wen, Zhihua, et al.
Publicado: (2024)
Multimodal Reranking for Knowledge-Intensive Visual Question Answering
por: Wen, Haoyang, et al.
Publicado: (2024)
por: Wen, Haoyang, et al.
Publicado: (2024)
An Effective Approach to Embedding Source Code by Combining Large Language and Sentence Embedding Models
por: Xian, Zixiang, et al.
Publicado: (2024)
por: Xian, Zixiang, et al.
Publicado: (2024)
Where do Large Vision-Language Models Look at when Answering Questions?
por: Xing, Xiaoying, et al.
Publicado: (2025)
por: Xing, Xiaoying, et al.
Publicado: (2025)
Token Constraint Decoding Improves Robustness on Question Answering for Large Language Models
por: Yao, Jui-Ming, et al.
Publicado: (2025)
por: Yao, Jui-Ming, et al.
Publicado: (2025)
Visual Question Answering Instruction: Unlocking Multimodal Large Language Model To Domain-Specific Visual Multitasks
por: Lee, Jusung, et al.
Publicado: (2024)
por: Lee, Jusung, et al.
Publicado: (2024)
Modality-Aware Integration with Large Language Models for Knowledge-based Visual Question Answering
por: Dong, Junnan, et al.
Publicado: (2024)
por: Dong, Junnan, et al.
Publicado: (2024)
Collaboration among Multiple Large Language Models for Medical Question Answering
por: Shang, Kexin, et al.
Publicado: (2025)
por: Shang, Kexin, et al.
Publicado: (2025)
AVAM: Universal Training-free Adaptive Visual Anchoring Embedded into Multimodal Large Language Model for Multi-image Question Answering
por: Zeng, Kang, et al.
Publicado: (2025)
por: Zeng, Kang, et al.
Publicado: (2025)
Knowledge Acquisition Disentanglement for Knowledge-based Visual Question Answering with Large Language Models
por: An, Wenbin, et al.
Publicado: (2024)
por: An, Wenbin, et al.
Publicado: (2024)
Multimodal Rationales for Explainable Visual Question Answering
por: Li, Kun, et al.
Publicado: (2024)
por: Li, Kun, et al.
Publicado: (2024)
Visual Robustness Benchmark for Visual Question Answering (VQA)
por: Ishmam, Md Farhan, et al.
Publicado: (2024)
por: Ishmam, Md Farhan, et al.
Publicado: (2024)
DialTest‐EA: An Enhanced Fuzzing Approach With Energy Adjustment for Dialogue Systems via Metamorphic Testing
por: Haibo Chen, et al.
Publicado: (2024)
por: Haibo Chen, et al.
Publicado: (2024)
TemporalDoRA: Temporal PEFT for Robust Surgical Video Question Answering
por: Carlini, Luca, et al.
Publicado: (2026)
por: Carlini, Luca, et al.
Publicado: (2026)
Music Audio-Visual Question Answering Requires Specialized Multimodal Designs
por: You, Wenhao, et al.
Publicado: (2025)
por: You, Wenhao, et al.
Publicado: (2025)
VQA$^2$: Visual Question Answering for Video Quality Assessment
por: Jia, Ziheng, et al.
Publicado: (2024)
por: Jia, Ziheng, et al.
Publicado: (2024)
VoQA: Visual-only Question Answering
por: An, Jianing, et al.
Publicado: (2025)
por: An, Jianing, et al.
Publicado: (2025)
Efficient Multimodal Planning Agent for Visual Question-Answering
por: Chen, Zhuo, et al.
Publicado: (2026)
por: Chen, Zhuo, et al.
Publicado: (2026)
Multimodal Commonsense Knowledge Distillation for Visual Question Answering
por: Yang, Shuo, et al.
Publicado: (2024)
por: Yang, Shuo, et al.
Publicado: (2024)
Evaluating Multimodal Large Language Models on Educational Textbook Question Answering
por: Alawwad, Hessa A., et al.
Publicado: (2025)
por: Alawwad, Hessa A., et al.
Publicado: (2025)
Advancing Egocentric Video Question Answering with Multimodal Large Language Models
por: Patel, Alkesh, et al.
Publicado: (2025)
por: Patel, Alkesh, et al.
Publicado: (2025)
Evaluating the Meta- and Object-Level Reasoning of Large Language Models for Question Answering
por: Ferguson, Nick, et al.
Publicado: (2025)
por: Ferguson, Nick, et al.
Publicado: (2025)
PDF-MVQA: A Dataset for Multimodal Information Retrieval in PDF-based Visual Question Answering
por: Ding, Yihao, et al.
Publicado: (2024)
por: Ding, Yihao, et al.
Publicado: (2024)
Safe LoRA: the Silver Lining of Reducing Safety Risks when Fine-tuning Large Language Models
por: Hsu, Chia-Yi, et al.
Publicado: (2024)
por: Hsu, Chia-Yi, et al.
Publicado: (2024)
Large Vision-Language Models for Remote Sensing Visual Question Answering
por: Siripong, Surasakdi, et al.
Publicado: (2024)
por: Siripong, Surasakdi, et al.
Publicado: (2024)
Breaking the Visual Shortcuts in Multimodal Knowledge-Based Visual Question Answering
por: Lee, Dosung, et al.
Publicado: (2025)
por: Lee, Dosung, et al.
Publicado: (2025)
DARE: Diverse Visual Question Answering with Robustness Evaluation
por: Sterz, Hannah, et al.
Publicado: (2024)
por: Sterz, Hannah, et al.
Publicado: (2024)
Benchmarking Large Multimodal Models for Ophthalmic Visual Question Answering with OphthalWeChat
por: Xu, Pusheng, et al.
Publicado: (2025)
por: Xu, Pusheng, et al.
Publicado: (2025)
FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering
por: Huang, Chengyue, et al.
Publicado: (2025)
por: Huang, Chengyue, et al.
Publicado: (2025)
Sportify: Question Answering with Embedded Visualizations and Personified Narratives for Sports Video
por: Lee, Chunggi, et al.
Publicado: (2024)
por: Lee, Chunggi, et al.
Publicado: (2024)
Cost-efficient Knowledge-based Question Answering with Large Language Models
por: Dong, Junnan, et al.
Publicado: (2024)
por: Dong, Junnan, et al.
Publicado: (2024)
Reliable Academic Conference Question Answering: A Study Based on Large Language Model
por: Huang, Zhiwei, et al.
Publicado: (2023)
por: Huang, Zhiwei, et al.
Publicado: (2023)
MapIQ: Evaluating Multimodal Large Language Models for Map Question Answering
por: Srivastava, Varun, et al.
Publicado: (2025)
por: Srivastava, Varun, et al.
Publicado: (2025)
Chain-of-Action: Faithful and Multimodal Question Answering through Large Language Models
por: Pan, Zhenyu, et al.
Publicado: (2024)
por: Pan, Zhenyu, et al.
Publicado: (2024)
Ejemplares similares
-
Enhancing Visual Question Answering with Multimodal LLMs via Chain-of-Question Guided Retrieval-Augmented Generation
por: Xu, Quanxing, et al.
Publicado: (2026) -
QIRL: Boosting Visual Question Answering via Optimized Question-Image Relation Learning
por: Xu, Quanxing, et al.
Publicado: (2025) -
OAD-Promoter: Enhancing Zero-shot VQA using Large Language Models with Object Attribute Description
por: Xu, Quanxing, et al.
Publicado: (2025) -
PC-MNet: Dual-Level Congruity Modeling for Multimodal Sarcasm Detection via Polarity-Modulated Attention
por: Li, Maoheng, et al.
Publicado: (2026) -
Advancing Multimodal Large Language Models in Chart Question Answering with Visualization-Referenced Instruction Tuning
por: Zeng, Xingchen, et al.
Publicado: (2024)