Adversarial Training with OCR Modality Perturbation for Scene-Text Visual Question Answering
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Shen, Zhixuan, Luo, Haonan, Li, Sijia, Li, Tianrui |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
InstructOCR: Instruction Boosting Scene Text Spotting
par: Duan, Chen, et autres
Publié: (2024)
par: Duan, Chen, et autres
Publié: (2024)
Robustness Evaluation of OCR-based Visual Document Understanding under Multi-Modal Adversarial Attacks
par: Tien, Dong Nguyen, et autres
Publié: (2025)
par: Tien, Dong Nguyen, et autres
Publié: (2025)
VoQA: Visual-only Question Answering
par: An, Jianing, et autres
Publié: (2025)
par: An, Jianing, et autres
Publié: (2025)
MM-Prompt: Cross-Modal Prompt Tuning for Continual Visual Question Answering
par: Li, Xu, et autres
Publié: (2025)
par: Li, Xu, et autres
Publié: (2025)
Multi-Sourced Compositional Generalization in Visual Question Answering
par: Li, Chuanhao, et autres
Publié: (2025)
par: Li, Chuanhao, et autres
Publié: (2025)
Object Attribute Matters in Visual Question Answering
par: Li, Peize, et autres
Publié: (2023)
par: Li, Peize, et autres
Publié: (2023)
Learning Trimodal Relation for Audio-Visual Question Answering with Missing Modality
par: Park, Kyu Ri, et autres
Publié: (2024)
par: Park, Kyu Ri, et autres
Publié: (2024)
Fine-Grained Knowledge Structuring and Retrieval for Visual Question Answering
par: Zhang, Zhengxuan, et autres
Publié: (2025)
par: Zhang, Zhengxuan, et autres
Publié: (2025)
Pyramid Coder: Hierarchical Code Generator for Compositional Visual Question Answering
par: Shen, Ruoyue, et autres
Publié: (2024)
par: Shen, Ruoyue, et autres
Publié: (2024)
CluMo: Cluster-based Modality Fusion Prompt for Continual Learning in Visual Question Answering
par: Cai, Yuliang, et autres
Publié: (2024)
par: Cai, Yuliang, et autres
Publié: (2024)
IIU: Independent Inference Units for Knowledge-based Visual Question Answering
par: Li, Yili, et autres
Publié: (2024)
par: Li, Yili, et autres
Publié: (2024)
Hierarchical Modeling for Medical Visual Question Answering with Cross-Attention Fusion
par: Zhang, Junkai, et autres
Publié: (2025)
par: Zhang, Junkai, et autres
Publié: (2025)
Instance-Level Trojan Attacks on Visual Question Answering via Adversarial Learning in Neuron Activation Space
par: Sun, Yuwei, et autres
Publié: (2023)
par: Sun, Yuwei, et autres
Publié: (2023)
VQA$^2$: Visual Question Answering for Video Quality Assessment
par: Jia, Ziheng, et autres
Publié: (2024)
par: Jia, Ziheng, et autres
Publié: (2024)
Adversarial Attacks on VQA-NLE: Exposing and Alleviating Inconsistencies in Visual Question Answering Explanations
par: Yeh, Yahsin, et autres
Publié: (2025)
par: Yeh, Yahsin, et autres
Publié: (2025)
LiteMedCoT-VL: Parameter-Efficient Adaptation for Medical Visual Question Answering
par: Ma, Runze, et autres
Publié: (2026)
par: Ma, Runze, et autres
Publié: (2026)
Knowledge Detection by Relevant Question and Image Attributes in Visual Question Answering
par: Ahir, Param, et autres
Publié: (2023)
par: Ahir, Param, et autres
Publié: (2023)
AVAM: Universal Training-free Adaptive Visual Anchoring Embedded into Multimodal Large Language Model for Multi-image Question Answering
par: Zeng, Kang, et autres
Publié: (2025)
par: Zeng, Kang, et autres
Publié: (2025)
Enhancing Long Video Question Answering with Scene-Localized Frame Grouping
par: Yang, Xuyi, et autres
Publié: (2025)
par: Yang, Xuyi, et autres
Publié: (2025)
Vista: Scene-Aware Optimization for Streaming Video Question Answering under Post-Hoc Queries
par: Lu, Haocheng, et autres
Publié: (2026)
par: Lu, Haocheng, et autres
Publié: (2026)
WSI-VQA: Interpreting Whole Slide Images by Generative Visual Question Answering
par: Chen, Pingyi, et autres
Publié: (2024)
par: Chen, Pingyi, et autres
Publié: (2024)
Free Form Medical Visual Question Answering in Radiology
par: Narayanan, Abhishek, et autres
Publié: (2024)
par: Narayanan, Abhishek, et autres
Publié: (2024)
Saliency Guided Longitudinal Medical Visual Question Answering
par: Wu, Jialin, et autres
Publié: (2025)
par: Wu, Jialin, et autres
Publié: (2025)
Mixture of Rationale: Multi-Modal Reasoning Mixture for Visual Question Answering
par: Li, Tao, et autres
Publié: (2024)
par: Li, Tao, et autres
Publié: (2024)
Enhancing Visual Question Answering through Question-Driven Image Captions as Prompts
par: Özdemir, Övgü, et autres
Publié: (2024)
par: Özdemir, Övgü, et autres
Publié: (2024)
TM-PATHVQA:90000+ Textless Multilingual Questions for Medical Visual Question Answering
par: Rajkhowa, Tonmoy, et autres
Publié: (2024)
par: Rajkhowa, Tonmoy, et autres
Publié: (2024)
Eliminating the Language Bias for Visual Question Answering with fine-grained Causal Intervention
par: Liu, Ying, et autres
Publié: (2024)
par: Liu, Ying, et autres
Publié: (2024)
Hierarchical Question-Answering for Driving Scene Understanding Using Vision-Language Models
par: Mohamud, Safaa Abdullahi Moallim, et autres
Publié: (2025)
par: Mohamud, Safaa Abdullahi Moallim, et autres
Publié: (2025)
Evaluating Image Hallucination in Text-to-Image Generation with Question-Answering
par: Lim, Youngsun, et autres
Publié: (2024)
par: Lim, Youngsun, et autres
Publié: (2024)
WikiVQABench: A Knowledge-Grounded Visual Question Answering Benchmark from Wikipedia and Wikidata
par: Shbita, Basel, et autres
Publié: (2026)
par: Shbita, Basel, et autres
Publié: (2026)
Ask and Remember: A Questions-Only Replay Strategy for Continual Visual Question Answering
par: Marouf, Imad Eddine, et autres
Publié: (2025)
par: Marouf, Imad Eddine, et autres
Publié: (2025)
Integrating Object Interaction Self-Attention and GAN-Based Debiasing for Visual Question Answering
par: Li, Zhifei, et autres
Publié: (2025)
par: Li, Zhifei, et autres
Publié: (2025)
MaS-VQA: A Mask-and-Select Framework for Knowledge-Based Visual Question Answering
par: Mao, Xianwei, et autres
Publié: (2026)
par: Mao, Xianwei, et autres
Publié: (2026)
MedLVR: Latent Visual Reasoning for Reliable Medical Visual Question Answering
par: Xi, Suyang, et autres
Publié: (2026)
par: Xi, Suyang, et autres
Publié: (2026)
Variational Visual Question Answering for Uncertainty-Aware Selective Prediction
par: Wieczorek, Tobias Jan, et autres
Publié: (2025)
par: Wieczorek, Tobias Jan, et autres
Publié: (2025)
Wasserstein Equilibrium Decoding for Reliable Medical Visual Question Answering
par: Hagen, Luca, et autres
Publié: (2026)
par: Hagen, Luca, et autres
Publié: (2026)
Location-Aware Pretraining for Medical Difference Visual Question Answering
par: Musinguzi, Denis, et autres
Publié: (2026)
par: Musinguzi, Denis, et autres
Publié: (2026)
Boosting Audio Visual Question Answering via Key Semantic-Aware Cues
par: Li, Guangyao, et autres
Publié: (2024)
par: Li, Guangyao, et autres
Publié: (2024)
Compositional 4D Dynamic Scenes Understanding with Physics Priors for Video Question Answering
par: Wang, Xingrui, et autres
Publié: (2024)
par: Wang, Xingrui, et autres
Publié: (2024)
FaithSCAN: Model-Driven Single-Pass Hallucination Detection for Faithful Visual Question Answering
par: Tong, Chaodong, et autres
Publié: (2026)
par: Tong, Chaodong, et autres
Publié: (2026)
Documents similaires
-
InstructOCR: Instruction Boosting Scene Text Spotting
par: Duan, Chen, et autres
Publié: (2024) -
Robustness Evaluation of OCR-based Visual Document Understanding under Multi-Modal Adversarial Attacks
par: Tien, Dong Nguyen, et autres
Publié: (2025) -
VoQA: Visual-only Question Answering
par: An, Jianing, et autres
Publié: (2025) -
MM-Prompt: Cross-Modal Prompt Tuning for Continual Visual Question Answering
par: Li, Xu, et autres
Publié: (2025) -
Multi-Sourced Compositional Generalization in Visual Question Answering
par: Li, Chuanhao, et autres
Publié: (2025)