A Comprehensive Evaluation of Transformer-Based Question Answering Models and RAG-Enhanced Design
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Zhang, Zichen, Zhang, Kunlong, Ruan, Hongwei, Luo, Yiming |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Enhanced Multimodal RAG-LLM for Accurate Visual Question Answering
von: Xue, Junxiao, et al.
Veröffentlicht: (2024)
von: Xue, Junxiao, et al.
Veröffentlicht: (2024)
AstroRAG -- A Pagerank-Based Retrieval-Augmented Generation Pipeline for Question Answering in Astronomy
von: Wang, Zhifeng, et al.
Veröffentlicht: (2026)
von: Wang, Zhifeng, et al.
Veröffentlicht: (2026)
A Comprehensive Survey on Visual Question Answering Datasets and Algorithms
von: Kabir, Raihan, et al.
Veröffentlicht: (2024)
von: Kabir, Raihan, et al.
Veröffentlicht: (2024)
Enhanced Textual Feature Extraction for Visual Question Answering: A Simple Convolutional Approach
von: Zhang, Zhilin, et al.
Veröffentlicht: (2024)
von: Zhang, Zhilin, et al.
Veröffentlicht: (2024)
BLaVe-CoT: Consistency-Aware Visual Question Answering for Blind and Low Vision Users
von: Cheng, Wanyin, et al.
Veröffentlicht: (2025)
von: Cheng, Wanyin, et al.
Veröffentlicht: (2025)
OCR Hinders RAG: Evaluating the Cascading Impact of OCR on Retrieval-Augmented Generation
von: Zhang, Junyuan, et al.
Veröffentlicht: (2024)
von: Zhang, Junyuan, et al.
Veröffentlicht: (2024)
Improving Few-Shot Change Detection Visual Question Answering via Decision-Ambiguity-guided Reinforcement Fine-Tuning
von: Dong, Fuyu, et al.
Veröffentlicht: (2025)
von: Dong, Fuyu, et al.
Veröffentlicht: (2025)
AV-Master: Dual-Path Comprehensive Perception Makes Better Audio-Visual Question Answering
von: Zhang, Jiayu, et al.
Veröffentlicht: (2025)
von: Zhang, Jiayu, et al.
Veröffentlicht: (2025)
Evaluating Variance in Visual Question Answering Benchmarks
von: SR, Nikitha
Veröffentlicht: (2025)
von: SR, Nikitha
Veröffentlicht: (2025)
Reconstruction as a Bridge for Event-Based Visual Question Answering
von: Lou, Hanyue, et al.
Veröffentlicht: (2025)
von: Lou, Hanyue, et al.
Veröffentlicht: (2025)
Question-Aware Gaussian Experts for Audio-Visual Question Answering
von: Kim, Hongyeob, et al.
Veröffentlicht: (2025)
von: Kim, Hongyeob, et al.
Veröffentlicht: (2025)
DocPrune:Efficient Document Question Answering via Background, Question, and Comprehension-aware Token Pruning
von: Choi, Joonmyung, et al.
Veröffentlicht: (2026)
von: Choi, Joonmyung, et al.
Veröffentlicht: (2026)
DriveLM: Driving with Graph Visual Question Answering
von: Sima, Chonghao, et al.
Veröffentlicht: (2023)
von: Sima, Chonghao, et al.
Veröffentlicht: (2023)
MQADet: A Plug-and-Play Paradigm for Enhancing Open-Vocabulary Object Detection via Multimodal Question Answering
von: Li, Caixiong, et al.
Veröffentlicht: (2025)
von: Li, Caixiong, et al.
Veröffentlicht: (2025)
EVQAScore: A Fine-grained Metric for Video Question Answering Data Quality Evaluation
von: Liang, Hao, et al.
Veröffentlicht: (2024)
von: Liang, Hao, et al.
Veröffentlicht: (2024)
Enhancing Scientific Visual Question Answering through Multimodal Reasoning and Ensemble Modeling
von: Movva, Prahitha, et al.
Veröffentlicht: (2025)
von: Movva, Prahitha, et al.
Veröffentlicht: (2025)
Benchmarking Multimodal RAG through a Chart-based Document Question-Answering Generation Framework
von: Yang, Yuming, et al.
Veröffentlicht: (2025)
von: Yang, Yuming, et al.
Veröffentlicht: (2025)
Design as Desired: Utilizing Visual Question Answering for Multimodal Pre-training
von: Su, Tongkun, et al.
Veröffentlicht: (2024)
von: Su, Tongkun, et al.
Veröffentlicht: (2024)
Bidirectional Progressive Transformer for Interaction Intention Anticipation
von: Zhang, Zichen, et al.
Veröffentlicht: (2024)
von: Zhang, Zichen, et al.
Veröffentlicht: (2024)
ETVA: Evaluation of Text-to-Video Alignment via Fine-grained Question Generation and Answering
von: Guan, Kaisi, et al.
Veröffentlicht: (2025)
von: Guan, Kaisi, et al.
Veröffentlicht: (2025)
Fine-Grained Knowledge Structuring and Retrieval for Visual Question Answering
von: Zhang, Zhengxuan, et al.
Veröffentlicht: (2025)
von: Zhang, Zhengxuan, et al.
Veröffentlicht: (2025)
One VLM to Keep it Learning: Generation and Balancing for Data-free Continual Visual Question Answering
von: Das, Deepayan, et al.
Veröffentlicht: (2024)
von: Das, Deepayan, et al.
Veröffentlicht: (2024)
Enhancing Visual Question Answering through Ranking-Based Hybrid Training and Multimodal Fusion
von: Chen, Peiyuan, et al.
Veröffentlicht: (2024)
von: Chen, Peiyuan, et al.
Veröffentlicht: (2024)
Advancing Vietnamese Visual Question Answering with Transformer and Convolutional Integration
von: Nguyen, Ngoc Son, et al.
Veröffentlicht: (2024)
von: Nguyen, Ngoc Son, et al.
Veröffentlicht: (2024)
Towards Flexible Evaluation for Generative Visual Question Answering
von: Ji, Huishan, et al.
Veröffentlicht: (2024)
von: Ji, Huishan, et al.
Veröffentlicht: (2024)
SaSR-Net: Source-Aware Semantic Representation Network for Enhancing Audio-Visual Question Answering
von: Yang, Tianyu, et al.
Veröffentlicht: (2024)
von: Yang, Tianyu, et al.
Veröffentlicht: (2024)
QIRL: Boosting Visual Question Answering via Optimized Question-Image Relation Learning
von: Xu, Quanxing, et al.
Veröffentlicht: (2025)
von: Xu, Quanxing, et al.
Veröffentlicht: (2025)
DocVideoQA: Towards Comprehensive Understanding of Document-Centric Videos through Question Answering
von: Wang, Haochen, et al.
Veröffentlicht: (2025)
von: Wang, Haochen, et al.
Veröffentlicht: (2025)
Evaluating Hallucination in Text-to-Image Diffusion Models with Scene-Graph based Question-Answering Agent
von: Qin, Ziyuan, et al.
Veröffentlicht: (2024)
von: Qin, Ziyuan, et al.
Veröffentlicht: (2024)
Enhancing Visual Question Answering with Multimodal LLMs via Chain-of-Question Guided Retrieval-Augmented Generation
von: Xu, Quanxing, et al.
Veröffentlicht: (2026)
von: Xu, Quanxing, et al.
Veröffentlicht: (2026)
PMC-VQA: Visual Instruction Tuning for Medical Visual Question Answering
von: Zhang, Xiaoman, et al.
Veröffentlicht: (2023)
von: Zhang, Xiaoman, et al.
Veröffentlicht: (2023)
Object Retrieval for Visual Question Answering with Outside Knowledge
von: Kan, Shichao, et al.
Veröffentlicht: (2024)
von: Kan, Shichao, et al.
Veröffentlicht: (2024)
3D Question Answering via only 2D Vision-Language Models
von: Wang, Fengyun, et al.
Veröffentlicht: (2025)
von: Wang, Fengyun, et al.
Veröffentlicht: (2025)
Learning to Search: A Decision-Based Agent for Knowledge-Based Visual Question Answering
von: Chen, Zhuohong, et al.
Veröffentlicht: (2026)
von: Chen, Zhuohong, et al.
Veröffentlicht: (2026)
VisualSimpleQA: A Benchmark for Decoupled Evaluation of Large Vision-Language Models in Fact-Seeking Question Answering
von: Wang, Yanling, et al.
Veröffentlicht: (2025)
von: Wang, Yanling, et al.
Veröffentlicht: (2025)
A Simple LLM Framework for Long-Range Video Question-Answering
von: Zhang, Ce, et al.
Veröffentlicht: (2023)
von: Zhang, Ce, et al.
Veröffentlicht: (2023)
Enhancing Long Video Question Answering with Scene-Localized Frame Grouping
von: Yang, Xuyi, et al.
Veröffentlicht: (2025)
von: Yang, Xuyi, et al.
Veröffentlicht: (2025)
VQAttack: Transferable Adversarial Attacks on Visual Question Answering via Pre-trained Models
von: Yin, Ziyi, et al.
Veröffentlicht: (2024)
von: Yin, Ziyi, et al.
Veröffentlicht: (2024)
Combining Knowledge Graph and LLMs for Enhanced Zero-shot Visual Question Answering
von: Tao, Qian, et al.
Veröffentlicht: (2025)
von: Tao, Qian, et al.
Veröffentlicht: (2025)
Geospatial Chain of Thought Reasoning for Enhanced Visual Question Answering on Satellite Imagery
von: Shanker, Shambhavi, et al.
Veröffentlicht: (2025)
von: Shanker, Shambhavi, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
Enhanced Multimodal RAG-LLM for Accurate Visual Question Answering
von: Xue, Junxiao, et al.
Veröffentlicht: (2024) -
AstroRAG -- A Pagerank-Based Retrieval-Augmented Generation Pipeline for Question Answering in Astronomy
von: Wang, Zhifeng, et al.
Veröffentlicht: (2026) -
A Comprehensive Survey on Visual Question Answering Datasets and Algorithms
von: Kabir, Raihan, et al.
Veröffentlicht: (2024) -
Enhanced Textual Feature Extraction for Visual Question Answering: A Simple Convolutional Approach
von: Zhang, Zhilin, et al.
Veröffentlicht: (2024) -
BLaVe-CoT: Consistency-Aware Visual Question Answering for Blind and Low Vision Users
von: Cheng, Wanyin, et al.
Veröffentlicht: (2025)