SparrowVQE: Visual Question Explanation for Course Content Understanding
Fuente:
arXiv
Salvato in:
| Autori principali: | Li, Jialu, Thota, Manish Kumar, Gokhman, Ruslan, Holik, Radek, Zhang, Youshan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Automatic Teaching Platform on Vision Language Retrieval Augmented Generation
di: Gokhman, Ruslan, et al.
Pubblicazione: (2025)
di: Gokhman, Ruslan, et al.
Pubblicazione: (2025)
SST-EM: Advanced Metrics for Evaluating Semantic, Spatial and Temporal Aspects in Video Editing
di: Biyyala, Varun, et al.
Pubblicazione: (2025)
di: Biyyala, Varun, et al.
Pubblicazione: (2025)
Natural Language Understanding and Inference with MLLM in Visual Question Answering: A Survey
di: Kuang, Jiayi, et al.
Pubblicazione: (2024)
di: Kuang, Jiayi, et al.
Pubblicazione: (2024)
FruitEnsemble: MLLM-Guided Arbitration for Heterogeneous ensemble in Fine-Grained Fruit Recognition
di: Yu, Enhui, et al.
Pubblicazione: (2026)
di: Yu, Enhui, et al.
Pubblicazione: (2026)
ECIS-VQG: Generation of Entity-centric Information-seeking Questions from Videos
di: Phukan, Arpan, et al.
Pubblicazione: (2024)
di: Phukan, Arpan, et al.
Pubblicazione: (2024)
Deep Learning based Visually Rich Document Content Understanding: A Survey
di: Ding, Yihao, et al.
Pubblicazione: (2024)
di: Ding, Yihao, et al.
Pubblicazione: (2024)
Adversarial Attacks on VQA-NLE: Exposing and Alleviating Inconsistencies in Visual Question Answering Explanations
di: Yeh, Yahsin, et al.
Pubblicazione: (2025)
di: Yeh, Yahsin, et al.
Pubblicazione: (2025)
Dynamic Embedding of Hierarchical Visual Features for Efficient Vision-Language Fine-Tuning
di: Wei, Xinyu, et al.
Pubblicazione: (2025)
di: Wei, Xinyu, et al.
Pubblicazione: (2025)
Sparrow: Data-Efficient Video-LLM with Text-to-Image Augmentation
di: Yin, Shukang, et al.
Pubblicazione: (2024)
di: Yin, Shukang, et al.
Pubblicazione: (2024)
Selectively Answering Visual Questions
di: Eisenschlos, Julian Martin, et al.
Pubblicazione: (2024)
di: Eisenschlos, Julian Martin, et al.
Pubblicazione: (2024)
GeReA: Question-Aware Prompt Captions for Knowledge-based Visual Question Answering
di: Ma, Ziyu, et al.
Pubblicazione: (2024)
di: Ma, Ziyu, et al.
Pubblicazione: (2024)
Large Content And Behavior Models To Understand, Simulate, And Optimize Content And Behavior
di: Khandelwal, Ashmit, et al.
Pubblicazione: (2023)
di: Khandelwal, Ashmit, et al.
Pubblicazione: (2023)
Fusion of Domain-Adapted Vision and Language Models for Medical Visual Question Answering
di: Ha, Cuong Nhat, et al.
Pubblicazione: (2024)
di: Ha, Cuong Nhat, et al.
Pubblicazione: (2024)
Design as Desired: Utilizing Visual Question Answering for Multimodal Pre-training
di: Su, Tongkun, et al.
Pubblicazione: (2024)
di: Su, Tongkun, et al.
Pubblicazione: (2024)
Towards Perceiving Small Visual Details in Zero-shot Visual Question Answering with Multimodal LLMs
di: Zhang, Jiarui, et al.
Pubblicazione: (2023)
di: Zhang, Jiarui, et al.
Pubblicazione: (2023)
Investigating Prompting Techniques for Zero- and Few-Shot Visual Question Answering
di: Awal, Rabiul, et al.
Pubblicazione: (2023)
di: Awal, Rabiul, et al.
Pubblicazione: (2023)
A Gaze-grounded Visual Question Answering Dataset for Clarifying Ambiguous Japanese Questions
di: Inadumi, Shun, et al.
Pubblicazione: (2024)
di: Inadumi, Shun, et al.
Pubblicazione: (2024)
LLMs Meet Long Video: Advancing Long Video Question Answering with An Interactive Visual Adapter in LLMs
di: Li, Yunxin, et al.
Pubblicazione: (2024)
di: Li, Yunxin, et al.
Pubblicazione: (2024)
Teaching Vision-Language Models to Ask: Resolving Ambiguity in Visual Questions
di: Jian, Pu, et al.
Pubblicazione: (2025)
di: Jian, Pu, et al.
Pubblicazione: (2025)
AIM: Asymmetric Information Masking for Visual Question Answering Continual Learning
di: Zhang, Peifeng, et al.
Pubblicazione: (2026)
di: Zhang, Peifeng, et al.
Pubblicazione: (2026)
Spatially Grounded Explanations in Vision Language Models for Document Visual Question Answering
di: Lagos, Maximiliano Hormazábal, et al.
Pubblicazione: (2025)
di: Lagos, Maximiliano Hormazábal, et al.
Pubblicazione: (2025)
Teaching Human Behavior Improves Content Understanding Abilities Of LLMs
di: Singh, Somesh, et al.
Pubblicazione: (2024)
di: Singh, Somesh, et al.
Pubblicazione: (2024)
RAVENEA: A Benchmark for Multimodal Retrieval-Augmented Visual Culture Understanding
di: Li, Jiaang, et al.
Pubblicazione: (2025)
di: Li, Jiaang, et al.
Pubblicazione: (2025)
DualToken: Towards Unifying Visual Understanding and Generation with Dual Visual Vocabularies
di: Song, Wei, et al.
Pubblicazione: (2025)
di: Song, Wei, et al.
Pubblicazione: (2025)
CommVQA: Situating Visual Question Answering in Communicative Contexts
di: Naik, Nandita Shankar, et al.
Pubblicazione: (2024)
di: Naik, Nandita Shankar, et al.
Pubblicazione: (2024)
Multimodal Integration of Human-Like Attention in Visual Question Answering
di: Sood, Ekta, et al.
Pubblicazione: (2021)
di: Sood, Ekta, et al.
Pubblicazione: (2021)
Advancing Vietnamese Visual Question Answering with Transformer and Convolutional Integration
di: Nguyen, Ngoc Son, et al.
Pubblicazione: (2024)
di: Nguyen, Ngoc Son, et al.
Pubblicazione: (2024)
DynTok: Dynamic Compression of Visual Tokens for Efficient and Effective Video Understanding
di: Zhang, Hongzhi, et al.
Pubblicazione: (2025)
di: Zhang, Hongzhi, et al.
Pubblicazione: (2025)
VisualSimpleQA: A Benchmark for Decoupled Evaluation of Large Vision-Language Models in Fact-Seeking Question Answering
di: Wang, Yanling, et al.
Pubblicazione: (2025)
di: Wang, Yanling, et al.
Pubblicazione: (2025)
Computed Tomography Visual Question Answering with Cross-modal Feature Graphing
di: Tian, Yuanhe, et al.
Pubblicazione: (2025)
di: Tian, Yuanhe, et al.
Pubblicazione: (2025)
Large Vision-Language Models for Remote Sensing Visual Question Answering
di: Siripong, Surasakdi, et al.
Pubblicazione: (2024)
di: Siripong, Surasakdi, et al.
Pubblicazione: (2024)
Overcoming Language Priors for Visual Question Answering Based on Knowledge Distillation
di: Peng, Daowan, et al.
Pubblicazione: (2025)
di: Peng, Daowan, et al.
Pubblicazione: (2025)
Ask Questions with Double Hints: Visual Question Generation with Answer-awareness and Region-reference
di: Shen, Kai, et al.
Pubblicazione: (2024)
di: Shen, Kai, et al.
Pubblicazione: (2024)
LLaVAR: Enhanced Visual Instruction Tuning for Text-Rich Image Understanding
di: Zhang, Yanzhe, et al.
Pubblicazione: (2023)
di: Zhang, Yanzhe, et al.
Pubblicazione: (2023)
VISaGE: Understanding Visual Generics and Exceptions
di: Frank, Stella, et al.
Pubblicazione: (2025)
di: Frank, Stella, et al.
Pubblicazione: (2025)
MMLongBench-Doc: Benchmarking Long-context Document Understanding with Visualizations
di: Ma, Yubo, et al.
Pubblicazione: (2024)
di: Ma, Yubo, et al.
Pubblicazione: (2024)
Generalizing Visual Question Answering from Synthetic to Human-Written Questions via a Chain of QA with a Large Language Model
di: Kim, Taehee, et al.
Pubblicazione: (2024)
di: Kim, Taehee, et al.
Pubblicazione: (2024)
How Good LLMs Are at Answering Bangla Medical Visual Questions? Dataset and Benchmarking
di: Ahmed, Rafid, et al.
Pubblicazione: (2026)
di: Ahmed, Rafid, et al.
Pubblicazione: (2026)
LaPA: Latent Prompt Assist Model For Medical Visual Question Answering
di: Gu, Tiancheng, et al.
Pubblicazione: (2024)
di: Gu, Tiancheng, et al.
Pubblicazione: (2024)
Long-Form Answers to Visual Questions from Blind and Low Vision People
di: Huh, Mina, et al.
Pubblicazione: (2024)
di: Huh, Mina, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Automatic Teaching Platform on Vision Language Retrieval Augmented Generation
di: Gokhman, Ruslan, et al.
Pubblicazione: (2025) -
SST-EM: Advanced Metrics for Evaluating Semantic, Spatial and Temporal Aspects in Video Editing
di: Biyyala, Varun, et al.
Pubblicazione: (2025) -
Natural Language Understanding and Inference with MLLM in Visual Question Answering: A Survey
di: Kuang, Jiayi, et al.
Pubblicazione: (2024) -
FruitEnsemble: MLLM-Guided Arbitration for Heterogeneous ensemble in Fine-Grained Fruit Recognition
di: Yu, Enhui, et al.
Pubblicazione: (2026) -
ECIS-VQG: Generation of Entity-centric Information-seeking Questions from Videos
di: Phukan, Arpan, et al.
Pubblicazione: (2024)