Learning to Compress Contexts for Efficient Knowledge-based Visual Question Answering
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Weng, Weixi, Zhu, Jieming, Meng, Xiaojun, Zhang, Hao, Zhang, Rui, Yuan, Chun |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Expert Knowledge-Aware Image Difference Graph Representation Learning for Difference-Aware Medical Visual Question Answering
par: Hu, Xinyue, et autres
Publié: (2023)
par: Hu, Xinyue, et autres
Publié: (2023)
Questioning the Stability of Visual Question Answering
par: Rosenfeld, Amir, et autres
Publié: (2025)
par: Rosenfeld, Amir, et autres
Publié: (2025)
DocVXQA: Context-Aware Visual Explanations for Document Question Answering
par: Souibgui, Mohamed Ali, et autres
Publié: (2025)
par: Souibgui, Mohamed Ali, et autres
Publié: (2025)
Prophet: Prompting Large Language Models with Complementary Answer Heuristics for Knowledge-based Visual Question Answering
par: Yu, Zhou, et autres
Publié: (2023)
par: Yu, Zhou, et autres
Publié: (2023)
BERT-VQA: Visual Question Answering on Plots
par: Vu, Tai, et autres
Publié: (2025)
par: Vu, Tai, et autres
Publié: (2025)
TPCL: Task Progressive Curriculum Learning for Robust Visual Question Answering
par: Akl, Ahmed, et autres
Publié: (2024)
par: Akl, Ahmed, et autres
Publié: (2024)
Mean Teacher DETR with Masked Feature Alignment: A Robust Domain Adaptive Detection Transformer Framework
par: Weng, Weixi, et autres
Publié: (2023)
par: Weng, Weixi, et autres
Publié: (2023)
COREVQA: A Crowd Observation and Reasoning Entailment Visual Question Answering Benchmark
par: Chintapatla, Ishant, et autres
Publié: (2025)
par: Chintapatla, Ishant, et autres
Publié: (2025)
Modality-Aware Integration with Large Language Models for Knowledge-based Visual Question Answering
par: Dong, Junnan, et autres
Publié: (2024)
par: Dong, Junnan, et autres
Publié: (2024)
Find The Gap: Knowledge Base Reasoning For Visual Question Answering
par: Barezi, Elham J., et autres
Publié: (2024)
par: Barezi, Elham J., et autres
Publié: (2024)
Describe Anything Model for Visual Question Answering on Text-rich Images
par: Vu, Yen-Linh, et autres
Publié: (2025)
par: Vu, Yen-Linh, et autres
Publié: (2025)
RSAdapter: Adapting Multimodal Models for Remote Sensing Visual Question Answering
par: Wang, Yuduo, et autres
Publié: (2023)
par: Wang, Yuduo, et autres
Publié: (2023)
Privacy-Aware Document Visual Question Answering
par: Tito, Rubèn, et autres
Publié: (2023)
par: Tito, Rubèn, et autres
Publié: (2023)
Towards Self-Explainable Document Visual Question Answering with Chain-of-Explanation Predictions
par: Indrehus, Kjetil, et autres
Publié: (2026)
par: Indrehus, Kjetil, et autres
Publié: (2026)
Vision-Language Models for Medical Report Generation and Visual Question Answering: A Review
par: Hartsock, Iryna, et autres
Publié: (2024)
par: Hartsock, Iryna, et autres
Publié: (2024)
ReasonDrive: Efficient Visual Question Answering for Autonomous Vehicles with Reasoning-Enhanced Small Vision-Language Models
par: Chahe, Amirhosein, et autres
Publié: (2025)
par: Chahe, Amirhosein, et autres
Publié: (2025)
Enhancing Visual Question Answering through Ranking-Based Hybrid Training and Multimodal Fusion
par: Chen, Peiyuan, et autres
Publié: (2024)
par: Chen, Peiyuan, et autres
Publié: (2024)
Improving Video Question Answering through query-based frame selection
par: Patil, Himanshu, et autres
Publié: (2026)
par: Patil, Himanshu, et autres
Publié: (2026)
SViQA: A Unified Speech-Vision Multimodal Model for Textless Visual Question Answering
par: Li, Bingxin
Publié: (2025)
par: Li, Bingxin
Publié: (2025)
Exploring the Effectiveness of Object-Centric Representations in Visual Question Answering: Comparative Insights with Foundation Models
par: Mamaghan, Amir Mohammad Karimi, et autres
Publié: (2024)
par: Mamaghan, Amir Mohammad Karimi, et autres
Publié: (2024)
RECODE: Reasoning Through Code Generation for Visual Question Answering
par: Shen, Junhong, et autres
Publié: (2025)
par: Shen, Junhong, et autres
Publié: (2025)
ViInfographicVQA: A Benchmark for Single and Multi-image Visual Question Answering on Vietnamese Infographics
par: Van-Dinh, Tue-Thu, et autres
Publié: (2025)
par: Van-Dinh, Tue-Thu, et autres
Publié: (2025)
Evaluating Zero-Shot GPT-4V Performance on 3D Visual Question Answering Benchmarks
par: Singh, Simranjit, et autres
Publié: (2024)
par: Singh, Simranjit, et autres
Publié: (2024)
Which Client is Reliable?: A Reliable and Personalized Prompt-based Federated Learning for Medical Image Question Answering
par: Zhu, He, et autres
Publié: (2024)
par: Zhu, He, et autres
Publié: (2024)
PromptHub: Enhancing Multi-Prompt Visual In-Context Learning with Locality-Aware Fusion, Concentration and Alignment
par: Luo, Tianci, et autres
Publié: (2026)
par: Luo, Tianci, et autres
Publié: (2026)
Exploring Diverse Methods in Visual Question Answering
par: Li, Panfeng, et autres
Publié: (2024)
par: Li, Panfeng, et autres
Publié: (2024)
ALoRE: Efficient Visual Adaptation via Aggregating Low Rank Experts
par: Du, Sinan, et autres
Publié: (2024)
par: Du, Sinan, et autres
Publié: (2024)
Federated Learning with Instance-Dependent Noisy Label
par: Wang, Lei, et autres
Publié: (2023)
par: Wang, Lei, et autres
Publié: (2023)
Compressor-VLA: Instruction-Guided Visual Token Compression for Efficient Robotic Manipulation
par: Gao, Juntao, et autres
Publié: (2025)
par: Gao, Juntao, et autres
Publié: (2025)
Taming Cross-Domain Representation Variance in Federated Prototype Learning with Heterogeneous Data Domains
par: Wang, Lei, et autres
Publié: (2024)
par: Wang, Lei, et autres
Publié: (2024)
MM-Prompt: Cross-Modal Prompt Tuning for Continual Visual Question Answering
par: Li, Xu, et autres
Publié: (2025)
par: Li, Xu, et autres
Publié: (2025)
Glyph: Scaling Context Windows via Visual-Text Compression
par: Cheng, Jiale, et autres
Publié: (2025)
par: Cheng, Jiale, et autres
Publié: (2025)
Towards Interpretable and Efficient Attention: Compressing All by Contracting a Few
par: Wen, Qishuai, et autres
Publié: (2025)
par: Wen, Qishuai, et autres
Publié: (2025)
Vision Mamba: Efficient Visual Representation Learning with Bidirectional State Space Model
par: Zhu, Lianghui, et autres
Publié: (2024)
par: Zhu, Lianghui, et autres
Publié: (2024)
Efficient Conditional Diffusion Model with Probability Flow Sampling for Image Super-resolution
par: Yuan, Yutao, et autres
Publié: (2024)
par: Yuan, Yutao, et autres
Publié: (2024)
Enriching Knowledge Distillation with Intra-Class Contrastive Learning
par: Yuan, Hua, et autres
Publié: (2025)
par: Yuan, Hua, et autres
Publié: (2025)
Guiding Vision-Language Model Selection for Visual Question-Answering Across Tasks, Domains, and Knowledge Types
par: Sinha, Neelabh, et autres
Publié: (2024)
par: Sinha, Neelabh, et autres
Publié: (2024)
Rethinking Decoders for Transformer-based Semantic Segmentation: A Compression Perspective
par: Wen, Qishuai, et autres
Publié: (2024)
par: Wen, Qishuai, et autres
Publié: (2024)
CL-MoE: Enhancing Multimodal Large Language Model with Dual Momentum Mixture-of-Experts for Continual Visual Question Answering
par: Huai, Tianyu, et autres
Publié: (2025)
par: Huai, Tianyu, et autres
Publié: (2025)
Pre-trained Visual Dynamics Representations for Efficient Policy Learning
par: Luo, Hao, et autres
Publié: (2024)
par: Luo, Hao, et autres
Publié: (2024)
Documents similaires
-
Expert Knowledge-Aware Image Difference Graph Representation Learning for Difference-Aware Medical Visual Question Answering
par: Hu, Xinyue, et autres
Publié: (2023) -
Questioning the Stability of Visual Question Answering
par: Rosenfeld, Amir, et autres
Publié: (2025) -
DocVXQA: Context-Aware Visual Explanations for Document Question Answering
par: Souibgui, Mohamed Ali, et autres
Publié: (2025) -
Prophet: Prompting Large Language Models with Complementary Answer Heuristics for Knowledge-based Visual Question Answering
par: Yu, Zhou, et autres
Publié: (2023) -
BERT-VQA: Visual Question Answering on Plots
par: Vu, Tai, et autres
Publié: (2025)