DocPrune:Efficient Document Question Answering via Background, Question, and Comprehension-aware Token Pruning
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Choi, Joonmyung, Lee, Sanghyeok, Kim, Jongha, Kim, Sehyung, Ko, Dohwan, Kil, Jihyung, Kim, Hyunwoo J. |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Representation Shift: Unifying Token Compression with FlashAttention
von: Choi, Joonmyung, et al.
Veröffentlicht: (2025)
von: Choi, Joonmyung, et al.
Veröffentlicht: (2025)
TabFlash: Efficient Table Understanding with Progressive Question Conditioning and Token Focusing
von: Kim, Jongha, et al.
Veröffentlicht: (2025)
von: Kim, Jongha, et al.
Veröffentlicht: (2025)
Multi-criteria Token Fusion with One-step-ahead Attention for Efficient Vision Transformers
von: Lee, Sanghyeok, et al.
Veröffentlicht: (2024)
von: Lee, Sanghyeok, et al.
Veröffentlicht: (2024)
EfficientViM: Efficient Vision Mamba with Hidden State Mixer based State Space Duality
von: Lee, Sanghyeok, et al.
Veröffentlicht: (2024)
von: Lee, Sanghyeok, et al.
Veröffentlicht: (2024)
Relevance-aware Multi-context Contrastive Decoding for Retrieval-augmented Visual Question Answering
von: Kim, Jongha, et al.
Veröffentlicht: (2026)
von: Kim, Jongha, et al.
Veröffentlicht: (2026)
vid-TLDR: Training Free Token merging for Light-weight Video Transformer
von: Choi, Joonmyung, et al.
Veröffentlicht: (2024)
von: Choi, Joonmyung, et al.
Veröffentlicht: (2024)
MoE-GRPO: Optimizing Mixture-of-Experts via Reinforcement Learning in Vision-Language Models
von: Ko, Dohwan, et al.
Veröffentlicht: (2026)
von: Ko, Dohwan, et al.
Veröffentlicht: (2026)
II-MMR: Identifying and Improving Multi-modal Multi-hop Reasoning in Visual Question Answering
von: Kil, Jihyung, et al.
Veröffentlicht: (2024)
von: Kil, Jihyung, et al.
Veröffentlicht: (2024)
Groupwise Query Specialization and Quality-Aware Multi-Assignment for Transformer-based Visual Relationship Detection
von: Kim, Jongha, et al.
Veröffentlicht: (2024)
von: Kim, Jongha, et al.
Veröffentlicht: (2024)
Bidirectional Likelihood Estimation with Multi-Modal Large Language Models for Text-Video Retrieval
von: Ko, Dohwan, et al.
Veröffentlicht: (2025)
von: Ko, Dohwan, et al.
Veröffentlicht: (2025)
Retrieval-Augmented Open-Vocabulary Object Detection
von: Kim, Jooyeon, et al.
Veröffentlicht: (2024)
von: Kim, Jooyeon, et al.
Veröffentlicht: (2024)
DocVXQA: Context-Aware Visual Explanations for Document Question Answering
von: Souibgui, Mohamed Ali, et al.
Veröffentlicht: (2025)
von: Souibgui, Mohamed Ali, et al.
Veröffentlicht: (2025)
Decompose-and-Refine: Structured Legal Question Answering with Parametric Retrieval
von: lee, Jihyung, et al.
Veröffentlicht: (2026)
von: lee, Jihyung, et al.
Veröffentlicht: (2026)
IWP: Token Pruning as Implicit Weight Pruning in Large Vision Language Models
von: Lee, Dong-Jae, et al.
Veröffentlicht: (2026)
von: Lee, Dong-Jae, et al.
Veröffentlicht: (2026)
ERASE: Eliminating Redundant Visual Tokens via Adaptive Two-Stage Token Pruning
von: Lee, Yuna, et al.
Veröffentlicht: (2026)
von: Lee, Yuna, et al.
Veröffentlicht: (2026)
DocVideoQA: Towards Comprehensive Understanding of Document-Centric Videos through Question Answering
von: Wang, Haochen, et al.
Veröffentlicht: (2025)
von: Wang, Haochen, et al.
Veröffentlicht: (2025)
KoBLEX: Open Legal Question Answering with Multi-hop Reasoning
von: Lee, Jihyung, et al.
Veröffentlicht: (2025)
von: Lee, Jihyung, et al.
Veröffentlicht: (2025)
Learning an Ensemble Token from Task-driven Priors in Facial Analysis
von: Seo, Sunyong, et al.
Veröffentlicht: (2025)
von: Seo, Sunyong, et al.
Veröffentlicht: (2025)
FIQ: Fundamental Question Generation with the Integration of Question Embeddings for Video Question Answering
von: Oh, Ju-Young, et al.
Veröffentlicht: (2025)
von: Oh, Ju-Young, et al.
Veröffentlicht: (2025)
ZOO-Prune: Training-Free Token Pruning via Zeroth-Order Gradient Estimation in Vision-Language Models
von: Kim, Youngeun, et al.
Veröffentlicht: (2025)
von: Kim, Youngeun, et al.
Veröffentlicht: (2025)
Transferable Model-agnostic Vision-Language Model Adaptation for Efficient Weak-to-Strong Generalization
von: Park, Jihwan, et al.
Veröffentlicht: (2025)
von: Park, Jihwan, et al.
Veröffentlicht: (2025)
Super-class guided Transformer for Zero-Shot Attribute Classification
von: Kim, Sehyung, et al.
Veröffentlicht: (2025)
von: Kim, Sehyung, et al.
Veröffentlicht: (2025)
FastSTAR: Spatiotemporal Token Pruning for Efficient Autoregressive Video Synthesis
von: Yune, Sungwoong, et al.
Veröffentlicht: (2026)
von: Yune, Sungwoong, et al.
Veröffentlicht: (2026)
One-Cycle Structured Pruning via Stability-Driven Subnetwork Search
von: Ghimire, Deepak, et al.
Veröffentlicht: (2025)
von: Ghimire, Deepak, et al.
Veröffentlicht: (2025)
Question-Aware Gaussian Experts for Audio-Visual Question Answering
von: Kim, Hongyeob, et al.
Veröffentlicht: (2025)
von: Kim, Hongyeob, et al.
Veröffentlicht: (2025)
SEA: Evaluating Sketch Abstraction Efficiency via Element-level Commonsense Visual Question Answering
von: Park, Jiho, et al.
Veröffentlicht: (2026)
von: Park, Jiho, et al.
Veröffentlicht: (2026)
Focus on the Core: Efficient Attention via Pruned Token Compression for Document Classification
von: Yun, Jungmin, et al.
Veröffentlicht: (2024)
von: Yun, Jungmin, et al.
Veröffentlicht: (2024)
Optimizing Retrieval Strategies for Financial Question Answering Documents in Retrieval-Augmented Generation Systems
von: Kim, Sejong, et al.
Veröffentlicht: (2025)
von: Kim, Sejong, et al.
Veröffentlicht: (2025)
Why and When Visual Token Pruning Fails? A Study on Relevant Visual Information Shift in MLLMs Decoding
von: Kim, Jiwan, et al.
Veröffentlicht: (2026)
von: Kim, Jiwan, et al.
Veröffentlicht: (2026)
VidChain: Chain-of-Tasks with Metric-based Direct Preference Optimization for Dense Video Captioning
von: Lee, Ji Soo, et al.
Veröffentlicht: (2025)
von: Lee, Ji Soo, et al.
Veröffentlicht: (2025)
Breaking the Visual Shortcuts in Multimodal Knowledge-Based Visual Question Answering
von: Lee, Dosung, et al.
Veröffentlicht: (2025)
von: Lee, Dosung, et al.
Veröffentlicht: (2025)
Training-Free Restoration of Pruned Neural Networks
von: Lee, Keonho, et al.
Veröffentlicht: (2025)
von: Lee, Keonho, et al.
Veröffentlicht: (2025)
Progressive Multimodal Search and Reasoning for Knowledge-Intensive Visual Question Answering
von: Choi, Changin, et al.
Veröffentlicht: (2025)
von: Choi, Changin, et al.
Veröffentlicht: (2025)
Retrieval-Augmented Natural Language Reasoning for Explainable Visual Question Answering
von: Lim, Su Hyeon, et al.
Veröffentlicht: (2024)
von: Lim, Su Hyeon, et al.
Veröffentlicht: (2024)
Robust Multimodal 3D Object Detection via Modality-Agnostic Decoding and Proximity-based Modality Ensemble
von: Cha, Juhan, et al.
Veröffentlicht: (2024)
von: Cha, Juhan, et al.
Veröffentlicht: (2024)
Learning Question-Aware Keyframe Selection with Synthetic Supervision for Video Question Answering
von: Kwon, Minchan, et al.
Veröffentlicht: (2026)
von: Kwon, Minchan, et al.
Veröffentlicht: (2026)
Prune-Then-Plan: Step-Level Calibration for Stable Frontier Exploration in Embodied Question Answering
von: Frahm, Noah, et al.
Veröffentlicht: (2025)
von: Frahm, Noah, et al.
Veröffentlicht: (2025)
Prune-then-Quantize or Quantize-then-Prune? Understanding the Impact of Compression Order in Joint Model Compression
von: Kim, Minjun, et al.
Veröffentlicht: (2026)
von: Kim, Minjun, et al.
Veröffentlicht: (2026)
Index-Preserving Lightweight Token Pruning for Efficient Document Understanding in Vision-Language Models
von: Son, Jaemin, et al.
Veröffentlicht: (2025)
von: Son, Jaemin, et al.
Veröffentlicht: (2025)
ST-VLM: Kinematic Instruction Tuning for Spatio-Temporal Reasoning in Vision-Language Models
von: Ko, Dohwan, et al.
Veröffentlicht: (2025)
von: Ko, Dohwan, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
Representation Shift: Unifying Token Compression with FlashAttention
von: Choi, Joonmyung, et al.
Veröffentlicht: (2025) -
TabFlash: Efficient Table Understanding with Progressive Question Conditioning and Token Focusing
von: Kim, Jongha, et al.
Veröffentlicht: (2025) -
Multi-criteria Token Fusion with One-step-ahead Attention for Efficient Vision Transformers
von: Lee, Sanghyeok, et al.
Veröffentlicht: (2024) -
EfficientViM: Efficient Vision Mamba with Hidden State Mixer based State Space Duality
von: Lee, Sanghyeok, et al.
Veröffentlicht: (2024) -
Relevance-aware Multi-context Contrastive Decoding for Retrieval-augmented Visual Question Answering
von: Kim, Jongha, et al.
Veröffentlicht: (2026)