Focus-then-Context: Subject-Centric Progressive Visual Token Reduction for Vision-Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhao, Yulin, Wang, Yun, Zheng, Dehua, jiang, Borui, Zhang, Zheng |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
AGFT: Alignment-Guided Fine-Tuning for Zero-Shot Adversarial Robustness of Vision-Language Models
par: Cui, Yubo, et autres
Publié: (2026)
par: Cui, Yubo, et autres
Publié: (2026)
Towards Lossless Ultimate Vision Token Compression for VLMs
par: Zheng, Dehua, et autres
Publié: (2025)
par: Zheng, Dehua, et autres
Publié: (2025)
PPE: Positional Preservation Embedding for Token Compression in Multimodal Large Language Models
par: Huang, Mouxiao, et autres
Publié: (2025)
par: Huang, Mouxiao, et autres
Publié: (2025)
SimpliPy: A Source-Tracking Notional Machine for Simplified Python
par: Jain, Moida Praneeth, et autres
Publié: (2025)
par: Jain, Moida Praneeth, et autres
Publié: (2025)
What if we have 90 minutes only to teach programming?
par: Egri-Nagy, Attila
Publié: (2026)
par: Egri-Nagy, Attila
Publié: (2026)
Double Eisenstein series and modular forms of level $4$
par: Kina, Katsumi
Publié: (2024)
par: Kina, Katsumi
Publié: (2024)
Using Vision + Language Models to Predict Item Difficulty
par: Khan, Samin
Publié: (2026)
par: Khan, Samin
Publié: (2026)
Shimura lift of Rankin-Cohen brackets of eigenforms and theta series
par: Wang, Wei
Publié: (2024)
par: Wang, Wei
Publié: (2024)
Object-Centric Vision Token Pruning for Vision Language Models
par: Li, Guangyuan, et autres
Publié: (2025)
par: Li, Guangyuan, et autres
Publié: (2025)
Weaving Context Across Images: Improving Vision-Language Models through Focus-Centric Visual Chains
par: Zhang, Juntian, et autres
Publié: (2025)
par: Zhang, Juntian, et autres
Publié: (2025)
Towards Interpretable Foundation Models for Retinal Fundus Images
par: Mensah, Samuel Ofosu, et autres
Publié: (2026)
par: Mensah, Samuel Ofosu, et autres
Publié: (2026)
On twisted Koecher-Maass series and its integral Kernel
par: Herrera, Fernando
Publié: (2024)
par: Herrera, Fernando
Publié: (2024)
Triple Correlation Sums of Coefficients of Cusp Forms
par: Hulse, Thomas A., et autres
Publié: (2019)
par: Hulse, Thomas A., et autres
Publié: (2019)
Symmetric multiple Eisenstein series
par: Hara, Takashi, et autres
Publié: (2026)
par: Hara, Takashi, et autres
Publié: (2026)
CLM: Removing the GPU Memory Barrier for 3D Gaussian Splatting
par: Zhao, Hexu, et autres
Publié: (2025)
par: Zhao, Hexu, et autres
Publié: (2025)
Inversion by Partial Evaluation: A Reversible Interpreter Experiment
par: Glück, Robert, et autres
Publié: (2024)
par: Glück, Robert, et autres
Publié: (2024)
Replicate, Reuse, Repeat: Capturing Non-Linear Communication via Session Types and Graded Modal Types
par: Marshall, Danielle, et autres
Publié: (2022)
par: Marshall, Danielle, et autres
Publié: (2022)
On obstructions to the Euler system method for Rankin-Selberg convolutions
par: Studnia, Elie
Publié: (2024)
par: Studnia, Elie
Publié: (2024)
Training-free Token Reduction for Vision Mamba
par: Ma, Qiankun, et autres
Publié: (2025)
par: Ma, Qiankun, et autres
Publié: (2025)
Modelling Distributed Applications with Mixed-Choice Stateful Typestates
par: Parrinha, Francisco, et autres
Publié: (2026)
par: Parrinha, Francisco, et autres
Publié: (2026)
VScan: Rethinking Visual Token Reduction for Efficient Large Vision-Language Models
par: Zhang, Ce, et autres
Publié: (2025)
par: Zhang, Ce, et autres
Publié: (2025)
Current and future roles of artificial intelligence in retinopathy of prematurity
par: Jafarizadeh, Ali, et autres
Publié: (2024)
par: Jafarizadeh, Ali, et autres
Publié: (2024)
DRIVE-T: A Methodology for Discriminative and Representative Data Viz Item Selection for Literacy Construct and Assessment
par: Locoro, Angela, et autres
Publié: (2025)
par: Locoro, Angela, et autres
Publié: (2025)
SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference
par: Zhang, Yuan, et autres
Publié: (2024)
par: Zhang, Yuan, et autres
Publié: (2024)
PVC: Progressive Visual Token Compression for Unified Image and Video Processing in Large Vision-Language Models
par: Yang, Chenyu, et autres
Publié: (2024)
par: Yang, Chenyu, et autres
Publié: (2024)
Enhancing Vision-Language Model with Unmasked Token Alignment
par: Liu, Jihao, et autres
Publié: (2024)
par: Liu, Jihao, et autres
Publié: (2024)
HERO: Rethinking Visual Token Early Dropping in High-Resolution Large Vision-Language Models
par: Li, Xu, et autres
Publié: (2025)
par: Li, Xu, et autres
Publié: (2025)
Vision-Centric Activation and Coordination for Multimodal Large Language Models
par: Wang, Yunnan, et autres
Publié: (2025)
par: Wang, Yunnan, et autres
Publié: (2025)
Seeing the Forest and the Trees: Solving Visual Graph and Tree Based Data Structure Problems using Large Multimodal Models
par: Gutierrez, Sebastian, et autres
Publié: (2024)
par: Gutierrez, Sebastian, et autres
Publié: (2024)
Congruences modulo $23$ to $y^2=x^3-23$ are trivial
par: Studnia, Elie
Publié: (2025)
par: Studnia, Elie
Publié: (2025)
Accelerating Multimodal Large Language Models by Searching Optimal Vision Token Reduction
par: Zhao, Shiyu, et autres
Publié: (2024)
par: Zhao, Shiyu, et autres
Publié: (2024)
TinyChemVL: Advancing Chemical Vision-Language Models via Efficient Visual Token Reduction and Complex Reaction Tasks
par: Zhao, Xuanle, et autres
Publié: (2025)
par: Zhao, Xuanle, et autres
Publié: (2025)
Residual paramodularity of a certain Calabi-Yau threefold
par: Dummigan, Neil, et autres
Publié: (2024)
par: Dummigan, Neil, et autres
Publié: (2024)
A Vision Centric Remote Sensing Benchmark
par: Adejumo, Abduljaleel, et autres
Publié: (2025)
par: Adejumo, Abduljaleel, et autres
Publié: (2025)
Compositional Separation of Control Flow and Data Flow
par: Arellanes, Damian
Publié: (2023)
par: Arellanes, Damian
Publié: (2023)
Gradual Guarantee via Step-Indexed Logical Relations in Agda
par: Siek, Jeremy G.
Publié: (2024)
par: Siek, Jeremy G.
Publié: (2024)
MienCap: Realtime Performance-Based Facial Animation with Live Mood Dynamics
par: Pan, Ye, et autres
Publié: (2025)
par: Pan, Ye, et autres
Publié: (2025)
Generating real-time detailed ground visualisations from sparse aerial point clouds
par: Murray, Aidan, et autres
Publié: (2025)
par: Murray, Aidan, et autres
Publié: (2025)
Rethinking Token Reduction for Large Vision-Language Models
par: Wang, Yi, et autres
Publié: (2026)
par: Wang, Yi, et autres
Publié: (2026)
FocusLLaVA: A Coarse-to-Fine Approach for Efficient and Effective Visual Token Compression
par: Zhu, Yuke, et autres
Publié: (2024)
par: Zhu, Yuke, et autres
Publié: (2024)
Documents similaires
-
AGFT: Alignment-Guided Fine-Tuning for Zero-Shot Adversarial Robustness of Vision-Language Models
par: Cui, Yubo, et autres
Publié: (2026) -
Towards Lossless Ultimate Vision Token Compression for VLMs
par: Zheng, Dehua, et autres
Publié: (2025) -
PPE: Positional Preservation Embedding for Token Compression in Multimodal Large Language Models
par: Huang, Mouxiao, et autres
Publié: (2025) -
SimpliPy: A Source-Tracking Notional Machine for Simplified Python
par: Jain, Moida Praneeth, et autres
Publié: (2025) -
What if we have 90 minutes only to teach programming?
par: Egri-Nagy, Attila
Publié: (2026)