TRIO: Token Reduction via Inference-Objective Guidance for Efficient Vision-Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhang, Haokui, Ou, Congyang, Yan, Dawei, Wang, Peng, Yan, Qingsen, Zhang, Yu, Li, Ying, Xiao, Rong |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
CC-Pan: Channel-wise Compression based Diffusion for Efficient Pan-Sharpening
di: Li, Junjie, et al.
Pubblicazione: (2026)
di: Li, Junjie, et al.
Pubblicazione: (2026)
Rethinking Practical and Efficient Quantization Calibration for Vision-Language Models
di: Shang, Zhenhao, et al.
Pubblicazione: (2026)
di: Shang, Zhenhao, et al.
Pubblicazione: (2026)
Efficient Adaptation of Pre-trained Vision Transformer via Householder Transformation
di: Dong, Wei, et al.
Pubblicazione: (2024)
di: Dong, Wei, et al.
Pubblicazione: (2024)
UVLM: Benchmarking Video Language Model for Underwater World Understanding
di: Xue, Xizhe, et al.
Pubblicazione: (2025)
di: Xue, Xizhe, et al.
Pubblicazione: (2025)
Text-Visual Semantic Constrained AI-Generated Image Quality Assessment
di: Li, Qiang, et al.
Pubblicazione: (2025)
di: Li, Qiang, et al.
Pubblicazione: (2025)
Efficient Adaptation of Pre-trained Vision Transformer underpinned by Approximately Orthogonal Fine-Tuning Strategy
di: Yang, Yiting, et al.
Pubblicazione: (2025)
di: Yang, Yiting, et al.
Pubblicazione: (2025)
TG-LLaVA: Text Guided LLaVA via Learnable Latent Embeddings
di: Yan, Dawei, et al.
Pubblicazione: (2024)
di: Yan, Dawei, et al.
Pubblicazione: (2024)
Open-Vocabulary Object Detection in UAV Imagery: A Review and Future Perspectives
di: Zhou, Yang, et al.
Pubblicazione: (2025)
di: Zhou, Yang, et al.
Pubblicazione: (2025)
Low-Rank Rescaled Vision Transformer Fine-Tuning: A Residual Design Approach
di: Dong, Wei, et al.
Pubblicazione: (2024)
di: Dong, Wei, et al.
Pubblicazione: (2024)
VScan: Rethinking Visual Token Reduction for Efficient Large Vision-Language Models
di: Zhang, Ce, et al.
Pubblicazione: (2025)
di: Zhang, Ce, et al.
Pubblicazione: (2025)
AdaptInfer: Adaptive Token Pruning for Vision-Language Model Inference with Dynamical Text Guidance
di: Zhang, Weichen, et al.
Pubblicazione: (2025)
di: Zhang, Weichen, et al.
Pubblicazione: (2025)
EAPFusion: Intrinsic Evolving Auxiliary Prior Guidance for Infrared and Visible Image Fusion
di: Sun, Zhenyu, et al.
Pubblicazione: (2026)
di: Sun, Zhenyu, et al.
Pubblicazione: (2026)
STAR: Stage-Wise Attention-Guided Token Reduction for Efficient Large Vision-Language Models Inference
di: Guo, Yichen, et al.
Pubblicazione: (2025)
di: Guo, Yichen, et al.
Pubblicazione: (2025)
Skip-Vision: Efficient and Scalable Acceleration of Vision-Language Models via Adaptive Token Skipping
di: Zeng, Weili, et al.
Pubblicazione: (2025)
di: Zeng, Weili, et al.
Pubblicazione: (2025)
Filter, Correlate, Compress: Training-Free Token Reduction for MLLM Acceleration
di: Han, Yuhang, et al.
Pubblicazione: (2024)
di: Han, Yuhang, et al.
Pubblicazione: (2024)
PaAgent: Portrait-Aware Image Restoration Agent via Subjective-Objective Reinforcement Learning
di: Wang, Yijian, et al.
Pubblicazione: (2026)
di: Wang, Yijian, et al.
Pubblicazione: (2026)
SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference
di: Zhang, Yuan, et al.
Pubblicazione: (2024)
di: Zhang, Yuan, et al.
Pubblicazione: (2024)
Language Embedding Meets Dynamic Graph: A New Exploration for Neural Architecture Representation Learning
di: Jing, Haizhao, et al.
Pubblicazione: (2025)
di: Jing, Haizhao, et al.
Pubblicazione: (2025)
Efficient Adaptation of Large Vision Transformer via Adapter Re-Composing
di: Dong, Wei, et al.
Pubblicazione: (2023)
di: Dong, Wei, et al.
Pubblicazione: (2023)
SwiftVLM: Efficient Vision-Language Model Inference via Cross-Layer Token Bypass
di: Qian, Chen, et al.
Pubblicazione: (2026)
di: Qian, Chen, et al.
Pubblicazione: (2026)
Language-Guided Token Compression with Reinforcement Learning in Large Vision-Language Models
di: Cao, Sihan, et al.
Pubblicazione: (2026)
di: Cao, Sihan, et al.
Pubblicazione: (2026)
TinyChemVL: Advancing Chemical Vision-Language Models via Efficient Visual Token Reduction and Complex Reaction Tasks
di: Zhao, Xuanle, et al.
Pubblicazione: (2025)
di: Zhao, Xuanle, et al.
Pubblicazione: (2025)
Rethinking Token Reduction for Large Vision-Language Models
di: Wang, Yi, et al.
Pubblicazione: (2026)
di: Wang, Yi, et al.
Pubblicazione: (2026)
Accelerating Multimodal Large Language Models by Searching Optimal Vision Token Reduction
di: Zhao, Shiyu, et al.
Pubblicazione: (2024)
di: Zhao, Shiyu, et al.
Pubblicazione: (2024)
VIP: Visual-guided Prompt Evolution for Efficient Dense Vision-Language Inference
di: Zhu, Hao, et al.
Pubblicazione: (2026)
di: Zhu, Hao, et al.
Pubblicazione: (2026)
Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models
di: Li, Jinlong, et al.
Pubblicazione: (2026)
di: Li, Jinlong, et al.
Pubblicazione: (2026)
VLCache: Computing 2% Vision Tokens and Reusing 98% for Vision-Language Inference
di: Qin, Shengling, et al.
Pubblicazione: (2025)
di: Qin, Shengling, et al.
Pubblicazione: (2025)
Vote&Mix: Plug-and-Play Token Reduction for Efficient Vision Transformer
di: Peng, Shuai, et al.
Pubblicazione: (2024)
di: Peng, Shuai, et al.
Pubblicazione: (2024)
Token-Level Inference-Time Alignment for Vision-Language Models
di: Chen, Kejia, et al.
Pubblicazione: (2025)
di: Chen, Kejia, et al.
Pubblicazione: (2025)
Towards Video Anomaly Detection from Event Streams: A Baseline and Benchmark Datasets
di: Wu, Peng, et al.
Pubblicazione: (2026)
di: Wu, Peng, et al.
Pubblicazione: (2026)
Redefining Quality Criteria and Distance-Aware Score Modeling for Image Editing Assessment
di: Zhang, Xinjie, et al.
Pubblicazione: (2026)
di: Zhang, Xinjie, et al.
Pubblicazione: (2026)
TopV: Compatible Token Pruning with Inference Time Optimization for Fast and Low-Memory Multimodal Vision Language Model
di: Yang, Cheng, et al.
Pubblicazione: (2025)
di: Yang, Cheng, et al.
Pubblicazione: (2025)
Generating Content for HDR Deghosting from Frequency View
di: Hu, Tao, et al.
Pubblicazione: (2024)
di: Hu, Tao, et al.
Pubblicazione: (2024)
Frequency-Aware Token Reduction for Efficient Vision Transformer
di: Lee, Dong-Jae, et al.
Pubblicazione: (2025)
di: Lee, Dong-Jae, et al.
Pubblicazione: (2025)
Think Twice, Act Once: Token-Aware Compression and Action Reuse for Efficient Inference in Vision-Language-Action Models
di: Tan, Xudong, et al.
Pubblicazione: (2025)
di: Tan, Xudong, et al.
Pubblicazione: (2025)
ToFe: Lagged Token Freezing and Reusing for Efficient Vision Transformer Inference
di: Zhang, Haoyue, et al.
Pubblicazione: (2025)
di: Zhang, Haoyue, et al.
Pubblicazione: (2025)
HCC-3D: Hierarchical Compensatory Compression for 98% 3D Token Reduction in Vision-Language Models
di: Zhang, Liheng, et al.
Pubblicazione: (2025)
di: Zhang, Liheng, et al.
Pubblicazione: (2025)
CELLO: Causal Evaluation of Large Vision-Language Models
di: Chen, Meiqi, et al.
Pubblicazione: (2024)
di: Chen, Meiqi, et al.
Pubblicazione: (2024)
FASTer: Toward Efficient Autoregressive Vision Language Action Modeling via Neural Action Tokenization
di: Liu, Yicheng, et al.
Pubblicazione: (2025)
di: Liu, Yicheng, et al.
Pubblicazione: (2025)
Improving Visual Token Reduction via Rectifying Distortions for Efficient Multimodal LLM Inference
di: Cho, Hyeonwoo, et al.
Pubblicazione: (2026)
di: Cho, Hyeonwoo, et al.
Pubblicazione: (2026)
Documenti analoghi
-
CC-Pan: Channel-wise Compression based Diffusion for Efficient Pan-Sharpening
di: Li, Junjie, et al.
Pubblicazione: (2026) -
Rethinking Practical and Efficient Quantization Calibration for Vision-Language Models
di: Shang, Zhenhao, et al.
Pubblicazione: (2026) -
Efficient Adaptation of Pre-trained Vision Transformer via Householder Transformation
di: Dong, Wei, et al.
Pubblicazione: (2024) -
UVLM: Benchmarking Video Language Model for Underwater World Understanding
di: Xue, Xizhe, et al.
Pubblicazione: (2025) -
Text-Visual Semantic Constrained AI-Generated Image Quality Assessment
di: Li, Qiang, et al.
Pubblicazione: (2025)