Language-Guided Token Compression with Reinforcement Learning in Large Vision-Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Cao, Sihan, Zhang, Jianwei, Zheng, Pengcheng, Yan, Jiaxin, Qin, Caiyan, Ye, Yalan, Dong, Wei, Wang, Peng, Yang, Yang, Zhang, Chaoning |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
RCP: Representation Consistency Pruner for Mitigating Distribution Shift in Large Vision-Language Models
by: Zhang, Jianwei, et al.
Published: (2026)
by: Zhang, Jianwei, et al.
Published: (2026)
Relaxing Anchor-Frame Dominance for Mitigating Hallucinations in Video Large Language Models
by: Liu, Zijian, et al.
Published: (2026)
by: Liu, Zijian, et al.
Published: (2026)
Immunizing 3D Gaussian Generative Models Against Unauthorized Fine-Tuning via Attribute-Space Traps
by: Zhang, Jianwei, et al.
Published: (2026)
by: Zhang, Jianwei, et al.
Published: (2026)
LLaVA-FA: Learning Fourier Approximation for Compressing Large Multimodal Models
by: Zheng, Pengcheng, et al.
Published: (2026)
by: Zheng, Pengcheng, et al.
Published: (2026)
Topology-Aware Layer Pruning for Large Vision-Language Models
by: Zheng, Pengcheng, et al.
Published: (2026)
by: Zheng, Pengcheng, et al.
Published: (2026)
Joint Lossless Compression and Steganography for Medical Images via Large Language Models
by: Zheng, Pengcheng, et al.
Published: (2025)
by: Zheng, Pengcheng, et al.
Published: (2025)
TokenCarve: Information-Preserving Visual Token Compression in Multimodal Large Language Models
by: Tan, Xudong, et al.
Published: (2025)
by: Tan, Xudong, et al.
Published: (2025)
Fast SAM2 with Text-Driven Token Pruning
by: Mandal, Avilasha, et al.
Published: (2025)
by: Mandal, Avilasha, et al.
Published: (2025)
On the Adversarial Robustness of Large Vision-Language Models under Visual Token Compression
by: Zhang, Xinwei, et al.
Published: (2026)
by: Zhang, Xinwei, et al.
Published: (2026)
TDA-RC: Task-Driven Alignment for Knowledge-Based Reasoning Chains in Large Language Models
by: Zhang, Jiaquan, et al.
Published: (2026)
by: Zhang, Jiaquan, et al.
Published: (2026)
Vision-centric Token Compression in Large Language Model
by: Xing, Ling, et al.
Published: (2025)
by: Xing, Ling, et al.
Published: (2025)
From Similarity to Structure: Training-free LLM Context Compression with Hybrid Graph Priors
by: Zhou, Yitian, et al.
Published: (2026)
by: Zhou, Yitian, et al.
Published: (2026)
Optimizing Soft Prompt Tuning via Structural Evolution
by: Huang, Zhenzhen, et al.
Published: (2026)
by: Huang, Zhenzhen, et al.
Published: (2026)
VLCache: Computing 2% Vision Tokens and Reusing 98% for Vision-Language Inference
by: Qin, Shengling, et al.
Published: (2025)
by: Qin, Shengling, et al.
Published: (2025)
Less Is More -- Until It Breaks: Security Pitfalls of Vision Token Compression in Large Vision-Language Models
by: Zhang, Xiaomei, et al.
Published: (2026)
by: Zhang, Xiaomei, et al.
Published: (2026)
Solving Token Gradient Conflict in Mixture-of-Experts for Large Vision-Language Model
by: Yang, Longrong, et al.
Published: (2024)
by: Yang, Longrong, et al.
Published: (2024)
A Survey of Token Compression for Efficient Multimodal Large Language Models
by: Shao, Kele, et al.
Published: (2025)
by: Shao, Kele, et al.
Published: (2025)
Think Twice, Act Once: Token-Aware Compression and Action Reuse for Efficient Inference in Vision-Language-Action Models
by: Tan, Xudong, et al.
Published: (2025)
by: Tan, Xudong, et al.
Published: (2025)
DyCoke: Dynamic Compression of Tokens for Fast Video Large Language Models
by: Tao, Keda, et al.
Published: (2024)
by: Tao, Keda, et al.
Published: (2024)
MADTP: Multimodal Alignment-Guided Dynamic Token Pruning for Accelerating Vision-Language Transformer
by: Cao, Jianjian, et al.
Published: (2024)
by: Cao, Jianjian, et al.
Published: (2024)
Rethinking Token Reduction for Large Vision-Language Models
by: Wang, Yi, et al.
Published: (2026)
by: Wang, Yi, et al.
Published: (2026)
InPK: Infusing Prior Knowledge into Prompt for Vision-Language Models
by: Zhou, Shuchang, et al.
Published: (2025)
by: Zhou, Shuchang, et al.
Published: (2025)
Contextual Reinforcement in Multimodal Token Compression for Large Language Models
by: Piero, Naderdel, et al.
Published: (2025)
by: Piero, Naderdel, et al.
Published: (2025)
Vision-R1: Evolving Human-Free Alignment in Large Vision-Language Models via Vision-Guided Reinforcement Learning
by: Zhan, Yufei, et al.
Published: (2025)
by: Zhan, Yufei, et al.
Published: (2025)
HybridToken-VLM: Hybrid Token Compression for Vision-Language Models
by: Zhang, Jusheng, et al.
Published: (2025)
by: Zhang, Jusheng, et al.
Published: (2025)
Token Expand-Merge: Training-Free Token Compression for Vision-Language-Action Models
by: Ye, Yifan, et al.
Published: (2025)
by: Ye, Yifan, et al.
Published: (2025)
Autoregression-Free Neural Operators for Time-Dependent PDEs
by: Zhang, Jiaquan, et al.
Published: (2026)
by: Zhang, Jiaquan, et al.
Published: (2026)
PVC: Progressive Visual Token Compression for Unified Image and Video Processing in Large Vision-Language Models
by: Yang, Chenyu, et al.
Published: (2024)
by: Yang, Chenyu, et al.
Published: (2024)
Reinforcement Learning with Promising Tokens for Large Language Models
by: Pang, Jing-Cheng, et al.
Published: (2026)
by: Pang, Jing-Cheng, et al.
Published: (2026)
Short-LVLM: Compressing and Accelerating Large Vision-Language Models by Pruning Redundant Layers
by: Ma, Ji, et al.
Published: (2025)
by: Ma, Ji, et al.
Published: (2025)
A Glimpse to Compress: Dynamic Visual Token Pruning for Large Vision-Language Models
by: Zeng, Quan-Sheng, et al.
Published: (2025)
by: Zeng, Quan-Sheng, et al.
Published: (2025)
Geometric Neural Operators via Lie Group-Constrained Latent Dynamics
by: Zhang, Jiaquan, et al.
Published: (2026)
by: Zhang, Jiaquan, et al.
Published: (2026)
GRASP: Guided Region-Aware Sparse Prompting for Adapting MLLMs to Remote Sensing
by: Sun, Qigan, et al.
Published: (2026)
by: Sun, Qigan, et al.
Published: (2026)
Rethinking Input Domains in Physics-Informed Neural Networks via Geometric Compactification Mappings
by: Huang, Zhenzhen, et al.
Published: (2026)
by: Huang, Zhenzhen, et al.
Published: (2026)
Recoverable Compression: A Multimodal Vision Token Recovery Mechanism Guided by Text Information
by: Chen, Yi, et al.
Published: (2024)
by: Chen, Yi, et al.
Published: (2024)
HierKick: Hierarchical Reinforcement Learning for Vision-Guided Soccer Robot Control
by: Chen, Yizhi, et al.
Published: (2026)
by: Chen, Yizhi, et al.
Published: (2026)
Growing a Multi-head Twig via Distillation and Reinforcement Learning to Accelerate Large Vision-Language Models
by: Shao, Zhenwei, et al.
Published: (2025)
by: Shao, Zhenwei, et al.
Published: (2025)
SOUP: Token-level Single-sample Mix-policy Reinforcement Learning for Large Language Models
by: Yang, Lei, et al.
Published: (2026)
by: Yang, Lei, et al.
Published: (2026)
Multi-agent KTO: Reinforcing Strategic Interactions of Large Language Model in Language Game
by: Ye, Rong, et al.
Published: (2025)
by: Ye, Rong, et al.
Published: (2025)
Lightweight LLM Agent Memory with Small Language Models
by: Zhang, Jiaquan, et al.
Published: (2026)
by: Zhang, Jiaquan, et al.
Published: (2026)
Similar Items
-
RCP: Representation Consistency Pruner for Mitigating Distribution Shift in Large Vision-Language Models
by: Zhang, Jianwei, et al.
Published: (2026) -
Relaxing Anchor-Frame Dominance for Mitigating Hallucinations in Video Large Language Models
by: Liu, Zijian, et al.
Published: (2026) -
Immunizing 3D Gaussian Generative Models Against Unauthorized Fine-Tuning via Attribute-Space Traps
by: Zhang, Jianwei, et al.
Published: (2026) -
LLaVA-FA: Learning Fourier Approximation for Compressing Large Multimodal Models
by: Zheng, Pengcheng, et al.
Published: (2026) -
Topology-Aware Layer Pruning for Large Vision-Language Models
by: Zheng, Pengcheng, et al.
Published: (2026)