HybridToken-VLM: Hybrid Token Compression for Vision-Language Models
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Zhang, Jusheng, Guo, Xiaoyang, Cai, Kaitong, Lv, Qinhan, Fan, Yijia, Chai, Wenhao, Wang, Jian, Wang, Keze |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
FlashVLM: Text-Guided Visual Token Selection for Large Multimodal Models
von: Cai, Kaitong, et al.
Veröffentlicht: (2025)
von: Cai, Kaitong, et al.
Veröffentlicht: (2025)
Adaptive-VoCo: Complexity-Aware Visual Token Compression for Vision-Language Models
von: Guo, Xiaoyang, et al.
Veröffentlicht: (2025)
von: Guo, Xiaoyang, et al.
Veröffentlicht: (2025)
3DAlign-DAER: Dynamic Attention Policy and Efficient Retrieval Strategy for Fine-grained 3D-Text Alignment at Scale
von: Fan, Yijia, et al.
Veröffentlicht: (2025)
von: Fan, Yijia, et al.
Veröffentlicht: (2025)
MAT-Agent: Adaptive Multi-Agent Training Optimization
von: Zhang, Jusheng, et al.
Veröffentlicht: (2025)
von: Zhang, Jusheng, et al.
Veröffentlicht: (2025)
MM-CoT:A Benchmark for Probing Visual Chain-of-Thought Reasoning in Multimodal Models
von: Zhang, Jusheng, et al.
Veröffentlicht: (2025)
von: Zhang, Jusheng, et al.
Veröffentlicht: (2025)
CoAgent: Collaborative Planning and Consistency Agent for Coherent Video Generation
von: Zeng, Qinglin, et al.
Veröffentlicht: (2025)
von: Zeng, Qinglin, et al.
Veröffentlicht: (2025)
CF-VLM:CounterFactual Vision-Language Fine-tuning
von: Zhang, Jusheng, et al.
Veröffentlicht: (2025)
von: Zhang, Jusheng, et al.
Veröffentlicht: (2025)
PTTA: A Pure Text-to-Animation Framework for High-Quality Creation
von: Chen, Ruiqi, et al.
Veröffentlicht: (2025)
von: Chen, Ruiqi, et al.
Veröffentlicht: (2025)
Top-Down Semantic Refinement for Image Captioning
von: Zhang, Jusheng, et al.
Veröffentlicht: (2025)
von: Zhang, Jusheng, et al.
Veröffentlicht: (2025)
3D-Agent:Tri-Modal Multi-Agent Collaboration for Scalable 3D Object Annotation
von: Zhang, Jusheng, et al.
Veröffentlicht: (2026)
von: Zhang, Jusheng, et al.
Veröffentlicht: (2026)
Process-of-Thought Reasoning for Videos
von: Zhang, Jusheng, et al.
Veröffentlicht: (2026)
von: Zhang, Jusheng, et al.
Veröffentlicht: (2026)
STORM: Search-Guided Generative World Models for Robotic Manipulation
von: Lin, Wenjun, et al.
Veröffentlicht: (2025)
von: Lin, Wenjun, et al.
Veröffentlicht: (2025)
SirenPose: Dynamic Scene Reconstruction via Geometric Supervision
von: Cai, Kaitong, et al.
Veröffentlicht: (2025)
von: Cai, Kaitong, et al.
Veröffentlicht: (2025)
SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference
von: Zhang, Yuan, et al.
Veröffentlicht: (2024)
von: Zhang, Yuan, et al.
Veröffentlicht: (2024)
OmniVLM: A Token-Compressed, Sub-Billion-Parameter Vision-Language Model for Efficient On-Device Inference
von: Chen, Wei, et al.
Veröffentlicht: (2024)
von: Chen, Wei, et al.
Veröffentlicht: (2024)
Dynamic-VLM: Simple Dynamic Visual Token Compression for VideoLLM
von: Wang, Han, et al.
Veröffentlicht: (2024)
von: Wang, Han, et al.
Veröffentlicht: (2024)
Vision-centric Token Compression in Large Language Model
von: Xing, Ling, et al.
Veröffentlicht: (2025)
von: Xing, Ling, et al.
Veröffentlicht: (2025)
UniCompress: Token Compression for Unified Vision-Language Understanding and Generation
von: Wang, Ziyao, et al.
Veröffentlicht: (2026)
von: Wang, Ziyao, et al.
Veröffentlicht: (2026)
Adapted Center and Scale Prediction: More Stable and More Accurate
von: Wang, Wenhao, et al.
Veröffentlicht: (2020)
von: Wang, Wenhao, et al.
Veröffentlicht: (2020)
Language-Guided Token Compression with Reinforcement Learning in Large Vision-Language Models
von: Cao, Sihan, et al.
Veröffentlicht: (2026)
von: Cao, Sihan, et al.
Veröffentlicht: (2026)
Kolmogorov-Arnold Fourier Networks
von: Zhang, Jusheng, et al.
Veröffentlicht: (2025)
von: Zhang, Jusheng, et al.
Veröffentlicht: (2025)
TAG: Target-Agnostic Guidance for Stable Object-Centric Inference in Vision-Language-Action Models
von: Zhou, Jiaying, et al.
Veröffentlicht: (2026)
von: Zhou, Jiaying, et al.
Veröffentlicht: (2026)
A Glimpse to Compress: Dynamic Visual Token Pruning for Large Vision-Language Models
von: Zeng, Quan-Sheng, et al.
Veröffentlicht: (2025)
von: Zeng, Quan-Sheng, et al.
Veröffentlicht: (2025)
A Survey of Token Compression for Efficient Multimodal Large Language Models
von: Shao, Kele, et al.
Veröffentlicht: (2025)
von: Shao, Kele, et al.
Veröffentlicht: (2025)
Learning Dynamics of VLM Finetuning
von: Zhang, Jusheng, et al.
Veröffentlicht: (2025)
von: Zhang, Jusheng, et al.
Veröffentlicht: (2025)
Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation
von: Wang, Zihan, et al.
Veröffentlicht: (2025)
von: Wang, Zihan, et al.
Veröffentlicht: (2025)
TokenCom: Vision-Language Model for Multimodal and Multitask Token Communications
von: Jiang, Feibo, et al.
Veröffentlicht: (2026)
von: Jiang, Feibo, et al.
Veröffentlicht: (2026)
OmniZip: Audio-Guided Dynamic Token Compression for Fast Omnimodal Large Language Models
von: Tao, Keda, et al.
Veröffentlicht: (2025)
von: Tao, Keda, et al.
Veröffentlicht: (2025)
WinTok: A Win-Win Hybrid Tokenizer via Decomposing Visual Understanding and Generation with Transferable Tokens
von: Guo, Yiwei, et al.
Veröffentlicht: (2026)
von: Guo, Yiwei, et al.
Veröffentlicht: (2026)
From Motion to Behavior: Hierarchical Modeling of Humanoid Generative Behavior Control
von: Zhang, Jusheng, et al.
Veröffentlicht: (2025)
von: Zhang, Jusheng, et al.
Veröffentlicht: (2025)
Fourier Compressor: Frequency-Domain Visual Token Compression for Vision-Language Models
von: Wang, Huanyu, et al.
Veröffentlicht: (2025)
von: Wang, Huanyu, et al.
Veröffentlicht: (2025)
LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression
von: Hu, Lianyu, et al.
Veröffentlicht: (2025)
von: Hu, Lianyu, et al.
Veröffentlicht: (2025)
PVC: Progressive Visual Token Compression for Unified Image and Video Processing in Large Vision-Language Models
von: Yang, Chenyu, et al.
Veröffentlicht: (2024)
von: Yang, Chenyu, et al.
Veröffentlicht: (2024)
Beyond Pixels: Introducing Geometric-Semantic World Priors for Video-based Embodied Models via Spatio-temporal Alignment
von: Tang, Jinzhou, et al.
Veröffentlicht: (2025)
von: Tang, Jinzhou, et al.
Veröffentlicht: (2025)
Solving Token Gradient Conflict in Mixture-of-Experts for Large Vision-Language Model
von: Yang, Longrong, et al.
Veröffentlicht: (2024)
von: Yang, Longrong, et al.
Veröffentlicht: (2024)
TokenFLEX: Unified VLM Training for Flexible Visual Tokens Inference
von: Hu, Junshan, et al.
Veröffentlicht: (2025)
von: Hu, Junshan, et al.
Veröffentlicht: (2025)
TokenCarve: Information-Preserving Visual Token Compression in Multimodal Large Language Models
von: Tan, Xudong, et al.
Veröffentlicht: (2025)
von: Tan, Xudong, et al.
Veröffentlicht: (2025)
Attention Debiasing for Token Pruning in Vision Language Models
von: Zhao, Kai, et al.
Veröffentlicht: (2025)
von: Zhao, Kai, et al.
Veröffentlicht: (2025)
SwiftVLM: Efficient Vision-Language Model Inference via Cross-Layer Token Bypass
von: Qian, Chen, et al.
Veröffentlicht: (2026)
von: Qian, Chen, et al.
Veröffentlicht: (2026)
Extreme Model Compression for Edge Vision-Language Models: Sparse Temporal Token Fusion and Adaptive Neural Compression
von: Tanvir, Md Tasnin, et al.
Veröffentlicht: (2025)
von: Tanvir, Md Tasnin, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
FlashVLM: Text-Guided Visual Token Selection for Large Multimodal Models
von: Cai, Kaitong, et al.
Veröffentlicht: (2025) -
Adaptive-VoCo: Complexity-Aware Visual Token Compression for Vision-Language Models
von: Guo, Xiaoyang, et al.
Veröffentlicht: (2025) -
3DAlign-DAER: Dynamic Attention Policy and Efficient Retrieval Strategy for Fine-grained 3D-Text Alignment at Scale
von: Fan, Yijia, et al.
Veröffentlicht: (2025) -
MAT-Agent: Adaptive Multi-Agent Training Optimization
von: Zhang, Jusheng, et al.
Veröffentlicht: (2025) -
MM-CoT:A Benchmark for Probing Visual Chain-of-Thought Reasoning in Multimodal Models
von: Zhang, Jusheng, et al.
Veröffentlicht: (2025)