TokenFLEX: Unified VLM Training for Flexible Visual Tokens Inference
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Hu, Junshan, Mao, Jialiang, Liu, Zhikang, Xia, Zhongpu, Jia, Peng, Lang, Xianpeng |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
DUET-VLM: Dual stage Unified Efficient Token reduction for VLM Training and Inference
par: Singh, Aditya Kumar, et autres
Publié: (2026)
par: Singh, Aditya Kumar, et autres
Publié: (2026)
Efficient Token Pruning for LLaDA-V
par: Wan, Zhewen, et autres
Publié: (2026)
par: Wan, Zhewen, et autres
Publié: (2026)
OccamToken: Efficient VLM Inference with Training-Free and Budget-Adaptive Token Pruning
par: Li, Geng, et autres
Publié: (2026)
par: Li, Geng, et autres
Publié: (2026)
SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference
par: Zhang, Yuan, et autres
Publié: (2024)
par: Zhang, Yuan, et autres
Publié: (2024)
UTPTrack: Towards Simple and Unified Token Pruning for Visual Tracking
par: Wu, Hao, et autres
Publié: (2026)
par: Wu, Hao, et autres
Publié: (2026)
Dynamic-VLM: Simple Dynamic Visual Token Compression for VideoLLM
par: Wang, Han, et autres
Publié: (2024)
par: Wang, Han, et autres
Publié: (2024)
Efficient Video Sampling: Pruning Temporally Redundant Tokens for Faster VLM Inference
par: Bagrov, Natan, et autres
Publié: (2025)
par: Bagrov, Natan, et autres
Publié: (2025)
MergeTok: Unified Continuous and Discrete Visual Tokenization via Token Merging
par: Zhang, Luyuan, et autres
Publié: (2026)
par: Zhang, Luyuan, et autres
Publié: (2026)
NativeTok: Native Visual Tokenization for Improved Image Generation
par: Wu, Bin, et autres
Publié: (2026)
par: Wu, Bin, et autres
Publié: (2026)
DriveAgent-R1: Advancing VLM-based Autonomous Driving with Active Perception and Hybrid Thinking
par: Zheng, Weicheng, et autres
Publié: (2025)
par: Zheng, Weicheng, et autres
Publié: (2025)
DriveVLM: The Convergence of Autonomous Driving and Large Vision-Language Models
par: Tian, Xiaoyu, et autres
Publié: (2024)
par: Tian, Xiaoyu, et autres
Publié: (2024)
FlashVLM: Text-Guided Visual Token Selection for Large Multimodal Models
par: Cai, Kaitong, et autres
Publié: (2025)
par: Cai, Kaitong, et autres
Publié: (2025)
Training-Free Efficient Video Generation via Dynamic Token Carving
par: Zhang, Yuechen, et autres
Publié: (2025)
par: Zhang, Yuechen, et autres
Publié: (2025)
2D Gaussians Meet Visual Tokenizer
par: Shi, Yiang, et autres
Publié: (2025)
par: Shi, Yiang, et autres
Publié: (2025)
RedVTP: Training-Free Acceleration of Diffusion Vision-Language Models Inference via Masked Token-Guided Visual Token Pruning
par: Xu, Jingqi, et autres
Publié: (2025)
par: Xu, Jingqi, et autres
Publié: (2025)
Token Transforming: A Unified and Training-Free Token Compression Framework for Vision Transformer Acceleration
par: Zeng, Fanhu, et autres
Publié: (2025)
par: Zeng, Fanhu, et autres
Publié: (2025)
Similarity-Aware Token Pruning: Your VLM but Faster
par: Jeddi, Ahmadreza, et autres
Publié: (2025)
par: Jeddi, Ahmadreza, et autres
Publié: (2025)
The Better You Learn, The Smarter You Prune: Towards Efficient Vision-language-action Models via Differentiable Token Pruning
par: Jiang, Titong, et autres
Publié: (2025)
par: Jiang, Titong, et autres
Publié: (2025)
HybridToken-VLM: Hybrid Token Compression for Vision-Language Models
par: Zhang, Jusheng, et autres
Publié: (2025)
par: Zhang, Jusheng, et autres
Publié: (2025)
OmniTokenizer: A Joint Image-Video Tokenizer for Visual Generation
par: Wang, Junke, et autres
Publié: (2024)
par: Wang, Junke, et autres
Publié: (2024)
Video Token Merging for Long-form Video Understanding
par: Lee, Seon-Ho, et autres
Publié: (2024)
par: Lee, Seon-Ho, et autres
Publié: (2024)
TokenFlow: Unified Image Tokenizer for Multimodal Understanding and Generation
par: Qu, Liao, et autres
Publié: (2024)
par: Qu, Liao, et autres
Publié: (2024)
Unified Pix Token And Word Token Generative Language Model
par: Leung, Haun, et autres
Publié: (2026)
par: Leung, Haun, et autres
Publié: (2026)
Unified Language-Vision Pretraining in LLM with Dynamic Discrete Visual Tokenization
par: Jin, Yang, et autres
Publié: (2023)
par: Jin, Yang, et autres
Publié: (2023)
UniTok: A Unified Tokenizer for Visual Generation and Understanding
par: Ma, Chuofan, et autres
Publié: (2025)
par: Ma, Chuofan, et autres
Publié: (2025)
OmniVLM: A Token-Compressed, Sub-Billion-Parameter Vision-Language Model for Efficient On-Device Inference
par: Chen, Wei, et autres
Publié: (2024)
par: Chen, Wei, et autres
Publié: (2024)
TransDiffuser: Diverse Trajectory Generation with Decorrelated Multi-modal Representation for End-to-end Autonomous Driving
par: Jiang, Xuefeng, et autres
Publié: (2025)
par: Jiang, Xuefeng, et autres
Publié: (2025)
LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression
par: Hu, Lianyu, et autres
Publié: (2025)
par: Hu, Lianyu, et autres
Publié: (2025)
ILLUME+: Illuminating Unified MLLM with Dual Visual Tokenization and Diffusion Refinement
par: Huang, Runhui, et autres
Publié: (2025)
par: Huang, Runhui, et autres
Publié: (2025)
TokenCarve: Information-Preserving Visual Token Compression in Multimodal Large Language Models
par: Tan, Xudong, et autres
Publié: (2025)
par: Tan, Xudong, et autres
Publié: (2025)
Other Vehicle Trajectories Are Also Needed: A Driving World Model Unifies Ego-Other Vehicle Trajectories in Video Latent Space
par: Zhu, Jian, et autres
Publié: (2025)
par: Zhu, Jian, et autres
Publié: (2025)
ID-Selection: Importance-Diversity Based Visual Token Selection for Efficient LVLM Inference
par: Huang, Zhaohong, et autres
Publié: (2026)
par: Huang, Zhaohong, et autres
Publié: (2026)
SwiftVLM: Efficient Vision-Language Model Inference via Cross-Layer Token Bypass
par: Qian, Chen, et autres
Publié: (2026)
par: Qian, Chen, et autres
Publié: (2026)
DualToken: Towards Unifying Visual Understanding and Generation with Dual Visual Vocabularies
par: Song, Wei, et autres
Publié: (2025)
par: Song, Wei, et autres
Publié: (2025)
TokenAR: Multiple Subject Generation via Autoregressive Token-level enhancement
par: Sun, Haiyue, et autres
Publié: (2025)
par: Sun, Haiyue, et autres
Publié: (2025)
Unified Autoregressive Visual Generation and Understanding with Continuous Tokens
par: Fan, Lijie, et autres
Publié: (2025)
par: Fan, Lijie, et autres
Publié: (2025)
Improving Flexible Image Tokenizers for Autoregressive Image Generation
par: Fu, Zixuan, et autres
Publié: (2026)
par: Fu, Zixuan, et autres
Publié: (2026)
When Token Pruning is Worse than Random: Understanding Visual Token Information in VLLMs
par: Wang, Yahong, et autres
Publié: (2025)
par: Wang, Yahong, et autres
Publié: (2025)
VisionTrim: Unified Vision Token Compression for Training-Free MLLM Acceleration
par: Yu, Hanxun, et autres
Publié: (2026)
par: Yu, Hanxun, et autres
Publié: (2026)
UniFlow: A Unified Pixel Flow Tokenizer for Visual Understanding and Generation
par: Yue, Zhengrong, et autres
Publié: (2025)
par: Yue, Zhengrong, et autres
Publié: (2025)
Documents similaires
-
DUET-VLM: Dual stage Unified Efficient Token reduction for VLM Training and Inference
par: Singh, Aditya Kumar, et autres
Publié: (2026) -
Efficient Token Pruning for LLaDA-V
par: Wan, Zhewen, et autres
Publié: (2026) -
OccamToken: Efficient VLM Inference with Training-Free and Budget-Adaptive Token Pruning
par: Li, Geng, et autres
Publié: (2026) -
SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference
par: Zhang, Yuan, et autres
Publié: (2024) -
UTPTrack: Towards Simple and Unified Token Pruning for Visual Tracking
par: Wu, Hao, et autres
Publié: (2026)