Mutual Enhancement Between Global Tokens and Patch Tokens: From Theory to Practice
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Huang, Xiusheng, Jiang, Xin, Zhao, Jun, Liu, Kang, Wang, Yequan |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
TokenFlow: Unified Image Tokenizer for Multimodal Understanding and Generation
par: Qu, Liao, et autres
Publié: (2024)
par: Qu, Liao, et autres
Publié: (2024)
CODA: Repurposing Continuous VAEs for Discrete Tokenization
par: Liu, Zeyu, et autres
Publié: (2025)
par: Liu, Zeyu, et autres
Publié: (2025)
Less is more: Summarizing Patch Tokens for efficient Multi-Label Class-Incremental Learning
par: De Min, Thomas, et autres
Publié: (2024)
par: De Min, Thomas, et autres
Publié: (2024)
BatStyler: Advancing Multi-category Style Generation for Source-free Domain Generalization
par: Xu, Xiusheng, et autres
Publié: (2025)
par: Xu, Xiusheng, et autres
Publié: (2025)
How Many Visual Tokens Do Multimodal Language Models Need? Scaling Visual Token Pruning with F^3A
par: Huang, YiJie, et autres
Publié: (2026)
par: Huang, YiJie, et autres
Publié: (2026)
HybridToken-VLM: Hybrid Token Compression for Vision-Language Models
par: Zhang, Jusheng, et autres
Publié: (2025)
par: Zhang, Jusheng, et autres
Publié: (2025)
Towards Lossless Ultimate Vision Token Compression for VLMs
par: Zheng, Dehua, et autres
Publié: (2025)
par: Zheng, Dehua, et autres
Publié: (2025)
Frequency Autoregressive Image Generation with Continuous Tokens
par: Yu, Hu, et autres
Publié: (2025)
par: Yu, Hu, et autres
Publié: (2025)
GaussianToken: An Effective Image Tokenizer with 2D Gaussian Splatting
par: Dong, Jiajun, et autres
Publié: (2025)
par: Dong, Jiajun, et autres
Publié: (2025)
VFRTok: Variable Frame Rates Video Tokenizer with Duration-Proportional Information Assumption
par: Zhong, Tianxiong, et autres
Publié: (2025)
par: Zhong, Tianxiong, et autres
Publié: (2025)
AT-SNN: Adaptive Tokens for Vision Transformer on Spiking Neural Network
par: Kang, Donghwa, et autres
Publié: (2024)
par: Kang, Donghwa, et autres
Publié: (2024)
Hita: Holistic Tokenizer for Autoregressive Image Generation
par: Zheng, Anlin, et autres
Publié: (2025)
par: Zheng, Anlin, et autres
Publié: (2025)
From Linear Probing to Joint-Weighted Token Hierarchy: A Foundation Model Bridging Global and Cellular Representations in Biomarker Detection
par: Liu, Jingsong, et autres
Publié: (2025)
par: Liu, Jingsong, et autres
Publié: (2025)
TokenDance: Token-to-Token Music-to-Dance Generation with Bidirectional Mamba
par: Yang, Ziyue, et autres
Publié: (2026)
par: Yang, Ziyue, et autres
Publié: (2026)
UniTok: A Unified Tokenizer for Visual Generation and Understanding
par: Ma, Chuofan, et autres
Publié: (2025)
par: Ma, Chuofan, et autres
Publié: (2025)
Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction
par: Jang, Huiwon, et autres
Publié: (2024)
par: Jang, Huiwon, et autres
Publié: (2024)
AdaptToken: Entropy-based Adaptive Token Selection for MLLM Long Video Understanding
par: Qi, Haozhe, et autres
Publié: (2026)
par: Qi, Haozhe, et autres
Publié: (2026)
Famba-V: Fast Vision Mamba with Cross-Layer Token Fusion
par: Shen, Hui, et autres
Publié: (2024)
par: Shen, Hui, et autres
Publié: (2024)
MacTok: Robust Continuous Tokenization for Image Generation
par: Zeng, Hengyu, et autres
Publié: (2026)
par: Zeng, Hengyu, et autres
Publié: (2026)
Rethinking Token Reduction for Large Vision-Language Models
par: Wang, Yi, et autres
Publié: (2026)
par: Wang, Yi, et autres
Publié: (2026)
Homogeneous Tokenizer Matters: Homogeneous Visual Tokenizer for Remote Sensing Image Understanding
par: Shao, Run, et autres
Publié: (2024)
par: Shao, Run, et autres
Publié: (2024)
TokenTrim: Inference-Time Token Pruning for Autoregressive Long Video Generation
par: Shaulov, Ariel, et autres
Publié: (2026)
par: Shaulov, Ariel, et autres
Publié: (2026)
Object-Centric Vision Token Pruning for Vision Language Models
par: Li, Guangyuan, et autres
Publié: (2025)
par: Li, Guangyuan, et autres
Publié: (2025)
TinyDrop: Tiny Model Guided Token Dropping for Vision Transformers
par: Wang, Guoxin, et autres
Publié: (2025)
par: Wang, Guoxin, et autres
Publié: (2025)
Identifying Critical Tokens for Accurate Predictions in Transformer-based Medical Imaging Models
par: Kang, Solha, et autres
Publié: (2025)
par: Kang, Solha, et autres
Publié: (2025)
Stateful Token Reduction for Long-Video Hybrid VLMs
par: Jiang, Jindong, et autres
Publié: (2026)
par: Jiang, Jindong, et autres
Publié: (2026)
ENAT: Rethinking Spatial-temporal Interactions in Token-based Image Synthesis
par: Ni, Zanlin, et autres
Publié: (2024)
par: Ni, Zanlin, et autres
Publié: (2024)
Decoupled Seg Tokens Make Stronger Reasoning Video Segmenter and Grounder
par: Jisheng, Dang, et autres
Publié: (2025)
par: Jisheng, Dang, et autres
Publié: (2025)
LaVida Drive: Vision-Text Interaction VLM for Autonomous Driving with Token Selection, Recovery and Enhancement
par: Jiao, Siwen, et autres
Publié: (2024)
par: Jiao, Siwen, et autres
Publié: (2024)
IDPruner: Harmonizing Importance and Diversity in Visual Token Pruning for MLLMs
par: Tan, Yifan, et autres
Publié: (2026)
par: Tan, Yifan, et autres
Publié: (2026)
DiffMoE: Dynamic Token Selection for Scalable Diffusion Transformers
par: Shi, Minglei, et autres
Publié: (2025)
par: Shi, Minglei, et autres
Publié: (2025)
OccamToken: Efficient VLM Inference with Training-Free and Budget-Adaptive Token Pruning
par: Li, Geng, et autres
Publié: (2026)
par: Li, Geng, et autres
Publié: (2026)
Rethinking Video Tokenization: A Conditioned Diffusion-based Approach
par: Yang, Nianzu, et autres
Publié: (2025)
par: Yang, Nianzu, et autres
Publié: (2025)
Commonsense Knowledge Editing Based on Free-Text in LLMs
par: Huang, Xiusheng, et autres
Publié: (2024)
par: Huang, Xiusheng, et autres
Publié: (2024)
Vision Foundation Models as Effective Visual Tokenizers for Autoregressive Image Generation
par: Zheng, Anlin, et autres
Publié: (2025)
par: Zheng, Anlin, et autres
Publié: (2025)
TokenMotion: Decoupled Motion Control via Token Disentanglement for Human-centric Video Generation
par: Li, Ruineng, et autres
Publié: (2025)
par: Li, Ruineng, et autres
Publié: (2025)
Bridging the Semantic-Action Gap in Visual Token Pruning for Efficient VLA Inference
par: Liu, Ziyan, et autres
Publié: (2025)
par: Liu, Ziyan, et autres
Publié: (2025)
What Kind of Visual Tokens Do We Need? Training-free Visual Token Pruning for Multi-modal Large Language Models from the Perspective of Graph
par: Jiang, Yutao, et autres
Publié: (2025)
par: Jiang, Yutao, et autres
Publié: (2025)
Image Tokens Matter: Mitigating Hallucination in Discrete Tokenizer-based Large Vision-Language Models via Latent Editing
par: Wang, Weixing, et autres
Publié: (2025)
par: Wang, Weixing, et autres
Publié: (2025)
Instinct vs. Reflection: Unifying Token and Verbalized Confidence in Multimodal Large Models
par: Dang, Yunkai, et autres
Publié: (2026)
par: Dang, Yunkai, et autres
Publié: (2026)
Documents similaires
-
TokenFlow: Unified Image Tokenizer for Multimodal Understanding and Generation
par: Qu, Liao, et autres
Publié: (2024) -
CODA: Repurposing Continuous VAEs for Discrete Tokenization
par: Liu, Zeyu, et autres
Publié: (2025) -
Less is more: Summarizing Patch Tokens for efficient Multi-Label Class-Incremental Learning
par: De Min, Thomas, et autres
Publié: (2024) -
BatStyler: Advancing Multi-category Style Generation for Source-free Domain Generalization
par: Xu, Xiusheng, et autres
Publié: (2025) -
How Many Visual Tokens Do Multimodal Language Models Need? Scaling Visual Token Pruning with F^3A
par: Huang, YiJie, et autres
Publié: (2026)