The Model Knows Which Tokens Matter: Automatic Token Selection via Noise Gating
Fuente:
arXiv
Salvato in:
| Autori principali: | He, Landi, Yang, Xiaoyu, Xu, Lijian |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Beyond Surrogate Gradients: Fully Differentiable Token Pruning for Vision-Language Models
di: He, Landi, et al.
Pubblicazione: (2026)
di: He, Landi, et al.
Pubblicazione: (2026)
TC-SSA: Token Compression via Semantic Slot Aggregation for Gigapixel Pathology Reasoning
di: Chen, Zhuo, et al.
Pubblicazione: (2026)
di: Chen, Zhuo, et al.
Pubblicazione: (2026)
Fewer Tokens, Greater Scaling: Self-Adaptive Visual Bases for Efficient and Expansive Representation Learning
di: Young, Shawn, et al.
Pubblicazione: (2025)
di: Young, Shawn, et al.
Pubblicazione: (2025)
TEASER: Token Enhanced Spatial Modeling for Expressions Reconstruction
di: Liu, Yunfei, et al.
Pubblicazione: (2025)
di: Liu, Yunfei, et al.
Pubblicazione: (2025)
Training Noise Token Pruning
di: Rao, Mingxing, et al.
Pubblicazione: (2024)
di: Rao, Mingxing, et al.
Pubblicazione: (2024)
Image Tokens Matter: Mitigating Hallucination in Discrete Tokenizer-based Large Vision-Language Models via Latent Editing
di: Wang, Weixing, et al.
Pubblicazione: (2025)
di: Wang, Weixing, et al.
Pubblicazione: (2025)
Zero-Shot Video Translation via Token Warping
di: Zhu, Haiming, et al.
Pubblicazione: (2024)
di: Zhu, Haiming, et al.
Pubblicazione: (2024)
The First to Know: How Token Distributions Reveal Hidden Knowledge in Large Vision-Language Models?
di: Zhao, Qinyu, et al.
Pubblicazione: (2024)
di: Zhao, Qinyu, et al.
Pubblicazione: (2024)
TrimTokenator: Towards Adaptive Visual Token Pruning for Large Multimodal Models
di: Zhang, Hao, et al.
Pubblicazione: (2025)
di: Zhang, Hao, et al.
Pubblicazione: (2025)
TokenAR: Multiple Subject Generation via Autoregressive Token-level enhancement
di: Sun, Haiyue, et al.
Pubblicazione: (2025)
di: Sun, Haiyue, et al.
Pubblicazione: (2025)
Recolour What Matters: Region-Aware Colour Editing via Token-Level Diffusion
di: Yang, Yuqi, et al.
Pubblicazione: (2026)
di: Yang, Yuqi, et al.
Pubblicazione: (2026)
OptiPrune: Boosting Prompt-Image Consistency with Attention-Guided Noise and Dynamic Token Selection
di: Lu, Ziji
Pubblicazione: (2025)
di: Lu, Ziji
Pubblicazione: (2025)
Stop Looking for Important Tokens in Multimodal Language Models: Duplication Matters More
di: Wen, Zichen, et al.
Pubblicazione: (2025)
di: Wen, Zichen, et al.
Pubblicazione: (2025)
ToDRE: Effective Visual Token Pruning via Token Diversity and Task Relevance
di: Li, Duo, et al.
Pubblicazione: (2025)
di: Li, Duo, et al.
Pubblicazione: (2025)
Enhancing Visual Grounding and Generalization: A Multi-Task Cycle Training Approach for Vision-Language Models
di: Yang, Xiaoyu, et al.
Pubblicazione: (2023)
di: Yang, Xiaoyu, et al.
Pubblicazione: (2023)
FPAN: Mitigating Replication in Diffusion Models through the Fine-Grained Probabilistic Addition of Noise to Token Embeddings
di: Xu, Jingqi, et al.
Pubblicazione: (2025)
di: Xu, Jingqi, et al.
Pubblicazione: (2025)
FlexSelect: Flexible Token Selection for Efficient Long Video Understanding
di: Zhang, Yunzhu, et al.
Pubblicazione: (2025)
di: Zhang, Yunzhu, et al.
Pubblicazione: (2025)
Pyramid Token Pruning for High-Resolution Large Vision-Language Models via Region, Token, and Instruction-Guided Importance
di: Liang, Yuxuan, et al.
Pubblicazione: (2025)
di: Liang, Yuxuan, et al.
Pubblicazione: (2025)
TokensGen: Harnessing Condensed Tokens for Long Video Generation
di: Ouyang, Wenqi, et al.
Pubblicazione: (2025)
di: Ouyang, Wenqi, et al.
Pubblicazione: (2025)
A Frame is Worth One Token: Efficient Generative World Modeling with Delta Tokens
di: Kerssies, Tommie, et al.
Pubblicazione: (2026)
di: Kerssies, Tommie, et al.
Pubblicazione: (2026)
Model Already Knows the Best Noise: Bayesian Active Noise Selection via Attention in Video Diffusion Model
di: Kim, Kwanyoung, et al.
Pubblicazione: (2025)
di: Kim, Kwanyoung, et al.
Pubblicazione: (2025)
Beyond Next-Token Alignment: Distilling Multimodal Large Language Models via Token Interactions
di: Chen, Lin, et al.
Pubblicazione: (2026)
di: Chen, Lin, et al.
Pubblicazione: (2026)
FlashVLM: Text-Guided Visual Token Selection for Large Multimodal Models
di: Cai, Kaitong, et al.
Pubblicazione: (2025)
di: Cai, Kaitong, et al.
Pubblicazione: (2025)
Unified Pix Token And Word Token Generative Language Model
di: Leung, Haun, et al.
Pubblicazione: (2026)
di: Leung, Haun, et al.
Pubblicazione: (2026)
When Token Pruning is Worse than Random: Understanding Visual Token Information in VLLMs
di: Wang, Yahong, et al.
Pubblicazione: (2025)
di: Wang, Yahong, et al.
Pubblicazione: (2025)
Homogeneous Tokenizer Matters: Homogeneous Visual Tokenizer for Remote Sensing Image Understanding
di: Shao, Run, et al.
Pubblicazione: (2024)
di: Shao, Run, et al.
Pubblicazione: (2024)
TokenSeg: Efficient 3D Medical Image Segmentation via Hierarchical Visual Token Compression
di: Zeng, Sen, et al.
Pubblicazione: (2026)
di: Zeng, Sen, et al.
Pubblicazione: (2026)
Purge-Gate: Backpropagation-Free Test-Time Adaptation for Point Clouds Classification via Token Purging
di: Yazdanpanah, Moslem, et al.
Pubblicazione: (2025)
di: Yazdanpanah, Moslem, et al.
Pubblicazione: (2025)
TokenCarve: Information-Preserving Visual Token Compression in Multimodal Large Language Models
di: Tan, Xudong, et al.
Pubblicazione: (2025)
di: Tan, Xudong, et al.
Pubblicazione: (2025)
RedVTP: Training-Free Acceleration of Diffusion Vision-Language Models Inference via Masked Token-Guided Visual Token Pruning
di: Xu, Jingqi, et al.
Pubblicazione: (2025)
di: Xu, Jingqi, et al.
Pubblicazione: (2025)
WeMMU: Enhanced Bridging of Vision-Language Models and Diffusion Models via Noisy Query Tokens
di: Yang, Jian, et al.
Pubblicazione: (2025)
di: Yang, Jian, et al.
Pubblicazione: (2025)
MergeTok: Unified Continuous and Discrete Visual Tokenization via Token Merging
di: Zhang, Luyuan, et al.
Pubblicazione: (2026)
di: Zhang, Luyuan, et al.
Pubblicazione: (2026)
Tokenize Anything via Prompting
di: Pan, Ting, et al.
Pubblicazione: (2023)
di: Pan, Ting, et al.
Pubblicazione: (2023)
OmniSelect: Dynamic Modality-Aware Token Compression for Efficient Omni-modal Large Language Models
di: Yang, Morunliu, et al.
Pubblicazione: (2026)
di: Yang, Morunliu, et al.
Pubblicazione: (2026)
Know Your Attention Maps: Class-specific Token Masking for Weakly Supervised Semantic Segmentation
di: Hanna, Joelle, et al.
Pubblicazione: (2025)
di: Hanna, Joelle, et al.
Pubblicazione: (2025)
TokenCLIP: Token-wise Prompt Learning for Zero-shot Anomaly Detection
di: Zhou, Qihang, et al.
Pubblicazione: (2025)
di: Zhou, Qihang, et al.
Pubblicazione: (2025)
Magic Tokens: Select Diverse Tokens for Multi-modal Object Re-Identification
di: Zhang, Pingping, et al.
Pubblicazione: (2024)
di: Zhang, Pingping, et al.
Pubblicazione: (2024)
TokenPure: Watermark Removal through Tokenized Appearance and Structural Guidance
di: Yang, Pei, et al.
Pubblicazione: (2025)
di: Yang, Pei, et al.
Pubblicazione: (2025)
TokenMotion: Motion-Guided Vision Transformer for Video Camouflaged Object Detection Via Learnable Token Selection
di: Yu, Zifan, et al.
Pubblicazione: (2023)
di: Yu, Zifan, et al.
Pubblicazione: (2023)
PanoLlama: Generating Endless and Coherent Panoramas with Next-Token-Prediction LLMs
di: Zhou, Teng, et al.
Pubblicazione: (2024)
di: Zhou, Teng, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Beyond Surrogate Gradients: Fully Differentiable Token Pruning for Vision-Language Models
di: He, Landi, et al.
Pubblicazione: (2026) -
TC-SSA: Token Compression via Semantic Slot Aggregation for Gigapixel Pathology Reasoning
di: Chen, Zhuo, et al.
Pubblicazione: (2026) -
Fewer Tokens, Greater Scaling: Self-Adaptive Visual Bases for Efficient and Expansive Representation Learning
di: Young, Shawn, et al.
Pubblicazione: (2025) -
TEASER: Token Enhanced Spatial Modeling for Expressions Reconstruction
di: Liu, Yunfei, et al.
Pubblicazione: (2025) -
Training Noise Token Pruning
di: Rao, Mingxing, et al.
Pubblicazione: (2024)