Soft Tail-dropping for Adaptive Visual Tokenization
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Chen, Zeyuan, Zhang, Kai, Tu, Zhuowen, Xiong, Yuanjun |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
CVP: Central-Peripheral Vision-Inspired Multimodal Model for Spatial Reasoning
von: Chen, Zeyuan, et al.
Veröffentlicht: (2025)
von: Chen, Zeyuan, et al.
Veröffentlicht: (2025)
AlignTok: Aligning Visual Foundation Encoders to Tokenizers for Diffusion Models
von: Chen, Bowei, et al.
Veröffentlicht: (2025)
von: Chen, Bowei, et al.
Veröffentlicht: (2025)
Gaussian Swaying: Surface-Based Framework for Aerodynamic Simulation with 3D Gaussians
von: Yan, Hongru, et al.
Veröffentlicht: (2025)
von: Yan, Hongru, et al.
Veröffentlicht: (2025)
TokenCompose: Text-to-Image Diffusion with Token-level Supervision
von: Wang, Zirui, et al.
Veröffentlicht: (2023)
von: Wang, Zirui, et al.
Veröffentlicht: (2023)
C3Editor: Achieving Controllable Consistency in 2D Model for 3D Editing
von: Tao, Zeng, et al.
Veröffentlicht: (2025)
von: Tao, Zeng, et al.
Veröffentlicht: (2025)
YOLO-Count: Differentiable Object Counting for Text-to-Image Generation
von: Zeng, Guanning, et al.
Veröffentlicht: (2025)
von: Zeng, Guanning, et al.
Veröffentlicht: (2025)
DepR: Depth Guided Single-view Scene Reconstruction with Instance-level Diffusion
von: Zhao, Qingcheng, et al.
Veröffentlicht: (2025)
von: Zhao, Qingcheng, et al.
Veröffentlicht: (2025)
Exploring the Equivalence of Closed-Set Generative and Real Data Augmentation in Image Classification
von: Wang, Haowen, et al.
Veröffentlicht: (2025)
von: Wang, Haowen, et al.
Veröffentlicht: (2025)
ELODI: Ensemble Logit Difference Inhibition for Positive-Congruent Training
von: Zhao, Yue, et al.
Veröffentlicht: (2022)
von: Zhao, Yue, et al.
Veröffentlicht: (2022)
OmniControlNet: Dual-stage Integration for Conditional Image Generation
von: Wang, Yilin, et al.
Veröffentlicht: (2024)
von: Wang, Yilin, et al.
Veröffentlicht: (2024)
Bayesian Diffusion Models for 3D Shape Reconstruction
von: Xu, Haiyang, et al.
Veröffentlicht: (2024)
von: Xu, Haiyang, et al.
Veröffentlicht: (2024)
Restoration by Generation with Constrained Priors
von: Ding, Zheng, et al.
Veröffentlicht: (2023)
von: Ding, Zheng, et al.
Veröffentlicht: (2023)
EVATok: Adaptive Length Video Tokenization for Efficient Visual Autoregressive Generation
von: Xiong, Tianwei, et al.
Veröffentlicht: (2026)
von: Xiong, Tianwei, et al.
Veröffentlicht: (2026)
TokenCarve: Information-Preserving Visual Token Compression in Multimodal Large Language Models
von: Tan, Xudong, et al.
Veröffentlicht: (2025)
von: Tan, Xudong, et al.
Veröffentlicht: (2025)
OverLayBench: A Benchmark for Layout-to-Image Generation with Dense Overlaps
von: Li, Bingnan, et al.
Veröffentlicht: (2025)
von: Li, Bingnan, et al.
Veröffentlicht: (2025)
Machine Mental Imagery: Empower Multimodal Reasoning with Latent Visual Tokens
von: Yang, Zeyuan, et al.
Veröffentlicht: (2025)
von: Yang, Zeyuan, et al.
Veröffentlicht: (2025)
TrimTokenator: Towards Adaptive Visual Token Pruning for Large Multimodal Models
von: Zhang, Hao, et al.
Veröffentlicht: (2025)
von: Zhang, Hao, et al.
Veröffentlicht: (2025)
AffordanceLLM: Grounding Affordance from Vision Language Models
von: Qian, Shengyi, et al.
Veröffentlicht: (2024)
von: Qian, Shengyi, et al.
Veröffentlicht: (2024)
Image and Video Tokenization with Binary Spherical Quantization
von: Zhao, Yue, et al.
Veröffentlicht: (2024)
von: Zhao, Yue, et al.
Veröffentlicht: (2024)
TrimTokenator-LC: Towards Adaptive Visual Token Pruning for Large Multimodal Models with Long Contexts
von: Zhang, Hao, et al.
Veröffentlicht: (2025)
von: Zhang, Hao, et al.
Veröffentlicht: (2025)
ERASE: Eliminating Redundant Visual Tokens via Adaptive Two-Stage Token Pruning
von: Lee, Yuna, et al.
Veröffentlicht: (2026)
von: Lee, Yuna, et al.
Veröffentlicht: (2026)
Open-World Dynamic Prompt and Continual Visual Representation Learning
von: Kim, Youngeun, et al.
Veröffentlicht: (2024)
von: Kim, Youngeun, et al.
Veröffentlicht: (2024)
KnapFormer: An Online Load Balancer for Efficient Diffusion Transformers Training
von: Zhang, Kai, et al.
Veröffentlicht: (2025)
von: Zhang, Kai, et al.
Veröffentlicht: (2025)
HOIDiffusion: Generating Realistic 3D Hand-Object Interaction Data
von: Zhang, Mengqi, et al.
Veröffentlicht: (2024)
von: Zhang, Mengqi, et al.
Veröffentlicht: (2024)
Feature Fusion from Head to Tail for Long-Tailed Visual Recognition
von: Li, Mengke, et al.
Veröffentlicht: (2023)
von: Li, Mengke, et al.
Veröffentlicht: (2023)
MergeTok: Unified Continuous and Discrete Visual Tokenization via Token Merging
von: Zhang, Luyuan, et al.
Veröffentlicht: (2026)
von: Zhang, Luyuan, et al.
Veröffentlicht: (2026)
EchoingPixels: Cross-Modal Adaptive Token Reduction for Efficient Audio-Visual LLMs
von: Gong, Chao, et al.
Veröffentlicht: (2025)
von: Gong, Chao, et al.
Veröffentlicht: (2025)
Long-Tailed Continual Learning For Visual Food Recognition
von: He, Jiangpeng, et al.
Veröffentlicht: (2023)
von: He, Jiangpeng, et al.
Veröffentlicht: (2023)
Long-Tailed Visual Recognition via Permutation-Invariant Head-to-Tail Feature Fusion
von: Li, Mengke, et al.
Veröffentlicht: (2025)
von: Li, Mengke, et al.
Veröffentlicht: (2025)
Multi-Cue Adaptive Visual Token Pruning for Large Vision-Language Models
von: Luan, Bozhi, et al.
Veröffentlicht: (2025)
von: Luan, Bozhi, et al.
Veröffentlicht: (2025)
Lay-Your-Scene: Natural Scene Layout Generation with Diffusion Transformers
von: Srivastava, Divyansh, et al.
Veröffentlicht: (2025)
von: Srivastava, Divyansh, et al.
Veröffentlicht: (2025)
PruneVid: Visual Token Pruning for Efficient Video Large Language Models
von: Huang, Xiaohu, et al.
Veröffentlicht: (2024)
von: Huang, Xiaohu, et al.
Veröffentlicht: (2024)
CARE: Class-Adaptive Expert Consensus for Reliable Learning with Long-Tailed Noisy Labels
von: Li, Mengke, et al.
Veröffentlicht: (2026)
von: Li, Mengke, et al.
Veröffentlicht: (2026)
Factorized Visual Tokenization and Generation
von: Bai, Zechen, et al.
Veröffentlicht: (2024)
von: Bai, Zechen, et al.
Veröffentlicht: (2024)
Improving Visual Prompt Tuning by Gaussian Neighborhood Minimization for Long-Tailed Visual Recognition
von: Li, Mengke, et al.
Veröffentlicht: (2024)
von: Li, Mengke, et al.
Veröffentlicht: (2024)
G$^2$TR: Generation-Guided Visual Token Reduction for Separate-Encoder Unified Multimodal Models
von: Li, Junxian, et al.
Veröffentlicht: (2026)
von: Li, Junxian, et al.
Veröffentlicht: (2026)
Less is More: Token-Efficient Video-QA via Adaptive Frame-Pruning and Semantic Graph Integration
von: Wang, Shaoguang, et al.
Veröffentlicht: (2025)
von: Wang, Shaoguang, et al.
Veröffentlicht: (2025)
Energy-Driven Adaptive Visual Token Pruning for Efficient Vision-Language Models
von: He, Jialuo, et al.
Veröffentlicht: (2026)
von: He, Jialuo, et al.
Veröffentlicht: (2026)
Adaptive-VoCo: Complexity-Aware Visual Token Compression for Vision-Language Models
von: Guo, Xiaoyang, et al.
Veröffentlicht: (2025)
von: Guo, Xiaoyang, et al.
Veröffentlicht: (2025)
OTPrune: Distribution-Aligned Visual Token Pruning via Optimal Transport
von: Chen, Xiwen, et al.
Veröffentlicht: (2026)
von: Chen, Xiwen, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
CVP: Central-Peripheral Vision-Inspired Multimodal Model for Spatial Reasoning
von: Chen, Zeyuan, et al.
Veröffentlicht: (2025) -
AlignTok: Aligning Visual Foundation Encoders to Tokenizers for Diffusion Models
von: Chen, Bowei, et al.
Veröffentlicht: (2025) -
Gaussian Swaying: Surface-Based Framework for Aerodynamic Simulation with 3D Gaussians
von: Yan, Hongru, et al.
Veröffentlicht: (2025) -
TokenCompose: Text-to-Image Diffusion with Token-level Supervision
von: Wang, Zirui, et al.
Veröffentlicht: (2023) -
C3Editor: Achieving Controllable Consistency in 2D Model for 3D Editing
von: Tao, Zeng, et al.
Veröffentlicht: (2025)