AdaTok: Adaptive Token Compression with Object-Aware Representations for Efficient Multimodal LLMs
Fuente:
arXiv
Saved in:
| Main Authors: | Zhang, Xinliang, Zhu, Lei, He, Hangzhou, Zeng, Shuang, Fu, Ourui, Hu, Jiakui, Yao, Zhengjian, Lu, Yanye |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Chat-CBM: Towards Interactive Concept Bottleneck Models with Frozen Large Language Models
by: He, Hangzhou, et al.
Published: (2025)
by: He, Hangzhou, et al.
Published: (2025)
Exploiting Inherent Class Label: Towards Robust Scribble Supervised Semantic Segmentation
by: Zhang, Xinliang, et al.
Published: (2025)
by: Zhang, Xinliang, et al.
Published: (2025)
Bridging Information Asymmetry: A Hierarchical Framework for Deterministic Blind Face Restoration
by: Yao, Zhengjian, et al.
Published: (2026)
by: Yao, Zhengjian, et al.
Published: (2026)
Inter- and Intra-image Refinement for Few Shot Segmentation
by: Fu, Ourui, et al.
Published: (2025)
by: Fu, Ourui, et al.
Published: (2025)
V2C-CBM: Building Concept Bottlenecks with Vision-to-Concept Tokenizer
by: He, Hangzhou, et al.
Published: (2025)
by: He, Hangzhou, et al.
Published: (2025)
RADA: Region-Aware Dual-encoder Auxiliary learning for Barely-supervised Medical Image Segmentation
by: Zeng, Shuang, et al.
Published: (2026)
by: Zeng, Shuang, et al.
Published: (2026)
SuperCL: Superpixel Guided Contrastive Learning for Medical Image Segmentation Pre-training
by: Zeng, Shuang, et al.
Published: (2025)
by: Zeng, Shuang, et al.
Published: (2025)
Enhancing Image Restoration Transformer via Adaptive Translation Equivariance
by: Hu, JiaKui, et al.
Published: (2025)
by: Hu, JiaKui, et al.
Published: (2025)
Improve Retinal Artery/Vein Classification via Channel Couplin
by: Zeng, Shuang, et al.
Published: (2025)
by: Zeng, Shuang, et al.
Published: (2025)
Low-Rank Mixture-of-Experts for Continual Medical Image Segmentation
by: Chen, Qian, et al.
Published: (2024)
by: Chen, Qian, et al.
Published: (2024)
Scribble Hides Class: Promoting Scribble-Based Weakly-Supervised Semantic Segmentation with Its Class Label
by: Zhang, Xinliang, et al.
Published: (2024)
by: Zhang, Xinliang, et al.
Published: (2024)
DynaTok: Temporally Adaptive and Positional Bias-Aware Token Compression for Video-LLMs
by: Park, Minyoung, et al.
Published: (2026)
by: Park, Minyoung, et al.
Published: (2026)
Training-free Test-time Improvement for Explainable Medical Image Classification
by: He, Hangzhou, et al.
Published: (2025)
by: He, Hangzhou, et al.
Published: (2025)
Spike2Former: Efficient Spiking Transformer for High-performance Image Segmentation
by: Lei, Zhenxin, et al.
Published: (2024)
by: Lei, Zhenxin, et al.
Published: (2024)
Bridging Degradation Discrimination and Generation for Universal Image Restoration
by: Hu, JiaKui, et al.
Published: (2026)
by: Hu, JiaKui, et al.
Published: (2026)
Universal Image Restoration Pre-training via Degradation Classification
by: Hu, JiaKui, et al.
Published: (2025)
by: Hu, JiaKui, et al.
Published: (2025)
Universal Image Restoration Pre-training via Masked Degradation Classification
by: Hu, JiaKui, et al.
Published: (2025)
by: Hu, JiaKui, et al.
Published: (2025)
InfoTok: Adaptive Discrete Video Tokenizer via Information-Theoretic Compression
by: Ye, Haotian, et al.
Published: (2025)
by: Ye, Haotian, et al.
Published: (2025)
MultiTok: Variable-Length Tokenization for Efficient LLMs Adapted from LZW Compression
by: Elias, Noel, et al.
Published: (2024)
by: Elias, Noel, et al.
Published: (2024)
Narrative Weaver: Towards Controllable Long-Range Visual Consistency with Multi-Modal Conditioning
by: Yao, Zhengjian, et al.
Published: (2026)
by: Yao, Zhengjian, et al.
Published: (2026)
VisionSelector: End-to-End Learnable Visual Token Compression for Efficient Multimodal LLMs
by: Zhu, Jiaying, et al.
Published: (2025)
by: Zhu, Jiaying, et al.
Published: (2025)
Multi-level Asymmetric Contrastive Learning for Volumetric Medical Image Segmentation Pre-training
by: Zeng, Shuang, et al.
Published: (2023)
by: Zeng, Shuang, et al.
Published: (2023)
Novel Extraction of Discriminative Fine-Grained Feature to Improve Retinal Vessel Segmentation
by: Zeng, Shuang, et al.
Published: (2025)
by: Zeng, Shuang, et al.
Published: (2025)
DynTok: Dynamic Compression of Visual Tokens for Efficient and Effective Video Understanding
by: Zhang, Hongzhi, et al.
Published: (2025)
by: Zhang, Hongzhi, et al.
Published: (2025)
DA-Ada: Learning Domain-Aware Adapter for Domain Adaptive Object Detection
by: Li, Haochen, et al.
Published: (2024)
by: Li, Haochen, et al.
Published: (2024)
AdaNAT: Exploring Adaptive Policy for Token-Based Image Generation
by: Ni, Zanlin, et al.
Published: (2024)
by: Ni, Zanlin, et al.
Published: (2024)
AdaPerceiver: Transformers with Adaptive Width, Depth, and Tokens
by: Jajal, Purvish, et al.
Published: (2025)
by: Jajal, Purvish, et al.
Published: (2025)
AdaPonderLM: Gated Pondering Language Models with Token-Wise Adaptive Depth
by: Song, Shixiang, et al.
Published: (2026)
by: Song, Shixiang, et al.
Published: (2026)
ElasticTok: Adaptive Tokenization for Image and Video
by: Yan, Wilson, et al.
Published: (2024)
by: Yan, Wilson, et al.
Published: (2024)
AdaGATE: Adaptive Gap-Aware Token-Efficient Evidence Assembly for Multi-Hop Retrieval-Augmented Generation
by: Guo, Yilin, et al.
Published: (2026)
by: Guo, Yilin, et al.
Published: (2026)
AdaFuse: Adaptive Ensemble Decoding with Test-Time Scaling for LLMs
by: Cui, Chengming, et al.
Published: (2026)
by: Cui, Chengming, et al.
Published: (2026)
TokLIP: Marry Visual Tokens to CLIP for Multimodal Comprehension and Generation
by: Lin, Haokun, et al.
Published: (2025)
by: Lin, Haokun, et al.
Published: (2025)
AdaMorph: Unified Motion Retargeting via Embodiment-Aware Adaptive Transformers
by: Zhang, Haoyu, et al.
Published: (2026)
by: Zhang, Haoyu, et al.
Published: (2026)
MelTok: 2D Tokenization for Single-Codebook Audio Compression
by: Li, Jingyi, et al.
Published: (2025)
by: Li, Jingyi, et al.
Published: (2025)
Token Sequence Compression for Efficient Multimodal Computing
by: Omri, Yasmine, et al.
Published: (2025)
by: Omri, Yasmine, et al.
Published: (2025)
Beyond Text: Frozen Large Language Models in Visual Signal Comprehension
by: Zhu, Lei, et al.
Published: (2024)
by: Zhu, Lei, et al.
Published: (2024)
STORM: Token-Efficient Long Video Understanding for Multimodal LLMs
by: Jiang, Jindong, et al.
Published: (2025)
by: Jiang, Jindong, et al.
Published: (2025)
AdaMoE: Token-Adaptive Routing with Null Experts for Mixture-of-Experts Language Models
by: Zeng, Zihao, et al.
Published: (2024)
by: Zeng, Zihao, et al.
Published: (2024)
An Efficient Token Compression Framework for Visual Object Tracking
by: Wu, Weijing, et al.
Published: (2026)
by: Wu, Weijing, et al.
Published: (2026)
Ada-Diffuser: Latent-Aware Adaptive Diffusion for Decision-Making
by: Feng, Fan, et al.
Published: (2026)
by: Feng, Fan, et al.
Published: (2026)
Similar Items
-
Chat-CBM: Towards Interactive Concept Bottleneck Models with Frozen Large Language Models
by: He, Hangzhou, et al.
Published: (2025) -
Exploiting Inherent Class Label: Towards Robust Scribble Supervised Semantic Segmentation
by: Zhang, Xinliang, et al.
Published: (2025) -
Bridging Information Asymmetry: A Hierarchical Framework for Deterministic Blind Face Restoration
by: Yao, Zhengjian, et al.
Published: (2026) -
Inter- and Intra-image Refinement for Few Shot Segmentation
by: Fu, Ourui, et al.
Published: (2025) -
V2C-CBM: Building Concept Bottlenecks with Vision-to-Concept Tokenizer
by: He, Hangzhou, et al.
Published: (2025)