Highly Compressed Tokenizer Can Generate Without Training
Fuente:
arXiv
Salvato in:
| Autori principali: | Beyer, L. Lao, Li, T., Chen, X., Karaman, S., He, K. |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Semantic-Geometric Dual Compression: Training-Free Visual Token Reduction for Ultra-High-Resolution Remote Sensing Understanding
di: Li, Yueying, et al.
Pubblicazione: (2026)
di: Li, Yueying, et al.
Pubblicazione: (2026)
DC-AR: Efficient Masked Autoregressive Image Generation with Deep Compression Hybrid Tokenizer
di: Wu, Yecheng, et al.
Pubblicazione: (2025)
di: Wu, Yecheng, et al.
Pubblicazione: (2025)
OccamToken: Efficient VLM Inference with Training-Free and Budget-Adaptive Token Pruning
di: Li, Geng, et al.
Pubblicazione: (2026)
di: Li, Geng, et al.
Pubblicazione: (2026)
Towards Lossless Ultimate Vision Token Compression for VLMs
di: Zheng, Dehua, et al.
Pubblicazione: (2025)
di: Zheng, Dehua, et al.
Pubblicazione: (2025)
HybridToken-VLM: Hybrid Token Compression for Vision-Language Models
di: Zhang, Jusheng, et al.
Pubblicazione: (2025)
di: Zhang, Jusheng, et al.
Pubblicazione: (2025)
InfoTok: Adaptive Discrete Video Tokenizer via Information-Theoretic Compression
di: Ye, Haotian, et al.
Pubblicazione: (2025)
di: Ye, Haotian, et al.
Pubblicazione: (2025)
StreamingTOM: Streaming Token Compression for Efficient Video Understanding
di: Chen, Xueyi, et al.
Pubblicazione: (2025)
di: Chen, Xueyi, et al.
Pubblicazione: (2025)
UHR-BAT: Budget-Aware Token Compression Vision-Language model for Ultra-High-Resolution Remote Sensing
di: Dang, Yunkai, et al.
Pubblicazione: (2026)
di: Dang, Yunkai, et al.
Pubblicazione: (2026)
Advanced Sign Language Video Generation with Compressed and Quantized Multi-Condition Tokenization
di: Wang, Cong, et al.
Pubblicazione: (2025)
di: Wang, Cong, et al.
Pubblicazione: (2025)
Fourier Compressor: Frequency-Domain Visual Token Compression for Vision-Language Models
di: Wang, Huanyu, et al.
Pubblicazione: (2025)
di: Wang, Huanyu, et al.
Pubblicazione: (2025)
Conditional Video Generation for High-Efficiency Video Compression
di: Yi, Fangqiu, et al.
Pubblicazione: (2025)
di: Yi, Fangqiu, et al.
Pubblicazione: (2025)
Flow Matching with Uncertainty Quantification and Guidance
di: Han, Juyeop, et al.
Pubblicazione: (2026)
di: Han, Juyeop, et al.
Pubblicazione: (2026)
AdaTok: Adaptive Token Compression with Object-Aware Representations for Efficient Multimodal LLMs
di: Zhang, Xinliang, et al.
Pubblicazione: (2025)
di: Zhang, Xinliang, et al.
Pubblicazione: (2025)
TC-SSA: Token Compression via Semantic Slot Aggregation for Gigapixel Pathology Reasoning
di: Chen, Zhuo, et al.
Pubblicazione: (2026)
di: Chen, Zhuo, et al.
Pubblicazione: (2026)
QMoP: Query Guided Mixture-of-Projector for Efficient Visual Token Compression
di: Li, Zhongyang, et al.
Pubblicazione: (2026)
di: Li, Zhongyang, et al.
Pubblicazione: (2026)
DC-Gen: Post-Training Diffusion Acceleration with Deeply Compressed Latent Space
di: He, Wenkun, et al.
Pubblicazione: (2025)
di: He, Wenkun, et al.
Pubblicazione: (2025)
Can LLMs See Without Pixels? Benchmarking Spatial Intelligence from Textual Descriptions
di: Guo, Zhongbin, et al.
Pubblicazione: (2026)
di: Guo, Zhongbin, et al.
Pubblicazione: (2026)
Contribution-aware Token Compression for Efficient Video Understanding via Reinforcement Learning
di: Ma, Yinchao, et al.
Pubblicazione: (2026)
di: Ma, Yinchao, et al.
Pubblicazione: (2026)
TokenFlow: Unified Image Tokenizer for Multimodal Understanding and Generation
di: Qu, Liao, et al.
Pubblicazione: (2024)
di: Qu, Liao, et al.
Pubblicazione: (2024)
Motion Guided Token Compression for Efficient Masked Video Modeling
di: Feng, Yukun, et al.
Pubblicazione: (2024)
di: Feng, Yukun, et al.
Pubblicazione: (2024)
ForestPrune: High-ratio Visual Token Compression for Video Multimodal Large Language Models via Spatial-Temporal Forest Modeling
di: Ju, Shaobo, et al.
Pubblicazione: (2026)
di: Ju, Shaobo, et al.
Pubblicazione: (2026)
On the Limits of Token Reduction for Efficient Unified Vision Language Training
di: Chen, Siyi, et al.
Pubblicazione: (2026)
di: Chen, Siyi, et al.
Pubblicazione: (2026)
A General and Efficient Training for Transformer via Token Expansion
di: Huang, Wenxuan, et al.
Pubblicazione: (2024)
di: Huang, Wenxuan, et al.
Pubblicazione: (2024)
Dataset Color Quantization: A Training-Oriented Framework for Dataset-Level Compression
di: Yu, Chenyue, et al.
Pubblicazione: (2026)
di: Yu, Chenyue, et al.
Pubblicazione: (2026)
Compression for Better: A General and Stable Lossless Compression Framework
di: Zhang, Boyang, et al.
Pubblicazione: (2024)
di: Zhang, Boyang, et al.
Pubblicazione: (2024)
Token Sequence Compression for Efficient Multimodal Computing
di: Omri, Yasmine, et al.
Pubblicazione: (2025)
di: Omri, Yasmine, et al.
Pubblicazione: (2025)
Luminark: Training-free, Probabilistically-Certified Watermarking for General Vision Generative Models
di: Xu, Jiayi, et al.
Pubblicazione: (2026)
di: Xu, Jiayi, et al.
Pubblicazione: (2026)
TV-SAM: Increasing Zero-Shot Segmentation Performance on Multimodal Medical Images Using GPT-4 Generated Descriptive Prompts Without Human Annotation
di: Jiang, Zekun, et al.
Pubblicazione: (2024)
di: Jiang, Zekun, et al.
Pubblicazione: (2024)
Gen-LangSplat: Generalized Language Gaussian Splatting with Pre-Trained Feature Compression
di: Saxena, Pranav
Pubblicazione: (2025)
di: Saxena, Pranav
Pubblicazione: (2025)
Toward Ethical Facial Age Estimation: A Generalized Zero-Shot Benchmark Without Training on Children's Data
di: Petrucci, Caio, et al.
Pubblicazione: (2026)
di: Petrucci, Caio, et al.
Pubblicazione: (2026)
Deep Compression Autoencoder for Efficient High-Resolution Diffusion Models
di: Chen, Junyu, et al.
Pubblicazione: (2024)
di: Chen, Junyu, et al.
Pubblicazione: (2024)
Energy-Driven Adaptive Visual Token Pruning for Efficient Vision-Language Models
di: He, Jialuo, et al.
Pubblicazione: (2026)
di: He, Jialuo, et al.
Pubblicazione: (2026)
ImgCoT: Compressing Long Chain of Thought into Compact Visual Tokens for Efficient Reasoning of Large Language Model
di: Chen, Xiaoshu, et al.
Pubblicazione: (2026)
di: Chen, Xiaoshu, et al.
Pubblicazione: (2026)
Token Merging for Training-Free Semantic Binding in Text-to-Image Synthesis
di: Hu, Taihang, et al.
Pubblicazione: (2024)
di: Hu, Taihang, et al.
Pubblicazione: (2024)
PlaneCycle: Training-Free 2D-to-3D Lifting of Foundation Models Without Adapters
di: Yu, Yinghong, et al.
Pubblicazione: (2026)
di: Yu, Yinghong, et al.
Pubblicazione: (2026)
FCoT-VL:Advancing Text-oriented Large Vision-Language Models with Efficient Visual Token Compression
di: Li, Jianjian, et al.
Pubblicazione: (2025)
di: Li, Jianjian, et al.
Pubblicazione: (2025)
Towards Compact and Robust DNNs via Compression-aware Sharpness Minimization
di: He, Jialuo, et al.
Pubblicazione: (2026)
di: He, Jialuo, et al.
Pubblicazione: (2026)
TokenMotion: Decoupled Motion Control via Token Disentanglement for Human-centric Video Generation
di: Li, Ruineng, et al.
Pubblicazione: (2025)
di: Li, Ruineng, et al.
Pubblicazione: (2025)
OTT-Vid: Optimal Transport Temporal Token Compression for Video Large Language Models
di: Kang, Minseok, et al.
Pubblicazione: (2026)
di: Kang, Minseok, et al.
Pubblicazione: (2026)
DC-VideoGen: Efficient Video Generation with Deep Compression Video Autoencoder
di: Chen, Junyu, et al.
Pubblicazione: (2025)
di: Chen, Junyu, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Semantic-Geometric Dual Compression: Training-Free Visual Token Reduction for Ultra-High-Resolution Remote Sensing Understanding
di: Li, Yueying, et al.
Pubblicazione: (2026) -
DC-AR: Efficient Masked Autoregressive Image Generation with Deep Compression Hybrid Tokenizer
di: Wu, Yecheng, et al.
Pubblicazione: (2025) -
OccamToken: Efficient VLM Inference with Training-Free and Budget-Adaptive Token Pruning
di: Li, Geng, et al.
Pubblicazione: (2026) -
Towards Lossless Ultimate Vision Token Compression for VLMs
di: Zheng, Dehua, et al.
Pubblicazione: (2025) -
HybridToken-VLM: Hybrid Token Compression for Vision-Language Models
di: Zhang, Jusheng, et al.
Pubblicazione: (2025)