Compression Tells Intelligence: Visual Coding, Visual Token Technology, and the Unification
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Jin, Xin, Liu, Jinming, Wei, Yuntao, Lin, Junyan, Wang, Zhicheng, Huang, Jianguo, Yang, Xudong, Liu, Yanxiao, Zeng, Wenjun |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Revisiting MLLM Token Technology through the Lens of Classical Visual Coding
par: Liu, Jinming, et autres
Publié: (2025)
par: Liu, Jinming, et autres
Publié: (2025)
Tell Codec What Worth Compressing: Semantically Disentangled Image Coding for Machine with LMMs
par: Liu, Jinming, et autres
Publié: (2024)
par: Liu, Jinming, et autres
Publié: (2024)
Semantics Disentanglement and Composition for Universal Image Coding with Efficiently LLM Reasoning and Generative Diffusion
par: Liu, Jinming, et autres
Publié: (2024)
par: Liu, Jinming, et autres
Publié: (2024)
When MLLMs Meet Compression Distortion: A Coding Paradigm Tailored to MLLMs
par: Liu, Jinming, et autres
Publié: (2025)
par: Liu, Jinming, et autres
Publié: (2025)
Can Visual Input Be Compressed? A Visual Token Compression Benchmark for Large Multimodal Models
par: Peng, Tianfan, et autres
Publié: (2025)
par: Peng, Tianfan, et autres
Publié: (2025)
TokenCarve: Information-Preserving Visual Token Compression in Multimodal Large Language Models
par: Tan, Xudong, et autres
Publié: (2025)
par: Tan, Xudong, et autres
Publié: (2025)
TokenSeg: Efficient 3D Medical Image Segmentation via Hierarchical Visual Token Compression
par: Zeng, Sen, et autres
Publié: (2026)
par: Zeng, Sen, et autres
Publié: (2026)
UTPTrack: Towards Simple and Unified Token Pruning for Visual Tracking
par: Wu, Hao, et autres
Publié: (2026)
par: Wu, Hao, et autres
Publié: (2026)
Rate-Distortion-Cognition Controllable Versatile Neural Image Compression
par: Liu, Jinming, et autres
Publié: (2024)
par: Liu, Jinming, et autres
Publié: (2024)
Visual Transformation Telling
par: Cui, Wanqing, et autres
Publié: (2023)
par: Cui, Wanqing, et autres
Publié: (2023)
Generation Navigator: A State-Aware Agentic Framework for Image Generation
par: Liu, Jinming, et autres
Publié: (2026)
par: Liu, Jinming, et autres
Publié: (2026)
QG-VTC: Question-Guided Visual Token Compression in MLLMs for Efficient VQA
par: Li, Shuai, et autres
Publié: (2025)
par: Li, Shuai, et autres
Publié: (2025)
TokBench: Evaluating Your Visual Tokenizer before Visual Generation
par: Wu, Junfeng, et autres
Publié: (2025)
par: Wu, Junfeng, et autres
Publié: (2025)
An Efficient Streaming Video Understanding Framework with Agentic Control
par: Liu, Jinming, et autres
Publié: (2026)
par: Liu, Jinming, et autres
Publié: (2026)
VisionSelector: End-to-End Learnable Visual Token Compression for Efficient Multimodal LLMs
par: Zhu, Jiaying, et autres
Publié: (2025)
par: Zhu, Jiaying, et autres
Publié: (2025)
VOLoc: Visual Place Recognition by Querying Compressed Lidar Map
par: Cai, Xudong, et autres
Publié: (2024)
par: Cai, Xudong, et autres
Publié: (2024)
Stereo Image Coding for Machines with Joint Visual Feature Compression
par: Jin, Dengchao, et autres
Publié: (2025)
par: Jin, Dengchao, et autres
Publié: (2025)
TCFormer: Visual Recognition via Token Clustering Transformer
par: Zeng, Wang, et autres
Publié: (2024)
par: Zeng, Wang, et autres
Publié: (2024)
Attention Guidance Mechanism for Handwritten Mathematical Expression Recognition
par: Liu, Yutian, et autres
Publié: (2024)
par: Liu, Yutian, et autres
Publié: (2024)
InternVL-X: Advancing and Accelerating InternVL Series with Efficient Visual Token Compression
par: Lu, Dongchen, et autres
Publié: (2025)
par: Lu, Dongchen, et autres
Publié: (2025)
Video-LaVIT: Unified Video-Language Pre-training with Decoupled Visual-Motional Tokenization
par: Jin, Yang, et autres
Publié: (2024)
par: Jin, Yang, et autres
Publié: (2024)
Dynamic-VLM: Simple Dynamic Visual Token Compression for VideoLLM
par: Wang, Han, et autres
Publié: (2024)
par: Wang, Han, et autres
Publié: (2024)
Top-Down Compression: Revisit Efficient Vision Token Projection for Visual Instruction Tuning
par: li, Bonan, et autres
Publié: (2025)
par: li, Bonan, et autres
Publié: (2025)
Speak While Watching: Unleashing TRUE Real-Time Video Understanding Capability of Multimodal Large Language Models
par: Lin, Junyan, et autres
Publié: (2026)
par: Lin, Junyan, et autres
Publié: (2026)
FCoT-VL:Advancing Text-oriented Large Vision-Language Models with Efficient Visual Token Compression
par: Li, Jianjian, et autres
Publié: (2025)
par: Li, Jianjian, et autres
Publié: (2025)
Tell Me Without Telling Me: Two-Way Prediction of Visualization Literacy and Visual Attention
par: Chang, Minsuk, et autres
Publié: (2025)
par: Chang, Minsuk, et autres
Publié: (2025)
One at a Time: Progressive Multi-step Volumetric Probability Learning for Reliable 3D Scene Perception
par: Li, Bohan, et autres
Publié: (2023)
par: Li, Bohan, et autres
Publié: (2023)
ETC: Extreme Token Compression via Task-aware Visual Information Distillation in VLMs
par: Gao, Yiling, et autres
Publié: (2026)
par: Gao, Yiling, et autres
Publié: (2026)
A Glimpse to Compress: Dynamic Visual Token Pruning for Large Vision-Language Models
par: Zeng, Quan-Sheng, et autres
Publié: (2025)
par: Zeng, Quan-Sheng, et autres
Publié: (2025)
MAL: Cluster-Masked and Multi-Task Pretraining for Enhanced xLSTM Vision Performance
par: Huang, Wenjun, et autres
Publié: (2024)
par: Huang, Wenjun, et autres
Publié: (2024)
Are We Using the Right Benchmark: An Evaluation Framework for Visual Token Compression Methods
par: Liao, Chenfei, et autres
Publié: (2025)
par: Liao, Chenfei, et autres
Publié: (2025)
An Efficient Token Compression Framework for Visual Object Tracking
par: Wu, Weijing, et autres
Publié: (2026)
par: Wu, Weijing, et autres
Publié: (2026)
LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models
par: Liu, Juntao, et autres
Publié: (2025)
par: Liu, Juntao, et autres
Publié: (2025)
How Many Visual Tokens Do Multimodal Language Models Need? Scaling Visual Token Pruning with F^3A
par: Huang, YiJie, et autres
Publié: (2026)
par: Huang, YiJie, et autres
Publié: (2026)
EVATok: Adaptive Length Video Tokenization for Efficient Visual Autoregressive Generation
par: Xiong, Tianwei, et autres
Publié: (2026)
par: Xiong, Tianwei, et autres
Publié: (2026)
Fourier Compressor: Frequency-Domain Visual Token Compression for Vision-Language Models
par: Wang, Huanyu, et autres
Publié: (2025)
par: Wang, Huanyu, et autres
Publié: (2025)
On the Adversarial Robustness of Large Vision-Language Models under Visual Token Compression
par: Zhang, Xinwei, et autres
Publié: (2026)
par: Zhang, Xinwei, et autres
Publié: (2026)
Visual Text Compression as Measure Transport
par: Tang, Lv, et autres
Publié: (2026)
par: Tang, Lv, et autres
Publié: (2026)
Closed-Loop Unsupervised Representation Disentanglement with $β$-VAE Distillation and Diffusion Probabilistic Feedback
par: Jin, Xin, et autres
Publié: (2024)
par: Jin, Xin, et autres
Publié: (2024)
2D Gaussians Meet Visual Tokenizer
par: Shi, Yiang, et autres
Publié: (2025)
par: Shi, Yiang, et autres
Publié: (2025)
Documents similaires
-
Revisiting MLLM Token Technology through the Lens of Classical Visual Coding
par: Liu, Jinming, et autres
Publié: (2025) -
Tell Codec What Worth Compressing: Semantically Disentangled Image Coding for Machine with LMMs
par: Liu, Jinming, et autres
Publié: (2024) -
Semantics Disentanglement and Composition for Universal Image Coding with Efficiently LLM Reasoning and Generative Diffusion
par: Liu, Jinming, et autres
Publié: (2024) -
When MLLMs Meet Compression Distortion: A Coding Paradigm Tailored to MLLMs
par: Liu, Jinming, et autres
Publié: (2025) -
Can Visual Input Be Compressed? A Visual Token Compression Benchmark for Large Multimodal Models
par: Peng, Tianfan, et autres
Publié: (2025)