Revisiting MLLM Token Technology through the Lens of Classical Visual Coding
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Liu, Jinming, Lin, Junyan, Wei, Yuntao, Shao, Kele, Tao, Keda, Huang, Jianguo, Yang, Xudong, Chen, Zhibo, Wang, Huan, Jin, Xin |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Compression Tells Intelligence: Visual Coding, Visual Token Technology, and the Unification
par: Jin, Xin, et autres
Publié: (2026)
par: Jin, Xin, et autres
Publié: (2026)
StreamingTOM: Streaming Token Compression for Efficient Video Understanding
par: Chen, Xueyi, et autres
Publié: (2025)
par: Chen, Xueyi, et autres
Publié: (2025)
HoliTom: Holistic Token Merging for Fast Video Large Language Models
par: Shao, Kele, et autres
Publié: (2025)
par: Shao, Kele, et autres
Publié: (2025)
OmniZip: Audio-Guided Dynamic Token Compression for Fast Omnimodal Large Language Models
par: Tao, Keda, et autres
Publié: (2025)
par: Tao, Keda, et autres
Publié: (2025)
Semantics Disentanglement and Composition for Universal Image Coding with Efficiently LLM Reasoning and Generative Diffusion
par: Liu, Jinming, et autres
Publié: (2024)
par: Liu, Jinming, et autres
Publié: (2024)
Tell Codec What Worth Compressing: Semantically Disentangled Image Coding for Machine with LMMs
par: Liu, Jinming, et autres
Publié: (2024)
par: Liu, Jinming, et autres
Publié: (2024)
A Survey of Token Compression for Efficient Multimodal Large Language Models
par: Shao, Kele, et autres
Publié: (2025)
par: Shao, Kele, et autres
Publié: (2025)
Poison as Cure: Visual Noise for Mitigating Object Hallucinations in LVMs
par: Zhang, Kejia, et autres
Publié: (2025)
par: Zhang, Kejia, et autres
Publié: (2025)
DyCoke: Dynamic Compression of Tokens for Fast Video Large Language Models
par: Tao, Keda, et autres
Publié: (2024)
par: Tao, Keda, et autres
Publié: (2024)
Revisiting Visual Understanding in Multimodal Reasoning through a Lens of Image Perturbation
par: Li, Yuting, et autres
Publié: (2025)
par: Li, Yuting, et autres
Publié: (2025)
Is Oracle Pruning the True Oracle?
par: Feng, Sicheng, et autres
Publié: (2024)
par: Feng, Sicheng, et autres
Publié: (2024)
StreamingAssistant: Efficient Visual Token Pruning for Accelerating Online Video Understanding
par: Jin, Xinqi, et autres
Publié: (2025)
par: Jin, Xinqi, et autres
Publié: (2025)
TARS: MinMax Token-Adaptive Preference Strategy for Hallucination Reduction in MLLMs
par: Zhang, Kejia, et autres
Publié: (2025)
par: Zhang, Kejia, et autres
Publié: (2025)
UTPTrack: Towards Simple and Unified Token Pruning for Visual Tracking
par: Wu, Hao, et autres
Publié: (2026)
par: Wu, Hao, et autres
Publié: (2026)
ILLUME+: Illuminating Unified MLLM with Dual Visual Tokenization and Diffusion Refinement
par: Huang, Runhui, et autres
Publié: (2025)
par: Huang, Runhui, et autres
Publié: (2025)
Limitations and Implications: Revisiting the Clinical Relevance of Ductal Features in Abiraterone‐Treated Prostate Cancer
par: Wenjing Xie, et autres
Publié: (2026)
par: Wenjing Xie, et autres
Publié: (2026)
Slot-MLLM: Object-Centric Visual Tokenization for Multimodal LLM
par: Chi, Donghwan, et autres
Publié: (2025)
par: Chi, Donghwan, et autres
Publié: (2025)
CodeDance: A Dynamic Tool-integrated MLLM for Executable Visual Reasoning
par: Song, Qi, et autres
Publié: (2025)
par: Song, Qi, et autres
Publié: (2025)
Survey on Visual Signal Coding and Processing with Generative Models: Technologies, Standards and Optimization
par: Chen, Zhibo, et autres
Publié: (2024)
par: Chen, Zhibo, et autres
Publié: (2024)
TokenCarve: Information-Preserving Visual Token Compression in Multimodal Large Language Models
par: Tan, Xudong, et autres
Publié: (2025)
par: Tan, Xudong, et autres
Publié: (2025)
VisualLens: Personalization through Task-Agnostic Visual History
par: Zhu, Wang Bill, et autres
Publié: (2024)
par: Zhu, Wang Bill, et autres
Publié: (2024)
Plug-and-Play 1.x-Bit KV Cache Quantization for Video Large Language Models
par: Tao, Keda, et autres
Publié: (2025)
par: Tao, Keda, et autres
Publié: (2025)
Which Heads Matter for Reasoning? RL-Guided KV Cache Compression
par: Du, Wenjie, et autres
Publié: (2025)
par: Du, Wenjie, et autres
Publié: (2025)
Speak While Watching: Unleashing TRUE Real-Time Video Understanding Capability of Multimodal Large Language Models
par: Lin, Junyan, et autres
Publié: (2026)
par: Lin, Junyan, et autres
Publié: (2026)
AdaCodec: A Predictive Visual Code for Video MLLMs
par: Hou, Haowen, et autres
Publié: (2026)
par: Hou, Haowen, et autres
Publié: (2026)
Visual Position Prompt for MLLM based Visual Grounding
par: Tang, Wei, et autres
Publié: (2025)
par: Tang, Wei, et autres
Publié: (2025)
Treat Visual Tokens as Text? But Your MLLM Only Needs Fewer Efforts to See
par: Zhang, Zeliang, et autres
Publié: (2024)
par: Zhang, Zeliang, et autres
Publié: (2024)
LatentLens: Revealing Highly Interpretable Visual Tokens in LLMs
par: Krojer, Benno, et autres
Publié: (2026)
par: Krojer, Benno, et autres
Publié: (2026)
LVOmniBench: Pioneering Long Audio-Video Understanding Evaluation for Omnimodal LLMs
par: Tao, Keda, et autres
Publié: (2026)
par: Tao, Keda, et autres
Publié: (2026)
RedundancyLens: Revealing and Exploiting Visual Token Processing Redundancy for Efficient Decoder-Only MLLMs
par: Li, Hongliang, et autres
Publié: (2025)
par: Li, Hongliang, et autres
Publié: (2025)
ECR-Chain: Advancing Generative Language Models to Better Emotion-Cause Reasoners through Reasoning Chains
par: Huang, Zhaopei, et autres
Publié: (2024)
par: Huang, Zhaopei, et autres
Publié: (2024)
Sequential Token Merging: Revisiting Hidden States
par: Wen, Yan, et autres
Publié: (2025)
par: Wen, Yan, et autres
Publié: (2025)
Diff-ICMH: Harmonizing Machine and Human Vision in Image Compression with Generative Prior
par: Feng, Ruoyu, et autres
Publié: (2025)
par: Feng, Ruoyu, et autres
Publié: (2025)
Revisiting Multi-Permutation Equivariance through the Lens of Irreducible Representations
par: Sverdlov, Yonatan, et autres
Publié: (2024)
par: Sverdlov, Yonatan, et autres
Publié: (2024)
Revisiting Transformers through the Lens of Low Entropy and Dynamic Sparsity
par: Ren, Ruifeng, et autres
Publié: (2025)
par: Ren, Ruifeng, et autres
Publié: (2025)
Multilingual Tokenization through the Lens of Indian Languages: Challenges and Insights
par: Karthika, N J, et autres
Publié: (2025)
par: Karthika, N J, et autres
Publié: (2025)
EfficientUICoder: Efficient MLLM-based UI Code Generation via Input and Output Token Compression
par: Xiao, Jingyu, et autres
Publié: (2025)
par: Xiao, Jingyu, et autres
Publié: (2025)
Rethinking MLLM Itself as a Segmenter with a Single Segmentation Token
par: Zhang, Anqi, et autres
Publié: (2026)
par: Zhang, Anqi, et autres
Publié: (2026)
Homogeneous Tokenizer Matters: Homogeneous Visual Tokenizer for Remote Sensing Image Understanding
par: Shao, Run, et autres
Publié: (2024)
par: Shao, Run, et autres
Publié: (2024)
Active Perception Agent for Omnimodal Audio-Video Understanding
par: Tao, Keda, et autres
Publié: (2025)
par: Tao, Keda, et autres
Publié: (2025)
Documents similaires
-
Compression Tells Intelligence: Visual Coding, Visual Token Technology, and the Unification
par: Jin, Xin, et autres
Publié: (2026) -
StreamingTOM: Streaming Token Compression for Efficient Video Understanding
par: Chen, Xueyi, et autres
Publié: (2025) -
HoliTom: Holistic Token Merging for Fast Video Large Language Models
par: Shao, Kele, et autres
Publié: (2025) -
OmniZip: Audio-Guided Dynamic Token Compression for Fast Omnimodal Large Language Models
par: Tao, Keda, et autres
Publié: (2025) -
Semantics Disentanglement and Composition for Universal Image Coding with Efficiently LLM Reasoning and Generative Diffusion
par: Liu, Jinming, et autres
Publié: (2024)