Enregistré dans:
| Auteurs principaux: | Tang, Lv, Zheng, Tianyi, Li, Bo, Li, Xingyu |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2602.01554 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
InfoTok: Adaptive Discrete Video Tokenizer via Information-Theoretic Compression
par: Ye, Haotian, et autres
Publié: (2025)
par: Ye, Haotian, et autres
Publié: (2025)
Visual Text Compression as Measure Transport
par: Tang, Lv, et autres
Publié: (2026)
par: Tang, Lv, et autres
Publié: (2026)
UniTok: A Unified Tokenizer for Visual Generation and Understanding
par: Ma, Chuofan, et autres
Publié: (2025)
par: Ma, Chuofan, et autres
Publié: (2025)
Mitigating Visual Hallucinations via Semantic Curriculum Preference Optimization in MLLMs
par: Li, Yuanshuai, et autres
Publié: (2025)
par: Li, Yuanshuai, et autres
Publié: (2025)
UniWeTok: An Unified Binary Tokenizer with Codebook Size $\mathit{2^{128}}$ for Unified Multimodal Large Language Model
par: Zhuang, Shaobin, et autres
Publié: (2026)
par: Zhuang, Shaobin, et autres
Publié: (2026)
IDPruner: Harmonizing Importance and Diversity in Visual Token Pruning for MLLMs
par: Tan, Yifan, et autres
Publié: (2026)
par: Tan, Yifan, et autres
Publié: (2026)
VidTok: A Versatile and Open-Source Video Tokenizer
par: Tang, Anni, et autres
Publié: (2024)
par: Tang, Anni, et autres
Publié: (2024)
MacTok: Robust Continuous Tokenization for Image Generation
par: Zeng, Hengyu, et autres
Publié: (2026)
par: Zeng, Hengyu, et autres
Publié: (2026)
HieraTok: Multi-Scale Visual Tokenizer Improves Image Reconstruction and Generation
par: Chen, Cong, et autres
Publié: (2025)
par: Chen, Cong, et autres
Publié: (2025)
VISA: Group-wise Visual Token Selection and Aggregation via Graph Summarization for Efficient MLLMs Inference
par: Jiang, Pengfei, et autres
Publié: (2025)
par: Jiang, Pengfei, et autres
Publié: (2025)
TokLIP: Marry Visual Tokens to CLIP for Multimodal Comprehension and Generation
par: Lin, Haokun, et autres
Publié: (2025)
par: Lin, Haokun, et autres
Publié: (2025)
CrystaL: Spontaneous Emergence of Visual Latents in MLLMs
par: Zhang, Yang, et autres
Publié: (2026)
par: Zhang, Yang, et autres
Publié: (2026)
Efficient3D: A Unified Framework for Adaptive and Debiased Token Reduction in 3D MLLMs
par: Lin, Yuhui, et autres
Publié: (2026)
par: Lin, Yuhui, et autres
Publié: (2026)
SemHiTok: A Unified Image Tokenizer via Semantic-Guided Hierarchical Codebook for Multimodal Understanding and Generation
par: Chen, Zisheng, et autres
Publié: (2025)
par: Chen, Zisheng, et autres
Publié: (2025)
Beyond Attention or Similarity: Maximizing Conditional Diversity for Token Pruning in MLLMs
par: Zhang, Qizhe, et autres
Publié: (2025)
par: Zhang, Qizhe, et autres
Publié: (2025)
Discrete Diffusion Models with MLLMs for Unified Medical Multimodal Generation
par: Mao, Jiawei, et autres
Publié: (2025)
par: Mao, Jiawei, et autres
Publié: (2025)
ToolTok: Tool Tokenization for Efficient and Generalizable GUI Agents
par: Wang, Xiaoce, et autres
Publié: (2026)
par: Wang, Xiaoce, et autres
Publié: (2026)
PyraTok: Language-Aligned Pyramidal Tokenizer for Video Understanding and Generation
par: Susladkar, Onkar, et autres
Publié: (2026)
par: Susladkar, Onkar, et autres
Publié: (2026)
On the Limits of Token Reduction for Efficient Unified Vision Language Training
par: Chen, Siyi, et autres
Publié: (2026)
par: Chen, Siyi, et autres
Publié: (2026)
SweetTok: Semantic-Aware Spatial-Temporal Tokenizer for Compact Video Discretization
par: Tan, Zhentao, et autres
Publié: (2024)
par: Tan, Zhentao, et autres
Publié: (2024)
Do MLLMs Really See It: Reinforcing Visual Attention in Multimodal LLMs
par: Ou, Siqu, et autres
Publié: (2026)
par: Ou, Siqu, et autres
Publié: (2026)
Towards Unified Surgical Scene Understanding:Bridging Reasoning and Grounding via MLLMs
par: Huang, Jincai, et autres
Publié: (2026)
par: Huang, Jincai, et autres
Publié: (2026)
Lifting the Veil on Visual Information Flow in MLLMs: Unlocking Pathways to Faster Inference
par: Yin, Hao, et autres
Publié: (2025)
par: Yin, Hao, et autres
Publié: (2025)
AdaTok: Adaptive Token Compression with Object-Aware Representations for Efficient Multimodal LLMs
par: Zhang, Xinliang, et autres
Publié: (2025)
par: Zhang, Xinliang, et autres
Publié: (2025)
V2Flow: Unifying Visual Tokenization and Large Language Model Vocabularies for Autoregressive Image Generation
par: Zhang, Guiwei, et autres
Publié: (2025)
par: Zhang, Guiwei, et autres
Publié: (2025)
Moment-Video: Diagnosing Temporal Fidelity of Video MLLMs on Momentary Visual Events
par: Liu, Xiaolin, et autres
Publié: (2026)
par: Liu, Xiaolin, et autres
Publié: (2026)
InfoDisent: Explainability of Image Classification Models by Information Disentanglement
par: Struski, Łukasz, et autres
Publié: (2024)
par: Struski, Łukasz, et autres
Publié: (2024)
MergeVQ: A Unified Framework for Visual Generation and Representation with Disentangled Token Merging and Quantization
par: Li, Siyuan, et autres
Publié: (2025)
par: Li, Siyuan, et autres
Publié: (2025)
Geodesics with Unified Tangent-constrained Priors and Curvature Regularization
par: Di, Chong, et autres
Publié: (2026)
par: Di, Chong, et autres
Publié: (2026)
What does RL improve for Visual Reasoning? A Frankenstein-Style Analysis
par: Li, Xirui, et autres
Publié: (2026)
par: Li, Xirui, et autres
Publié: (2026)
UniHOI: Unified Human-Object Interaction Understanding via Unified Token Space
par: Yang, Panqi, et autres
Publié: (2025)
par: Yang, Panqi, et autres
Publié: (2025)
A More Word-like Image Tokenization for MLLMs
par: Lee, Hyun, et autres
Publié: (2026)
par: Lee, Hyun, et autres
Publié: (2026)
Bridging the Semantic-Action Gap in Visual Token Pruning for Efficient VLA Inference
par: Liu, Ziyan, et autres
Publié: (2025)
par: Liu, Ziyan, et autres
Publié: (2025)
QMoP: Query Guided Mixture-of-Projector for Efficient Visual Token Compression
par: Li, Zhongyang, et autres
Publié: (2026)
par: Li, Zhongyang, et autres
Publié: (2026)
SSMamba: A Self-Supervised Hybrid State Space Model for Pathological Image Classification
par: Chai, Enhui, et autres
Publié: (2026)
par: Chai, Enhui, et autres
Publié: (2026)
VITAL: Visual-Semantic Dual Supervision for Enhanced and Interpretable Latent Reasoning in Medical MLLMs
par: Li, Qiaoru, et autres
Publié: (2026)
par: Li, Qiaoru, et autres
Publié: (2026)
How Do Medical MLLMs Fail? A Study on Visual Grounding in Medical Images
par: Liu, Guimeng, et autres
Publié: (2026)
par: Liu, Guimeng, et autres
Publié: (2026)
UniToken: Harmonizing Multimodal Understanding and Generation through Unified Visual Encoding
par: Jiao, Yang, et autres
Publié: (2025)
par: Jiao, Yang, et autres
Publié: (2025)
Landmark-Guided Cross-Speaker Lip Reading with Mutual Information Regularization
par: Wu, Linzhi, et autres
Publié: (2024)
par: Wu, Linzhi, et autres
Publié: (2024)
Learning Shared RGB-D Fields: Unified Self-supervised Pre-training for Label-efficient LiDAR-Camera 3D Perception
par: Xu, Xiaohao, et autres
Publié: (2024)
par: Xu, Xiaohao, et autres
Publié: (2024)
Documents similaires
-
InfoTok: Adaptive Discrete Video Tokenizer via Information-Theoretic Compression
par: Ye, Haotian, et autres
Publié: (2025) -
Visual Text Compression as Measure Transport
par: Tang, Lv, et autres
Publié: (2026) -
UniTok: A Unified Tokenizer for Visual Generation and Understanding
par: Ma, Chuofan, et autres
Publié: (2025) -
Mitigating Visual Hallucinations via Semantic Curriculum Preference Optimization in MLLMs
par: Li, Yuanshuai, et autres
Publié: (2025) -
UniWeTok: An Unified Binary Tokenizer with Codebook Size $\mathit{2^{128}}$ for Unified Multimodal Large Language Model
par: Zhuang, Shaobin, et autres
Publié: (2026)