DeCo: Decoupling Token Compression from Semantic Abstraction in Multimodal Large Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Yao, Linli, Li, Lei, Ren, Shuhuai, Wang, Lean, Liu, Yuanxin, Sun, Xu, Hou, Lu |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
TimeChat: A Time-sensitive Multimodal Large Language Model for Long Video Understanding
par: Ren, Shuhuai, et autres
Publié: (2023)
par: Ren, Shuhuai, et autres
Publié: (2023)
DeCo-DETR: Decoupled Cognition DETR for efficient Open-Vocabulary Object Detection
par: Wang, Siheng, et autres
Publié: (2026)
par: Wang, Siheng, et autres
Publié: (2026)
Towards Multimodal Video Paragraph Captioning Models Robust to Missing Modality
par: Chen, Sishuo, et autres
Publié: (2024)
par: Chen, Sishuo, et autres
Publié: (2024)
TimeChat-Online: 80% Visual Tokens are Naturally Redundant in Streaming Videos
par: Yao, Linli, et autres
Publié: (2025)
par: Yao, Linli, et autres
Publié: (2025)
DeCo: Decoupled Human-Centered Diffusion Video Editing with Motion Consistency
par: Zhong, Xiaojing, et autres
Publié: (2024)
par: Zhong, Xiaojing, et autres
Publié: (2024)
DeCo-VAE: Learning Compact Latents for Video Reconstruction via Decoupled Representation
par: Yin, Xiangchen, et autres
Publié: (2025)
par: Yin, Xiangchen, et autres
Publié: (2025)
DeCo: Frequency-Decoupled Pixel Diffusion for End-to-End Image Generation
par: Ma, Zehong, et autres
Publié: (2025)
par: Ma, Zehong, et autres
Publié: (2025)
VITATECS: A Diagnostic Dataset for Temporal Concept Understanding of Video-Language Models
par: Li, Shicheng, et autres
Publié: (2023)
par: Li, Shicheng, et autres
Publié: (2023)
RICO: Improving Accuracy and Completeness in Image Recaptioning via Visual Reconstruction
par: Wang, Yuchi, et autres
Publié: (2025)
par: Wang, Yuchi, et autres
Publié: (2025)
Task-Related Token Compression in Multimodal Large Language Models from an Explainability Perspective
par: Lei, Lei, et autres
Publié: (2025)
par: Lei, Lei, et autres
Publié: (2025)
TempCompass: Do Video LLMs Really Understand Videos?
par: Liu, Yuanxin, et autres
Publié: (2024)
par: Liu, Yuanxin, et autres
Publié: (2024)
TEMPLE: Incentivizing Temporal Understanding of Video Large Language Models via Progressive Pre-SFT Alignment
par: Li, Shicheng, et autres
Publié: (2025)
par: Li, Shicheng, et autres
Publié: (2025)
Temporal Reasoning Transfer from Text to Video
par: Li, Lei, et autres
Publié: (2024)
par: Li, Lei, et autres
Publié: (2024)
UVE: Are MLLMs Unified Evaluators for AI-Generated Videos?
par: Liu, Yuanxin, et autres
Publié: (2025)
par: Liu, Yuanxin, et autres
Publié: (2025)
Grounding Everything in Tokens for Multimodal Large Language Models
par: Ren, Xiangxuan, et autres
Publié: (2025)
par: Ren, Xiangxuan, et autres
Publié: (2025)
LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models
par: Liu, Juntao, et autres
Publié: (2025)
par: Liu, Juntao, et autres
Publié: (2025)
LaDiC: Are Diffusion Models Really Inferior to Autoregressive Counterparts for Image-to-Text Generation?
par: Wang, Yuchi, et autres
Publié: (2024)
par: Wang, Yuchi, et autres
Publié: (2024)
TokenCarve: Information-Preserving Visual Token Compression in Multimodal Large Language Models
par: Tan, Xudong, et autres
Publié: (2025)
par: Tan, Xudong, et autres
Publié: (2025)
A Survey of Token Compression for Efficient Multimodal Large Language Models
par: Shao, Kele, et autres
Publié: (2025)
par: Shao, Kele, et autres
Publié: (2025)
EvoComp: Learning Visual Token Compression for Multimodal Large Language Models via Semantic-Guided Evolutionary Labeling
par: Song, Jiafei, et autres
Publié: (2026)
par: Song, Jiafei, et autres
Publié: (2026)
BASIC: Boosting Visual Alignment with Intrinsic Refined Embeddings in Multimodal Large Language Models
par: Tang, Jianting, et autres
Publié: (2025)
par: Tang, Jianting, et autres
Publié: (2025)
Dynamic Token Compression for Efficient Video Understanding through Reinforcement Learning
par: Wang, Shida, et autres
Publié: (2026)
par: Wang, Shida, et autres
Publié: (2026)
PPE: Positional Preservation Embedding for Token Compression in Multimodal Large Language Models
par: Huang, Mouxiao, et autres
Publié: (2025)
par: Huang, Mouxiao, et autres
Publié: (2025)
MVP: Enhancing Video Large Language Models via Self-supervised Masked Video Prediction
par: Sun, Xiaokun, et autres
Publié: (2026)
par: Sun, Xiaokun, et autres
Publié: (2026)
Script: Graph-Structured and Query-Conditioned Semantic Token Pruning for Multimodal Large Language Models
par: Yang, Zhongyu, et autres
Publié: (2025)
par: Yang, Zhongyu, et autres
Publié: (2025)
DiCoDe: Diffusion-Compressed Deep Tokens for Autoregressive Video Generation with Language Models
par: Li, Yizhuo, et autres
Publié: (2024)
par: Li, Yizhuo, et autres
Publié: (2024)
Bridging Continuous and Discrete Tokens for Autoregressive Visual Generation
par: Wang, Yuqing, et autres
Publié: (2025)
par: Wang, Yuqing, et autres
Publié: (2025)
Next Block Prediction: Video Generation via Semi-Autoregressive Modeling
par: Ren, Shuhuai, et autres
Publié: (2025)
par: Ren, Shuhuai, et autres
Publié: (2025)
DiG: Differential Grounding for Enhancing Fine-Grained Perception in Multimodal Large Language Model
par: Tao, Zhou, et autres
Publié: (2025)
par: Tao, Zhou, et autres
Publié: (2025)
InfoMerge: Information-aware Token Compression for Efficient Video Large Language Models
par: Liu, Xinxin, et autres
Publié: (2026)
par: Liu, Xinxin, et autres
Publié: (2026)
Next Token Is Enough: Realistic Image Quality and Aesthetic Scoring with Multimodal Large Language Model
par: Li, Mingxing, et autres
Publié: (2025)
par: Li, Mingxing, et autres
Publié: (2025)
Conan: Progressive Learning to Reason Like a Detective over Multi-Scale Visual Evidence
par: Ouyang, Kun, et autres
Publié: (2025)
par: Ouyang, Kun, et autres
Publié: (2025)
A Glimpse to Compress: Dynamic Visual Token Pruning for Large Vision-Language Models
par: Zeng, Quan-Sheng, et autres
Publié: (2025)
par: Zeng, Quan-Sheng, et autres
Publié: (2025)
Can Visual Input Be Compressed? A Visual Token Compression Benchmark for Large Multimodal Models
par: Peng, Tianfan, et autres
Publié: (2025)
par: Peng, Tianfan, et autres
Publié: (2025)
Break the Visual Perception: Adversarial Attacks Targeting Encoded Visual Tokens of Large Vision-Language Models
par: Wang, Yubo, et autres
Publié: (2024)
par: Wang, Yubo, et autres
Publié: (2024)
VidCoM: Fast Video Comprehension through Large Language Models with Multimodal Tools
par: Qi, Ji, et autres
Publié: (2023)
par: Qi, Ji, et autres
Publié: (2023)
EvoCut: Multi-Layer Evolution-Aware Visual Token Compression for Efficient Large Vision-Language Models
par: Lu, Hongyu, et autres
Publié: (2026)
par: Lu, Hongyu, et autres
Publié: (2026)
Decoupled Similarity for Task-Aware Token Pruning in Large Vision-Language Models
par: Ma, Kexin, et autres
Publié: (2026)
par: Ma, Kexin, et autres
Publié: (2026)
AdaTok: Adaptive Token Compression with Object-Aware Representations for Efficient Multimodal LLMs
par: Zhang, Xinliang, et autres
Publié: (2025)
par: Zhang, Xinliang, et autres
Publié: (2025)
Vision-centric Token Compression in Large Language Model
par: Xing, Ling, et autres
Publié: (2025)
par: Xing, Ling, et autres
Publié: (2025)
Documents similaires
-
TimeChat: A Time-sensitive Multimodal Large Language Model for Long Video Understanding
par: Ren, Shuhuai, et autres
Publié: (2023) -
DeCo-DETR: Decoupled Cognition DETR for efficient Open-Vocabulary Object Detection
par: Wang, Siheng, et autres
Publié: (2026) -
Towards Multimodal Video Paragraph Captioning Models Robust to Missing Modality
par: Chen, Sishuo, et autres
Publié: (2024) -
TimeChat-Online: 80% Visual Tokens are Naturally Redundant in Streaming Videos
par: Yao, Linli, et autres
Publié: (2025) -
DeCo: Decoupled Human-Centered Diffusion Video Editing with Motion Consistency
par: Zhong, Xiaojing, et autres
Publié: (2024)