Token-level Correlation-guided Compression for Efficient Multimodal Document Understanding
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhang, Renshan, Lyu, Yibo, Shao, Rui, Chen, Gongwei, Guan, Weili, Nie, Liqiang |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
PUMA: Layer-Pruned Language Model for Efficient Unified Multimodal Retrieval with Modality-Adaptive Learning
por: Lyu, Yibo, et al.
Publicado: (2025)
por: Lyu, Yibo, et al.
Publicado: (2025)
FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers
por: Zhang, Renshan, et al.
Publicado: (2025)
por: Zhang, Renshan, et al.
Publicado: (2025)
MoME: Mixture of Multimodal Experts for Generalist Multimodal Large Language Models
por: Shen, Leyang, et al.
Publicado: (2024)
por: Shen, Leyang, et al.
Publicado: (2024)
PersonalAlign: Hierarchical Implicit Intent Alignment for Personalized GUI Agent with Long-Term User-Centric Records
por: Lyu, Yibo, et al.
Publicado: (2026)
por: Lyu, Yibo, et al.
Publicado: (2026)
Curriculum Coarse-to-Fine Selection for High-IPC Dataset Distillation
por: Chen, Yanda, et al.
Publicado: (2025)
por: Chen, Yanda, et al.
Publicado: (2025)
CogVLA: Cognition-Aligned Vision-Language-Action Model via Instruction-Driven Routing & Sparsification
por: Li, Wei, et al.
Publicado: (2025)
por: Li, Wei, et al.
Publicado: (2025)
SemanticVLA: Semantic-Aligned Sparsification and Enhancement for Efficient Robotic Manipulation
por: Li, Wei, et al.
Publicado: (2025)
por: Li, Wei, et al.
Publicado: (2025)
Large VLM-based Vision-Language-Action Models for Robotic Manipulation: A Survey
por: Shao, Rui, et al.
Publicado: (2025)
por: Shao, Rui, et al.
Publicado: (2025)
Beyond Quantity: Distribution-Aware Labeling for Visual Grounding
por: Zhang, Yichi, et al.
Publicado: (2025)
por: Zhang, Yichi, et al.
Publicado: (2025)
LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models
por: Liu, Juntao, et al.
Publicado: (2025)
por: Liu, Juntao, et al.
Publicado: (2025)
HATS: Hardness-Aware Trajectory Synthesis for GUI Agents
por: Shao, Rui, et al.
Publicado: (2026)
por: Shao, Rui, et al.
Publicado: (2026)
Global Prior Meets Local Consistency: Dual-Memory Augmented Vision-Language-Action Model for Efficient Robotic Manipulation
por: Li, Zaijing, et al.
Publicado: (2026)
por: Li, Zaijing, et al.
Publicado: (2026)
StreamingTOM: Streaming Token Compression for Efficient Video Understanding
por: Chen, Xueyi, et al.
Publicado: (2025)
por: Chen, Xueyi, et al.
Publicado: (2025)
UniCompress: Token Compression for Unified Vision-Language Understanding and Generation
por: Wang, Ziyao, et al.
Publicado: (2026)
por: Wang, Ziyao, et al.
Publicado: (2026)
Less is More: Empowering GUI Agent with Context-Aware Simplification
por: Chen, Gongwei, et al.
Publicado: (2025)
por: Chen, Gongwei, et al.
Publicado: (2025)
Spatial Understanding from Videos: Structured Prompts Meet Simulation Data
por: Zhang, Haoyu, et al.
Publicado: (2025)
por: Zhang, Haoyu, et al.
Publicado: (2025)
R^3: Composed Video Retrieval via Reasoning-Guided Recalling and Re-ranking
por: Li, Zixu, et al.
Publicado: (2026)
por: Li, Zixu, et al.
Publicado: (2026)
Advancing Complex Video Object Segmentation via Tracking-Enhanced Prompt: The 1st Winner for 5th PVUW MOSE Challenge
por: Zhang, Jinrong, et al.
Publicado: (2026)
por: Zhang, Jinrong, et al.
Publicado: (2026)
The 1st Winner for 5th PVUW MeViS-Text Challenge: Strong MLLMs Meet SAM3 for Referring Video Object Segmentation
por: He, Xusheng, et al.
Publicado: (2026)
por: He, Xusheng, et al.
Publicado: (2026)
Object-Shot Enhanced Grounding Network for Egocentric Video
por: Feng, Yisen, et al.
Publicado: (2025)
por: Feng, Yisen, et al.
Publicado: (2025)
UniEmo: Unifying Emotional Understanding and Generation with Learnable Expert Queries
por: Zhu, Yijie, et al.
Publicado: (2025)
por: Zhu, Yijie, et al.
Publicado: (2025)
A Survey of Token Compression for Efficient Multimodal Large Language Models
por: Shao, Kele, et al.
Publicado: (2025)
por: Shao, Kele, et al.
Publicado: (2025)
ELIP: Efficient Discriminative Language-Image Pre-training with Fewer Vision Tokens
por: Guo, Yangyang, et al.
Publicado: (2023)
por: Guo, Yangyang, et al.
Publicado: (2023)
DAgger Diffusion Navigation: DAgger Boosted Diffusion Policy for Vision-Language Navigation
por: Shi, Haoxiang, et al.
Publicado: (2025)
por: Shi, Haoxiang, et al.
Publicado: (2025)
StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval
por: Wang, Shaokun, et al.
Publicado: (2026)
por: Wang, Shaokun, et al.
Publicado: (2026)
UniCVR: From Alignment to Reranking for Unified Zero-Shot Composed Visual Retrieval
por: Wen, Haokun, et al.
Publicado: (2026)
por: Wen, Haokun, et al.
Publicado: (2026)
EgoAdapt: A Multi-Scene Egocentric Adaptation Method for CVPR 2026 HD-EPIC VQA Challenge
por: Chen, Zhiwei, et al.
Publicado: (2026)
por: Chen, Zhiwei, et al.
Publicado: (2026)
TempRet: Temporal Enhancement and Two-Stage Reranking for CVPR 2026 EPIC-KITCHENS-100 Multi-Instance Retrieval Challenge
por: Li, Zixu, et al.
Publicado: (2026)
por: Li, Zixu, et al.
Publicado: (2026)
OmniEgo-R$^2$: A Routed Reasoning Framework for the 1st Cross-Domain EgoCross Challenge at CVPR 2026
por: Li, Zixu, et al.
Publicado: (2026)
por: Li, Zixu, et al.
Publicado: (2026)
EgoAction: Egocentric Action Composition with Reliability-Aware Temporal Fusion for the EPIC-KITCHENS Action Detection Challenge at CVPR 2026
por: Fu, Zhiheng, et al.
Publicado: (2026)
por: Fu, Zhiheng, et al.
Publicado: (2026)
JFAA: Technical Report for the EPIC-KITCHENS-100 Action Anticipation Challenge at EgoVis 2026
por: Chu, Qiaohui, et al.
Publicado: (2026)
por: Chu, Qiaohui, et al.
Publicado: (2026)
A Token-level Text Image Foundation Model for Document Understanding
por: Guan, Tongkun, et al.
Publicado: (2025)
por: Guan, Tongkun, et al.
Publicado: (2025)
DeepFake-Adapter: Dual-Level Adapter for DeepFake Detection
por: Shao, Rui, et al.
Publicado: (2023)
por: Shao, Rui, et al.
Publicado: (2023)
Handling Imbalanced Pseudolabels for Vision-Language Models with Concept Alignment and Confusion-Aware Calibrated Margin
por: Wang, Yuchen, et al.
Publicado: (2025)
por: Wang, Yuchen, et al.
Publicado: (2025)
Uncovering Hidden Connections: Iterative Search and Reasoning for Video-grounded Dialog
por: Zhang, Haoyu, et al.
Publicado: (2023)
por: Zhang, Haoyu, et al.
Publicado: (2023)
DiVE: Efficient Multi-View Driving Scenes Generation Based on Video Diffusion Transformer
por: Jiang, Junpeng, et al.
Publicado: (2025)
por: Jiang, Junpeng, et al.
Publicado: (2025)
STORM: Token-Efficient Long Video Understanding for Multimodal LLMs
por: Jiang, Jindong, et al.
Publicado: (2025)
por: Jiang, Jindong, et al.
Publicado: (2025)
DynTok: Dynamic Compression of Visual Tokens for Efficient and Effective Video Understanding
por: Zhang, Hongzhi, et al.
Publicado: (2025)
por: Zhang, Hongzhi, et al.
Publicado: (2025)
OSGNet with MLLM Reranking @ Ego4D Episodic Memory Challenge 2026
por: Feng, Yisen, et al.
Publicado: (2026)
por: Feng, Yisen, et al.
Publicado: (2026)
HiPrune: Hierarchical Attention for Efficient Token Pruning in Vision-Language Models
por: Liu, Jizhihui, et al.
Publicado: (2025)
por: Liu, Jizhihui, et al.
Publicado: (2025)
Ejemplares similares
-
PUMA: Layer-Pruned Language Model for Efficient Unified Multimodal Retrieval with Modality-Adaptive Learning
por: Lyu, Yibo, et al.
Publicado: (2025) -
FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers
por: Zhang, Renshan, et al.
Publicado: (2025) -
MoME: Mixture of Multimodal Experts for Generalist Multimodal Large Language Models
por: Shen, Leyang, et al.
Publicado: (2024) -
PersonalAlign: Hierarchical Implicit Intent Alignment for Personalized GUI Agent with Long-Term User-Centric Records
por: Lyu, Yibo, et al.
Publicado: (2026) -
Curriculum Coarse-to-Fine Selection for High-IPC Dataset Distillation
por: Chen, Yanda, et al.
Publicado: (2025)