Streamline Without Sacrifice -- Squeeze out Computation Redundancy in LMM
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wu, Penghao, Lu, Lewei, Liu, Ziwei |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Visual Jigsaw Post-Training Improves MLLMs
par: Wu, Penghao, et autres
Publié: (2025)
par: Wu, Penghao, et autres
Publié: (2025)
GUI-Reflection: Empowering Multimodal GUI Models with Self-Reflection Behavior
par: Wu, Penghao, et autres
Publié: (2025)
par: Wu, Penghao, et autres
Publié: (2025)
Acquire and then Adapt: Squeezing out Text-to-Image Model for Image Restoration
par: Deng, Junyuan, et autres
Publié: (2025)
par: Deng, Junyuan, et autres
Publié: (2025)
LMM-PCQA: Assisting Point Cloud Quality Assessment with LMM
par: Zhang, Zicheng, et autres
Publié: (2024)
par: Zhang, Zicheng, et autres
Publié: (2024)
LMM4LMM: Benchmarking and Evaluating Large-multimodal Image Generation with LMMs
par: Wang, Jiarui, et autres
Publié: (2025)
par: Wang, Jiarui, et autres
Publié: (2025)
F-LMM: Grounding Frozen Large Multimodal Models
par: Wu, Size, et autres
Publié: (2024)
par: Wu, Size, et autres
Publié: (2024)
Q-Adapt: Adapting LMM for Visual Quality Assessment with Progressive Instruction Tuning
par: Lu, Yiting, et autres
Publié: (2025)
par: Lu, Yiting, et autres
Publié: (2025)
Multi-scale 2D Temporal Map Diffusion Models for Natural Language Video Localization
par: Zhang, Chongzhi, et autres
Publié: (2024)
par: Zhang, Chongzhi, et autres
Publié: (2024)
Harnessing the Computation Redundancy in ViTs to Boost Adversarial Transferability
par: Liu, Jiani, et autres
Publié: (2025)
par: Liu, Jiani, et autres
Publié: (2025)
LMM-Regularized CLIP Embeddings for Image Classification
par: Tzelepi, Maria, et autres
Publié: (2024)
par: Tzelepi, Maria, et autres
Publié: (2024)
Multimodal 3D Reasoning Segmentation with Complex Scenes
par: Jiang, Xueying, et autres
Publié: (2024)
par: Jiang, Xueying, et autres
Publié: (2024)
Disturbing Image Detection Using LMM-Elicited Emotion Embeddings
par: Tzelepi, Maria, et autres
Publié: (2024)
par: Tzelepi, Maria, et autres
Publié: (2024)
Empower Vision Applications with LoRA LMM
par: Mi, Liang, et autres
Publié: (2024)
par: Mi, Liang, et autres
Publié: (2024)
MaskGWM: A Generalizable Driving World Model with Video Mask Reconstruction
par: Ni, Jingcheng, et autres
Publié: (2025)
par: Ni, Jingcheng, et autres
Publié: (2025)
FVQ: A Large-Scale Dataset and an LMM-based Method for Face Video Quality Assessment
par: Wu, Sijing, et autres
Publié: (2025)
par: Wu, Sijing, et autres
Publié: (2025)
LMM4Edit: Benchmarking and Evaluating Multimodal Image Editing with LMMs
par: Xu, Zitong, et autres
Publié: (2025)
par: Xu, Zitong, et autres
Publié: (2025)
An LMM for Efficient Video Understanding via Reinforced Compression of Video Cubes
par: Qi, Ji, et autres
Publié: (2025)
par: Qi, Ji, et autres
Publié: (2025)
LMM-Det: Make Large Multimodal Models Excel in Object Detection
par: Li, Jincheng, et autres
Publié: (2025)
par: Li, Jincheng, et autres
Publié: (2025)
TLAC: Two-stage LMM Augmented CLIP for Zero-Shot Classification
par: Munir, Ans, et autres
Publié: (2025)
par: Munir, Ans, et autres
Publié: (2025)
Improving Multimodal Hateful Meme Detection Exploiting LMM-Generated Knowledge
par: Tzelepi, Maria, et autres
Publié: (2025)
par: Tzelepi, Maria, et autres
Publié: (2025)
EvoLMM: Self-Evolving Large Multimodal Models with Continuous Rewards
par: Thawakar, Omkar, et autres
Publié: (2025)
par: Thawakar, Omkar, et autres
Publié: (2025)
Cross-Architecture Distillation Made Simple with Redundancy Suppression
par: Zhang, Weijia, et autres
Publié: (2025)
par: Zhang, Weijia, et autres
Publié: (2025)
Video-LMM Post-Training: A Deep Dive into Video Reasoning with Large Multimodal Models
par: Tang, Yolo Y., et autres
Publié: (2025)
par: Tang, Yolo Y., et autres
Publié: (2025)
HiStream: Efficient High-Resolution Video Generation via Redundancy-Eliminated Streaming
par: Qiu, Haonan, et autres
Publié: (2025)
par: Qiu, Haonan, et autres
Publié: (2025)
AIGV-Assessor: Benchmarking and Evaluating the Perceptual Quality of Text-to-Video Generation with LMM
par: Wang, Jiarui, et autres
Publié: (2024)
par: Wang, Jiarui, et autres
Publié: (2024)
Video-MMMU: Evaluating Knowledge Acquisition from Multi-Discipline Professional Videos
par: Hu, Kairui, et autres
Publié: (2025)
par: Hu, Kairui, et autres
Publié: (2025)
From Pixels to Words -- Towards Native One-Vision Models at Scale
par: Diao, Haiwen, et autres
Publié: (2026)
par: Diao, Haiwen, et autres
Publié: (2026)
LLMs Meet VLMs: Boost Open Vocabulary Object Detection with Fine-grained Descriptors
par: Jin, Sheng, et autres
Publié: (2024)
par: Jin, Sheng, et autres
Publié: (2024)
Weakly Supervised Monocular 3D Detection with a Single-View Image
par: Jiang, Xueying, et autres
Publié: (2024)
par: Jiang, Xueying, et autres
Publié: (2024)
Triad: Empowering LMM-based Anomaly Detection with Vision Expert-guided Visual Tokenizer and Manufacturing Process
par: Li, Yuanze, et autres
Publié: (2025)
par: Li, Yuanze, et autres
Publié: (2025)
From Pixels to Words -- Towards Native Vision-Language Primitives at Scale
par: Diao, Haiwen, et autres
Publié: (2025)
par: Diao, Haiwen, et autres
Publié: (2025)
Fine-Grained Customized Fashion Design with Image-into-Prompt benchmark and dataset from LMM
par: Li, Hui, et autres
Publié: (2025)
par: Li, Hui, et autres
Publié: (2025)
MA-LMM: Memory-Augmented Large Multimodal Model for Long-Term Video Understanding
par: He, Bo, et autres
Publié: (2024)
par: He, Bo, et autres
Publié: (2024)
BiMediX2: Bio-Medical EXpert LMM for Diverse Medical Modalities
par: Mullappilly, Sahal Shaji, et autres
Publié: (2024)
par: Mullappilly, Sahal Shaji, et autres
Publié: (2024)
FoodLMM: A Versatile Food Assistant using Large Multi-modal Model
par: Yin, Yuehao, et autres
Publié: (2023)
par: Yin, Yuehao, et autres
Publié: (2023)
ScaleLSD: Scalable Deep Line Segment Detection Streamlined
par: Ke, Zeran, et autres
Publié: (2025)
par: Ke, Zeran, et autres
Publié: (2025)
Modeling Continuous Motion for 3D Point Cloud Object Tracking
par: Luo, Zhipeng, et autres
Publié: (2023)
par: Luo, Zhipeng, et autres
Publié: (2023)
AviationLMM: A Large Multimodal Foundation Model for Civil Aviation
par: Li, Wenbin, et autres
Publié: (2026)
par: Li, Wenbin, et autres
Publié: (2026)
SASE: A Searching Architecture for Squeeze and Excitation Operations
par: Wang, Hanming, et autres
Publié: (2024)
par: Wang, Hanming, et autres
Publié: (2024)
AnomalyLMM: Bridging Generative Knowledge and Discriminative Retrieval for Text-Based Person Anomaly Search
par: Ju, Hao, et autres
Publié: (2025)
par: Ju, Hao, et autres
Publié: (2025)
Documents similaires
-
Visual Jigsaw Post-Training Improves MLLMs
par: Wu, Penghao, et autres
Publié: (2025) -
GUI-Reflection: Empowering Multimodal GUI Models with Self-Reflection Behavior
par: Wu, Penghao, et autres
Publié: (2025) -
Acquire and then Adapt: Squeezing out Text-to-Image Model for Image Restoration
par: Deng, Junyuan, et autres
Publié: (2025) -
LMM-PCQA: Assisting Point Cloud Quality Assessment with LMM
par: Zhang, Zicheng, et autres
Publié: (2024) -
LMM4LMM: Benchmarking and Evaluating Large-multimodal Image Generation with LMMs
par: Wang, Jiarui, et autres
Publié: (2025)