MoPE-CLIP: Structured Pruning for Efficient Vision-Language Models with Module-wise Pruning Error Metric
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Lin, Haokun, Bai, Haoli, Liu, Zhili, Hou, Lu, Sun, Muyi, Song, Linqi, Wei, Ying, Sun, Zhenan |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Accelerating Multi-Condition T2I Generation via Adaptive Condition Offloading and Pruning
von: Kong, Yuxin, et al.
Veröffentlicht: (2026)
von: Kong, Yuxin, et al.
Veröffentlicht: (2026)
PUMA: Layer-Pruned Language Model for Efficient Unified Multimodal Retrieval with Modality-Adaptive Learning
von: Lyu, Yibo, et al.
Veröffentlicht: (2025)
von: Lyu, Yibo, et al.
Veröffentlicht: (2025)
Fit and Prune: Fast and Training-free Visual Token Pruning for Multi-modal Large Language Models
von: Ye, Weihao, et al.
Veröffentlicht: (2024)
von: Ye, Weihao, et al.
Veröffentlicht: (2024)
Follow-Your-MultiPose: Tuning-Free Multi-Character Text-to-Video Generation via Pose Guidance
von: Zhang, Beiyuan, et al.
Veröffentlicht: (2024)
von: Zhang, Beiyuan, et al.
Veröffentlicht: (2024)
Self-Training Boosted Multi-Factor Matching Network for Composed Image Retrieval
von: Wen, Haokun, et al.
Veröffentlicht: (2023)
von: Wen, Haokun, et al.
Veröffentlicht: (2023)
Simple but Effective Raw-Data Level Multimodal Fusion for Composed Image Retrieval
von: Wen, Haokun, et al.
Veröffentlicht: (2024)
von: Wen, Haokun, et al.
Veröffentlicht: (2024)
Pseudo-triplet Guided Few-shot Composed Image Retrieval
von: Hou, Bohan, et al.
Veröffentlicht: (2024)
von: Hou, Bohan, et al.
Veröffentlicht: (2024)
GSSF: Generalized Structural Sparse Function for Deep Cross-modal Metric Learning
von: Diao, Haiwen, et al.
Veröffentlicht: (2024)
von: Diao, Haiwen, et al.
Veröffentlicht: (2024)
A CLIP-based siamese approach for meme classification
von: Huertas-Tato, Javier, et al.
Veröffentlicht: (2024)
von: Huertas-Tato, Javier, et al.
Veröffentlicht: (2024)
Selective Vision-Language Subspace Projection for Few-shot CLIP
von: Zhu, Xingyu, et al.
Veröffentlicht: (2024)
von: Zhu, Xingyu, et al.
Veröffentlicht: (2024)
An Efficient NVoD Scheme Using Implicit Error Correction and Subchannels for Wireless Networks
von: Asorey-Cacheda, Rafael, et al.
Veröffentlicht: (2025)
von: Asorey-Cacheda, Rafael, et al.
Veröffentlicht: (2025)
Dual Knowledge-Enhanced Two-Stage Reasoner for Multimodal Dialog Systems
von: Chen, Xiaolin, et al.
Veröffentlicht: (2025)
von: Chen, Xiaolin, et al.
Veröffentlicht: (2025)
LLaVA-NeuMT: Selective Layer-Neuron Modulation for Efficient Multilingual Multimodal Translation
von: Wei, Jingxuan, et al.
Veröffentlicht: (2025)
von: Wei, Jingxuan, et al.
Veröffentlicht: (2025)
Reply with Sticker: New Dataset and Model for Sticker Retrieval
von: Liang, Bin, et al.
Veröffentlicht: (2024)
von: Liang, Bin, et al.
Veröffentlicht: (2024)
Towards Alleviating Text-to-Image Retrieval Hallucination for CLIP in Zero-shot Learning
von: Wang, Hanyao, et al.
Veröffentlicht: (2024)
von: Wang, Hanyao, et al.
Veröffentlicht: (2024)
Efficient and Accurate Image Provenance Analysis: A Scalable Pipeline for Large-scale Images
von: Lai, Jiewei, et al.
Veröffentlicht: (2025)
von: Lai, Jiewei, et al.
Veröffentlicht: (2025)
Latency Effects on Multi-Dimensional QoE in Networked VR Whiteboards
von: Song, Jiarun, et al.
Veröffentlicht: (2026)
von: Song, Jiarun, et al.
Veröffentlicht: (2026)
EVE: Efficient Vision-Language Pre-training with Masked Prediction and Modality-Aware MoE
von: Chen, Junyi, et al.
Veröffentlicht: (2023)
von: Chen, Junyi, et al.
Veröffentlicht: (2023)
EyEar: Learning Audio Synchronized Human Gaze Trajectory Based on Physics-Informed Dynamics
von: Liu, Xiaochuan, et al.
Veröffentlicht: (2025)
von: Liu, Xiaochuan, et al.
Veröffentlicht: (2025)
SIG-Chat: Spatial Intent-Guided Conversational Gesture Generation Involving How, When and Where
von: Huang, Yiheng, et al.
Veröffentlicht: (2025)
von: Huang, Yiheng, et al.
Veröffentlicht: (2025)
DanceEditor: Towards Iterative Editable Music-driven Dance Generation with Open-Vocabulary Descriptions
von: Zhang, Hengyuan, et al.
Veröffentlicht: (2025)
von: Zhang, Hengyuan, et al.
Veröffentlicht: (2025)
Delayed Commitment for Representation Readiness in Stage-wise Audio-Visual Learning
von: Xu, Xinmeng, et al.
Veröffentlicht: (2026)
von: Xu, Xinmeng, et al.
Veröffentlicht: (2026)
Test-Time Adaptation with CLIP Reward for Zero-Shot Generalization in Vision-Language Models
von: Zhao, Shuai, et al.
Veröffentlicht: (2023)
von: Zhao, Shuai, et al.
Veröffentlicht: (2023)
Structured Image-based Coding for Efficient Gaussian Splatting Compression
von: Martin, Pedro, et al.
Veröffentlicht: (2026)
von: Martin, Pedro, et al.
Veröffentlicht: (2026)
MemeCLIP: Leveraging CLIP Representations for Multimodal Meme Classification
von: Shah, Siddhant Bikram, et al.
Veröffentlicht: (2024)
von: Shah, Siddhant Bikram, et al.
Veröffentlicht: (2024)
TraveLLaMA: A Multimodal Travel Assistant with Large-Scale Dataset and Structured Reasoning
von: Chu, Meng, et al.
Veröffentlicht: (2025)
von: Chu, Meng, et al.
Veröffentlicht: (2025)
MDF: A Dynamic Fusion Model for Multi-modal Fake News Detection
von: Lv, Hongzhen, et al.
Veröffentlicht: (2024)
von: Lv, Hongzhen, et al.
Veröffentlicht: (2024)
COPA: Efficient Vision-Language Pre-training Through Collaborative Object- and Patch-Text Alignment
von: Jiang, Chaoya, et al.
Veröffentlicht: (2023)
von: Jiang, Chaoya, et al.
Veröffentlicht: (2023)
CLIP-PCQA: Exploring Subjective-Aligned Vision-Language Modeling for Point Cloud Quality Assessment
von: Liu, Yating, et al.
Veröffentlicht: (2025)
von: Liu, Yating, et al.
Veröffentlicht: (2025)
Detecting Notational Errors in Digital Music Scores
von: Léo, Géré, et al.
Veröffentlicht: (2025)
von: Léo, Géré, et al.
Veröffentlicht: (2025)
DiffCL: A Diffusion-Based Contrastive Learning Framework with Semantic Alignment for Multimodal Recommendations
von: Song, Qiya, et al.
Veröffentlicht: (2025)
von: Song, Qiya, et al.
Veröffentlicht: (2025)
Dual Dynamic Threshold Adjustment Strategy for Deep Metric Learning
von: Jiang, Xiruo, et al.
Veröffentlicht: (2024)
von: Jiang, Xiruo, et al.
Veröffentlicht: (2024)
FashionLens: Toward Versatile Fashion Image Retrieval via Task-Adaptive Learning
von: Wen, Haokun, et al.
Veröffentlicht: (2026)
von: Wen, Haokun, et al.
Veröffentlicht: (2026)
Fine-grained Textual Inversion Network for Zero-Shot Composed Image Retrieval
von: Lin, Haoqiang, et al.
Veröffentlicht: (2025)
von: Lin, Haoqiang, et al.
Veröffentlicht: (2025)
UniCVR: From Alignment to Reranking for Unified Zero-Shot Composed Visual Retrieval
von: Wen, Haokun, et al.
Veröffentlicht: (2026)
von: Wen, Haokun, et al.
Veröffentlicht: (2026)
A Comprehensive Survey on Composed Image Retrieval
von: Song, Xuemeng, et al.
Veröffentlicht: (2025)
von: Song, Xuemeng, et al.
Veröffentlicht: (2025)
A 3D-Cascading Crossing Coupling Framework for Hyperchaotic Map Construction and Its Application to Color Image Encryption
von: Sun, Jilei, et al.
Veröffentlicht: (2025)
von: Sun, Jilei, et al.
Veröffentlicht: (2025)
Sec2Sec Co-attention for Video-Based Apparent Affective Prediction
von: Sun, Mingwei, et al.
Veröffentlicht: (2024)
von: Sun, Mingwei, et al.
Veröffentlicht: (2024)
Evaluation of Objective Image Quality Metrics for High-Fidelity Image Compression
von: Mohammadi, Shima, et al.
Veröffentlicht: (2025)
von: Mohammadi, Shima, et al.
Veröffentlicht: (2025)
Pre-training CLIP against Data Poisoning with Optimal Transport-based Matching and Alignment
von: Zhang, Tong, et al.
Veröffentlicht: (2025)
von: Zhang, Tong, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
Accelerating Multi-Condition T2I Generation via Adaptive Condition Offloading and Pruning
von: Kong, Yuxin, et al.
Veröffentlicht: (2026) -
PUMA: Layer-Pruned Language Model for Efficient Unified Multimodal Retrieval with Modality-Adaptive Learning
von: Lyu, Yibo, et al.
Veröffentlicht: (2025) -
Fit and Prune: Fast and Training-free Visual Token Pruning for Multi-modal Large Language Models
von: Ye, Weihao, et al.
Veröffentlicht: (2024) -
Follow-Your-MultiPose: Tuning-Free Multi-Character Text-to-Video Generation via Pose Guidance
von: Zhang, Beiyuan, et al.
Veröffentlicht: (2024) -
Self-Training Boosted Multi-Factor Matching Network for Composed Image Retrieval
von: Wen, Haokun, et al.
Veröffentlicht: (2023)