PUMA: Layer-Pruned Language Model for Efficient Unified Multimodal Retrieval with Modality-Adaptive Learning
Fuente:
arXiv
Guardado en:
| Autores principales: | Lyu, Yibo, Shao, Rui, Chen, Gongwei, Zhu, Yijie, Guan, Weili, Nie, Liqiang |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
UniCVR: From Alignment to Reranking for Unified Zero-Shot Composed Visual Retrieval
por: Wen, Haokun, et al.
Publicado: (2026)
por: Wen, Haokun, et al.
Publicado: (2026)
Token-level Correlation-guided Compression for Efficient Multimodal Document Understanding
por: Zhang, Renshan, et al.
Publicado: (2024)
por: Zhang, Renshan, et al.
Publicado: (2024)
MoME: Mixture of Multimodal Experts for Generalist Multimodal Large Language Models
por: Shen, Leyang, et al.
Publicado: (2024)
por: Shen, Leyang, et al.
Publicado: (2024)
PersonalAlign: Hierarchical Implicit Intent Alignment for Personalized GUI Agent with Long-Term User-Centric Records
por: Lyu, Yibo, et al.
Publicado: (2026)
por: Lyu, Yibo, et al.
Publicado: (2026)
FashionLens: Toward Versatile Fashion Image Retrieval via Task-Adaptive Learning
por: Wen, Haokun, et al.
Publicado: (2026)
por: Wen, Haokun, et al.
Publicado: (2026)
Generative Cross-Modal Retrieval: Memorizing Images in Multimodal Language Models for Retrieval and Beyond
por: Li, Yongqi, et al.
Publicado: (2024)
por: Li, Yongqi, et al.
Publicado: (2024)
Cross-Modal and Uni-Modal Soft-Label Alignment for Image-Text Retrieval
por: Huang, Hailang, et al.
Publicado: (2024)
por: Huang, Hailang, et al.
Publicado: (2024)
BadCM: Invisible Backdoor Attack Against Cross-Modal Learning
por: Zhang, Zheng, et al.
Publicado: (2024)
por: Zhang, Zheng, et al.
Publicado: (2024)
HUD: Hierarchical Uncertainty-Aware Disambiguation Network for Composed Video Retrieval
por: Chen, Zhiwei, et al.
Publicado: (2025)
por: Chen, Zhiwei, et al.
Publicado: (2025)
Fine-grained Textual Inversion Network for Zero-Shot Composed Image Retrieval
por: Lin, Haoqiang, et al.
Publicado: (2025)
por: Lin, Haoqiang, et al.
Publicado: (2025)
TIGeR: Unifying Text-to-Image Generation and Retrieval with Large Multimodal Models
por: Qu, Leigang, et al.
Publicado: (2024)
por: Qu, Leigang, et al.
Publicado: (2024)
FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers
por: Zhang, Renshan, et al.
Publicado: (2025)
por: Zhang, Renshan, et al.
Publicado: (2025)
Dynamic Multimodal Fusion via Meta-Learning Towards Micro-Video Recommendation
por: Liu, Han, et al.
Publicado: (2025)
por: Liu, Han, et al.
Publicado: (2025)
AdaReTaKe: Adaptive Redundancy Reduction to Perceive Longer for Video-language Understanding
por: Wang, Xiao, et al.
Publicado: (2025)
por: Wang, Xiao, et al.
Publicado: (2025)
Semi-supervised Semantic Segmentation with Multi-Constraint Consistency Learning
por: Yin, Jianjian, et al.
Publicado: (2025)
por: Yin, Jianjian, et al.
Publicado: (2025)
Self-Training Boosted Multi-Factor Matching Network for Composed Image Retrieval
por: Wen, Haokun, et al.
Publicado: (2023)
por: Wen, Haokun, et al.
Publicado: (2023)
Towards Unbiased Cross-Modal Representation Learning for Food Image-to-Recipe Retrieval
por: Wang, Qing, et al.
Publicado: (2025)
por: Wang, Qing, et al.
Publicado: (2025)
Vision-Language Models Learn Super Images for Efficient Partially Relevant Video Retrieval
por: Nishimura, Taichi, et al.
Publicado: (2023)
por: Nishimura, Taichi, et al.
Publicado: (2023)
A Unified Optimal Transport Framework for Cross-Modal Retrieval with Noisy Labels
por: Han, Haochen, et al.
Publicado: (2024)
por: Han, Haochen, et al.
Publicado: (2024)
Multi-Modal Image Fusion via Intervention-Stable Feature Learning
por: Wang, Xue, et al.
Publicado: (2026)
por: Wang, Xue, et al.
Publicado: (2026)
Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval
por: Kong, Fanheng, et al.
Publicado: (2025)
por: Kong, Fanheng, et al.
Publicado: (2025)
Turing Patterns for Multimedia: Reaction-Diffusion Multi-Modal Fusion for Language-Guided Video Moment Retrieval
por: Fang, Xiang, et al.
Publicado: (2026)
por: Fang, Xiang, et al.
Publicado: (2026)
Revolutionizing Text-to-Image Retrieval as Autoregressive Token-to-Voken Generation
por: Li, Yongqi, et al.
Publicado: (2024)
por: Li, Yongqi, et al.
Publicado: (2024)
A Comprehensive Survey on Composed Image Retrieval
por: Song, Xuemeng, et al.
Publicado: (2025)
por: Song, Xuemeng, et al.
Publicado: (2025)
Zero-shot Video Moment Retrieval via Off-the-shelf Multimodal Large Language Models
por: Xu, Yifang, et al.
Publicado: (2025)
por: Xu, Yifang, et al.
Publicado: (2025)
Unify-Agent: A Unified Multimodal Agent for World-Grounded Image Synthesis
por: Chen, Shuang, et al.
Publicado: (2026)
por: Chen, Shuang, et al.
Publicado: (2026)
MoPE-CLIP: Structured Pruning for Efficient Vision-Language Models with Module-wise Pruning Error Metric
por: Lin, Haokun, et al.
Publicado: (2024)
por: Lin, Haokun, et al.
Publicado: (2024)
Calibrated Multimodal Representation Learning with Missing Modalities
por: Liu, Xiaohao, et al.
Publicado: (2025)
por: Liu, Xiaohao, et al.
Publicado: (2025)
When Video Coding Meets Multimodal Large Language Models: A Unified Paradigm for Video Coding
por: Zhang, Pingping, et al.
Publicado: (2024)
por: Zhang, Pingping, et al.
Publicado: (2024)
Robust Self-Paced Hashing for Cross-Modal Retrieval with Noisy Labels
por: Pu, Ruitao, et al.
Publicado: (2025)
por: Pu, Ruitao, et al.
Publicado: (2025)
CAMeL: Cross-modality Adaptive Meta-Learning for Text-based Person Retrieval
por: Yu, Hang, et al.
Publicado: (2025)
por: Yu, Hang, et al.
Publicado: (2025)
Towards Robust and Realible Multimodal Misinformation Recognition with Incomplete Modality
por: Zhou, Hengyang, et al.
Publicado: (2025)
por: Zhou, Hengyang, et al.
Publicado: (2025)
ASAP: Advancing Semantic Alignment Promotes Multi-Modal Manipulation Detecting and Grounding
por: Zhang, Zhenxing, et al.
Publicado: (2024)
por: Zhang, Zhenxing, et al.
Publicado: (2024)
Learning to Rematch Mismatched Pairs for Robust Cross-Modal Retrieval
por: Han, Haochen, et al.
Publicado: (2024)
por: Han, Haochen, et al.
Publicado: (2024)
An Empirical Comparison of Video Frame Sampling Methods for Multi-Modal RAG Retrieval
por: Kandhare, Mahesh, et al.
Publicado: (2024)
por: Kandhare, Mahesh, et al.
Publicado: (2024)
ReTaKe: Reducing Temporal and Knowledge Redundancy for Long Video Understanding
por: Wang, Xiao, et al.
Publicado: (2024)
por: Wang, Xiao, et al.
Publicado: (2024)
Enhancing Interactive Image Retrieval With Query Rewriting Using Large Language Models and Vision Language Models
por: Zhu, Hongyi, et al.
Publicado: (2024)
por: Zhu, Hongyi, et al.
Publicado: (2024)
PromptHash: Affinity-Prompted Collaborative Cross-Modal Learning for Adaptive Hashing Retrieval
por: Zou, Qiang, et al.
Publicado: (2025)
por: Zou, Qiang, et al.
Publicado: (2025)
Context-Enhanced Video Moment Retrieval with Large Language Models
por: Liu, Weijia, et al.
Publicado: (2024)
por: Liu, Weijia, et al.
Publicado: (2024)
GuardAlign: Test-time Safety Alignment in Multimodal Large Language Models
por: Zhu, Xingyu, et al.
Publicado: (2026)
por: Zhu, Xingyu, et al.
Publicado: (2026)
Ejemplares similares
-
UniCVR: From Alignment to Reranking for Unified Zero-Shot Composed Visual Retrieval
por: Wen, Haokun, et al.
Publicado: (2026) -
Token-level Correlation-guided Compression for Efficient Multimodal Document Understanding
por: Zhang, Renshan, et al.
Publicado: (2024) -
MoME: Mixture of Multimodal Experts for Generalist Multimodal Large Language Models
por: Shen, Leyang, et al.
Publicado: (2024) -
PersonalAlign: Hierarchical Implicit Intent Alignment for Personalized GUI Agent with Long-Term User-Centric Records
por: Lyu, Yibo, et al.
Publicado: (2026) -
FashionLens: Toward Versatile Fashion Image Retrieval via Task-Adaptive Learning
por: Wen, Haokun, et al.
Publicado: (2026)