Segmentation as A Plug-and-Play Capability for Frozen Multimodal LLMs
Fuente:
arXiv
Guardado en:
| Autores principales: | Liu, Jiazhen, Chen, Long |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Plug-and-Play Grounding of Reasoning in Multimodal Large Language Models
por: Chen, Jiaxing, et al.
Publicado: (2024)
por: Chen, Jiaxing, et al.
Publicado: (2024)
Better, Stronger, Faster: Tackling the Trilemma in MLLM-based Segmentation with Simultaneous Textual Mask Prediction
por: Liu, Jiazhen, et al.
Publicado: (2025)
por: Liu, Jiazhen, et al.
Publicado: (2025)
MGML: A Plug-and-Play Meta-Guided Multi-Modal Learning Framework for Incomplete Multimodal Brain Tumor Segmentation
por: Zou, Yulong, et al.
Publicado: (2025)
por: Zou, Yulong, et al.
Publicado: (2025)
MotionCraft: Crafting Whole-Body Motion with Plug-and-Play Multimodal Controls
por: Bian, Yuxuan, et al.
Publicado: (2024)
por: Bian, Yuxuan, et al.
Publicado: (2024)
ARM: A Learnable, Plug-and-Play Module for CLIP-based Open-vocabulary Semantic Segmentation
por: Liu, Ziquan, et al.
Publicado: (2025)
por: Liu, Ziquan, et al.
Publicado: (2025)
CBNet: A Plug-and-Play Network for Segmentation-Based Scene Text Detection
por: Zhao, Xi, et al.
Publicado: (2022)
por: Zhao, Xi, et al.
Publicado: (2022)
Enhanced Motion Forecasting with Plug-and-Play Multimodal Large Language Models
por: Luo, Katie, et al.
Publicado: (2025)
por: Luo, Katie, et al.
Publicado: (2025)
Text-to-Image Rectified Flow as Plug-and-Play Priors
por: Yang, Xiaofeng, et al.
Publicado: (2024)
por: Yang, Xiaofeng, et al.
Publicado: (2024)
Plug-and-Play Diffusion Distillation
por: Hsiao, Yi-Ting, et al.
Publicado: (2024)
por: Hsiao, Yi-Ting, et al.
Publicado: (2024)
FrozenSeg: Harmonizing Frozen Foundation Models for Open-Vocabulary Segmentation
por: Chen, Xi, et al.
Publicado: (2024)
por: Chen, Xi, et al.
Publicado: (2024)
Plug, Play, and Fortify: A Low-Cost Module for Robust Multimodal Image Understanding Models
por: Lu, Siqi, et al.
Publicado: (2026)
por: Lu, Siqi, et al.
Publicado: (2026)
Stand-In: A Lightweight and Plug-and-Play Identity Control for Video Generation
por: Xue, Bowen, et al.
Publicado: (2025)
por: Xue, Bowen, et al.
Publicado: (2025)
Plug-and-Play Context Feature Reuse for Efficient Masked Generation
por: Liu, Xuejie, et al.
Publicado: (2025)
por: Liu, Xuejie, et al.
Publicado: (2025)
Trans-Adapter: A Plug-and-Play Framework for Transparent Image Inpainting
por: Dai, Yuekun, et al.
Publicado: (2025)
por: Dai, Yuekun, et al.
Publicado: (2025)
Plug-and-Play Versatile Compressed Video Enhancement
por: Zeng, Huimin, et al.
Publicado: (2025)
por: Zeng, Huimin, et al.
Publicado: (2025)
Empowering Small VLMs to Think with Dynamic Memorization and Exploration
por: Liu, Jiazhen, et al.
Publicado: (2025)
por: Liu, Jiazhen, et al.
Publicado: (2025)
MQADet: A Plug-and-Play Paradigm for Enhancing Open-Vocabulary Object Detection via Multimodal Question Answering
por: Li, Caixiong, et al.
Publicado: (2025)
por: Li, Caixiong, et al.
Publicado: (2025)
Implicit Multimodal Alignment: On the Generalization of Frozen LLMs to Multimodal Inputs
por: Shukor, Mustafa, et al.
Publicado: (2024)
por: Shukor, Mustafa, et al.
Publicado: (2024)
Momentum Guidance: Plug-and-Play Guidance for Flow Models
por: Liao, Runlong, et al.
Publicado: (2026)
por: Liao, Runlong, et al.
Publicado: (2026)
Enhancing Logits Distillation with Plug\&Play Kendall's $τ$ Ranking Loss
por: Guan, Yuchen, et al.
Publicado: (2024)
por: Guan, Yuchen, et al.
Publicado: (2024)
F-LMM: Grounding Frozen Large Multimodal Models
por: Wu, Size, et al.
Publicado: (2024)
por: Wu, Size, et al.
Publicado: (2024)
From Camera to World: A Plug-and-Play Module for Human Mesh Transformation
por: Ma, Changhai, et al.
Publicado: (2025)
por: Ma, Changhai, et al.
Publicado: (2025)
Derain-Agent: A Plug-and-Play Agent Framework for Rainy Image Restoration
por: Yu, Zhaocheng, et al.
Publicado: (2026)
por: Yu, Zhaocheng, et al.
Publicado: (2026)
Fancy123: One Image to High-Quality 3D Mesh Generation via Plug-and-Play Deformation
por: Yu, Qiao, et al.
Publicado: (2024)
por: Yu, Qiao, et al.
Publicado: (2024)
Flash-VAED: Plug-and-Play VAE Decoders for Efficient Video Generation
por: Zhu, Lunjie, et al.
Publicado: (2026)
por: Zhu, Lunjie, et al.
Publicado: (2026)
RAG-Adapter: A Plug-and-Play RAG-enhanced Framework for Long Video Understanding
por: Tan, Xichen, et al.
Publicado: (2025)
por: Tan, Xichen, et al.
Publicado: (2025)
FasterVAR: Plug-and-Play Acceleration for Visual Autoregressive Models
por: Li, Senmao, et al.
Publicado: (2025)
por: Li, Senmao, et al.
Publicado: (2025)
TDiff: Thermal Plug-And-Play Prior with Patch-Based Diffusion
por: Dashpute, Piyush, et al.
Publicado: (2025)
por: Dashpute, Piyush, et al.
Publicado: (2025)
Plug-and-Play Logit Fusion for Heterogeneous Pathology Foundation Models
por: Huang, Gexin, et al.
Publicado: (2026)
por: Huang, Gexin, et al.
Publicado: (2026)
Plug-and-Play Clarifier: A Zero-Shot Multimodal Framework for Egocentric Intent Disambiguation
por: Yang, Sicheng, et al.
Publicado: (2025)
por: Yang, Sicheng, et al.
Publicado: (2025)
NFCDS: A Plug-and-Play Noise Frequency-Controlled Diffusion Sampling Strategy for Image Restoration
por: Wang, Zhen, et al.
Publicado: (2026)
por: Wang, Zhen, et al.
Publicado: (2026)
Video Compression Commander: Plug-and-Play Inference Acceleration for Video Large Language Models
por: Liu, Xuyang, et al.
Publicado: (2025)
por: Liu, Xuyang, et al.
Publicado: (2025)
Global Compression Commander: Plug-and-Play Inference Acceleration for High-Resolution Large Vision-Language Models
por: Liu, Xuyang, et al.
Publicado: (2025)
por: Liu, Xuyang, et al.
Publicado: (2025)
BrushNet: A Plug-and-Play Image Inpainting Model with Decomposed Dual-Branch Diffusion
por: Ju, Xuan, et al.
Publicado: (2024)
por: Ju, Xuan, et al.
Publicado: (2024)
A convergent Plug-and-Play Majorization-Minimization algorithm for Poisson inverse problems
por: Modrzyk, Thibaut, et al.
Publicado: (2026)
por: Modrzyk, Thibaut, et al.
Publicado: (2026)
ReMA: A Training-Free Plug-and-Play Mixing Augmentation for Video Behavior Recognition
por: Cui, Feng-Qi, et al.
Publicado: (2026)
por: Cui, Feng-Qi, et al.
Publicado: (2026)
ConvRot: Rotation-Based Plug-and-Play 4-bit Quantization for Diffusion Transformers
por: Huang, Feice, et al.
Publicado: (2025)
por: Huang, Feice, et al.
Publicado: (2025)
Score-Based Turbo Message Passing for Plug-and-Play Compressive Imaging
por: Cai, Chang, et al.
Publicado: (2025)
por: Cai, Chang, et al.
Publicado: (2025)
PSTTS: A Plug-and-Play Token Selector for Efficient Event-based Spatio-temporal Representation Learning
por: Zhao, Xiangmo, et al.
Publicado: (2025)
por: Zhao, Xiangmo, et al.
Publicado: (2025)
Vote&Mix: Plug-and-Play Token Reduction for Efficient Vision Transformer
por: Peng, Shuai, et al.
Publicado: (2024)
por: Peng, Shuai, et al.
Publicado: (2024)
Ejemplares similares
-
Plug-and-Play Grounding of Reasoning in Multimodal Large Language Models
por: Chen, Jiaxing, et al.
Publicado: (2024) -
Better, Stronger, Faster: Tackling the Trilemma in MLLM-based Segmentation with Simultaneous Textual Mask Prediction
por: Liu, Jiazhen, et al.
Publicado: (2025) -
MGML: A Plug-and-Play Meta-Guided Multi-Modal Learning Framework for Incomplete Multimodal Brain Tumor Segmentation
por: Zou, Yulong, et al.
Publicado: (2025) -
MotionCraft: Crafting Whole-Body Motion with Plug-and-Play Multimodal Controls
por: Bian, Yuxuan, et al.
Publicado: (2024) -
ARM: A Learnable, Plug-and-Play Module for CLIP-based Open-vocabulary Semantic Segmentation
por: Liu, Ziquan, et al.
Publicado: (2025)