ControlMLLM: Training-Free Visual Prompt Learning for Multimodal Large Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wu, Mingrui, Cai, Xinyue, Ji, Jiayi, Li, Jiale, Huang, Oucheng, Luo, Gen, Fei, Hao, Jiang, Guannan, Sun, Xiaoshuai, Ji, Rongrong |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
TraDiffusion: Trajectory-Based Training-Free Image Generation
par: Wu, Mingrui, et autres
Publié: (2024)
par: Wu, Mingrui, et autres
Publié: (2024)
Evaluating and Analyzing Relationship Hallucinations in Large Vision-Language Models
par: Wu, Mingrui, et autres
Publié: (2024)
par: Wu, Mingrui, et autres
Publié: (2024)
MIHBench: Benchmarking and Mitigating Multi-Image Hallucinations in Multimodal Large Language Models
par: Li, Jiale, et autres
Publié: (2025)
par: Li, Jiale, et autres
Publié: (2025)
$γ-$MoD: Exploring Mixture-of-Depth Adaptation for Multimodal Large Language Models
par: Luo, Yaxin, et autres
Publié: (2024)
par: Luo, Yaxin, et autres
Publié: (2024)
MICON-Bench: Benchmarking and Enhancing Multi-Image Context Image Generation in Unified Multimodal Models
par: Wu, Mingrui, et autres
Publié: (2026)
par: Wu, Mingrui, et autres
Publié: (2026)
Test-Time Computing for Referring Multimodal Large Language Models
par: Wu, Mingrui, et autres
Publié: (2026)
par: Wu, Mingrui, et autres
Publié: (2026)
ComfyGPT: A Self-Optimizing Multi-Agent System for Comprehensive ComfyUI Workflow Generation
par: Huang, Oucheng, et autres
Publié: (2025)
par: Huang, Oucheng, et autres
Publié: (2025)
Feast Your Eyes: Mixture-of-Resolution Adaptation for Multimodal Large Language Models
par: Luo, Gen, et autres
Publié: (2024)
par: Luo, Gen, et autres
Publié: (2024)
Beat: Bi-directional One-to-Many Embedding Alignment for Text-based Person Retrieval
par: Ma, Yiwei, et autres
Publié: (2024)
par: Ma, Yiwei, et autres
Publié: (2024)
MLLM-Selector: Necessity and Diversity-driven High-Value Data Selection for Enhanced Visual Instruction Tuning
par: Ma, Yiwei, et autres
Publié: (2025)
par: Ma, Yiwei, et autres
Publié: (2025)
FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression
par: Tong, Bo, et autres
Publié: (2024)
par: Tong, Bo, et autres
Publié: (2024)
Training-Free Multimodal Large Language Model Orchestration
par: Xie, Tianyu, et autres
Publié: (2025)
par: Xie, Tianyu, et autres
Publié: (2025)
INF-LLaVA: Dual-perspective Perception for High-Resolution Multimodal Large Language Model
par: Ma, Yiwei, et autres
Publié: (2024)
par: Ma, Yiwei, et autres
Publié: (2024)
X-Dreamer: Creating High-quality 3D Content by Bridging the Domain Gap Between Text-to-2D and Text-to-3D Generation
par: Ma, Yiwei, et autres
Publié: (2023)
par: Ma, Yiwei, et autres
Publié: (2023)
Look on Demand: A Cognitive Scheduling Framework for Visual Evidence Acquisition in Multimodal Reasoning
par: Zhang, Yang, et autres
Publié: (2026)
par: Zhang, Yang, et autres
Publié: (2026)
RG-SAN: Rule-Guided Spatial Awareness Network for End-to-End 3D Referring Expression Segmentation
par: Wu, Changli, et autres
Publié: (2024)
par: Wu, Changli, et autres
Publié: (2024)
Accelerating Multimodal Large Language Models via Dynamic Visual-Token Exit and the Empirical Findings
par: Wu, Qiong, et autres
Publié: (2024)
par: Wu, Qiong, et autres
Publié: (2024)
AIGI-Holmes: Towards Explainable and Generalizable AI-Generated Image Detection via Multimodal Large Language Models
par: Zhou, Ziyin, et autres
Publié: (2025)
par: Zhou, Ziyin, et autres
Publié: (2025)
Rethinking 3D Dense Caption and Visual Grounding in A Unified Framework through Prompt-based Localization
par: Luo, Yongdong, et autres
Publié: (2024)
par: Luo, Yongdong, et autres
Publié: (2024)
M4-BLIP: Advancing Multi-Modal Media Manipulation Detection through Face-Enhanced Local Analysis
par: Wu, Hang, et autres
Publié: (2025)
par: Wu, Hang, et autres
Publié: (2025)
CIR-CoT: Towards Interpretable Composed Image Retrieval via End-to-End Chain-of-Thought Reasoning
par: Lin, Weihuang, et autres
Publié: (2025)
par: Lin, Weihuang, et autres
Publié: (2025)
Any-to-3D Generation via Hybrid Diffusion Supervision
par: Fan, Yijun, et autres
Publié: (2024)
par: Fan, Yijun, et autres
Publié: (2024)
Scaling the Long Video Understanding of Multimodal Large Language Models via Visual Memory Mechanism
par: Chen, Tao, et autres
Publié: (2026)
par: Chen, Tao, et autres
Publié: (2026)
HRSeg: High-Resolution Visual Perception and Enhancement for Reasoning Segmentation
par: Lin, Weihuang, et autres
Publié: (2025)
par: Lin, Weihuang, et autres
Publié: (2025)
Grounded Chain-of-Thought for Multimodal Large Language Models
par: Wu, Qiong, et autres
Publié: (2025)
par: Wu, Qiong, et autres
Publié: (2025)
Multi-branch Collaborative Learning Network for 3D Visual Grounding
par: Qian, Zhipeng, et autres
Publié: (2024)
par: Qian, Zhipeng, et autres
Publié: (2024)
3D-GRES: Generalized 3D Referring Expression Segmentation
par: Wu, Changli, et autres
Publié: (2024)
par: Wu, Changli, et autres
Publié: (2024)
SpaCE-10: A Comprehensive Benchmark for Multimodal Large Language Models in Compositional Spatial Intelligence
par: Gong, Ziyang, et autres
Publié: (2025)
par: Gong, Ziyang, et autres
Publié: (2025)
Boosting Multimodal Large Language Models with Visual Tokens Withdrawal for Rapid Inference
par: Lin, Zhihang, et autres
Publié: (2024)
par: Lin, Zhihang, et autres
Publié: (2024)
X-Oscar: A Progressive Framework for High-quality Text-guided 3D Animatable Avatar Generation
par: Ma, Yiwei, et autres
Publié: (2024)
par: Ma, Yiwei, et autres
Publié: (2024)
Mixed Degradation Image Restoration via Local Dynamic Optimization and Conditional Embedding
par: Gu, Yubin, et autres
Publié: (2024)
par: Gu, Yubin, et autres
Publié: (2024)
JM3D & JM3D-LLM: Elevating 3D Understanding with Joint Multi-modal Cues
par: Ji, Jiayi, et autres
Publié: (2023)
par: Ji, Jiayi, et autres
Publié: (2023)
Routing Experts: Learning to Route Dynamic Experts in Multi-modal Large Language Models
par: Wu, Qiong, et autres
Publié: (2024)
par: Wu, Qiong, et autres
Publié: (2024)
Not All Attention is Needed: Parameter and Computation Efficient Transfer Learning for Multi-modal Large Language Models
par: Wu, Qiong, et autres
Publié: (2024)
par: Wu, Qiong, et autres
Publié: (2024)
Towards General Visual-Linguistic Face Forgery Detection(V2)
par: Sun, Ke, et autres
Publié: (2025)
par: Sun, Ke, et autres
Publié: (2025)
Training Long-Context LLMs Efficiently via Chunk-wise Optimization
par: Li, Wenhao, et autres
Publié: (2025)
par: Li, Wenhao, et autres
Publié: (2025)
Graph-MLLM: Harnessing Multimodal Large Language Models for Multimodal Graph Learning
par: Liu, Jiajin, et autres
Publié: (2025)
par: Liu, Jiajin, et autres
Publié: (2025)
Evading Visual Aphasia: Contrastive Adaptive Semantic Token Pruning for Vision-Language Models
par: Ma, Jie, et autres
Publié: (2026)
par: Ma, Jie, et autres
Publié: (2026)
Deep Instruction Tuning for Segment Anything Model
par: Huang, Xiaorui, et autres
Publié: (2024)
par: Huang, Xiaorui, et autres
Publié: (2024)
Speculative Decoding Reimagined for Multimodal Large Language Models
par: Lin, Luxi, et autres
Publié: (2025)
par: Lin, Luxi, et autres
Publié: (2025)
Documents similaires
-
TraDiffusion: Trajectory-Based Training-Free Image Generation
par: Wu, Mingrui, et autres
Publié: (2024) -
Evaluating and Analyzing Relationship Hallucinations in Large Vision-Language Models
par: Wu, Mingrui, et autres
Publié: (2024) -
MIHBench: Benchmarking and Mitigating Multi-Image Hallucinations in Multimodal Large Language Models
par: Li, Jiale, et autres
Publié: (2025) -
$γ-$MoD: Exploring Mixture-of-Depth Adaptation for Multimodal Large Language Models
par: Luo, Yaxin, et autres
Publié: (2024) -
MICON-Bench: Benchmarking and Enhancing Multi-Image Context Image Generation in Unified Multimodal Models
par: Wu, Mingrui, et autres
Publié: (2026)