Migician: Revealing the Magic of Free-Form Multi-Image Grounding in Multimodal Large Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Li, You, Huang, Heyu, Chen, Chi, Huang, Kaiyu, Huang, Chao, Guo, Zonghao, Liu, Zhiyuan, Xu, Jinan, Li, Yuhua, Li, Ruixuan, Sun, Maosong |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Think in Safety: Unveiling and Mitigating Safety Alignment Collapse in Multimodal Large Reasoning Model
by: Lou, Xinyue, et al.
Published: (2025)
by: Lou, Xinyue, et al.
Published: (2025)
Imagination Helps Visual Reasoning, But Not Yet in Latent Space
by: Li, You, et al.
Published: (2026)
by: Li, You, et al.
Published: (2026)
Multilingual Collaborative Defense for Large Language Models
by: Li, Hongliang, et al.
Published: (2025)
by: Li, Hongliang, et al.
Published: (2025)
Multi-Aspect Knowledge Distillation for Language Model with Low-rank Factorization
by: Liu, Zihe, et al.
Published: (2026)
by: Liu, Zihe, et al.
Published: (2026)
Addressing Exacerbated Attention Sink for Source-Free Cross-Domain Few-Shot Learning
by: Yi, Shuai, et al.
Published: (2026)
by: Yi, Shuai, et al.
Published: (2026)
Improving CLIP Adaptation by Breaking Tail Alignment for Source-Free Cross-Domain Few-Shot Learning
by: Yi, Shuai, et al.
Published: (2026)
by: Yi, Shuai, et al.
Published: (2026)
SoT: Structured-of-Thought Prompting Guides Multilingual Reasoning in Large Language Models
by: Qi, Rui, et al.
Published: (2025)
by: Qi, Rui, et al.
Published: (2025)
Revisiting Continuity of Image Tokens for Cross-domain Few-shot Learning
by: Yi, Shuai, et al.
Published: (2025)
by: Yi, Shuai, et al.
Published: (2025)
Reconstruction Target Matters in Masked Image Modeling for Cross-Domain Few-Shot Learning
by: Ma, Ran, et al.
Published: (2024)
by: Ma, Ran, et al.
Published: (2024)
STAR: Stage-Wise Attention-Guided Token Reduction for Efficient Large Vision-Language Models Inference
by: Guo, Yichen, et al.
Published: (2025)
by: Guo, Yichen, et al.
Published: (2025)
MM-UAVBench: How Well Do Multimodal Large Language Models See, Think, and Plan in Low-Altitude UAV Scenarios?
by: Dai, Shiqi, et al.
Published: (2025)
by: Dai, Shiqi, et al.
Published: (2025)
MICM: Rethinking Unsupervised Pretraining for Enhanced Few-shot Learning
by: Zhang, Zhenyu, et al.
Published: (2024)
by: Zhang, Zhenyu, et al.
Published: (2024)
Mind the Discriminability Trap in Source-Free Cross-domain Few-shot Learning
by: Zhang, Zhenyu, et al.
Published: (2026)
by: Zhang, Zhenyu, et al.
Published: (2026)
Reviving In-domain Fine-tuning Methods for Source-Free Cross-domain Few-shot Learning
by: Zhao, Yaze, et al.
Published: (2026)
by: Zhao, Yaze, et al.
Published: (2026)
KARL: Knowledge-Aware Reasoning and Reinforcement Learning for Knowledge-Intensive Visual Grounding
by: Ma, Xinyu, et al.
Published: (2025)
by: Ma, Xinyu, et al.
Published: (2025)
Model Composition for Multimodal Large Language Models
by: Chen, Chi, et al.
Published: (2024)
by: Chen, Chi, et al.
Published: (2024)
DoRA: Enhancing Parameter-Efficient Fine-Tuning with Dynamic Rank Distribution
by: Mao, Yulong, et al.
Published: (2024)
by: Mao, Yulong, et al.
Published: (2024)
FreeMotion: MoCap-Free Human Motion Synthesis with Multimodal Large Language Models
by: Zhang, Zhikai, et al.
Published: (2024)
by: Zhang, Zhikai, et al.
Published: (2024)
OmniVLA: Physically-Grounded Multimodal VLA with Unified Multi-Sensor Perception for Robotic Manipulation
by: Guo, Heyu, et al.
Published: (2025)
by: Guo, Heyu, et al.
Published: (2025)
Revisiting Pool-based Prompt Learning for Few-shot Class-incremental Learning
by: Jiang, Yongwei, et al.
Published: (2025)
by: Jiang, Yongwei, et al.
Published: (2025)
Random Registers for Cross-Domain Few-Shot Learning
by: Yi, Shuai, et al.
Published: (2025)
by: Yi, Shuai, et al.
Published: (2025)
Remedying Target-Domain Astigmatism for Cross-Domain Few-Shot Object Detection
by: Jiang, Yongwei, et al.
Published: (2026)
by: Jiang, Yongwei, et al.
Published: (2026)
LLaVA-UHD: an LMM Perceiving Any Aspect Ratio and High-Resolution Images
by: Xu, Ruyi, et al.
Published: (2024)
by: Xu, Ruyi, et al.
Published: (2024)
Lightweight Frequency Masker for Cross-Domain Few-Shot Semantic Segmentation
by: Tong, Jintao, et al.
Published: (2024)
by: Tong, Jintao, et al.
Published: (2024)
The Devil is in Low-Level Features for Cross-Domain Few-Shot Segmentation
by: Liu, Yuhan, et al.
Published: (2025)
by: Liu, Yuhan, et al.
Published: (2025)
Interpretable Cross-Domain Few-Shot Learning with Rectified Target-Domain Local Alignment
by: Zhao, Yaze, et al.
Published: (2026)
by: Zhao, Yaze, et al.
Published: (2026)
MAP: Mitigating Hallucinations in Large Vision-Language Models with Map-Level Attention Processing
by: Li, Chenxi, et al.
Published: (2025)
by: Li, Chenxi, et al.
Published: (2025)
A Survey on Large Language Models with Multilingualism: Recent Advances and New Frontiers
by: Huang, Kaiyu, et al.
Published: (2024)
by: Huang, Kaiyu, et al.
Published: (2024)
Enhancing Descriptive Image Quality Assessment with A Large-scale Multi-modal Dataset
by: You, Zhiyuan, et al.
Published: (2024)
by: You, Zhiyuan, et al.
Published: (2024)
AdaMMS: Model Merging for Heterogeneous Multimodal Large Language Models with Unsupervised Coefficient Optimization
by: Du, Yiyang, et al.
Published: (2025)
by: Du, Yiyang, et al.
Published: (2025)
XLRS-Bench: Could Your Multimodal LLMs Understand Extremely Large Ultra-High-Resolution Remote Sensing Imagery?
by: Wang, Fengxiang, et al.
Published: (2025)
by: Wang, Fengxiang, et al.
Published: (2025)
VoCoT: Unleashing Visually Grounded Multi-Step Reasoning in Large Multi-Modal Models
by: Li, Zejun, et al.
Published: (2024)
by: Li, Zejun, et al.
Published: (2024)
Kosmos-G: Generating Images in Context with Multimodal Large Language Models
by: Pan, Xichen, et al.
Published: (2023)
by: Pan, Xichen, et al.
Published: (2023)
A Refer-and-Ground Multimodal Large Language Model for Biomedicine
by: Huang, Xiaoshuang, et al.
Published: (2024)
by: Huang, Xiaoshuang, et al.
Published: (2024)
Surface Defect Detector Based on Deformable Convolution and Lightweight Multi‐Scale Attention
by: Zilin Xia, et al.
Published: (2025)
by: Zilin Xia, et al.
Published: (2025)
Does Seeing More Mean Knowing More? Mono-Anchored Advantage Normalization for Multi-Source Visual Reasoning
by: Zeng, Fanhu, et al.
Published: (2026)
by: Zeng, Fanhu, et al.
Published: (2026)
Learning Unknowns from Unknowns: Diversified Negative Prototypes Generator for Few-Shot Open-Set Recognition
by: Zhang, Zhenyu, et al.
Published: (2024)
by: Zhang, Zhenyu, et al.
Published: (2024)
VisRAG 2.0: Evidence-Guided Multi-Image Reasoning in Visual Retrieval-Augmented Generation
by: Sun, Yubo, et al.
Published: (2025)
by: Sun, Yubo, et al.
Published: (2025)
TimeSoccer: An End-to-End Multimodal Large Language Model for Soccer Commentary Generation
by: You, Ling, et al.
Published: (2025)
by: You, Ling, et al.
Published: (2025)
LLaVA-UHD v3: Progressive Visual Compression for Efficient Native-Resolution Encoding in MLLMs
by: Sun, Shichu, et al.
Published: (2025)
by: Sun, Shichu, et al.
Published: (2025)
Similar Items
-
Think in Safety: Unveiling and Mitigating Safety Alignment Collapse in Multimodal Large Reasoning Model
by: Lou, Xinyue, et al.
Published: (2025) -
Imagination Helps Visual Reasoning, But Not Yet in Latent Space
by: Li, You, et al.
Published: (2026) -
Multilingual Collaborative Defense for Large Language Models
by: Li, Hongliang, et al.
Published: (2025) -
Multi-Aspect Knowledge Distillation for Language Model with Low-rank Factorization
by: Liu, Zihe, et al.
Published: (2026) -
Addressing Exacerbated Attention Sink for Source-Free Cross-Domain Few-Shot Learning
by: Yi, Shuai, et al.
Published: (2026)