LatentRouter: Can We Choose the Right Multimodal Model Before Seeing Its Answer?
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Cheng, Xueqi, Dong, Yushun |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
BLINK: Multimodal Large Language Models Can See but Not Perceive
par: Fu, Xingyu, et autres
Publié: (2024)
par: Fu, Xingyu, et autres
Publié: (2024)
Can We Edit Multimodal Large Language Models?
par: Cheng, Siyuan, et autres
Publié: (2023)
par: Cheng, Siyuan, et autres
Publié: (2023)
Watch Before You Answer: Learning from Visually Grounded Post-Training
par: Zhang, Yuxuan, et autres
Publié: (2026)
par: Zhang, Yuxuan, et autres
Publié: (2026)
Can't See the Forest for the Trees: Benchmarking Multimodal Safety Awareness for Multimodal LLMs
par: Wang, Wenxuan, et autres
Publié: (2025)
par: Wang, Wenxuan, et autres
Publié: (2025)
Can Multimodal LLMs See Materials Clearly? A Multimodal Benchmark on Materials Characterization
par: Lai, Zhengzhao, et autres
Publié: (2025)
par: Lai, Zhengzhao, et autres
Publié: (2025)
Router-Suggest: Dynamic Routing for Multimodal Auto-Completion in Visually-Grounded Dialogs
par: Mishra, Sandeep, et autres
Publié: (2026)
par: Mishra, Sandeep, et autres
Publié: (2026)
Seeing Isn't Knowing: Do VLMs Know When Not to Answer Spatial Questions (and Why)?
par: Zhang, Yue, et autres
Publié: (2026)
par: Zhang, Yue, et autres
Publié: (2026)
Right this way: Can VLMs Guide Us to See More to Answer Questions?
par: Liu, Li, et autres
Publié: (2024)
par: Liu, Li, et autres
Publié: (2024)
More Thinking, Less Seeing? Assessing Amplified Hallucination in Multimodal Reasoning Models
par: Liu, Chengzhi, et autres
Publié: (2025)
par: Liu, Chengzhi, et autres
Publié: (2025)
Seeing but Not Thinking: Routing Distraction in Multimodal Mixture-of-Experts
par: Xu, Haolei, et autres
Publié: (2026)
par: Xu, Haolei, et autres
Publié: (2026)
Cross-Modal Safety Mechanism Transfer in Large Vision-Language Models
par: Xu, Shicheng, et autres
Publié: (2024)
par: Xu, Shicheng, et autres
Publié: (2024)
Olympus: A Universal Task Router for Computer Vision Tasks
par: Lin, Yuanze, et autres
Publié: (2024)
par: Lin, Yuanze, et autres
Publié: (2024)
Seeing Beyond Words: Self-Supervised Visual Learning for Multimodal Large Language Models
par: Caffagni, Davide, et autres
Publié: (2025)
par: Caffagni, Davide, et autres
Publié: (2025)
Bifrost-1: Bridging Multimodal LLMs and Diffusion Models with Patch-level CLIP Latents
par: Lin, Han, et autres
Publié: (2025)
par: Lin, Han, et autres
Publié: (2025)
Can Visual Encoder Learn to See Arrows?
par: Terashita, Naoyuki, et autres
Publié: (2025)
par: Terashita, Naoyuki, et autres
Publié: (2025)
How Multimodal LLMs Solve Image Tasks: A Lens on Visual Grounding, Task Reasoning, and Answer Decoding
par: Yu, Zhuoran, et autres
Publié: (2025)
par: Yu, Zhuoran, et autres
Publié: (2025)
Text as Images: Can Multimodal Large Language Models Follow Printed Instructions in Pixels?
par: Li, Xiujun, et autres
Publié: (2023)
par: Li, Xiujun, et autres
Publié: (2023)
Can We Generate Images with CoT? Let's Verify and Reinforce Image Generation Step by Step
par: Guo, Ziyu, et autres
Publié: (2025)
par: Guo, Ziyu, et autres
Publié: (2025)
Graphic Design with Large Multimodal Model
par: Cheng, Yutao, et autres
Publié: (2024)
par: Cheng, Yutao, et autres
Publié: (2024)
From Sora What We Can See: A Survey of Text-to-Video Generation
par: Sun, Rui, et autres
Publié: (2024)
par: Sun, Rui, et autres
Publié: (2024)
Can Video Large Multimodal Models Think Like Doubters-or Double-Down: A Study on Defeasible Video Entailment
par: Zhang, Yue, et autres
Publié: (2025)
par: Zhang, Yue, et autres
Publié: (2025)
Language Models Can See Better: Visual Contrastive Decoding For LLM Multimodal Reasoning
par: Pang, Yuqi, et autres
Publié: (2025)
par: Pang, Yuqi, et autres
Publié: (2025)
Match & Choose: Model Selection Framework for Fine-tuning Text-to-Image Diffusion Models
par: Lewandowski, Basile, et autres
Publié: (2025)
par: Lewandowski, Basile, et autres
Publié: (2025)
Pixels, Patterns, but No Poetry: To See The World like Humans
par: Gao, Hongcheng, et autres
Publié: (2025)
par: Gao, Hongcheng, et autres
Publié: (2025)
Seeing the Image: Prioritizing Visual Correlation by Contrastive Alignment
par: Xiao, Xin, et autres
Publié: (2024)
par: Xiao, Xin, et autres
Publié: (2024)
Seeing Symbols, Missing Cultures: Probing Vision-Language Models' Reasoning on Fire Imagery and Cultural Meaning
par: Yu, Haorui, et autres
Publié: (2025)
par: Yu, Haorui, et autres
Publié: (2025)
Seeing Through Words, Speaking Through Pixels: Deep Representational Alignment Between Vision and Language Models
par: He, Zoe Wanying, et autres
Publié: (2025)
par: He, Zoe Wanying, et autres
Publié: (2025)
Explain Before You Answer: A Survey on Compositional Visual Reasoning
par: Ke, Fucai, et autres
Publié: (2025)
par: Ke, Fucai, et autres
Publié: (2025)
LatentEdit: Adaptive Latent Control for Consistent Semantic Editing
par: Liu, Siyi, et autres
Publié: (2025)
par: Liu, Siyi, et autres
Publié: (2025)
Multimodal LLMs Can Reason about Aesthetics in Zero-Shot
par: Jiang, Ruixiang, et autres
Publié: (2025)
par: Jiang, Ruixiang, et autres
Publié: (2025)
Can-Do! A Dataset and Neuro-Symbolic Grounded Framework for Embodied Planning with Large Multimodal Models
par: Chia, Yew Ken, et autres
Publié: (2024)
par: Chia, Yew Ken, et autres
Publié: (2024)
Toward Robust Multimodal Learning using Multimodal Foundational Models
par: Zhao, Xianbing, et autres
Publié: (2024)
par: Zhao, Xianbing, et autres
Publié: (2024)
Med-RewardBench: Benchmarking Reward Models and Judges for Medical Multimodal Large Language Models
par: Ding, Meidan, et autres
Publié: (2025)
par: Ding, Meidan, et autres
Publié: (2025)
Can We Talk Models Into Seeing the World Differently?
par: Gavrikov, Paul, et autres
Publié: (2024)
par: Gavrikov, Paul, et autres
Publié: (2024)
Rethinking Machine Unlearning in Image Generation Models
par: Liu, Renyang, et autres
Publié: (2025)
par: Liu, Renyang, et autres
Publié: (2025)
What You See is What You Ask: Evaluating Audio Descriptions
par: Kala, Divy, et autres
Publié: (2025)
par: Kala, Divy, et autres
Publié: (2025)
TruthPrInt: Mitigating Large Vision-Language Models Object Hallucination Via Latent Truthful-Guided Pre-Intervention
par: Duan, Jinhao, et autres
Publié: (2025)
par: Duan, Jinhao, et autres
Publié: (2025)
Model Composition for Multimodal Large Language Models
par: Chen, Chi, et autres
Publié: (2024)
par: Chen, Chi, et autres
Publié: (2024)
Multimodal Language Models See Better When They Look Shallower
par: Chen, Haoran, et autres
Publié: (2025)
par: Chen, Haoran, et autres
Publié: (2025)
Can Vision Language Models Understand Mimed Actions?
par: Cho, Hyundong, et autres
Publié: (2025)
par: Cho, Hyundong, et autres
Publié: (2025)
Documents similaires
-
BLINK: Multimodal Large Language Models Can See but Not Perceive
par: Fu, Xingyu, et autres
Publié: (2024) -
Can We Edit Multimodal Large Language Models?
par: Cheng, Siyuan, et autres
Publié: (2023) -
Watch Before You Answer: Learning from Visually Grounded Post-Training
par: Zhang, Yuxuan, et autres
Publié: (2026) -
Can't See the Forest for the Trees: Benchmarking Multimodal Safety Awareness for Multimodal LLMs
par: Wang, Wenxuan, et autres
Publié: (2025) -
Can Multimodal LLMs See Materials Clearly? A Multimodal Benchmark on Materials Characterization
par: Lai, Zhengzhao, et autres
Publié: (2025)