Vision Also You Need: Navigating Out-of-Distribution Detection with Multimodal Large Language Model
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Xu, Haoran, Liu, Yanlin, Tong, Zizhao, Li, Jiaze, Fu, Kexue, Zhang, Yuyang, Gao, Longxiang, Li, Shuaiguang, Li, Xingyu, Xu, Yanran, Wang, Changwei |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Federated Balanced Learning
par: Li, Jiaze, et autres
Publié: (2026)
par: Li, Jiaze, et autres
Publié: (2026)
Region Matters: Efficient and Reliable Region-Aware Visual Place Recognition
par: Chen, Shunpeng, et autres
Publié: (2026)
par: Chen, Shunpeng, et autres
Publié: (2026)
Focus on Local: Finding Reliable Discriminative Regions for Visual Place Recognition
par: Wang, Changwei, et autres
Publié: (2025)
par: Wang, Changwei, et autres
Publié: (2025)
Visual Para-Thinker: Divide-and-Conquer Reasoning for Visual Comprehension
par: Xu, Haoran, et autres
Publié: (2026)
par: Xu, Haoran, et autres
Publié: (2026)
Neural Distribution Prior for LiDAR Out-of-Distribution Detection
par: Li, Zizhao, et autres
Publié: (2026)
par: Li, Zizhao, et autres
Publié: (2026)
Relative Energy Learning for LiDAR Out-of-Distribution Detection
par: Li, Zizhao, et autres
Publié: (2025)
par: Li, Zizhao, et autres
Publié: (2025)
Image Recognition with Online Lightweight Vision Transformer: A Survey
par: Zhang, Zherui, et autres
Publié: (2025)
par: Zhang, Zherui, et autres
Publié: (2025)
Federated Learning with Sample-level Client Drift Mitigation
par: Xu, Haoran, et autres
Publié: (2025)
par: Xu, Haoran, et autres
Publié: (2025)
Federated Joint Learning for Domain and Class Generalization
par: Xu, Haoran, et autres
Publié: (2026)
par: Xu, Haoran, et autres
Publié: (2026)
CurriFlow: Curriculum-Guided Depth Fusion with Optical Flow-Based Temporal Alignment for 3D Semantic Scene Completion
par: Lin, Jinzhou, et autres
Publié: (2025)
par: Lin, Jinzhou, et autres
Publié: (2025)
Multimodal Fusion and Vision-Language Models: A Survey for Robot Vision
par: Han, Xiaofeng, et autres
Publié: (2025)
par: Han, Xiaofeng, et autres
Publié: (2025)
What Limits Vision-and-Language Navigation ?
par: Wang, Yunheng, et autres
Publié: (2026)
par: Wang, Yunheng, et autres
Publié: (2026)
Detectability of minority communities in networks
par: Li, Jiaze, et autres
Publié: (2026)
par: Li, Jiaze, et autres
Publié: (2026)
On the Out-Of-Distribution Generalization of Multimodal Large Language Models
par: Zhang, Xingxuan, et autres
Publié: (2024)
par: Zhang, Xingxuan, et autres
Publié: (2024)
Data is All You Need: Markov Chain Car-Following (MC-CF) Model
par: Chung, Sungyong, et autres
Publié: (2026)
par: Chung, Sungyong, et autres
Publié: (2026)
Vision Language Models See What You Want but not What You See
par: Gao, Qingying, et autres
Publié: (2024)
par: Gao, Qingying, et autres
Publié: (2024)
Multilevel Semantic-Aware Model for AI-Generated Video Quality Assessment
par: Li, Jiaze, et autres
Publié: (2025)
par: Li, Jiaze, et autres
Publié: (2025)
SAM2-LOVE: Segment Anything Model 2 in Language-aided Audio-Visual Scenes
par: Wang, Yuji, et autres
Publié: (2025)
par: Wang, Yuji, et autres
Publié: (2025)
Distributed Retrieval-Augmented Generation
par: Xu, Chenhao, et autres
Publié: (2025)
par: Xu, Chenhao, et autres
Publié: (2025)
"I See What You Did There": Can Large Vision-Language Models Understand Multimodal Puns?
par: Xu, Naen, et autres
Publié: (2026)
par: Xu, Naen, et autres
Publié: (2026)
'No' Matters: Out-of-Distribution Detection in Multimodality Long Dialogue
par: Gao, Rena, et autres
Publié: (2024)
par: Gao, Rena, et autres
Publié: (2024)
DPU: Dynamic Prototype Updating for Multimodal Out-of-Distribution Detection
par: Li, Shawn, et autres
Publié: (2024)
par: Li, Shawn, et autres
Publié: (2024)
Exchange Is All You Need for Remote Sensing Change Detection
par: Dong, Sijun, et autres
Publié: (2026)
par: Dong, Sijun, et autres
Publié: (2026)
Calibrate, Don't Curate: Label-Efficient Estimation from Noisy LLM Judges
par: Li, Yanran
Publié: (2026)
par: Li, Yanran
Publié: (2026)
Multimodal Classification and Out-of-distribution Detection for Multimodal Intent Understanding
par: Zhang, Hanlei, et autres
Publié: (2024)
par: Zhang, Hanlei, et autres
Publié: (2024)
Advances in Embodied Navigation Using Large Language Models: A Survey
par: Lin, Jinzhou, et autres
Publié: (2023)
par: Lin, Jinzhou, et autres
Publié: (2023)
Out-of-distribution detection in 3D applications: a review
par: Li, Zizhao, et autres
Publié: (2025)
par: Li, Zizhao, et autres
Publié: (2025)
Bayesian Flow Is All You Need to Sample Out-of-Distribution Chemical Spaces
par: Tao, Nianze, et autres
Publié: (2024)
par: Tao, Nianze, et autres
Publié: (2024)
From Open Vocabulary to Open World: Teaching Vision Language Models to Detect Novel Objects
par: Li, Zizhao, et autres
Publié: (2024)
par: Li, Zizhao, et autres
Publié: (2024)
How Does Fine-Tuning Impact Out-of-Distribution Detection for Vision-Language Models?
par: Ming, Yifei, et autres
Publié: (2023)
par: Ming, Yifei, et autres
Publié: (2023)
Distraction is All You Need for Multimodal Large Language Model Jailbreaking
par: Yang, Zuopeng, et autres
Publié: (2025)
par: Yang, Zuopeng, et autres
Publié: (2025)
Resultant: Incremental Effectiveness on Likelihood for Unsupervised Out-of-Distribution Detection
par: Li, Yewen, et autres
Publié: (2024)
par: Li, Yewen, et autres
Publié: (2024)
FAST: A Dual-tier Few-Shot Learning Paradigm for Whole Slide Image Classification
par: Fu, Kexue, et autres
Publié: (2024)
par: Fu, Kexue, et autres
Publié: (2024)
Video-OPD: Efficient Post-Training of Multimodal Large Language Models for Temporal Video Grounding via On-Policy Distillation
par: Li, Jiaze, et autres
Publié: (2026)
par: Li, Jiaze, et autres
Publié: (2026)
VisualAD: Language-Free Zero-Shot Anomaly Detection via Vision Transformer
par: Hou, Yanning, et autres
Publié: (2026)
par: Hou, Yanning, et autres
Publié: (2026)
ReAgent: Reversible Multi-Agent Reasoning for Knowledge-Enhanced Multi-Hop QA
par: Zhao, Xinjie, et autres
Publié: (2025)
par: Zhao, Xinjie, et autres
Publié: (2025)
More Agents Is All You Need
par: Li, Junyou, et autres
Publié: (2024)
par: Li, Junyou, et autres
Publié: (2024)
Attention Score is not All You Need for Token Importance Indicator in KV Cache Reduction: Value Also Matters
par: Guo, Zhiyu, et autres
Publié: (2024)
par: Guo, Zhiyu, et autres
Publié: (2024)
Other Vehicle Trajectories Are Also Needed: A Driving World Model Unifies Ego-Other Vehicle Trajectories in Video Latent Space
par: Zhu, Jian, et autres
Publié: (2025)
par: Zhu, Jian, et autres
Publié: (2025)
Blind-Wayfarer: A Minimalist, Probing-Driven Framework for Resilient Navigation in Perception-Degraded Environments
par: Xu, Yanran, et autres
Publié: (2025)
par: Xu, Yanran, et autres
Publié: (2025)
Documents similaires
-
Federated Balanced Learning
par: Li, Jiaze, et autres
Publié: (2026) -
Region Matters: Efficient and Reliable Region-Aware Visual Place Recognition
par: Chen, Shunpeng, et autres
Publié: (2026) -
Focus on Local: Finding Reliable Discriminative Regions for Visual Place Recognition
par: Wang, Changwei, et autres
Publié: (2025) -
Visual Para-Thinker: Divide-and-Conquer Reasoning for Visual Comprehension
par: Xu, Haoran, et autres
Publié: (2026) -
Neural Distribution Prior for LiDAR Out-of-Distribution Detection
par: Li, Zizhao, et autres
Publié: (2026)