To Trust Or Not To Trust Your Vision-Language Model's Prediction
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Dong, Hao, Liu, Moru, Liang, Jian, Chatzi, Eleni, Fink, Olga |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Adapting Vision-Language Models Without Labels: A Comprehensive Survey
par: Dong, Hao, et autres
Publié: (2025)
par: Dong, Hao, et autres
Publié: (2025)
Towards Robust Multimodal Open-set Test-time Adaptation via Adaptive Entropy-aware Optimization
par: Dong, Hao, et autres
Publié: (2025)
par: Dong, Hao, et autres
Publié: (2025)
Multimodal Learning for Arcing Detection in Pantograph-Catenary Systems
par: Dong, Hao, et autres
Publié: (2026)
par: Dong, Hao, et autres
Publié: (2026)
Towards Multimodal Open-Set Domain Generalization and Adaptation through Self-supervision
par: Dong, Hao, et autres
Publié: (2024)
par: Dong, Hao, et autres
Publié: (2024)
Advances in Multimodal Adaptation and Generalization: From Traditional Approaches to Foundation Models
par: Dong, Hao, et autres
Publié: (2025)
par: Dong, Hao, et autres
Publié: (2025)
MultiOOD: Scaling Out-of-Distribution Detection for Multiple Modalities
par: Dong, Hao, et autres
Publié: (2024)
par: Dong, Hao, et autres
Publié: (2024)
Adaptive Confidence Regularization for Multimodal Failure Detection
par: Liu, Moru, et autres
Publié: (2026)
par: Liu, Moru, et autres
Publié: (2026)
NNG-Mix: Improving Semi-supervised Anomaly Detection with Pseudo-anomaly Generation
par: Dong, Hao, et autres
Publié: (2023)
par: Dong, Hao, et autres
Publié: (2023)
Extremely Simple Multimodal Outlier Synthesis for Out-of-Distribution Detection and Segmentation
par: Liu, Moru, et autres
Publié: (2025)
par: Liu, Moru, et autres
Publié: (2025)
Are We Making Progress in Multimodal Domain Generalization? A Comprehensive Benchmark Study
par: Dong, Hao, et autres
Publié: (2026)
par: Dong, Hao, et autres
Publié: (2026)
Trust-Aware Joint Feature-Prediction Discrepancy for Robust Domain Adaptation
par: Ding, Xi, et autres
Publié: (2026)
par: Ding, Xi, et autres
Publié: (2026)
Counterfactual Gradients-based Quantification of Prediction Trust in Neural Networks
par: Prabhushankar, Mohit, et autres
Publié: (2024)
par: Prabhushankar, Mohit, et autres
Publié: (2024)
MultiTrust: A Comprehensive Benchmark Towards Trustworthy Multimodal Large Language Models
par: Zhang, Yichi, et autres
Publié: (2024)
par: Zhang, Yichi, et autres
Publié: (2024)
Trust-Region Noise Search for Black-Box Alignment of Diffusion and Flow Models
par: Schweiger, Niklas, et autres
Publié: (2026)
par: Schweiger, Niklas, et autres
Publié: (2026)
Connecting the Dots: Collaborative Fine-tuning for Black-Box Vision-Language Models
par: Wang, Zhengbo, et autres
Publié: (2024)
par: Wang, Zhengbo, et autres
Publié: (2024)
Towards a Novel Measure of User Trust in XAI Systems
par: Miró-Nicolau, Miquel, et autres
Publié: (2024)
par: Miró-Nicolau, Miquel, et autres
Publié: (2024)
Open Your Eyes: Vision Enhances Message Passing Neural Networks in Link Prediction
par: Wei, Yanbin, et autres
Publié: (2025)
par: Wei, Yanbin, et autres
Publié: (2025)
Lightweight Unsupervised Federated Learning with Pretrained Vision Language Model
par: Yan, Hao, et autres
Publié: (2024)
par: Yan, Hao, et autres
Publié: (2024)
Beyond Human Vision: The Role of Large Vision Language Models in Microscope Image Analysis
par: Verma, Prateek, et autres
Publié: (2024)
par: Verma, Prateek, et autres
Publié: (2024)
Efficient Medical Vision-Language Alignment Through Adapting Masked Vision Models
par: Lian, Chenyu, et autres
Publié: (2025)
par: Lian, Chenyu, et autres
Publié: (2025)
FastVLM: Efficient Vision Encoding for Vision Language Models
par: Vasu, Pavan Kumar Anasosalu, et autres
Publié: (2024)
par: Vasu, Pavan Kumar Anasosalu, et autres
Publié: (2024)
Evaluating the Evaluators: Trust in Adversarial Robustness Tests
par: Cinà, Antonio Emanuele, et autres
Publié: (2025)
par: Cinà, Antonio Emanuele, et autres
Publié: (2025)
Hierarchically Robust Zero-shot Vision-language Models
par: Dong, Junhao, et autres
Publié: (2026)
par: Dong, Junhao, et autres
Publié: (2026)
Unified Supervision For Vision-Language Modeling in 3D Computed Tomography
par: Lee, Hao-Chih, et autres
Publié: (2025)
par: Lee, Hao-Chih, et autres
Publié: (2025)
Programmatic Video Prediction Using Large Language Models
par: Tang, Hao, et autres
Publié: (2025)
par: Tang, Hao, et autres
Publié: (2025)
Inference-Time Alignment of Diffusion Models via Trust-Region Iterative Twisted Sequential Monte Carlo
par: Wang, Weixin, et autres
Publié: (2026)
par: Wang, Weixin, et autres
Publié: (2026)
TopoPerception: A Shortcut-Free Evaluation of Global Visual Perception in Large Vision-Language Models
par: Zhou, Wenhao, et autres
Publié: (2025)
par: Zhou, Wenhao, et autres
Publié: (2025)
The Hidden Life of Tokens: Reducing Hallucination of Large Vision-Language Models via Visual Information Steering
par: Li, Zhuowei, et autres
Publié: (2025)
par: Li, Zhuowei, et autres
Publié: (2025)
From Spatial to Actions: Grounding Vision-Language-Action Model in Spatial Foundation Priors
par: Zhang, Zhengshen, et autres
Publié: (2025)
par: Zhang, Zhengshen, et autres
Publié: (2025)
GEASS: Gated Evidence-Adaptive Selective Caption Trust for Vision-Language Models
par: Li, Zeshang, et autres
Publié: (2026)
par: Li, Zeshang, et autres
Publié: (2026)
Development of a Neural Network Model for Currency Detection to aid visually impaired people in Nigeria
par: Nwokoye, Sochukwuma, et autres
Publié: (2025)
par: Nwokoye, Sochukwuma, et autres
Publié: (2025)
Prismer: A Vision-Language Model with Multi-Task Experts
par: Liu, Shikun, et autres
Publié: (2023)
par: Liu, Shikun, et autres
Publié: (2023)
VLLFL: A Vision-Language Model Based Lightweight Federated Learning Framework for Smart Agriculture
par: Li, Long, et autres
Publié: (2025)
par: Li, Long, et autres
Publié: (2025)
Vision-Language Models Can Self-Improve Reasoning via Reflection
par: Cheng, Kanzhi, et autres
Publié: (2024)
par: Cheng, Kanzhi, et autres
Publié: (2024)
Scalable Vision-Language-Action Model Pretraining for Robotic Manipulation with Real-Life Human Activity Videos
par: Li, Qixiu, et autres
Publié: (2025)
par: Li, Qixiu, et autres
Publié: (2025)
FG-CLIP 2: A Bilingual Fine-grained Vision-Language Alignment Model
par: Xie, Chunyu, et autres
Publié: (2025)
par: Xie, Chunyu, et autres
Publié: (2025)
Adapting Vision-Language Models for Evaluating World Models
par: Hendriksen, Mariya, et autres
Publié: (2025)
par: Hendriksen, Mariya, et autres
Publié: (2025)
NavTrust: Benchmarking Trustworthiness for Embodied Navigation
par: Jiang, Huaide, et autres
Publié: (2026)
par: Jiang, Huaide, et autres
Publié: (2026)
Composition Vision-Language Understanding via Segment and Depth Anything Model
par: Huo, Mingxiao, et autres
Publié: (2024)
par: Huo, Mingxiao, et autres
Publié: (2024)
Self-Captioning Multimodal Interaction Tuning: Amplifying Exploitable Redundancies for Robust Vision Language Models
par: Ryan, Yuriel, et autres
Publié: (2026)
par: Ryan, Yuriel, et autres
Publié: (2026)
Documents similaires
-
Adapting Vision-Language Models Without Labels: A Comprehensive Survey
par: Dong, Hao, et autres
Publié: (2025) -
Towards Robust Multimodal Open-set Test-time Adaptation via Adaptive Entropy-aware Optimization
par: Dong, Hao, et autres
Publié: (2025) -
Multimodal Learning for Arcing Detection in Pantograph-Catenary Systems
par: Dong, Hao, et autres
Publié: (2026) -
Towards Multimodal Open-Set Domain Generalization and Adaptation through Self-supervision
par: Dong, Hao, et autres
Publié: (2024) -
Advances in Multimodal Adaptation and Generalization: From Traditional Approaches to Foundation Models
par: Dong, Hao, et autres
Publié: (2025)