DASH: Detection and Assessment of Systematic Hallucinations of VLMs
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Augustin, Maximilian, Neuhaus, Yannic, Hein, Matthias |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
DiG-IN: Diffusion Guidance for Investigating Networks -- Uncovering Classifier Differences Neuron Visualisations and Visual Counterfactual Explanations
par: Augustin, Maximilian, et autres
Publié: (2023)
par: Augustin, Maximilian, et autres
Publié: (2023)
RePOPE: Impact of Annotation Errors on the POPE Benchmark
par: Neuhaus, Yannic, et autres
Publié: (2025)
par: Neuhaus, Yannic, et autres
Publié: (2025)
On the Out-of-Distribution Generalization of Reasoning in Multimodal LLMs for Simple Visual Planning Tasks
par: Neuhaus, Yannic, et autres
Publié: (2026)
par: Neuhaus, Yannic, et autres
Publié: (2026)
DASH: Dual-Branch Score Distillation for Guidance-Calibrated Compact Diffusion Models
par: Shafi, Abdullah Al, et autres
Publié: (2026)
par: Shafi, Abdullah Al, et autres
Publié: (2026)
Quo Vadis, Anomaly Detection? LLMs and VLMs in the Spotlight
par: Ding, Xi, et autres
Publié: (2024)
par: Ding, Xi, et autres
Publié: (2024)
ArtifactLens: Hundreds of Labels Are Enough for Artifact Detection with VLMs
par: Burgess, James, et autres
Publié: (2026)
par: Burgess, James, et autres
Publié: (2026)
Toxicity Assessment in Preclinical Histopathology via Class-Aware Mahalanobis Distance for Known and Novel Anomalies
par: Graf, Olga, et autres
Publié: (2026)
par: Graf, Olga, et autres
Publié: (2026)
Less Precise Can Be More Reliable: A Systematic Evaluation of Quantization's Impact on VLMs Beyond Accuracy
par: Bouguerra, Aymen, et autres
Publié: (2025)
par: Bouguerra, Aymen, et autres
Publié: (2025)
How to train your ViT for OOD Detection
par: Mueller, Maximilian, et autres
Publié: (2024)
par: Mueller, Maximilian, et autres
Publié: (2024)
Rethinking VLMs and LLMs for Image Classification
par: Cooper, Avi, et autres
Publié: (2024)
par: Cooper, Avi, et autres
Publié: (2024)
Mahalanobis++: Improving OOD Detection via Feature Normalization
par: Mueller, Maximilian, et autres
Publié: (2025)
par: Mueller, Maximilian, et autres
Publié: (2025)
Have the VLMs Lost Confidence? A Study of Sycophancy in VLMs
par: Li, Shuo, et autres
Publié: (2024)
par: Li, Shuo, et autres
Publié: (2024)
Frugal Federated Learning for Violence Detection: A Comparison of LoRA-Tuned VLMs and Personalized CNNs
par: Thuau, Sébastien, et autres
Publié: (2025)
par: Thuau, Sébastien, et autres
Publié: (2025)
CARES: Context-Aware Resolution Selector for VLMs
par: Kimhi, Moshe, et autres
Publié: (2025)
par: Kimhi, Moshe, et autres
Publié: (2025)
Retrieval-Augmented VLMs for Multimodal Melanoma Diagnosis
par: Moon, Jihyun, et autres
Publié: (2025)
par: Moon, Jihyun, et autres
Publié: (2025)
Sparse Autoencoders as Plug-and-Play Firewalls for Adversarial Attack Detection in VLMs
par: Wang, Hao, et autres
Publié: (2026)
par: Wang, Hao, et autres
Publié: (2026)
Robust CLIP: Unsupervised Adversarial Fine-Tuning of Vision Embeddings for Robust Large Vision-Language Models
par: Schlarmann, Christian, et autres
Publié: (2024)
par: Schlarmann, Christian, et autres
Publié: (2024)
Hidden in plain sight: VLMs overlook their visual representations
par: Fu, Stephanie, et autres
Publié: (2025)
par: Fu, Stephanie, et autres
Publié: (2025)
DEAL: Disentangle and Localize Concept-level Explanations for VLMs
par: Li, Tang, et autres
Publié: (2024)
par: Li, Tang, et autres
Publié: (2024)
Galaxy Walker: Geometry-aware VLMs For Galaxy-scale Understanding
par: Chen, Tianyu, et autres
Publié: (2025)
par: Chen, Tianyu, et autres
Publié: (2025)
IndicVisionBench: Benchmarking Cultural and Multilingual Understanding in VLMs
par: Faraz, Ali, et autres
Publié: (2025)
par: Faraz, Ali, et autres
Publié: (2025)
Do We Need Large VLMs for Spotting Soccer Actions?
par: Chakraborty, Ritabrata, et autres
Publié: (2025)
par: Chakraborty, Ritabrata, et autres
Publié: (2025)
Unified Spatio-Temporal Token Scoring for Efficient Video VLMs
par: Zhang, Jianrui, et autres
Publié: (2026)
par: Zhang, Jianrui, et autres
Publié: (2026)
Can VLMs Reason Robustly? A Neuro-Symbolic Investigation
par: Chen, Weixin, et autres
Publié: (2026)
par: Chen, Weixin, et autres
Publié: (2026)
Efficient Contrastive Decoding with Probabilistic Hallucination Detection - Mitigating Hallucinations in Large Vision Language Models -
par: Fieback, Laura, et autres
Publié: (2025)
par: Fieback, Laura, et autres
Publié: (2025)
Visual Structures Helps Visual Reasoning: Addressing the Binding Problem in VLMs
par: Izadi, Amirmohammad, et autres
Publié: (2025)
par: Izadi, Amirmohammad, et autres
Publié: (2025)
Inference Optimal VLMs Need Fewer Visual Tokens and More Parameters
par: Li, Kevin Y., et autres
Publié: (2024)
par: Li, Kevin Y., et autres
Publié: (2024)
COVR:Collaborative Optimization of VLMs and RL Agent for Visual-Based Control
par: Xia, Canming, et autres
Publié: (2026)
par: Xia, Canming, et autres
Publié: (2026)
Reinforcing VLMs to Use Tools for Detailed Visual Reasoning Under Resource Constraints
par: Kumar, Sunil, et autres
Publié: (2025)
par: Kumar, Sunil, et autres
Publié: (2025)
Right this way: Can VLMs Guide Us to See More to Answer Questions?
par: Liu, Li, et autres
Publié: (2024)
par: Liu, Li, et autres
Publié: (2024)
ConVis: Contrastive Decoding with Hallucination Visualization for Mitigating Hallucinations in Multimodal Large Language Models
par: Park, Yeji, et autres
Publié: (2024)
par: Park, Yeji, et autres
Publié: (2024)
Leveraging NTPs for Efficient Hallucination Detection in VLMs
par: Azachi, Ofir, et autres
Publié: (2025)
par: Azachi, Ofir, et autres
Publié: (2025)
Chain-of-Visual-Thought: Teaching VLMs to See and Think Better with Continuous Visual Tokens
par: Qin, Yiming, et autres
Publié: (2025)
par: Qin, Yiming, et autres
Publié: (2025)
VLM-SubtleBench: How Far Are VLMs from Human-Level Subtle Comparative Reasoning?
par: Kim, Minkyu, et autres
Publié: (2026)
par: Kim, Minkyu, et autres
Publié: (2026)
Shaking Up VLMs: Comparing Transformers and Structured State Space Models for Vision & Language Modeling
par: Pantazopoulos, Georgios, et autres
Publié: (2024)
par: Pantazopoulos, Georgios, et autres
Publié: (2024)
Robustness in Both Domains: CLIP Needs a Robust Text Encoder
par: Rocamora, Elias Abad, et autres
Publié: (2025)
par: Rocamora, Elias Abad, et autres
Publié: (2025)
Can World Models Benefit VLMs for World Dynamics?
par: Zhang, Kevin, et autres
Publié: (2025)
par: Zhang, Kevin, et autres
Publié: (2025)
Feature Hallucination for Self-supervised Action Recognition
par: Wang, Lei, et autres
Publié: (2025)
par: Wang, Lei, et autres
Publié: (2025)
A Deep U-Net Framework for Flood Hazard Mapping Using Hydraulic Simulations of the Wupper Catchment
par: Lammers, Christian, et autres
Publié: (2026)
par: Lammers, Christian, et autres
Publié: (2026)
Correlation of Object Detection Performance with Visual Saliency and Depth Estimation
par: Bartolo, Matthias, et autres
Publié: (2024)
par: Bartolo, Matthias, et autres
Publié: (2024)
Documents similaires
-
DiG-IN: Diffusion Guidance for Investigating Networks -- Uncovering Classifier Differences Neuron Visualisations and Visual Counterfactual Explanations
par: Augustin, Maximilian, et autres
Publié: (2023) -
RePOPE: Impact of Annotation Errors on the POPE Benchmark
par: Neuhaus, Yannic, et autres
Publié: (2025) -
On the Out-of-Distribution Generalization of Reasoning in Multimodal LLMs for Simple Visual Planning Tasks
par: Neuhaus, Yannic, et autres
Publié: (2026) -
DASH: Dual-Branch Score Distillation for Guidance-Calibrated Compact Diffusion Models
par: Shafi, Abdullah Al, et autres
Publié: (2026) -
Quo Vadis, Anomaly Detection? LLMs and VLMs in the Spotlight
par: Ding, Xi, et autres
Publié: (2024)