Discovering Failure Modes in Vision-Language Models using RL
Fuente:
arXiv
Salvato in:
| Autori principali: | Jain, Kanishk, Yang, Qian, Nayak, Shravan, Kordjamshidi, Parisa, Anand, Nishanth, Agrawal, Aishwarya |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Benchmarking Vision Language Models for Cultural Understanding
di: Nayak, Shravan, et al.
Pubblicazione: (2024)
di: Nayak, Shravan, et al.
Pubblicazione: (2024)
Learning What Matters: Prioritized Concept Learning via Relative Error-driven Sample Selection
di: Chandhok, Shivam, et al.
Pubblicazione: (2025)
di: Chandhok, Shivam, et al.
Pubblicazione: (2025)
Referring Expressions as a Lens into Spatial Language Grounding in Vision-Language Models
di: Tumu, Akshar, et al.
Pubblicazione: (2025)
di: Tumu, Akshar, et al.
Pubblicazione: (2025)
NePTune: A Neuro-Pythonic Framework for Tunable Compositional Reasoning on Vision-Language
di: Kamali, Danial, et al.
Pubblicazione: (2025)
di: Kamali, Danial, et al.
Pubblicazione: (2025)
Exploring Spatial Language Grounding Through Referring Expressions
di: Tumu, Akshar, et al.
Pubblicazione: (2025)
di: Tumu, Akshar, et al.
Pubblicazione: (2025)
Vision-and-Language Navigation with Analogical Textual Descriptions in LLMs
di: Zhang, Yue, et al.
Pubblicazione: (2025)
di: Zhang, Yue, et al.
Pubblicazione: (2025)
Breaking Down and Building Up: Mixture of Skill-Based Vision-and-Language Navigation Agents
di: Ma, Tianyi, et al.
Pubblicazione: (2025)
di: Ma, Tianyi, et al.
Pubblicazione: (2025)
Find The Gap: Knowledge Base Reasoning For Visual Question Answering
di: Barezi, Elham J., et al.
Pubblicazione: (2024)
di: Barezi, Elham J., et al.
Pubblicazione: (2024)
CulturalFrames: Assessing Cultural Expectation Alignment in Text-to-Image Models and Evaluation Metrics
di: Nayak, Shravan, et al.
Pubblicazione: (2025)
di: Nayak, Shravan, et al.
Pubblicazione: (2025)
Assessing and Learning Alignment of Unimodal Vision and Language Models
di: Zhang, Le, et al.
Pubblicazione: (2024)
di: Zhang, Le, et al.
Pubblicazione: (2024)
Edge Reliability Gap in Vision-Language Models: Quantifying Failure Modes of Compressed VLMs Under Visual Corruption
di: Erol, Mehmet Kaan
Pubblicazione: (2026)
di: Erol, Mehmet Kaan
Pubblicazione: (2026)
Towards Adversarially Robust Vision-Language Models: Insights from Design Choices and Prompt Formatting Techniques
di: Bhagwatkar, Rishika, et al.
Pubblicazione: (2024)
di: Bhagwatkar, Rishika, et al.
Pubblicazione: (2024)
The Geometry of Representational Failures in Vision Language Models
di: Savietto, Daniele, et al.
Pubblicazione: (2026)
di: Savietto, Daniele, et al.
Pubblicazione: (2026)
Improving Automatic VQA Evaluation Using Large Language Models
di: Mañas, Oscar, et al.
Pubblicazione: (2023)
di: Mañas, Oscar, et al.
Pubblicazione: (2023)
Narrowing the Gap between Vision and Action in Navigation
di: Zhang, Yue, et al.
Pubblicazione: (2024)
di: Zhang, Yue, et al.
Pubblicazione: (2024)
PyVision-RL: Forging Open Agentic Vision Models via RL
di: Zhao, Shitian, et al.
Pubblicazione: (2026)
di: Zhao, Shitian, et al.
Pubblicazione: (2026)
UI-Vision: A Desktop-centric GUI Benchmark for Visual Perception and Interaction
di: Nayak, Shravan, et al.
Pubblicazione: (2025)
di: Nayak, Shravan, et al.
Pubblicazione: (2025)
RaVL: Discovering and Mitigating Spurious Correlations in Fine-Tuned Vision-Language Models
di: Varma, Maya, et al.
Pubblicazione: (2024)
di: Varma, Maya, et al.
Pubblicazione: (2024)
PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning
di: Zhang, Yizhen, et al.
Pubblicazione: (2025)
di: Zhang, Yizhen, et al.
Pubblicazione: (2025)
Foundation versus Domain-specific Models: Performance Comparison, Fusion, and Explainability in Face Recognition
di: Sony, Redwan, et al.
Pubblicazione: (2025)
di: Sony, Redwan, et al.
Pubblicazione: (2025)
An Examination of the Robustness of Reference-Free Image Captioning Evaluation Metrics
di: Ahmadi, Saba, et al.
Pubblicazione: (2023)
di: Ahmadi, Saba, et al.
Pubblicazione: (2023)
Zooming into Comics: Region-Aware RL Improves Fine-Grained Comic Understanding in Vision-Language Models
di: Chen, Yule, et al.
Pubblicazione: (2025)
di: Chen, Yule, et al.
Pubblicazione: (2025)
Discovering and using Spelke segments
di: Venkatesh, Rahul, et al.
Pubblicazione: (2025)
di: Venkatesh, Rahul, et al.
Pubblicazione: (2025)
VLN-Video: Utilizing Driving Videos for Outdoor Vision-and-Language Navigation
di: Li, Jialu, et al.
Pubblicazione: (2024)
di: Li, Jialu, et al.
Pubblicazione: (2024)
Why We Look Where We Look: Emergent Human-like Fixations of a Foveated Visual Language Model Maximizing Scene Understanding
di: Murlidaran, Shravan, et al.
Pubblicazione: (2026)
di: Murlidaran, Shravan, et al.
Pubblicazione: (2026)
Your Vision-Language Model Can't Even Count to 20: Exposing the Failures of VLMs in Compositional Counting
di: Guo, Xuyang, et al.
Pubblicazione: (2025)
di: Guo, Xuyang, et al.
Pubblicazione: (2025)
LatentLens: Revealing Highly Interpretable Visual Tokens in LLMs
di: Krojer, Benno, et al.
Pubblicazione: (2026)
di: Krojer, Benno, et al.
Pubblicazione: (2026)
Unveiling the "Fairness Seesaw": Discovering and Mitigating Gender and Race Bias in Vision-Language Models
di: Lan, Jian, et al.
Pubblicazione: (2025)
di: Lan, Jian, et al.
Pubblicazione: (2025)
CTRL-O: Language-Controllable Object-Centric Visual Representation Learning
di: Didolkar, Aniket, et al.
Pubblicazione: (2025)
di: Didolkar, Aniket, et al.
Pubblicazione: (2025)
DriveGenVLM: Real-world Video Generation for Vision Language Model based Autonomous Driving
di: Fu, Yongjie, et al.
Pubblicazione: (2024)
di: Fu, Yongjie, et al.
Pubblicazione: (2024)
Pre-Trained Vision-Language Models as Partial Annotators
di: Wang, Qian-Wei, et al.
Pubblicazione: (2024)
di: Wang, Qian-Wei, et al.
Pubblicazione: (2024)
Discovering Influential Neuron Path in Vision Transformers
di: Wang, Yifan, et al.
Pubblicazione: (2025)
di: Wang, Yifan, et al.
Pubblicazione: (2025)
VLM-RL: A Unified Vision Language Models and Reinforcement Learning Framework for Safe Autonomous Driving
di: Huang, Zilin, et al.
Pubblicazione: (2024)
di: Huang, Zilin, et al.
Pubblicazione: (2024)
FoR-SALE: Frame of Reference-guided Spatial Adjustment in LLM-based Diffusion Editing
di: Premsri, Tanawan, et al.
Pubblicazione: (2025)
di: Premsri, Tanawan, et al.
Pubblicazione: (2025)
GenSeg-R1: RL-Driven Vision-Language Grounding for Fine-Grained Referring Segmentation
di: Hegde, Sandesh, et al.
Pubblicazione: (2026)
di: Hegde, Sandesh, et al.
Pubblicazione: (2026)
OmniVL-Guard: Towards Unified Vision-Language Forgery Detection and Grounding via Balanced RL
di: Shen, Jinjie, et al.
Pubblicazione: (2026)
di: Shen, Jinjie, et al.
Pubblicazione: (2026)
Investigating Deep Learning Models for Ejection Fraction Estimation from Echocardiography Videos
di: Saranyan, Shravan, et al.
Pubblicazione: (2025)
di: Saranyan, Shravan, et al.
Pubblicazione: (2025)
CapRecover: A Cross-Modality Feature Inversion Attack Framework on Vision Language Models
di: Xiu, Kedong, et al.
Pubblicazione: (2025)
di: Xiu, Kedong, et al.
Pubblicazione: (2025)
From Pixels to Predicates: Learning Symbolic World Models via Pretrained Vision-Language Models
di: Athalye, Ashay, et al.
Pubblicazione: (2024)
di: Athalye, Ashay, et al.
Pubblicazione: (2024)
BalCapRL: A Balanced Framework for RL-Based MLLM Image Captioning
di: Ye, Shaokai, et al.
Pubblicazione: (2026)
di: Ye, Shaokai, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Benchmarking Vision Language Models for Cultural Understanding
di: Nayak, Shravan, et al.
Pubblicazione: (2024) -
Learning What Matters: Prioritized Concept Learning via Relative Error-driven Sample Selection
di: Chandhok, Shivam, et al.
Pubblicazione: (2025) -
Referring Expressions as a Lens into Spatial Language Grounding in Vision-Language Models
di: Tumu, Akshar, et al.
Pubblicazione: (2025) -
NePTune: A Neuro-Pythonic Framework for Tunable Compositional Reasoning on Vision-Language
di: Kamali, Danial, et al.
Pubblicazione: (2025) -
Exploring Spatial Language Grounding Through Referring Expressions
di: Tumu, Akshar, et al.
Pubblicazione: (2025)