Sherlock: Self-Correcting Reasoning in Vision-Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Ding, Yi, Zhang, Ruqi |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Learning Self-Correction in Vision-Language Models via Rollout Augmentation
par: Ding, Yi, et autres
Publié: (2026)
par: Ding, Yi, et autres
Publié: (2026)
ETA: Evaluating Then Aligning Safety of Vision Language Models at Inference Time
par: Ding, Yi, et autres
Publié: (2024)
par: Ding, Yi, et autres
Publié: (2024)
VERA-V: Variational Inference Framework for Jailbreaking Vision-Language Models
par: Liao, Qilin, et autres
Publié: (2025)
par: Liao, Qilin, et autres
Publié: (2025)
Calibrated Self-Rewarding Vision Language Models
par: Zhou, Yiyang, et autres
Publié: (2024)
par: Zhou, Yiyang, et autres
Publié: (2024)
Vision-Language Models Can Self-Improve Reasoning via Reflection
par: Cheng, Kanzhi, et autres
Publié: (2024)
par: Cheng, Kanzhi, et autres
Publié: (2024)
TopViewRS: Vision-Language Models as Top-View Spatial Reasoners
par: Li, Chengzu, et autres
Publié: (2024)
par: Li, Chengzu, et autres
Publié: (2024)
Measuring and Improving Chain-of-Thought Reasoning in Vision-Language Models
par: Chen, Yangyi, et autres
Publié: (2023)
par: Chen, Yangyi, et autres
Publié: (2023)
Towards Grounded Visual Spatial Reasoning in Multi-Modal Vision Language Models
par: Rajabi, Navid, et autres
Publié: (2023)
par: Rajabi, Navid, et autres
Publié: (2023)
Progressive Multi-granular Alignments for Grounded Reasoning in Large Vision-Language Models
par: Le, Quang-Hung, et autres
Publié: (2024)
par: Le, Quang-Hung, et autres
Publié: (2024)
Efficient Vision-Language Reasoning via Adaptive Token Pruning
par: Li, Xue, et autres
Publié: (2025)
par: Li, Xue, et autres
Publié: (2025)
Zebra-CoT: A Dataset for Interleaved Vision Language Reasoning
par: Li, Ang, et autres
Publié: (2025)
par: Li, Ang, et autres
Publié: (2025)
MASSV: Multimodal Adaptation and Self-Data Distillation for Speculative Decoding of Vision-Language Models
par: Ganesan, Mugilan, et autres
Publié: (2025)
par: Ganesan, Mugilan, et autres
Publié: (2025)
Matryoshka Query Transformer for Large Vision-Language Models
par: Hu, Wenbo, et autres
Publié: (2024)
par: Hu, Wenbo, et autres
Publié: (2024)
SpatialVLM: Endowing Vision-Language Models with Spatial Reasoning Capabilities
par: Chen, Boyuan, et autres
Publié: (2024)
par: Chen, Boyuan, et autres
Publié: (2024)
Understanding the Effects of Distractors on Reasoning Vision-Language Models
par: Bae, Jiyun, et autres
Publié: (2025)
par: Bae, Jiyun, et autres
Publié: (2025)
MoPD: Mixture-of-Prompts Distillation for Vision-Language Models
par: Chen, Yang, et autres
Publié: (2024)
par: Chen, Yang, et autres
Publié: (2024)
Towards Efficient Vision-Language Tuning: More Information Density, More Generalizability
par: Hao, Tianxiang, et autres
Publié: (2023)
par: Hao, Tianxiang, et autres
Publié: (2023)
Investigating Video Reasoning Capability of Large Language Models with Tropes in Movies
par: Su, Hung-Ting, et autres
Publié: (2024)
par: Su, Hung-Ting, et autres
Publié: (2024)
The Neglected Tails in Vision-Language Models
par: Parashar, Shubham, et autres
Publié: (2024)
par: Parashar, Shubham, et autres
Publié: (2024)
Hierarchical Safety Realignment: Lightweight Restoration of Safety in Pruned Large Vision-Language Models
par: Li, Yue, et autres
Publié: (2025)
par: Li, Yue, et autres
Publié: (2025)
MMIE: Massive Multimodal Interleaved Comprehension Benchmark for Large Vision-Language Models
par: Xia, Peng, et autres
Publié: (2024)
par: Xia, Peng, et autres
Publié: (2024)
When are Lemons Purple? The Concept Association Bias of Vision-Language Models
par: Yamada, Yutaro, et autres
Publié: (2022)
par: Yamada, Yutaro, et autres
Publié: (2022)
Towards Statistical Factuality Guarantee for Large Vision-Language Models
par: Li, Zhuohang, et autres
Publié: (2025)
par: Li, Zhuohang, et autres
Publié: (2025)
Analyzing and Mitigating Object Hallucination in Large Vision-Language Models
par: Zhou, Yiyang, et autres
Publié: (2023)
par: Zhou, Yiyang, et autres
Publié: (2023)
TLDR: Token-Level Detective Reward Model for Large Vision Language Models
par: Fu, Deqing, et autres
Publié: (2024)
par: Fu, Deqing, et autres
Publié: (2024)
A Vision Check-up for Language Models
par: Sharma, Pratyusha, et autres
Publié: (2024)
par: Sharma, Pratyusha, et autres
Publié: (2024)
Lever LM: Configuring In-Context Sequence to Lever Large Vision Language Models
par: Yang, Xu, et autres
Publié: (2023)
par: Yang, Xu, et autres
Publié: (2023)
Rethinking Misalignment in Vision-Language Model Adaptation from a Causal Perspective
par: Zhang, Yanan, et autres
Publié: (2024)
par: Zhang, Yanan, et autres
Publié: (2024)
C2-Evo: Co-Evolving Multimodal Data and Model for Self-Improving Reasoning
par: Chen, Xiuwei, et autres
Publié: (2025)
par: Chen, Xiuwei, et autres
Publié: (2025)
Memory-Space Visual Prompting for Efficient Vision-Language Fine-Tuning
par: Jie, Shibo, et autres
Publié: (2024)
par: Jie, Shibo, et autres
Publié: (2024)
Zero-Shot Visual Reasoning by Vision-Language Models: Benchmarking and Analysis
par: Nagar, Aishik, et autres
Publié: (2024)
par: Nagar, Aishik, et autres
Publié: (2024)
Rephrase, Augment, Reason: Visual Grounding of Questions for Vision-Language Models
par: Prasad, Archiki, et autres
Publié: (2023)
par: Prasad, Archiki, et autres
Publié: (2023)
Reasoning Dynamics and the Limits of Monitoring Modality Reliance in Vision-Language Models
par: Villegas, Danae Sánchez, et autres
Publié: (2026)
par: Villegas, Danae Sánchez, et autres
Publié: (2026)
Kiki or Bouba? Sound Symbolism in Vision-and-Language Models
par: Alper, Morris, et autres
Publié: (2023)
par: Alper, Morris, et autres
Publié: (2023)
A Survey on Hallucination in Large Vision-Language Models
par: Liu, Hanchao, et autres
Publié: (2024)
par: Liu, Hanchao, et autres
Publié: (2024)
IPO: Interpretable Prompt Optimization for Vision-Language Models
par: Du, Yingjun, et autres
Publié: (2024)
par: Du, Yingjun, et autres
Publié: (2024)
Overconfidence is Key: Verbalized Uncertainty Evaluation in Large Language and Vision-Language Models
par: Groot, Tobias, et autres
Publié: (2024)
par: Groot, Tobias, et autres
Publié: (2024)
MMed-RAG: Versatile Multimodal RAG System for Medical Vision Language Models
par: Xia, Peng, et autres
Publié: (2024)
par: Xia, Peng, et autres
Publié: (2024)
What If the TV Was Off? Examining Counterfactual Reasoning Abilities of Multi-modal Language Models
par: Zhang, Letian, et autres
Publié: (2023)
par: Zhang, Letian, et autres
Publié: (2023)
SOLO: A Single Transformer for Scalable Vision-Language Modeling
par: Chen, Yangyi, et autres
Publié: (2024)
par: Chen, Yangyi, et autres
Publié: (2024)
Documents similaires
-
Learning Self-Correction in Vision-Language Models via Rollout Augmentation
par: Ding, Yi, et autres
Publié: (2026) -
ETA: Evaluating Then Aligning Safety of Vision Language Models at Inference Time
par: Ding, Yi, et autres
Publié: (2024) -
VERA-V: Variational Inference Framework for Jailbreaking Vision-Language Models
par: Liao, Qilin, et autres
Publié: (2025) -
Calibrated Self-Rewarding Vision Language Models
par: Zhou, Yiyang, et autres
Publié: (2024) -
Vision-Language Models Can Self-Improve Reasoning via Reflection
par: Cheng, Kanzhi, et autres
Publié: (2024)