Sherlock: Self-Correcting Reasoning in Vision-Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Ding, Yi, Zhang, Ruqi |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Learning Self-Correction in Vision-Language Models via Rollout Augmentation
por: Ding, Yi, et al.
Publicado: (2026)
por: Ding, Yi, et al.
Publicado: (2026)
ETA: Evaluating Then Aligning Safety of Vision Language Models at Inference Time
por: Ding, Yi, et al.
Publicado: (2024)
por: Ding, Yi, et al.
Publicado: (2024)
VERA-V: Variational Inference Framework for Jailbreaking Vision-Language Models
por: Liao, Qilin, et al.
Publicado: (2025)
por: Liao, Qilin, et al.
Publicado: (2025)
Calibrated Self-Rewarding Vision Language Models
por: Zhou, Yiyang, et al.
Publicado: (2024)
por: Zhou, Yiyang, et al.
Publicado: (2024)
Vision-Language Models Can Self-Improve Reasoning via Reflection
por: Cheng, Kanzhi, et al.
Publicado: (2024)
por: Cheng, Kanzhi, et al.
Publicado: (2024)
TopViewRS: Vision-Language Models as Top-View Spatial Reasoners
por: Li, Chengzu, et al.
Publicado: (2024)
por: Li, Chengzu, et al.
Publicado: (2024)
Measuring and Improving Chain-of-Thought Reasoning in Vision-Language Models
por: Chen, Yangyi, et al.
Publicado: (2023)
por: Chen, Yangyi, et al.
Publicado: (2023)
Towards Grounded Visual Spatial Reasoning in Multi-Modal Vision Language Models
por: Rajabi, Navid, et al.
Publicado: (2023)
por: Rajabi, Navid, et al.
Publicado: (2023)
Progressive Multi-granular Alignments for Grounded Reasoning in Large Vision-Language Models
por: Le, Quang-Hung, et al.
Publicado: (2024)
por: Le, Quang-Hung, et al.
Publicado: (2024)
Efficient Vision-Language Reasoning via Adaptive Token Pruning
por: Li, Xue, et al.
Publicado: (2025)
por: Li, Xue, et al.
Publicado: (2025)
Zebra-CoT: A Dataset for Interleaved Vision Language Reasoning
por: Li, Ang, et al.
Publicado: (2025)
por: Li, Ang, et al.
Publicado: (2025)
MASSV: Multimodal Adaptation and Self-Data Distillation for Speculative Decoding of Vision-Language Models
por: Ganesan, Mugilan, et al.
Publicado: (2025)
por: Ganesan, Mugilan, et al.
Publicado: (2025)
Matryoshka Query Transformer for Large Vision-Language Models
por: Hu, Wenbo, et al.
Publicado: (2024)
por: Hu, Wenbo, et al.
Publicado: (2024)
SpatialVLM: Endowing Vision-Language Models with Spatial Reasoning Capabilities
por: Chen, Boyuan, et al.
Publicado: (2024)
por: Chen, Boyuan, et al.
Publicado: (2024)
Understanding the Effects of Distractors on Reasoning Vision-Language Models
por: Bae, Jiyun, et al.
Publicado: (2025)
por: Bae, Jiyun, et al.
Publicado: (2025)
MoPD: Mixture-of-Prompts Distillation for Vision-Language Models
por: Chen, Yang, et al.
Publicado: (2024)
por: Chen, Yang, et al.
Publicado: (2024)
Towards Efficient Vision-Language Tuning: More Information Density, More Generalizability
por: Hao, Tianxiang, et al.
Publicado: (2023)
por: Hao, Tianxiang, et al.
Publicado: (2023)
Investigating Video Reasoning Capability of Large Language Models with Tropes in Movies
por: Su, Hung-Ting, et al.
Publicado: (2024)
por: Su, Hung-Ting, et al.
Publicado: (2024)
The Neglected Tails in Vision-Language Models
por: Parashar, Shubham, et al.
Publicado: (2024)
por: Parashar, Shubham, et al.
Publicado: (2024)
Hierarchical Safety Realignment: Lightweight Restoration of Safety in Pruned Large Vision-Language Models
por: Li, Yue, et al.
Publicado: (2025)
por: Li, Yue, et al.
Publicado: (2025)
MMIE: Massive Multimodal Interleaved Comprehension Benchmark for Large Vision-Language Models
por: Xia, Peng, et al.
Publicado: (2024)
por: Xia, Peng, et al.
Publicado: (2024)
When are Lemons Purple? The Concept Association Bias of Vision-Language Models
por: Yamada, Yutaro, et al.
Publicado: (2022)
por: Yamada, Yutaro, et al.
Publicado: (2022)
Towards Statistical Factuality Guarantee for Large Vision-Language Models
por: Li, Zhuohang, et al.
Publicado: (2025)
por: Li, Zhuohang, et al.
Publicado: (2025)
Analyzing and Mitigating Object Hallucination in Large Vision-Language Models
por: Zhou, Yiyang, et al.
Publicado: (2023)
por: Zhou, Yiyang, et al.
Publicado: (2023)
TLDR: Token-Level Detective Reward Model for Large Vision Language Models
por: Fu, Deqing, et al.
Publicado: (2024)
por: Fu, Deqing, et al.
Publicado: (2024)
A Vision Check-up for Language Models
por: Sharma, Pratyusha, et al.
Publicado: (2024)
por: Sharma, Pratyusha, et al.
Publicado: (2024)
Lever LM: Configuring In-Context Sequence to Lever Large Vision Language Models
por: Yang, Xu, et al.
Publicado: (2023)
por: Yang, Xu, et al.
Publicado: (2023)
Rethinking Misalignment in Vision-Language Model Adaptation from a Causal Perspective
por: Zhang, Yanan, et al.
Publicado: (2024)
por: Zhang, Yanan, et al.
Publicado: (2024)
C2-Evo: Co-Evolving Multimodal Data and Model for Self-Improving Reasoning
por: Chen, Xiuwei, et al.
Publicado: (2025)
por: Chen, Xiuwei, et al.
Publicado: (2025)
Memory-Space Visual Prompting for Efficient Vision-Language Fine-Tuning
por: Jie, Shibo, et al.
Publicado: (2024)
por: Jie, Shibo, et al.
Publicado: (2024)
Zero-Shot Visual Reasoning by Vision-Language Models: Benchmarking and Analysis
por: Nagar, Aishik, et al.
Publicado: (2024)
por: Nagar, Aishik, et al.
Publicado: (2024)
Rephrase, Augment, Reason: Visual Grounding of Questions for Vision-Language Models
por: Prasad, Archiki, et al.
Publicado: (2023)
por: Prasad, Archiki, et al.
Publicado: (2023)
Reasoning Dynamics and the Limits of Monitoring Modality Reliance in Vision-Language Models
por: Villegas, Danae Sánchez, et al.
Publicado: (2026)
por: Villegas, Danae Sánchez, et al.
Publicado: (2026)
Kiki or Bouba? Sound Symbolism in Vision-and-Language Models
por: Alper, Morris, et al.
Publicado: (2023)
por: Alper, Morris, et al.
Publicado: (2023)
A Survey on Hallucination in Large Vision-Language Models
por: Liu, Hanchao, et al.
Publicado: (2024)
por: Liu, Hanchao, et al.
Publicado: (2024)
IPO: Interpretable Prompt Optimization for Vision-Language Models
por: Du, Yingjun, et al.
Publicado: (2024)
por: Du, Yingjun, et al.
Publicado: (2024)
Overconfidence is Key: Verbalized Uncertainty Evaluation in Large Language and Vision-Language Models
por: Groot, Tobias, et al.
Publicado: (2024)
por: Groot, Tobias, et al.
Publicado: (2024)
MMed-RAG: Versatile Multimodal RAG System for Medical Vision Language Models
por: Xia, Peng, et al.
Publicado: (2024)
por: Xia, Peng, et al.
Publicado: (2024)
What If the TV Was Off? Examining Counterfactual Reasoning Abilities of Multi-modal Language Models
por: Zhang, Letian, et al.
Publicado: (2023)
por: Zhang, Letian, et al.
Publicado: (2023)
SOLO: A Single Transformer for Scalable Vision-Language Modeling
por: Chen, Yangyi, et al.
Publicado: (2024)
por: Chen, Yangyi, et al.
Publicado: (2024)
Ejemplares similares
-
Learning Self-Correction in Vision-Language Models via Rollout Augmentation
por: Ding, Yi, et al.
Publicado: (2026) -
ETA: Evaluating Then Aligning Safety of Vision Language Models at Inference Time
por: Ding, Yi, et al.
Publicado: (2024) -
VERA-V: Variational Inference Framework for Jailbreaking Vision-Language Models
por: Liao, Qilin, et al.
Publicado: (2025) -
Calibrated Self-Rewarding Vision Language Models
por: Zhou, Yiyang, et al.
Publicado: (2024) -
Vision-Language Models Can Self-Improve Reasoning via Reflection
por: Cheng, Kanzhi, et al.
Publicado: (2024)