No Labels, No Problem: Training Visual Reasoners with Multimodal Verifiers
Fuente:
arXiv
Guardado en:
| Autores principales: | Marsili, Damiano, Gkioxari, Georgia |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Visual Agentic AI for Spatial Reasoning with a Dynamic API
por: Marsili, Damiano, et al.
Publicado: (2025)
por: Marsili, Damiano, et al.
Publicado: (2025)
Same or Not? Enhancing Visual Perception in Vision-Language Models
por: Marsili, Damiano, et al.
Publicado: (2025)
por: Marsili, Damiano, et al.
Publicado: (2025)
Feedforward 3D Editing via Text-Steerable Image-to-3D
por: Ma, Ziqi, et al.
Publicado: (2025)
por: Ma, Ziqi, et al.
Publicado: (2025)
Generative Universal Verifier as Multimodal Meta-Reasoner
por: Zhang, Xinchen, et al.
Publicado: (2025)
por: Zhang, Xinchen, et al.
Publicado: (2025)
Multimodal Fact-Level Attribution for Verifiable Reasoning
por: Wan, David, et al.
Publicado: (2026)
por: Wan, David, et al.
Publicado: (2026)
Unlocking Complex Visual Generation via Closed-Loop Verified Reasoning
por: Cheng, Hanbo, et al.
Publicado: (2026)
por: Cheng, Hanbo, et al.
Publicado: (2026)
CoRGI: Verified Chain-of-Thought Reasoning with Post-hoc Visual Grounding
por: Yi, Shixin, et al.
Publicado: (2025)
por: Yi, Shixin, et al.
Publicado: (2025)
Conversational Image Segmentation: Grounding Abstract Concepts with Scalable Supervision
por: Sahoo, Aadarsh, et al.
Publicado: (2026)
por: Sahoo, Aadarsh, et al.
Publicado: (2026)
The Role of Visual Modality in Multimodal Mathematical Reasoning: Challenges and Insights
por: Liu, Yufang, et al.
Publicado: (2025)
por: Liu, Yufang, et al.
Publicado: (2025)
GenEARL: A Training-Free Generative Framework for Multimodal Event Argument Role Labeling
por: Bansal, Hritik, et al.
Publicado: (2024)
por: Bansal, Hritik, et al.
Publicado: (2024)
Linear Mechanisms for Spatiotemporal Reasoning in Vision Language Models
por: Kang, Raphi, et al.
Publicado: (2026)
por: Kang, Raphi, et al.
Publicado: (2026)
Progressive Multimodal Search and Reasoning for Knowledge-Intensive Visual Question Answering
por: Choi, Changin, et al.
Publicado: (2025)
por: Choi, Changin, et al.
Publicado: (2025)
Machine Mental Imagery: Empower Multimodal Reasoning with Latent Visual Tokens
por: Yang, Zeyuan, et al.
Publicado: (2025)
por: Yang, Zeyuan, et al.
Publicado: (2025)
Self-Rewarded Multimodal Coherent Reasoning Across Diverse Visual Domains
por: Zhang, Jesen, et al.
Publicado: (2025)
por: Zhang, Jesen, et al.
Publicado: (2025)
Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models
por: Zhan, Yufei, et al.
Publicado: (2025)
por: Zhan, Yufei, et al.
Publicado: (2025)
Chain-of-Thought Degrades Visual Spatial Reasoning Capabilities of Multimodal LLMs
por: Kancheti, Sai Srinivas, et al.
Publicado: (2026)
por: Kancheti, Sai Srinivas, et al.
Publicado: (2026)
PerturboLLaVA: Reducing Multimodal Hallucinations with Perturbative Visual Training
por: Chen, Cong, et al.
Publicado: (2025)
por: Chen, Cong, et al.
Publicado: (2025)
Training-Free Mitigation of Language Reasoning Degradation After Multimodal Instruction Tuning
por: Ratzlaff, Neale, et al.
Publicado: (2024)
por: Ratzlaff, Neale, et al.
Publicado: (2024)
SATORI-R1: Incentivizing Multimodal Reasoning through Explicit Visual Anchoring
por: Shen, Chuming, et al.
Publicado: (2025)
por: Shen, Chuming, et al.
Publicado: (2025)
Revisiting Visual Understanding in Multimodal Reasoning through a Lens of Image Perturbation
por: Li, Yuting, et al.
Publicado: (2025)
por: Li, Yuting, et al.
Publicado: (2025)
Multi-Label Contrastive Learning for Abstract Visual Reasoning
por: Małkiński, Mikołaj, et al.
Publicado: (2020)
por: Małkiński, Mikołaj, et al.
Publicado: (2020)
DIVER: Dynamic Iterative Visual Evidence Reasoning for Multimodal Fake News Detection
por: Zhou, Weilin, et al.
Publicado: (2026)
por: Zhou, Weilin, et al.
Publicado: (2026)
PaLMR: Towards Faithful Visual Reasoning via Multimodal Process Alignment
por: Li, Yantao, et al.
Publicado: (2026)
por: Li, Yantao, et al.
Publicado: (2026)
Improved Visual-Spatial Reasoning via R1-Zero-Like Training
por: Liao, Zhenyi, et al.
Publicado: (2025)
por: Liao, Zhenyi, et al.
Publicado: (2025)
Seg-Agent: Test-Time Multimodal Reasoning for Training-Free Language-Guided Segmentation
por: Hao, Chao, et al.
Publicado: (2026)
por: Hao, Chao, et al.
Publicado: (2026)
MM-CoT:A Benchmark for Probing Visual Chain-of-Thought Reasoning in Multimodal Models
por: Zhang, Jusheng, et al.
Publicado: (2025)
por: Zhang, Jusheng, et al.
Publicado: (2025)
Language Models Can See Better: Visual Contrastive Decoding For LLM Multimodal Reasoning
por: Pang, Yuqi, et al.
Publicado: (2025)
por: Pang, Yuqi, et al.
Publicado: (2025)
Thinking Diffusion: Penalize and Guide Visual-Grounded Reasoning in Diffusion Multimodal Language Models
por: Kim, Keuntae, et al.
Publicado: (2026)
por: Kim, Keuntae, et al.
Publicado: (2026)
Thinking Before Looking: Improving Multimodal LLM Reasoning via Mitigating Visual Hallucination
por: Zheng, Haojie, et al.
Publicado: (2024)
por: Zheng, Haojie, et al.
Publicado: (2024)
EVE: Verifiable Self-Evolution of MLLMs via Executable Visual Transformations
por: Heng, Yongrui, et al.
Publicado: (2026)
por: Heng, Yongrui, et al.
Publicado: (2026)
SARE: Sample-wise Adaptive Reasoning for Training-free Fine-grained Visual Recognition
por: Yang, Jingxiao, et al.
Publicado: (2026)
por: Yang, Jingxiao, et al.
Publicado: (2026)
ClueTracer: Question-to-Vision Clue Tracing for Training-Free Hallucination Suppression in Multimodal Reasoning
por: Xi, Gongli, et al.
Publicado: (2026)
por: Xi, Gongli, et al.
Publicado: (2026)
CogFlow: Bridging Perception and Reasoning through Knowledge Internalization for Visual Mathematical Problem Solving
por: Chen, Shuhang, et al.
Publicado: (2026)
por: Chen, Shuhang, et al.
Publicado: (2026)
GoViG: Goal-Conditioned Visual Navigation Instruction Generation via Multimodal Reasoning
por: Wu, Fengyi, et al.
Publicado: (2025)
por: Wu, Fengyi, et al.
Publicado: (2025)
VTPerception-R1: Enhancing Multimodal Reasoning via Explicit Visual and Textual Perceptual Grounding
por: Ding, Yizhuo, et al.
Publicado: (2025)
por: Ding, Yizhuo, et al.
Publicado: (2025)
Graph-of-Mark: Promote Spatial Reasoning in Multimodal Language Models with Graph-Based Visual Prompting
por: Frisoni, Giacomo, et al.
Publicado: (2026)
por: Frisoni, Giacomo, et al.
Publicado: (2026)
ScalSelect: Scalable Training-Free Multimodal Data Selection for Efficient Visual Instruction Tuning
por: Wu, Changti, et al.
Publicado: (2026)
por: Wu, Changti, et al.
Publicado: (2026)
Bridging the Dynamic Perception Gap: Training-Free Draft Chain-of-Thought for Dynamic Multimodal Spatial Reasoning
por: Ou, Siqu, et al.
Publicado: (2025)
por: Ou, Siqu, et al.
Publicado: (2025)
Long Grounded Thoughts: Synthesizing Visual Problems and Reasoning Chains at Scale
por: Acuna, David, et al.
Publicado: (2025)
por: Acuna, David, et al.
Publicado: (2025)
Visual Structures Helps Visual Reasoning: Addressing the Binding Problem in VLMs
por: Izadi, Amirmohammad, et al.
Publicado: (2025)
por: Izadi, Amirmohammad, et al.
Publicado: (2025)
Ejemplares similares
-
Visual Agentic AI for Spatial Reasoning with a Dynamic API
por: Marsili, Damiano, et al.
Publicado: (2025) -
Same or Not? Enhancing Visual Perception in Vision-Language Models
por: Marsili, Damiano, et al.
Publicado: (2025) -
Feedforward 3D Editing via Text-Steerable Image-to-3D
por: Ma, Ziqi, et al.
Publicado: (2025) -
Generative Universal Verifier as Multimodal Meta-Reasoner
por: Zhang, Xinchen, et al.
Publicado: (2025) -
Multimodal Fact-Level Attribution for Verifiable Reasoning
por: Wan, David, et al.
Publicado: (2026)