Faithful GRPO: Improving Visual Spatial Reasoning in Multimodal Language Models via Constrained Policy Optimization
Fuente:
arXiv
Salvato in:
| Autori principali: | Kancheti, Sai Srinivas, Kanade, Aditya, Sinha, Rohit, Balasubramanian, Vineeth N, Ganu, Tanuja |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Chain-of-Thought Degrades Visual Spatial Reasoning Capabilities of Multimodal LLMs
di: Kancheti, Sai Srinivas, et al.
Pubblicazione: (2026)
di: Kancheti, Sai Srinivas, et al.
Pubblicazione: (2026)
Mind's Eye: A Benchmark of Visual Abstraction, Transformation and Composition for Multimodal LLMs
di: Sinha, Rohit, et al.
Pubblicazione: (2026)
di: Sinha, Rohit, et al.
Pubblicazione: (2026)
Do You See Me : A Multidimensional Benchmark for Evaluating Visual Perception in Multimodal LLMs
di: Kanade, Aditya, et al.
Pubblicazione: (2025)
di: Kanade, Aditya, et al.
Pubblicazione: (2025)
Efficient Vocabulary-Free Fine-Grained Visual Recognition in the Age of Multimodal LLMs
di: Kuchibhotla, Hari Chandana, et al.
Pubblicazione: (2025)
di: Kuchibhotla, Hari Chandana, et al.
Pubblicazione: (2025)
Can Better Text Semantics in Prompt Tuning Improve VLM Generalization?
di: Kuchibhotla, Hari Chandana, et al.
Pubblicazione: (2024)
di: Kuchibhotla, Hari Chandana, et al.
Pubblicazione: (2024)
Interpretable Model Drift Detection
di: Panda, Pranoy, et al.
Pubblicazione: (2025)
di: Panda, Pranoy, et al.
Pubblicazione: (2025)
MMCTAgent: Multi-modal Critical Thinking Agent Framework for Complex Visual Reasoning
di: Kumar, Somnath, et al.
Pubblicazione: (2024)
di: Kumar, Somnath, et al.
Pubblicazione: (2024)
RadPhi-3: Small Language Models for Radiology
di: Ranjit, Mercy, et al.
Pubblicazione: (2024)
di: Ranjit, Mercy, et al.
Pubblicazione: (2024)
$\oslash$ Source Models Leak What They Shouldn't $\nrightarrow$: Unlearning Zero-Shot Transfer in Domain Adaptation Through Adversarial Optimization
di: Devalapally, Arnav, et al.
Pubblicazione: (2026)
di: Devalapally, Arnav, et al.
Pubblicazione: (2026)
Source-Free Domain Adaptation by Optimizing Batch-Wise Cosine Similarity
di: Pathak, Harsharaj, et al.
Pubblicazione: (2026)
di: Pathak, Harsharaj, et al.
Pubblicazione: (2026)
UniGRPO: Unified Policy Optimization for Reasoning-Driven Visual Generation
di: Liu, Jie, et al.
Pubblicazione: (2026)
di: Liu, Jie, et al.
Pubblicazione: (2026)
Faithful-MR1: Faithful Multimodal Reasoning via Anchoring and Reinforcing Visual Attention
di: Tian, Changyuan, et al.
Pubblicazione: (2026)
di: Tian, Changyuan, et al.
Pubblicazione: (2026)
CodeV: Code with Images for Faithful Visual Reasoning via Tool-Aware Policy Optimization
di: Hou, Xinhai, et al.
Pubblicazione: (2025)
di: Hou, Xinhai, et al.
Pubblicazione: (2025)
LogicCBMs: Logic-Enhanced Concept-Based Learning
di: Vemuri, Deepika SN, et al.
Pubblicazione: (2025)
di: Vemuri, Deepika SN, et al.
Pubblicazione: (2025)
Multimodal Needle in a Haystack: Benchmarking Long-Context Capability of Multimodal Large Language Models
di: Wang, Hengyi, et al.
Pubblicazione: (2024)
di: Wang, Hengyi, et al.
Pubblicazione: (2024)
Can Reasons Help Improve Pedestrian Intent Estimation? A Cross-Modal Approach
di: Khindkar, Vaishnavi, et al.
Pubblicazione: (2024)
di: Khindkar, Vaishnavi, et al.
Pubblicazione: (2024)
SafeGRPO: Self-Rewarded Multimodal Safety Alignment via Rule-Governed Policy Optimization
di: Rong, Xuankun, et al.
Pubblicazione: (2025)
di: Rong, Xuankun, et al.
Pubblicazione: (2025)
PaLMR: Towards Faithful Visual Reasoning via Multimodal Process Alignment
di: Li, Yantao, et al.
Pubblicazione: (2026)
di: Li, Yantao, et al.
Pubblicazione: (2026)
Understanding Task Transfer in Vision-Language Models
di: Sachdeva, Bhuvan, et al.
Pubblicazione: (2025)
di: Sachdeva, Bhuvan, et al.
Pubblicazione: (2025)
Where does an LLM begin computing an instruction?
di: Pola, Aditya, et al.
Pubblicazione: (2025)
di: Pola, Aditya, et al.
Pubblicazione: (2025)
LVRPO: Language-Visual Alignment with GRPO for Multimodal Understanding and Generation
di: Mo, Shentong, et al.
Pubblicazione: (2026)
di: Mo, Shentong, et al.
Pubblicazione: (2026)
Exposing Weak Links in Multi-Agent Systems under Adversarial Prompting
di: Arora, Nirmit, et al.
Pubblicazione: (2025)
di: Arora, Nirmit, et al.
Pubblicazione: (2025)
Designing Culturally Aligned AI Systems For Social Good in Non-Western Contexts
di: Dennison, Deepak Varuvel, et al.
Pubblicazione: (2025)
di: Dennison, Deepak Varuvel, et al.
Pubblicazione: (2025)
DanceGRPO: Unleashing GRPO on Visual Generation
di: Xue, Zeyue, et al.
Pubblicazione: (2025)
di: Xue, Zeyue, et al.
Pubblicazione: (2025)
C2FDrone: Coarse-to-Fine Drone-to-Drone Detection using Vision Transformer Networks
di: Rebbapragada, Sairam VC, et al.
Pubblicazione: (2024)
di: Rebbapragada, Sairam VC, et al.
Pubblicazione: (2024)
Advancing Ante-Hoc Explainable Models through Generative Adversarial Networks
di: Garg, Tanmay, et al.
Pubblicazione: (2024)
di: Garg, Tanmay, et al.
Pubblicazione: (2024)
NoisyGRPO: Incentivizing Multimodal CoT Reasoning via Noise Injection and Bayesian Estimation
di: Qiu, Longtian, et al.
Pubblicazione: (2025)
di: Qiu, Longtian, et al.
Pubblicazione: (2025)
Improving Visual Representation Alignment Generation with GRPO
di: Mo, Shentong, et al.
Pubblicazione: (2026)
di: Mo, Shentong, et al.
Pubblicazione: (2026)
GRPO-TTA: Test-Time Visual Tuning for Vision-Language Models via GRPO-Driven Reinforcement Learning
di: Li, Yujun, et al.
Pubblicazione: (2026)
di: Li, Yujun, et al.
Pubblicazione: (2026)
Flash-GRPO: Efficient Alignment for Video Diffusion via One-Step Policy Optimization
di: He, Xiaoxuan, et al.
Pubblicazione: (2026)
di: He, Xiaoxuan, et al.
Pubblicazione: (2026)
SPD-Faith Bench: Diagnosing and Improving Faithfulness in Chain-of-Thought for Multimodal Large Language Models
di: Lv, Weijiang, et al.
Pubblicazione: (2026)
di: Lv, Weijiang, et al.
Pubblicazione: (2026)
Attention-guided Fine-tuning of Multimodal Large Language Models Improves Chain-of-Thought Reasoning
di: Sinha, Sanchit, et al.
Pubblicazione: (2026)
di: Sinha, Sanchit, et al.
Pubblicazione: (2026)
Precise Event Spotting in Sports Videos: Solving Long-Range Dependency and Class Imbalance
di: Santra, Sanchayan, et al.
Pubblicazione: (2025)
di: Santra, Sanchayan, et al.
Pubblicazione: (2025)
R1-ShareVL: Incentivizing Reasoning Capability of Multimodal Large Language Models via Share-GRPO
di: Yao, Huanjin, et al.
Pubblicazione: (2025)
di: Yao, Huanjin, et al.
Pubblicazione: (2025)
OP-GRPO: Efficient Off-Policy GRPO for Flow-Matching Models
di: Zhang, Liyu, et al.
Pubblicazione: (2026)
di: Zhang, Liyu, et al.
Pubblicazione: (2026)
Evaluating LLMs' Mathematical Reasoning in Financial Document Question Answering
di: Srivastava, Pragya, et al.
Pubblicazione: (2024)
di: Srivastava, Pragya, et al.
Pubblicazione: (2024)
Evaluating Reasoning Faithfulness in Medical Vision-Language Models using Multimodal Perturbations
di: Moll, Johannes, et al.
Pubblicazione: (2025)
di: Moll, Johannes, et al.
Pubblicazione: (2025)
GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning
di: Chen, Yi, et al.
Pubblicazione: (2025)
di: Chen, Yi, et al.
Pubblicazione: (2025)
Unifying Scientific Communication: Fine-Grained Correspondence Across Scientific Media
di: M, Megha Mariam K., et al.
Pubblicazione: (2026)
di: M, Megha Mariam K., et al.
Pubblicazione: (2026)
Edit-GRPO: A Locality-Preserving Policy Optimization Framework for Image Editing
di: Xu, Shaodong, et al.
Pubblicazione: (2026)
di: Xu, Shaodong, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Chain-of-Thought Degrades Visual Spatial Reasoning Capabilities of Multimodal LLMs
di: Kancheti, Sai Srinivas, et al.
Pubblicazione: (2026) -
Mind's Eye: A Benchmark of Visual Abstraction, Transformation and Composition for Multimodal LLMs
di: Sinha, Rohit, et al.
Pubblicazione: (2026) -
Do You See Me : A Multidimensional Benchmark for Evaluating Visual Perception in Multimodal LLMs
di: Kanade, Aditya, et al.
Pubblicazione: (2025) -
Efficient Vocabulary-Free Fine-Grained Visual Recognition in the Age of Multimodal LLMs
di: Kuchibhotla, Hari Chandana, et al.
Pubblicazione: (2025) -
Can Better Text Semantics in Prompt Tuning Improve VLM Generalization?
di: Kuchibhotla, Hari Chandana, et al.
Pubblicazione: (2024)