Faithful GRPO: Improving Visual Spatial Reasoning in Multimodal Language Models via Constrained Policy Optimization

Fuente: arXiv
Salvato in:
Dettagli Bibliografici
Autori principali: Kancheti, Sai Srinivas, Kanade, Aditya, Sinha, Rohit, Balasubramanian, Vineeth N, Ganu, Tanuja
Natura: Preprint
Pubblicazione: 2026
Soggetti:
Accesso online:
Tags: Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!

Documenti analoghi