Prioritizing the Best: Incentivizing Reliable Multimodal Reasoning by Rewarding Beyond Answer Correctness
Fuente:
arXiv
Guardado en:
| Autores principales: | Jia, Mengzhao, Zhang, Zhihan, Jiang, Meng |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
AutoRubric: Rubric-Based Generative Rewards for Faithful Multimodal Reasoning
por: Jia, Mengzhao, et al.
Publicado: (2025)
por: Jia, Mengzhao, et al.
Publicado: (2025)
Learn Beyond The Answer: Training Language Models with Reflection for Mathematical Reasoning
por: Zhang, Zhihan, et al.
Publicado: (2024)
por: Zhang, Zhihan, et al.
Publicado: (2024)
Describe-then-Reason: Improving Multimodal Mathematical Reasoning through Visual Comprehension Training
por: Jia, Mengzhao, et al.
Publicado: (2024)
por: Jia, Mengzhao, et al.
Publicado: (2024)
MMTutorBench: The First Multimodal Benchmark for AI Math Tutoring
por: Yang, Tengchao, et al.
Publicado: (2025)
por: Yang, Tengchao, et al.
Publicado: (2025)
MultiChartQA: Benchmarking Vision-Language Models on Multi-Chart Problems
por: Zhu, Zifeng, et al.
Publicado: (2024)
por: Zhu, Zifeng, et al.
Publicado: (2024)
Enhancing Mathematical Reasoning in LLMs by Stepwise Correction
por: Wu, Zhenyu, et al.
Publicado: (2024)
por: Wu, Zhenyu, et al.
Publicado: (2024)
Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs
por: Wen, Xumeng, et al.
Publicado: (2025)
por: Wen, Xumeng, et al.
Publicado: (2025)
PLUG: Leveraging Pivot Language in Cross-Lingual Instruction Tuning
por: Zhang, Zhihan, et al.
Publicado: (2023)
por: Zhang, Zhihan, et al.
Publicado: (2023)
Sandwich Reasoning: An Answer-Reasoning-Answer Approach for Low-Latency Query Correction
por: Zhang, Chen, et al.
Publicado: (2026)
por: Zhang, Chen, et al.
Publicado: (2026)
Beyond Correctness: Rewarding Faithful Reasoning in Retrieval-Augmented Generation
por: Xu, Zhichao, et al.
Publicado: (2025)
por: Xu, Zhichao, et al.
Publicado: (2025)
Leopard: A Vision Language Model For Text-Rich Multi-Image Tasks
por: Jia, Mengzhao, et al.
Publicado: (2024)
por: Jia, Mengzhao, et al.
Publicado: (2024)
Protecting Privacy in Multimodal Large Language Models with MLLMU-Bench
por: Liu, Zheyuan, et al.
Publicado: (2024)
por: Liu, Zheyuan, et al.
Publicado: (2024)
The Strongest Teacher Is Not Always the Best Teacher: Student-Centric Answer Selection
por: Hu, Zhengyu, et al.
Publicado: (2026)
por: Hu, Zhengyu, et al.
Publicado: (2026)
From Answers to Rationales: Self-Aligning Multimodal Reasoning with Answer-Oriented Chain-of-Thought
por: Tan, Wentao, et al.
Publicado: (2025)
por: Tan, Wentao, et al.
Publicado: (2025)
LogicReward: Incentivizing LLM Reasoning via Step-Wise Logical Supervision
por: Xu, Jundong, et al.
Publicado: (2025)
por: Xu, Jundong, et al.
Publicado: (2025)
DentalGPT: Incentivizing Multimodal Complex Reasoning in Dentistry
por: Cai, Zhenyang, et al.
Publicado: (2025)
por: Cai, Zhenyang, et al.
Publicado: (2025)
Large Language Models Can Self-Correct with Key Condition Verification
por: Wu, Zhenyu, et al.
Publicado: (2024)
por: Wu, Zhenyu, et al.
Publicado: (2024)
Best-of-L: Cross-Lingual Reward Modeling for Mathematical Reasoning
por: Rajaee, Sara, et al.
Publicado: (2025)
por: Rajaee, Sara, et al.
Publicado: (2025)
DuaShepherd: Integrating Stepwise Correctness and Potential Rewards for Mathematical Reasoning
por: Wu, Yuanhao, et al.
Publicado: (2025)
por: Wu, Yuanhao, et al.
Publicado: (2025)
TOWER: Tree Organized Weighting for Evaluating Complex Instructions
por: Ziems, Noah, et al.
Publicado: (2024)
por: Ziems, Noah, et al.
Publicado: (2024)
Knowing When Not to Answer: Evaluating Abstention in Multimodal Reasoning Systems
por: Madhusudhan, Nishanth, et al.
Publicado: (2026)
por: Madhusudhan, Nishanth, et al.
Publicado: (2026)
GM-PRM: A Generative Multimodal Process Reward Model for Multimodal Mathematical Reasoning
por: Zhang, Jianghangfan, et al.
Publicado: (2025)
por: Zhang, Jianghangfan, et al.
Publicado: (2025)
Reliable Reasoning Beyond Natural Language
por: Borazjanizadeh, Nasim, et al.
Publicado: (2024)
por: Borazjanizadeh, Nasim, et al.
Publicado: (2024)
Agentic Reward Modeling: Integrating Human Preferences with Verifiable Correctness Signals for Reliable Reward Systems
por: Peng, Hao, et al.
Publicado: (2025)
por: Peng, Hao, et al.
Publicado: (2025)
Beyond the Final Answer: Evaluating the Reasoning Trajectories of Tool-Augmented Agents
por: Kim, Wonjoong, et al.
Publicado: (2025)
por: Kim, Wonjoong, et al.
Publicado: (2025)
HiMed: Incentivizing Hindi Reasoning in Medical LLMs
por: Jiang, Dingfeng, et al.
Publicado: (2026)
por: Jiang, Dingfeng, et al.
Publicado: (2026)
Latent Self-Consistency for Reliable Majority-Set Selection in Short- and Long-Answer Reasoning
por: Oh, Jungsuk, et al.
Publicado: (2025)
por: Oh, Jungsuk, et al.
Publicado: (2025)
Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models
por: Huang, Wenxuan, et al.
Publicado: (2025)
por: Huang, Wenxuan, et al.
Publicado: (2025)
Correct Answers from Sound Reasoning: Verifiable Process Supervision for Language Models
por: Kim, Kyuyoung, et al.
Publicado: (2026)
por: Kim, Kyuyoung, et al.
Publicado: (2026)
Triviality Corrected Endogenous Reward
por: Wang, Xinda, et al.
Publicado: (2026)
por: Wang, Xinda, et al.
Publicado: (2026)
Correct Is Not Enough: Training Reasoning Planners with Executor-Grounded Rewards
por: Han, Tianyang, et al.
Publicado: (2026)
por: Han, Tianyang, et al.
Publicado: (2026)
A Survey of Efficient Reasoning for Large Reasoning Models: Language, Multimodality, and Beyond
por: Qu, Xiaoye, et al.
Publicado: (2025)
por: Qu, Xiaoye, et al.
Publicado: (2025)
Unlocking Multimodal Mathematical Reasoning via Process Reward Model
por: Luo, Ruilin, et al.
Publicado: (2025)
por: Luo, Ruilin, et al.
Publicado: (2025)
VisualPRM: An Effective Process Reward Model for Multimodal Reasoning
por: Wang, Weiyun, et al.
Publicado: (2025)
por: Wang, Weiyun, et al.
Publicado: (2025)
Refining Answer Distributions for Improved Large Language Model Reasoning
por: Pal, Soumyasundar, et al.
Publicado: (2024)
por: Pal, Soumyasundar, et al.
Publicado: (2024)
Explore-on-Graph: Incentivizing Autonomous Exploration of Large Language Models on Knowledge Graphs with Path-refined Reward Modeling
por: Yan, Shiqi, et al.
Publicado: (2026)
por: Yan, Shiqi, et al.
Publicado: (2026)
R1-T1: Fully Incentivizing Translation Capability in LLMs via Reasoning Learning
por: He, Minggui, et al.
Publicado: (2025)
por: He, Minggui, et al.
Publicado: (2025)
Beyond Majority Voting: Towards Fine-grained and More Reliable Reward Signal for Test-Time Reinforcement Learning
por: Wang, Weiqin, et al.
Publicado: (2025)
por: Wang, Weiqin, et al.
Publicado: (2025)
Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?
por: Yue, Yang, et al.
Publicado: (2025)
por: Yue, Yang, et al.
Publicado: (2025)
RepoGraph: Enhancing AI Software Engineering with Repository-level Code Graph
por: Ouyang, Siru, et al.
Publicado: (2024)
por: Ouyang, Siru, et al.
Publicado: (2024)
Ejemplares similares
-
AutoRubric: Rubric-Based Generative Rewards for Faithful Multimodal Reasoning
por: Jia, Mengzhao, et al.
Publicado: (2025) -
Learn Beyond The Answer: Training Language Models with Reflection for Mathematical Reasoning
por: Zhang, Zhihan, et al.
Publicado: (2024) -
Describe-then-Reason: Improving Multimodal Mathematical Reasoning through Visual Comprehension Training
por: Jia, Mengzhao, et al.
Publicado: (2024) -
MMTutorBench: The First Multimodal Benchmark for AI Math Tutoring
por: Yang, Tengchao, et al.
Publicado: (2025) -
MultiChartQA: Benchmarking Vision-Language Models on Multi-Chart Problems
por: Zhu, Zifeng, et al.
Publicado: (2024)