RewardMap: Tackling Sparse Rewards in Fine-grained Visual Reasoning via Multi-Stage Reinforcement Learning
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Feng, Sicheng, Tuo, Kaiwen, Wang, Song, Kong, Lingdong, Zhu, Jianke, Wang, Huan |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
ReasonMap: Towards Fine-Grained Visual Reasoning from Transit Maps
von: Feng, Sicheng, et al.
Veröffentlicht: (2025)
von: Feng, Sicheng, et al.
Veröffentlicht: (2025)
SparseSSM: Efficient Selective Structured State Space Models Can Be Pruned in One-Shot
von: Tuo, Kaiwen, et al.
Veröffentlicht: (2025)
von: Tuo, Kaiwen, et al.
Veröffentlicht: (2025)
MSRL: Scaling Generative Multimodal Reward Modeling via Multi-Stage Reinforcement Learning
von: Wang, Chenglong, et al.
Veröffentlicht: (2026)
von: Wang, Chenglong, et al.
Veröffentlicht: (2026)
Unveiling Chain of Step Reasoning for Vision-Language Models with Fine-grained Rewards
von: Chen, Honghao, et al.
Veröffentlicht: (2025)
von: Chen, Honghao, et al.
Veröffentlicht: (2025)
ARMS: Automatic Reward Shaping for Sparse-Reward Multi-Agent Reinforcement Learning
von: Abboud, Elie, et al.
Veröffentlicht: (2026)
von: Abboud, Elie, et al.
Veröffentlicht: (2026)
TaxonRL: Reinforcement Learning with Intermediate Rewards for Interpretable Fine-Grained Visual Reasoning
von: von Klinski, Maximilian, et al.
Veröffentlicht: (2026)
von: von Klinski, Maximilian, et al.
Veröffentlicht: (2026)
Hedging with Sparse Reward Reinforcement Learning
von: Ding, Yiheng, et al.
Veröffentlicht: (2025)
von: Ding, Yiheng, et al.
Veröffentlicht: (2025)
Reliable Reasoning in SVG-LLMs via Multi-Task Multi-Reward Reinforcement Learning
von: Wang, Haomin, et al.
Veröffentlicht: (2026)
von: Wang, Haomin, et al.
Veröffentlicht: (2026)
Revisiting Sparse Rewards for Goal-Reaching Reinforcement Learning
von: Vasan, Gautham, et al.
Veröffentlicht: (2024)
von: Vasan, Gautham, et al.
Veröffentlicht: (2024)
Beyond Majority Voting: Towards Fine-grained and More Reliable Reward Signal for Test-Time Reinforcement Learning
von: Wang, Weiqin, et al.
Veröffentlicht: (2025)
von: Wang, Weiqin, et al.
Veröffentlicht: (2025)
Multi-Objective and Mixed-Reward Reinforcement Learning via Reward-Decorrelated Policy Optimization
von: Bai, Yang, et al.
Veröffentlicht: (2026)
von: Bai, Yang, et al.
Veröffentlicht: (2026)
R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning
von: Zhao, Qingfei, et al.
Veröffentlicht: (2025)
von: Zhao, Qingfei, et al.
Veröffentlicht: (2025)
Preference-Guided Learning for Sparse-Reward Multi-Agent Reinforcement Learning
von: Bui, The Viet, et al.
Veröffentlicht: (2025)
von: Bui, The Viet, et al.
Veröffentlicht: (2025)
Diffusion Reinforcement Learning via Centered Reward Distillation
von: Zhu, Yuanzhi, et al.
Veröffentlicht: (2026)
von: Zhu, Yuanzhi, et al.
Veröffentlicht: (2026)
PixelThink: Towards Efficient Chain-of-Pixel Reasoning
von: Wang, Song, et al.
Veröffentlicht: (2025)
von: Wang, Song, et al.
Veröffentlicht: (2025)
Multi-Agent Collaborative Reward Design for Enhancing Reasoning in Reinforcement Learning
von: Yang, Pei, et al.
Veröffentlicht: (2025)
von: Yang, Pei, et al.
Veröffentlicht: (2025)
MedPRMBench: A Fine-grained Benchmark for Process Reward Models in Medical Reasoning
von: Wu, Lingyan, et al.
Veröffentlicht: (2026)
von: Wu, Lingyan, et al.
Veröffentlicht: (2026)
Training Language Models to Generate Text with Citations via Fine-grained Rewards
von: Huang, Chengyu, et al.
Veröffentlicht: (2024)
von: Huang, Chengyu, et al.
Veröffentlicht: (2024)
AD-FM: Multimodal LLMs for Anomaly Detection via Multi-Stage Reasoning and Fine-Grained Reward Optimization
von: Liao, Jingyi, et al.
Veröffentlicht: (2025)
von: Liao, Jingyi, et al.
Veröffentlicht: (2025)
Learning to Reason without External Rewards
von: Zhao, Xuandong, et al.
Veröffentlicht: (2025)
von: Zhao, Xuandong, et al.
Veröffentlicht: (2025)
MOSS-ChatV: Reinforcement Learning with Process Reasoning Reward for Video Temporal Reasoning
von: Tao, Sicheng, et al.
Veröffentlicht: (2025)
von: Tao, Sicheng, et al.
Veröffentlicht: (2025)
Focal Reward: Balanced Reinforcement Learning under Rubric-Based Rewards
von: Huang, Yu, et al.
Veröffentlicht: (2026)
von: Huang, Yu, et al.
Veröffentlicht: (2026)
Reinforcement Learning to Rank Using Coarse-grained Rewards
von: Tu, Yiteng, et al.
Veröffentlicht: (2022)
von: Tu, Yiteng, et al.
Veröffentlicht: (2022)
Deep Reinforcement Learning for Cloud Manufacturing Task Scheduling via Sparse‐Reward Optimization
von: Shanchen Pang, et al.
Veröffentlicht: (2026)
von: Shanchen Pang, et al.
Veröffentlicht: (2026)
Skeleton2Stage: Reward-Guided Fine-Tuning for Physically Plausible Dance Generation
von: Jia, Jidong, et al.
Veröffentlicht: (2026)
von: Jia, Jidong, et al.
Veröffentlicht: (2026)
TLCR: Token-Level Continuous Reward for Fine-grained Reinforcement Learning from Human Feedback
von: Yoon, Eunseop, et al.
Veröffentlicht: (2024)
von: Yoon, Eunseop, et al.
Veröffentlicht: (2024)
Addressing Exploration Challenges in Sparse Reward Reinforcement Learning Environments via Intrinsic Curiosity Modules and Reward Shaping
von: Elena Rossi
Veröffentlicht: (2026)
von: Elena Rossi
Veröffentlicht: (2026)
Self-Explore: Enhancing Mathematical Reasoning in Language Models with Fine-grained Rewards
von: Hwang, Hyeonbin, et al.
Veröffentlicht: (2024)
von: Hwang, Hyeonbin, et al.
Veröffentlicht: (2024)
UniSRM: A Unified Speech Reward Model for Reasoning-Based Fine-grained Assessment
von: Wang, Yuanyuan, et al.
Veröffentlicht: (2026)
von: Wang, Yuanyuan, et al.
Veröffentlicht: (2026)
Forging Spatial Intelligence: A Roadmap of Multi-Modal Data Pre-Training for Autonomous Systems
von: Wang, Song, et al.
Veröffentlicht: (2025)
von: Wang, Song, et al.
Veröffentlicht: (2025)
Subwords as Skills: Tokenization for Sparse-Reward Reinforcement Learning
von: Yunis, David, et al.
Veröffentlicht: (2023)
von: Yunis, David, et al.
Veröffentlicht: (2023)
DISCOVER: Automated Curricula for Sparse-Reward Reinforcement Learning
von: Diaz-Bone, Leander, et al.
Veröffentlicht: (2025)
von: Diaz-Bone, Leander, et al.
Veröffentlicht: (2025)
CCL: Collaborative Curriculum Learning for Sparse-Reward Multi-Agent Reinforcement Learning via Co-evolutionary Task Evolution
von: Lin, Yufei, et al.
Veröffentlicht: (2025)
von: Lin, Yufei, et al.
Veröffentlicht: (2025)
OpenReward: Learning to Reward Long-form Agentic Tasks via Reinforcement Learning
von: Hu, Ziyou, et al.
Veröffentlicht: (2025)
von: Hu, Ziyou, et al.
Veröffentlicht: (2025)
Metacognition as Reward: Reinforcing LLM Reasoning via Knowledge and Regulation Signals
von: Chen, Sirui, et al.
Veröffentlicht: (2026)
von: Chen, Sirui, et al.
Veröffentlicht: (2026)
A Coarse-to-Fine Approach to Multi-Modality 3D Occupancy Grounding
von: Shi, Zhan, et al.
Veröffentlicht: (2025)
von: Shi, Zhan, et al.
Veröffentlicht: (2025)
Tackling Heavy-Tailed Rewards in Reinforcement Learning with Function Approximation: Minimax Optimal and Instance-Dependent Regret Bounds
von: Huang, Jiayi, et al.
Veröffentlicht: (2023)
von: Huang, Jiayi, et al.
Veröffentlicht: (2023)
SARL: Label-Free Reinforcement Learning by Rewarding Reasoning Topology
von: Wang, Yifan, et al.
Veröffentlicht: (2026)
von: Wang, Yifan, et al.
Veröffentlicht: (2026)
DynaSearcher: Dynamic Knowledge Graph Augmented Search Agent via Multi-Reward Reinforcement Learning
von: Hao, Chuzhan, et al.
Veröffentlicht: (2025)
von: Hao, Chuzhan, et al.
Veröffentlicht: (2025)
Causal Reward Adjustment: Mitigating Reward Hacking in External Reasoning via Backdoor Correction
von: Song, Ruike, et al.
Veröffentlicht: (2025)
von: Song, Ruike, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
ReasonMap: Towards Fine-Grained Visual Reasoning from Transit Maps
von: Feng, Sicheng, et al.
Veröffentlicht: (2025) -
SparseSSM: Efficient Selective Structured State Space Models Can Be Pruned in One-Shot
von: Tuo, Kaiwen, et al.
Veröffentlicht: (2025) -
MSRL: Scaling Generative Multimodal Reward Modeling via Multi-Stage Reinforcement Learning
von: Wang, Chenglong, et al.
Veröffentlicht: (2026) -
Unveiling Chain of Step Reasoning for Vision-Language Models with Fine-grained Rewards
von: Chen, Honghao, et al.
Veröffentlicht: (2025) -
ARMS: Automatic Reward Shaping for Sparse-Reward Multi-Agent Reinforcement Learning
von: Abboud, Elie, et al.
Veröffentlicht: (2026)