Entropy-Guided Data-Efficient Training for Multimodal Reasoning Reward Models
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Yang, Shidong, Huang, Tongwen, Wen, Hao, Wang, Yong, Chen, Li, Chu, Xiangxiang |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
GPG: A Simple and Strong Reinforcement Learning Baseline for Model Reasoning
von: Chu, Xiangxiang, et al.
Veröffentlicht: (2025)
von: Chu, Xiangxiang, et al.
Veröffentlicht: (2025)
MMGenBench: Fully Automatically Evaluating LMMs from the Text-to-Image Generation Perspective
von: Huang, Hailang, et al.
Veröffentlicht: (2024)
von: Huang, Hailang, et al.
Veröffentlicht: (2024)
Unlocking Multimodal Mathematical Reasoning via Process Reward Model
von: Luo, Ruilin, et al.
Veröffentlicht: (2025)
von: Luo, Ruilin, et al.
Veröffentlicht: (2025)
DRPO: Efficient Reasoning via Decoupled Reward Policy Optimization
von: Li, Gang, et al.
Veröffentlicht: (2025)
von: Li, Gang, et al.
Veröffentlicht: (2025)
Native Reasoning Models: Training Language Models to Reason on Unverifiable Data
von: Wang, Yuanfu, et al.
Veröffentlicht: (2026)
von: Wang, Yuanfu, et al.
Veröffentlicht: (2026)
MathSE: Improving Multimodal Mathematical Reasoning via Self-Evolving Iterative Reflection and Reward-Guided Fine-Tuning
von: Chen, Jinhao, et al.
Veröffentlicht: (2025)
von: Chen, Jinhao, et al.
Veröffentlicht: (2025)
RationalRewards: Reasoning Rewards Scale Visual Generation Both Training and Test Time
von: Wang, Haozhe, et al.
Veröffentlicht: (2026)
von: Wang, Haozhe, et al.
Veröffentlicht: (2026)
D$^2$Evo: Dual Difficulty-Aware Self-Evolution for Data-Efficient Reinforcement Learning
von: Zhang, Ru, et al.
Veröffentlicht: (2026)
von: Zhang, Ru, et al.
Veröffentlicht: (2026)
Self-Improving Tabular Language Models via Iterative Reward-Guided Post-Training
von: Long, Yunbo, et al.
Veröffentlicht: (2026)
von: Long, Yunbo, et al.
Veröffentlicht: (2026)
Efficient Process Reward Model Training via Active Learning
von: Duan, Keyu, et al.
Veröffentlicht: (2025)
von: Duan, Keyu, et al.
Veröffentlicht: (2025)
DreamPRM: Domain-Reweighted Process Reward Model for Multimodal Reasoning
von: Cao, Qi, et al.
Veröffentlicht: (2025)
von: Cao, Qi, et al.
Veröffentlicht: (2025)
Adversarial Training for Process Reward Models
von: Juneja, Gurusha, et al.
Veröffentlicht: (2025)
von: Juneja, Gurusha, et al.
Veröffentlicht: (2025)
CoLD: Counterfactually-Guided Length Debiasing for Process Reward Models in Mathematical Reasoning
von: Zheng, Congmin, et al.
Veröffentlicht: (2025)
von: Zheng, Congmin, et al.
Veröffentlicht: (2025)
SkillClaw: Let Skills Evolve Collectively with Agentic Evolver
von: Ma, Ziyu, et al.
Veröffentlicht: (2026)
von: Ma, Ziyu, et al.
Veröffentlicht: (2026)
A Model Can Help Itself: Reward-Free Self-Training for LLM Reasoning
von: Li, Mengqi, et al.
Veröffentlicht: (2025)
von: Li, Mengqi, et al.
Veröffentlicht: (2025)
HS-STaR: Hierarchical Sampling for Self-Taught Reasoners via Difficulty Estimation and Budget Reallocation
von: Xiong, Feng, et al.
Veröffentlicht: (2025)
von: Xiong, Feng, et al.
Veröffentlicht: (2025)
GUI-GENESIS: Automated Synthesis of Efficient Environments with Verifiable Rewards for GUI Agent Post-Training
von: Cao, Yuan, et al.
Veröffentlicht: (2026)
von: Cao, Yuan, et al.
Veröffentlicht: (2026)
AceMath: Advancing Frontier Math Reasoning with Post-Training and Reward Modeling
von: Liu, Zihan, et al.
Veröffentlicht: (2024)
von: Liu, Zihan, et al.
Veröffentlicht: (2024)
Tree Search for LLM Agent Reinforcement Learning
von: Ji, Yuxiang, et al.
Veröffentlicht: (2025)
von: Ji, Yuxiang, et al.
Veröffentlicht: (2025)
Ranking-aware Reinforcement Learning for Ordinal Ranking
von: Hao, Aiming, et al.
Veröffentlicht: (2026)
von: Hao, Aiming, et al.
Veröffentlicht: (2026)
Train at Moving Edge: Online-Verified Prompt Selection for Efficient RL Training of Large Reasoning Model
von: Wu, Jiahao, et al.
Veröffentlicht: (2026)
von: Wu, Jiahao, et al.
Veröffentlicht: (2026)
LLM Reasoning with Process Rewards for Outcome-Guided Steps
von: Rezaei, Mohammad, et al.
Veröffentlicht: (2026)
von: Rezaei, Mohammad, et al.
Veröffentlicht: (2026)
IRIS: Implicit Reward-Guided Internal Sifting for Mitigating Multimodal Hallucination
von: Li, Yuanshuai, et al.
Veröffentlicht: (2026)
von: Li, Yuanshuai, et al.
Veröffentlicht: (2026)
Optimal Transport for LLM Reward Modeling from Noisy Preference
von: Pan, Licheng, et al.
Veröffentlicht: (2026)
von: Pan, Licheng, et al.
Veröffentlicht: (2026)
Athena: Enhancing Multimodal Reasoning with Data-efficient Process Reward Models
von: Wang, Shuai, et al.
Veröffentlicht: (2025)
von: Wang, Shuai, et al.
Veröffentlicht: (2025)
AdaCuRL: Adaptive Curriculum Reinforcement Learning with Invalid Sample Mitigation and Historical Revisiting
von: Li, Renda, et al.
Veröffentlicht: (2025)
von: Li, Renda, et al.
Veröffentlicht: (2025)
Preference Alignment for Diffusion Model via Explicit Denoised Distribution Estimation
von: Shi, Dingyuan, et al.
Veröffentlicht: (2024)
von: Shi, Dingyuan, et al.
Veröffentlicht: (2024)
From Entropy to Calibrated Uncertainty: Training Language Models to Reason About Uncertainty
von: Jenane, Azza, et al.
Veröffentlicht: (2026)
von: Jenane, Azza, et al.
Veröffentlicht: (2026)
TED: Training-Free Experience Distillation for Multimodal Reasoning
von: Yuan, Shuozhi, et al.
Veröffentlicht: (2026)
von: Yuan, Shuozhi, et al.
Veröffentlicht: (2026)
Beyond Scaling Law: A Data-Efficient Distillation Framework for Reasoning
von: Wu, Xiaojun, et al.
Veröffentlicht: (2025)
von: Wu, Xiaojun, et al.
Veröffentlicht: (2025)
PersRM-R1: Enhance Personalized Reward Modeling with Reinforcement Learning
von: Li, Mengdi, et al.
Veröffentlicht: (2025)
von: Li, Mengdi, et al.
Veröffentlicht: (2025)
Rounding-Guided Backdoor Injection in Deep Learning Model Quantization
von: Chen, Xiangxiang, et al.
Veröffentlicht: (2025)
von: Chen, Xiangxiang, et al.
Veröffentlicht: (2025)
Beyond Correctness: Harmonizing Process and Outcome Rewards through RL Training
von: Ye, Chenlu, et al.
Veröffentlicht: (2025)
von: Ye, Chenlu, et al.
Veröffentlicht: (2025)
Sampling for Quality: Training-Free Reward-Guided LLM Decoding via Sequential Monte Carlo
von: Markovic-Voronov, Jelena, et al.
Veröffentlicht: (2026)
von: Markovic-Voronov, Jelena, et al.
Veröffentlicht: (2026)
Small Generalizable Prompt Predictive Models Can Steer Efficient RL Post-Training of Large Reasoning Models
von: Qu, Yun, et al.
Veröffentlicht: (2026)
von: Qu, Yun, et al.
Veröffentlicht: (2026)
Beyond Reward Hacking: Causal Rewards for Large Language Model Alignment
von: Wang, Chaoqi, et al.
Veröffentlicht: (2025)
von: Wang, Chaoqi, et al.
Veröffentlicht: (2025)
ERPO: Token-Level Entropy-Regulated Policy Optimization for Large Reasoning Models
von: Yu, Song, et al.
Veröffentlicht: (2026)
von: Yu, Song, et al.
Veröffentlicht: (2026)
More Bang for the Buck: Process Reward Modeling with Entropy-Driven Uncertainty
von: Cao, Lang, et al.
Veröffentlicht: (2025)
von: Cao, Lang, et al.
Veröffentlicht: (2025)
Verifying Meta-Awareness via Predictive Rewards in Reasoning Models
von: Kim, Yoonjeon, et al.
Veröffentlicht: (2025)
von: Kim, Yoonjeon, et al.
Veröffentlicht: (2025)
How Fast Should a Model Commit to Supervision? Training Reasoning Models on the Tsallis Loss Continuum
von: Lin, Chu-Cheng, et al.
Veröffentlicht: (2026)
von: Lin, Chu-Cheng, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
GPG: A Simple and Strong Reinforcement Learning Baseline for Model Reasoning
von: Chu, Xiangxiang, et al.
Veröffentlicht: (2025) -
MMGenBench: Fully Automatically Evaluating LMMs from the Text-to-Image Generation Perspective
von: Huang, Hailang, et al.
Veröffentlicht: (2024) -
Unlocking Multimodal Mathematical Reasoning via Process Reward Model
von: Luo, Ruilin, et al.
Veröffentlicht: (2025) -
DRPO: Efficient Reasoning via Decoupled Reward Policy Optimization
von: Li, Gang, et al.
Veröffentlicht: (2025) -
Native Reasoning Models: Training Language Models to Reason on Unverifiable Data
von: Wang, Yuanfu, et al.
Veröffentlicht: (2026)