Promoting Efficient Reasoning with Verifiable Stepwise Reward
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Yue, Chuhuai, Dong, Chengqi, Gao, Yinan, He, Hang, Chai, Jiajun, Yin, Guojun, Lin, Wei |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Training Multi-Image Vision Agents via End2End Reinforcement Learning
par: Dong, Chengqi, et autres
Publié: (2025)
par: Dong, Chengqi, et autres
Publié: (2025)
RLFactory: A Plug-and-Play Reinforcement Learning Post-Training Framework for LLM Multi-Turn Tool-Use
par: Chai, Jiajun, et autres
Publié: (2025)
par: Chai, Jiajun, et autres
Publié: (2025)
MTIR-SQL: Multi-turn Tool-Integrated Reasoning Reinforcement Learning for Text-to-SQL
par: Xu, Zekun, et autres
Publié: (2025)
par: Xu, Zekun, et autres
Publié: (2025)
LocalSearchBench: Benchmarking Agentic Search in Real-World Local Life Services
par: He, Hang, et autres
Publié: (2025)
par: He, Hang, et autres
Publié: (2025)
Contextual Rollout Bandits for Reinforcement Learning with Verifiable Rewards
par: Lu, Xiaodong, et autres
Publié: (2026)
par: Lu, Xiaodong, et autres
Publié: (2026)
SSL4RL: Revisiting Self-supervised Learning as Intrinsic Reward for Visual-Language Reasoning
par: Guo, Xiaojun, et autres
Publié: (2025)
par: Guo, Xiaojun, et autres
Publié: (2025)
Verifiable Process Rewards for Agentic Reasoning
par: Yuan, Huining, et autres
Publié: (2026)
par: Yuan, Huining, et autres
Publié: (2026)
CDRRM: Contrast-Driven Rubric Generation for Reliable and Interpretable Reward Modeling
par: Liu, Dengcan, et autres
Publié: (2026)
par: Liu, Dengcan, et autres
Publié: (2026)
ZipRL: Adaptive Multi-Turn Context Compression with Hindsight Response Replay
par: Hu, Zhexin, et autres
Publié: (2026)
par: Hu, Zhexin, et autres
Publié: (2026)
SAE as a Crystal Ball: Interpretable Features Predict Cross-domain Transferability of LLMs without Training
par: Zhang, Qi, et autres
Publié: (2026)
par: Zhang, Qi, et autres
Publié: (2026)
CompassVerifier: A Unified and Robust Verifier for LLMs Evaluation and Outcome Reward
par: Liu, Shudong, et autres
Publié: (2025)
par: Liu, Shudong, et autres
Publié: (2025)
AutoSearch: Adaptive Search Depth for Efficient Agentic RAG via Reinforcement Learning
par: Sun, Jingbo, et autres
Publié: (2026)
par: Sun, Jingbo, et autres
Publié: (2026)
RLAE: Reinforcement Learning-Assisted Ensemble for LLMs
par: Fu, Yuqian, et autres
Publié: (2025)
par: Fu, Yuqian, et autres
Publié: (2025)
Stepwise Penalization for Length-Efficient Chain-of-Thought Reasoning
par: Li, Xintong, et autres
Publié: (2026)
par: Li, Xintong, et autres
Publié: (2026)
AMR-SD: Asymmetric Meta-Reflective Self-Distillation for Token-Level Credit Assignment
par: Wei, Zhenlin, et autres
Publié: (2026)
par: Wei, Zhenlin, et autres
Publié: (2026)
An Efficient and Precise Training Data Construction Framework for Process-supervised Reward Model in Mathematical Reasoning
par: Sun, Wei, et autres
Publié: (2025)
par: Sun, Wei, et autres
Publié: (2025)
Random Policy Valuation is Enough for LLM Reasoning with Verifiable Rewards
par: He, Haoran, et autres
Publié: (2025)
par: He, Haoran, et autres
Publié: (2025)
Teaching AI Stepwise Diagnostic Reasoning with Report-Guided Chain-of-Thought Learning
par: Luo, Yihong, et autres
Publié: (2025)
par: Luo, Yihong, et autres
Publié: (2025)
SRFT: A Single-Stage Method with Supervised and Reinforcement Fine-Tuning for Reasoning
par: Fu, Yuqian, et autres
Publié: (2025)
par: Fu, Yuqian, et autres
Publié: (2025)
StructVRM: Aligning Multimodal Reasoning with Structured and Verifiable Reward Models
par: Zhang, Xiangxiang, et autres
Publié: (2025)
par: Zhang, Xiangxiang, et autres
Publié: (2025)
Trust, But Verify: A Self-Verification Approach to Reinforcement Learning with Verifiable Rewards
par: Liu, Xiaoyuan, et autres
Publié: (2025)
par: Liu, Xiaoyuan, et autres
Publié: (2025)
Decoupling Reasoning and Confidence: Resurrecting Calibration in Reinforcement Learning from Verifiable Rewards
par: Ma, Zhengzhao, et autres
Publié: (2026)
par: Ma, Zhengzhao, et autres
Publié: (2026)
InterSketch: An Interleaved Reasoning Model with Self-correcting Visual Sketch and Stepwise Reward
par: Ning, Zhiwei, et autres
Publié: (2026)
par: Ning, Zhiwei, et autres
Publié: (2026)
AgentV-RL: Scaling Reward Modeling with Agentic Verifier
par: Zhang, Jiazheng, et autres
Publié: (2026)
par: Zhang, Jiazheng, et autres
Publié: (2026)
Stepwise Perplexity-Guided Refinement for Efficient Chain-of-Thought Reasoning in Large Language Models
par: Cui, Yingqian, et autres
Publié: (2025)
par: Cui, Yingqian, et autres
Publié: (2025)
PEAR: Phase Entropy Aware Reward for Efficient Reasoning
par: Huang, Chen, et autres
Publié: (2025)
par: Huang, Chen, et autres
Publié: (2025)
Verifying Meta-Awareness via Predictive Rewards in Reasoning Models
par: Kim, Yoonjeon, et autres
Publié: (2025)
par: Kim, Yoonjeon, et autres
Publié: (2025)
ToolForge: A Data Synthesis Pipeline for Multi-Hop Search without Real-World APIs
par: Chen, Hao, et autres
Publié: (2025)
par: Chen, Hao, et autres
Publié: (2025)
Verifier-Free RL for LLMs via Intrinsic Gradient-Norm Reward
par: Wen, Xuexiang, et autres
Publié: (2026)
par: Wen, Xuexiang, et autres
Publié: (2026)
GeoX: Mastering Geospatial Reasoning Through Self-Play and Verifiable Rewards
par: Ahn, Kyeongjin, et autres
Publié: (2026)
par: Ahn, Kyeongjin, et autres
Publié: (2026)
VORTEX: Aligning Task Utility and Human Preferences through LLM-Guided Reward Shaping
par: Xiong, Guojun, et autres
Publié: (2025)
par: Xiong, Guojun, et autres
Publié: (2025)
Rubric-Guided Process Reward for Stepwise Model Routing
par: Ye, Shenghao, et autres
Publié: (2026)
par: Ye, Shenghao, et autres
Publié: (2026)
Efficient Paths and Dense Rewards: Probabilistic Flow Reasoning for Large Language Models
par: Liu, Yan, et autres
Publié: (2026)
par: Liu, Yan, et autres
Publié: (2026)
Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers
par: Cai, Xin-Qiang, et autres
Publié: (2025)
par: Cai, Xin-Qiang, et autres
Publié: (2025)
Beyond Outcome Verification: Verifiable Process Reward Models for Structured Reasoning
par: Pronesti, Massimiliano, et autres
Publié: (2026)
par: Pronesti, Massimiliano, et autres
Publié: (2026)
Fuse, Reason and Verify: Geometry Problem Solving with Parsed Clauses from Diagram
par: Zhang, Ming-Liang, et autres
Publié: (2024)
par: Zhang, Ming-Liang, et autres
Publié: (2024)
Stepwise Reasoning Error Disruption Attack of LLMs
par: Peng, Jingyu, et autres
Publié: (2024)
par: Peng, Jingyu, et autres
Publié: (2024)
Efficient Reasoning via Reward Model
par: Wang, Yuhao, et autres
Publié: (2025)
par: Wang, Yuhao, et autres
Publié: (2025)
REASONING GYM: Reasoning Environments for Reinforcement Learning with Verifiable Rewards
par: Stojanovski, Zafir, et autres
Publié: (2025)
par: Stojanovski, Zafir, et autres
Publié: (2025)
StepWiser: Stepwise Generative Judges for Wiser Reasoning
par: Xiong, Wei, et autres
Publié: (2025)
par: Xiong, Wei, et autres
Publié: (2025)
Documents similaires
-
Training Multi-Image Vision Agents via End2End Reinforcement Learning
par: Dong, Chengqi, et autres
Publié: (2025) -
RLFactory: A Plug-and-Play Reinforcement Learning Post-Training Framework for LLM Multi-Turn Tool-Use
par: Chai, Jiajun, et autres
Publié: (2025) -
MTIR-SQL: Multi-turn Tool-Integrated Reasoning Reinforcement Learning for Text-to-SQL
par: Xu, Zekun, et autres
Publié: (2025) -
LocalSearchBench: Benchmarking Agentic Search in Real-World Local Life Services
par: He, Hang, et autres
Publié: (2025) -
Contextual Rollout Bandits for Reinforcement Learning with Verifiable Rewards
par: Lu, Xiaodong, et autres
Publié: (2026)