Your Reward Function for RL is Your Best PRM for Search: Unifying RL and Search-Based TTS
Fuente:
arXiv
Salvato in:
| Autori principali: | Jin, Can, Zhou, Yang, Zhang, Qixin, Peng, Hongwu, Zhang, Di, Dong, Zihan, Pavone, Marco, Han, Ligong, Hong, Zhang-Wei, Che, Tong, Metaxas, Dimitris N. |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Two Heads are Better Than One: Test-time Scaling of Multi-agent Collaborative Reasoning
di: Jin, Can, et al.
Pubblicazione: (2025)
di: Jin, Can, et al.
Pubblicazione: (2025)
Learning from Teaching Regularization: Generalizable Correlations Should be Easy to Imitate
di: Jin, Can, et al.
Pubblicazione: (2024)
di: Jin, Can, et al.
Pubblicazione: (2024)
Reasoning over Precedents Alongside Statutes: Case-Augmented Deliberative Alignment for LLM Safety
di: Jin, Can, et al.
Pubblicazione: (2026)
di: Jin, Can, et al.
Pubblicazione: (2026)
Is PRM Necessary? Problem-Solving RL Implicitly Induces PRM Capability in LLMs
di: Feng, Zhangying, et al.
Pubblicazione: (2025)
di: Feng, Zhangying, et al.
Pubblicazione: (2025)
rePIRL: Learn PRM with Inverse RL for LLM Reasoning
di: Wu, Xian, et al.
Pubblicazione: (2026)
di: Wu, Xian, et al.
Pubblicazione: (2026)
Score-Guided Diffusion for 3D Human Recovery
di: Stathopoulos, Anastasis, et al.
Pubblicazione: (2024)
di: Stathopoulos, Anastasis, et al.
Pubblicazione: (2024)
DTop-p MoE: Sparsity-Controlled Dynamic Top-p MoE for Foundation Model Pre-training
di: Jin, Can, et al.
Pubblicazione: (2025)
di: Jin, Can, et al.
Pubblicazione: (2025)
DeepDive: Advancing Deep Search Agents with Knowledge Graphs and Multi-Turn RL
di: Lu, Rui, et al.
Pubblicazione: (2025)
di: Lu, Rui, et al.
Pubblicazione: (2025)
PRM-BAS: Enhancing Multimodal Reasoning through PRM-guided Beam Annealing Search
di: Hu, Pengfei, et al.
Pubblicazione: (2025)
di: Hu, Pengfei, et al.
Pubblicazione: (2025)
SINE: SINgle Image Editing with Text-to-Image Diffusion Models
di: Zhang, Zhixing, et al.
Pubblicazione: (2022)
di: Zhang, Zhixing, et al.
Pubblicazione: (2022)
LoR-VP: Low-Rank Visual Prompting for Efficient Vision Model Adaptation
di: Jin, Can, et al.
Pubblicazione: (2025)
di: Jin, Can, et al.
Pubblicazione: (2025)
Mind Your Entropy: From Maximum Entropy to Trajectory Entropy-Constrained RL
di: Zhan, Guojian, et al.
Pubblicazione: (2025)
di: Zhan, Guojian, et al.
Pubblicazione: (2025)
Shorten After You're Right: Lazy Length Penalties for Reasoning RL
di: Yuan, Danlong, et al.
Pubblicazione: (2025)
di: Yuan, Danlong, et al.
Pubblicazione: (2025)
APEER: Automatic Prompt Engineering Enhances Large Language Model Reranking
di: Jin, Can, et al.
Pubblicazione: (2024)
di: Jin, Can, et al.
Pubblicazione: (2024)
Composition-RL: Compose Your Verifiable Prompts for Reinforcement Learning of Large Language Models
di: Xu, Xin, et al.
Pubblicazione: (2026)
di: Xu, Xin, et al.
Pubblicazione: (2026)
Searching for Your Ancesters on Microfilm.
di: Smith, Judith Dinkel, Comp., et al.
Pubblicazione: (1990)
di: Smith, Judith Dinkel, Comp., et al.
Pubblicazione: (1990)
Beyond Correctness: Harmonizing Process and Outcome Rewards through RL Training
di: Ye, Chenlu, et al.
Pubblicazione: (2025)
di: Ye, Chenlu, et al.
Pubblicazione: (2025)
Balancing Signal and Variance: Adaptive Offline RL Post-Training for VLA Flow Models
di: Zhang, Hongyin, et al.
Pubblicazione: (2025)
di: Zhang, Hongyin, et al.
Pubblicazione: (2025)
FlowRL: Matching Reward Distributions for LLM Reasoning
di: Zhu, Xuekai, et al.
Pubblicazione: (2025)
di: Zhu, Xuekai, et al.
Pubblicazione: (2025)
FuRL: Visual-Language Models as Fuzzy Rewards for Reinforcement Learning
di: Fu, Yuwei, et al.
Pubblicazione: (2024)
di: Fu, Yuwei, et al.
Pubblicazione: (2024)
WisPaper: Your AI Scholar Search Engine
di: Ju, Li, et al.
Pubblicazione: (2025)
di: Ju, Li, et al.
Pubblicazione: (2025)
FunPRM: Function-as-Step Process Reward Model with Meta Reward Correction for Code Generation
di: Zhang, Ruiyi, et al.
Pubblicazione: (2026)
di: Zhang, Ruiyi, et al.
Pubblicazione: (2026)
TreeRL: LLM Reinforcement Learning with On-Policy Tree Search
di: Hou, Zhenyu, et al.
Pubblicazione: (2025)
di: Hou, Zhenyu, et al.
Pubblicazione: (2025)
On-Policy RL with Optimal Reward Baseline
di: Hao, Yaru, et al.
Pubblicazione: (2025)
di: Hao, Yaru, et al.
Pubblicazione: (2025)
Crossing the Reward Bridge: Expanding RL with Verifiable Rewards Across Diverse Domains
di: Su, Yi, et al.
Pubblicazione: (2025)
di: Su, Yi, et al.
Pubblicazione: (2025)
Searching for Lost Treasure in Your Library.
di: Brown, Sandra L.
Pubblicazione: (2001)
di: Brown, Sandra L.
Pubblicazione: (2001)
Hone Your Job Search Skills
Pubblicazione: (2024)
Pubblicazione: (2024)
Adaptive Layerwise Perturbation: Unifying Off-Policy Corrections for LLM RL
di: Ye, Chenlu, et al.
Pubblicazione: (2026)
di: Ye, Chenlu, et al.
Pubblicazione: (2026)
Latent Reward Steering: An Adaptive Inference-Time Framework that Implicitly Promotes Cognitive Behaviors in Reasoning LLMs
di: Li, Jiakang, et al.
Pubblicazione: (2026)
di: Li, Jiakang, et al.
Pubblicazione: (2026)
XPG-RL: Reinforcement Learning with Explainable Priority Guidance for Efficiency-Boosted Mechanical Search
di: Zhang, Yiting, et al.
Pubblicazione: (2025)
di: Zhang, Yiting, et al.
Pubblicazione: (2025)
BLoB: Bayesian Low-Rank Adaptation by Backpropagation for Large Language Models
di: Wang, Yibin, et al.
Pubblicazione: (2024)
di: Wang, Yibin, et al.
Pubblicazione: (2024)
Rethinking RL Evaluation: Can Benchmarks Truly Reveal Failures of RL Methods?
di: Chen, Zihan, et al.
Pubblicazione: (2025)
di: Chen, Zihan, et al.
Pubblicazione: (2025)
Weak Critics Make Strong Learners: On-Policy Critique Distillation for Scalable Oversight
di: Jin, Can, et al.
Pubblicazione: (2026)
di: Jin, Can, et al.
Pubblicazione: (2026)
Planning without Search: Refining Frontier LLMs with Offline Goal-Conditioned RL
di: Hong, Joey, et al.
Pubblicazione: (2025)
di: Hong, Joey, et al.
Pubblicazione: (2025)
Towards Improving Reward Design in RL: A Reward Alignment Metric for RL Practitioners
di: Muslimani, Calarina, et al.
Pubblicazione: (2025)
di: Muslimani, Calarina, et al.
Pubblicazione: (2025)
Clip Your Sequences Fairly: Enforcing Length Fairness for Sequence-Level RL
di: Mao, Hanyi, et al.
Pubblicazione: (2025)
di: Mao, Hanyi, et al.
Pubblicazione: (2025)
PrefGen: Multimodal Preference Learning for Preference-Conditioned Image Generation
di: Mo, Wenyi, et al.
Pubblicazione: (2025)
di: Mo, Wenyi, et al.
Pubblicazione: (2025)
Diagnosing and Mitigating System Bias in Self-Rewarding RL
di: Tan, Chuyi, et al.
Pubblicazione: (2025)
di: Tan, Chuyi, et al.
Pubblicazione: (2025)
ToolRL: Reward is All Tool Learning Needs
di: Qian, Cheng, et al.
Pubblicazione: (2025)
di: Qian, Cheng, et al.
Pubblicazione: (2025)
MARBLE: Multi-Aspect Reward Balance for Diffusion RL
di: Zhao, Canyu, et al.
Pubblicazione: (2026)
di: Zhao, Canyu, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Two Heads are Better Than One: Test-time Scaling of Multi-agent Collaborative Reasoning
di: Jin, Can, et al.
Pubblicazione: (2025) -
Learning from Teaching Regularization: Generalizable Correlations Should be Easy to Imitate
di: Jin, Can, et al.
Pubblicazione: (2024) -
Reasoning over Precedents Alongside Statutes: Case-Augmented Deliberative Alignment for LLM Safety
di: Jin, Can, et al.
Pubblicazione: (2026) -
Is PRM Necessary? Problem-Solving RL Implicitly Induces PRM Capability in LLMs
di: Feng, Zhangying, et al.
Pubblicazione: (2025) -
rePIRL: Learn PRM with Inverse RL for LLM Reasoning
di: Wu, Xian, et al.
Pubblicazione: (2026)