Process Reinforcement through Implicit Rewards
Fuente:
arXiv
Salvato in:
| Autori principali: | Cui, Ganqu, Yuan, Lifan, Wang, Zefan, Wang, Hanbin, Zhang, Yuchen, Chen, Jiacheng, Li, Wendi, He, Bingxiang, Fan, Yuchen, Yu, Tianyu, Xu, Qixin, Chen, Weize, Yuan, Jiarui, Chen, Huayu, Zhang, Kaiyan, Lv, Xingtai, Wang, Shuo, Yao, Yuan, Han, Xu, Peng, Hao, Cheng, Yu, Liu, Zhiyuan, Sun, Maosong, Zhou, Bowen, Ding, Ning |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Free Process Rewards without Process Labels
di: Yuan, Lifan, et al.
Pubblicazione: (2024)
di: Yuan, Lifan, et al.
Pubblicazione: (2024)
From $f(x)$ and $g(x)$ to $f(g(x))$: LLMs Learn New Skills in RL by Composing Old Ones
di: Yuan, Lifan, et al.
Pubblicazione: (2025)
di: Yuan, Lifan, et al.
Pubblicazione: (2025)
Noise Contrastive Alignment of Language Models with Explicit Rewards
di: Chen, Huayu, et al.
Pubblicazione: (2024)
di: Chen, Huayu, et al.
Pubblicazione: (2024)
The Entropy Mechanism of Reinforcement Learning for Reasoning Language Models
di: Cui, Ganqu, et al.
Pubblicazione: (2025)
di: Cui, Ganqu, et al.
Pubblicazione: (2025)
RLPR: Extrapolating RLVR to General Domains without Verifiers
di: Yu, Tianyu, et al.
Pubblicazione: (2025)
di: Yu, Tianyu, et al.
Pubblicazione: (2025)
Optima: Optimizing Effectiveness and Efficiency for LLM-Based Multi-Agent System
di: Chen, Weize, et al.
Pubblicazione: (2024)
di: Chen, Weize, et al.
Pubblicazione: (2024)
CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning
di: Li, Ran, et al.
Pubblicazione: (2026)
di: Li, Ran, et al.
Pubblicazione: (2026)
The Overthinker's DIET: Cutting Token Calories with DIfficulty-AwarE Training
di: Chen, Weize, et al.
Pubblicazione: (2025)
di: Chen, Weize, et al.
Pubblicazione: (2025)
UltraFeedback: Boosting Language Models with Scaled AI Feedback
di: Cui, Ganqu, et al.
Pubblicazione: (2023)
di: Cui, Ganqu, et al.
Pubblicazione: (2023)
Beyond Natural Language: LLMs Leveraging Alternative Formats for Enhanced Reasoning and Communication
di: Chen, Weize, et al.
Pubblicazione: (2024)
di: Chen, Weize, et al.
Pubblicazione: (2024)
JustRL: Scaling a 1.5B LLM with a Simple RL Recipe
di: He, Bingxiang, et al.
Pubblicazione: (2025)
di: He, Bingxiang, et al.
Pubblicazione: (2025)
Scalable Efficient Training of Large Language Models with Low-dimensional Projected Attention
di: Lv, Xingtai, et al.
Pubblicazione: (2024)
di: Lv, Xingtai, et al.
Pubblicazione: (2024)
The Right Time Matters: Data Arrangement Affects Zero-Shot Generalization in Instruction Tuning
di: He, Bingxiang, et al.
Pubblicazione: (2024)
di: He, Bingxiang, et al.
Pubblicazione: (2024)
Integrated bioinformatics analysis reveals vital genes and immune infiltration for the co‐occurrence of Epstein–Barr virus‐related infectious mononucleosis and systemic lupus erythematosus
di: Yuchen Liu, et al.
Pubblicazione: (2024)
di: Yuchen Liu, et al.
Pubblicazione: (2024)
Advancing LLM Reasoning Generalists with Preference Trees
di: Yuan, Lifan, et al.
Pubblicazione: (2024)
di: Yuan, Lifan, et al.
Pubblicazione: (2024)
SE-Bench: Benchmarking Self-Evolution with Knowledge Internalization
di: Yuan, Jiarui, et al.
Pubblicazione: (2026)
di: Yuan, Jiarui, et al.
Pubblicazione: (2026)
Recent Advances in Life Cycle Assessment of Methane Pyrolysis for Sustainable Hydrogen Production
di: Yuchen Zhang, et al.
Pubblicazione: (2026)
di: Yuchen Zhang, et al.
Pubblicazione: (2026)
NFT: Bridging Supervised Learning and Reinforcement Learning in Math Reasoning
di: Chen, Huayu, et al.
Pubblicazione: (2025)
di: Chen, Huayu, et al.
Pubblicazione: (2025)
Mastering Text, Code and Math Simultaneously via Fusing Highly Specialized Language Models
di: Ding, Ning, et al.
Pubblicazione: (2024)
di: Ding, Ning, et al.
Pubblicazione: (2024)
How Far Can Unsupervised RLVR Scale LLM Training?
di: He, Bingxiang, et al.
Pubblicazione: (2026)
di: He, Bingxiang, et al.
Pubblicazione: (2026)
A Survey of Reinforcement Learning for Large Reasoning Models
di: Zhang, Kaiyan, et al.
Pubblicazione: (2025)
di: Zhang, Kaiyan, et al.
Pubblicazione: (2025)
AgentRM: Enhancing Agent Generalization with Reward Modeling
di: Xia, Yu, et al.
Pubblicazione: (2025)
di: Xia, Yu, et al.
Pubblicazione: (2025)
Investigation on deformation behavior and bearing capacity of a segmental ring based on the horizontal convergence
di: Qiang Yuan, et al.
Pubblicazione: (2024)
di: Qiang Yuan, et al.
Pubblicazione: (2024)
RLAIF-V: Open-Source AI Feedback Leads to Super GPT-4V Trustworthiness
di: Yu, Tianyu, et al.
Pubblicazione: (2024)
di: Yu, Tianyu, et al.
Pubblicazione: (2024)
INTERVENOR: Prompting the Coding Ability of Large Language Models with the Interactive Chain of Repair
di: Wang, Hanbin, et al.
Pubblicazione: (2023)
di: Wang, Hanbin, et al.
Pubblicazione: (2023)
TTRL: Test-Time Reinforcement Learning
di: Zuo, Yuxin, et al.
Pubblicazione: (2025)
di: Zuo, Yuxin, et al.
Pubblicazione: (2025)
Controllable Preference Optimization: Toward Controllable Multi-Objective Alignment
di: Guo, Yiju, et al.
Pubblicazione: (2024)
di: Guo, Yiju, et al.
Pubblicazione: (2024)
DuCodeMark: Dual-Purpose Code Dataset Watermarking via Style-Aware Watermark-Poison Design
di: Chen, Yuchen, et al.
Pubblicazione: (2026)
di: Chen, Yuchen, et al.
Pubblicazione: (2026)
AutoEval-Video: An Automatic Benchmark for Assessing Large Vision Language Models in Open-Ended Video Question Answering
di: Chen, Xiuyuan, et al.
Pubblicazione: (2023)
di: Chen, Xiuyuan, et al.
Pubblicazione: (2023)
Tarsier2: Advancing Large Vision-Language Models from Detailed Video Description to Comprehensive Video Understanding
di: Yuan, Liping, et al.
Pubblicazione: (2025)
di: Yuan, Liping, et al.
Pubblicazione: (2025)
Unlearning-Enhanced Website Fingerprinting Attack: Against Backdoor Poisoning in Anonymous Networks
di: Yuan, Yali, et al.
Pubblicazione: (2025)
di: Yuan, Yali, et al.
Pubblicazione: (2025)
States Hidden in Hidden States: LLMs Emerge Discrete State Representations Implicitly
di: Chen, Junhao, et al.
Pubblicazione: (2024)
di: Chen, Junhao, et al.
Pubblicazione: (2024)
Fuzzy Logic Guided Reward Function Variation: An Oracle for Testing Reinforcement Learning Programs
di: Zhang, Shiyu, et al.
Pubblicazione: (2024)
di: Zhang, Shiyu, et al.
Pubblicazione: (2024)
TrafficKAN-GCN: Graph Convolutional-based Kolmogorov-Arnold Network for Traffic Flow Optimization
di: Zhang, Jiayi, et al.
Pubblicazione: (2025)
di: Zhang, Jiayi, et al.
Pubblicazione: (2025)
RLHF-V: Towards Trustworthy MLLMs via Behavior Alignment from Fine-grained Correctional Human Feedback
di: Yu, Tianyu, et al.
Pubblicazione: (2023)
di: Yu, Tianyu, et al.
Pubblicazione: (2023)
ImplicitRM: Unbiased Reward Modeling from Implicit Preference Data for LLM alignment
di: Wang, Hao, et al.
Pubblicazione: (2026)
di: Wang, Hao, et al.
Pubblicazione: (2026)
Tarsier: Recipes for Training and Evaluating Large Video Description Models
di: Wang, Jiawei, et al.
Pubblicazione: (2024)
di: Wang, Jiawei, et al.
Pubblicazione: (2024)
UltraMedical: Building Specialized Generalists in Biomedicine
di: Zhang, Kaiyan, et al.
Pubblicazione: (2024)
di: Zhang, Kaiyan, et al.
Pubblicazione: (2024)
MiniCPM-V 4.5: Cooking Efficient MLLMs via Architecture, Data, and Training Recipe
di: Yu, Tianyu, et al.
Pubblicazione: (2025)
di: Yu, Tianyu, et al.
Pubblicazione: (2025)
SSR-Speech: Towards Stable, Safe and Robust Zero-shot Text-based Speech Editing and Synthesis
di: Wang, Helin, et al.
Pubblicazione: (2024)
di: Wang, Helin, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Free Process Rewards without Process Labels
di: Yuan, Lifan, et al.
Pubblicazione: (2024) -
From $f(x)$ and $g(x)$ to $f(g(x))$: LLMs Learn New Skills in RL by Composing Old Ones
di: Yuan, Lifan, et al.
Pubblicazione: (2025) -
Noise Contrastive Alignment of Language Models with Explicit Rewards
di: Chen, Huayu, et al.
Pubblicazione: (2024) -
The Entropy Mechanism of Reinforcement Learning for Reasoning Language Models
di: Cui, Ganqu, et al.
Pubblicazione: (2025) -
RLPR: Extrapolating RLVR to General Domains without Verifiers
di: Yu, Tianyu, et al.
Pubblicazione: (2025)