VinePPO: Refining Credit Assignment in RL Training of LLMs
Fuente:
arXiv
Salvato in:
| Autori principali: | Kazemnejad, Amirhossein, Aghajohari, Milad, Portelance, Eva, Sordoni, Alessandro, Reddy, Siva, Courville, Aaron, Roux, Nicolas Le |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
The Markovian Thinker: Architecture-Agnostic Linear Scaling of Reasoning
di: Aghajohari, Milad, et al.
Pubblicazione: (2025)
di: Aghajohari, Milad, et al.
Pubblicazione: (2025)
Exploiting Tree Structure for Credit Assignment in RL Training of LLMs
di: Tran, Hieu, et al.
Pubblicazione: (2025)
di: Tran, Hieu, et al.
Pubblicazione: (2025)
Reframing linguistic bootstrapping as joint inference using visually-grounded grammar induction models
di: Portelance, Eva, et al.
Pubblicazione: (2024)
di: Portelance, Eva, et al.
Pubblicazione: (2024)
V-STaR: Training Verifiers for Self-Taught Reasoners
di: Hosseini, Arian, et al.
Pubblicazione: (2024)
di: Hosseini, Arian, et al.
Pubblicazione: (2024)
Improving Context-Aware Preference Modeling for Language Models
di: Pitis, Silviu, et al.
Pubblicazione: (2024)
di: Pitis, Silviu, et al.
Pubblicazione: (2024)
LOQA: Learning with Opponent Q-Learning Awareness
di: Aghajohari, Milad, et al.
Pubblicazione: (2024)
di: Aghajohari, Milad, et al.
Pubblicazione: (2024)
Towards Modular LLMs by Building and Reusing a Library of LoRAs
di: Ostapenko, Oleksiy, et al.
Pubblicazione: (2024)
di: Ostapenko, Oleksiy, et al.
Pubblicazione: (2024)
On the Compatibility of Generative AI and Generative Linguistics
di: Portelance, Eva, et al.
Pubblicazione: (2024)
di: Portelance, Eva, et al.
Pubblicazione: (2024)
DeepSeek-R1 Thoughtology: Let's think about LLM Reasoning
di: Marjanović, Sara Vera, et al.
Pubblicazione: (2025)
di: Marjanović, Sara Vera, et al.
Pubblicazione: (2025)
Best Response Shaping
di: Aghajohari, Milad, et al.
Pubblicazione: (2024)
di: Aghajohari, Milad, et al.
Pubblicazione: (2024)
Learning Robust Social Strategies with Large Language Models
di: Piche, Dereck, et al.
Pubblicazione: (2025)
di: Piche, Dereck, et al.
Pubblicazione: (2025)
APEX-Searcher: Refining Credit Assignment with Subgoaling for Agentic Retrieval-Augmented Generation
di: Chen, Kun, et al.
Pubblicazione: (2026)
di: Chen, Kun, et al.
Pubblicazione: (2026)
Scaling Graph-Based Dependency Parsing with Arc Vectorization and Attention-Based Refinement
di: Floquet, Nicolas, et al.
Pubblicazione: (2025)
di: Floquet, Nicolas, et al.
Pubblicazione: (2025)
AgentRewardBench: Evaluating Automatic Evaluations of Web Agent Trajectories
di: Lù, Xing Han, et al.
Pubblicazione: (2025)
di: Lù, Xing Han, et al.
Pubblicazione: (2025)
Learning the meanings of function words from grounded language using a visual question answering model
di: Portelance, Eva, et al.
Pubblicazione: (2023)
di: Portelance, Eva, et al.
Pubblicazione: (2023)
Not All LLM Reasoners Are Created Equal
di: Hosseini, Arian, et al.
Pubblicazione: (2024)
di: Hosseini, Arian, et al.
Pubblicazione: (2024)
Segment Policy Optimization: Effective Segment-Level Credit Assignment in RL for Large Language Models
di: Guo, Yiran, et al.
Pubblicazione: (2025)
di: Guo, Yiran, et al.
Pubblicazione: (2025)
Beyond Uniform Credit: Causal Credit Assignment for Policy Optimization
di: Khandoga, Mykola, et al.
Pubblicazione: (2026)
di: Khandoga, Mykola, et al.
Pubblicazione: (2026)
Asynchronous RLHF: Faster and More Efficient Off-Policy RL for Language Models
di: Noukhovitch, Michael, et al.
Pubblicazione: (2024)
di: Noukhovitch, Michael, et al.
Pubblicazione: (2024)
Advantage Alignment Algorithms
di: Duque, Juan Agustin, et al.
Pubblicazione: (2024)
di: Duque, Juan Agustin, et al.
Pubblicazione: (2024)
Forecasting Downstream Performance of LLMs With Proxy Metrics
di: Patel, Arkil, et al.
Pubblicazione: (2026)
di: Patel, Arkil, et al.
Pubblicazione: (2026)
Dependent Type Refinements for Futures
di: Somayyajula, Siva, et al.
Pubblicazione: (2023)
di: Somayyajula, Siva, et al.
Pubblicazione: (2023)
The Promise of RL for Autoregressive Image Editing
di: Ahmadi, Saba, et al.
Pubblicazione: (2025)
di: Ahmadi, Saba, et al.
Pubblicazione: (2025)
Effect of Document Packing on the Latent Multi-Hop Reasoning Capabilities of Large Language Models
di: Prato, Gabriele, et al.
Pubblicazione: (2025)
di: Prato, Gabriele, et al.
Pubblicazione: (2025)
Planning without Search: Refining Frontier LLMs with Offline Goal-Conditioned RL
di: Hong, Joey, et al.
Pubblicazione: (2025)
di: Hong, Joey, et al.
Pubblicazione: (2025)
From Reasoning to Agentic: Credit Assignment in Reinforcement Learning for Large Language Models
di: Zhang, Chenchen
Pubblicazione: (2026)
di: Zhang, Chenchen
Pubblicazione: (2026)
Reducing Credit Assignment Variance via Counterfactual Reasoning Paths
di: Ding, Fei, et al.
Pubblicazione: (2026)
di: Ding, Fei, et al.
Pubblicazione: (2026)
Humans and LLMs Diverge on Probabilistic Inferences
di: Kamath, Gaurav, et al.
Pubblicazione: (2026)
di: Kamath, Gaurav, et al.
Pubblicazione: (2026)
How to Get Your LLM to Generate Challenging Problems for Evaluation
di: Patel, Arkil, et al.
Pubblicazione: (2025)
di: Patel, Arkil, et al.
Pubblicazione: (2025)
Investigating Adversarial Trigger Transfer in Large Language Models
di: Meade, Nicholas, et al.
Pubblicazione: (2024)
di: Meade, Nicholas, et al.
Pubblicazione: (2024)
Not All Data Are Unlearned Equally
di: Krishnan, Aravind, et al.
Pubblicazione: (2025)
di: Krishnan, Aravind, et al.
Pubblicazione: (2025)
Learning Action and Reasoning-Centric Image Editing from Videos and Simulations
di: Krojer, Benno, et al.
Pubblicazione: (2024)
di: Krojer, Benno, et al.
Pubblicazione: (2024)
Advancing Language Multi-Agent Learning with Credit Re-Assignment for Interactive Environment Generalization
di: He, Zhitao, et al.
Pubblicazione: (2025)
di: He, Zhitao, et al.
Pubblicazione: (2025)
Every Step Counts: Step-Level Credit Assignment for Tool-Integrated Text-to-SQL
di: Dai, Yaxun, et al.
Pubblicazione: (2026)
di: Dai, Yaxun, et al.
Pubblicazione: (2026)
Knowing When to Ask: Segment-Level Credit Assignment for LLM Tool Use
di: Kumar, Abhijit, et al.
Pubblicazione: (2026)
di: Kumar, Abhijit, et al.
Pubblicazione: (2026)
Outcome-Grounded Advantage Reshaping for Fine-Grained Credit Assignment in Mathematical Reasoning
di: Li, Ziheng, et al.
Pubblicazione: (2026)
di: Li, Ziheng, et al.
Pubblicazione: (2026)
InT: Self-Proposed Interventions Enable Credit Assignment in LLM Reasoning
di: Yang, Matthew Y. R., et al.
Pubblicazione: (2026)
di: Yang, Matthew Y. R., et al.
Pubblicazione: (2026)
CAPO: Towards Enhancing LLM Reasoning through Generative Credit Assignment
di: Xie, Guofu, et al.
Pubblicazione: (2025)
di: Xie, Guofu, et al.
Pubblicazione: (2025)
Exploration Hacking: Can LLMs Learn to Resist RL Training?
di: Jang, Eyon, et al.
Pubblicazione: (2026)
di: Jang, Eyon, et al.
Pubblicazione: (2026)
CriticSearch: Fine-Grained Credit Assignment for Search Agents via a Retrospective Critic
di: Zhang, Yaocheng, et al.
Pubblicazione: (2025)
di: Zhang, Yaocheng, et al.
Pubblicazione: (2025)
Documenti analoghi
-
The Markovian Thinker: Architecture-Agnostic Linear Scaling of Reasoning
di: Aghajohari, Milad, et al.
Pubblicazione: (2025) -
Exploiting Tree Structure for Credit Assignment in RL Training of LLMs
di: Tran, Hieu, et al.
Pubblicazione: (2025) -
Reframing linguistic bootstrapping as joint inference using visually-grounded grammar induction models
di: Portelance, Eva, et al.
Pubblicazione: (2024) -
V-STaR: Training Verifiers for Self-Taught Reasoners
di: Hosseini, Arian, et al.
Pubblicazione: (2024) -
Improving Context-Aware Preference Modeling for Language Models
di: Pitis, Silviu, et al.
Pubblicazione: (2024)