Imbalanced Gradients in RL Post-Training of Multi-Task LLMs
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wu, Runzhe, Samanta, Ankur, Jain, Ayush, Fujimoto, Scott, Kwon, Jeongyeol, Kretzu, Ben, Yu, Youliang, Hassani, Kaveh, Vidolov, Boris, Efroni, Yonathan |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Self-Improvement of Language Models by Post-Training on Multi-Agent Debate
par: Samanta, Ankur, et autres
Publié: (2025)
par: Samanta, Ankur, et autres
Publié: (2025)
Structure Enables Effective Self-Localization of Errors in LLMs
par: Samanta, Ankur, et autres
Publié: (2026)
par: Samanta, Ankur, et autres
Publié: (2026)
Simple Optimizers for Convex Aligned Multi-Objective Optimization
par: Kretzu, Ben, et autres
Publié: (2025)
par: Kretzu, Ben, et autres
Publié: (2025)
RL in Latent MDPs is Tractable: Online Guarantees via Off-Policy Evaluation
par: Kwon, Jeongyeol, et autres
Publié: (2024)
par: Kwon, Jeongyeol, et autres
Publié: (2024)
Credit Assignment with Resets in Language Model Reasoning
par: Samanta, Ankur, et autres
Publié: (2026)
par: Samanta, Ankur, et autres
Publié: (2026)
Aligned Multi Objective Optimization
par: Efroni, Yonathan, et autres
Publié: (2025)
par: Efroni, Yonathan, et autres
Publié: (2025)
Hack-Verifiable Environments: Towards Evaluating Reward Hacking at Scale
par: Roth, Amit, et autres
Publié: (2026)
par: Roth, Amit, et autres
Publié: (2026)
Exploiting Structure in Offline Multi-Agent RL: The Benefits of Low Interaction Rank
par: Zhan, Wenhao, et autres
Publié: (2024)
par: Zhan, Wenhao, et autres
Publié: (2024)
Gradient Free Deep Reinforcement Learning With TabPFN
par: Schiff, David, et autres
Publié: (2025)
par: Schiff, David, et autres
Publié: (2025)
Projection-Free Online Convex Optimization with Time-Varying Constraints
par: Garber, Dan, et autres
Publié: (2024)
par: Garber, Dan, et autres
Publié: (2024)
Computationally Efficient RL under Linear Bellman Completeness for Deterministic Dynamics
par: Wu, Runzhe, et autres
Publié: (2024)
par: Wu, Runzhe, et autres
Publié: (2024)
The Bias of Harmful Label Associations in Vision-Language Models
par: Hazirbas, Caner, et autres
Publié: (2024)
par: Hazirbas, Caner, et autres
Publié: (2024)
On the Complexity of First-Order Methods in Stochastic Bilevel Optimization
par: Kwon, Jeongyeol, et autres
Publié: (2024)
par: Kwon, Jeongyeol, et autres
Publié: (2024)
Generalizing Multi-Step Inverse Models for Representation Learning to Finite-Memory POMDPs
par: Wu, Lili, et autres
Publié: (2024)
par: Wu, Lili, et autres
Publié: (2024)
Optimal Zeroth-Order Bilevel Optimization
par: Aghasi, Alireza, et autres
Publié: (2025)
par: Aghasi, Alireza, et autres
Publié: (2025)
On Penalty Methods for Nonconvex Bilevel Optimization and First-Order Stochastic Approximation
par: Kwon, Jeongyeol, et autres
Publié: (2023)
par: Kwon, Jeongyeol, et autres
Publié: (2023)
Making RL with Preference-based Feedback Efficient via Randomization
par: Wu, Runzhe, et autres
Publié: (2023)
par: Wu, Runzhe, et autres
Publié: (2023)
Difficult Task Yes but Simple Task No: Unveiling the Laziness in Multimodal LLMs
par: Zhao, Sihang, et autres
Publié: (2024)
par: Zhao, Sihang, et autres
Publié: (2024)
Two-Timescale Linear Stochastic Approximation: Constant Stepsizes Go a Long Way
par: Kwon, Jeongyeol, et autres
Publié: (2024)
par: Kwon, Jeongyeol, et autres
Publié: (2024)
A Classification View on Meta Learning Bandits
par: Mutti, Mirco, et autres
Publié: (2025)
par: Mutti, Mirco, et autres
Publié: (2025)
An Empirical Study on the Power of Future Prediction in Partially Observable Environments
par: Kwon, Jeongyeol, et autres
Publié: (2024)
par: Kwon, Jeongyeol, et autres
Publié: (2024)
Time After Time: Deep-Q Effect Estimation for Interventions on When and What to do
par: Wald, Yoav, et autres
Publié: (2025)
par: Wald, Yoav, et autres
Publié: (2025)
A Comedy of Estimators: On KL Regularization in RL Training of LLMs
par: Shah, Vedant, et autres
Publié: (2025)
par: Shah, Vedant, et autres
Publié: (2025)
GAC: Stabilizing Asynchronous RL Training for LLMs via Gradient Alignment Control
par: Xu, Haofeng, et autres
Publié: (2026)
par: Xu, Haofeng, et autres
Publié: (2026)
Partial Policy Gradients for RL in LLMs
par: Mathur, Puneet, et autres
Publié: (2026)
par: Mathur, Puneet, et autres
Publié: (2026)
Exact analysis of potential flow past bodies of irregular shapes
par: Jain, Ankur
Publié: (2025)
par: Jain, Ankur
Publié: (2025)
ART: Adaptive Resampling-based Training for Imbalanced Classification
par: Basandrai, Arjun, et autres
Publié: (2025)
par: Basandrai, Arjun, et autres
Publié: (2025)
Detecting Causality with Symplectic Quandles
par: Jain, Ayush
Publié: (2023)
par: Jain, Ayush
Publié: (2023)
Improved Offline Contextual Bandits with Second-Order Bounds: Betting and Freezing
par: Ryu, J. Jon, et autres
Publié: (2025)
par: Ryu, J. Jon, et autres
Publié: (2025)
Exploration Hacking: Can LLMs Learn to Resist RL Training?
par: Jang, Eyon, et autres
Publié: (2026)
par: Jang, Eyon, et autres
Publié: (2026)
JigsawRL: Assembling RL Pipelines for Efficient LLM Post-Training
par: Hu, Zhengding, et autres
Publié: (2026)
par: Hu, Zhengding, et autres
Publié: (2026)
Train on Validation (ToV): Fast data selection with applications to fine-tuning
par: Jain, Ayush, et autres
Publié: (2025)
par: Jain, Ayush, et autres
Publié: (2025)
Nemotron-Cascade 2: Post-Training LLMs with Cascade RL and Multi-Domain On-Policy Distillation
par: Yang, Zhuolin, et autres
Publié: (2026)
par: Yang, Zhuolin, et autres
Publié: (2026)
SCOPE-RL: Stable and Quantitative Control of Policy Entropy in RL Post-Training
par: Wang, Chen, et autres
Publié: (2025)
par: Wang, Chen, et autres
Publié: (2025)
Multimodal Emotion Recognition via Bi-directional Cross-Attention and Temporal Modeling
par: Byeon, Junhyeong, et autres
Publié: (2026)
par: Byeon, Junhyeong, et autres
Publié: (2026)
Learning Dynamics in RL Post-Training for Language Models
par: Tomihari, Akiyoshi
Publié: (2026)
par: Tomihari, Akiyoshi
Publié: (2026)
AI based Content Creation and Product Recommendation Applications in E-commerce: An Ethical overview
par: Jain, Aditi Madhusudan, et autres
Publié: (2025)
par: Jain, Aditi Madhusudan, et autres
Publié: (2025)
Efficient RL Training for LLMs with Experience Replay
par: Arnal, Charles, et autres
Publié: (2026)
par: Arnal, Charles, et autres
Publié: (2026)
Feed Two Birds with One Scone: Exploiting Wild Data for Both Out-of-Distribution Generalization and Detection
par: Bai, Haoyue, et autres
Publié: (2023)
par: Bai, Haoyue, et autres
Publié: (2023)
Sharing is Caring: Efficient LM Post-Training with Collective RL Experience Sharing
par: Amico, Jeffrey, et autres
Publié: (2025)
par: Amico, Jeffrey, et autres
Publié: (2025)
Documents similaires
-
Self-Improvement of Language Models by Post-Training on Multi-Agent Debate
par: Samanta, Ankur, et autres
Publié: (2025) -
Structure Enables Effective Self-Localization of Errors in LLMs
par: Samanta, Ankur, et autres
Publié: (2026) -
Simple Optimizers for Convex Aligned Multi-Objective Optimization
par: Kretzu, Ben, et autres
Publié: (2025) -
RL in Latent MDPs is Tractable: Online Guarantees via Off-Policy Evaluation
par: Kwon, Jeongyeol, et autres
Publié: (2024) -
Credit Assignment with Resets in Language Model Reasoning
par: Samanta, Ankur, et autres
Publié: (2026)