GRADE: Replacing Policy Gradients with Backpropagation for LLM Alignment
Fuente:
arXiv
Salvato in:
| Autore principale: | Nel, Lukas Abrie |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Randomized Advantage Transformation (RAT): Computing Natural Policy Gradients via Direct Backpropagation
di: Sun, Mingfei
Pubblicazione: (2026)
di: Sun, Mingfei
Pubblicazione: (2026)
Beyond Backpropagation: Optimization with Multi-Tangent Forward Gradients
di: Flügel, Katharina, et al.
Pubblicazione: (2024)
di: Flügel, Katharina, et al.
Pubblicazione: (2024)
Fine-tuning Diffusion Policies with Backpropagation Through Diffusion Timesteps
di: Yang, Ningyuan, et al.
Pubblicazione: (2025)
di: Yang, Ningyuan, et al.
Pubblicazione: (2025)
Practical Boolean Backpropagation
di: Golbert, Simon
Pubblicazione: (2025)
di: Golbert, Simon
Pubblicazione: (2025)
LearnAlign: Data Selection for LLM Reinforcement Learning with Improved Gradient Alignment
di: Li, Shipeng, et al.
Pubblicazione: (2025)
di: Li, Shipeng, et al.
Pubblicazione: (2025)
Generalized Euler Logarithm and its Applications in Machine Learning: Natural Gradient, Backpropagation, Generalized EG, Mirror Descent and OLPS
di: Cichocki, Andrzej
Pubblicazione: (2025)
di: Cichocki, Andrzej
Pubblicazione: (2025)
Stabilizing Policy Gradients for Sample-Efficient Reinforcement Learning in LLM Reasoning
di: Melo, Luckeciano C., et al.
Pubblicazione: (2025)
di: Melo, Luckeciano C., et al.
Pubblicazione: (2025)
Backpropagation-Free Metropolis-Adjusted Langevin Algorithm
di: Cobb, Adam D., et al.
Pubblicazione: (2025)
di: Cobb, Adam D., et al.
Pubblicazione: (2025)
Few-shot Steerable Alignment: Adapting Rewards and LLM Policies with Neural Processes
di: Kobalczyk, Katarzyna, et al.
Pubblicazione: (2024)
di: Kobalczyk, Katarzyna, et al.
Pubblicazione: (2024)
HKAN: Hierarchical Kolmogorov-Arnold Network without Backpropagation
di: Dudek, Grzegorz, et al.
Pubblicazione: (2025)
di: Dudek, Grzegorz, et al.
Pubblicazione: (2025)
Dense Backpropagation Improves Training for Sparse Mixture-of-Experts
di: Panda, Ashwinee, et al.
Pubblicazione: (2025)
di: Panda, Ashwinee, et al.
Pubblicazione: (2025)
Dynamic Spectral Backpropagation for Efficient Neural Network Training
di: Muthuraman, Mannmohan
Pubblicazione: (2025)
di: Muthuraman, Mannmohan
Pubblicazione: (2025)
Exploring the Performance of Perforated Backpropagation through Further Experiments
di: Brenner, Rorry, et al.
Pubblicazione: (2025)
di: Brenner, Rorry, et al.
Pubblicazione: (2025)
Learning General Policies with Policy Gradient Methods
di: Ståhlberg, Simon, et al.
Pubblicazione: (2025)
di: Ståhlberg, Simon, et al.
Pubblicazione: (2025)
Policy Gradient with Kernel Quadrature
di: Hayakawa, Satoshi, et al.
Pubblicazione: (2023)
di: Hayakawa, Satoshi, et al.
Pubblicazione: (2023)
Policy Gradient with Tree Expansion
di: Dalal, Gal, et al.
Pubblicazione: (2023)
di: Dalal, Gal, et al.
Pubblicazione: (2023)
Learning without Global Backpropagation via Synergistic Information Distillation
di: Ye, Chenhao, et al.
Pubblicazione: (2025)
di: Ye, Chenhao, et al.
Pubblicazione: (2025)
Local Pairwise Distance Matching for Backpropagation-Free Reinforcement Learning
di: Tanneberg, Daniel
Pubblicazione: (2025)
di: Tanneberg, Daniel
Pubblicazione: (2025)
Stochastic Layer-wise Learning: Scalable and Efficient Alternative to Backpropagation
di: Yin, Bojian, et al.
Pubblicazione: (2025)
di: Yin, Bojian, et al.
Pubblicazione: (2025)
SAL: Selective Adaptive Learning for Backpropagation-Free Training with Sparsification
di: Liu, Fanping, et al.
Pubblicazione: (2026)
di: Liu, Fanping, et al.
Pubblicazione: (2026)
AdjointDPM: Adjoint Sensitivity Method for Gradient Backpropagation of Diffusion Probabilistic Models
di: Pan, Jiachun, et al.
Pubblicazione: (2023)
di: Pan, Jiachun, et al.
Pubblicazione: (2023)
On the Design of KL-Regularized Policy Gradient Algorithms for LLM Reasoning
di: Zhang, Yifan, et al.
Pubblicazione: (2025)
di: Zhang, Yifan, et al.
Pubblicazione: (2025)
Interpreting and Controlling LLM Reasoning through Integrated Policy Gradient
di: Li, Changming, et al.
Pubblicazione: (2026)
di: Li, Changming, et al.
Pubblicazione: (2026)
Gradient-Adaptive Policy Optimization: Towards Multi-Objective Alignment of Large Language Models
di: Li, Chengao, et al.
Pubblicazione: (2025)
di: Li, Chengao, et al.
Pubblicazione: (2025)
Gradient Extrapolation-Based Policy Optimization
di: Swapnil, Ismam Nur, et al.
Pubblicazione: (2026)
di: Swapnil, Ismam Nur, et al.
Pubblicazione: (2026)
Partial Policy Gradients for RL in LLMs
di: Mathur, Puneet, et al.
Pubblicazione: (2026)
di: Mathur, Puneet, et al.
Pubblicazione: (2026)
BoA: Attention-aware Post-training Quantization without Backpropagation
di: Kim, Junhan, et al.
Pubblicazione: (2024)
di: Kim, Junhan, et al.
Pubblicazione: (2024)
Reducing Fine-Tuning Memory Overhead by Approximate and Memory-Sharing Backpropagation
di: Yang, Yuchen, et al.
Pubblicazione: (2024)
di: Yang, Yuchen, et al.
Pubblicazione: (2024)
Recursive Speculative Decoding: Accelerating LLM Inference via Sampling Without Replacement
di: Jeon, Wonseok, et al.
Pubblicazione: (2024)
di: Jeon, Wonseok, et al.
Pubblicazione: (2024)
StreamBP: Memory-Efficient Exact Backpropagation for Long Sequence Training of LLMs
di: Luo, Qijun, et al.
Pubblicazione: (2025)
di: Luo, Qijun, et al.
Pubblicazione: (2025)
Logit Dynamics in Softmax Policy Gradient Methods
di: Li, Yingru
Pubblicazione: (2025)
di: Li, Yingru
Pubblicazione: (2025)
Measures of Variability for Risk-averse Policy Gradient
di: Luo, Yudong, et al.
Pubblicazione: (2025)
di: Luo, Yudong, et al.
Pubblicazione: (2025)
Sequential Policy Gradient for Adaptive Hyperparameter Optimization
di: Li, Zheng, et al.
Pubblicazione: (2025)
di: Li, Zheng, et al.
Pubblicazione: (2025)
Soft Deterministic Policy Gradient with Gaussian Smoothing
di: Na, Hyunjun, et al.
Pubblicazione: (2026)
di: Na, Hyunjun, et al.
Pubblicazione: (2026)
Towards Provable Log Density Policy Gradient
di: Katdare, Pulkit, et al.
Pubblicazione: (2024)
di: Katdare, Pulkit, et al.
Pubblicazione: (2024)
Policy Gradient for Robust Markov Decision Processes
di: Wang, Qiuhao, et al.
Pubblicazione: (2024)
di: Wang, Qiuhao, et al.
Pubblicazione: (2024)
mGRADE: Minimal Recurrent Gating Meets Delay Convolutions for Lightweight Sequence Modeling
di: Torchet, Tristan, et al.
Pubblicazione: (2025)
di: Torchet, Tristan, et al.
Pubblicazione: (2025)
Does "Do Differentiable Simulators Give Better Policy Gradients?'' Give Better Policy Gradients?
di: Onoda, Ku, et al.
Pubblicazione: (2026)
di: Onoda, Ku, et al.
Pubblicazione: (2026)
First Order Model-Based RL through Decoupled Backpropagation
di: Amigo, Joseph, et al.
Pubblicazione: (2025)
di: Amigo, Joseph, et al.
Pubblicazione: (2025)
ABPT: Amended Backpropagation through Time with Partially Differentiable Rewards
di: Li, Fanxing, et al.
Pubblicazione: (2025)
di: Li, Fanxing, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Randomized Advantage Transformation (RAT): Computing Natural Policy Gradients via Direct Backpropagation
di: Sun, Mingfei
Pubblicazione: (2026) -
Beyond Backpropagation: Optimization with Multi-Tangent Forward Gradients
di: Flügel, Katharina, et al.
Pubblicazione: (2024) -
Fine-tuning Diffusion Policies with Backpropagation Through Diffusion Timesteps
di: Yang, Ningyuan, et al.
Pubblicazione: (2025) -
Practical Boolean Backpropagation
di: Golbert, Simon
Pubblicazione: (2025) -
LearnAlign: Data Selection for LLM Reinforcement Learning with Improved Gradient Alignment
di: Li, Shipeng, et al.
Pubblicazione: (2025)