STAPO: Stabilizing Reinforcement Learning for LLMs by Silencing Rare Spurious Tokens
Fuente:
arXiv
Salvato in:
| Autori principali: | Liu, Shiqi, He, Zeyu, Zhan, Guojian, Tao, Letian, Zheng, Zhilong, Wu, Jiang, Wang, Yinuo, Guan, Yang, Sheng, Kehua, Zhang, Bo, Li, Keqiang, Duan, Jingliang, Li, Shengbo Eben |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Off-policy Reinforcement Learning with Model-based Exploration Augmentation
di: Wang, Likun, et al.
Pubblicazione: (2025)
di: Wang, Likun, et al.
Pubblicazione: (2025)
Conformal Symplectic Optimization for Stable Reinforcement Learning
di: Lyu, Yao, et al.
Pubblicazione: (2024)
di: Lyu, Yao, et al.
Pubblicazione: (2024)
Distributional Soft Actor-Critic with Harmonic Gradient for Safe and Efficient Autonomous Driving in Multi-lane Scenarios
di: Zhang, Feihong, et al.
Pubblicazione: (2025)
di: Zhang, Feihong, et al.
Pubblicazione: (2025)
Canonical Form of Datatic Description in Control Systems
di: Zhan, Guojian, et al.
Pubblicazione: (2024)
di: Zhan, Guojian, et al.
Pubblicazione: (2024)
Jump-Start Reinforcement Learning with Self-Evolving Priors for Extreme Monopedal Locomotion
di: Zheng, Ziang, et al.
Pubblicazione: (2025)
di: Zheng, Ziang, et al.
Pubblicazione: (2025)
Mind Your Entropy: From Maximum Entropy to Trajectory Entropy-Constrained RL
di: Zhan, Guojian, et al.
Pubblicazione: (2025)
di: Zhan, Guojian, et al.
Pubblicazione: (2025)
On the Stability of Datatic Control Systems
di: Yang, Yujie, et al.
Pubblicazione: (2024)
di: Yang, Yujie, et al.
Pubblicazione: (2024)
Predictive Lagrangian Optimization for Constrained Reinforcement Learning
di: Zhang, Tianqi, et al.
Pubblicazione: (2025)
di: Zhang, Tianqi, et al.
Pubblicazione: (2025)
Policy Bifurcation in Safe Reinforcement Learning
di: Zou, Wenjun, et al.
Pubblicazione: (2024)
di: Zou, Wenjun, et al.
Pubblicazione: (2024)
Mixed Policy Gradient: off-policy reinforcement learning driven jointly by data and model
di: Guan, Yang, et al.
Pubblicazione: (2021)
di: Guan, Yang, et al.
Pubblicazione: (2021)
Enhanced DACER Algorithm with High Diffusion Efficiency
di: Wang, Yinuo, et al.
Pubblicazione: (2025)
di: Wang, Yinuo, et al.
Pubblicazione: (2025)
An Explicit Discrete-Time Dynamic Vehicle Model with Assured Numerical Stability
di: Zhan, Guojian, et al.
Pubblicazione: (2024)
di: Zhan, Guojian, et al.
Pubblicazione: (2024)
On the Equilibrium between Feasible Zone and Uncertain Model in Safe Exploration
di: Yang, Yujie, et al.
Pubblicazione: (2026)
di: Yang, Yujie, et al.
Pubblicazione: (2026)
Hierarchical Feature-level Reverse Propagation for Post-Training Neural Networks
di: Ding, Ni, et al.
Pubblicazione: (2025)
di: Ding, Ni, et al.
Pubblicazione: (2025)
Distributional Soft Actor-Critic with Three Refinements
di: Duan, Jingliang, et al.
Pubblicazione: (2023)
di: Duan, Jingliang, et al.
Pubblicazione: (2023)
Enhance Sample Efficiency and Robustness of End-to-end Urban Autonomous Driving via Semantic Masked World Model
di: Gao, Zeyu, et al.
Pubblicazione: (2022)
di: Gao, Zeyu, et al.
Pubblicazione: (2022)
The Feasibility Theory of Constrained Reinforcement Learning: A Tutorial Study
di: Yang, Yujie, et al.
Pubblicazione: (2024)
di: Yang, Yujie, et al.
Pubblicazione: (2024)
Mean Flow Policy with Instantaneous Velocity Constraint for One-step Action Generation
di: Zhan, Guojian, et al.
Pubblicazione: (2026)
di: Zhan, Guojian, et al.
Pubblicazione: (2026)
Hierarchical End-to-End Autonomous Driving: Integrating BEV Perception with Deep Reinforcement Learning
di: Lu, Siyi, et al.
Pubblicazione: (2024)
di: Lu, Siyi, et al.
Pubblicazione: (2024)
Bootstrap Off-policy with World Model
di: Zhan, Guojian, et al.
Pubblicazione: (2025)
di: Zhan, Guojian, et al.
Pubblicazione: (2025)
Feasible Policy Iteration for Safe Reinforcement Learning
di: Yang, Yujie, et al.
Pubblicazione: (2023)
di: Yang, Yujie, et al.
Pubblicazione: (2023)
Controllability Test for Nonlinear Datatic Systems
di: Yang, Yujie, et al.
Pubblicazione: (2024)
di: Yang, Yujie, et al.
Pubblicazione: (2024)
Distributional Soft Actor-Critic with Diffusion Policy
di: Liu, Tong, et al.
Pubblicazione: (2025)
di: Liu, Tong, et al.
Pubblicazione: (2025)
Transferable Latent-to-Latent Locomotion Policy for Efficient and Versatile Motion Control of Diverse Legged Robots
di: Zheng, Ziang, et al.
Pubblicazione: (2025)
di: Zheng, Ziang, et al.
Pubblicazione: (2025)
Rocket Landing Control with Random Annealing Jump Start Reinforcement Learning
di: Jiang, Yuxuan, et al.
Pubblicazione: (2024)
di: Jiang, Yuxuan, et al.
Pubblicazione: (2024)
One Filters All: A Generalist Filter for State Estimation
di: Liu, Shiqi, et al.
Pubblicazione: (2025)
di: Liu, Shiqi, et al.
Pubblicazione: (2025)
Convolutional Bayesian Filtering
di: Cao, Wenhan, et al.
Pubblicazione: (2024)
di: Cao, Wenhan, et al.
Pubblicazione: (2024)
On the Optimization Landscape of Observer-based Dynamic Linear Quadratic Control
di: Duan, Jingliang, et al.
Pubblicazione: (2026)
di: Duan, Jingliang, et al.
Pubblicazione: (2026)
Zeroth-Order Actor-Critic: An Evolutionary Framework for Sequential Decision Problems
di: Lei, Yuheng, et al.
Pubblicazione: (2022)
di: Lei, Yuheng, et al.
Pubblicazione: (2022)
Diffusion Actor-Critic with Entropy Regulator
di: Wang, Yinuo, et al.
Pubblicazione: (2024)
di: Wang, Yinuo, et al.
Pubblicazione: (2024)
Convolutional Unscented Kalman Filter for Multi-Object Tracking with Outliers
di: Liu, Shiqi, et al.
Pubblicazione: (2024)
di: Liu, Shiqi, et al.
Pubblicazione: (2024)
Real-Time Generative Policy via Langevin-Guided Flow Matching for Autonomous Driving
di: Zhu, Tianze, et al.
Pubblicazione: (2026)
di: Zhu, Tianze, et al.
Pubblicazione: (2026)
Hierarchical and Decoupled BEV Perception Learning Framework for Autonomous Driving
di: Dai, Yuqi, et al.
Pubblicazione: (2024)
di: Dai, Yuqi, et al.
Pubblicazione: (2024)
Self-supervised Pretraining for Integrated Prediction and Planning of Automated Vehicles
di: Ren, Yangang, et al.
Pubblicazione: (2025)
di: Ren, Yangang, et al.
Pubblicazione: (2025)
Safe Offline Reinforcement Learning with Feasibility-Guided Diffusion Model
di: Zheng, Yinan, et al.
Pubblicazione: (2024)
di: Zheng, Yinan, et al.
Pubblicazione: (2024)
Algorithm Design and Comparative Test of Natural Gradient Gaussian Approximation Filter
di: Cao, Wenhan, et al.
Pubblicazione: (2025)
di: Cao, Wenhan, et al.
Pubblicazione: (2025)
Natural Gradient Gaussian Approximation Filter with Positive Definiteness Guarantee
di: Zhang, Tianyi, et al.
Pubblicazione: (2026)
di: Zhang, Tianyi, et al.
Pubblicazione: (2026)
Indirect Shared Control of Highly Automated Vehicles for Cooperative Driving between Driver and Automation
di: Li, Renjie, et al.
Pubblicazione: (2017)
di: Li, Renjie, et al.
Pubblicazione: (2017)
Exchange Policy Optimization Algorithm for Semi-Infinite Safe Reinforcement Learning
di: Zhang, Jiaming, et al.
Pubblicazione: (2025)
di: Zhang, Jiaming, et al.
Pubblicazione: (2025)
Augmented Lagrangian Multiplier Network for State-wise Safety in Reinforcement Learning
di: Zhang, Jiaming, et al.
Pubblicazione: (2026)
di: Zhang, Jiaming, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Off-policy Reinforcement Learning with Model-based Exploration Augmentation
di: Wang, Likun, et al.
Pubblicazione: (2025) -
Conformal Symplectic Optimization for Stable Reinforcement Learning
di: Lyu, Yao, et al.
Pubblicazione: (2024) -
Distributional Soft Actor-Critic with Harmonic Gradient for Safe and Efficient Autonomous Driving in Multi-lane Scenarios
di: Zhang, Feihong, et al.
Pubblicazione: (2025) -
Canonical Form of Datatic Description in Control Systems
di: Zhan, Guojian, et al.
Pubblicazione: (2024) -
Jump-Start Reinforcement Learning with Self-Evolving Priors for Extreme Monopedal Locomotion
di: Zheng, Ziang, et al.
Pubblicazione: (2025)