Salvato in:
| Autori principali: | Su, Zhenpeng, Pan, Leiyu, Lv, Minxuan, Li, Yuntao, Hu, Wenping, Zhang, Fuzheng, Gai, Kun, Zhou, Guorui |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2509.20712 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Klear-Reasoner: Advancing Reasoning Capability via Gradient-Preserving Clipping Policy Optimization
di: Su, Zhenpeng, et al.
Pubblicazione: (2025)
di: Su, Zhenpeng, et al.
Pubblicazione: (2025)
Entropy Ratio Clipping as a Soft Global Constraint for Stable Reinforcement Learning
di: Su, Zhenpeng, et al.
Pubblicazione: (2025)
di: Su, Zhenpeng, et al.
Pubblicazione: (2025)
Good Reasoning Makes Good Demonstrations: Implicit Reasoning Quality Supervision via In-Context Reinforcement Learning
di: Mei, Tiehua, et al.
Pubblicazione: (2026)
di: Mei, Tiehua, et al.
Pubblicazione: (2026)
DSMoE: Matrix-Partitioned Experts with Dynamic Routing for Computation-Efficient Dense LLMs
di: Lv, Minxuan, et al.
Pubblicazione: (2025)
di: Lv, Minxuan, et al.
Pubblicazione: (2025)
Finedeep: Mitigating Sparse Activation in Dense LLMs via Multi-Layer Fine-Grained Experts
di: Pan, Leiyu, et al.
Pubblicazione: (2025)
di: Pan, Leiyu, et al.
Pubblicazione: (2025)
Agentic Entropy-Balanced Policy Optimization
di: Dong, Guanting, et al.
Pubblicazione: (2025)
di: Dong, Guanting, et al.
Pubblicazione: (2025)
When Importance Sampling Misallocates Credit: Asymmetric Ratios for Outcome-Supervised RL
di: Wang, Jiakang, et al.
Pubblicazione: (2025)
di: Wang, Jiakang, et al.
Pubblicazione: (2025)
Leanabell-Prover-V2: Verifier-integrated Reasoning for Formal Theorem Proving via Reinforcement Learning
di: Ji, Xingguang, et al.
Pubblicazione: (2025)
di: Ji, Xingguang, et al.
Pubblicazione: (2025)
Agentic Reinforced Policy Optimization
di: Dong, Guanting, et al.
Pubblicazione: (2025)
di: Dong, Guanting, et al.
Pubblicazione: (2025)
Attention as a Compass: Efficient Exploration for Process-Supervised RL in Reasoning Models
di: Liu, Runze, et al.
Pubblicazione: (2025)
di: Liu, Runze, et al.
Pubblicazione: (2025)
Leanabell-Prover: Posttraining Scaling in Formal Reasoning
di: Zhang, Jingyuan, et al.
Pubblicazione: (2025)
di: Zhang, Jingyuan, et al.
Pubblicazione: (2025)
CartesianMoE: Boosting Knowledge Sharing among Experts via Cartesian Product Routing in Mixture-of-Experts
di: Su, Zhenpeng, et al.
Pubblicazione: (2024)
di: Su, Zhenpeng, et al.
Pubblicazione: (2024)
AR-GRPO: Training Autoregressive Image Generation Models via Reinforcement Learning
di: Yuan, Shihao, et al.
Pubblicazione: (2025)
di: Yuan, Shihao, et al.
Pubblicazione: (2025)
Stabilizing Knowledge, Promoting Reasoning: Dual-Token Constraints for RLVR
di: Wang, Jiakang, et al.
Pubblicazione: (2025)
di: Wang, Jiakang, et al.
Pubblicazione: (2025)
RLEP: Reinforcement Learning with Experience Replay for LLM Reasoning
di: Zhang, Hongzhi, et al.
Pubblicazione: (2025)
di: Zhang, Hongzhi, et al.
Pubblicazione: (2025)
GoLongRL: Capability-Oriented Long Context Reinforcement Learning with Multitask Alignment
di: Lv, Minxuan, et al.
Pubblicazione: (2026)
di: Lv, Minxuan, et al.
Pubblicazione: (2026)
BAPO: Stabilizing Off-Policy Reinforcement Learning for LLMs via Balanced Policy Optimization with Adaptive Clipping
di: Xi, Zhiheng, et al.
Pubblicazione: (2025)
di: Xi, Zhiheng, et al.
Pubblicazione: (2025)
Pantheon: Personalized Multi-objective Ensemble Sort via Iterative Pareto Policy Optimization
di: Cao, Jiangxia, et al.
Pubblicazione: (2025)
di: Cao, Jiangxia, et al.
Pubblicazione: (2025)
HoME: Hierarchy of Multi-Gate Experts for Multi-Task Learning at Kuaishou
di: Wang, Xu, et al.
Pubblicazione: (2024)
di: Wang, Xu, et al.
Pubblicazione: (2024)
Scalable Multi-Objective and Meta Reinforcement Learning via Gradient Estimation
di: Zhang, Zhenshuo, et al.
Pubblicazione: (2025)
di: Zhang, Zhenshuo, et al.
Pubblicazione: (2025)
Clip-Low Increases Entropy and Clip-High Decreases Entropy in Reinforcement Learning of Large Language Models
di: Park, Jaesung R., et al.
Pubblicazione: (2025)
di: Park, Jaesung R., et al.
Pubblicazione: (2025)
Robust Stochastic Optimization via Gradient Quantile Clipping
di: Merad, Ibrahim, et al.
Pubblicazione: (2023)
di: Merad, Ibrahim, et al.
Pubblicazione: (2023)
Multi-Agent Reinforcement Learning for Unmanned Aerial Vehicle Coordination by Multi-Critic Policy Gradient Optimization
di: Alon, Yoav, et al.
Pubblicazione: (2020)
di: Alon, Yoav, et al.
Pubblicazione: (2020)
Klear-CodeTest: Scalable Test Case Generation for Code Reinforcement Learning
di: Fu, Jia, et al.
Pubblicazione: (2025)
di: Fu, Jia, et al.
Pubblicazione: (2025)
To Clip or not to Clip: the Dynamics of SGD with Gradient Clipping in High-Dimensions
di: Marshall, Noah, et al.
Pubblicazione: (2024)
di: Marshall, Noah, et al.
Pubblicazione: (2024)
FIM: Frequency-Aware Multi-View Interest Modeling for Local-Life Service Recommendation
di: Wang, Guoquan, et al.
Pubblicazione: (2025)
di: Wang, Guoquan, et al.
Pubblicazione: (2025)
DCPO: Dynamic Clipping Policy Optimization
di: Yang, Shihui, et al.
Pubblicazione: (2025)
di: Yang, Shihui, et al.
Pubblicazione: (2025)
An Empirical Study on the Robustness of Massively Multilingual Neural Machine Translation
di: Supryadi, et al.
Pubblicazione: (2024)
di: Supryadi, et al.
Pubblicazione: (2024)
Inductive-Deductive Strategy Reuse for Multi-Turn Instructional Dialogues
di: Ou, Jiao, et al.
Pubblicazione: (2024)
di: Ou, Jiao, et al.
Pubblicazione: (2024)
ERABAL: Enhancing Role-Playing Agents through Boundary-Aware Learning
di: Tang, Yihong, et al.
Pubblicazione: (2024)
di: Tang, Yihong, et al.
Pubblicazione: (2024)
Enhancing Role-playing Systems through Aggressive Queries: Evaluation and Improvement
di: Tang, Yihong, et al.
Pubblicazione: (2024)
di: Tang, Yihong, et al.
Pubblicazione: (2024)
Optimized Gradient Clipping for Noisy Label Learning
di: Ye, Xichen, et al.
Pubblicazione: (2024)
di: Ye, Xichen, et al.
Pubblicazione: (2024)
Efficient Privacy-Preserving Recommendation on Sparse Data using Fully Homomorphic Encryption
di: Chowdhury, Moontaha Nishat, et al.
Pubblicazione: (2025)
di: Chowdhury, Moontaha Nishat, et al.
Pubblicazione: (2025)
Flexible Entropy Control in RLVR with a Gradient-Preserving Perspective
di: Chen, Kun, et al.
Pubblicazione: (2026)
di: Chen, Kun, et al.
Pubblicazione: (2026)
Social-Aware Clustered Federated Learning with Customized Privacy Preservation
di: Wang, Yuntao, et al.
Pubblicazione: (2022)
di: Wang, Yuntao, et al.
Pubblicazione: (2022)
MISS: Multi-Modal Tree Indexing and Searching with Lifelong Sequential Behavior for Retrieval Recommendation
di: Guo, Chengcheng, et al.
Pubblicazione: (2025)
di: Guo, Chengcheng, et al.
Pubblicazione: (2025)
Fast Explanations via Policy Gradient-Optimized Explainer
di: Pan, Deng, et al.
Pubblicazione: (2024)
di: Pan, Deng, et al.
Pubblicazione: (2024)
EPO: Entropy-regularized Policy Optimization for LLM Agents Reinforcement Learning
di: Xu, Wujiang, et al.
Pubblicazione: (2025)
di: Xu, Wujiang, et al.
Pubblicazione: (2025)
DialogBench: Evaluating LLMs as Human-like Dialogue Systems
di: Ou, Jiao, et al.
Pubblicazione: (2023)
di: Ou, Jiao, et al.
Pubblicazione: (2023)
Entropy formula for surface diffeomorphisms
di: Zang, Yuntao
Pubblicazione: (2026)
di: Zang, Yuntao
Pubblicazione: (2026)
Documenti analoghi
-
Klear-Reasoner: Advancing Reasoning Capability via Gradient-Preserving Clipping Policy Optimization
di: Su, Zhenpeng, et al.
Pubblicazione: (2025) -
Entropy Ratio Clipping as a Soft Global Constraint for Stable Reinforcement Learning
di: Su, Zhenpeng, et al.
Pubblicazione: (2025) -
Good Reasoning Makes Good Demonstrations: Implicit Reasoning Quality Supervision via In-Context Reinforcement Learning
di: Mei, Tiehua, et al.
Pubblicazione: (2026) -
DSMoE: Matrix-Partitioned Experts with Dynamic Routing for Computation-Efficient Dense LLMs
di: Lv, Minxuan, et al.
Pubblicazione: (2025) -
Finedeep: Mitigating Sparse Activation in Dense LLMs via Multi-Layer Fine-Grained Experts
di: Pan, Leiyu, et al.
Pubblicazione: (2025)