HPO: Hysteretic Policy Optimization for Stable and Efficient Training under Sparse-Reward Regime
Fuente:
arXiv
Salvato in:
| Autori principali: | Sana, Mohamed, Piovesan, Nicola, De Domenico, Antonio, Ayed, Fadhel, Zhang, Haozhe |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
TeleTables: A Benchmark for Large Language Models in Telecom Table Interpretation
di: Ezzakri, Anas, et al.
Pubblicazione: (2025)
di: Ezzakri, Anas, et al.
Pubblicazione: (2025)
Reasoning Language Models for Root Cause Analysis in 5G Wireless Networks
di: Sana, Mohamed, et al.
Pubblicazione: (2025)
di: Sana, Mohamed, et al.
Pubblicazione: (2025)
Large Language Models for Telecom: Forthcoming Impact on the Industry
di: Maatouk, Ali, et al.
Pubblicazione: (2023)
di: Maatouk, Ali, et al.
Pubblicazione: (2023)
Goal-Oriented Time-Series Forecasting: Foundation Framework Design
di: Fechete, Luca-Andrei, et al.
Pubblicazione: (2025)
di: Fechete, Luca-Andrei, et al.
Pubblicazione: (2025)
TeleMath: A Benchmark for Large Language Models in Telecom Mathematical Problem Solving
di: Colle, Vincenzo, et al.
Pubblicazione: (2025)
di: Colle, Vincenzo, et al.
Pubblicazione: (2025)
Telecom Language Models: Must They Be Large?
di: Piovesan, Nicola, et al.
Pubblicazione: (2024)
di: Piovesan, Nicola, et al.
Pubblicazione: (2024)
KVCompose: Efficient Structured KV Cache Compression with Composite Tokens
di: Akulov, Dmitry, et al.
Pubblicazione: (2025)
di: Akulov, Dmitry, et al.
Pubblicazione: (2025)
Hermes: A Large Language Model Framework on the Journey to Autonomous Networks
di: Ayed, Fadhel, et al.
Pubblicazione: (2024)
di: Ayed, Fadhel, et al.
Pubblicazione: (2024)
Intrinsic Reward Policy Optimization for Sparse-Reward Environments
di: Cho, Minjae, et al.
Pubblicazione: (2026)
di: Cho, Minjae, et al.
Pubblicazione: (2026)
Pay Attention to What Matters
di: Silva, Pedro Luiz, et al.
Pubblicazione: (2024)
di: Silva, Pedro Luiz, et al.
Pubblicazione: (2024)
RationalRewards: Reasoning Rewards Scale Visual Generation Both Training and Test Time
di: Wang, Haozhe, et al.
Pubblicazione: (2026)
di: Wang, Haozhe, et al.
Pubblicazione: (2026)
DRPO: Efficient Reasoning via Decoupled Reward Policy Optimization
di: Li, Gang, et al.
Pubblicazione: (2025)
di: Li, Gang, et al.
Pubblicazione: (2025)
Confidence-Controlled Exploration: Efficient Sparse-Reward Policy Learning for Robot Navigation
di: Patel, Bhrij, et al.
Pubblicazione: (2023)
di: Patel, Bhrij, et al.
Pubblicazione: (2023)
Beyond GRPO and On-Policy Distillation: An Empirical Sparse-to-Dense Reward Principle for Language-Model Post-Training
di: Xu, Yuanda, et al.
Pubblicazione: (2026)
di: Xu, Yuanda, et al.
Pubblicazione: (2026)
Telco-RAG: Navigating the Challenges of Retrieval-Augmented Language Models for Telecommunications
di: Bornea, Andrei-Laurentiu, et al.
Pubblicazione: (2024)
di: Bornea, Andrei-Laurentiu, et al.
Pubblicazione: (2024)
Hindsight-Anchored Policy Optimization: Turning Failure into Feedback in Sparse Reward Settings
di: Wu, Yuning, et al.
Pubblicazione: (2026)
di: Wu, Yuning, et al.
Pubblicazione: (2026)
RiskPO: Risk-based Policy Optimization via Verifiable Reward for LLM Post-Training
di: Ren, Tao, et al.
Pubblicazione: (2025)
di: Ren, Tao, et al.
Pubblicazione: (2025)
Highly Efficient Self-Adaptive Reward Shaping for Reinforcement Learning
di: Ma, Haozhe, et al.
Pubblicazione: (2024)
di: Ma, Haozhe, et al.
Pubblicazione: (2024)
What Fundamental Structure in Reward Functions Enables Efficient Sparse-Reward Learning?
di: Shihab, Ibne Farabi, et al.
Pubblicazione: (2025)
di: Shihab, Ibne Farabi, et al.
Pubblicazione: (2025)
Pretrain Value, Not Reward: Decoupled Value Policy Optimization
di: Huang, Chenghua, et al.
Pubblicazione: (2025)
di: Huang, Chenghua, et al.
Pubblicazione: (2025)
ORSO: Accelerating Reward Design via Online Reward Selection and Policy Optimization
di: Zhang, Chen Bo Calvin, et al.
Pubblicazione: (2024)
di: Zhang, Chen Bo Calvin, et al.
Pubblicazione: (2024)
VESPO: Variational Sequence-Level Soft Policy Optimization for Stable Off-Policy LLM Training
di: Shen, Guobin, et al.
Pubblicazione: (2026)
di: Shen, Guobin, et al.
Pubblicazione: (2026)
GOPO: Policy Optimization using Ranked Rewards
di: Choi, Kyuseong, et al.
Pubblicazione: (2026)
di: Choi, Kyuseong, et al.
Pubblicazione: (2026)
Black-Box Optimization From Small Offline Datasets via Meta Learning with Synthetic Tasks
di: Fadhel, Azza, et al.
Pubblicazione: (2026)
di: Fadhel, Azza, et al.
Pubblicazione: (2026)
Value-Free Policy Optimization via Reward Partitioning
di: Faye, Bilal, et al.
Pubblicazione: (2025)
di: Faye, Bilal, et al.
Pubblicazione: (2025)
Exploration by Random Reward Perturbation
di: Ma, Haozhe, et al.
Pubblicazione: (2025)
di: Ma, Haozhe, et al.
Pubblicazione: (2025)
Telco-oRAG: Optimizing Retrieval-augmented Generation for Telecom Queries via Hybrid Retrieval and Neural Routing
di: Bornea, Andrei-Laurentiu, et al.
Pubblicazione: (2025)
di: Bornea, Andrei-Laurentiu, et al.
Pubblicazione: (2025)
FastBO: Fast HPO and NAS with Adaptive Fidelity Identification
di: Jiang, Jiantong, et al.
Pubblicazione: (2024)
di: Jiang, Jiantong, et al.
Pubblicazione: (2024)
Attention-Based Reward Shaping for Sparse and Delayed Rewards
di: Holmes, Ian, et al.
Pubblicazione: (2025)
di: Holmes, Ian, et al.
Pubblicazione: (2025)
Overcoming Reward Overoptimization via Adversarial Policy Optimization with Lightweight Uncertainty Estimation
di: Zhang, Xiaoying, et al.
Pubblicazione: (2024)
di: Zhang, Xiaoying, et al.
Pubblicazione: (2024)
Efficient On-Policy Reinforcement Learning via Exploration of Sparse Parameter Space
di: Zhang, Xinyu, et al.
Pubblicazione: (2025)
di: Zhang, Xinyu, et al.
Pubblicazione: (2025)
ODRPO: Ordinal Decompositions of Discrete Rewards for Robust Policy Optimization
di: Patel, Nirmal, et al.
Pubblicazione: (2026)
di: Patel, Nirmal, et al.
Pubblicazione: (2026)
CROP: Conservative Reward for Model-based Offline Policy Optimization
di: Li, Hao, et al.
Pubblicazione: (2023)
di: Li, Hao, et al.
Pubblicazione: (2023)
Topology-Aware Revival for Efficient Sparse Training
di: Jin, Meiling, et al.
Pubblicazione: (2026)
di: Jin, Meiling, et al.
Pubblicazione: (2026)
Trust Region Reward Optimization and Proximal Inverse Reward Optimization Algorithm
di: Chen, Yang, et al.
Pubblicazione: (2025)
di: Chen, Yang, et al.
Pubblicazione: (2025)
Revisiting Regularized Policy Optimization for Stable and Efficient Reinforcement Learning in Two-Player Games
di: Ota, Kazuki, et al.
Pubblicazione: (2026)
di: Ota, Kazuki, et al.
Pubblicazione: (2026)
Learning Surrogates for Offline Black-Box Optimization via Gradient Matching
di: Hoang, Minh, et al.
Pubblicazione: (2025)
di: Hoang, Minh, et al.
Pubblicazione: (2025)
Efficient Process Reward Model Training via Active Learning
di: Duan, Keyu, et al.
Pubblicazione: (2025)
di: Duan, Keyu, et al.
Pubblicazione: (2025)
Fairness Aware Reward Optimization
di: Choi, Ching Lam, et al.
Pubblicazione: (2026)
di: Choi, Ching Lam, et al.
Pubblicazione: (2026)
Towards Leveraging AutoML for Sustainable Deep Learning: A Multi-Objective HPO Approach on Deep Shift Neural Networks
di: Hennig, Leona, et al.
Pubblicazione: (2024)
di: Hennig, Leona, et al.
Pubblicazione: (2024)
Documenti analoghi
-
TeleTables: A Benchmark for Large Language Models in Telecom Table Interpretation
di: Ezzakri, Anas, et al.
Pubblicazione: (2025) -
Reasoning Language Models for Root Cause Analysis in 5G Wireless Networks
di: Sana, Mohamed, et al.
Pubblicazione: (2025) -
Large Language Models for Telecom: Forthcoming Impact on the Industry
di: Maatouk, Ali, et al.
Pubblicazione: (2023) -
Goal-Oriented Time-Series Forecasting: Foundation Framework Design
di: Fechete, Luca-Andrei, et al.
Pubblicazione: (2025) -
TeleMath: A Benchmark for Large Language Models in Telecom Mathematical Problem Solving
di: Colle, Vincenzo, et al.
Pubblicazione: (2025)