Enregistré dans:
| Auteurs principaux: | Yan, Renye, Gan, Yaozhong, Wu, You, Xing, Junliang, Liangn, Ling, Zhu, Yeshang, Cai, Yimao |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2410.04498 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
The Exploration-Exploitation Dilemma Revisited: An Entropy Perspective
par: Yan, Renye, et autres
Publié: (2024)
par: Yan, Renye, et autres
Publié: (2024)
Reflective Policy Optimization
par: Gan, Yaozhong, et autres
Publié: (2024)
par: Gan, Yaozhong, et autres
Publié: (2024)
Transductive Off-policy Proximal Policy Optimization
par: Gan, Yaozhong, et autres
Publié: (2024)
par: Gan, Yaozhong, et autres
Publié: (2024)
MARPO: A Reflective Policy Optimization for Multi Agent Reinforcement Learning
par: Wu, Cuiling, et autres
Publié: (2025)
par: Wu, Cuiling, et autres
Publié: (2025)
Do Less, Achieve More: Do We Need Every-Step Optimization for RL Fine-tuning of Diffusion Models?
par: Yan, Renye, et autres
Publié: (2026)
par: Yan, Renye, et autres
Publié: (2026)
Memento 2: Learning by Stateful Reflective Memory
par: Wang, Jun
Publié: (2025)
par: Wang, Jun
Publié: (2025)
A Sanity Check for Multi-In-Domain Face Forgery Detection in the Real World
par: Cheng, Jikang, et autres
Publié: (2025)
par: Cheng, Jikang, et autres
Publié: (2025)
AdaLomo: Low-memory Optimization with Adaptive Learning Rate
par: Lv, Kai, et autres
Publié: (2023)
par: Lv, Kai, et autres
Publié: (2023)
Synergizing Reinforcement Learning and Genetic Algorithms for Neural Combinatorial Optimization
par: Gu, Shengda, et autres
Publié: (2025)
par: Gu, Shengda, et autres
Publié: (2025)
AdaMuon: Adaptive Muon Optimizer
par: Si, Chongjie, et autres
Publié: (2025)
par: Si, Chongjie, et autres
Publié: (2025)
Efficient Multi-Task Reinforcement Learning with Cross-Task Policy Guidance
par: He, Jinmin, et autres
Publié: (2025)
par: He, Jinmin, et autres
Publié: (2025)
AdaCubic: An Adaptive Cubic Regularization Optimizer for Deep Learning
par: Tsingalis, Ioannis, et autres
Publié: (2026)
par: Tsingalis, Ioannis, et autres
Publié: (2026)
AdaFlow: Imitation Learning with Variance-Adaptive Flow-Based Policies
par: Hu, Xixi, et autres
Publié: (2024)
par: Hu, Xixi, et autres
Publié: (2024)
AdaCoT: Pareto-Optimal Adaptive Chain-of-Thought Triggering via Reinforcement Learning
par: Lou, Chenwei, et autres
Publié: (2025)
par: Lou, Chenwei, et autres
Publié: (2025)
AdaTKG: Adaptive Memory for Temporal Knowledge Graph Reasoning
par: Lee, Seunghan, et autres
Publié: (2026)
par: Lee, Seunghan, et autres
Publié: (2026)
AdaMuS: Adaptive Multi-view Sparsity Learning for Dimensionally Unbalanced Data
par: Xu, Cai, et autres
Publié: (2026)
par: Xu, Cai, et autres
Publié: (2026)
AdaFRUGAL: Adaptive Memory-Efficient Training with Dynamic Control
par: Bui, Quang-Hung, et autres
Publié: (2025)
par: Bui, Quang-Hung, et autres
Publié: (2025)
Memento-Skills: Let Agents Design Agents
par: Zhou, Huichi, et autres
Publié: (2026)
par: Zhou, Huichi, et autres
Publié: (2026)
BiBLDR: Bidirectional Behavior Learning for Drug Repositioning
par: Zhang, Renye, et autres
Publié: (2025)
par: Zhang, Renye, et autres
Publié: (2025)
Inner-Probe: Discovering Copyright-related Data Generation in LLM Architecture
par: Ma, Qichao, et autres
Publié: (2024)
par: Ma, Qichao, et autres
Publié: (2024)
Memento: Fine-tuning LLM Agents without Fine-tuning LLMs
par: Zhou, Huichi, et autres
Publié: (2025)
par: Zhou, Huichi, et autres
Publié: (2025)
AdaCL:Adaptive Continual Learning
par: Yildirim, Elif Ceren Gok, et autres
Publié: (2023)
par: Yildirim, Elif Ceren Gok, et autres
Publié: (2023)
Ada-MSHyper: Adaptive Multi-Scale Hypergraph Transformer for Time Series Forecasting
par: Shang, Zongjiang, et autres
Publié: (2024)
par: Shang, Zongjiang, et autres
Publié: (2024)
AdaKernel: Learning Adaptive Kernel Parameters for Spatiotemporal Graph Neural Networks
par: Zhang, Zhongyue, et autres
Publié: (2026)
par: Zhang, Zhongyue, et autres
Publié: (2026)
AdaMeZO: Adam-style Zeroth-Order Optimizer for LLM Fine-tuning Without Maintaining the Moments
par: Cai, Zhijie, et autres
Publié: (2026)
par: Cai, Zhijie, et autres
Publié: (2026)
AdaCuRL: Adaptive Curriculum Reinforcement Learning with Invalid Sample Mitigation and Historical Revisiting
par: Li, Renda, et autres
Publié: (2025)
par: Li, Renda, et autres
Publié: (2025)
AdaFair-MARL: Enforcing Adaptive Fairness Constraints in Multi-Agent Reinforcement Learning
par: Ekpo, Promise, et autres
Publié: (2025)
par: Ekpo, Promise, et autres
Publié: (2025)
Temperature as a Meta-Policy: Adaptive Temperature in LLM Reinforcement Learning
par: Dang, Haoran, et autres
Publié: (2026)
par: Dang, Haoran, et autres
Publié: (2026)
BAPO: Stabilizing Off-Policy Reinforcement Learning for LLMs via Balanced Policy Optimization with Adaptive Clipping
par: Xi, Zhiheng, et autres
Publié: (2025)
par: Xi, Zhiheng, et autres
Publié: (2025)
MementoGUI: Learning Agentic Multimodal Memory Control for Long-Horizon GUI Agents
par: Zeng, Ziyun, et autres
Publié: (2026)
par: Zeng, Ziyun, et autres
Publié: (2026)
Network Topology Optimization via Deep Reinforcement Learning
par: Li, Zhuoran, et autres
Publié: (2022)
par: Li, Zhuoran, et autres
Publié: (2022)
AdaFisher: Adaptive Second Order Optimization via Fisher Information
par: Gomes, Damien Martins, et autres
Publié: (2024)
par: Gomes, Damien Martins, et autres
Publié: (2024)
Belief-Based Offline Reinforcement Learning for Delay-Robust Policy Optimization
par: Zhan, Simon Sinong, et autres
Publié: (2025)
par: Zhan, Simon Sinong, et autres
Publié: (2025)
MHPO: Modulated Hazard-aware Policy Optimization for Stable Reinforcement Learning
par: Wang, Hongjun, et autres
Publié: (2026)
par: Wang, Hongjun, et autres
Publié: (2026)
Reinforce-Ada: An Adaptive Sampling Framework under Non-linear RL Objectives
par: Xiong, Wei, et autres
Publié: (2025)
par: Xiong, Wei, et autres
Publié: (2025)
AceGRPO: Adaptive Curriculum Enhanced Group Relative Policy Optimization for Autonomous Machine Learning Engineering
par: Cai, Yuzhu, et autres
Publié: (2026)
par: Cai, Yuzhu, et autres
Publié: (2026)
AdaWorld: Learning Adaptable World Models with Latent Actions
par: Gao, Shenyuan, et autres
Publié: (2025)
par: Gao, Shenyuan, et autres
Publié: (2025)
On the Reuse Bias in Off-Policy Reinforcement Learning
par: Ying, Chengyang, et autres
Publié: (2022)
par: Ying, Chengyang, et autres
Publié: (2022)
AdaRankGrad: Adaptive Gradient-Rank and Moments for Memory-Efficient LLMs Training and Fine-Tuning
par: Refael, Yehonathan, et autres
Publié: (2024)
par: Refael, Yehonathan, et autres
Publié: (2024)
Adaptive Policy Synchronization for Scalable Reinforcement Learning
par: Lafuente-Mercado, Rodney
Publié: (2025)
par: Lafuente-Mercado, Rodney
Publié: (2025)
Documents similaires
-
The Exploration-Exploitation Dilemma Revisited: An Entropy Perspective
par: Yan, Renye, et autres
Publié: (2024) -
Reflective Policy Optimization
par: Gan, Yaozhong, et autres
Publié: (2024) -
Transductive Off-policy Proximal Policy Optimization
par: Gan, Yaozhong, et autres
Publié: (2024) -
MARPO: A Reflective Policy Optimization for Multi Agent Reinforcement Learning
par: Wu, Cuiling, et autres
Publié: (2025) -
Do Less, Achieve More: Do We Need Every-Step Optimization for RL Fine-tuning of Diffusion Models?
par: Yan, Renye, et autres
Publié: (2026)