Experiential Reinforcement Learning
Fuente:
arXiv
Guardado en:
| Autores principales: | Shi, Taiwei, Chen, Sihao, Jiang, Bowen, Song, Linxin, Yang, Longqi, Zhao, Jieyu |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Efficient Reinforcement Finetuning via Adaptive Curriculum Learning
por: Shi, Taiwei, et al.
Publicado: (2025)
por: Shi, Taiwei, et al.
Publicado: (2025)
Skill Reuse as Compression in Agentic RL
por: Xu, Zhikun, et al.
Publicado: (2026)
por: Xu, Zhikun, et al.
Publicado: (2026)
The Hallucination Tax of Reinforcement Finetuning
por: Song, Linxin, et al.
Publicado: (2025)
por: Song, Linxin, et al.
Publicado: (2025)
Towards Effective Experiential Learning: Dual Guidance for Utilization and Internalization
por: Bai, Fei, et al.
Publicado: (2026)
por: Bai, Fei, et al.
Publicado: (2026)
Safer-Instruct: Aligning Language Models with Automated Preference Data
por: Shi, Taiwei, et al.
Publicado: (2023)
por: Shi, Taiwei, et al.
Publicado: (2023)
Experiential Reflective Learning for Self-Improving LLM Agents
por: Allard, Marc-Antoine, et al.
Publicado: (2026)
por: Allard, Marc-Antoine, et al.
Publicado: (2026)
TraPO: A Semi-Supervised Reinforcement Learning Framework for Boosting LLM Reasoning
por: Yang, Shenzhi, et al.
Publicado: (2025)
por: Yang, Shenzhi, et al.
Publicado: (2025)
Experiential Co-Learning of Software-Developing Agents
por: Qian, Chen, et al.
Publicado: (2023)
por: Qian, Chen, et al.
Publicado: (2023)
TACO: Temporal Latent Action-Driven Contrastive Loss for Visual Reinforcement Learning
por: Zheng, Ruijie, et al.
Publicado: (2023)
por: Zheng, Ruijie, et al.
Publicado: (2023)
Conceptual Belief-Informed Reinforcement Learning
por: Gu, Xingrui, et al.
Publicado: (2024)
por: Gu, Xingrui, et al.
Publicado: (2024)
Kolb-Based Experiential Learning for Generalist Agents with Human-Level Kaggle Data Science Performance
por: Grosnit, Antoine, et al.
Publicado: (2024)
por: Grosnit, Antoine, et al.
Publicado: (2024)
ExpeL: LLM Agents Are Experiential Learners
por: Zhao, Andrew, et al.
Publicado: (2023)
por: Zhao, Andrew, et al.
Publicado: (2023)
QuadEnhancer: Leveraging Quadratic Transformations to Enhance Deep Neural Networks
por: Chen, Qian, et al.
Publicado: (2025)
por: Chen, Qian, et al.
Publicado: (2025)
In-Context Compositional Q-Learning for Offline Reinforcement Learning
por: Xu, Qiushui, et al.
Publicado: (2025)
por: Xu, Qiushui, et al.
Publicado: (2025)
Group Fairness in Multi-Task Reinforcement Learning
por: Song, Kefan, et al.
Publicado: (2025)
por: Song, Kefan, et al.
Publicado: (2025)
Speculative Sampling with Reinforcement Learning
por: Wang, Chenan, et al.
Publicado: (2026)
por: Wang, Chenan, et al.
Publicado: (2026)
Learning in Context, Guided by Choice: A Reward-Free Paradigm for Reinforcement Learning with Transformers
por: Dong, Juncheng, et al.
Publicado: (2026)
por: Dong, Juncheng, et al.
Publicado: (2026)
A Survey on Explainable Reinforcement Learning: Concepts, Algorithms, Challenges
por: Qing, Yunpeng, et al.
Publicado: (2022)
por: Qing, Yunpeng, et al.
Publicado: (2022)
Transferable Delay-Aware Reinforcement Learning via Implicit Causal Graph Modeling
por: Zhao, Chenran, et al.
Publicado: (2026)
por: Zhao, Chenran, et al.
Publicado: (2026)
Adaptive Preference Scaling for Reinforcement Learning with Human Feedback
por: Hong, Ilgee, et al.
Publicado: (2024)
por: Hong, Ilgee, et al.
Publicado: (2024)
The Blind Spot of Agent Safety: How Benign User Instructions Expose Critical Vulnerabilities in Computer-Use Agents
por: Ding, Xuwei, et al.
Publicado: (2026)
por: Ding, Xuwei, et al.
Publicado: (2026)
Offline Imitation of Badminton Player Behavior via Experiential Contexts and Brownian Motion
por: Wang, Kuang-Da, et al.
Publicado: (2024)
por: Wang, Kuang-Da, et al.
Publicado: (2024)
Revisiting Reinforcement Learning with Verifiable Rewards from a Contrastive Perspective
por: Zhang, Feng, et al.
Publicado: (2026)
por: Zhang, Feng, et al.
Publicado: (2026)
Offline Reinforcement Learning with Imbalanced Datasets
por: Jiang, Li, et al.
Publicado: (2023)
por: Jiang, Li, et al.
Publicado: (2023)
BAFFLE: Hiding Backdoors in Offline Reinforcement Learning Datasets
por: Gong, Chen, et al.
Publicado: (2022)
por: Gong, Chen, et al.
Publicado: (2022)
Learning Future Representation with Synthetic Observations for Sample-efficient Reinforcement Learning
por: Liu, Xin, et al.
Publicado: (2024)
por: Liu, Xin, et al.
Publicado: (2024)
MARLIN: Multi-Agent Reinforcement Learning for Incremental DAG Discovery
por: Li, Dong, et al.
Publicado: (2026)
por: Li, Dong, et al.
Publicado: (2026)
BECAUSE: Bilinear Causal Representation for Generalizable Offline Model-based Reinforcement Learning
por: Lin, Haohong, et al.
Publicado: (2024)
por: Lin, Haohong, et al.
Publicado: (2024)
Meta-Learning Reinforcement Learning for Crypto-Return Prediction
por: Wang, Junqiao, et al.
Publicado: (2025)
por: Wang, Junqiao, et al.
Publicado: (2025)
Detecting and Filtering Unsafe Training Data via Data Attribution with Denoised Representation
por: Pan, Yijun, et al.
Publicado: (2025)
por: Pan, Yijun, et al.
Publicado: (2025)
Applying Ensemble Models based on Graph Neural Network and Reinforcement Learning for Wind Power Forecasting
por: Song, Hongjin, et al.
Publicado: (2025)
por: Song, Hongjin, et al.
Publicado: (2025)
Multimodal Representation Learning Conditioned on Semantic Relations
por: Qiao, Yang, et al.
Publicado: (2025)
por: Qiao, Yang, et al.
Publicado: (2025)
DSAC: Distributional Soft Actor-Critic for Risk-Sensitive Reinforcement Learning
por: Ma, Xiaoteng, et al.
Publicado: (2020)
por: Ma, Xiaoteng, et al.
Publicado: (2020)
One for All: A Non-Linear Transformer can Enable Cross-Domain Generalization for In-Context Reinforcement Learning
por: He, Bowen, et al.
Publicado: (2026)
por: He, Bowen, et al.
Publicado: (2026)
Sample and Computationally Efficient Continuous-Time Reinforcement Learning with General Function Approximation
por: Zhao, Runze, et al.
Publicado: (2025)
por: Zhao, Runze, et al.
Publicado: (2025)
ECHO: Entropy-Confidence Hybrid Optimization for Test-Time Reinforcement Learning
por: Zhao, Chu, et al.
Publicado: (2026)
por: Zhao, Chu, et al.
Publicado: (2026)
Offline Trajectory Optimization for Offline Reinforcement Learning
por: Zhao, Ziqi, et al.
Publicado: (2024)
por: Zhao, Ziqi, et al.
Publicado: (2024)
Internalizing Meta-Experience into Memory for Guided Reinforcement Learning in Large Language Models
por: Huang, Shiting, et al.
Publicado: (2026)
por: Huang, Shiting, et al.
Publicado: (2026)
Breaking the Exploration Bottleneck: Rubric-Scaffolded Reinforcement Learning for General LLM Reasoning
por: Zhou, Yang, et al.
Publicado: (2025)
por: Zhou, Yang, et al.
Publicado: (2025)
Self Paced Gaussian Contextual Reinforcement Learning
por: Ardakani, Mohsen Sahraei, et al.
Publicado: (2026)
por: Ardakani, Mohsen Sahraei, et al.
Publicado: (2026)
Ejemplares similares
-
Efficient Reinforcement Finetuning via Adaptive Curriculum Learning
por: Shi, Taiwei, et al.
Publicado: (2025) -
Skill Reuse as Compression in Agentic RL
por: Xu, Zhikun, et al.
Publicado: (2026) -
The Hallucination Tax of Reinforcement Finetuning
por: Song, Linxin, et al.
Publicado: (2025) -
Towards Effective Experiential Learning: Dual Guidance for Utilization and Internalization
por: Bai, Fei, et al.
Publicado: (2026) -
Safer-Instruct: Aligning Language Models with Automated Preference Data
por: Shi, Taiwei, et al.
Publicado: (2023)