Solving Continual Offline RL through Selective Weights Activation on Aligned Spaces
Fuente:
arXiv
Salvato in:
| Autori principali: | Hu, Jifeng, Huang, Sili, Shen, Li, Yang, Zhejian, Hu, Shengchao, Tang, Shisong, Chen, Hechang, Chang, Yi, Tao, Dacheng, Sun, Lichao |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Analytic Energy-Guided Policy Optimization for Offline Reinforcement Learning
di: Hu, Jifeng, et al.
Pubblicazione: (2025)
di: Hu, Jifeng, et al.
Pubblicazione: (2025)
Continual Diffuser (CoD): Mastering Continual Offline Reinforcement Learning with Experience Rehearsal
di: Hu, Jifeng, et al.
Pubblicazione: (2024)
di: Hu, Jifeng, et al.
Pubblicazione: (2024)
Decision Mamba: Reinforcement Learning via Hybrid Selective Sequence Modeling
di: Huang, Sili, et al.
Pubblicazione: (2024)
di: Huang, Sili, et al.
Pubblicazione: (2024)
A Simple Unified Uncertainty-Guided Framework for Offline-to-Online Reinforcement Learning
di: Guo, Siyuan, et al.
Pubblicazione: (2023)
di: Guo, Siyuan, et al.
Pubblicazione: (2023)
Decision Flow Policy Optimization
di: Hu, Jifeng, et al.
Pubblicazione: (2025)
di: Hu, Jifeng, et al.
Pubblicazione: (2025)
In-Context Decision Transformer: Reinforcement Learning via Hierarchical Chain-of-Thought
di: Huang, Sili, et al.
Pubblicazione: (2024)
di: Huang, Sili, et al.
Pubblicazione: (2024)
Continual Task Learning through Adaptive Policy Self-Composition
di: Hu, Shengchao, et al.
Pubblicazione: (2024)
di: Hu, Shengchao, et al.
Pubblicazione: (2024)
Solving Continual Offline Reinforcement Learning with Decision Transformer
di: Huang, Kaixin, et al.
Pubblicazione: (2024)
di: Huang, Kaixin, et al.
Pubblicazione: (2024)
HarmoDT: Harmony Multi-Task Decision Transformer for Offline Reinforcement Learning
di: Hu, Shengchao, et al.
Pubblicazione: (2024)
di: Hu, Shengchao, et al.
Pubblicazione: (2024)
SeWA: Selective Weight Average via Probabilistic Masking
di: Wang, Peng, et al.
Pubblicazione: (2025)
di: Wang, Peng, et al.
Pubblicazione: (2025)
Q-value Regularized Transformer for Offline Reinforcement Learning
di: Hu, Shengchao, et al.
Pubblicazione: (2024)
di: Hu, Shengchao, et al.
Pubblicazione: (2024)
Learning Multi-Agent Communication from Graph Modeling Perspective
di: Hu, Shengchao, et al.
Pubblicazione: (2024)
di: Hu, Shengchao, et al.
Pubblicazione: (2024)
Communication Learning in Multi-Agent Systems from Graph Modeling Perspective
di: Hu, Shengchao, et al.
Pubblicazione: (2024)
di: Hu, Shengchao, et al.
Pubblicazione: (2024)
Task-Aware Harmony Multi-Task Decision Transformer for Offline Reinforcement Learning
di: Fan, Ziqing, et al.
Pubblicazione: (2024)
di: Fan, Ziqing, et al.
Pubblicazione: (2024)
Offline Behavioral Data Selection
di: Lei, Shiye, et al.
Pubblicazione: (2025)
di: Lei, Shiye, et al.
Pubblicazione: (2025)
TGSBM: Transformer-Guided Stochastic Block Model for Link Prediction
di: Yang, Zhejian, et al.
Pubblicazione: (2026)
di: Yang, Zhejian, et al.
Pubblicazione: (2026)
Prompt Tuning with Diffusion for Few-Shot Pre-trained Policy Generalization
di: Hu, Shengchao, et al.
Pubblicazione: (2024)
di: Hu, Shengchao, et al.
Pubblicazione: (2024)
Combatting Dimensional Collapse in LLM Pre-Training Data via Diversified File Selection
di: Fan, Ziqing, et al.
Pubblicazione: (2025)
di: Fan, Ziqing, et al.
Pubblicazione: (2025)
Why Self-Rewarding Works: Theoretical Guarantees for Iterative Alignment of Language Models
di: Fu, Shi, et al.
Pubblicazione: (2026)
di: Fu, Shi, et al.
Pubblicazione: (2026)
A-FedPD: Aligning Dual-Drift is All Federated Primal-Dual Learning Needs
di: Sun, Yan, et al.
Pubblicazione: (2024)
di: Sun, Yan, et al.
Pubblicazione: (2024)
Offline Behavior Distillation
di: Lei, Shiye, et al.
Pubblicazione: (2024)
di: Lei, Shiye, et al.
Pubblicazione: (2024)
Mining Citywide Dengue Spread Patterns in Singapore Through Hotspot Dynamics from Open Web Data
di: Huang, Liping, et al.
Pubblicazione: (2026)
di: Huang, Liping, et al.
Pubblicazione: (2026)
Selective Uncertainty Propagation in Offline RL
di: Krishnamurthy, Sanath Kumar, et al.
Pubblicazione: (2023)
di: Krishnamurthy, Sanath Kumar, et al.
Pubblicazione: (2023)
State Diversity Matters in Offline Behavior Distillation
di: Lei, Shiye, et al.
Pubblicazione: (2025)
di: Lei, Shiye, et al.
Pubblicazione: (2025)
Multinoulli Extension: A Lossless Continuous Relaxation for Partition-Constrained Subset Selection
di: Zhang, Qixin, et al.
Pubblicazione: (2026)
di: Zhang, Qixin, et al.
Pubblicazione: (2026)
A Unified Analysis for Finite Weight Averaging
di: Wang, Peng, et al.
Pubblicazione: (2024)
di: Wang, Peng, et al.
Pubblicazione: (2024)
Agentic Robot: A Brain-Inspired Framework for Vision-Language-Action Models in Embodied Agents
di: Yang, Zhejian, et al.
Pubblicazione: (2025)
di: Yang, Zhejian, et al.
Pubblicazione: (2025)
Offline RL by Reward-Weighted Fine-Tuning for Conversation Optimization
di: Mukherjee, Subhojyoti, et al.
Pubblicazione: (2025)
di: Mukherjee, Subhojyoti, et al.
Pubblicazione: (2025)
Are Expressive Models Truly Necessary for Offline RL?
di: Wang, Guan, et al.
Pubblicazione: (2024)
di: Wang, Guan, et al.
Pubblicazione: (2024)
Merging Models on the Fly Without Retraining: A Sequential Approach to Scalable Continual Model Merging
di: Tang, Anke, et al.
Pubblicazione: (2025)
di: Tang, Anke, et al.
Pubblicazione: (2025)
Is Mamba Compatible with Trajectory Optimization in Offline Reinforcement Learning?
di: Dai, Yang, et al.
Pubblicazione: (2024)
di: Dai, Yang, et al.
Pubblicazione: (2024)
Rethinking the Role of Dynamic Sparse Training for Scalable Deep Reinforcement Learning
di: Ma, Guozheng, et al.
Pubblicazione: (2025)
di: Ma, Guozheng, et al.
Pubblicazione: (2025)
Reason-KE++: Aligning the Process, Not Just the Outcome, for Faithful LLM Knowledge Editing
di: Wu, Yuchen, et al.
Pubblicazione: (2025)
di: Wu, Yuchen, et al.
Pubblicazione: (2025)
NeuroStrike: Neuron-Level Attacks on Aligned LLMs
di: Wu, Lichao
Pubblicazione: (2025)
di: Wu, Lichao
Pubblicazione: (2025)
Rethinking Data Curation in LLM Training: Online Reweighting Offers Better Generalization than Offline Methods
di: Zhao, Wanru, et al.
Pubblicazione: (2026)
di: Zhao, Wanru, et al.
Pubblicazione: (2026)
CASCADE: Case-Based Continual Adaptation for Large Language Models During Deployment
di: Guo, Siyuan, et al.
Pubblicazione: (2026)
di: Guo, Siyuan, et al.
Pubblicazione: (2026)
Merging Multi-Task Models via Weight-Ensembling Mixture of Experts
di: Tang, Anke, et al.
Pubblicazione: (2024)
di: Tang, Anke, et al.
Pubblicazione: (2024)
Advantage Weighted Matching: Aligning RL with Pretraining in Diffusion Models
di: Xue, Shuchen, et al.
Pubblicazione: (2025)
di: Xue, Shuchen, et al.
Pubblicazione: (2025)
DISA: Offline Importance Sampling for Distribution-Matching LLM-RL
di: Wang, Shaobo, et al.
Pubblicazione: (2026)
di: Wang, Shaobo, et al.
Pubblicazione: (2026)
BadVLA: Towards Backdoor Attacks on Vision-Language-Action Models via Objective-Decoupled Optimization
di: Zhou, Xueyang, et al.
Pubblicazione: (2025)
di: Zhou, Xueyang, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Analytic Energy-Guided Policy Optimization for Offline Reinforcement Learning
di: Hu, Jifeng, et al.
Pubblicazione: (2025) -
Continual Diffuser (CoD): Mastering Continual Offline Reinforcement Learning with Experience Rehearsal
di: Hu, Jifeng, et al.
Pubblicazione: (2024) -
Decision Mamba: Reinforcement Learning via Hybrid Selective Sequence Modeling
di: Huang, Sili, et al.
Pubblicazione: (2024) -
A Simple Unified Uncertainty-Guided Framework for Offline-to-Online Reinforcement Learning
di: Guo, Siyuan, et al.
Pubblicazione: (2023) -
Decision Flow Policy Optimization
di: Hu, Jifeng, et al.
Pubblicazione: (2025)