CARE-RL: Capability-Aware Reinforcement Learning for Mitigating Cross-Domain Conflicts
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Zhang, Rui, Wu, Xinle, Lu, Yao |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Automatic Configuration of LLM Post-Training Pipelines
von: Chwa, Channe, et al.
Veröffentlicht: (2026)
von: Chwa, Channe, et al.
Veröffentlicht: (2026)
CoBA-RL: Capability-Oriented Budget Allocation for Reinforcement Learning in LLMs
von: Yao, Zhiyuan, et al.
Veröffentlicht: (2026)
von: Yao, Zhiyuan, et al.
Veröffentlicht: (2026)
FedCARE: Federated Unlearning with Conflict-Aware Projection and Relearning-Resistant Recovery
von: Li, Yue, et al.
Veröffentlicht: (2026)
von: Li, Yue, et al.
Veröffentlicht: (2026)
GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning
von: Chen, Yi, et al.
Veröffentlicht: (2025)
von: Chen, Yi, et al.
Veröffentlicht: (2025)
Conflict-Aware Adversarial Training
von: Xue, Zhiyu, et al.
Veröffentlicht: (2024)
von: Xue, Zhiyu, et al.
Veröffentlicht: (2024)
Scaling In-Context Online Learning Capability of LLMs via Cross-Episode Meta-RL
von: Lin, Xiaofeng, et al.
Veröffentlicht: (2026)
von: Lin, Xiaofeng, et al.
Veröffentlicht: (2026)
SAFE-RL: Saliency-Aware Counterfactual Explainer for Deep Reinforcement Learning Policies
von: Samadi, Amir, et al.
Veröffentlicht: (2024)
von: Samadi, Amir, et al.
Veröffentlicht: (2024)
Planner-Centric Reinforcement Learning for Deep Research with Structure-Aware Reward
von: Hussain, Mustafa Anis, et al.
Veröffentlicht: (2026)
von: Hussain, Mustafa Anis, et al.
Veröffentlicht: (2026)
RL-GPT: Integrating Reinforcement Learning and Code-as-policy
von: Liu, Shaoteng, et al.
Veröffentlicht: (2024)
von: Liu, Shaoteng, et al.
Veröffentlicht: (2024)
Contrastive Representation for Data Filtering in Cross-Domain Offline Reinforcement Learning
von: Wen, Xiaoyu, et al.
Veröffentlicht: (2024)
von: Wen, Xiaoyu, et al.
Veröffentlicht: (2024)
RL-PLUS: Countering Capability Boundary Collapse of LLMs in Reinforcement Learning with Hybrid-policy Optimization
von: Dong, Yihong, et al.
Veröffentlicht: (2025)
von: Dong, Yihong, et al.
Veröffentlicht: (2025)
RL$^3$: Boosting Meta Reinforcement Learning via RL inside RL$^2$
von: Bhatia, Abhinav, et al.
Veröffentlicht: (2023)
von: Bhatia, Abhinav, et al.
Veröffentlicht: (2023)
FBOS-RL: Feedback-Driven Bi-Objective Synergistic Reinforcement Learning
von: Zhang, Xikai, et al.
Veröffentlicht: (2026)
von: Zhang, Xikai, et al.
Veröffentlicht: (2026)
LPPG-RL: Lexicographically Projected Policy Gradient Reinforcement Learning with Subproblem Exploration
von: Qiu, Ruiyu, et al.
Veröffentlicht: (2025)
von: Qiu, Ruiyu, et al.
Veröffentlicht: (2025)
Teaching RL Agents to Act Better: VLM as Action Advisor for Online Reinforcement Learning
von: Wu, Xiefeng, et al.
Veröffentlicht: (2025)
von: Wu, Xiefeng, et al.
Veröffentlicht: (2025)
Bridging Dynamics Gaps via Diffusion Schrödinger Bridge for Cross-Domain Reinforcement Learning
von: Zhang, Hanping, et al.
Veröffentlicht: (2026)
von: Zhang, Hanping, et al.
Veröffentlicht: (2026)
Is PRM Necessary? Problem-Solving RL Implicitly Induces PRM Capability in LLMs
von: Feng, Zhangying, et al.
Veröffentlicht: (2025)
von: Feng, Zhangying, et al.
Veröffentlicht: (2025)
Paying Less Generalization Tax: A Cross-Domain Generalization Study of RL Training for LLM Agents
von: Liu, Zhihan, et al.
Veröffentlicht: (2026)
von: Liu, Zhihan, et al.
Veröffentlicht: (2026)
RL-Struct: A Lightweight Reinforcement Learning Framework for Reliable Structured Output in LLMs
von: Hu, Ruike, et al.
Veröffentlicht: (2025)
von: Hu, Ruike, et al.
Veröffentlicht: (2025)
CARE: Confounder-Aware Aggregation for Reliable LLM Evaluation
von: Zhao, Jitian, et al.
Veröffentlicht: (2026)
von: Zhao, Jitian, et al.
Veröffentlicht: (2026)
MobileRL: Online Agentic Reinforcement Learning for Mobile GUI Agents
von: Xu, Yifan, et al.
Veröffentlicht: (2025)
von: Xu, Yifan, et al.
Veröffentlicht: (2025)
CARE: Covariance-Aware and Rank-Enhanced Decomposition for Enabling Multi-Head Latent Attention
von: Zhou, Zhongzhu, et al.
Veröffentlicht: (2026)
von: Zhou, Zhongzhu, et al.
Veröffentlicht: (2026)
AdaCuRL: Adaptive Curriculum Reinforcement Learning with Invalid Sample Mitigation and Historical Revisiting
von: Li, Renda, et al.
Veröffentlicht: (2025)
von: Li, Renda, et al.
Veröffentlicht: (2025)
RL2Grid: Benchmarking Reinforcement Learning in Power Grid Operations
von: Marchesini, Enrico, et al.
Veröffentlicht: (2025)
von: Marchesini, Enrico, et al.
Veröffentlicht: (2025)
EchoRL: Reinforcement Learning via Rollout Echoing
von: Bi, Jinhe, et al.
Veröffentlicht: (2026)
von: Bi, Jinhe, et al.
Veröffentlicht: (2026)
RL4CO: an Extensive Reinforcement Learning for Combinatorial Optimization Benchmark
von: Berto, Federico, et al.
Veröffentlicht: (2023)
von: Berto, Federico, et al.
Veröffentlicht: (2023)
SPEC-RL: Accelerating On-Policy Reinforcement Learning with Speculative Rollouts
von: Liu, Bingshuai, et al.
Veröffentlicht: (2025)
von: Liu, Bingshuai, et al.
Veröffentlicht: (2025)
Beyond Reasoning Gains: Mitigating General Capabilities Forgetting in Large Reasoning Models
von: Phan, Hoang, et al.
Veröffentlicht: (2025)
von: Phan, Hoang, et al.
Veröffentlicht: (2025)
LlamaRL: A Distributed Asynchronous Reinforcement Learning Framework for Efficient Large-scale LLM Training
von: Wu, Bo, et al.
Veröffentlicht: (2025)
von: Wu, Bo, et al.
Veröffentlicht: (2025)
Dual RL: Unification and New Methods for Reinforcement and Imitation Learning
von: Sikchi, Harshit, et al.
Veröffentlicht: (2023)
von: Sikchi, Harshit, et al.
Veröffentlicht: (2023)
Assessing the Zero-Shot Capabilities of LLMs for Action Evaluation in RL
von: Pignatelli, Eduardo, et al.
Veröffentlicht: (2024)
von: Pignatelli, Eduardo, et al.
Veröffentlicht: (2024)
SortedRL: Accelerating RL Training for LLMs through Online Length-Aware Scheduling
von: Zhang, Yiqi, et al.
Veröffentlicht: (2026)
von: Zhang, Yiqi, et al.
Veröffentlicht: (2026)
Mitigating LLM Hallucination via Behaviorally Calibrated Reinforcement Learning
von: Wu, Jiayun, et al.
Veröffentlicht: (2025)
von: Wu, Jiayun, et al.
Veröffentlicht: (2025)
Knowledge Transfer for Cross-Domain Reinforcement Learning: A Systematic Review
von: Serrano, Sergio A., et al.
Veröffentlicht: (2024)
von: Serrano, Sergio A., et al.
Veröffentlicht: (2024)
Failure-Aware RL: Reliable Offline-to-Online Reinforcement Learning with Self-Recovery for Real-World Manipulation
von: Li, Huanyu, et al.
Veröffentlicht: (2026)
von: Li, Huanyu, et al.
Veröffentlicht: (2026)
Soft Conflict-Resolution Decision Transformer for Offline Multi-Task Reinforcement Learning
von: Wang, Shudong, et al.
Veröffentlicht: (2025)
von: Wang, Shudong, et al.
Veröffentlicht: (2025)
RL-STaR: Theoretical Analysis of Reinforcement Learning Frameworks for Self-Taught Reasoner
von: Chang, Fu-Chieh, et al.
Veröffentlicht: (2024)
von: Chang, Fu-Chieh, et al.
Veröffentlicht: (2024)
GAR: Generative Adversarial Reinforcement Learning for Formal Theorem Proving
von: Wang, Ruida, et al.
Veröffentlicht: (2025)
von: Wang, Ruida, et al.
Veröffentlicht: (2025)
Discovering Temporally-Aware Reinforcement Learning Algorithms
von: Jackson, Matthew Thomas, et al.
Veröffentlicht: (2024)
von: Jackson, Matthew Thomas, et al.
Veröffentlicht: (2024)
Graph-R1: Incentivizing the Zero-Shot Graph Learning Capability in LLMs via Explicit Reasoning
von: Wu, Yicong, et al.
Veröffentlicht: (2025)
von: Wu, Yicong, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
Automatic Configuration of LLM Post-Training Pipelines
von: Chwa, Channe, et al.
Veröffentlicht: (2026) -
CoBA-RL: Capability-Oriented Budget Allocation for Reinforcement Learning in LLMs
von: Yao, Zhiyuan, et al.
Veröffentlicht: (2026) -
FedCARE: Federated Unlearning with Conflict-Aware Projection and Relearning-Resistant Recovery
von: Li, Yue, et al.
Veröffentlicht: (2026) -
GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning
von: Chen, Yi, et al.
Veröffentlicht: (2025) -
Conflict-Aware Adversarial Training
von: Xue, Zhiyu, et al.
Veröffentlicht: (2024)