Rethinking Inverse Reinforcement Learning: from Data Alignment to Task Alignment
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Zhou, Weichao, Li, Wenchao |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Temporal Logic Specification-Conditioned Decision Transformer for Offline Safe Reinforcement Learning
von: Guo, Zijian, et al.
Veröffentlicht: (2024)
von: Guo, Zijian, et al.
Veröffentlicht: (2024)
Inverse-RLignment: Large Language Model Alignment from Demonstrations through Inverse Reinforcement Learning
von: Sun, Hao, et al.
Veröffentlicht: (2024)
von: Sun, Hao, et al.
Veröffentlicht: (2024)
Rethinking LoRA for Data Heterogeneous Federated Learning: Subspace and State Alignment
von: Peng, Hongyi, et al.
Veröffentlicht: (2026)
von: Peng, Hongyi, et al.
Veröffentlicht: (2026)
Inverse Reinforcement Learning with Dynamic Reward Scaling for LLM Alignment
von: Cheng, Ruoxi, et al.
Veröffentlicht: (2025)
von: Cheng, Ruoxi, et al.
Veröffentlicht: (2025)
PAGAR: Taming Reward Misalignment in Inverse Reinforcement Learning-Based Imitation Learning with Protagonist Antagonist Guided Adversarial Reward
von: Zhou, Weichao, et al.
Veröffentlicht: (2023)
von: Zhou, Weichao, et al.
Veröffentlicht: (2023)
Rethinking Robustness: A New Approach to Evaluating Feature Attribution Methods
von: Kiourti, Panagiota, et al.
Veröffentlicht: (2025)
von: Kiourti, Panagiota, et al.
Veröffentlicht: (2025)
LearnAlign: Data Selection for LLM Reinforcement Learning with Improved Gradient Alignment
von: Li, Shipeng, et al.
Veröffentlicht: (2025)
von: Li, Shipeng, et al.
Veröffentlicht: (2025)
Rethinking the Sampling Criteria in Reinforcement Learning for LLM Reasoning: A Competence-Difficulty Alignment Perspective
von: Kong, Deyang, et al.
Veröffentlicht: (2025)
von: Kong, Deyang, et al.
Veröffentlicht: (2025)
Task Addition in Multi-Task Learning by Geometrical Alignment
von: Yim, Soorin, et al.
Veröffentlicht: (2024)
von: Yim, Soorin, et al.
Veröffentlicht: (2024)
Diffusion Model with Representation Alignment for Protein Inverse Folding
von: Wang, Chenglin, et al.
Veröffentlicht: (2024)
von: Wang, Chenglin, et al.
Veröffentlicht: (2024)
Generalization Limits of Reinforcement Learning Alignment
von: Shida, Haruhi, et al.
Veröffentlicht: (2026)
von: Shida, Haruhi, et al.
Veröffentlicht: (2026)
From Coefficients to Directions: Rethinking Model Merging with Directional Alignment
von: Chen, Zhikang, et al.
Veröffentlicht: (2025)
von: Chen, Zhikang, et al.
Veröffentlicht: (2025)
Multi-objective Reinforcement Learning: A Tool for Pluralistic Alignment
von: Vamplew, Peter, et al.
Veröffentlicht: (2024)
von: Vamplew, Peter, et al.
Veröffentlicht: (2024)
Offline Regularised Reinforcement Learning for Large Language Models Alignment
von: Richemond, Pierre Harvey, et al.
Veröffentlicht: (2024)
von: Richemond, Pierre Harvey, et al.
Veröffentlicht: (2024)
TOPPO: Rethinking PPO for Multi-Task Reinforcement Learning with Critic Balancing
von: Li, Yuanpeng, et al.
Veröffentlicht: (2026)
von: Li, Yuanpeng, et al.
Veröffentlicht: (2026)
An Optimization Algorithm for Multimodal Data Alignment
von: Zhang, Wei, et al.
Veröffentlicht: (2025)
von: Zhang, Wei, et al.
Veröffentlicht: (2025)
From Coordinate Matching to Structural Alignment: Rethinking Prototype Alignment in Heterogeneous Federated Learning
von: Wu, Xinghao, et al.
Veröffentlicht: (2026)
von: Wu, Xinghao, et al.
Veröffentlicht: (2026)
Feature Alignment: Rethinking Efficient Active Learning via Proxy in the Context of Pre-trained Models
von: Wen, Ziting, et al.
Veröffentlicht: (2024)
von: Wen, Ziting, et al.
Veröffentlicht: (2024)
Contextual Bilevel Reinforcement Learning for Incentive Alignment
von: Thoma, Vinzenz, et al.
Veröffentlicht: (2024)
von: Thoma, Vinzenz, et al.
Veröffentlicht: (2024)
Similarity as Reward Alignment: Robust and Versatile Preference-based Reinforcement Learning
von: Rajaram, Sara, et al.
Veröffentlicht: (2025)
von: Rajaram, Sara, et al.
Veröffentlicht: (2025)
Inference-Time Alignment Control for Diffusion Models with Reinforcement Learning Guidance
von: Jin, Luozhijie, et al.
Veröffentlicht: (2025)
von: Jin, Luozhijie, et al.
Veröffentlicht: (2025)
Property-driven Protein Inverse Folding With Multi-Objective Preference Alignment
von: Hou, Xiaoyang, et al.
Veröffentlicht: (2026)
von: Hou, Xiaoyang, et al.
Veröffentlicht: (2026)
Cross-Session Decoding of Neural Spiking Data via Task-Conditioned Latent Alignment
von: Zhao, Canyang, et al.
Veröffentlicht: (2026)
von: Zhao, Canyang, et al.
Veröffentlicht: (2026)
Contrastive Reasoning Alignment: Reinforcement Learning from Hidden Representations
von: Luo, Haozheng, et al.
Veröffentlicht: (2026)
von: Luo, Haozheng, et al.
Veröffentlicht: (2026)
Rethinking the Role of Proxy Rewards in Language Model Alignment
von: Kim, Sungdong, et al.
Veröffentlicht: (2024)
von: Kim, Sungdong, et al.
Veröffentlicht: (2024)
Understanding the Learning Dynamics of Alignment with Human Feedback
von: Im, Shawn, et al.
Veröffentlicht: (2024)
von: Im, Shawn, et al.
Veröffentlicht: (2024)
Cultivating Helpful, Personalized, and Creative AI Tutors: A Framework for Pedagogical Alignment using Reinforcement Learning
von: Song, Siyu, et al.
Veröffentlicht: (2025)
von: Song, Siyu, et al.
Veröffentlicht: (2025)
Curriculum Learning for Safety Alignment
von: Kumar, Sandeep, et al.
Veröffentlicht: (2026)
von: Kumar, Sandeep, et al.
Veröffentlicht: (2026)
RTMol: Rethinking Molecule-text Alignment in a Round-trip View
von: Chen, Letian, et al.
Veröffentlicht: (2025)
von: Chen, Letian, et al.
Veröffentlicht: (2025)
BioFormer: Rethinking Cross-Subject Generalization via Spectral Structural Alignment in Biomedical Time-Series
von: Du, Guikang, et al.
Veröffentlicht: (2026)
von: Du, Guikang, et al.
Veröffentlicht: (2026)
Hybrid Inverse Reinforcement Learning
von: Ren, Juntao, et al.
Veröffentlicht: (2024)
von: Ren, Juntao, et al.
Veröffentlicht: (2024)
Lyapunov-Guided Self-Alignment: Test-Time Adaptation for Offline Safe Reinforcement Learning
von: Han, Seungyub, et al.
Veröffentlicht: (2026)
von: Han, Seungyub, et al.
Veröffentlicht: (2026)
Vision-Based Generic Potential Function for Policy Alignment in Multi-Agent Reinforcement Learning
von: Ma, Hao, et al.
Veröffentlicht: (2025)
von: Ma, Hao, et al.
Veröffentlicht: (2025)
Aggregation Alignment for Federated Learning with Mixture-of-Experts under Data Heterogeneity
von: Fang, Zihan, et al.
Veröffentlicht: (2026)
von: Fang, Zihan, et al.
Veröffentlicht: (2026)
Kernel Density Bayesian Inverse Reinforcement Learning
von: Mandyam, Aishwarya, et al.
Veröffentlicht: (2023)
von: Mandyam, Aishwarya, et al.
Veröffentlicht: (2023)
Rethinking Cross-Modal Fine-Tuning: Optimizing the Interaction Between Feature Alignment and Target Fitting
von: Tran, Trong Khiem, et al.
Veröffentlicht: (2026)
von: Tran, Trong Khiem, et al.
Veröffentlicht: (2026)
Rethinking the Foundations for Continual Reinforcement Learning
von: Elelimy, Esraa, et al.
Veröffentlicht: (2025)
von: Elelimy, Esraa, et al.
Veröffentlicht: (2025)
Rethinking Plasticity in Deep Reinforcement Learning
von: He, Zhiqiang
Veröffentlicht: (2026)
von: He, Zhiqiang
Veröffentlicht: (2026)
Provably Efficient Exploration in Inverse Constrained Reinforcement Learning
von: Yue, Bo, et al.
Veröffentlicht: (2024)
von: Yue, Bo, et al.
Veröffentlicht: (2024)
Adaptive Alignment: Dynamic Preference Adjustments via Multi-Objective Reinforcement Learning for Pluralistic AI
von: Harland, Hadassah, et al.
Veröffentlicht: (2024)
von: Harland, Hadassah, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
Temporal Logic Specification-Conditioned Decision Transformer for Offline Safe Reinforcement Learning
von: Guo, Zijian, et al.
Veröffentlicht: (2024) -
Inverse-RLignment: Large Language Model Alignment from Demonstrations through Inverse Reinforcement Learning
von: Sun, Hao, et al.
Veröffentlicht: (2024) -
Rethinking LoRA for Data Heterogeneous Federated Learning: Subspace and State Alignment
von: Peng, Hongyi, et al.
Veröffentlicht: (2026) -
Inverse Reinforcement Learning with Dynamic Reward Scaling for LLM Alignment
von: Cheng, Ruoxi, et al.
Veröffentlicht: (2025) -
PAGAR: Taming Reward Misalignment in Inverse Reinforcement Learning-Based Imitation Learning with Protagonist Antagonist Guided Adversarial Reward
von: Zhou, Weichao, et al.
Veröffentlicht: (2023)