Rethinking Inverse Reinforcement Learning: from Data Alignment to Task Alignment
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhou, Weichao, Li, Wenchao |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Temporal Logic Specification-Conditioned Decision Transformer for Offline Safe Reinforcement Learning
di: Guo, Zijian, et al.
Pubblicazione: (2024)
di: Guo, Zijian, et al.
Pubblicazione: (2024)
Inverse-RLignment: Large Language Model Alignment from Demonstrations through Inverse Reinforcement Learning
di: Sun, Hao, et al.
Pubblicazione: (2024)
di: Sun, Hao, et al.
Pubblicazione: (2024)
Rethinking LoRA for Data Heterogeneous Federated Learning: Subspace and State Alignment
di: Peng, Hongyi, et al.
Pubblicazione: (2026)
di: Peng, Hongyi, et al.
Pubblicazione: (2026)
Inverse Reinforcement Learning with Dynamic Reward Scaling for LLM Alignment
di: Cheng, Ruoxi, et al.
Pubblicazione: (2025)
di: Cheng, Ruoxi, et al.
Pubblicazione: (2025)
PAGAR: Taming Reward Misalignment in Inverse Reinforcement Learning-Based Imitation Learning with Protagonist Antagonist Guided Adversarial Reward
di: Zhou, Weichao, et al.
Pubblicazione: (2023)
di: Zhou, Weichao, et al.
Pubblicazione: (2023)
Rethinking Robustness: A New Approach to Evaluating Feature Attribution Methods
di: Kiourti, Panagiota, et al.
Pubblicazione: (2025)
di: Kiourti, Panagiota, et al.
Pubblicazione: (2025)
LearnAlign: Data Selection for LLM Reinforcement Learning with Improved Gradient Alignment
di: Li, Shipeng, et al.
Pubblicazione: (2025)
di: Li, Shipeng, et al.
Pubblicazione: (2025)
Rethinking the Sampling Criteria in Reinforcement Learning for LLM Reasoning: A Competence-Difficulty Alignment Perspective
di: Kong, Deyang, et al.
Pubblicazione: (2025)
di: Kong, Deyang, et al.
Pubblicazione: (2025)
Task Addition in Multi-Task Learning by Geometrical Alignment
di: Yim, Soorin, et al.
Pubblicazione: (2024)
di: Yim, Soorin, et al.
Pubblicazione: (2024)
Diffusion Model with Representation Alignment for Protein Inverse Folding
di: Wang, Chenglin, et al.
Pubblicazione: (2024)
di: Wang, Chenglin, et al.
Pubblicazione: (2024)
Generalization Limits of Reinforcement Learning Alignment
di: Shida, Haruhi, et al.
Pubblicazione: (2026)
di: Shida, Haruhi, et al.
Pubblicazione: (2026)
From Coefficients to Directions: Rethinking Model Merging with Directional Alignment
di: Chen, Zhikang, et al.
Pubblicazione: (2025)
di: Chen, Zhikang, et al.
Pubblicazione: (2025)
Multi-objective Reinforcement Learning: A Tool for Pluralistic Alignment
di: Vamplew, Peter, et al.
Pubblicazione: (2024)
di: Vamplew, Peter, et al.
Pubblicazione: (2024)
Offline Regularised Reinforcement Learning for Large Language Models Alignment
di: Richemond, Pierre Harvey, et al.
Pubblicazione: (2024)
di: Richemond, Pierre Harvey, et al.
Pubblicazione: (2024)
TOPPO: Rethinking PPO for Multi-Task Reinforcement Learning with Critic Balancing
di: Li, Yuanpeng, et al.
Pubblicazione: (2026)
di: Li, Yuanpeng, et al.
Pubblicazione: (2026)
An Optimization Algorithm for Multimodal Data Alignment
di: Zhang, Wei, et al.
Pubblicazione: (2025)
di: Zhang, Wei, et al.
Pubblicazione: (2025)
From Coordinate Matching to Structural Alignment: Rethinking Prototype Alignment in Heterogeneous Federated Learning
di: Wu, Xinghao, et al.
Pubblicazione: (2026)
di: Wu, Xinghao, et al.
Pubblicazione: (2026)
Feature Alignment: Rethinking Efficient Active Learning via Proxy in the Context of Pre-trained Models
di: Wen, Ziting, et al.
Pubblicazione: (2024)
di: Wen, Ziting, et al.
Pubblicazione: (2024)
Contextual Bilevel Reinforcement Learning for Incentive Alignment
di: Thoma, Vinzenz, et al.
Pubblicazione: (2024)
di: Thoma, Vinzenz, et al.
Pubblicazione: (2024)
Similarity as Reward Alignment: Robust and Versatile Preference-based Reinforcement Learning
di: Rajaram, Sara, et al.
Pubblicazione: (2025)
di: Rajaram, Sara, et al.
Pubblicazione: (2025)
Inference-Time Alignment Control for Diffusion Models with Reinforcement Learning Guidance
di: Jin, Luozhijie, et al.
Pubblicazione: (2025)
di: Jin, Luozhijie, et al.
Pubblicazione: (2025)
Property-driven Protein Inverse Folding With Multi-Objective Preference Alignment
di: Hou, Xiaoyang, et al.
Pubblicazione: (2026)
di: Hou, Xiaoyang, et al.
Pubblicazione: (2026)
Cross-Session Decoding of Neural Spiking Data via Task-Conditioned Latent Alignment
di: Zhao, Canyang, et al.
Pubblicazione: (2026)
di: Zhao, Canyang, et al.
Pubblicazione: (2026)
Contrastive Reasoning Alignment: Reinforcement Learning from Hidden Representations
di: Luo, Haozheng, et al.
Pubblicazione: (2026)
di: Luo, Haozheng, et al.
Pubblicazione: (2026)
Rethinking the Role of Proxy Rewards in Language Model Alignment
di: Kim, Sungdong, et al.
Pubblicazione: (2024)
di: Kim, Sungdong, et al.
Pubblicazione: (2024)
Understanding the Learning Dynamics of Alignment with Human Feedback
di: Im, Shawn, et al.
Pubblicazione: (2024)
di: Im, Shawn, et al.
Pubblicazione: (2024)
Cultivating Helpful, Personalized, and Creative AI Tutors: A Framework for Pedagogical Alignment using Reinforcement Learning
di: Song, Siyu, et al.
Pubblicazione: (2025)
di: Song, Siyu, et al.
Pubblicazione: (2025)
Curriculum Learning for Safety Alignment
di: Kumar, Sandeep, et al.
Pubblicazione: (2026)
di: Kumar, Sandeep, et al.
Pubblicazione: (2026)
RTMol: Rethinking Molecule-text Alignment in a Round-trip View
di: Chen, Letian, et al.
Pubblicazione: (2025)
di: Chen, Letian, et al.
Pubblicazione: (2025)
BioFormer: Rethinking Cross-Subject Generalization via Spectral Structural Alignment in Biomedical Time-Series
di: Du, Guikang, et al.
Pubblicazione: (2026)
di: Du, Guikang, et al.
Pubblicazione: (2026)
Hybrid Inverse Reinforcement Learning
di: Ren, Juntao, et al.
Pubblicazione: (2024)
di: Ren, Juntao, et al.
Pubblicazione: (2024)
Lyapunov-Guided Self-Alignment: Test-Time Adaptation for Offline Safe Reinforcement Learning
di: Han, Seungyub, et al.
Pubblicazione: (2026)
di: Han, Seungyub, et al.
Pubblicazione: (2026)
Vision-Based Generic Potential Function for Policy Alignment in Multi-Agent Reinforcement Learning
di: Ma, Hao, et al.
Pubblicazione: (2025)
di: Ma, Hao, et al.
Pubblicazione: (2025)
Aggregation Alignment for Federated Learning with Mixture-of-Experts under Data Heterogeneity
di: Fang, Zihan, et al.
Pubblicazione: (2026)
di: Fang, Zihan, et al.
Pubblicazione: (2026)
Kernel Density Bayesian Inverse Reinforcement Learning
di: Mandyam, Aishwarya, et al.
Pubblicazione: (2023)
di: Mandyam, Aishwarya, et al.
Pubblicazione: (2023)
Rethinking Cross-Modal Fine-Tuning: Optimizing the Interaction Between Feature Alignment and Target Fitting
di: Tran, Trong Khiem, et al.
Pubblicazione: (2026)
di: Tran, Trong Khiem, et al.
Pubblicazione: (2026)
Rethinking the Foundations for Continual Reinforcement Learning
di: Elelimy, Esraa, et al.
Pubblicazione: (2025)
di: Elelimy, Esraa, et al.
Pubblicazione: (2025)
Rethinking Plasticity in Deep Reinforcement Learning
di: He, Zhiqiang
Pubblicazione: (2026)
di: He, Zhiqiang
Pubblicazione: (2026)
Provably Efficient Exploration in Inverse Constrained Reinforcement Learning
di: Yue, Bo, et al.
Pubblicazione: (2024)
di: Yue, Bo, et al.
Pubblicazione: (2024)
Adaptive Alignment: Dynamic Preference Adjustments via Multi-Objective Reinforcement Learning for Pluralistic AI
di: Harland, Hadassah, et al.
Pubblicazione: (2024)
di: Harland, Hadassah, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Temporal Logic Specification-Conditioned Decision Transformer for Offline Safe Reinforcement Learning
di: Guo, Zijian, et al.
Pubblicazione: (2024) -
Inverse-RLignment: Large Language Model Alignment from Demonstrations through Inverse Reinforcement Learning
di: Sun, Hao, et al.
Pubblicazione: (2024) -
Rethinking LoRA for Data Heterogeneous Federated Learning: Subspace and State Alignment
di: Peng, Hongyi, et al.
Pubblicazione: (2026) -
Inverse Reinforcement Learning with Dynamic Reward Scaling for LLM Alignment
di: Cheng, Ruoxi, et al.
Pubblicazione: (2025) -
PAGAR: Taming Reward Misalignment in Inverse Reinforcement Learning-Based Imitation Learning with Protagonist Antagonist Guided Adversarial Reward
di: Zhou, Weichao, et al.
Pubblicazione: (2023)