Beyond Human Preferences: Exploring Reinforcement Learning Trajectory Evaluation and Improvement through LLMs
Fuente:
arXiv
Guardado en:
| Autores principales: | Shen, Zichao, Zhu, Tianchen, Sun, Qingyun, Gao, Shiqi, Li, Jianxin |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
From Text to Trajectory: Exploring Complex Constraint Representation and Decomposition in Safe Reinforcement Learning
por: Dong, Pusen, et al.
Publicado: (2024)
por: Dong, Pusen, et al.
Publicado: (2024)
SDA-PLANNER: State-Dependency Aware Adaptive Planner for Embodied Task Planning
por: Shen, Zichao, et al.
Publicado: (2025)
por: Shen, Zichao, et al.
Publicado: (2025)
Sycophancy Mitigation Through Reinforcement Learning with Uncertainty-Aware Adaptive Reasoning Trajectories
por: Beigi, Mohammad, et al.
Publicado: (2025)
por: Beigi, Mohammad, et al.
Publicado: (2025)
Toward a Unified Geometry Understanding: Riemannian Diffusion Framework for Graph Generation and Prediction
por: Gao, Yisen, et al.
Publicado: (2025)
por: Gao, Yisen, et al.
Publicado: (2025)
Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference
por: Chiang, Wei-Lin, et al.
Publicado: (2024)
por: Chiang, Wei-Lin, et al.
Publicado: (2024)
Robust Graph Learning Against Adversarial Evasion Attacks via Prior-Free Diffusion-Based Structure Purification
por: Luo, Jiayi, et al.
Publicado: (2025)
por: Luo, Jiayi, et al.
Publicado: (2025)
Dual Defense: Enhancing Privacy and Mitigating Poisoning Attacks in Federated Learning
por: Xu, Runhua, et al.
Publicado: (2025)
por: Xu, Runhua, et al.
Publicado: (2025)
In-Dataset Trajectory Return Regularization for Offline Preference-based Reinforcement Learning
por: Tu, Songjun, et al.
Publicado: (2024)
por: Tu, Songjun, et al.
Publicado: (2024)
Rethinking Diverse Human Preference Learning through Principal Component Analysis
por: Luo, Feng, et al.
Publicado: (2025)
por: Luo, Feng, et al.
Publicado: (2025)
Adaptive Preference Scaling for Reinforcement Learning with Human Feedback
por: Hong, Ilgee, et al.
Publicado: (2024)
por: Hong, Ilgee, et al.
Publicado: (2024)
Directly Aligning the Full Diffusion Trajectory with Fine-Grained Human Preference
por: Shen, Xiangwei, et al.
Publicado: (2025)
por: Shen, Xiangwei, et al.
Publicado: (2025)
Dynamic Graph Information Bottleneck
por: Yuan, Haonan, et al.
Publicado: (2024)
por: Yuan, Haonan, et al.
Publicado: (2024)
Zero-shot Generalizable Graph Anomaly Detection with Mixture of Riemannian Experts
por: Zhao, Xinyu, et al.
Publicado: (2026)
por: Zhao, Xinyu, et al.
Publicado: (2026)
RAG-GFM: Overcoming In-Memory Bottlenecks in Graph Foundation Models via Retrieval-Augmented Generation
por: Yuan, Haonan, et al.
Publicado: (2026)
por: Yuan, Haonan, et al.
Publicado: (2026)
Hindsight Preference Learning for Offline Preference-based Reinforcement Learning
por: Gao, Chen-Xiao, et al.
Publicado: (2024)
por: Gao, Chen-Xiao, et al.
Publicado: (2024)
TIDE: Trajectory-based Diagnostic Evaluation of Test-Time Improvement in LLM Agents
por: Yan, Hang, et al.
Publicado: (2026)
por: Yan, Hang, et al.
Publicado: (2026)
MemSearcher: Training LLMs to Reason, Search and Manage Memory via End-to-End Reinforcement Learning
por: Yuan, Qianhao, et al.
Publicado: (2025)
por: Yuan, Qianhao, et al.
Publicado: (2025)
Controllable Logical Hypothesis Generation for Abductive Reasoning in Knowledge Graphs
por: Gao, Yisen, et al.
Publicado: (2025)
por: Gao, Yisen, et al.
Publicado: (2025)
GraphMoRE: Mitigating Topological Heterogeneity via Mixture of Riemannian Experts
por: Guo, Zihao, et al.
Publicado: (2024)
por: Guo, Zihao, et al.
Publicado: (2024)
GraphKeeper: Graph Domain-Incremental Learning via Knowledge Disentanglement and Preservation
por: Guo, Zihao, et al.
Publicado: (2025)
por: Guo, Zihao, et al.
Publicado: (2025)
Evaluating Feature Dependent Noise in Preference-based Reinforcement Learning
por: Li, Yuxuan, et al.
Publicado: (2026)
por: Li, Yuxuan, et al.
Publicado: (2026)
Beyond Error-Based Optimization: Experience-Driven Symbolic Regression with Goal-Conditioned Reinforcement Learning
por: Sun, Jianwen, et al.
Publicado: (2026)
por: Sun, Jianwen, et al.
Publicado: (2026)
Jailbreak-R1: Exploring the Jailbreak Capabilities of LLMs via Reinforcement Learning
por: Guo, Weiyang, et al.
Publicado: (2025)
por: Guo, Weiyang, et al.
Publicado: (2025)
A Comparison of DeepSeek and Other LLMs
por: Gao, Tianchen, et al.
Publicado: (2025)
por: Gao, Tianchen, et al.
Publicado: (2025)
Can LLMs Capture Human Preferences?
por: Goli, Ali, et al.
Publicado: (2023)
por: Goli, Ali, et al.
Publicado: (2023)
Beyond Accuracy: Dissecting Mathematical Reasoning for LLMs Under Reinforcement Learning
por: Wang, Jiayu, et al.
Publicado: (2025)
por: Wang, Jiayu, et al.
Publicado: (2025)
Decoupled and Divergence-Conditioned Prompt for Multi-domain Dynamic Graph Foundation Models
por: Yuan, Haonan, et al.
Publicado: (2026)
por: Yuan, Haonan, et al.
Publicado: (2026)
FARPLS: A Feature-Augmented Robot Trajectory Preference Labeling System to Assist Human Labelers' Preference Elicitation
por: Lyu, Hanfang, et al.
Publicado: (2024)
por: Lyu, Hanfang, et al.
Publicado: (2024)
Search-Based Credit Assignment for Offline Preference-Based Reinforcement Learning
por: Gao, Xiancheng, et al.
Publicado: (2025)
por: Gao, Xiancheng, et al.
Publicado: (2025)
Exploring Text-to-Motion Generation with Human Preference
por: Sheng, Jenny, et al.
Publicado: (2024)
por: Sheng, Jenny, et al.
Publicado: (2024)
Swap-guided Preference Learning for Personalized Reinforcement Learning from Human Feedback
por: Kim, Gihoon, et al.
Publicado: (2026)
por: Kim, Gihoon, et al.
Publicado: (2026)
Beyond Imitation: Reinforcement Learning for Active Latent Planning
por: Zheng, Zhi, et al.
Publicado: (2026)
por: Zheng, Zhi, et al.
Publicado: (2026)
Geo-Llama: Leveraging LLMs for Human Mobility Trajectory Generation with Spatiotemporal Constraints
por: Li, Siyu, et al.
Publicado: (2024)
por: Li, Siyu, et al.
Publicado: (2024)
BotUmc: An Uncertainty-Aware Twitter Bot Detection with Multi-view Causal Inference
por: Yang, Tao, et al.
Publicado: (2025)
por: Yang, Tao, et al.
Publicado: (2025)
Towards Monotonic Improvement in In-Context Reinforcement Learning
por: Zhang, Wenhao, et al.
Publicado: (2025)
por: Zhang, Wenhao, et al.
Publicado: (2025)
LRHP: Learning Representations for Human Preferences via Preference Pairs
por: Wang, Chenglong, et al.
Publicado: (2024)
por: Wang, Chenglong, et al.
Publicado: (2024)
Beyond Ordinal Preferences: Why Alignment Needs Cardinal Human Feedback
por: Whitfill, Parker, et al.
Publicado: (2025)
por: Whitfill, Parker, et al.
Publicado: (2025)
Exploring the Personality Traits of LLMs through Latent Features Steering
por: Yang, Shu, et al.
Publicado: (2024)
por: Yang, Shu, et al.
Publicado: (2024)
Beyond Mimicry: Preference Coherence in LLMs
por: Mikaelson, Luhan, et al.
Publicado: (2025)
por: Mikaelson, Luhan, et al.
Publicado: (2025)
Preferred-Action-Optimized Diffusion Policies for Offline Reinforcement Learning
por: Zhang, Tianle, et al.
Publicado: (2024)
por: Zhang, Tianle, et al.
Publicado: (2024)
Ejemplares similares
-
From Text to Trajectory: Exploring Complex Constraint Representation and Decomposition in Safe Reinforcement Learning
por: Dong, Pusen, et al.
Publicado: (2024) -
SDA-PLANNER: State-Dependency Aware Adaptive Planner for Embodied Task Planning
por: Shen, Zichao, et al.
Publicado: (2025) -
Sycophancy Mitigation Through Reinforcement Learning with Uncertainty-Aware Adaptive Reasoning Trajectories
por: Beigi, Mohammad, et al.
Publicado: (2025) -
Toward a Unified Geometry Understanding: Riemannian Diffusion Framework for Graph Generation and Prediction
por: Gao, Yisen, et al.
Publicado: (2025) -
Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference
por: Chiang, Wei-Lin, et al.
Publicado: (2024)