PREDILECT: Preferences Delineated with Zero-Shot Language-based Reasoning in Reinforcement Learning
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Holk, Simon, Marta, Daniel, Leite, Iolanda |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
FLoRA: Sample-Efficient Preference-based RL via Low-Rank Style Adaptation of Reward Functions
von: Marta, Daniel, et al.
Veröffentlicht: (2025)
von: Marta, Daniel, et al.
Veröffentlicht: (2025)
The Impact of VR and 2D Interfaces on Human Feedback in Preference-Based Robot Learning
von: de Heuvel, Jorge, et al.
Veröffentlicht: (2025)
von: de Heuvel, Jorge, et al.
Veröffentlicht: (2025)
Large Language Models as Zero-Shot Human Models for Human-Robot Interaction
von: Zhang, Bowen, et al.
Veröffentlicht: (2023)
von: Zhang, Bowen, et al.
Veröffentlicht: (2023)
Language Models as Zero-Shot Trajectory Generators
von: Kwon, Teyun, et al.
Veröffentlicht: (2023)
von: Kwon, Teyun, et al.
Veröffentlicht: (2023)
Personalizing Reinforcement Learning from Human Feedback with Variational Preference Learning
von: Poddar, Sriyash, et al.
Veröffentlicht: (2024)
von: Poddar, Sriyash, et al.
Veröffentlicht: (2024)
LGR2: Language Guided Reward Relabeling for Accelerating Hierarchical Reinforcement Learning
von: Singh, Utsav, et al.
Veröffentlicht: (2024)
von: Singh, Utsav, et al.
Veröffentlicht: (2024)
Energy-based Models are Zero-Shot Planners for Compositional Scene Rearrangement
von: Gkanatsios, Nikolaos, et al.
Veröffentlicht: (2023)
von: Gkanatsios, Nikolaos, et al.
Veröffentlicht: (2023)
Mental Modeling of Reinforcement Learning Agents by Language Models
von: Lu, Wenhao, et al.
Veröffentlicht: (2024)
von: Lu, Wenhao, et al.
Veröffentlicht: (2024)
Diffusion-ES: Gradient-free Planning with Diffusion for Autonomous Driving and Zero-Shot Instruction Following
von: Yang, Brian, et al.
Veröffentlicht: (2024)
von: Yang, Brian, et al.
Veröffentlicht: (2024)
Text2Reward: Reward Shaping with Language Models for Reinforcement Learning
von: Xie, Tianbao, et al.
Veröffentlicht: (2023)
von: Xie, Tianbao, et al.
Veröffentlicht: (2023)
Survey on Large Language Model-Enhanced Reinforcement Learning: Concept, Taxonomy, and Methods
von: Cao, Yuji, et al.
Veröffentlicht: (2024)
von: Cao, Yuji, et al.
Veröffentlicht: (2024)
The RL/LLM Taxonomy Tree: Reviewing Synergies Between Reinforcement Learning and Large Language Models
von: Pternea, Moschoula, et al.
Veröffentlicht: (2024)
von: Pternea, Moschoula, et al.
Veröffentlicht: (2024)
Retrieve-Augmented Generation for Speeding up Diffusion Policy without Additional Training
von: Odonchimed, Sodtavilan, et al.
Veröffentlicht: (2025)
von: Odonchimed, Sodtavilan, et al.
Veröffentlicht: (2025)
Chain of Code: Reasoning with a Language Model-Augmented Code Emulator
von: Li, Chengshu, et al.
Veröffentlicht: (2023)
von: Li, Chengshu, et al.
Veröffentlicht: (2023)
Chain of Uncertain Rewards with Large Language Models for Reinforcement Learning
von: Mo, Shentong
Veröffentlicht: (2026)
von: Mo, Shentong
Veröffentlicht: (2026)
Towards Robust Zero-Shot Reinforcement Learning
von: Zheng, Kexin, et al.
Veröffentlicht: (2025)
von: Zheng, Kexin, et al.
Veröffentlicht: (2025)
REFLEX: Metacognitive Reasoning for Reflective Zero-Shot Robotic Planning with Large Language Models
von: Lin, Wenjie, et al.
Veröffentlicht: (2025)
von: Lin, Wenjie, et al.
Veröffentlicht: (2025)
MaxMin-RLHF: Alignment with Diverse Human Preferences
von: Chakraborty, Souradip, et al.
Veröffentlicht: (2024)
von: Chakraborty, Souradip, et al.
Veröffentlicht: (2024)
SimpleVLA-RL: Scaling VLA Training via Reinforcement Learning
von: Li, Haozhan, et al.
Veröffentlicht: (2025)
von: Li, Haozhan, et al.
Veröffentlicht: (2025)
LLM-based Multi-Agent Reinforcement Learning: Current and Future Directions
von: Sun, Chuanneng, et al.
Veröffentlicht: (2024)
von: Sun, Chuanneng, et al.
Veröffentlicht: (2024)
Zero-Shot Policy Transfer in Reinforcement Learning using Buckingham's Pi Theorem
von: Pascoa, Francisco, et al.
Veröffentlicht: (2025)
von: Pascoa, Francisco, et al.
Veröffentlicht: (2025)
Grounding Large Language Models In Embodied Environment With Imperfect World Models
von: Liu, Haolan, et al.
Veröffentlicht: (2024)
von: Liu, Haolan, et al.
Veröffentlicht: (2024)
Intrinsic Language-Guided Exploration for Complex Long-Horizon Robotic Manipulation Tasks
von: Triantafyllidis, Eleftherios, et al.
Veröffentlicht: (2023)
von: Triantafyllidis, Eleftherios, et al.
Veröffentlicht: (2023)
SpatialVLM: Endowing Vision-Language Models with Spatial Reasoning Capabilities
von: Chen, Boyuan, et al.
Veröffentlicht: (2024)
von: Chen, Boyuan, et al.
Veröffentlicht: (2024)
Teaching Embodied Reinforcement Learning Agents: Informativeness and Diversity of Language Use
von: Xi, Jiajun, et al.
Veröffentlicht: (2024)
von: Xi, Jiajun, et al.
Veröffentlicht: (2024)
Reinforcement Learning with Physics-Informed Symbolic Program Priors for Zero-Shot Wireless Indoor Navigation
von: Li, Tao, et al.
Veröffentlicht: (2025)
von: Li, Tao, et al.
Veröffentlicht: (2025)
Distilled Feature Fields Enable Few-Shot Language-Guided Manipulation
von: Shen, William, et al.
Veröffentlicht: (2023)
von: Shen, William, et al.
Veröffentlicht: (2023)
Agent Instructs Large Language Models to be General Zero-Shot Reasoners
von: Crispino, Nicholas, et al.
Veröffentlicht: (2023)
von: Crispino, Nicholas, et al.
Veröffentlicht: (2023)
DecisionNCE: Embodied Multimodal Representations via Implicit Preference Learning
von: Li, Jianxiong, et al.
Veröffentlicht: (2024)
von: Li, Jianxiong, et al.
Veröffentlicht: (2024)
RIME: Robust Preference-based Reinforcement Learning with Noisy Preferences
von: Cheng, Jie, et al.
Veröffentlicht: (2024)
von: Cheng, Jie, et al.
Veröffentlicht: (2024)
A Zero-Shot Reinforcement Learning Strategy for Autonomous Guidewire Navigation
von: Scarponi, Valentina, et al.
Veröffentlicht: (2024)
von: Scarponi, Valentina, et al.
Veröffentlicht: (2024)
LogicDiff: Logic-Guided Denoising Improves Zero-Shot Reasoning in Masked Diffusion Language Models
von: Aman, Shaik
Veröffentlicht: (2026)
von: Aman, Shaik
Veröffentlicht: (2026)
General Agentic Planning Through Simulative Reasoning with World Models
von: Deng, Mingkai, et al.
Veröffentlicht: (2025)
von: Deng, Mingkai, et al.
Veröffentlicht: (2025)
Efficient Agentic Reasoning Through Self-Regulated Simulative Planning
von: Deng, Mingkai, et al.
Veröffentlicht: (2026)
von: Deng, Mingkai, et al.
Veröffentlicht: (2026)
General Preference Reinforcement Learning
von: Umer, Muhammad, et al.
Veröffentlicht: (2026)
von: Umer, Muhammad, et al.
Veröffentlicht: (2026)
PRISM: Preference Refinement via Implicit Scene Modeling for 3D Vision-Language Preference-Based Reinforcement Learning
von: Sun, Yirong, et al.
Veröffentlicht: (2025)
von: Sun, Yirong, et al.
Veröffentlicht: (2025)
Conversational Orientation Reasoning: Egocentric-to-Allocentric Navigation with Multimodal Chain-of-Thought
von: Huang, Yu Ti
Veröffentlicht: (2025)
von: Huang, Yu Ti
Veröffentlicht: (2025)
Digital Twin-Enhanced Wireless Indoor Navigation: Achieving Efficient Environment Sensing with Zero-Shot Reinforcement Learning
von: Li, Tao, et al.
Veröffentlicht: (2023)
von: Li, Tao, et al.
Veröffentlicht: (2023)
SYNAPSE: SYmbolic Neural-Aided Preference Synthesis Engine
von: Modak, Sadanand, et al.
Veröffentlicht: (2024)
von: Modak, Sadanand, et al.
Veröffentlicht: (2024)
Prompt-Based Bias Calibration for Better Zero/Few-Shot Learning of Language Models
von: He, Kang, et al.
Veröffentlicht: (2024)
von: He, Kang, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
FLoRA: Sample-Efficient Preference-based RL via Low-Rank Style Adaptation of Reward Functions
von: Marta, Daniel, et al.
Veröffentlicht: (2025) -
The Impact of VR and 2D Interfaces on Human Feedback in Preference-Based Robot Learning
von: de Heuvel, Jorge, et al.
Veröffentlicht: (2025) -
Large Language Models as Zero-Shot Human Models for Human-Robot Interaction
von: Zhang, Bowen, et al.
Veröffentlicht: (2023) -
Language Models as Zero-Shot Trajectory Generators
von: Kwon, Teyun, et al.
Veröffentlicht: (2023) -
Personalizing Reinforcement Learning from Human Feedback with Variational Preference Learning
von: Poddar, Sriyash, et al.
Veröffentlicht: (2024)