LLM-Based Offline Learning for Embodied Agents via Consistency-Guided Reward Ensemble
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Lee, Yujeong, Shin, Sangwoo, Park, Wei-Jin, Woo, Honguk |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Semantic Skill Grounding for Embodied Instruction-Following in Cross-Domain Environments
par: Shin, Sangwoo, et autres
Publié: (2024)
par: Shin, Sangwoo, et autres
Publié: (2024)
Efficient Policy Adaptation with Contrastive Prompt Ensemble for Embodied Agents
par: Choi, Wonje, et autres
Publié: (2024)
par: Choi, Wonje, et autres
Publié: (2024)
SemTra: A Semantic Skill Translator for Cross-Domain Zero-Shot Policy Adaptation
par: Shin, Sangwoo, et autres
Publié: (2024)
par: Shin, Sangwoo, et autres
Publié: (2024)
Efficient Process Reward Modeling via Contrastive Mutual Information
par: Lee, Nakyung, et autres
Publié: (2026)
par: Lee, Nakyung, et autres
Publié: (2026)
One-shot Imitation in a Non-Stationary Environment via Multi-Modal Skill
par: Shin, Sangwoo, et autres
Publié: (2024)
par: Shin, Sangwoo, et autres
Publié: (2024)
Embodied CoT Distillation From LLM To Off-the-shelf Agents
par: Choi, Wonje, et autres
Publié: (2024)
par: Choi, Wonje, et autres
Publié: (2024)
Expanding Search Space with Diverse Prompting Agents: An Efficient Sampling Approach for LLM Mathematical Reasoning
par: Lee, Gisang, et autres
Publié: (2024)
par: Lee, Gisang, et autres
Publié: (2024)
T-MAP: Red-Teaming LLM Agents with Trajectory-aware Evolutionary Search
par: Lee, Hyomin, et autres
Publié: (2026)
par: Lee, Hyomin, et autres
Publié: (2026)
Nudging Beyond the Comfort Zone: Efficient Strategy-Guided Exploration for RLVR
par: Lee, Chanuk, et autres
Publié: (2026)
par: Lee, Chanuk, et autres
Publié: (2026)
Robust Policy Learning via Offline Skill Diffusion
par: Kim, Woo Kyung, et autres
Publié: (2024)
par: Kim, Woo Kyung, et autres
Publié: (2024)
Harnessing Consistency for Robust Test-Time LLM Ensemble
par: Zeng, Zhichen, et autres
Publié: (2025)
par: Zeng, Zhichen, et autres
Publié: (2025)
Guide-LLM: An Embodied LLM Agent and Text-Based Topological Map for Robotic Guidance of People with Visual Impairments
par: Song, Sangmim, et autres
Publié: (2024)
par: Song, Sangmim, et autres
Publié: (2024)
Consistent Paths Lead to Truth: Self-Rewarding Reinforcement Learning for LLM Reasoning
par: Zhang, Kongcheng, et autres
Publié: (2025)
par: Zhang, Kongcheng, et autres
Publié: (2025)
Exploratory Retrieval-Augmented Planning For Continual Embodied Instruction Following
par: Yoo, Minjong, et autres
Publié: (2025)
par: Yoo, Minjong, et autres
Publié: (2025)
SuRe: Summarizing Retrievals using Answer Candidates for Open-domain QA of LLMs
par: Kim, Jaehyung, et autres
Publié: (2024)
par: Kim, Jaehyung, et autres
Publié: (2024)
Offline Policy Learning via Skill-step Abstraction for Long-horizon Goal-Conditioned Tasks
par: Kim, Donghoon, et autres
Publié: (2024)
par: Kim, Donghoon, et autres
Publié: (2024)
World Model Implanting for Test-time Adaptation of Embodied Agents
par: Yoo, Minjong, et autres
Publié: (2025)
par: Yoo, Minjong, et autres
Publié: (2025)
Test-Time Mixture of World Models for Embodied Agents in Dynamic Environments
par: Jang, Jinwoo, et autres
Publié: (2026)
par: Jang, Jinwoo, et autres
Publié: (2026)
Embodied LLM Agents Learn to Cooperate in Organized Teams
par: Guo, Xudong, et autres
Publié: (2024)
par: Guo, Xudong, et autres
Publié: (2024)
PREPING: Building Agent Memory without Tasks
par: Choi, Yumin, et autres
Publié: (2026)
par: Choi, Yumin, et autres
Publié: (2026)
Reward-Guided Speculative Decoding for Efficient LLM Reasoning
par: Liao, Baohao, et autres
Publié: (2025)
par: Liao, Baohao, et autres
Publié: (2025)
A Theoretical Analysis of Why Masked Diffusion Models Mitigate the Reversal Curse
par: Jeon, Moongyu, et autres
Publié: (2026)
par: Jeon, Moongyu, et autres
Publié: (2026)
Pay What LLM Wants: Can LLM Simulate Economics Experiment with 522 Real-human Persona?
par: Choi, Junhyuk, et autres
Publié: (2025)
par: Choi, Junhyuk, et autres
Publié: (2025)
Adaptive Selection of LoRA Components in Privacy-Preserving Federated Learning
par: Kim, Myoungjun, et autres
Publié: (2026)
par: Kim, Myoungjun, et autres
Publié: (2026)
Reward Difference Optimization For Sample Reweighting In Offline RLHF
par: Wang, Shiqi, et autres
Publié: (2024)
par: Wang, Shiqi, et autres
Publié: (2024)
Beyond Self-Consistency: Ensemble Reasoning Boosts Consistency and Accuracy of LLMs in Cancer Staging
par: Chang, Chia-Hsuan, et autres
Publié: (2024)
par: Chang, Chia-Hsuan, et autres
Publié: (2024)
Grounded in Reality: Learning and Deploying Proactive LLM from Offline Logs
par: Wei, Fei, et autres
Publié: (2025)
par: Wei, Fei, et autres
Publié: (2025)
NeSyPr: Neurosymbolic Proceduralization For Efficient Embodied Reasoning
par: Choi, Wonje, et autres
Publié: (2025)
par: Choi, Wonje, et autres
Publié: (2025)
SPIO: Ensemble and Selective Strategies via LLM-Based Multi-Agent Planning in Automated Data Science
par: Seo, Wonduk, et autres
Publié: (2025)
par: Seo, Wonduk, et autres
Publié: (2025)
AdaRubric: Task-Adaptive Rubrics for Reliable LLM Agent Evaluation and Reward Learning
par: Ding, Liang
Publié: (2026)
par: Ding, Liang
Publié: (2026)
NeSyC: A Neuro-symbolic Continual Learner For Complex Embodied Tasks In Open Domains
par: Choi, Wonje, et autres
Publié: (2025)
par: Choi, Wonje, et autres
Publié: (2025)
MT-RewardTree: A Comprehensive Framework for Advancing LLM-Based Machine Translation via Reward Modeling
par: Feng, Zhaopeng, et autres
Publié: (2025)
par: Feng, Zhaopeng, et autres
Publié: (2025)
Towards Reliable Code-as-Policies: A Neuro-Symbolic Framework for Embodied Task Planning
par: Ahn, Sanghyun, et autres
Publié: (2025)
par: Ahn, Sanghyun, et autres
Publié: (2025)
When to Ensemble: Identifying Token-Level Points for Stable and Fast LLM Ensembling
par: Yun, Heecheol, et autres
Publié: (2025)
par: Yun, Heecheol, et autres
Publié: (2025)
Can an Embodied Agent Find Your "Cat-shaped Mug"? LLM-Guided Exploration for Zero-Shot Object Navigation
par: Dorbala, Vishnu Sashank, et autres
Publié: (2023)
par: Dorbala, Vishnu Sashank, et autres
Publié: (2023)
OptiHive: Ensemble Selection for LLM-Based Optimization via Statistical Modeling
par: Bouscary, Maxime, et autres
Publié: (2025)
par: Bouscary, Maxime, et autres
Publié: (2025)
MENTOR: A Reinforcement Learning Framework for Enabling Tool Use in Small Models via Teacher-Optimized Rewards
par: Choi, ChangSu, et autres
Publié: (2025)
par: Choi, ChangSu, et autres
Publié: (2025)
Retrospex: Language Agent Meets Offline Reinforcement Learning Critic
par: Xiang, Yufei, et autres
Publié: (2025)
par: Xiang, Yufei, et autres
Publié: (2025)
The Lighthouse of Language: Enhancing LLM Agents via Critique-Guided Improvement
par: Yang, Ruihan, et autres
Publié: (2025)
par: Yang, Ruihan, et autres
Publié: (2025)
Distribution-Aware Reward: Reinforcement Learning over Predictive Distributions for LLM Regression
par: Park, Jungsoo, et autres
Publié: (2026)
par: Park, Jungsoo, et autres
Publié: (2026)
Documents similaires
-
Semantic Skill Grounding for Embodied Instruction-Following in Cross-Domain Environments
par: Shin, Sangwoo, et autres
Publié: (2024) -
Efficient Policy Adaptation with Contrastive Prompt Ensemble for Embodied Agents
par: Choi, Wonje, et autres
Publié: (2024) -
SemTra: A Semantic Skill Translator for Cross-Domain Zero-Shot Policy Adaptation
par: Shin, Sangwoo, et autres
Publié: (2024) -
Efficient Process Reward Modeling via Contrastive Mutual Information
par: Lee, Nakyung, et autres
Publié: (2026) -
One-shot Imitation in a Non-Stationary Environment via Multi-Modal Skill
par: Shin, Sangwoo, et autres
Publié: (2024)