ESearch-R1: Learning Cost-Aware MLLM Agents for Interactive Embodied Search via Reinforcement Learning
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Zhou, Weijie, Xiong, Xuangtang, Tian, Ye, Yue, Lijun, Wu, Xinyu, Li, Wei, Zhao, Chaoyang, Dong, Honghui, Tang, Ming, Wang, Jinqiao, Zhang, Zhengyou |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Listening with the Eyes: Benchmarking Egocentric Co-Speech Grounding across Space and Time
von: Zhou, Weijie, et al.
Veröffentlicht: (2026)
von: Zhou, Weijie, et al.
Veröffentlicht: (2026)
LightPlanner: Unleashing the Reasoning Capabilities of Lightweight Large Language Models in Task Planning
von: Zhou, Weijie, et al.
Veröffentlicht: (2025)
von: Zhou, Weijie, et al.
Veröffentlicht: (2025)
MLLM as Retriever: Interactively Learning Multimodal Retrieval for Embodied Agents
von: Yue, Junpeng, et al.
Veröffentlicht: (2024)
von: Yue, Junpeng, et al.
Veröffentlicht: (2024)
PhysVLM-AVR: Active Visual Reasoning for Multimodal Large Language Models in Physical Environments
von: Zhou, Weijie, et al.
Veröffentlicht: (2025)
von: Zhou, Weijie, et al.
Veröffentlicht: (2025)
PhysVLM: Enabling Visual Language Models to Understand Robotic Physical Reachability
von: Zhou, Weijie, et al.
Veröffentlicht: (2025)
von: Zhou, Weijie, et al.
Veröffentlicht: (2025)
ProAct: A Benchmark and Multimodal Framework for Structure-Aware Proactive Response
von: Zhu, Xiaomeng, et al.
Veröffentlicht: (2026)
von: Zhu, Xiaomeng, et al.
Veröffentlicht: (2026)
BREATH: A Bio-Radar Embodied Agent for Tonal and Human-Aware Diffusion Music Generation
von: Wang, Yunzhe, et al.
Veröffentlicht: (2025)
von: Wang, Yunzhe, et al.
Veröffentlicht: (2025)
EARBench: Towards Evaluating Physical Risk Awareness for Task Planning of Foundation Model-based Embodied AI Agents
von: Zhu, Zihao, et al.
Veröffentlicht: (2024)
von: Zhu, Zihao, et al.
Veröffentlicht: (2024)
VRAgent-R1: Boosting Video Recommendation with MLLM-based Agents via Reinforcement Learning
von: Chen, Siran, et al.
Veröffentlicht: (2025)
von: Chen, Siran, et al.
Veröffentlicht: (2025)
VIKI-R: Coordinating Embodied Multi-Agent Cooperation via Reinforcement Learning
von: Kang, Li, et al.
Veröffentlicht: (2025)
von: Kang, Li, et al.
Veröffentlicht: (2025)
UniBYD: A Unified Framework for Learning Robotic Manipulation Across Embodiments Beyond Imitation of Human Demonstrations
von: Yuan, Tingyu, et al.
Veröffentlicht: (2025)
von: Yuan, Tingyu, et al.
Veröffentlicht: (2025)
Vision-R1: Evolving Human-Free Alignment in Large Vision-Language Models via Vision-Guided Reinforcement Learning
von: Zhan, Yufei, et al.
Veröffentlicht: (2025)
von: Zhan, Yufei, et al.
Veröffentlicht: (2025)
Reinforcement Learning with Foundation Priors: Let the Embodied Agent Efficiently Learn on Its Own
von: Ye, Weirui, et al.
Veröffentlicht: (2023)
von: Ye, Weirui, et al.
Veröffentlicht: (2023)
ERA: Transforming VLMs into Embodied Agents via Embodied Prior Learning and Online Reinforcement Learning
von: Chen, Hanyang, et al.
Veröffentlicht: (2025)
von: Chen, Hanyang, et al.
Veröffentlicht: (2025)
Deep Reinforcement Learning Empowered Activity-Aware Dynamic Health Monitoring Systems
von: Ye, Ziqiaing, et al.
Veröffentlicht: (2024)
von: Ye, Ziqiaing, et al.
Veröffentlicht: (2024)
ML-Agent: Reinforcing LLM Agents for Autonomous Machine Learning Engineering
von: Liu, Zexi, et al.
Veröffentlicht: (2025)
von: Liu, Zexi, et al.
Veröffentlicht: (2025)
Dual-Agent Reinforcement Learning for Adaptive and Cost-Aware Visual-Inertial Odometry
von: Pan, Feiyang, et al.
Veröffentlicht: (2025)
von: Pan, Feiyang, et al.
Veröffentlicht: (2025)
TraceVision: Trajectory-Aware Vision-Language Model for Human-Like Spatial Understanding
von: Yang, Fan, et al.
Veröffentlicht: (2026)
von: Yang, Fan, et al.
Veröffentlicht: (2026)
Memo: Training Memory-Efficient Embodied Agents with Reinforcement Learning
von: Gupta, Gunshi, et al.
Veröffentlicht: (2025)
von: Gupta, Gunshi, et al.
Veröffentlicht: (2025)
FOCUS: Fine-grained Optimization with Semantic Guided Understanding for Pedestrian Attributes Recognition
von: An, Hongyan, et al.
Veröffentlicht: (2025)
von: An, Hongyan, et al.
Veröffentlicht: (2025)
GoT-R1: Unleashing Reasoning Capability of MLLM for Visual Generation with Reinforcement Learning
von: Duan, Chengqi, et al.
Veröffentlicht: (2025)
von: Duan, Chengqi, et al.
Veröffentlicht: (2025)
Tempo-R0: A Video-MLLM for Temporal Video Grounding through Efficient Temporal Sensing Reinforcement Learning
von: Yue, Feng, et al.
Veröffentlicht: (2025)
von: Yue, Feng, et al.
Veröffentlicht: (2025)
Communication-Aware Reinforcement Learning for Cooperative Adaptive Cruise Control
von: Jiang, Sicong, et al.
Veröffentlicht: (2024)
von: Jiang, Sicong, et al.
Veröffentlicht: (2024)
Improving Medical Reasoning with Curriculum-Aware Reinforcement Learning
von: Rui, Shaohao, et al.
Veröffentlicht: (2025)
von: Rui, Shaohao, et al.
Veröffentlicht: (2025)
AIC MLLM: Autonomous Interactive Correction MLLM for Robust Robotic Manipulation
von: Xiong, Chuyan, et al.
Veröffentlicht: (2024)
von: Xiong, Chuyan, et al.
Veröffentlicht: (2024)
SEEA-R1: Tree-Structured Reinforcement Fine-Tuning for Self-Evolving Embodied Agents
von: Tian, Wanxin, et al.
Veröffentlicht: (2025)
von: Tian, Wanxin, et al.
Veröffentlicht: (2025)
Manifold-Aware Exploration for Reinforcement Learning in Video Generation
von: Zheng, Mingzhe, et al.
Veröffentlicht: (2026)
von: Zheng, Mingzhe, et al.
Veröffentlicht: (2026)
Embodied-R1: Reinforced Embodied Reasoning for General Robotic Manipulation
von: Yuan, Yifu, et al.
Veröffentlicht: (2025)
von: Yuan, Yifu, et al.
Veröffentlicht: (2025)
Robot-R1: Reinforcement Learning for Enhanced Embodied Reasoning in Robotics
von: Kim, Dongyoung, et al.
Veröffentlicht: (2025)
von: Kim, Dongyoung, et al.
Veröffentlicht: (2025)
Mind the Third Eye! Benchmarking Privacy Awareness in MLLM-powered Smartphone Agents
von: Lin, Zhixin, et al.
Veröffentlicht: (2025)
von: Lin, Zhixin, et al.
Veröffentlicht: (2025)
Teaching Embodied Reinforcement Learning Agents: Informativeness and Diversity of Language Use
von: Xi, Jiajun, et al.
Veröffentlicht: (2024)
von: Xi, Jiajun, et al.
Veröffentlicht: (2024)
Grounding Multimodal LLMs to Embodied Agents that Ask for Help with Reinforcement Learning
von: Ramrakhya, Ram, et al.
Veröffentlicht: (2025)
von: Ramrakhya, Ram, et al.
Veröffentlicht: (2025)
Embodied-R: Collaborative Framework for Activating Embodied Spatial Reasoning in Foundation Models via Reinforcement Learning
von: Zhao, Baining, et al.
Veröffentlicht: (2025)
von: Zhao, Baining, et al.
Veröffentlicht: (2025)
Hybrid Differential Reward: Combining Temporal Difference and Action Gradients for Efficient Multi-Agent Reinforcement Learning in Cooperative Driving
von: Han, Ye, et al.
Veröffentlicht: (2025)
von: Han, Ye, et al.
Veröffentlicht: (2025)
Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning
von: Jin, Bowen, et al.
Veröffentlicht: (2025)
von: Jin, Bowen, et al.
Veröffentlicht: (2025)
SPA: 3D Spatial-Awareness Enables Effective Embodied Representation
von: Zhu, Haoyi, et al.
Veröffentlicht: (2024)
von: Zhu, Haoyi, et al.
Veröffentlicht: (2024)
OPTAGENT: Optimizing Multi-Agent LLM Interactions Through Verbal Reinforcement Learning for Enhanced Reasoning
von: Bi, Zhenyu, et al.
Veröffentlicht: (2025)
von: Bi, Zhenyu, et al.
Veröffentlicht: (2025)
Drive-R1: Bridging Reasoning and Planning in VLMs for Autonomous Driving with Reinforcement Learning
von: Li, Yue, et al.
Veröffentlicht: (2025)
von: Li, Yue, et al.
Veröffentlicht: (2025)
Quality-Aware Language-Conditioned Local Auto-Regressive Anomaly Synthesis and Detection
von: Qian, Long, et al.
Veröffentlicht: (2025)
von: Qian, Long, et al.
Veröffentlicht: (2025)
Interactive Explanations for Reinforcement-Learning Agents
von: Amitai, Yotam, et al.
Veröffentlicht: (2025)
von: Amitai, Yotam, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
Listening with the Eyes: Benchmarking Egocentric Co-Speech Grounding across Space and Time
von: Zhou, Weijie, et al.
Veröffentlicht: (2026) -
LightPlanner: Unleashing the Reasoning Capabilities of Lightweight Large Language Models in Task Planning
von: Zhou, Weijie, et al.
Veröffentlicht: (2025) -
MLLM as Retriever: Interactively Learning Multimodal Retrieval for Embodied Agents
von: Yue, Junpeng, et al.
Veröffentlicht: (2024) -
PhysVLM-AVR: Active Visual Reasoning for Multimodal Large Language Models in Physical Environments
von: Zhou, Weijie, et al.
Veröffentlicht: (2025) -
PhysVLM: Enabling Visual Language Models to Understand Robotic Physical Reachability
von: Zhou, Weijie, et al.
Veröffentlicht: (2025)