When Robots Do the Chores: A Benchmark and Agent for Long-Horizon Household Task Execution
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhu, Zilin, Guo, Longteng, Mei, Yanghong, Pang, Bowen, Zhang, Zongxun, He, Xingjian, Ji, Ruyi, Liu, Jing |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
UrbanNav: Learning Language-Guided Urban Navigation from Web-Scale Human Trajectories
por: Mei, Yanghong, et al.
Publicado: (2025)
por: Mei, Yanghong, et al.
Publicado: (2025)
The Tool Decathlon: Benchmarking Language Agents for Diverse, Realistic, and Long-Horizon Task Execution
por: Li, Junlong, et al.
Publicado: (2025)
por: Li, Junlong, et al.
Publicado: (2025)
Odysseys: Benchmarking Web Agents on Realistic Long Horizon Tasks
por: Jang, Lawrence Keunho, et al.
Publicado: (2026)
por: Jang, Lawrence Keunho, et al.
Publicado: (2026)
OS-Marathon: Benchmarking Computer-Use Agents on Long-Horizon Repetitive Tasks
por: Wu, Jing, et al.
Publicado: (2026)
por: Wu, Jing, et al.
Publicado: (2026)
Thinking in Streaming Video
por: Liu, Zikang, et al.
Publicado: (2026)
por: Liu, Zikang, et al.
Publicado: (2026)
PARC: An Autonomous Self-Reflective Coding Agent for Robust Execution of Long-Horizon Tasks
por: Orimo, Yuki, et al.
Publicado: (2025)
por: Orimo, Yuki, et al.
Publicado: (2025)
Guaranteeing MMS for All but One Agent When Allocating Indivisible Chores
por: Qiu, Jiawei, et al.
Publicado: (2024)
por: Qiu, Jiawei, et al.
Publicado: (2024)
RoboClaw: An Agentic Framework for Scalable Long-Horizon Robotic Tasks
por: Li, Ruiying, et al.
Publicado: (2026)
por: Li, Ruiying, et al.
Publicado: (2026)
VALOR: Vision-Audio-Language Omni-Perception Pretraining Model and Dataset
por: Liu, Jing, et al.
Publicado: (2023)
por: Liu, Jing, et al.
Publicado: (2023)
When the Specification Emerges: Benchmarking Faithfulness Loss in Long-Horizon Coding Agents
por: Yan, Lu, et al.
Publicado: (2026)
por: Yan, Lu, et al.
Publicado: (2026)
From Dialogue to Execution: Mixture-of-Agents Assisted Interactive Planning for Behavior Tree-Based Long-Horizon Robot Execution
por: Suzuki, Kanata, et al.
Publicado: (2026)
por: Suzuki, Kanata, et al.
Publicado: (2026)
TaskGround: Structured Executable Task Inference for Full-Scene Household Reasoning
por: Feng, ZhiYuan, et al.
Publicado: (2026)
por: Feng, ZhiYuan, et al.
Publicado: (2026)
UltraHorizon: Benchmarking Agent Capabilities in Ultra Long-Horizon Scenarios
por: Luo, Haotian, et al.
Publicado: (2025)
por: Luo, Haotian, et al.
Publicado: (2025)
When is Truthfully Allocating Chores no Harder than Goods?
por: Li, Bo, et al.
Publicado: (2025)
por: Li, Bo, et al.
Publicado: (2025)
Unveiling Parts Beyond Objects:Towards Finer-Granularity Referring Expression Segmentation
por: Wang, Wenxuan, et al.
Publicado: (2023)
por: Wang, Wenxuan, et al.
Publicado: (2023)
SAGE: Scene Graph-Aware Guidance and Execution for Long-Horizon Manipulation Tasks
por: Li, Jialiang, et al.
Publicado: (2025)
por: Li, Jialiang, et al.
Publicado: (2025)
A Backbone for Long-Horizon Robot Task Understanding
por: Chen, Xiaoshuai, et al.
Publicado: (2024)
por: Chen, Xiaoshuai, et al.
Publicado: (2024)
Generalizable Dense Reward for Long-Horizon Robotic Tasks
por: Yong, Silong, et al.
Publicado: (2026)
por: Yong, Silong, et al.
Publicado: (2026)
Artifact for "Deductive Synthesis of Reinforcement Learning Agents for Infinite Horizon Tasks"
por: Wang, Yuning, et al.
Publicado: (2025)
por: Wang, Yuning, et al.
Publicado: (2025)
Artifact for "Deductive Synthesis of Reinforcement Learning Agents for Infinite Horizon Tasks"
por: Wang, Yuning, et al.
Publicado: (2025)
por: Wang, Yuning, et al.
Publicado: (2025)
WebChoreArena: Evaluating Web Browsing Agents on Realistic Tedious Web Tasks
por: Miyai, Atsuyuki, et al.
Publicado: (2025)
por: Miyai, Atsuyuki, et al.
Publicado: (2025)
ColorBench: Benchmarking Mobile Agents with Graph-Structured Framework for Complex Long-Horizon Tasks
por: Song, Yuanyi, et al.
Publicado: (2025)
por: Song, Yuanyi, et al.
Publicado: (2025)
Learning on the Job: An Experience-Driven Self-Evolving Agent for Long-Horizon Tasks
por: Yang, Cheng, et al.
Publicado: (2025)
por: Yang, Cheng, et al.
Publicado: (2025)
Fair Assignment of Indivisible Chores to Asymmetric Agents
por: Seddighin, Masoud, et al.
Publicado: (2025)
por: Seddighin, Masoud, et al.
Publicado: (2025)
VLABench: A Large-Scale Benchmark for Language-Conditioned Robotics Manipulation with Long-Horizon Reasoning Tasks
por: Zhang, Shiduo, et al.
Publicado: (2024)
por: Zhang, Shiduo, et al.
Publicado: (2024)
BOSS: Benchmark for Observation Space Shift in Long-Horizon Task
por: Yang, Yue, et al.
Publicado: (2025)
por: Yang, Yue, et al.
Publicado: (2025)
LLM-Empowered Embodied Agent for Memory-Augmented Task Planning in Household Robotics
por: Glocker, Marc, et al.
Publicado: (2025)
por: Glocker, Marc, et al.
Publicado: (2025)
ContextFlow: Hierarchical Task-State Alignment for Long-Horizon Embodied Agents
por: Guo, Shuhan, et al.
Publicado: (2026)
por: Guo, Shuhan, et al.
Publicado: (2026)
NaturalGAIA: A Verifiable Benchmark and Hierarchical Framework for Long-Horizon GUI Tasks
por: Zheng, Zihan, et al.
Publicado: (2025)
por: Zheng, Zihan, et al.
Publicado: (2025)
SlopCodeBench: Benchmarking How Coding Agents Degrade Over Long-Horizon Iterative Tasks
por: Orlanski, Gabriel, et al.
Publicado: (2026)
por: Orlanski, Gabriel, et al.
Publicado: (2026)
Shopping Companion: Benchmarking and Training LLM Agents for Long-Horizon Preference-Grounded E-Commerce Tasks
por: Yu, Zijian, et al.
Publicado: (2026)
por: Yu, Zijian, et al.
Publicado: (2026)
AgentLAB: Benchmarking LLM Agents against Long-Horizon Attacks
por: Jiang, Tanqiu, et al.
Publicado: (2026)
por: Jiang, Tanqiu, et al.
Publicado: (2026)
Towards Unified Referring Expression Segmentation Across Omni-Level Visual Target Granularities
por: Liu, Jing, et al.
Publicado: (2025)
por: Liu, Jing, et al.
Publicado: (2025)
EvolvingAgent: Curriculum Self-evolving Agent with Continual World Model for Long-Horizon Tasks
por: Feng, Tongtong, et al.
Publicado: (2025)
por: Feng, Tongtong, et al.
Publicado: (2025)
Learning Agent-Compatible Context Management for Long-Horizon Tasks
por: Yi, Lu, et al.
Publicado: (2026)
por: Yi, Lu, et al.
Publicado: (2026)
GTA: Generating Long-Horizon Tasks for Web Agents at Scale
por: Huang, Tenghao, et al.
Publicado: (2026)
por: Huang, Tenghao, et al.
Publicado: (2026)
Plan-and-Act: Improving Planning of Agents for Long-Horizon Tasks
por: Erdogan, Lutfi Eren, et al.
Publicado: (2025)
por: Erdogan, Lutfi Eren, et al.
Publicado: (2025)
Future Predictive Success-or-Failure Classification for Long-Horizon Robotic Tasks
por: Sogi, Naoya, et al.
Publicado: (2024)
por: Sogi, Naoya, et al.
Publicado: (2024)
AgentFugue: Agent Scaling for Long-Horizon Tasks through Collective Reasoning
por: Hu, Yuyang, et al.
Publicado: (2026)
por: Hu, Yuyang, et al.
Publicado: (2026)
LongBench: Evaluating Robotic Manipulation Policies on Real-World Long-Horizon Tasks
por: Chen, Xueyao, et al.
Publicado: (2026)
por: Chen, Xueyao, et al.
Publicado: (2026)
Ejemplares similares
-
UrbanNav: Learning Language-Guided Urban Navigation from Web-Scale Human Trajectories
por: Mei, Yanghong, et al.
Publicado: (2025) -
The Tool Decathlon: Benchmarking Language Agents for Diverse, Realistic, and Long-Horizon Task Execution
por: Li, Junlong, et al.
Publicado: (2025) -
Odysseys: Benchmarking Web Agents on Realistic Long Horizon Tasks
por: Jang, Lawrence Keunho, et al.
Publicado: (2026) -
OS-Marathon: Benchmarking Computer-Use Agents on Long-Horizon Repetitive Tasks
por: Wu, Jing, et al.
Publicado: (2026) -
Thinking in Streaming Video
por: Liu, Zikang, et al.
Publicado: (2026)