Shopping Companion: Benchmarking and Training LLM Agents for Long-Horizon Preference-Grounded E-Commerce Tasks
Fuente:
arXiv
Salvato in:
| Autori principali: | Yu, Zijian, Xiao, Kejun, Zhao, Huaipeng, Luo, Tao, Zeng, Xiaoyi |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
ShoppingBench: A Real-World Intent-Grounded Shopping Benchmark for LLM-based Agents
di: Wang, Jiangyuan, et al.
Pubblicazione: (2025)
di: Wang, Jiangyuan, et al.
Pubblicazione: (2025)
Quality Over Clicks: Intrinsic Quality-Driven Iterative Reinforcement Learning for Cold-Start E-Commerce Query Suggestion
di: Sun, Qi, et al.
Pubblicazione: (2026)
di: Sun, Qi, et al.
Pubblicazione: (2026)
ProductResearch: Training E-Commerce Deep Research Agents via Multi-Agent Synthetic Trajectory Distillation
di: Wang, Jiangyuan, et al.
Pubblicazione: (2026)
di: Wang, Jiangyuan, et al.
Pubblicazione: (2026)
LLaSA: Large Language and E-Commerce Shopping Assistant
di: Zhang, Shuo, et al.
Pubblicazione: (2024)
di: Zhang, Shuo, et al.
Pubblicazione: (2024)
Odysseys: Benchmarking Web Agents on Realistic Long Horizon Tasks
di: Jang, Lawrence Keunho, et al.
Pubblicazione: (2026)
di: Jang, Lawrence Keunho, et al.
Pubblicazione: (2026)
The Tool Decathlon: Benchmarking Language Agents for Diverse, Realistic, and Long-Horizon Task Execution
di: Li, Junlong, et al.
Pubblicazione: (2025)
di: Li, Junlong, et al.
Pubblicazione: (2025)
ColorBench: Benchmarking Mobile Agents with Graph-Structured Framework for Complex Long-Horizon Tasks
di: Song, Yuanyi, et al.
Pubblicazione: (2025)
di: Song, Yuanyi, et al.
Pubblicazione: (2025)
A Goal Without a Plan Is Just a Wish: Efficient and Effective Global Planner Training for Long-Horizon Agent Tasks
di: Si, Shuzheng, et al.
Pubblicazione: (2025)
di: Si, Shuzheng, et al.
Pubblicazione: (2025)
UltraHorizon: Benchmarking Agent Capabilities in Ultra Long-Horizon Scenarios
di: Luo, Haotian, et al.
Pubblicazione: (2025)
di: Luo, Haotian, et al.
Pubblicazione: (2025)
Preference-Aware Memory Update for Long-Term LLM Agents
di: Sun, Haoran, et al.
Pubblicazione: (2025)
di: Sun, Haoran, et al.
Pubblicazione: (2025)
Plan-and-Act: Improving Planning of Agents for Long-Horizon Tasks
di: Erdogan, Lutfi Eren, et al.
Pubblicazione: (2025)
di: Erdogan, Lutfi Eren, et al.
Pubblicazione: (2025)
AgentFugue: Agent Scaling for Long-Horizon Tasks through Collective Reasoning
di: Hu, Yuyang, et al.
Pubblicazione: (2026)
di: Hu, Yuyang, et al.
Pubblicazione: (2026)
WebExplorer: Explore and Evolve for Training Long-Horizon Web Agents
di: Liu, Junteng, et al.
Pubblicazione: (2025)
di: Liu, Junteng, et al.
Pubblicazione: (2025)
KLong: Training LLM Agent for Extremely Long-horizon Tasks
di: Liu, Yue, et al.
Pubblicazione: (2026)
di: Liu, Yue, et al.
Pubblicazione: (2026)
Structured Preference Optimization for Vision-Language Long-Horizon Task Planning
di: Liang, Xiwen, et al.
Pubblicazione: (2025)
di: Liang, Xiwen, et al.
Pubblicazione: (2025)
HorizonBench: Long-Horizon Personalization with Evolving Preferences
di: Li, Shuyue Stella, et al.
Pubblicazione: (2026)
di: Li, Shuyue Stella, et al.
Pubblicazione: (2026)
Stabilizing Off-Policy Training for Long-Horizon LLM Agent via Turn-Level Importance Sampling and Clipping-Triggered Normalization
di: Li, Chenliang, et al.
Pubblicazione: (2025)
di: Li, Chenliang, et al.
Pubblicazione: (2025)
GTA: Generating Long-Horizon Tasks for Web Agents at Scale
di: Huang, Tenghao, et al.
Pubblicazione: (2026)
di: Huang, Tenghao, et al.
Pubblicazione: (2026)
AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning
di: Xi, Zhiheng, et al.
Pubblicazione: (2025)
di: Xi, Zhiheng, et al.
Pubblicazione: (2025)
Investigating LLM Applications in E-Commerce
di: Palen-Michel, Chester, et al.
Pubblicazione: (2024)
di: Palen-Michel, Chester, et al.
Pubblicazione: (2024)
Learning on the Job: An Experience-Driven Self-Evolving Agent for Long-Horizon Tasks
di: Yang, Cheng, et al.
Pubblicazione: (2025)
di: Yang, Cheng, et al.
Pubblicazione: (2025)
HiAgent: Hierarchical Working Memory Management for Solving Long-Horizon Agent Tasks with Large Language Model
di: Hu, Mengkang, et al.
Pubblicazione: (2024)
di: Hu, Mengkang, et al.
Pubblicazione: (2024)
SlopCodeBench: Benchmarking How Coding Agents Degrade Over Long-Horizon Iterative Tasks
di: Orlanski, Gabriel, et al.
Pubblicazione: (2026)
di: Orlanski, Gabriel, et al.
Pubblicazione: (2026)
Scaling Long-Horizon LLM Agent via Context-Folding
di: Sun, Weiwei, et al.
Pubblicazione: (2025)
di: Sun, Weiwei, et al.
Pubblicazione: (2025)
FrontierFinance: A Long-Horizon Computer-Use Benchmark of Real-World Financial Tasks
di: Krumdick, Michael, et al.
Pubblicazione: (2026)
di: Krumdick, Michael, et al.
Pubblicazione: (2026)
WebMall -- A Multi-Shop Benchmark for Evaluating Web Agents
di: Peeters, Ralph, et al.
Pubblicazione: (2025)
di: Peeters, Ralph, et al.
Pubblicazione: (2025)
Harnessing Uncertainty: Entropy-Modulated Policy Gradients for Long-Horizon LLM Agents
di: Wang, Jiawei, et al.
Pubblicazione: (2025)
di: Wang, Jiawei, et al.
Pubblicazione: (2025)
WildClawBench: A Benchmark for Real-World, Long-Horizon Agent Evaluation
di: Ding, Shuangrui, et al.
Pubblicazione: (2026)
di: Ding, Shuangrui, et al.
Pubblicazione: (2026)
Examples as the Prompt: A Scalable Approach for Efficient LLM Adaptation in E-Commerce
di: Zeng, Jingying, et al.
Pubblicazione: (2025)
di: Zeng, Jingying, et al.
Pubblicazione: (2025)
LLM Agent Meets Agentic AI: Can LLM Agents Simulate Customers to Evaluate Agentic-AI-based Shopping Assistants?
di: Sun, Lu, et al.
Pubblicazione: (2025)
di: Sun, Lu, et al.
Pubblicazione: (2025)
Temporal Preferences in Language Models for Long-Horizon Assistance
di: Mazyaki, Ali, et al.
Pubblicazione: (2025)
di: Mazyaki, Ali, et al.
Pubblicazione: (2025)
Causal Intervention-Based Memory Selection for Long-Horizon LLM Agents
di: Srivastava, Saksham Sahai
Pubblicazione: (2026)
di: Srivastava, Saksham Sahai
Pubblicazione: (2026)
OdysseyBench: Evaluating LLM Agents on Long-Horizon Complex Office Application Workflows
di: Wang, Weixuan, et al.
Pubblicazione: (2025)
di: Wang, Weixuan, et al.
Pubblicazione: (2025)
TheAgentCompany: Benchmarking LLM Agents on Consequential Real World Tasks
di: Xu, Frank F., et al.
Pubblicazione: (2024)
di: Xu, Frank F., et al.
Pubblicazione: (2024)
MEM1: Learning to Synergize Memory and Reasoning for Efficient Long-Horizon Agents
di: Zhou, Zijian, et al.
Pubblicazione: (2025)
di: Zhou, Zijian, et al.
Pubblicazione: (2025)
FS-Researcher: Test-Time Scaling for Long-Horizon Research Tasks with File-System-Based Agents
di: Zhu, Chiwei, et al.
Pubblicazione: (2026)
di: Zhu, Chiwei, et al.
Pubblicazione: (2026)
Optimus-1: Hybrid Multimodal Memory Empowered Agents Excel in Long-Horizon Tasks
di: Li, Zaijing, et al.
Pubblicazione: (2024)
di: Li, Zaijing, et al.
Pubblicazione: (2024)
ACC: Compiling Agent Trajectories for Long-Context Training
di: Su, Qisheng, et al.
Pubblicazione: (2026)
di: Su, Qisheng, et al.
Pubblicazione: (2026)
Ask Now, Use Later: Benchmarking the Proactivity Gap in Long-Lived LLM Agents
di: Wu, Bin, et al.
Pubblicazione: (2026)
di: Wu, Bin, et al.
Pubblicazione: (2026)
DecisionBench: A Benchmark for Emergent Delegation in Long-Horizon Agentic Workflows
di: Gao, Yuxuan, et al.
Pubblicazione: (2026)
di: Gao, Yuxuan, et al.
Pubblicazione: (2026)
Documenti analoghi
-
ShoppingBench: A Real-World Intent-Grounded Shopping Benchmark for LLM-based Agents
di: Wang, Jiangyuan, et al.
Pubblicazione: (2025) -
Quality Over Clicks: Intrinsic Quality-Driven Iterative Reinforcement Learning for Cold-Start E-Commerce Query Suggestion
di: Sun, Qi, et al.
Pubblicazione: (2026) -
ProductResearch: Training E-Commerce Deep Research Agents via Multi-Agent Synthetic Trajectory Distillation
di: Wang, Jiangyuan, et al.
Pubblicazione: (2026) -
LLaSA: Large Language and E-Commerce Shopping Assistant
di: Zhang, Shuo, et al.
Pubblicazione: (2024) -
Odysseys: Benchmarking Web Agents on Realistic Long Horizon Tasks
di: Jang, Lawrence Keunho, et al.
Pubblicazione: (2026)