EcomBench: Towards Holistic Evaluation of Foundation Agents in E-commerce
Fuente:
arXiv
Guardado en:
| Autores principales: | Min, Rui, Qiao, Zile, Xu, Ze, Zhai, Jiawen, Gao, Wenyu, Chen, Xuanzhong, Sun, Haozhen, Zhang, Zhen, Wang, Xinyu, Zhou, Hong, Yin, Wenbiao, Zhang, Bo, Zhou, Xuan, Yan, Ming, Jiang, Yong, Liu, Haicheng, Ding, Liang, Zou, Ling, Fung, Yi R., Li, Yalong, Xie, Pengjun |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
AgentFrontier: Expanding the Capability Frontier of LLM Agents with ZPD-Guided Data Synthesis
por: Chen, Xuanzhong, et al.
Publicado: (2025)
por: Chen, Xuanzhong, et al.
Publicado: (2025)
EcomMMMU: Strategic Utilization of Visuals for Robust Multimodal E-commerce Models
por: Ling, Xinyi, et al.
Publicado: (2025)
por: Ling, Xinyi, et al.
Publicado: (2025)
OxyEcomBench: Benchmarking Multimodal Foundation Models across E-Commerce Ecosystems
por: Liu, Yong, et al.
Publicado: (2026)
por: Liu, Yong, et al.
Publicado: (2026)
WebResearcher: Unleashing unbounded reasoning capability in Long-Horizon Agents
por: Qiao, Zile, et al.
Publicado: (2025)
por: Qiao, Zile, et al.
Publicado: (2025)
HiMA-Ecom: Enabling Joint Training of Hierarchical Multi-Agent E-commerce Assistants
por: Hu, Junxing, et al.
Publicado: (2025)
por: Hu, Junxing, et al.
Publicado: (2025)
EcomScriptBench: A Multi-task Benchmark for E-commerce Script Planning via Step-wise Intention-Driven Product Association
por: Wang, Weiqi, et al.
Publicado: (2025)
por: Wang, Weiqi, et al.
Publicado: (2025)
ChineseEcomQA: A Scalable E-commerce Concept Evaluation Benchmark for Large Language Models
por: Chen, Haibin, et al.
Publicado: (2025)
por: Chen, Haibin, et al.
Publicado: (2025)
IterResearch: Rethinking Long-Horizon Agents with Interaction Scaling
por: Chen, Guoxin, et al.
Publicado: (2025)
por: Chen, Guoxin, et al.
Publicado: (2025)
DynamicBench: Evaluating Real-Time Report Generation in Large Language Models
por: Li, Jingyao, et al.
Publicado: (2025)
por: Li, Jingyao, et al.
Publicado: (2025)
EcomEdit: An Automated E-commerce Knowledge Editing Framework for Enhanced Product and Purchase Intention Understanding
por: Lau, Ching Ming Samuel, et al.
Publicado: (2024)
por: Lau, Ching Ming Samuel, et al.
Publicado: (2024)
ProteinBench: A Holistic Evaluation of Protein Foundation Models
por: Ye, Fei, et al.
Publicado: (2024)
por: Ye, Fei, et al.
Publicado: (2024)
Scaling Agents via Continual Pre-training
por: Su, Liangcai, et al.
Publicado: (2025)
por: Su, Liangcai, et al.
Publicado: (2025)
The Breakthrough and Confrontation of Mainland Chinese Opera Films in Hong Kong under the Cold War Framework (1953–1957)
por: Du, Jiachen, et al.
Publicado: (2025)
por: Du, Jiachen, et al.
Publicado: (2025)
KBM: Delineating Knowledge Boundary for Adaptive Retrieval in Large Language Models
por: Zhang, Zhen, et al.
Publicado: (2024)
por: Zhang, Zhen, et al.
Publicado: (2024)
RareBench: Can LLMs Serve as Rare Diseases Specialists?
por: Chen, Xuanzhong, et al.
Publicado: (2024)
por: Chen, Xuanzhong, et al.
Publicado: (2024)
Supportiveness-based Knowledge Rewriting for Retrieval-augmented Language Modeling
por: Qiao, Zile, et al.
Publicado: (2024)
por: Qiao, Zile, et al.
Publicado: (2024)
ZeroSearch: Incentivize the Search Capability of LLMs without Searching
por: Sun, Hao, et al.
Publicado: (2025)
por: Sun, Hao, et al.
Publicado: (2025)
Mix-Ecom: Towards Mixed-Type E-Commerce Dialogues with Complex Domain Rules
por: Zhou, Chenyu, et al.
Publicado: (2025)
por: Zhou, Chenyu, et al.
Publicado: (2025)
BrowseConf: Confidence-Guided Test-Time Scaling for Web Agents
por: Ou, Litu, et al.
Publicado: (2025)
por: Ou, Litu, et al.
Publicado: (2025)
DecoupleSearch: Decouple Planning and Search via Hierarchical Reward Modeling
por: Sun, Hao, et al.
Publicado: (2025)
por: Sun, Hao, et al.
Publicado: (2025)
Hall algebras associated to root categories
por: Zhang, Haicheng
Publicado: (2022)
por: Zhang, Haicheng
Publicado: (2022)
CodeCriticBench: A Holistic Code Critique Benchmark for Large Language Models
por: Zhang, Alexander, et al.
Publicado: (2025)
por: Zhang, Alexander, et al.
Publicado: (2025)
AgentFold: Long-Horizon Web Agents with Proactive Context Management
por: Ye, Rui, et al.
Publicado: (2025)
por: Ye, Rui, et al.
Publicado: (2025)
Simple Vertex Algebras Arising From Congruence Subgroups
por: Dai, Xuanzhong, et al.
Publicado: (2022)
por: Dai, Xuanzhong, et al.
Publicado: (2022)
WebShaper: Agentically Data Synthesizing via Information-Seeking Formalization
por: Tao, Zhengwei, et al.
Publicado: (2025)
por: Tao, Zhengwei, et al.
Publicado: (2025)
WebSailor-V2: Bridging the Chasm to Proprietary Agents via Synthetic Data and Scalable Reinforcement Learning
por: Li, Kuan, et al.
Publicado: (2025)
por: Li, Kuan, et al.
Publicado: (2025)
Valley3: Scaling Omni Foundation Models for E-commerce
por: Chen, Zeyu, et al.
Publicado: (2026)
por: Chen, Zeyu, et al.
Publicado: (2026)
LookBench: A Live and Holistic Open Benchmark for Fashion Image Retrieval
por: ai, Gensmo., et al.
Publicado: (2026)
por: ai, Gensmo., et al.
Publicado: (2026)
C sequential optimization numbers
por: Hui, Zile
Publicado: (2024)
por: Hui, Zile
Publicado: (2024)
Extriangulated length categories: torsion classes and $τ$-tilting theory
por: Wang, Li, et al.
Publicado: (2025)
por: Wang, Li, et al.
Publicado: (2025)
Nested Browser-Use Learning for Agentic Information Seeking
por: Li, Baixuan, et al.
Publicado: (2025)
por: Li, Baixuan, et al.
Publicado: (2025)
Q-Bench+: A Benchmark for Multi-modal Foundation Models on Low-level Vision from Single Images to Pairs
por: Zhang, Zicheng, et al.
Publicado: (2024)
por: Zhang, Zicheng, et al.
Publicado: (2024)
Regist3R: Incremental Registration with Stereo Foundation Model
por: Liu, Sidun, et al.
Publicado: (2025)
por: Liu, Sidun, et al.
Publicado: (2025)
WebLeaper: Empowering Efficiency and Efficacy in WebAgent via Enabling Info-Rich Seeking
por: Tao, Zhengwei, et al.
Publicado: (2025)
por: Tao, Zhengwei, et al.
Publicado: (2025)
Holistic Utility Preference Learning for Listwise Alignment
por: Zhou, Jiacong, et al.
Publicado: (2024)
por: Zhou, Jiacong, et al.
Publicado: (2024)
V2Flow: Unifying Visual Tokenization and Large Language Model Vocabularies for Autoregressive Image Generation
por: Zhang, Guiwei, et al.
Publicado: (2025)
por: Zhang, Guiwei, et al.
Publicado: (2025)
A Rare Case of Primary Breast Angiosarcoma: Diagnostic Challenges and Findings
por: Yalong Zhang, et al.
Publicado: (2026)
por: Yalong Zhang, et al.
Publicado: (2026)
A degeneration formula of Donaldson-Thomas theory on Calabi-Yau 4-folds
por: Cao, Yalong, et al.
Publicado: (2024)
por: Cao, Yalong, et al.
Publicado: (2024)
Unsupervised Detection of Fraudulent Transactions in E-commerce Using Contrastive Learning
por: Li, Xuan, et al.
Publicado: (2025)
por: Li, Xuan, et al.
Publicado: (2025)
IndustryBench: Probing the Industrial Knowledge Boundaries of LLMs
por: Bai, Songlin, et al.
Publicado: (2026)
por: Bai, Songlin, et al.
Publicado: (2026)
Ejemplares similares
-
AgentFrontier: Expanding the Capability Frontier of LLM Agents with ZPD-Guided Data Synthesis
por: Chen, Xuanzhong, et al.
Publicado: (2025) -
EcomMMMU: Strategic Utilization of Visuals for Robust Multimodal E-commerce Models
por: Ling, Xinyi, et al.
Publicado: (2025) -
OxyEcomBench: Benchmarking Multimodal Foundation Models across E-Commerce Ecosystems
por: Liu, Yong, et al.
Publicado: (2026) -
WebResearcher: Unleashing unbounded reasoning capability in Long-Horizon Agents
por: Qiao, Zile, et al.
Publicado: (2025) -
HiMA-Ecom: Enabling Joint Training of Hierarchical Multi-Agent E-commerce Assistants
por: Hu, Junxing, et al.
Publicado: (2025)