ChineseEcomQA: A Scalable E-commerce Concept Evaluation Benchmark for Large Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Chen, Haibin, Lv, Kangtao, Hu, Chengwei, Li, Yanshi, Yuan, Yujin, He, Yancheng, Zhang, Xingyao, Liu, Langming, Liu, Shilei, Su, Wenbo, Zheng, Bo |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
How to inject knowledge efficiently? Knowledge Infusion Scaling Law for Pre-training Large Language Models
by: Lv, Kangtao, et al.
Published: (2025)
by: Lv, Kangtao, et al.
Published: (2025)
ECKGBench: Benchmarking Large Language Models in E-commerce Leveraging Knowledge Graph
by: Liu, Langming, et al.
Published: (2025)
by: Liu, Langming, et al.
Published: (2025)
Data Distribution Matters: A Data-Centric Perspective on Context Compression for Large Language Model
by: Lv, Kangtao, et al.
Published: (2026)
by: Lv, Kangtao, et al.
Published: (2026)
PretrainRL: Alleviating Factuality Hallucination of Large Language Models at the Beginning
by: Liu, Langming, et al.
Published: (2026)
by: Liu, Langming, et al.
Published: (2026)
PoC: Performance-oriented Context Compression for Large Language Models via Performance Prediction
by: Zhao, Runsong, et al.
Published: (2026)
by: Zhao, Runsong, et al.
Published: (2026)
Chinese SimpleQA: A Chinese Factuality Evaluation for Large Language Models
by: He, Yancheng, et al.
Published: (2024)
by: He, Yancheng, et al.
Published: (2024)
CoMeT: Collaborative Memory Transformer for Efficient Long Context Modeling
by: Zhao, Runsong, et al.
Published: (2026)
by: Zhao, Runsong, et al.
Published: (2026)
Read As Human: Compressing Context via Parallelizable Close Reading and Skimming
by: Tang, Jiwei, et al.
Published: (2026)
by: Tang, Jiwei, et al.
Published: (2026)
EcomBench: Towards Holistic Evaluation of Foundation Agents in E-commerce
by: Min, Rui, et al.
Published: (2025)
by: Min, Rui, et al.
Published: (2025)
Expert Divergence Learning for MoE-based Language Models
by: Li, Jiaang, et al.
Published: (2026)
by: Li, Jiaang, et al.
Published: (2026)
Chinese SafetyQA: A Safety Short-form Factuality Benchmark for Large Language Models
by: Tan, Yingshui, et al.
Published: (2024)
by: Tan, Yingshui, et al.
Published: (2024)
UQABench: Evaluating User Embedding for Prompting LLMs in Personalized Question Answering
by: Liu, Langming, et al.
Published: (2025)
by: Liu, Langming, et al.
Published: (2025)
Unlocking Scaling Law in Industrial Recommendation Systems with a Three-step Paradigm based Large User Model
by: Yan, Bencheng, et al.
Published: (2025)
by: Yan, Bencheng, et al.
Published: (2025)
COMI: Coarse-to-fine Context Compression via Marginal Information Gain
by: Tang, Jiwei, et al.
Published: (2026)
by: Tang, Jiwei, et al.
Published: (2026)
EcomMMMU: Strategic Utilization of Visuals for Robust Multimodal E-commerce Models
by: Ling, Xinyi, et al.
Published: (2025)
by: Ling, Xinyi, et al.
Published: (2025)
ConceptMath: A Bilingual Concept-wise Benchmark for Measuring Mathematical Reasoning of Large Language Models
by: Wu, Yanan, et al.
Published: (2024)
by: Wu, Yanan, et al.
Published: (2024)
EcomScriptBench: A Multi-task Benchmark for E-commerce Script Planning via Step-wise Intention-Driven Product Association
by: Wang, Weiqi, et al.
Published: (2025)
by: Wang, Weiqi, et al.
Published: (2025)
HiMA-Ecom: Enabling Joint Training of Hierarchical Multi-Agent E-commerce Assistants
by: Hu, Junxing, et al.
Published: (2025)
by: Hu, Junxing, et al.
Published: (2025)
AIR: Complex Instruction Generation via Automatic Iterative Refinement
by: Liu, Wei, et al.
Published: (2025)
by: Liu, Wei, et al.
Published: (2025)
OxyEcomBench: Benchmarking Multimodal Foundation Models across E-Commerce Ecosystems
by: Liu, Yong, et al.
Published: (2026)
by: Liu, Yong, et al.
Published: (2026)
EcomEdit: An Automated E-commerce Knowledge Editing Framework for Enhanced Product and Purchase Intention Understanding
by: Lau, Ching Ming Samuel, et al.
Published: (2024)
by: Lau, Ching Ming Samuel, et al.
Published: (2024)
IntentionQA: A Benchmark for Evaluating Purchase Intention Comprehension Abilities of Language Models in E-commerce
by: Ding, Wenxuan, et al.
Published: (2024)
by: Ding, Wenxuan, et al.
Published: (2024)
MT-Bench-101: A Fine-Grained Benchmark for Evaluating Large Language Models in Multi-Turn Dialogues
by: Bai, Ge, et al.
Published: (2024)
by: Bai, Ge, et al.
Published: (2024)
MedConceptsQA: Open Source Medical Concepts QA Benchmark
by: Shoham, Ofir Ben, et al.
Published: (2024)
by: Shoham, Ofir Ben, et al.
Published: (2024)
Analysis of regularized federated learning
by: Liu, Langming, et al.
Published: (2024)
by: Liu, Langming, et al.
Published: (2024)
Equilibrate RLHF: Towards Balancing Helpfulness-Safety Trade-off in Large Language Models
by: Tan, Yingshui, et al.
Published: (2025)
by: Tan, Yingshui, et al.
Published: (2025)
NAN: A Training-Free Solution to Coefficient Estimation in Model Merging
by: Si, Chongjie, et al.
Published: (2025)
by: Si, Chongjie, et al.
Published: (2025)
WiS Platform: Enhancing Evaluation of LLM-Based Multi-Agent Systems Through Game-Based Analysis
by: Hu, Chengwei, et al.
Published: (2024)
by: Hu, Chengwei, et al.
Published: (2024)
Multi-task Offline Reinforcement Learning for Online Advertising in Recommender Systems
by: Liu, Langming, et al.
Published: (2025)
by: Liu, Langming, et al.
Published: (2025)
BaziQA-Benchmark: Evaluating Symbolic and Temporally Compositional Reasoning in Large Language Models
by: Chen, Jiangxi, et al.
Published: (2026)
by: Chen, Jiangxi, et al.
Published: (2026)
A Functionality-Grounded Benchmark for Evaluating Web Agents in E-commerce Domains
by: Zhang, Xianren, et al.
Published: (2025)
by: Zhang, Xianren, et al.
Published: (2025)
"See the World, Discover Knowledge": A Chinese Factuality Evaluation for Large Vision Language Models
by: Gu, Jihao, et al.
Published: (2025)
by: Gu, Jihao, et al.
Published: (2025)
SimpleDevQA: Benchmarking Large Language Models on Development Knowledge QA
by: Zhang, Jing, et al.
Published: (2025)
by: Zhang, Jing, et al.
Published: (2025)
RAVR: Reference-Answer-guided Variational Reasoning for Large Language Models
by: Lin, Tianqianjin, et al.
Published: (2025)
by: Lin, Tianqianjin, et al.
Published: (2025)
McBE: A Multi-task Chinese Bias Evaluation Benchmark for Large Language Models
by: Lan, Tian, et al.
Published: (2025)
by: Lan, Tian, et al.
Published: (2025)
EconLogicQA: A Question-Answering Benchmark for Evaluating Large Language Models in Economic Sequential Reasoning
by: Quan, Yinzhu, et al.
Published: (2024)
by: Quan, Yinzhu, et al.
Published: (2024)
Mix-Ecom: Towards Mixed-Type E-Commerce Dialogues with Complex Domain Rules
by: Zhou, Chenyu, et al.
Published: (2025)
by: Zhou, Chenyu, et al.
Published: (2025)
Does International Financial Reporting Standards adoption improve or impede comparability? New evidence from Chinese dual‐class firms
by: Jenny Xinjiao Guan, et al.
Published: (2024)
by: Jenny Xinjiao Guan, et al.
Published: (2024)
An Improved Quantum Private Set Intersection Protocol Based on Hadamard Gates
by: Liu, Wenjie, et al.
Published: (2023)
by: Liu, Wenjie, et al.
Published: (2023)
ChiMDQA: Towards Comprehensive Chinese Document QA with Fine-grained Evaluation
by: Gao, Jing, et al.
Published: (2025)
by: Gao, Jing, et al.
Published: (2025)
Similar Items
-
How to inject knowledge efficiently? Knowledge Infusion Scaling Law for Pre-training Large Language Models
by: Lv, Kangtao, et al.
Published: (2025) -
ECKGBench: Benchmarking Large Language Models in E-commerce Leveraging Knowledge Graph
by: Liu, Langming, et al.
Published: (2025) -
Data Distribution Matters: A Data-Centric Perspective on Context Compression for Large Language Model
by: Lv, Kangtao, et al.
Published: (2026) -
PretrainRL: Alleviating Factuality Hallucination of Large Language Models at the Beginning
by: Liu, Langming, et al.
Published: (2026) -
PoC: Performance-oriented Context Compression for Large Language Models via Performance Prediction
by: Zhao, Runsong, et al.
Published: (2026)