Xiezhi: An Ever-Updating Benchmark for Holistic Domain Knowledge Evaluation
Fuente:
arXiv
Guardado en:
| Autores principales: | Gu, Zhouhong, Zhu, Xiaoxuan, Ye, Haoning, Zhang, Lin, Wang, Jianchen, Zhu, Yixin, Jiang, Sihang, Xiong, Zhuozhi, Li, Zihan, Wu, Weijie, He, Qianyu, Xu, Rui, Huang, Wenhao, Liu, Jingping, Wang, Zili, Wang, Shusen, Zheng, Weiguo, Feng, Hongwei, Xiao, Yanghua |
|---|---|
| Formato: | Preprint |
| Publicado: |
2023
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Efficiently Quantifying and Mitigating Ripple Effects in Model Editing
por: Wang, Jianchen, et al.
Publicado: (2024)
por: Wang, Jianchen, et al.
Publicado: (2024)
VCEval: Rethinking What is a Good Educational Video and How to Automatically Evaluate It
por: Zhu, Xiaoxuan, et al.
Publicado: (2024)
por: Zhu, Xiaoxuan, et al.
Publicado: (2024)
DetectBench: Can Large Language Model Detect and Piece Together Implicit Evidence?
por: Gu, Zhouhong, et al.
Publicado: (2024)
por: Gu, Zhouhong, et al.
Publicado: (2024)
Piecing Together Clues: A Benchmark for Evaluating the Detective Skills of Large Language Models
por: Gu, Zhouhong, et al.
Publicado: (2023)
por: Gu, Zhouhong, et al.
Publicado: (2023)
StrucText-Eval: Evaluating Large Language Model's Reasoning Ability in Structure-Rich Text
por: Gu, Zhouhong, et al.
Publicado: (2024)
por: Gu, Zhouhong, et al.
Publicado: (2024)
ToReMi: Topic-Aware Data Reweighting for Dynamic Pre-Training Data Selection
por: Zhu, Xiaoxuan, et al.
Publicado: (2025)
por: Zhu, Xiaoxuan, et al.
Publicado: (2025)
RECKON: Large-scale Reference-based Efficient Knowledge Evaluation for Large Language Model
por: Zhang, Lin, et al.
Publicado: (2025)
por: Zhang, Lin, et al.
Publicado: (2025)
LITE: LLM-Impelled efficient Taxonomy Evaluation
por: Zhang, Lin, et al.
Publicado: (2025)
por: Zhang, Lin, et al.
Publicado: (2025)
LLM-GAN: Construct Generative Adversarial Network Through Large Language Models For Explainable Fake News Detection
por: Wang, Yifeng, et al.
Publicado: (2024)
por: Wang, Yifeng, et al.
Publicado: (2024)
Can Large Language Models Understand Real-World Complex Instructions?
por: He, Qianyu, et al.
Publicado: (2023)
por: He, Qianyu, et al.
Publicado: (2023)
ConcEPT: Concept-Enhanced Pre-Training for Language Models
por: Wang, Xintao, et al.
Publicado: (2024)
por: Wang, Xintao, et al.
Publicado: (2024)
Enhancing Quantitative Reasoning Skills of Large Language Models through Dimension Perception
por: Huang, Yuncheng, et al.
Publicado: (2023)
por: Huang, Yuncheng, et al.
Publicado: (2023)
GAPO: Learning Preferential Prompt through Generative Adversarial Policy Optimization
por: Gu, Zhouhong, et al.
Publicado: (2025)
por: Gu, Zhouhong, et al.
Publicado: (2025)
Real-time Holistic Robot Pose Estimation with Unknown States
por: Ban, Shikun, et al.
Publicado: (2024)
por: Ban, Shikun, et al.
Publicado: (2024)
Is There a One-Model-Fits-All Approach to Information Extraction? Revisiting Task Definition Biases
por: Huang, Wenhao, et al.
Publicado: (2024)
por: Huang, Wenhao, et al.
Publicado: (2024)
AgentGroupChat: An Interactive Group Chat Simulacra For Better Eliciting Emergent Behavior
por: Gu, Zhouhong, et al.
Publicado: (2024)
por: Gu, Zhouhong, et al.
Publicado: (2024)
Bullying prevention training for Chinese preservice teachers' efficacy and beliefs toward bullying
por: Qianyu Zhu, et al.
Publicado: (2024)
por: Qianyu Zhu, et al.
Publicado: (2024)
AgentGroupChat-V2: Divide-and-Conquer Is What LLM-Based Multi-Agent System Need
por: Gu, Zhouhong, et al.
Publicado: (2025)
por: Gu, Zhouhong, et al.
Publicado: (2025)
Towards Dynamic and Small Objects Refinement for Unsupervised Domain Adaptative Nighttime Semantic Segmentation
por: Pan, Jingyi, et al.
Publicado: (2023)
por: Pan, Jingyi, et al.
Publicado: (2023)
AutoScraper: A Progressive Understanding Web Agent for Web Scraper Generation
por: Huang, Wenhao, et al.
Publicado: (2024)
por: Huang, Wenhao, et al.
Publicado: (2024)
Negation Triplet Extraction with Syntactic Dependency and Semantic Consistency
por: Shi, Yuchen, et al.
Publicado: (2024)
por: Shi, Yuchen, et al.
Publicado: (2024)
Scaling Behavior of Single LLM-Driven Multi-Agent Systems
por: Li, Jialing, et al.
Publicado: (2026)
por: Li, Jialing, et al.
Publicado: (2026)
Complex Dynamical Analysis of Two Factors of Fractional‐Order Conflict Model With Time Delay and Feedback Control Strategy: With Focus on China’s Internet Conflicts
por: Hao Xiong, et al.
Publicado: (2026)
por: Hao Xiong, et al.
Publicado: (2026)
Why Did Apple Fall: Evaluating Curiosity in Large Language Models
por: Wang, Haoyu, et al.
Publicado: (2025)
por: Wang, Haoyu, et al.
Publicado: (2025)
Clostridium innocuum: More Important Than Ever
por: Xujuan Luo, et al.
Publicado: (2024)
por: Xujuan Luo, et al.
Publicado: (2024)
Light Up the Shadows: Enhance Long-Tailed Entity Grounding with Concept-Guided Vision-Language Models
por: Zhang, Yikai, et al.
Publicado: (2024)
por: Zhang, Yikai, et al.
Publicado: (2024)
DeepSeek: Paradigm Shifts and Technical Evolution in Large AI Models
por: Xiong, Luolin, et al.
Publicado: (2025)
por: Xiong, Luolin, et al.
Publicado: (2025)
Low-rank Tensor Autoregressive Predictor for Third-Order Time-Series Forecasting
por: Wang, Haoning, et al.
Publicado: (2024)
por: Wang, Haoning, et al.
Publicado: (2024)
Scaling Up Dynamic Human-Scene Interaction Modeling
por: Jiang, Nan, et al.
Publicado: (2024)
por: Jiang, Nan, et al.
Publicado: (2024)
OmniSonic: Towards Universal and Holistic Audio Generation from Video and Text
por: Pian, Weiguo, et al.
Publicado: (2026)
por: Pian, Weiguo, et al.
Publicado: (2026)
Toward a Holistic Evaluation of Robustness in CLIP Models
por: Tu, Weijie, et al.
Publicado: (2024)
por: Tu, Weijie, et al.
Publicado: (2024)
The Ever-Evolving Science Exam
por: Wang, Junying, et al.
Publicado: (2025)
por: Wang, Junying, et al.
Publicado: (2025)
Fecal testosterone levels positively correlated with sexually motivated behaviors in male Tibetan macaques (Macaca thibetana)
por: Yong Zhu, et al.
Publicado: (2024)
por: Yong Zhu, et al.
Publicado: (2024)
GW-MoE: Resolving Uncertainty in MoE Router with Global Workspace Theory
por: Wu, Haoze, et al.
Publicado: (2024)
por: Wu, Haoze, et al.
Publicado: (2024)
Exploiting Duality in Open Information Extraction with Predicate Prompt
por: Chen, Zhen, et al.
Publicado: (2024)
por: Chen, Zhen, et al.
Publicado: (2024)
Two Binary trees of Rational numbers -- the S-tree and the SC-tree
por: Wang, Ziting, et al.
Publicado: (2023)
por: Wang, Ziting, et al.
Publicado: (2023)
Trade Efficiency of Information and Communication Technology Products Between China and RCEP Member Countries
por: Xiaomei Wang, et al.
Publicado: (2025)
por: Xiaomei Wang, et al.
Publicado: (2025)
Ever Faithful
por: Sartorious, David
Publicado: (2018)
por: Sartorious, David
Publicado: (2018)
Reason from Fallacy: Enhancing Large Language Models' Logical Reasoning through Logical Fallacy Understanding
por: Li, Yanda, et al.
Publicado: (2024)
por: Li, Yanda, et al.
Publicado: (2024)
Production, Characteristics and Biological effects of Protonated Small Water Clusters
por: Zhu, Yixin
Publicado: (2025)
por: Zhu, Yixin
Publicado: (2025)
Ejemplares similares
-
Efficiently Quantifying and Mitigating Ripple Effects in Model Editing
por: Wang, Jianchen, et al.
Publicado: (2024) -
VCEval: Rethinking What is a Good Educational Video and How to Automatically Evaluate It
por: Zhu, Xiaoxuan, et al.
Publicado: (2024) -
DetectBench: Can Large Language Model Detect and Piece Together Implicit Evidence?
por: Gu, Zhouhong, et al.
Publicado: (2024) -
Piecing Together Clues: A Benchmark for Evaluating the Detective Skills of Large Language Models
por: Gu, Zhouhong, et al.
Publicado: (2023) -
StrucText-Eval: Evaluating Large Language Model's Reasoning Ability in Structure-Rich Text
por: Gu, Zhouhong, et al.
Publicado: (2024)