CT-Eval: Benchmarking Chinese Text-to-Table Performance in Large Language Models
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Shi, Haoxiang, Wang, Jiaan, Xu, Jiarong, Wang, Cen, Sakai, Tetsuya |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
An Empirical Study of Many-to-Many Summarization with Large Language Models
von: Wang, Jiaan, et al.
Veröffentlicht: (2025)
von: Wang, Jiaan, et al.
Veröffentlicht: (2025)
Cross-Lingual Knowledge Editing in Large Language Models
von: Wang, Jiaan, et al.
Veröffentlicht: (2023)
von: Wang, Jiaan, et al.
Veröffentlicht: (2023)
AgriEval: A Comprehensive Chinese Agricultural Benchmark for Large Language Models
von: Yan, Lian, et al.
Veröffentlicht: (2025)
von: Yan, Lian, et al.
Veröffentlicht: (2025)
Unleashing the Power of Emojis in Texts via Self-supervised Graph Pre-Training
von: Zhang, Zhou, et al.
Veröffentlicht: (2024)
von: Zhang, Zhou, et al.
Veröffentlicht: (2024)
CRiskEval: A Chinese Multi-Level Risk Evaluation Benchmark Dataset for Large Language Models
von: Shi, Ling, et al.
Veröffentlicht: (2024)
von: Shi, Ling, et al.
Veröffentlicht: (2024)
FinEval: A Chinese Financial Domain Knowledge Evaluation Benchmark for Large Language Models
von: Guo, Xin, et al.
Veröffentlicht: (2023)
von: Guo, Xin, et al.
Veröffentlicht: (2023)
ESC-Eval: Evaluating Emotion Support Conversations in Large Language Models
von: Zhao, Haiquan, et al.
Veröffentlicht: (2024)
von: Zhao, Haiquan, et al.
Veröffentlicht: (2024)
MedEthicEval: Evaluating Large Language Models Based on Chinese Medical Ethics
von: Jin, Haoan, et al.
Veröffentlicht: (2025)
von: Jin, Haoan, et al.
Veröffentlicht: (2025)
LexEval: A Comprehensive Chinese Legal Benchmark for Evaluating Large Language Models
von: Li, Haitao, et al.
Veröffentlicht: (2024)
von: Li, Haitao, et al.
Veröffentlicht: (2024)
CLongEval: A Chinese Benchmark for Evaluating Long-Context Large Language Models
von: Qiu, Zexuan, et al.
Veröffentlicht: (2024)
von: Qiu, Zexuan, et al.
Veröffentlicht: (2024)
EduEval: A Hierarchical Cognitive Benchmark for Evaluating Large Language Models in Chinese Education
von: Ma, Guoqing, et al.
Veröffentlicht: (2025)
von: Ma, Guoqing, et al.
Veröffentlicht: (2025)
CMoralEval: A Moral Evaluation Benchmark for Chinese Large Language Models
von: Yu, Linhao, et al.
Veröffentlicht: (2024)
von: Yu, Linhao, et al.
Veröffentlicht: (2024)
StatEval: A Comprehensive Benchmark for Large Language Models in Statistics
von: Lu, Yuchen, et al.
Veröffentlicht: (2025)
von: Lu, Yuchen, et al.
Veröffentlicht: (2025)
Isolating Language-Coding from Problem-Solving: Benchmarking LLMs with PseudoEval
von: Wu, Jiarong, et al.
Veröffentlicht: (2025)
von: Wu, Jiarong, et al.
Veröffentlicht: (2025)
Large Language Models for Healthcare Text Classification: A Systematic Review
von: Sakai, Hajar, et al.
Veröffentlicht: (2025)
von: Sakai, Hajar, et al.
Veröffentlicht: (2025)
VisEval: A Benchmark for Data Visualization in the Era of Large Language Models
von: Chen, Nan, et al.
Veröffentlicht: (2024)
von: Chen, Nan, et al.
Veröffentlicht: (2024)
INSEva: A Comprehensive Chinese Benchmark for Large Language Models in Insurance
von: Chen, Shisong, et al.
Veröffentlicht: (2025)
von: Chen, Shisong, et al.
Veröffentlicht: (2025)
MT-Eval: A Multi-Turn Capabilities Evaluation Benchmark for Large Language Models
von: Kwan, Wai-Chung, et al.
Veröffentlicht: (2024)
von: Kwan, Wai-Chung, et al.
Veröffentlicht: (2024)
TCM-Eval: An Expert-Level Dynamic and Extensible Benchmark for Traditional Chinese Medicine
von: Cheng, Zihao, et al.
Veröffentlicht: (2025)
von: Cheng, Zihao, et al.
Veröffentlicht: (2025)
SocialEval: Evaluating Social Intelligence of Large Language Models
von: Zhou, Jinfeng, et al.
Veröffentlicht: (2025)
von: Zhou, Jinfeng, et al.
Veröffentlicht: (2025)
ChineseSafe: A Chinese Benchmark for Evaluating Safety in Large Language Models
von: Zhang, Hengxiang, et al.
Veröffentlicht: (2024)
von: Zhang, Hengxiang, et al.
Veröffentlicht: (2024)
AICoderEval: Improving AI Domain Code Generation of Large Language Models
von: Xia, Yinghui, et al.
Veröffentlicht: (2024)
von: Xia, Yinghui, et al.
Veröffentlicht: (2024)
AccessEval: Benchmarking Disability Bias in Large Language Models
von: Panda, Srikant, et al.
Veröffentlicht: (2025)
von: Panda, Srikant, et al.
Veröffentlicht: (2025)
StressEval: Failure-Driven Dynamic Benchmarking for Knowledge-Intensive Reasoning in Large Language Models
von: Chen, Yongrui, et al.
Veröffentlicht: (2026)
von: Chen, Yongrui, et al.
Veröffentlicht: (2026)
OpenEval: Benchmarking Chinese LLMs across Capability, Alignment and Safety
von: Liu, Chuang, et al.
Veröffentlicht: (2024)
von: Liu, Chuang, et al.
Veröffentlicht: (2024)
SlangDIT: Benchmarking LLMs in Interpretative Slang Translation
von: Liang, Yunlong, et al.
Veröffentlicht: (2025)
von: Liang, Yunlong, et al.
Veröffentlicht: (2025)
AdaptEval: Evaluating Large Language Models on Domain Adaptation for Text Summarization
von: Afzal, Anum, et al.
Veröffentlicht: (2024)
von: Afzal, Anum, et al.
Veröffentlicht: (2024)
McBE: A Multi-task Chinese Bias Evaluation Benchmark for Large Language Models
von: Lan, Tian, et al.
Veröffentlicht: (2025)
von: Lan, Tian, et al.
Veröffentlicht: (2025)
PerHalluEval: Persian Hallucination Evaluation Benchmark for Large Language Models
von: Hosseini, Mohammad, et al.
Veröffentlicht: (2025)
von: Hosseini, Mohammad, et al.
Veröffentlicht: (2025)
QuantEval: A Benchmark for Financial Quantitative Tasks in Large Language Models
von: Kang, Zhaolu, et al.
Veröffentlicht: (2026)
von: Kang, Zhaolu, et al.
Veröffentlicht: (2026)
RoleEval: A Bilingual Role Evaluation Benchmark for Large Language Models
von: Shen, Tianhao, et al.
Veröffentlicht: (2023)
von: Shen, Tianhao, et al.
Veröffentlicht: (2023)
CFinBench: A Comprehensive Chinese Financial Benchmark for Large Language Models
von: Nie, Ying, et al.
Veröffentlicht: (2024)
von: Nie, Ying, et al.
Veröffentlicht: (2024)
QUAD-LLM-MLTC: Large Language Models Ensemble Learning for Healthcare Text Multi-Label Classification
von: Sakai, Hajar, et al.
Veröffentlicht: (2025)
von: Sakai, Hajar, et al.
Veröffentlicht: (2025)
TableEval: A Real-World Benchmark for Complex, Multilingual, and Multi-Structured Table Question Answering
von: Zhu, Junnan, et al.
Veröffentlicht: (2025)
von: Zhu, Junnan, et al.
Veröffentlicht: (2025)
On the (In)Effectiveness of Large Language Models for Chinese Text Correction
von: Li, Yinghui, et al.
Veröffentlicht: (2023)
von: Li, Yinghui, et al.
Veröffentlicht: (2023)
LAiW: A Chinese Legal Large Language Models Benchmark
von: Dai, Yongfu, et al.
Veröffentlicht: (2023)
von: Dai, Yongfu, et al.
Veröffentlicht: (2023)
UHGEval: Benchmarking the Hallucination of Chinese Large Language Models via Unconstrained Generation
von: Liang, Xun, et al.
Veröffentlicht: (2023)
von: Liang, Xun, et al.
Veröffentlicht: (2023)
ToolBeHonest: A Multi-level Hallucination Diagnostic Benchmark for Tool-Augmented Large Language Models
von: Zhang, Yuxiang, et al.
Veröffentlicht: (2024)
von: Zhang, Yuxiang, et al.
Veröffentlicht: (2024)
StrucText-Eval: Evaluating Large Language Model's Reasoning Ability in Structure-Rich Text
von: Gu, Zhouhong, et al.
Veröffentlicht: (2024)
von: Gu, Zhouhong, et al.
Veröffentlicht: (2024)
Challenging the Boundaries of Reasoning: An Olympiad-Level Math Benchmark for Large Language Models
von: Sun, Haoxiang, et al.
Veröffentlicht: (2025)
von: Sun, Haoxiang, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
An Empirical Study of Many-to-Many Summarization with Large Language Models
von: Wang, Jiaan, et al.
Veröffentlicht: (2025) -
Cross-Lingual Knowledge Editing in Large Language Models
von: Wang, Jiaan, et al.
Veröffentlicht: (2023) -
AgriEval: A Comprehensive Chinese Agricultural Benchmark for Large Language Models
von: Yan, Lian, et al.
Veröffentlicht: (2025) -
Unleashing the Power of Emojis in Texts via Self-supervised Graph Pre-Training
von: Zhang, Zhou, et al.
Veröffentlicht: (2024) -
CRiskEval: A Chinese Multi-Level Risk Evaluation Benchmark Dataset for Large Language Models
von: Shi, Ling, et al.
Veröffentlicht: (2024)