Fùxì: A Benchmark for Evaluating Language Models on Ancient Chinese Text Understanding and Generation
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Zhao, Shangqing, Zhou, Yuhao, Ren, Yupei, Chen, Zhe, Jia, Chenghao, Zhe, Fang, Long, Zhaogaung, Liu, Shu, Lan, Man |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
CCiV: A Benchmark for Structure, Rhythm and Quality in LLM-Generated Chinese \textit{Ci} Poetry
von: Zhao, Shangqing, et al.
Veröffentlicht: (2026)
von: Zhao, Shangqing, et al.
Veröffentlicht: (2026)
FinDABench: Benchmarking Financial Data Analysis Ability of Large Language Models
von: Liu, Shu, et al.
Veröffentlicht: (2024)
von: Liu, Shu, et al.
Veröffentlicht: (2024)
Towards Comprehensive Argument Analysis in Education: Dataset, Tasks, and Method
von: Ren, Yupei, et al.
Veröffentlicht: (2025)
von: Ren, Yupei, et al.
Veröffentlicht: (2025)
CSRP: Chain-of-Thought Reasoning for Chinese Text Correction via Reinforcement Learning with Efficiency-Aware Rewards
von: Tian, Wei, et al.
Veröffentlicht: (2026)
von: Tian, Wei, et al.
Veröffentlicht: (2026)
Does Visual Grounding Enhance the Understanding of Embodied Knowledge in Large Language Models?
von: Yang, Zhihui, et al.
Veröffentlicht: (2025)
von: Yang, Zhihui, et al.
Veröffentlicht: (2025)
FuxiMT: Sparsifying Large Language Models for Chinese-Centric Multilingual Machine Translation
von: Zhu, Shaolin, et al.
Veröffentlicht: (2025)
von: Zhu, Shaolin, et al.
Veröffentlicht: (2025)
Beyond Agreement: Diagnosing the Rationale Alignment of Automated Essay Scoring Methods based on Linguistically-informed Counterfactuals
von: Wang, Yupei, et al.
Veröffentlicht: (2024)
von: Wang, Yupei, et al.
Veröffentlicht: (2024)
Understanding Literary Texts by LLMs: A Case Study of Ancient Chinese Poetry
von: Zhao, Cheng, et al.
Veröffentlicht: (2024)
von: Zhao, Cheng, et al.
Veröffentlicht: (2024)
AC-EVAL: Evaluating Ancient Chinese Language Understanding in Large Language Models
von: Wei, Yuting, et al.
Veröffentlicht: (2024)
von: Wei, Yuting, et al.
Veröffentlicht: (2024)
Worlds Within Words: Translating Culture in Ancient Chinese Texts with Multi-Agent Coordination
von: He, Xiaoqi, et al.
Veröffentlicht: (2026)
von: He, Xiaoqi, et al.
Veröffentlicht: (2026)
Falcon: A Comprehensive Chinese Text-to-SQL Benchmark for Enterprise-Grade Evaluation
von: Luo, Wenzhen, et al.
Veröffentlicht: (2025)
von: Luo, Wenzhen, et al.
Veröffentlicht: (2025)
Benchmarking Vision-Language Models on Chinese Ancient Documents: From OCR to Knowledge Reasoning
von: Yu, Haiyang, et al.
Veröffentlicht: (2025)
von: Yu, Haiyang, et al.
Veröffentlicht: (2025)
FuxiTranyu: A Multilingual Large Language Model Trained with Balanced Data
von: Sun, Haoran, et al.
Veröffentlicht: (2024)
von: Sun, Haoran, et al.
Veröffentlicht: (2024)
Prompt Tuning for Few-Shot Continual Learning Named Entity Recognition
von: Ren, Zhe
Veröffentlicht: (2025)
von: Ren, Zhe
Veröffentlicht: (2025)
AncientBench: Towards Comprehensive Evaluation on Excavated and Transmitted Chinese Corpora
von: Zhou, Zhihan, et al.
Veröffentlicht: (2025)
von: Zhou, Zhihan, et al.
Veröffentlicht: (2025)
CERD: A Comprehensive Chinese Rhetoric Dataset for Rhetorical Understanding and Generation in Essays
von: Liu, Nuowei, et al.
Veröffentlicht: (2024)
von: Liu, Nuowei, et al.
Veröffentlicht: (2024)
Benchmarking Large Language Models on CFLUE -- A Chinese Financial Language Understanding Evaluation Dataset
von: Zhu, Jie, et al.
Veröffentlicht: (2024)
von: Zhu, Jie, et al.
Veröffentlicht: (2024)
McBE: A Multi-task Chinese Bias Evaluation Benchmark for Large Language Models
von: Lan, Tian, et al.
Veröffentlicht: (2025)
von: Lan, Tian, et al.
Veröffentlicht: (2025)
Palette of Language Models: A Solver for Controlled Text Generation
von: Yang, Zhe, et al.
Veröffentlicht: (2025)
von: Yang, Zhe, et al.
Veröffentlicht: (2025)
CVLUE: A New Benchmark Dataset for Chinese Vision-Language Understanding Evaluation
von: Wang, Yuxuan, et al.
Veröffentlicht: (2024)
von: Wang, Yuxuan, et al.
Veröffentlicht: (2024)
Accounting Reasoning in Large Language Models: Concepts, Evaluation, and Empirical Analysis
von: Zhou, Jie, et al.
Veröffentlicht: (2025)
von: Zhou, Jie, et al.
Veröffentlicht: (2025)
Benchmarking Machine Translation on Chinese Social Media Texts
von: Zhao, Kaiyan, et al.
Veröffentlicht: (2026)
von: Zhao, Kaiyan, et al.
Veröffentlicht: (2026)
CNSL-bench: Benchmarking the Sign Language Understanding Capabilities of MLLMs on Chinese National Sign Language
von: Zhao, Rui, et al.
Veröffentlicht: (2026)
von: Zhao, Rui, et al.
Veröffentlicht: (2026)
A Survey on Temporal Knowledge Graph: Representation Learning and Applications
von: Cai, Li, et al.
Veröffentlicht: (2024)
von: Cai, Li, et al.
Veröffentlicht: (2024)
Evaluating Chinese Ambiguity Understanding in Large Language Models
von: Mo, Junwen, et al.
Veröffentlicht: (2026)
von: Mo, Junwen, et al.
Veröffentlicht: (2026)
LawGPT: A Chinese Legal Knowledge-Enhanced Large Language Model
von: Zhou, Zhi, et al.
Veröffentlicht: (2024)
von: Zhou, Zhi, et al.
Veröffentlicht: (2024)
CITE: A Comprehensive Benchmark for Heterogeneous Text-Attributed Graphs on Catalytic Materials
von: Zhang, Chenghao, et al.
Veröffentlicht: (2025)
von: Zhang, Chenghao, et al.
Veröffentlicht: (2025)
Evaluating, Understanding, and Improving Constrained Text Generation for Large Language Models
von: Chen, Xiang, et al.
Veröffentlicht: (2023)
von: Chen, Xiang, et al.
Veröffentlicht: (2023)
ChineseSafe: A Chinese Benchmark for Evaluating Safety in Large Language Models
von: Zhang, Hengxiang, et al.
Veröffentlicht: (2024)
von: Zhang, Hengxiang, et al.
Veröffentlicht: (2024)
Predicting Punctuation in Ancient Chinese Texts: A Multi-Layered LSTM and Attention-Based Approach
von: Cai, Tracy, et al.
Veröffentlicht: (2024)
von: Cai, Tracy, et al.
Veröffentlicht: (2024)
ChineseErrorCorrector3-4B: State-of-the-Art Chinese Spelling and Grammar Corrector
von: Tian, Wei, et al.
Veröffentlicht: (2025)
von: Tian, Wei, et al.
Veröffentlicht: (2025)
Qibo: A Large Language Model for Traditional Chinese Medicine
von: Zhang, Heyi, et al.
Veröffentlicht: (2024)
von: Zhang, Heyi, et al.
Veröffentlicht: (2024)
LHMKE: A Large-scale Holistic Multi-subject Knowledge Evaluation Benchmark for Chinese Large Language Models
von: Liu, Chuang, et al.
Veröffentlicht: (2024)
von: Liu, Chuang, et al.
Veröffentlicht: (2024)
Chinese-Vicuna: A Chinese Instruction-following Llama-based Model
von: Fan, Chenghao, et al.
Veröffentlicht: (2025)
von: Fan, Chenghao, et al.
Veröffentlicht: (2025)
A Visually Impaired Assistance Benchmark for VLM-as-a-Judge Evaluation
von: Zhao, Yi, et al.
Veröffentlicht: (2026)
von: Zhao, Yi, et al.
Veröffentlicht: (2026)
CT-Eval: Benchmarking Chinese Text-to-Table Performance in Large Language Models
von: Shi, Haoxiang, et al.
Veröffentlicht: (2024)
von: Shi, Haoxiang, et al.
Veröffentlicht: (2024)
Chengyu-Bench: Benchmarking Large Language Models for Chinese Idiom Understanding and Use
von: Fu, Yicheng, et al.
Veröffentlicht: (2025)
von: Fu, Yicheng, et al.
Veröffentlicht: (2025)
InteChar: A Unified Oracle Bone Character List for Ancient Chinese Language Modeling
von: Diao, Xiaolei, et al.
Veröffentlicht: (2025)
von: Diao, Xiaolei, et al.
Veröffentlicht: (2025)
EchoMind: An Interrelated Multi-level Benchmark for Evaluating Empathetic Speech Language Models
von: Zhou, Li, et al.
Veröffentlicht: (2025)
von: Zhou, Li, et al.
Veröffentlicht: (2025)
CArtBench: Evaluating Vision-Language Models on Chinese Art Understanding, Interpretation, and Authenticity
von: Wei, Xuefeng, et al.
Veröffentlicht: (2026)
von: Wei, Xuefeng, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
CCiV: A Benchmark for Structure, Rhythm and Quality in LLM-Generated Chinese \textit{Ci} Poetry
von: Zhao, Shangqing, et al.
Veröffentlicht: (2026) -
FinDABench: Benchmarking Financial Data Analysis Ability of Large Language Models
von: Liu, Shu, et al.
Veröffentlicht: (2024) -
Towards Comprehensive Argument Analysis in Education: Dataset, Tasks, and Method
von: Ren, Yupei, et al.
Veröffentlicht: (2025) -
CSRP: Chain-of-Thought Reasoning for Chinese Text Correction via Reinforcement Learning with Efficiency-Aware Rewards
von: Tian, Wei, et al.
Veröffentlicht: (2026) -
Does Visual Grounding Enhance the Understanding of Embodied Knowledge in Large Language Models?
von: Yang, Zhihui, et al.
Veröffentlicht: (2025)