The Mask of Civility: Benchmarking Chinese Mock Politeness Comprehension in Large Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhang, Yitong, Xiang, Yuhan, Liu, Mingxuan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
AgriEval: A Comprehensive Chinese Agricultural Benchmark for Large Language Models
di: Yan, Lian, et al.
Pubblicazione: (2025)
di: Yan, Lian, et al.
Pubblicazione: (2025)
LexEval: A Comprehensive Chinese Legal Benchmark for Evaluating Large Language Models
di: Li, Haitao, et al.
Pubblicazione: (2024)
di: Li, Haitao, et al.
Pubblicazione: (2024)
PediaBench: A Comprehensive Chinese Pediatric Dataset for Benchmarking Large Language Models
di: Zhang, Qian, et al.
Pubblicazione: (2024)
di: Zhang, Qian, et al.
Pubblicazione: (2024)
INSEva: A Comprehensive Chinese Benchmark for Large Language Models in Insurance
di: Chen, Shisong, et al.
Pubblicazione: (2025)
di: Chen, Shisong, et al.
Pubblicazione: (2025)
CFinBench: A Comprehensive Chinese Financial Benchmark for Large Language Models
di: Nie, Ying, et al.
Pubblicazione: (2024)
di: Nie, Ying, et al.
Pubblicazione: (2024)
JailBench: A Comprehensive Chinese Security Assessment Benchmark for Large Language Models
di: Liu, Shuyi, et al.
Pubblicazione: (2025)
di: Liu, Shuyi, et al.
Pubblicazione: (2025)
C$^{3}$Bench: A Comprehensive Classical Chinese Understanding Benchmark for Large Language Models
di: Cao, Jiahuan, et al.
Pubblicazione: (2024)
di: Cao, Jiahuan, et al.
Pubblicazione: (2024)
OmniEduBench: A Comprehensive Chinese Benchmark for Evaluating Large Language Models in Education
di: Zhang, Min, et al.
Pubblicazione: (2025)
di: Zhang, Min, et al.
Pubblicazione: (2025)
CRUD-RAG: A Comprehensive Chinese Benchmark for Retrieval-Augmented Generation of Large Language Models
di: Lyu, Yuanjie, et al.
Pubblicazione: (2024)
di: Lyu, Yuanjie, et al.
Pubblicazione: (2024)
GLBench: A Comprehensive Benchmark for Graph with Large Language Models
di: Li, Yuhan, et al.
Pubblicazione: (2024)
di: Li, Yuhan, et al.
Pubblicazione: (2024)
Gender Representation and Bias in Indian Civil Service Mock Interviews
di: Banerjee, Somonnoy, et al.
Pubblicazione: (2024)
di: Banerjee, Somonnoy, et al.
Pubblicazione: (2024)
ChineseSafe: A Chinese Benchmark for Evaluating Safety in Large Language Models
di: Zhang, Hengxiang, et al.
Pubblicazione: (2024)
di: Zhang, Hengxiang, et al.
Pubblicazione: (2024)
OphthBench: A Comprehensive Benchmark for Evaluating Large Language Models in Chinese Ophthalmology
di: Zhou, Chengfeng, et al.
Pubblicazione: (2025)
di: Zhou, Chengfeng, et al.
Pubblicazione: (2025)
TCMBench: A Comprehensive Benchmark for Evaluating Large Language Models in Traditional Chinese Medicine
di: Yue, Wenjing, et al.
Pubblicazione: (2024)
di: Yue, Wenjing, et al.
Pubblicazione: (2024)
E-EVAL: A Comprehensive Chinese K-12 Education Evaluation Benchmark for Large Language Models
di: Hou, Jinchang, et al.
Pubblicazione: (2024)
di: Hou, Jinchang, et al.
Pubblicazione: (2024)
MedBench: A Comprehensive, Standardized, and Reliable Benchmarking System for Evaluating Chinese Medical Large Language Models
di: Liu, Mianxin, et al.
Pubblicazione: (2024)
di: Liu, Mianxin, et al.
Pubblicazione: (2024)
BrowseComp-ZH: Benchmarking Web Browsing Ability of Large Language Models in Chinese
di: Zhou, Peilin, et al.
Pubblicazione: (2025)
di: Zhou, Peilin, et al.
Pubblicazione: (2025)
Large Language Models for Classical Chinese Poetry Translation: Benchmarking, Evaluating, and Improving
di: Chen, Andong, et al.
Pubblicazione: (2024)
di: Chen, Andong, et al.
Pubblicazione: (2024)
LexRel: Benchmarking Legal Relation Extraction for Chinese Civil Cases
di: Cai, Yida, et al.
Pubblicazione: (2025)
di: Cai, Yida, et al.
Pubblicazione: (2025)
StatEval: A Comprehensive Benchmark for Large Language Models in Statistics
di: Lu, Yuchen, et al.
Pubblicazione: (2025)
di: Lu, Yuchen, et al.
Pubblicazione: (2025)
LAiW: A Chinese Legal Large Language Models Benchmark
di: Dai, Yongfu, et al.
Pubblicazione: (2023)
di: Dai, Yongfu, et al.
Pubblicazione: (2023)
MultiTrust: A Comprehensive Benchmark Towards Trustworthy Multimodal Large Language Models
di: Zhang, Yichi, et al.
Pubblicazione: (2024)
di: Zhang, Yichi, et al.
Pubblicazione: (2024)
CMB: A Comprehensive Medical Benchmark in Chinese
di: Wang, Xidong, et al.
Pubblicazione: (2023)
di: Wang, Xidong, et al.
Pubblicazione: (2023)
CFBenchmark: Chinese Financial Assistant Benchmark for Large Language Model
di: Lei, Yang, et al.
Pubblicazione: (2023)
di: Lei, Yang, et al.
Pubblicazione: (2023)
Injecting Domain-Specific Knowledge into Large Language Models: A Comprehensive Survey
di: Song, Zirui, et al.
Pubblicazione: (2025)
di: Song, Zirui, et al.
Pubblicazione: (2025)
Large Language Models in Politics and Democracy: A Comprehensive Survey
di: Aoki, Goshi
Pubblicazione: (2024)
di: Aoki, Goshi
Pubblicazione: (2024)
Large Language Models in the Clinic: A Comprehensive Benchmark
di: Liu, Fenglin, et al.
Pubblicazione: (2024)
di: Liu, Fenglin, et al.
Pubblicazione: (2024)
Benchmarking Political Persuasion Risks Across Frontier Large Language Models
di: Chen, Zhongren, et al.
Pubblicazione: (2026)
di: Chen, Zhongren, et al.
Pubblicazione: (2026)
McBE: A Multi-task Chinese Bias Evaluation Benchmark for Large Language Models
di: Lan, Tian, et al.
Pubblicazione: (2025)
di: Lan, Tian, et al.
Pubblicazione: (2025)
AlignBench: Benchmarking Chinese Alignment of Large Language Models
di: Liu, Xiao, et al.
Pubblicazione: (2023)
di: Liu, Xiao, et al.
Pubblicazione: (2023)
FinEval: A Chinese Financial Domain Knowledge Evaluation Benchmark for Large Language Models
di: Guo, Xin, et al.
Pubblicazione: (2023)
di: Guo, Xin, et al.
Pubblicazione: (2023)
ChineseEcomQA: A Scalable E-commerce Concept Evaluation Benchmark for Large Language Models
di: Chen, Haibin, et al.
Pubblicazione: (2025)
di: Chen, Haibin, et al.
Pubblicazione: (2025)
Mechanistic Decoding of Cognitive Constructs in Large Language Models
di: Shou, Yitong, et al.
Pubblicazione: (2026)
di: Shou, Yitong, et al.
Pubblicazione: (2026)
LHMKE: A Large-scale Holistic Multi-subject Knowledge Evaluation Benchmark for Chinese Large Language Models
di: Liu, Chuang, et al.
Pubblicazione: (2024)
di: Liu, Chuang, et al.
Pubblicazione: (2024)
Improving Sampling for Masked Diffusion Models via Information Gain
di: Yang, Kaisen, et al.
Pubblicazione: (2026)
di: Yang, Kaisen, et al.
Pubblicazione: (2026)
The performances of the Chinese and U.S. Large Language Models on the Topic of Chinese Culture
di: Liu, Feiyan, et al.
Pubblicazione: (2026)
di: Liu, Feiyan, et al.
Pubblicazione: (2026)
PoliticsBench: Benchmarking Political Values in Large Language Models with Multi-Turn Roleplay
di: Khetan, Rohan, et al.
Pubblicazione: (2026)
di: Khetan, Rohan, et al.
Pubblicazione: (2026)
CHiSafetyBench: A Chinese Hierarchical Safety Benchmark for Large Language Models
di: Zhang, Wenjing, et al.
Pubblicazione: (2024)
di: Zhang, Wenjing, et al.
Pubblicazione: (2024)
CFBenchmark-MM: Chinese Financial Assistant Benchmark for Multimodal Large Language Model
di: Li, Jiangtong, et al.
Pubblicazione: (2025)
di: Li, Jiangtong, et al.
Pubblicazione: (2025)
Chengyu-Bench: Benchmarking Large Language Models for Chinese Idiom Understanding and Use
di: Fu, Yicheng, et al.
Pubblicazione: (2025)
di: Fu, Yicheng, et al.
Pubblicazione: (2025)
Documenti analoghi
-
AgriEval: A Comprehensive Chinese Agricultural Benchmark for Large Language Models
di: Yan, Lian, et al.
Pubblicazione: (2025) -
LexEval: A Comprehensive Chinese Legal Benchmark for Evaluating Large Language Models
di: Li, Haitao, et al.
Pubblicazione: (2024) -
PediaBench: A Comprehensive Chinese Pediatric Dataset for Benchmarking Large Language Models
di: Zhang, Qian, et al.
Pubblicazione: (2024) -
INSEva: A Comprehensive Chinese Benchmark for Large Language Models in Insurance
di: Chen, Shisong, et al.
Pubblicazione: (2025) -
CFinBench: A Comprehensive Chinese Financial Benchmark for Large Language Models
di: Nie, Ying, et al.
Pubblicazione: (2024)