Evaluating Chinese Ambiguity Understanding in Large Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Mo, Junwen, Lu, Yuanzhi, Xue, Yifang, Xu, Ke, Nakayama, Hideki |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
AC-EVAL: Evaluating Ancient Chinese Language Understanding in Large Language Models
por: Wei, Yuting, et al.
Publicado: (2024)
por: Wei, Yuting, et al.
Publicado: (2024)
A Comprehensive Information-Decomposition Analysis of Large Vision-Language Models
por: Xiu, Lixin, et al.
Publicado: (2026)
por: Xiu, Lixin, et al.
Publicado: (2026)
Large Language Models Understanding: an Inherent Ambiguity Barrier
por: Nissani, Daniel N.
Publicado: (2025)
por: Nissani, Daniel N.
Publicado: (2025)
Evaluating the Generation Capabilities of Large Chinese Language Models
por: Zeng, Hui, et al.
Publicado: (2023)
por: Zeng, Hui, et al.
Publicado: (2023)
McBE: A Multi-task Chinese Bias Evaluation Benchmark for Large Language Models
por: Lan, Tian, et al.
Publicado: (2025)
por: Lan, Tian, et al.
Publicado: (2025)
LAiW: A Chinese Legal Large Language Models Benchmark
por: Dai, Yongfu, et al.
Publicado: (2023)
por: Dai, Yongfu, et al.
Publicado: (2023)
Chengyu-Bench: Benchmarking Large Language Models for Chinese Idiom Understanding and Use
por: Fu, Yicheng, et al.
Publicado: (2025)
por: Fu, Yicheng, et al.
Publicado: (2025)
Scope Ambiguities in Large Language Models
por: Kamath, Gaurav, et al.
Publicado: (2024)
por: Kamath, Gaurav, et al.
Publicado: (2024)
Trick or Neat: Adversarial Ambiguity and Language Model Evaluation
por: Karamolegkou, Antonia, et al.
Publicado: (2025)
por: Karamolegkou, Antonia, et al.
Publicado: (2025)
CHBench: A Chinese Dataset for Evaluating Health in Large Language Models
por: Guo, Chenlu, et al.
Publicado: (2024)
por: Guo, Chenlu, et al.
Publicado: (2024)
Benchmarking Large Language Models on CFLUE -- A Chinese Financial Language Understanding Evaluation Dataset
por: Zhu, Jie, et al.
Publicado: (2024)
por: Zhu, Jie, et al.
Publicado: (2024)
LLM as a Scorer: The Impact of Output Order on Dialogue Evaluation
por: Chen, Yi-Pei, et al.
Publicado: (2024)
por: Chen, Yi-Pei, et al.
Publicado: (2024)
Edu-Values: Towards Evaluating the Chinese Education Values of Large Language Models
por: Zhang, Peiyi, et al.
Publicado: (2024)
por: Zhang, Peiyi, et al.
Publicado: (2024)
ChineseSafe: A Chinese Benchmark for Evaluating Safety in Large Language Models
por: Zhang, Hengxiang, et al.
Publicado: (2024)
por: Zhang, Hengxiang, et al.
Publicado: (2024)
Chinese SimpleQA: A Chinese Factuality Evaluation for Large Language Models
por: He, Yancheng, et al.
Publicado: (2024)
por: He, Yancheng, et al.
Publicado: (2024)
A Better LLM Evaluator for Text Generation: The Impact of Prompt Output Sequencing and Optimization
por: Chu, KuanChao, et al.
Publicado: (2024)
por: Chu, KuanChao, et al.
Publicado: (2024)
TCMD: A Traditional Chinese Medicine QA Dataset for Evaluating Large Language Models
por: Yu, Ping, et al.
Publicado: (2024)
por: Yu, Ping, et al.
Publicado: (2024)
Ambiguity-Aware In-Context Learning with Large Language Models
por: Gao, Lingyu, et al.
Publicado: (2023)
por: Gao, Lingyu, et al.
Publicado: (2023)
A Chinese Dataset for Evaluating the Safeguards in Large Language Models
por: Wang, Yuxia, et al.
Publicado: (2024)
por: Wang, Yuxia, et al.
Publicado: (2024)
Multilingual Relative Clause Attachment Ambiguity Resolution in Large Language Models
por: Lee, So Young, et al.
Publicado: (2025)
por: Lee, So Young, et al.
Publicado: (2025)
MedEthicEval: Evaluating Large Language Models Based on Chinese Medical Ethics
por: Jin, Haoan, et al.
Publicado: (2025)
por: Jin, Haoan, et al.
Publicado: (2025)
Can LLMs assist with Ambiguity? A Quantitative Evaluation of various Large Language Models on Word Sense Disambiguation
por: Sumanathilaka, T. G. D. K., et al.
Publicado: (2024)
por: Sumanathilaka, T. G. D. K., et al.
Publicado: (2024)
RUIE: Retrieval-based Unified Information Extraction using Large Language Model
por: Liao, Xincheng, et al.
Publicado: (2024)
por: Liao, Xincheng, et al.
Publicado: (2024)
WXImpactBench: A Disruptive Weather Impact Understanding Benchmark for Evaluating Large Language Models
por: Yu, Yongan, et al.
Publicado: (2025)
por: Yu, Yongan, et al.
Publicado: (2025)
Understanding the Dilemma of Unlearning for Large Language Models
por: Zhang, Qingjie, et al.
Publicado: (2025)
por: Zhang, Qingjie, et al.
Publicado: (2025)
Can Large Language Models Understand Preferences in Personalized Recommendation?
por: Tan, Zhaoxuan, et al.
Publicado: (2025)
por: Tan, Zhaoxuan, et al.
Publicado: (2025)
CArtBench: Evaluating Vision-Language Models on Chinese Art Understanding, Interpretation, and Authenticity
por: Wei, Xuefeng, et al.
Publicado: (2026)
por: Wei, Xuefeng, et al.
Publicado: (2026)
Mitigating Boundary Ambiguity and Inherent Bias for Text Classification in the Era of Large Language Models
por: Lu, Zhenyi, et al.
Publicado: (2024)
por: Lu, Zhenyi, et al.
Publicado: (2024)
TongGu: Mastering Classical Chinese Understanding with Knowledge-Grounded Large Language Models
por: Cao, Jiahuan, et al.
Publicado: (2024)
por: Cao, Jiahuan, et al.
Publicado: (2024)
Does Visual Grounding Enhance the Understanding of Embodied Knowledge in Large Language Models?
por: Yang, Zhihui, et al.
Publicado: (2025)
por: Yang, Zhihui, et al.
Publicado: (2025)
AlignMMBench: Evaluating Chinese Multimodal Alignment in Large Vision-Language Models
por: Wu, Yuhang, et al.
Publicado: (2024)
por: Wu, Yuhang, et al.
Publicado: (2024)
Evaluating Spatial Understanding of Large Language Models
por: Yamada, Yutaro, et al.
Publicado: (2023)
por: Yamada, Yutaro, et al.
Publicado: (2023)
Aligning Language Models to Explicitly Handle Ambiguity
por: Kim, Hyuhng Joon, et al.
Publicado: (2024)
por: Kim, Hyuhng Joon, et al.
Publicado: (2024)
C$^{3}$Bench: A Comprehensive Classical Chinese Understanding Benchmark for Large Language Models
por: Cao, Jiahuan, et al.
Publicado: (2024)
por: Cao, Jiahuan, et al.
Publicado: (2024)
PUMGPT: A Large Vision-Language Model for Product Understanding
por: Xue, Wei, et al.
Publicado: (2023)
por: Xue, Wei, et al.
Publicado: (2023)
An Empirical Study of the Role of Incompleteness and Ambiguity in Interactions with Large Language Models
por: Naik, Riya, et al.
Publicado: (2025)
por: Naik, Riya, et al.
Publicado: (2025)
PediatricsGPT: Large Language Models as Chinese Medical Assistants for Pediatric Applications
por: Yang, Dingkang, et al.
Publicado: (2024)
por: Yang, Dingkang, et al.
Publicado: (2024)
Recent Trends in Personalized Dialogue Generation: A Review of Datasets, Methodologies, and Evaluations
por: Chen, Yi-Pei, et al.
Publicado: (2024)
por: Chen, Yi-Pei, et al.
Publicado: (2024)
INSEva: A Comprehensive Chinese Benchmark for Large Language Models in Insurance
por: Chen, Shisong, et al.
Publicado: (2025)
por: Chen, Shisong, et al.
Publicado: (2025)
Handling Ambiguity in Emotion: From Out-of-Domain Detection to Distribution Estimation
por: Wu, Wen, et al.
Publicado: (2024)
por: Wu, Wen, et al.
Publicado: (2024)
Ejemplares similares
-
AC-EVAL: Evaluating Ancient Chinese Language Understanding in Large Language Models
por: Wei, Yuting, et al.
Publicado: (2024) -
A Comprehensive Information-Decomposition Analysis of Large Vision-Language Models
por: Xiu, Lixin, et al.
Publicado: (2026) -
Large Language Models Understanding: an Inherent Ambiguity Barrier
por: Nissani, Daniel N.
Publicado: (2025) -
Evaluating the Generation Capabilities of Large Chinese Language Models
por: Zeng, Hui, et al.
Publicado: (2023) -
McBE: A Multi-task Chinese Bias Evaluation Benchmark for Large Language Models
por: Lan, Tian, et al.
Publicado: (2025)