ERAS: Evaluating the Robustness of Chinese NLP Models to Morphological Garden Path Errors
Fuente:
arXiv
Guardado en:
| Autores principales: | Li, Qinchan, Hao, Sophie |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
CEC-Zero: Chinese Error Correction Solution Based on LLM
por: Zhang, Sophie, et al.
Publicado: (2025)
por: Zhang, Sophie, et al.
Publicado: (2025)
Loss-Aware Curriculum Learning for Chinese Grammatical Error Correction
por: Zhang, Ding, et al.
Publicado: (2024)
por: Zhang, Ding, et al.
Publicado: (2024)
Evaluation Metrics for Text Data Augmentation in NLP
por: Amadeus, Marcellus, et al.
Publicado: (2024)
por: Amadeus, Marcellus, et al.
Publicado: (2024)
Select, Label, Evaluate: Active Testing in NLP
por: Purificato, Antonio, et al.
Publicado: (2026)
por: Purificato, Antonio, et al.
Publicado: (2026)
Large Language Models Meet NLP: A Survey
por: Qin, Libo, et al.
Publicado: (2024)
por: Qin, Libo, et al.
Publicado: (2024)
Alirector: Alignment-Enhanced Chinese Grammatical Error Corrector
por: Yang, Haihui, et al.
Publicado: (2024)
por: Yang, Haihui, et al.
Publicado: (2024)
GREEN: Generative Radiology Report Evaluation and Error Notation
por: Ostmeier, Sophie, et al.
Publicado: (2024)
por: Ostmeier, Sophie, et al.
Publicado: (2024)
An Empirical Study on Large Language Models in Accuracy and Robustness under Chinese Industrial Scenarios
por: Li, Zongjie, et al.
Publicado: (2024)
por: Li, Zongjie, et al.
Publicado: (2024)
ChineseErrorCorrector3-4B: State-of-the-Art Chinese Spelling and Grammar Corrector
por: Tian, Wei, et al.
Publicado: (2025)
por: Tian, Wei, et al.
Publicado: (2025)
Evaluating Morphological Compositional Generalization in Large Language Models
por: Ismayilzada, Mete, et al.
Publicado: (2024)
por: Ismayilzada, Mete, et al.
Publicado: (2024)
CIF-Bench: A Chinese Instruction-Following Benchmark for Evaluating the Generalizability of Large Language Models
por: LI, Yizhi, et al.
Publicado: (2024)
por: LI, Yizhi, et al.
Publicado: (2024)
Enhancing Steganographic Text Extraction: Evaluating the Impact of NLP Models on Accuracy and Semantic Coherence
por: Li, Mingyang, et al.
Publicado: (2024)
por: Li, Mingyang, et al.
Publicado: (2024)
The Garden of Forking Paths: Observing Dynamic Parameters Distribution in Large Language Models
por: Nicolini, Carlo, et al.
Publicado: (2024)
por: Nicolini, Carlo, et al.
Publicado: (2024)
Deanthropomorphising NLP: Can a Language Model Be Conscious?
por: Shardlow, Matthew, et al.
Publicado: (2022)
por: Shardlow, Matthew, et al.
Publicado: (2022)
Safety Evaluation of DeepSeek Models in Chinese Contexts
por: Zhang, Wenjing, et al.
Publicado: (2025)
por: Zhang, Wenjing, et al.
Publicado: (2025)
Leveraging LLMs for Bangla Grammar Error Correction:Error Categorization, Synthetic Data, and Model Evaluation
por: Bhattacharyya, Pramit, et al.
Publicado: (2024)
por: Bhattacharyya, Pramit, et al.
Publicado: (2024)
MASE: Interpretable NLP Models via Model-Agnostic Saliency Estimation
por: Yang, Zhou, et al.
Publicado: (2025)
por: Yang, Zhou, et al.
Publicado: (2025)
Advancing Prompt Recovery in NLP: A Deep Dive into the Integration of Gemma-2b-it and Phi2 Models
por: Chen, Jianlong, et al.
Publicado: (2024)
por: Chen, Jianlong, et al.
Publicado: (2024)
Benchmarking Large Language Models on Multiple Tasks in Bioinformatics NLP with Prompting
por: Jiang, Jiyue, et al.
Publicado: (2025)
por: Jiang, Jiyue, et al.
Publicado: (2025)
AncientBench: Towards Comprehensive Evaluation on Excavated and Transmitted Chinese Corpora
por: Zhou, Zhihan, et al.
Publicado: (2025)
por: Zhou, Zhihan, et al.
Publicado: (2025)
CL$^2$GEC: A Multi-Discipline Benchmark for Continual Learning in Chinese Literature Grammatical Error Correction
por: Qin, Shang, et al.
Publicado: (2025)
por: Qin, Shang, et al.
Publicado: (2025)
On the Evaluation Practices in Multilingual NLP: Can Machine Translation Offer an Alternative to Human Translations?
por: Choenni, Rochelle, et al.
Publicado: (2024)
por: Choenni, Rochelle, et al.
Publicado: (2024)
On Behalf of the Stakeholders: Trends in NLP Model Interpretability in the Era of LLMs
por: Calderon, Nitay, et al.
Publicado: (2024)
por: Calderon, Nitay, et al.
Publicado: (2024)
Modeling Orthographic Variation Improves NLP Performance for Nigerian Pidgin
por: Lin, Pin-Jie, et al.
Publicado: (2024)
por: Lin, Pin-Jie, et al.
Publicado: (2024)
Tokenization and Representation Biases in Multilingual Models on Dialectal NLP Tasks
por: Kanjirangat, Vani, et al.
Publicado: (2025)
por: Kanjirangat, Vani, et al.
Publicado: (2025)
FoundaBench: Evaluating Chinese Fundamental Knowledge Capabilities of Large Language Models
por: Li, Wei, et al.
Publicado: (2024)
por: Li, Wei, et al.
Publicado: (2024)
NLP Security and Ethics, in the Wild
por: Lent, Heather, et al.
Publicado: (2025)
por: Lent, Heather, et al.
Publicado: (2025)
Reasoning Robustness of LLMs to Adversarial Typographical Errors
por: Gan, Esther, et al.
Publicado: (2024)
por: Gan, Esther, et al.
Publicado: (2024)
EssayBench: Evaluating Large Language Models in Multi-Genre Chinese Essay Writing
por: Gao, Fan, et al.
Publicado: (2025)
por: Gao, Fan, et al.
Publicado: (2025)
Benchmarking Large Language Models on CFLUE -- A Chinese Financial Language Understanding Evaluation Dataset
por: Zhu, Jie, et al.
Publicado: (2024)
por: Zhu, Jie, et al.
Publicado: (2024)
Batayan: A Filipino NLP benchmark for evaluating Large Language Models
por: Montalan, Jann Railey, et al.
Publicado: (2025)
por: Montalan, Jann Railey, et al.
Publicado: (2025)
EvalxNLP: A Framework for Benchmarking Post-Hoc Explainability Methods on NLP Models
por: Dhaini, Mahdi, et al.
Publicado: (2025)
por: Dhaini, Mahdi, et al.
Publicado: (2025)
NLP Verification: Towards a General Methodology for Certifying Robustness
por: Casadio, Marco, et al.
Publicado: (2024)
por: Casadio, Marco, et al.
Publicado: (2024)
Cheems: A Practical Guidance for Building and Evaluating Chinese Reward Models from Scratch
por: Wen, Xueru, et al.
Publicado: (2025)
por: Wen, Xueru, et al.
Publicado: (2025)
Evaluating Modern Large Language Models on Low-Resource and Morphologically Rich Languages:A Cross-Lingual Benchmark Across Cantonese, Japanese, and Turkish
por: Xia, Chengxuan, et al.
Publicado: (2025)
por: Xia, Chengxuan, et al.
Publicado: (2025)
HSKBenchmark: Modeling and Benchmarking Chinese Second Language Acquisition in Large Language Models through Curriculum Tuning
por: Yang, Qihao, et al.
Publicado: (2025)
por: Yang, Qihao, et al.
Publicado: (2025)
An Audit on the Perspectives and Challenges of Hallucinations in NLP
por: Venkit, Pranav Narayanan, et al.
Publicado: (2024)
por: Venkit, Pranav Narayanan, et al.
Publicado: (2024)
State of NLP in Kenya: A Survey
por: Amol, Cynthia Jayne, et al.
Publicado: (2024)
por: Amol, Cynthia Jayne, et al.
Publicado: (2024)
On Evaluating Explanation Utility for Human-AI Decision Making in NLP
por: Chaleshtori, Fateme Hashemi, et al.
Publicado: (2024)
por: Chaleshtori, Fateme Hashemi, et al.
Publicado: (2024)
From Word Sequences to Behavioral Sequences: Adapting Modeling and Evaluation Paradigms for Longitudinal NLP
por: Ganesan, Adithya V, et al.
Publicado: (2026)
por: Ganesan, Adithya V, et al.
Publicado: (2026)
Ejemplares similares
-
CEC-Zero: Chinese Error Correction Solution Based on LLM
por: Zhang, Sophie, et al.
Publicado: (2025) -
Loss-Aware Curriculum Learning for Chinese Grammatical Error Correction
por: Zhang, Ding, et al.
Publicado: (2024) -
Evaluation Metrics for Text Data Augmentation in NLP
por: Amadeus, Marcellus, et al.
Publicado: (2024) -
Select, Label, Evaluate: Active Testing in NLP
por: Purificato, Antonio, et al.
Publicado: (2026) -
Large Language Models Meet NLP: A Survey
por: Qin, Libo, et al.
Publicado: (2024)