Rethinking Evaluation Metrics for Grammatical Error Correction: Why Use a Different Evaluation Process than Human?
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Goto, Takumi, Sakai, Yusuke, Watanabe, Taro |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Grammatical Error Correction Evaluation by Optimally Transporting Edit Representation
par: Goto, Takumi, et autres
Publié: (2026)
par: Goto, Takumi, et autres
Publié: (2026)
Reliability Crisis of Reference-free Metrics for Grammatical Error Correction
par: Goto, Takumi, et autres
Publié: (2025)
par: Goto, Takumi, et autres
Publié: (2025)
gec-metrics: A Unified Library for Grammatical Error Correction Evaluation
par: Goto, Takumi, et autres
Publié: (2025)
par: Goto, Takumi, et autres
Publié: (2025)
Edit-level Majority Voting Mitigates Over-Correction in LLM-based Grammatical Error Correction
par: Goto, Takumi, et autres
Publié: (2026)
par: Goto, Takumi, et autres
Publié: (2026)
IMPARA-GED: Grammatical Error Detection is Boosting Reference-free Grammatical Error Quality Estimator
par: Sakai, Yusuke, et autres
Publié: (2025)
par: Sakai, Yusuke, et autres
Publié: (2025)
Improving Explainability of Sentence-level Metrics via Edit-level Attribution for Grammatical Error Correction
par: Goto, Takumi, et autres
Publié: (2024)
par: Goto, Takumi, et autres
Publié: (2024)
Multi-Dimensional Evaluation of LLMs for Grammatical Error Correction
par: Labib, Adnan, et autres
Publié: (2026)
par: Labib, Adnan, et autres
Publié: (2026)
How to Make the Most of LLMs' Grammatical Knowledge for Acceptability Judgments
par: Ide, Yusuke, et autres
Publié: (2024)
par: Ide, Yusuke, et autres
Publié: (2024)
Rethinking the Roles of Large Language Models in Chinese Grammatical Error Correction
par: Li, Yinghui, et autres
Publié: (2024)
par: Li, Yinghui, et autres
Publié: (2024)
Large Language Models Are State-of-the-Art Evaluator for Grammatical Error Correction
par: Kobayashi, Masamune, et autres
Publié: (2024)
par: Kobayashi, Masamune, et autres
Publié: (2024)
Evaluating Prompting Strategies for Grammatical Error Correction Based on Language Proficiency
par: Zeng, Min, et autres
Publié: (2024)
par: Zeng, Min, et autres
Publié: (2024)
Hacking Neural Evaluation Metrics with Single Hub Text
par: Deguchi, Hiroyuki, et autres
Publié: (2025)
par: Deguchi, Hiroyuki, et autres
Publié: (2025)
mCSQA: Multilingual Commonsense Reasoning Dataset with Unified Creation Strategy by Language Models and Humans
par: Sakai, Yusuke, et autres
Publié: (2024)
par: Sakai, Yusuke, et autres
Publié: (2024)
AdTEC: A Unified Benchmark for Evaluating Text Quality in Search Engine Advertising
par: Zhang, Peinan, et autres
Publié: (2024)
par: Zhang, Peinan, et autres
Publié: (2024)
A Formal Framework for Fluency-based Multi-Reference Evaluation in Grammatical Error Correction
par: Klinger, Eitan, et autres
Publié: (2025)
par: Klinger, Eitan, et autres
Publié: (2025)
Evaluating the Capability of Large-scale Language Models on Chinese Grammatical Error Correction Task
par: Qu, Fanyi, et autres
Publié: (2023)
par: Qu, Fanyi, et autres
Publié: (2023)
CLEME2.0: Towards Interpretable Evaluation by Disentangling Edits for Grammatical Error Correction
par: Ye, Jingheng, et autres
Publié: (2024)
par: Ye, Jingheng, et autres
Publié: (2024)
Grammatical Error Feedback: An Implicit Evaluation Approach
par: Bannò, Stefano, et autres
Publié: (2024)
par: Bannò, Stefano, et autres
Publié: (2024)
Chinese Grammatical Error Correction: A Survey
par: Qiu, Mengyang, et autres
Publié: (2025)
par: Qiu, Mengyang, et autres
Publié: (2025)
Revisiting Meta-evaluation for Grammatical Error Correction
par: Kobayashi, Masamune, et autres
Publié: (2024)
par: Kobayashi, Masamune, et autres
Publié: (2024)
Neural Grammatical Error Correction for Romanian
par: Cotet, Teodor-Mihai, et autres
Publié: (2026)
par: Cotet, Teodor-Mihai, et autres
Publié: (2026)
Revisiting Compositional Generalization Capability of Large Language Models Considering Instruction Following Ability
par: Sakai, Yusuke, et autres
Publié: (2025)
par: Sakai, Yusuke, et autres
Publié: (2025)
JELV: A Judge of Edit-Level Validity for Evaluation and Automated Reference Expansion in Grammatical Error Correction
par: Zhan, Yuhao, et autres
Publié: (2025)
par: Zhan, Yuhao, et autres
Publié: (2025)
Toward the Evaluation of Large Language Models Considering Score Variance across Instruction Templates
par: Sakai, Yusuke, et autres
Publié: (2024)
par: Sakai, Yusuke, et autres
Publié: (2024)
Efficient and Interpretable Grammatical Error Correction with Mixture of Experts
par: Qorib, Muhammad Reza, et autres
Publié: (2024)
par: Qorib, Muhammad Reza, et autres
Publié: (2024)
DSGram: Dynamic Weighting Sub-Metrics for Grammatical Error Correction in the Era of Large Language Models
par: Xie, Jinxiang, et autres
Publié: (2024)
par: Xie, Jinxiang, et autres
Publié: (2024)
GPT-3.5 for Grammatical Error Correction
par: Katinskaia, Anisia, et autres
Publié: (2024)
par: Katinskaia, Anisia, et autres
Publié: (2024)
HalluCitation Matters: Revealing the Impact of Hallucinated References with 300 Hallucinated Papers in ACL Conferences
par: Sakai, Yusuke, et autres
Publié: (2026)
par: Sakai, Yusuke, et autres
Publié: (2026)
HalluCiteChecker: A Lightweight Toolkit for Hallucinated Citation Detection and Verification in the Era of AI Scientists
par: Sakai, Yusuke, et autres
Publié: (2026)
par: Sakai, Yusuke, et autres
Publié: (2026)
Diagnosing Vision Language Models' Perception by Leveraging Human Methods for Color Vision Deficiencies
par: Hayashi, Kazuki, et autres
Publié: (2025)
par: Hayashi, Kazuki, et autres
Publié: (2025)
mbrs: A Library for Minimum Bayes Risk Decoding
par: Deguchi, Hiroyuki, et autres
Publié: (2024)
par: Deguchi, Hiroyuki, et autres
Publié: (2024)
The CoNLL-2013 Shared Task on Grammatical Error Correction
par: Ng, Hwee Tou, et autres
Publié: (2025)
par: Ng, Hwee Tou, et autres
Publié: (2025)
Grammatical Error Correction for Code-Switched Sentences by Learners of English
par: Chan, Kelvin Wey Han, et autres
Publié: (2024)
par: Chan, Kelvin Wey Han, et autres
Publié: (2024)
Multi-head Sequence Tagging Model for Grammatical Error Correction
par: Al-Sabahi, Kamal, et autres
Publié: (2024)
par: Al-Sabahi, Kamal, et autres
Publié: (2024)
Detection-Correction Structure via General Language Model for Grammatical Error Correction
par: Li, Wei, et autres
Publié: (2024)
par: Li, Wei, et autres
Publié: (2024)
Adapting LLMs for Minimal-edit Grammatical Error Correction
par: Staruch, Ryszard, et autres
Publié: (2025)
par: Staruch, Ryszard, et autres
Publié: (2025)
ErAConD : Error Annotated Conversational Dialog Dataset for Grammatical Error Correction
par: Yuan, Xun, et autres
Publié: (2021)
par: Yuan, Xun, et autres
Publié: (2021)
Multilingual Dialogue Generation and Localization with Dialogue Act Scripting
par: Vasselli, Justin, et autres
Publié: (2025)
par: Vasselli, Justin, et autres
Publié: (2025)
CArtBench: Evaluating Vision-Language Models on Chinese Art Understanding, Interpretation, and Authenticity
par: Wei, Xuefeng, et autres
Publié: (2026)
par: Wei, Xuefeng, et autres
Publié: (2026)
Explanation based In-Context Demonstrations Retrieval for Multilingual Grammatical Error Correction
par: Li, Wei, et autres
Publié: (2025)
par: Li, Wei, et autres
Publié: (2025)
Documents similaires
-
Grammatical Error Correction Evaluation by Optimally Transporting Edit Representation
par: Goto, Takumi, et autres
Publié: (2026) -
Reliability Crisis of Reference-free Metrics for Grammatical Error Correction
par: Goto, Takumi, et autres
Publié: (2025) -
gec-metrics: A Unified Library for Grammatical Error Correction Evaluation
par: Goto, Takumi, et autres
Publié: (2025) -
Edit-level Majority Voting Mitigates Over-Correction in LLM-based Grammatical Error Correction
par: Goto, Takumi, et autres
Publié: (2026) -
IMPARA-GED: Grammatical Error Detection is Boosting Reference-free Grammatical Error Quality Estimator
par: Sakai, Yusuke, et autres
Publié: (2025)