Textual Similarity as a Key Metric in Machine Translation Quality Estimation

Fuente: arXiv
Salvato in:
Dettagli Bibliografici
Autori principali: Sun, Kun, Wang, Rong
Natura: Preprint
Pubblicazione: 2024
Soggetti:
Accesso online:
Tags: Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
_version_ 1866910507377623040
author Sun, Kun
Wang, Rong
author_facet Sun, Kun
Wang, Rong
contents Machine Translation (MT) Quality Estimation (QE) assesses translation reliability without reference texts. This study introduces "textual similarity" as a new metric for QE, using sentence transformers and cosine similarity to measure semantic closeness. Analyzing data from the MLQE-PE dataset, we found that textual similarity exhibits stronger correlations with human scores than traditional metrics (hter, model evaluation, sentence probability etc.). Employing GAMMs as a statistical tool, we demonstrated that textual similarity consistently outperforms other metrics across multiple language pairs in predicting human scores. We also found that "hter" actually failed to predict human scores in QE. Our findings highlight the effectiveness of textual similarity as a robust QE metric, recommending its integration with other metrics into QE frameworks and MT system training for improved accuracy and usability.
format Preprint
id arxiv_https___arxiv_org_abs_2406_07440
institution arXiv
publishDate 2024
record_format arxiv
spellingShingle Textual Similarity as a Key Metric in Machine Translation Quality Estimation
Sun, Kun
Wang, Rong
Computation and Language
Artificial Intelligence
Machine Translation (MT) Quality Estimation (QE) assesses translation reliability without reference texts. This study introduces "textual similarity" as a new metric for QE, using sentence transformers and cosine similarity to measure semantic closeness. Analyzing data from the MLQE-PE dataset, we found that textual similarity exhibits stronger correlations with human scores than traditional metrics (hter, model evaluation, sentence probability etc.). Employing GAMMs as a statistical tool, we demonstrated that textual similarity consistently outperforms other metrics across multiple language pairs in predicting human scores. We also found that "hter" actually failed to predict human scores in QE. Our findings highlight the effectiveness of textual similarity as a robust QE metric, recommending its integration with other metrics into QE frameworks and MT system training for improved accuracy and usability.
title Textual Similarity as a Key Metric in Machine Translation Quality Estimation
topic Computation and Language
Artificial Intelligence
url https://arxiv.org/abs/2406.07440