On the Implications of Verbose LLM Outputs: A Case Study in Translation Evaluation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Briakou, Eleftheria, Liu, Zhongtao, Cherry, Colin, Freitag, Markus |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Translating Step-by-Step: Decomposing the Translation Process for Improved Translation Quality of Long-Form Texts
par: Briakou, Eleftheria, et autres
Publié: (2024)
par: Briakou, Eleftheria, et autres
Publié: (2024)
Overestimation in LLM Evaluation: A Controlled Large-Scale Study on Data Contamination's Impact on Machine Translation
par: Kocyigit, Muhammed Yusuf, et autres
Publié: (2025)
par: Kocyigit, Muhammed Yusuf, et autres
Publié: (2025)
Leveraging Domain Knowledge at Inference Time for LLM Translation: Retrieval versus Generation
par: Li, Bryan, et autres
Publié: (2025)
par: Li, Bryan, et autres
Publié: (2025)
Déjà Vu: Multilingual LLM Evaluation through the Lens of Machine Translation Evaluation
par: Kreutzer, Julia, et autres
Publié: (2025)
par: Kreutzer, Julia, et autres
Publié: (2025)
Don't Throw Away Data: Better Sequence Knowledge Distillation
par: Wang, Jun, et autres
Publié: (2024)
par: Wang, Jun, et autres
Publié: (2024)
When Scaling Meets LLM Finetuning: The Effect of Data, Model and Finetuning Method
par: Zhang, Biao, et autres
Publié: (2024)
par: Zhang, Biao, et autres
Publié: (2024)
Beyond Human-Only: Evaluating Human-Machine Collaboration for Collecting High-Quality Translation Data
par: Liu, Zhongtao, et autres
Publié: (2024)
par: Liu, Zhongtao, et autres
Publié: (2024)
Rethinking Cross-lingual Alignment: Balancing Transfer and Cultural Erasure in Multilingual LLMs
par: Han, HyoJung, et autres
Publié: (2025)
par: Han, HyoJung, et autres
Publié: (2025)
TranslateGemma Technical Report
par: Finkelstein, Mara, et autres
Publié: (2026)
par: Finkelstein, Mara, et autres
Publié: (2026)
To Diverge or Not to Diverge: A Morphosyntactic Perspective on Machine Translation vs Human Translation
par: Luo, Jiaming, et autres
Publié: (2024)
par: Luo, Jiaming, et autres
Publié: (2024)
Quality-Aware Translation Models: Efficient Generation and Quality Estimation in a Single Model
par: Tomani, Christian, et autres
Publié: (2023)
par: Tomani, Christian, et autres
Publié: (2023)
Penalizing Length: Uncovering Systematic Bias in Quality Estimation Metrics
par: Zhang, Yilin, et autres
Publié: (2025)
par: Zhang, Yilin, et autres
Publié: (2025)
Verbosity $\neq$ Veracity: Demystify Verbosity Compensation Behavior of Large Language Models
par: Zhang, Yusen, et autres
Publié: (2024)
par: Zhang, Yusen, et autres
Publié: (2024)
SSA-COMET: Do LLMs Outperform Learned Metrics in Evaluating MT for Under-Resourced African Languages?
par: Li, Senyu, et autres
Publié: (2025)
par: Li, Senyu, et autres
Publié: (2025)
Enhancing Human Evaluation in Machine Translation with Comparative Judgment
par: Song, Yixiao, et autres
Publié: (2025)
par: Song, Yixiao, et autres
Publié: (2025)
MQM Re-Annotation: A Technique for Collaborative Evaluation of Machine Translation
par: Riley, Parker, et autres
Publié: (2025)
par: Riley, Parker, et autres
Publié: (2025)
Verbosity Tradeoffs and the Impact of Scale on the Faithfulness of LLM Self-Explanations
par: Siegel, Noah Y., et autres
Publié: (2025)
par: Siegel, Noah Y., et autres
Publié: (2025)
Mind the Gap... or Not? How Translation Errors and Evaluation Details Skew Multilingual Results
par: Peter, Jan-Thorsten, et autres
Publié: (2025)
par: Peter, Jan-Thorsten, et autres
Publié: (2025)
You Cannot Feed Two Birds with One Score: the Accuracy-Naturalness Tradeoff in Translation
par: Flamich, Gergely, et autres
Publié: (2025)
par: Flamich, Gergely, et autres
Publié: (2025)
Introducing the NewsPaLM MBR and QE Dataset: LLM-Generated High-Quality Parallel Data Outperforms Traditional Web-Crawled Data
par: Finkelstein, Mara, et autres
Publié: (2024)
par: Finkelstein, Mara, et autres
Publié: (2024)
Word Alignment as Preference for Machine Translation
par: Wu, Qiyu, et autres
Publié: (2024)
par: Wu, Qiyu, et autres
Publié: (2024)
Measuring Chain-of-Thought Monitorability Through Faithfulness and Verbosity
par: Meek, Austin, et autres
Publié: (2025)
par: Meek, Austin, et autres
Publié: (2025)
Generating Difficult-to-Translate Texts
par: Zouhar, Vilém, et autres
Publié: (2025)
par: Zouhar, Vilém, et autres
Publié: (2025)
WMT24++: Expanding the Language Coverage of WMT24 to 55 Languages & Dialects
par: Deutsch, Daniel, et autres
Publié: (2025)
par: Deutsch, Daniel, et autres
Publié: (2025)
Large Language Models as Students Who Think Aloud: Overly Coherent, Verbose, and Confident
par: Borchers, Conrad, et autres
Publié: (2026)
par: Borchers, Conrad, et autres
Publié: (2026)
MetricX-25 and GemSpanEval: Google Translate Submissions to the WMT25 Evaluation Shared Task
par: Juraska, Juraj, et autres
Publié: (2025)
par: Juraska, Juraj, et autres
Publié: (2025)
Benchmarking LLM-as-a-Judge for Long-Form Output Evaluation
par: Chen, Junjie, et autres
Publié: (2026)
par: Chen, Junjie, et autres
Publié: (2026)
LLMRefine: Pinpointing and Refining Large Language Models via Fine-Grained Actionable Feedback
par: Xu, Wenda, et autres
Publié: (2023)
par: Xu, Wenda, et autres
Publié: (2023)
Reasoning with OmniThought: A Large CoT Dataset with Verbosity and Cognitive Difficulty Annotations
par: Cai, Wenrui, et autres
Publié: (2025)
par: Cai, Wenrui, et autres
Publié: (2025)
NeoAMT: Neologism-Aware Agentic Machine Translation with Reinforcement Learning
par: Miao, Zhongtao, et autres
Publié: (2026)
par: Miao, Zhongtao, et autres
Publié: (2026)
Benchmarking Machine Translation on Chinese Social Media Texts
par: Zhao, Kaiyan, et autres
Publié: (2026)
par: Zhao, Kaiyan, et autres
Publié: (2026)
Feeding Two Birds or Favoring One? Adequacy-Fluency Tradeoffs in Evaluation and Meta-Evaluation of Machine Translation
par: Shayegh, Behzad, et autres
Publié: (2025)
par: Shayegh, Behzad, et autres
Publié: (2025)
A Course Shared Task on Evaluating LLM Output for Clinical Questions
par: Hou, Yufang, et autres
Publié: (2024)
par: Hou, Yufang, et autres
Publié: (2024)
LLM as a Scorer: The Impact of Output Order on Dialogue Evaluation
par: Chen, Yi-Pei, et autres
Publié: (2024)
par: Chen, Yi-Pei, et autres
Publié: (2024)
Verbosity-Aware Rationale Reduction: Effective Reduction of Redundant Rationale via Principled Criteria
par: Jang, Joonwon, et autres
Publié: (2024)
par: Jang, Joonwon, et autres
Publié: (2024)
Task-Dependent Evaluation of LLM Output Homogenization: A Taxonomy-Guided Framework
par: Jain, Shomik, et autres
Publié: (2025)
par: Jain, Shomik, et autres
Publié: (2025)
STED and Consistency Scoring: A Framework for Evaluating LLM Structured Output Reliability
par: Wang, Guanghui, et autres
Publié: (2025)
par: Wang, Guanghui, et autres
Publié: (2025)
Found in Translation: Measuring Multilingual LLM Consistency as Simple as Translate then Evaluate
par: Gupta, Ashim, et autres
Publié: (2025)
par: Gupta, Ashim, et autres
Publié: (2025)
A Better LLM Evaluator for Text Generation: The Impact of Prompt Output Sequencing and Optimization
par: Chu, KuanChao, et autres
Publié: (2024)
par: Chu, KuanChao, et autres
Publié: (2024)
LLM-GLOBE: A Benchmark Evaluating the Cultural Values Embedded in LLM Output
par: Karinshak, Elise, et autres
Publié: (2024)
par: Karinshak, Elise, et autres
Publié: (2024)
Documents similaires
-
Translating Step-by-Step: Decomposing the Translation Process for Improved Translation Quality of Long-Form Texts
par: Briakou, Eleftheria, et autres
Publié: (2024) -
Overestimation in LLM Evaluation: A Controlled Large-Scale Study on Data Contamination's Impact on Machine Translation
par: Kocyigit, Muhammed Yusuf, et autres
Publié: (2025) -
Leveraging Domain Knowledge at Inference Time for LLM Translation: Retrieval versus Generation
par: Li, Bryan, et autres
Publié: (2025) -
Déjà Vu: Multilingual LLM Evaluation through the Lens of Machine Translation Evaluation
par: Kreutzer, Julia, et autres
Publié: (2025) -
Don't Throw Away Data: Better Sequence Knowledge Distillation
par: Wang, Jun, et autres
Publié: (2024)