Multi-Dimensional Machine Translation Evaluation: Model Evaluation and Resource for Korean
Fuente:
arXiv
Saved in:
| Main Authors: | Park, Dojun, Padó, Sebastian |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Pragmatic Competence Evaluation of Large Language Models for the Korean Language
by: Park, Dojun, et al.
Published: (2024)
by: Park, Dojun, et al.
Published: (2024)
Evaluating Large language models on Understanding Korean indirect Speech acts
by: Koo, Youngeun, et al.
Published: (2025)
by: Koo, Youngeun, et al.
Published: (2025)
MultiPragEval: Multilingual Pragmatic Evaluation of Large Language Models
by: Park, Dojun, et al.
Published: (2024)
by: Park, Dojun, et al.
Published: (2024)
Do Language Models Encode Knowledge of Linguistic Constraint Violations?
by: Hardy, et al.
Published: (2026)
by: Hardy, et al.
Published: (2026)
Efficient Language Modeling for Low-Resource Settings with Hybrid RNN-Transformer Architectures
by: Lindenmaier, Gabriel, et al.
Published: (2025)
by: Lindenmaier, Gabriel, et al.
Published: (2025)
Finding Sense in Nonsense with Generated Contexts: Perspectives from Humans and Language Models
by: Olsen, Katrina, et al.
Published: (2026)
by: Olsen, Katrina, et al.
Published: (2026)
Beyond Marginal Distributions: A Framework to Evaluate the Representativeness of Demographic-Aligned LLMs
by: Williams, Tristan, et al.
Published: (2026)
by: Williams, Tristan, et al.
Published: (2026)
Artwork Interpretation with Vision Language Models: A Case Study on Emotions and Emotion Symbols
by: Padó, Sebastian, et al.
Published: (2025)
by: Padó, Sebastian, et al.
Published: (2025)
Beyond prompt brittleness: Evaluating the reliability and consistency of political worldviews in LLMs
by: Ceron, Tanise, et al.
Published: (2024)
by: Ceron, Tanise, et al.
Published: (2024)
Towards Understanding the Relationship between In-context Learning and Compositional Generalization
by: Han, Sungjun, et al.
Published: (2024)
by: Han, Sungjun, et al.
Published: (2024)
Actor Identification in Discourse: A Challenge for LLMs?
by: Barić, Ana, et al.
Published: (2024)
by: Barić, Ana, et al.
Published: (2024)
Diverging Transformer Predictions for Human Sentence Processing: A Comprehensive Analysis of Agreement Attraction Effects
by: von der Malsburg, Titus, et al.
Published: (2026)
by: von der Malsburg, Titus, et al.
Published: (2026)
Translation or Recitation? Calibrating Evaluation Scores for Machine Translation of Extremely Low-Resource Languages
by: Chen, Danlu, et al.
Published: (2026)
by: Chen, Danlu, et al.
Published: (2026)
KITE: A Benchmark for Evaluating Korean Instruction-Following Abilities in Large Language Models
by: Kim, Dongjun, et al.
Published: (2025)
by: Kim, Dongjun, et al.
Published: (2025)
Mergen: The First Manchu-Korean Machine Translation Model Trained on Augmented Data
by: Seo, Jean, et al.
Published: (2023)
by: Seo, Jean, et al.
Published: (2023)
How Well Do Large Reasoning Models Translate? A Comprehensive Evaluation for Multi-Domain Machine Translation
by: Ye, Yongshi, et al.
Published: (2025)
by: Ye, Yongshi, et al.
Published: (2025)
Evaluating Multimodal Generative AI with Korean Educational Standards
by: Park, Sanghee, et al.
Published: (2025)
by: Park, Sanghee, et al.
Published: (2025)
Are they lovers or friends? Evaluating LLMs' Social Reasoning in English and Korean Dialogues
by: Kim, Eunsu, et al.
Published: (2025)
by: Kim, Eunsu, et al.
Published: (2025)
Regular-pattern-sensitive CRFs for Distant Label Interactions
by: Papay, Sean, et al.
Published: (2024)
by: Papay, Sean, et al.
Published: (2024)
Approximate Attributions for Off-the-Shelf Siamese Transformers
by: Möller, Lucas, et al.
Published: (2024)
by: Möller, Lucas, et al.
Published: (2024)
Exploring Multimodal Perception in Large Language Models Through Perceptual Strength Ratings
by: Lee, Jonghyun, et al.
Published: (2025)
by: Lee, Jonghyun, et al.
Published: (2025)
Expanding FLORES+ Benchmark for more Low-Resource Settings: Portuguese-Emakhuwa Machine Translation Evaluation
by: Ali, Felermino D. M. Antonio, et al.
Published: (2024)
by: Ali, Felermino D. M. Antonio, et al.
Published: (2024)
Thunder-LLM: Efficiently Adapting LLMs to Korean with Minimal Resources
by: Kim, Jinpyo, et al.
Published: (2025)
by: Kim, Jinpyo, et al.
Published: (2025)
Toeing the Party Line: Election Manifestos as a Key to Understand Political Discourse on Twitter
by: Maurer, Maximilian, et al.
Published: (2024)
by: Maurer, Maximilian, et al.
Published: (2024)
Generalizability of Media Frames: Corpus creation and analysis across countries
by: Daffara, Agnese, et al.
Published: (2025)
by: Daffara, Agnese, et al.
Published: (2025)
One Persona, Many Cues, Different Results: How Sociodemographic Cues Impact LLM Personalization
by: Weeber, Franziska, et al.
Published: (2026)
by: Weeber, Franziska, et al.
Published: (2026)
HiMATE: A Hierarchical Multi-Agent Framework for Machine Translation Evaluation
by: Zhang, Shijie, et al.
Published: (2025)
by: Zhang, Shijie, et al.
Published: (2025)
Evaluating Structural Generalization in Neural Machine Translation
by: Kumon, Ryoma, et al.
Published: (2024)
by: Kumon, Ryoma, et al.
Published: (2024)
AI-Assisted Human Evaluation of Machine Translation
by: Zouhar, Vilém, et al.
Published: (2024)
by: Zouhar, Vilém, et al.
Published: (2024)
Uncertainty Quantification for Evaluating Machine Translation Bias
by: Staliūnaitė, Ieva Raminta, et al.
Published: (2025)
by: Staliūnaitė, Ieva Raminta, et al.
Published: (2025)
Evaluating Extremely Low-Resource Machine Translation: A Comparative Study of ChrF++ and BLEU Metrics
by: Kumar, Sanjeev, et al.
Published: (2026)
by: Kumar, Sanjeev, et al.
Published: (2026)
Do Political Opinions Transfer Between Western Languages? An Analysis of Unaligned and Aligned Multilingual LLMs
by: Weeber, Franziska, et al.
Published: (2025)
by: Weeber, Franziska, et al.
Published: (2025)
Machine Translation Meta Evaluation through Translation Accuracy Challenge Sets
by: Moghe, Nikita, et al.
Published: (2024)
by: Moghe, Nikita, et al.
Published: (2024)
HAE-RAE Bench: Evaluation of Korean Knowledge in Language Models
by: Son, Guijin, et al.
Published: (2023)
by: Son, Guijin, et al.
Published: (2023)
What do Large Language Models Need for Machine Translation Evaluation?
by: Qian, Shenbin, et al.
Published: (2024)
by: Qian, Shenbin, et al.
Published: (2024)
Evaluating Automatic Metrics with Incremental Machine Translation Systems
by: Wu, Guojun, et al.
Published: (2024)
by: Wu, Guojun, et al.
Published: (2024)
Evaluating the Impact of Verbal Multiword Expressions on Machine Translation
by: Liu, Linfeng, et al.
Published: (2025)
by: Liu, Linfeng, et al.
Published: (2025)
Enhancing Human Evaluation in Machine Translation with Comparative Judgment
by: Song, Yixiao, et al.
Published: (2025)
by: Song, Yixiao, et al.
Published: (2025)
Comparative Evaluation of Machine Translation Systems on Images with Text
by: Puchol, Blai, et al.
Published: (2026)
by: Puchol, Blai, et al.
Published: (2026)
Specification-Aware Machine Translation and Evaluation for Purpose Alignment
by: Kayano, Yoko, et al.
Published: (2025)
by: Kayano, Yoko, et al.
Published: (2025)
Similar Items
-
Pragmatic Competence Evaluation of Large Language Models for the Korean Language
by: Park, Dojun, et al.
Published: (2024) -
Evaluating Large language models on Understanding Korean indirect Speech acts
by: Koo, Youngeun, et al.
Published: (2025) -
MultiPragEval: Multilingual Pragmatic Evaluation of Large Language Models
by: Park, Dojun, et al.
Published: (2024) -
Do Language Models Encode Knowledge of Linguistic Constraint Violations?
by: Hardy, et al.
Published: (2026) -
Efficient Language Modeling for Low-Resource Settings with Hybrid RNN-Transformer Architectures
by: Lindenmaier, Gabriel, et al.
Published: (2025)