When LLMs Struggle: Reference-less Translation Evaluation for Low-resource Languages
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Sindhujan, Archchana, Kanojia, Diptesh, Orasan, Constantin, Qian, Shenbin |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Beyond Scalar Scores: Reinforcement Learning for Error-Aware Quality Estimation of Machine Translation
von: Sindhujan, Archchana, et al.
Veröffentlicht: (2026)
von: Sindhujan, Archchana, et al.
Veröffentlicht: (2026)
ALOPE: Adaptive Layer Optimization for Translation Quality Estimation using Large Language Models
von: Sindhujan, Archchana, et al.
Veröffentlicht: (2025)
von: Sindhujan, Archchana, et al.
Veröffentlicht: (2025)
What do Large Language Models Need for Machine Translation Evaluation?
von: Qian, Shenbin, et al.
Veröffentlicht: (2024)
von: Qian, Shenbin, et al.
Veröffentlicht: (2024)
A Multi-task Learning Framework for Evaluating Machine Translation of Emotion-loaded User-generated Content
von: Qian, Shenbin, et al.
Veröffentlicht: (2024)
von: Qian, Shenbin, et al.
Veröffentlicht: (2024)
Are Large Language Models State-of-the-art Quality Estimators for Machine Translation of User-generated Content?
von: Qian, Shenbin, et al.
Veröffentlicht: (2024)
von: Qian, Shenbin, et al.
Veröffentlicht: (2024)
Automatically Generating Chinese Homophone Words to Probe Machine Translation Estimation Systems
von: Qian, Shenbin, et al.
Veröffentlicht: (2025)
von: Qian, Shenbin, et al.
Veröffentlicht: (2025)
Domain-Specific Quality Estimation for Machine Translation in Low-Resource Scenarios
von: Gurav, Namrata Patil, et al.
Veröffentlicht: (2026)
von: Gurav, Namrata Patil, et al.
Veröffentlicht: (2026)
NEAR$^2$: A Nested Embedding Approach to Efficient Product Retrieval and Ranking
von: Qian, Shenbin, et al.
Veröffentlicht: (2025)
von: Qian, Shenbin, et al.
Veröffentlicht: (2025)
Google Translate Error Analysis for Mental Healthcare Information: Evaluating Accuracy, Comprehensibility, and Implications for Multilingual Healthcare Communication
von: Delfani, Jaleh, et al.
Veröffentlicht: (2024)
von: Delfani, Jaleh, et al.
Veröffentlicht: (2024)
Why do Large Language Models Fail in Low-resource Translation? Unraveling the Token Dynamics of Large Language Models for Machine Translation
von: Qian, Shenbin, et al.
Veröffentlicht: (2026)
von: Qian, Shenbin, et al.
Veröffentlicht: (2026)
The Mind's Eye: A Multi-Faceted Reward Framework for Guiding Visual Metaphor Generation
von: Koushik, Girish A., et al.
Veröffentlicht: (2025)
von: Koushik, Girish A., et al.
Veröffentlicht: (2025)
Together We Can: Multilingual Automatic Post-Editing for Low-Resource Languages
von: Deoghare, Sourabh, et al.
Veröffentlicht: (2024)
von: Deoghare, Sourabh, et al.
Veröffentlicht: (2024)
Connecting Ideas in 'Lower-Resource' Scenarios: NLP for National Varieties, Creoles and Other Low-resource Scenarios
von: Joshi, Aditya, et al.
Veröffentlicht: (2024)
von: Joshi, Aditya, et al.
Veröffentlicht: (2024)
Edit Distances and Their Applications to Downstream Tasks in Research and Commercial Contexts
von: Carmo, Félix do, et al.
Veröffentlicht: (2024)
von: Carmo, Félix do, et al.
Veröffentlicht: (2024)
Cyber Risks of Machine Translation Critical Errors : Arabic Mental Health Tweets as a Case Study
von: Saadany, Hadeel, et al.
Veröffentlicht: (2024)
von: Saadany, Hadeel, et al.
Veröffentlicht: (2024)
Giving the Old a Fresh Spin: Quality Estimation-Assisted Constrained Decoding for Automatic Post-Editing
von: Deoghare, Sourabh, et al.
Veröffentlicht: (2025)
von: Deoghare, Sourabh, et al.
Veröffentlicht: (2025)
Parameter-Efficient Quality Estimation via Frozen Recursive Models
von: Abubacar, Umar, et al.
Veröffentlicht: (2026)
von: Abubacar, Umar, et al.
Veröffentlicht: (2026)
Experiences from Creating a Benchmark for Sentiment Classification for Varieties of English
von: Srirag, Dipankar, et al.
Veröffentlicht: (2024)
von: Srirag, Dipankar, et al.
Veröffentlicht: (2024)
Integrating automatic speech recognition into remote healthcare interpreting: A pilot study of its impact on interpreting quality
von: Tan, Shiyi, et al.
Veröffentlicht: (2025)
von: Tan, Shiyi, et al.
Veröffentlicht: (2025)
Benchmarking terminology building capabilities of ChatGPT on an English-Russian Fashion Corpus
von: Bezobrazova, Anastasiia, et al.
Veröffentlicht: (2024)
von: Bezobrazova, Anastasiia, et al.
Veröffentlicht: (2024)
BESSTIE: A Benchmark for Sentiment and Sarcasm Classification for Varieties of English
von: Srirag, Dipankar, et al.
Veröffentlicht: (2024)
von: Srirag, Dipankar, et al.
Veröffentlicht: (2024)
Towards Large Language Model driven Reference-less Translation Evaluation for English and Indian Languages
von: Mujadia, Vandan, et al.
Veröffentlicht: (2024)
von: Mujadia, Vandan, et al.
Veröffentlicht: (2024)
TRACE: Textual Relevance Augmentation and Contextual Encoding for Multimodal Hate Detection
von: Koushik, Girish A., et al.
Veröffentlicht: (2025)
von: Koushik, Girish A., et al.
Veröffentlicht: (2025)
GCDance: Genre-Controlled Music-Driven 3D Full Body Dance Generation
von: Liu, Xinran, et al.
Veröffentlicht: (2025)
von: Liu, Xinran, et al.
Veröffentlicht: (2025)
A Survey of Multimodal Sarcasm Detection
von: Farabi, Shafkat, et al.
Veröffentlicht: (2024)
von: Farabi, Shafkat, et al.
Veröffentlicht: (2024)
Natural Language Processing for Dialects of a Language: A Survey
von: Joshi, Aditya, et al.
Veröffentlicht: (2024)
von: Joshi, Aditya, et al.
Veröffentlicht: (2024)
Human-Centred Evaluation of Text-to-Image Generation Models for Self-expression of Mental Distress: A Dataset Based on GPT-4o
von: He, Sui, et al.
Veröffentlicht: (2025)
von: He, Sui, et al.
Veröffentlicht: (2025)
Cyberbullying Detection via Aggression-Enhanced Prompting
von: Saeid, Aisha, et al.
Veröffentlicht: (2025)
von: Saeid, Aisha, et al.
Veröffentlicht: (2025)
Centrality-aware Product Retrieval and Ranking
von: Saadany, Hadeel, et al.
Veröffentlicht: (2024)
von: Saadany, Hadeel, et al.
Veröffentlicht: (2024)
Towards a Robust Framework for Multimodal Hate Detection: A Study on Video vs. Image-based Content
von: Koushik, Girish A., et al.
Veröffentlicht: (2025)
von: Koushik, Girish A., et al.
Veröffentlicht: (2025)
Reference-less Analysis of Context Specificity in Translation with Personalised Language Models
von: Vincent, Sebastian, et al.
Veröffentlicht: (2023)
von: Vincent, Sebastian, et al.
Veröffentlicht: (2023)
LLM-Based Evaluation of Low-Resource Machine Translation: A Reference-less Dialect Guided Approach with a Refined Sylheti-English Benchmark
von: Rahman, Md. Atiqur, et al.
Veröffentlicht: (2025)
von: Rahman, Md. Atiqur, et al.
Veröffentlicht: (2025)
Tuning LLMs with Contrastive Alignment Instructions for Machine Translation in Unseen, Low-resource Languages
von: Mao, Zhuoyuan, et al.
Veröffentlicht: (2024)
von: Mao, Zhuoyuan, et al.
Veröffentlicht: (2024)
Creativity Bias: How Machine Evaluation Struggles with Creativity in Literary Translations
von: Gerrits, Kyo, et al.
Veröffentlicht: (2026)
von: Gerrits, Kyo, et al.
Veröffentlicht: (2026)
MUNIChus: Multilingual News Image Captioning Benchmark
von: Chen, Yuji, et al.
Veröffentlicht: (2026)
von: Chen, Yuji, et al.
Veröffentlicht: (2026)
Evaluating Optimal Reference Translations
von: Zouhar, Vilém, et al.
Veröffentlicht: (2023)
von: Zouhar, Vilém, et al.
Veröffentlicht: (2023)
Embedded Translations for Low-resource Automated Glossing
von: Yang, Changbing, et al.
Veröffentlicht: (2024)
von: Yang, Changbing, et al.
Veröffentlicht: (2024)
Towards Better Chinese-centric Neural Machine Translation for Low-resource Languages
von: Li, Bin, et al.
Veröffentlicht: (2022)
von: Li, Bin, et al.
Veröffentlicht: (2022)
Exploiting Domain-Specific Parallel Data on Multilingual Language Models for Low-resource Language Translation
von: Ranathungaa, Surangika, et al.
Veröffentlicht: (2024)
von: Ranathungaa, Surangika, et al.
Veröffentlicht: (2024)
Why Do Large Language Models (LLMs) Struggle to Count Letters?
von: Fu, Tairan, et al.
Veröffentlicht: (2024)
von: Fu, Tairan, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
Beyond Scalar Scores: Reinforcement Learning for Error-Aware Quality Estimation of Machine Translation
von: Sindhujan, Archchana, et al.
Veröffentlicht: (2026) -
ALOPE: Adaptive Layer Optimization for Translation Quality Estimation using Large Language Models
von: Sindhujan, Archchana, et al.
Veröffentlicht: (2025) -
What do Large Language Models Need for Machine Translation Evaluation?
von: Qian, Shenbin, et al.
Veröffentlicht: (2024) -
A Multi-task Learning Framework for Evaluating Machine Translation of Emotion-loaded User-generated Content
von: Qian, Shenbin, et al.
Veröffentlicht: (2024) -
Are Large Language Models State-of-the-art Quality Estimators for Machine Translation of User-generated Content?
von: Qian, Shenbin, et al.
Veröffentlicht: (2024)