Round-Trip Translation Reveals What Frontier Multilingual Benchmarks Miss
Fuente:
arXiv
Salvato in:
| Autori principali: | Skorobogat, Ronald, Prabhu, Ameya, Bethge, Matthias |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Mapping Post-Training Forgetting in Language Models at Scale
di: Harmon, Jackson, et al.
Pubblicazione: (2025)
di: Harmon, Jackson, et al.
Pubblicazione: (2025)
Wu's Method can Boost Symbolic AI to Rival Silver Medalists and AlphaGeometry to Outperform Gold Medalists at IMO Geometry
di: Sinha, Shiven, et al.
Pubblicazione: (2024)
di: Sinha, Shiven, et al.
Pubblicazione: (2024)
LLM generation novelty through the lens of semantic similarity
di: Davydov, Philipp, et al.
Pubblicazione: (2025)
di: Davydov, Philipp, et al.
Pubblicazione: (2025)
CiteME: Can Language Models Accurately Cite Scientific Claims?
di: Press, Ori, et al.
Pubblicazione: (2024)
di: Press, Ori, et al.
Pubblicazione: (2024)
Improving Low-Resource Machine Translation via Round-Trip Reinforcement Learning
di: Attia, Ahmed, et al.
Pubblicazione: (2026)
di: Attia, Ahmed, et al.
Pubblicazione: (2026)
Round Trip Translation Defence against Large Language Model Jailbreaking Attacks
di: Yung, Canaan, et al.
Pubblicazione: (2024)
di: Yung, Canaan, et al.
Pubblicazione: (2024)
Are We Done with Object-Centric Learning?
di: Rubinstein, Alexander, et al.
Pubblicazione: (2025)
di: Rubinstein, Alexander, et al.
Pubblicazione: (2025)
Great Models Think Alike and this Undermines AI Oversight
di: Goel, Shashwat, et al.
Pubblicazione: (2025)
di: Goel, Shashwat, et al.
Pubblicazione: (2025)
Mining the Mind: What 100M Beliefs Reveal About Frontier LLM Knowledge
di: Ghosh, Shrestha, et al.
Pubblicazione: (2025)
di: Ghosh, Shrestha, et al.
Pubblicazione: (2025)
OmniFusion: Simultaneous Multilingual Multimodal Translations via Modular Fusion
di: Koneru, Sai, et al.
Pubblicazione: (2025)
di: Koneru, Sai, et al.
Pubblicazione: (2025)
Project Alexandria: Towards Freeing Scientific Knowledge from Copyright Burdens via LLMs
di: Schuhmann, Christoph, et al.
Pubblicazione: (2025)
di: Schuhmann, Christoph, et al.
Pubblicazione: (2025)
GAIA-v2-LILT: Multilingual Adaptation of Agent Benchmark beyond Translation
di: Kim, Yunsu, et al.
Pubblicazione: (2026)
di: Kim, Yunsu, et al.
Pubblicazione: (2026)
Towards Safe Multilingual Frontier AI
di: Kanepajs, Artūrs, et al.
Pubblicazione: (2024)
di: Kanepajs, Artūrs, et al.
Pubblicazione: (2024)
TripTide: A Benchmark for Adaptive Travel Planning under Disruptions
di: Karmakar, Priyanshu, et al.
Pubblicazione: (2025)
di: Karmakar, Priyanshu, et al.
Pubblicazione: (2025)
Languages Still Left Behind: Toward a Better Multilingual Machine Translation Benchmark
di: Taguchi, Chihiro, et al.
Pubblicazione: (2025)
di: Taguchi, Chihiro, et al.
Pubblicazione: (2025)
MultiTEND: A Multilingual Benchmark for Natural Language to NoSQL Query Translation
di: Qin, Zhiqian, et al.
Pubblicazione: (2025)
di: Qin, Zhiqian, et al.
Pubblicazione: (2025)
Only Send What You Need: Learning to Communicate Efficiently in Federated Multilingual Machine Translation
di: Chu, Yun-Wei, et al.
Pubblicazione: (2024)
di: Chu, Yun-Wei, et al.
Pubblicazione: (2024)
TripCraft: A Benchmark for Spatio-Temporally Fine Grained Travel Planning
di: Chaudhuri, Soumyabrata, et al.
Pubblicazione: (2025)
di: Chaudhuri, Soumyabrata, et al.
Pubblicazione: (2025)
TripScore: Benchmarking and rewarding real-world travel planning with fine-grained evaluation
di: Qu, Yincen, et al.
Pubblicazione: (2025)
di: Qu, Yincen, et al.
Pubblicazione: (2025)
Learning When to Translate for Multilingual Reasoning
di: Kang, Deokhyung, et al.
Pubblicazione: (2026)
di: Kang, Deokhyung, et al.
Pubblicazione: (2026)
Stories of Your Life as Others: A Round-Trip Evaluation of LLM-Generated Life Stories Conditioned on Rich Psychometric Profiles
di: Wigler, Ben, et al.
Pubblicazione: (2026)
di: Wigler, Ben, et al.
Pubblicazione: (2026)
Transformer-Encoder Trees for Efficient Multilingual Machine Translation and Speech Translation
di: Guan, Yiwen, et al.
Pubblicazione: (2025)
di: Guan, Yiwen, et al.
Pubblicazione: (2025)
ONEBench to Test Them All: Sample-Level Benchmarking Over Open-Ended Capabilities
di: Ghosh, Adhiraj, et al.
Pubblicazione: (2024)
di: Ghosh, Adhiraj, et al.
Pubblicazione: (2024)
Answer Matching Outperforms Multiple Choice for Language Model Evaluation
di: Chandak, Nikhil, et al.
Pubblicazione: (2025)
di: Chandak, Nikhil, et al.
Pubblicazione: (2025)
Translation as a Scalable Proxy for Multilingual Evaluation
di: Issaka, Sheriff, et al.
Pubblicazione: (2026)
di: Issaka, Sheriff, et al.
Pubblicazione: (2026)
On the Shortcut Learning in Multilingual Neural Machine Translation
di: Wang, Wenxuan, et al.
Pubblicazione: (2024)
di: Wang, Wenxuan, et al.
Pubblicazione: (2024)
A Survey on Large Language Models with Multilingualism: Recent Advances and New Frontiers
di: Huang, Kaiyu, et al.
Pubblicazione: (2024)
di: Huang, Kaiyu, et al.
Pubblicazione: (2024)
Tower+: Bridging Generality and Translation Specialization in Multilingual LLMs
di: Rei, Ricardo, et al.
Pubblicazione: (2025)
di: Rei, Ricardo, et al.
Pubblicazione: (2025)
Quality-Aware Translation Tagging in Multilingual RAG system
di: Moon, Hoyeon, et al.
Pubblicazione: (2025)
di: Moon, Hoyeon, et al.
Pubblicazione: (2025)
Is Multilingual LLM Watermarking Truly Multilingual? Scaling Robustness to 100+ Languages via Back-Translation
di: Mohamed, Asim, et al.
Pubblicazione: (2025)
di: Mohamed, Asim, et al.
Pubblicazione: (2025)
On the Evaluation Practices in Multilingual NLP: Can Machine Translation Offer an Alternative to Human Translations?
di: Choenni, Rochelle, et al.
Pubblicazione: (2024)
di: Choenni, Rochelle, et al.
Pubblicazione: (2024)
Subspace-Boosted Model Merging
di: Skorobogat, Ronald, et al.
Pubblicazione: (2025)
di: Skorobogat, Ronald, et al.
Pubblicazione: (2025)
What Is Missing: Interpretable Ratings for Large Language Model Outputs
di: Stranges, Nicholas, et al.
Pubblicazione: (2026)
di: Stranges, Nicholas, et al.
Pubblicazione: (2026)
Anthropomimetic Uncertainty: What Verbalized Uncertainty in Language Models is Missing
di: Ulmer, Dennis, et al.
Pubblicazione: (2025)
di: Ulmer, Dennis, et al.
Pubblicazione: (2025)
How Transferable are Attribute Controllers on Pretrained Multilingual Translation Models?
di: Liu, Danni, et al.
Pubblicazione: (2023)
di: Liu, Danni, et al.
Pubblicazione: (2023)
CreoleVal: Multilingual Multitask Benchmarks for Creoles
di: Lent, Heather, et al.
Pubblicazione: (2023)
di: Lent, Heather, et al.
Pubblicazione: (2023)
RepoTransBench: A Real-World Multilingual Benchmark for Repository-Level Code Translation
di: Wang, Yanli, et al.
Pubblicazione: (2024)
di: Wang, Yanli, et al.
Pubblicazione: (2024)
ACT-MNMT Auto-Constriction Turning for Multilingual Neural Machine Translation
di: Dai, Shaojie, et al.
Pubblicazione: (2024)
di: Dai, Shaojie, et al.
Pubblicazione: (2024)
m3P: Towards Multimodal Multilingual Translation with Multimodal Prompt
di: Yang, Jian, et al.
Pubblicazione: (2024)
di: Yang, Jian, et al.
Pubblicazione: (2024)
Scaling Laws of Decoder-Only Models on the Multilingual Machine Translation Task
di: Caillaut, Gaëtan, et al.
Pubblicazione: (2024)
di: Caillaut, Gaëtan, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Mapping Post-Training Forgetting in Language Models at Scale
di: Harmon, Jackson, et al.
Pubblicazione: (2025) -
Wu's Method can Boost Symbolic AI to Rival Silver Medalists and AlphaGeometry to Outperform Gold Medalists at IMO Geometry
di: Sinha, Shiven, et al.
Pubblicazione: (2024) -
LLM generation novelty through the lens of semantic similarity
di: Davydov, Philipp, et al.
Pubblicazione: (2025) -
CiteME: Can Language Models Accurately Cite Scientific Claims?
di: Press, Ori, et al.
Pubblicazione: (2024) -
Improving Low-Resource Machine Translation via Round-Trip Reinforcement Learning
di: Attia, Ahmed, et al.
Pubblicazione: (2026)