Lost in Literalism: How Supervised Training Shapes Translationese in LLMs
Fuente:
arXiv
Guardado en:
| Autores principales: | Li, Yafu, Zhang, Ronghao, Wang, Zhilin, Zhang, Huajian, Cui, Leyang, Yin, Yongjing, Xiao, Tong, Zhang, Yue |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
What Have We Achieved on Non-autoregressive Translation?
por: Li, Yafu, et al.
Publicado: (2024)
por: Li, Yafu, et al.
Publicado: (2024)
Spotting AI's Touch: Identifying LLM-Paraphrased Spans in Text
por: Li, Yafu, et al.
Publicado: (2024)
por: Li, Yafu, et al.
Publicado: (2024)
LexMatcher: Dictionary-centric Data Collection for LLM-based Machine Translation
por: Yin, Yongjing, et al.
Publicado: (2024)
por: Yin, Yongjing, et al.
Publicado: (2024)
MAGE: Machine-generated Text Detection in the Wild
por: Li, Yafu, et al.
Publicado: (2023)
por: Li, Yafu, et al.
Publicado: (2023)
Translationese-index: Using Likelihood Ratios for Graded and Generalizable Measurement of Translationese
por: Liu, Yikang, et al.
Publicado: (2025)
por: Liu, Yikang, et al.
Publicado: (2025)
Lost in Translationese? Reducing Translation Effect Using Abstract Meaning Representation
por: Wein, Shira, et al.
Publicado: (2023)
por: Wein, Shira, et al.
Publicado: (2023)
Training Models on Dialects of Translationese Shows How Lexical Diversity and Source-Target Syntactic Similarity Shape Learning
por: Kunz, Jenny
Publicado: (2026)
por: Kunz, Jenny
Publicado: (2026)
Unveiling Attractor Cycles in Large Language Models: A Dynamical Systems View of Successive Paraphrasing
por: Wang, Zhilin, et al.
Publicado: (2025)
por: Wang, Zhilin, et al.
Publicado: (2025)
Semformer: Transformer Language Models with Semantic Planning
por: Yin, Yongjing, et al.
Publicado: (2024)
por: Yin, Yongjing, et al.
Publicado: (2024)
Characterizing, Evaluating, and Optimizing Complex Reasoning
por: Zhang, Haoran, et al.
Publicado: (2026)
por: Zhang, Haoran, et al.
Publicado: (2026)
Decoding Machine Translationese in English-Chinese News: LLMs vs. NMTs
por: Kong, Delu, et al.
Publicado: (2025)
por: Kong, Delu, et al.
Publicado: (2025)
SEE: Continual Fine-tuning with Sequential Ensemble of Experts
por: Wang, Zhilin, et al.
Publicado: (2025)
por: Wang, Zhilin, et al.
Publicado: (2025)
Pretraining Language Models Using Translationese
por: Doshi, Meet, et al.
Publicado: (2024)
por: Doshi, Meet, et al.
Publicado: (2024)
Reasoning over Boundaries: Enhancing Specification Alignment via Test-time Deliberation
por: Zhang, Haoran, et al.
Publicado: (2025)
por: Zhang, Haoran, et al.
Publicado: (2025)
From Drafts to Answers: Unlocking LLM Potential via Aggregation Fine-Tuning
por: Li, Yafu, et al.
Publicado: (2025)
por: Li, Yafu, et al.
Publicado: (2025)
Alleviating Hallucinations of Large Language Models through Induced Hallucinations
por: Zhang, Yue, et al.
Publicado: (2023)
por: Zhang, Yue, et al.
Publicado: (2023)
Potential and Challenges of Model Editing for Social Debiasing
por: Yan, Jianhao, et al.
Publicado: (2024)
por: Yan, Jianhao, et al.
Publicado: (2024)
Mitigating Translationese Bias in Multilingual LLM-as-a-Judge via Disentangled Information Bottleneck
por: Zhang, Hongbin, et al.
Publicado: (2026)
por: Zhang, Hongbin, et al.
Publicado: (2026)
Keys to Robust Edits: from Theoretical Insights to Practical Advances
por: Yan, Jianhao, et al.
Publicado: (2024)
por: Yan, Jianhao, et al.
Publicado: (2024)
New Skills or Sharper Primitives? A Probabilistic Perspective on the Emergence of Reasoning in RLVR
por: Wang, Zhilin, et al.
Publicado: (2026)
por: Wang, Zhilin, et al.
Publicado: (2026)
Measuring Spurious Correlation in Classification: 'Clever Hans' in Translationese
por: Borah, Angana, et al.
Publicado: (2023)
por: Borah, Angana, et al.
Publicado: (2023)
GSM-Plus: A Comprehensive Benchmark for Evaluating the Robustness of LLMs as Mathematical Problem Solvers
por: Li, Qintong, et al.
Publicado: (2024)
por: Li, Qintong, et al.
Publicado: (2024)
A Dataset for Probing Translationese Preferences in English-to-Swedish Translation
por: Kunz, Jenny, et al.
Publicado: (2026)
por: Kunz, Jenny, et al.
Publicado: (2026)
Beyond English-Centric Training: How Reinforcement Learning Improves Cross-Lingual Reasoning in LLMs
por: Huang, Shulin, et al.
Publicado: (2025)
por: Huang, Shulin, et al.
Publicado: (2025)
DiffuGuard: How Intrinsic Safety is Lost and Found in Diffusion Large Language Models
por: Li, Zherui, et al.
Publicado: (2025)
por: Li, Zherui, et al.
Publicado: (2025)
Understanding How Value Neurons Shape the Generation of Specified Values in LLMs
por: Su, Yi, et al.
Publicado: (2025)
por: Su, Yi, et al.
Publicado: (2025)
The Comparison of Translationese in Machine Translation and Human Transation in terms of Translation Relations
por: Zhou, Fan
Publicado: (2024)
por: Zhou, Fan
Publicado: (2024)
Mitigating Translationese in Low-resource Languages: The Storyboard Approach
por: Kuwanto, Garry, et al.
Publicado: (2024)
por: Kuwanto, Garry, et al.
Publicado: (2024)
Beyond Literal Mapping: Benchmarking and Improving Non-Literal Translation Evaluation
por: Tian, Yanzhi, et al.
Publicado: (2026)
por: Tian, Yanzhi, et al.
Publicado: (2026)
Leveraging Entailment Judgements in Cross-Lingual Summarisation
por: Zhang, Huajian, et al.
Publicado: (2024)
por: Zhang, Huajian, et al.
Publicado: (2024)
Under the Shadow of Babel: How Language Shapes Reasoning in LLMs
por: Wang, Chenxi, et al.
Publicado: (2025)
por: Wang, Chenxi, et al.
Publicado: (2025)
KOSMOS-2.5: A Multimodal Literate Model
por: Lv, Tengchao, et al.
Publicado: (2023)
por: Lv, Tengchao, et al.
Publicado: (2023)
Understanding In-Context Learning from Repetitions
por: Yan, Jianhao, et al.
Publicado: (2023)
por: Yan, Jianhao, et al.
Publicado: (2023)
An Empirical Study of Catastrophic Forgetting in Large Language Models During Continual Fine-tuning
por: Luo, Yun, et al.
Publicado: (2023)
por: Luo, Yun, et al.
Publicado: (2023)
Not All Needles Are Found: How Fact Distribution and Don't Make It Up Prompts Shape Literal Extraction, Logical Inference, and Hallucination Risks in Long-Context LLMs
por: Ebrahimzadeh, Amirali, et al.
Publicado: (2026)
por: Ebrahimzadeh, Amirali, et al.
Publicado: (2026)
Right Is Not Enough: The Pitfalls of Outcome Supervision in Training LLMs for Math Reasoning
por: Guo, Jiaxing, et al.
Publicado: (2025)
por: Guo, Jiaxing, et al.
Publicado: (2025)
Retracing the Past: LLMs Emit Training Data When They Get Lost
por: Ko, Myeongseob, et al.
Publicado: (2025)
por: Ko, Myeongseob, et al.
Publicado: (2025)
CopyBench: Measuring Literal and Non-Literal Reproduction of Copyright-Protected Text in Language Model Generation
por: Chen, Tong, et al.
Publicado: (2024)
por: Chen, Tong, et al.
Publicado: (2024)
Exploring the Reliability of Large Language Models as Customized Evaluators for Diverse NLP Tasks
por: Li, Qintong, et al.
Publicado: (2023)
por: Li, Qintong, et al.
Publicado: (2023)
TIM: Teaching Large Language Models to Translate with Comparison
por: Zeng, Jiali, et al.
Publicado: (2023)
por: Zeng, Jiali, et al.
Publicado: (2023)
Ejemplares similares
-
What Have We Achieved on Non-autoregressive Translation?
por: Li, Yafu, et al.
Publicado: (2024) -
Spotting AI's Touch: Identifying LLM-Paraphrased Spans in Text
por: Li, Yafu, et al.
Publicado: (2024) -
LexMatcher: Dictionary-centric Data Collection for LLM-based Machine Translation
por: Yin, Yongjing, et al.
Publicado: (2024) -
MAGE: Machine-generated Text Detection in the Wild
por: Li, Yafu, et al.
Publicado: (2023) -
Translationese-index: Using Likelihood Ratios for Graded and Generalizable Measurement of Translationese
por: Liu, Yikang, et al.
Publicado: (2025)