LLM Reasoning for Machine Translation: Synthetic Data Generation over Thinking Tokens
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zebaze, Armel, Bawden, Rachel, Sagot, Benoît |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Compositional Translation: A Novel LLM-based Approach for Low-resource Machine Translation
par: Zebaze, Armel, et autres
Publié: (2025)
par: Zebaze, Armel, et autres
Publié: (2025)
TopXGen: Topic-Diverse Parallel Data Generation for Low-Resource Machine Translation
par: Zebaze, Armel, et autres
Publié: (2025)
par: Zebaze, Armel, et autres
Publié: (2025)
In-Context Example Selection via Similarity Search Improves Low-Resource Machine Translation
par: Zebaze, Armel, et autres
Publié: (2024)
par: Zebaze, Armel, et autres
Publié: (2024)
Tree of Problems: Improving structured problem solving with compositionality
par: Zebaze, Armel, et autres
Publié: (2024)
par: Zebaze, Armel, et autres
Publié: (2024)
Disentangling meaning from language in LLM-based machine translation
par: Lasnier, Théo, et autres
Publié: (2026)
par: Lasnier, Théo, et autres
Publié: (2026)
Explicit Learning and the LLM in Machine Translation
par: Marmonier, Malik, et autres
Publié: (2025)
par: Marmonier, Malik, et autres
Publié: (2025)
Testing the Deliteralization Hypothesis in Human and Machine Translation
par: Marmonier, Malik, et autres
Publié: (2026)
par: Marmonier, Malik, et autres
Publié: (2026)
Hindsight Quality Prediction Experiments in Multi-Candidate Human-Post-Edited Machine Translation
par: Marmonier, Malik, et autres
Publié: (2026)
par: Marmonier, Malik, et autres
Publié: (2026)
Towards Zero-Shot Multimodal Machine Translation
par: Futeral, Matthieu, et autres
Publié: (2024)
par: Futeral, Matthieu, et autres
Publié: (2024)
Making Sentence Embeddings Robust to User-Generated Content
par: Nishimwe, Lydia, et autres
Publié: (2024)
par: Nishimwe, Lydia, et autres
Publié: (2024)
mOSCAR: A Large-scale Multilingual and Multimodal Document-level Corpus
par: Futeral, Matthieu, et autres
Publié: (2024)
par: Futeral, Matthieu, et autres
Publié: (2024)
A French Version of the OLDI Seed Corpus
par: Marmonier, Malik, et autres
Publié: (2025)
par: Marmonier, Malik, et autres
Publié: (2025)
When your Cousin has the Right Connections: Unsupervised Bilingual Lexicon Induction for Related Data-Imbalanced Languages
par: Bafna, Niyati, et autres
Publié: (2023)
par: Bafna, Niyati, et autres
Publié: (2023)
Investigating Length Issues in Document-level Machine Translation
par: Peng, Ziqian, et autres
Publié: (2024)
par: Peng, Ziqian, et autres
Publié: (2024)
Gaperon: A Peppered English-French Generative Language Model Suite
par: Godey, Nathan, et autres
Publié: (2025)
par: Godey, Nathan, et autres
Publié: (2025)
ModernBERT or DeBERTaV3? Examining Architecture and Data Influence on Transformer Encoder Models Performance
par: Antoun, Wissam, et autres
Publié: (2025)
par: Antoun, Wissam, et autres
Publié: (2025)
From Text to Source: Results in Detecting Large Language Model-Generated Content
par: Antoun, Wissam, et autres
Publié: (2023)
par: Antoun, Wissam, et autres
Publié: (2023)
Think Deep, Not Just Long: Measuring LLM Reasoning Effort via Deep-Thinking Tokens
par: Chen, Wei-Lin, et autres
Publié: (2026)
par: Chen, Wei-Lin, et autres
Publié: (2026)
Reasoning-Driven Synthetic Data Generation and Evaluation
par: Davidson, Tim R., et autres
Publié: (2026)
par: Davidson, Tim R., et autres
Publié: (2026)
Thinking Machines: A Survey of LLM based Reasoning Strategies
par: Bandyopadhyay, Dibyanayan, et autres
Publié: (2025)
par: Bandyopadhyay, Dibyanayan, et autres
Publié: (2025)
BigO(Bench) -- Can LLMs Generate Code with Controlled Time and Space Complexity?
par: Chambon, Pierre, et autres
Publié: (2025)
par: Chambon, Pierre, et autres
Publié: (2025)
Demystifying Reasoning Dynamics with Mutual Information: Thinking Tokens are Information Peaks in LLM Reasoning
par: Qian, Chen, et autres
Publié: (2025)
par: Qian, Chen, et autres
Publié: (2025)
Can Character-based Language Models Improve Downstream Task Performance in Low-Resource and Noisy Language Scenarios?
par: Riabi, Arij, et autres
Publié: (2021)
par: Riabi, Arij, et autres
Publié: (2021)
Improving LLMs for Machine Translation Using Synthetic Preference Data
par: Vajda, Dario, et autres
Publié: (2025)
par: Vajda, Dario, et autres
Publié: (2025)
TARGA: Targeted Synthetic Data Generation for Practical Reasoning over Structured Data
par: Huang, Xiang, et autres
Publié: (2024)
par: Huang, Xiang, et autres
Publié: (2024)
Alleviating Distribution Shift in Synthetic Data for Machine Translation Quality Estimation
par: Geng, Xiang, et autres
Publié: (2025)
par: Geng, Xiang, et autres
Publié: (2025)
Anisotropy Is Inherent to Self-Attention in Transformers
par: Godey, Nathan, et autres
Publié: (2024)
par: Godey, Nathan, et autres
Publié: (2024)
Why do small language models underperform? Studying Language Model Saturation via the Softmax Bottleneck
par: Godey, Nathan, et autres
Publié: (2024)
par: Godey, Nathan, et autres
Publié: (2024)
Preliminary Ranking of WMT25 General Machine Translation Systems
par: Kocmi, Tom, et autres
Publié: (2025)
par: Kocmi, Tom, et autres
Publié: (2025)
Improving Indigenous Language Machine Translation with Synthetic Data and Language-Specific Preprocessing
par: Dhawan, Aashish, et autres
Publié: (2026)
par: Dhawan, Aashish, et autres
Publié: (2026)
Non-Fluent Synthetic Target-Language Data Improve Neural Machine Translation
par: Sánchez-Cartagena, Víctor M., et autres
Publié: (2024)
par: Sánchez-Cartagena, Víctor M., et autres
Publié: (2024)
MedInjection-FR: Exploring the Role of Native, Synthetic, and Translated Data in Biomedical Instruction Tuning
par: Belmadani, Ikram, et autres
Publié: (2026)
par: Belmadani, Ikram, et autres
Publié: (2026)
Compensating for Data with Reasoning: Low-Resource Machine Translation with LLMs
par: Frontull, Samuel, et autres
Publié: (2025)
par: Frontull, Samuel, et autres
Publié: (2025)
KréyoLID From Language Identification Towards Language Mining
par: Dent, Rasul, et autres
Publié: (2025)
par: Dent, Rasul, et autres
Publié: (2025)
How Should We Model the Probability of a Language?
par: Dent, Rasul, et autres
Publié: (2026)
par: Dent, Rasul, et autres
Publié: (2026)
Generating Logically Consistent Synthetic Supply Chain Data with LLM-Driven Knowledge Graph Reasoning
par: Long, Yunbo, et autres
Publié: (2026)
par: Long, Yunbo, et autres
Publié: (2026)
PatentEval: Understanding Errors in Patent Generation
par: Zuo, You, et autres
Publié: (2024)
par: Zuo, You, et autres
Publié: (2024)
Synthetic Fluency: Hallucinations, Confabulations, and the Creation of Irish Words in LLM-Generated Translations
par: Castilho, Sheila, et autres
Publié: (2025)
par: Castilho, Sheila, et autres
Publié: (2025)
Detecting Concrete Visual Tokens for Multimodal Machine Translation
par: Bowen, Braeden, et autres
Publié: (2024)
par: Bowen, Braeden, et autres
Publié: (2024)
CHIMERA: Compact Synthetic Data for Generalizable LLM Reasoning
par: Zhu, Xinyu, et autres
Publié: (2026)
par: Zhu, Xinyu, et autres
Publié: (2026)
Documents similaires
-
Compositional Translation: A Novel LLM-based Approach for Low-resource Machine Translation
par: Zebaze, Armel, et autres
Publié: (2025) -
TopXGen: Topic-Diverse Parallel Data Generation for Low-Resource Machine Translation
par: Zebaze, Armel, et autres
Publié: (2025) -
In-Context Example Selection via Similarity Search Improves Low-Resource Machine Translation
par: Zebaze, Armel, et autres
Publié: (2024) -
Tree of Problems: Improving structured problem solving with compositionality
par: Zebaze, Armel, et autres
Publié: (2024) -
Disentangling meaning from language in LLM-based machine translation
par: Lasnier, Théo, et autres
Publié: (2026)