How Much Data is Enough Data? Fine-Tuning Large Language Models for In-House Translation: Performance Evaluation Across Multiple Dataset Sizes
Fuente:
arXiv
Saved in:
| Main Authors: | Vieira, Inacio, Allred, Will, Lankford, Séamus, Castilho, Sheila, Way, Andy |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
adaptMLLM: Fine-Tuning Multilingual Language Models on Low-Resource Languages with Integrated LLM Playgrounds
by: Lankford, Séamus, et al.
Published: (2024)
by: Lankford, Séamus, et al.
Published: (2024)
Sociotechnical Effects of Machine Translation
by: Moorkens, Joss, et al.
Published: (2025)
by: Moorkens, Joss, et al.
Published: (2025)
Leveraging LLMs for MT in Crisis Scenarios: a blueprint for low-resource languages
by: Lankford, Séamus, et al.
Published: (2024)
by: Lankford, Séamus, et al.
Published: (2024)
Design of an Open-Source Architecture for Neural Machine Translation
by: Lankford, Séamus, et al.
Published: (2024)
by: Lankford, Séamus, et al.
Published: (2024)
adaptNMT: an open-source, language-agnostic development environment for Neural Machine Translation
by: Lankford, Séamus, et al.
Published: (2024)
by: Lankford, Séamus, et al.
Published: (2024)
Machine Translation in the Covid domain: an English-Irish case study for LoResMT 2021
by: Lankford, Séamus, et al.
Published: (2024)
by: Lankford, Séamus, et al.
Published: (2024)
Human Evaluation of English--Irish Transformer-Based NMT
by: Lankford, Séamus, et al.
Published: (2024)
by: Lankford, Séamus, et al.
Published: (2024)
Transformers for Low-Resource Languages: Is Féidir Linn!
by: Lankford, Séamus, et al.
Published: (2024)
by: Lankford, Séamus, et al.
Published: (2024)
Enhancing Neural Machine Translation of Low-Resource Languages: Corpus Development, Human Evaluation and Explainable AI Architectures
by: Lankford, Séamus
Published: (2024)
by: Lankford, Séamus
Published: (2024)
gaHealth: An English-Irish Bilingual Corpus of Health Data
by: Lankford, Séamus, et al.
Published: (2024)
by: Lankford, Séamus, et al.
Published: (2024)
Data-Efficient Domain Adaptation for LLM-based MT using Contrastive Preference Optimization
by: Vieira, Inacio, et al.
Published: (2025)
by: Vieira, Inacio, et al.
Published: (2025)
Neural Architecture Search using Particle Swarm and Ant Colony Optimization
by: Lankford, Séamus, et al.
Published: (2024)
by: Lankford, Séamus, et al.
Published: (2024)
How Much is Enough? The Diminishing Returns of Tokenization Training Data
by: Reddy, Varshini, et al.
Published: (2025)
by: Reddy, Varshini, et al.
Published: (2025)
How Much Data are Enough? Investigating Dataset Requirements for Patch-Based Brain MRI Segmentation Tasks
by: Wang, Dongang, et al.
Published: (2024)
by: Wang, Dongang, et al.
Published: (2024)
How Much Data is Enough? Optimization of Data Collection for Artifact Detection in EEG Recordings
by: Wang-Nöth, Lu, et al.
Published: (2024)
by: Wang-Nöth, Lu, et al.
Published: (2024)
Context-Aware Monolingual Human Evaluation of Machine Translation
by: Picinini, Silvio, et al.
Published: (2025)
by: Picinini, Silvio, et al.
Published: (2025)
How Much Data is Enough? The Zeta Law of Discoverability in Biomedical Data, featuring the enigmatic Riemann zeta function
by: Thompson, Paul M.
Published: (2026)
by: Thompson, Paul M.
Published: (2026)
How Multilingual Are Large Language Models Fine-Tuned for Translation?
by: Richburg, Aquia, et al.
Published: (2024)
by: Richburg, Aquia, et al.
Published: (2024)
How Much Data Is Enough? Uniform Convergence Bounds for Generative & Vision-Language Models under Low-Dimensional Structure
by: Thompson, Paul M.
Published: (2025)
by: Thompson, Paul M.
Published: (2025)
Extending CREAMT: Leveraging Large Language Models for Literary Translation Post-Editing
by: Castaldo, Antonio, et al.
Published: (2025)
by: Castaldo, Antonio, et al.
Published: (2025)
On the Universality of Transformer Architectures; How Much Attention Is Enough?
by: Abbasi, Amirreza, et al.
Published: (2025)
by: Abbasi, Amirreza, et al.
Published: (2025)
Audio-Based Crowd-Sourced Evaluation of Machine Translation Quality
by: Haq, Sami Ul, et al.
Published: (2025)
by: Haq, Sami Ul, et al.
Published: (2025)
How Much Trust is Enough? Towards Calibrating Trust in Technology
by: Beltrão, Gabriela, et al.
Published: (2026)
by: Beltrão, Gabriela, et al.
Published: (2026)
How Much is Enough? An Empirical Test of the Resource Dispersion Hypothesis
by: Biswas, Sourabh, et al.
Published: (2025)
by: Biswas, Sourabh, et al.
Published: (2025)
How Much Is Enough? An Empirical Test of the Resource Dispersion Hypothesis
by: Sourabh Biswas, et al.
Published: (2025)
by: Sourabh Biswas, et al.
Published: (2025)
Quantifying Dietary Breadth in Howlers: How Much Sampling Is Enough?
by: Ariadna Rangel Negrín, et al.
Published: (2026)
by: Ariadna Rangel Negrín, et al.
Published: (2026)
On the Reliability of Biometric Datasets: How Much Test Data Ensures Reliability?
by: Fallahi, Matin, et al.
Published: (2025)
by: Fallahi, Matin, et al.
Published: (2025)
Domain Terminology Integration into Machine Translation: Leveraging Large Language Models
by: Moslem, Yasmin, et al.
Published: (2023)
by: Moslem, Yasmin, et al.
Published: (2023)
Fine-Tuning Large Language Models to Translate: Will a Touch of Noisy Data in Misaligned Languages Suffice?
by: Zhu, Dawei, et al.
Published: (2024)
by: Zhu, Dawei, et al.
Published: (2024)
Theoretical and Experimental Assessment of Large Beam Codebook at mmWave Devices: How Much is Enough?
by: Bozkurt, Bora, et al.
Published: (2025)
by: Bozkurt, Bora, et al.
Published: (2025)
How Much Thinking is Enough? Quantifying and Understanding Redundancy in LLM Reasoning
by: Zhai, Zhiyuan, et al.
Published: (2026)
by: Zhai, Zhiyuan, et al.
Published: (2026)
How Much Is Enough? Examining Computer Science and Civil Engineering Citation Data to Inform Collection Development and Retention Decisions in Three Large Canadian University Libraries
by: Spence, Michelle, et al.
Published: (2012)
by: Spence, Michelle, et al.
Published: (2012)
Simple Yet Effective: Extracting Private Data Across Clients in Federated Fine-Tuning of Large Language Models
by: Hu, Yingqi, et al.
Published: (2025)
by: Hu, Yingqi, et al.
Published: (2025)
How Much Do Code Language Models Remember? An Investigation on Data Extraction Attacks before and after Fine-tuning
by: Salerno, Fabio, et al.
Published: (2025)
by: Salerno, Fabio, et al.
Published: (2025)
Design for Change: How to Plan the School Library You Really Need.
by: Lankford, Mary D.
Published: (1994)
by: Lankford, Mary D.
Published: (1994)
How Much Backtracking is Enough? Exploring the Interplay of SFT and RL in Enhancing LLM Reasoning
by: Cai, Hongyi James, et al.
Published: (2025)
by: Cai, Hongyi James, et al.
Published: (2025)
Fine-Tuning Language Models on Multiple Datasets for Citation Intention Classification
by: Shui, Zeren, et al.
Published: (2024)
by: Shui, Zeren, et al.
Published: (2024)
How Much is Brain Data Worth for Machine Learning?
by: Lewis, Lane, et al.
Published: (2026)
by: Lewis, Lane, et al.
Published: (2026)
Data Mixing Optimization for Supervised Fine-Tuning of Large Language Models
by: Li, Yuan, et al.
Published: (2025)
by: Li, Yuan, et al.
Published: (2025)
The Effect of Language Diversity When Fine-Tuning Large Language Models for Translation
by: Stap, David, et al.
Published: (2025)
by: Stap, David, et al.
Published: (2025)
Similar Items
-
adaptMLLM: Fine-Tuning Multilingual Language Models on Low-Resource Languages with Integrated LLM Playgrounds
by: Lankford, Séamus, et al.
Published: (2024) -
Sociotechnical Effects of Machine Translation
by: Moorkens, Joss, et al.
Published: (2025) -
Leveraging LLMs for MT in Crisis Scenarios: a blueprint for low-resource languages
by: Lankford, Séamus, et al.
Published: (2024) -
Design of an Open-Source Architecture for Neural Machine Translation
by: Lankford, Séamus, et al.
Published: (2024) -
adaptNMT: an open-source, language-agnostic development environment for Neural Machine Translation
by: Lankford, Séamus, et al.
Published: (2024)