Assessing the Role of Data Quality in Training Bilingual Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Seto, Skyler, ter Hoeve, Maartje, de Seyssel, Maureen, Grangier, David |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Training Bilingual LMs with Data Constraints in the Targeted Language
by: Seto, Skyler, et al.
Published: (2024)
by: Seto, Skyler, et al.
Published: (2024)
Discriminating Form and Meaning in Multilingual Models with Minimal-Pair ABX Tasks
by: de Seyssel, Maureen, et al.
Published: (2025)
by: de Seyssel, Maureen, et al.
Published: (2025)
Multilingual Knowledge Transfer under Data Constraints via Lexical Interventions
by: Sedova, Anastasiia, et al.
Published: (2026)
by: Sedova, Anastasiia, et al.
Published: (2026)
Analyzing Dialectical Biases in LLMs for Knowledge and Reasoning Benchmarks
by: Pan, Eileen, et al.
Published: (2025)
by: Pan, Eileen, et al.
Published: (2025)
Task-Adaptive Pretrained Language Models via Clustered-Importance Sampling
by: Grangier, David, et al.
Published: (2024)
by: Grangier, David, et al.
Published: (2024)
Rephrasing the Web: A Recipe for Compute and Data-Efficient Language Modeling
by: Maini, Pratyush, et al.
Published: (2024)
by: Maini, Pratyush, et al.
Published: (2024)
Analyzing the Effect of Linguistic Similarity on Cross-Lingual Transfer: Tasks and Experimental Setups Matter
by: Blaschke, Verena, et al.
Published: (2025)
by: Blaschke, Verena, et al.
Published: (2025)
Soup-of-Experts: Pretraining Specialist Models via Parameters Averaging
by: Ablin, Pierre, et al.
Published: (2025)
by: Ablin, Pierre, et al.
Published: (2025)
On the Limited Generalization Capability of the Implicit Reward Model Induced by Direct Preference Optimization
by: Lin, Yong, et al.
Published: (2024)
by: Lin, Yong, et al.
Published: (2024)
How Value Induction Reshapes LLM Behaviour
by: Arora, Arnav, et al.
Published: (2026)
by: Arora, Arnav, et al.
Published: (2026)
The Role of Prosody in Spoken Question Answering
by: Chi, Jie, et al.
Published: (2025)
by: Chi, Jie, et al.
Published: (2025)
GrammaMT: Improving Machine Translation with Grammar-Informed In-Context Learning
by: Ramos, Rita, et al.
Published: (2024)
by: Ramos, Rita, et al.
Published: (2024)
mRAKL: Multilingual Retrieval-Augmented Knowledge Graph Construction for Low-Resourced Languages
by: Nigatu, Hellina Hailu, et al.
Published: (2025)
by: Nigatu, Hellina Hailu, et al.
Published: (2025)
Optimal Splitting of Language Models from Mixtures to Specialized Domains
by: Seto, Skyler, et al.
Published: (2026)
by: Seto, Skyler, et al.
Published: (2026)
On the Way to LLM Personalization: Learning to Remember User Conversations
by: Magister, Lucie Charlotte, et al.
Published: (2024)
by: Magister, Lucie Charlotte, et al.
Published: (2024)
Which Evaluation for Which Model? A Taxonomy for Speech Model Assessment
by: de Seyssel, Maureen, et al.
Published: (2025)
by: de Seyssel, Maureen, et al.
Published: (2025)
EmphAssess : a Prosodic Benchmark on Assessing Emphasis Transfer in Speech-to-Speech Models
by: de Seyssel, Maureen, et al.
Published: (2023)
by: de Seyssel, Maureen, et al.
Published: (2023)
Closing the Gap Between Text and Speech Understanding in LLMs
by: Cuervo, Santiago, et al.
Published: (2025)
by: Cuervo, Santiago, et al.
Published: (2025)
Leveraging Audio-Visual Data to Reduce the Multilingual Gap in Self-Supervised Speech Models
by: Blandón, María Andrea Cruz, et al.
Published: (2025)
by: Blandón, María Andrea Cruz, et al.
Published: (2025)
Toward Machine Interpreting: Lessons from Human Interpreting Studies
by: Sperber, Matthias, et al.
Published: (2025)
by: Sperber, Matthias, et al.
Published: (2025)
Scaling Laws for Mixture Pretraining Under Data Constraints
by: Sedova, Anastasiia, et al.
Published: (2026)
by: Sedova, Anastasiia, et al.
Published: (2026)
Aggregate-and-Adapt Natural Language Prompts for Downstream Generalization of CLIP
by: Huang, Chen, et al.
Published: (2024)
by: Huang, Chen, et al.
Published: (2024)
The Data-Quality Illusion: Rethinking Classifier-Based Quality Filtering for LLM Pretraining
by: Saada, Thiziri Nait, et al.
Published: (2025)
by: Saada, Thiziri Nait, et al.
Published: (2025)
Dynamic Gradient Alignment for Online Data Mixing
by: Fan, Simin, et al.
Published: (2024)
by: Fan, Simin, et al.
Published: (2024)
No Need to Talk: Asynchronous Mixture of Language Models
by: Filippova, Anastasiia, et al.
Published: (2024)
by: Filippova, Anastasiia, et al.
Published: (2024)
Need a Small Specialized Language Model? Plan Early!
by: Grangier, David, et al.
Published: (2024)
by: Grangier, David, et al.
Published: (2024)
RoleEval: A Bilingual Role Evaluation Benchmark for Large Language Models
by: Shen, Tianhao, et al.
Published: (2023)
by: Shen, Tianhao, et al.
Published: (2023)
Which Data Matter? Embedding-Based Data Selection for Speech Recognition
by: Aldeneh, Zakaria, et al.
Published: (2026)
by: Aldeneh, Zakaria, et al.
Published: (2026)
Steering into New Embedding Spaces: Analyzing Cross-Lingual Alignment Induced by Model Interventions in Multilingual Language Models
by: Sundar, Anirudh, et al.
Published: (2025)
by: Sundar, Anirudh, et al.
Published: (2025)
Massively Multilingual Adaptation of Large Language Models Using Bilingual Translation Data
by: Ji, Shaoxiong, et al.
Published: (2025)
by: Ji, Shaoxiong, et al.
Published: (2025)
StatBot.Swiss: Bilingual Open Data Exploration in Natural Language
by: Nooralahzadeh, Farhad, et al.
Published: (2024)
by: Nooralahzadeh, Farhad, et al.
Published: (2024)
Information Loss in LLMs' Multilingual Translation: The Role of Training Data, Language Proximity, and Language Family
by: Lin, Yumeng, et al.
Published: (2025)
by: Lin, Yumeng, et al.
Published: (2025)
Scaling Laws for Forgetting during Finetuning with Pretraining Data Injection
by: Bethune, Louis, et al.
Published: (2025)
by: Bethune, Louis, et al.
Published: (2025)
Enabling Precise Topic Alignment in Large Language Models Via Sparse Autoencoders
by: Joshi, Ananya, et al.
Published: (2025)
by: Joshi, Ananya, et al.
Published: (2025)
On the Acquisition of Shared Grammatical Representations in Bilingual Language Models
by: Arnett, Catherine, et al.
Published: (2025)
by: Arnett, Catherine, et al.
Published: (2025)
QuRating: Selecting High-Quality Data for Training Language Models
by: Wettig, Alexander, et al.
Published: (2024)
by: Wettig, Alexander, et al.
Published: (2024)
Training a Bilingual Language Model by Mapping Tokens onto a Shared Character Space
by: Rom, Aviad, et al.
Published: (2024)
by: Rom, Aviad, et al.
Published: (2024)
ExpertLens: Activation steering features are highly interpretable
by: Fedzechkina, Masha, et al.
Published: (2025)
by: Fedzechkina, Masha, et al.
Published: (2025)
Scalable Vision Language Model Training via High Quality Data Curation
by: Dong, Hongyuan, et al.
Published: (2025)
by: Dong, Hongyuan, et al.
Published: (2025)
Disparities In Negation Understanding Across Languages In Vision-Language Models
by: Moraitaki, Charikleia, et al.
Published: (2026)
by: Moraitaki, Charikleia, et al.
Published: (2026)
Similar Items
-
Training Bilingual LMs with Data Constraints in the Targeted Language
by: Seto, Skyler, et al.
Published: (2024) -
Discriminating Form and Meaning in Multilingual Models with Minimal-Pair ABX Tasks
by: de Seyssel, Maureen, et al.
Published: (2025) -
Multilingual Knowledge Transfer under Data Constraints via Lexical Interventions
by: Sedova, Anastasiia, et al.
Published: (2026) -
Analyzing Dialectical Biases in LLMs for Knowledge and Reasoning Benchmarks
by: Pan, Eileen, et al.
Published: (2025) -
Task-Adaptive Pretrained Language Models via Clustered-Importance Sampling
by: Grangier, David, et al.
Published: (2024)