Judging Quality Across Languages: A Multilingual Approach to Pretraining Data Filtering with Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Ali, Mehdi, Brack, Manuel, Lübbering, Max, Wendt, Elias, Khan, Abbas Goher, Rutmann, Richard, Jude, Alex, Kraus, Maurice, Weber, Alexander Arno, Kaczér, David, Mai, Florian, Flek, Lucie, Sifa, Rafet, Flores-Herr, Nicolas, Köhler, Joachim, Schramowski, Patrick, Fromm, Michael, Kersting, Kristian |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Modalities, a PyTorch-native Framework For Large-scale LLM Training and Research
por: Lübbering, Max, et al.
Publicado: (2026)
por: Lübbering, Max, et al.
Publicado: (2026)
Core Tokensets for Data-efficient Sequential Training of Transformers
por: Paul, Subarnaduti, et al.
Publicado: (2024)
por: Paul, Subarnaduti, et al.
Publicado: (2024)
T-FREE: Subword Tokenizer-Free Generative LLMs via Sparse Representations for Memory-Efficient Embeddings
por: Deiseroth, Björn, et al.
Publicado: (2024)
por: Deiseroth, Björn, et al.
Publicado: (2024)
LlavaGuard: An Open VLM-based Framework for Safeguarding Vision Datasets and Models
por: Helff, Lukas, et al.
Publicado: (2024)
por: Helff, Lukas, et al.
Publicado: (2024)
Multilingual Text-to-Image Generation Magnifies Gender Stereotypes and Prompt Engineering May Not Help You
por: Friedrich, Felix, et al.
Publicado: (2024)
por: Friedrich, Felix, et al.
Publicado: (2024)
Do Multilingual Large Language Models Mitigate Stereotype Bias?
por: Nie, Shangrui, et al.
Publicado: (2024)
por: Nie, Shangrui, et al.
Publicado: (2024)
CHRONOBERG: Capturing Language Evolution and Temporal Awareness in Foundation Models
por: Hegde, Niharika, et al.
Publicado: (2025)
por: Hegde, Niharika, et al.
Publicado: (2025)
Beyond Overcorrection: Evaluating Diversity in T2I Models with DivBench
por: Friedrich, Felix, et al.
Publicado: (2025)
por: Friedrich, Felix, et al.
Publicado: (2025)
United We Pretrain, Divided We Fail! Representation Learning for Time Series by Pretraining on 75 Datasets at Once
por: Kraus, Maurice, et al.
Publicado: (2024)
por: Kraus, Maurice, et al.
Publicado: (2024)
Superalignment with Dynamic Human Values
por: Mai, Florian, et al.
Publicado: (2025)
por: Mai, Florian, et al.
Publicado: (2025)
Exploiting Cultural Biases via Homoglyphs in Text-to-Image Synthesis
por: Struppek, Lukas, et al.
Publicado: (2022)
por: Struppek, Lukas, et al.
Publicado: (2022)
AtMan: Understanding Transformer Predictions Through Memory Efficient Attention Manipulation
por: Deiseroth, Björn, et al.
Publicado: (2023)
por: Deiseroth, Björn, et al.
Publicado: (2023)
Does CLIP Know My Face?
por: Hintersdorf, Dominik, et al.
Publicado: (2022)
por: Hintersdorf, Dominik, et al.
Publicado: (2022)
SCAR: Sparse Conditioned Autoencoders for Concept Detection and Steering in LLMs
por: Härle, Ruben, et al.
Publicado: (2024)
por: Härle, Ruben, et al.
Publicado: (2024)
Towards Multilingual LLM Evaluation for European Languages
por: Thellmann, Klaudia, et al.
Publicado: (2024)
por: Thellmann, Klaudia, et al.
Publicado: (2024)
In-Training Defenses against Emergent Misalignment in Language Models
por: Kaczér, David, et al.
Publicado: (2025)
por: Kaczér, David, et al.
Publicado: (2025)
DeiSAM: Segment Anything with Deictic Prompting
por: Shindo, Hikaru, et al.
Publicado: (2024)
por: Shindo, Hikaru, et al.
Publicado: (2024)
On the Limitations of Language Targeted Pruning: Investigating the Calibration Language Impact in Multilingual LLM Pruning
por: Kurz, Simon, et al.
Publicado: (2024)
por: Kurz, Simon, et al.
Publicado: (2024)
Quantum Computing from Hopfield Nets
por: Bauckhage, Christian, et al.
Publicado: (2025)
por: Bauckhage, Christian, et al.
Publicado: (2025)
How to Train your Text-to-Image Model: Evaluating Design Choices for Synthetic Training Captions
por: Brack, Manuel, et al.
Publicado: (2025)
por: Brack, Manuel, et al.
Publicado: (2025)
Measuring and Guiding Monosemanticity
por: Härle, Ruben, et al.
Publicado: (2025)
por: Härle, Ruben, et al.
Publicado: (2025)
LEDITS++: Limitless Image Editing using Text-to-Image Models
por: Brack, Manuel, et al.
Publicado: (2023)
por: Brack, Manuel, et al.
Publicado: (2023)
Model-agnostic Body Part Relevance Assessment for Pedestrian Detection
por: Günder, Maurice, et al.
Publicado: (2023)
por: Günder, Maurice, et al.
Publicado: (2023)
IKnow: Instruction-Knowledge-Aware Continual Pretraining for Effective Domain Adaptation
por: Zhang, Tianyi, et al.
Publicado: (2025)
por: Zhang, Tianyi, et al.
Publicado: (2025)
Survey-to-Behavior: Downstream Alignment of Human Values in LLMs via Survey Questions
por: Nie, Shangrui, et al.
Publicado: (2025)
por: Nie, Shangrui, et al.
Publicado: (2025)
Reinforcement Learning Amplifies Emergent Misalignment from Harmless Rewards
por: Jørgenvåg, Magnus, et al.
Publicado: (2026)
por: Jørgenvåg, Magnus, et al.
Publicado: (2026)
Pointer-Guided Pre-Training: Infusing Large Language Models with Paragraph-Level Contextual Awareness
por: Hillebrand, Lars, et al.
Publicado: (2024)
por: Hillebrand, Lars, et al.
Publicado: (2024)
A Typology for Exploring the Mitigation of Shortcut Behavior
por: Friedrich, Felix, et al.
Publicado: (2022)
por: Friedrich, Felix, et al.
Publicado: (2022)
Exploring Robustness of Multilingual LLMs on Real-World Noisy Data
por: Aliakbarzadeh, Amirhossein, et al.
Publicado: (2025)
por: Aliakbarzadeh, Amirhossein, et al.
Publicado: (2025)
How Small Can You Go? Compact Language Models for On-Device Critical Error Detection in Machine Translation
por: Chopra, Muskaan, et al.
Publicado: (2025)
por: Chopra, Muskaan, et al.
Publicado: (2025)
Tokenizer Choice For LLM Training: Negligible or Crucial?
por: Ali, Mehdi, et al.
Publicado: (2023)
por: Ali, Mehdi, et al.
Publicado: (2023)
LLMs Lost in Translation: M-ALERT uncovers Cross-Linguistic Safety Inconsistencies
por: Friedrich, Felix, et al.
Publicado: (2024)
por: Friedrich, Felix, et al.
Publicado: (2024)
xLSTM-Mixer: Multivariate Time Series Forecasting by Mixing via Scalar Memories
por: Kraus, Maurice, et al.
Publicado: (2024)
por: Kraus, Maurice, et al.
Publicado: (2024)
Probing the Robustness of Theory of Mind in Large Language Models
por: Nickel, Christian, et al.
Publicado: (2024)
por: Nickel, Christian, et al.
Publicado: (2024)
Investigating Multilingual Instruction-Tuning: Do Polyglot Models Demand for Multilingual Instructions?
por: Weber, Alexander Arno, et al.
Publicado: (2024)
por: Weber, Alexander Arno, et al.
Publicado: (2024)
Multipole Semantic Attention: A Fast Approximation of Softmax Attention for Pretraining
por: Mitchell, Rupert, et al.
Publicado: (2025)
por: Mitchell, Rupert, et al.
Publicado: (2025)
SynCED-EnDe 2025: A Synthetic and Curated English - German Dataset for Critical Error Detection in Machine Translation
por: Chopra, Muskaan, et al.
Publicado: (2025)
por: Chopra, Muskaan, et al.
Publicado: (2025)
Towards Reliable Machine Translation: Scaling LLMs for Critical Error Detection and Safety
por: Chopra, Muskaan, et al.
Publicado: (2026)
por: Chopra, Muskaan, et al.
Publicado: (2026)
Right on Time: Revising Time Series Models by Constraining their Explanations
por: Kraus, Maurice, et al.
Publicado: (2024)
por: Kraus, Maurice, et al.
Publicado: (2024)
Recursive Inference Machines for Neural Reasoning
por: Komisarczyk, Mieszko, et al.
Publicado: (2026)
por: Komisarczyk, Mieszko, et al.
Publicado: (2026)
Ejemplares similares
-
Modalities, a PyTorch-native Framework For Large-scale LLM Training and Research
por: Lübbering, Max, et al.
Publicado: (2026) -
Core Tokensets for Data-efficient Sequential Training of Transformers
por: Paul, Subarnaduti, et al.
Publicado: (2024) -
T-FREE: Subword Tokenizer-Free Generative LLMs via Sparse Representations for Memory-Efficient Embeddings
por: Deiseroth, Björn, et al.
Publicado: (2024) -
LlavaGuard: An Open VLM-based Framework for Safeguarding Vision Datasets and Models
por: Helff, Lukas, et al.
Publicado: (2024) -
Multilingual Text-to-Image Generation Magnifies Gender Stereotypes and Prompt Engineering May Not Help You
por: Friedrich, Felix, et al.
Publicado: (2024)