KréyoLID From Language Identification Towards Language Mining
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Dent, Rasul, Suarez, Pedro Ortiz, Clérice, Thibault, Sagot, Benoît |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
How Should We Model the Probability of a Language?
par: Dent, Rasul, et autres
Publié: (2026)
par: Dent, Rasul, et autres
Publié: (2026)
Molyé: A Corpus-based Approach to Language Contact in Colonial France
par: Dent, Rasul, et autres
Publié: (2024)
par: Dent, Rasul, et autres
Publié: (2024)
Reading or Guessing? Visual Grounding Failures of Vision-Language Models for OCR in Ancient Greek Editions
par: Karamolegkou, Antonia, et autres
Publié: (2026)
par: Karamolegkou, Antonia, et autres
Publié: (2026)
Detecting Sexual Content at the Sentence Level in First Millennium Latin Texts
par: Clérice, Thibault
Publié: (2023)
par: Clérice, Thibault
Publié: (2023)
CommonLID: Re-evaluating State-of-the-Art Language Identification Performance on Web Data
par: Suarez, Pedro Ortiz, et autres
Publié: (2026)
par: Suarez, Pedro Ortiz, et autres
Publié: (2026)
GlotLID: Language Identification for Low-Resource Languages
par: Kargaran, Amir Hossein, et autres
Publié: (2023)
par: Kargaran, Amir Hossein, et autres
Publié: (2023)
From Text to Source: Results in Detecting Large Language Model-Generated Content
par: Antoun, Wissam, et autres
Publié: (2023)
par: Antoun, Wissam, et autres
Publié: (2023)
MaskLID: Code-Switching Language Identification through Iterative Masking
par: Kargaran, Amir Hossein, et autres
Publié: (2024)
par: Kargaran, Amir Hossein, et autres
Publié: (2024)
Can Character-based Language Models Improve Downstream Task Performance in Low-Resource and Noisy Language Scenarios?
par: Riabi, Arij, et autres
Publié: (2021)
par: Riabi, Arij, et autres
Publié: (2021)
BERT-LID: Leveraging BERT to Improve Spoken Language Identification
par: Nie, Yuting, et autres
Publié: (2022)
par: Nie, Yuting, et autres
Publié: (2022)
ConLID: Supervised Contrastive Learning for Low-Resource Language Identification
par: Foroutan, Negar, et autres
Publié: (2025)
par: Foroutan, Negar, et autres
Publié: (2025)
Language-Switching Triggers Take a Latent Detour Through Language Models
par: Kulumba, Francis, et autres
Publié: (2026)
par: Kulumba, Francis, et autres
Publié: (2026)
OpenLID-v3: Improving the Precision of Closely Related Language Identification -- An Experience Report
par: Fedorova, Mariia, et autres
Publié: (2026)
par: Fedorova, Mariia, et autres
Publié: (2026)
On the Scaling Laws of Geographical Representation in Language Models
par: Godey, Nathan, et autres
Publié: (2024)
par: Godey, Nathan, et autres
Publié: (2024)
You Actually Look Twice At it (YALTAi): using an object detection approach instead of region segmentation within the Kraken engine
par: Clérice, Thibault
Publié: (2022)
par: Clérice, Thibault
Publié: (2022)
Why do small language models underperform? Studying Language Model Saturation via the Softmax Bottleneck
par: Godey, Nathan, et autres
Publié: (2024)
par: Godey, Nathan, et autres
Publié: (2024)
Towards Zero-Shot Multimodal Machine Translation
par: Futeral, Matthieu, et autres
Publié: (2024)
par: Futeral, Matthieu, et autres
Publié: (2024)
Pre-Editorial Normalization for Automatically Transcribed Medieval Manuscripts in Old French and Latin
par: Clérice, Thibault, et autres
Publié: (2026)
par: Clérice, Thibault, et autres
Publié: (2026)
A French Version of the OLDI Seed Corpus
par: Marmonier, Malik, et autres
Publié: (2025)
par: Marmonier, Malik, et autres
Publié: (2025)
ModernBERT or DeBERTaV3? Examining Architecture and Data Influence on Transformer Encoder Models Performance
par: Antoun, Wissam, et autres
Publié: (2025)
par: Antoun, Wissam, et autres
Publié: (2025)
LLM Reasoning for Machine Translation: Synthetic Data Generation over Thinking Tokens
par: Zebaze, Armel, et autres
Publié: (2025)
par: Zebaze, Armel, et autres
Publié: (2025)
Explicit Learning and the LLM in Machine Translation
par: Marmonier, Malik, et autres
Publié: (2025)
par: Marmonier, Malik, et autres
Publié: (2025)
TopXGen: Topic-Diverse Parallel Data Generation for Low-Resource Machine Translation
par: Zebaze, Armel, et autres
Publié: (2025)
par: Zebaze, Armel, et autres
Publié: (2025)
Compositional Translation: A Novel LLM-based Approach for Low-resource Machine Translation
par: Zebaze, Armel, et autres
Publié: (2025)
par: Zebaze, Armel, et autres
Publié: (2025)
Tree of Problems: Improving structured problem solving with compositionality
par: Zebaze, Armel, et autres
Publié: (2024)
par: Zebaze, Armel, et autres
Publié: (2024)
Testing the Deliteralization Hypothesis in Human and Machine Translation
par: Marmonier, Malik, et autres
Publié: (2026)
par: Marmonier, Malik, et autres
Publié: (2026)
In-Context Example Selection via Similarity Search Improves Low-Resource Machine Translation
par: Zebaze, Armel, et autres
Publié: (2024)
par: Zebaze, Armel, et autres
Publié: (2024)
Hindsight Quality Prediction Experiments in Multi-Candidate Human-Post-Edited Machine Translation
par: Marmonier, Malik, et autres
Publié: (2026)
par: Marmonier, Malik, et autres
Publié: (2026)
Making Sentence Embeddings Robust to User-Generated Content
par: Nishimwe, Lydia, et autres
Publié: (2024)
par: Nishimwe, Lydia, et autres
Publié: (2024)
When your Cousin has the Right Connections: Unsupervised Bilingual Lexicon Induction for Related Data-Imbalanced Languages
par: Bafna, Niyati, et autres
Publié: (2023)
par: Bafna, Niyati, et autres
Publié: (2023)
mOSCAR: A Large-scale Multilingual and Multimodal Document-level Corpus
par: Futeral, Matthieu, et autres
Publié: (2024)
par: Futeral, Matthieu, et autres
Publié: (2024)
CamemBERT 2.0: A Smarter French Language Model Aged to Perfection
par: Antoun, Wissam, et autres
Publié: (2024)
par: Antoun, Wissam, et autres
Publié: (2024)
Anisotropy Is Inherent to Self-Attention in Transformers
par: Godey, Nathan, et autres
Publié: (2024)
par: Godey, Nathan, et autres
Publié: (2024)
LID Models are Actually Accent Classifiers: Implications and Solutions for LID on Accented Speech
par: Bafna, Niyati, et autres
Publié: (2025)
par: Bafna, Niyati, et autres
Publié: (2025)
Diachronic Document Dataset for Semantic Layout Analysis
par: Clérice, Thibault, et autres
Publié: (2024)
par: Clérice, Thibault, et autres
Publié: (2024)
BigO(Bench) -- Can LLMs Generate Code with Controlled Time and Space Complexity?
par: Chambon, Pierre, et autres
Publié: (2025)
par: Chambon, Pierre, et autres
Publié: (2025)
Gaperon: A Peppered English-French Generative Language Model Suite
par: Godey, Nathan, et autres
Publié: (2025)
par: Godey, Nathan, et autres
Publié: (2025)
Language Arithmetics: Towards Systematic Language Neuron Identification and Manipulation
par: Gurgurov, Daniil, et autres
Publié: (2025)
par: Gurgurov, Daniil, et autres
Publié: (2025)
Disentangling meaning from language in LLM-based machine translation
par: Lasnier, Théo, et autres
Publié: (2026)
par: Lasnier, Théo, et autres
Publié: (2026)
Towards Generalized Offensive Language Identification
par: Dmonte, Alphaeus, et autres
Publié: (2024)
par: Dmonte, Alphaeus, et autres
Publié: (2024)
Documents similaires
-
How Should We Model the Probability of a Language?
par: Dent, Rasul, et autres
Publié: (2026) -
Molyé: A Corpus-based Approach to Language Contact in Colonial France
par: Dent, Rasul, et autres
Publié: (2024) -
Reading or Guessing? Visual Grounding Failures of Vision-Language Models for OCR in Ancient Greek Editions
par: Karamolegkou, Antonia, et autres
Publié: (2026) -
Detecting Sexual Content at the Sentence Level in First Millennium Latin Texts
par: Clérice, Thibault
Publié: (2023) -
CommonLID: Re-evaluating State-of-the-Art Language Identification Performance on Web Data
par: Suarez, Pedro Ortiz, et autres
Publié: (2026)